{"as_of":"2026-08-23T07:30:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:3a37c37c6fc1b4665e814608217976a5b8961c5a79417c03f3b2b3e7026ce95f","coverage":[{"denominator":95,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":95,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T19:43:02.115828Z","state":"measured"},{"denominator":115,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":115,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-23T06:30:58.430688+00:00","state":"measured"},{"denominator":20,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":20,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T17:20:51.021889Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T20:18:56.218978Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2411.10438","last_updated":"2025-09-04T09:37:05Z","snapshot_observed_at":"2026-08-17T20:25:32.027243Z","submitted_at":"2024-11-15T18:57:39Z","title":"MARS: Unleashing the Power of Variance Reduction for Training Large Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.10438","snapshot_observed_at":"2026-08-10T17:20:51.021889Z","title":"Mars: Unleashing the power of variance reduction for training large models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.12391","last_updated":"2025-01-21T18:59:49Z","snapshot_observed_at":"2026-08-17T16:58:20.460633Z","submitted_at":"2025-01-21T18:59:49Z","title":"Physics of Skill Learning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-10T17:20:51.021889Z"},"links":{"cited_paper":"/paper/2411.10438","citing_paper":"/paper/2501.12391"},"observation_digest":"sha256:5d5bd084e7a53b5de3395955a0b87df76b0536c5a9099286adb814ab7110a247","observation_id":"82111d87-d0d8-4a25-a1e8-c4c8250ce563","resolution":{"observed_at":"2026-08-10T17:20:51.021889Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.10438","last_updated":"2025-09-04T09:37:05Z","snapshot_observed_at":"2026-08-17T20:25:32.027243Z","submitted_at":"2024-11-15T18:57:39Z","title":"MARS: Unleashing the Power of Variance Reduction for Training Large Models","version":4},"cited_work":{"arxiv_id":"2411.10438","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.10438","snapshot_observed_at":"2026-07-03T20:18:56.218978Z","title":"Mars: Unleashing the power of variance reduction for training large models.arXiv preprint arXiv:2411.10438","venue":null,"work_id":"c3479a39-1a42-40c5-8f10-bafb1da1e032","year":2024},"citing_paper":{"arxiv_id":"2502.07529","last_updated":"2025-06-06T13:42:19Z","snapshot_observed_at":"2026-08-16T22:34:28.103547Z","submitted_at":"2025-02-11T13:10:34Z","title":"Training Deep Learning Models with Norm-Constrained LMOs","version":2},"reference_index":218,"source":"arxiv_source","source_observed_at":"2026-05-21T21:22:36.870292Z"},"links":{"cited_paper":"/paper/2411.10438","citing_paper":"/paper/2502.07529"},"observation_digest":"sha256:bc89bc5466c5cf09003703cd07fa04d32b9330edb05e42dca0ffe4110da8668b","observation_id":"b5c46eee-9c29-44dd-865b-18abd9153a49","resolution":{"observed_at":"2026-05-21T21:22:37.163437Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.10438","last_updated":"2025-09-04T09:37:05Z","snapshot_observed_at":"2026-08-17T20:25:32.027243Z","submitted_at":"2024-11-15T18:57:39Z","title":"MARS: Unleashing the Power of Variance Reduction for Training Large Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.10438","snapshot_observed_at":"2026-08-08T04:32:13.501247Z","title":"Mars: Unleashing the power of variance reduction for training large models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08612","last_updated":"2025-02-12T18:01:04Z","snapshot_observed_at":"2026-08-20T09:38:06.265796Z","submitted_at":"2025-02-12T18:01:04Z","title":"Continuous Cardiac Arrest Prediction in ICU using PPG Foundation Model","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-08T04:32:13.501247Z"},"links":{"cited_paper":"/paper/2411.10438","citing_paper":"/paper/2502.08612"},"observation_digest":"sha256:2ae2f7a7854d3161bdcd73f37000e94bb3ae224e2e0599ed9c648403d6f8c1f4","observation_id":"073a7acf-1bb7-471c-953e-9a2431184c4a","resolution":{"observed_at":"2026-08-08T04:32:13.501247Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.10438","last_updated":"2025-09-04T09:37:05Z","snapshot_observed_at":"2026-08-17T20:25:32.027243Z","submitted_at":"2024-11-15T18:57:39Z","title":"MARS: Unleashing the Power of Variance Reduction for Training Large Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.10438","snapshot_observed_at":"2026-08-07T10:58:37.720082Z","title":"Mars: Unleashing the power of variance reduction for training large models, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.04192","last_updated":"2026-07-24T19:09:15Z","snapshot_observed_at":"2026-08-20T16:59:24.938173Z","submitted_at":"2025-06-04T17:39:03Z","title":"Lions and Muons: Optimization via Stochastic Frank-Wolfe under Heavy-Tailed Noise","version":3},"reference_index":93,"source":"arxiv_source","source_observed_at":"2026-08-07T10:58:37.720082Z"},"links":{"cited_paper":"/paper/2411.10438","citing_paper":"/paper/2506.04192"},"observation_digest":"sha256:b400c13ee11b7cfb41a55316fa83a685ff9d51dfa95f21276eebf996d16e1d7e","observation_id":"a2b38aa2-0c1f-4d77-81d3-f81653fca415","resolution":{"observed_at":"2026-08-07T10:58:37.720082Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.10438","last_updated":"2025-09-04T09:37:05Z","snapshot_observed_at":"2026-08-17T20:25:32.027243Z","submitted_at":"2024-11-15T18:57:39Z","title":"MARS: Unleashing the Power of Variance Reduction for Training Large Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.10438","snapshot_observed_at":"2026-08-06T14:54:58.857286Z","title":"Mars: Unleashing the power of variance reduction for training large models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.17501","last_updated":"2025-07-23T13:37:23Z","snapshot_observed_at":"2026-08-21T04:05:00.830348Z","submitted_at":"2025-07-23T13:37:23Z","title":"DNT: a Deeply Normalized Transformer that can be trained by Momentum SGD","version":1},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-06T14:54:58.857286Z"},"links":{"cited_paper":"/paper/2411.10438","citing_paper":"/paper/2507.17501"},"observation_digest":"sha256:d5dfe436b566c1c8908e36507de9af7e072824d8f6c69d2b5f77f907b0b79fe2","observation_id":"a11c4c39-2f8d-4a92-a779-1caf95de60bb","resolution":{"observed_at":"2026-08-06T14:54:58.857286Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.10438","last_updated":"2025-09-04T09:37:05Z","snapshot_observed_at":"2026-08-17T20:25:32.027243Z","submitted_at":"2024-11-15T18:57:39Z","title":"MARS: Unleashing the Power of Variance Reduction for Training Large Models","version":4},"cited_work":{"arxiv_id":"2411.10438","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.10438","snapshot_observed_at":"2026-07-03T20:18:56.218978Z","title":"Mars: Unleashing the power of variance reduction for training large models.arXiv preprint arXiv:2411.10438","venue":null,"work_id":"c3479a39-1a42-40c5-8f10-bafb1da1e032","year":2024},"citing_paper":{"arxiv_id":"2509.15816","last_updated":"2026-05-10T06:58:46Z","snapshot_observed_at":"2026-08-18T20:56:42.898921Z","submitted_at":"2025-09-19T09:43:37Z","title":"On the Convergence of Muon and Beyond","version":5},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-05-18T15:56:30.602824Z"},"links":{"cited_paper":"/paper/2411.10438","citing_paper":"/paper/2509.15816"},"observation_digest":"sha256:d326ec9afdd7bfa7ea4d498d97371cac40527b5f0ea415cf7a7da86c0eac661d","observation_id":"96305ccd-7657-4bf1-b514-55b65d9d72a7","resolution":{"observed_at":"2026-05-18T15:56:34.038686Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.10438","last_updated":"2025-09-04T09:37:05Z","snapshot_observed_at":"2026-08-17T20:25:32.027243Z","submitted_at":"2024-11-15T18:57:39Z","title":"MARS: Unleashing the Power of Variance Reduction for Training Large Models","version":4},"cited_work":{"arxiv_id":"2411.10438","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.10438","snapshot_observed_at":"2026-07-03T20:18:56.218978Z","title":"Mars: Unleashing the power of variance reduction for training large models.arXiv preprint arXiv:2411.10438","venue":null,"work_id":"c3479a39-1a42-40c5-8f10-bafb1da1e032","year":2024},"citing_paper":{"arxiv_id":"2510.04988","last_updated":"2026-05-10T14:57:23Z","snapshot_observed_at":"2026-08-14T08:23:37.106467Z","submitted_at":"2025-10-06T16:24:57Z","title":"Adaptive Memory Momentum via a Model-Based Framework for Deep Learning Optimization","version":3},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-05-18T09:44:53.004293Z"},"links":{"cited_paper":"/paper/2411.10438","citing_paper":"/paper/2510.04988"},"observation_digest":"sha256:62080dd412d8740dba09256d6cdc490c6683f1e361ccf9d6d3f0577b47be7cab","observation_id":"837ee271-41b3-4b54-aa56-2611a1f51e82","resolution":{"observed_at":"2026-05-18T09:46:12.512191Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.10438","last_updated":"2025-09-04T09:37:05Z","snapshot_observed_at":"2026-08-17T20:25:32.027243Z","submitted_at":"2024-11-15T18:57:39Z","title":"MARS: Unleashing the Power of Variance Reduction for Training Large Models","version":4},"cited_work":{"arxiv_id":"2411.10438","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.10438","snapshot_observed_at":"2026-07-03T20:18:56.218978Z","title":"Mars: Unleashing the power of variance reduction for training large models.arXiv preprint arXiv:2411.10438","venue":null,"work_id":"c3479a39-1a42-40c5-8f10-bafb1da1e032","year":2024},"citing_paper":{"arxiv_id":"2602.01505","last_updated":"2026-05-06T16:04:38Z","snapshot_observed_at":"2026-08-11T14:55:55.889399Z","submitted_at":"2026-02-02T00:35:42Z","title":"Optimal Sample Complexity for Single Time-Scale Actor-Critic with Momentum","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-05-16T08:12:57.430291Z"},"links":{"cited_paper":"/paper/2411.10438","citing_paper":"/paper/2602.01505"},"observation_digest":"sha256:c06a19ebeac97c2acf5fc8a11506ccb0bd3f368754f9a437ec5fa8bb1d23315c","observation_id":"9d406b4a-3007-4676-bb2c-6be5b7626b11","resolution":{"observed_at":"2026-05-16T08:17:36.532381Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.10438","last_updated":"2025-09-04T09:37:05Z","snapshot_observed_at":"2026-08-17T20:25:32.027243Z","submitted_at":"2024-11-15T18:57:39Z","title":"MARS: Unleashing the Power of Variance Reduction for Training Large Models","version":4},"cited_work":{"arxiv_id":"2411.10438","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.10438","snapshot_observed_at":"2026-07-03T20:18:56.218978Z","title":"Mars: Unleashing the power of variance reduction for training large models.arXiv preprint arXiv:2411.10438","venue":null,"work_id":"c3479a39-1a42-40c5-8f10-bafb1da1e032","year":2024},"citing_paper":{"arxiv_id":"2603.10067","last_updated":"2026-05-21T20:35:00Z","snapshot_observed_at":"2026-08-12T22:23:04.265995Z","submitted_at":"2026-03-10T02:12:24Z","title":"HTMuon: Improving Muon via Heavy-Tailed Spectral Correction","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-25T06:50:29.893126Z"},"links":{"cited_paper":"/paper/2411.10438","citing_paper":"/paper/2603.10067"},"observation_digest":"sha256:8eedf5bb47c436fa1b1cfe48984dc6922e2639b3de4b0d08293b77913aad4f33","observation_id":"a767a7f1-1c97-42be-904b-2253a4f48c5c","resolution":{"observed_at":"2026-05-25T06:55:26.336736Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.10438","last_updated":"2025-09-04T09:37:05Z","snapshot_observed_at":"2026-08-17T20:25:32.027243Z","submitted_at":"2024-11-15T18:57:39Z","title":"MARS: Unleashing the Power of Variance Reduction for Training Large Models","version":4},"cited_work":{"arxiv_id":"2411.10438","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.10438","snapshot_observed_at":"2026-07-03T20:18:56.218978Z","title":"Mars: Unleashing the power of variance reduction for training large models.arXiv preprint arXiv:2411.10438","venue":null,"work_id":"c3479a39-1a42-40c5-8f10-bafb1da1e032","year":2024},"citing_paper":{"arxiv_id":"2604.14587","last_updated":"2026-04-16T03:32:48Z","snapshot_observed_at":"2026-08-14T05:02:11.700557Z","submitted_at":"2026-04-16T03:32:48Z","title":"CLion: Efficient Cautious Lion Optimizer with Enhanced Generalization","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-05-10T11:53:28.411087Z"},"links":{"cited_paper":"/paper/2411.10438","citing_paper":"/paper/2604.14587"},"observation_digest":"sha256:a581cf81ea7a13aa8548b0e99e48dad2003e74fa889db0b7b746aebf0f7a960f","observation_id":"8f4fb87c-5a45-480f-a4f1-3e547fba4e02","resolution":{"observed_at":"2026-05-10T11:55:20.585950Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.10438","last_updated":"2025-09-04T09:37:05Z","snapshot_observed_at":"2026-08-17T20:25:32.027243Z","submitted_at":"2024-11-15T18:57:39Z","title":"MARS: Unleashing the Power of Variance Reduction for Training Large Models","version":4},"cited_work":{"arxiv_id":"2411.10438","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.10438","snapshot_observed_at":"2026-07-03T20:18:56.218978Z","title":"Mars: Unleashing the power of variance reduction for training large models.arXiv preprint arXiv:2411.10438","venue":null,"work_id":"c3479a39-1a42-40c5-8f10-bafb1da1e032","year":2024},"citing_paper":{"arxiv_id":"2605.02143","last_updated":"2026-05-04T01:50:54Z","snapshot_observed_at":"2026-08-19T09:37:12.152902Z","submitted_at":"2026-05-04T01:50:54Z","title":"Personalized Federated Learning for Gradient Alignment","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-05-08T19:32:49.261153Z"},"links":{"cited_paper":"/paper/2411.10438","citing_paper":"/paper/2605.02143"},"observation_digest":"sha256:93109147e165546187419f5d8195bc4a0b31de3512921980d7ea85580bb6e071","observation_id":"020babd5-7115-47a9-b824-8019276a58f3","resolution":{"observed_at":"2026-05-09T05:50:26.268022Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.10438","last_updated":"2025-09-04T09:37:05Z","snapshot_observed_at":"2026-08-17T20:25:32.027243Z","submitted_at":"2024-11-15T18:57:39Z","title":"MARS: Unleashing the Power of Variance Reduction for Training Large Models","version":4},"cited_work":{"arxiv_id":"2411.10438","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.10438","snapshot_observed_at":"2026-07-03T20:18:56.218978Z","title":"Mars: Unleashing the power of variance reduction for training large models.arXiv preprint arXiv:2411.10438","venue":null,"work_id":"c3479a39-1a42-40c5-8f10-bafb1da1e032","year":2024},"citing_paper":{"arxiv_id":"2605.06654","last_updated":"2026-05-07T17:57:02Z","snapshot_observed_at":"2026-08-14T17:08:26.107852Z","submitted_at":"2026-05-07T17:57:02Z","title":"Optimizer-Model Consistency: Full Finetuning with the Same Optimizer as Pretraining Forgets Less","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-08T12:00:49.127471Z"},"links":{"cited_paper":"/paper/2411.10438","citing_paper":"/paper/2605.06654"},"observation_digest":"sha256:e493633cff9214fa4d973fea8a51f285901ef3ae6ce531fc6f5e1ab18cfa5841","observation_id":"538e25c1-2441-4600-8506-41ad000ad01b","resolution":{"observed_at":"2026-05-11T19:26:08.551157Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.10438","last_updated":"2025-09-04T09:37:05Z","snapshot_observed_at":"2026-08-17T20:25:32.027243Z","submitted_at":"2024-11-15T18:57:39Z","title":"MARS: Unleashing the Power of Variance Reduction for Training Large Models","version":4},"cited_work":{"arxiv_id":"2411.10438","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.10438","snapshot_observed_at":"2026-07-03T20:18:56.218978Z","title":"Mars: Unleashing the power of variance reduction for training large models.arXiv preprint arXiv:2411.10438","venue":null,"work_id":"c3479a39-1a42-40c5-8f10-bafb1da1e032","year":2024},"citing_paper":{"arxiv_id":"2605.18106","last_updated":"2026-06-22T06:06:33Z","snapshot_observed_at":"2026-08-14T08:05:42.459480Z","submitted_at":"2026-05-18T09:17:26Z","title":"Symmetry-Compatible Principle for Optimizer Design: Embeddings, LM Heads, SwiGLU MLPs, and MoE Routers","version":1},"reference_index":165,"source":"pdf_text","source_observed_at":"2026-05-20T09:34:45.186929Z"},"links":{"cited_paper":"/paper/2411.10438","citing_paper":"/paper/2605.18106"},"observation_digest":"sha256:5d4dacf6e26c71a42fdef0df29c3a8aa65cb76063a7a9e26d0c6d886af0c074c","observation_id":"1c50ea8b-05e4-4edd-a635-6d520343531d","resolution":{"observed_at":"2026-05-20T09:38:11.033711Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.10438","last_updated":"2025-09-04T09:37:05Z","snapshot_observed_at":"2026-08-17T20:25:32.027243Z","submitted_at":"2024-11-15T18:57:39Z","title":"MARS: Unleashing the Power of Variance Reduction for Training Large Models","version":4},"cited_work":{"arxiv_id":"2411.10438","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.10438","snapshot_observed_at":"2026-07-03T20:18:56.218978Z","title":"Mars: Unleashing the power of variance reduction for training large models.arXiv preprint arXiv:2411.10438","venue":null,"work_id":"c3479a39-1a42-40c5-8f10-bafb1da1e032","year":2024},"citing_paper":{"arxiv_id":"2605.18106","last_updated":"2026-06-22T06:06:33Z","snapshot_observed_at":"2026-08-14T08:05:42.459480Z","submitted_at":"2026-05-18T09:17:26Z","title":"Symmetry-Compatible Principle for Optimizer Design: Embeddings, LM Heads, SwiGLU MLPs, and MoE Routers","version":4},"reference_index":168,"source":"pdf_text","source_observed_at":"2026-06-30T18:42:01.854481Z"},"links":{"cited_paper":"/paper/2411.10438","citing_paper":"/paper/2605.18106"},"observation_digest":"sha256:569d37b343805fc9e187073bdd4fb6a2cc5fffa46caa6e67b015aa773ba8a034","observation_id":"e4e9ed29-c096-40da-a023-b20670e9989e","resolution":{"observed_at":"2026-06-30T18:45:00.292382Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.10438","last_updated":"2025-09-04T09:37:05Z","snapshot_observed_at":"2026-08-17T20:25:32.027243Z","submitted_at":"2024-11-15T18:57:39Z","title":"MARS: Unleashing the Power of Variance Reduction for Training Large Models","version":4},"cited_work":{"arxiv_id":"2411.10438","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.10438","snapshot_observed_at":"2026-07-03T20:18:56.218978Z","title":"Mars: Unleashing the power of variance reduction for training large models.arXiv preprint arXiv:2411.10438","venue":null,"work_id":"c3479a39-1a42-40c5-8f10-bafb1da1e032","year":2024},"citing_paper":{"arxiv_id":"2605.22644","last_updated":"2026-05-21T15:50:40Z","snapshot_observed_at":"2026-08-16T20:55:32.393949Z","submitted_at":"2026-05-21T15:50:40Z","title":"Why SGD is not Brownian Motion: A New Perspective on Stochastic Dynamics","version":1},"reference_index":158,"source":"arxiv_source","source_observed_at":"2026-05-22T08:06:52.309619Z"},"links":{"cited_paper":"/paper/2411.10438","citing_paper":"/paper/2605.22644"},"observation_digest":"sha256:6ba855bcd22c25106935b7fe5d7c2fee44e6989943362503a9baa48597bfcd92","observation_id":"8c1a22ae-c71f-4321-af06-e8f23ac2b9cf","resolution":{"observed_at":"2026-05-22T08:11:17.303623Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.10438","last_updated":"2025-09-04T09:37:05Z","snapshot_observed_at":"2026-08-17T20:25:32.027243Z","submitted_at":"2024-11-15T18:57:39Z","title":"MARS: Unleashing the Power of Variance Reduction for Training Large Models","version":4},"cited_work":{"arxiv_id":"2411.10438","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.10438","snapshot_observed_at":"2026-07-03T20:18:56.218978Z","title":"Mars: Unleashing the power of variance reduction for training large models.arXiv preprint arXiv:2411.10438","venue":null,"work_id":"c3479a39-1a42-40c5-8f10-bafb1da1e032","year":2024},"citing_paper":{"arxiv_id":"2606.17526","last_updated":"2026-06-16T05:10:29Z","snapshot_observed_at":"2026-08-15T19:26:27.614515Z","submitted_at":"2026-06-16T05:10:29Z","title":"MGUP: A Momentum-Gradient Alignment Update Policy for Stochastic Optimization","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-27T01:31:53.550342Z"},"links":{"cited_paper":"/paper/2411.10438","citing_paper":"/paper/2606.17526"},"observation_digest":"sha256:3b06534a9b364ad31297ab3304cbd2dae32c9224254d548f25c2c15d8b36fe88","observation_id":"b4b54b21-6276-4641-8006-bcd108a796c8","resolution":{"observed_at":"2026-07-03T20:18:56.220618Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.10438","last_updated":"2025-09-04T09:37:05Z","snapshot_observed_at":"2026-08-17T20:25:32.027243Z","submitted_at":"2024-11-15T18:57:39Z","title":"MARS: Unleashing the Power of Variance Reduction for Training Large Models","version":4},"cited_work":{"arxiv_id":"2411.10438","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.10438","snapshot_observed_at":"2026-07-03T20:18:56.218978Z","title":"Mars: Unleashing the power of variance reduction for training large models.arXiv preprint arXiv:2411.10438","venue":null,"work_id":"c3479a39-1a42-40c5-8f10-bafb1da1e032","year":2024},"citing_paper":{"arxiv_id":"2606.30634","last_updated":"2026-06-29T17:57:50Z","snapshot_observed_at":"2026-08-08T07:12:14.083887Z","submitted_at":"2026-06-29T17:57:50Z","title":"One-Step Gradient Delay is Not a Barrier for Large-Scale Asynchronous Pipeline Parallel LLM Pretraining","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-06-30T06:41:55.732230Z"},"links":{"cited_paper":"/paper/2411.10438","citing_paper":"/paper/2606.30634"},"observation_digest":"sha256:2e8e0ceb89e7367475e37c73bcfd1f8d8b27ba645e26d0f8dc0c0e6c2b6fab52","observation_id":"72e002c3-65e5-4a39-875c-59bb0765fa72","resolution":{"observed_at":"2026-06-30T06:44:18.839572Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.10438","last_updated":"2025-09-04T09:37:05Z","snapshot_observed_at":"2026-08-17T20:25:32.027243Z","submitted_at":"2024-11-15T18:57:39Z","title":"MARS: Unleashing the Power of Variance Reduction for Training Large Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.10438","snapshot_observed_at":"2026-07-11T22:10:49.683444Z","title":"Mars: Unleashing the power of variance reduction for training large models.arXiv preprint arXiv:2411.10438, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.04033","last_updated":"2026-07-04T21:27:05Z","snapshot_observed_at":"2026-08-07T05:07:10.107694Z","submitted_at":"2026-07-04T21:27:05Z","title":"OmniOpt: Taxonomy, Geometry, and Benchmarking of Modern Optimizers","version":1},"reference_index":128,"source":"pdf_text","source_observed_at":"2026-07-11T22:10:49.683444Z"},"links":{"cited_paper":"/paper/2411.10438","citing_paper":"/paper/2607.04033"},"observation_digest":"sha256:c28f22ccb3db90833a70e5104e5b03fe1220b86bb8b3d08cd3310cf8ad9dcfd4","observation_id":"92f28a8e-159e-4574-89fd-27f8a1ea7be4","resolution":{"observed_at":"2026-07-11T22:10:49.683444Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.10438","last_updated":"2025-09-04T09:37:05Z","snapshot_observed_at":"2026-08-17T20:25:32.027243Z","submitted_at":"2024-11-15T18:57:39Z","title":"MARS: Unleashing the Power of Variance Reduction for Training Large Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.10438","snapshot_observed_at":"2026-08-02T01:58:58.664681Z","title":"Mars: Unleashing the power of variance reduction for training large models.arXiv preprint arXiv:2411.10438,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14536","last_updated":"2026-07-16T03:42:21Z","snapshot_observed_at":"2026-08-14T00:59:23.434969Z","submitted_at":"2026-07-16T03:42:21Z","title":"Muse: Representation Geometry of Muon Beyond Normalized Momentum","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-02T01:58:58.664681Z"},"links":{"cited_paper":"/paper/2411.10438","citing_paper":"/paper/2607.14536"},"observation_digest":"sha256:27a380246927b63fe383a685a698865f2f3c360f7fec26565eadced3650feae4","observation_id":"bd0f53ac-6b1c-47ec-96bf-825f239333de","resolution":{"observed_at":"2026-08-02T01:58:58.664681Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.10438","last_updated":"2025-09-04T09:37:05Z","snapshot_observed_at":"2026-08-17T20:25:32.027243Z","submitted_at":"2024-11-15T18:57:39Z","title":"MARS: Unleashing the Power of Variance Reduction for Training Large Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.10438","snapshot_observed_at":"2026-08-02T12:30:38.237293Z","title":"Mars: Unleashing the power of variance reduction for training large models.arXiv preprint arXiv:2411.10438,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.20486","last_updated":"2026-06-02T15:21:53Z","snapshot_observed_at":"2026-08-14T21:11:09.117740Z","submitted_at":"2026-06-02T15:21:53Z","title":"OPTScientist: Multi-Agent Discovery of Typed Optimizer Programs for Transformer Pretraining","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-02T12:30:38.237293Z"},"links":{"cited_paper":"/paper/2411.10438","citing_paper":"/paper/2607.20486"},"observation_digest":"sha256:979e77911519e92411805b2f4ad4789a2ba6d9126b27f010c96eaa7507039b65","observation_id":"0f32997d-8304-4d9a-9fa0-e4c2397f32b3","resolution":{"observed_at":"2026-08-02T12:30:38.237293Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2411.10438/citation-record","integrity":"/paper/2411.10438/integrity","json":"/paper/2411.10438/citation-record.json","paper":"/paper/2411.10438"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:43:01.585508Z","title":"and Yuan, Y","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2411.10438","last_updated":"2025-09-04T09:37:05Z","snapshot_observed_at":"2026-08-17T20:25:32.027243Z","submitted_at":"2024-11-15T18:57:39Z","title":"MARS: Unleashing the Power of Variance Reduction for Training Large Models","version":4},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-12T19:43:01.585508Z"},"links":{"citing_paper":"/paper/2411.10438"},"observation_digest":"sha256:c0e2e3291297736708e0dc2c4661a422faa4a66fcd23451b67021967fcd4dd3a","observation_id":"32587236-7371-4bc6-8cae-c4c9317b1f20","resolution":{"observed_at":"2026-08-12T19:43:01.585508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2002.09018","last_updated":"2021-03-05T06:29:48Z","snapshot_observed_at":"2026-08-20T11:15:02.831518Z","submitted_at":"2020-02-20T20:51:33Z","title":"Scalable Second Order Optimization for Deep Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.09018","snapshot_observed_at":"2026-08-12T19:43:01.591712Z","title":"Scalable second order optimization for deep learning","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2411.10438","last_updated":"2025-09-04T09:37:05Z","snapshot_observed_at":"2026-08-17T20:25:32.027243Z","submitted_at":"2024-11-15T18:57:39Z","title":"MARS: Unleashing the Power of Variance Reduction for Training Large Models","version":4},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-12T19:43:01.591712Z"},"links":{"cited_paper":"/paper/2002.09018","citing_paper":"/paper/2411.10438"},"observation_digest":"sha256:70278e094e6b7db25842569100e97759a7811b413b47d6d7c4c29db7ac937e38","observation_id":"c23494a3-6110-4f42-b1fb-ef0b3e02ddac","resolution":{"observed_at":"2026-08-12T19:43:01.591712Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:43:01.597515Z","title":"C., Foster, D","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.10438","last_updated":"2025-09-04T09:37:05Z","snapshot_observed_at":"2026-08-17T20:25:32.027243Z","submitted_at":"2024-11-15T18:57:39Z","title":"MARS: Unleashing the Power of Variance Reduction for Training Large Models","version":4},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-12T19:43:01.597515Z"},"links":{"citing_paper":"/paper/2411.10438"},"observation_digest":"sha256:766e896ff0ec92f0dcc0454b9a3f801495eb1431cd2b5159e37febb5df2191fe","observation_id":"489e2f04-193e-4726-9e4f-70c67a967204","resolution":{"observed_at":"2026-08-12T19:43:01.597515Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:43:01.603039Z","title":"and Glynn, P","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2411.10438","last_updated":"2025-09-04T09:37:05Z","snapshot_observed_at":"2026-08-17T20:25:32.027243Z","submitted_at":"2024-11-15T18:57:39Z","title":"MARS: Unleashing the Power of Variance Reduction for Training Large Models","version":4},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-12T19:43:01.603039Z"},"links":{"citing_paper":"/paper/2411.10438"},"observation_digest":"sha256:ddf9c988d9f041a94827c4b6bddc6b4ce0dc733963dd03bf92a89a452a2d3c86","observation_id":"a3cade9e-05c8-4b36-a45c-aa930683b285","resolution":{"observed_at":"2026-08-12T19:43:01.603039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.20325","last_updated":"2024-12-06T14:09:22Z","snapshot_observed_at":"2026-08-12T12:26:45.359430Z","submitted_at":"2024-09-30T14:26:12Z","title":"Old Optimizer, New Norm: An Anthology","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.20325","snapshot_observed_at":"2026-08-12T19:43:01.608492Z","title":"and Newhouse, L","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.10438","last_updated":"2025-09-04T09:37:05Z","snapshot_observed_at":"2026-08-17T20:25:32.027243Z","submitted_at":"2024-11-15T18:57:39Z","title":"MARS: Unleashing the Power of Variance Reduction for Training Large Models","version":4},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-12T19:43:01.608492Z"},"links":{"cited_paper":"/paper/2409.20325","citing_paper":"/paper/2411.10438"},"observation_digest":"sha256:7ff2988997dc449709ca88229ff00be96ab52255ed82a32f46f00881f60ba2be","observation_id":"75163b56-d8a4-4c74-b8e2-2ff5c75ab8cd","resolution":{"observed_at":"2026-08-12T19:43:01.608492Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:43:01.615584Z","title":"L., Gao, J., and Choi, Y","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2411.10438","last_updated":"2025-09-04T09:37:05Z","snapshot_observed_at":"2026-08-17T20:25:32.027243Z","submitted_at":"2024-11-15T18:57:39Z","title":"MARS: Unleashing the Power of Variance Reduction for Training Large Models","version":4},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-12T19:43:01.615584Z"},"links":{"citing_paper":"/paper/2411.10438"},"observation_digest":"sha256:9a37552822be527474bafd844336ea17c333cf143184f9ea89b4f00acb711825","observation_id":"34e7797b-eb8b-4859-a7d8-4b4e61f5733d","resolution":{"observed_at":"2026-08-12T19:43:01.615584Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.14165","last_updated":"2020-07-22T19:47:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-28T17:29:03Z","title":"Language Models are Few-Shot Learners","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.14165","snapshot_observed_at":"2026-08-12T19:43:01.622016Z","title":null,"venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2411.10438","last_updated":"2025-09-04T09:37:05Z","snapshot_observed_at":"2026-08-17T20:25:32.027243Z","submitted_at":"2024-11-15T18:57:39Z","title":"MARS: Unleashing the Power of Variance Reduction for Training Large Models","version":4},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-12T19:43:01.622016Z"},"links":{"cited_paper":"/paper/2005.14165","citing_paper":"/paper/2411.10438"},"observation_digest":"sha256:80300c5e383058fbd6bcbe5ba59350d991696b18e98305ef89cb878daa8c1e9d","observation_id":"0af577b4-de4b-447b-a9c0-132775e4e360","resolution":{"observed_at":"2026-08-12T19:43:01.622016Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:43:01.629196Z","title":"Stochastic spectral descent for restricted boltzmann machines","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2411.10438","last_updated":"2025-09-04T09:37:05Z","snapshot_observed_at":"2026-08-17T20:25:32.027243Z","submitted_at":"2024-11-15T18:57:39Z","title":"MARS: Unleashing the Power of Variance Reduction for Training Large Models","version":4},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-12T19:43:01.629196Z"},"links":{"citing_paper":"/paper/2411.10438"},"observation_digest":"sha256:e99a8bae3acde6672413255c054ad62d63e36c9921aae226c40b7bf5f5496fea","observation_id":"18cd5d9d-fd4e-4d79-9728-7799a3146168","resolution":{"observed_at":"2026-08-12T19:43:01.629196Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:43:01.635158Z","title":"Stochastic spectral descent for discrete graphical models","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2411.10438","last_updated":"2025-09-04T09:37:05Z","snapshot_observed_at":"2026-08-17T20:25:32.027243Z","submitted_at":"2024-11-15T18:57:39Z","title":"MARS: Unleashing the Power of Variance Reduction for Training Large Models","version":4},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-12T19:43:01.635158Z"},"links":{"citing_paper":"/paper/2411.10438"},"observation_digest":"sha256:79be33fafb729b5bce71b0635085a8140986f6f469b4a70781c9fb8df06bc35e","observation_id":"f271a367-fd5f-4c90-be6b-be2c2a5d4c4f","resolution":{"observed_at":"2026-08-12T19:43:01.635158Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1806.06763","last_updated":"2020-06-23T06:47:00Z","snapshot_observed_at":"2026-08-19T14:19:07.002118Z","submitted_at":"2018-06-18T15:17:01Z","title":"Closing the Generalization Gap of Adaptive Gradient Methods in Training Deep Neural Networks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1806.06763","snapshot_observed_at":"2026-08-12T19:43:01.642149Z","title":"Closing the generalization gap of adaptive gradient methods in training deep neural networks","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2411.10438","last_updated":"2025-09-04T09:37:05Z","snapshot_observed_at":"2026-08-17T20:25:32.027243Z","submitted_at":"2024-11-15T18:57:39Z","title":"MARS: Unleashing the Power of Variance Reduction for Training Large Models","version":4},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-12T19:43:01.642149Z"},"links":{"cited_paper":"/paper/1806.06763","citing_paper":"/paper/2411.10438"},"observation_digest":"sha256:aaf04e50cbd5e709831804724db47eeb65335ac6fe51baf6ef23c38a63f182d4","observation_id":"6a327634-7f86-4bdd-abcb-41771812372d","resolution":{"observed_at":"2026-08-12T19:43:01.642149Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:43:01.647714Z","title":"Symbolic discovery of optimization algorithms","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.10438","last_updated":"2025-09-04T09:37:05Z","snapshot_observed_at":"2026-08-17T20:25:32.027243Z","submitted_at":"2024-11-15T18:57:39Z","title":"MARS: Unleashing the Power of Variance Reduction for Training Large Models","version":4},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-12T19:43:01.647714Z"},"links":{"citing_paper":"/paper/2411.10438"},"observation_digest":"sha256:b576e6d9f618293d6caf5a8522d1620306e5b4d4ceec2b2e291aa99eb066f302","observation_id":"5a69e144-f8f0-4d1e-a106-01c139073854","resolution":{"observed_at":"2026-08-12T19:43:01.647714Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:43:01.652838Z","title":"W., Sutton, C., Gehrmann, S., et al","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.10438","last_updated":"2025-09-04T09:37:05Z","snapshot_observed_at":"2026-08-17T20:25:32.027243Z","submitted_at":"2024-11-15T18:57:39Z","title":"MARS: Unleashing the Power of Variance Reduction for Training Large Models","version":4},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-12T19:43:01.652838Z"},"links":{"citing_paper":"/paper/2411.10438"},"observation_digest":"sha256:c2592a4a8302a27f6978bdccd6b4e5bb4201d3a8657d630fba5b0702771b0a73","observation_id":"de0da958-9185-4240-ab0b-e12a0a20c986","resolution":{"observed_at":"2026-08-12T19:43:01.652838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:43:01.657716Z","title":"Boolq: Exploring the surprising difficulty of natural yes/no questions","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2411.10438","last_updated":"2025-09-04T09:37:05Z","snapshot_observed_at":"2026-08-17T20:25:32.027243Z","submitted_at":"2024-11-15T18:57:39Z","title":"MARS: Unleashing the Power of Variance Reduction for Training Large Models","version":4},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-12T19:43:01.657716Z"},"links":{"citing_paper":"/paper/2411.10438"},"observation_digest":"sha256:0915964bf8cae8f4c26dd45df581df5fd06c30144f6d0e1c2a4212fb806d897a","observation_id":"4dfdbe6d-757e-4d09-aded-a15b2248b3ce","resolution":{"observed_at":"2026-08-12T19:43:01.657716Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:43:01.662494Z","title":"and Orabona, F","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2411.10438","last_updated":"2025-09-04T09:37:05Z","snapshot_observed_at":"2026-08-17T20:25:32.027243Z","submitted_at":"2024-11-15T18:57:39Z","title":"MARS: Unleashing the Power of Variance Reduction for Training Large Models","version":4},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-12T19:43:01.662494Z"},"links":{"citing_paper":"/paper/2411.10438"},"observation_digest":"sha256:7930cb6a7256d9720350296bac01ba3ac94b1eafc771cafa874482977c7bf647","observation_id":"c6986463-4542-4b2e-9862-06881e5d84fe","resolution":{"observed_at":"2026-08-12T19:43:01.662494Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:43:01.667415Z","title":"and Bottou, L","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2411.10438","last_updated":"2025-09-04T09:37:05Z","snapshot_observed_at":"2026-08-17T20:25:32.027243Z","submitted_at":"2024-11-15T18:57:39Z","title":"MARS: Unleashing the Power of Variance Reduction for Training Large Models","version":4},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-12T19:43:01.667415Z"},"links":{"citing_paper":"/paper/2411.10438"},"observation_digest":"sha256:425e9f47fe13293c89b8d4b82fc232b6f6da99d93a33f701a0c50e554b1750df","observation_id":"11856636-9353-4a77-a17b-83886cbbd8a4","resolution":{"observed_at":"2026-08-12T19:43:01.667415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:43:01.672447Z","title":"Saga: A fast incremental gradient method with support for non-strongly convex composite objectives","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2411.10438","last_updated":"2025-09-04T09:37:05Z","snapshot_observed_at":"2026-08-17T20:25:32.027243Z","submitted_at":"2024-11-15T18:57:39Z","title":"MARS: Unleashing the Power of Variance Reduction for Training Large Models","version":4},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-12T19:43:01.672447Z"},"links":{"citing_paper":"/paper/2411.10438"},"observation_digest":"sha256:c6785c526530334e604dd2ffc79a1e67c0b6b749b019a92494b800036e533997","observation_id":"383cc93d-6e19-4562-b8f7-bf25784f1e2f","resolution":{"observed_at":"2026-08-12T19:43:01.672447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.15682","last_updated":"2024-10-29T22:40:23Z","snapshot_observed_at":"2026-08-16T13:49:41.180584Z","submitted_at":"2024-05-24T16:20:46Z","title":"The Road Less Scheduled","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.15682","snapshot_observed_at":"2026-08-12T19:43:01.677433Z","title":"A., Mehta, H., Mishchenko, K., Khaled, A., and Cutkosky, A","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.10438","last_updated":"2025-09-04T09:37:05Z","snapshot_observed_at":"2026-08-17T20:25:32.027243Z","submitted_at":"2024-11-15T18:57:39Z","title":"MARS: Unleashing the Power of Variance Reduction for Training Large Models","version":4},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-12T19:43:01.677433Z"},"links":{"cited_paper":"/paper/2405.15682","citing_paper":"/paper/2411.10438"},"observation_digest":"sha256:5f6cf138c4f2f6794ec8fd27dd395c61f1c4eb10538a03b570b24035bce34d07","observation_id":"473f2f71-6b58-4f5c-baaf-687600880774","resolution":{"observed_at":"2026-08-12T19:43:01.677433Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:43:01.683546Z","title":"Stochastic variance-reduced newton: Accelerating finite-sum minimization with large batches","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.10438","last_updated":"2025-09-04T09:37:05Z","snapshot_observed_at":"2026-08-17T20:25:32.027243Z","submitted_at":"2024-11-15T18:57:39Z","title":"MARS: Unleashing the Power of Variance Reduction for Training Large Models","version":4},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-12T19:43:01.683546Z"},"links":{"citing_paper":"/paper/2411.10438"},"observation_digest":"sha256:8e3317bfd060aaef3f1a5d714332d863b1c1c03aee0eb8f5b013b20b9f5c81fc","observation_id":"311715d3-4e4b-4421-a965-f5f1ccda8f22","resolution":{"observed_at":"2026-08-12T19:43:01.683546Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1810.04805","last_updated":"2019-05-24T20:37:26Z","snapshot_observed_at":"2026-08-14T18:16:28.847993Z","submitted_at":"2018-10-11T00:50:01Z","title":"BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.04805","snapshot_observed_at":"2026-08-12T19:43:01.688005Z","title":"Bert: Pre-training of deep bidirectional transformers for language understanding","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2411.10438","last_updated":"2025-09-04T09:37:05Z","snapshot_observed_at":"2026-08-17T20:25:32.027243Z","submitted_at":"2024-11-15T18:57:39Z","title":"MARS: Unleashing the Power of Variance Reduction for Training Large Models","version":4},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-12T19:43:01.688005Z"},"links":{"cited_paper":"/paper/1810.04805","citing_paper":"/paper/2411.10438"},"observation_digest":"sha256:a2fdba29d4044bdbac99e21fa85797d2b469b0b27911b295f496b5c6eb1aee93","observation_id":"a9ce96ff-9c55-4f14-b1e6-4d48be2963c5","resolution":{"observed_at":"2026-08-12T19:43:01.688005Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-12T19:43:01.692307Z","title":"The llama 3 herd of models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.10438","last_updated":"2025-09-04T09:37:05Z","snapshot_observed_at":"2026-08-17T20:25:32.027243Z","submitted_at":"2024-11-15T18:57:39Z","title":"MARS: Unleashing the Power of Variance Reduction for Training Large Models","version":4},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-12T19:43:01.692307Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2411.10438"},"observation_digest":"sha256:97bbc3dcf146aaf7e7f33617037cbca26d7490ce7122214fffeb0cdf5d9277eb","observation_id":"c084cd7b-690e-4278-8d2c-dd4f5fcfbf75","resolution":{"observed_at":"2026-08-12T19:43:01.692307Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:43:01.696550Z","title":"Adaptive subgradient methods for online learning and stochastic optimization","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2411.10438","last_updated":"2025-09-04T09:37:05Z","snapshot_observed_at":"2026-08-17T20:25:32.027243Z","submitted_at":"2024-11-15T18:57:39Z","title":"MARS: Unleashing the Power of Variance Reduction for Training Large Models","version":4},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-12T19:43:01.696550Z"},"links":{"citing_paper":"/paper/2411.10438"},"observation_digest":"sha256:0d185f77ce3f563720af7f6cc1e5bae5308e5ca20fc8cdc774d87b3b2ed2599a","observation_id":"82f877d8-2988-4dd1-9e2e-4e596f507325","resolution":{"observed_at":"2026-08-12T19:43:01.696550Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:43:01.701454Z","title":"J., Lin, Z., and Zhang, T","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2411.10438","last_updated":"2025-09-04T09:37:05Z","snapshot_observed_at":"2026-08-17T20:25:32.027243Z","submitted_at":"2024-11-15T18:57:39Z","title":"MARS: Unleashing the Power of Variance Reduction for Training Large Models","version":4},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-12T19:43:01.701454Z"},"links":{"citing_paper":"/paper/2411.10438"},"observation_digest":"sha256:be881f643fa9215452b0943edd0d2bdfc2ce3a4491d84bc1af0c3eb3f1956eef","observation_id":"e7450097-b671-4ddc-96e0-bb465215a037","resolution":{"observed_at":"2026-08-12T19:43:01.701454Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:43:03.971454Z","title":"Promise: Preconditioned stochastic optimization methods by incorporating scalable curvature estimates","venue":null,"work_id":"6ebd045d-6cfd-4fba-82da-a745ea4e7147","year":2024},"citing_paper":{"arxiv_id":"2411.10438","last_updated":"2025-09-04T09:37:05Z","snapshot_observed_at":"2026-08-17T20:25:32.027243Z","submitted_at":"2024-11-15T18:57:39Z","title":"MARS: Unleashing the Power of Variance Reduction for Training Large Models","version":4},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-12T19:43:01.706512Z"},"links":{"citing_paper":"/paper/2411.10438"},"observation_digest":"sha256:7176fcd73d7368018f4be221a34c6da77f355d04b65e711f67b1181681c925fe","observation_id":"d2867a9b-db15-4931-a3b8-dbaa05ed9173","resolution":{"observed_at":"2026-08-12T19:43:03.977171Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:43:01.711300Z","title":"A framework for few-shot language model evaluation, 07 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.10438","last_updated":"2025-09-04T09:37:05Z","snapshot_observed_at":"2026-08-17T20:25:32.027243Z","submitted_at":"2024-11-15T18:57:39Z","title":"MARS: Unleashing the Power of Variance Reduction for Training Large Models","version":4},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-12T19:43:01.711300Z"},"links":{"citing_paper":"/paper/2411.10438"},"observation_digest":"sha256:212a4f9c6264233ad00a320eed15b37d38a6ced7931ddb4d6da96fa443d51f22","observation_id":"28f611b6-5a1a-40d5-8130-e98ebebb5e23","resolution":{"observed_at":"2026-08-12T19:43:01.711300Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:43:01.715934Z","title":"and Lan, G","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2411.10438","last_updated":"2025-09-04T09:37:05Z","snapshot_observed_at":"2026-08-17T20:25:32.027243Z","submitted_at":"2024-11-15T18:57:39Z","title":"MARS: Unleashing the Power of Variance Reduction for Training Large Models","version":4},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-12T19:43:01.715934Z"},"links":{"citing_paper":"/paper/2411.10438"},"observation_digest":"sha256:831873ccc2e786a8690ad11e900749549b5d68e1274bb6aa95be9f03eff80cfa","observation_id":"332c3eeb-a786-460f-91d7-5586729a2c81","resolution":{"observed_at":"2026-08-12T19:43:01.715934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:43:01.720780Z","title":"Openwebtext corpus","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2411.10438","last_updated":"2025-09-04T09:37:05Z","snapshot_observed_at":"2026-08-17T20:25:32.027243Z","submitted_at":"2024-11-15T18:57:39Z","title":"MARS: Unleashing the Power of Variance Reduction for Training Large Models","version":4},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-12T19:43:01.720780Z"},"links":{"citing_paper":"/paper/2411.10438"},"observation_digest":"sha256:5ad71fb55da23ca30b74882f026506f68e5c9d2550d5f4d886ca6feec2782a87","observation_id":"0a9c5b38-f97a-4ac3-ad29-1b5a50e3f11e","resolution":{"observed_at":"2026-08-12T19:43:01.720780Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:43:01.725724Z","title":"and Graves, A","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2411.10438","last_updated":"2025-09-04T09:37:05Z","snapshot_observed_at":"2026-08-17T20:25:32.027243Z","submitted_at":"2024-11-15T18:57:39Z","title":"MARS: Unleashing the Power of Variance Reduction for Training Large Models","version":4},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-12T19:43:01.725724Z"},"links":{"citing_paper":"/paper/2411.10438"},"observation_digest":"sha256:6cb32b49f6e7193ce2e31ee3685a007759e10653c2650277436526d026dabe6a","observation_id":"f0090491-0933-4f80-86d8-14c98d7ad1e8","resolution":{"observed_at":"2026-08-12T19:43:01.725724Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:43:01.730667Z","title":"Shampoo: Preconditioned stochastic tensor optimization","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2411.10438","last_updated":"2025-09-04T09:37:05Z","snapshot_observed_at":"2026-08-17T20:25:32.027243Z","submitted_at":"2024-11-15T18:57:39Z","title":"MARS: Unleashing the Power of Variance Reduction for Training Large Models","version":4},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-12T19:43:01.730667Z"},"links":{"citing_paper":"/paper/2411.10438"},"observation_digest":"sha256:718366294317709d2271fd3d25595404e45220aa79a5efeac15a65acc5f0d996","observation_id":"c99be9de-a6d6-4e29-ab8a-075002b83bb4","resolution":{"observed_at":"2026-08-12T19:43:01.730667Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:43:01.735999Z","title":"Beyond convexity: Stochastic quasi-convex optimization","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2411.10438","last_updated":"2025-09-04T09:37:05Z","snapshot_observed_at":"2026-08-17T20:25:32.027243Z","submitted_at":"2024-11-15T18:57:39Z","title":"MARS: Unleashing the Power of Variance Reduction for Training Large Models","version":4},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-12T19:43:01.735999Z"},"links":{"citing_paper":"/paper/2411.10438"},"observation_digest":"sha256:5f9ebb35eb68573be2e6ca9dae6a0341db45bf198e6a0f682e41728da30fe05f","observation_id":"837873a5-4868-487b-9676-6051d1199ade","resolution":{"observed_at":"2026-08-12T19:43:01.735999Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:43:01.740817Z","title":"Deep residual learning for image recognition","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2411.10438","last_updated":"2025-09-04T09:37:05Z","snapshot_observed_at":"2026-08-17T20:25:32.027243Z","submitted_at":"2024-11-15T18:57:39Z","title":"MARS: Unleashing the Power of Variance Reduction for Training Large Models","version":4},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-12T19:43:01.740817Z"},"links":{"citing_paper":"/paper/2411.10438"},"observation_digest":"sha256:0a1c822c0582a6e3b3668b81f6d48b801b5d7abebcc2eb64afefab44ab2a0d9a","observation_id":"0eb16ae7-421a-4793-818f-b9012f330f17","resolution":{"observed_at":"2026-08-12T19:43:01.740817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:43:03.857254Z","title":"Measuring massive multitask language understanding","venue":null,"work_id":"3eae0715-0408-4270-a32a-1d41a6fde3e1","year":2021},"citing_paper":{"arxiv_id":"2411.10438","last_updated":"2025-09-04T09:37:05Z","snapshot_observed_at":"2026-08-17T20:25:32.027243Z","submitted_at":"2024-11-15T18:57:39Z","title":"MARS: Unleashing the Power of Variance Reduction for Training Large Models","version":4},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-12T19:43:01.745796Z"},"links":{"citing_paper":"/paper/2411.10438"},"observation_digest":"sha256:4dbd28210d2bd8ed1f63bfcf75c545cb2366ca89eda3ed32eb3270834bdf7fa0","observation_id":"365be778-5806-4500-81d9-2650b84c20ee","resolution":{"observed_at":"2026-08-12T19:43:03.863789Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:43:03.835092Z","title":null,"venue":null,"work_id":"f3a38773-6339-4611-8294-ec7198b92ab4","year":2008},"citing_paper":{"arxiv_id":"2411.10438","last_updated":"2025-09-04T09:37:05Z","snapshot_observed_at":"2026-08-17T20:25:32.027243Z","submitted_at":"2024-11-15T18:57:39Z","title":"MARS: Unleashing the Power of Variance Reduction for Training Large Models","version":4},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-12T19:43:01.750649Z"},"links":{"citing_paper":"/paper/2411.10438"},"observation_digest":"sha256:d13296dcc66862d45983a63c4d03e11ba39b93def9d7bbed3aa629d1f41c7365","observation_id":"7c0c1a4f-42c9-4135-80fe-d10eab8c40bc","resolution":{"observed_at":"2026-08-12T19:43:03.843349Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06395","last_updated":"2024-06-03T08:54:38Z","snapshot_observed_at":"2026-08-12T13:10:06.472493Z","submitted_at":"2024-04-09T15:36:50Z","title":"MiniCPM: Unveiling the Potential of Small Language Models with Scalable Training Strategies","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.06395","snapshot_observed_at":"2026-08-12T19:43:01.756402Z","title":"Minicpm: Unveiling the potential of small language models with scalable training strategies","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.10438","last_updated":"2025-09-04T09:37:05Z","snapshot_observed_at":"2026-08-17T20:25:32.027243Z","submitted_at":"2024-11-15T18:57:39Z","title":"MARS: Unleashing the Power of Variance Reduction for Training Large Models","version":4},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-12T19:43:01.756402Z"},"links":{"cited_paper":"/paper/2404.06395","citing_paper":"/paper/2411.10438"},"observation_digest":"sha256:1d706ba66327a50529a564d762e12888890465fa4eadfeefd073008f120d716f","observation_id":"a44fc610-5fee-424c-903f-eeff8f848111","resolution":{"observed_at":"2026-08-12T19:43:01.756402Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:43:03.808084Z","title":"Super-adam: faster and universal framework of adaptive gradients","venue":null,"work_id":"ee3ba22c-866e-4490-97b7-6376798ec456","year":2021},"citing_paper":{"arxiv_id":"2411.10438","last_updated":"2025-09-04T09:37:05Z","snapshot_observed_at":"2026-08-17T20:25:32.027243Z","submitted_at":"2024-11-15T18:57:39Z","title":"MARS: Unleashing the Power of Variance Reduction for Training Large Models","version":4},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-12T19:43:01.762055Z"},"links":{"citing_paper":"/paper/2411.10438"},"observation_digest":"sha256:f7933a658dd81c8a5ad5b8542a359c51815dacd03611467b6191a4e2ce32836e","observation_id":"f860c1b5-000b-43e3-90d6-ad060a880bd7","resolution":{"observed_at":"2026-08-12T19:43:03.815290Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:43:01.766979Z","title":"and Zhang, T","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2411.10438","last_updated":"2025-09-04T09:37:05Z","snapshot_observed_at":"2026-08-17T20:25:32.027243Z","submitted_at":"2024-11-15T18:57:39Z","title":"MARS: Unleashing the Power of Variance Reduction for Training Large Models","version":4},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-12T19:43:01.766979Z"},"links":{"citing_paper":"/paper/2411.10438"},"observation_digest":"sha256:648838a1713854419b5fe9a7e04b395ce35f5eef3f729e42ca66c1e493c66659","observation_id":"095ffd0c-484f-441a-958f-0ccf4ac6f5a4","resolution":{"observed_at":"2026-08-12T19:43:01.766979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:43:01.771826Z","title":"Muon: An optimizer for hidden layers in neural networks, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.10438","last_updated":"2025-09-04T09:37:05Z","snapshot_observed_at":"2026-08-17T20:25:32.027243Z","submitted_at":"2024-11-15T18:57:39Z","title":"MARS: Unleashing the Power of Variance Reduction for Training Large Models","version":4},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-12T19:43:01.771826Z"},"links":{"citing_paper":"/paper/2411.10438"},"observation_digest":"sha256:2b1059ff3528b1188e97b50c6e5c7ff3d8066e492fc157b02fcdff59389c9d90","observation_id":"e6ac791e-5db5-4467-b101-9f19dc00ae43","resolution":{"observed_at":"2026-08-12T19:43:01.771826Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:43:03.754571Z","title":null,"venue":null,"work_id":"36c7cc44-cf14-44fe-86e3-b934f1b4174b","year":2024},"citing_paper":{"arxiv_id":"2411.10438","last_updated":"2025-09-04T09:37:05Z","snapshot_observed_at":"2026-08-17T20:25:32.027243Z","submitted_at":"2024-11-15T18:57:39Z","title":"MARS: Unleashing the Power of Variance Reduction for Training Large Models","version":4},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-12T19:43:01.776602Z"},"links":{"citing_paper":"/paper/2411.10438"},"observation_digest":"sha256:26c92b3847101621afabc4ffeb21efcc286abbb0a742aaf3bc0ce9bbfeb9b4a7","observation_id":"22458ebd-08da-48ea-9dec-10abb76e7a98","resolution":{"observed_at":"2026-08-12T19:43:03.761712Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:43:03.725050Z","title":null,"venue":null,"work_id":"acc99a76-684d-4e9c-a7b3-0f2602ea68ee","year":2022},"citing_paper":{"arxiv_id":"2411.10438","last_updated":"2025-09-04T09:37:05Z","snapshot_observed_at":"2026-08-17T20:25:32.027243Z","submitted_at":"2024-11-15T18:57:39Z","title":"MARS: Unleashing the Power of Variance Reduction for Training Large Models","version":4},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-12T19:43:01.781457Z"},"links":{"citing_paper":"/paper/2411.10438"},"observation_digest":"sha256:bcf9230a35cd10496f93e3d4e1d676ce5bdfb2aac164a584f9d4f3bfc3b5999b","observation_id":"d99fb412-a9cf-421e-93ec-20e084cb9f06","resolution":{"observed_at":"2026-08-12T19:43:03.735491Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:43:03.690477Z","title":"T., and Cevher, V","venue":null,"work_id":"057dcc20-4522-42d0-8eec-545360c1cebf","year":2022},"citing_paper":{"arxiv_id":"2411.10438","last_updated":"2025-09-04T09:37:05Z","snapshot_observed_at":"2026-08-17T20:25:32.027243Z","submitted_at":"2024-11-15T18:57:39Z","title":"MARS: Unleashing the Power of Variance Reduction for Training Large Models","version":4},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-12T19:43:01.786181Z"},"links":{"citing_paper":"/paper/2411.10438"},"observation_digest":"sha256:f874e1c75f51163fb3b7078f322ae1529d6494812558f93608fe3aa1f90fdef4","observation_id":"7db134d0-4a1a-44a0-8ce9-914866c1da56","resolution":{"observed_at":"2026-08-12T19:43:03.699534Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:43:01.791022Z","title":null,"venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2411.10438","last_updated":"2025-09-04T09:37:05Z","snapshot_observed_at":"2026-08-17T20:25:32.027243Z","submitted_at":"2024-11-15T18:57:39Z","title":"MARS: Unleashing the Power of Variance Reduction for Training Large Models","version":4},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-12T19:43:01.791022Z"},"links":{"citing_paper":"/paper/2411.10438"},"observation_digest":"sha256:84f70c22b5f64efa6c6aad678d5202c412c9b04c251df738fe198729c2c8dbd7","observation_id":"e0978da1-f323-430f-9617-c1a31cc3e799","resolution":{"observed_at":"2026-08-12T19:43:01.791022Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:43:01.795890Z","title":"Learning multiple layers of features from tiny images","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2411.10438","last_updated":"2025-09-04T09:37:05Z","snapshot_observed_at":"2026-08-17T20:25:32.027243Z","submitted_at":"2024-11-15T18:57:39Z","title":"MARS: Unleashing the Power of Variance Reduction for Training Large Models","version":4},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-12T19:43:01.795890Z"},"links":{"citing_paper":"/paper/2411.10438"},"observation_digest":"sha256:9c826c43b67ddb373afffce0fb56c3161cf62dac0b3a3a8be7be26b105b24038","observation_id":"579e6a5e-ef91-48af-ae00-7b31d2e79891","resolution":{"observed_at":"2026-08-12T19:43:01.795890Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:43:03.641021Z","title":"On the computation of the matrix k-th root","venue":null,"work_id":"78415228-6779-41dc-927b-3994f7233405","year":1998},"citing_paper":{"arxiv_id":"2411.10438","last_updated":"2025-09-04T09:37:05Z","snapshot_observed_at":"2026-08-17T20:25:32.027243Z","submitted_at":"2024-11-15T18:57:39Z","title":"MARS: Unleashing the Power of Variance Reduction for Training Large Models","version":4},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-12T19:43:01.801647Z"},"links":{"citing_paper":"/paper/2411.10438"},"observation_digest":"sha256:69766a74e4999b9d8523d2cdc19bf42532852a1e4fa8c9de2d5bc054dbfe67bd","observation_id":"cce1d6db-0167-4dcb-b47f-59bb14ca9253","resolution":{"observed_at":"2026-08-12T19:43:03.646413Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:43:03.613596Z","title":"S., Moeller, T","venue":null,"work_id":"3340fa6d-9eb8-43b8-be7a-f276442ad811","year":1977},"citing_paper":{"arxiv_id":"2411.10438","last_updated":"2025-09-04T09:37:05Z","snapshot_observed_at":"2026-08-17T20:25:32.027243Z","submitted_at":"2024-11-15T18:57:39Z","title":"MARS: Unleashing the Power of Variance Reduction for Training Large Models","version":4},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-12T19:43:01.807152Z"},"links":{"citing_paper":"/paper/2411.10438"},"observation_digest":"sha256:a2165385a0fc5b193ba1fdd07a193caa2021c199679745d45cc47701d204f472","observation_id":"6b6aa78d-cce2-4b06-9429-5f6a6637dc43","resolution":{"observed_at":"2026-08-12T19:43:03.621762Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:43:01.813004Z","title":"Gradient-based learning applied to document recognition","venue":null,"work_id":null,"year":1998},"citing_paper":{"arxiv_id":"2411.10438","last_updated":"2025-09-04T09:37:05Z","snapshot_observed_at":"2026-08-17T20:25:32.027243Z","submitted_at":"2024-11-15T18:57:39Z","title":"MARS: Unleashing the Power of Variance Reduction for Training Large Models","version":4},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-12T19:43:01.813004Z"},"links":{"citing_paper":"/paper/2411.10438"},"observation_digest":"sha256:22bfab8957ebda6c19321fc1f59f2e59e27b02ec92b39e790dd0302f3c43d245","observation_id":"564e5370-2bc4-40a4-bf8c-75b95e12b00b","resolution":{"observed_at":"2026-08-12T19:43:01.813004Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:43:03.575631Z","title":"Storm+: Fully adaptive sgd with recursive momentum for nonconvex optimization","venue":null,"work_id":"7713da40-3924-485c-a04c-8a09c0519969","year":2021},"citing_paper":{"arxiv_id":"2411.10438","last_updated":"2025-09-04T09:37:05Z","snapshot_observed_at":"2026-08-17T20:25:32.027243Z","submitted_at":"2024-11-15T18:57:39Z","title":"MARS: Unleashing the Power of Variance Reduction for Training Large Models","version":4},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-12T19:43:01.817989Z"},"links":{"citing_paper":"/paper/2411.10438"},"observation_digest":"sha256:abdcfee727fc67b76217210dfd738710f8e0114de24f4dc3628dd34d79e28c42","observation_id":"29b4ed67-9353-458f-8251-93feac329703","resolution":{"observed_at":"2026-08-12T19:43:03.583059Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:43:03.557213Z","title":"Smoothness and Adaptivity in Nonlinear Optimization for Machine Learning Applications","venue":null,"work_id":"08b3bc1f-5489-4ee8-b876-c2abcf125002","year":2024},"citing_paper":{"arxiv_id":"2411.10438","last_updated":"2025-09-04T09:37:05Z","snapshot_observed_at":"2026-08-17T20:25:32.027243Z","submitted_at":"2024-11-15T18:57:39Z","title":"MARS: Unleashing the Power of Variance Reduction for Training Large Models","version":4},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-12T19:43:01.823101Z"},"links":{"citing_paper":"/paper/2411.10438"},"observation_digest":"sha256:dc3ea23ff2cdda2c44c434739966cfabe01a6315d855c2adcb828fd5249efdca","observation_id":"49389a72-448f-4e61-b719-5bd1f2b428dc","resolution":{"observed_at":"2026-08-12T19:43:03.562677Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:43:03.533252Z","title":"Convergence of adam under relaxed assumptions","venue":null,"work_id":"9513ca20-9230-4d6e-ab18-5176f8e78625","year":2024},"citing_paper":{"arxiv_id":"2411.10438","last_updated":"2025-09-04T09:37:05Z","snapshot_observed_at":"2026-08-17T20:25:32.027243Z","submitted_at":"2024-11-15T18:57:39Z","title":"MARS: Unleashing the Power of Variance Reduction for Training Large Models","version":4},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-12T19:43:01.828261Z"},"links":{"citing_paper":"/paper/2411.10438"},"observation_digest":"sha256:8200085808a8bc5d121e8c47d7d55673f2cf0e1f256241463c18043f28368d41","observation_id":"28f3b14e-136d-4d1c-a3ae-94871d9d4cae","resolution":{"observed_at":"2026-08-12T19:43:03.541573Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04434","snapshot_observed_at":"2026-08-12T19:43:01.833269Z","title":"Deepseek-v2: A strong, economical, and efficient mixture-of-experts language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.10438","last_updated":"2025-09-04T09:37:05Z","snapshot_observed_at":"2026-08-17T20:25:32.027243Z","submitted_at":"2024-11-15T18:57:39Z","title":"MARS: Unleashing the Power of Variance Reduction for Training Large Models","version":4},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-12T19:43:01.833269Z"},"links":{"cited_paper":"/paper/2405.04434","citing_paper":"/paper/2411.10438"},"observation_digest":"sha256:ab8d056ce61b1e31b79a00972ac5230763e0327bc20b0d007db5031bbadcccb1","observation_id":"476a60c7-8422-4d96-af61-7dabfc07b7ce","resolution":{"observed_at":"2026-08-12T19:43:01.833269Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14342","last_updated":"2024-03-05T17:07:16Z","snapshot_observed_at":"2026-08-20T04:30:51.893630Z","submitted_at":"2023-05-23T17:59:21Z","title":"Sophia: A Scalable Stochastic Second-order Optimizer for Language Model Pre-training","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.14342","snapshot_observed_at":"2026-08-12T19:43:01.838625Z","title":"Sophia: A scalable stochastic second-order optimizer for language model pre-training","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.10438","last_updated":"2025-09-04T09:37:05Z","snapshot_observed_at":"2026-08-17T20:25:32.027243Z","submitted_at":"2024-11-15T18:57:39Z","title":"MARS: Unleashing the Power of Variance Reduction for Training Large Models","version":4},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-12T19:43:01.838625Z"},"links":{"cited_paper":"/paper/2305.14342","citing_paper":"/paper/2411.10438"},"observation_digest":"sha256:b6aacc83575e64420307fd8a37f049fd209eae191b729faa8f9a70540d770b1b","observation_id":"6704f74b-430b-4ac6-aabf-bd407257fa08","resolution":{"observed_at":"2026-08-12T19:43:01.838625Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2011.11985","last_updated":"2020-11-24T09:28:53Z","snapshot_observed_at":"2026-08-21T16:23:41.851198Z","submitted_at":"2020-11-24T09:28:53Z","title":"Adam$^+$: A Stochastic Method with Adaptive Variance Reduction","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2011.11985","snapshot_observed_at":"2026-08-12T19:43:01.844215Z","title":"Adam ^+ : A stochastic method with adaptive variance reduction","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2411.10438","last_updated":"2025-09-04T09:37:05Z","snapshot_observed_at":"2026-08-17T20:25:32.027243Z","submitted_at":"2024-11-15T18:57:39Z","title":"MARS: Unleashing the Power of Variance Reduction for Training Large Models","version":4},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-12T19:43:01.844215Z"},"links":{"cited_paper":"/paper/2011.11985","citing_paper":"/paper/2411.10438"},"observation_digest":"sha256:f6849e6514de27ddb25d2df4163890df52b2f77e0d3c760c455e34de922cd884","observation_id":"929c6321-4e29-4615-9ed1-0bff2eb4f95e","resolution":{"observed_at":"2026-08-12T19:43:01.844215Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:43:01.849372Z","title":"and Hutter, F","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2411.10438","last_updated":"2025-09-04T09:37:05Z","snapshot_observed_at":"2026-08-17T20:25:32.027243Z","submitted_at":"2024-11-15T18:57:39Z","title":"MARS: Unleashing the Power of Variance Reduction for Training Large Models","version":4},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-12T19:43:01.849372Z"},"links":{"citing_paper":"/paper/2411.10438"},"observation_digest":"sha256:e55bebdbdef8fe431c0a27c0b715a8055944a0a427239f2d845f96fc84898fe6","observation_id":"98bfc228-49f1-4c1d-90ea-7fcf22fbdc3f","resolution":{"observed_at":"2026-08-12T19:43:01.849372Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:43:03.487682Z","title":"Fineweb-edu: the finest collection of educational content, 2024","venue":null,"work_id":"8b2d82d5-677e-4399-80de-501715b66d2d","year":2024},"citing_paper":{"arxiv_id":"2411.10438","last_updated":"2025-09-04T09:37:05Z","snapshot_observed_at":"2026-08-17T20:25:32.027243Z","submitted_at":"2024-11-15T18:57:39Z","title":"MARS: Unleashing the Power of Variance Reduction for Training Large Models","version":4},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-12T19:43:01.855256Z"},"links":{"citing_paper":"/paper/2411.10438"},"observation_digest":"sha256:741b0375ae7cfa8e60f8c2889bc9680f201fb1762cabc14dad855a410c8f7a7d","observation_id":"7feaa9b5-925b-4996-a482-6bb4a927d258","resolution":{"observed_at":"2026-08-12T19:43:03.498210Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:43:01.860686Z","title":"and Grosse, R","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2411.10438","last_updated":"2025-09-04T09:37:05Z","snapshot_observed_at":"2026-08-17T20:25:32.027243Z","submitted_at":"2024-11-15T18:57:39Z","title":"MARS: Unleashing the Power of Variance Reduction for Training Large Models","version":4},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-12T19:43:01.860686Z"},"links":{"citing_paper":"/paper/2411.10438"},"observation_digest":"sha256:4eaa313ae34dd7e38c5939c7ca99842e81d6b429f38a7f4922d138723590bafb","observation_id":"0d21d3e8-2f8b-4f1a-b690-c0ab786f0e98","resolution":{"observed_at":"2026-08-12T19:43:01.860686Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:43:03.445385Z","title":"and Tropp, J","venue":null,"work_id":"1dd9737f-24e4-475e-93c3-1aaa3253dbaa","year":2020},"citing_paper":{"arxiv_id":"2411.10438","last_updated":"2025-09-04T09:37:05Z","snapshot_observed_at":"2026-08-17T20:25:32.027243Z","submitted_at":"2024-11-15T18:57:39Z","title":"MARS: Unleashing the Power of Variance Reduction for Training Large Models","version":4},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-12T19:43:01.866570Z"},"links":{"citing_paper":"/paper/2411.10438"},"observation_digest":"sha256:e57168d2103811de98a2160fb9e3e97f4ec70f97dc5cfec068e61813bef6a1a6","observation_id":"c7297947-5172-401e-93a6-a3807bcf4d5b","resolution":{"observed_at":"2026-08-12T19:43:03.453737Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1812.06162","last_updated":"2018-12-14T20:49:09Z","snapshot_observed_at":"2026-08-20T11:22:33.275550Z","submitted_at":"2018-12-14T20:49:09Z","title":"An Empirical Model of Large-Batch Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.06162","snapshot_observed_at":"2026-08-12T19:43:01.872324Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2411.10438","last_updated":"2025-09-04T09:37:05Z","snapshot_observed_at":"2026-08-17T20:25:32.027243Z","submitted_at":"2024-11-15T18:57:39Z","title":"MARS: Unleashing the Power of Variance Reduction for Training Large Models","version":4},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-12T19:43:01.872324Z"},"links":{"cited_paper":"/paper/1812.06162","citing_paper":"/paper/2411.10438"},"observation_digest":"sha256:aa5e2a8bf069b52a406735ace4c4e709877fc02ad86114cc4b5134b27a238ab8","observation_id":"c3cd4b70-9543-4b57-8d1f-e0488227881d","resolution":{"observed_at":"2026-08-12T19:43:01.872324Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1002.4908","last_updated":"2010-07-07T19:07:16Z","snapshot_observed_at":"2026-08-20T14:35:17.147982Z","submitted_at":"2010-02-26T01:36:34Z","title":"Adaptive Bound Optimization for Online Convex Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1002.4908","snapshot_observed_at":"2026-08-12T19:43:01.879308Z","title":null,"venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2411.10438","last_updated":"2025-09-04T09:37:05Z","snapshot_observed_at":"2026-08-17T20:25:32.027243Z","submitted_at":"2024-11-15T18:57:39Z","title":"MARS: Unleashing the Power of Variance Reduction for Training Large Models","version":4},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-12T19:43:01.879308Z"},"links":{"cited_paper":"/paper/1002.4908","citing_paper":"/paper/2411.10438"},"observation_digest":"sha256:b51673d0ea958717d39868d9eec131d4ce3ceeb5e3d13f0298e200bfe28e2b59","observation_id":"b2c25452-1b46-4637-9aff-884ce3bff0e5","resolution":{"observed_at":"2026-08-12T19:43:01.879308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:43:01.885057Z","title":"Can a suit of armor conduct electricity? A new dataset for open book question answering","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2411.10438","last_updated":"2025-09-04T09:37:05Z","snapshot_observed_at":"2026-08-17T20:25:32.027243Z","submitted_at":"2024-11-15T18:57:39Z","title":"MARS: Unleashing the Power of Variance Reduction for Training Large Models","version":4},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-12T19:43:01.885057Z"},"links":{"citing_paper":"/paper/2411.10438"},"observation_digest":"sha256:352d121c37d4db7072ed3c79bdba95bda6e2669c0341644e1ac2c26ae8243238","observation_id":"68ea52d1-0b27-4be9-be39-b1dd82794446","resolution":{"observed_at":"2026-08-12T19:43:01.885057Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.17748","last_updated":"2024-06-25T17:34:51Z","snapshot_observed_at":"2026-08-20T05:13:43.610459Z","submitted_at":"2024-06-25T17:34:51Z","title":"A New Perspective on Shampoo's Preconditioner","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.17748","snapshot_observed_at":"2026-08-12T19:43:01.891022Z","title":"A new perspective on shampoo's preconditioner","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.10438","last_updated":"2025-09-04T09:37:05Z","snapshot_observed_at":"2026-08-17T20:25:32.027243Z","submitted_at":"2024-11-15T18:57:39Z","title":"MARS: Unleashing the Power of Variance Reduction for Training Large Models","version":4},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-12T19:43:01.891022Z"},"links":{"cited_paper":"/paper/2406.17748","citing_paper":"/paper/2411.10438"},"observation_digest":"sha256:0960d4e9bd6fd219db7965e56175621dcead25602d4505bcdd7911f92f8af752","observation_id":"af18d8a0-4378-440b-9257-b35ebf83d8c2","resolution":{"observed_at":"2026-08-12T19:43:01.891022Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:43:01.898101Z","title":"A method for solving the convex programming problem with convergence rate o(1/k^2)","venue":null,"work_id":null,"year":1983},"citing_paper":{"arxiv_id":"2411.10438","last_updated":"2025-09-04T09:37:05Z","snapshot_observed_at":"2026-08-17T20:25:32.027243Z","submitted_at":"2024-11-15T18:57:39Z","title":"MARS: Unleashing the Power of Variance Reduction for Training Large Models","version":4},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-12T19:43:01.898101Z"},"links":{"citing_paper":"/paper/2411.10438"},"observation_digest":"sha256:31eadc0621df9484f515fb350926a1bfe53d5cb7abb2a1a6bec10856b2bb6a36","observation_id":"85cfd310-4490-42d3-a135-aa6de65968f7","resolution":{"observed_at":"2026-08-12T19:43:01.898101Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:43:03.402450Z","title":"Introductory lectures on convex optimization: A basic course, volume 87","venue":null,"work_id":"5d605130-5caa-4f54-9cd0-c9c78e16ffb5","year":2013},"citing_paper":{"arxiv_id":"2411.10438","last_updated":"2025-09-04T09:37:05Z","snapshot_observed_at":"2026-08-17T20:25:32.027243Z","submitted_at":"2024-11-15T18:57:39Z","title":"MARS: Unleashing the Power of Variance Reduction for Training Large Models","version":4},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-12T19:43:01.903254Z"},"links":{"citing_paper":"/paper/2411.10438"},"observation_digest":"sha256:b0a5167168c2a1be7a4ea63de3082f46f79eaba7293aad57e19bb99901368e5a","observation_id":"2845d882-48fc-4566-8ce3-ed4e2923103f","resolution":{"observed_at":"2026-08-12T19:43:03.410000Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:43:03.373169Z","title":"M., Liu, J., Scheinberg, K., and Tak \\'a c , M","venue":null,"work_id":"bbbd1bab-885c-4d7f-b44c-d5bc842aa3b7","year":2017},"citing_paper":{"arxiv_id":"2411.10438","last_updated":"2025-09-04T09:37:05Z","snapshot_observed_at":"2026-08-17T20:25:32.027243Z","submitted_at":"2024-11-15T18:57:39Z","title":"MARS: Unleashing the Power of Variance Reduction for Training Large Models","version":4},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-12T19:43:01.908303Z"},"links":{"citing_paper":"/paper/2411.10438"},"observation_digest":"sha256:aa184e150a9b45c16d63117eb0507071b9651a79db816ea52e2495b1f5d3fb2f","observation_id":"4ff75ab9-714f-4a67-b7f3-503bb0df5637","resolution":{"observed_at":"2026-08-12T19:43:03.379053Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1705.07261","last_updated":"2017-05-20T05:09:33Z","snapshot_observed_at":"2026-08-14T20:59:24.018366Z","submitted_at":"2017-05-20T05:09:33Z","title":"Stochastic Recursive Gradient Algorithm for Nonconvex Optimization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1705.07261","snapshot_observed_at":"2026-08-12T19:43:01.913923Z","title":"M., Liu, J., Scheinberg, K., and Tak \\'a c , M","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2411.10438","last_updated":"2025-09-04T09:37:05Z","snapshot_observed_at":"2026-08-17T20:25:32.027243Z","submitted_at":"2024-11-15T18:57:39Z","title":"MARS: Unleashing the Power of Variance Reduction for Training Large Models","version":4},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-12T19:43:01.913923Z"},"links":{"cited_paper":"/paper/1705.07261","citing_paper":"/paper/2411.10438"},"observation_digest":"sha256:89be31257d4885c99b9cce530727373c615de18e16cdc3444116ad35109fb8e4","observation_id":"3f2a9ec6-1ccb-468c-bb19-2d2e95021808","resolution":{"observed_at":"2026-08-12T19:43:01.913923Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:43:01.919275Z","title":"Language models are unsupervised multitask learners","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2411.10438","last_updated":"2025-09-04T09:37:05Z","snapshot_observed_at":"2026-08-17T20:25:32.027243Z","submitted_at":"2024-11-15T18:57:39Z","title":"MARS: Unleashing the Power of Variance Reduction for Training Large Models","version":4},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-12T19:43:01.919275Z"},"links":{"citing_paper":"/paper/2411.10438"},"observation_digest":"sha256:f229c00f6ac88aee4234e22b4618f4e8a9af275e2c9c6d843330a62c5640c714","observation_id":"16aaf30a-2629-4f06-990b-25a4de6a3f11","resolution":{"observed_at":"2026-08-12T19:43:01.919275Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:43:03.323525Z","title":"J., Hefny, A., Sra, S., Poczos, B., and Smola, A","venue":null,"work_id":"a28eb27d-2018-4062-a267-0df85cbbd25b","year":2016},"citing_paper":{"arxiv_id":"2411.10438","last_updated":"2025-09-04T09:37:05Z","snapshot_observed_at":"2026-08-17T20:25:32.027243Z","submitted_at":"2024-11-15T18:57:39Z","title":"MARS: Unleashing the Power of Variance Reduction for Training Large Models","version":4},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-12T19:43:01.924796Z"},"links":{"citing_paper":"/paper/2411.10438"},"observation_digest":"sha256:91f1db9ddf02d25750e9f192568a7c7314079ec9b5c37490471d25613939f721","observation_id":"28c67352-ff2d-457b-b4a0-f5a51d15074e","resolution":{"observed_at":"2026-08-12T19:43:03.332688Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1904.09237","last_updated":"2019-04-19T16:21:38Z","snapshot_observed_at":"2026-08-14T16:43:55.734754Z","submitted_at":"2019-04-19T16:21:38Z","title":"On the Convergence of Adam and Beyond","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.09237","snapshot_observed_at":"2026-08-12T19:43:01.936920Z","title":"J., Kale, S., and Kumar, S","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2411.10438","last_updated":"2025-09-04T09:37:05Z","snapshot_observed_at":"2026-08-17T20:25:32.027243Z","submitted_at":"2024-11-15T18:57:39Z","title":"MARS: Unleashing the Power of Variance Reduction for Training Large Models","version":4},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-12T19:43:01.936920Z"},"links":{"cited_paper":"/paper/1904.09237","citing_paper":"/paper/2411.10438"},"observation_digest":"sha256:665953f7c4741126a1bfd6d7d5e9c8b8bdd9a937ce0217ccb2615bd55c8999c5","observation_id":"64e703b0-6003-4ae7-ac02-cbd442a56063","resolution":{"observed_at":"2026-08-12T19:43:01.936920Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:43:03.299626Z","title":"and Braun, H","venue":null,"work_id":"eecec6f1-8a65-4c7d-9e9e-6eafc4161669","year":1993},"citing_paper":{"arxiv_id":"2411.10438","last_updated":"2025-09-04T09:37:05Z","snapshot_observed_at":"2026-08-17T20:25:32.027243Z","submitted_at":"2024-11-15T18:57:39Z","title":"MARS: Unleashing the Power of Variance Reduction for Training Large Models","version":4},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-12T19:43:01.943511Z"},"links":{"citing_paper":"/paper/2411.10438"},"observation_digest":"sha256:55a1d58703679ac22e2181b39feae63b09e32b4a496b2abe9e0dccd0e4dcfd37","observation_id":"43854652-eacd-442b-9a6d-4ecb8e5021ab","resolution":{"observed_at":"2026-08-12T19:43:03.306454Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:43:01.950051Z","title":"A stochastic gradient method with an exponential convergence \\_rate for finite training sets","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2411.10438","last_updated":"2025-09-04T09:37:05Z","snapshot_observed_at":"2026-08-17T20:25:32.027243Z","submitted_at":"2024-11-15T18:57:39Z","title":"MARS: Unleashing the Power of Variance Reduction for Training Large Models","version":4},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-12T19:43:01.950051Z"},"links":{"citing_paper":"/paper/2411.10438"},"observation_digest":"sha256:6f3d22eab8d99881f42e8d268890e68122a1318da03b558b75feaf2f8aae71ef","observation_id":"eea572f5-4d30-4393-b5c5-794629c95ca1","resolution":{"observed_at":"2026-08-12T19:43:01.950051Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:43:03.255157Z","title":"L., Bhagavatula, C., and Choi, Y","venue":null,"work_id":"8a7ce78f-956a-4604-bd0d-d934e47682c7","year":2020},"citing_paper":{"arxiv_id":"2411.10438","last_updated":"2025-09-04T09:37:05Z","snapshot_observed_at":"2026-08-17T20:25:32.027243Z","submitted_at":"2024-11-15T18:57:39Z","title":"MARS: Unleashing the Power of Variance Reduction for Training Large Models","version":4},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-12T19:43:01.955568Z"},"links":{"citing_paper":"/paper/2411.10438"},"observation_digest":"sha256:cd14f635c01d7d47491136e5cf47b150589566a94d14991cd46d893dcea542bc","observation_id":"7709864d-3762-4722-a6f1-245e4196a9ce","resolution":{"observed_at":"2026-08-12T19:43:03.262329Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1703.02136","last_updated":"2017-03-06T22:37:43Z","snapshot_observed_at":"2026-08-14T21:13:13.737774Z","submitted_at":"2017-03-06T22:37:43Z","title":"English Conversational Telephone Speech Recognition by Humans and Machines","version":1},"cited_work":{"arxiv_id":"1703.02136","doi":null,"metadata_source":"pith","pith_arxiv_id":"1703.02136","snapshot_observed_at":"2026-08-12T19:43:02.350339Z","title":"English Conversational Telephone Speech Recognition by Humans and Machines","venue":"cs.CL","work_id":"8babb298-6f38-40b5-9884-30b0e297d8be","year":2017},"citing_paper":{"arxiv_id":"2411.10438","last_updated":"2025-09-04T09:37:05Z","snapshot_observed_at":"2026-08-17T20:25:32.027243Z","submitted_at":"2024-11-15T18:57:39Z","title":"MARS: Unleashing the Power of Variance Reduction for Training Large Models","version":4},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-12T19:43:01.960751Z"},"links":{"cited_paper":"/paper/1703.02136","citing_paper":"/paper/2411.10438"},"observation_digest":"sha256:5e9fd9bc85b2b7837436d1c5fd947bad8ddac8ee205ae28bc4c5b85bb37b2bd0","observation_id":"ed306893-a7be-47ee-b441-72d8d69ab381","resolution":{"observed_at":"2026-08-12T19:43:02.356237Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:43:01.966520Z","title":"and Smola, A","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2411.10438","last_updated":"2025-09-04T09:37:05Z","snapshot_observed_at":"2026-08-17T20:25:32.027243Z","submitted_at":"2024-11-15T18:57:39Z","title":"MARS: Unleashing the Power of Variance Reduction for Training Large Models","version":4},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-12T19:43:01.966520Z"},"links":{"citing_paper":"/paper/2411.10438"},"observation_digest":"sha256:6c84114dfc741bb8c2e5d279d80526b15affdf8559f05f8ebcd10e60d36f2927","observation_id":"b4caae8a-a9b1-4331-a710-0b162f46e2bc","resolution":{"observed_at":"2026-08-12T19:43:01.966520Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:43:03.203829Z","title":"Iterative berechnung der reziproken matrix","venue":null,"work_id":"c3f6ba9a-f23b-4f4d-9df3-191ca85db0d6","year":1933},"citing_paper":{"arxiv_id":"2411.10438","last_updated":"2025-09-04T09:37:05Z","snapshot_observed_at":"2026-08-17T20:25:32.027243Z","submitted_at":"2024-11-15T18:57:39Z","title":"MARS: Unleashing the Power of Variance Reduction for Training Large Models","version":4},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-08-12T19:43:01.972196Z"},"links":{"citing_paper":"/paper/2411.10438"},"observation_digest":"sha256:4404a964949da96bf7b0d96f6aff4c33054e15dec57514183ad9848aa5e8bbe7","observation_id":"85de6cc9-7d30-49f6-baaa-a23a13a6ab46","resolution":{"observed_at":"2026-08-12T19:43:03.209999Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:43:03.159711Z","title":"and Zhang, T","venue":null,"work_id":"0e4b44f6-fbf3-443d-bcf5-e357ac2c60fc","year":2013},"citing_paper":{"arxiv_id":"2411.10438","last_updated":"2025-09-04T09:37:05Z","snapshot_observed_at":"2026-08-17T20:25:32.027243Z","submitted_at":"2024-11-15T18:57:39Z","title":"MARS: Unleashing the Power of Variance Reduction for Training Large Models","version":4},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-08-12T19:43:01.977890Z"},"links":{"citing_paper":"/paper/2411.10438"},"observation_digest":"sha256:0881bc0f7993b3fb2fce0a9271be37055f4f3925df5d3a77442431ea661bb2d2","observation_id":"8bbaeb57-1417-41df-9d90-d1be52929e5c","resolution":{"observed_at":"2026-08-12T19:43:03.173456Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:43:01.983245Z","title":"and Stern, M","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2411.10438","last_updated":"2025-09-04T09:37:05Z","snapshot_observed_at":"2026-08-17T20:25:32.027243Z","submitted_at":"2024-11-15T18:57:39Z","title":"MARS: Unleashing the Power of Variance Reduction for Training Large Models","version":4},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-08-12T19:43:01.983245Z"},"links":{"citing_paper":"/paper/2411.10438"},"observation_digest":"sha256:7b8c537323f6d13e025e3ea6f49f7bcaac2818fef9d2d14f802a441debccc8d7","observation_id":"c262343c-682c-4473-8583-183ee134a835","resolution":{"observed_at":"2026-08-12T19:43:01.983245Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.06497","last_updated":"2023-09-12T18:11:10Z","snapshot_observed_at":"2026-08-19T05:42:54.006296Z","submitted_at":"2023-09-12T18:11:10Z","title":"A Distributed Data-Parallel PyTorch Implementation of the Distributed Shampoo Optimizer for Training Neural Networks At-Scale","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.06497","snapshot_observed_at":"2026-08-12T19:43:01.988790Z","title":"M., Lee, T.-H., Iwasaki, S., Gallego-Posada, J., Li, Z., Rangadurai, K., Mudigere, D., and Rabbat, M","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.10438","last_updated":"2025-09-04T09:37:05Z","snapshot_observed_at":"2026-08-17T20:25:32.027243Z","submitted_at":"2024-11-15T18:57:39Z","title":"MARS: Unleashing the Power of Variance Reduction for Training Large Models","version":4},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-08-12T19:43:01.988790Z"},"links":{"cited_paper":"/paper/2309.06497","citing_paper":"/paper/2411.10438"},"observation_digest":"sha256:c992258b9f9bc3a94d365894815123ab43b004ff1037e7137672009bc2741d4d","observation_id":"840b886c-4ca4-4976-9d25-026b41b288c8","resolution":{"observed_at":"2026-08-12T19:43:01.988790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:43:01.993564Z","title":"Dropout: a simple way to prevent neural networks from overfitting","venue":null,"work_id":null,"year":1929},"citing_paper":{"arxiv_id":"2411.10438","last_updated":"2025-09-04T09:37:05Z","snapshot_observed_at":"2026-08-17T20:25:32.027243Z","submitted_at":"2024-11-15T18:57:39Z","title":"MARS: Unleashing the Power of Variance Reduction for Training Large Models","version":4},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-08-12T19:43:01.993564Z"},"links":{"citing_paper":"/paper/2411.10438"},"observation_digest":"sha256:18fb0521941cdb2052640dd60a855101446b07d54679ca722ebb54cbab02c62c","observation_id":"7d974669-e5d9-4404-b931-c8068638f8c8","resolution":{"observed_at":"2026-08-12T19:43:01.993564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:43:03.100858Z","title":"Lecture 6.5-rmsprop: Divide the gradient by a running average of its recent magnitude","venue":null,"work_id":"92759da6-d466-48b6-9826-d7b2830ae07c","year":2012},"citing_paper":{"arxiv_id":"2411.10438","last_updated":"2025-09-04T09:37:05Z","snapshot_observed_at":"2026-08-17T20:25:32.027243Z","submitted_at":"2024-11-15T18:57:39Z","title":"MARS: Unleashing the Power of Variance Reduction for Training Large Models","version":4},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-08-12T19:43:01.999285Z"},"links":{"citing_paper":"/paper/2411.10438"},"observation_digest":"sha256:06e6e1802de788318cafc5f99e08c5dbbe97a2ee4cf4ec01b3b89ecc32437c9c","observation_id":"cfa80dc0-fdc0-4942-8de4-99571633fcc4","resolution":{"observed_at":"2026-08-12T19:43:03.107413Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:43:02.005034Z","title":"Attention is all you need","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2411.10438","last_updated":"2025-09-04T09:37:05Z","snapshot_observed_at":"2026-08-17T20:25:32.027243Z","submitted_at":"2024-11-15T18:57:39Z","title":"MARS: Unleashing the Power of Variance Reduction for Training Large Models","version":4},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-08-12T19:43:02.005034Z"},"links":{"citing_paper":"/paper/2411.10438"},"observation_digest":"sha256:fa56ce21f3a5896cc79c16102c52e0e30f6e2b04f5d089ba0265cb98317ac96d","observation_id":"0024312a-7550-4bd0-ada2-61fad6a32166","resolution":{"observed_at":"2026-08-12T19:43:02.005034Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.11321","last_updated":"2025-01-31T18:52:42Z","snapshot_observed_at":"2026-08-15T04:58:58.957938Z","submitted_at":"2024-09-17T16:18:05Z","title":"SOAP: Improving and Stabilizing Shampoo using Adam","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.11321","snapshot_observed_at":"2026-08-12T19:43:02.010064Z","title":"Soap: Improving and stabilizing shampoo using adam","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.10438","last_updated":"2025-09-04T09:37:05Z","snapshot_observed_at":"2026-08-17T20:25:32.027243Z","submitted_at":"2024-11-15T18:57:39Z","title":"MARS: Unleashing the Power of Variance Reduction for Training Large Models","version":4},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-08-12T19:43:02.010064Z"},"links":{"cited_paper":"/paper/2409.11321","citing_paper":"/paper/2411.10438"},"observation_digest":"sha256:509e5230336e645b8e91b5aaaebd9a3ecff1f3cdf3cd9674d4e29358d80c0096","observation_id":"4a752e3d-2adc-4526-a48a-4cfed46f2a60","resolution":{"observed_at":"2026-08-12T19:43:02.010064Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:43:03.068520Z","title":"Spiderboost and momentum: Faster variance reduction algorithms","venue":null,"work_id":"9d732b22-8a83-4f96-9213-8f1e08ac4aeb","year":2019},"citing_paper":{"arxiv_id":"2411.10438","last_updated":"2025-09-04T09:37:05Z","snapshot_observed_at":"2026-08-17T20:25:32.027243Z","submitted_at":"2024-11-15T18:57:39Z","title":"MARS: Unleashing the Power of Variance Reduction for Training Large Models","version":4},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-08-12T19:43:02.016660Z"},"links":{"citing_paper":"/paper/2411.10438"},"observation_digest":"sha256:33b5c33590239bdb4081f0c10ea876918237ba54a42ce1625f8da7025ba39ae8","observation_id":"012af07a-9e4d-4b3d-836a-77b90ec463da","resolution":{"observed_at":"2026-08-12T19:43:03.075581Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:43:02.023654Z","title":"Adagrad stepsizes: Sharp convergence over nonconvex landscapes","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2411.10438","last_updated":"2025-09-04T09:37:05Z","snapshot_observed_at":"2026-08-17T20:25:32.027243Z","submitted_at":"2024-11-15T18:57:39Z","title":"MARS: Unleashing the Power of Variance Reduction for Training Large Models","version":4},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-08-12T19:43:02.023654Z"},"links":{"citing_paper":"/paper/2411.10438"},"observation_digest":"sha256:92cd8d6b5e537b2b8429c097992307caaa6becd72e62ae69c9f82e5ba9db7e85","observation_id":"b3dc8bbf-c6f3-4315-8dad-6e039b3dea6a","resolution":{"observed_at":"2026-08-12T19:43:02.023654Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:43:02.032612Z","title":"Adan: Adaptive nesterov momentum algorithm for faster optimizing deep models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.10438","last_updated":"2025-09-04T09:37:05Z","snapshot_observed_at":"2026-08-17T20:25:32.027243Z","submitted_at":"2024-11-15T18:57:39Z","title":"MARS: Unleashing the Power of Variance Reduction for Training Large Models","version":4},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-08-12T19:43:02.032612Z"},"links":{"citing_paper":"/paper/2411.10438"},"observation_digest":"sha256:a73893bf461deb0ab5045aabb9721663cfa2a80351ad101fa6d15da2ee26e7cf","observation_id":"be36d960-c952-4b93-986c-5cdb9aa09499","resolution":{"observed_at":"2026-08-12T19:43:02.032612Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:43:02.039030Z","title":"Quick and (not so) dirty: Unsupervised selection of justification sentences for multi-hop question answering","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2411.10438","last_updated":"2025-09-04T09:37:05Z","snapshot_observed_at":"2026-08-17T20:25:32.027243Z","submitted_at":"2024-11-15T18:57:39Z","title":"MARS: Unleashing the Power of Variance Reduction for Training Large Models","version":4},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-08-12T19:43:02.039030Z"},"links":{"citing_paper":"/paper/2411.10438"},"observation_digest":"sha256:23497083267dfdd083d3e3f36b757262a6b17aea19c8aa55ca99855251717634","observation_id":"bf3a7227-59be-4ac9-a24e-864cf24dc490","resolution":{"observed_at":"2026-08-12T19:43:02.039030Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.05589","last_updated":"2025-03-17T11:14:58Z","snapshot_observed_at":"2026-08-16T14:44:33.673988Z","submitted_at":"2023-11-09T18:47:44Z","title":"A Coefficient Makes SVRG Effective","version":2},"cited_work":{"arxiv_id":"2311.05589","doi":null,"metadata_source":"pith","pith_arxiv_id":"2311.05589","snapshot_observed_at":"2026-08-12T19:43:02.276286Z","title":"A Coefficient Makes SVRG Effective","venue":"cs.LG","work_id":"a40a331a-8c28-476a-957a-d3f296022bea","year":2023},"citing_paper":{"arxiv_id":"2411.10438","last_updated":"2025-09-04T09:37:05Z","snapshot_observed_at":"2026-08-17T20:25:32.027243Z","submitted_at":"2024-11-15T18:57:39Z","title":"MARS: Unleashing the Power of Variance Reduction for Training Large Models","version":4},"reference_index":84,"source":"arxiv_source","source_observed_at":"2026-08-12T19:43:02.044225Z"},"links":{"cited_paper":"/paper/2311.05589","citing_paper":"/paper/2411.10438"},"observation_digest":"sha256:1c921bfe3e6e1654d52fe51ea457de947dd9122ce2a6fc1f02d4fd4e03895199","observation_id":"08c21778-335f-47a5-9962-26cecaa098da","resolution":{"observed_at":"2026-08-12T19:43:02.285588Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1904.00962","last_updated":"2020-01-03T06:53:00Z","snapshot_observed_at":"2026-08-19T04:31:12.196632Z","submitted_at":"2019-04-01T16:53:35Z","title":"Large Batch Optimization for Deep Learning: Training BERT in 76 minutes","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.00962","snapshot_observed_at":"2026-08-12T19:43:02.050371Z","title":"Large batch optimization for deep learning: Training bert in 76 minutes","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2411.10438","last_updated":"2025-09-04T09:37:05Z","snapshot_observed_at":"2026-08-17T20:25:32.027243Z","submitted_at":"2024-11-15T18:57:39Z","title":"MARS: Unleashing the Power of Variance Reduction for Training Large Models","version":4},"reference_index":85,"source":"arxiv_source","source_observed_at":"2026-08-12T19:43:02.050371Z"},"links":{"cited_paper":"/paper/1904.00962","citing_paper":"/paper/2411.10438"},"observation_digest":"sha256:a6a03311777e2f84e74973f5a79e26c9cd397e3eecc011bb131621dfbf24280c","observation_id":"a3c723bf-65ea-48d1-8cee-0424688e03d4","resolution":{"observed_at":"2026-08-12T19:43:02.050371Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1212.5701","last_updated":"2012-12-22T15:46:49Z","snapshot_observed_at":"2026-08-19T05:19:50.480481Z","submitted_at":"2012-12-22T15:46:49Z","title":"ADADELTA: An Adaptive Learning Rate Method","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1212.5701","snapshot_observed_at":"2026-08-12T19:43:02.057300Z","title":null,"venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2411.10438","last_updated":"2025-09-04T09:37:05Z","snapshot_observed_at":"2026-08-17T20:25:32.027243Z","submitted_at":"2024-11-15T18:57:39Z","title":"MARS: Unleashing the Power of Variance Reduction for Training Large Models","version":4},"reference_index":86,"source":"arxiv_source","source_observed_at":"2026-08-12T19:43:02.057300Z"},"links":{"cited_paper":"/paper/1212.5701","citing_paper":"/paper/2411.10438"},"observation_digest":"sha256:f1d9883d3da1bba8a8d05a2084267856f52ea77d1e1b99ef6b8ffd5577e4d0d9","observation_id":"5d6dde87-279b-4b4a-b5b7-79bfaf0dd268","resolution":{"observed_at":"2026-08-12T19:43:02.057300Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:43:02.063883Z","title":"Hellaswag: Can a machine really finish your sentence? In Korhonen, A., Traum, D","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2411.10438","last_updated":"2025-09-04T09:37:05Z","snapshot_observed_at":"2026-08-17T20:25:32.027243Z","submitted_at":"2024-11-15T18:57:39Z","title":"MARS: Unleashing the Power of Variance Reduction for Training Large Models","version":4},"reference_index":87,"source":"arxiv_source","source_observed_at":"2026-08-12T19:43:02.063883Z"},"links":{"citing_paper":"/paper/2411.10438"},"observation_digest":"sha256:7ff325444f376255f7ec4c7e59060d9fd48273452e31d8e2c554e6d2d7da1cd5","observation_id":"11b4d049-9e91-4b71-bc3f-4cd504d7f7fc","resolution":{"observed_at":"2026-08-12T19:43:02.063883Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-08-06T03:13:37.403059Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.01068","snapshot_observed_at":"2026-08-12T19:43:02.069466Z","title":"V., et al","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.10438","last_updated":"2025-09-04T09:37:05Z","snapshot_observed_at":"2026-08-17T20:25:32.027243Z","submitted_at":"2024-11-15T18:57:39Z","title":"MARS: Unleashing the Power of Variance Reduction for Training Large Models","version":4},"reference_index":88,"source":"arxiv_source","source_observed_at":"2026-08-12T19:43:02.069466Z"},"links":{"cited_paper":"/paper/2205.01068","citing_paper":"/paper/2411.10438"},"observation_digest":"sha256:fc0783862f42547100bbbfbda5880310a185428b4549872a2012772e3bd7e0b0","observation_id":"2fd7335a-5e17-4e65-8923-dc475745f55a","resolution":{"observed_at":"2026-08-12T19:43:02.069466Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:43:02.998977Z","title":"Adam can converge without any modification on update rules","venue":null,"work_id":"aa42dcb7-aa1b-4046-a4e1-4e60ebcd9075","year":2022},"citing_paper":{"arxiv_id":"2411.10438","last_updated":"2025-09-04T09:37:05Z","snapshot_observed_at":"2026-08-17T20:25:32.027243Z","submitted_at":"2024-11-15T18:57:39Z","title":"MARS: Unleashing the Power of Variance Reduction for Training Large Models","version":4},"reference_index":89,"source":"arxiv_source","source_observed_at":"2026-08-12T19:43:02.074897Z"},"links":{"citing_paper":"/paper/2411.10438"},"observation_digest":"sha256:f7f6babcdafc788fcc6495765e944f2a73845a542ca0a62bb8a2f08901b831b0","observation_id":"107f6011-4904-4dc7-b21d-236b708babfd","resolution":{"observed_at":"2026-08-12T19:43:03.004859Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07972","last_updated":"2025-02-28T01:47:44Z","snapshot_observed_at":"2026-08-19T06:02:49.560543Z","submitted_at":"2024-07-10T18:11:40Z","title":"Deconstructing What Makes a Good Optimizer for Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07972","snapshot_observed_at":"2026-08-12T19:43:02.080704Z","title":"Deconstructing what makes a good optimizer for language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.10438","last_updated":"2025-09-04T09:37:05Z","snapshot_observed_at":"2026-08-17T20:25:32.027243Z","submitted_at":"2024-11-15T18:57:39Z","title":"MARS: Unleashing the Power of Variance Reduction for Training Large Models","version":4},"reference_index":90,"source":"arxiv_source","source_observed_at":"2026-08-12T19:43:02.080704Z"},"links":{"cited_paper":"/paper/2407.07972","citing_paper":"/paper/2411.10438"},"observation_digest":"sha256:bb83de3ab6ef27604a1b539577499a947201b41396315794a0bec672dd75dbda","observation_id":"c62ad04f-5834-4868-a3e1-459c08c6a12a","resolution":{"observed_at":"2026-08-12T19:43:02.080704Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:43:02.977198Z","title":"Stochastic nested variance reduction for nonconvex optimization","venue":null,"work_id":"075c644a-4e83-4793-805c-3ee07e6663a6","year":2020},"citing_paper":{"arxiv_id":"2411.10438","last_updated":"2025-09-04T09:37:05Z","snapshot_observed_at":"2026-08-17T20:25:32.027243Z","submitted_at":"2024-11-15T18:57:39Z","title":"MARS: Unleashing the Power of Variance Reduction for Training Large Models","version":4},"reference_index":91,"source":"arxiv_source","source_observed_at":"2026-08-12T19:43:02.086996Z"},"links":{"citing_paper":"/paper/2411.10438"},"observation_digest":"sha256:3a5b63020be0ee120d86ed3391959a338686df9e8a3ebbdc5fc3d4cfbb7725fd","observation_id":"5e1daf55-ba58-4897-a71d-419a408daae3","resolution":{"observed_at":"2026-08-12T19:43:02.984590Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:43:02.954452Z","title":"Towards understanding convergence and generalization of adamw","venue":null,"work_id":"cd9b7f90-279d-47ea-9b92-8a92340b5422","year":2024},"citing_paper":{"arxiv_id":"2411.10438","last_updated":"2025-09-04T09:37:05Z","snapshot_observed_at":"2026-08-17T20:25:32.027243Z","submitted_at":"2024-11-15T18:57:39Z","title":"MARS: Unleashing the Power of Variance Reduction for Training Large Models","version":4},"reference_index":92,"source":"arxiv_source","source_observed_at":"2026-08-12T19:43:02.093463Z"},"links":{"citing_paper":"/paper/2411.10438"},"observation_digest":"sha256:f0db94abfce61ca919754593e6fca491ba6525ca2d54786befd0f17eda14453c","observation_id":"54a450a1-df44-4fc5-b952-58b06cdd5cb6","resolution":{"observed_at":"2026-08-12T19:43:02.960616Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:43:02.099002Z","title":"C., Dvornek, N., Papademetris, X., and Duncan, J","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2411.10438","last_updated":"2025-09-04T09:37:05Z","snapshot_observed_at":"2026-08-17T20:25:32.027243Z","submitted_at":"2024-11-15T18:57:39Z","title":"MARS: Unleashing the Power of Variance Reduction for Training Large Models","version":4},"reference_index":93,"source":"arxiv_source","source_observed_at":"2026-08-12T19:43:02.099002Z"},"links":{"citing_paper":"/paper/2411.10438"},"observation_digest":"sha256:f1589ad544a59f06e56afafcfaf344497e6b7bc985c1b5f067484a7616544ffc","observation_id":"5465fbce-eb1c-4d54-a499-e15f24becaf1","resolution":{"observed_at":"2026-08-12T19:43:02.099002Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:43:02.104287Z","title":"@esa (Ref","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.10438","last_updated":"2025-09-04T09:37:05Z","snapshot_observed_at":"2026-08-17T20:25:32.027243Z","submitted_at":"2024-11-15T18:57:39Z","title":"MARS: Unleashing the Power of Variance Reduction for Training Large Models","version":4},"reference_index":94,"source":"arxiv_source","source_observed_at":"2026-08-12T19:43:02.104287Z"},"links":{"citing_paper":"/paper/2411.10438"},"observation_digest":"sha256:d2db49e4d7ace679aef25c0fb2da97e62cd12aaf6c3c157bfa625c6ced34a0ae","observation_id":"ad9cbca0-2e2f-4589-ae04-316cdc5154a9","resolution":{"observed_at":"2026-08-12T19:43:02.104287Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:43:02.110478Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.10438","last_updated":"2025-09-04T09:37:05Z","snapshot_observed_at":"2026-08-17T20:25:32.027243Z","submitted_at":"2024-11-15T18:57:39Z","title":"MARS: Unleashing the Power of Variance Reduction for Training Large Models","version":4},"reference_index":95,"source":"arxiv_source","source_observed_at":"2026-08-12T19:43:02.110478Z"},"links":{"citing_paper":"/paper/2411.10438"},"observation_digest":"sha256:be715335d7b124774aacb9bd3c23e5f97591fb4e9ee31586f452fbf272f27c07","observation_id":"209059a6-ecd1-410f-926f-bbbd5bc28d06","resolution":{"observed_at":"2026-08-12T19:43:02.110478Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:43:02.115828Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.10438","last_updated":"2025-09-04T09:37:05Z","snapshot_observed_at":"2026-08-17T20:25:32.027243Z","submitted_at":"2024-11-15T18:57:39Z","title":"MARS: Unleashing the Power of Variance Reduction for Training Large Models","version":4},"reference_index":96,"source":"arxiv_source","source_observed_at":"2026-08-12T19:43:02.115828Z"},"links":{"citing_paper":"/paper/2411.10438"},"observation_digest":"sha256:9e7faa5e891b4c063d043deff6dd30b56243558271903b933d09507aa238f859","observation_id":"bafc3be5-4fca-4f01-9a61-c7cbb5b25d94","resolution":{"observed_at":"2026-08-12T19:43:02.115828Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2411.10438","last_updated":"2025-09-04T09:37:05Z","latest_version":4,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-17T20:25:32.027243Z","submitted_at":"2024-11-15T18:57:39Z","title":"MARS: Unleashing the Power of Variance Reduction for Training Large Models"},"reference_resolution":{"displayed":95,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":70,"verified_exact":2,"verified_fuzzy":23},"total_outbound_references":95},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"thesis":"As of 23 August 2026, this Paper Citation Record lists 95 of 95 outbound references and 20 inbound Pith citation observations for arXiv:2411.10438."}