{"as_of":"2026-08-15T19:53:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:942e59c2bf9deb50fbc2645b26c08eb1a1a8660461d0ed13f16d6d610472df33","coverage":[{"denominator":67,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":67,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T18:35:40.252196Z","state":"measured"},{"denominator":67,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":67,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.08091/citation-record","integrity":"/paper/2507.08091/integrity","json":"/paper/2507.08091/citation-record.json","paper":"/paper/2507.08091"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:35:40.841845Z","title":"Memory efficient adaptive optimization","venue":null,"work_id":"c4e67402-4036-43d4-a04d-6e684257e2e2","year":2019},"citing_paper":{"arxiv_id":"2507.08091","last_updated":"2025-07-10T18:04:52Z","snapshot_observed_at":"2026-08-14T06:41:55.088814Z","submitted_at":"2025-07-10T18:04:52Z","title":"Low-rank Momentum Factorization for Memory Efficient Training","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-06T18:35:40.092595Z"},"links":{"citing_paper":"/paper/2507.08091"},"observation_digest":"sha256:6cf3c9fc24ea88a35c1ac9bd9581af6427026255551d2b6056dd3c1339f0a3d8","observation_id":"3d091fdb-94ec-4d6e-8c7c-3f6b9ada94e2","resolution":{"observed_at":"2026-08-06T18:35:40.844330Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:35:40.095813Z","title":"Lower bounds for non-convex stochastic optimization","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.08091","last_updated":"2025-07-10T18:04:52Z","snapshot_observed_at":"2026-08-14T06:41:55.088814Z","submitted_at":"2025-07-10T18:04:52Z","title":"Low-rank Momentum Factorization for Memory Efficient Training","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-06T18:35:40.095813Z"},"links":{"citing_paper":"/paper/2507.08091"},"observation_digest":"sha256:c0c6af35b044ef2bbed9cb0533cd3583509dd41c9c3c4ef29a9e607128ab2eb3","observation_id":"b532b623-71d0-40f4-b010-b66bc957a580","resolution":{"observed_at":"2026-08-06T18:35:40.095813Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21265","last_updated":"2024-12-06T17:02:28Z","snapshot_observed_at":"2026-08-14T21:50:44.099805Z","submitted_at":"2024-10-28T17:57:31Z","title":"Modular Duality in Deep Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21265","snapshot_observed_at":"2026-08-06T18:35:40.098289Z","title":"Modular duality in deep learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.08091","last_updated":"2025-07-10T18:04:52Z","snapshot_observed_at":"2026-08-14T06:41:55.088814Z","submitted_at":"2025-07-10T18:04:52Z","title":"Low-rank Momentum Factorization for Memory Efficient Training","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-06T18:35:40.098289Z"},"links":{"cited_paper":"/paper/2410.21265","citing_paper":"/paper/2507.08091"},"observation_digest":"sha256:b660080c3ff03f4b7160ac084ffddb3455e89150a1308f87ba113ad0592af34d","observation_id":"3fe12a6e-83c1-43dd-9681-700cffe0ce6e","resolution":{"observed_at":"2026-08-06T18:35:40.098289Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.20325","last_updated":"2024-12-06T14:09:22Z","snapshot_observed_at":"2026-08-12T12:26:45.359430Z","submitted_at":"2024-09-30T14:26:12Z","title":"Old Optimizer, New Norm: An Anthology","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.20325","snapshot_observed_at":"2026-08-06T18:35:40.101337Z","title":"Old optimizer, new norm: An anthology","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.08091","last_updated":"2025-07-10T18:04:52Z","snapshot_observed_at":"2026-08-14T06:41:55.088814Z","submitted_at":"2025-07-10T18:04:52Z","title":"Low-rank Momentum Factorization for Memory Efficient Training","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-06T18:35:40.101337Z"},"links":{"cited_paper":"/paper/2409.20325","citing_paper":"/paper/2507.08091"},"observation_digest":"sha256:02aa918cb185ca9b0ed5f8430c033a0f88caead93948c8eeb5c9d3f811ac83fb","observation_id":"ce0bfadf-c388-47e9-b543-633023dd2d42","resolution":{"observed_at":"2026-08-06T18:35:40.101337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:35:40.830089Z","title":"signsgd: Compressed optimisation for non-convex problems","venue":null,"work_id":"e9360a72-8ccc-4b19-826d-a1deb084d9b1","year":2018},"citing_paper":{"arxiv_id":"2507.08091","last_updated":"2025-07-10T18:04:52Z","snapshot_observed_at":"2026-08-14T06:41:55.088814Z","submitted_at":"2025-07-10T18:04:52Z","title":"Low-rank Momentum Factorization for Memory Efficient Training","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-06T18:35:40.104099Z"},"links":{"citing_paper":"/paper/2507.08091"},"observation_digest":"sha256:11dbe3fdace7f250cf07e1fa87768a42565d83ca12ce7e5fa5e36f40ec330ba4","observation_id":"ca466eb8-9b8a-426e-aba8-48cdb118eb72","resolution":{"observed_at":"2026-08-06T18:35:40.832449Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.05187","last_updated":"2023-04-11T12:45:52Z","snapshot_observed_at":"2026-08-13T12:05:02.555424Z","submitted_at":"2023-04-11T12:45:52Z","title":"Automatic Gradient Descent: Deep Learning without Hyperparameters","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.05187","snapshot_observed_at":"2026-08-06T18:35:40.106492Z","title":"Automatic gradient descent: Deep learning without hyperparameters","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.08091","last_updated":"2025-07-10T18:04:52Z","snapshot_observed_at":"2026-08-14T06:41:55.088814Z","submitted_at":"2025-07-10T18:04:52Z","title":"Low-rank Momentum Factorization for Memory Efficient Training","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-06T18:35:40.106492Z"},"links":{"cited_paper":"/paper/2304.05187","citing_paper":"/paper/2507.08091"},"observation_digest":"sha256:385f1fc5dd4fcbe079e15a0e54220e6819e15a74dbdbc0fc8eef59f29f343df8","observation_id":"bbb69756-4f58-421b-9dca-bf1f25d5c1a4","resolution":{"observed_at":"2026-08-06T18:35:40.106492Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:35:40.822347Z","title":"Symbolic discovery of optimization algorithms","venue":null,"work_id":"b0036d8c-b993-4e7d-8e8b-1072e05e5d2c","year":2024},"citing_paper":{"arxiv_id":"2507.08091","last_updated":"2025-07-10T18:04:52Z","snapshot_observed_at":"2026-08-14T06:41:55.088814Z","submitted_at":"2025-07-10T18:04:52Z","title":"Low-rank Momentum Factorization for Memory Efficient Training","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-06T18:35:40.109327Z"},"links":{"citing_paper":"/paper/2507.08091"},"observation_digest":"sha256:f2888fdee985a3f068c853fffc046b04e5866722ef0d522f1326250335ce5d23","observation_id":"01992ade-7bfc-4cf9-bad7-33c5713dd188","resolution":{"observed_at":"2026-08-06T18:35:40.825256Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.02861","last_updated":"2022-06-20T16:05:15Z","snapshot_observed_at":"2026-08-14T11:59:04.372290Z","submitted_at":"2021-10-06T15:43:20Z","title":"8-bit Optimizers via Block-wise Quantization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.02861","snapshot_observed_at":"2026-08-06T18:35:40.111493Z","title":"8-bit optimizers via block-wise quantization","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.08091","last_updated":"2025-07-10T18:04:52Z","snapshot_observed_at":"2026-08-14T06:41:55.088814Z","submitted_at":"2025-07-10T18:04:52Z","title":"Low-rank Momentum Factorization for Memory Efficient Training","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-06T18:35:40.111493Z"},"links":{"cited_paper":"/paper/2110.02861","citing_paper":"/paper/2507.08091"},"observation_digest":"sha256:472c013e797b86c83ab4b7764c5a4da44ddadb0232aba3c6e7b18495ac0753be","observation_id":"37add5ea-1f3f-4a0b-8e0b-d16bbe160b7b","resolution":{"observed_at":"2026-08-06T18:35:40.111493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:35:40.114360Z","title":"Qlora: Efficient finetuning of quantized llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.08091","last_updated":"2025-07-10T18:04:52Z","snapshot_observed_at":"2026-08-14T06:41:55.088814Z","submitted_at":"2025-07-10T18:04:52Z","title":"Low-rank Momentum Factorization for Memory Efficient Training","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-06T18:35:40.114360Z"},"links":{"citing_paper":"/paper/2507.08091"},"observation_digest":"sha256:f203c82b65545ed9a38aa0226d14054d536661a19690ef0f599b741143a59c40","observation_id":"1e8c6ba0-3238-45b3-965b-ea5cae56aedf","resolution":{"observed_at":"2026-08-06T18:35:40.114360Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:35:40.117442Z","title":"Adaptive subgradient methods for online learning and stochastic optimization","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2507.08091","last_updated":"2025-07-10T18:04:52Z","snapshot_observed_at":"2026-08-14T06:41:55.088814Z","submitted_at":"2025-07-10T18:04:52Z","title":"Low-rank Momentum Factorization for Memory Efficient Training","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-06T18:35:40.117442Z"},"links":{"citing_paper":"/paper/2507.08091"},"observation_digest":"sha256:026a9b3f166725a192568df380984eaea0fbef87987c9d6d72579fe8a4cd37e4","observation_id":"92ea956e-c64b-40a3-8cc9-9336f072b503","resolution":{"observed_at":"2026-08-06T18:35:40.117442Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:35:40.805786Z","title":"Combining axes preconditioners through kronecker approximation for deep learning","venue":null,"work_id":"aa1430a7-b72a-4f44-9400-8a34a8b6ab20","year":2024},"citing_paper":{"arxiv_id":"2507.08091","last_updated":"2025-07-10T18:04:52Z","snapshot_observed_at":"2026-08-14T06:41:55.088814Z","submitted_at":"2025-07-10T18:04:52Z","title":"Low-rank Momentum Factorization for Memory Efficient Training","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-06T18:35:40.119531Z"},"links":{"citing_paper":"/paper/2507.08091"},"observation_digest":"sha256:a40e6e934a08beb1cb62010bcd7675ba196353c8f7e34cd4e83fe74a2f834b10","observation_id":"fba15dfa-01fe-458d-bf68-7558f6d01345","resolution":{"observed_at":"2026-08-06T18:35:40.808185Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:35:40.798289Z","title":"Sketchy: Memory-efficient adaptive regularization with frequent directions","venue":null,"work_id":"8573fc76-c15c-438d-a3fa-d1d089a2a6f3","year":2024},"citing_paper":{"arxiv_id":"2507.08091","last_updated":"2025-07-10T18:04:52Z","snapshot_observed_at":"2026-08-14T06:41:55.088814Z","submitted_at":"2025-07-10T18:04:52Z","title":"Low-rank Momentum Factorization for Memory Efficient Training","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-06T18:35:40.121654Z"},"links":{"citing_paper":"/paper/2507.08091"},"observation_digest":"sha256:53d1dbddedaf8a8ea9c0f0fa14cf31b183a2a3cb822839a9d45e571ca1055ff4","observation_id":"d8b1410a-a235-4978-bcc1-8cd76cb2083a","resolution":{"observed_at":"2026-08-06T18:35:40.800933Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:35:40.790371Z","title":"Fast approximate natural gradient descent in a kronecker factored eigenbasis","venue":null,"work_id":"4e1ed06a-3e67-4792-aa9a-a33eca9ced79","year":2018},"citing_paper":{"arxiv_id":"2507.08091","last_updated":"2025-07-10T18:04:52Z","snapshot_observed_at":"2026-08-14T06:41:55.088814Z","submitted_at":"2025-07-10T18:04:52Z","title":"Low-rank Momentum Factorization for Memory Efficient Training","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-06T18:35:40.123726Z"},"links":{"citing_paper":"/paper/2507.08091"},"observation_digest":"sha256:02923911500385fc91bea69f3b3cb9903334b68e06d5c499b9c585f0b39aabf7","observation_id":"f3523b01-4493-4be9-9ec8-8377958da5fd","resolution":{"observed_at":"2026-08-06T18:35:40.792974Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:35:40.783071Z","title":"Improving neural network training in low dimensional random bases","venue":null,"work_id":"bb38cc9b-dfd8-4661-8ed7-3705697827ed","year":2020},"citing_paper":{"arxiv_id":"2507.08091","last_updated":"2025-07-10T18:04:52Z","snapshot_observed_at":"2026-08-14T06:41:55.088814Z","submitted_at":"2025-07-10T18:04:52Z","title":"Low-rank Momentum Factorization for Memory Efficient Training","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-06T18:35:40.125769Z"},"links":{"citing_paper":"/paper/2507.08091"},"observation_digest":"sha256:92c7e90b774b18925338e3fed1a8d47138c2e64efae032f4665d1f5fef45022b","observation_id":"43c30931-6709-46ec-ba7b-63fdf9549231","resolution":{"observed_at":"2026-08-06T18:35:40.785399Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:35:40.775399Z","title":"A kronecker-factored approximate fisher matrix for convolution layers","venue":null,"work_id":"262bf342-07e3-4b29-b1aa-a3abc68a5c29","year":2016},"citing_paper":{"arxiv_id":"2507.08091","last_updated":"2025-07-10T18:04:52Z","snapshot_observed_at":"2026-08-14T06:41:55.088814Z","submitted_at":"2025-07-10T18:04:52Z","title":"Low-rank Momentum Factorization for Memory Efficient Training","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-06T18:35:40.127897Z"},"links":{"citing_paper":"/paper/2507.08091"},"observation_digest":"sha256:5cec22bc7d9fb2940aa441b3e60f698696774ae96aa9723e1209f4198e1d3b46","observation_id":"46d2730b-4bb7-4c8c-83c8-1e7073e1420b","resolution":{"observed_at":"2026-08-06T18:35:40.777756Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08446","last_updated":"2025-02-11T18:59:26Z","snapshot_observed_at":"2026-08-13T15:18:54.804747Z","submitted_at":"2024-06-12T17:37:09Z","title":"OLMES: A Standard for Language Model Evaluations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08446","snapshot_observed_at":"2026-08-06T18:35:40.130029Z","title":"Olmes: A standard for language model evaluations","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.08091","last_updated":"2025-07-10T18:04:52Z","snapshot_observed_at":"2026-08-14T06:41:55.088814Z","submitted_at":"2025-07-10T18:04:52Z","title":"Low-rank Momentum Factorization for Memory Efficient Training","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-06T18:35:40.130029Z"},"links":{"cited_paper":"/paper/2406.08446","citing_paper":"/paper/2507.08091"},"observation_digest":"sha256:588a86ce957f4841522db6cefdfac093c40f917304dea4600f3c21e6966d2238","observation_id":"d2334a67-9cef-41e9-bad2-19cb0492beaa","resolution":{"observed_at":"2026-08-06T18:35:40.130029Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:35:40.768403Z","title":"Shampoo: Preconditioned stochastic tensor optimization","venue":null,"work_id":"dec3b086-57e7-4db2-a4c0-4177d86a7ae6","year":2018},"citing_paper":{"arxiv_id":"2507.08091","last_updated":"2025-07-10T18:04:52Z","snapshot_observed_at":"2026-08-14T06:41:55.088814Z","submitted_at":"2025-07-10T18:04:52Z","title":"Low-rank Momentum Factorization for Memory Efficient Training","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-06T18:35:40.132495Z"},"links":{"citing_paper":"/paper/2507.08091"},"observation_digest":"sha256:78f01e3e7441af76747e7ea54cd80f27facf2a3cc30f906d3dd0c6691c99b6b5","observation_id":"cc7931f7-ca09-446e-b00e-37a06f26928d","resolution":{"observed_at":"2026-08-06T18:35:40.770861Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1812.04754","last_updated":"2018-12-12T00:36:17Z","snapshot_observed_at":"2026-08-14T17:44:58.723571Z","submitted_at":"2018-12-12T00:36:17Z","title":"Gradient Descent Happens in a Tiny Subspace","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.04754","snapshot_observed_at":"2026-08-06T18:35:40.134826Z","title":"Gradient descent happens in a tiny subspace","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.08091","last_updated":"2025-07-10T18:04:52Z","snapshot_observed_at":"2026-08-14T06:41:55.088814Z","submitted_at":"2025-07-10T18:04:52Z","title":"Low-rank Momentum Factorization for Memory Efficient Training","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-06T18:35:40.134826Z"},"links":{"cited_paper":"/paper/1812.04754","citing_paper":"/paper/2507.08091"},"observation_digest":"sha256:1bd764196ba8c0476fdc668523e20fa33e3a80f4c082b75aefccdedba81e39ae","observation_id":"71536acc-4a68-4f4f-bfcb-ea96cc205e28","resolution":{"observed_at":"2026-08-06T18:35:40.134826Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03293","last_updated":"2024-06-12T22:17:37Z","snapshot_observed_at":"2026-08-14T02:51:44.358086Z","submitted_at":"2024-02-05T18:50:39Z","title":"Flora: Low-Rank Adapters Are Secretly Gradient Compressors","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03293","snapshot_observed_at":"2026-08-06T18:35:40.137244Z","title":"Flora: Low-rank adapters are secretly gradient compressors","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.08091","last_updated":"2025-07-10T18:04:52Z","snapshot_observed_at":"2026-08-14T06:41:55.088814Z","submitted_at":"2025-07-10T18:04:52Z","title":"Low-rank Momentum Factorization for Memory Efficient Training","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-06T18:35:40.137244Z"},"links":{"cited_paper":"/paper/2402.03293","citing_paper":"/paper/2507.08091"},"observation_digest":"sha256:d10b28621c41f432f02373a1e964cceb58d7e6bf311e8f4fdf6eed186d8b3fce","observation_id":"7d13c518-a176-44f3-a921-2569a2abe3a7","resolution":{"observed_at":"2026-08-06T18:35:40.137244Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:35:40.761260Z","title":"Topics in matrix analysis","venue":null,"work_id":"e64eec70-2f98-4a41-a9df-667b9a95ae76","year":1994},"citing_paper":{"arxiv_id":"2507.08091","last_updated":"2025-07-10T18:04:52Z","snapshot_observed_at":"2026-08-14T06:41:55.088814Z","submitted_at":"2025-07-10T18:04:52Z","title":"Low-rank Momentum Factorization for Memory Efficient Training","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-06T18:35:40.139626Z"},"links":{"citing_paper":"/paper/2507.08091"},"observation_digest":"sha256:16c5e420a65a48b3e8d5498d295ef7d6e0f2c4930cd15eb98593a6a66d54dca9","observation_id":"bd10f289-2c68-460e-b447-ed4f2b5479b8","resolution":{"observed_at":"2026-08-06T18:35:40.763802Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:35:40.141663Z","title":"Parameter-efficient transfer learning for nlp","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.08091","last_updated":"2025-07-10T18:04:52Z","snapshot_observed_at":"2026-08-14T06:41:55.088814Z","submitted_at":"2025-07-10T18:04:52Z","title":"Low-rank Momentum Factorization for Memory Efficient Training","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-06T18:35:40.141663Z"},"links":{"citing_paper":"/paper/2507.08091"},"observation_digest":"sha256:d7891f21dcf2d6654134ce1fe9b66c0190c714eed348736c9f5eb0a32593e6f0","observation_id":"a823097d-4846-4f24-9830-cd0abd3df947","resolution":{"observed_at":"2026-08-06T18:35:40.141663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-11T08:20:29.798517Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-06T18:35:40.143830Z","title":"Lora: Low-rank adaptation of large language models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.08091","last_updated":"2025-07-10T18:04:52Z","snapshot_observed_at":"2026-08-14T06:41:55.088814Z","submitted_at":"2025-07-10T18:04:52Z","title":"Low-rank Momentum Factorization for Memory Efficient Training","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-06T18:35:40.143830Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2507.08091"},"observation_digest":"sha256:483bfbe7042a8736050ef61e0db4292dcb3fd0be804b97d9ca88658827ea80ef","observation_id":"81fac90f-2158-41c7-b5b7-fdaa8185c668","resolution":{"observed_at":"2026-08-06T18:35:40.143830Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:35:40.748739Z","title":"modded-nanogpt: Speedrunning the nanogpt baseline, 2024 a","venue":null,"work_id":"62b70d73-adf2-498f-a17d-7912e9f35ff0","year":2024},"citing_paper":{"arxiv_id":"2507.08091","last_updated":"2025-07-10T18:04:52Z","snapshot_observed_at":"2026-08-14T06:41:55.088814Z","submitted_at":"2025-07-10T18:04:52Z","title":"Low-rank Momentum Factorization for Memory Efficient Training","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-06T18:35:40.146130Z"},"links":{"citing_paper":"/paper/2507.08091"},"observation_digest":"sha256:545ac9bba141b0f134cbcc5c027babca2647cf374e701376b4f69cba43c28069","observation_id":"305cc2a1-a26b-4291-9bf4-8fd0fb450d06","resolution":{"observed_at":"2026-08-06T18:35:40.751685Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:35:40.740553Z","title":"Muon: An optimizer for hidden layers in neural networks, 2024 b","venue":null,"work_id":"e2900391-7e3b-421d-9c7b-b34dfd469e04","year":2024},"citing_paper":{"arxiv_id":"2507.08091","last_updated":"2025-07-10T18:04:52Z","snapshot_observed_at":"2026-08-14T06:41:55.088814Z","submitted_at":"2025-07-10T18:04:52Z","title":"Low-rank Momentum Factorization for Memory Efficient Training","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-06T18:35:40.148307Z"},"links":{"citing_paper":"/paper/2507.08091"},"observation_digest":"sha256:f3f047ee848fad3f86bab33b63924f880d9676b63d50ce03bdb4d2e3b28f6348","observation_id":"86df6ef4-909a-4fda-b1dd-0e25d75367f4","resolution":{"observed_at":"2026-08-06T18:35:40.743734Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.03732","last_updated":"2023-11-28T03:23:20Z","snapshot_observed_at":"2026-08-14T13:45:26.254758Z","submitted_at":"2023-11-28T03:23:20Z","title":"A Rank Stabilization Scaling Factor for Fine-Tuning with LoRA","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.03732","snapshot_observed_at":"2026-08-06T18:35:40.150396Z","title":"A rank stabilization scaling factor for fine-tuning with lora","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.08091","last_updated":"2025-07-10T18:04:52Z","snapshot_observed_at":"2026-08-14T06:41:55.088814Z","submitted_at":"2025-07-10T18:04:52Z","title":"Low-rank Momentum Factorization for Memory Efficient Training","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-06T18:35:40.150396Z"},"links":{"cited_paper":"/paper/2312.03732","citing_paper":"/paper/2507.08091"},"observation_digest":"sha256:f154bededef566a247286a134462643ee93dbecf76daca0a397b10b8839b6f44","observation_id":"705f936e-4b9c-4cdc-84c2-2819e351c7c1","resolution":{"observed_at":"2026-08-06T18:35:40.150396Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-08-13T17:41:53.092611Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-08-06T18:35:40.153241Z","title":"Scaling laws for neural language models","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2507.08091","last_updated":"2025-07-10T18:04:52Z","snapshot_observed_at":"2026-08-14T06:41:55.088814Z","submitted_at":"2025-07-10T18:04:52Z","title":"Low-rank Momentum Factorization for Memory Efficient Training","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-06T18:35:40.153241Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2507.08091"},"observation_digest":"sha256:2c579d23d6c1ac9bc6842242d22cc3f336ca0e91f9a6b7cce4df1c10273593a9","observation_id":"b05009ba-c43f-40bb-8ca5-f9d0c7d3d80f","resolution":{"observed_at":"2026-08-06T18:35:40.153241Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.15015","last_updated":"2025-02-20T20:11:54Z","snapshot_observed_at":"2026-08-07T18:00:42.269560Z","submitted_at":"2025-02-20T20:11:54Z","title":"Accelerating Neural Network Training: An Analysis of the AlgoPerf Competition","version":1},"cited_work":{"arxiv_id":"2502.15015","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.15015","snapshot_observed_at":"2026-08-06T18:35:40.574170Z","title":"Accelerating Neural Network Training: An Analysis of the AlgoPerf Competition","venue":"cs.LG","work_id":"ee90f9e0-0be6-4c62-8275-4aa8111abcb8","year":2025},"citing_paper":{"arxiv_id":"2507.08091","last_updated":"2025-07-10T18:04:52Z","snapshot_observed_at":"2026-08-14T06:41:55.088814Z","submitted_at":"2025-07-10T18:04:52Z","title":"Low-rank Momentum Factorization for Memory Efficient Training","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-06T18:35:40.155578Z"},"links":{"cited_paper":"/paper/2502.15015","citing_paper":"/paper/2507.08091"},"observation_digest":"sha256:7755a6b1a0153760ec1d00581f0fabbb70ee3a25127b8dcc091760c5a6669886","observation_id":"70e53d3a-442f-4abb-aa35-4c9f769be0fb","resolution":{"observed_at":"2026-08-06T18:35:40.577672Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:35:40.733322Z","title":"Kingma and Jimmy Ba","venue":null,"work_id":"92e01713-6e6e-4062-a868-5d1942b1302f","year":2015},"citing_paper":{"arxiv_id":"2507.08091","last_updated":"2025-07-10T18:04:52Z","snapshot_observed_at":"2026-08-14T06:41:55.088814Z","submitted_at":"2025-07-10T18:04:52Z","title":"Low-rank Momentum Factorization for Memory Efficient Training","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-06T18:35:40.157919Z"},"links":{"citing_paper":"/paper/2507.08091"},"observation_digest":"sha256:70a838592f3a86253e53d4516f793a43491c1a03d4d2c662b30bf58c53addc7b","observation_id":"58235faa-8bb5-44c0-b417-5c000c6c6e7f","resolution":{"observed_at":"2026-08-06T18:35:40.735655Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11454","last_updated":"2024-01-16T18:59:22Z","snapshot_observed_at":"2026-08-13T05:47:23.578307Z","submitted_at":"2023-10-17T17:59:46Z","title":"VeRA: Vector-based Random Matrix Adaptation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.11454","snapshot_observed_at":"2026-08-06T18:35:40.160096Z","title":"Vera: Vector-based random matrix adaptation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.08091","last_updated":"2025-07-10T18:04:52Z","snapshot_observed_at":"2026-08-14T06:41:55.088814Z","submitted_at":"2025-07-10T18:04:52Z","title":"Low-rank Momentum Factorization for Memory Efficient Training","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-06T18:35:40.160096Z"},"links":{"cited_paper":"/paper/2310.11454","citing_paper":"/paper/2507.08091"},"observation_digest":"sha256:b5be329ba04879dda790da93e0fc5033b294a238fa48509c1b46be9c98c991dd","observation_id":"5c145465-698e-4d14-940f-d61f01f4069e","resolution":{"observed_at":"2026-08-06T18:35:40.160096Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15124","last_updated":"2025-04-14T22:39:09Z","snapshot_observed_at":"2026-08-10T16:05:13.426341Z","submitted_at":"2024-11-22T18:44:04Z","title":"Tulu 3: Pushing Frontiers in Open Language Model Post-Training","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15124","snapshot_observed_at":"2026-08-06T18:35:40.162460Z","title":"T \" ulu 3: Pushing frontiers in open language model post-training","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.08091","last_updated":"2025-07-10T18:04:52Z","snapshot_observed_at":"2026-08-14T06:41:55.088814Z","submitted_at":"2025-07-10T18:04:52Z","title":"Low-rank Momentum Factorization for Memory Efficient Training","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-06T18:35:40.162460Z"},"links":{"cited_paper":"/paper/2411.15124","citing_paper":"/paper/2507.08091"},"observation_digest":"sha256:d6766ee142c3efa314a7a8ab28f6043f4fffb902f2689ee9a1f6803093f88d2f","observation_id":"b72f3667-9544-45d7-a43d-53d61327f79e","resolution":{"observed_at":"2026-08-06T18:35:40.162460Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:35:40.726068Z","title":"Scalable optimization in the modular norm","venue":null,"work_id":"894cb028-649b-4153-8f7d-46eafab15b55","year":2025},"citing_paper":{"arxiv_id":"2507.08091","last_updated":"2025-07-10T18:04:52Z","snapshot_observed_at":"2026-08-14T06:41:55.088814Z","submitted_at":"2025-07-10T18:04:52Z","title":"Low-rank Momentum Factorization for Memory Efficient Training","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-06T18:35:40.165018Z"},"links":{"citing_paper":"/paper/2507.08091"},"observation_digest":"sha256:a3b21730a8512db37a74479968654b1f53103f28fd17b5c61394ad973d849eea","observation_id":"33ae95ce-59c6-4ccc-a4b7-14e26ed11296","resolution":{"observed_at":"2026-08-06T18:35:40.728448Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08691","last_updated":"2021-09-02T17:34:41Z","snapshot_observed_at":"2026-08-06T15:24:34.790850Z","submitted_at":"2021-04-18T03:19:26Z","title":"The Power of Scale for Parameter-Efficient Prompt Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08691","snapshot_observed_at":"2026-08-06T18:35:40.167207Z","title":"The power of scale for parameter-efficient prompt tuning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.08091","last_updated":"2025-07-10T18:04:52Z","snapshot_observed_at":"2026-08-14T06:41:55.088814Z","submitted_at":"2025-07-10T18:04:52Z","title":"Low-rank Momentum Factorization for Memory Efficient Training","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-06T18:35:40.167207Z"},"links":{"cited_paper":"/paper/2104.08691","citing_paper":"/paper/2507.08091"},"observation_digest":"sha256:466132a17fa1a3c72a49453b396f70fdd36c133b1c377555ff8bc9a2fc3b8bfd","observation_id":"48215550-78b8-43a5-ba07-9e7dadf5e798","resolution":{"observed_at":"2026-08-06T18:35:40.167207Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:35:40.718711Z","title":"Memory efficient optimizers with 4-bit states","venue":null,"work_id":"bd8140ee-ce0a-4ac2-89d3-b1133771a3c2","year":2023},"citing_paper":{"arxiv_id":"2507.08091","last_updated":"2025-07-10T18:04:52Z","snapshot_observed_at":"2026-08-14T06:41:55.088814Z","submitted_at":"2025-07-10T18:04:52Z","title":"Low-rank Momentum Factorization for Memory Efficient Training","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-06T18:35:40.169646Z"},"links":{"citing_paper":"/paper/2507.08091"},"observation_digest":"sha256:41c8dee13f0a9f48daca8f71ed36bf8a2189801ab96773d113f89d38a366865b","observation_id":"7b5e13d4-b336-4951-b0b3-e6aac2eafcf5","resolution":{"observed_at":"2026-08-06T18:35:40.721169Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2101.00190","last_updated":"2021-01-01T08:00:36Z","snapshot_observed_at":"2026-08-12T12:37:28.207761Z","submitted_at":"2021-01-01T08:00:36Z","title":"Prefix-Tuning: Optimizing Continuous Prompts for Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2101.00190","snapshot_observed_at":"2026-08-06T18:35:40.171944Z","title":"Prefix-tuning: Optimizing continuous prompts for generation","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.08091","last_updated":"2025-07-10T18:04:52Z","snapshot_observed_at":"2026-08-14T06:41:55.088814Z","submitted_at":"2025-07-10T18:04:52Z","title":"Low-rank Momentum Factorization for Memory Efficient Training","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-06T18:35:40.171944Z"},"links":{"cited_paper":"/paper/2101.00190","citing_paper":"/paper/2507.08091"},"observation_digest":"sha256:e8f294b59b481b74bb83a62664a93f827e685c3b9a998db52f1b864172338da7","observation_id":"cd7943ca-2435-4c8e-9273-49dbd1343839","resolution":{"observed_at":"2026-08-06T18:35:40.171944Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:35:40.711248Z","title":"Relora: High-rank training through low-rank updates","venue":null,"work_id":"04e684b3-f7e4-4973-9028-40a2bd99fd33","year":2023},"citing_paper":{"arxiv_id":"2507.08091","last_updated":"2025-07-10T18:04:52Z","snapshot_observed_at":"2026-08-14T06:41:55.088814Z","submitted_at":"2025-07-10T18:04:52Z","title":"Low-rank Momentum Factorization for Memory Efficient Training","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-06T18:35:40.174393Z"},"links":{"citing_paper":"/paper/2507.08091"},"observation_digest":"sha256:d60b2d18355d41bcdd0fcd52c1e4bcd3278d325f0b4988119380ce5075f79fe5","observation_id":"805a5003-36a7-43bb-bef0-dc9b00e5268b","resolution":{"observed_at":"2026-08-06T18:35:40.713960Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:35:40.176629Z","title":"On the limited memory bfgs method for large scale optimization","venue":null,"work_id":null,"year":1989},"citing_paper":{"arxiv_id":"2507.08091","last_updated":"2025-07-10T18:04:52Z","snapshot_observed_at":"2026-08-14T06:41:55.088814Z","submitted_at":"2025-07-10T18:04:52Z","title":"Low-rank Momentum Factorization for Memory Efficient Training","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-06T18:35:40.176629Z"},"links":{"citing_paper":"/paper/2507.08091"},"observation_digest":"sha256:5e33427ecc275ea30a07160183d8efd57a1328b8b47ec070c1e8a0312e9eb848","observation_id":"2c3af3d2-a44b-4111-bd5e-3e79e5bc9429","resolution":{"observed_at":"2026-08-06T18:35:40.176629Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.16982","last_updated":"2025-02-24T09:12:29Z","snapshot_observed_at":"2026-08-02T00:32:51.000665Z","submitted_at":"2025-02-24T09:12:29Z","title":"Muon is Scalable for LLM Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.16982","snapshot_observed_at":"2026-08-06T18:35:40.178866Z","title":"Muon is scalable for llm training","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.08091","last_updated":"2025-07-10T18:04:52Z","snapshot_observed_at":"2026-08-14T06:41:55.088814Z","submitted_at":"2025-07-10T18:04:52Z","title":"Low-rank Momentum Factorization for Memory Efficient Training","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-06T18:35:40.178866Z"},"links":{"cited_paper":"/paper/2502.16982","citing_paper":"/paper/2507.08091"},"observation_digest":"sha256:eb0afea7e79c6c30696efc0f59d513380ccf1cd1740383c725f1592a57ae7009","observation_id":"5bd23c7b-b0fa-4202-ba6c-cbb38d1c8ce9","resolution":{"observed_at":"2026-08-06T18:35:40.178866Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.09353","last_updated":"2024-07-09T05:59:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-14T17:59:34Z","title":"DoRA: Weight-Decomposed Low-Rank Adaptation","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.09353","snapshot_observed_at":"2026-08-06T18:35:40.181226Z","title":"Dora: Weight-decomposed low-rank adaptation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.08091","last_updated":"2025-07-10T18:04:52Z","snapshot_observed_at":"2026-08-14T06:41:55.088814Z","submitted_at":"2025-07-10T18:04:52Z","title":"Low-rank Momentum Factorization for Memory Efficient Training","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-06T18:35:40.181226Z"},"links":{"cited_paper":"/paper/2402.09353","citing_paper":"/paper/2507.08091"},"observation_digest":"sha256:6a41bdf8f0abecade8202b141e8b513db3294d18bff8feb42cb6ebc4a26d6daa","observation_id":"8e34f1bb-6d34-4aaa-b435-50c22f551eb7","resolution":{"observed_at":"2026-08-06T18:35:40.181226Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-08-14T20:13:52.872565Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-06T18:35:40.183763Z","title":"Fixing weight decay regularization in adam","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.08091","last_updated":"2025-07-10T18:04:52Z","snapshot_observed_at":"2026-08-14T06:41:55.088814Z","submitted_at":"2025-07-10T18:04:52Z","title":"Low-rank Momentum Factorization for Memory Efficient Training","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-06T18:35:40.183763Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2507.08091"},"observation_digest":"sha256:8b5b9771672a49eff41784a3dd8f1c5b2d78fed06b1ab9df41c0a786def889c9","observation_id":"bdd016c8-8623-473e-b4f0-d65feca6e5fd","resolution":{"observed_at":"2026-08-06T18:35:40.183763Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02827","last_updated":"2024-11-15T04:17:35Z","snapshot_observed_at":"2026-08-13T19:55:53.558023Z","submitted_at":"2024-04-03T15:59:42Z","title":"BAdam: A Memory Efficient Full Parameter Optimization Method for Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02827","snapshot_observed_at":"2026-08-06T18:35:40.186047Z","title":"Badam: A memory efficient full parameter training method for large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.08091","last_updated":"2025-07-10T18:04:52Z","snapshot_observed_at":"2026-08-14T06:41:55.088814Z","submitted_at":"2025-07-10T18:04:52Z","title":"Low-rank Momentum Factorization for Memory Efficient Training","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-06T18:35:40.186047Z"},"links":{"cited_paper":"/paper/2404.02827","citing_paper":"/paper/2507.08091"},"observation_digest":"sha256:af51013f0d858185a07e4622a466b4b98c76ddaa063880cb9db776e0123069d5","observation_id":"41f8934f-c0ca-4531-9d2b-174c4e6cfcac","resolution":{"observed_at":"2026-08-06T18:35:40.186047Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.02047","last_updated":"2023-08-07T06:21:31Z","snapshot_observed_at":"2026-08-13T11:02:37.986791Z","submitted_at":"2023-07-05T06:05:36Z","title":"CAME: Confidence-guided Adaptive Memory Efficient Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.02047","snapshot_observed_at":"2026-08-06T18:35:40.188746Z","title":"Came: Confidence-guided adaptive memory efficient optimization","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.08091","last_updated":"2025-07-10T18:04:52Z","snapshot_observed_at":"2026-08-14T06:41:55.088814Z","submitted_at":"2025-07-10T18:04:52Z","title":"Low-rank Momentum Factorization for Memory Efficient Training","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-06T18:35:40.188746Z"},"links":{"cited_paper":"/paper/2307.02047","citing_paper":"/paper/2507.08091"},"observation_digest":"sha256:48d4d2bee04f0f031e989ecf53631982a838f93886f9c894900198a289553f1e","observation_id":"bbe63c38-2c25-47b1-a48b-e8cd765c3073","resolution":{"observed_at":"2026-08-06T18:35:40.188746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.10195","last_updated":"2024-06-06T13:22:25Z","snapshot_observed_at":"2026-08-13T05:48:41.487036Z","submitted_at":"2023-10-16T09:04:28Z","title":"AdaLomo: Low-memory Optimization with Adaptive Learning Rate","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.10195","snapshot_observed_at":"2026-08-06T18:35:40.191264Z","title":"Adalomo: Low-memory optimization with adaptive learning rate","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.08091","last_updated":"2025-07-10T18:04:52Z","snapshot_observed_at":"2026-08-14T06:41:55.088814Z","submitted_at":"2025-07-10T18:04:52Z","title":"Low-rank Momentum Factorization for Memory Efficient Training","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-06T18:35:40.191264Z"},"links":{"cited_paper":"/paper/2310.10195","citing_paper":"/paper/2507.08091"},"observation_digest":"sha256:66e2485fe12b7a09e7dec334f620138f3aa7736097bc3f601eebd7e965ea43a6","observation_id":"5758d07c-1abf-450f-9b2b-0ada3efa269a","resolution":{"observed_at":"2026-08-06T18:35:40.191264Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09782","last_updated":"2024-06-06T13:22:26Z","snapshot_observed_at":"2026-08-14T18:20:42.263331Z","submitted_at":"2023-06-16T11:37:15Z","title":"Full Parameter Fine-tuning for Large Language Models with Limited Resources","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.09782","snapshot_observed_at":"2026-08-06T18:35:40.193728Z","title":"Full parameter fine-tuning for large language models with limited resources","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.08091","last_updated":"2025-07-10T18:04:52Z","snapshot_observed_at":"2026-08-14T06:41:55.088814Z","submitted_at":"2025-07-10T18:04:52Z","title":"Low-rank Momentum Factorization for Memory Efficient Training","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-06T18:35:40.193728Z"},"links":{"cited_paper":"/paper/2306.09782","citing_paper":"/paper/2507.08091"},"observation_digest":"sha256:bd620c352ad5892ef9ba8fc033633c237f2704c81d18792dc85797f09a87af5a","observation_id":"aa8b78af-79f6-4412-8c45-a7c3df309054","resolution":{"observed_at":"2026-08-06T18:35:40.193728Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.13148","last_updated":"2025-02-21T18:59:37Z","snapshot_observed_at":"2026-08-15T15:12:45.559733Z","submitted_at":"2024-12-17T18:13:18Z","title":"SWAN: SGD with Normalization and Whitening Enables Stateless LLM Training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.13148","snapshot_observed_at":"2026-08-06T18:35:40.196266Z","title":"Swan: Preprocessing sgd enables adam-level performance on llm training with significant memory reduction","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.08091","last_updated":"2025-07-10T18:04:52Z","snapshot_observed_at":"2026-08-14T06:41:55.088814Z","submitted_at":"2025-07-10T18:04:52Z","title":"Low-rank Momentum Factorization for Memory Efficient Training","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-06T18:35:40.196266Z"},"links":{"cited_paper":"/paper/2412.13148","citing_paper":"/paper/2507.08091"},"observation_digest":"sha256:ba1aa8b3d1e28bba8db83a94bfea8e72de87de47b71c54d5baed8235fe4920cc","observation_id":"b33f2a32-f26b-4cab-bc92-e0b243e5deb4","resolution":{"observed_at":"2026-08-06T18:35:40.196266Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:35:40.199023Z","title":"New insights and perspectives on the natural gradient method","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.08091","last_updated":"2025-07-10T18:04:52Z","snapshot_observed_at":"2026-08-14T06:41:55.088814Z","submitted_at":"2025-07-10T18:04:52Z","title":"Low-rank Momentum Factorization for Memory Efficient Training","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-06T18:35:40.199023Z"},"links":{"citing_paper":"/paper/2507.08091"},"observation_digest":"sha256:630c36b7b11bf40902c6f57e518613519397b9d20e6722b0bd53867df3f96a8e","observation_id":"1ecbedd0-ba15-4420-b2ea-843301b4e023","resolution":{"observed_at":"2026-08-06T18:35:40.199023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:35:40.201548Z","title":"Optimizing neural networks with kronecker-factored approximate curvature","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2507.08091","last_updated":"2025-07-10T18:04:52Z","snapshot_observed_at":"2026-08-14T06:41:55.088814Z","submitted_at":"2025-07-10T18:04:52Z","title":"Low-rank Momentum Factorization for Memory Efficient Training","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-06T18:35:40.201548Z"},"links":{"citing_paper":"/paper/2507.08091"},"observation_digest":"sha256:e95d7e9b662af6f3a3501d6110d96c5d9d739aeab7e667230e7e03dbe28f3815","observation_id":"535a1cff-93fd-4595-b5dc-57ac99e1d34f","resolution":{"observed_at":"2026-08-06T18:35:40.201548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.15593","last_updated":"2024-11-05T15:15:13Z","snapshot_observed_at":"2026-08-12T23:58:44.711802Z","submitted_at":"2024-05-24T14:25:23Z","title":"MicroAdam: Accurate Adaptive Optimization with Low Space Overhead and Provable Convergence","version":2},"cited_work":{"arxiv_id":"2405.15593","doi":"10.48550/arxiv.2405.15593","metadata_source":"pith","pith_arxiv_id":"2405.15593","snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":"MicroAdam: Accurate Adaptive Optimization with Low Space Overhead and Provable Convergence","venue":"cs.LG","work_id":"f0177c3b-ed55-4659-95ab-ec94aad16410","year":2024},"citing_paper":{"arxiv_id":"2507.08091","last_updated":"2025-07-10T18:04:52Z","snapshot_observed_at":"2026-08-14T06:41:55.088814Z","submitted_at":"2025-07-10T18:04:52Z","title":"Low-rank Momentum Factorization for Memory Efficient Training","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-06T18:35:40.203626Z"},"links":{"cited_paper":"/paper/2405.15593","citing_paper":"/paper/2507.08091"},"observation_digest":"sha256:4ab9cf9510495ca8274794cfbbf39e6c9f927ce13a22c7c419ede8d9eacd5818","observation_id":"d96bc255-68ef-4318-8d27-7152607d0cfa","resolution":{"observed_at":"2026-08-06T18:35:40.279717Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.17748","last_updated":"2024-06-25T17:34:51Z","snapshot_observed_at":"2026-08-14T13:56:50.646250Z","submitted_at":"2024-06-25T17:34:51Z","title":"A New Perspective on Shampoo's Preconditioner","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.17748","snapshot_observed_at":"2026-08-06T18:35:40.206232Z","title":"A new perspective on shampoo's preconditioner","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.08091","last_updated":"2025-07-10T18:04:52Z","snapshot_observed_at":"2026-08-14T06:41:55.088814Z","submitted_at":"2025-07-10T18:04:52Z","title":"Low-rank Momentum Factorization for Memory Efficient Training","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-06T18:35:40.206232Z"},"links":{"cited_paper":"/paper/2406.17748","citing_paper":"/paper/2507.08091"},"observation_digest":"sha256:cba43413641abdf7578945142e11ca3fea99061f5285e461afcc055bd399ca74","observation_id":"3f9068b4-d42c-48fe-8539-1770cd4965d8","resolution":{"observed_at":"2026-08-06T18:35:40.206232Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:35:40.208989Z","title":"Training language models to follow instructions with human feedback","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.08091","last_updated":"2025-07-10T18:04:52Z","snapshot_observed_at":"2026-08-14T06:41:55.088814Z","submitted_at":"2025-07-10T18:04:52Z","title":"Low-rank Momentum Factorization for Memory Efficient Training","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-06T18:35:40.208989Z"},"links":{"citing_paper":"/paper/2507.08091"},"observation_digest":"sha256:09939b22f5f6e8332e16948f539591f857f69348e9235d1b7b758ecb8b979e3b","observation_id":"1efd01c2-0826-46a9-bcfa-d986b1cb4467","resolution":{"observed_at":"2026-08-06T18:35:40.208989Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:35:40.685883Z","title":"The fineweb datasets: Decanting the web for the finest text data at scale","venue":null,"work_id":"b3680e44-5b5a-4f10-bff5-478e2b10b72e","year":2025},"citing_paper":{"arxiv_id":"2507.08091","last_updated":"2025-07-10T18:04:52Z","snapshot_observed_at":"2026-08-14T06:41:55.088814Z","submitted_at":"2025-07-10T18:04:52Z","title":"Low-rank Momentum Factorization for Memory Efficient Training","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-06T18:35:40.211977Z"},"links":{"citing_paper":"/paper/2507.08091"},"observation_digest":"sha256:35f99751639c01198a086c00adc1e6a07930a43a058d593ca502ae60294cd532","observation_id":"6f316196-de61-474c-baa8-f2798e19a7d8","resolution":{"observed_at":"2026-08-06T18:35:40.688519Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:35:40.214420Z","title":"Zero: Memory optimizations toward training trillion parameter models","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.08091","last_updated":"2025-07-10T18:04:52Z","snapshot_observed_at":"2026-08-14T06:41:55.088814Z","submitted_at":"2025-07-10T18:04:52Z","title":"Low-rank Momentum Factorization for Memory Efficient Training","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-06T18:35:40.214420Z"},"links":{"citing_paper":"/paper/2507.08091"},"observation_digest":"sha256:e377476e4413e64a7d1ebb32480d5055573e10e72248708f2f13d06ef663fc24","observation_id":"af92c5c3-9423-4e42-906b-a077d1a73022","resolution":{"observed_at":"2026-08-06T18:35:40.214420Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:35:40.216796Z","title":"Adarankgrad: Adaptive gradient-rank and moments for memory-efficient llms training and fine-tuning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.08091","last_updated":"2025-07-10T18:04:52Z","snapshot_observed_at":"2026-08-14T06:41:55.088814Z","submitted_at":"2025-07-10T18:04:52Z","title":"Low-rank Momentum Factorization for Memory Efficient Training","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-06T18:35:40.216796Z"},"links":{"citing_paper":"/paper/2507.08091"},"observation_digest":"sha256:55c26011b3ffe3bc8ec7fbfbb55860361902c7ad56ebfcfedab9f1778ce09649","observation_id":"9adae0d8-c7be-4909-8e96-53e62d9dc309","resolution":{"observed_at":"2026-08-06T18:35:40.216796Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:35:40.674016Z","title":"Ldadam: Adaptive optimization from low-dimensional gradient statistics","venue":null,"work_id":"50865f83-2438-4c74-8cec-bb1e853608b9","year":2024},"citing_paper":{"arxiv_id":"2507.08091","last_updated":"2025-07-10T18:04:52Z","snapshot_observed_at":"2026-08-14T06:41:55.088814Z","submitted_at":"2025-07-10T18:04:52Z","title":"Low-rank Momentum Factorization for Memory Efficient Training","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-06T18:35:40.219217Z"},"links":{"citing_paper":"/paper/2507.08091"},"observation_digest":"sha256:3513766a3872327d0022ac503b7651d7d51f956ca01721fdd5332bcc55153701","observation_id":"7e249672-1596-48c3-943e-0e72ef748e99","resolution":{"observed_at":"2026-08-06T18:35:40.676755Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06742","last_updated":"2025-02-10T18:09:53Z","snapshot_observed_at":"2026-08-14T13:02:54.181944Z","submitted_at":"2025-02-10T18:09:53Z","title":"Gradient Multi-Normalization for Stateless and Scalable LLM Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.06742","snapshot_observed_at":"2026-08-06T18:35:40.221296Z","title":"Gradient multi-normalization for stateless and scalable llm training","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.08091","last_updated":"2025-07-10T18:04:52Z","snapshot_observed_at":"2026-08-14T06:41:55.088814Z","submitted_at":"2025-07-10T18:04:52Z","title":"Low-rank Momentum Factorization for Memory Efficient Training","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-06T18:35:40.221296Z"},"links":{"cited_paper":"/paper/2502.06742","citing_paper":"/paper/2507.08091"},"observation_digest":"sha256:0c07ed50a2788f121e9800db1738e096f0d446c4d610c2c71829000a1c94f435","observation_id":"b23d3601-7f59-4904-8d2e-0039c1fa3197","resolution":{"observed_at":"2026-08-06T18:35:40.221296Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:35:40.223758Z","title":"Adafactor: Adaptive learning rates with sublinear memory cost","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.08091","last_updated":"2025-07-10T18:04:52Z","snapshot_observed_at":"2026-08-14T06:41:55.088814Z","submitted_at":"2025-07-10T18:04:52Z","title":"Low-rank Momentum Factorization for Memory Efficient Training","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-06T18:35:40.223758Z"},"links":{"citing_paper":"/paper/2507.08091"},"observation_digest":"sha256:5fa412aec6af4d6cc92931596f48d921f180e8da2a20463f5ce23dc03314ec4a","observation_id":"34e4caf4-1165-4a4f-9045-929d96a595e8","resolution":{"observed_at":"2026-08-06T18:35:40.223758Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:35:40.662362Z","title":"Tieleman and G","venue":null,"work_id":"afe001a0-0137-4f0c-a405-be48fd783052","year":2012},"citing_paper":{"arxiv_id":"2507.08091","last_updated":"2025-07-10T18:04:52Z","snapshot_observed_at":"2026-08-14T06:41:55.088814Z","submitted_at":"2025-07-10T18:04:52Z","title":"Low-rank Momentum Factorization for Memory Efficient Training","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-06T18:35:40.225792Z"},"links":{"citing_paper":"/paper/2507.08091"},"observation_digest":"sha256:68df0900ee86e52d69f84420541a0b8ac0b46a20c8ce2ecea94b6395dda03921","observation_id":"841a71e7-81fb-4fbb-85f4-c201c60929ff","resolution":{"observed_at":"2026-08-06T18:35:40.664744Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:35:40.654699Z","title":"Practical low-rank communication compression in decentralized deep learning","venue":null,"work_id":"eb101da9-2a3a-41db-88f5-c76f5e862972","year":2020},"citing_paper":{"arxiv_id":"2507.08091","last_updated":"2025-07-10T18:04:52Z","snapshot_observed_at":"2026-08-14T06:41:55.088814Z","submitted_at":"2025-07-10T18:04:52Z","title":"Low-rank Momentum Factorization for Memory Efficient Training","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-06T18:35:40.227937Z"},"links":{"citing_paper":"/paper/2507.08091"},"observation_digest":"sha256:3824a2defbbd6a58b267d0b728b6a5da034087a5d979287435958def83907a75","observation_id":"110f4a2b-637f-488c-ae65-3bfc5ac28b6f","resolution":{"observed_at":"2026-08-06T18:35:40.657442Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.11321","last_updated":"2025-01-31T18:52:42Z","snapshot_observed_at":"2026-08-15T04:58:58.957938Z","submitted_at":"2024-09-17T16:18:05Z","title":"SOAP: Improving and Stabilizing Shampoo using Adam","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.11321","snapshot_observed_at":"2026-08-06T18:35:40.230139Z","title":"Soap: Improving and stabilizing shampoo using adam","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.08091","last_updated":"2025-07-10T18:04:52Z","snapshot_observed_at":"2026-08-14T06:41:55.088814Z","submitted_at":"2025-07-10T18:04:52Z","title":"Low-rank Momentum Factorization for Memory Efficient Training","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-06T18:35:40.230139Z"},"links":{"cited_paper":"/paper/2409.11321","citing_paper":"/paper/2507.08091"},"observation_digest":"sha256:fbe4c512b66d64d392b204e160fa2e48cc88f31441d63507dfec17fe04d72cfc","observation_id":"c37c9c3d-7ce6-4a10-95b5-e88c51857c64","resolution":{"observed_at":"2026-08-06T18:35:40.230139Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1804.07461","last_updated":"2019-02-22T23:53:34Z","snapshot_observed_at":"2026-07-06T06:34:26.609892Z","submitted_at":"2018-04-20T06:35:04Z","title":"GLUE: A Multi-Task Benchmark and Analysis Platform for Natural Language Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1804.07461","snapshot_observed_at":"2026-08-06T18:35:40.232517Z","title":"Glue: A multi-task benchmark and analysis platform for natural language understanding","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.08091","last_updated":"2025-07-10T18:04:52Z","snapshot_observed_at":"2026-08-14T06:41:55.088814Z","submitted_at":"2025-07-10T18:04:52Z","title":"Low-rank Momentum Factorization for Memory Efficient Training","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-06T18:35:40.232517Z"},"links":{"cited_paper":"/paper/1804.07461","citing_paper":"/paper/2507.08091"},"observation_digest":"sha256:70a7ddba508205cb1c443d8d007b2b96a7041e98039edee30a44d153f79c99f9","observation_id":"47ef6f09-ff35-46fa-80a5-2adbad33c61f","resolution":{"observed_at":"2026-08-06T18:35:40.232517Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:35:40.234934Z","title":"How far can camels go? exploring the state of instruction tuning on open resources","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.08091","last_updated":"2025-07-10T18:04:52Z","snapshot_observed_at":"2026-08-14T06:41:55.088814Z","submitted_at":"2025-07-10T18:04:52Z","title":"Low-rank Momentum Factorization for Memory Efficient Training","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-06T18:35:40.234934Z"},"links":{"citing_paper":"/paper/2507.08091"},"observation_digest":"sha256:dbc918570b827d48a8d7ce6f0931d6d5e6432a175cd878d7e7c6e6f99a03ff6d","observation_id":"70c1579f-dfb6-489b-ae7b-dac080c96305","resolution":{"observed_at":"2026-08-06T18:35:40.234934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.17813","last_updated":"2024-05-14T00:10:33Z","snapshot_observed_at":"2026-08-13T05:39:27.729878Z","submitted_at":"2023-10-26T23:17:39Z","title":"A Spectral Condition for Feature Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.17813","snapshot_observed_at":"2026-08-06T18:35:40.237394Z","title":"A spectral condition for feature learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.08091","last_updated":"2025-07-10T18:04:52Z","snapshot_observed_at":"2026-08-14T06:41:55.088814Z","submitted_at":"2025-07-10T18:04:52Z","title":"Low-rank Momentum Factorization for Memory Efficient Training","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-06T18:35:40.237394Z"},"links":{"cited_paper":"/paper/2310.17813","citing_paper":"/paper/2507.08091"},"observation_digest":"sha256:900437ee28b0f111931cfc6598f86eba2cf082900db909d704c452940c3fd02e","observation_id":"0d750cd9-6d15-4d64-8b9f-3f5302b61e32","resolution":{"observed_at":"2026-08-06T18:35:40.237394Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:35:40.239930Z","title":"Bitfit: Simple parameter-efficient fine-tuning for transformer-based masked language-models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.08091","last_updated":"2025-07-10T18:04:52Z","snapshot_observed_at":"2026-08-14T06:41:55.088814Z","submitted_at":"2025-07-10T18:04:52Z","title":"Low-rank Momentum Factorization for Memory Efficient Training","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-06T18:35:40.239930Z"},"links":{"citing_paper":"/paper/2507.08091"},"observation_digest":"sha256:6c1cba8e5dd56e2bf88c42a768457fbef6f0c1c3dbd10e8b3233963d57fa12da","observation_id":"44fa1c87-6636-4c72-b2e2-b83704a4c2f4","resolution":{"observed_at":"2026-08-06T18:35:40.239930Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.10512","last_updated":"2023-12-20T20:56:14Z","snapshot_observed_at":"2026-08-12T23:46:47.414754Z","submitted_at":"2023-03-18T22:36:25Z","title":"AdaLoRA: Adaptive Budget Allocation for Parameter-Efficient Fine-Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.10512","snapshot_observed_at":"2026-08-06T18:35:40.242074Z","title":"Adalora: Adaptive budget allocation for parameter-efficient fine-tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.08091","last_updated":"2025-07-10T18:04:52Z","snapshot_observed_at":"2026-08-14T06:41:55.088814Z","submitted_at":"2025-07-10T18:04:52Z","title":"Low-rank Momentum Factorization for Memory Efficient Training","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-06T18:35:40.242074Z"},"links":{"cited_paper":"/paper/2303.10512","citing_paper":"/paper/2507.08091"},"observation_digest":"sha256:cabd197095922bde34b11b58fadf82314f6a865d065b29da5bfca715227aca13","observation_id":"f90f451e-8e67-4718-ab89-7507bd97bf7f","resolution":{"observed_at":"2026-08-06T18:35:40.242074Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03507","last_updated":"2024-06-02T21:24:12Z","snapshot_observed_at":"2026-08-15T01:25:39.422061Z","submitted_at":"2024-03-06T07:29:57Z","title":"GaLore: Memory-Efficient LLM Training by Gradient Low-Rank Projection","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.03507","snapshot_observed_at":"2026-08-06T18:35:40.244756Z","title":"Galore: Memory-efficient llm training by gradient low-rank projection","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.08091","last_updated":"2025-07-10T18:04:52Z","snapshot_observed_at":"2026-08-14T06:41:55.088814Z","submitted_at":"2025-07-10T18:04:52Z","title":"Low-rank Momentum Factorization for Memory Efficient Training","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-06T18:35:40.244756Z"},"links":{"cited_paper":"/paper/2403.03507","citing_paper":"/paper/2507.08091"},"observation_digest":"sha256:151bda626d3de154b78891ff535834585cd2edd80b85ecfb0066cb2d9542e767","observation_id":"ce95a6af-a70d-440f-91d7-1eabe494034a","resolution":{"observed_at":"2026-08-06T18:35:40.244756Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.14958","last_updated":"2024-03-22T05:23:31Z","snapshot_observed_at":"2026-08-13T00:48:10.381890Z","submitted_at":"2024-03-22T05:23:31Z","title":"Adapprox: Adaptive Approximation in Adam Optimization via Randomized Low-Rank Matrices","version":1},"cited_work":{"arxiv_id":"2403.14958","doi":null,"metadata_source":"pith","pith_arxiv_id":"2403.14958","snapshot_observed_at":"2026-08-06T18:35:40.304676Z","title":"Adapprox: Adaptive Approximation in Adam Optimization via Randomized Low-Rank Matrices","venue":"cs.LG","work_id":"3074e8f4-0e4c-4805-932d-a4740f3250fc","year":2024},"citing_paper":{"arxiv_id":"2507.08091","last_updated":"2025-07-10T18:04:52Z","snapshot_observed_at":"2026-08-14T06:41:55.088814Z","submitted_at":"2025-07-10T18:04:52Z","title":"Low-rank Momentum Factorization for Memory Efficient Training","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-06T18:35:40.247371Z"},"links":{"cited_paper":"/paper/2403.14958","citing_paper":"/paper/2507.08091"},"observation_digest":"sha256:bb5aab96a0625c9e9a37c93848752abbb93ff5e37e2b9266143f31722e5a2cfc","observation_id":"0b28fa6a-0895-48f6-8cb4-0bdc270963a8","resolution":{"observed_at":"2026-08-06T18:35:40.307682Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05270","last_updated":"2025-02-17T08:27:58Z","snapshot_observed_at":"2026-08-11T20:47:03.266207Z","submitted_at":"2024-12-06T18:55:34Z","title":"APOLLO: SGD-like Memory, AdamW-level Performance","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05270","snapshot_observed_at":"2026-08-06T18:35:40.249822Z","title":"Apollo: Sgd-like memory, adamw-level performance","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.08091","last_updated":"2025-07-10T18:04:52Z","snapshot_observed_at":"2026-08-14T06:41:55.088814Z","submitted_at":"2025-07-10T18:04:52Z","title":"Low-rank Momentum Factorization for Memory Efficient Training","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-06T18:35:40.249822Z"},"links":{"cited_paper":"/paper/2412.05270","citing_paper":"/paper/2507.08091"},"observation_digest":"sha256:12bf6787c4300522ca3ad88c1e6f0bb198e6b4f8295801fe2dd301bc2d3344f2","observation_id":"008ee817-5a97-436a-97d1-a07d2e8019f7","resolution":{"observed_at":"2026-08-06T18:35:40.249822Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:35:40.252196Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.08091","last_updated":"2025-07-10T18:04:52Z","snapshot_observed_at":"2026-08-14T06:41:55.088814Z","submitted_at":"2025-07-10T18:04:52Z","title":"Low-rank Momentum Factorization for Memory Efficient Training","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-06T18:35:40.252196Z"},"links":{"citing_paper":"/paper/2507.08091"},"observation_digest":"sha256:b6a6adf16647610a89c758cf90db48ce13349c0a4f405d3be4988a1746b8c0c1","observation_id":"9b521a52-776b-4ec0-9b32-ea53ebece1f2","resolution":{"observed_at":"2026-08-06T18:35:40.252196Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.08091","last_updated":"2025-07-10T18:04:52Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-14T06:41:55.088814Z","submitted_at":"2025-07-10T18:04:52Z","title":"Low-rank Momentum Factorization for Memory Efficient Training"},"reference_resolution":{"displayed":67,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":44,"verified_exact":3,"verified_fuzzy":20},"total_outbound_references":67},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 67 of 67 outbound references and 0 inbound Pith citation observations for arXiv:2507.08091."}