{"as_of":"2026-08-15T05:31:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b3457f0b54b250919cfb003a13bd02613631c9c39e5d3f678bd74eecca7ff63c","coverage":[{"denominator":83,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":83,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T10:23:52.037279Z","state":"measured"},{"denominator":85,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":85,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-01T06:36:46.924135Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T16:49:58.438161Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2508.00180","last_updated":"2025-07-31T21:49:20Z","snapshot_observed_at":"2026-08-09T00:27:39.697134Z","submitted_at":"2025-07-31T21:49:20Z","title":"EMA Without the Lag: Bias-Corrected Iterate Averaging Schemes","version":1},"cited_work":{"arxiv_id":"2508.00180","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.00180","snapshot_observed_at":"2026-07-04T16:49:58.438161Z","title":"Ema without the lag: Bias-corrected iterate averaging schemes","venue":null,"work_id":"fdf3d55b-fa1b-4f7c-ab8b-101c3c658747","year":2025},"citing_paper":{"arxiv_id":"2606.25086","last_updated":"2026-06-30T16:49:44Z","snapshot_observed_at":"2026-08-13T07:23:32.497516Z","submitted_at":"2026-06-23T18:47:40Z","title":"Training for the Model You Return: Improving Optimization for Iterate-Averaged Language Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-26T00:09:54.353782Z"},"links":{"cited_paper":"/paper/2508.00180","citing_paper":"/paper/2606.25086"},"observation_digest":"sha256:45e8fcaeed2427bfc67a6f29a7d4d76b7aae1a5f4bdb05a3f745cb1f852a6299","observation_id":"374ef32c-908d-4e31-9576-f1af93cdc24d","resolution":{"observed_at":"2026-07-04T16:49:58.439604Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.00180","last_updated":"2025-07-31T21:49:20Z","snapshot_observed_at":"2026-08-09T00:27:39.697134Z","submitted_at":"2025-07-31T21:49:20Z","title":"EMA Without the Lag: Bias-Corrected Iterate Averaging Schemes","version":1},"cited_work":{"arxiv_id":"2508.00180","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.00180","snapshot_observed_at":"2026-07-04T16:49:58.438161Z","title":"Ema without the lag: Bias-corrected iterate averaging schemes","venue":null,"work_id":"fdf3d55b-fa1b-4f7c-ab8b-101c3c658747","year":2025},"citing_paper":{"arxiv_id":"2606.25086","last_updated":"2026-06-30T16:49:44Z","snapshot_observed_at":"2026-08-13T07:23:32.497516Z","submitted_at":"2026-06-23T18:47:40Z","title":"Training for the Model You Return: Improving Optimization for Iterate-Averaged Language Models","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-01T06:36:46.924135Z"},"links":{"cited_paper":"/paper/2508.00180","citing_paper":"/paper/2606.25086"},"observation_digest":"sha256:e16aead583135759dd82ae4cccef210cae4ec61a444824158b73539af7a68643","observation_id":"a0734cca-aa0f-4edd-a9cf-aafd1e765fd1","resolution":{"observed_at":"2026-07-01T09:25:41.338906Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2508.00180/citation-record","integrity":"/paper/2508.00180/integrity","json":"/paper/2508.00180/citation-record.json","paper":"/paper/2508.00180"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2108.07732","last_updated":"2021-08-16T03:57:30Z","snapshot_observed_at":"2026-08-02T19:23:53.535075Z","submitted_at":"2021-08-16T03:57:30Z","title":"Program Synthesis with Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.07732","snapshot_observed_at":"2026-08-06T10:23:45.651809Z","title":"Program synthesis with large language models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.00180","last_updated":"2025-07-31T21:49:20Z","snapshot_observed_at":"2026-08-09T00:27:39.697134Z","submitted_at":"2025-07-31T21:49:20Z","title":"EMA Without the Lag: Bias-Corrected Iterate Averaging Schemes","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-06T10:23:45.651809Z"},"links":{"cited_paper":"/paper/2108.07732","citing_paper":"/paper/2508.00180"},"observation_digest":"sha256:5dc434ffe743de1c1425c760601e15b38aae87a427d013bb481d4f94df1c1241","observation_id":"77d65f5c-2ad6-45b1-8128-7fa0df78b51b","resolution":{"observed_at":"2026-08-06T10:23:45.651809Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:23:45.744826Z","title":"High-dimensional limit theorems for sgd: Effective dynamics and critical scaling","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.00180","last_updated":"2025-07-31T21:49:20Z","snapshot_observed_at":"2026-08-09T00:27:39.697134Z","submitted_at":"2025-07-31T21:49:20Z","title":"EMA Without the Lag: Bias-Corrected Iterate Averaging Schemes","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-06T10:23:45.744826Z"},"links":{"citing_paper":"/paper/2508.00180"},"observation_digest":"sha256:2608ff6cd320729aaa73e621d2b6775eef92b1eeeefb4dc87fd60f951f85a556","observation_id":"2fd7dd10-ca30-4ebc-995a-d843395cfb1d","resolution":{"observed_at":"2026-08-06T10:23:45.744826Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:23:45.821133Z","title":"Provable guarantees for generative behavior cloning: Bridging low-level stability and high-level behavior","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.00180","last_updated":"2025-07-31T21:49:20Z","snapshot_observed_at":"2026-08-09T00:27:39.697134Z","submitted_at":"2025-07-31T21:49:20Z","title":"EMA Without the Lag: Bias-Corrected Iterate Averaging Schemes","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-06T10:23:45.821133Z"},"links":{"citing_paper":"/paper/2508.00180"},"observation_digest":"sha256:05678ce98cb4ea1cf6051f703bf8a9c869ebec990369003409b37ecac3e5174b","observation_id":"896df6f7-d37c-412f-96ea-fef7358e4f68","resolution":{"observed_at":"2026-08-06T10:23:45.821133Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:23:45.847970Z","title":"Butterfly effects of sgd noise: Error amplification in behavior cloning and autoregression","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.00180","last_updated":"2025-07-31T21:49:20Z","snapshot_observed_at":"2026-08-09T00:27:39.697134Z","submitted_at":"2025-07-31T21:49:20Z","title":"EMA Without the Lag: Bias-Corrected Iterate Averaging Schemes","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-06T10:23:45.847970Z"},"links":{"citing_paper":"/paper/2508.00180"},"observation_digest":"sha256:d666c7b5033b35ac6cb7fc251a0cd0d8f86159062cfb20071ac381a146f7c62a","observation_id":"93c7e947-9878-47dd-9ea3-2962ab80e862","resolution":{"observed_at":"2026-08-06T10:23:45.847970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:23:52.710547Z","title":"Approximation methods which converge with probability one","venue":null,"work_id":"c98aee12-98e0-466a-a182-c0dfbb03f937","year":1954},"citing_paper":{"arxiv_id":"2508.00180","last_updated":"2025-07-31T21:49:20Z","snapshot_observed_at":"2026-08-09T00:27:39.697134Z","submitted_at":"2025-07-31T21:49:20Z","title":"EMA Without the Lag: Bias-Corrected Iterate Averaging Schemes","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-06T10:23:45.891086Z"},"links":{"citing_paper":"/paper/2508.00180"},"observation_digest":"sha256:5a38d8d30a33fc302d093645c4bd1b97c775dad7d22b0ca6e1d84b169a20f533","observation_id":"4f3e6366-e1a1-40cf-96b8-f73a2e26bc03","resolution":{"observed_at":"2026-08-06T10:23:52.713434Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:23:52.701591Z","title":"How to scale your ema","venue":null,"work_id":"e79b72d7-060c-4765-9f3e-d399c6763f83","year":2023},"citing_paper":{"arxiv_id":"2508.00180","last_updated":"2025-07-31T21:49:20Z","snapshot_observed_at":"2026-08-09T00:27:39.697134Z","submitted_at":"2025-07-31T21:49:20Z","title":"EMA Without the Lag: Bias-Corrected Iterate Averaging Schemes","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-06T10:23:46.086657Z"},"links":{"citing_paper":"/paper/2508.00180"},"observation_digest":"sha256:3a1b0202ad03059e90cb84dd286d0b899ff8258e2a7c034067f09c7ef157f8de","observation_id":"71712a5f-ec88-4c23-b972-f6cb2bfc0284","resolution":{"observed_at":"2026-08-06T10:23:52.704441Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.02559","last_updated":"2020-10-06T09:06:07Z","snapshot_observed_at":"2026-08-13T21:24:54.655946Z","submitted_at":"2020-10-06T09:06:07Z","title":"LEGAL-BERT: The Muppets straight out of Law School","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.02559","snapshot_observed_at":"2026-08-06T10:23:46.241953Z","title":"Legal-bert: The muppets straight out of law school","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2508.00180","last_updated":"2025-07-31T21:49:20Z","snapshot_observed_at":"2026-08-09T00:27:39.697134Z","submitted_at":"2025-07-31T21:49:20Z","title":"EMA Without the Lag: Bias-Corrected Iterate Averaging Schemes","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-06T10:23:46.241953Z"},"links":{"cited_paper":"/paper/2010.02559","citing_paper":"/paper/2508.00180"},"observation_digest":"sha256:cfff7fe1dbe2f354b9c5bc9692204248e3980b79254c65c3ab389306a44d2240","observation_id":"739fa8a4-4a7e-4faf-9323-205d53801095","resolution":{"observed_at":"2026-08-06T10:23:46.241953Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:23:52.691658Z","title":"Incorrect baseline evaluations call into question recent llm-rl claims, 2025","venue":null,"work_id":"14d4cf45-55df-4301-87d8-68b5b30bbd3d","year":2025},"citing_paper":{"arxiv_id":"2508.00180","last_updated":"2025-07-31T21:49:20Z","snapshot_observed_at":"2026-08-09T00:27:39.697134Z","submitted_at":"2025-07-31T21:49:20Z","title":"EMA Without the Lag: Bias-Corrected Iterate Averaging Schemes","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-06T10:23:46.351256Z"},"links":{"citing_paper":"/paper/2508.00180"},"observation_digest":"sha256:1bf8faa6c2e0c149739f11d8af5c8ca0d40fe5c1244f0c0ab443391fb72f4625","observation_id":"658e397c-b1a2-46e6-a480-ba086aed9129","resolution":{"observed_at":"2026-08-06T10:23:52.694876Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.11816","last_updated":"2023-11-13T18:51:42Z","snapshot_observed_at":"2026-08-13T11:13:06.992714Z","submitted_at":"2023-06-20T18:19:17Z","title":"Learning to Generate Better Than Your LLM","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.11816","snapshot_observed_at":"2026-08-06T10:23:46.465760Z","title":"Learning to generate better than your llm","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.00180","last_updated":"2025-07-31T21:49:20Z","snapshot_observed_at":"2026-08-09T00:27:39.697134Z","submitted_at":"2025-07-31T21:49:20Z","title":"EMA Without the Lag: Bias-Corrected Iterate Averaging Schemes","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-06T10:23:46.465760Z"},"links":{"cited_paper":"/paper/2306.11816","citing_paper":"/paper/2508.00180"},"observation_digest":"sha256:9df51253acc538e106aa1e8b37b9ea7da4eda6df48d346219e97299706a867be","observation_id":"1693cfb4-1984-47db-a98a-c47900d5666c","resolution":{"observed_at":"2026-08-06T10:23:46.465760Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:23:52.682301Z","title":"Bidirectional looking with a novel double exponential moving average to adaptive and non-adaptive momentum optimizers","venue":null,"work_id":"025aaa82-da52-48db-8aa6-e2d5733c23f1","year":2023},"citing_paper":{"arxiv_id":"2508.00180","last_updated":"2025-07-31T21:49:20Z","snapshot_observed_at":"2026-08-09T00:27:39.697134Z","submitted_at":"2025-07-31T21:49:20Z","title":"EMA Without the Lag: Bias-Corrected Iterate Averaging Schemes","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-06T10:23:46.525397Z"},"links":{"citing_paper":"/paper/2508.00180"},"observation_digest":"sha256:792690695439009320cccb738a2d2a4eb14350892ebb726f26306b2dee5aac24","observation_id":"e92d7ade-133c-4a6c-a0a6-5c32c8cc73db","resolution":{"observed_at":"2026-08-06T10:23:52.685663Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:23:46.595345Z","title":"Double/debiased machine learning for treatment and structural parameters, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2508.00180","last_updated":"2025-07-31T21:49:20Z","snapshot_observed_at":"2026-08-09T00:27:39.697134Z","submitted_at":"2025-07-31T21:49:20Z","title":"EMA Without the Lag: Bias-Corrected Iterate Averaging Schemes","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-06T10:23:46.595345Z"},"links":{"citing_paper":"/paper/2508.00180"},"observation_digest":"sha256:d1b02ffb30df3a74cf6b2132eb7d6ce733935844b1202c79698b96f69e0b3711","observation_id":"62db7694-fe61-409d-9657-a56932319d04","resolution":{"observed_at":"2026-08-06T10:23:46.595345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:23:46.712637Z","title":"Deep reinforcement learning from human preferences","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2508.00180","last_updated":"2025-07-31T21:49:20Z","snapshot_observed_at":"2026-08-09T00:27:39.697134Z","submitted_at":"2025-07-31T21:49:20Z","title":"EMA Without the Lag: Bias-Corrected Iterate Averaging Schemes","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-06T10:23:46.712637Z"},"links":{"citing_paper":"/paper/2508.00180"},"observation_digest":"sha256:d5706912e04f4f2e12cc3bf2ca91ca96e788c15dd8303126b264f56c4a3f31c3","observation_id":"8083e651-f737-47e3-8a4c-7f1cb04ceaeb","resolution":{"observed_at":"2026-08-06T10:23:46.712637Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1905.10044","last_updated":"2019-05-24T05:48:49Z","snapshot_observed_at":"2026-08-14T15:52:43.138964Z","submitted_at":"2019-05-24T05:48:49Z","title":"BoolQ: Exploring the Surprising Difficulty of Natural Yes/No Questions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.10044","snapshot_observed_at":"2026-08-06T10:23:46.829935Z","title":"Boolq: Exploring the surprising difficulty of natural yes/no questions","venue":null,"work_id":null,"year":1905},"citing_paper":{"arxiv_id":"2508.00180","last_updated":"2025-07-31T21:49:20Z","snapshot_observed_at":"2026-08-09T00:27:39.697134Z","submitted_at":"2025-07-31T21:49:20Z","title":"EMA Without the Lag: Bias-Corrected Iterate Averaging Schemes","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-06T10:23:46.829935Z"},"links":{"cited_paper":"/paper/1905.10044","citing_paper":"/paper/2508.00180"},"observation_digest":"sha256:3b3e544fc38fb8d59ac16a617ba6b16f81e480d46de9bf01093a6feb638b2387","observation_id":"e6e0a726-cff1-4a2a-b042-9c8d44377b3c","resolution":{"observed_at":"2026-08-06T10:23:46.829935Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-14T02:43:01.480086Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-06T10:23:46.868383Z","title":"Training verifiers to solve math word problems","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.00180","last_updated":"2025-07-31T21:49:20Z","snapshot_observed_at":"2026-08-09T00:27:39.697134Z","submitted_at":"2025-07-31T21:49:20Z","title":"EMA Without the Lag: Bias-Corrected Iterate Averaging Schemes","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-06T10:23:46.868383Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2508.00180"},"observation_digest":"sha256:7ab41fd6465f1e6ebfe01e27cce53b6f0fb59bd3d49045f843d2cb9d68172daa","observation_id":"cfa83e9a-5329-42f5-a3fc-6079bdc55943","resolution":{"observed_at":"2026-08-06T10:23:46.868383Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.00065","last_updated":"2022-11-23T18:09:57Z","snapshot_observed_at":"2026-08-13T04:20:08.395688Z","submitted_at":"2021-02-26T22:08:19Z","title":"Gradient Descent on Neural Networks Typically Occurs at the Edge of Stability","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.00065","snapshot_observed_at":"2026-08-06T10:23:46.940838Z","title":"Gradient descent on neural networks typically occurs at the edge of stability","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.00180","last_updated":"2025-07-31T21:49:20Z","snapshot_observed_at":"2026-08-09T00:27:39.697134Z","submitted_at":"2025-07-31T21:49:20Z","title":"EMA Without the Lag: Bias-Corrected Iterate Averaging Schemes","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-06T10:23:46.940838Z"},"links":{"cited_paper":"/paper/2103.00065","citing_paper":"/paper/2508.00180"},"observation_digest":"sha256:70bc4507a04af576d5944c9d8446a47b4148161013b9d15cb8160f28a5cee708","observation_id":"9d96bd46-3797-412d-a50d-1b9585d41287","resolution":{"observed_at":"2026-08-06T10:23:46.940838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:23:47.049340Z","title":"Saga: A fast incremental gradient method with support for non-strongly convex composite objectives","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2508.00180","last_updated":"2025-07-31T21:49:20Z","snapshot_observed_at":"2026-08-09T00:27:39.697134Z","submitted_at":"2025-07-31T21:49:20Z","title":"EMA Without the Lag: Bias-Corrected Iterate Averaging Schemes","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-06T10:23:47.049340Z"},"links":{"citing_paper":"/paper/2508.00180"},"observation_digest":"sha256:5982cd5e69a0d9d243949e8265cfb6679e17cb81a91ed0aec6eefb2ffdfc50e0","observation_id":"39618f0a-9a58-4c81-92e1-093b7557d8d4","resolution":{"observed_at":"2026-08-06T10:23:47.049340Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:23:52.656873Z","title":"Averaged least-mean-squares: Bias-variance trade-offs and optimal sampling distributions","venue":null,"work_id":"cf829f7f-7908-4377-9f7e-b6ac1257bf27","year":2015},"citing_paper":{"arxiv_id":"2508.00180","last_updated":"2025-07-31T21:49:20Z","snapshot_observed_at":"2026-08-09T00:27:39.697134Z","submitted_at":"2025-07-31T21:49:20Z","title":"EMA Without the Lag: Bias-Corrected Iterate Averaging Schemes","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-06T10:23:47.109317Z"},"links":{"citing_paper":"/paper/2508.00180"},"observation_digest":"sha256:28e72d1635e91dc6c7f8cf3d3de08bc49215d8cbcb7285ae023e2b0114d9aa09","observation_id":"289142f1-3423-4b30-9061-e1b4c64b5796","resolution":{"observed_at":"2026-08-06T10:23:52.660256Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:23:52.648142Z","title":"Harder, better, faster, stronger convergence rates for least-squares regression","venue":null,"work_id":"6bd6dc0e-7b6e-4176-a1e0-dd9d1946e9a4","year":2017},"citing_paper":{"arxiv_id":"2508.00180","last_updated":"2025-07-31T21:49:20Z","snapshot_observed_at":"2026-08-09T00:27:39.697134Z","submitted_at":"2025-07-31T21:49:20Z","title":"EMA Without the Lag: Bias-Corrected Iterate Averaging Schemes","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-06T10:23:47.232493Z"},"links":{"citing_paper":"/paper/2508.00180"},"observation_digest":"sha256:675c06a942399f9ff90286724b356fa6e27e96fd364239950d0b695632451155","observation_id":"ccb16d40-0472-4d07-b715-80d9f10420f0","resolution":{"observed_at":"2026-08-06T10:23:52.650886Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:23:47.286455Z","title":"Adaptive subgradient methods for online learning and stochastic optimization","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2508.00180","last_updated":"2025-07-31T21:49:20Z","snapshot_observed_at":"2026-08-09T00:27:39.697134Z","submitted_at":"2025-07-31T21:49:20Z","title":"EMA Without the Lag: Bias-Corrected Iterate Averaging Schemes","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-06T10:23:47.286455Z"},"links":{"citing_paper":"/paper/2508.00180"},"observation_digest":"sha256:1c20d85a1264c0a27013013cde127892d4356a9f296437e611729cfb96b3d158","observation_id":"13b7bb9e-5939-40de-b10a-ca467174d357","resolution":{"observed_at":"2026-08-06T10:23:47.286455Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:23:52.633625Z","title":"Is behavior cloning all you need? understanding horizon in imitation learning","venue":null,"work_id":"3a0dba16-196d-44d4-a59a-dbe940d90d9e","year":2024},"citing_paper":{"arxiv_id":"2508.00180","last_updated":"2025-07-31T21:49:20Z","snapshot_observed_at":"2026-08-09T00:27:39.697134Z","submitted_at":"2025-07-31T21:49:20Z","title":"EMA Without the Lag: Bias-Corrected Iterate Averaging Schemes","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-06T10:23:47.382502Z"},"links":{"citing_paper":"/paper/2508.00180"},"observation_digest":"sha256:6cf1920cbc6a34b661467c8aa5ed5a9e23c18d2c2709e54ac8f02198b7e10309","observation_id":"5dfb3620-86a9-4642-8b03-f979ba971b2f","resolution":{"observed_at":"2026-08-06T10:23:52.636518Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-06T10:23:47.454252Z","title":"The llama 3 herd of models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.00180","last_updated":"2025-07-31T21:49:20Z","snapshot_observed_at":"2026-08-09T00:27:39.697134Z","submitted_at":"2025-07-31T21:49:20Z","title":"EMA Without the Lag: Bias-Corrected Iterate Averaging Schemes","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-06T10:23:47.454252Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2508.00180"},"observation_digest":"sha256:66c11f6e9f008fe020d7bbb32de06522bb37b8f67114f57df366026fe1ae7e97","observation_id":"98952c78-f52a-43a7-8762-b8befb25b1ea","resolution":{"observed_at":"2026-08-06T10:23:47.454252Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:23:52.625436Z","title":"Bootstrap your own latent-a new approach to self-supervised learning","venue":null,"work_id":"2a1ad12d-500a-489b-8b3b-df47c685782c","year":2020},"citing_paper":{"arxiv_id":"2508.00180","last_updated":"2025-07-31T21:49:20Z","snapshot_observed_at":"2026-08-09T00:27:39.697134Z","submitted_at":"2025-07-31T21:49:20Z","title":"EMA Without the Lag: Bias-Corrected Iterate Averaging Schemes","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-06T10:23:47.588289Z"},"links":{"citing_paper":"/paper/2508.00180"},"observation_digest":"sha256:d488e97ef3e15326e6b5788f88744ef9713d3f1daf67e9f1309de9aebe77ba65","observation_id":"2d917c7c-1e02-4cba-b043-0fc3e628a464","resolution":{"observed_at":"2026-08-06T10:23:52.628324Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:23:47.675863Z","title":"Shampoo: Preconditioned stochastic tensor optimization","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2508.00180","last_updated":"2025-07-31T21:49:20Z","snapshot_observed_at":"2026-08-09T00:27:39.697134Z","submitted_at":"2025-07-31T21:49:20Z","title":"EMA Without the Lag: Bias-Corrected Iterate Averaging Schemes","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-06T10:23:47.675863Z"},"links":{"citing_paper":"/paper/2508.00180"},"observation_digest":"sha256:880fcb822adf78b435fc9a03ae5e6514f0f0445bb29b232793cd76f20c722f09","observation_id":"c7d64f01-90ce-482c-9e60-ac4c9f22bc6d","resolution":{"observed_at":"2026-08-06T10:23:47.675863Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:23:47.715586Z","title":"Measuring massive multitask language understanding","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.00180","last_updated":"2025-07-31T21:49:20Z","snapshot_observed_at":"2026-08-09T00:27:39.697134Z","submitted_at":"2025-07-31T21:49:20Z","title":"EMA Without the Lag: Bias-Corrected Iterate Averaging Schemes","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-06T10:23:47.715586Z"},"links":{"citing_paper":"/paper/2508.00180"},"observation_digest":"sha256:58579c879235c1cb024e5c56b2fb2c24dbf28878113168423f1c524df789cb5e","observation_id":"b5a3b82a-2d64-46fe-9b46-5323414f16b9","resolution":{"observed_at":"2026-08-06T10:23:47.715586Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.05407","last_updated":"2019-02-25T14:18:11Z","snapshot_observed_at":"2026-08-14T19:36:09.254749Z","submitted_at":"2018-03-14T17:09:27Z","title":"Averaging Weights Leads to Wider Optima and Better Generalization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.05407","snapshot_observed_at":"2026-08-06T10:23:47.788636Z","title":"Averaging weights leads to wider optima and better generalization","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2508.00180","last_updated":"2025-07-31T21:49:20Z","snapshot_observed_at":"2026-08-09T00:27:39.697134Z","submitted_at":"2025-07-31T21:49:20Z","title":"EMA Without the Lag: Bias-Corrected Iterate Averaging Schemes","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-06T10:23:47.788636Z"},"links":{"cited_paper":"/paper/1803.05407","citing_paper":"/paper/2508.00180"},"observation_digest":"sha256:d4b3843c6fed133928d1d250ea451d3a4bf80c3ec7fe1c8610b7fec842e371dd","observation_id":"25f37361-a597-4e58-b341-fbe7cadf4fe0","resolution":{"observed_at":"2026-08-06T10:23:47.788636Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:23:47.969468Z","title":"Neural tangent kernel: Convergence and generalization in neural networks","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2508.00180","last_updated":"2025-07-31T21:49:20Z","snapshot_observed_at":"2026-08-09T00:27:39.697134Z","submitted_at":"2025-07-31T21:49:20Z","title":"EMA Without the Lag: Bias-Corrected Iterate Averaging Schemes","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-06T10:23:47.969468Z"},"links":{"citing_paper":"/paper/2508.00180"},"observation_digest":"sha256:df319343d566b3174745b502a37e719313e9e3ec7d39c60dc4dd49f0c26a526d","observation_id":"2b320dce-cf3e-4c70-ac64-2d6cafb1a769","resolution":{"observed_at":"2026-08-06T10:23:47.969468Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:23:48.111032Z","title":"Accelerating stochastic gradient descent using predictive variance reduction","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2508.00180","last_updated":"2025-07-31T21:49:20Z","snapshot_observed_at":"2026-08-09T00:27:39.697134Z","submitted_at":"2025-07-31T21:49:20Z","title":"EMA Without the Lag: Bias-Corrected Iterate Averaging Schemes","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-06T10:23:48.111032Z"},"links":{"citing_paper":"/paper/2508.00180"},"observation_digest":"sha256:a1b904a8ca3f8e2831dec9cdbbe85323f5d632594c2d3d4c53cafeef0833d4c2","observation_id":"1896506d-1216-420a-8999-dadc4a973a61","resolution":{"observed_at":"2026-08-06T10:23:48.111032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.14981","last_updated":"2022-10-06T17:57:36Z","snapshot_observed_at":"2026-08-13T20:12:31.788693Z","submitted_at":"2022-09-29T17:46:13Z","title":"Stop Wasting My Time! Saving Days of ImageNet and BERT Training with Latest Weight Averaging","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.14981","snapshot_observed_at":"2026-08-06T10:23:48.286379Z","title":"Stop wasting my time! saving days of imagenet and bert training with latest weight averaging","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.00180","last_updated":"2025-07-31T21:49:20Z","snapshot_observed_at":"2026-08-09T00:27:39.697134Z","submitted_at":"2025-07-31T21:49:20Z","title":"EMA Without the Lag: Bias-Corrected Iterate Averaging Schemes","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-06T10:23:48.286379Z"},"links":{"cited_paper":"/paper/2209.14981","citing_paper":"/paper/2508.00180"},"observation_digest":"sha256:becf3e63043fd415b063e1a127405c9c1b493d03ba2fce9e2961648a817c2376","observation_id":"96672192-4172-4668-8c19-b26010b8810b","resolution":{"observed_at":"2026-08-06T10:23:48.286379Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:23:52.591396Z","title":"No train no gain: Revisiting efficient training algorithms for transformer-based language models","venue":null,"work_id":"945966d7-0f94-4064-97b3-8cf64997d40d","year":2023},"citing_paper":{"arxiv_id":"2508.00180","last_updated":"2025-07-31T21:49:20Z","snapshot_observed_at":"2026-08-09T00:27:39.697134Z","submitted_at":"2025-07-31T21:49:20Z","title":"EMA Without the Lag: Bias-Corrected Iterate Averaging Schemes","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-06T10:23:48.404641Z"},"links":{"citing_paper":"/paper/2508.00180"},"observation_digest":"sha256:4c1af902d9b2c8a59efdbd7f88c4a18b22000cb6868894157bb02e59843d8c8d","observation_id":"09d638c1-2edc-4312-bfa7-39834e488387","resolution":{"observed_at":"2026-08-06T10:23:52.594443Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19786","last_updated":"2025-03-25T15:52:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-25T15:52:34Z","title":"Gemma 3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.19786","snapshot_observed_at":"2026-08-06T10:23:48.550625Z","title":"Gemma 3 technical report","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.00180","last_updated":"2025-07-31T21:49:20Z","snapshot_observed_at":"2026-08-09T00:27:39.697134Z","submitted_at":"2025-07-31T21:49:20Z","title":"EMA Without the Lag: Bias-Corrected Iterate Averaging Schemes","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-06T10:23:48.550625Z"},"links":{"cited_paper":"/paper/2503.19786","citing_paper":"/paper/2508.00180"},"observation_digest":"sha256:d2aacff03b879ca7837ba16ce584c871ca05f63b84a50976339977dfa6edf767","observation_id":"27489973-0d4f-4fca-bbb8-1ddfbc324af7","resolution":{"observed_at":"2026-08-06T10:23:48.550625Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.02696","last_updated":"2024-03-20T12:58:14Z","snapshot_observed_at":"2026-08-13T05:09:38.727338Z","submitted_at":"2023-12-05T11:55:47Z","title":"Analyzing and Improving the Training Dynamics of Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.02696","snapshot_observed_at":"2026-08-06T10:23:48.659364Z","title":"Analyzing and improving the training dynamics of diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.00180","last_updated":"2025-07-31T21:49:20Z","snapshot_observed_at":"2026-08-09T00:27:39.697134Z","submitted_at":"2025-07-31T21:49:20Z","title":"EMA Without the Lag: Bias-Corrected Iterate Averaging Schemes","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-06T10:23:48.659364Z"},"links":{"cited_paper":"/paper/2312.02696","citing_paper":"/paper/2508.00180"},"observation_digest":"sha256:24283359c31d3bbcfc0398f3d13898bc378eface5b9f09a632e311d54a175b53","observation_id":"edf4b9f7-060b-40ef-b8ac-f239fde50a20","resolution":{"observed_at":"2026-08-06T10:23:48.659364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-08-14T18:51:16.666127Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-06T10:23:48.814561Z","title":"Adam: A method for stochastic optimization","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2508.00180","last_updated":"2025-07-31T21:49:20Z","snapshot_observed_at":"2026-08-09T00:27:39.697134Z","submitted_at":"2025-07-31T21:49:20Z","title":"EMA Without the Lag: Bias-Corrected Iterate Averaging Schemes","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-06T10:23:48.814561Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/2508.00180"},"observation_digest":"sha256:290cd036fc1e334062c9815e60944d3c9e45afa576e562b97433c61184b8f75b","observation_id":"32dc7719-8ef9-4931-9a68-79d2831431ec","resolution":{"observed_at":"2026-08-06T10:23:48.814561Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:23:52.582047Z","title":null,"venue":null,"work_id":"f9ce70c2-4a33-4bff-b501-5e8da4fd8835","year":2012},"citing_paper":{"arxiv_id":"2508.00180","last_updated":"2025-07-31T21:49:20Z","snapshot_observed_at":"2026-08-09T00:27:39.697134Z","submitted_at":"2025-07-31T21:49:20Z","title":"EMA Without the Lag: Bias-Corrected Iterate Averaging Schemes","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-06T10:23:48.845871Z"},"links":{"citing_paper":"/paper/2508.00180"},"observation_digest":"sha256:e49f5a7fd0a41c34056b82dda28f03ff971f33fef1f998e6379bccbc386bf241","observation_id":"8798bd86-4e58-4e5f-b18c-fc4f255e4fee","resolution":{"observed_at":"2026-08-06T10:23:52.585249Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:23:52.573304Z","title":"Statistical inference for ergodic diffusion processes","venue":null,"work_id":"684d4fd2-09f8-4674-bb45-23bbe5c731e0","year":2013},"citing_paper":{"arxiv_id":"2508.00180","last_updated":"2025-07-31T21:49:20Z","snapshot_observed_at":"2026-08-09T00:27:39.697134Z","submitted_at":"2025-07-31T21:49:20Z","title":"EMA Without the Lag: Bias-Corrected Iterate Averaging Schemes","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-06T10:23:48.958790Z"},"links":{"citing_paper":"/paper/2508.00180"},"observation_digest":"sha256:455ee5eaba6d94a6e6c3027fc4edb3f621fe7089dd0f4f8bc1dd7166816084b1","observation_id":"a4e38958-5226-4474-ad47-caaca1076791","resolution":{"observed_at":"2026-08-06T10:23:52.576321Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:23:49.190251Z","title":"Gonzalez, Hao Zhang, and Ion Stoica","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.00180","last_updated":"2025-07-31T21:49:20Z","snapshot_observed_at":"2026-08-09T00:27:39.697134Z","submitted_at":"2025-07-31T21:49:20Z","title":"EMA Without the Lag: Bias-Corrected Iterate Averaging Schemes","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-06T10:23:49.190251Z"},"links":{"citing_paper":"/paper/2508.00180"},"observation_digest":"sha256:d89e30ed65ff6b65498089cd9cdd3e7f8ddf76e95b70104924acd76e06a79df0","observation_id":"c6e724a6-2d50-4fcb-8afe-e57fca99404a","resolution":{"observed_at":"2026-08-06T10:23:49.190251Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15124","last_updated":"2025-04-14T22:39:09Z","snapshot_observed_at":"2026-08-10T16:05:13.426341Z","submitted_at":"2024-11-22T18:44:04Z","title":"Tulu 3: Pushing Frontiers in Open Language Model Post-Training","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15124","snapshot_observed_at":"2026-08-06T10:23:49.237889Z","title":"Tulu 3: Pushing frontiers in open language model post-training","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.00180","last_updated":"2025-07-31T21:49:20Z","snapshot_observed_at":"2026-08-09T00:27:39.697134Z","submitted_at":"2025-07-31T21:49:20Z","title":"EMA Without the Lag: Bias-Corrected Iterate Averaging Schemes","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-06T10:23:49.237889Z"},"links":{"cited_paper":"/paper/2411.15124","citing_paper":"/paper/2508.00180"},"observation_digest":"sha256:f48b638a25884ea056a81ad27e3fc1ed5be7883785cdb86cdb7fd00ecbabf690","observation_id":"a0a7993c-f5cd-4937-9f93-9d7ed7c6069b","resolution":{"observed_at":"2026-08-06T10:23:49.237889Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:23:52.559079Z","title":"Brownian motion, martingales, and stochastic calculus","venue":null,"work_id":"d96c7ca7-a1b8-46e1-8daa-1bb6f3b60380","year":2016},"citing_paper":{"arxiv_id":"2508.00180","last_updated":"2025-07-31T21:49:20Z","snapshot_observed_at":"2026-08-09T00:27:39.697134Z","submitted_at":"2025-07-31T21:49:20Z","title":"EMA Without the Lag: Bias-Corrected Iterate Averaging Schemes","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-06T10:23:49.371231Z"},"links":{"citing_paper":"/paper/2508.00180"},"observation_digest":"sha256:c63cae16f82d54d2352016e83ac1d0d138babdff0ace489065f0dec151a5ad73","observation_id":"66afda0a-b3f5-4f90-ae01-639a92707c1b","resolution":{"observed_at":"2026-08-06T10:23:52.561802Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02596","last_updated":"2025-02-04T09:13:43Z","snapshot_observed_at":"2026-08-12T23:52:41.535807Z","submitted_at":"2024-06-01T05:55:15Z","title":"Slow and Steady Wins the Race: Maintaining Plasticity with Hare and Tortoise Networks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02596","snapshot_observed_at":"2026-08-06T10:23:49.456993Z","title":"Slow and steady wins the race: Maintaining plasticity with hare and tortoise networks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.00180","last_updated":"2025-07-31T21:49:20Z","snapshot_observed_at":"2026-08-09T00:27:39.697134Z","submitted_at":"2025-07-31T21:49:20Z","title":"EMA Without the Lag: Bias-Corrected Iterate Averaging Schemes","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-06T10:23:49.456993Z"},"links":{"cited_paper":"/paper/2406.02596","citing_paper":"/paper/2508.00180"},"observation_digest":"sha256:ac8b96bb9d43a500be03ae5ac6d627e22f9eb309b4aa66aef5c50a3fc29bacb0","observation_id":"f31e223d-ed04-4978-b17c-ea41dc475b74","resolution":{"observed_at":"2026-08-06T10:23:49.456993Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:23:49.577990Z","title":"Biobert: a pre-trained biomedical language representation model for biomedical text mining","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2508.00180","last_updated":"2025-07-31T21:49:20Z","snapshot_observed_at":"2026-08-09T00:27:39.697134Z","submitted_at":"2025-07-31T21:49:20Z","title":"EMA Without the Lag: Bias-Corrected Iterate Averaging Schemes","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-06T10:23:49.577990Z"},"links":{"citing_paper":"/paper/2508.00180"},"observation_digest":"sha256:ec2ac921d34f03764395420502e8a85e6eb5fc303222b1e6e7d1f54e7f5b3aae","observation_id":"9bf4a260-eafb-4224-a215-816eb2051fb1","resolution":{"observed_at":"2026-08-06T10:23:49.577990Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:23:52.545470Z","title":"Theory of point estimation","venue":null,"work_id":"27830917-432b-4238-a38c-b02cc3105d9d","year":2006},"citing_paper":{"arxiv_id":"2508.00180","last_updated":"2025-07-31T21:49:20Z","snapshot_observed_at":"2026-08-09T00:27:39.697134Z","submitted_at":"2025-07-31T21:49:20Z","title":"EMA Without the Lag: Bias-Corrected Iterate Averaging Schemes","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-06T10:23:49.729624Z"},"links":{"citing_paper":"/paper/2508.00180"},"observation_digest":"sha256:880c927c9472a85b4b3f6111d09f4ae83464890b3cc2b4497a3ca5f546ff6925","observation_id":"02ffbe8d-dd24-4b18-a2f7-d2fa7f8dec37","resolution":{"observed_at":"2026-08-06T10:23:52.548229Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:23:52.535362Z","title":"Stochastic modified equations and adaptive stochastic gradient algorithms","venue":null,"work_id":"bb56f596-d9fc-4995-99f1-041fa4c8c4d5","year":2017},"citing_paper":{"arxiv_id":"2508.00180","last_updated":"2025-07-31T21:49:20Z","snapshot_observed_at":"2026-08-09T00:27:39.697134Z","submitted_at":"2025-07-31T21:49:20Z","title":"EMA Without the Lag: Bias-Corrected Iterate Averaging Schemes","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-06T10:23:49.847926Z"},"links":{"citing_paper":"/paper/2508.00180"},"observation_digest":"sha256:09c6a902b04bf59918e435c19bdf988f6c8432d6c77c95216cf43220f11ed01d","observation_id":"00607ca9-db1b-4724-b9f2-5151132513de","resolution":{"observed_at":"2026-08-06T10:23:52.539762Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.09240","last_updated":"2024-10-06T17:44:46Z","snapshot_observed_at":"2026-08-13T04:19:02.861055Z","submitted_at":"2024-02-14T15:28:42Z","title":"Switch EMA: A Free Lunch for Better Flatness and Sharpness","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.09240","snapshot_observed_at":"2026-08-06T10:23:49.973613Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.00180","last_updated":"2025-07-31T21:49:20Z","snapshot_observed_at":"2026-08-09T00:27:39.697134Z","submitted_at":"2025-07-31T21:49:20Z","title":"EMA Without the Lag: Bias-Corrected Iterate Averaging Schemes","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-06T10:23:49.973613Z"},"links":{"cited_paper":"/paper/2402.09240","citing_paper":"/paper/2508.00180"},"observation_digest":"sha256:d2352df33240f2a3d5d211c4932b92810ca65c3785bbe5cfff6fbebb8a2575c8","observation_id":"314f98bd-a0a5-47c9-86d3-210482100d3b","resolution":{"observed_at":"2026-08-06T10:23:49.973613Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:23:52.526618Z","title":"Statistics of random processes: I","venue":null,"work_id":"8f7d6f1c-dd60-4109-b2c6-b1f1115d7fc2","year":2013},"citing_paper":{"arxiv_id":"2508.00180","last_updated":"2025-07-31T21:49:20Z","snapshot_observed_at":"2026-08-09T00:27:39.697134Z","submitted_at":"2025-07-31T21:49:20Z","title":"EMA Without the Lag: Bias-Corrected Iterate Averaging Schemes","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-06T10:23:50.040897Z"},"links":{"citing_paper":"/paper/2508.00180"},"observation_digest":"sha256:843e71298e2e4dad583342ac44072f2dfb2b12af8b51e269bd8a5fd16177b244","observation_id":"6715869e-a04f-4124-85bc-61f40ef76e69","resolution":{"observed_at":"2026-08-06T10:23:52.529338Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:23:52.516702Z","title":"Statistics of random processes II: Applications, volume 6","venue":null,"work_id":"73a1d6bc-8e4a-4b66-a245-1f80405f0fef","year":2013},"citing_paper":{"arxiv_id":"2508.00180","last_updated":"2025-07-31T21:49:20Z","snapshot_observed_at":"2026-08-09T00:27:39.697134Z","submitted_at":"2025-07-31T21:49:20Z","title":"EMA Without the Lag: Bias-Corrected Iterate Averaging Schemes","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-06T10:23:50.182736Z"},"links":{"citing_paper":"/paper/2508.00180"},"observation_digest":"sha256:ec65e9ce050fbe2b9fec7ea73a2475c5f10840a5ac804e0a695c6151e961bcb3","observation_id":"eb64e063-3c2a-47b7-b32f-7ce796c46572","resolution":{"observed_at":"2026-08-06T10:23:52.520280Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.10047","last_updated":"2023-10-16T04:11:19Z","snapshot_observed_at":"2026-08-13T05:48:51.271185Z","submitted_at":"2023-10-16T04:11:19Z","title":"Improving Large Language Model Fine-tuning for Solving Math Problems","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.10047","snapshot_observed_at":"2026-08-06T10:23:50.334485Z","title":"Improving large language model fine-tuning for solving math problems","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.00180","last_updated":"2025-07-31T21:49:20Z","snapshot_observed_at":"2026-08-09T00:27:39.697134Z","submitted_at":"2025-07-31T21:49:20Z","title":"EMA Without the Lag: Bias-Corrected Iterate Averaging Schemes","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-06T10:23:50.334485Z"},"links":{"cited_paper":"/paper/2310.10047","citing_paper":"/paper/2508.00180"},"observation_digest":"sha256:9f6c242e6d00447baac99e07696bb1e420f115240fa905d43604089b80365b0e","observation_id":"3ae028ca-7d4f-4477-91b8-157b9104151d","resolution":{"observed_at":"2026-08-06T10:23:50.334485Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-08-14T20:13:52.872565Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-06T10:23:50.449308Z","title":"Decoupled weight decay regularization","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2508.00180","last_updated":"2025-07-31T21:49:20Z","snapshot_observed_at":"2026-08-09T00:27:39.697134Z","submitted_at":"2025-07-31T21:49:20Z","title":"EMA Without the Lag: Bias-Corrected Iterate Averaging Schemes","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-06T10:23:50.449308Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2508.00180"},"observation_digest":"sha256:e8116966ef5c3ba1aadb36bcc1be0db13b3842f02a4ed1ce6d454af0b651501a","observation_id":"3531bf4d-9dac-43e8-9824-003672414d38","resolution":{"observed_at":"2026-08-06T10:23:50.449308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:23:52.507330Z","title":"Sgdr: Stochastic gradient descent with warm restarts","venue":null,"work_id":"28e0c25f-5a48-4918-849a-5eb2226dbdc4","year":2022},"citing_paper":{"arxiv_id":"2508.00180","last_updated":"2025-07-31T21:49:20Z","snapshot_observed_at":"2026-08-09T00:27:39.697134Z","submitted_at":"2025-07-31T21:49:20Z","title":"EMA Without the Lag: Bias-Corrected Iterate Averaging Schemes","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-06T10:23:50.592820Z"},"links":{"citing_paper":"/paper/2508.00180"},"observation_digest":"sha256:52b6b05c65d228e8047c8f56663e8e4151e4fb605110e57aac861d8fadd1e155","observation_id":"9354b131-9533-4e5d-b039-e6df4926a553","resolution":{"observed_at":"2026-08-06T10:23:52.510379Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:23:52.497489Z","title":"On the sdes and scaling rules for adaptive gradient algorithms","venue":null,"work_id":"e54183b2-5da5-4ba8-b2b5-ec9c4e9b3a6b","year":2022},"citing_paper":{"arxiv_id":"2508.00180","last_updated":"2025-07-31T21:49:20Z","snapshot_observed_at":"2026-08-09T00:27:39.697134Z","submitted_at":"2025-07-31T21:49:20Z","title":"EMA Without the Lag: Bias-Corrected Iterate Averaging Schemes","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-06T10:23:50.740473Z"},"links":{"citing_paper":"/paper/2508.00180"},"observation_digest":"sha256:83e6cff8a0ff08c4813cebaeaf6cfbb829c0b4f7ab034e7db5aa7bd41090f0f6","observation_id":"4c731e40-810a-4bef-a614-2d93dff90ae5","resolution":{"observed_at":"2026-08-06T10:23:52.500602Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:23:52.487340Z","title":"A kernel-based view of language model fine-tuning","venue":null,"work_id":"5f4d1a15-ba76-40e8-8703-952ec1a80ba0","year":2023},"citing_paper":{"arxiv_id":"2508.00180","last_updated":"2025-07-31T21:49:20Z","snapshot_observed_at":"2026-08-09T00:27:39.697134Z","submitted_at":"2025-07-31T21:49:20Z","title":"EMA Without the Lag: Bias-Corrected Iterate Averaging Schemes","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-06T10:23:50.856525Z"},"links":{"citing_paper":"/paper/2508.00180"},"observation_digest":"sha256:79e00e59d71aab0d2c347488add84890edf5b955f2267972255001a02c99641a","observation_id":"8218bda6-13f4-49a8-b80a-f68c516c1237","resolution":{"observed_at":"2026-08-06T10:23:52.490518Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:23:52.477696Z","title":"Continuous-time limit of stochastic gradient descent revisited","venue":null,"work_id":"36f6cf4f-b280-4b63-8546-5a22870ad3e9","year":2015},"citing_paper":{"arxiv_id":"2508.00180","last_updated":"2025-07-31T21:49:20Z","snapshot_observed_at":"2026-08-09T00:27:39.697134Z","submitted_at":"2025-07-31T21:49:20Z","title":"EMA Without the Lag: Bias-Corrected Iterate Averaging Schemes","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-06T10:23:51.026324Z"},"links":{"citing_paper":"/paper/2508.00180"},"observation_digest":"sha256:fbc33a8a240e03fab32a3593dbde8cc4bd60f985a0924fa271390b5c618478a5","observation_id":"003eaaf9-a0fc-42a3-bf0e-6e5dfb9aa8d6","resolution":{"observed_at":"2026-08-06T10:23:52.480815Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1804.07612","last_updated":"2018-04-20T13:44:12Z","snapshot_observed_at":"2026-08-14T19:23:51.651137Z","submitted_at":"2018-04-20T13:44:12Z","title":"Revisiting Small Batch Training for Deep Neural Networks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1804.07612","snapshot_observed_at":"2026-08-06T10:23:51.098062Z","title":"Revisiting small batch training for deep neural networks","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2508.00180","last_updated":"2025-07-31T21:49:20Z","snapshot_observed_at":"2026-08-09T00:27:39.697134Z","submitted_at":"2025-07-31T21:49:20Z","title":"EMA Without the Lag: Bias-Corrected Iterate Averaging Schemes","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-06T10:23:51.098062Z"},"links":{"cited_paper":"/paper/1804.07612","citing_paper":"/paper/2508.00180"},"observation_digest":"sha256:3629702718a8628640e1084b6b9a3eeb644ebfb16a5efb8e736b0962f88d667f","observation_id":"6d91ba18-c107-4815-8ff2-1f4b5fa364c7","resolution":{"observed_at":"2026-08-06T10:23:51.098062Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:23:52.467721Z","title":"Scaling data-constrained language models","venue":null,"work_id":"07a09b87-4782-4812-819d-dc7345434ecb","year":2023},"citing_paper":{"arxiv_id":"2508.00180","last_updated":"2025-07-31T21:49:20Z","snapshot_observed_at":"2026-08-09T00:27:39.697134Z","submitted_at":"2025-07-31T21:49:20Z","title":"EMA Without the Lag: Bias-Corrected Iterate Averaging Schemes","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-06T10:23:51.144262Z"},"links":{"citing_paper":"/paper/2508.00180"},"observation_digest":"sha256:a8cf54ed01d5d471b566a768d30693e079974a8f730e99d2111d5fb0abff2379","observation_id":"0c8c19e7-d57e-4c68-b2db-ed8c2d61560a","resolution":{"observed_at":"2026-08-06T10:23:52.471882Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:23:52.458830Z","title":"Smoothing data with faster moving averages","venue":null,"work_id":"ae8470f1-d2e7-42fa-b7f5-7dcdf1e76fff","year":1994},"citing_paper":{"arxiv_id":"2508.00180","last_updated":"2025-07-31T21:49:20Z","snapshot_observed_at":"2026-08-09T00:27:39.697134Z","submitted_at":"2025-07-31T21:49:20Z","title":"EMA Without the Lag: Bias-Corrected Iterate Averaging Schemes","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-06T10:23:51.198764Z"},"links":{"citing_paper":"/paper/2508.00180"},"observation_digest":"sha256:864d2b4366cf11b89fa9cc492b3c38ea58a625b5043a205a852b02e847f46943","observation_id":"20f73c62-3c1d-4e41-b91a-35c3b02ad8bf","resolution":{"observed_at":"2026-08-06T10:23:52.461579Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:23:51.248593Z","title":"Introductory lectures on convex optimization: A basic course, volume 87","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2508.00180","last_updated":"2025-07-31T21:49:20Z","snapshot_observed_at":"2026-08-09T00:27:39.697134Z","submitted_at":"2025-07-31T21:49:20Z","title":"EMA Without the Lag: Bias-Corrected Iterate Averaging Schemes","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-06T10:23:51.248593Z"},"links":{"citing_paper":"/paper/2508.00180"},"observation_digest":"sha256:f4334831873be2ab5b755c04690be85356c25422fb57c109cdc0a9f2a8e833e8","observation_id":"bc56b3ed-8cf8-43b1-a2bb-ef7d4ee063bc","resolution":{"observed_at":"2026-08-06T10:23:51.248593Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.03137","last_updated":"2024-09-27T18:31:02Z","snapshot_observed_at":"2026-08-15T01:00:48.691168Z","submitted_at":"2024-09-05T00:13:16Z","title":"The AdEMAMix Optimizer: Better, Faster, Older","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.03137","snapshot_observed_at":"2026-08-06T10:23:51.290978Z","title":"The ademamix optimizer: Better, faster, older","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.00180","last_updated":"2025-07-31T21:49:20Z","snapshot_observed_at":"2026-08-09T00:27:39.697134Z","submitted_at":"2025-07-31T21:49:20Z","title":"EMA Without the Lag: Bias-Corrected Iterate Averaging Schemes","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-06T10:23:51.290978Z"},"links":{"cited_paper":"/paper/2409.03137","citing_paper":"/paper/2508.00180"},"observation_digest":"sha256:429d0ded2cd559d8258c3a85ccc7250b7d075f57c171c3843eaf2867afb574fd","observation_id":"2c4a8d23-c44c-4622-a190-d8c2f52971b7","resolution":{"observed_at":"2026-08-06T10:23:51.290978Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:23:51.355993Z","title":"Acceleration of stochastic approximation by averaging","venue":null,"work_id":null,"year":1992},"citing_paper":{"arxiv_id":"2508.00180","last_updated":"2025-07-31T21:49:20Z","snapshot_observed_at":"2026-08-09T00:27:39.697134Z","submitted_at":"2025-07-31T21:49:20Z","title":"EMA Without the Lag: Bias-Corrected Iterate Averaging Schemes","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-06T10:23:51.355993Z"},"links":{"citing_paper":"/paper/2508.00180"},"observation_digest":"sha256:1b9e3495574ff5fd97970d75a2d2856fb66b21d9ea7c63d7c0dbe71b357c828d","observation_id":"903ef485-a89c-4c09-a73f-5d0fed6b6d38","resolution":{"observed_at":"2026-08-06T10:23:51.355993Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:23:52.439265Z","title":"Early stopping-but when? In Neural Networks: Tricks of the trade, pages 55--69","venue":null,"work_id":"2a7de958-8d4b-4ec1-bbdb-f908ee499c80","year":2002},"citing_paper":{"arxiv_id":"2508.00180","last_updated":"2025-07-31T21:49:20Z","snapshot_observed_at":"2026-08-09T00:27:39.697134Z","submitted_at":"2025-07-31T21:49:20Z","title":"EMA Without the Lag: Bias-Corrected Iterate Averaging Schemes","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-06T10:23:51.405126Z"},"links":{"citing_paper":"/paper/2508.00180"},"observation_digest":"sha256:b5134f839a784245e5e90e0986c4804b25fb8e8f3c3ed4a53277f0087359fc8f","observation_id":"f677e7bf-abe4-4933-aff1-388584f22d12","resolution":{"observed_at":"2026-08-06T10:23:52.442277Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:23:52.430578Z","title":"Non-convex learning via stochastic gradient langevin dynamics: a nonasymptotic analysis","venue":null,"work_id":"a81594b4-6b1c-4b9a-af8b-9e0e586314e8","year":2017},"citing_paper":{"arxiv_id":"2508.00180","last_updated":"2025-07-31T21:49:20Z","snapshot_observed_at":"2026-08-09T00:27:39.697134Z","submitted_at":"2025-07-31T21:49:20Z","title":"EMA Without the Lag: Bias-Corrected Iterate Averaging Schemes","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-06T10:23:51.485496Z"},"links":{"citing_paper":"/paper/2508.00180"},"observation_digest":"sha256:f1ecac0918dcd82d3bf03aa2ece6fd8531814efaee007bc2798722c9145f764a","observation_id":"2be369ba-6019-4b73-b08c-5dbffc90b2f0","resolution":{"observed_at":"2026-08-06T10:23:52.433596Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:23:52.421178Z","title":"Breaking the data barrier: a review of deep learning techniques for democratizing ai with small datasets","venue":null,"work_id":"c4dd6502-4de6-45f4-bbee-aea07bd4ce42","year":2024},"citing_paper":{"arxiv_id":"2508.00180","last_updated":"2025-07-31T21:49:20Z","snapshot_observed_at":"2026-08-09T00:27:39.697134Z","submitted_at":"2025-07-31T21:49:20Z","title":"EMA Without the Lag: Bias-Corrected Iterate Averaging Schemes","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-06T10:23:51.560773Z"},"links":{"citing_paper":"/paper/2508.00180"},"observation_digest":"sha256:3844be50e14d181db494f381c9a1f37775f7ae25ac1e36ba2c75d63ca56a9898","observation_id":"0701a113-76b3-454d-b5fa-9eb10308df36","resolution":{"observed_at":"2026-08-06T10:23:52.424548Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:23:51.615896Z","title":"A stochastic approximation method","venue":null,"work_id":null,"year":1951},"citing_paper":{"arxiv_id":"2508.00180","last_updated":"2025-07-31T21:49:20Z","snapshot_observed_at":"2026-08-09T00:27:39.697134Z","submitted_at":"2025-07-31T21:49:20Z","title":"EMA Without the Lag: Bias-Corrected Iterate Averaging Schemes","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-06T10:23:51.615896Z"},"links":{"citing_paper":"/paper/2508.00180"},"observation_digest":"sha256:22b13281ef1cca84821a8c5adaec9ea01fe406df3e8e71906441fa8aeda75a2e","observation_id":"2992878c-c911-417e-820b-29eedb5144d3","resolution":{"observed_at":"2026-08-06T10:23:51.615896Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.12465","last_updated":"2025-02-18T02:52:00Z","snapshot_observed_at":"2026-08-10T12:47:20.234703Z","submitted_at":"2025-02-18T02:52:00Z","title":"Computational-Statistical Tradeoffs at the Next-Token Prediction Barrier: Autoregressive and Imitation Learning under Misspecification","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.12465","snapshot_observed_at":"2026-08-06T10:23:51.683656Z","title":"Computational-statistical tradeoffs at the next-token prediction barrier: Autoregressive and imitation learning under misspecification","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.00180","last_updated":"2025-07-31T21:49:20Z","snapshot_observed_at":"2026-08-09T00:27:39.697134Z","submitted_at":"2025-07-31T21:49:20Z","title":"EMA Without the Lag: Bias-Corrected Iterate Averaging Schemes","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-06T10:23:51.683656Z"},"links":{"cited_paper":"/paper/2502.12465","citing_paper":"/paper/2508.00180"},"observation_digest":"sha256:8d73502413be6417f44bbe656ddd87da6b63375a54cd800e8300fc63b22dd167","observation_id":"78351fb6-0bc2-4d51-b568-5f4c6915fac4","resolution":{"observed_at":"2026-08-06T10:23:51.683656Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:23:51.748205Z","title":"Efficient reductions for imitation learning","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2508.00180","last_updated":"2025-07-31T21:49:20Z","snapshot_observed_at":"2026-08-09T00:27:39.697134Z","submitted_at":"2025-07-31T21:49:20Z","title":"EMA Without the Lag: Bias-Corrected Iterate Averaging Schemes","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-06T10:23:51.748205Z"},"links":{"citing_paper":"/paper/2508.00180"},"observation_digest":"sha256:532a4365de79c37a916cacd3ebb7b3b37155bced0e415ea26d1cd1fd8a6a8ffb","observation_id":"aa313c8a-d8d0-4e06-a8a6-aee62b6b93d6","resolution":{"observed_at":"2026-08-06T10:23:51.748205Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:23:51.794840Z","title":"A reduction of imitation learning and structured prediction to no-regret online learning","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2508.00180","last_updated":"2025-07-31T21:49:20Z","snapshot_observed_at":"2026-08-09T00:27:39.697134Z","submitted_at":"2025-07-31T21:49:20Z","title":"EMA Without the Lag: Bias-Corrected Iterate Averaging Schemes","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-06T10:23:51.794840Z"},"links":{"citing_paper":"/paper/2508.00180"},"observation_digest":"sha256:4a9e5a1cf5f9c357ce3f7d23974e14d0808f74f574d94de5602252a83a641c9e","observation_id":"b6c21b4a-dfc1-47d9-af30-0012d76567e7","resolution":{"observed_at":"2026-08-06T10:23:51.794840Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:23:51.859645Z","title":"Efficient estimations from a slowly convergent robbins-monro process","venue":null,"work_id":null,"year":1988},"citing_paper":{"arxiv_id":"2508.00180","last_updated":"2025-07-31T21:49:20Z","snapshot_observed_at":"2026-08-09T00:27:39.697134Z","submitted_at":"2025-07-31T21:49:20Z","title":"EMA Without the Lag: Bias-Corrected Iterate Averaging Schemes","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-06T10:23:51.859645Z"},"links":{"citing_paper":"/paper/2508.00180"},"observation_digest":"sha256:c23b60bde08b733e740cfe99e6f64432a4bbc2ab5e2c3d61a55b16d7556ae668","observation_id":"c787143b-5a90-431d-8842-6c8a82b87ebf","resolution":{"observed_at":"2026-08-06T10:23:51.859645Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.02312","last_updated":"2023-02-01T07:08:58Z","snapshot_observed_at":"2026-08-14T23:56:28.315260Z","submitted_at":"2023-01-05T21:58:46Z","title":"Training trajectories, mini-batch losses and the curious role of the learning rate","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.02312","snapshot_observed_at":"2026-08-06T10:23:51.923341Z","title":"Training trajectories, mini-batch losses and the curious role of the learning rate","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.00180","last_updated":"2025-07-31T21:49:20Z","snapshot_observed_at":"2026-08-09T00:27:39.697134Z","submitted_at":"2025-07-31T21:49:20Z","title":"EMA Without the Lag: Bias-Corrected Iterate Averaging Schemes","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-06T10:23:51.923341Z"},"links":{"cited_paper":"/paper/2301.02312","citing_paper":"/paper/2508.00180"},"observation_digest":"sha256:e793224cc31a1205d3fe7e23e098523604afe931d731ecf84c7c0fcd5e270c73","observation_id":"8a87a096-54f8-4fa8-9708-00f1012e76a9","resolution":{"observed_at":"2026-08-06T10:23:51.923341Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:23:52.390136Z","title":"Minimizing finite sums with the stochastic average gradient","venue":null,"work_id":"7ed90fd9-fbee-435b-b6e8-4a07ed75f01b","year":2017},"citing_paper":{"arxiv_id":"2508.00180","last_updated":"2025-07-31T21:49:20Z","snapshot_observed_at":"2026-08-09T00:27:39.697134Z","submitted_at":"2025-07-31T21:49:20Z","title":"EMA Without the Lag: Bias-Corrected Iterate Averaging Schemes","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-06T10:23:51.987485Z"},"links":{"citing_paper":"/paper/2508.00180"},"observation_digest":"sha256:e634731c09a4fc6b5edd8d0afa50c6bd644d5d951677fa51d53c4a58fe9b4e18","observation_id":"cbe8cf81-2aef-45e3-8691-11425c434cd4","resolution":{"observed_at":"2026-08-06T10:23:52.393897Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-06T10:23:51.990831Z","title":"Deepseekmath: Pushing the limits of mathematical reasoning in open language models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.00180","last_updated":"2025-07-31T21:49:20Z","snapshot_observed_at":"2026-08-09T00:27:39.697134Z","submitted_at":"2025-07-31T21:49:20Z","title":"EMA Without the Lag: Bias-Corrected Iterate Averaging Schemes","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-06T10:23:51.990831Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2508.00180"},"observation_digest":"sha256:6ff8eebfd019ee85a1da81b92d62ec41c3515b6a837ef95b7e768bd366fd8819","observation_id":"f8128de6-fac8-49a3-8b6f-0d8fac1217cd","resolution":{"observed_at":"2026-08-06T10:23:51.990831Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:23:52.381930Z","title":"Super-convergence: Very fast training of neural networks using large learning rates","venue":null,"work_id":"d0e90021-dc0f-4869-a6b9-5f677488cd50","year":2019},"citing_paper":{"arxiv_id":"2508.00180","last_updated":"2025-07-31T21:49:20Z","snapshot_observed_at":"2026-08-09T00:27:39.697134Z","submitted_at":"2025-07-31T21:49:20Z","title":"EMA Without the Lag: Bias-Corrected Iterate Averaging Schemes","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-06T10:23:51.993904Z"},"links":{"citing_paper":"/paper/2508.00180"},"observation_digest":"sha256:f2dd9506d878a5ab03dd06dac7364099894dea2fb7217df34ce826a6dd459360","observation_id":"0aba7616-5249-4866-8dd2-021dbb866380","resolution":{"observed_at":"2026-08-06T10:23:52.384775Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10671","last_updated":"2024-09-10T13:25:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-15T12:35:42Z","title":"Qwen2 Technical Report","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10671","snapshot_observed_at":"2026-08-06T10:23:51.996778Z","title":"Qwen2 technical report","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.00180","last_updated":"2025-07-31T21:49:20Z","snapshot_observed_at":"2026-08-09T00:27:39.697134Z","submitted_at":"2025-07-31T21:49:20Z","title":"EMA Without the Lag: Bias-Corrected Iterate Averaging Schemes","version":1},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-06T10:23:51.996778Z"},"links":{"cited_paper":"/paper/2407.10671","citing_paper":"/paper/2508.00180"},"observation_digest":"sha256:54a97b83618d1361919a112534d69b45efaf510a7d5ca2d6c7cd23de7be15ce3","observation_id":"543628a2-0b7b-4f9d-9b0b-1d21292efd3a","resolution":{"observed_at":"2026-08-06T10:23:51.996778Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:23:52.373221Z","title":"The calculus of variations","venue":null,"work_id":"ef9dee4c-e54f-4d0d-9d8b-bb90c26cedf4","year":2004},"citing_paper":{"arxiv_id":"2508.00180","last_updated":"2025-07-31T21:49:20Z","snapshot_observed_at":"2026-08-09T00:27:39.697134Z","submitted_at":"2025-07-31T21:49:20Z","title":"EMA Without the Lag: Bias-Corrected Iterate Averaging Schemes","version":1},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-06T10:23:52.000058Z"},"links":{"citing_paper":"/paper/2508.00180"},"observation_digest":"sha256:defcd42c660408f4910184acd97863c7fa7ed5e8520646d69388523f0d27a333","observation_id":"38f0b125-781e-485d-97f1-451cb290f238","resolution":{"observed_at":"2026-08-06T10:23:52.376386Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:23:52.363818Z","title":"Position: Will we run out of data? limits of llm scaling based on human-generated data","venue":null,"work_id":"ad6fbd5f-5a7d-41d8-9384-243b5d92e2ef","year":2024},"citing_paper":{"arxiv_id":"2508.00180","last_updated":"2025-07-31T21:49:20Z","snapshot_observed_at":"2026-08-09T00:27:39.697134Z","submitted_at":"2025-07-31T21:49:20Z","title":"EMA Without the Lag: Bias-Corrected Iterate Averaging Schemes","version":1},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-06T10:23:52.002693Z"},"links":{"citing_paper":"/paper/2508.00180"},"observation_digest":"sha256:29dcc5a736931ddaa84728ba99a04aef32d65439f01a80e943b916216ab2f193","observation_id":"49c508b4-ce11-4e0d-991f-627df44efe78","resolution":{"observed_at":"2026-08-06T10:23:52.367049Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:23:52.005485Z","title":"Trl: Transformer reinforcement learning","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2508.00180","last_updated":"2025-07-31T21:49:20Z","snapshot_observed_at":"2026-08-09T00:27:39.697134Z","submitted_at":"2025-07-31T21:49:20Z","title":"EMA Without the Lag: Bias-Corrected Iterate Averaging Schemes","version":1},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-08-06T10:23:52.005485Z"},"links":{"citing_paper":"/paper/2508.00180"},"observation_digest":"sha256:1300ff6ff9a36f5247e2495d7614b9937b868e2260ff0e88901f4d933583e354","observation_id":"06956e02-6b0b-4a44-a0a3-53510cf559dd","resolution":{"observed_at":"2026-08-06T10:23:52.005485Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.11321","last_updated":"2025-01-31T18:52:42Z","snapshot_observed_at":"2026-08-15T04:58:58.957938Z","submitted_at":"2024-09-17T16:18:05Z","title":"SOAP: Improving and Stabilizing Shampoo using Adam","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.11321","snapshot_observed_at":"2026-08-06T10:23:52.008343Z","title":"Soap: Improving and stabilizing shampoo using adam","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.00180","last_updated":"2025-07-31T21:49:20Z","snapshot_observed_at":"2026-08-09T00:27:39.697134Z","submitted_at":"2025-07-31T21:49:20Z","title":"EMA Without the Lag: Bias-Corrected Iterate Averaging Schemes","version":1},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-08-06T10:23:52.008343Z"},"links":{"cited_paper":"/paper/2409.11321","citing_paper":"/paper/2508.00180"},"observation_digest":"sha256:c7ef6c64ef33a90b046c39c34cf62fef76ee81c3976982f98f5fe69b708a9ed9","observation_id":"5546061b-d571-40d7-bca1-0c66a26c29b5","resolution":{"observed_at":"2026-08-06T10:23:52.008343Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:23:52.011334Z","title":"Superglue: A stickier benchmark for general-purpose language understanding systems","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2508.00180","last_updated":"2025-07-31T21:49:20Z","snapshot_observed_at":"2026-08-09T00:27:39.697134Z","submitted_at":"2025-07-31T21:49:20Z","title":"EMA Without the Lag: Bias-Corrected Iterate Averaging Schemes","version":1},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-08-06T10:23:52.011334Z"},"links":{"citing_paper":"/paper/2508.00180"},"observation_digest":"sha256:bc7d7a3c43a768faa37282782cd80b28ac38354da792a1c4dbda497c611db3ff","observation_id":"49120fe7-4a2a-405e-88dd-11a465f3e2d1","resolution":{"observed_at":"2026-08-06T10:23:52.011334Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:23:52.344590Z","title":"ema-pytorch: A simple way to keep track of an exponential moving average (ema) version of your pytorch model","venue":null,"work_id":"d785352d-b3ed-4baa-8fcd-c1ccb060f572","year":2024},"citing_paper":{"arxiv_id":"2508.00180","last_updated":"2025-07-31T21:49:20Z","snapshot_observed_at":"2026-08-09T00:27:39.697134Z","submitted_at":"2025-07-31T21:49:20Z","title":"EMA Without the Lag: Bias-Corrected Iterate Averaging Schemes","version":1},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-08-06T10:23:52.014564Z"},"links":{"citing_paper":"/paper/2508.00180"},"observation_digest":"sha256:30fcb3492981d8c09baa772b6474bb7ca831e333cc598ab40511d389ee2dfe25","observation_id":"58e3edb6-777e-47a0-b3a9-3d29950c1ede","resolution":{"observed_at":"2026-08-06T10:23:52.347595Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:23:52.017038Z","title":"Chain-of-thought prompting elicits reasoning in large language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.00180","last_updated":"2025-07-31T21:49:20Z","snapshot_observed_at":"2026-08-09T00:27:39.697134Z","submitted_at":"2025-07-31T21:49:20Z","title":"EMA Without the Lag: Bias-Corrected Iterate Averaging Schemes","version":1},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-08-06T10:23:52.017038Z"},"links":{"citing_paper":"/paper/2508.00180"},"observation_digest":"sha256:c1599319d8ed0886136393e6baac8ebd7c49dac93acf06f266afa9ebaa97d74e","observation_id":"62e13964-feeb-487e-83ed-eef21cfeb3f8","resolution":{"observed_at":"2026-08-06T10:23:52.017038Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:23:52.329438Z","title":"The large-sample distribution of the likelihood ratio for testing composite hypotheses","venue":null,"work_id":"3eda07d0-76e0-4b11-b625-8013e1a7863c","year":1938},"citing_paper":{"arxiv_id":"2508.00180","last_updated":"2025-07-31T21:49:20Z","snapshot_observed_at":"2026-08-09T00:27:39.697134Z","submitted_at":"2025-07-31T21:49:20Z","title":"EMA Without the Lag: Bias-Corrected Iterate Averaging Schemes","version":1},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-08-06T10:23:52.019789Z"},"links":{"citing_paper":"/paper/2508.00180"},"observation_digest":"sha256:c70b2639900923b11f46c9873b9534d196eaf5566037823a4d725d5e172444e5","observation_id":"f8442a29-4453-4dc7-8b4c-e7fde02af4a7","resolution":{"observed_at":"2026-08-06T10:23:52.332725Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.03771","last_updated":"2020-07-14T03:42:34Z","snapshot_observed_at":"2026-07-06T08:27:58.343233Z","submitted_at":"2019-10-09T03:23:22Z","title":"HuggingFace's Transformers: State-of-the-art Natural Language Processing","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.03771","snapshot_observed_at":"2026-08-06T10:23:52.022460Z","title":"Huggingface's transformers: State-of-the-art natural language processing","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2508.00180","last_updated":"2025-07-31T21:49:20Z","snapshot_observed_at":"2026-08-09T00:27:39.697134Z","submitted_at":"2025-07-31T21:49:20Z","title":"EMA Without the Lag: Bias-Corrected Iterate Averaging Schemes","version":1},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-08-06T10:23:52.022460Z"},"links":{"cited_paper":"/paper/1910.03771","citing_paper":"/paper/2508.00180"},"observation_digest":"sha256:15c5886ad6f5bea5f61dbdd87519c3bac8ec47e682a00a1df4b61eda183edb87","observation_id":"be69d861-2136-41e0-9408-812959c91b77","resolution":{"observed_at":"2026-08-06T10:23:52.022460Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:23:52.320462Z","title":"On early stopping in gradient descent learning","venue":null,"work_id":"64401181-a62d-4366-b577-679b2095417f","year":2007},"citing_paper":{"arxiv_id":"2508.00180","last_updated":"2025-07-31T21:49:20Z","snapshot_observed_at":"2026-08-09T00:27:39.697134Z","submitted_at":"2025-07-31T21:49:20Z","title":"EMA Without the Lag: Bias-Corrected Iterate Averaging Schemes","version":1},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-08-06T10:23:52.025357Z"},"links":{"citing_paper":"/paper/2508.00180"},"observation_digest":"sha256:b5997819455bfe8416ce1ed488b6c0388587adc49b91d6944a412dae4da072f3","observation_id":"a1d1c380-9e97-4495-84a3-df5afbb5e8af","resolution":{"observed_at":"2026-08-06T10:23:52.323689Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:23:52.311131Z","title":"Which algorithmic choices matter at which batch sizes? insights from a noisy quadratic model","venue":null,"work_id":"f2caf806-0912-4e0b-99c7-22c4d5e8109f","year":2019},"citing_paper":{"arxiv_id":"2508.00180","last_updated":"2025-07-31T21:49:20Z","snapshot_observed_at":"2026-08-09T00:27:39.697134Z","submitted_at":"2025-07-31T21:49:20Z","title":"EMA Without the Lag: Bias-Corrected Iterate Averaging Schemes","version":1},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-08-06T10:23:52.028226Z"},"links":{"citing_paper":"/paper/2508.00180"},"observation_digest":"sha256:e3ec33ca22bbed21a32ca234874d1d8bc2d2bc26603ac703d1ddb8a942729d75","observation_id":"cef1f308-1976-48a3-8571-c6680040d92a","resolution":{"observed_at":"2026-08-06T10:23:52.314284Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21676","last_updated":"2025-04-21T04:19:56Z","snapshot_observed_at":"2026-08-14T23:56:27.148203Z","submitted_at":"2024-10-29T02:54:06Z","title":"How Does Critical Batch Size Scale in Pre-training?","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21676","snapshot_observed_at":"2026-08-06T10:23:52.031002Z","title":"How does critical batch size scale in pre-training? arXiv preprint arXiv:2410.21676, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.00180","last_updated":"2025-07-31T21:49:20Z","snapshot_observed_at":"2026-08-09T00:27:39.697134Z","submitted_at":"2025-07-31T21:49:20Z","title":"EMA Without the Lag: Bias-Corrected Iterate Averaging Schemes","version":1},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-08-06T10:23:52.031002Z"},"links":{"cited_paper":"/paper/2410.21676","citing_paper":"/paper/2508.00180"},"observation_digest":"sha256:091f6c5242ff02c1afdb0a92bddfa80e26be4adf6527714a5d5fa4e4e00fa646","observation_id":"31cb124b-8863-4e1e-92e1-f0b93d1a78dd","resolution":{"observed_at":"2026-08-06T10:23:52.031002Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:23:52.299052Z","title":"Parameter identification for fractional ornstein--uhlenbeck processes based on discrete observation","venue":null,"work_id":"b6297df8-c8ee-4da3-aa79-a758e6dea00f","year":2014},"citing_paper":{"arxiv_id":"2508.00180","last_updated":"2025-07-31T21:49:20Z","snapshot_observed_at":"2026-08-09T00:27:39.697134Z","submitted_at":"2025-07-31T21:49:20Z","title":"EMA Without the Lag: Bias-Corrected Iterate Averaging Schemes","version":1},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-08-06T10:23:52.034082Z"},"links":{"citing_paper":"/paper/2508.00180"},"observation_digest":"sha256:e91601b40c26849e93d5dc44f5b1b45ca1edfdb7b207e82a3ad53022e1a0f00e","observation_id":"18f89d3e-88e6-4ce6-b4be-7b8479fc860d","resolution":{"observed_at":"2026-08-06T10:23:52.304477Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:23:52.037279Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.00180","last_updated":"2025-07-31T21:49:20Z","snapshot_observed_at":"2026-08-09T00:27:39.697134Z","submitted_at":"2025-07-31T21:49:20Z","title":"EMA Without the Lag: Bias-Corrected Iterate Averaging Schemes","version":1},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-08-06T10:23:52.037279Z"},"links":{"citing_paper":"/paper/2508.00180"},"observation_digest":"sha256:83906a236fc5913152e3c29a1344d5bc5971c6efe97757e0dd58a693863092c7","observation_id":"203f65ac-9dcb-4883-b707-fd0aed7e2406","resolution":{"observed_at":"2026-08-06T10:23:52.037279Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2508.00180","last_updated":"2025-07-31T21:49:20Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-09T00:27:39.697134Z","submitted_at":"2025-07-31T21:49:20Z","title":"EMA Without the Lag: Bias-Corrected Iterate Averaging Schemes"},"reference_resolution":{"displayed":83,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":50,"verified_exact":0,"verified_fuzzy":33},"total_outbound_references":83},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 83 of 83 outbound references and 2 inbound Pith citation observations for arXiv:2508.00180."}