{"as_of":"2026-08-16T11:33:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:38ba81aa1bd45fb0ea3a64d49c4dbc8750282d4f83b8065855e9b1bbfa970931","coverage":[{"denominator":22,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":22,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T11:32:04.384284Z","state":"measured"},{"denominator":32,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":32,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":10,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":10,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-14T04:27:56.628221Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-25T05:40:24.372091Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.02285","last_updated":"2025-06-09T22:08:17Z","snapshot_observed_at":"2026-08-14T08:48:49.903804Z","submitted_at":"2025-06-02T21:51:04Z","title":"Why Gradients Rapidly Increase Near the End of Training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.02285","snapshot_observed_at":"2026-08-04T12:38:53.777630Z","title":"Why gradients rapidly increase near the end of training","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.03164","last_updated":"2026-06-28T16:14:54Z","snapshot_observed_at":"2026-08-14T12:29:49.923863Z","submitted_at":"2025-10-03T16:35:56Z","title":"Why Do We Need Warm-up? A Theoretical Perspective","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-04T12:38:53.777630Z"},"links":{"cited_paper":"/paper/2506.02285","citing_paper":"/paper/2510.03164"},"observation_digest":"sha256:9ced6623c15037d34ee809dbf7793fe92642c643acc6ab261b1a6eb0db4f730c","observation_id":"57c806d0-96f4-4a92-99f6-aedbce155fcc","resolution":{"observed_at":"2026-08-04T12:38:53.777630Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.02285","last_updated":"2025-06-09T22:08:17Z","snapshot_observed_at":"2026-08-14T08:48:49.903804Z","submitted_at":"2025-06-02T21:51:04Z","title":"Why Gradients Rapidly Increase Near the End of Training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.02285","snapshot_observed_at":"2026-08-03T19:10:48.092792Z","title":"Why gradients rapidly increase near the end of training.arXiv preprint arXiv:2506.02285,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.02342","last_updated":"2026-06-01T07:48:25Z","snapshot_observed_at":"2026-08-13T11:56:59.121415Z","submitted_at":"2025-12-02T02:24:32Z","title":"Safeguarded Stochastic Polyak Step Sizes for Non-smooth Optimization: Robust Performance Without Small (Sub)Gradients","version":3},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-03T19:10:48.092792Z"},"links":{"cited_paper":"/paper/2506.02285","citing_paper":"/paper/2512.02342"},"observation_digest":"sha256:e8f31380f4333ad63d0b40e35da313179319162090358afe2a89739ed3ba710e","observation_id":"574e5e0b-156e-4985-8126-dcf919846b31","resolution":{"observed_at":"2026-08-03T19:10:48.092792Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.02285","last_updated":"2025-06-09T22:08:17Z","snapshot_observed_at":"2026-08-14T08:48:49.903804Z","submitted_at":"2025-06-02T21:51:04Z","title":"Why Gradients Rapidly Increase Near the End of Training","version":2},"cited_work":{"arxiv_id":"2506.02285","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.02285","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Why gradients rapidly increase near the end of training.arXiv preprint arXiv: 2506.02285","venue":null,"work_id":"d7d91978-0bbd-407c-b5ea-208029246d0d","year":2025},"citing_paper":{"arxiv_id":"2603.28743","last_updated":"2026-04-05T02:15:47Z","snapshot_observed_at":"2026-08-14T08:17:47.916907Z","submitted_at":"2026-03-30T17:51:47Z","title":"Rethinking Language Model Scaling under Transferable Hypersphere Optimization","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-14T21:51:14.678941Z"},"links":{"cited_paper":"/paper/2506.02285","citing_paper":"/paper/2603.28743"},"observation_digest":"sha256:ac284428281eb4a8f7ae504fa1ffca908b868731ceee646667257c6215017bd2","observation_id":"4f6d60b2-9096-4fc1-ae1f-5a2baabaab1e","resolution":{"observed_at":"2026-05-14T21:53:02.525835Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.02285","last_updated":"2025-06-09T22:08:17Z","snapshot_observed_at":"2026-08-14T08:48:49.903804Z","submitted_at":"2025-06-02T21:51:04Z","title":"Why Gradients Rapidly Increase Near the End of Training","version":2},"cited_work":{"arxiv_id":"2506.02285","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.02285","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Why gradients rapidly increase near the end of training.arXiv preprint arXiv: 2506.02285","venue":null,"work_id":"d7d91978-0bbd-407c-b5ea-208029246d0d","year":2025},"citing_paper":{"arxiv_id":"2604.13483","last_updated":"2026-04-15T05:14:45Z","snapshot_observed_at":"2026-07-06T23:01:28.082506Z","submitted_at":"2026-04-15T05:14:45Z","title":"Broximal Alignment for Global Non-Convex Optimization","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-10T12:57:52.201675Z"},"links":{"cited_paper":"/paper/2506.02285","citing_paper":"/paper/2604.13483"},"observation_digest":"sha256:e9caeaef822d1a56b4aaec5c854d2c015c8908d43820e245a7ddf70fbef3ea39","observation_id":"f0d07f9d-136b-4fa3-8284-a26bcbc926ab","resolution":{"observed_at":"2026-05-10T13:00:24.674807Z","resolver_source":"arxiv_id","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.02285","last_updated":"2025-06-09T22:08:17Z","snapshot_observed_at":"2026-08-14T08:48:49.903804Z","submitted_at":"2025-06-02T21:51:04Z","title":"Why Gradients Rapidly Increase Near the End of Training","version":2},"cited_work":{"arxiv_id":"2506.02285","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.02285","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Why gradients rapidly increase near the end of training.arXiv preprint arXiv: 2506.02285","venue":null,"work_id":"d7d91978-0bbd-407c-b5ea-208029246d0d","year":2025},"citing_paper":{"arxiv_id":"2605.04418","last_updated":"2026-05-06T02:22:06Z","snapshot_observed_at":"2026-08-15T03:40:21.944750Z","submitted_at":"2026-05-06T02:22:06Z","title":"Demystifying Manifold Constraints in LLM Pre-training","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-08T17:44:44.438637Z"},"links":{"cited_paper":"/paper/2506.02285","citing_paper":"/paper/2605.04418"},"observation_digest":"sha256:eb0c46e21f63cf851e0e4da5ffa7579513dd966cf66d2529b679f6955ae21989","observation_id":"366a7266-7668-49cf-a79c-f180b3c32392","resolution":{"observed_at":"2026-05-11T17:16:08.661283Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.02285","last_updated":"2025-06-09T22:08:17Z","snapshot_observed_at":"2026-08-14T08:48:49.903804Z","submitted_at":"2025-06-02T21:51:04Z","title":"Why Gradients Rapidly Increase Near the End of Training","version":2},"cited_work":{"arxiv_id":"2506.02285","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.02285","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Why gradients rapidly increase near the end of training.arXiv preprint arXiv: 2506.02285","venue":null,"work_id":"d7d91978-0bbd-407c-b5ea-208029246d0d","year":2025},"citing_paper":{"arxiv_id":"2605.06654","last_updated":"2026-05-07T17:57:02Z","snapshot_observed_at":"2026-08-14T17:08:26.107852Z","submitted_at":"2026-05-07T17:57:02Z","title":"Optimizer-Model Consistency: Full Finetuning with the Same Optimizer as Pretraining Forgets Less","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-08T12:00:49.127471Z"},"links":{"cited_paper":"/paper/2506.02285","citing_paper":"/paper/2605.06654"},"observation_digest":"sha256:053227338efc97b058603d88fabb44426dc4dce08d2add1fdf4a3be3031238da","observation_id":"2c37b115-b48a-4f6b-83e9-cfa5e1166495","resolution":{"observed_at":"2026-05-11T19:26:08.465260Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.02285","last_updated":"2025-06-09T22:08:17Z","snapshot_observed_at":"2026-08-14T08:48:49.903804Z","submitted_at":"2025-06-02T21:51:04Z","title":"Why Gradients Rapidly Increase Near the End of Training","version":2},"cited_work":{"arxiv_id":"2506.02285","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.02285","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Why gradients rapidly increase near the end of training.arXiv preprint arXiv: 2506.02285","venue":null,"work_id":"d7d91978-0bbd-407c-b5ea-208029246d0d","year":2025},"citing_paper":{"arxiv_id":"2605.23061","last_updated":"2026-05-21T21:50:22Z","snapshot_observed_at":"2026-08-02T04:10:09.683333Z","submitted_at":"2026-05-21T21:50:22Z","title":"Anytime Training with Schedule-Free Spectral Optimization","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-05-25T05:38:16.958574Z"},"links":{"cited_paper":"/paper/2506.02285","citing_paper":"/paper/2605.23061"},"observation_digest":"sha256:103c9111fda8da59aa55d62c610d8166d3a3b8314356a5819f6972b9ced3a829","observation_id":"41ab2342-e1d9-4e23-96d5-104b291b08d0","resolution":{"observed_at":"2026-05-25T05:40:24.375625Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.02285","last_updated":"2025-06-09T22:08:17Z","snapshot_observed_at":"2026-08-14T08:48:49.903804Z","submitted_at":"2025-06-02T21:51:04Z","title":"Why Gradients Rapidly Increase Near the End of Training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.02285","snapshot_observed_at":"2026-07-11T22:10:49.683444Z","title":"Why gradients rapidly increase near the end of training.arXiv preprint arXiv:2506.02285, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04033","last_updated":"2026-07-04T21:27:05Z","snapshot_observed_at":"2026-08-07T05:07:10.107694Z","submitted_at":"2026-07-04T21:27:05Z","title":"OmniOpt: Taxonomy, Geometry, and Benchmarking of Modern Optimizers","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-11T22:10:49.683444Z"},"links":{"cited_paper":"/paper/2506.02285","citing_paper":"/paper/2607.04033"},"observation_digest":"sha256:ca7579b5ec9d1064118de9746a5ec9d527b02148a090504183def014f6f9c316","observation_id":"75168a28-59d3-473b-a6c4-d52b80b9be66","resolution":{"observed_at":"2026-07-11T22:10:49.683444Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.02285","last_updated":"2025-06-09T22:08:17Z","snapshot_observed_at":"2026-08-14T08:48:49.903804Z","submitted_at":"2025-06-02T21:51:04Z","title":"Why Gradients Rapidly Increase Near the End of Training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.02285","snapshot_observed_at":"2026-07-30T12:53:40.954445Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23777","last_updated":"2026-07-26T17:55:40Z","snapshot_observed_at":"2026-07-30T23:56:43.497541Z","submitted_at":"2026-07-26T17:55:40Z","title":"Scale Weight Decay and Train Better","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-30T12:53:40.954445Z"},"links":{"cited_paper":"/paper/2506.02285","citing_paper":"/paper/2607.23777"},"observation_digest":"sha256:f3be84eb93919ab4398673e9ac786927e96a6ab3ba52a54c8e64ca418ad9a52a","observation_id":"cf743017-35ec-4b6e-a066-38f82f0bb173","resolution":{"observed_at":"2026-07-30T12:53:40.954445Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.02285","last_updated":"2025-06-09T22:08:17Z","snapshot_observed_at":"2026-08-14T08:48:49.903804Z","submitted_at":"2025-06-02T21:51:04Z","title":"Why Gradients Rapidly Increase Near the End of Training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.02285","snapshot_observed_at":"2026-08-14T04:27:56.628221Z","title":"arXiv preprint arXiv:2506.02285 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08888","last_updated":"2026-08-09T19:59:45Z","snapshot_observed_at":"2026-08-15T22:49:51.903904Z","submitted_at":"2026-08-09T19:59:45Z","title":"Full-bandwidth transformer","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-14T04:27:56.628221Z"},"links":{"cited_paper":"/paper/2506.02285","citing_paper":"/paper/2608.08888"},"observation_digest":"sha256:323bba50719ba3d8e609a6890b5bfe3f959aea941b52039506de12a013204a9a","observation_id":"adbc6f64-beda-4a03-9c7f-03f92a182b1a","resolution":{"observed_at":"2026-08-14T04:27:56.628221Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.02285/citation-record","integrity":"/paper/2506.02285/integrity","json":"/paper/2506.02285/citation-record.json","paper":"/paper/2506.02285"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"1607.06450","last_updated":"2016-07-21T19:57:52Z","snapshot_observed_at":"2026-08-15T04:53:45.483331Z","submitted_at":"2016-07-21T19:57:52Z","title":"Layer Normalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1607.06450","snapshot_observed_at":"2026-08-07T11:32:02.886552Z","title":"L., Kiros, J","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.02285","last_updated":"2025-06-09T22:08:17Z","snapshot_observed_at":"2026-08-14T08:48:49.903804Z","submitted_at":"2025-06-02T21:51:04Z","title":"Why Gradients Rapidly Increase Near the End of Training","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T11:32:02.886552Z"},"links":{"cited_paper":"/paper/1607.06450","citing_paper":"/paper/2506.02285"},"observation_digest":"sha256:f56356071bad579ec31fb5ebbeacb48f3843ab45f833e889e9a0bf075f4d7719","observation_id":"8667ed2e-7c56-4e37-a221-106fbab8bc69","resolution":{"observed_at":"2026-08-07T11:32:02.886552Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:32:06.465747Z","title":null,"venue":null,"work_id":"d156d2ea-81f8-4e22-a455-0e4f153559a0","year":2020},"citing_paper":{"arxiv_id":"2506.02285","last_updated":"2025-06-09T22:08:17Z","snapshot_observed_at":"2026-08-14T08:48:49.903804Z","submitted_at":"2025-06-02T21:51:04Z","title":"Why Gradients Rapidly Increase Near the End of Training","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T11:32:02.936151Z"},"links":{"citing_paper":"/paper/2506.02285"},"observation_digest":"sha256:ef85e53295cd2673ef80593e7858145d983150d128995fd6a8eaa04f918701f7","observation_id":"7672aa3e-7fed-494e-ab7b-b28e33ba24e4","resolution":{"observed_at":"2026-08-07T11:32:06.594928Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:32:06.282508Z","title":null,"venue":null,"work_id":"4ebee952-bd3b-4817-bfd7-e88e459faf80","year":2018},"citing_paper":{"arxiv_id":"2506.02285","last_updated":"2025-06-09T22:08:17Z","snapshot_observed_at":"2026-08-14T08:48:49.903804Z","submitted_at":"2025-06-02T21:51:04Z","title":"Why Gradients Rapidly Increase Near the End of Training","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T11:32:03.009411Z"},"links":{"citing_paper":"/paper/2506.02285"},"observation_digest":"sha256:d7fbe9c2aac416391ea1c25a86f00cf47adf93e83172fc970172e9ea2bf1764d","observation_id":"5531a407-aaf0-4ace-8ac2-0c91d91a7ef6","resolution":{"observed_at":"2026-08-07T11:32:06.390649Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:32:05.973185Z","title":null,"venue":null,"work_id":"91a1160e-4a91-4160-aadd-fd7aadb4aac9","year":2024},"citing_paper":{"arxiv_id":"2506.02285","last_updated":"2025-06-09T22:08:17Z","snapshot_observed_at":"2026-08-14T08:48:49.903804Z","submitted_at":"2025-06-02T21:51:04Z","title":"Why Gradients Rapidly Increase Near the End of Training","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T11:32:03.095688Z"},"links":{"citing_paper":"/paper/2506.02285"},"observation_digest":"sha256:abe6e4ab1d1311eeca32591f27ca50435b5d31645bdffeb79963ad21e9eb3f36","observation_id":"c6c93d21-9bbd-48e5-bd22-a63995c07b03","resolution":{"observed_at":"2026-08-07T11:32:06.122567Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:32:05.723520Z","title":"and Bottou, L","venue":null,"work_id":"0369bd2b-6f91-487f-ad07-63171e750189","year":2022},"citing_paper":{"arxiv_id":"2506.02285","last_updated":"2025-06-09T22:08:17Z","snapshot_observed_at":"2026-08-14T08:48:49.903804Z","submitted_at":"2025-06-02T21:51:04Z","title":"Why Gradients Rapidly Increase Near the End of Training","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T11:32:03.175874Z"},"links":{"citing_paper":"/paper/2506.02285"},"observation_digest":"sha256:0e5d136b51a27993b4adc792c09debbd95ca5a54cfdaa693c56a65ac594553bf","observation_id":"08db36d8-a0df-4c7c-8936-ef46e243c71d","resolution":{"observed_at":"2026-08-07T11:32:05.877245Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:32:05.495697Z","title":null,"venue":null,"work_id":"bfd503ca-1d36-4936-ba88-1fba7681d09c","year":2023},"citing_paper":{"arxiv_id":"2506.02285","last_updated":"2025-06-09T22:08:17Z","snapshot_observed_at":"2026-08-14T08:48:49.903804Z","submitted_at":"2025-06-02T21:51:04Z","title":"Why Gradients Rapidly Increase Near the End of Training","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T11:32:03.230459Z"},"links":{"citing_paper":"/paper/2506.02285"},"observation_digest":"sha256:e58550d8bd2a7c5c1d4fa2a5c222566fb9dafdc8218b68c8c89a3325a834c48b","observation_id":"4b0b303b-89ab-4fd6-bd30-7809a85fbde7","resolution":{"observed_at":"2026-08-07T11:32:05.627056Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:32:03.275141Z","title":"and Gower, R","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.02285","last_updated":"2025-06-09T22:08:17Z","snapshot_observed_at":"2026-08-14T08:48:49.903804Z","submitted_at":"2025-06-02T21:51:04Z","title":"Why Gradients Rapidly Increase Near the End of Training","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T11:32:03.275141Z"},"links":{"citing_paper":"/paper/2506.02285"},"observation_digest":"sha256:c20567f307c6272d47661a7f9aa0e904c033774c8207603e965cee40123bd986","observation_id":"2be33ce0-a8e0-4f4e-a52d-2e5194feacd1","resolution":{"observed_at":"2026-08-07T11:32:03.275141Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:32:03.377669Z","title":"and Mishchenko, K","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.02285","last_updated":"2025-06-09T22:08:17Z","snapshot_observed_at":"2026-08-14T08:48:49.903804Z","submitted_at":"2025-06-02T21:51:04Z","title":"Why Gradients Rapidly Increase Near the End of Training","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T11:32:03.377669Z"},"links":{"citing_paper":"/paper/2506.02285"},"observation_digest":"sha256:e172a10740f0479deeb04b2bbadfcc8dcc6bbc95b799da1c8163cb03ab558c29","observation_id":"9a60bbc3-005f-40d8-9af8-f4a85fee0872","resolution":{"observed_at":"2026-08-07T11:32:03.377669Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:32:05.369481Z","title":null,"venue":null,"work_id":"fd5a959b-29d8-4560-81eb-1156f1bc33be","year":2011},"citing_paper":{"arxiv_id":"2506.02285","last_updated":"2025-06-09T22:08:17Z","snapshot_observed_at":"2026-08-14T08:48:49.903804Z","submitted_at":"2025-06-02T21:51:04Z","title":"Why Gradients Rapidly Increase Near the End of Training","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T11:32:03.474851Z"},"links":{"citing_paper":"/paper/2506.02285"},"observation_digest":"sha256:0475ddcc43fcbed6a9ce0336d2f16de7ab54c971a3164070faff6a18fdcf804a","observation_id":"4f5789c7-82a3-4da5-974f-41a7fc2e7191","resolution":{"observed_at":"2026-08-07T11:32:05.400559Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:32:05.303581Z","title":null,"venue":null,"work_id":"2dfafeae-aa12-473d-b3c4-79b3a8c218d2","year":2016},"citing_paper":{"arxiv_id":"2506.02285","last_updated":"2025-06-09T22:08:17Z","snapshot_observed_at":"2026-08-14T08:48:49.903804Z","submitted_at":"2025-06-02T21:51:04Z","title":"Why Gradients Rapidly Increase Near the End of Training","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T11:32:03.579676Z"},"links":{"citing_paper":"/paper/2506.02285"},"observation_digest":"sha256:35e2cb6c08decbafce57bb5e03b4e9bcf8d5d7bdff45b57951534deda204d2ea","observation_id":"27c72ec4-65e5-4f5a-a0ea-94f42066bec4","resolution":{"observed_at":"2026-08-07T11:32:05.334360Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:32:05.208107Z","title":"and Szegedy, C","venue":null,"work_id":"1afcdfa2-9e2d-4edb-ac80-1c8a9af5e5ff","year":2015},"citing_paper":{"arxiv_id":"2506.02285","last_updated":"2025-06-09T22:08:17Z","snapshot_observed_at":"2026-08-14T08:48:49.903804Z","submitted_at":"2025-06-02T21:51:04Z","title":"Why Gradients Rapidly Increase Near the End of Training","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T11:32:03.676898Z"},"links":{"citing_paper":"/paper/2506.02285"},"observation_digest":"sha256:f79604bf0c123cf8f523dfe699422611c29d44e08d01a9357960b11301103bb7","observation_id":"ef705d8e-9ab2-4a36-a65c-b673f8576b72","resolution":{"observed_at":"2026-08-07T11:32:05.238177Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:32:03.723875Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02285","last_updated":"2025-06-09T22:08:17Z","snapshot_observed_at":"2026-08-14T08:48:49.903804Z","submitted_at":"2025-06-02T21:51:04Z","title":"Why Gradients Rapidly Increase Near the End of Training","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T11:32:03.723875Z"},"links":{"citing_paper":"/paper/2506.02285"},"observation_digest":"sha256:dc1afc012d5f5eb15712ab5a15493853540982c337ab5e9fb33aa3cf4e003fb6","observation_id":"9263c93b-63c6-4827-a537-8a53c4918d37","resolution":{"observed_at":"2026-08-07T11:32:03.723875Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:32:03.811301Z","title":"and Hutter, F","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.02285","last_updated":"2025-06-09T22:08:17Z","snapshot_observed_at":"2026-08-14T08:48:49.903804Z","submitted_at":"2025-06-02T21:51:04Z","title":"Why Gradients Rapidly Increase Near the End of Training","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T11:32:03.811301Z"},"links":{"citing_paper":"/paper/2506.02285"},"observation_digest":"sha256:2416c5caf8552dd4d5b179d61623615efb473786c026453c138b24fbf4797b26","observation_id":"636ae290-6d76-4cf3-b12e-1e9760ad81d5","resolution":{"observed_at":"2026-08-07T11:32:03.811301Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1912.13213","last_updated":"2026-06-21T08:13:27Z","snapshot_observed_at":"2026-08-15T05:32:55.984958Z","submitted_at":"2019-12-31T08:16:31Z","title":"Online Learning: A Modern Introduction Using Convex Optimization","version":10},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.13213","snapshot_observed_at":"2026-08-07T11:32:03.877272Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.02285","last_updated":"2025-06-09T22:08:17Z","snapshot_observed_at":"2026-08-14T08:48:49.903804Z","submitted_at":"2025-06-02T21:51:04Z","title":"Why Gradients Rapidly Increase Near the End of Training","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T11:32:03.877272Z"},"links":{"cited_paper":"/paper/1912.13213","citing_paper":"/paper/2506.02285"},"observation_digest":"sha256:27716f4209a4d1b6c22922332ff90abe6e226f63bd43056b9e2f28bbfffbfe5e","observation_id":"4611d213-a767-43d1-a745-7f4e4bce64e4","resolution":{"observed_at":"2026-08-07T11:32:03.877272Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:32:05.030079Z","title":"B., Lozhkov, A., Mitchell, M., Raffel, C., Werra, L","venue":null,"work_id":"d218e7b7-7771-4167-9333-0ddd40673b1b","year":2024},"citing_paper":{"arxiv_id":"2506.02285","last_updated":"2025-06-09T22:08:17Z","snapshot_observed_at":"2026-08-14T08:48:49.903804Z","submitted_at":"2025-06-02T21:51:04Z","title":"Why Gradients Rapidly Increase Near the End of Training","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T11:32:03.915870Z"},"links":{"citing_paper":"/paper/2506.02285"},"observation_digest":"sha256:46df2af9e3f4ed0bd388c3b566ae526ad0ff138524289ba5c6ba5c99f381ab95","observation_id":"28337d32-f3c9-4675-ba61-592f81b7276a","resolution":{"observed_at":"2026-08-07T11:32:05.093205Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:32:04.926981Z","title":"C., and Fei-Fei, L","venue":null,"work_id":"c0900d51-c428-4fbd-878d-9ff557aa3a16","year":2015},"citing_paper":{"arxiv_id":"2506.02285","last_updated":"2025-06-09T22:08:17Z","snapshot_observed_at":"2026-08-14T08:48:49.903804Z","submitted_at":"2025-06-02T21:51:04Z","title":"Why Gradients Rapidly Increase Near the End of Training","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T11:32:03.994499Z"},"links":{"citing_paper":"/paper/2506.02285"},"observation_digest":"sha256:a39357b3579664f97414b376c4205b7879a6f68f00a13824dccaf57259a58a6c","observation_id":"66ba23e5-347c-45bc-af2c-85bb6040e140","resolution":{"observed_at":"2026-08-07T11:32:04.951450Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:32:04.824687Z","title":null,"venue":null,"work_id":"ce5076f6-8c28-4106-803a-9cea33b5d0e0","year":2023},"citing_paper":{"arxiv_id":"2506.02285","last_updated":"2025-06-09T22:08:17Z","snapshot_observed_at":"2026-08-14T08:48:49.903804Z","submitted_at":"2025-06-02T21:51:04Z","title":"Why Gradients Rapidly Increase Near the End of Training","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T11:32:04.050469Z"},"links":{"citing_paper":"/paper/2506.02285"},"observation_digest":"sha256:c789d43787774f67049aa66c38beddf193b54a52257118fcd70705d28a3031b0","observation_id":"817e3174-5ca4-4ea4-81ba-0167e048b52c","resolution":{"observed_at":"2026-08-07T11:32:04.884836Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1706.05350","last_updated":"2017-06-16T17:08:08Z","snapshot_observed_at":"2026-08-14T20:53:33.331220Z","submitted_at":"2017-06-16T17:08:08Z","title":"L2 Regularization versus Batch and Weight Normalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1706.05350","snapshot_observed_at":"2026-08-07T11:32:04.103673Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.02285","last_updated":"2025-06-09T22:08:17Z","snapshot_observed_at":"2026-08-14T08:48:49.903804Z","submitted_at":"2025-06-02T21:51:04Z","title":"Why Gradients Rapidly Increase Near the End of Training","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T11:32:04.103673Z"},"links":{"cited_paper":"/paper/1706.05350","citing_paper":"/paper/2506.02285"},"observation_digest":"sha256:37296b5a2c92882b3b44d36b941f0c39dbd20faa5b3e6fc7bdfe47472ff926e2","observation_id":"7c43b120-6677-4a8d-b09a-739151b93b4c","resolution":{"observed_at":"2026-08-07T11:32:04.103673Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.04454","last_updated":"2024-04-05T23:56:50Z","snapshot_observed_at":"2026-08-13T00:36:45.005789Z","submitted_at":"2024-04-05T23:56:50Z","title":"Implicit Bias of AdamW: $\\ell_\\infty$ Norm Constrained Optimization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.04454","snapshot_observed_at":"2026-08-07T11:32:04.192151Z","title":"and Li, Z","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02285","last_updated":"2025-06-09T22:08:17Z","snapshot_observed_at":"2026-08-14T08:48:49.903804Z","submitted_at":"2025-06-02T21:51:04Z","title":"Why Gradients Rapidly Increase Near the End of Training","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T11:32:04.192151Z"},"links":{"cited_paper":"/paper/2404.04454","citing_paper":"/paper/2506.02285"},"observation_digest":"sha256:11f0f53bdfe17d0d5b1938eebac507ab017b1fc206538935d5bc239486b49c0a","observation_id":"69a1258c-d2bc-4057-a133-b27204da1a16","resolution":{"observed_at":"2026-08-07T11:32:04.192151Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:32:04.738959Z","title":null,"venue":null,"work_id":"7e390f8b-bce1-465b-8184-ddf8afcf8d6d","year":2023},"citing_paper":{"arxiv_id":"2506.02285","last_updated":"2025-06-09T22:08:17Z","snapshot_observed_at":"2026-08-14T08:48:49.903804Z","submitted_at":"2025-06-02T21:51:04Z","title":"Why Gradients Rapidly Increase Near the End of Training","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T11:32:04.246337Z"},"links":{"citing_paper":"/paper/2506.02285"},"observation_digest":"sha256:35d0c821268295b2493ad3812d01701440fd1f969fc514a42eafc776660915e7","observation_id":"6b97a015-9c9b-499f-b25b-f1fbb9092572","resolution":{"observed_at":"2026-08-07T11:32:04.764571Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:32:04.592559Z","title":null,"venue":null,"work_id":"c9bee3a8-a361-4914-9a91-285682412ffb","year":2019},"citing_paper":{"arxiv_id":"2506.02285","last_updated":"2025-06-09T22:08:17Z","snapshot_observed_at":"2026-08-14T08:48:49.903804Z","submitted_at":"2025-06-02T21:51:04Z","title":"Why Gradients Rapidly Increase Near the End of Training","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T11:32:04.332003Z"},"links":{"citing_paper":"/paper/2506.02285"},"observation_digest":"sha256:7a5b48c18cfffd5849cb589995dd5141842a316f91680bbd22acd5ccbc83eb03","observation_id":"7db33698-d989-43f0-955a-82cd872ea666","resolution":{"observed_at":"2026-08-07T11:32:04.653154Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:32:04.478542Z","title":null,"venue":null,"work_id":"086a51d3-ae29-4bff-8bee-2d6e78782624","year":2022},"citing_paper":{"arxiv_id":"2506.02285","last_updated":"2025-06-09T22:08:17Z","snapshot_observed_at":"2026-08-14T08:48:49.903804Z","submitted_at":"2025-06-02T21:51:04Z","title":"Why Gradients Rapidly Increase Near the End of Training","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T11:32:04.384284Z"},"links":{"citing_paper":"/paper/2506.02285"},"observation_digest":"sha256:f8012580a89fe70e7eb3f1c061613f248bd2bb30cb51b69e6bcdaa9f17a62499","observation_id":"4e3c916a-4668-49dc-9a72-591cd53e0501","resolution":{"observed_at":"2026-08-07T11:32:04.541396Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.02285","last_updated":"2025-06-09T22:08:17Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-14T08:48:49.903804Z","submitted_at":"2025-06-02T21:51:04Z","title":"Why Gradients Rapidly Increase Near the End of Training"},"reference_resolution":{"displayed":22,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":18,"verified_exact":0,"verified_fuzzy":4},"total_outbound_references":22},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 22 of 22 outbound references and 10 inbound Pith citation observations for arXiv:2506.02285."}