{"as_of":"2026-08-15T18:01:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:421e7c7c8c199b9e5ca870a2b90826b177014105cdb9bb04d690fbb5404549c7","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":37,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":37,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":37,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":37,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T17:22:55.395736Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T10:29:44.281858Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"1905.11881","last_updated":"2020-02-10T22:58:53Z","snapshot_observed_at":"2026-08-14T16:25:08.350015Z","submitted_at":"2019-05-28T15:23:12Z","title":"Why gradient clipping accelerates training: A theoretical justification for adaptivity","version":2},"cited_work":{"arxiv_id":"1905.11881","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1905.11881","snapshot_observed_at":"2026-07-04T10:29:44.281858Z","title":"arXiv preprint arXiv:1905.11881 (2019)","venue":null,"work_id":"fbf2f93c-f73e-413f-b24f-e6153c29bf03","year":1905},"citing_paper":{"arxiv_id":"2003.00295","last_updated":"2021-09-08T23:37:17Z","snapshot_observed_at":"2026-08-13T06:06:10.844945Z","submitted_at":"2020-02-29T16:37:29Z","title":"Adaptive Federated Optimization","version":5},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-05-21T10:30:58.601351Z"},"links":{"cited_paper":"/paper/1905.11881","citing_paper":"/paper/2003.00295"},"observation_digest":"sha256:4e69b065e9dc37dc8b914f2f2e8db96130906d7bc42d98f6a3f40eb62794ab65","observation_id":"a86adcb6-e681-4ab9-a614-da945dd611d2","resolution":{"observed_at":"2026-05-21T10:30:58.750778Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1905.11881","last_updated":"2020-02-10T22:58:53Z","snapshot_observed_at":"2026-08-14T16:25:08.350015Z","submitted_at":"2019-05-28T15:23:12Z","title":"Why gradient clipping accelerates training: A theoretical justification for adaptivity","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.11881","snapshot_observed_at":"2026-08-12T19:30:55.159499Z","title":"Why gradient clipping accelerates training: A theoretical justification for adaptivity","venue":null,"work_id":null,"year":1905},"citing_paper":{"arxiv_id":"2411.10696","last_updated":"2024-11-16T04:27:22Z","snapshot_observed_at":"2026-08-14T18:58:02.314747Z","submitted_at":"2024-11-16T04:27:22Z","title":"HELENE: Hessian Layer-wise Clipping and Gradient Annealing for Accelerating Fine-tuning LLM with Zeroth-order Optimization","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-12T19:30:55.159499Z"},"links":{"cited_paper":"/paper/1905.11881","citing_paper":"/paper/2411.10696"},"observation_digest":"sha256:96c06145cba7ce59d69e46b2148d23892f676e58f158abc4a6ece482abfd100a","observation_id":"31f0b3c5-db6d-4e0a-946d-2e142fe3c6c2","resolution":{"observed_at":"2026-08-12T19:30:55.159499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1905.11881","last_updated":"2020-02-10T22:58:53Z","snapshot_observed_at":"2026-08-14T16:25:08.350015Z","submitted_at":"2019-05-28T15:23:12Z","title":"Why gradient clipping accelerates training: A theoretical justification for adaptivity","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.11881","snapshot_observed_at":"2026-08-12T11:26:17.133029Z","title":"Why gradient clipping accelerates training: A theoretical justification for adaptivity","venue":null,"work_id":null,"year":1905},"citing_paper":{"arxiv_id":"2411.18269","last_updated":"2024-11-27T12:04:37Z","snapshot_observed_at":"2026-08-12T11:19:42.557913Z","submitted_at":"2024-11-27T12:04:37Z","title":"Hidden Data Privacy Breaches in Federated Learning","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-12T11:26:17.133029Z"},"links":{"cited_paper":"/paper/1905.11881","citing_paper":"/paper/2411.18269"},"observation_digest":"sha256:961a108939712955feff84545e533654f2ff9177cc31a592a19de2dc9a498a24","observation_id":"f3e73a44-d092-402c-9577-ce1ed2968ec9","resolution":{"observed_at":"2026-08-12T11:26:17.133029Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1905.11881","last_updated":"2020-02-10T22:58:53Z","snapshot_observed_at":"2026-08-14T16:25:08.350015Z","submitted_at":"2019-05-28T15:23:12Z","title":"Why gradient clipping accelerates training: A theoretical justification for adaptivity","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.11881","snapshot_observed_at":"2026-08-11T14:47:46.361895Z","title":"Why gradient clipping accelerates training: A theoretical justification for adaptivity","venue":null,"work_id":null,"year":1905},"citing_paper":{"arxiv_id":"2412.11773","last_updated":"2025-06-27T06:34:09Z","snapshot_observed_at":"2026-08-13T08:19:14.013569Z","submitted_at":"2024-12-16T13:46:02Z","title":"Toward a Unified Theory of Gradient Descent under Generalized Smoothness","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T14:47:46.361895Z"},"links":{"cited_paper":"/paper/1905.11881","citing_paper":"/paper/2412.11773"},"observation_digest":"sha256:66926e4812a7da95f0f2aab2b3b701cb97096f40f9d5afd0b7cbb9822c8699d7","observation_id":"96fe0dda-9a44-4369-a088-4427ece666d3","resolution":{"observed_at":"2026-08-11T14:47:46.361895Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1905.11881","last_updated":"2020-02-10T22:58:53Z","snapshot_observed_at":"2026-08-14T16:25:08.350015Z","submitted_at":"2019-05-28T15:23:12Z","title":"Why gradient clipping accelerates training: A theoretical justification for adaptivity","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.11881","snapshot_observed_at":"2026-08-11T13:41:24.665198Z","title":"Diederik P Kingma and Jimmy Ba","venue":null,"work_id":null,"year":1905},"citing_paper":{"arxiv_id":"2412.12916","last_updated":"2024-12-18T10:16:59Z","snapshot_observed_at":"2026-08-15T15:59:30.261617Z","submitted_at":"2024-12-17T13:50:20Z","title":"Graph Spring Neural ODEs for Link Sign Prediction","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T13:41:24.665198Z"},"links":{"cited_paper":"/paper/1905.11881","citing_paper":"/paper/2412.12916"},"observation_digest":"sha256:9f465751baac9f04c4061eec2088271a47e4372fe8e297fac9b44b700d67b17f","observation_id":"cf27b873-bb5f-4327-907b-c05dfb43ad15","resolution":{"observed_at":"2026-08-11T13:41:24.665198Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1905.11881","last_updated":"2020-02-10T22:58:53Z","snapshot_observed_at":"2026-08-14T16:25:08.350015Z","submitted_at":"2019-05-28T15:23:12Z","title":"Why gradient clipping accelerates training: A theoretical justification for adaptivity","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.11881","snapshot_observed_at":"2026-08-11T11:32:54.299359Z","title":"Why gradient clipping accelerates training: A theoretical justification for adaptivity","venue":null,"work_id":null,"year":1905},"citing_paper":{"arxiv_id":"2412.16243","last_updated":"2024-12-19T20:52:10Z","snapshot_observed_at":"2026-08-14T08:18:59.579433Z","submitted_at":"2024-12-19T20:52:10Z","title":"Bag of Tricks for Multimodal AutoML with Image, Text, and Tabular Data","version":1},"reference_index":101,"source":"pdf_text","source_observed_at":"2026-08-11T11:32:54.299359Z"},"links":{"cited_paper":"/paper/1905.11881","citing_paper":"/paper/2412.16243"},"observation_digest":"sha256:97810d2603bb71a860493f1308f78b91729fac8802daf33e84ac54fe4067f419","observation_id":"7c63de90-72a8-495c-84cb-f76b0c264743","resolution":{"observed_at":"2026-08-11T11:32:54.299359Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1905.11881","last_updated":"2020-02-10T22:58:53Z","snapshot_observed_at":"2026-08-14T16:25:08.350015Z","submitted_at":"2019-05-28T15:23:12Z","title":"Why gradient clipping accelerates training: A theoretical justification for adaptivity","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.11881","snapshot_observed_at":"2026-08-11T05:13:10.240195Z","title":"Why gradient clip- ping accelerates training: A theoretical justification for adaptivity,","venue":null,"work_id":null,"year":1905},"citing_paper":{"arxiv_id":"2412.17951","last_updated":"2024-12-23T20:04:07Z","snapshot_observed_at":"2026-08-15T06:17:44.147565Z","submitted_at":"2024-12-23T20:04:07Z","title":"Hyperbolic Chamfer Distance for Point Cloud Completion and Beyond","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-11T05:13:10.240195Z"},"links":{"cited_paper":"/paper/1905.11881","citing_paper":"/paper/2412.17951"},"observation_digest":"sha256:317fa4694312e1ab3bd3f8ab5db1a0154f7192621c1ba61324d3889c0779a1cb","observation_id":"1edceb1f-e2f6-4dde-b635-71cd71485ad5","resolution":{"observed_at":"2026-08-11T05:13:10.240195Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1905.11881","last_updated":"2020-02-10T22:58:53Z","snapshot_observed_at":"2026-08-14T16:25:08.350015Z","submitted_at":"2019-05-28T15:23:12Z","title":"Why gradient clipping accelerates training: A theoretical justification for adaptivity","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.11881","snapshot_observed_at":"2026-08-11T04:32:51.695893Z","title":"Why gradient clipping accelerates training: A theoretical justification for adaptivity","venue":null,"work_id":null,"year":1905},"citing_paper":{"arxiv_id":"2412.18790","last_updated":"2024-12-25T05:58:07Z","snapshot_observed_at":"2026-08-12T06:39:00.033987Z","submitted_at":"2024-12-25T05:58:07Z","title":"Torque-Aware Momentum","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-11T04:32:51.695893Z"},"links":{"cited_paper":"/paper/1905.11881","citing_paper":"/paper/2412.18790"},"observation_digest":"sha256:126db3322799da570425a0336fceb5a51040abc30cc423baba7b35c9c7899c0c","observation_id":"b2b9cbc5-d0bb-462a-885d-3428c5d5359c","resolution":{"observed_at":"2026-08-11T04:32:51.695893Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1905.11881","last_updated":"2020-02-10T22:58:53Z","snapshot_observed_at":"2026-08-14T16:25:08.350015Z","submitted_at":"2019-05-28T15:23:12Z","title":"Why gradient clipping accelerates training: A theoretical justification for adaptivity","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.11881","snapshot_observed_at":"2026-08-09T13:53:06.399894Z","title":"Why gradient clipping accelerates training: A theoretical justification for adaptivity","venue":null,"work_id":null,"year":1905},"citing_paper":{"arxiv_id":"2502.02002","last_updated":"2025-07-30T08:25:58Z","snapshot_observed_at":"2026-08-09T15:36:50.248580Z","submitted_at":"2025-02-04T04:30:03Z","title":"The Ball-Proximal (=\"Broximal\") Point Method: a New Algorithm, Convergence Theory, and Applications","version":2},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-08-09T13:53:06.399894Z"},"links":{"cited_paper":"/paper/1905.11881","citing_paper":"/paper/2502.02002"},"observation_digest":"sha256:015efea02e28712dfd55134d5de2a26a855c38cb8f91a14d55b8ce09bf2f8746","observation_id":"9efe2696-a607-4661-bf1a-dd5036aaca12","resolution":{"observed_at":"2026-08-09T13:53:06.399894Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1905.11881","last_updated":"2020-02-10T22:58:53Z","snapshot_observed_at":"2026-08-14T16:25:08.350015Z","submitted_at":"2019-05-28T15:23:12Z","title":"Why gradient clipping accelerates training: A theoretical justification for adaptivity","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.11881","snapshot_observed_at":"2026-08-08T23:30:59.143293Z","title":"Why gradient clipping accelerates training: A theoret- ical justiﬁcation for adaptivity,","venue":null,"work_id":null,"year":1905},"citing_paper":{"arxiv_id":"2502.04116","last_updated":"2025-02-09T14:16:07Z","snapshot_observed_at":"2026-08-09T04:31:17.532908Z","submitted_at":"2025-02-06T14:46:12Z","title":"Generative Adversarial Networks Bridging Art and Machine Intelligence","version":2},"reference_index":113,"source":"pdf_text","source_observed_at":"2026-08-08T23:30:59.143293Z"},"links":{"cited_paper":"/paper/1905.11881","citing_paper":"/paper/2502.04116"},"observation_digest":"sha256:69fda2fb1ce921a1519ff93d2a381c1bea8440cd5304108ba23b5608af14e068","observation_id":"861108a2-3afd-4bbc-ba62-8ec0c4f76ebd","resolution":{"observed_at":"2026-08-08T23:30:59.143293Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1905.11881","last_updated":"2020-02-10T22:58:53Z","snapshot_observed_at":"2026-08-14T16:25:08.350015Z","submitted_at":"2019-05-28T15:23:12Z","title":"Why gradient clipping accelerates training: A theoretical justification for adaptivity","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.11881","snapshot_observed_at":"2026-08-07T14:14:10.057507Z","title":"Zhang, T","venue":null,"work_id":null,"year":1905},"citing_paper":{"arxiv_id":"2505.19827","last_updated":"2025-05-26T11:04:59Z","snapshot_observed_at":"2026-08-10T09:29:01.974309Z","submitted_at":"2025-05-26T11:04:59Z","title":"Revisiting Glorot Initialization for Long-Range Linear Recurrences","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T14:14:10.057507Z"},"links":{"cited_paper":"/paper/1905.11881","citing_paper":"/paper/2505.19827"},"observation_digest":"sha256:8c97f194548e4036f1b5e7b467a41660b53aeaaefa9f6fa60779326c58448c94","observation_id":"06cc42a0-dda5-4f30-810e-c14ac27a2f86","resolution":{"observed_at":"2026-08-07T14:14:10.057507Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1905.11881","last_updated":"2020-02-10T22:58:53Z","snapshot_observed_at":"2026-08-14T16:25:08.350015Z","submitted_at":"2019-05-28T15:23:12Z","title":"Why gradient clipping accelerates training: A theoretical justification for adaptivity","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.11881","snapshot_observed_at":"2026-08-06T18:33:07.895662Z","title":"Zhang, T","venue":null,"work_id":null,"year":1905},"citing_paper":{"arxiv_id":"2507.08913","last_updated":"2025-07-11T15:36:48Z","snapshot_observed_at":"2026-08-12T06:39:59.193452Z","submitted_at":"2025-07-11T15:36:48Z","title":"Revisiting Convergence: Shuffling Complexity Beyond Lipschitz Smoothness","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-06T18:33:07.895662Z"},"links":{"cited_paper":"/paper/1905.11881","citing_paper":"/paper/2507.08913"},"observation_digest":"sha256:2a11326abd2dea2588a7fb3c84d9380a829cd4dab64c7d77d64fcfe356aacfe3","observation_id":"a6335d00-2cfa-4972-b4d5-e219fc3c4cc3","resolution":{"observed_at":"2026-08-06T18:33:07.895662Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1905.11881","last_updated":"2020-02-10T22:58:53Z","snapshot_observed_at":"2026-08-14T16:25:08.350015Z","submitted_at":"2019-05-28T15:23:12Z","title":"Why gradient clipping accelerates training: A theoretical justification for adaptivity","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.11881","snapshot_observed_at":"2026-08-15T17:22:55.395736Z","title":"Why gradient clipping accelerates training: A theoretical justification for adaptivity","venue":null,"work_id":null,"year":1905},"citing_paper":{"arxiv_id":"2508.13496","last_updated":"2025-09-09T02:01:10Z","snapshot_observed_at":"2026-08-15T17:11:19.805810Z","submitted_at":"2025-08-19T04:10:38Z","title":"Revisiting Randomized Smoothing: Nonsmooth Nonconvex Optimization Beyond Global Lipschitz Continuity","version":3},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-15T17:22:55.395736Z"},"links":{"cited_paper":"/paper/1905.11881","citing_paper":"/paper/2508.13496"},"observation_digest":"sha256:347f5622b5f89067ad4fcbb01f25d286dd3f6febdf7f38ac04cd9d71421161dc","observation_id":"f2548962-f523-4fd1-82f4-72d874c04d3a","resolution":{"observed_at":"2026-08-15T17:22:55.395736Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1905.11881","last_updated":"2020-02-10T22:58:53Z","snapshot_observed_at":"2026-08-14T16:25:08.350015Z","submitted_at":"2019-05-28T15:23:12Z","title":"Why gradient clipping accelerates training: A theoretical justification for adaptivity","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.11881","snapshot_observed_at":"2026-08-05T10:22:04.800612Z","title":"Why gradient clip- ping accelerates training: A theoretical justification for adaptivity,","venue":null,"work_id":null,"year":1905},"citing_paper":{"arxiv_id":"2509.04213","last_updated":"2025-09-04T13:38:54Z","snapshot_observed_at":"2026-08-13T16:32:10.662692Z","submitted_at":"2025-09-04T13:38:54Z","title":"Sailing Towards Zero-Shot State Estimation using Foundation Models Combined with a UKF","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-05T10:22:04.800612Z"},"links":{"cited_paper":"/paper/1905.11881","citing_paper":"/paper/2509.04213"},"observation_digest":"sha256:9d87af2e7464ac440bc6422bc1d404952ee435a0d00abdb20805018cddd9918f","observation_id":"c0912f20-4171-4402-8969-4f2c1658cb0c","resolution":{"observed_at":"2026-08-05T10:22:04.800612Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1905.11881","last_updated":"2020-02-10T22:58:53Z","snapshot_observed_at":"2026-08-14T16:25:08.350015Z","submitted_at":"2019-05-28T15:23:12Z","title":"Why gradient clipping accelerates training: A theoretical justification for adaptivity","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.11881","snapshot_observed_at":"2026-08-15T15:57:38.296515Z","title":"Why gradient clipping accelerates training: A theoretical justification for adaptivity.arXiv preprint arXiv:1905.11881,","venue":null,"work_id":null,"year":1905},"citing_paper":{"arxiv_id":"2509.14562","last_updated":"2026-07-24T13:07:17Z","snapshot_observed_at":"2026-08-15T15:48:44.803568Z","submitted_at":"2025-09-18T02:49:27Z","title":"LiMuon: Light and Fast Muon Optimizer for Large Models","version":5},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T15:57:38.296515Z"},"links":{"cited_paper":"/paper/1905.11881","citing_paper":"/paper/2509.14562"},"observation_digest":"sha256:bc2e1798f890786f191ee4a382f813188f5bd5bd8985efcf1fdb9b85645e2bca","observation_id":"76bfa91a-14f7-44cb-9d32-65370677252c","resolution":{"observed_at":"2026-08-15T15:57:38.296515Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1905.11881","last_updated":"2020-02-10T22:58:53Z","snapshot_observed_at":"2026-08-14T16:25:08.350015Z","submitted_at":"2019-05-28T15:23:12Z","title":"Why gradient clipping accelerates training: A theoretical justification for adaptivity","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.11881","snapshot_observed_at":"2026-08-04T12:39:02.842307Z","title":"Why gradient clipping accelerates training: A theoretical justification for adaptivity","venue":null,"work_id":null,"year":1905},"citing_paper":{"arxiv_id":"2510.03164","last_updated":"2026-06-28T16:14:54Z","snapshot_observed_at":"2026-08-14T12:29:49.923863Z","submitted_at":"2025-10-03T16:35:56Z","title":"Why Do We Need Warm-up? A Theoretical Perspective","version":2},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-08-04T12:39:02.842307Z"},"links":{"cited_paper":"/paper/1905.11881","citing_paper":"/paper/2510.03164"},"observation_digest":"sha256:6d209a00d4322a4a976acf948148d45d5fa6d879afee31e1b8189a331e980bef","observation_id":"b8c02199-f48d-4b06-a70f-52f3feac5a49","resolution":{"observed_at":"2026-08-04T12:39:02.842307Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1905.11881","last_updated":"2020-02-10T22:58:53Z","snapshot_observed_at":"2026-08-14T16:25:08.350015Z","submitted_at":"2019-05-28T15:23:12Z","title":"Why gradient clipping accelerates training: A theoretical justification for adaptivity","version":2},"cited_work":{"arxiv_id":"1905.11881","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1905.11881","snapshot_observed_at":"2026-07-04T10:29:44.281858Z","title":"arXiv preprint arXiv:1905.11881 (2019)","venue":null,"work_id":"fbf2f93c-f73e-413f-b24f-e6153c29bf03","year":1905},"citing_paper":{"arxiv_id":"2510.16468","last_updated":"2026-05-20T09:46:29Z","snapshot_observed_at":"2026-08-09T23:22:53.996244Z","submitted_at":"2025-10-18T12:26:28Z","title":"Frank-Wolfe Algorithms for (L0, L1)-smooth functions","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-18T06:18:52.290660Z"},"links":{"cited_paper":"/paper/1905.11881","citing_paper":"/paper/2510.16468"},"observation_digest":"sha256:2b4bce2f9d3733815d2db5871e29b0bd37bf079a3fb64538d21f39d481aef815","observation_id":"27440969-e32b-4d43-b5d9-71103666dfeb","resolution":{"observed_at":"2026-05-18T06:20:58.638743Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1905.11881","last_updated":"2020-02-10T22:58:53Z","snapshot_observed_at":"2026-08-14T16:25:08.350015Z","submitted_at":"2019-05-28T15:23:12Z","title":"Why gradient clipping accelerates training: A theoretical justification for adaptivity","version":2},"cited_work":{"arxiv_id":"1905.11881","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1905.11881","snapshot_observed_at":"2026-07-04T10:29:44.281858Z","title":"arXiv preprint arXiv:1905.11881 (2019)","venue":null,"work_id":"fbf2f93c-f73e-413f-b24f-e6153c29bf03","year":1905},"citing_paper":{"arxiv_id":"2510.16468","last_updated":"2026-05-20T09:46:29Z","snapshot_observed_at":"2026-08-09T23:22:53.996244Z","submitted_at":"2025-10-18T12:26:28Z","title":"Frank-Wolfe Algorithms for (L0, L1)-smooth functions","version":4},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-21T20:19:34.726206Z"},"links":{"cited_paper":"/paper/1905.11881","citing_paper":"/paper/2510.16468"},"observation_digest":"sha256:cee601f447a1a5dc698985a89713bc6d558811cd3c201241151810cf090c32d5","observation_id":"7780bc98-a93a-45b5-9d3e-8618907d043f","resolution":{"observed_at":"2026-05-21T20:20:34.576541Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1905.11881","last_updated":"2020-02-10T22:58:53Z","snapshot_observed_at":"2026-08-14T16:25:08.350015Z","submitted_at":"2019-05-28T15:23:12Z","title":"Why gradient clipping accelerates training: A theoretical justification for adaptivity","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.11881","snapshot_observed_at":"2026-08-03T22:20:05.654941Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2511.11466","last_updated":"2026-06-22T13:35:19Z","snapshot_observed_at":"2026-08-13T05:16:19.109873Z","submitted_at":"2025-11-14T16:38:15Z","title":"Non-Euclidean SGD for Structured Optimization: Unified Analysis and Improved Rates","version":2},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-03T22:20:05.654941Z"},"links":{"cited_paper":"/paper/1905.11881","citing_paper":"/paper/2511.11466"},"observation_digest":"sha256:dc3078bb0765843891ef3120eddc0e917d81c26194b634561535c47cbbf9cfd4","observation_id":"20d74278-a8ba-4bf9-8261-862a7329ae4b","resolution":{"observed_at":"2026-08-03T22:20:05.654941Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1905.11881","last_updated":"2020-02-10T22:58:53Z","snapshot_observed_at":"2026-08-14T16:25:08.350015Z","submitted_at":"2019-05-28T15:23:12Z","title":"Why gradient clipping accelerates training: A theoretical justification for adaptivity","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.11881","snapshot_observed_at":"2026-08-02T22:51:22.451530Z","title":"Why gradient clip- ping accelerates training: A theoretical justification for adaptiv- ity,","venue":null,"work_id":null,"year":1905},"citing_paper":{"arxiv_id":"2602.15519","last_updated":"2026-06-08T11:40:00Z","snapshot_observed_at":"2026-08-09T04:37:03.295131Z","submitted_at":"2026-02-17T11:47:56Z","title":"Enroll-on-Wakeup: A First Comparative Study of Target Speech Extraction for Seamless Interaction in Real Noisy Human-Machine Dialogue Scenarios","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-02T22:51:22.451530Z"},"links":{"cited_paper":"/paper/1905.11881","citing_paper":"/paper/2602.15519"},"observation_digest":"sha256:e6d63cb96a4720d7297d666638e9de720741b91a8ae2d627d9ed4592531f2698","observation_id":"2cd800e0-941d-47fb-85a3-18ecb12804e5","resolution":{"observed_at":"2026-08-02T22:51:22.451530Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1905.11881","last_updated":"2020-02-10T22:58:53Z","snapshot_observed_at":"2026-08-14T16:25:08.350015Z","submitted_at":"2019-05-28T15:23:12Z","title":"Why gradient clipping accelerates training: A theoretical justification for adaptivity","version":2},"cited_work":{"arxiv_id":"1905.11881","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1905.11881","snapshot_observed_at":"2026-07-04T10:29:44.281858Z","title":"arXiv preprint arXiv:1905.11881 (2019)","venue":null,"work_id":"fbf2f93c-f73e-413f-b24f-e6153c29bf03","year":1905},"citing_paper":{"arxiv_id":"2604.17560","last_updated":"2026-04-19T17:59:22Z","snapshot_observed_at":"2026-08-13T03:48:14.223637Z","submitted_at":"2026-04-19T17:59:22Z","title":"The Multi-Block DC Function Class: Theory, Algorithms, and Applications","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-05-10T05:39:18.719506Z"},"links":{"cited_paper":"/paper/1905.11881","citing_paper":"/paper/2604.17560"},"observation_digest":"sha256:ed6321ed85c6de0b5fbed8533df84ed44f0f010606d34e98f0b5651de6f5210e","observation_id":"988fb1ce-3bbe-4d8b-b8c8-993a43c592ed","resolution":{"observed_at":"2026-05-10T05:41:02.038729Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1905.11881","last_updated":"2020-02-10T22:58:53Z","snapshot_observed_at":"2026-08-14T16:25:08.350015Z","submitted_at":"2019-05-28T15:23:12Z","title":"Why gradient clipping accelerates training: A theoretical justification for adaptivity","version":2},"cited_work":{"arxiv_id":"1905.11881","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1905.11881","snapshot_observed_at":"2026-07-04T10:29:44.281858Z","title":"arXiv preprint arXiv:1905.11881 (2019)","venue":null,"work_id":"fbf2f93c-f73e-413f-b24f-e6153c29bf03","year":1905},"citing_paper":{"arxiv_id":"2604.28020","last_updated":"2026-05-29T15:07:05Z","snapshot_observed_at":"2026-07-06T23:13:24.960159Z","submitted_at":"2026-04-30T15:39:09Z","title":"Cost-Aware Learning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-07T05:11:01.131590Z"},"links":{"cited_paper":"/paper/1905.11881","citing_paper":"/paper/2604.28020"},"observation_digest":"sha256:e8ef131483e2ce19ed3062765584740f9021080031dbc7e94230ba532fb66e08","observation_id":"6e68920c-7d74-4ab5-84f4-755937775578","resolution":{"observed_at":"2026-05-12T10:36:30.859539Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1905.11881","last_updated":"2020-02-10T22:58:53Z","snapshot_observed_at":"2026-08-14T16:25:08.350015Z","submitted_at":"2019-05-28T15:23:12Z","title":"Why gradient clipping accelerates training: A theoretical justification for adaptivity","version":2},"cited_work":{"arxiv_id":"1905.11881","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1905.11881","snapshot_observed_at":"2026-07-04T10:29:44.281858Z","title":"arXiv preprint arXiv:1905.11881 (2019)","venue":null,"work_id":"fbf2f93c-f73e-413f-b24f-e6153c29bf03","year":1905},"citing_paper":{"arxiv_id":"2605.05660","last_updated":"2026-05-07T04:24:17Z","snapshot_observed_at":"2026-08-11T13:49:13.441974Z","submitted_at":"2026-05-07T04:24:17Z","title":"Distributionally Robust Multi-Objective Optimization","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-05-08T15:00:37.589354Z"},"links":{"cited_paper":"/paper/1905.11881","citing_paper":"/paper/2605.05660"},"observation_digest":"sha256:605f207e9173d8157a4709f7a61d109758af0ff25351802143cdccd95e677f24","observation_id":"f846a943-9d7a-4f89-8937-ca31226f7a17","resolution":{"observed_at":"2026-05-11T18:36:08.403171Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1905.11881","last_updated":"2020-02-10T22:58:53Z","snapshot_observed_at":"2026-08-14T16:25:08.350015Z","submitted_at":"2019-05-28T15:23:12Z","title":"Why gradient clipping accelerates training: A theoretical justification for adaptivity","version":2},"cited_work":{"arxiv_id":"1905.11881","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1905.11881","snapshot_observed_at":"2026-07-04T10:29:44.281858Z","title":"arXiv preprint arXiv:1905.11881 (2019)","venue":null,"work_id":"fbf2f93c-f73e-413f-b24f-e6153c29bf03","year":1905},"citing_paper":{"arxiv_id":"2605.11850","last_updated":"2026-05-12T09:36:13Z","snapshot_observed_at":"2026-08-11T10:43:39.565980Z","submitted_at":"2026-05-12T09:36:13Z","title":"Constrained Stochastic Spectral Preconditioning Converges for Nonconvex Objectives","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-05-13T05:34:48.195468Z"},"links":{"cited_paper":"/paper/1905.11881","citing_paper":"/paper/2605.11850"},"observation_digest":"sha256:62b5df42bd5c5bb57a195311cc4c572ea7a2bf8738d3c0c4ed9993055a13e20a","observation_id":"d157392f-000c-49f2-accb-eaaba1b3f8c0","resolution":{"observed_at":"2026-05-13T05:37:19.224751Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1905.11881","last_updated":"2020-02-10T22:58:53Z","snapshot_observed_at":"2026-08-14T16:25:08.350015Z","submitted_at":"2019-05-28T15:23:12Z","title":"Why gradient clipping accelerates training: A theoretical justification for adaptivity","version":2},"cited_work":{"arxiv_id":"1905.11881","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1905.11881","snapshot_observed_at":"2026-07-04T10:29:44.281858Z","title":"arXiv preprint arXiv:1905.11881 (2019)","venue":null,"work_id":"fbf2f93c-f73e-413f-b24f-e6153c29bf03","year":1905},"citing_paper":{"arxiv_id":"2605.12666","last_updated":"2026-05-12T19:16:13Z","snapshot_observed_at":"2026-08-03T00:15:00.075977Z","submitted_at":"2026-05-12T19:16:13Z","title":"Newton methods beyond Hessian Lipschitz continuity: A nonlinear preconditioning approach","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-14T20:32:13.593088Z"},"links":{"cited_paper":"/paper/1905.11881","citing_paper":"/paper/2605.12666"},"observation_digest":"sha256:b9a9af4c71531ee3ecda95504db7d65e8e39a910f17af277da37c2b08c029dd0","observation_id":"a0001604-ffe2-48eb-9c1c-dc1857fd795b","resolution":{"observed_at":"2026-05-14T20:32:56.529199Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1905.11881","last_updated":"2020-02-10T22:58:53Z","snapshot_observed_at":"2026-08-14T16:25:08.350015Z","submitted_at":"2019-05-28T15:23:12Z","title":"Why gradient clipping accelerates training: A theoretical justification for adaptivity","version":2},"cited_work":{"arxiv_id":"1905.11881","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1905.11881","snapshot_observed_at":"2026-07-04T10:29:44.281858Z","title":"arXiv preprint arXiv:1905.11881 (2019)","venue":null,"work_id":"fbf2f93c-f73e-413f-b24f-e6153c29bf03","year":1905},"citing_paper":{"arxiv_id":"2605.15314","last_updated":"2026-05-14T18:27:49Z","snapshot_observed_at":"2026-08-14T19:21:09.667986Z","submitted_at":"2026-05-14T18:27:49Z","title":"Beyond Bounded Variance: Variance-Reduced Normalized Methods for Nonconvex Optimization under Blum-Gladyshev Noise","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-19T16:12:03.664411Z"},"links":{"cited_paper":"/paper/1905.11881","citing_paper":"/paper/2605.15314"},"observation_digest":"sha256:313c45c46dbc29d3f69d8c8cb8a634aa360d3b5b23df8c9a873de969beea050d","observation_id":"e5fbf670-bc2a-4fb8-90d3-ad33f686465d","resolution":{"observed_at":"2026-05-19T16:12:38.850518Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1905.11881","last_updated":"2020-02-10T22:58:53Z","snapshot_observed_at":"2026-08-14T16:25:08.350015Z","submitted_at":"2019-05-28T15:23:12Z","title":"Why gradient clipping accelerates training: A theoretical justification for adaptivity","version":2},"cited_work":{"arxiv_id":"1905.11881","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1905.11881","snapshot_observed_at":"2026-07-04T10:29:44.281858Z","title":"arXiv preprint arXiv:1905.11881 (2019)","venue":null,"work_id":"fbf2f93c-f73e-413f-b24f-e6153c29bf03","year":1905},"citing_paper":{"arxiv_id":"2605.15522","last_updated":"2026-05-26T17:45:23Z","snapshot_observed_at":"2026-08-15T07:58:43.827022Z","submitted_at":"2026-05-15T01:43:22Z","title":"Stochastic Non-Smooth Convex Optimization with Unbounded Gradients","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-19T15:17:01.028675Z"},"links":{"cited_paper":"/paper/1905.11881","citing_paper":"/paper/2605.15522"},"observation_digest":"sha256:44ca096df00d74e4fd690f3bdaf2d93f4e7cabc81e2012aad2ef3cf84c3651df","observation_id":"1f146131-eb85-4a85-8fc0-e7849c9d0ac1","resolution":{"observed_at":"2026-05-19T15:17:39.256972Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1905.11881","last_updated":"2020-02-10T22:58:53Z","snapshot_observed_at":"2026-08-14T16:25:08.350015Z","submitted_at":"2019-05-28T15:23:12Z","title":"Why gradient clipping accelerates training: A theoretical justification for adaptivity","version":2},"cited_work":{"arxiv_id":"1905.11881","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1905.11881","snapshot_observed_at":"2026-07-04T10:29:44.281858Z","title":"arXiv preprint arXiv:1905.11881 (2019)","venue":null,"work_id":"fbf2f93c-f73e-413f-b24f-e6153c29bf03","year":1905},"citing_paper":{"arxiv_id":"2606.04384","last_updated":"2026-06-03T03:00:26Z","snapshot_observed_at":"2026-08-15T02:57:34.537491Z","submitted_at":"2026-06-03T03:00:26Z","title":"Revisiting Privacy Amplification by Subsampling in Selective Release DPSGD","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-06-28T06:56:30.044721Z"},"links":{"cited_paper":"/paper/1905.11881","citing_paper":"/paper/2606.04384"},"observation_digest":"sha256:205b69ec903ce9f236344b93fd120d2182d374552c794f3466df96de77862fef","observation_id":"708ae3b1-fc9e-4fcd-ad6e-d892f2e1a4ee","resolution":{"observed_at":"2026-07-02T07:26:45.944148Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1905.11881","last_updated":"2020-02-10T22:58:53Z","snapshot_observed_at":"2026-08-14T16:25:08.350015Z","submitted_at":"2019-05-28T15:23:12Z","title":"Why gradient clipping accelerates training: A theoretical justification for adaptivity","version":2},"cited_work":{"arxiv_id":"1905.11881","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1905.11881","snapshot_observed_at":"2026-07-04T10:29:44.281858Z","title":"arXiv preprint arXiv:1905.11881 (2019)","venue":null,"work_id":"fbf2f93c-f73e-413f-b24f-e6153c29bf03","year":1905},"citing_paper":{"arxiv_id":"2606.08783","last_updated":"2026-06-26T09:55:08Z","snapshot_observed_at":"2026-07-06T23:48:11.819398Z","submitted_at":"2026-06-07T18:59:24Z","title":"OptMuon: Closed-Loop Orthogonalized Momentum Methods for Stochastic Optimization with Zero-Noise Optimality","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-06-27T17:47:21.377462Z"},"links":{"cited_paper":"/paper/1905.11881","citing_paper":"/paper/2606.08783"},"observation_digest":"sha256:36349fadbeb8f1b0ae903c6a33889ae513540e33886b7fb97904b95b9d2f4b9e","observation_id":"6e469f61-157a-4e59-8fdb-41d608a47084","resolution":{"observed_at":"2026-07-02T23:47:28.508872Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1905.11881","last_updated":"2020-02-10T22:58:53Z","snapshot_observed_at":"2026-08-14T16:25:08.350015Z","submitted_at":"2019-05-28T15:23:12Z","title":"Why gradient clipping accelerates training: A theoretical justification for adaptivity","version":2},"cited_work":{"arxiv_id":"1905.11881","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1905.11881","snapshot_observed_at":"2026-07-04T10:29:44.281858Z","title":"arXiv preprint arXiv:1905.11881 (2019)","venue":null,"work_id":"fbf2f93c-f73e-413f-b24f-e6153c29bf03","year":1905},"citing_paper":{"arxiv_id":"2606.08783","last_updated":"2026-06-26T09:55:08Z","snapshot_observed_at":"2026-07-06T23:48:11.819398Z","submitted_at":"2026-06-07T18:59:24Z","title":"OptMuon: Closed-Loop Orthogonalized Momentum Methods for Stochastic Optimization with Zero-Noise Optimality","version":2},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-06-29T05:33:27.870787Z"},"links":{"cited_paper":"/paper/1905.11881","citing_paper":"/paper/2606.08783"},"observation_digest":"sha256:2937ac05b8bdf1683644f428539c274e9a9918ff7520d1e02157c36918f3fe3a","observation_id":"8a83ebba-1dcb-48fe-befc-68fd16b15394","resolution":{"observed_at":"2026-06-29T05:43:08.831493Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1905.11881","last_updated":"2020-02-10T22:58:53Z","snapshot_observed_at":"2026-08-14T16:25:08.350015Z","submitted_at":"2019-05-28T15:23:12Z","title":"Why gradient clipping accelerates training: A theoretical justification for adaptivity","version":2},"cited_work":{"arxiv_id":"1905.11881","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1905.11881","snapshot_observed_at":"2026-07-04T10:29:44.281858Z","title":"arXiv preprint arXiv:1905.11881 (2019)","venue":null,"work_id":"fbf2f93c-f73e-413f-b24f-e6153c29bf03","year":1905},"citing_paper":{"arxiv_id":"2606.21581","last_updated":"2026-06-19T16:36:53Z","snapshot_observed_at":"2026-07-06T23:56:35.743669Z","submitted_at":"2026-06-19T16:36:53Z","title":"Convergence Analysis of Muon-type Methods with Inexact LMO in the Degenerate Case","version":1},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-06-26T13:28:36.618788Z"},"links":{"cited_paper":"/paper/1905.11881","citing_paper":"/paper/2606.21581"},"observation_digest":"sha256:1970f3762671143e8195bf6566264e90ccdd4564f4f94232a6ab5ac28bf14fdb","observation_id":"73ab61f4-3356-4830-8d1d-e42820f50ce0","resolution":{"observed_at":"2026-07-04T07:29:38.574235Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1905.11881","last_updated":"2020-02-10T22:58:53Z","snapshot_observed_at":"2026-08-14T16:25:08.350015Z","submitted_at":"2019-05-28T15:23:12Z","title":"Why gradient clipping accelerates training: A theoretical justification for adaptivity","version":2},"cited_work":{"arxiv_id":"1905.11881","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1905.11881","snapshot_observed_at":"2026-07-04T10:29:44.281858Z","title":"arXiv preprint arXiv:1905.11881 (2019)","venue":null,"work_id":"fbf2f93c-f73e-413f-b24f-e6153c29bf03","year":1905},"citing_paper":{"arxiv_id":"2606.22436","last_updated":"2026-06-21T10:57:37Z","snapshot_observed_at":"2026-08-08T03:08:35.933225Z","submitted_at":"2026-06-21T10:57:37Z","title":"Distribution-Aware Robust Bilevel Optimization: Quantile-Guided Huber Updates in Two-Timescale Stochastic Approximation","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-06-26T10:53:12.577252Z"},"links":{"cited_paper":"/paper/1905.11881","citing_paper":"/paper/2606.22436"},"observation_digest":"sha256:89f3a84889c3387c5ff52cacdf35872ceb32e301e6ab78435ecf13ad2cd589e2","observation_id":"c557f51f-2960-4e93-ba02-ec489e64a96d","resolution":{"observed_at":"2026-07-04T08:49:42.561321Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1905.11881","last_updated":"2020-02-10T22:58:53Z","snapshot_observed_at":"2026-08-14T16:25:08.350015Z","submitted_at":"2019-05-28T15:23:12Z","title":"Why gradient clipping accelerates training: A theoretical justification for adaptivity","version":2},"cited_work":{"arxiv_id":"1905.11881","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1905.11881","snapshot_observed_at":"2026-07-04T10:29:44.281858Z","title":"arXiv preprint arXiv:1905.11881 (2019)","venue":null,"work_id":"fbf2f93c-f73e-413f-b24f-e6153c29bf03","year":1905},"citing_paper":{"arxiv_id":"2606.23364","last_updated":"2026-06-22T14:00:26Z","snapshot_observed_at":"2026-08-02T17:37:15.368213Z","submitted_at":"2026-06-22T14:00:26Z","title":"Convergence of Gradient Descent for General Neural Network Architectures Beyond the NTK Regime","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-06-26T08:53:46.285233Z"},"links":{"cited_paper":"/paper/1905.11881","citing_paper":"/paper/2606.23364"},"observation_digest":"sha256:adcae7ad073c89545cc562727e1d7eaabef758c439035eed5ff14d8adba57715","observation_id":"b6e209a2-7cf9-497d-be8d-99afaaff0f66","resolution":{"observed_at":"2026-07-04T10:29:44.283468Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1905.11881","last_updated":"2020-02-10T22:58:53Z","snapshot_observed_at":"2026-08-14T16:25:08.350015Z","submitted_at":"2019-05-28T15:23:12Z","title":"Why gradient clipping accelerates training: A theoretical justification for adaptivity","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.11881","snapshot_observed_at":"2026-07-30T15:28:01.828654Z","title":null,"venue":null,"work_id":null,"year":1905},"citing_paper":{"arxiv_id":"2607.26969","last_updated":"2026-08-04T19:16:45Z","snapshot_observed_at":"2026-08-10T03:40:34.297184Z","submitted_at":"2026-07-29T14:31:24Z","title":"Normalized First-Order Methods for Convex (L0, L1)-Smooth Optimization with Inexact Gradients","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-30T15:28:01.828654Z"},"links":{"cited_paper":"/paper/1905.11881","citing_paper":"/paper/2607.26969"},"observation_digest":"sha256:80cc9d94afa9fd087f1db40cde4562bb1007652eaf83e46cd5713f195606d4d9","observation_id":"68b1d868-e1bd-4e9d-9caf-4d5fa53315b6","resolution":{"observed_at":"2026-07-30T15:28:01.828654Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1905.11881","last_updated":"2020-02-10T22:58:53Z","snapshot_observed_at":"2026-08-14T16:25:08.350015Z","submitted_at":"2019-05-28T15:23:12Z","title":"Why gradient clipping accelerates training: A theoretical justification for adaptivity","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.11881","snapshot_observed_at":"2026-08-01T08:37:47.304471Z","title":"Why gradient clipping accelerates training: A theoretical justification for adaptivity.arXiv preprint arXiv:1905.11881,","venue":null,"work_id":null,"year":1905},"citing_paper":{"arxiv_id":"2607.27383","last_updated":"2026-08-02T16:57:14Z","snapshot_observed_at":"2026-08-10T03:03:22.395909Z","submitted_at":"2026-07-29T18:42:35Z","title":"The Convergence Behavior of Adam under Heavy-Tailed Noise","version":1},"reference_index":2026,"source":"pdf_text","source_observed_at":"2026-08-01T08:37:47.304471Z"},"links":{"cited_paper":"/paper/1905.11881","citing_paper":"/paper/2607.27383"},"observation_digest":"sha256:01a083385bff272035c10c467df8d26b61ad4d7fb69cf46332222c64bafaf943","observation_id":"d7b0e0c6-7989-44c1-b181-901f25227c23","resolution":{"observed_at":"2026-08-01T08:37:47.304471Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1905.11881","last_updated":"2020-02-10T22:58:53Z","snapshot_observed_at":"2026-08-14T16:25:08.350015Z","submitted_at":"2019-05-28T15:23:12Z","title":"Why gradient clipping accelerates training: A theoretical justification for adaptivity","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.11881","snapshot_observed_at":"2026-08-04T03:30:54.243075Z","title":"Why gradient clipping accelerates training: A theoretical justification for adaptivity.arXiv preprint arXiv:1905.11881,","venue":null,"work_id":null,"year":1905},"citing_paper":{"arxiv_id":"2607.27383","last_updated":"2026-08-02T16:57:14Z","snapshot_observed_at":"2026-08-10T03:03:22.395909Z","submitted_at":"2026-07-29T18:42:35Z","title":"The Convergence Behavior of Adam under Heavy-Tailed Noise","version":2},"reference_index":2026,"source":"pdf_text","source_observed_at":"2026-08-04T03:30:54.243075Z"},"links":{"cited_paper":"/paper/1905.11881","citing_paper":"/paper/2607.27383"},"observation_digest":"sha256:5da8f4c4880b6f7fc38caf41cee9e0c5ff2130ea906ea4b318d9a64fa5db9af6","observation_id":"94d398b3-5b16-44b0-ada8-31b52e053153","resolution":{"observed_at":"2026-08-04T03:30:54.243075Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1905.11881","last_updated":"2020-02-10T22:58:53Z","snapshot_observed_at":"2026-08-14T16:25:08.350015Z","submitted_at":"2019-05-28T15:23:12Z","title":"Why gradient clipping accelerates training: A theoretical justification for adaptivity","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.11881","snapshot_observed_at":"2026-08-15T14:39:15.174798Z","title":"Why gradi- ent clipping accelerates training: A theoretical justification for adaptivity","venue":null,"work_id":null,"year":1905},"citing_paper":{"arxiv_id":"2608.06563","last_updated":"2026-08-06T20:20:52Z","snapshot_observed_at":"2026-08-15T14:29:18.109897Z","submitted_at":"2026-08-06T20:20:52Z","title":"Theoretical Foundations of Communication-Efficient, Robust, and Practical Distributed and Federated Optimization","version":1},"reference_index":295,"source":"pdf_text","source_observed_at":"2026-08-15T14:39:15.174798Z"},"links":{"cited_paper":"/paper/1905.11881","citing_paper":"/paper/2608.06563"},"observation_digest":"sha256:d8bbc491267a68763727ac7585afdfcb62faedce015ad694a13e4c18a7175c94","observation_id":"31041144-d195-4112-95bd-6db20284ce95","resolution":{"observed_at":"2026-08-15T14:39:15.174798Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/1905.11881/citation-record","integrity":"/paper/1905.11881/integrity","json":"/paper/1905.11881/citation-record.json","paper":"/paper/1905.11881"},"outbound":[],"paper":{"arxiv_id":"1905.11881","last_updated":"2020-02-10T22:58:53Z","latest_version":2,"primary_category":"math.OC","snapshot_observed_at":"2026-08-14T16:25:08.350015Z","submitted_at":"2019-05-28T15:23:12Z","title":"Why gradient clipping accelerates training: A theoretical justification for adaptivity"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 37 inbound Pith citation observations for arXiv:1905.11881."}