{"as_of":"2026-08-12T07:40:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:48557f4c397578b107ce5cd7ecd8c82d7d810044e9b3414d046b4cd6575b3bc8","coverage":[{"denominator":16,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":16,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T14:47:46.392025Z","state":"measured"},{"denominator":16,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":16,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2412.11773/citation-record","integrity":"/paper/2412.11773/integrity","json":"/paper/2412.11773/citation-record.json","paper":"/paper/2412.11773"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:47:46.523701Z","title":"For any M ≥ 0, taking ¯T (M ) such that ∥∇f (x ¯T )∥ ≤M, we get f (xT ) − f (x∗) ≤ ℓ(2M ) ∥x0 − x∗∥2 2(T − ¯T (M ) + 1)","venue":null,"work_id":"4e472b8c-1b85-47cf-aeb0-69d69aff310d","year":2008},"citing_paper":{"arxiv_id":"2412.11773","last_updated":"2025-06-27T06:34:09Z","snapshot_observed_at":"2026-08-12T06:39:31.883427Z","submitted_at":"2024-12-16T13:46:02Z","title":"Toward a Unified Theory of Gradient Descent under Generalized Smoothness","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T14:47:46.392025Z"},"links":{"citing_paper":"/paper/2412.11773"},"observation_digest":"sha256:9289cbdff27de79644d8ad286b03042769fa756fe7e96d508167b48efef43658","observation_id":"28a837b3-8d0f-4e12-9adc-e796e768e00e","resolution":{"observed_at":"2026-08-11T14:47:46.527885Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:47:46.578787Z","title":"This function is (3.3, 1)–smooth, meaning we can run Algorithm 1 with ℓ(s) = 3.3 + s","venue":null,"work_id":"1d3b84dc-3cb7-4180-95ca-2e8456cb9c13","year":null},"citing_paper":{"arxiv_id":"2412.11773","last_updated":"2025-06-27T06:34:09Z","snapshot_observed_at":"2026-08-12T06:39:31.883427Z","submitted_at":"2024-12-16T13:46:02Z","title":"Toward a Unified Theory of Gradient Descent under Generalized Smoothness","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T14:47:46.374599Z"},"links":{"citing_paper":"/paper/2412.11773"},"observation_digest":"sha256:657c1c63b4d2ab5a7ae9d7981f773760cc750c67d91470f4f595fe2e5ce71b6e","observation_id":"24cac4c9-6c86-493e-abd1-81a08474564f","resolution":{"observed_at":"2026-08-11T14:47:46.583136Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"0809.0813","last_updated":"2023-01-30T17:20:23Z","snapshot_observed_at":"2026-08-12T06:01:04.800165Z","submitted_at":"2008-09-04T13:48:07Z","title":"Large Deviations of Vector-valued Martingales in 2-Smooth Normed Spaces","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"0809.0813","snapshot_observed_at":"2026-08-11T14:47:46.340297Z","title":"and Nemirovski, A","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.11773","last_updated":"2025-06-27T06:34:09Z","snapshot_observed_at":"2026-08-12T06:39:31.883427Z","submitted_at":"2024-12-16T13:46:02Z","title":"Toward a Unified Theory of Gradient Descent under Generalized Smoothness","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T14:47:46.340297Z"},"links":{"cited_paper":"/paper/0809.0813","citing_paper":"/paper/2412.11773"},"observation_digest":"sha256:fd925766cbf791f0e9add0ae7f97873087dd4132f96e7cf9078b60e8d0838461","observation_id":"94b02397-078e-4add-bcde-fa63625f7551","resolution":{"observed_at":"2026-08-11T14:47:46.340297Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1610.05492","last_updated":"2017-10-30T20:52:14Z","snapshot_observed_at":"2026-07-06T05:15:00.158639Z","submitted_at":"2016-10-18T09:11:51Z","title":"Federated Learning: Strategies for Improving Communication Efficiency","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1610.05492","snapshot_observed_at":"2026-08-11T14:47:46.344761Z","title":"B., Yu, F","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.11773","last_updated":"2025-06-27T06:34:09Z","snapshot_observed_at":"2026-08-12T06:39:31.883427Z","submitted_at":"2024-12-16T13:46:02Z","title":"Toward a Unified Theory of Gradient Descent under Generalized Smoothness","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T14:47:46.344761Z"},"links":{"cited_paper":"/paper/1610.05492","citing_paper":"/paper/2412.11773"},"observation_digest":"sha256:9c0a911b1241dc75e4030dfb9d0fa3f1d655583dc7c944f721fbc3e6a2c29321","observation_id":"798fd856-6e30-4944-bdbe-37cc476a9141","resolution":{"observed_at":"2026-08-11T14:47:46.344761Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10800","last_updated":"2025-03-07T20:23:27Z","snapshot_observed_at":"2026-08-10T07:34:27.890905Z","submitted_at":"2024-10-14T17:57:33Z","title":"Optimizing $(L_0, L_1)$-Smooth Functions by Gradient Methods","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10800","snapshot_observed_at":"2026-08-11T14:47:46.353647Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.11773","last_updated":"2025-06-27T06:34:09Z","snapshot_observed_at":"2026-08-12T06:39:31.883427Z","submitted_at":"2024-12-16T13:46:02Z","title":"Toward a Unified Theory of Gradient Descent under Generalized Smoothness","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T14:47:46.353647Z"},"links":{"cited_paper":"/paper/2410.10800","citing_paper":"/paper/2412.11773"},"observation_digest":"sha256:eadeccb5127640a833d18fbb564b22d2809dc2af47fda5623b54747309cd4aad","observation_id":"e65d4d06-6939-4437-879b-52de45629bef","resolution":{"observed_at":"2026-08-11T14:47:46.353647Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.09074","last_updated":"2024-11-03T14:34:59Z","snapshot_observed_at":"2026-08-12T06:39:49.992112Z","submitted_at":"2024-08-17T02:22:08Z","title":"Gradient-Variation Online Learning under Generalized Smoothness","version":2},"cited_work":{"arxiv_id":"2408.09074","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.09074","snapshot_observed_at":"2026-08-11T14:47:46.439831Z","title":"Gradient-Variation Online Learning under Generalized Smoothness","venue":"cs.LG","work_id":"a553ce1e-c9a6-4ced-abac-2a44b94633e8","year":2024},"citing_paper":{"arxiv_id":"2412.11773","last_updated":"2025-06-27T06:34:09Z","snapshot_observed_at":"2026-08-12T06:39:31.883427Z","submitted_at":"2024-12-16T13:46:02Z","title":"Toward a Unified Theory of Gradient Descent under Generalized Smoothness","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T14:47:46.358018Z"},"links":{"cited_paper":"/paper/2408.09074","citing_paper":"/paper/2412.11773"},"observation_digest":"sha256:4c3a32b702ffe885d57df18a0695e58cd148ba8a1389b9b6787de91ca5a8ac61","observation_id":"396e8e86-8831-423d-8707-c84d8eb55bd0","resolution":{"observed_at":"2026-08-11T14:47:46.446044Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1905.11881","last_updated":"2020-02-10T22:58:53Z","snapshot_observed_at":"2026-08-12T06:39:06.981787Z","submitted_at":"2019-05-28T15:23:12Z","title":"Why gradient clipping accelerates training: A theoretical justification for adaptivity","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.11881","snapshot_observed_at":"2026-08-11T14:47:46.361895Z","title":"Why gradient clipping accelerates training: A theoretical justification for adaptivity","venue":null,"work_id":null,"year":1905},"citing_paper":{"arxiv_id":"2412.11773","last_updated":"2025-06-27T06:34:09Z","snapshot_observed_at":"2026-08-12T06:39:31.883427Z","submitted_at":"2024-12-16T13:46:02Z","title":"Toward a Unified Theory of Gradient Descent under Generalized Smoothness","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T14:47:46.361895Z"},"links":{"cited_paper":"/paper/1905.11881","citing_paper":"/paper/2412.11773"},"observation_digest":"sha256:c8e507e3e49a683f713980ef6ca0edfd35a7440a5fe16c1c9d9612127c874ecb","observation_id":"96fe0dda-9a44-4369-a088-4427ece666d3","resolution":{"observed_at":"2026-08-11T14:47:46.361895Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:47:46.591688Z","title":"Next, we take the step size γk = 1/(800 + 2(2f ′(x0))2) from (Li et al., 2024a) and observe that GD requires at least 20.000 iterations because f ′(x0) is huge","venue":null,"work_id":"3bf3be96-2825-4505-ac35-d62fff7a4cd7","year":2024},"citing_paper":{"arxiv_id":"2412.11773","last_updated":"2025-06-27T06:34:09Z","snapshot_observed_at":"2026-08-12T06:39:31.883427Z","submitted_at":"2024-12-16T13:46:02Z","title":"Toward a Unified Theory of Gradient Descent under Generalized Smoothness","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T14:47:46.370237Z"},"links":{"citing_paper":"/paper/2412.11773"},"observation_digest":"sha256:d0620380ba3b49bfe087b8f75bd5300d2238fec09edbea98fea764f87c3ec51a","observation_id":"4eb5ac19-5ad3-4592-93e8-d45fd3bd0718","resolution":{"observed_at":"2026-08-11T14:47:46.595659Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:47:46.564577Z","title":"Using the standard differential algebra, we can solve it: dg(t) ℓ(∥∇f (x)∥ + g(t)) = dt ⇒ Z t 0 dg(v) ℓ(∥∇f (x)∥ + g(v)) = t ⇒ Z g(t) 0 dv ℓ(∥∇f (x)∥ + v) = t","venue":null,"work_id":"81b34149-afd9-48f6-9941-8edacc7fc57b","year":1919},"citing_paper":{"arxiv_id":"2412.11773","last_updated":"2025-06-27T06:34:09Z","snapshot_observed_at":"2026-08-12T06:39:31.883427Z","submitted_at":"2024-12-16T13:46:02Z","title":"Toward a Unified Theory of Gradient Descent under Generalized Smoothness","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T14:47:46.378443Z"},"links":{"citing_paper":"/paper/2412.11773"},"observation_digest":"sha256:20140445a9b324a2463f40ebc802a370742f2292d5df9cd8f4bb049de3f3748c","observation_id":"de1bb650-520f-4772-b690-52acced1c794","resolution":{"observed_at":"2026-08-11T14:47:46.569462Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:47:46.551307Z","title":null,"venue":null,"work_id":"9929b37c-9eb6-4c65-b94f-e942e971f710","year":2018},"citing_paper":{"arxiv_id":"2412.11773","last_updated":"2025-06-27T06:34:09Z","snapshot_observed_at":"2026-08-12T06:39:31.883427Z","submitted_at":"2024-12-16T13:46:02Z","title":"Toward a Unified Theory of Gradient Descent under Generalized Smoothness","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T14:47:46.383119Z"},"links":{"citing_paper":"/paper/2412.11773"},"observation_digest":"sha256:f8e957f21bc1b40a5ac59100697bd29a028121eaebd69e23874384ad8a26302b","observation_id":"43edb0f4-f171-4a37-9873-2c0ff80b75b9","resolution":{"observed_at":"2026-08-11T14:47:46.555804Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:47:46.537336Z","title":"Due to the strategy from Alg","venue":null,"work_id":"adbe4b59-bd3c-48a7-9e11-8b031833729a","year":2024},"citing_paper":{"arxiv_id":"2412.11773","last_updated":"2025-06-27T06:34:09Z","snapshot_observed_at":"2026-08-12T06:39:31.883427Z","submitted_at":"2024-12-16T13:46:02Z","title":"Toward a Unified Theory of Gradient Descent under Generalized Smoothness","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T14:47:46.387503Z"},"links":{"citing_paper":"/paper/2412.11773"},"observation_digest":"sha256:2edc411a2866f5d0dd799331308ccfea6f8cd28867a8952cc1c8085ab0ff566a","observation_id":"993fdb7d-0f8e-4e28-a9d8-7bc75035d8a6","resolution":{"observed_at":"2026-08-11T14:47:46.542435Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.15010","last_updated":"2024-10-31T15:03:06Z","snapshot_observed_at":"2026-08-07T05:31:10.881567Z","submitted_at":"2024-05-23T19:29:38Z","title":"Parameter-free Clipped Gradient Descent Meets Polyak","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.15010","snapshot_observed_at":"2026-08-11T14:47:46.349125Z","title":"Polyak meets parameter-free clipped gradient descent","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.11773","last_updated":"2025-06-27T06:34:09Z","snapshot_observed_at":"2026-08-12T06:39:31.883427Z","submitted_at":"2024-12-16T13:46:02Z","title":"Toward a Unified Theory of Gradient Descent under Generalized Smoothness","version":2},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-11T14:47:46.349125Z"},"links":{"cited_paper":"/paper/2405.15010","citing_paper":"/paper/2412.11773"},"observation_digest":"sha256:34798617a1495ad3a594ce18762179884bcdd8d91433d7998f0a4ba95c9e952e","observation_id":"0892a7b6-1813-4d05-ad69-5c4ba1b58b0a","resolution":{"observed_at":"2026-08-11T14:47:46.349125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:47:46.604048Z","title":null,"venue":null,"work_id":"f1cdbcbb-1180-4628-ac92-d28a105580de","year":2024},"citing_paper":{"arxiv_id":"2412.11773","last_updated":"2025-06-27T06:34:09Z","snapshot_observed_at":"2026-08-12T06:39:31.883427Z","submitted_at":"2024-12-16T13:46:02Z","title":"Toward a Unified Theory of Gradient Descent under Generalized Smoothness","version":2},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-11T14:47:46.366168Z"},"links":{"citing_paper":"/paper/2412.11773"},"observation_digest":"sha256:7eba69de623c3744815cf72256a3b4fb1ad2ac174683d540506f51915f39470e","observation_id":"9dd21d60-127c-4ee0-b65e-54bccbb5aa1a","resolution":{"observed_at":"2026-08-11T14:47:46.608869Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.14989","last_updated":"2024-12-25T15:02:32Z","snapshot_observed_at":"2026-08-01T19:23:09.616554Z","submitted_at":"2024-09-23T13:11:37Z","title":"Methods for Convex $(L_0,L_1)$-Smooth Optimization: Clipping, Acceleration, and Adaptivity","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.14989","snapshot_observed_at":"2026-08-11T14:47:46.330224Z","title":"Methods for convex (L0, L1)-smooth optimization: Clipping, acceler- ation, and adaptivity","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.11773","last_updated":"2025-06-27T06:34:09Z","snapshot_observed_at":"2026-08-12T06:39:31.883427Z","submitted_at":"2024-12-16T13:46:02Z","title":"Toward a Unified Theory of Gradient Descent under Generalized Smoothness","version":2},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-11T14:47:46.330224Z"},"links":{"cited_paper":"/paper/2409.14989","citing_paper":"/paper/2412.11773"},"observation_digest":"sha256:5e924b16b88707974fa29172c87bca624e17860604062687494a29759cc8305b","observation_id":"8dd84dcc-81f2-49d3-a939-28321be14537","resolution":{"observed_at":"2026-08-11T14:47:46.330224Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:47:46.616764Z","title":"A theoretical study of the(l 0, l1)-smoothness condition in deep learning","venue":null,"work_id":"1d262079-288b-4a7b-bee2-b2533dee5e85","year":2024},"citing_paper":{"arxiv_id":"2412.11773","last_updated":"2025-06-27T06:34:09Z","snapshot_observed_at":"2026-08-12T06:39:31.883427Z","submitted_at":"2024-12-16T13:46:02Z","title":"Toward a Unified Theory of Gradient Descent under Generalized Smoothness","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-11T14:47:46.324863Z"},"links":{"citing_paper":"/paper/2412.11773"},"observation_digest":"sha256:38dc6e31509e12f03994bb354fde9681b1813b0dde2854efa9f58c56ba2c73b3","observation_id":"d5a437c0-4c84-4287-b832-013d350911c3","resolution":{"observed_at":"2026-08-11T14:47:46.621303Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.14045","last_updated":"2024-04-12T15:24:14Z","snapshot_observed_at":"2026-08-03T03:29:13.192119Z","submitted_at":"2024-03-20T23:57:38Z","title":"Accelerated Objective Gap and Gradient Norm Convergence for Gradient Descent via Long Steps","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.14045","snapshot_observed_at":"2026-08-11T14:47:46.334977Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.11773","last_updated":"2025-06-27T06:34:09Z","snapshot_observed_at":"2026-08-12T06:39:31.883427Z","submitted_at":"2024-12-16T13:46:02Z","title":"Toward a Unified Theory of Gradient Descent under Generalized Smoothness","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-11T14:47:46.334977Z"},"links":{"cited_paper":"/paper/2403.14045","citing_paper":"/paper/2412.11773"},"observation_digest":"sha256:4a4eb7ea6781ddf55636510ebc81c867f3c966cbde0e70f189838ecfa9e6a643","observation_id":"dac0dda4-a466-4f9c-9efa-70e19b249496","resolution":{"observed_at":"2026-08-11T14:47:46.334977Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2412.11773","last_updated":"2025-06-27T06:34:09Z","latest_version":2,"primary_category":"math.OC","snapshot_observed_at":"2026-08-12T06:39:31.883427Z","submitted_at":"2024-12-16T13:46:02Z","title":"Toward a Unified Theory of Gradient Descent under Generalized Smoothness"},"reference_resolution":{"displayed":16,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":9,"verified_exact":1,"verified_fuzzy":5},"total_outbound_references":16},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 12 August 2026, this Paper Citation Record lists 16 of 16 outbound references and 0 inbound Pith citation observations for arXiv:2412.11773."}