{"as_of":"2026-08-10T20:41:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:1e4f4302e22fd78e5ba58bda277c35ea8534a6b5831f8e044d767a22bb7a30fe","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":9,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":9,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":9,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":9,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T21:45:10.173055Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-06-30T14:04:45.249124Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2308.05621","last_updated":"2023-08-10T15:10:08Z","snapshot_observed_at":"2026-08-10T15:16:35.779037Z","submitted_at":"2023-08-10T15:10:08Z","title":"Normalized Gradients for All","version":1},"cited_work":{"arxiv_id":"2308.05621","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2308.05621","snapshot_observed_at":"2026-06-30T14:04:45.249124Z","title":"Nesterov","venue":null,"work_id":"ef0978f5-de28-4fbf-91bc-13ecf3e7acbb","year":2012},"citing_paper":{"arxiv_id":"2502.07529","last_updated":"2025-06-06T13:42:19Z","snapshot_observed_at":"2026-08-03T03:50:14.086851Z","submitted_at":"2025-02-11T13:10:34Z","title":"Training Deep Learning Models with Norm-Constrained LMOs","version":2},"reference_index":201,"source":"arxiv_source","source_observed_at":"2026-05-21T21:22:36.870292Z"},"links":{"cited_paper":"/paper/2308.05621","citing_paper":"/paper/2502.07529"},"observation_digest":"sha256:e35740b20b1ab74c06b5bea6a818b5a2ca5b427df3569c82e65a59c0f72f01d7","observation_id":"b86d2590-5808-45dc-b823-0f3bbfcefae2","resolution":{"observed_at":"2026-05-21T21:22:37.077202Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.05621","last_updated":"2023-08-10T15:10:08Z","snapshot_observed_at":"2026-08-10T15:16:35.779037Z","submitted_at":"2023-08-10T15:10:08Z","title":"Normalized Gradients for All","version":1},"cited_work":{"arxiv_id":"2308.05621","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2308.05621","snapshot_observed_at":"2026-06-30T14:04:45.249124Z","title":"Nesterov","venue":null,"work_id":"ef0978f5-de28-4fbf-91bc-13ecf3e7acbb","year":2012},"citing_paper":{"arxiv_id":"2506.12648","last_updated":"2026-05-15T19:09:03Z","snapshot_observed_at":"2026-08-06T01:54:06.797273Z","submitted_at":"2025-06-14T22:18:53Z","title":"Glocal Smoothness: Line search and adaptive step sizes can help in theory too!","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-22T00:57:03.982703Z"},"links":{"cited_paper":"/paper/2308.05621","citing_paper":"/paper/2506.12648"},"observation_digest":"sha256:1e557f232ee2d975ddba08aa20831e02980fdb172553bd4995bdffc2801646ea","observation_id":"9bb9c299-cac0-4b00-a284-ab1de3f4a0da","resolution":{"observed_at":"2026-05-22T01:00:52.243994Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.05621","last_updated":"2023-08-10T15:10:08Z","snapshot_observed_at":"2026-08-10T15:16:35.779037Z","submitted_at":"2023-08-10T15:10:08Z","title":"Normalized Gradients for All","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.05621","snapshot_observed_at":"2026-08-06T21:45:10.173055Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.23803","last_updated":"2025-06-30T12:47:10Z","snapshot_observed_at":"2026-08-09T12:25:14.601906Z","submitted_at":"2025-06-30T12:47:10Z","title":"SGD with Adaptive Preconditioning: Unified Analysis and Momentum Acceleration","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-06T21:45:10.173055Z"},"links":{"cited_paper":"/paper/2308.05621","citing_paper":"/paper/2506.23803"},"observation_digest":"sha256:41d577fbcd9c296b1b54975dd7015ef9e41e7e6d17b2b62924197b5bc166d7e8","observation_id":"697105f1-47ad-4c49-84b3-236b98b37cd2","resolution":{"observed_at":"2026-08-06T21:45:10.173055Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.05621","last_updated":"2023-08-10T15:10:08Z","snapshot_observed_at":"2026-08-10T15:16:35.779037Z","submitted_at":"2023-08-10T15:10:08Z","title":"Normalized Gradients for All","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.05621","snapshot_observed_at":"2026-08-06T17:59:08.087181Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.09823","last_updated":"2025-08-29T15:15:31Z","snapshot_observed_at":"2026-08-09T11:05:20.331803Z","submitted_at":"2025-07-13T23:07:45Z","title":"Nesterov Finds GRAAL: Optimal and Adaptive Gradient Method for Convex Optimization","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-06T17:59:08.087181Z"},"links":{"cited_paper":"/paper/2308.05621","citing_paper":"/paper/2507.09823"},"observation_digest":"sha256:0273313244c42934d8bb2e15f8610dd6e662c6edf91823d258dabf9adf946ff9","observation_id":"b294c62b-46ac-4af6-8ee9-5afcaa70cf19","resolution":{"observed_at":"2026-08-06T17:59:08.087181Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.05621","last_updated":"2023-08-10T15:10:08Z","snapshot_observed_at":"2026-08-10T15:16:35.779037Z","submitted_at":"2023-08-10T15:10:08Z","title":"Normalized Gradients for All","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.05621","snapshot_observed_at":"2026-08-05T11:25:45.035920Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.02981","last_updated":"2025-09-06T21:55:53Z","snapshot_observed_at":"2026-08-10T00:19:26.172026Z","submitted_at":"2025-09-03T03:42:22Z","title":"AdaGrad Meets Muon: Adaptive Stepsizes for Orthogonal Updates","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-05T11:25:45.035920Z"},"links":{"cited_paper":"/paper/2308.05621","citing_paper":"/paper/2509.02981"},"observation_digest":"sha256:fd6474c1a64f60f2dc59cf52fede0d82043a774e671120ba4b7a883ed942e9f8","observation_id":"11e49d20-8ae1-448d-863e-01dd7de3ab65","resolution":{"observed_at":"2026-08-05T11:25:45.035920Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.05621","last_updated":"2023-08-10T15:10:08Z","snapshot_observed_at":"2026-08-10T15:16:35.779037Z","submitted_at":"2023-08-10T15:10:08Z","title":"Normalized Gradients for All","version":1},"cited_work":{"arxiv_id":"2308.05621","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2308.05621","snapshot_observed_at":"2026-06-30T14:04:45.249124Z","title":"Nesterov","venue":null,"work_id":"ef0978f5-de28-4fbf-91bc-13ecf3e7acbb","year":2012},"citing_paper":{"arxiv_id":"2604.02505","last_updated":"2026-04-02T21:02:10Z","snapshot_observed_at":"2026-07-06T22:51:53.458444Z","submitted_at":"2026-04-02T21:02:10Z","title":"Optimal Projection-Free Adaptive SGD for Matrix Optimization","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-13T20:56:41.466669Z"},"links":{"cited_paper":"/paper/2308.05621","citing_paper":"/paper/2604.02505"},"observation_digest":"sha256:fe2d4c6ce73a39cc70b96072e78c7c81609180daf3451f81b8746feeb642d5c7","observation_id":"5938504b-6833-4ef0-89df-25d93ece93bc","resolution":{"observed_at":"2026-05-13T20:58:15.730379Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.05621","last_updated":"2023-08-10T15:10:08Z","snapshot_observed_at":"2026-08-10T15:16:35.779037Z","submitted_at":"2023-08-10T15:10:08Z","title":"Normalized Gradients for All","version":1},"cited_work":{"arxiv_id":"2308.05621","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2308.05621","snapshot_observed_at":"2026-06-30T14:04:45.249124Z","title":"Nesterov","venue":null,"work_id":"ef0978f5-de28-4fbf-91bc-13ecf3e7acbb","year":2012},"citing_paper":{"arxiv_id":"2604.06525","last_updated":"2026-04-14T04:56:12Z","snapshot_observed_at":"2026-08-02T21:35:49.903063Z","submitted_at":"2026-04-07T23:43:48Z","title":"Stochastic Auto-conditioned Fast Gradient Methods with Optimal Rates","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-10T18:23:59.771222Z"},"links":{"cited_paper":"/paper/2308.05621","citing_paper":"/paper/2604.06525"},"observation_digest":"sha256:aa4e92bc182e17e70ff6e01715909a06ee46ba7939683e324cacb8c3691d0c21","observation_id":"262390be-1b2b-4bd2-bd3c-461b3dfb44b2","resolution":{"observed_at":"2026-05-11T00:41:05.436600Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.05621","last_updated":"2023-08-10T15:10:08Z","snapshot_observed_at":"2026-08-10T15:16:35.779037Z","submitted_at":"2023-08-10T15:10:08Z","title":"Normalized Gradients for All","version":1},"cited_work":{"arxiv_id":"2308.05621","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2308.05621","snapshot_observed_at":"2026-06-30T14:04:45.249124Z","title":"Nesterov","venue":null,"work_id":"ef0978f5-de28-4fbf-91bc-13ecf3e7acbb","year":2012},"citing_paper":{"arxiv_id":"2604.26867","last_updated":"2026-05-18T20:15:44Z","snapshot_observed_at":"2026-08-05T21:35:22.094908Z","submitted_at":"2026-04-29T16:34:11Z","title":"Function-free Optimization via Comparison Oracles","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-21T00:08:34.431809Z"},"links":{"cited_paper":"/paper/2308.05621","citing_paper":"/paper/2604.26867"},"observation_digest":"sha256:e3ece0d4b600be2f9535d782eb5fc263a1c7efb37769ffb6483b3e52a4c9b947","observation_id":"5e3d897c-ec10-4a8d-bafa-aa34785c4541","resolution":{"observed_at":"2026-05-21T00:09:16.827801Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.05621","last_updated":"2023-08-10T15:10:08Z","snapshot_observed_at":"2026-08-10T15:16:35.779037Z","submitted_at":"2023-08-10T15:10:08Z","title":"Normalized Gradients for All","version":1},"cited_work":{"arxiv_id":"2308.05621","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2308.05621","snapshot_observed_at":"2026-06-30T14:04:45.249124Z","title":"Nesterov","venue":null,"work_id":"ef0978f5-de28-4fbf-91bc-13ecf3e7acbb","year":2012},"citing_paper":{"arxiv_id":"2606.29893","last_updated":"2026-06-29T07:31:55Z","snapshot_observed_at":"2026-08-07T16:39:06.909379Z","submitted_at":"2026-06-29T07:31:55Z","title":"AdaGrad does not adapt to H\\\"older-smoothness for composite objectives","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-06-30T05:37:19.393934Z"},"links":{"cited_paper":"/paper/2308.05621","citing_paper":"/paper/2606.29893"},"observation_digest":"sha256:c82cb22bdc31e0d1f9b477a6b4453b7d4cb0ffecc98140127cbe8126ace70447","observation_id":"9b1d2338-fcbc-4e2b-98a2-94d06fb65a26","resolution":{"observed_at":"2026-06-30T14:04:45.251069Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2308.05621/citation-record","integrity":"/paper/2308.05621/integrity","json":"/paper/2308.05621/citation-record.json","paper":"/paper/2308.05621"},"outbound":[],"paper":{"arxiv_id":"2308.05621","last_updated":"2023-08-10T15:10:08Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-10T15:16:35.779037Z","submitted_at":"2023-08-10T15:10:08Z","title":"Normalized Gradients for All"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 9 inbound Pith citation observations for arXiv:2308.05621."}