{"as_of":"2026-08-10T13:26:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:54c94ee9db22231434a9ed2749be3dd493cc32daf9d4c41589b694607183791d","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":6,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":6,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":6,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":6,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T13:10:06.894473Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-02T02:06:26.401747Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2002.11803","last_updated":"2020-02-26T21:42:49Z","snapshot_observed_at":"2026-08-09T02:43:23.661437Z","submitted_at":"2020-02-26T21:42:49Z","title":"Disentangling Adaptive Gradient Methods from Learning Rates","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.11803","snapshot_observed_at":"2026-08-07T13:10:06.894473Z","title":"Disentangling adaptive gradient methods from learning rates.CoRR, abs/2002.11803, 2020","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2505.23081","last_updated":"2025-09-05T02:19:47Z","snapshot_observed_at":"2026-08-08T05:47:28.129882Z","submitted_at":"2025-05-29T04:35:21Z","title":"Gradient Methods with Online Scaling Part I. Theoretical Foundations","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:06.894473Z"},"links":{"cited_paper":"/paper/2002.11803","citing_paper":"/paper/2505.23081"},"observation_digest":"sha256:3072e44adadd21947f51380b73c3ff8739bfad685ecd9dc8dcfe10413df6f400","observation_id":"582a86a0-fd6c-4ea8-b92a-5d0679058bde","resolution":{"observed_at":"2026-08-07T13:10:06.894473Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2002.11803","last_updated":"2020-02-26T21:42:49Z","snapshot_observed_at":"2026-08-09T02:43:23.661437Z","submitted_at":"2020-02-26T21:42:49Z","title":"Disentangling Adaptive Gradient Methods from Learning Rates","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.11803","snapshot_observed_at":"2026-08-07T00:50:29.766980Z","title":"Agarwal, R","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2506.12543","last_updated":"2025-06-14T15:37:31Z","snapshot_observed_at":"2026-08-08T23:08:34.335687Z","submitted_at":"2025-06-14T15:37:31Z","title":"Is your batch size the problem? Revisiting the Adam-SGD gap in language modeling","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T00:50:29.766980Z"},"links":{"cited_paper":"/paper/2002.11803","citing_paper":"/paper/2506.12543"},"observation_digest":"sha256:9fa1f3a9e7d71c91558191fe5bd463efaaf8055f9a78ecea06a039321ce89934","observation_id":"a21bd626-5831-4ece-acb5-d4840f36f7b9","resolution":{"observed_at":"2026-08-07T00:50:29.766980Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2002.11803","last_updated":"2020-02-26T21:42:49Z","snapshot_observed_at":"2026-08-09T02:43:23.661437Z","submitted_at":"2020-02-26T21:42:49Z","title":"Disentangling Adaptive Gradient Methods from Learning Rates","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.11803","snapshot_observed_at":"2026-08-05T11:03:35.039673Z","title":"Disentangling adaptive gradient methods from learning rates","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2509.03378","last_updated":"2026-06-22T12:44:13Z","snapshot_observed_at":"2026-08-05T11:03:31.234845Z","submitted_at":"2025-09-03T14:55:15Z","title":"Understanding and Improving Shampoo and SOAP via Kullback-Leibler Minimization","version":10},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-05T11:03:35.039673Z"},"links":{"cited_paper":"/paper/2002.11803","citing_paper":"/paper/2509.03378"},"observation_digest":"sha256:aa7c987914997beed09b52c088b98f8e4be92893d8b50e9d26836321deb77365","observation_id":"62632e78-14e8-4969-83a4-bddf8105f172","resolution":{"observed_at":"2026-08-05T11:03:35.039673Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2002.11803","last_updated":"2020-02-26T21:42:49Z","snapshot_observed_at":"2026-08-09T02:43:23.661437Z","submitted_at":"2020-02-26T21:42:49Z","title":"Disentangling Adaptive Gradient Methods from Learning Rates","version":1},"cited_work":{"arxiv_id":"2002.11803","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2002.11803","snapshot_observed_at":"2026-07-02T02:06:26.401747Z","title":"Disentangling adaptive gradient methods from learning rates.arXiv preprint arXiv:2002.11803,","venue":null,"work_id":"b9fb822e-8869-4cb1-bf78-9ea130c4acee","year":2002},"citing_paper":{"arxiv_id":"2606.02365","last_updated":"2026-06-01T15:13:28Z","snapshot_observed_at":"2026-08-02T10:19:39.354615Z","submitted_at":"2026-06-01T15:13:28Z","title":"FOAM: Frequency and Operator Error-Based Adaptive Damping Method for Reducing Staleness-Oriented Error for Shampoo","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-06-28T15:49:18.685160Z"},"links":{"cited_paper":"/paper/2002.11803","citing_paper":"/paper/2606.02365"},"observation_digest":"sha256:075a311e2f9997198ce46629739e460e6796292896a73f9592514c25a73d8f6f","observation_id":"b8d34e6a-b4de-43e2-ae92-7328937188ef","resolution":{"observed_at":"2026-07-01T22:06:16.039069Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2002.11803","last_updated":"2020-02-26T21:42:49Z","snapshot_observed_at":"2026-08-09T02:43:23.661437Z","submitted_at":"2020-02-26T21:42:49Z","title":"Disentangling Adaptive Gradient Methods from Learning Rates","version":1},"cited_work":{"arxiv_id":"2002.11803","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2002.11803","snapshot_observed_at":"2026-07-02T02:06:26.401747Z","title":"Disentangling adaptive gradient methods from learning rates.arXiv preprint arXiv:2002.11803,","venue":null,"work_id":"b9fb822e-8869-4cb1-bf78-9ea130c4acee","year":2002},"citing_paper":{"arxiv_id":"2606.04058","last_updated":"2026-06-05T12:50:11Z","snapshot_observed_at":"2026-08-06T02:55:51.608023Z","submitted_at":"2026-06-02T11:31:21Z","title":"Spectral Scaling Laws of Muon","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-28T11:19:05.939340Z"},"links":{"cited_paper":"/paper/2002.11803","citing_paper":"/paper/2606.04058"},"observation_digest":"sha256:7173de8f588d020fa04938522be2b7b61e20fcec652b90ccb3b28af05dcc94ac","observation_id":"1e39e7cc-0d51-4227-aac6-8f11a2e7ad7c","resolution":{"observed_at":"2026-07-02T02:06:26.403597Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2002.11803","last_updated":"2020-02-26T21:42:49Z","snapshot_observed_at":"2026-08-09T02:43:23.661437Z","submitted_at":"2020-02-26T21:42:49Z","title":"Disentangling Adaptive Gradient Methods from Learning Rates","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.11803","snapshot_observed_at":"2026-08-06T05:39:21.617424Z","title":"Disentangling adaptive gradient methods from learning rates","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2608.05088","last_updated":"2026-08-05T17:26:47Z","snapshot_observed_at":"2026-08-10T04:21:57.898620Z","submitted_at":"2026-08-05T17:26:47Z","title":"MALT: Lightweight Curvature-Aware Muon via Diagonal Preconditioning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T05:39:21.617424Z"},"links":{"cited_paper":"/paper/2002.11803","citing_paper":"/paper/2608.05088"},"observation_digest":"sha256:e2047cdc1a1b683653e130a4e9003128ca543466fdd78a031314293bb634107b","observation_id":"38fc84e2-20b4-4c7b-9f19-88a7c61e6d59","resolution":{"observed_at":"2026-08-06T05:39:21.617424Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2002.11803/citation-record","integrity":"/paper/2002.11803/integrity","json":"/paper/2002.11803/citation-record.json","paper":"/paper/2002.11803"},"outbound":[],"paper":{"arxiv_id":"2002.11803","last_updated":"2020-02-26T21:42:49Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-09T02:43:23.661437Z","submitted_at":"2020-02-26T21:42:49Z","title":"Disentangling Adaptive Gradient Methods from Learning Rates"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 6 inbound Pith citation observations for arXiv:2002.11803."}