{"as_of":"2026-08-22T06:03:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a7f17b9049e16c449bc62d815526f0a6370da2c71d8e96839263314e289c0f6a","coverage":[{"denominator":26,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":26,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-28T18:51:37.230404Z","state":"measured"},{"denominator":26,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":26,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-21T06:32:19.484+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2606.00542/citation-record","integrity":"/paper/2606.00542/integrity","json":"/paper/2606.00542/citation-record.json","paper":"/paper/2606.00542"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T18:51:37.230404Z","title":"ASGO : Adaptive structured gradient optimization","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.00542","last_updated":"2026-06-02T15:25:25Z","snapshot_observed_at":"2026-08-07T13:59:33.285581Z","submitted_at":"2026-05-30T05:17:48Z","title":"Rethinking Bregman Divergences in Kronecker-Factored Optimizers","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-06-28T18:51:37.230404Z"},"links":{"citing_paper":"/paper/2606.00542"},"observation_digest":"sha256:e96a1fb11d67aab84d3271aecdac5d4a44fb80be47cc8426f1ad8c2bf414029a","observation_id":"a26cda3a-c27b-4072-b428-8251cab86500","resolution":{"observed_at":"2026-06-28T18:51:37.230404Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T18:51:37.230404Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.00542","last_updated":"2026-06-02T15:25:25Z","snapshot_observed_at":"2026-08-07T13:59:33.285581Z","submitted_at":"2026-05-30T05:17:48Z","title":"Rethinking Bregman Divergences in Kronecker-Factored Optimizers","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-06-28T18:51:37.230404Z"},"links":{"citing_paper":"/paper/2606.00542"},"observation_digest":"sha256:2107381352461b2e51a12490b0241a64b3f25edb4443e43e74dfd725a318b75c","observation_id":"0f430907-0350-4330-9008-5635e73544e3","resolution":{"observed_at":"2026-06-28T18:51:37.230404Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T18:51:37.230404Z","title":"Turner, and Hao-Jun Michael Shi","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.00542","last_updated":"2026-06-02T15:25:25Z","snapshot_observed_at":"2026-08-07T13:59:33.285581Z","submitted_at":"2026-05-30T05:17:48Z","title":"Rethinking Bregman Divergences in Kronecker-Factored Optimizers","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-06-28T18:51:37.230404Z"},"links":{"citing_paper":"/paper/2606.00542"},"observation_digest":"sha256:55a1db6b015509271837bc3ab69cce5cdd773982647d14127d2366b70649631f","observation_id":"745a3180-de59-4feb-bbb5-3946fac6ed23","resolution":{"observed_at":"2026-06-28T18:51:37.230404Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T18:51:37.230404Z","title":"Shampoo: Preconditioned stochastic tensor optimization","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2606.00542","last_updated":"2026-06-02T15:25:25Z","snapshot_observed_at":"2026-08-07T13:59:33.285581Z","submitted_at":"2026-05-30T05:17:48Z","title":"Rethinking Bregman Divergences in Kronecker-Factored Optimizers","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-06-28T18:51:37.230404Z"},"links":{"citing_paper":"/paper/2606.00542"},"observation_digest":"sha256:d04df51a4d1f72c8b4b3837954428634f8e181182fc5dbb8df230555b814576b","observation_id":"4153d71b-0560-4f59-86ac-75db167f5ba3","resolution":{"observed_at":"2026-06-28T18:51:37.230404Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1812.04754","last_updated":"2018-12-12T00:36:17Z","snapshot_observed_at":"2026-08-14T17:44:58.723571Z","submitted_at":"2018-12-12T00:36:17Z","title":"Gradient Descent Happens in a Tiny Subspace","version":1},"cited_work":{"arxiv_id":"1812.04754","doi":null,"metadata_source":"pith","pith_arxiv_id":"1812.04754","snapshot_observed_at":"2026-07-10T16:57:24.483104Z","title":"Gradient Descent Happens in a Tiny Subspace","venue":"cs.LG","work_id":"4c83c7ac-e217-4d73-b433-14f6b522da36","year":2018},"citing_paper":{"arxiv_id":"2606.00542","last_updated":"2026-06-02T15:25:25Z","snapshot_observed_at":"2026-08-07T13:59:33.285581Z","submitted_at":"2026-05-30T05:17:48Z","title":"Rethinking Bregman Divergences in Kronecker-Factored Optimizers","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-06-28T18:51:37.230404Z"},"links":{"cited_paper":"/paper/1812.04754","citing_paper":"/paper/2606.00542"},"observation_digest":"sha256:6f90cce1d6c248b07d15fe38ea7d5c1100132806e091d50ab1a8dbdeadb6f20e","observation_id":"f5bf783f-a1be-4e9b-9b2c-537179ce6f4e","resolution":{"observed_at":"2026-06-28T19:52:35.336533Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T18:51:37.230404Z","title":"Muon: An optimizer for hidden layers in neural networks, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.00542","last_updated":"2026-06-02T15:25:25Z","snapshot_observed_at":"2026-08-07T13:59:33.285581Z","submitted_at":"2026-05-30T05:17:48Z","title":"Rethinking Bregman Divergences in Kronecker-Factored Optimizers","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-06-28T18:51:37.230404Z"},"links":{"citing_paper":"/paper/2606.00542"},"observation_digest":"sha256:c2c1f6022c293c8b0ccefefafd66e9660c2cce536c11806da849650882de4363","observation_id":"274f45da-84d5-4d1d-b3df-fd85c48deaea","resolution":{"observed_at":"2026-06-28T18:51:37.230404Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T18:51:37.230404Z","title":"Yang, Zachary Nado, Sourabh Medapati, Philipp Hennig, Michael Rabbat, and George E","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.00542","last_updated":"2026-06-02T15:25:25Z","snapshot_observed_at":"2026-08-07T13:59:33.285581Z","submitted_at":"2026-05-30T05:17:48Z","title":"Rethinking Bregman Divergences in Kronecker-Factored Optimizers","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-06-28T18:51:37.230404Z"},"links":{"citing_paper":"/paper/2606.00542"},"observation_digest":"sha256:eff0778ba90b23868d4dd62b119156e7d50f023419c97db04f55caa421abbdc6","observation_id":"84058f33-fcce-4c74-b103-608709bd2c3f","resolution":{"observed_at":"2026-06-28T18:51:37.230404Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.16981","doi":"10.48550/arxiv.2510.16981","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2510.16981 , year=","venue":"ArXiv.org","work_id":"15052c26-b8e7-4957-ac0e-9af367d68fdf","year":2025},"citing_paper":{"arxiv_id":"2606.00542","last_updated":"2026-06-02T15:25:25Z","snapshot_observed_at":"2026-08-07T13:59:33.285581Z","submitted_at":"2026-05-30T05:17:48Z","title":"Rethinking Bregman Divergences in Kronecker-Factored Optimizers","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-06-28T18:51:37.230404Z"},"links":{"citing_paper":"/paper/2606.00542"},"observation_digest":"sha256:e4bac8d7388e5b7848bf1ac1766d9657de04c31c402c153f18f6d33357e288a1","observation_id":"80c3ab90-7dac-4a56-a057-d47e07ec5932","resolution":{"observed_at":"2026-06-28T19:52:35.330523Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T18:51:37.230404Z","title":"Adam: A method for stochastic optimization","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2606.00542","last_updated":"2026-06-02T15:25:25Z","snapshot_observed_at":"2026-08-07T13:59:33.285581Z","submitted_at":"2026-05-30T05:17:48Z","title":"Rethinking Bregman Divergences in Kronecker-Factored Optimizers","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-06-28T18:51:37.230404Z"},"links":{"citing_paper":"/paper/2606.00542"},"observation_digest":"sha256:92ec96017f595e38bf88407fd5e15728e8e21b8fdf4311476729290d0aa1a109","observation_id":"e2164c44-f190-4bf8-aeb5-317f68126685","resolution":{"observed_at":"2026-06-28T18:51:37.230404Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T18:51:37.230404Z","title":"Limitations of the empirical fisher approximation for natural gradient descent","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2606.00542","last_updated":"2026-06-02T15:25:25Z","snapshot_observed_at":"2026-08-07T13:59:33.285581Z","submitted_at":"2026-05-30T05:17:48Z","title":"Rethinking Bregman Divergences in Kronecker-Factored Optimizers","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-06-28T18:51:37.230404Z"},"links":{"citing_paper":"/paper/2606.00542"},"observation_digest":"sha256:912654f454ee35c718e20e53aeea4ed6c9b7b757d800082f14ef2d7fad6b564d","observation_id":"f2a6292c-7d31-4d3c-970a-4543308ae124","resolution":{"observed_at":"2026-06-28T18:51:37.230404Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T18:51:37.230404Z","title":"Lowe, Felix Dangel, Runa Eschenhagen, Zikun Xu, and Roger Baker Grosse","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.00542","last_updated":"2026-06-02T15:25:25Z","snapshot_observed_at":"2026-08-07T13:59:33.285581Z","submitted_at":"2026-05-30T05:17:48Z","title":"Rethinking Bregman Divergences in Kronecker-Factored Optimizers","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-06-28T18:51:37.230404Z"},"links":{"citing_paper":"/paper/2606.00542"},"observation_digest":"sha256:f6d68efe3bd83315be1169115d4dc49e139dbafe8df54610bd233195dc0987cc","observation_id":"58c045b2-ed9b-4fbc-bf23-899a38e713cf","resolution":{"observed_at":"2026-06-28T18:51:37.230404Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T18:51:37.230404Z","title":"Decoupled weight decay regularization","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2606.00542","last_updated":"2026-06-02T15:25:25Z","snapshot_observed_at":"2026-08-07T13:59:33.285581Z","submitted_at":"2026-05-30T05:17:48Z","title":"Rethinking Bregman Divergences in Kronecker-Factored Optimizers","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-06-28T18:51:37.230404Z"},"links":{"citing_paper":"/paper/2606.00542"},"observation_digest":"sha256:b4e46965dee0446d80f2220cb61e855d408f8e1bfae6d94ed6445494ff6ab570","observation_id":"91f9f3eb-44fa-45d1-b11c-15923fd66d42","resolution":{"observed_at":"2026-06-28T18:51:37.230404Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T18:51:37.230404Z","title":"Optimizing neural networks with kronecker-factored approximate curvature","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2606.00542","last_updated":"2026-06-02T15:25:25Z","snapshot_observed_at":"2026-08-07T13:59:33.285581Z","submitted_at":"2026-05-30T05:17:48Z","title":"Rethinking Bregman Divergences in Kronecker-Factored Optimizers","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-06-28T18:51:37.230404Z"},"links":{"citing_paper":"/paper/2606.00542"},"observation_digest":"sha256:ce6e0c50a826c944a0c3dfe4ec771c380fc3b74860e0028bafbf8d32bd49cc89","observation_id":"d2d7a0bd-28c8-4653-8705-afa77104c650","resolution":{"observed_at":"2026-06-28T18:51:37.230404Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T18:51:37.230404Z","title":"A new perspective on shampoo's preconditioner","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.00542","last_updated":"2026-06-02T15:25:25Z","snapshot_observed_at":"2026-08-07T13:59:33.285581Z","submitted_at":"2026-05-30T05:17:48Z","title":"Rethinking Bregman Divergences in Kronecker-Factored Optimizers","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-06-28T18:51:37.230404Z"},"links":{"citing_paper":"/paper/2606.00542"},"observation_digest":"sha256:eb177de3c82df130b5d50782bac58b8ba193c9e737b191695907a2518c08add1","observation_id":"1224fc82-45f1-42a6-acee-463ebd212618","resolution":{"observed_at":"2026-06-28T18:51:37.230404Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T18:51:37.230404Z","title":"Does sgd really happen in tiny subspaces? In 13th International Conference on Learning Representations","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.00542","last_updated":"2026-06-02T15:25:25Z","snapshot_observed_at":"2026-08-07T13:59:33.285581Z","submitted_at":"2026-05-30T05:17:48Z","title":"Rethinking Bregman Divergences in Kronecker-Factored Optimizers","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-06-28T18:51:37.230404Z"},"links":{"citing_paper":"/paper/2606.00542"},"observation_digest":"sha256:6a6dd4994cb07756aac3815659e2ebecaecfb5939aeb6b5022740ade17e014ec","observation_id":"c8563f8f-840c-4fb5-a933-c4dd23cc39eb","resolution":{"observed_at":"2026-06-28T18:51:37.230404Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T18:51:37.230404Z","title":"On the interplay between noise and curvature and its effect on optimization and generalization","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2606.00542","last_updated":"2026-06-02T15:25:25Z","snapshot_observed_at":"2026-08-07T13:59:33.285581Z","submitted_at":"2026-05-30T05:17:48Z","title":"Rethinking Bregman Divergences in Kronecker-Factored Optimizers","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-06-28T18:51:37.230404Z"},"links":{"citing_paper":"/paper/2606.00542"},"observation_digest":"sha256:5038705324ce5632a3192ec7c7b514816601a33ee8a6156d6307953f71004a3a","observation_id":"e43a6d8b-94a7-484f-a71d-d8c6c280601e","resolution":{"observed_at":"2026-06-28T18:51:37.230404Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T18:51:37.230404Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.00542","last_updated":"2026-06-02T15:25:25Z","snapshot_observed_at":"2026-08-07T13:59:33.285581Z","submitted_at":"2026-05-30T05:17:48Z","title":"Rethinking Bregman Divergences in Kronecker-Factored Optimizers","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-06-28T18:51:37.230404Z"},"links":{"citing_paper":"/paper/2606.00542"},"observation_digest":"sha256:968367b5676c4f237273ea6415490dcefbeb1e6743d6656342890ce2644e9c9c","observation_id":"4ffb2bd3-525f-4d46-86ed-b46ca3976675","resolution":{"observed_at":"2026-06-28T18:51:37.230404Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T18:51:37.230404Z","title":"The sharpness disparity principle in transformers for accelerating language model pre-training","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.00542","last_updated":"2026-06-02T15:25:25Z","snapshot_observed_at":"2026-08-07T13:59:33.285581Z","submitted_at":"2026-05-30T05:17:48Z","title":"Rethinking Bregman Divergences in Kronecker-Factored Optimizers","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-06-28T18:51:37.230404Z"},"links":{"citing_paper":"/paper/2606.00542"},"observation_digest":"sha256:3f3e518ed9fad1d6b96200c7e75d16d9591dfd5faa0e1f11ccffe70a209e878e","observation_id":"7c5f60c7-2d40-4962-b601-6d971d4b339b","resolution":{"observed_at":"2026-06-28T18:51:37.230404Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T18:51:37.230404Z","title":"Understanding warmup-stable-decay learning rates: A river valley loss landscape view","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.00542","last_updated":"2026-06-02T15:25:25Z","snapshot_observed_at":"2026-08-07T13:59:33.285581Z","submitted_at":"2026-05-30T05:17:48Z","title":"Rethinking Bregman Divergences in Kronecker-Factored Optimizers","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-06-28T18:51:37.230404Z"},"links":{"citing_paper":"/paper/2606.00542"},"observation_digest":"sha256:32b7dd1eadb0f38b35a8c7bb1cd46334cc4259ea0a7f1c5a37c509bd1a80eacb","observation_id":"ab861ed9-d794-4359-885e-7e28b1194e48","resolution":{"observed_at":"2026-06-28T18:51:37.230404Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T18:51:37.230404Z","title":"The alignment property of sgd noise and how it helps select flat minima: A stability analysis","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.00542","last_updated":"2026-06-02T15:25:25Z","snapshot_observed_at":"2026-08-07T13:59:33.285581Z","submitted_at":"2026-05-30T05:17:48Z","title":"Rethinking Bregman Divergences in Kronecker-Factored Optimizers","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-06-28T18:51:37.230404Z"},"links":{"citing_paper":"/paper/2606.00542"},"observation_digest":"sha256:ad8569ca353268c7062ee43d7dc2c10be92af585fb4f092a10a4415a7a525dbd","observation_id":"ee9f0a48-5448-4fdb-a79e-65efb26138d1","resolution":{"observed_at":"2026-06-28T18:51:37.230404Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T18:51:37.230404Z","title":"Reddi, Sanjiv Kumar, and Zhiyuan Li","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.00542","last_updated":"2026-06-02T15:25:25Z","snapshot_observed_at":"2026-08-07T13:59:33.285581Z","submitted_at":"2026-05-30T05:17:48Z","title":"Rethinking Bregman Divergences in Kronecker-Factored Optimizers","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-06-28T18:51:37.230404Z"},"links":{"citing_paper":"/paper/2606.00542"},"observation_digest":"sha256:d6aae7b2936d868ce7152ca1aa4d6e043972792ccd80dbec2f48f70e10ae99cf","observation_id":"19809789-42de-478b-994c-9526c5ba1f71","resolution":{"observed_at":"2026-06-28T18:51:37.230404Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2601.08393","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T20:30:07.779389Z","title":"Controlled llm training on spectral sphere","venue":null,"work_id":"69f692bf-c6bb-45da-9428-f2f0a648156c","year":2026},"citing_paper":{"arxiv_id":"2606.00542","last_updated":"2026-06-02T15:25:25Z","snapshot_observed_at":"2026-08-07T13:59:33.285581Z","submitted_at":"2026-05-30T05:17:48Z","title":"Rethinking Bregman Divergences in Kronecker-Factored Optimizers","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-06-28T18:51:37.230404Z"},"links":{"citing_paper":"/paper/2606.00542"},"observation_digest":"sha256:16781638af5c4e1cda411d826aa5cb3c50fd46fe9455c424aa2569b03b1685aa","observation_id":"b0c8a427-3451-47d0-971c-552df71004c8","resolution":{"observed_at":"2026-06-28T19:52:35.324721Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2601.21750","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-01T14:55:48.593553Z","title":"Fismo: Fisher-structured momentum- orthogonalized optimizer.ArXiv, abs/2601.21750","venue":null,"work_id":"b1d555bb-00df-40eb-95ea-5e34a4751f69","year":2026},"citing_paper":{"arxiv_id":"2606.00542","last_updated":"2026-06-02T15:25:25Z","snapshot_observed_at":"2026-08-07T13:59:33.285581Z","submitted_at":"2026-05-30T05:17:48Z","title":"Rethinking Bregman Divergences in Kronecker-Factored Optimizers","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-06-28T18:51:37.230404Z"},"links":{"citing_paper":"/paper/2606.00542"},"observation_digest":"sha256:5ed700b7bba5f639fdcf806c2927d47a51d247dbf45036af6876c29384909615","observation_id":"53888d26-5ccc-45b9-984c-def042bda5b4","resolution":{"observed_at":"2026-06-28T19:52:35.327789Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T18:51:37.230404Z","title":"Bsfa: Leveraging the subspace dichotomy to accelerate neural network training","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.00542","last_updated":"2026-06-02T15:25:25Z","snapshot_observed_at":"2026-08-07T13:59:33.285581Z","submitted_at":"2026-05-30T05:17:48Z","title":"Rethinking Bregman Divergences in Kronecker-Factored Optimizers","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-06-28T18:51:37.230404Z"},"links":{"citing_paper":"/paper/2606.00542"},"observation_digest":"sha256:71480a57d7df16361f6aae343e5c95c042520cd232a8090e3bae739a51439470","observation_id":"3228543d-166c-44e8-a593-920d8b5d7fd4","resolution":{"observed_at":"2026-06-28T18:51:37.230404Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2602.22681","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T06:29:38.137309Z","title":"arXiv preprint arXiv:2602.22681 , year=","venue":null,"work_id":"a4ad176e-d8f6-4dfb-a868-35f0093833da","year":2026},"citing_paper":{"arxiv_id":"2606.00542","last_updated":"2026-06-02T15:25:25Z","snapshot_observed_at":"2026-08-07T13:59:33.285581Z","submitted_at":"2026-05-30T05:17:48Z","title":"Rethinking Bregman Divergences in Kronecker-Factored Optimizers","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-06-28T18:51:37.230404Z"},"links":{"citing_paper":"/paper/2606.00542"},"observation_digest":"sha256:6c764333afadc4b4c101e7193e5e4d1d6d5fcfbc1b3a5a89b758502ec4967fbb","observation_id":"eee0867e-2477-4ce7-abf3-48256660f97c","resolution":{"observed_at":"2026-06-28T19:52:35.333419Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T18:51:37.230404Z","title":"The anisotropic noise in stochastic gradient descent: Its behavior of escaping from sharp minima and regularization effects","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2606.00542","last_updated":"2026-06-02T15:25:25Z","snapshot_observed_at":"2026-08-07T13:59:33.285581Z","submitted_at":"2026-05-30T05:17:48Z","title":"Rethinking Bregman Divergences in Kronecker-Factored Optimizers","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-06-28T18:51:37.230404Z"},"links":{"citing_paper":"/paper/2606.00542"},"observation_digest":"sha256:36095fb2bea968bbcd7127aa2449f29ab4994f1f6f74d0372624be86f43621c3","observation_id":"6db2095f-8197-4b16-8628-b5f480511d67","resolution":{"observed_at":"2026-06-28T18:51:37.230404Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2606.00542","last_updated":"2026-06-02T15:25:25Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-07T13:59:33.285581Z","submitted_at":"2026-05-30T05:17:48Z","title":"Rethinking Bregman Divergences in Kronecker-Factored Optimizers"},"reference_resolution":{"displayed":26,"state_counts":{"malformed_identifier":0,"metadata_mismatch":2,"parse_uncertain":0,"unresolved":21,"verified_exact":3,"verified_fuzzy":0},"total_outbound_references":26},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"thesis":"As of 22 August 2026, this Paper Citation Record lists 26 of 26 outbound references and 0 inbound Pith citation observations for arXiv:2606.00542."}