{"as_of":"2026-08-10T06:02:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:0443c9daab7c7deb411bd3398a18dce08cdbec16ee922f6aaa518101dc7184d6","coverage":[{"denominator":31,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":31,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T22:36:57.984353Z","state":"measured"},{"denominator":31,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":31,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.18306/citation-record","integrity":"/paper/2607.18306/integrity","json":"/paper/2607.18306/citation-record.json","paper":"/paper/2607.18306"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"1609.04836","last_updated":"2017-02-09T20:38:16Z","snapshot_observed_at":"2026-07-06T05:10:58.923264Z","submitted_at":"2016-09-15T20:03:06Z","title":"On Large-Batch Training for Deep Learning: Generalization Gap and Sharp Minima","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.04836","snapshot_observed_at":"2026-08-01T22:36:55.531930Z","title":"On large-batch training for deep learning: Generalization gap and sharp minima,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.18306","last_updated":"2026-07-17T06:59:02Z","snapshot_observed_at":"2026-08-06T19:11:56.985109Z","submitted_at":"2026-07-17T06:59:02Z","title":"Gradient-Energy Guided Block-Wise Perturbations for Sharpness-Aware Minimization","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-01T22:36:55.531930Z"},"links":{"cited_paper":"/paper/1609.04836","citing_paper":"/paper/2607.18306"},"observation_digest":"sha256:e1b6c25b2e3689685d6e8f81186cad2f81e83db8ae42b687b1d99467d32a7095","observation_id":"7883a0c7-9ed0-4f7c-ac1c-13853bd6f90c","resolution":{"observed_at":"2026-08-01T22:36:55.531930Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1912.02178","last_updated":"2019-12-04T18:58:26Z","snapshot_observed_at":"2026-07-06T08:42:06.688732Z","submitted_at":"2019-12-04T18:58:26Z","title":"Fantastic Generalization Measures and Where to Find Them","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.02178","snapshot_observed_at":"2026-08-01T22:36:55.619690Z","title":"Fantastic generalization measures and where to find them,","venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2607.18306","last_updated":"2026-07-17T06:59:02Z","snapshot_observed_at":"2026-08-06T19:11:56.985109Z","submitted_at":"2026-07-17T06:59:02Z","title":"Gradient-Energy Guided Block-Wise Perturbations for Sharpness-Aware Minimization","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-01T22:36:55.619690Z"},"links":{"cited_paper":"/paper/1912.02178","citing_paper":"/paper/2607.18306"},"observation_digest":"sha256:b27d0d838fc5deb9aae82d6f73ebd0e930460818c27560e1eed384724bb29b3d","observation_id":"69f449ae-a6e7-493f-b30a-cdef1861b5a5","resolution":{"observed_at":"2026-08-01T22:36:55.619690Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T22:36:55.712456Z","title":"Entropy-sgd: Biasing gradient descent into wide valleys,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.18306","last_updated":"2026-07-17T06:59:02Z","snapshot_observed_at":"2026-08-06T19:11:56.985109Z","submitted_at":"2026-07-17T06:59:02Z","title":"Gradient-Energy Guided Block-Wise Perturbations for Sharpness-Aware Minimization","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-01T22:36:55.712456Z"},"links":{"citing_paper":"/paper/2607.18306"},"observation_digest":"sha256:20bb51e5c0e3a22d058aee16307b178ebd2a4efcbfb773bbf59de54432576b69","observation_id":"69fdb958-7d15-4471-b1b5-602c0be13b28","resolution":{"observed_at":"2026-08-01T22:36:55.712456Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.01412","last_updated":"2021-04-29T16:44:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-10-03T19:02:10Z","title":"Sharpness-Aware Minimization for Efficiently Improving Generalization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.01412","snapshot_observed_at":"2026-08-01T22:36:55.759217Z","title":"Sharpness-aware minimization for efficiently improving generalization,","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2607.18306","last_updated":"2026-07-17T06:59:02Z","snapshot_observed_at":"2026-08-06T19:11:56.985109Z","submitted_at":"2026-07-17T06:59:02Z","title":"Gradient-Energy Guided Block-Wise Perturbations for Sharpness-Aware Minimization","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-01T22:36:55.759217Z"},"links":{"cited_paper":"/paper/2010.01412","citing_paper":"/paper/2607.18306"},"observation_digest":"sha256:315394268fd2981025e737e144820a694084148213e8a53841f43991cdfa6118","observation_id":"c13cb5f7-abe7-4a57-b5c1-b8697bb65e63","resolution":{"observed_at":"2026-08-01T22:36:55.759217Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T22:36:55.832850Z","title":"Asam: Adaptive sharpness- aware minimization for scale-invariant learning of deep neural net- works,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.18306","last_updated":"2026-07-17T06:59:02Z","snapshot_observed_at":"2026-08-06T19:11:56.985109Z","submitted_at":"2026-07-17T06:59:02Z","title":"Gradient-Energy Guided Block-Wise Perturbations for Sharpness-Aware Minimization","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-01T22:36:55.832850Z"},"links":{"citing_paper":"/paper/2607.18306"},"observation_digest":"sha256:3dc006bb334c052c488589a66a018d6e14644750f447e03977a774312bf0092f","observation_id":"3db5faff-b6af-4463-bf9c-00e66bb696df","resolution":{"observed_at":"2026-08-01T22:36:55.832850Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.08065","last_updated":"2022-03-19T15:56:32Z","snapshot_observed_at":"2026-07-06T12:48:13.087800Z","submitted_at":"2022-03-15T16:57:59Z","title":"Surrogate Gap Minimization Improves Sharpness-Aware Training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.08065","snapshot_observed_at":"2026-08-01T22:36:55.916937Z","title":"Surrogate gap minimization improves sharpness-aware training,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.18306","last_updated":"2026-07-17T06:59:02Z","snapshot_observed_at":"2026-08-06T19:11:56.985109Z","submitted_at":"2026-07-17T06:59:02Z","title":"Gradient-Energy Guided Block-Wise Perturbations for Sharpness-Aware Minimization","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-01T22:36:55.916937Z"},"links":{"cited_paper":"/paper/2203.08065","citing_paper":"/paper/2607.18306"},"observation_digest":"sha256:87803dd5d2231bdcb5c84fc09209fc7783ea0a4a846d6d07172ccbd47fb16de0","observation_id":"9e851ae5-8054-451c-9c31-d6e90880e71a","resolution":{"observed_at":"2026-08-01T22:36:55.916937Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T22:36:55.991338Z","title":"Fisher sam: Information geometry and sharpness aware minimisation,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.18306","last_updated":"2026-07-17T06:59:02Z","snapshot_observed_at":"2026-08-06T19:11:56.985109Z","submitted_at":"2026-07-17T06:59:02Z","title":"Gradient-Energy Guided Block-Wise Perturbations for Sharpness-Aware Minimization","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-01T22:36:55.991338Z"},"links":{"citing_paper":"/paper/2607.18306"},"observation_digest":"sha256:21c55c181cebbf4651445d241c5718496613edfdafad3f842ec1f28b9fa6253c","observation_id":"efe336a5-e764-4991-8527-35e701aa0f9f","resolution":{"observed_at":"2026-08-01T22:36:55.991338Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T22:36:56.040212Z","title":"Friendly sharpness- aware minimization,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.18306","last_updated":"2026-07-17T06:59:02Z","snapshot_observed_at":"2026-08-06T19:11:56.985109Z","submitted_at":"2026-07-17T06:59:02Z","title":"Gradient-Energy Guided Block-Wise Perturbations for Sharpness-Aware Minimization","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-01T22:36:56.040212Z"},"links":{"citing_paper":"/paper/2607.18306"},"observation_digest":"sha256:dd2cfa48853877870717f1cc35e752d79282ec9ed6ab7ef65b44cb15d9c2a6c1","observation_id":"524253b2-4d5c-4f04-8b84-9a98bdaeba33","resolution":{"observed_at":"2026-08-01T22:36:56.040212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T22:36:56.114849Z","title":"Bilateral sharpness- aware minimization for flatter minima,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.18306","last_updated":"2026-07-17T06:59:02Z","snapshot_observed_at":"2026-08-06T19:11:56.985109Z","submitted_at":"2026-07-17T06:59:02Z","title":"Gradient-Energy Guided Block-Wise Perturbations for Sharpness-Aware Minimization","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-01T22:36:56.114849Z"},"links":{"citing_paper":"/paper/2607.18306"},"observation_digest":"sha256:37ba2646ccde5352b26de08269eb84c7f7f35ce2ae0e498b9182ebdbb8a4b094","observation_id":"085e5e3a-3dd2-40cc-8788-a0e5bbfe130d","resolution":{"observed_at":"2026-08-01T22:36:56.114849Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T22:36:56.177849Z","title":"Limitations of the empirical fisher approximation for natural gradient descent,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.18306","last_updated":"2026-07-17T06:59:02Z","snapshot_observed_at":"2026-08-06T19:11:56.985109Z","submitted_at":"2026-07-17T06:59:02Z","title":"Gradient-Energy Guided Block-Wise Perturbations for Sharpness-Aware Minimization","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-01T22:36:56.177849Z"},"links":{"citing_paper":"/paper/2607.18306"},"observation_digest":"sha256:6e58155a4bf29474193f102d9e7f1733e65d1c82cbe4e0d69b75c0f97dbc1775","observation_id":"41e80aa9-3f2a-4926-a02a-aa8856750b0e","resolution":{"observed_at":"2026-08-01T22:36:56.177849Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.12807","last_updated":"2024-09-03T21:00:39Z","snapshot_observed_at":"2026-07-06T18:17:21.217971Z","submitted_at":"2024-05-21T13:58:17Z","title":"FAdam: Adam is a natural gradient optimizer using diagonal empirical Fisher information","version":11},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.12807","snapshot_observed_at":"2026-08-01T22:36:56.240433Z","title":"Fadam: Adam is a natural gradient optimizer using diagonal empirical fisher information,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.18306","last_updated":"2026-07-17T06:59:02Z","snapshot_observed_at":"2026-08-06T19:11:56.985109Z","submitted_at":"2026-07-17T06:59:02Z","title":"Gradient-Energy Guided Block-Wise Perturbations for Sharpness-Aware Minimization","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-01T22:36:56.240433Z"},"links":{"cited_paper":"/paper/2405.12807","citing_paper":"/paper/2607.18306"},"observation_digest":"sha256:fb0ae45cf9ecf85e97b7f6294c0812c5523b6054026c29030195e4ddec4083e1","observation_id":"a66805d2-b764-47fe-b70c-9439513a0923","resolution":{"observed_at":"2026-08-01T22:36:56.240433Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.03141","last_updated":"2022-05-28T15:35:32Z","snapshot_observed_at":"2026-08-09T06:09:10.757790Z","submitted_at":"2021-10-07T02:20:37Z","title":"Efficient Sharpness-aware Minimization for Improved Training of Neural Networks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.03141","snapshot_observed_at":"2026-08-01T22:36:56.332176Z","title":"Efficient sharpness-aware minimization for improved training of neural networks,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.18306","last_updated":"2026-07-17T06:59:02Z","snapshot_observed_at":"2026-08-06T19:11:56.985109Z","submitted_at":"2026-07-17T06:59:02Z","title":"Gradient-Energy Guided Block-Wise Perturbations for Sharpness-Aware Minimization","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-01T22:36:56.332176Z"},"links":{"cited_paper":"/paper/2110.03141","citing_paper":"/paper/2607.18306"},"observation_digest":"sha256:04618d2dbbf07ddff497fde3e38490404f7840e1b0d6660ead89995d0a891660","observation_id":"07180b4b-a146-4923-ac73-81e69513dbfe","resolution":{"observed_at":"2026-08-01T22:36:56.332176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T22:36:56.435480Z","title":"Towards efficient and scalable sharpness-aware minimization,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.18306","last_updated":"2026-07-17T06:59:02Z","snapshot_observed_at":"2026-08-06T19:11:56.985109Z","submitted_at":"2026-07-17T06:59:02Z","title":"Gradient-Energy Guided Block-Wise Perturbations for Sharpness-Aware Minimization","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-01T22:36:56.435480Z"},"links":{"citing_paper":"/paper/2607.18306"},"observation_digest":"sha256:4f3373fd84761a5d3161bc4e980c3504a1249d936d2c340636cf4c08b9041733","observation_id":"fa9a10ab-2b85-422d-b525-afbffe4c24b6","resolution":{"observed_at":"2026-08-01T22:36:56.435480Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.14647","last_updated":"2023-04-28T06:23:32Z","snapshot_observed_at":"2026-07-06T15:21:04.733820Z","submitted_at":"2023-04-28T06:23:32Z","title":"An Adaptive Policy to Employ Sharpness-Aware Minimization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.14647","snapshot_observed_at":"2026-08-01T22:36:56.572134Z","title":"An adaptive policy to em- ploy sharpness-aware minimization,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.18306","last_updated":"2026-07-17T06:59:02Z","snapshot_observed_at":"2026-08-06T19:11:56.985109Z","submitted_at":"2026-07-17T06:59:02Z","title":"Gradient-Energy Guided Block-Wise Perturbations for Sharpness-Aware Minimization","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-01T22:36:56.572134Z"},"links":{"cited_paper":"/paper/2304.14647","citing_paper":"/paper/2607.18306"},"observation_digest":"sha256:a5093ad7fa2d403f4043cfd57720209edadbbdf155c3fea79e849c35b9e00bc1","observation_id":"bfe5104c-7780-4d3a-9057-ace53e2ab02d","resolution":{"observed_at":"2026-08-01T22:36:56.572134Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.12864","last_updated":"2022-10-23T21:49:58Z","snapshot_observed_at":"2026-08-03T14:29:04.773351Z","submitted_at":"2022-10-23T21:49:58Z","title":"K-SAM: Sharpness-Aware Minimization at the Speed of SGD","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.12864","snapshot_observed_at":"2026-08-01T22:36:56.628358Z","title":"K-sam: Sharpness-aware minimization at the speed of sgd,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.18306","last_updated":"2026-07-17T06:59:02Z","snapshot_observed_at":"2026-08-06T19:11:56.985109Z","submitted_at":"2026-07-17T06:59:02Z","title":"Gradient-Energy Guided Block-Wise Perturbations for Sharpness-Aware Minimization","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-01T22:36:56.628358Z"},"links":{"cited_paper":"/paper/2210.12864","citing_paper":"/paper/2607.18306"},"observation_digest":"sha256:1f788937deb25fc9a11e1304ccf3d5e32bb98da67062ad9362ffaf33319cd915","observation_id":"82c9f727-c6af-4eea-b325-dee97ee3f0b1","resolution":{"observed_at":"2026-08-01T22:36:56.628358Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T22:36:56.673659Z","title":"Sampa: Sharpness-aware minimiza- tion parallelized,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.18306","last_updated":"2026-07-17T06:59:02Z","snapshot_observed_at":"2026-08-06T19:11:56.985109Z","submitted_at":"2026-07-17T06:59:02Z","title":"Gradient-Energy Guided Block-Wise Perturbations for Sharpness-Aware Minimization","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-01T22:36:56.673659Z"},"links":{"citing_paper":"/paper/2607.18306"},"observation_digest":"sha256:74789581f7768da20d0c0131acc09920767614b1b8211882ca80a675864780c5","observation_id":"46744fa7-683b-4537-b47d-3ca64c39c30d","resolution":{"observed_at":"2026-08-01T22:36:56.673659Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T22:36:56.728261Z","title":"Normalization layers are all that sharpness-aware minimization needs,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.18306","last_updated":"2026-07-17T06:59:02Z","snapshot_observed_at":"2026-08-06T19:11:56.985109Z","submitted_at":"2026-07-17T06:59:02Z","title":"Gradient-Energy Guided Block-Wise Perturbations for Sharpness-Aware Minimization","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-01T22:36:56.728261Z"},"links":{"citing_paper":"/paper/2607.18306"},"observation_digest":"sha256:6adb2afede374800a4ee49ff8e8dc8b8aa1ba49ec407f6561cc65ca2fca227cf","observation_id":"16733a06-923a-4104-a693-3c82f0a9d88b","resolution":{"observed_at":"2026-08-01T22:36:56.728261Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T22:36:56.809656Z","title":"The crucial role of normalization in sharpness-aware minimization,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.18306","last_updated":"2026-07-17T06:59:02Z","snapshot_observed_at":"2026-08-06T19:11:56.985109Z","submitted_at":"2026-07-17T06:59:02Z","title":"Gradient-Energy Guided Block-Wise Perturbations for Sharpness-Aware Minimization","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-01T22:36:56.809656Z"},"links":{"citing_paper":"/paper/2607.18306"},"observation_digest":"sha256:3f62912e99208b908afd0c77f7148ae30eecaa0948311baf4cc41c8161a17fab","observation_id":"1e4718cf-678f-4aea-a4ab-60c3e4118d0a","resolution":{"observed_at":"2026-08-01T22:36:56.809656Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.00075","last_updated":"2025-02-10T15:57:43Z","snapshot_observed_at":"2026-08-07T02:45:20.380382Z","submitted_at":"2024-10-31T16:32:04Z","title":"{\\mu}P$^2$: Effective Sharpness Aware Minimization Requires Layerwise Perturbation Scaling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.00075","snapshot_observed_at":"2026-08-01T22:36:56.867802Z","title":"µP 2: Effective sharpness aware minimization requires layerwise perturbation scaling,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.18306","last_updated":"2026-07-17T06:59:02Z","snapshot_observed_at":"2026-08-06T19:11:56.985109Z","submitted_at":"2026-07-17T06:59:02Z","title":"Gradient-Energy Guided Block-Wise Perturbations for Sharpness-Aware Minimization","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-01T22:36:56.867802Z"},"links":{"cited_paper":"/paper/2411.00075","citing_paper":"/paper/2607.18306"},"observation_digest":"sha256:8d0cda1983788c6f00ecda6b1e96f43fc359d0321c4f2a5f929296bc73d4eff5","observation_id":"5e0af7c1-76dc-448c-81f1-15c192d79b3c","resolution":{"observed_at":"2026-08-01T22:36:56.867802Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T22:36:56.962469Z","title":"Make sharpness-aware minimization stronger: A sparsified perturbation ap- proach,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.18306","last_updated":"2026-07-17T06:59:02Z","snapshot_observed_at":"2026-08-06T19:11:56.985109Z","submitted_at":"2026-07-17T06:59:02Z","title":"Gradient-Energy Guided Block-Wise Perturbations for Sharpness-Aware Minimization","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-01T22:36:56.962469Z"},"links":{"citing_paper":"/paper/2607.18306"},"observation_digest":"sha256:502bb673cad7373e9c7a9a70a60b9009bf857317e4c9eb0ae3cd64002e72d5db","observation_id":"63c66f0e-8b21-4185-aaa2-93856f52294f","resolution":{"observed_at":"2026-08-01T22:36:56.962469Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T22:36:57.034234Z","title":"Improving sharpness-aware minimization with fisher mask for better generalization on language models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.18306","last_updated":"2026-07-17T06:59:02Z","snapshot_observed_at":"2026-08-06T19:11:56.985109Z","submitted_at":"2026-07-17T06:59:02Z","title":"Gradient-Energy Guided Block-Wise Perturbations for Sharpness-Aware Minimization","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-01T22:36:57.034234Z"},"links":{"citing_paper":"/paper/2607.18306"},"observation_digest":"sha256:3956a0420f47f9a21827d272670acd81072feb215d30657b3ba473cb23244c17","observation_id":"46490b11-144e-4a63-9a4c-0d7cc5d32e06","resolution":{"observed_at":"2026-08-01T22:36:57.034234Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T22:36:57.095422Z","title":"Layer-wise adaptive gradient norm penalizing method for efficient and accurate deep learning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.18306","last_updated":"2026-07-17T06:59:02Z","snapshot_observed_at":"2026-08-06T19:11:56.985109Z","submitted_at":"2026-07-17T06:59:02Z","title":"Gradient-Energy Guided Block-Wise Perturbations for Sharpness-Aware Minimization","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-01T22:36:57.095422Z"},"links":{"citing_paper":"/paper/2607.18306"},"observation_digest":"sha256:95e9aedc6c6eb381941d0be8c6cdb9ddb5465abcb62aa3c18b6f0db4adf4cae4","observation_id":"10383105-9550-4034-a2d7-c61e26a3e59f","resolution":{"observed_at":"2026-08-01T22:36:57.095422Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T22:36:57.171984Z","title":"Sparse layer sharpness-aware minimization for efficient fine- tuning,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.18306","last_updated":"2026-07-17T06:59:02Z","snapshot_observed_at":"2026-08-06T19:11:56.985109Z","submitted_at":"2026-07-17T06:59:02Z","title":"Gradient-Energy Guided Block-Wise Perturbations for Sharpness-Aware Minimization","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-01T22:36:57.171984Z"},"links":{"citing_paper":"/paper/2607.18306"},"observation_digest":"sha256:aac6123ff7fc2c11b4a8515ce795d45b2d967b83c33b206b6df1202cb19679a3","observation_id":"5e4ae9a8-4e1f-4952-ace6-6125b2eb3676","resolution":{"observed_at":"2026-08-01T22:36:57.171984Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.04623","last_updated":"2018-09-13T09:29:55Z","snapshot_observed_at":"2026-07-06T06:09:11.794595Z","submitted_at":"2017-11-13T15:11:56Z","title":"Three Factors Influencing Minima in SGD","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.04623","snapshot_observed_at":"2026-08-01T22:36:57.245424Z","title":"Three factors influencing minima in sgd,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.18306","last_updated":"2026-07-17T06:59:02Z","snapshot_observed_at":"2026-08-06T19:11:56.985109Z","submitted_at":"2026-07-17T06:59:02Z","title":"Gradient-Energy Guided Block-Wise Perturbations for Sharpness-Aware Minimization","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-01T22:36:57.245424Z"},"links":{"cited_paper":"/paper/1711.04623","citing_paper":"/paper/2607.18306"},"observation_digest":"sha256:78ee6528caafc311bc47e449c4bba753f0819a76307665804c85013d3946c673","observation_id":"575e29f5-1c5b-4645-8711-adb660c55f69","resolution":{"observed_at":"2026-08-01T22:36:57.245424Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T22:36:57.348228Z","title":"Sharpness-aware minimization and the edge of stability,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.18306","last_updated":"2026-07-17T06:59:02Z","snapshot_observed_at":"2026-08-06T19:11:56.985109Z","submitted_at":"2026-07-17T06:59:02Z","title":"Gradient-Energy Guided Block-Wise Perturbations for Sharpness-Aware Minimization","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-01T22:36:57.348228Z"},"links":{"citing_paper":"/paper/2607.18306"},"observation_digest":"sha256:ffc22257cb4eb32cad7260e1923913555e06ff8737c52e6b66e2b95203a4a241","observation_id":"67b51e01-97f2-4f0a-925f-0a7566b752c9","resolution":{"observed_at":"2026-08-01T22:36:57.348228Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T22:36:57.402874Z","title":"Gradient norm aware minimization seeks first-order flatness and improves generalization,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.18306","last_updated":"2026-07-17T06:59:02Z","snapshot_observed_at":"2026-08-06T19:11:56.985109Z","submitted_at":"2026-07-17T06:59:02Z","title":"Gradient-Energy Guided Block-Wise Perturbations for Sharpness-Aware Minimization","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-01T22:36:57.402874Z"},"links":{"citing_paper":"/paper/2607.18306"},"observation_digest":"sha256:914e16fe8744eb00f0a5c563386011484d651f307e7e100e249fc420cdbee0c3","observation_id":"5c574b5e-3ce1-4004-b9f8-4a8cf373f55c","resolution":{"observed_at":"2026-08-01T22:36:57.402874Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T22:36:57.484033Z","title":"Cr-sam: Curvature regularized sharpness-aware minimization,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.18306","last_updated":"2026-07-17T06:59:02Z","snapshot_observed_at":"2026-08-06T19:11:56.985109Z","submitted_at":"2026-07-17T06:59:02Z","title":"Gradient-Energy Guided Block-Wise Perturbations for Sharpness-Aware Minimization","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-01T22:36:57.484033Z"},"links":{"citing_paper":"/paper/2607.18306"},"observation_digest":"sha256:4c31c34f0de889b0321ceaeaf723ee3e54ffac1a11af660767f87e7815d7872b","observation_id":"914cd6a9-d95a-480c-9e88-76b17312cc99","resolution":{"observed_at":"2026-08-01T22:36:57.484033Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-01T22:36:57.539091Z","title":"Adam: A method for stochastic optimization,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2607.18306","last_updated":"2026-07-17T06:59:02Z","snapshot_observed_at":"2026-08-06T19:11:56.985109Z","submitted_at":"2026-07-17T06:59:02Z","title":"Gradient-Energy Guided Block-Wise Perturbations for Sharpness-Aware Minimization","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-01T22:36:57.539091Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/2607.18306"},"observation_digest":"sha256:fb443f6460da605032a6171a766026b60352fe7ceab778fe3a195fde75cbc956","observation_id":"b2e2e549-0f85-4ccc-bcda-1890542e7b78","resolution":{"observed_at":"2026-08-01T22:36:57.539091Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T22:36:57.655265Z","title":"Computing a trust region step,","venue":null,"work_id":null,"year":1983},"citing_paper":{"arxiv_id":"2607.18306","last_updated":"2026-07-17T06:59:02Z","snapshot_observed_at":"2026-08-06T19:11:56.985109Z","submitted_at":"2026-07-17T06:59:02Z","title":"Gradient-Energy Guided Block-Wise Perturbations for Sharpness-Aware Minimization","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-01T22:36:57.655265Z"},"links":{"citing_paper":"/paper/2607.18306"},"observation_digest":"sha256:d67a0bee277ad12d86cca4096c0b6d11473305e3a930ba4449ac0f3c0f63a7fa","observation_id":"c1d0a0c0-cb41-4c1d-ab71-12959f5ed501","resolution":{"observed_at":"2026-08-01T22:36:57.655265Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T22:36:57.826294Z","title":"Pyhessian: Neural networks through the lens of the hessian,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.18306","last_updated":"2026-07-17T06:59:02Z","snapshot_observed_at":"2026-08-06T19:11:56.985109Z","submitted_at":"2026-07-17T06:59:02Z","title":"Gradient-Energy Guided Block-Wise Perturbations for Sharpness-Aware Minimization","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-01T22:36:57.826294Z"},"links":{"citing_paper":"/paper/2607.18306"},"observation_digest":"sha256:c0f8519e37a78775cf76fed06b93d6ead4f7701fc16c393261a98925eadd6e4b","observation_id":"99b83492-f294-4ed9-85bc-09d4f0a14463","resolution":{"observed_at":"2026-08-01T22:36:57.826294Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T22:36:57.984353Z","title":"O2u-net: A simple noisy label detection approach for deep neural networks,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.18306","last_updated":"2026-07-17T06:59:02Z","snapshot_observed_at":"2026-08-06T19:11:56.985109Z","submitted_at":"2026-07-17T06:59:02Z","title":"Gradient-Energy Guided Block-Wise Perturbations for Sharpness-Aware Minimization","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-01T22:36:57.984353Z"},"links":{"citing_paper":"/paper/2607.18306"},"observation_digest":"sha256:968a5bf9ed1a75b91af6c1630e4301cd4e336d33a4f590166c95314d77230e48","observation_id":"656d04cf-bdaa-4ce2-9905-c59e796e3471","resolution":{"observed_at":"2026-08-01T22:36:57.984353Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.18306","last_updated":"2026-07-17T06:59:02Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-06T19:11:56.985109Z","submitted_at":"2026-07-17T06:59:02Z","title":"Gradient-Energy Guided Block-Wise Perturbations for Sharpness-Aware Minimization"},"reference_resolution":{"displayed":31,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":31,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":31},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 31 of 31 outbound references and 0 inbound Pith citation observations for arXiv:2607.18306."}