{"as_of":"2026-08-10T20:48:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:fa628d74461631d09fcc577b70d04122e9e9c695e80677f53606bc5867d52a47","coverage":[{"denominator":32,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":32,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T10:51:39.015136Z","state":"measured"},{"denominator":32,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":32,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2509.03677/citation-record","integrity":"/paper/2509.03677/integrity","json":"/paper/2509.03677/citation-record.json","paper":"/paper/2509.03677"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"1607.06450","last_updated":"2016-07-21T19:57:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-07-21T19:57:52Z","title":"Layer Normalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1607.06450","snapshot_observed_at":"2026-08-05T10:51:38.901558Z","title":"Layer normalization","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2509.03677","last_updated":"2025-09-08T06:17:26Z","snapshot_observed_at":"2026-08-06T07:57:11.469546Z","submitted_at":"2025-09-03T19:54:23Z","title":"Insights from Gradient Dynamics: Gradient Autoscaled Normalization","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-05T10:51:38.901558Z"},"links":{"cited_paper":"/paper/1607.06450","citing_paper":"/paper/2509.03677"},"observation_digest":"sha256:06a33b49cfd9e400df4ffdfc1f6a2b4160649e71b6daccab4dfdeb64f69cdc8b","observation_id":"2e8a9f65-878d-44ad-9fdb-c2c37f4b8f47","resolution":{"observed_at":"2026-08-05T10:51:38.901558Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:51:38.906194Z","title":"Large-scale machine learning with stochastic gradient descent","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2509.03677","last_updated":"2025-09-08T06:17:26Z","snapshot_observed_at":"2026-08-06T07:57:11.469546Z","submitted_at":"2025-09-03T19:54:23Z","title":"Insights from Gradient Dynamics: Gradient Autoscaled Normalization","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-05T10:51:38.906194Z"},"links":{"citing_paper":"/paper/2509.03677"},"observation_digest":"sha256:1b2bffefd0e34dbff172d5a7441d6e1ab6cd7cce73a95df3e82954fb44423796","observation_id":"1407376e-2cff-4088-9ec5-946660a7db70","resolution":{"observed_at":"2026-08-05T10:51:38.906194Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:51:39.380294Z","title":"The tradeoffs of large scale learning","venue":null,"work_id":"7e4ba85f-57fc-4bb0-ace3-ec0e38d13129","year":2007},"citing_paper":{"arxiv_id":"2509.03677","last_updated":"2025-09-08T06:17:26Z","snapshot_observed_at":"2026-08-06T07:57:11.469546Z","submitted_at":"2025-09-03T19:54:23Z","title":"Insights from Gradient Dynamics: Gradient Autoscaled Normalization","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-05T10:51:38.909953Z"},"links":{"citing_paper":"/paper/2509.03677"},"observation_digest":"sha256:0c94df63f1db71518c65b2d40bc8b793e72cc925e4cd465b82222bffec4d8c68","observation_id":"1cca347b-b28b-4c88-b834-82b04607df9a","resolution":{"observed_at":"2026-08-05T10:51:39.384027Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:51:38.913948Z","title":"Curtis, and Jorge Nocedal","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2509.03677","last_updated":"2025-09-08T06:17:26Z","snapshot_observed_at":"2026-08-06T07:57:11.469546Z","submitted_at":"2025-09-03T19:54:23Z","title":"Insights from Gradient Dynamics: Gradient Autoscaled Normalization","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-05T10:51:38.913948Z"},"links":{"citing_paper":"/paper/2509.03677"},"observation_digest":"sha256:f7656854f9a01cba6647d85cb6ea2f815793dfaedfa191d24dc7b819fd0bfa0b","observation_id":"5eb220e4-b18d-4c94-87c2-831deb57219a","resolution":{"observed_at":"2026-08-05T10:51:38.913948Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:51:38.917822Z","title":"Entropy-sgd: biasing gradient descent into wide valleys.Journal of Statistical Mechanics: Theory and Experiment, 2019 (12):124018, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2509.03677","last_updated":"2025-09-08T06:17:26Z","snapshot_observed_at":"2026-08-06T07:57:11.469546Z","submitted_at":"2025-09-03T19:54:23Z","title":"Insights from Gradient Dynamics: Gradient Autoscaled Normalization","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-05T10:51:38.917822Z"},"links":{"citing_paper":"/paper/2509.03677"},"observation_digest":"sha256:cdce6b4573ee8da87da77c4be63e984cd29687423fb7559a25f5ad25a52efa85","observation_id":"508674f8-9780-4928-8f92-23f6ddc6c4fd","resolution":{"observed_at":"2026-08-05T10:51:38.917822Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:51:39.367956Z","title":"Gradnorm: Gra- dient normalization for adaptive loss balancing in deep multitask networks","venue":null,"work_id":"c91b34fb-359f-44f1-b1cc-b6f0d31dbe38","year":2018},"citing_paper":{"arxiv_id":"2509.03677","last_updated":"2025-09-08T06:17:26Z","snapshot_observed_at":"2026-08-06T07:57:11.469546Z","submitted_at":"2025-09-03T19:54:23Z","title":"Insights from Gradient Dynamics: Gradient Autoscaled Normalization","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T10:51:38.921632Z"},"links":{"citing_paper":"/paper/2509.03677"},"observation_digest":"sha256:413c2ebc349897ec607ebd890bc80b5ba5ee505ad090c0ae1412a6aa3065962e","observation_id":"50dd9eb9-c3a2-4dea-bfc4-8127695d03bd","resolution":{"observed_at":"2026-08-05T10:51:39.372116Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2007.04532","last_updated":"2020-07-09T03:23:10Z","snapshot_observed_at":"2026-08-07T10:56:43.715478Z","submitted_at":"2020-07-09T03:23:10Z","title":"A Study of Gradient Variance in Deep Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2007.04532","snapshot_observed_at":"2026-08-05T10:51:38.925694Z","title":"Fleet, and Jimmy Ba","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2509.03677","last_updated":"2025-09-08T06:17:26Z","snapshot_observed_at":"2026-08-06T07:57:11.469546Z","submitted_at":"2025-09-03T19:54:23Z","title":"Insights from Gradient Dynamics: Gradient Autoscaled Normalization","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-05T10:51:38.925694Z"},"links":{"cited_paper":"/paper/2007.04532","citing_paper":"/paper/2509.03677"},"observation_digest":"sha256:64e2894392a81b66dbc7961e80fd80fcbb6fdf0a675d818a5e55e0c69670c9d5","observation_id":"daf8b0b3-9c90-4ece-9d20-2d14d4ef2401","resolution":{"observed_at":"2026-08-05T10:51:38.925694Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:51:39.354897Z","title":"Understanding the difficulty of training deep feedfor- ward neural networks","venue":null,"work_id":"f36ff805-2595-4328-a274-186261c8e58a","year":2010},"citing_paper":{"arxiv_id":"2509.03677","last_updated":"2025-09-08T06:17:26Z","snapshot_observed_at":"2026-08-06T07:57:11.469546Z","submitted_at":"2025-09-03T19:54:23Z","title":"Insights from Gradient Dynamics: Gradient Autoscaled Normalization","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-05T10:51:38.929387Z"},"links":{"citing_paper":"/paper/2509.03677"},"observation_digest":"sha256:5b37814385deab79e92b0aa70ab290aebe648a0889fcf2a10fdbf85b193916ff","observation_id":"39c137a0-1bb3-4d63-a904-e524da2847fc","resolution":{"observed_at":"2026-08-05T10:51:39.358803Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:51:39.342693Z","title":"Take a shortcut back: Mitigating the gradient vanishing for training spiking neural networks","venue":null,"work_id":"92616a61-0e6a-4fab-ab34-3066e56893ac","year":2024},"citing_paper":{"arxiv_id":"2509.03677","last_updated":"2025-09-08T06:17:26Z","snapshot_observed_at":"2026-08-06T07:57:11.469546Z","submitted_at":"2025-09-03T19:54:23Z","title":"Insights from Gradient Dynamics: Gradient Autoscaled Normalization","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-05T10:51:38.933179Z"},"links":{"citing_paper":"/paper/2509.03677"},"observation_digest":"sha256:df618bb57d02991c29c9d8cb492feb84d02d424dbd42ef5d1f913d3c517bfa73","observation_id":"2b9b9e64-56f9-45ad-82a7-5bf40561b76f","resolution":{"observed_at":"2026-08-05T10:51:39.346789Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:51:38.936717Z","title":"Stable architectures for deep neural networks.Inverse Prob- lems, 34(1):014004, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2509.03677","last_updated":"2025-09-08T06:17:26Z","snapshot_observed_at":"2026-08-06T07:57:11.469546Z","submitted_at":"2025-09-03T19:54:23Z","title":"Insights from Gradient Dynamics: Gradient Autoscaled Normalization","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T10:51:38.936717Z"},"links":{"citing_paper":"/paper/2509.03677"},"observation_digest":"sha256:3a7b3951925285f06f7a47a016375e31894872272df57d0c2f30a0c7084ab3e6","observation_id":"0ded4a05-1d21-438d-876b-2a6eb660e9db","resolution":{"observed_at":"2026-08-05T10:51:38.936717Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:51:38.940301Z","title":"Deep residual learning for im- age recognition","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2509.03677","last_updated":"2025-09-08T06:17:26Z","snapshot_observed_at":"2026-08-06T07:57:11.469546Z","submitted_at":"2025-09-03T19:54:23Z","title":"Insights from Gradient Dynamics: Gradient Autoscaled Normalization","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T10:51:38.940301Z"},"links":{"citing_paper":"/paper/2509.03677"},"observation_digest":"sha256:2e31ce19c6a17d53e20d7dcf307276701e84d090d0903b8f48fd2f068ea49ada","observation_id":"5b8fee62-d60a-4c24-982a-08ffbde2ad7a","resolution":{"observed_at":"2026-08-05T10:51:38.940301Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:51:39.322731Z","title":"Densely con- nected convolutional networks","venue":null,"work_id":"66f70acd-b278-4340-8de7-43e66994abc7","year":2017},"citing_paper":{"arxiv_id":"2509.03677","last_updated":"2025-09-08T06:17:26Z","snapshot_observed_at":"2026-08-06T07:57:11.469546Z","submitted_at":"2025-09-03T19:54:23Z","title":"Insights from Gradient Dynamics: Gradient Autoscaled Normalization","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-05T10:51:38.943653Z"},"links":{"citing_paper":"/paper/2509.03677"},"observation_digest":"sha256:13bd7301992d6405b23d839ccbf943d29f2c7c0dea291bbdc64f274f3e93734b","observation_id":"277ef9dd-4430-4ac2-84ce-f950cd0255d2","resolution":{"observed_at":"2026-08-05T10:51:39.326434Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:51:39.310508Z","title":"Batch normalization: accelerating deep network training by reducing internal covariate shift","venue":null,"work_id":"3089b1db-34e5-45c5-8fca-098d7d252d5c","year":2015},"citing_paper":{"arxiv_id":"2509.03677","last_updated":"2025-09-08T06:17:26Z","snapshot_observed_at":"2026-08-06T07:57:11.469546Z","submitted_at":"2025-09-03T19:54:23Z","title":"Insights from Gradient Dynamics: Gradient Autoscaled Normalization","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-05T10:51:38.947919Z"},"links":{"citing_paper":"/paper/2509.03677"},"observation_digest":"sha256:42b6a6fa54f540e3512f454a4dbdd45698e9f309e980d46cf5c31af5efbc77a7","observation_id":"8680cf61-593d-422f-a7ab-24d101621042","resolution":{"observed_at":"2026-08-05T10:51:39.314758Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:51:39.298575Z","title":"Adam: A method for stochastic optimization","venue":null,"work_id":"369dd429-a705-4413-9cbe-e1d41a9dcc3c","year":2015},"citing_paper":{"arxiv_id":"2509.03677","last_updated":"2025-09-08T06:17:26Z","snapshot_observed_at":"2026-08-06T07:57:11.469546Z","submitted_at":"2025-09-03T19:54:23Z","title":"Insights from Gradient Dynamics: Gradient Autoscaled Normalization","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-05T10:51:38.951799Z"},"links":{"citing_paper":"/paper/2509.03677"},"observation_digest":"sha256:0f3ce6f539c86a4ccd9d3f9053569c31300444391f397f4b1b8f1821068f3a87","observation_id":"14022fec-0fee-4ade-b581-4aeadc1fc45d","resolution":{"observed_at":"2026-08-05T10:51:39.302393Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:51:38.955468Z","title":"Learning multiple layers of features from tiny images","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2509.03677","last_updated":"2025-09-08T06:17:26Z","snapshot_observed_at":"2026-08-06T07:57:11.469546Z","submitted_at":"2025-09-03T19:54:23Z","title":"Insights from Gradient Dynamics: Gradient Autoscaled Normalization","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-05T10:51:38.955468Z"},"links":{"citing_paper":"/paper/2509.03677"},"observation_digest":"sha256:a442588dc4a91e4677b75bd5ea42d5a79368a1a920003b8aac0ddcb62af04557","observation_id":"136da08e-f23b-47f1-9cbe-f0acc8558cf5","resolution":{"observed_at":"2026-08-05T10:51:38.955468Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:51:38.958937Z","title":"Decoupled weight decay regularization","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2509.03677","last_updated":"2025-09-08T06:17:26Z","snapshot_observed_at":"2026-08-06T07:57:11.469546Z","submitted_at":"2025-09-03T19:54:23Z","title":"Insights from Gradient Dynamics: Gradient Autoscaled Normalization","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-05T10:51:38.958937Z"},"links":{"citing_paper":"/paper/2509.03677"},"observation_digest":"sha256:30d93b6bcdbc136729c25cd75c3c1616af3732af2e8170876dd36103ec0bb946","observation_id":"0b18b826-dd66-4c09-9ecc-2c100c3d7a92","resolution":{"observed_at":"2026-08-05T10:51:38.958937Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:51:39.270398Z","title":null,"venue":null,"work_id":"79ad0fbe-3637-4dc1-9dea-53e8085b9a6e","year":2019},"citing_paper":{"arxiv_id":"2509.03677","last_updated":"2025-09-08T06:17:26Z","snapshot_observed_at":"2026-08-06T07:57:11.469546Z","submitted_at":"2025-09-03T19:54:23Z","title":"Insights from Gradient Dynamics: Gradient Autoscaled Normalization","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-05T10:51:38.962218Z"},"links":{"citing_paper":"/paper/2509.03677"},"observation_digest":"sha256:c6e6c426a495126abbf2c296ba487f5bc75d991eab43959c0cebc9e18d3a4ff5","observation_id":"30333d8f-2e0f-45f9-a5e4-418c21ce1513","resolution":{"observed_at":"2026-08-05T10:51:39.273980Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:51:38.965544Z","title":"ViT-CIFAR: PyTorch implementation for Vision Transformer on CIFAR datasets.https://github.com/omihub777/ViT-CIFAR, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.03677","last_updated":"2025-09-08T06:17:26Z","snapshot_observed_at":"2026-08-06T07:57:11.469546Z","submitted_at":"2025-09-03T19:54:23Z","title":"Insights from Gradient Dynamics: Gradient Autoscaled Normalization","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-05T10:51:38.965544Z"},"links":{"citing_paper":"/paper/2509.03677"},"observation_digest":"sha256:b908b8bbf1bd51af796d10e5488e1ed9a1236fe3e8cc471158ad5534b6d1f1b4","observation_id":"d105d30b-bd0c-4d82-b4f0-7a71b96498ea","resolution":{"observed_at":"2026-08-05T10:51:38.965544Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:51:39.249372Z","title":"On the difficulty of training recur- rent neural networks","venue":null,"work_id":"69ec8d5e-89d4-4008-9ec1-048c641d86b4","year":2013},"citing_paper":{"arxiv_id":"2509.03677","last_updated":"2025-09-08T06:17:26Z","snapshot_observed_at":"2026-08-06T07:57:11.469546Z","submitted_at":"2025-09-03T19:54:23Z","title":"Insights from Gradient Dynamics: Gradient Autoscaled Normalization","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-05T10:51:38.969144Z"},"links":{"citing_paper":"/paper/2509.03677"},"observation_digest":"sha256:3601851463e8e34c42ccb44f2447ba58dd12c46eff56a640054732fb791fd747","observation_id":"cab82ace-f151-41f4-8b72-45abeeb5da04","resolution":{"observed_at":"2026-08-05T10:51:39.253197Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:51:39.236873Z","title":"How does batch normalization help optimization? InProceedings of the 32nd International Conference on Neural Information Processing Systems, page 2488–2498, 2018","venue":null,"work_id":"2463b6fc-7c3c-4b26-89b1-1224e7e9ba79","year":2018},"citing_paper":{"arxiv_id":"2509.03677","last_updated":"2025-09-08T06:17:26Z","snapshot_observed_at":"2026-08-06T07:57:11.469546Z","submitted_at":"2025-09-03T19:54:23Z","title":"Insights from Gradient Dynamics: Gradient Autoscaled Normalization","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-05T10:51:38.972958Z"},"links":{"citing_paper":"/paper/2509.03677"},"observation_digest":"sha256:6954fec16d1b4d6ec5ccd3b065f4d8c739f6fd7bb43f5c6bcf2245c43c455e41","observation_id":"44fd442c-17b7-4fc6-a684-1050325c3feb","resolution":{"observed_at":"2026-08-05T10:51:39.240820Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:51:38.976502Z","title":"Very deep convolutional networks for large-scale image recognition","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2509.03677","last_updated":"2025-09-08T06:17:26Z","snapshot_observed_at":"2026-08-06T07:57:11.469546Z","submitted_at":"2025-09-03T19:54:23Z","title":"Insights from Gradient Dynamics: Gradient Autoscaled Normalization","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-05T10:51:38.976502Z"},"links":{"citing_paper":"/paper/2509.03677"},"observation_digest":"sha256:9dd7e1c8291f1728afa24939a33b71c8a53a562372a0525553d0803e484228f9","observation_id":"5e225c31-4624-4cfe-a521-1c1bde9e2861","resolution":{"observed_at":"2026-08-05T10:51:38.976502Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:51:39.216514Z","title":"Lecture 6.5 - RMSProp: Divide the gradient by a running average of its recent magnitude","venue":null,"work_id":"b803b598-c9b5-4128-980d-fe7493baac76","year":null},"citing_paper":{"arxiv_id":"2509.03677","last_updated":"2025-09-08T06:17:26Z","snapshot_observed_at":"2026-08-06T07:57:11.469546Z","submitted_at":"2025-09-03T19:54:23Z","title":"Insights from Gradient Dynamics: Gradient Autoscaled Normalization","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-05T10:51:38.980056Z"},"links":{"citing_paper":"/paper/2509.03677"},"observation_digest":"sha256:a1f3a0502e80695bfab42972fcf27c91960de60013c34f3d91d1f1a2378ab258","observation_id":"eeccafcb-e5fc-4df6-aa39-dfcdf2de9fec","resolution":{"observed_at":"2026-08-05T10:51:39.220382Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:51:39.195760Z","title":"Aggregated residual transformations for deep neural networks","venue":null,"work_id":"eb14a767-ffb3-4d49-aabb-e35de5ce5834","year":2017},"citing_paper":{"arxiv_id":"2509.03677","last_updated":"2025-09-08T06:17:26Z","snapshot_observed_at":"2026-08-06T07:57:11.469546Z","submitted_at":"2025-09-03T19:54:23Z","title":"Insights from Gradient Dynamics: Gradient Autoscaled Normalization","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-05T10:51:38.987147Z"},"links":{"citing_paper":"/paper/2509.03677"},"observation_digest":"sha256:cafabc99a5a5bb40c1eb3fa1779152e1239df084cce7802e098f6b25c08aa567","observation_id":"41d7e801-aebb-46f8-bee6-af6aa73c5519","resolution":{"observed_at":"2026-08-05T10:51:39.199732Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:51:39.183182Z","title":"Gradient centraliza- tion: A new optimization technique for deep neural networks.Proceedings of the Eu- ropean Conference on Computer Vision (ECCV), pages 635–651, 2020","venue":null,"work_id":"702d3bae-bba1-4f30-9a77-8c3edb6a5dec","year":2020},"citing_paper":{"arxiv_id":"2509.03677","last_updated":"2025-09-08T06:17:26Z","snapshot_observed_at":"2026-08-06T07:57:11.469546Z","submitted_at":"2025-09-03T19:54:23Z","title":"Insights from Gradient Dynamics: Gradient Autoscaled Normalization","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-05T10:51:38.990904Z"},"links":{"citing_paper":"/paper/2509.03677"},"observation_digest":"sha256:cf268958c9ae359b7b615fb8606a50ec9eec6e76670e495d647125f5ad179299","observation_id":"043e8490-a3aa-401d-8c54-cea17189a075","resolution":{"observed_at":"2026-08-05T10:51:39.187647Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:51:39.171564Z","title":"Znorm: Z-score gradient normalization accelerating skip-connected network training without architectural modification","venue":null,"work_id":"6b556015-a6dc-41cc-b608-28d85292456c","year":2025},"citing_paper":{"arxiv_id":"2509.03677","last_updated":"2025-09-08T06:17:26Z","snapshot_observed_at":"2026-08-06T07:57:11.469546Z","submitted_at":"2025-09-03T19:54:23Z","title":"Insights from Gradient Dynamics: Gradient Autoscaled Normalization","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-05T10:51:38.994138Z"},"links":{"citing_paper":"/paper/2509.03677"},"observation_digest":"sha256:38e36d72921ee908170ebd0c9b4440cec852c5aab52f35990d32d8e7cb29611b","observation_id":"6e4fcd63-838c-4864-b798-6e7bacc0f7c0","resolution":{"observed_at":"2026-08-05T10:51:39.175325Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:51:39.159146Z","title":"Cutmix: Regularization strategy to train strong classifiers with localizable features","venue":null,"work_id":"92228bbe-a1c8-4d2f-8f3e-64fc47bc1716","year":2019},"citing_paper":{"arxiv_id":"2509.03677","last_updated":"2025-09-08T06:17:26Z","snapshot_observed_at":"2026-08-06T07:57:11.469546Z","submitted_at":"2025-09-03T19:54:23Z","title":"Insights from Gradient Dynamics: Gradient Autoscaled Normalization","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-05T10:51:38.997441Z"},"links":{"citing_paper":"/paper/2509.03677"},"observation_digest":"sha256:8c6e63bca9333d37cdfc84f8b411c9dfc6883b3e37a3edef46416a83c51c4203","observation_id":"1f6f9682-e8f3-43ab-b0f5-5f048a893f88","resolution":{"observed_at":"2026-08-05T10:51:39.162901Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:51:39.146501Z","title":"Wide residual networks","venue":null,"work_id":"961f85c0-87de-4f62-a55e-bc1d79d7c9e6","year":2016},"citing_paper":{"arxiv_id":"2509.03677","last_updated":"2025-09-08T06:17:26Z","snapshot_observed_at":"2026-08-06T07:57:11.469546Z","submitted_at":"2025-09-03T19:54:23Z","title":"Insights from Gradient Dynamics: Gradient Autoscaled Normalization","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-05T10:51:39.000807Z"},"links":{"citing_paper":"/paper/2509.03677"},"observation_digest":"sha256:9be03384af7e46d44faefe00072b8cfa975f59aac8faf4cb62c061020f95f324","observation_id":"03ba7a4c-fef0-45a3-bab9-bfdc4d3a0626","resolution":{"observed_at":"2026-08-05T10:51:39.150168Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:51:39.134214Z","title":"When will gradient regularization be harmful? In Forty-first International Conference on Machine Learning","venue":null,"work_id":"d5763b40-01f7-431d-892a-a5519491019a","year":null},"citing_paper":{"arxiv_id":"2509.03677","last_updated":"2025-09-08T06:17:26Z","snapshot_observed_at":"2026-08-06T07:57:11.469546Z","submitted_at":"2025-09-03T19:54:23Z","title":"Insights from Gradient Dynamics: Gradient Autoscaled Normalization","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-05T10:51:39.004136Z"},"links":{"citing_paper":"/paper/2509.03677"},"observation_digest":"sha256:2f9f1e3ba87b050a46d0439481479db82d4bc4c9c49fa2664a279c3debe80735","observation_id":"b3896c69-dee6-45ef-87f8-c291c0611120","resolution":{"observed_at":"2026-08-05T10:51:39.138025Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:51:39.121954Z","title":"Penalizing gradient norm for efficiently improving generalization in deep learning","venue":null,"work_id":"5e53ff21-e5af-4dae-ac28-35b540b1306d","year":2022},"citing_paper":{"arxiv_id":"2509.03677","last_updated":"2025-09-08T06:17:26Z","snapshot_observed_at":"2026-08-06T07:57:11.469546Z","submitted_at":"2025-09-03T19:54:23Z","title":"Insights from Gradient Dynamics: Gradient Autoscaled Normalization","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-05T10:51:39.007740Z"},"links":{"citing_paper":"/paper/2509.03677"},"observation_digest":"sha256:442eed8662e261ef8a70b02c0f88044221c6411697eb7b5e55d363ab5d52b03d","observation_id":"a4417bfb-ccbe-4eef-b9b1-300ea2cf1166","resolution":{"observed_at":"2026-08-05T10:51:39.125921Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:51:39.109184Z","title":"Recurrent neural networks: vanishing and exploding gradients are not the end of the story","venue":null,"work_id":"c6ae5696-6f48-4199-9252-cbe8a86699dd","year":2024},"citing_paper":{"arxiv_id":"2509.03677","last_updated":"2025-09-08T06:17:26Z","snapshot_observed_at":"2026-08-06T07:57:11.469546Z","submitted_at":"2025-09-03T19:54:23Z","title":"Insights from Gradient Dynamics: Gradient Autoscaled Normalization","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-05T10:51:39.011129Z"},"links":{"citing_paper":"/paper/2509.03677"},"observation_digest":"sha256:80ab46de08ff5481060531dcd7defb2a404d5cf247cef3c558860980d2e180ba","observation_id":"4a462906-6865-4436-bb8f-37482170f4b7","resolution":{"observed_at":"2026-08-05T10:51:39.113707Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:51:39.095280Z","title":null,"venue":null,"work_id":"0ce2b5c1-0cfc-46db-b929-2f24b6346774","year":null},"citing_paper":{"arxiv_id":"2509.03677","last_updated":"2025-09-08T06:17:26Z","snapshot_observed_at":"2026-08-06T07:57:11.469546Z","submitted_at":"2025-09-03T19:54:23Z","title":"Insights from Gradient Dynamics: Gradient Autoscaled Normalization","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-05T10:51:39.015136Z"},"links":{"citing_paper":"/paper/2509.03677"},"observation_digest":"sha256:da2401b229d8299b4d82c12c5f0224f6acb7b9594cc5befd9d1587ce8f935479","observation_id":"cba70997-9462-43ef-88ca-6d9c72dc12f8","resolution":{"observed_at":"2026-08-05T10:51:39.100030Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:51:38.983623Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.03677","last_updated":"2025-09-08T06:17:26Z","snapshot_observed_at":"2026-08-06T07:57:11.469546Z","submitted_at":"2025-09-03T19:54:23Z","title":"Insights from Gradient Dynamics: Gradient Autoscaled Normalization","version":2},"reference_index":2012,"source":"pdf_text","source_observed_at":"2026-08-05T10:51:38.983623Z"},"links":{"citing_paper":"/paper/2509.03677"},"observation_digest":"sha256:3ab3d51cdf2b5ed608ce0dbb4eda0c7e6dc5b589f388125b7663ed2035ab8cc4","observation_id":"dd4adf9b-d6e3-4efe-8629-5e515d7ffd98","resolution":{"observed_at":"2026-08-05T10:51:38.983623Z","resolver_source":null,"status":"parse_uncertain"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2509.03677","last_updated":"2025-09-08T06:17:26Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-06T07:57:11.469546Z","submitted_at":"2025-09-03T19:54:23Z","title":"Insights from Gradient Dynamics: Gradient Autoscaled Normalization"},"reference_resolution":{"displayed":32,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":1,"unresolved":13,"verified_exact":0,"verified_fuzzy":17},"total_outbound_references":32},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 32 of 32 outbound references and 0 inbound Pith citation observations for arXiv:2509.03677."}