{"as_of":"2026-08-15T10:45:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:3aaceed386f84387b471aa68cf5fd59515bd7da770e6a43a76c7d45f5d84f433","coverage":[{"denominator":59,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":59,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-14T04:21:38.384143Z","state":"measured"},{"denominator":59,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":59,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.09417/citation-record","integrity":"/paper/2608.09417/integrity","json":"/paper/2608.09417/citation-record.json","paper":"/paper/2608.09417"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:21:38.123721Z","title":"International Conference on Learning Representations , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09417","last_updated":"2026-08-11T06:00:23Z","snapshot_observed_at":"2026-08-15T09:10:38.074164Z","submitted_at":"2026-08-10T10:45:16Z","title":"Why Post-Norm Transformers Collapse: Attention Amplification and Gradient Repair Failure","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-14T04:21:38.123721Z"},"links":{"citing_paper":"/paper/2608.09417"},"observation_digest":"sha256:198b11fcfa7addf1606b963e97d25e02caaf307c134c5f0cf4859a552def2c17","observation_id":"f74c7663-d9af-4219-b82e-ffca57c4291e","resolution":{"observed_at":"2026-08-14T04:21:38.123721Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:21:38.128188Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09417","last_updated":"2026-08-11T06:00:23Z","snapshot_observed_at":"2026-08-15T09:10:38.074164Z","submitted_at":"2026-08-10T10:45:16Z","title":"Why Post-Norm Transformers Collapse: Attention Amplification and Gradient Repair Failure","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-14T04:21:38.128188Z"},"links":{"citing_paper":"/paper/2608.09417"},"observation_digest":"sha256:05790e20377629825810b1c9f1a089a5027699bb2fba207b2f827e6ff095e0d8","observation_id":"7cf105bc-b22d-40a6-98a4-28182fd0b1ff","resolution":{"observed_at":"2026-08-14T04:21:38.128188Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1611.01232","last_updated":"2017-04-04T19:36:14Z","snapshot_observed_at":"2026-08-14T21:32:01.686705Z","submitted_at":"2016-11-04T00:44:32Z","title":"Deep Information Propagation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1611.01232","snapshot_observed_at":"2026-08-14T04:21:38.132515Z","title":"arXiv preprint arXiv:1611.01232 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09417","last_updated":"2026-08-11T06:00:23Z","snapshot_observed_at":"2026-08-15T09:10:38.074164Z","submitted_at":"2026-08-10T10:45:16Z","title":"Why Post-Norm Transformers Collapse: Attention Amplification and Gradient Repair Failure","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-14T04:21:38.132515Z"},"links":{"cited_paper":"/paper/1611.01232","citing_paper":"/paper/2608.09417"},"observation_digest":"sha256:ad794154893573ba43134a74d35bb215f3cbe106b3ef091a50da28405ab43fca","observation_id":"7e3aa621-96d6-473b-80da-b0a404dfd4f4","resolution":{"observed_at":"2026-08-14T04:21:38.132515Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:21:38.136887Z","title":"Proceedings of the Thirteenth International Conference on Artificial Intelligence and Statistics , pages=","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2608.09417","last_updated":"2026-08-11T06:00:23Z","snapshot_observed_at":"2026-08-15T09:10:38.074164Z","submitted_at":"2026-08-10T10:45:16Z","title":"Why Post-Norm Transformers Collapse: Attention Amplification and Gradient Repair Failure","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-14T04:21:38.136887Z"},"links":{"citing_paper":"/paper/2608.09417"},"observation_digest":"sha256:a6995a7f55f965ab6cd5c53e27849e53939f2832c5e26697ebc2e1cedd9b8a0c","observation_id":"0da489fd-7b24-4423-b563-15f2df7f7421","resolution":{"observed_at":"2026-08-14T04:21:38.136887Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:21:38.142143Z","title":"Proceedings of the IEEE International Conference on Computer Vision , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09417","last_updated":"2026-08-11T06:00:23Z","snapshot_observed_at":"2026-08-15T09:10:38.074164Z","submitted_at":"2026-08-10T10:45:16Z","title":"Why Post-Norm Transformers Collapse: Attention Amplification and Gradient Repair Failure","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-14T04:21:38.142143Z"},"links":{"citing_paper":"/paper/2608.09417"},"observation_digest":"sha256:b8c05f251f4bb97adee4bfabad8a1c71f7ec86d7727595811a32fe00e03a2277","observation_id":"880d16f8-5fb1-45a5-914c-f3908fe1de27","resolution":{"observed_at":"2026-08-14T04:21:38.142143Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1312.6120","last_updated":"2014-02-19T17:26:57Z","snapshot_observed_at":"2026-08-14T23:50:45.351114Z","submitted_at":"2013-12-20T20:24:00Z","title":"Exact solutions to the nonlinear dynamics of learning in deep linear neural networks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1312.6120","snapshot_observed_at":"2026-08-14T04:21:38.146460Z","title":"arXiv preprint arXiv:1312.6120 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09417","last_updated":"2026-08-11T06:00:23Z","snapshot_observed_at":"2026-08-15T09:10:38.074164Z","submitted_at":"2026-08-10T10:45:16Z","title":"Why Post-Norm Transformers Collapse: Attention Amplification and Gradient Repair Failure","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-14T04:21:38.146460Z"},"links":{"cited_paper":"/paper/1312.6120","citing_paper":"/paper/2608.09417"},"observation_digest":"sha256:7db3e17ac7aaa4e7eb9f07208688a650a20cf43944bcbb87f6748f03fe02a1ea","observation_id":"c62f5cd3-f4d5-4f5b-a9e2-23f4fe37258e","resolution":{"observed_at":"2026-08-14T04:21:38.146460Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:21:38.152125Z","title":"2012 , publisher=","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2608.09417","last_updated":"2026-08-11T06:00:23Z","snapshot_observed_at":"2026-08-15T09:10:38.074164Z","submitted_at":"2026-08-10T10:45:16Z","title":"Why Post-Norm Transformers Collapse: Attention Amplification and Gradient Repair Failure","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-14T04:21:38.152125Z"},"links":{"citing_paper":"/paper/2608.09417"},"observation_digest":"sha256:bbd6b021a2df92a7372306d493e8053610ea4e401584b36744fcd4e835891da6","observation_id":"e3df0a2b-ffc5-4735-ba97-8b626082d927","resolution":{"observed_at":"2026-08-14T04:21:38.152125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.00165","last_updated":"2018-03-03T00:45:00Z","snapshot_observed_at":"2026-08-14T20:18:09.717440Z","submitted_at":"2017-11-01T02:13:25Z","title":"Deep Neural Networks as Gaussian Processes","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.00165","snapshot_observed_at":"2026-08-14T04:21:38.156188Z","title":"arXiv preprint arXiv:1711.00165 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09417","last_updated":"2026-08-11T06:00:23Z","snapshot_observed_at":"2026-08-15T09:10:38.074164Z","submitted_at":"2026-08-10T10:45:16Z","title":"Why Post-Norm Transformers Collapse: Attention Amplification and Gradient Repair Failure","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-14T04:21:38.156188Z"},"links":{"cited_paper":"/paper/1711.00165","citing_paper":"/paper/2608.09417"},"observation_digest":"sha256:d3c4c1b679b0315c3e3565814d7c8c41ed389946d15fdfcfc1efe3a740abe6d6","observation_id":"00e2637e-ff86-4104-9879-2c639648f955","resolution":{"observed_at":"2026-08-14T04:21:38.156188Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1804.11271","last_updated":"2018-08-16T14:51:32Z","snapshot_observed_at":"2026-08-15T02:34:50.908802Z","submitted_at":"2018-04-30T15:21:23Z","title":"Gaussian Process Behaviour in Wide Deep Neural Networks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1804.11271","snapshot_observed_at":"2026-08-14T04:21:38.162038Z","title":"arXiv preprint arXiv:1804.11271 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09417","last_updated":"2026-08-11T06:00:23Z","snapshot_observed_at":"2026-08-15T09:10:38.074164Z","submitted_at":"2026-08-10T10:45:16Z","title":"Why Post-Norm Transformers Collapse: Attention Amplification and Gradient Repair Failure","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-14T04:21:38.162038Z"},"links":{"cited_paper":"/paper/1804.11271","citing_paper":"/paper/2608.09417"},"observation_digest":"sha256:2261f84f84c0bb165d59a661506ccb427c1a6f58f7465d9098e8278f18266b3a","observation_id":"43ed4e52-4570-44f5-b875-b0109803ec84","resolution":{"observed_at":"2026-08-14T04:21:38.162038Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.04735","last_updated":"2017-11-13T18:06:09Z","snapshot_observed_at":"2026-08-14T20:14:10.797989Z","submitted_at":"2017-11-13T18:06:09Z","title":"Resurrecting the sigmoid in deep learning through dynamical isometry: theory and practice","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.04735","snapshot_observed_at":"2026-08-14T04:21:38.166091Z","title":"arXiv preprint arXiv:1711.04735 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09417","last_updated":"2026-08-11T06:00:23Z","snapshot_observed_at":"2026-08-15T09:10:38.074164Z","submitted_at":"2026-08-10T10:45:16Z","title":"Why Post-Norm Transformers Collapse: Attention Amplification and Gradient Repair Failure","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-14T04:21:38.166091Z"},"links":{"cited_paper":"/paper/1711.04735","citing_paper":"/paper/2608.09417"},"observation_digest":"sha256:9a775895866a7be74be9aeb69bfb77b0294b98f885b32e755b0f85a85bac6558","observation_id":"7f97f1bc-b81f-42d1-9ff7-19a17fec67c7","resolution":{"observed_at":"2026-08-14T04:21:38.166091Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1806.05393","last_updated":"2018-07-10T16:09:39Z","snapshot_observed_at":"2026-08-14T19:03:52.537396Z","submitted_at":"2018-06-14T07:04:15Z","title":"Dynamical Isometry and a Mean Field Theory of CNNs: How to Train 10,000-Layer Vanilla Convolutional Neural Networks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1806.05393","snapshot_observed_at":"2026-08-14T04:21:38.175506Z","title":"arXiv preprint arXiv:1806.05393 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09417","last_updated":"2026-08-11T06:00:23Z","snapshot_observed_at":"2026-08-15T09:10:38.074164Z","submitted_at":"2026-08-10T10:45:16Z","title":"Why Post-Norm Transformers Collapse: Attention Amplification and Gradient Repair Failure","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-14T04:21:38.175506Z"},"links":{"cited_paper":"/paper/1806.05393","citing_paper":"/paper/2608.09417"},"observation_digest":"sha256:a92b927265994283ebe77ed0ffe2787320cca2d1144bf20f8bd68295013b01ef","observation_id":"9cf98165-b1d8-4980-8d31-20ac87d81c85","resolution":{"observed_at":"2026-08-14T04:21:38.175506Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1806.05394","last_updated":"2018-08-15T17:19:40Z","snapshot_observed_at":"2026-08-14T19:03:52.615354Z","submitted_at":"2018-06-14T07:04:31Z","title":"Dynamical Isometry and a Mean Field Theory of RNNs: Gating Enables Signal Propagation in Recurrent Neural Networks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1806.05394","snapshot_observed_at":"2026-08-14T04:21:38.180759Z","title":"arXiv preprint arXiv:1806.05394 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09417","last_updated":"2026-08-11T06:00:23Z","snapshot_observed_at":"2026-08-15T09:10:38.074164Z","submitted_at":"2026-08-10T10:45:16Z","title":"Why Post-Norm Transformers Collapse: Attention Amplification and Gradient Repair Failure","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-14T04:21:38.180759Z"},"links":{"cited_paper":"/paper/1806.05394","citing_paper":"/paper/2608.09417"},"observation_digest":"sha256:3ccb476eaca1e077cd8b3006876b8fac85b03ed54aaa3afd3b2a5f7141652c62","observation_id":"baf7eeaa-a249-4159-9d78-7674ace95e64","resolution":{"observed_at":"2026-08-14T04:21:38.180759Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:21:38.185670Z","title":"Classic","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09417","last_updated":"2026-08-11T06:00:23Z","snapshot_observed_at":"2026-08-15T09:10:38.074164Z","submitted_at":"2026-08-10T10:45:16Z","title":"Why Post-Norm Transformers Collapse: Attention Amplification and Gradient Repair Failure","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-14T04:21:38.185670Z"},"links":{"citing_paper":"/paper/2608.09417"},"observation_digest":"sha256:ae99fbfee4c750579a2e6219efbc387b2bcf1c9e09ce98938049d6b428f2beca","observation_id":"efb6ea85-815d-4c7e-84dc-c30f4167a005","resolution":{"observed_at":"2026-08-14T04:21:38.185670Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:21:38.189519Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09417","last_updated":"2026-08-11T06:00:23Z","snapshot_observed_at":"2026-08-15T09:10:38.074164Z","submitted_at":"2026-08-10T10:45:16Z","title":"Why Post-Norm Transformers Collapse: Attention Amplification and Gradient Repair Failure","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-14T04:21:38.189519Z"},"links":{"citing_paper":"/paper/2608.09417"},"observation_digest":"sha256:9436622c4f367d08836d301a95ad9505b7f2c37fb5499f353b7c76deb00567a4","observation_id":"ff81a120-2346-46e4-863f-b76336d4faf2","resolution":{"observed_at":"2026-08-14T04:21:38.189519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:21:38.199014Z","title":"International Conference on Machine Learning , pages=","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.09417","last_updated":"2026-08-11T06:00:23Z","snapshot_observed_at":"2026-08-15T09:10:38.074164Z","submitted_at":"2026-08-10T10:45:16Z","title":"Why Post-Norm Transformers Collapse: Attention Amplification and Gradient Repair Failure","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-14T04:21:38.199014Z"},"links":{"citing_paper":"/paper/2608.09417"},"observation_digest":"sha256:93886c852db4b33a6f016cabe8e695301cd72e572ebc300f8b9c0e17d53b8956","observation_id":"b6983274-58b5-4a36-ad5b-13f77ef0be6d","resolution":{"observed_at":"2026-08-14T04:21:38.199014Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:21:38.203406Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2608.09417","last_updated":"2026-08-11T06:00:23Z","snapshot_observed_at":"2026-08-15T09:10:38.074164Z","submitted_at":"2026-08-10T10:45:16Z","title":"Why Post-Norm Transformers Collapse: Attention Amplification and Gradient Repair Failure","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-14T04:21:38.203406Z"},"links":{"citing_paper":"/paper/2608.09417"},"observation_digest":"sha256:9c6a84d4fab3b32c6cc2d0ae1fba01e7b8b94ca23f31b352afb941a4970bbf49","observation_id":"fd79adb8-91a1-45ed-8026-1a253fd3dc7e","resolution":{"observed_at":"2026-08-14T04:21:38.203406Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:21:38.207831Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09417","last_updated":"2026-08-11T06:00:23Z","snapshot_observed_at":"2026-08-15T09:10:38.074164Z","submitted_at":"2026-08-10T10:45:16Z","title":"Why Post-Norm Transformers Collapse: Attention Amplification and Gradient Repair Failure","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-14T04:21:38.207831Z"},"links":{"citing_paper":"/paper/2608.09417"},"observation_digest":"sha256:7248e868a5ead89d95f86271c197af881cca02cd29861671f959f16353c406ba","observation_id":"74f895fb-5e99-46ad-8e2d-3a32928ee970","resolution":{"observed_at":"2026-08-14T04:21:38.207831Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1607.06450","last_updated":"2016-07-21T19:57:52Z","snapshot_observed_at":"2026-08-15T04:53:45.483331Z","submitted_at":"2016-07-21T19:57:52Z","title":"Layer Normalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1607.06450","snapshot_observed_at":"2026-08-14T04:21:38.213799Z","title":"arXiv preprint arXiv:1607.06450 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09417","last_updated":"2026-08-11T06:00:23Z","snapshot_observed_at":"2026-08-15T09:10:38.074164Z","submitted_at":"2026-08-10T10:45:16Z","title":"Why Post-Norm Transformers Collapse: Attention Amplification and Gradient Repair Failure","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-14T04:21:38.213799Z"},"links":{"cited_paper":"/paper/1607.06450","citing_paper":"/paper/2608.09417"},"observation_digest":"sha256:68f8496d43211aa21871496670c18ef583a24d1f12b1249ddf1f1bd962d89377","observation_id":"d8177392-84a3-4afb-9dad-91586138b85c","resolution":{"observed_at":"2026-08-14T04:21:38.213799Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:21:38.217808Z","title":"Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09417","last_updated":"2026-08-11T06:00:23Z","snapshot_observed_at":"2026-08-15T09:10:38.074164Z","submitted_at":"2026-08-10T10:45:16Z","title":"Why Post-Norm Transformers Collapse: Attention Amplification and Gradient Repair Failure","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-14T04:21:38.217808Z"},"links":{"citing_paper":"/paper/2608.09417"},"observation_digest":"sha256:157901f11fcdd182bdcb086a845366d79946a4dc22f05fb37dea8095522dd640","observation_id":"1cb01525-5f2c-4ec4-8016-c2575633e9ce","resolution":{"observed_at":"2026-08-14T04:21:38.217808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07799","last_updated":"2025-06-16T12:30:24Z","snapshot_observed_at":"2026-08-12T22:26:27.365527Z","submitted_at":"2024-10-10T10:34:18Z","title":"Mind the Gap: a Spectral Analysis of Rank Collapse and Signal Propagation in Attention Layers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07799","snapshot_observed_at":"2026-08-14T04:21:38.221472Z","title":"arXiv preprint arXiv:2410.07799 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09417","last_updated":"2026-08-11T06:00:23Z","snapshot_observed_at":"2026-08-15T09:10:38.074164Z","submitted_at":"2026-08-10T10:45:16Z","title":"Why Post-Norm Transformers Collapse: Attention Amplification and Gradient Repair Failure","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-14T04:21:38.221472Z"},"links":{"cited_paper":"/paper/2410.07799","citing_paper":"/paper/2608.09417"},"observation_digest":"sha256:9fae6ea48054ca1327e990046715893405abcf37065e089033d7a8443bd05b6a","observation_id":"e27a27d6-512f-446c-8d5d-99103f9a673c","resolution":{"observed_at":"2026-08-14T04:21:38.221472Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:21:38.225325Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09417","last_updated":"2026-08-11T06:00:23Z","snapshot_observed_at":"2026-08-15T09:10:38.074164Z","submitted_at":"2026-08-10T10:45:16Z","title":"Why Post-Norm Transformers Collapse: Attention Amplification and Gradient Repair Failure","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-14T04:21:38.225325Z"},"links":{"citing_paper":"/paper/2608.09417"},"observation_digest":"sha256:cae7ba3f490fce1f91b0d503ead69118a6c67165874178ef029cddb964ee69cb","observation_id":"fb86b79b-9440-4cb5-bbf7-041f31d48da6","resolution":{"observed_at":"2026-08-14T04:21:38.225325Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:21:38.229044Z","title":"Proceedings of the 2020 Conference on Empirical Methods in Natural Language Processing (EMNLP) , pages=","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.09417","last_updated":"2026-08-11T06:00:23Z","snapshot_observed_at":"2026-08-15T09:10:38.074164Z","submitted_at":"2026-08-10T10:45:16Z","title":"Why Post-Norm Transformers Collapse: Attention Amplification and Gradient Repair Failure","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-14T04:21:38.229044Z"},"links":{"citing_paper":"/paper/2608.09417"},"observation_digest":"sha256:8b2827b874c50509354c93802531d90b53acd289244a493b79a2e0a27def72c7","observation_id":"c18be136-d616-445c-a062-9ca3be07b15b","resolution":{"observed_at":"2026-08-14T04:21:38.229044Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:21:38.233082Z","title":"International Conference on Machine Learning , pages=","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.09417","last_updated":"2026-08-11T06:00:23Z","snapshot_observed_at":"2026-08-15T09:10:38.074164Z","submitted_at":"2026-08-10T10:45:16Z","title":"Why Post-Norm Transformers Collapse: Attention Amplification and Gradient Repair Failure","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-14T04:21:38.233082Z"},"links":{"citing_paper":"/paper/2608.09417"},"observation_digest":"sha256:1aae34150f8e684e70e01db100bf52d930415500df4a60e331994f3f70392d48","observation_id":"739af441-0bf2-4bc9-9c1e-b13ac165e496","resolution":{"observed_at":"2026-08-14T04:21:38.233082Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.05895","last_updated":"2019-12-30T03:53:04Z","snapshot_observed_at":"2026-08-07T19:31:58.707080Z","submitted_at":"2019-10-14T02:23:43Z","title":"Transformers without Tears: Improving the Normalization of Self-Attention","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.05895","snapshot_observed_at":"2026-08-14T04:21:38.237430Z","title":"arXiv preprint arXiv:1910.05895 , year=","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2608.09417","last_updated":"2026-08-11T06:00:23Z","snapshot_observed_at":"2026-08-15T09:10:38.074164Z","submitted_at":"2026-08-10T10:45:16Z","title":"Why Post-Norm Transformers Collapse: Attention Amplification and Gradient Repair Failure","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-14T04:21:38.237430Z"},"links":{"cited_paper":"/paper/1910.05895","citing_paper":"/paper/2608.09417"},"observation_digest":"sha256:2887a5319a826c368540b1ae24e224f55b12b0f7795de6b4ee3f4d6aed927f6d","observation_id":"ea6218c9-5ada-40a0-8355-d728d2e44927","resolution":{"observed_at":"2026-08-14T04:21:38.237430Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:21:38.241614Z","title":"Uncertainty in Artificial Intelligence , pages=","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.09417","last_updated":"2026-08-11T06:00:23Z","snapshot_observed_at":"2026-08-15T09:10:38.074164Z","submitted_at":"2026-08-10T10:45:16Z","title":"Why Post-Norm Transformers Collapse: Attention Amplification and Gradient Repair Failure","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-14T04:21:38.241614Z"},"links":{"citing_paper":"/paper/2608.09417"},"observation_digest":"sha256:ad174f096af3fb12f6aeb68c6f4ab4ed7bba354406f3f090d7c1013aa7b43e13","observation_id":"cb7dc440-1c1d-4873-bab7-e21185a317a3","resolution":{"observed_at":"2026-08-14T04:21:38.241614Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.04245","last_updated":"2020-10-08T20:12:35Z","snapshot_observed_at":"2026-08-14T10:26:38.195748Z","submitted_at":"2020-10-08T20:12:35Z","title":"Query-Key Normalization for Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.04245","snapshot_observed_at":"2026-08-14T04:21:38.245284Z","title":"arXiv preprint arXiv:2010.04245 , year=","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2608.09417","last_updated":"2026-08-11T06:00:23Z","snapshot_observed_at":"2026-08-15T09:10:38.074164Z","submitted_at":"2026-08-10T10:45:16Z","title":"Why Post-Norm Transformers Collapse: Attention Amplification and Gradient Repair Failure","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-14T04:21:38.245284Z"},"links":{"cited_paper":"/paper/2010.04245","citing_paper":"/paper/2608.09417"},"observation_digest":"sha256:2c4d6d737f0ea015c47c7993f828732672d0b5689ead21c4e733f7e9c3fcf1d4","observation_id":"94578d9f-cf14-44e4-8e6c-d39119724c9a","resolution":{"observed_at":"2026-08-14T04:21:38.245284Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:21:38.249111Z","title":"International Conference on Learning Representations , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09417","last_updated":"2026-08-11T06:00:23Z","snapshot_observed_at":"2026-08-15T09:10:38.074164Z","submitted_at":"2026-08-10T10:45:16Z","title":"Why Post-Norm Transformers Collapse: Attention Amplification and Gradient Repair Failure","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-14T04:21:38.249111Z"},"links":{"citing_paper":"/paper/2608.09417"},"observation_digest":"sha256:037708d672959fdc96f840cb46e3c7c74a8f908aef2f19e2165aceb93ab0efe2","observation_id":"e2e18924-66f5-49bb-a116-620e0f7528d9","resolution":{"observed_at":"2026-08-14T04:21:38.249111Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:21:38.253407Z","title":"International Conference on Machine Learning , pages=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.09417","last_updated":"2026-08-11T06:00:23Z","snapshot_observed_at":"2026-08-15T09:10:38.074164Z","submitted_at":"2026-08-10T10:45:16Z","title":"Why Post-Norm Transformers Collapse: Attention Amplification and Gradient Repair Failure","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-14T04:21:38.253407Z"},"links":{"citing_paper":"/paper/2608.09417"},"observation_digest":"sha256:37a2e72fc00fa5f0d475bce12e4fe6095cdff1263d74d43dd0dde3ea01a7d62e","observation_id":"6ffc9ff4-5a46-43d5-b4cc-32bf7a2d6d25","resolution":{"observed_at":"2026-08-14T04:21:38.253407Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1907.12009","last_updated":"2019-07-28T03:57:41Z","snapshot_observed_at":"2026-08-14T16:01:36.508705Z","submitted_at":"2019-07-28T03:57:41Z","title":"Representation Degeneration Problem in Training Natural Language Generation Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.12009","snapshot_observed_at":"2026-08-14T04:21:38.258563Z","title":"arXiv preprint arXiv:1907.12009 , year=","venue":null,"work_id":null,"year":1907},"citing_paper":{"arxiv_id":"2608.09417","last_updated":"2026-08-11T06:00:23Z","snapshot_observed_at":"2026-08-15T09:10:38.074164Z","submitted_at":"2026-08-10T10:45:16Z","title":"Why Post-Norm Transformers Collapse: Attention Amplification and Gradient Repair Failure","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-14T04:21:38.258563Z"},"links":{"cited_paper":"/paper/1907.12009","citing_paper":"/paper/2608.09417"},"observation_digest":"sha256:21dd9483ec8d075256bbcb401312010e5591cb7cd6a5730e94d587ff1951af38","observation_id":"522fa13b-147d-4acc-ac69-9cc76be05437","resolution":{"observed_at":"2026-08-14T04:21:38.258563Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1901.09321","last_updated":"2019-03-12T00:31:18Z","snapshot_observed_at":"2026-08-14T17:25:25.486314Z","submitted_at":"2019-01-27T05:30:11Z","title":"Fixup Initialization: Residual Learning Without Normalization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1901.09321","snapshot_observed_at":"2026-08-14T04:21:38.263899Z","title":"arXiv preprint arXiv:1901.09321 , year=","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2608.09417","last_updated":"2026-08-11T06:00:23Z","snapshot_observed_at":"2026-08-15T09:10:38.074164Z","submitted_at":"2026-08-10T10:45:16Z","title":"Why Post-Norm Transformers Collapse: Attention Amplification and Gradient Repair Failure","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-14T04:21:38.263899Z"},"links":{"cited_paper":"/paper/1901.09321","citing_paper":"/paper/2608.09417"},"observation_digest":"sha256:02d661bc2954a8374491376928dfa47224c1a9d136fc720fd183261236fc057e","observation_id":"1125f841-9d4e-4564-be6e-bbcd90ec4df0","resolution":{"observed_at":"2026-08-14T04:21:38.263899Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2002.05202","last_updated":"2020-02-12T19:57:13Z","snapshot_observed_at":"2026-08-11T06:21:56.129166Z","submitted_at":"2020-02-12T19:57:13Z","title":"GLU Variants Improve Transformer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.05202","snapshot_observed_at":"2026-08-14T04:21:38.268216Z","title":"2002.05202 , archivePrefix=","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2608.09417","last_updated":"2026-08-11T06:00:23Z","snapshot_observed_at":"2026-08-15T09:10:38.074164Z","submitted_at":"2026-08-10T10:45:16Z","title":"Why Post-Norm Transformers Collapse: Attention Amplification and Gradient Repair Failure","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-14T04:21:38.268216Z"},"links":{"cited_paper":"/paper/2002.05202","citing_paper":"/paper/2608.09417"},"observation_digest":"sha256:8735c04fd5f8a4ae4e48d6a9d066c5fffb19fb80937464521367fd6fb3989f32","observation_id":"390dcd6b-1c9a-4736-96bd-fe3dcb54af40","resolution":{"observed_at":"2026-08-14T04:21:38.268216Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:21:38.272607Z","title":"IEEE Transactions on Pattern Analysis and Machine Intelligence , volume=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.09417","last_updated":"2026-08-11T06:00:23Z","snapshot_observed_at":"2026-08-15T09:10:38.074164Z","submitted_at":"2026-08-10T10:45:16Z","title":"Why Post-Norm Transformers Collapse: Attention Amplification and Gradient Repair Failure","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-14T04:21:38.272607Z"},"links":{"citing_paper":"/paper/2608.09417"},"observation_digest":"sha256:261497bac0543e5111837c0e63b24f9e77ff56b2657b470001fbea632be676ad","observation_id":"daf62005-8b19-4569-b172-4a161ccdf761","resolution":{"observed_at":"2026-08-14T04:21:38.272607Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2012.11747","last_updated":"2021-09-10T18:58:03Z","snapshot_observed_at":"2026-08-13T20:42:02.537812Z","submitted_at":"2020-12-21T23:30:04Z","title":"RealFormer: Transformer Likes Residual Attention","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2012.11747","snapshot_observed_at":"2026-08-14T04:21:38.276925Z","title":"arXiv preprint arXiv:2012.11747 , year=","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2608.09417","last_updated":"2026-08-11T06:00:23Z","snapshot_observed_at":"2026-08-15T09:10:38.074164Z","submitted_at":"2026-08-10T10:45:16Z","title":"Why Post-Norm Transformers Collapse: Attention Amplification and Gradient Repair Failure","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-14T04:21:38.276925Z"},"links":{"cited_paper":"/paper/2012.11747","citing_paper":"/paper/2608.09417"},"observation_digest":"sha256:784175bbe00496e1f2a57553110035d29b802fe8434f9f2c9e9d7576cff80055","observation_id":"62ca9c71-053c-477e-a4fb-e0a4adb6d44a","resolution":{"observed_at":"2026-08-14T04:21:38.276925Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2102.11972","last_updated":"2021-09-10T20:33:39Z","snapshot_observed_at":"2026-08-13T20:09:35.154830Z","submitted_at":"2021-02-23T22:44:54Z","title":"Do Transformer Modifications Transfer Across Implementations and Applications?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.11972","snapshot_observed_at":"2026-08-14T04:21:38.280691Z","title":"arXiv preprint arXiv:2102.11972 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09417","last_updated":"2026-08-11T06:00:23Z","snapshot_observed_at":"2026-08-15T09:10:38.074164Z","submitted_at":"2026-08-10T10:45:16Z","title":"Why Post-Norm Transformers Collapse: Attention Amplification and Gradient Repair Failure","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-14T04:21:38.280691Z"},"links":{"cited_paper":"/paper/2102.11972","citing_paper":"/paper/2608.09417"},"observation_digest":"sha256:11f84b92476eb8cc1e651359eb89bd1a5819ddd5860145bd39920d78563c9eea","observation_id":"a483963a-9ce4-49ec-8ff6-d76413dd6f0a","resolution":{"observed_at":"2026-08-14T04:21:38.280691Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.09456","last_updated":"2021-11-01T15:34:23Z","snapshot_observed_at":"2026-08-13T03:29:36.228075Z","submitted_at":"2021-10-18T16:47:45Z","title":"NormFormer: Improved Transformer Pretraining with Extra Normalization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.09456","snapshot_observed_at":"2026-08-14T04:21:38.284545Z","title":"arXiv preprint arXiv:2110.09456 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09417","last_updated":"2026-08-11T06:00:23Z","snapshot_observed_at":"2026-08-15T09:10:38.074164Z","submitted_at":"2026-08-10T10:45:16Z","title":"Why Post-Norm Transformers Collapse: Attention Amplification and Gradient Repair Failure","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-14T04:21:38.284545Z"},"links":{"cited_paper":"/paper/2110.09456","citing_paper":"/paper/2608.09417"},"observation_digest":"sha256:0e5d6210795e050a714e533b7127c6d97e38be7c49b991927d688f66cc41615f","observation_id":"7a9cb568-1a6c-4a11-92d1-15cde46bcef3","resolution":{"observed_at":"2026-08-14T04:21:38.284545Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.08625","last_updated":"2022-02-17T12:20:52Z","snapshot_observed_at":"2026-07-31T09:00:36.259346Z","submitted_at":"2022-02-17T12:20:52Z","title":"Revisiting Over-smoothing in BERT from the Perspective of Graph","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.08625","snapshot_observed_at":"2026-08-14T04:21:38.288594Z","title":"arXiv preprint arXiv:2202.08625 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09417","last_updated":"2026-08-11T06:00:23Z","snapshot_observed_at":"2026-08-15T09:10:38.074164Z","submitted_at":"2026-08-10T10:45:16Z","title":"Why Post-Norm Transformers Collapse: Attention Amplification and Gradient Repair Failure","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-14T04:21:38.288594Z"},"links":{"cited_paper":"/paper/2202.08625","citing_paper":"/paper/2608.09417"},"observation_digest":"sha256:ff85a7abbcc64d2da5c249822d92e3e6688e522fdd00da30464ebab2d0895a75","observation_id":"a1d4ee16-ab05-41fa-9f3f-91b82e7dba05","resolution":{"observed_at":"2026-08-14T04:21:38.288594Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1905.10947","last_updated":"2021-01-06T13:32:14Z","snapshot_observed_at":"2026-08-14T22:01:14.568901Z","submitted_at":"2019-05-27T02:59:06Z","title":"Graph Neural Networks Exponentially Lose Expressive Power for Node Classification","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.10947","snapshot_observed_at":"2026-08-14T04:21:38.292787Z","title":"arXiv preprint arXiv:1905.10947 , year=","venue":null,"work_id":null,"year":1905},"citing_paper":{"arxiv_id":"2608.09417","last_updated":"2026-08-11T06:00:23Z","snapshot_observed_at":"2026-08-15T09:10:38.074164Z","submitted_at":"2026-08-10T10:45:16Z","title":"Why Post-Norm Transformers Collapse: Attention Amplification and Gradient Repair Failure","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-14T04:21:38.292787Z"},"links":{"cited_paper":"/paper/1905.10947","citing_paper":"/paper/2608.09417"},"observation_digest":"sha256:1563b594974a5d05393dc993bcb9189dac7ac53acae4f601d11a0ab5eecd0cb4","observation_id":"01294cd2-6324-4890-a278-9c8ef2cb9ef0","resolution":{"observed_at":"2026-08-14T04:21:38.292787Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:21:38.299347Z","title":"Uncertainty in Artificial Intelligence , pages=","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.09417","last_updated":"2026-08-11T06:00:23Z","snapshot_observed_at":"2026-08-15T09:10:38.074164Z","submitted_at":"2026-08-10T10:45:16Z","title":"Why Post-Norm Transformers Collapse: Attention Amplification and Gradient Repair Failure","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-14T04:21:38.299347Z"},"links":{"citing_paper":"/paper/2608.09417"},"observation_digest":"sha256:19469044e2065fabbbee9368694cabf663cd73aaea3691774e28567ce819702b","observation_id":"986fa79f-6904-4ca3-b909-916fa2a1a388","resolution":{"observed_at":"2026-08-14T04:21:38.299347Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:21:38.303040Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09417","last_updated":"2026-08-11T06:00:23Z","snapshot_observed_at":"2026-08-15T09:10:38.074164Z","submitted_at":"2026-08-10T10:45:16Z","title":"Why Post-Norm Transformers Collapse: Attention Amplification and Gradient Repair Failure","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-14T04:21:38.303040Z"},"links":{"citing_paper":"/paper/2608.09417"},"observation_digest":"sha256:d46cb2d0dde251147e61ad84d5e5fd1642af94f14aa2cf2c932378e8e48fe501","observation_id":"ae81cdfd-df89-4bae-9447-37c0aef5ee5a","resolution":{"observed_at":"2026-08-14T04:21:38.303040Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.05962","last_updated":"2022-03-09T23:55:24Z","snapshot_observed_at":"2026-08-15T01:52:42.386450Z","submitted_at":"2022-03-09T23:55:24Z","title":"Anti-Oversmoothing in Deep Vision Transformers via the Fourier Domain Analysis: From Theory to Practice","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.05962","snapshot_observed_at":"2026-08-14T04:21:38.306868Z","title":"arXiv preprint arXiv:2203.05962 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09417","last_updated":"2026-08-11T06:00:23Z","snapshot_observed_at":"2026-08-15T09:10:38.074164Z","submitted_at":"2026-08-10T10:45:16Z","title":"Why Post-Norm Transformers Collapse: Attention Amplification and Gradient Repair Failure","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-14T04:21:38.306868Z"},"links":{"cited_paper":"/paper/2203.05962","citing_paper":"/paper/2608.09417"},"observation_digest":"sha256:40186c7f667dd736919aa5ff20aad6c88771ced235c88485a2c7354aefc98ed9","observation_id":"dd3bb6c7-822a-424f-8bc9-182e79bf21ff","resolution":{"observed_at":"2026-08-14T04:21:38.306868Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:21:38.313229Z","title":"Proceedings of the AAAI Conference on Artificial Intelligence , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09417","last_updated":"2026-08-11T06:00:23Z","snapshot_observed_at":"2026-08-15T09:10:38.074164Z","submitted_at":"2026-08-10T10:45:16Z","title":"Why Post-Norm Transformers Collapse: Attention Amplification and Gradient Repair Failure","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-14T04:21:38.313229Z"},"links":{"citing_paper":"/paper/2608.09417"},"observation_digest":"sha256:ba4a2d59063df9172417d7e178d691e4a4ba9d60344d9530cbedd2f0033eb151","observation_id":"3793dee4-538f-4888-84b6-17b21f9701bb","resolution":{"observed_at":"2026-08-14T04:21:38.313229Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:21:38.318339Z","title":"Proceedings of the IEEE/CVF International Conference on Computer Vision , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09417","last_updated":"2026-08-11T06:00:23Z","snapshot_observed_at":"2026-08-15T09:10:38.074164Z","submitted_at":"2026-08-10T10:45:16Z","title":"Why Post-Norm Transformers Collapse: Attention Amplification and Gradient Repair Failure","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-14T04:21:38.318339Z"},"links":{"citing_paper":"/paper/2608.09417"},"observation_digest":"sha256:9f68eaa8167f9660da3930cb46cbff42b2f5e3ae2d640532924304aad7863be4","observation_id":"fb0cf219-3f3b-48e5-b18d-1be389b8a34e","resolution":{"observed_at":"2026-08-14T04:21:38.318339Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:21:38.322236Z","title":"Findings of the Association for Computational Linguistics: ACL 2023 , pages=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.09417","last_updated":"2026-08-11T06:00:23Z","snapshot_observed_at":"2026-08-15T09:10:38.074164Z","submitted_at":"2026-08-10T10:45:16Z","title":"Why Post-Norm Transformers Collapse: Attention Amplification and Gradient Repair Failure","version":2},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-14T04:21:38.322236Z"},"links":{"citing_paper":"/paper/2608.09417"},"observation_digest":"sha256:df7525b02d26ebafde64c748815d98c6aaecb6faf4934e26eb889cb19288e3b7","observation_id":"2817d25d-60d3-4363-a82d-0e38e02769b5","resolution":{"observed_at":"2026-08-14T04:21:38.322236Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.10322","last_updated":"2023-02-20T21:26:25Z","snapshot_observed_at":"2026-08-13T12:40:36.154751Z","submitted_at":"2023-02-20T21:26:25Z","title":"Deep Transformers without Shortcuts: Modifying Self-attention for Faithful Signal Propagation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.10322","snapshot_observed_at":"2026-08-14T04:21:38.325853Z","title":"arXiv preprint arXiv:2302.10322 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09417","last_updated":"2026-08-11T06:00:23Z","snapshot_observed_at":"2026-08-15T09:10:38.074164Z","submitted_at":"2026-08-10T10:45:16Z","title":"Why Post-Norm Transformers Collapse: Attention Amplification and Gradient Repair Failure","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-14T04:21:38.325853Z"},"links":{"cited_paper":"/paper/2302.10322","citing_paper":"/paper/2608.09417"},"observation_digest":"sha256:c0bba11ccbb78721020c3f0c3bbba30f14f567a82c363ad498a998f4de4d53bf","observation_id":"1a988e5c-76d2-4c1b-992c-8c5ac7ff6b4a","resolution":{"observed_at":"2026-08-14T04:21:38.325853Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.14802","last_updated":"2023-04-28T12:19:47Z","snapshot_observed_at":"2026-08-15T03:45:08.807078Z","submitted_at":"2023-04-28T12:19:47Z","title":"ResiDual: Transformer with Dual Residual Connections","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.14802","snapshot_observed_at":"2026-08-14T04:21:38.329641Z","title":"arXiv preprint arXiv:2304.14802 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09417","last_updated":"2026-08-11T06:00:23Z","snapshot_observed_at":"2026-08-15T09:10:38.074164Z","submitted_at":"2026-08-10T10:45:16Z","title":"Why Post-Norm Transformers Collapse: Attention Amplification and Gradient Repair Failure","version":2},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-14T04:21:38.329641Z"},"links":{"cited_paper":"/paper/2304.14802","citing_paper":"/paper/2608.09417"},"observation_digest":"sha256:969117ca979cbf7110882628f8b6ef344e28066b5f2a60aba83ad9611d9c5dd2","observation_id":"cadfe642-be91-4cd2-a17d-721b9960c43d","resolution":{"observed_at":"2026-08-14T04:21:38.329641Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09635","last_updated":"2024-07-18T17:59:35Z","snapshot_observed_at":"2026-08-15T08:37:32.847413Z","submitted_at":"2024-03-14T17:59:14Z","title":"Transformers Get Stable: An End-to-End Signal Propagation Theory for Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.09635","snapshot_observed_at":"2026-08-14T04:21:38.333325Z","title":"arXiv preprint arXiv:2403.09635 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09417","last_updated":"2026-08-11T06:00:23Z","snapshot_observed_at":"2026-08-15T09:10:38.074164Z","submitted_at":"2026-08-10T10:45:16Z","title":"Why Post-Norm Transformers Collapse: Attention Amplification and Gradient Repair Failure","version":2},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-14T04:21:38.333325Z"},"links":{"cited_paper":"/paper/2403.09635","citing_paper":"/paper/2608.09417"},"observation_digest":"sha256:fbc5c95ce5b7c1a35f767a6530b5ac5e3c44196f0c58df7322a53c693f0a44ab","observation_id":"3a1f7dec-477c-4b2b-a13b-3fa27dd36a2c","resolution":{"observed_at":"2026-08-14T04:21:38.333325Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:21:38.337114Z","title":"Proceedings of the 57th Annual Meeting of the Association for Computational Linguistics , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09417","last_updated":"2026-08-11T06:00:23Z","snapshot_observed_at":"2026-08-15T09:10:38.074164Z","submitted_at":"2026-08-10T10:45:16Z","title":"Why Post-Norm Transformers Collapse: Attention Amplification and Gradient Repair Failure","version":2},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-14T04:21:38.337114Z"},"links":{"citing_paper":"/paper/2608.09417"},"observation_digest":"sha256:91624f89961834110cb84218194c33c73f0972447894f7c1385518d355ea9c52","observation_id":"e149d968-3275-4d99-b95a-2a163cc82bf5","resolution":{"observed_at":"2026-08-14T04:21:38.337114Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:21:38.340692Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2608.09417","last_updated":"2026-08-11T06:00:23Z","snapshot_observed_at":"2026-08-15T09:10:38.074164Z","submitted_at":"2026-08-10T10:45:16Z","title":"Why Post-Norm Transformers Collapse: Attention Amplification and Gradient Repair Failure","version":2},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-14T04:21:38.340692Z"},"links":{"citing_paper":"/paper/2608.09417"},"observation_digest":"sha256:cb143813c1b3220738f8a7c792cd313ecb567857225e1fe3c0e7b494b46491db","observation_id":"40fef9a5-0b9f-44a6-921b-caa555f5774d","resolution":{"observed_at":"2026-08-14T04:21:38.340692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-08-13T14:19:26.598265Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-14T04:21:38.344912Z","title":"arXiv preprint arXiv:2010.11929 , year=","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2608.09417","last_updated":"2026-08-11T06:00:23Z","snapshot_observed_at":"2026-08-15T09:10:38.074164Z","submitted_at":"2026-08-10T10:45:16Z","title":"Why Post-Norm Transformers Collapse: Attention Amplification and Gradient Repair Failure","version":2},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-14T04:21:38.344912Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2608.09417"},"observation_digest":"sha256:e1790458e0756f6d054171fdd888f38a3e186de2548a015e8147f0750de4fc3c","observation_id":"10e4fcea-a7b6-4051-aa37-36dfa972e16f","resolution":{"observed_at":"2026-08-14T04:21:38.344912Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:21:38.348675Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09417","last_updated":"2026-08-11T06:00:23Z","snapshot_observed_at":"2026-08-15T09:10:38.074164Z","submitted_at":"2026-08-10T10:45:16Z","title":"Why Post-Norm Transformers Collapse: Attention Amplification and Gradient Repair Failure","version":2},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-14T04:21:38.348675Z"},"links":{"citing_paper":"/paper/2608.09417"},"observation_digest":"sha256:2d8c043d712ef0c8cfc02ab00dfccca17c02d4ff12d597c115a6017ba582b68f","observation_id":"521ef5a7-36bd-426d-84d5-68e0603eda13","resolution":{"observed_at":"2026-08-14T04:21:38.348675Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-08-13T17:41:53.092611Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-08-14T04:21:38.352066Z","title":"arXiv preprint arXiv:2001.08361 , year=","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2608.09417","last_updated":"2026-08-11T06:00:23Z","snapshot_observed_at":"2026-08-15T09:10:38.074164Z","submitted_at":"2026-08-10T10:45:16Z","title":"Why Post-Norm Transformers Collapse: Attention Amplification and Gradient Repair Failure","version":2},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-14T04:21:38.352066Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2608.09417"},"observation_digest":"sha256:49c56d168f1f30bc63d6b2f90734dcfca223a4febe68486a4fc66f27bda45a0e","observation_id":"765c2a44-7301-4137-9aa2-2a752c16cf76","resolution":{"observed_at":"2026-08-14T04:21:38.352066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.15556","last_updated":"2022-03-29T13:38:03Z","snapshot_observed_at":"2026-08-09T19:52:33.533277Z","submitted_at":"2022-03-29T13:38:03Z","title":"Training Compute-Optimal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.15556","snapshot_observed_at":"2026-08-14T04:21:38.356001Z","title":"arXiv preprint arXiv:2203.15556 , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09417","last_updated":"2026-08-11T06:00:23Z","snapshot_observed_at":"2026-08-15T09:10:38.074164Z","submitted_at":"2026-08-10T10:45:16Z","title":"Why Post-Norm Transformers Collapse: Attention Amplification and Gradient Repair Failure","version":2},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-14T04:21:38.356001Z"},"links":{"cited_paper":"/paper/2203.15556","citing_paper":"/paper/2608.09417"},"observation_digest":"sha256:65e73bcf04a634c46819577d89fa10c828468cf175c9d3d88d09db7223e4c447","observation_id":"6cc02f1f-0fa4-4cef-865c-a218e0108a8e","resolution":{"observed_at":"2026-08-14T04:21:38.356001Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-08-14T20:13:52.872565Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-14T04:21:38.359922Z","title":"arXiv preprint arXiv:1711.05101 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09417","last_updated":"2026-08-11T06:00:23Z","snapshot_observed_at":"2026-08-15T09:10:38.074164Z","submitted_at":"2026-08-10T10:45:16Z","title":"Why Post-Norm Transformers Collapse: Attention Amplification and Gradient Repair Failure","version":2},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-14T04:21:38.359922Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2608.09417"},"observation_digest":"sha256:a1beec0f6abac37304b5bb0cb1deeb5985e49d460869ce68f7b03bada7336f13","observation_id":"5b853770-ce91-4188-a3e7-7583fe7fb5b1","resolution":{"observed_at":"2026-08-14T04:21:38.359922Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:21:38.363798Z","title":"Journal of Machine Learning Research , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09417","last_updated":"2026-08-11T06:00:23Z","snapshot_observed_at":"2026-08-15T09:10:38.074164Z","submitted_at":"2026-08-10T10:45:16Z","title":"Why Post-Norm Transformers Collapse: Attention Amplification and Gradient Repair Failure","version":2},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-14T04:21:38.363798Z"},"links":{"citing_paper":"/paper/2608.09417"},"observation_digest":"sha256:368c25d72e40a6853cead61a456c55f26c9c5d21750053d1ac6401d354848789","observation_id":"e9ebae4b-41d5-40b8-85a1-41fc4afc03e9","resolution":{"observed_at":"2026-08-14T04:21:38.363798Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-14T04:21:38.368091Z","title":"arXiv preprint arXiv:2307.09288 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09417","last_updated":"2026-08-11T06:00:23Z","snapshot_observed_at":"2026-08-15T09:10:38.074164Z","submitted_at":"2026-08-10T10:45:16Z","title":"Why Post-Norm Transformers Collapse: Attention Amplification and Gradient Repair Failure","version":2},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-14T04:21:38.368091Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2608.09417"},"observation_digest":"sha256:ded0bce62ead06acafb1f7422ce120f36cf5853723d0c9d5470167498c72a096","observation_id":"4773ea73-9edb-4821-885c-4d2d8cb16f80","resolution":{"observed_at":"2026-08-14T04:21:38.368091Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:21:38.372095Z","title":"arXiv preprint arXiv:2602.18849 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09417","last_updated":"2026-08-11T06:00:23Z","snapshot_observed_at":"2026-08-15T09:10:38.074164Z","submitted_at":"2026-08-10T10:45:16Z","title":"Why Post-Norm Transformers Collapse: Attention Amplification and Gradient Repair Failure","version":2},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-14T04:21:38.372095Z"},"links":{"citing_paper":"/paper/2608.09417"},"observation_digest":"sha256:40e6e40bcdc2e224a21bb4d4d3432f44471f1d0bdc2d3d57ead36bf7921ca08b","observation_id":"6df78ccc-6302-48db-be7f-8667641b8f8c","resolution":{"observed_at":"2026-08-14T04:21:38.372095Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:21:38.376379Z","title":"arXiv preprint arXiv:2601.19895 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09417","last_updated":"2026-08-11T06:00:23Z","snapshot_observed_at":"2026-08-15T09:10:38.074164Z","submitted_at":"2026-08-10T10:45:16Z","title":"Why Post-Norm Transformers Collapse: Attention Amplification and Gradient Repair Failure","version":2},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-14T04:21:38.376379Z"},"links":{"citing_paper":"/paper/2608.09417"},"observation_digest":"sha256:0f3c9ffd5370d76a19ad4948c93cfc148842c741ade9e289bf73eb792951105d","observation_id":"eb0eb5e2-2bb4-4697-aa7d-971d99f474d1","resolution":{"observed_at":"2026-08-14T04:21:38.376379Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:21:38.380478Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09417","last_updated":"2026-08-11T06:00:23Z","snapshot_observed_at":"2026-08-15T09:10:38.074164Z","submitted_at":"2026-08-10T10:45:16Z","title":"Why Post-Norm Transformers Collapse: Attention Amplification and Gradient Repair Failure","version":2},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-14T04:21:38.380478Z"},"links":{"citing_paper":"/paper/2608.09417"},"observation_digest":"sha256:7614a87f3c657c4122d2697c84c63581ecce51fa5533234fdb17ff027c1c273e","observation_id":"e3dd11c8-1d48-4f6a-b40f-0590ffbdb8ca","resolution":{"observed_at":"2026-08-14T04:21:38.380478Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:21:38.384143Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2608.09417","last_updated":"2026-08-11T06:00:23Z","snapshot_observed_at":"2026-08-15T09:10:38.074164Z","submitted_at":"2026-08-10T10:45:16Z","title":"Why Post-Norm Transformers Collapse: Attention Amplification and Gradient Repair Failure","version":2},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-14T04:21:38.384143Z"},"links":{"citing_paper":"/paper/2608.09417"},"observation_digest":"sha256:bfbc869b5e48c051956aac47701bf77a3e99852369edc96915d82d0fd3558510","observation_id":"5423d62f-a521-44c8-a78d-c217b38f5494","resolution":{"observed_at":"2026-08-14T04:21:38.384143Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.09417","last_updated":"2026-08-11T06:00:23Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-15T09:10:38.074164Z","submitted_at":"2026-08-10T10:45:16Z","title":"Why Post-Norm Transformers Collapse: Attention Amplification and Gradient Repair Failure"},"reference_resolution":{"displayed":59,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":59,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":59},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 59 of 59 outbound references and 0 inbound Pith citation observations for arXiv:2608.09417."}