{"as_of":"2026-08-09T17:44:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:45edf856ca20d37577bcdb1d55de24d1c6af02d775b81f763734517c93f17286","coverage":[{"denominator":24,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":24,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T06:37:55.054757Z","state":"measured"},{"denominator":26,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":26,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T03:08:35.290649Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2601.22580","last_updated":"2026-06-04T11:50:53Z","snapshot_observed_at":"2026-08-03T06:37:49.104766Z","submitted_at":"2026-01-30T05:21:57Z","title":"SpanNorm: Reconciling Training Stability and Performance in Deep Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.22580","snapshot_observed_at":"2026-08-02T03:08:35.290649Z","title":"SpanNorm: Reconciling training stability and performance in deep transformers.arXiv preprint arXiv:2601.22580,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14018","last_updated":"2026-07-15T16:50:43Z","snapshot_observed_at":"2026-08-05T03:03:44.055926Z","submitted_at":"2026-07-15T16:50:43Z","title":"Transforming Rank: How Architecture Navigates the Spectral Pathologies of Depth","version":1},"reference_index":2016,"source":"pdf_text","source_observed_at":"2026-08-02T03:08:35.290649Z"},"links":{"cited_paper":"/paper/2601.22580","citing_paper":"/paper/2607.14018"},"observation_digest":"sha256:310ce4962e33a631f9480e04d3287ba5b645baf181bff68223d0c4e117a9baa5","observation_id":"c4654426-a0e4-448e-b38b-6af51e9993c0","resolution":{"observed_at":"2026-08-02T03:08:35.290649Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.22580","last_updated":"2026-06-04T11:50:53Z","snapshot_observed_at":"2026-08-03T06:37:49.104766Z","submitted_at":"2026-01-30T05:21:57Z","title":"SpanNorm: Reconciling Training Stability and Performance in Deep Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.22580","snapshot_observed_at":"2026-08-01T15:58:13.171476Z","title":"org/abs/2601.22580","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18130","last_updated":"2026-07-20T16:24:17Z","snapshot_observed_at":"2026-08-06T00:13:34.236374Z","submitted_at":"2026-07-20T16:24:17Z","title":"Manifold-Constrained Hyper-Connections for Parameter-Efficient Finetuning","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-01T15:58:13.171476Z"},"links":{"cited_paper":"/paper/2601.22580","citing_paper":"/paper/2607.18130"},"observation_digest":"sha256:95aafe5c3b7fe28de6c4319d14c50e037b843de222625709e536577c6f6e4f6e","observation_id":"74a1add0-7c06-4ea3-add0-8eff061bd9e7","resolution":{"observed_at":"2026-08-01T15:58:13.171476Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2601.22580/citation-record","integrity":"/paper/2601.22580/integrity","json":"/paper/2601.22580/citation-record.json","paper":"/paper/2601.22580"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:37:51.875002Z","title":"D., Dhariwal, P., Neelakantan, A., Shyam, P., Sastry, G., Askell, A., et al","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2601.22580","last_updated":"2026-06-04T11:50:53Z","snapshot_observed_at":"2026-08-03T06:37:49.104766Z","submitted_at":"2026-01-30T05:21:57Z","title":"SpanNorm: Reconciling Training Stability and Performance in Deep Transformers","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-03T06:37:51.875002Z"},"links":{"citing_paper":"/paper/2601.22580"},"observation_digest":"sha256:10c9c964074e28aae977d4f619dc6c3b36056cac776440d1f50092ad4c8cf4b1","observation_id":"293ba4ee-e339-4786-80db-b2dbe1f379f1","resolution":{"observed_at":"2026-08-03T06:37:51.875002Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:37:52.174764Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.22580","last_updated":"2026-06-04T11:50:53Z","snapshot_observed_at":"2026-08-03T06:37:49.104766Z","submitted_at":"2026-01-30T05:21:57Z","title":"SpanNorm: Reconciling Training Stability and Performance in Deep Transformers","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-03T06:37:52.174764Z"},"links":{"citing_paper":"/paper/2601.22580"},"observation_digest":"sha256:1ba733237050952a8d0e0c6e58f421169b2d34fde91dad2eddf3ea2fe2d77af1","observation_id":"0d237581-7563-45b5-bbde-8f33e8f20485","resolution":{"observed_at":"2026-08-03T06:37:52.174764Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:37:54.584809Z","title":"This isolates the impact of the architecture from the initialization scheme","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.22580","last_updated":"2026-06-04T11:50:53Z","snapshot_observed_at":"2026-08-03T06:37:49.104766Z","submitted_at":"2026-01-30T05:21:57Z","title":"SpanNorm: Reconciling Training Stability and Performance in Deep Transformers","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-03T06:37:54.584809Z"},"links":{"citing_paper":"/paper/2601.22580"},"observation_digest":"sha256:f918db7a57cae14132517a7de9ce487a58086248129f2b712fcb31e4c19154a7","observation_id":"bd10dc45-e6d9-413b-b4c2-10712ad8afb8","resolution":{"observed_at":"2026-08-03T06:37:54.584809Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:37:52.874760Z","title":"Li, P., Yin, L., and Liu, S","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.22580","last_updated":"2026-06-04T11:50:53Z","snapshot_observed_at":"2026-08-03T06:37:49.104766Z","submitted_at":"2026-01-30T05:21:57Z","title":"SpanNorm: Reconciling Training Stability and Performance in Deep Transformers","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-03T06:37:52.874760Z"},"links":{"citing_paper":"/paper/2601.22580"},"observation_digest":"sha256:ce224554e1643298a59000704fb8662b5fb5577aa029b1b0c2b2999bd82d45c8","observation_id":"e7fcc269-84a2-4d5e-a514-8f5e1515621f","resolution":{"observed_at":"2026-08-03T06:37:52.874760Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-03T06:37:53.044794Z","title":"Deepseek-v3 technical report.arXiv preprint arXiv:2412.19437,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.22580","last_updated":"2026-06-04T11:50:53Z","snapshot_observed_at":"2026-08-03T06:37:49.104766Z","submitted_at":"2026-01-30T05:21:57Z","title":"SpanNorm: Reconciling Training Stability and Performance in Deep Transformers","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-03T06:37:53.044794Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2601.22580"},"observation_digest":"sha256:cf614a2290b885f00ddcea1ff6bc3d0dcd20a2dc6a2fa597ed64235e51f17f3b","observation_id":"cc0dc7c0-85ff-46ac-a3ae-c82289339053","resolution":{"observed_at":"2026-08-03T06:37:53.044794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.16903","last_updated":"2025-07-25T05:09:17Z","snapshot_observed_at":"2026-07-06T17:09:10.513197Z","submitted_at":"2023-12-28T08:53:27Z","title":"Spike No More: Stabilizing the Pre-training of Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.16903","snapshot_observed_at":"2026-08-03T06:37:53.414766Z","title":"net/forum?id=Orpf8yDjdj","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.22580","last_updated":"2026-06-04T11:50:53Z","snapshot_observed_at":"2026-08-03T06:37:49.104766Z","submitted_at":"2026-01-30T05:21:57Z","title":"SpanNorm: Reconciling Training Stability and Performance in Deep Transformers","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-03T06:37:53.414766Z"},"links":{"cited_paper":"/paper/2312.16903","citing_paper":"/paper/2601.22580"},"observation_digest":"sha256:6bd7f2c93dfa753793bc01b034812e3db04b22a234bc3f2822c722a7094462e8","observation_id":"092d188c-22f4-48ec-aecf-9283e1ad4ed6","resolution":{"observed_at":"2026-08-03T06:37:53.414766Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00118","last_updated":"2024-10-02T15:22:49Z","snapshot_observed_at":"2026-08-02T16:20:09.773989Z","submitted_at":"2024-07-31T19:13:07Z","title":"Gemma 2: Improving Open Language Models at a Practical Size","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00118","snapshot_observed_at":"2026-08-03T06:37:53.551888Z","title":"G., Hardin, C., Bhupatiraju, S., Hussenot, L., Mesnard, T., Shahri- ari, B., Ram ´e, A., et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.22580","last_updated":"2026-06-04T11:50:53Z","snapshot_observed_at":"2026-08-03T06:37:49.104766Z","submitted_at":"2026-01-30T05:21:57Z","title":"SpanNorm: Reconciling Training Stability and Performance in Deep Transformers","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-03T06:37:53.551888Z"},"links":{"cited_paper":"/paper/2408.00118","citing_paper":"/paper/2601.22580"},"observation_digest":"sha256:57d89e91e70d3ad199eac2d796a6a60c9ad12ae2aa99e0de23e5c9deff06287e","observation_id":"58e2e5ac-c5cc-49b1-b893-abb46450f71b","resolution":{"observed_at":"2026-08-03T06:37:53.551888Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:37:53.644874Z","title":"L., Li, B., Lei, B., Wang, B., Rong, B., Wang, C., Zhang, C., Gao, C., Zhang, C., Sun, C., et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.22580","last_updated":"2026-06-04T11:50:53Z","snapshot_observed_at":"2026-08-03T06:37:49.104766Z","submitted_at":"2026-01-30T05:21:57Z","title":"SpanNorm: Reconciling Training Stability and Performance in Deep Transformers","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-03T06:37:53.644874Z"},"links":{"citing_paper":"/paper/2601.22580"},"observation_digest":"sha256:40597dd1664dc5e4b70c09ced64973810bfee37108cd1c4b989f8bdef756cd17","observation_id":"b0900031-97ac-4c3a-a19a-e25507a68749","resolution":{"observed_at":"2026-08-03T06:37:53.644874Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-03T06:37:53.764764Z","title":"Llama: Open and efficient foundation language models.CoRR, abs/2302.13971,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.22580","last_updated":"2026-06-04T11:50:53Z","snapshot_observed_at":"2026-08-03T06:37:49.104766Z","submitted_at":"2026-01-30T05:21:57Z","title":"SpanNorm: Reconciling Training Stability and Performance in Deep Transformers","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-03T06:37:53.764764Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2601.22580"},"observation_digest":"sha256:4269bc14ee7c2ea0b92700f9daf7fe090f50e5114757ac719744d82d16a60e3e","observation_id":"b6ea308e-b69c-4a77-896f-cb6f09727799","resolution":{"observed_at":"2026-08-03T06:37:53.764764Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-03T06:37:53.934754Z","title":"Qwen3 technical report.arXiv preprint arXiv:2505.09388,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.22580","last_updated":"2026-06-04T11:50:53Z","snapshot_observed_at":"2026-08-03T06:37:49.104766Z","submitted_at":"2026-01-30T05:21:57Z","title":"SpanNorm: Reconciling Training Stability and Performance in Deep Transformers","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-03T06:37:53.934754Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2601.22580"},"observation_digest":"sha256:084298eaf7ad6dc02c5e1d439f4549cb66890d2de7788af5faafb0847c8bcfd9","observation_id":"3238ff96-6bf5-48e8-8794-a9cf4ac718ef","resolution":{"observed_at":"2026-08-03T06:37:53.934754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:37:54.044772Z","title":"Improving deep transformer with depth-scaled initialization and merged attention","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2601.22580","last_updated":"2026-06-04T11:50:53Z","snapshot_observed_at":"2026-08-03T06:37:49.104766Z","submitted_at":"2026-01-30T05:21:57Z","title":"SpanNorm: Reconciling Training Stability and Performance in Deep Transformers","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-03T06:37:54.044772Z"},"links":{"citing_paper":"/paper/2601.22580"},"observation_digest":"sha256:eee62abdb376ea8782855b12d34015d849fd428e08c9dd94d364135882121661","observation_id":"e6dce9cb-04ad-4ae2-85e6-515d2827fca3","resolution":{"observed_at":"2026-08-03T06:37:54.044772Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:37:54.204766Z","title":"10 SpanNorm: Reconciling Training Stability and Performance in Deep Transformers A","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2601.22580","last_updated":"2026-06-04T11:50:53Z","snapshot_observed_at":"2026-08-03T06:37:49.104766Z","submitted_at":"2026-01-30T05:21:57Z","title":"SpanNorm: Reconciling Training Stability and Performance in Deep Transformers","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-03T06:37:54.204766Z"},"links":{"citing_paper":"/paper/2601.22580"},"observation_digest":"sha256:2da37153f6cbd5c26d72f24a0b5173d9cf4a6fba84cf71dacdede283c84aa3ae","observation_id":"7399ff37-2bdb-439e-919d-6b77bb2df8cb","resolution":{"observed_at":"2026-08-03T06:37:54.204766Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:37:54.376442Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.22580","last_updated":"2026-06-04T11:50:53Z","snapshot_observed_at":"2026-08-03T06:37:49.104766Z","submitted_at":"2026-01-30T05:21:57Z","title":"SpanNorm: Reconciling Training Stability and Performance in Deep Transformers","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-03T06:37:54.376442Z"},"links":{"citing_paper":"/paper/2601.22580"},"observation_digest":"sha256:8f3316567e95ef207f974492c05815c3d9a964c460555b0465bd4fa32636ceaf","observation_id":"9c50c541-1c22-4056-8cee-43e8bfb14b7e","resolution":{"observed_at":"2026-08-03T06:37:54.376442Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:37:54.684811Z","title":"In contrast, SpanNorm demonstrates superior representational capability","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.22580","last_updated":"2026-06-04T11:50:53Z","snapshot_observed_at":"2026-08-03T06:37:49.104766Z","submitted_at":"2026-01-30T05:21:57Z","title":"SpanNorm: Reconciling Training Stability and Performance in Deep Transformers","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-03T06:37:54.684811Z"},"links":{"citing_paper":"/paper/2601.22580"},"observation_digest":"sha256:571ea458fdb4f01fbe450178c0c8b36606b330c2103558cdba5a50b8b95ee757","observation_id":"302ab2e2-82a8-401b-87c3-80f181cbb33a","resolution":{"observed_at":"2026-08-03T06:37:54.684811Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:37:54.934759Z","title":"All models are trained on the same subset of the SlimPajama dataset (from 30B to 200B) with the Mistral tokenizer Jiang et al","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2601.22580","last_updated":"2026-06-04T11:50:53Z","snapshot_observed_at":"2026-08-03T06:37:49.104766Z","submitted_at":"2026-01-30T05:21:57Z","title":"SpanNorm: Reconciling Training Stability and Performance in Deep Transformers","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-03T06:37:54.934759Z"},"links":{"citing_paper":"/paper/2601.22580"},"observation_digest":"sha256:a56aa352b5f8dc75d1f9b543ff380859ab7cb4014c5e54dab2e4cc0feda6aacf","observation_id":"cfe41fac-244a-41c7-ae4f-97059b847ab6","resolution":{"observed_at":"2026-08-03T06:37:54.934759Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:37:55.054757Z","title":null,"venue":null,"work_id":null,"year":2000},"citing_paper":{"arxiv_id":"2601.22580","last_updated":"2026-06-04T11:50:53Z","snapshot_observed_at":"2026-08-03T06:37:49.104766Z","submitted_at":"2026-01-30T05:21:57Z","title":"SpanNorm: Reconciling Training Stability and Performance in Deep Transformers","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-03T06:37:55.054757Z"},"links":{"citing_paper":"/paper/2601.22580"},"observation_digest":"sha256:2c75e334f5e03a86920f6178cce9abe830aac2715e9b9ce6e32fcc07fd819d58","observation_id":"db33dd57-8bab-4de8-8000-12cb264d854e","resolution":{"observed_at":"2026-08-03T06:37:55.054757Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:37:54.475088Z","title":"It employs an MLA architecture, activating 6 out of 64 experts","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.22580","last_updated":"2026-06-04T11:50:53Z","snapshot_observed_at":"2026-08-03T06:37:49.104766Z","submitted_at":"2026-01-30T05:21:57Z","title":"SpanNorm: Reconciling Training Stability and Performance in Deep Transformers","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-03T06:37:54.475088Z"},"links":{"citing_paper":"/paper/2601.22580"},"observation_digest":"sha256:7d52004ac330d60a8e39a26702b81214d1241a3336385461142f0c18f35832fa","observation_id":"103a586a-32d8-4e97-b0bf-b6b0082c4c3c","resolution":{"observed_at":"2026-08-03T06:37:54.475088Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:37:54.805213Z","title":"SpanNorm shows a strict monotonic decrease in training loss, confirming robust stability and the effective avoidance of depth degradation at extreme scales","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.22580","last_updated":"2026-06-04T11:50:53Z","snapshot_observed_at":"2026-08-03T06:37:49.104766Z","submitted_at":"2026-01-30T05:21:57Z","title":"SpanNorm: Reconciling Training Stability and Performance in Deep Transformers","version":2},"reference_index":384,"source":"pdf_text","source_observed_at":"2026-08-03T06:37:54.805213Z"},"links":{"citing_paper":"/paper/2601.22580"},"observation_digest":"sha256:408983ef7242ecdbdd12788eba074726428c639b9a05823aa6789974dcf358c5","observation_id":"e8aeaa3c-e490-4587-a8e8-cf716e482242","resolution":{"observed_at":"2026-08-03T06:37:54.805213Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:37:52.754764Z","title":"Shallow-to-deep training for neural ma- chine translation","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2601.22580","last_updated":"2026-06-04T11:50:53Z","snapshot_observed_at":"2026-08-03T06:37:49.104766Z","submitted_at":"2026-01-30T05:21:57Z","title":"SpanNorm: Reconciling Training Stability and Performance in Deep Transformers","version":2},"reference_index":2016,"source":"pdf_text","source_observed_at":"2026-08-03T06:37:52.754764Z"},"links":{"citing_paper":"/paper/2601.22580"},"observation_digest":"sha256:cbfdf1291118add6eaf448524c4669945ed1143a2fb064ecf1748f1c5ef69fd2","observation_id":"35c1985e-c86e-49eb-b860-1e88f053b8eb","resolution":{"observed_at":"2026-08-03T06:37:52.754764Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:37:51.994756Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2601.22580","last_updated":"2026-06-04T11:50:53Z","snapshot_observed_at":"2026-08-03T06:37:49.104766Z","submitted_at":"2026-01-30T05:21:57Z","title":"SpanNorm: Reconciling Training Stability and Performance in Deep Transformers","version":2},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-03T06:37:51.994756Z"},"links":{"citing_paper":"/paper/2601.22580"},"observation_digest":"sha256:1b5b010df11286f7a584dba1776bc3c7299d87068d33a58c87fb8a435a02c9d6","observation_id":"39a1bcaa-cc6c-41a5-8c03-bec1ba88d064","resolution":{"observed_at":"2026-08-03T06:37:51.994756Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.09456","last_updated":"2021-11-01T15:34:23Z","snapshot_observed_at":"2026-07-06T11:59:11.865133Z","submitted_at":"2021-10-18T16:47:45Z","title":"NormFormer: Improved Transformer Pretraining with Extra Normalization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.09456","snapshot_observed_at":"2026-08-03T06:37:53.244800Z","title":"Shoeybi, M., Patwary, M., Puri, R., LeGresley, P., Casper, J., and Catanzaro, B","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2601.22580","last_updated":"2026-06-04T11:50:53Z","snapshot_observed_at":"2026-08-03T06:37:49.104766Z","submitted_at":"2026-01-30T05:21:57Z","title":"SpanNorm: Reconciling Training Stability and Performance in Deep Transformers","version":2},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-03T06:37:53.244800Z"},"links":{"cited_paper":"/paper/2110.09456","citing_paper":"/paper/2601.22580"},"observation_digest":"sha256:b957ba85c516e7bb989480eabde5d86170325a802e4fed99f9e31ac3fac59db1","observation_id":"7b20b22d-d874-4795-bebe-a0d7a08359e0","resolution":{"observed_at":"2026-08-03T06:37:53.244800Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09635","last_updated":"2024-07-18T17:59:35Z","snapshot_observed_at":"2026-07-06T17:44:45.924645Z","submitted_at":"2024-03-14T17:59:14Z","title":"Transformers Get Stable: An End-to-End Signal Propagation Theory for Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.09635","snapshot_observed_at":"2026-08-03T06:37:52.424760Z","title":"A., Khyalia, S., Jung, J., Goka, H., and Lee, H","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.22580","last_updated":"2026-06-04T11:50:53Z","snapshot_observed_at":"2026-08-03T06:37:49.104766Z","submitted_at":"2026-01-30T05:21:57Z","title":"SpanNorm: Reconciling Training Stability and Performance in Deep Transformers","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-03T06:37:52.424760Z"},"links":{"cited_paper":"/paper/2403.09635","citing_paper":"/paper/2601.22580"},"observation_digest":"sha256:f449a4a63467c72e87b37a3c2eacdcc96253f7ef323c1203c0191a66209a5b20","observation_id":"5565be61-45ba-488c-a31d-e5f4c4449a3b","resolution":{"observed_at":"2026-08-03T06:37:52.424760Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.02732","last_updated":"2025-06-06T11:19:11Z","snapshot_observed_at":"2026-08-09T11:16:06.304371Z","submitted_at":"2025-02-04T21:29:47Z","title":"Peri-LN: Revisiting Normalization Layer in the Transformer Architecture","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.02732","snapshot_observed_at":"2026-08-03T06:37:52.586372Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.22580","last_updated":"2026-06-04T11:50:53Z","snapshot_observed_at":"2026-08-03T06:37:49.104766Z","submitted_at":"2026-01-30T05:21:57Z","title":"SpanNorm: Reconciling Training Stability and Performance in Deep Transformers","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-03T06:37:52.586372Z"},"links":{"cited_paper":"/paper/2502.02732","citing_paper":"/paper/2601.22580"},"observation_digest":"sha256:11143dcfe299eb731b4e666e5346a8bc85effab2270c54cc5395c06c832016bb","observation_id":"06bcf884-d9c7-4e6d-947d-a84f125f271c","resolution":{"observed_at":"2026-08-03T06:37:52.586372Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06825","last_updated":"2023-10-10T17:54:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-10T17:54:58Z","title":"Mistral 7B","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06825","snapshot_observed_at":"2026-08-03T06:37:52.334759Z","title":"Q., Sablayrolles, A., Mensch, A., Bamford, C., Chaplot, D","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.22580","last_updated":"2026-06-04T11:50:53Z","snapshot_observed_at":"2026-08-03T06:37:49.104766Z","submitted_at":"2026-01-30T05:21:57Z","title":"SpanNorm: Reconciling Training Stability and Performance in Deep Transformers","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-03T06:37:52.334759Z"},"links":{"cited_paper":"/paper/2310.06825","citing_paper":"/paper/2601.22580"},"observation_digest":"sha256:4c32218dc6da42514a4f5d5d825762cfec9b6226bf5df228279703aa0bd1c547","observation_id":"3cfb67d6-0ef5-4585-a171-c128c013ec0c","resolution":{"observed_at":"2026-08-03T06:37:52.334759Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2601.22580","last_updated":"2026-06-04T11:50:53Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-03T06:37:49.104766Z","submitted_at":"2026-01-30T05:21:57Z","title":"SpanNorm: Reconciling Training Stability and Performance in Deep Transformers"},"reference_resolution":{"displayed":24,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":23,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":24},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 24 of 24 outbound references and 2 inbound Pith citation observations for arXiv:2601.22580."}