{"as_of":"2026-08-19T20:26:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:040b41a449a3c3ec2c5ca03098cf49c53e95551561e64db53b5facc7365632f0","coverage":[{"denominator":44,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":44,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-27T00:58:58.470595Z","state":"measured"},{"denominator":44,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":44,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2606.17945/citation-record","integrity":"/paper/2606.17945/integrity","json":"/paper/2606.17945/citation-record.json","paper":"/paper/2606.17945"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T00:58:58.470595Z","title":"Advances in neural information processing systems33, 1877–1901 (2020)","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2606.17945","last_updated":"2026-06-24T02:25:05Z","snapshot_observed_at":"2026-08-17T21:48:59.748057Z","submitted_at":"2026-06-16T13:53:48Z","title":"Small Initialization Matters for Large Language Models","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-27T00:58:58.470595Z"},"links":{"citing_paper":"/paper/2606.17945"},"observation_digest":"sha256:79c119fba7c6ac6492817667dfc9ad21dedeba2a38e119184279d27469f304fc","observation_id":"4729e3c0-8c34-4b5b-b2b0-aafca7c2b52b","resolution":{"observed_at":"2026-06-27T00:58:58.470595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-08-13T17:41:53.092611Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":"2001.08361","doi":"10.1145/3616855.3635845","metadata_source":"pith","pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scaling Laws for Neural Language Models","venue":"cs.LG","work_id":"b7dd8749-9c45-4977-ab9b-64478dce1ae8","year":2020},"citing_paper":{"arxiv_id":"2606.17945","last_updated":"2026-06-24T02:25:05Z","snapshot_observed_at":"2026-08-17T21:48:59.748057Z","submitted_at":"2026-06-16T13:53:48Z","title":"Small Initialization Matters for Large Language Models","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-27T00:58:58.470595Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2606.17945"},"observation_digest":"sha256:d6db38d5b92596cc9140693b5b0b36234484d249dfb5eb0e9bd1f4d2ad7c2c40","observation_id":"e2d856ea-9169-490f-8048-195571b5c770","resolution":{"observed_at":"2026-07-03T20:58:58.412627Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T00:58:58.470595Z","title":"In: Advances in Neural Information Processing Systems (2022)","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.17945","last_updated":"2026-06-24T02:25:05Z","snapshot_observed_at":"2026-08-17T21:48:59.748057Z","submitted_at":"2026-06-16T13:53:48Z","title":"Small Initialization Matters for Large Language Models","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-27T00:58:58.470595Z"},"links":{"citing_paper":"/paper/2606.17945"},"observation_digest":"sha256:fe91a870b9dcd6b3d29239db3b047487561199ec65175a17f4387f680bfb3872","observation_id":"44a2f264-e220-4ace-bfad-7725c1734393","resolution":{"observed_at":"2026-06-27T00:58:58.470595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T00:58:58.470595Z","title":"International Conference on Learning Representations (2022)","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.17945","last_updated":"2026-06-24T02:25:05Z","snapshot_observed_at":"2026-08-17T21:48:59.748057Z","submitted_at":"2026-06-16T13:53:48Z","title":"Small Initialization Matters for Large Language Models","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-27T00:58:58.470595Z"},"links":{"citing_paper":"/paper/2606.17945"},"observation_digest":"sha256:cdc414d090ae03e15e65f6dc2ab60219da86f71ee83eea77da89a6280e4027b6","observation_id":"d1770434-2031-4b2c-b390-4c677673c240","resolution":{"observed_at":"2026-06-27T00:58:58.470595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T00:58:58.470595Z","title":"In: International Conference on Learning Representations, vol","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.17945","last_updated":"2026-06-24T02:25:05Z","snapshot_observed_at":"2026-08-17T21:48:59.748057Z","submitted_at":"2026-06-16T13:53:48Z","title":"Small Initialization Matters for Large Language Models","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-27T00:58:58.470595Z"},"links":{"citing_paper":"/paper/2606.17945"},"observation_digest":"sha256:4d167c85006212381e972c421fe5a3b2e73cde708e5ffe7019f509303498479d","observation_id":"048599ac-7d64-44b6-9f3f-e2dc19da581a","resolution":{"observed_at":"2026-06-27T00:58:58.470595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T00:58:58.470595Z","title":"Nature645(8081), 633–638 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.17945","last_updated":"2026-06-24T02:25:05Z","snapshot_observed_at":"2026-08-17T21:48:59.748057Z","submitted_at":"2026-06-16T13:53:48Z","title":"Small Initialization Matters for Large Language Models","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-27T00:58:58.470595Z"},"links":{"citing_paper":"/paper/2606.17945"},"observation_digest":"sha256:55004663d6249f43800912078bc2d1044eba21fe96868ecc5c9618c1beef4fa6","observation_id":"6a00ad0a-d9f8-436b-85ae-6569ac8ee1ee","resolution":{"observed_at":"2026-06-27T00:58:58.470595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T00:58:58.470595Z","title":"Advances in neural information processing systems (2017)","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2606.17945","last_updated":"2026-06-24T02:25:05Z","snapshot_observed_at":"2026-08-17T21:48:59.748057Z","submitted_at":"2026-06-16T13:53:48Z","title":"Small Initialization Matters for Large Language Models","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-27T00:58:58.470595Z"},"links":{"citing_paper":"/paper/2606.17945"},"observation_digest":"sha256:63b5d5e25be54796b297360ca4d8da5f5bb6b62d3b1969f2e12a57ea842939fb","observation_id":"2f10ce0c-e8c0-4053-80b1-8ce87c2637b5","resolution":{"observed_at":"2026-06-27T00:58:58.470595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T00:58:58.470595Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2606.17945","last_updated":"2026-06-24T02:25:05Z","snapshot_observed_at":"2026-08-17T21:48:59.748057Z","submitted_at":"2026-06-16T13:53:48Z","title":"Small Initialization Matters for Large Language Models","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-27T00:58:58.470595Z"},"links":{"citing_paper":"/paper/2606.17945"},"observation_digest":"sha256:80ec4b6107699d6ba1689947466971ebdaea6dcc5c86a8eac19397de471b806f","observation_id":"47d70322-0b24-4ffe-b634-23c2c9ac3098","resolution":{"observed_at":"2026-06-27T00:58:58.470595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T00:58:58.470595Z","title":"Journal of Machine Learning Research23(120), 1–39 (2022)","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.17945","last_updated":"2026-06-24T02:25:05Z","snapshot_observed_at":"2026-08-17T21:48:59.748057Z","submitted_at":"2026-06-16T13:53:48Z","title":"Small Initialization Matters for Large Language Models","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-27T00:58:58.470595Z"},"links":{"citing_paper":"/paper/2606.17945"},"observation_digest":"sha256:f54a0e67424f8569719d04caac20e648a4a9284530856e619c49bb49fc636f5d","observation_id":"5ff0a5bc-e8df-436a-86ec-d13b60a4d126","resolution":{"observed_at":"2026-06-27T00:58:58.470595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T00:58:58.470595Z","title":"In: First Conference on Language Modeling (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.17945","last_updated":"2026-06-24T02:25:05Z","snapshot_observed_at":"2026-08-17T21:48:59.748057Z","submitted_at":"2026-06-16T13:53:48Z","title":"Small Initialization Matters for Large Language Models","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-27T00:58:58.470595Z"},"links":{"citing_paper":"/paper/2606.17945"},"observation_digest":"sha256:6ef843aaf04745f59b56378b0633cf37e2a90ec9409cfbd3989854a97f5a68b1","observation_id":"80f1f7bb-2fe2-4e8d-8fd5-7c9bf9ac4b9b","resolution":{"observed_at":"2026-06-27T00:58:58.470595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T00:58:58.470595Z","title":"nature521(7553), 436–444 23 (2015)","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2606.17945","last_updated":"2026-06-24T02:25:05Z","snapshot_observed_at":"2026-08-17T21:48:59.748057Z","submitted_at":"2026-06-16T13:53:48Z","title":"Small Initialization Matters for Large Language Models","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-27T00:58:58.470595Z"},"links":{"citing_paper":"/paper/2606.17945"},"observation_digest":"sha256:191738b68938d7d1e062951f87d996f7937ea5bf38cd3c276ffad00e3c64d28d","observation_id":"b923376c-c964-4105-997a-9a58133ee98e","resolution":{"observed_at":"2026-06-27T00:58:58.470595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T00:58:58.470595Z","title":"In: Proceedings of the Thirteenth International Conference on Artificial Intelligence and Statistics, pp","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2606.17945","last_updated":"2026-06-24T02:25:05Z","snapshot_observed_at":"2026-08-17T21:48:59.748057Z","submitted_at":"2026-06-16T13:53:48Z","title":"Small Initialization Matters for Large Language Models","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-27T00:58:58.470595Z"},"links":{"citing_paper":"/paper/2606.17945"},"observation_digest":"sha256:eba1ebfdd820a1cad58603867e98ea1e1858aa14dab1db43f145f542af7a3a27","observation_id":"f0086d7f-8f5d-4988-8813-4c7fa16597c8","resolution":{"observed_at":"2026-06-27T00:58:58.470595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T00:58:58.470595Z","title":"In: Neural Networks: Tricks of the Trade, (2012)","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2606.17945","last_updated":"2026-06-24T02:25:05Z","snapshot_observed_at":"2026-08-17T21:48:59.748057Z","submitted_at":"2026-06-16T13:53:48Z","title":"Small Initialization Matters for Large Language Models","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-27T00:58:58.470595Z"},"links":{"citing_paper":"/paper/2606.17945"},"observation_digest":"sha256:4d856d17b97133169cfc25a51548957369be0f27ad3c0dfc4c433cf3b597a167","observation_id":"f2c16a72-8ab6-4086-adcc-200bcf86b256","resolution":{"observed_at":"2026-06-27T00:58:58.470595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T00:58:58.470595Z","title":"In: Proceedings of the IEEE International Conference on Computer Vision, pp","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2606.17945","last_updated":"2026-06-24T02:25:05Z","snapshot_observed_at":"2026-08-17T21:48:59.748057Z","submitted_at":"2026-06-16T13:53:48Z","title":"Small Initialization Matters for Large Language Models","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-27T00:58:58.470595Z"},"links":{"citing_paper":"/paper/2606.17945"},"observation_digest":"sha256:2fbcec7d07c20161faa309da05ecaf00ccd686355133ed92b404add309441dd1","observation_id":"74e1234f-a13a-4512-8733-cdfcf672a875","resolution":{"observed_at":"2026-06-27T00:58:58.470595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T00:58:58.470595Z","title":"Advances in Neural Information Processing Systems 31(2018)","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2606.17945","last_updated":"2026-06-24T02:25:05Z","snapshot_observed_at":"2026-08-17T21:48:59.748057Z","submitted_at":"2026-06-16T13:53:48Z","title":"Small Initialization Matters for Large Language Models","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-27T00:58:58.470595Z"},"links":{"citing_paper":"/paper/2606.17945"},"observation_digest":"sha256:41a113bd22741403acf68d41694debf16b10b2604c70148093351381e0a3f01e","observation_id":"d3df91dd-094e-42ab-9170-de0d43d747d0","resolution":{"observed_at":"2026-06-27T00:58:58.470595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T00:58:58.470595Z","title":"Advances in neural information processing systems32(2019)","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2606.17945","last_updated":"2026-06-24T02:25:05Z","snapshot_observed_at":"2026-08-17T21:48:59.748057Z","submitted_at":"2026-06-16T13:53:48Z","title":"Small Initialization Matters for Large Language Models","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-27T00:58:58.470595Z"},"links":{"citing_paper":"/paper/2606.17945"},"observation_digest":"sha256:1b8a4d31af2fb00d57ba6432111567d0bf50fe5cc8dd42436dc2f20d9065ebdf","observation_id":"8b945521-db30-4b50-8b87-7f0e5ec0b590","resolution":{"observed_at":"2026-06-27T00:58:58.470595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T00:58:58.470595Z","title":"In: Conference on Learning Theory, pp","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2606.17945","last_updated":"2026-06-24T02:25:05Z","snapshot_observed_at":"2026-08-17T21:48:59.748057Z","submitted_at":"2026-06-16T13:53:48Z","title":"Small Initialization Matters for Large Language Models","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-27T00:58:58.470595Z"},"links":{"citing_paper":"/paper/2606.17945"},"observation_digest":"sha256:f23546621ecd5c6e3d96237761054b6843ca269a47a9cec091feae6065d39496","observation_id":"f9cef1d1-227f-4291-a9de-fdf7b820dd6e","resolution":{"observed_at":"2026-06-27T00:58:58.470595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T00:58:58.470595Z","title":"Journal of Machine Learning Research22(71), 1–47 (2021)","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.17945","last_updated":"2026-06-24T02:25:05Z","snapshot_observed_at":"2026-08-17T21:48:59.748057Z","submitted_at":"2026-06-16T13:53:48Z","title":"Small Initialization Matters for Large Language Models","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-27T00:58:58.470595Z"},"links":{"citing_paper":"/paper/2606.17945"},"observation_digest":"sha256:b0d46bdb1a107539d4a8f7f3c805b552e4ffab7406bb2bb28b978c9fcfd2aed0","observation_id":"3e38fd93-f357-48ba-b0e0-e0496c6475a4","resolution":{"observed_at":"2026-06-27T00:58:58.470595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T00:58:58.470595Z","title":"In: Advances in Neural Information Processing Systems (2022)","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.17945","last_updated":"2026-06-24T02:25:05Z","snapshot_observed_at":"2026-08-17T21:48:59.748057Z","submitted_at":"2026-06-16T13:53:48Z","title":"Small Initialization Matters for Large Language Models","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-27T00:58:58.470595Z"},"links":{"citing_paper":"/paper/2606.17945"},"observation_digest":"sha256:67fa44e0441913a65da1b840e5b8da2c23f3dfb3d0149285f502ae5272303940","observation_id":"42d50931-2d2f-46c7-9d18-65a0d09a3ec3","resolution":{"observed_at":"2026-06-27T00:58:58.470595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T00:58:58.470595Z","title":"Advances in Neural Information Processing Systems37, 81157–81203 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.17945","last_updated":"2026-06-24T02:25:05Z","snapshot_observed_at":"2026-08-17T21:48:59.748057Z","submitted_at":"2026-06-16T13:53:48Z","title":"Small Initialization Matters for Large Language Models","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-27T00:58:58.470595Z"},"links":{"citing_paper":"/paper/2606.17945"},"observation_digest":"sha256:b682afccac3a5ad189188e9bb0caf70cd59e2a4c2c092076be5283faa31bbec3","observation_id":"2b431299-8a2e-4b34-9c08-dacdbf15d5ac","resolution":{"observed_at":"2026-06-27T00:58:58.470595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T00:58:58.470595Z","title":"In: The Thirty-eighth Annual Conference on Neural Information Processing Systems (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.17945","last_updated":"2026-06-24T02:25:05Z","snapshot_observed_at":"2026-08-17T21:48:59.748057Z","submitted_at":"2026-06-16T13:53:48Z","title":"Small Initialization Matters for Large Language Models","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-27T00:58:58.470595Z"},"links":{"citing_paper":"/paper/2606.17945"},"observation_digest":"sha256:27723b425b21d14242f3ece2c93d4b19f8043063e67993ea17cf15d9c3eed49d","observation_id":"e51a9052-9ea4-4819-a3a8-60b1b452146c","resolution":{"observed_at":"2026-06-27T00:58:58.470595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T00:58:58.470595Z","title":"In: International Conference on Machine Learning, pp","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.17945","last_updated":"2026-06-24T02:25:05Z","snapshot_observed_at":"2026-08-17T21:48:59.748057Z","submitted_at":"2026-06-16T13:53:48Z","title":"Small Initialization Matters for Large Language Models","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-27T00:58:58.470595Z"},"links":{"citing_paper":"/paper/2606.17945"},"observation_digest":"sha256:dd71e887b29e9a4bc39f8cc10c5836eab052560efe63c5361286c85b5186715a","observation_id":"693b356b-b9fc-48e1-ba73-85bcb07f99a3","resolution":{"observed_at":"2026-06-27T00:58:58.470595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T00:58:58.470595Z","title":"IEEE Transactions on Pattern Analysis and Machine Intelligence (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.17945","last_updated":"2026-06-24T02:25:05Z","snapshot_observed_at":"2026-08-17T21:48:59.748057Z","submitted_at":"2026-06-16T13:53:48Z","title":"Small Initialization Matters for Large Language Models","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-27T00:58:58.470595Z"},"links":{"citing_paper":"/paper/2606.17945"},"observation_digest":"sha256:3bb203ea07c9c35de5b34eb850ab7fbe17dd112f2a8cc27d15c27cf0f14a81a7","observation_id":"d2b55cdb-720f-462e-b13c-a28b2cb36517","resolution":{"observed_at":"2026-06-27T00:58:58.470595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1607.06450","last_updated":"2016-07-21T19:57:52Z","snapshot_observed_at":"2026-08-15T04:53:45.483331Z","submitted_at":"2016-07-21T19:57:52Z","title":"Layer Normalization","version":1},"cited_work":{"arxiv_id":"1607.06450","doi":"10.1007/978-3-319-32025-0","metadata_source":"pith","pith_arxiv_id":"1607.06450","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Layer Normalization","venue":"stat.ML","work_id":"20a2d720-0046-4c7c-bcd6-327ec8143f69","year":2016},"citing_paper":{"arxiv_id":"2606.17945","last_updated":"2026-06-24T02:25:05Z","snapshot_observed_at":"2026-08-17T21:48:59.748057Z","submitted_at":"2026-06-16T13:53:48Z","title":"Small Initialization Matters for Large Language Models","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-27T00:58:58.470595Z"},"links":{"cited_paper":"/paper/1607.06450","citing_paper":"/paper/2606.17945"},"observation_digest":"sha256:189c3e1289a7aa2ca1cb1436781a909971a1bb016093436ed0bc4f1308eb0032","observation_id":"fa7fa121-80b1-4d39-9b2c-6a300671e8ba","resolution":{"observed_at":"2026-07-03T20:58:58.403580Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T00:58:58.470595Z","title":"In: International Conference on Learning Representations (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.17945","last_updated":"2026-06-24T02:25:05Z","snapshot_observed_at":"2026-08-17T21:48:59.748057Z","submitted_at":"2026-06-16T13:53:48Z","title":"Small Initialization Matters for Large Language Models","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-27T00:58:58.470595Z"},"links":{"citing_paper":"/paper/2606.17945"},"observation_digest":"sha256:ac97d4ea9bbfb88aebf49dd02d5fb1a10006892ca075fd1a0aa0daa74bca75c9","observation_id":"58f978bb-a7a7-4e5e-a631-8c4c0a28dd7d","resolution":{"observed_at":"2026-06-27T00:58:58.470595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T00:58:58.470595Z","title":"Advances in Neural Information Processing Systems38, 100092–100118 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.17945","last_updated":"2026-06-24T02:25:05Z","snapshot_observed_at":"2026-08-17T21:48:59.748057Z","submitted_at":"2026-06-16T13:53:48Z","title":"Small Initialization Matters for Large Language Models","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-27T00:58:58.470595Z"},"links":{"citing_paper":"/paper/2606.17945"},"observation_digest":"sha256:3cf851b0c0032151bf1efc8964ed4222e9f282be7113c8f798001706abb7d4f4","observation_id":"160145f4-a87e-48ae-924c-2cba9b974799","resolution":{"observed_at":"2026-06-27T00:58:58.470595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.09484","last_updated":"2026-04-12T13:30:14Z","snapshot_observed_at":"2026-08-17T21:48:09.195437Z","submitted_at":"2025-04-13T08:50:24Z","title":"An overview of condensation phenomenon in deep learning","version":2},"cited_work":{"arxiv_id":"2504.09484","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.09484","snapshot_observed_at":"2026-07-03T21:38:59.529206Z","title":"An overview of condensation phenomenon in deep learning","venue":"cs.LG","work_id":"ed2da5b3-d6bd-4631-84e1-4e3ac52094f8","year":2025},"citing_paper":{"arxiv_id":"2606.17945","last_updated":"2026-06-24T02:25:05Z","snapshot_observed_at":"2026-08-17T21:48:59.748057Z","submitted_at":"2026-06-16T13:53:48Z","title":"Small Initialization Matters for Large Language Models","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-27T00:58:58.470595Z"},"links":{"cited_paper":"/paper/2504.09484","citing_paper":"/paper/2606.17945"},"observation_digest":"sha256:edda31fae44efb273be9edcb9e6d073498dccd4974c5ee94d33e182d6e40a5fe","observation_id":"030349ab-de80-43c7-a5a7-0b5ff6699ca7","resolution":{"observed_at":"2026-07-03T20:58:58.406999Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.02732","last_updated":"2025-08-05T16:43:21Z","snapshot_observed_at":"2026-08-16T12:44:12.305500Z","submitted_at":"2025-04-03T16:17:55Z","title":"Why do LLMs attend to the first token?","version":4},"cited_work":{"arxiv_id":"2504.02732","doi":"10.48550/arxiv.2504.02732","metadata_source":"arxiv_reference","pith_arxiv_id":"2504.02732","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Why do llms attend to the first token?","venue":"arXiv (Cornell University)","work_id":"298dab4e-c69c-4720-af0e-c20f50c58b39","year":2025},"citing_paper":{"arxiv_id":"2606.17945","last_updated":"2026-06-24T02:25:05Z","snapshot_observed_at":"2026-08-17T21:48:59.748057Z","submitted_at":"2026-06-16T13:53:48Z","title":"Small Initialization Matters for Large Language Models","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-27T00:58:58.470595Z"},"links":{"cited_paper":"/paper/2504.02732","citing_paper":"/paper/2606.17945"},"observation_digest":"sha256:c00245c10a0028804fd1ec5fba8d93495a6d2de6be346607fc355a527c427cc0","observation_id":"6acfd640-8041-457e-b9ed-929b1f803646","resolution":{"observed_at":"2026-07-03T20:58:58.418070Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T00:58:58.470595Z","title":"In: International Conference on Learning Representations, vol","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.17945","last_updated":"2026-06-24T02:25:05Z","snapshot_observed_at":"2026-08-17T21:48:59.748057Z","submitted_at":"2026-06-16T13:53:48Z","title":"Small Initialization Matters for Large Language Models","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-27T00:58:58.470595Z"},"links":{"citing_paper":"/paper/2606.17945"},"observation_digest":"sha256:a66a204566506bacc1a1fad4695a20b6550b169ad0587ee37e6993901088fea6","observation_id":"fed06bd5-e862-4731-8073-e293244581f6","resolution":{"observed_at":"2026-06-27T00:58:58.470595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T00:58:58.470595Z","title":"In: Proceedings of the 41st International Conference on Machine Learning (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.17945","last_updated":"2026-06-24T02:25:05Z","snapshot_observed_at":"2026-08-17T21:48:59.748057Z","submitted_at":"2026-06-16T13:53:48Z","title":"Small Initialization Matters for Large Language Models","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-27T00:58:58.470595Z"},"links":{"citing_paper":"/paper/2606.17945"},"observation_digest":"sha256:b79c3ad8647e06c7f5f8176b4ee2914fb3ece304a07b092b7a3aaf51a9a8ac90","observation_id":"cb2d0ba3-01b5-40b8-b8ad-fa51ea9978ef","resolution":{"observed_at":"2026-06-27T00:58:58.470595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.05457","last_updated":"2018-03-14T18:04:21Z","snapshot_observed_at":"2026-08-14T19:36:07.505691Z","submitted_at":"2018-03-14T18:04:21Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","version":1},"cited_work":{"arxiv_id":"1803.05457","doi":"10.1162/tacl_a_00448.https://aclanthology.org/2022.tacl-1.5","metadata_source":"pith","pith_arxiv_id":"1803.05457","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","venue":"cs.AI","work_id":"28ea1282-d657-4c61-a83c-f1249be6d6b1","year":2018},"citing_paper":{"arxiv_id":"2606.17945","last_updated":"2026-06-24T02:25:05Z","snapshot_observed_at":"2026-08-17T21:48:59.748057Z","submitted_at":"2026-06-16T13:53:48Z","title":"Small Initialization Matters for Large Language Models","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-27T00:58:58.470595Z"},"links":{"cited_paper":"/paper/1803.05457","citing_paper":"/paper/2606.17945"},"observation_digest":"sha256:f3790ac8bdaf020cb6bcf3a1c121911d34cc81eb6d912f6876ba6e95da2c86c9","observation_id":"e5cab81e-eae8-45be-87fb-80da8f7d2c7d","resolution":{"observed_at":"2026-07-03T20:58:58.418062Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T00:58:58.470595Z","title":"In: Proceedings of the 55th Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers), pp","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2606.17945","last_updated":"2026-06-24T02:25:05Z","snapshot_observed_at":"2026-08-17T21:48:59.748057Z","submitted_at":"2026-06-16T13:53:48Z","title":"Small Initialization Matters for Large Language Models","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-27T00:58:58.470595Z"},"links":{"citing_paper":"/paper/2606.17945"},"observation_digest":"sha256:6d81b6c3db893243f5ee072bb82c95820f1386b17bae9a40c53077a7563fe05b","observation_id":"ba28dc68-20a1-4826-bf5f-ba1903b72e25","resolution":{"observed_at":"2026-06-27T00:58:58.470595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T00:58:58.470595Z","title":"Proceedings of the International Conference on Learning Representations (ICLR) (2021)","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.17945","last_updated":"2026-06-24T02:25:05Z","snapshot_observed_at":"2026-08-17T21:48:59.748057Z","submitted_at":"2026-06-16T13:53:48Z","title":"Small Initialization Matters for Large Language Models","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-27T00:58:58.470595Z"},"links":{"citing_paper":"/paper/2606.17945"},"observation_digest":"sha256:9a6a096e2fcb4690ac8918a788a79aea3388d24088af087f7352a318ca8b2f08","observation_id":"96db6105-9e03-425b-8269-3d42951b2bcb","resolution":{"observed_at":"2026-06-27T00:58:58.470595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T00:58:58.470595Z","title":"Proceedings of the International Conference on Learning Representations (ICLR) (2021) 25","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.17945","last_updated":"2026-06-24T02:25:05Z","snapshot_observed_at":"2026-08-17T21:48:59.748057Z","submitted_at":"2026-06-16T13:53:48Z","title":"Small Initialization Matters for Large Language Models","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-06-27T00:58:58.470595Z"},"links":{"citing_paper":"/paper/2606.17945"},"observation_digest":"sha256:5cd0a9cd9efab4da6166cfcfa1c8fe17a77d336259e14e6a6471377094b3b719","observation_id":"86dd3483-6527-4eb9-98e7-f9930378e109","resolution":{"observed_at":"2026-06-27T00:58:58.470595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T00:58:58.470595Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2606.17945","last_updated":"2026-06-24T02:25:05Z","snapshot_observed_at":"2026-08-17T21:48:59.748057Z","submitted_at":"2026-06-16T13:53:48Z","title":"Small Initialization Matters for Large Language Models","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-06-27T00:58:58.470595Z"},"links":{"citing_paper":"/paper/2606.17945"},"observation_digest":"sha256:844a80dcb660c1dd3068b86ece08140dbacf7d650873e49ac79ef2ad8819971e","observation_id":"af9f497f-ad91-433a-9a88-a8f0801c880b","resolution":{"observed_at":"2026-06-27T00:58:58.470595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T00:58:58.470595Z","title":"In: Findings of the Association for Computational Linguistics: ACL 2023, pp","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.17945","last_updated":"2026-06-24T02:25:05Z","snapshot_observed_at":"2026-08-17T21:48:59.748057Z","submitted_at":"2026-06-16T13:53:48Z","title":"Small Initialization Matters for Large Language Models","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-06-27T00:58:58.470595Z"},"links":{"citing_paper":"/paper/2606.17945"},"observation_digest":"sha256:3c94ec6c231419cbd6104a4189942df36e1dbcfc61b00eab41b1c5ecae2ab8dd","observation_id":"63945b5d-8556-4502-8a51-daab49b3edc9","resolution":{"observed_at":"2026-06-27T00:58:58.470595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T00:58:58.470595Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2606.17945","last_updated":"2026-06-24T02:25:05Z","snapshot_observed_at":"2026-08-17T21:48:59.748057Z","submitted_at":"2026-06-16T13:53:48Z","title":"Small Initialization Matters for Large Language Models","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-06-27T00:58:58.470595Z"},"links":{"citing_paper":"/paper/2606.17945"},"observation_digest":"sha256:c3477ef0405b042df3e1769d1166fabe2ce3112e71d3bee730f68913eb880ec7","observation_id":"99cce165-235d-410c-8874-663ae58305d0","resolution":{"observed_at":"2026-06-27T00:58:58.470595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-14T02:43:01.480086Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":"2110.14168","doi":"10.1002/j.1545-","metadata_source":"pith","pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Training Verifiers to Solve Math Word Problems","venue":"cs.LG","work_id":"acab1aa8-b4d6-40e0-a3ee-25341701dca2","year":2021},"citing_paper":{"arxiv_id":"2606.17945","last_updated":"2026-06-24T02:25:05Z","snapshot_observed_at":"2026-08-17T21:48:59.748057Z","submitted_at":"2026-06-16T13:53:48Z","title":"Small Initialization Matters for Large Language Models","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-06-27T00:58:58.470595Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2606.17945"},"observation_digest":"sha256:168bac54fca5fe755fc097e1215dc092add3af3b09ba753d6c78aecaa70ffff8","observation_id":"af9651db-60d0-4c9f-a100-a2e4bf12b2c3","resolution":{"observed_at":"2026-07-03T20:58:58.396066Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2103.03874","last_updated":"2021-11-08T21:30:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-03-05T18:59:39Z","title":"Measuring Mathematical Problem Solving With the MATH Dataset","version":2},"cited_work":{"arxiv_id":"2103.03874","doi":"10.48550/arxiv.2103.03874","metadata_source":"pith","pith_arxiv_id":"2103.03874","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Measuring Mathematical Problem Solving With the MATH Dataset","venue":"cs.LG","work_id":"50652ac6-fb7c-4675-a2c2-159c241feb17","year":2021},"citing_paper":{"arxiv_id":"2606.17945","last_updated":"2026-06-24T02:25:05Z","snapshot_observed_at":"2026-08-17T21:48:59.748057Z","submitted_at":"2026-06-16T13:53:48Z","title":"Small Initialization Matters for Large Language Models","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-06-27T00:58:58.470595Z"},"links":{"cited_paper":"/paper/2103.03874","citing_paper":"/paper/2606.17945"},"observation_digest":"sha256:de330fe7c57e491f6c10901400f0e98e2ecbe52644cf6b70775f66266581e658","observation_id":"d9a01194-e940-4393-bbe2-584e05afac69","resolution":{"observed_at":"2026-07-03T20:58:58.398810Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-07-14T18:20:22.649941+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-14T18:20:22.649941+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T00:58:58.470595Z","title":"In: The Thirty-ninth Annual Conference on Neural Information Processing Systems (2026)","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.17945","last_updated":"2026-06-24T02:25:05Z","snapshot_observed_at":"2026-08-17T21:48:59.748057Z","submitted_at":"2026-06-16T13:53:48Z","title":"Small Initialization Matters for Large Language Models","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-06-27T00:58:58.470595Z"},"links":{"citing_paper":"/paper/2606.17945"},"observation_digest":"sha256:7cb18036b3f30fe1241b673bebcdc1ad12ade467663f683a7f465f9b17bbbed9","observation_id":"972c3e19-ef1f-4b0b-b1ac-8e800993b774","resolution":{"observed_at":"2026-06-27T00:58:58.470595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-08-18T18:18:37.449517Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":"2412.19437","doi":"10.1016/j.neucom.2023.127063.url:https://www.sciencedirect","metadata_source":"pith","pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"DeepSeek-V3 Technical Report","venue":"cs.CL","work_id":"57d2791d-2219-4c31-a077-afc04b12a75c","year":2024},"citing_paper":{"arxiv_id":"2606.17945","last_updated":"2026-06-24T02:25:05Z","snapshot_observed_at":"2026-08-17T21:48:59.748057Z","submitted_at":"2026-06-16T13:53:48Z","title":"Small Initialization Matters for Large Language Models","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-06-27T00:58:58.470595Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2606.17945"},"observation_digest":"sha256:b0ba61f6c0c8785585464907a767f8ce1810074371dd3cf6d2eb213410f5f9ba","observation_id":"bb632b5e-9377-4a65-859c-b47719980bfe","resolution":{"observed_at":"2026-07-03T20:58:58.403894Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1909.08053","last_updated":"2020-03-13T23:45:18Z","snapshot_observed_at":"2026-08-12T10:50:46.357243Z","submitted_at":"2019-09-17T19:42:54Z","title":"Megatron-LM: Training Multi-Billion Parameter Language Models Using Model Parallelism","version":4},"cited_work":{"arxiv_id":"1909.08053","doi":"10.48550/arxiv.1909.08053","metadata_source":"pith","pith_arxiv_id":"1909.08053","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Megatron-LM: Training Multi-Billion Parameter Language Models Using Model Parallelism","venue":"cs.CL","work_id":"c888e6d1-0b1d-43d6-9ef5-f0912a0efa1b","year":2019},"citing_paper":{"arxiv_id":"2606.17945","last_updated":"2026-06-24T02:25:05Z","snapshot_observed_at":"2026-08-17T21:48:59.748057Z","submitted_at":"2026-06-16T13:53:48Z","title":"Small Initialization Matters for Large Language Models","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-06-27T00:58:58.470595Z"},"links":{"cited_paper":"/paper/1909.08053","citing_paper":"/paper/2606.17945"},"observation_digest":"sha256:c54f2c3e95436b3756823eb8a3f68fec8d8250fc016d41cd04872fcc3548a30f","observation_id":"35c9599c-9d52-429b-916c-bc193e5c4696","resolution":{"observed_at":"2026-07-03T20:58:58.415278Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:33.392193+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:33.392193+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T00:58:58.470595Z","title":"In: Interna- tional Conference on Learning Representations (2019)","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2606.17945","last_updated":"2026-06-24T02:25:05Z","snapshot_observed_at":"2026-08-17T21:48:59.748057Z","submitted_at":"2026-06-16T13:53:48Z","title":"Small Initialization Matters for Large Language Models","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-06-27T00:58:58.470595Z"},"links":{"citing_paper":"/paper/2606.17945"},"observation_digest":"sha256:6d645ca3a6b92d571f133fac8c55866d36d7dee4fc9e30bcecccf76f86360057","observation_id":"da52a56e-760a-4695-9fbf-640c0df8d199","resolution":{"observed_at":"2026-06-27T00:58:58.470595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T00:58:58.470595Z","title":"Zenodo (2024) 26","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.17945","last_updated":"2026-06-24T02:25:05Z","snapshot_observed_at":"2026-08-17T21:48:59.748057Z","submitted_at":"2026-06-16T13:53:48Z","title":"Small Initialization Matters for Large Language Models","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-06-27T00:58:58.470595Z"},"links":{"citing_paper":"/paper/2606.17945"},"observation_digest":"sha256:0d43937b436dee6ce597b7e8b6c6107e5e79c52e1cc4cc5f1e5863c7d214a5e9","observation_id":"3f76ff38-5d29-4894-8b95-ee030ae800ef","resolution":{"observed_at":"2026-06-27T00:58:58.470595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2606.17945","last_updated":"2026-06-24T02:25:05Z","latest_version":2,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-17T21:48:59.748057Z","submitted_at":"2026-06-16T13:53:48Z","title":"Small Initialization Matters for Large Language Models"},"reference_resolution":{"displayed":44,"state_counts":{"malformed_identifier":0,"metadata_mismatch":8,"parse_uncertain":0,"unresolved":35,"verified_exact":1,"verified_fuzzy":0},"total_outbound_references":44},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 44 of 44 outbound references and 0 inbound Pith citation observations for arXiv:2606.17945."}