{"as_of":"2026-08-17T16:35:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:3b07d2a00f0a9764b5bef7ae809a8a8222b2c8ec4faca562901c794dc5efff18","coverage":[{"denominator":38,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":38,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T19:54:42.614806Z","state":"measured"},{"denominator":41,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":41,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-30T17:31:32.533941Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-06-30T17:34:57.593618Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.15025","last_updated":"2025-06-17T23:57:30Z","snapshot_observed_at":"2026-08-16T05:28:11.998541Z","submitted_at":"2025-06-17T23:57:30Z","title":"Optimal Embedding Learning Rate in LLMs: The Effect of Vocabulary Size","version":1},"cited_work":{"arxiv_id":"2506.15025","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.15025","snapshot_observed_at":"2026-06-30T17:34:57.593618Z","title":"and Liu, L","venue":null,"work_id":"0c9aed32-c6c5-4249-a693-b94ad28fb680","year":null},"citing_paper":{"arxiv_id":"2605.21486","last_updated":"2026-05-20T17:59:40Z","snapshot_observed_at":"2026-08-14T09:06:52.127366Z","submitted_at":"2026-05-20T17:59:40Z","title":"Quantifying Hyperparameter Transfer and the Importance of Embedding Layer Learning Rate","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-21T05:01:27.451161Z"},"links":{"cited_paper":"/paper/2506.15025","citing_paper":"/paper/2605.21486"},"observation_digest":"sha256:ca6295070c74cf6d4e8ff40e70ca420ea54061ef5508db0e05478d37e0f2d1b3","observation_id":"b12fee4f-c0fe-4629-9cfd-5c377a29cff1","resolution":{"observed_at":"2026-05-21T05:03:57.956920Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.15025","last_updated":"2025-06-17T23:57:30Z","snapshot_observed_at":"2026-08-16T05:28:11.998541Z","submitted_at":"2025-06-17T23:57:30Z","title":"Optimal Embedding Learning Rate in LLMs: The Effect of Vocabulary Size","version":1},"cited_work":{"arxiv_id":"2506.15025","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.15025","snapshot_observed_at":"2026-06-30T17:34:57.593618Z","title":"and Liu, L","venue":null,"work_id":"0c9aed32-c6c5-4249-a693-b94ad28fb680","year":null},"citing_paper":{"arxiv_id":"2605.22297","last_updated":"2026-05-27T10:11:58Z","snapshot_observed_at":"2026-08-16T09:55:57.215138Z","submitted_at":"2026-05-21T10:46:23Z","title":"One LR Doesn't Fit All: Heavy-Tail Guided Layerwise Learning Rates for LLMs","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-22T07:44:16.677054Z"},"links":{"cited_paper":"/paper/2506.15025","citing_paper":"/paper/2605.22297"},"observation_digest":"sha256:e9fe653601031921ce383f0ba2b2832a28555c0a07e246365ebad0431c0d696e","observation_id":"00fd0d3b-1820-4c62-ad19-72b38dc51853","resolution":{"observed_at":"2026-05-22T07:44:42.593237Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.15025","last_updated":"2025-06-17T23:57:30Z","snapshot_observed_at":"2026-08-16T05:28:11.998541Z","submitted_at":"2025-06-17T23:57:30Z","title":"Optimal Embedding Learning Rate in LLMs: The Effect of Vocabulary Size","version":1},"cited_work":{"arxiv_id":"2506.15025","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.15025","snapshot_observed_at":"2026-06-30T17:34:57.593618Z","title":"and Liu, L","venue":null,"work_id":"0c9aed32-c6c5-4249-a693-b94ad28fb680","year":null},"citing_paper":{"arxiv_id":"2605.22297","last_updated":"2026-05-27T10:11:58Z","snapshot_observed_at":"2026-08-16T09:55:57.215138Z","submitted_at":"2026-05-21T10:46:23Z","title":"One LR Doesn't Fit All: Heavy-Tail Guided Layerwise Learning Rates for LLMs","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-30T17:31:32.533941Z"},"links":{"cited_paper":"/paper/2506.15025","citing_paper":"/paper/2605.22297"},"observation_digest":"sha256:afae182926dd0a8a1e0bf8db4a377d99835d600352fdc83af4e8b999fdcdd5a6","observation_id":"bc462715-4679-4150-bef0-3cee690c782f","resolution":{"observed_at":"2026-06-30T17:34:57.595450Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.15025/citation-record","integrity":"/paper/2506.15025/integrity","json":"/paper/2506.15025/citation-record.json","paper":"/paper/2506.15025"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2407.17465","last_updated":"2025-01-10T14:22:02Z","snapshot_observed_at":"2026-08-16T22:50:49.462330Z","submitted_at":"2024-07-24T17:58:42Z","title":"u-$\\mu$P: The Unit-Scaled Maximal Update Parametrization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.17465","snapshot_observed_at":"2026-08-15T19:54:42.444889Z","title":"Prince, Bj ¨orn Deiseroth, Andres Felipe Cruz-Salinas, Carlo Luschi, Samuel Weinbach, and Douglas Orr","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.15025","last_updated":"2025-06-17T23:57:30Z","snapshot_observed_at":"2026-08-16T05:28:11.998541Z","submitted_at":"2025-06-17T23:57:30Z","title":"Optimal Embedding Learning Rate in LLMs: The Effect of Vocabulary Size","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T19:54:42.444889Z"},"links":{"cited_paper":"/paper/2407.17465","citing_paper":"/paper/2506.15025"},"observation_digest":"sha256:8084646b33c697110c3d9ad013a86770ff5cc6aecf345497308b8d32e56b1c8f","observation_id":"b3f8b846-6e14-4517-be05-f687fba975d8","resolution":{"observed_at":"2026-08-15T19:54:42.444889Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16620","last_updated":"2023-12-08T18:19:44Z","snapshot_observed_at":"2026-08-17T01:46:12.835651Z","submitted_at":"2023-09-28T17:20:50Z","title":"Depthwise Hyperparameter Transfer in Residual Networks: Dynamics and Scaling Limit","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16620","snapshot_observed_at":"2026-08-15T19:54:42.450340Z","title":"Depthwise hyperparameter transfer in residual networks: Dynamics and scaling limit, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.15025","last_updated":"2025-06-17T23:57:30Z","snapshot_observed_at":"2026-08-16T05:28:11.998541Z","submitted_at":"2025-06-17T23:57:30Z","title":"Optimal Embedding Learning Rate in LLMs: The Effect of Vocabulary Size","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-15T19:54:42.450340Z"},"links":{"cited_paper":"/paper/2309.16620","citing_paper":"/paper/2506.15025"},"observation_digest":"sha256:d1cdb3ed9f4f31b8c7ad24300d2db342701576365239842704dfc841e6244b96","observation_id":"b4fc21cb-ea38-4af4-afab-63a2f63c7b5e","resolution":{"observed_at":"2026-08-15T19:54:42.450340Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1812.07956","last_updated":"2020-01-07T16:11:56Z","snapshot_observed_at":"2026-08-14T17:41:13.899637Z","submitted_at":"2018-12-19T14:11:20Z","title":"On Lazy Training in Differentiable Programming","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.07956","snapshot_observed_at":"2026-08-15T19:54:42.454722Z","title":"On lazy training in differentiable programming, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.15025","last_updated":"2025-06-17T23:57:30Z","snapshot_observed_at":"2026-08-16T05:28:11.998541Z","submitted_at":"2025-06-17T23:57:30Z","title":"Optimal Embedding Learning Rate in LLMs: The Effect of Vocabulary Size","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-15T19:54:42.454722Z"},"links":{"cited_paper":"/paper/1812.07956","citing_paper":"/paper/2506.15025"},"observation_digest":"sha256:cd73a0f6a9b67412a809df9ef4599fdda1802826d266f057030a98647ba83707","observation_id":"4e9517dd-5fdd-4a8e-91e5-5d50efc79d17","resolution":{"observed_at":"2026-08-15T19:54:42.454722Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:54:42.459894Z","title":"Infinite- width limit of deep linear neural networks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.15025","last_updated":"2025-06-17T23:57:30Z","snapshot_observed_at":"2026-08-16T05:28:11.998541Z","submitted_at":"2025-06-17T23:57:30Z","title":"Optimal Embedding Learning Rate in LLMs: The Effect of Vocabulary Size","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-15T19:54:42.459894Z"},"links":{"citing_paper":"/paper/2506.15025"},"observation_digest":"sha256:f6da7a3877ea489cd27a713b1469c09e4353bf3f25bb3717890bc089d22f3d2a","observation_id":"2e495ec2-61aa-4a99-b5c0-c7a317109251","resolution":{"observed_at":"2026-08-15T19:54:42.459894Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:54:43.125309Z","title":"Alemi, Roman Novak, Peter J","venue":null,"work_id":"a60a6dd4-d7cd-4bb9-83e2-acbeaad5a1a8","year":null},"citing_paper":{"arxiv_id":"2506.15025","last_updated":"2025-06-17T23:57:30Z","snapshot_observed_at":"2026-08-16T05:28:11.998541Z","submitted_at":"2025-06-17T23:57:30Z","title":"Optimal Embedding Learning Rate in LLMs: The Effect of Vocabulary Size","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-15T19:54:42.464142Z"},"links":{"citing_paper":"/paper/2506.15025"},"observation_digest":"sha256:8a803a3d695085e9f4fca4b6fc36032feb4b7969ae905575f3ee99efa005981c","observation_id":"52002095-c746-4854-844c-d90658e74767","resolution":{"observed_at":"2026-08-15T19:54:43.129312Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:54:43.111418Z","title":"On the infinite-depth limit of finite-width neural networks","venue":null,"work_id":"b320c90a-964e-4a44-a688-37b3e39e6748","year":2022},"citing_paper":{"arxiv_id":"2506.15025","last_updated":"2025-06-17T23:57:30Z","snapshot_observed_at":"2026-08-16T05:28:11.998541Z","submitted_at":"2025-06-17T23:57:30Z","title":"Optimal Embedding Learning Rate in LLMs: The Effect of Vocabulary Size","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-15T19:54:42.473690Z"},"links":{"citing_paper":"/paper/2506.15025"},"observation_digest":"sha256:1654ed7f89fefe2227d4c69f5aa311a99a41a11ccdb25117fbd7ae674e650e60","observation_id":"82f197d9-4eb3-444a-83c2-647fe2f7f6c1","resolution":{"observed_at":"2026-08-15T19:54:43.115696Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:54:43.097279Z","title":"On the impact of the ac- tivation function on deep neural networks training","venue":null,"work_id":"f2e2bb8a-dcca-4433-bbb8-4e0b4b4841a3","year":2019},"citing_paper":{"arxiv_id":"2506.15025","last_updated":"2025-06-17T23:57:30Z","snapshot_observed_at":"2026-08-16T05:28:11.998541Z","submitted_at":"2025-06-17T23:57:30Z","title":"Optimal Embedding Learning Rate in LLMs: The Effect of Vocabulary Size","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-15T19:54:42.477648Z"},"links":{"citing_paper":"/paper/2506.15025"},"observation_digest":"sha256:9a8c970fdef7ed14da64f0672feaa5da5e6d2ebefc07466bc85cb66f26842305","observation_id":"87e1e4de-8cd6-4997-a736-fe3820039dec","resolution":{"observed_at":"2026-08-15T19:54:43.102018Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:54:43.082780Z","title":"Stable resnet","venue":null,"work_id":"cd1eb10c-715c-4960-bb13-7a5f98fe12be","year":2021},"citing_paper":{"arxiv_id":"2506.15025","last_updated":"2025-06-17T23:57:30Z","snapshot_observed_at":"2026-08-16T05:28:11.998541Z","submitted_at":"2025-06-17T23:57:30Z","title":"Optimal Embedding Learning Rate in LLMs: The Effect of Vocabulary Size","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T19:54:42.482191Z"},"links":{"citing_paper":"/paper/2506.15025"},"observation_digest":"sha256:bdac151c21a8ffabb8e2a05479ae8f88aaa11cc07b40c3ef44ee7c35127d4158","observation_id":"2f285087-ba6c-4b17-946f-12894b8c479c","resolution":{"observed_at":"2026-08-15T19:54:43.087750Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1502.01852","last_updated":"2015-02-06T10:44:00Z","snapshot_observed_at":"2026-08-14T23:01:07.044616Z","submitted_at":"2015-02-06T10:44:00Z","title":"Delving Deep into Rectifiers: Surpassing Human-Level Performance on ImageNet Classification","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1502.01852","snapshot_observed_at":"2026-08-15T19:54:42.485996Z","title":"Delving deep into rec- tifiers: Surpassing human-level performance on imagenet classification, 2015","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.15025","last_updated":"2025-06-17T23:57:30Z","snapshot_observed_at":"2026-08-16T05:28:11.998541Z","submitted_at":"2025-06-17T23:57:30Z","title":"Optimal Embedding Learning Rate in LLMs: The Effect of Vocabulary Size","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T19:54:42.485996Z"},"links":{"cited_paper":"/paper/1502.01852","citing_paper":"/paper/2506.15025"},"observation_digest":"sha256:7c64a1358261c57a159b920c871ebc8a5cfa51fe887c80fe3583c8f4c1c674b2","observation_id":"b5cf8226-42e4-4f65-8ba2-6adf96c288c4","resolution":{"observed_at":"2026-08-15T19:54:42.485996Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1806.07572","last_updated":"2020-02-10T08:39:09Z","snapshot_observed_at":"2026-08-14T19:01:37.246770Z","submitted_at":"2018-06-20T06:35:46Z","title":"Neural Tangent Kernel: Convergence and Generalization in Neural Networks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1806.07572","snapshot_observed_at":"2026-08-15T19:54:42.490672Z","title":"Neural tangent kernel: Conver- gence and generalization in neural networks, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.15025","last_updated":"2025-06-17T23:57:30Z","snapshot_observed_at":"2026-08-16T05:28:11.998541Z","submitted_at":"2025-06-17T23:57:30Z","title":"Optimal Embedding Learning Rate in LLMs: The Effect of Vocabulary Size","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-15T19:54:42.490672Z"},"links":{"cited_paper":"/paper/1806.07572","citing_paper":"/paper/2506.15025"},"observation_digest":"sha256:abe337356e4c895a9406db9c89571b35d3ac04d67cf9a840cd5b475b1ab6d704","observation_id":"fd4661cb-4347-492a-aca5-915c0d87ec2a","resolution":{"observed_at":"2026-08-15T19:54:42.490672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:54:43.065583Z","title":"Muon: An optimizer for hidden layers in neural networks,","venue":null,"work_id":"8b4a61e3-a2f5-4692-a5d3-b12ebc56bccc","year":null},"citing_paper":{"arxiv_id":"2506.15025","last_updated":"2025-06-17T23:57:30Z","snapshot_observed_at":"2026-08-16T05:28:11.998541Z","submitted_at":"2025-06-17T23:57:30Z","title":"Optimal Embedding Learning Rate in LLMs: The Effect of Vocabulary Size","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T19:54:42.495390Z"},"links":{"citing_paper":"/paper/2506.15025"},"observation_digest":"sha256:a98170236b414f67eea7835fabf8c7dbc181a851eba516bf9d0f1f53c2a5eb58","observation_id":"590b4620-eaa3-47ac-be14-15a5c3c5747e","resolution":{"observed_at":"2026-08-15T19:54:43.070446Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:54:42.503330Z","title":"Kingma and Jimmy Ba","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.15025","last_updated":"2025-06-17T23:57:30Z","snapshot_observed_at":"2026-08-16T05:28:11.998541Z","submitted_at":"2025-06-17T23:57:30Z","title":"Optimal Embedding Learning Rate in LLMs: The Effect of Vocabulary Size","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T19:54:42.503330Z"},"links":{"citing_paper":"/paper/2506.15025"},"observation_digest":"sha256:7a7426d5b466594a71240ee55fccd33b9ce3424f64a7881f737852665e34f601","observation_id":"0f979c3d-4478-4ecb-953e-6ca8318b1ec3","resolution":{"observed_at":"2026-08-15T19:54:42.503330Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:54:43.052387Z","title":null,"venue":null,"work_id":"3cfd8d9b-d42b-4386-8678-7207e5a9f7f1","year":null},"citing_paper":{"arxiv_id":"2506.15025","last_updated":"2025-06-17T23:57:30Z","snapshot_observed_at":"2026-08-16T05:28:11.998541Z","submitted_at":"2025-06-17T23:57:30Z","title":"Optimal Embedding Learning Rate in LLMs: The Effect of Vocabulary Size","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T19:54:42.499441Z"},"links":{"citing_paper":"/paper/2506.15025"},"observation_digest":"sha256:ca4a835b6e0798347e61ef80ae66a94f7ed8d8f5083cb0f971d1747c7afeef85","observation_id":"d8abe900-b9de-495f-bf1e-7662454d1e7f","resolution":{"observed_at":"2026-08-15T19:54:43.056873Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:54:42.516190Z","title":"The llama 3 herd of models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.15025","last_updated":"2025-06-17T23:57:30Z","snapshot_observed_at":"2026-08-16T05:28:11.998541Z","submitted_at":"2025-06-17T23:57:30Z","title":"Optimal Embedding Learning Rate in LLMs: The Effect of Vocabulary Size","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-15T19:54:42.516190Z"},"links":{"citing_paper":"/paper/2506.15025"},"observation_digest":"sha256:d73ef9826909b6f21ce78e9735b6dfcde0f320be1503deb54cef1b967f2f1e90","observation_id":"3075e622-a266-4e46-b146-b163ba8bfff7","resolution":{"observed_at":"2026-08-15T19:54:42.516190Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:54:43.023657Z","title":"Pointer sen- tinel mixture models, 2016","venue":null,"work_id":"d34c3a9c-60ff-4fc1-bbc5-cd7fc9a6510e","year":2016},"citing_paper":{"arxiv_id":"2506.15025","last_updated":"2025-06-17T23:57:30Z","snapshot_observed_at":"2026-08-16T05:28:11.998541Z","submitted_at":"2025-06-17T23:57:30Z","title":"Optimal Embedding Learning Rate in LLMs: The Effect of Vocabulary Size","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T19:54:42.521875Z"},"links":{"citing_paper":"/paper/2506.15025"},"observation_digest":"sha256:8bdc57eb3aa2343be48f180f829a997ea53e0d65848ada45b32ac5f649c43293","observation_id":"230ffc16-b8eb-421f-8d85-49e6a96e7ec7","resolution":{"observed_at":"2026-08-15T19:54:43.028154Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.05728","last_updated":"2025-02-13T23:19:42Z","snapshot_observed_at":"2026-08-16T22:23:39.037897Z","submitted_at":"2024-04-08T17:59:44Z","title":"An Empirical Study of $\\mu$P Learning Rate Transfer","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.05728","snapshot_observed_at":"2026-08-15T19:54:42.511780Z","title":"An empirical study of µp learning rate transfer, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.15025","last_updated":"2025-06-17T23:57:30Z","snapshot_observed_at":"2026-08-16T05:28:11.998541Z","submitted_at":"2025-06-17T23:57:30Z","title":"Optimal Embedding Learning Rate in LLMs: The Effect of Vocabulary Size","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T19:54:42.511780Z"},"links":{"cited_paper":"/paper/2404.05728","citing_paper":"/paper/2506.15025"},"observation_digest":"sha256:be50f0f1d5b5e3e06f6c7f30aad074d65ab0bf2933ffdf6e07c1ad52fccef56a","observation_id":"4976277b-3b6d-46c9-ada3-c88d92d87a5f","resolution":{"observed_at":"2026-08-15T19:54:42.511780Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:54:43.011231Z","title":"Poole, S","venue":null,"work_id":"ee91bd4c-2c32-4129-b129-ee6207722fb2","year":2016},"citing_paper":{"arxiv_id":"2506.15025","last_updated":"2025-06-17T23:57:30Z","snapshot_observed_at":"2026-08-16T05:28:11.998541Z","submitted_at":"2025-06-17T23:57:30Z","title":"Optimal Embedding Learning Rate in LLMs: The Effect of Vocabulary Size","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-15T19:54:42.530857Z"},"links":{"citing_paper":"/paper/2506.15025"},"observation_digest":"sha256:3d2ace480886cb8dcab021c8de05fcedf58536930b82efdba999c18d5d480528","observation_id":"a6df0e87-6b3a-459e-9930-6d91c199d3ae","resolution":{"observed_at":"2026-08-15T19:54:43.015329Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:54:42.997361Z","title":"Schoenholz, J","venue":null,"work_id":"1b602377-d04c-4460-a2b1-15479b926aad","year":2017},"citing_paper":{"arxiv_id":"2506.15025","last_updated":"2025-06-17T23:57:30Z","snapshot_observed_at":"2026-08-16T05:28:11.998541Z","submitted_at":"2025-06-17T23:57:30Z","title":"Optimal Embedding Learning Rate in LLMs: The Effect of Vocabulary Size","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T19:54:42.535008Z"},"links":{"citing_paper":"/paper/2506.15025"},"observation_digest":"sha256:d4b2e3199090a8ac6d4f6cfe3051e6593f90b2adb37fd855d9350e75a6dd746c","observation_id":"07b7ee97-7df3-4b56-9441-1ac76142e1c4","resolution":{"observed_at":"2026-08-15T19:54:43.001690Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:54:42.526095Z","title":null,"venue":null,"work_id":null,"year":1996},"citing_paper":{"arxiv_id":"2506.15025","last_updated":"2025-06-17T23:57:30Z","snapshot_observed_at":"2026-08-16T05:28:11.998541Z","submitted_at":"2025-06-17T23:57:30Z","title":"Optimal Embedding Learning Rate in LLMs: The Effect of Vocabulary Size","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T19:54:42.526095Z"},"links":{"citing_paper":"/paper/2506.15025"},"observation_digest":"sha256:9787491bf562a44d6140aeb6d512f8643b430578a7a1b23ecd1a1af354072337","observation_id":"19eda179-91e6-419b-b004-cbde3f0c47a5","resolution":{"observed_at":"2026-08-15T19:54:42.526095Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.16867","last_updated":"2023-11-29T19:45:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-28T15:12:47Z","title":"The Falcon Series of Open Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.16867","snapshot_observed_at":"2026-08-15T19:54:42.544080Z","title":"The falcon series of open language models, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.15025","last_updated":"2025-06-17T23:57:30Z","snapshot_observed_at":"2026-08-16T05:28:11.998541Z","submitted_at":"2025-06-17T23:57:30Z","title":"Optimal Embedding Learning Rate in LLMs: The Effect of Vocabulary Size","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-15T19:54:42.544080Z"},"links":{"cited_paper":"/paper/2311.16867","citing_paper":"/paper/2506.15025"},"observation_digest":"sha256:c0ada17521e8f31ca113013185641a38b0482e4d157f056317604d990716000b","observation_id":"60dcbd05-82f5-42d8-827a-7668986fbb75","resolution":{"observed_at":"2026-08-15T19:54:42.544080Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:54:42.548770Z","title":"Gemma 3 technical report, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.15025","last_updated":"2025-06-17T23:57:30Z","snapshot_observed_at":"2026-08-16T05:28:11.998541Z","submitted_at":"2025-06-17T23:57:30Z","title":"Optimal Embedding Learning Rate in LLMs: The Effect of Vocabulary Size","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-15T19:54:42.548770Z"},"links":{"citing_paper":"/paper/2506.15025"},"observation_digest":"sha256:7f1250696457c482e838bd5c10ca0fcabaa9925bcb9ead1900e36739dfb6c3c4","observation_id":"2d3fc3b8-693c-4e3e-9bc2-7b06c8d81e88","resolution":{"observed_at":"2026-08-15T19:54:42.548770Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.13623","last_updated":"2024-11-01T02:41:36Z","snapshot_observed_at":"2026-08-16T13:33:00.004600Z","submitted_at":"2024-07-18T15:58:54Z","title":"Scaling Laws with Vocabulary: Larger Models Deserve Larger Vocabularies","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.13623","snapshot_observed_at":"2026-08-15T19:54:42.539112Z","title":"Scaling laws with vocabulary: Larger models deserve larger vocabularies, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.15025","last_updated":"2025-06-17T23:57:30Z","snapshot_observed_at":"2026-08-16T05:28:11.998541Z","submitted_at":"2025-06-17T23:57:30Z","title":"Optimal Embedding Learning Rate in LLMs: The Effect of Vocabulary Size","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-15T19:54:42.539112Z"},"links":{"cited_paper":"/paper/2407.13623","citing_paper":"/paper/2506.15025"},"observation_digest":"sha256:111644c4c74b46666b63e84b08627cb7afd497bf269894af782f25343c93d52c","observation_id":"f736ab14-e453-4cf0-811d-2a28c79e8fe8","resolution":{"observed_at":"2026-08-15T19:54:42.539112Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1902.04760","last_updated":"2020-04-04T22:53:19Z","snapshot_observed_at":"2026-08-14T17:17:07.234917Z","submitted_at":"2019-02-13T06:09:18Z","title":"Scaling Limits of Wide Neural Networks with Weight Sharing: Gaussian Process Behavior, Gradient Independence, and Neural Tangent Kernel Derivation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1902.04760","snapshot_observed_at":"2026-08-15T19:54:42.557483Z","title":null,"venue":null,"work_id":null,"year":1902},"citing_paper":{"arxiv_id":"2506.15025","last_updated":"2025-06-17T23:57:30Z","snapshot_observed_at":"2026-08-16T05:28:11.998541Z","submitted_at":"2025-06-17T23:57:30Z","title":"Optimal Embedding Learning Rate in LLMs: The Effect of Vocabulary Size","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-15T19:54:42.557483Z"},"links":{"cited_paper":"/paper/1902.04760","citing_paper":"/paper/2506.15025"},"observation_digest":"sha256:9f9d536576561c3b95db5d6d4f99f56073fd081f3c57070fd844da64c3bed061","observation_id":"ea63cfd8-d429-48e1-af50-f8099316e3ec","resolution":{"observed_at":"2026-08-15T19:54:42.557483Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.03466","last_updated":"2022-03-28T08:12:14Z","snapshot_observed_at":"2026-08-16T17:16:25.053180Z","submitted_at":"2022-03-07T15:37:35Z","title":"Tensor Programs V: Tuning Large Neural Networks via Zero-Shot Hyperparameter Transfer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.03466","snapshot_observed_at":"2026-08-15T19:54:42.562346Z","title":"Tensor programs v: Tuning large neural networks via zero-shot hyperparameter transfer.arXiv preprint arXiv:2203.03466, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.15025","last_updated":"2025-06-17T23:57:30Z","snapshot_observed_at":"2026-08-16T05:28:11.998541Z","submitted_at":"2025-06-17T23:57:30Z","title":"Optimal Embedding Learning Rate in LLMs: The Effect of Vocabulary Size","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-15T19:54:42.562346Z"},"links":{"cited_paper":"/paper/2203.03466","citing_paper":"/paper/2506.15025"},"observation_digest":"sha256:28094cc91df2835ff3e40a3f400c85d9ca17b6823e30b051050225eb464fc82d","observation_id":"9469a6ce-f8dc-40e0-b5ca-7656daaba731","resolution":{"observed_at":"2026-08-15T19:54:42.562346Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14219","last_updated":"2024-08-30T21:17:17Z","snapshot_observed_at":"2026-08-17T03:25:04.404839Z","submitted_at":"2024-04-22T14:32:33Z","title":"Phi-3 Technical Report: A Highly Capable Language Model Locally on Your Phone","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14219","snapshot_observed_at":"2026-08-15T19:54:42.552969Z","title":"Phi-3 technical report: A highly capable language model locally on your phone","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.15025","last_updated":"2025-06-17T23:57:30Z","snapshot_observed_at":"2026-08-16T05:28:11.998541Z","submitted_at":"2025-06-17T23:57:30Z","title":"Optimal Embedding Learning Rate in LLMs: The Effect of Vocabulary Size","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-15T19:54:42.552969Z"},"links":{"cited_paper":"/paper/2404.14219","citing_paper":"/paper/2506.15025"},"observation_digest":"sha256:875ea4a1e9c8f3024a6d95530b4db24db69f952e7f6826c7f8683e4a550f96c5","observation_id":"ec43db71-939e-494a-b99c-f35d63d9c7a3","resolution":{"observed_at":"2026-08-15T19:54:42.552969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:54:42.977782Z","title":"How does critical batch size scale in pre-training?,","venue":null,"work_id":"b2984cfe-92ff-4c83-ac46-5cc92fcdc670","year":null},"citing_paper":{"arxiv_id":"2506.15025","last_updated":"2025-06-17T23:57:30Z","snapshot_observed_at":"2026-08-16T05:28:11.998541Z","submitted_at":"2025-06-17T23:57:30Z","title":"Optimal Embedding Learning Rate in LLMs: The Effect of Vocabulary Size","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-15T19:54:42.571451Z"},"links":{"citing_paper":"/paper/2506.15025"},"observation_digest":"sha256:59e951eecaeb804815b3e789eff2593aafbd2ffd5d70cbd69d8e9103a6bf0893","observation_id":"1d57d817-22eb-4cb8-a62c-a0f2eb0de283","resolution":{"observed_at":"2026-08-15T19:54:42.981917Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:54:42.965370Z","title":"Selected Studies of the Principle of Relative Frequency in Language","venue":null,"work_id":"0cd45cff-0f73-42f7-91f7-dd9896f69e05","year":1932},"citing_paper":{"arxiv_id":"2506.15025","last_updated":"2025-06-17T23:57:30Z","snapshot_observed_at":"2026-08-16T05:28:11.998541Z","submitted_at":"2025-06-17T23:57:30Z","title":"Optimal Embedding Learning Rate in LLMs: The Effect of Vocabulary Size","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-15T19:54:42.579612Z"},"links":{"citing_paper":"/paper/2506.15025"},"observation_digest":"sha256:ae5094daffe1f9266212e5711da2c8a846b699e9fa779f444c5337c67f179531","observation_id":"23af0345-ba61-4677-a09e-a194ec2b363b","resolution":{"observed_at":"2026-08-15T19:54:42.969342Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02244","last_updated":"2023-10-12T17:50:31Z","snapshot_observed_at":"2026-08-16T14:55:24.037926Z","submitted_at":"2023-10-03T17:50:40Z","title":"Tensor Programs VI: Feature Learning in Infinite-Depth Neural Networks","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.02244","snapshot_observed_at":"2026-08-15T19:54:42.567261Z","title":"Tensor programs vi: Fea- ture learning in infinite-depth neural networks, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.15025","last_updated":"2025-06-17T23:57:30Z","snapshot_observed_at":"2026-08-16T05:28:11.998541Z","submitted_at":"2025-06-17T23:57:30Z","title":"Optimal Embedding Learning Rate in LLMs: The Effect of Vocabulary Size","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-15T19:54:42.567261Z"},"links":{"cited_paper":"/paper/2310.02244","citing_paper":"/paper/2506.15025"},"observation_digest":"sha256:4b5cf5ff548cd906db7755f9bdb29dea3ad1658a75459dec4ef0849c9c699fdf","observation_id":"301056cd-5a09-4409-b131-1c21484cc905","resolution":{"observed_at":"2026-08-15T19:54:42.567261Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:54:42.952467Z","title":"Because Wj∼N (0,Im) and Mj =⟨v,Wj⟩, for anyi∈ [m] the pair (Mj,Wji) is jointly Gaussian with correlationρ := vi ∥v∥","venue":null,"work_id":"7218c2bc-7a4d-472e-962c-9c3bae3d4b88","year":null},"citing_paper":{"arxiv_id":"2506.15025","last_updated":"2025-06-17T23:57:30Z","snapshot_observed_at":"2026-08-16T05:28:11.998541Z","submitted_at":"2025-06-17T23:57:30Z","title":"Optimal Embedding Learning Rate in LLMs: The Effect of Vocabulary Size","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-15T19:54:42.585134Z"},"links":{"citing_paper":"/paper/2506.15025"},"observation_digest":"sha256:87d14c79cf3e2a94e6651efd775a073c262d0494639f69691a667179a1326c66","observation_id":"69665084-8ddd-457a-aa2c-ee73b03ebf63","resolution":{"observed_at":"2026-08-15T19:54:42.956995Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:54:42.938881Z","title":"Still conditional on v, sign(Mj) is±1 with equal probability, independent of the magnitude of Wj","venue":null,"work_id":"262c8112-849a-46ab-adb1-420b3acfaba9","year":null},"citing_paper":{"arxiv_id":"2506.15025","last_updated":"2025-06-17T23:57:30Z","snapshot_observed_at":"2026-08-16T05:28:11.998541Z","submitted_at":"2025-06-17T23:57:30Z","title":"Optimal Embedding Learning Rate in LLMs: The Effect of Vocabulary Size","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-15T19:54:42.590226Z"},"links":{"citing_paper":"/paper/2506.15025"},"observation_digest":"sha256:65ac113d4041d7c60f01e1f5ad836c2adff2628117ad7b83c24932ae0e868565","observation_id":"f171a23a-e471-4f34-8e9d-ba48be49c6c9","resolution":{"observed_at":"2026-08-15T19:54:42.943251Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:54:42.926245Z","title":"Because the Yj’s are conditionally independent, Ev Cov(X|v) = Ev h dX j=1 Cov(Yj|v) i =d Im− Ev µ(v)µ(v)⊤ | {z } = 2 πmIm = d− 2d πm Im","venue":null,"work_id":"c5c00804-939f-449a-bf5d-18bbbfa91790","year":null},"citing_paper":{"arxiv_id":"2506.15025","last_updated":"2025-06-17T23:57:30Z","snapshot_observed_at":"2026-08-16T05:28:11.998541Z","submitted_at":"2025-06-17T23:57:30Z","title":"Optimal Embedding Learning Rate in LLMs: The Effect of Vocabulary Size","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-15T19:54:42.597097Z"},"links":{"citing_paper":"/paper/2506.15025"},"observation_digest":"sha256:bef1da06e4b3aed99ec38c778932af22945d7ecf4ffd117898629133424bc3db","observation_id":"a4358c98-7dd9-49d2-b588-4b01e82d6cf0","resolution":{"observed_at":"2026-08-15T19:54:42.930270Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:54:42.913532Z","title":"From Step1, E[X|v] =dµ (v), so Covv E[X|v] =d2 Covv µ(v) =d2 2 π Covv v ∥v∥ = 2d2 πmIm","venue":null,"work_id":"41a4b011-67d8-4c84-9828-d429de44d968","year":null},"citing_paper":{"arxiv_id":"2506.15025","last_updated":"2025-06-17T23:57:30Z","snapshot_observed_at":"2026-08-16T05:28:11.998541Z","submitted_at":"2025-06-17T23:57:30Z","title":"Optimal Embedding Learning Rate in LLMs: The Effect of Vocabulary Size","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-15T19:54:42.601434Z"},"links":{"citing_paper":"/paper/2506.15025"},"observation_digest":"sha256:211f673e0149c4b8dbbe8117a3e4762b87ea9c3da28b52a27e1fa280a84a4755","observation_id":"31f911b0-7376-4e10-a45a-49d7fdd94672","resolution":{"observed_at":"2026-08-15T19:54:42.917670Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:54:42.899105Z","title":"Conditioning on E, each entry of E⊤M a centered Gaussian variable, hence E[S(E⊤M)|E] = 0","venue":null,"work_id":"bd960df6-193c-4a56-a72a-3aaa845bd0aa","year":null},"citing_paper":{"arxiv_id":"2506.15025","last_updated":"2025-06-17T23:57:30Z","snapshot_observed_at":"2026-08-16T05:28:11.998541Z","submitted_at":"2025-06-17T23:57:30Z","title":"Optimal Embedding Learning Rate in LLMs: The Effect of Vocabulary Size","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-15T19:54:42.606351Z"},"links":{"citing_paper":"/paper/2506.15025"},"observation_digest":"sha256:86aba21143bb86743b6b701baf5db73af512818cc24d4a7a56128ca8f8e89c7b","observation_id":"99f7d6eb-a9a8-4b1c-8f78-015dd947a521","resolution":{"observed_at":"2026-08-15T19:54:42.903671Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:54:42.881893Z","title":"Fix a column index k","venue":null,"work_id":"f1a03e30-28e2-4be1-aac3-ab0a73d8aa63","year":null},"citing_paper":{"arxiv_id":"2506.15025","last_updated":"2025-06-17T23:57:30Z","snapshot_observed_at":"2026-08-16T05:28:11.998541Z","submitted_at":"2025-06-17T23:57:30Z","title":"Optimal Embedding Learning Rate in LLMs: The Effect of Vocabulary Size","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-15T19:54:42.610552Z"},"links":{"citing_paper":"/paper/2506.15025"},"observation_digest":"sha256:a3bc71316d2dfe81331433e4a9592e512c5ef13fff05e689403eb364b0c151f6","observation_id":"e1760d3f-2b56-4eaa-be4c-e3aca666982c","resolution":{"observed_at":"2026-08-15T19:54:42.888341Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:54:42.864908Z","title":"Different columns ofM (differentk) are independent, so Cov(X) is diagonal and each coordinate variance is the same as above","venue":null,"work_id":"bf1d1278-4ce4-4f9a-b9ba-99f97d0f2100","year":null},"citing_paper":{"arxiv_id":"2506.15025","last_updated":"2025-06-17T23:57:30Z","snapshot_observed_at":"2026-08-16T05:28:11.998541Z","submitted_at":"2025-06-17T23:57:30Z","title":"Optimal Embedding Learning Rate in LLMs: The Effect of Vocabulary Size","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-15T19:54:42.614806Z"},"links":{"citing_paper":"/paper/2506.15025"},"observation_digest":"sha256:46d435649369d25cf8bcfbdd0c9c48d2e16c842dd897cfbb2f010a924f976648","observation_id":"ef577664-d8da-4277-9f3e-194bb3efff91","resolution":{"observed_at":"2026-08-15T19:54:42.871604Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-08-14T18:51:16.666127Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-15T19:54:42.507645Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.15025","last_updated":"2025-06-17T23:57:30Z","snapshot_observed_at":"2026-08-16T05:28:11.998541Z","submitted_at":"2025-06-17T23:57:30Z","title":"Optimal Embedding Learning Rate in LLMs: The Effect of Vocabulary Size","version":1},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-15T19:54:42.507645Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/2506.15025"},"observation_digest":"sha256:65cb2cd9e558eec1f1626d9f6acf8ce7a29052649072bf9ffad96a184207b13e","observation_id":"52994ea5-ed58-4778-9f43-0c7fd4e17cd0","resolution":{"observed_at":"2026-08-15T19:54:42.507645Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05872","last_updated":"2024-07-16T17:40:09Z","snapshot_observed_at":"2026-08-16T13:36:11.410804Z","submitted_at":"2024-07-08T12:32:51Z","title":"Scaling Exponents Across Parameterizations and Optimizers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.05872","snapshot_observed_at":"2026-08-15T19:54:42.469149Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.15025","last_updated":"2025-06-17T23:57:30Z","snapshot_observed_at":"2026-08-16T05:28:11.998541Z","submitted_at":"2025-06-17T23:57:30Z","title":"Optimal Embedding Learning Rate in LLMs: The Effect of Vocabulary Size","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-15T19:54:42.469149Z"},"links":{"cited_paper":"/paper/2407.05872","citing_paper":"/paper/2506.15025"},"observation_digest":"sha256:51dd35860063efb1b7108c16f282b83733d809ddbe75e194c819370b1ff75ae5","observation_id":"3c8dd48f-a720-4c59-839c-43c18097175c","resolution":{"observed_at":"2026-08-15T19:54:42.469149Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21676","last_updated":"2025-04-21T04:19:56Z","snapshot_observed_at":"2026-08-16T13:05:08.265484Z","submitted_at":"2024-10-29T02:54:06Z","title":"How Does Critical Batch Size Scale in Pre-training?","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21676","snapshot_observed_at":"2026-08-15T19:54:42.575268Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.15025","last_updated":"2025-06-17T23:57:30Z","snapshot_observed_at":"2026-08-16T05:28:11.998541Z","submitted_at":"2025-06-17T23:57:30Z","title":"Optimal Embedding Learning Rate in LLMs: The Effect of Vocabulary Size","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-15T19:54:42.575268Z"},"links":{"cited_paper":"/paper/2410.21676","citing_paper":"/paper/2506.15025"},"observation_digest":"sha256:f2146e96973c347ea77a0be1f217102bd79c0ea9666782895be7577ef48a3027","observation_id":"08d43654-9d72-4310-8e60-28d09a1f0868","resolution":{"observed_at":"2026-08-15T19:54:42.575268Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.15025","last_updated":"2025-06-17T23:57:30Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-16T05:28:11.998541Z","submitted_at":"2025-06-17T23:57:30Z","title":"Optimal Embedding Learning Rate in LLMs: The Effect of Vocabulary Size"},"reference_resolution":{"displayed":38,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":21,"verified_exact":0,"verified_fuzzy":17},"total_outbound_references":38},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 38 of 38 outbound references and 3 inbound Pith citation observations for arXiv:2506.15025."}