{"as_of":"2026-08-09T16:55:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d8587934e238a245c73a5bdc2ec9f4ab3815f162005a81e2d38431278e9297a8","coverage":[{"denominator":28,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":28,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T18:04:09.494559Z","state":"measured"},{"denominator":28,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":28,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.03494/citation-record","integrity":"/paper/2608.03494/integrity","json":"/paper/2608.03494/citation-record.json","paper":"/paper/2608.03494"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"1508.07909","last_updated":"2016-06-10T14:45:08Z","snapshot_observed_at":"2026-07-06T04:28:16.222296Z","submitted_at":"2015-08-31T16:37:31Z","title":"Neural Machine Translation of Rare Words with Subword Units","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1508.07909","snapshot_observed_at":"2026-08-05T18:04:06.609564Z","title":"arXiv preprint arXiv:1508.07909 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03494","last_updated":"2026-08-04T11:32:10Z","snapshot_observed_at":"2026-08-08T14:58:35.522056Z","submitted_at":"2026-08-04T11:32:10Z","title":"Beyond Initialization Loss: A Systematic Study of Token Embedding Initialization Strategies for LLM Vocabulary Extension","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-05T18:04:06.609564Z"},"links":{"cited_paper":"/paper/1508.07909","citing_paper":"/paper/2608.03494"},"observation_digest":"sha256:9e496199e936c8b4f94b5645c4d861585a775e2d7176c5b1287dabbbe97ef57a","observation_id":"74ac2c2a-6cab-4dc2-91a2-ad19ac0cac95","resolution":{"observed_at":"2026-08-05T18:04:06.609564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T18:04:13.377222Z","title":"Proceedings of the 2018 conference on empirical methods in natural language processing: System demonstrations , pages=","venue":null,"work_id":"7d1e7aea-d7ef-446e-8bd2-6fbad5a69f90","year":2018},"citing_paper":{"arxiv_id":"2608.03494","last_updated":"2026-08-04T11:32:10Z","snapshot_observed_at":"2026-08-08T14:58:35.522056Z","submitted_at":"2026-08-04T11:32:10Z","title":"Beyond Initialization Loss: A Systematic Study of Token Embedding Initialization Strategies for LLM Vocabulary Extension","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-05T18:04:06.776543Z"},"links":{"citing_paper":"/paper/2608.03494"},"observation_digest":"sha256:29a95f117366207f5146d1ac9c5527a45b74b6be05cdad5f505aec1d9164294d","observation_id":"c5ad35bb-6c7b-4f96-92de-37333e19032e","resolution":{"observed_at":"2026-08-05T18:04:13.491540Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T18:04:13.103059Z","title":"Proceedings of the 2023 Conference on Empirical Methods in Natural Language Processing , pages=","venue":null,"work_id":"45d6946d-3614-4899-bf27-2e0e316b6a30","year":2023},"citing_paper":{"arxiv_id":"2608.03494","last_updated":"2026-08-04T11:32:10Z","snapshot_observed_at":"2026-08-08T14:58:35.522056Z","submitted_at":"2026-08-04T11:32:10Z","title":"Beyond Initialization Loss: A Systematic Study of Token Embedding Initialization Strategies for LLM Vocabulary Extension","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-05T18:04:06.884526Z"},"links":{"citing_paper":"/paper/2608.03494"},"observation_digest":"sha256:19305247308f0671cdfb5a09a14e5be7ff513a92a42d21222ab189c7f0b28069","observation_id":"00a532c5-e026-49df-8f9b-5c1419a9119d","resolution":{"observed_at":"2026-08-05T18:04:13.245592Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T18:04:07.007445Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03494","last_updated":"2026-08-04T11:32:10Z","snapshot_observed_at":"2026-08-08T14:58:35.522056Z","submitted_at":"2026-08-04T11:32:10Z","title":"Beyond Initialization Loss: A Systematic Study of Token Embedding Initialization Strategies for LLM Vocabulary Extension","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-05T18:04:07.007445Z"},"links":{"citing_paper":"/paper/2608.03494"},"observation_digest":"sha256:028b9631eae1ebf4854ff0215263c8efcca6fde48f1b5beec36c6e723c5f1a83","observation_id":"4f2735ac-1373-446b-9e5b-843271396847","resolution":{"observed_at":"2026-08-05T18:04:07.007445Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T18:04:12.834306Z","title":"URL: https:/nlp","venue":null,"work_id":"118a2776-675b-477e-af54-974cf1edffb0","year":null},"citing_paper":{"arxiv_id":"2608.03494","last_updated":"2026-08-04T11:32:10Z","snapshot_observed_at":"2026-08-08T14:58:35.522056Z","submitted_at":"2026-08-04T11:32:10Z","title":"Beyond Initialization Loss: A Systematic Study of Token Embedding Initialization Strategies for LLM Vocabulary Extension","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-05T18:04:07.186953Z"},"links":{"citing_paper":"/paper/2608.03494"},"observation_digest":"sha256:ab6e12e92a2141d6afa0da6aa98ee4468de379b109293d369bd626744850cff8","observation_id":"f7f6358d-245e-43ea-af95-927d195914e5","resolution":{"observed_at":"2026-08-05T18:04:12.939084Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T18:04:12.581961Z","title":"Proceedings of the 2022 Conference of the North American Chapter of the Association for Computational Linguistics: Human Language Technologies , pages=","venue":null,"work_id":"9329af7d-cb16-4220-8eb2-4b726017d44e","year":2022},"citing_paper":{"arxiv_id":"2608.03494","last_updated":"2026-08-04T11:32:10Z","snapshot_observed_at":"2026-08-08T14:58:35.522056Z","submitted_at":"2026-08-04T11:32:10Z","title":"Beyond Initialization Loss: A Systematic Study of Token Embedding Initialization Strategies for LLM Vocabulary Extension","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-05T18:04:07.347596Z"},"links":{"citing_paper":"/paper/2608.03494"},"observation_digest":"sha256:7c03f49e0038518f5c444f4ed42e75d3067668588828ad9def7c5254a7cd8044","observation_id":"140203a3-0c55-4cd3-8292-50cc87f60bb9","resolution":{"observed_at":"2026-08-05T18:04:12.697513Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T18:04:12.298792Z","title":"Proceedings of the 2023 Conference on Empirical Methods in Natural Language Processing , pages=","venue":null,"work_id":"7cf4c79e-4ce1-498b-bf16-c8e938470bb5","year":2023},"citing_paper":{"arxiv_id":"2608.03494","last_updated":"2026-08-04T11:32:10Z","snapshot_observed_at":"2026-08-08T14:58:35.522056Z","submitted_at":"2026-08-04T11:32:10Z","title":"Beyond Initialization Loss: A Systematic Study of Token Embedding Initialization Strategies for LLM Vocabulary Extension","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-05T18:04:07.492893Z"},"links":{"citing_paper":"/paper/2608.03494"},"observation_digest":"sha256:336b7607a77cca4337a82685df0469df0acbbd157591d37f5616352635a5f99b","observation_id":"eafb42a1-35da-46e4-9c2c-8931218ec1f5","resolution":{"observed_at":"2026-08-05T18:04:12.410049Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T18:04:07.623845Z","title":"International conference on machine learning , pages=","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2608.03494","last_updated":"2026-08-04T11:32:10Z","snapshot_observed_at":"2026-08-08T14:58:35.522056Z","submitted_at":"2026-08-04T11:32:10Z","title":"Beyond Initialization Loss: A Systematic Study of Token Embedding Initialization Strategies for LLM Vocabulary Extension","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-05T18:04:07.623845Z"},"links":{"citing_paper":"/paper/2608.03494"},"observation_digest":"sha256:e721aeca88542c4f4017df0f1f859f90bd09dadf645b7ed32cca689866a824c5","observation_id":"b53b773c-0137-42fb-a546-ad661c6e7beb","resolution":{"observed_at":"2026-08-05T18:04:07.623845Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.10730","last_updated":"2021-04-02T13:23:48Z","snapshot_observed_at":"2026-07-06T10:51:26.061443Z","submitted_at":"2021-03-19T11:06:37Z","title":"MuRIL: Multilingual Representations for Indian Languages","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.10730","snapshot_observed_at":"2026-08-05T18:04:07.734213Z","title":"arXiv preprint arXiv:2103.10730 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03494","last_updated":"2026-08-04T11:32:10Z","snapshot_observed_at":"2026-08-08T14:58:35.522056Z","submitted_at":"2026-08-04T11:32:10Z","title":"Beyond Initialization Loss: A Systematic Study of Token Embedding Initialization Strategies for LLM Vocabulary Extension","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-05T18:04:07.734213Z"},"links":{"cited_paper":"/paper/2103.10730","citing_paper":"/paper/2608.03494"},"observation_digest":"sha256:336f92d028ffcabb8172cedb6c8543ddc6f6842d433286a0d6030ea17dfb2079","observation_id":"a0cfbf40-d59c-4354-88d9-45e5fb208895","resolution":{"observed_at":"2026-08-05T18:04:07.734213Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T18:04:12.028021Z","title":"Proceedings of the 2022 Conference on Empirical Methods in Natural Language Processing: Industry Track , pages=","venue":null,"work_id":"fc52d538-ce1f-4c0a-83fb-b08937c294e3","year":2022},"citing_paper":{"arxiv_id":"2608.03494","last_updated":"2026-08-04T11:32:10Z","snapshot_observed_at":"2026-08-08T14:58:35.522056Z","submitted_at":"2026-08-04T11:32:10Z","title":"Beyond Initialization Loss: A Systematic Study of Token Embedding Initialization Strategies for LLM Vocabulary Extension","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-05T18:04:07.817713Z"},"links":{"citing_paper":"/paper/2608.03494"},"observation_digest":"sha256:46f3626a43bb85aa4092b7bd52d3fb8fdbd03cf33ec0469e9a2b40acf2708485","observation_id":"6c937ecd-10e0-4e7f-b763-ee88ff987d13","resolution":{"observed_at":"2026-08-05T18:04:12.112536Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.08177","last_updated":"2024-02-23T02:22:36Z","snapshot_observed_at":"2026-08-08T11:18:15.476977Z","submitted_at":"2023-04-17T11:39:53Z","title":"Efficient and Effective Text Encoding for Chinese LLaMA and Alpaca","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.08177","snapshot_observed_at":"2026-08-05T18:04:07.880367Z","title":"arXiv preprint arXiv:2304.08177 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03494","last_updated":"2026-08-04T11:32:10Z","snapshot_observed_at":"2026-08-08T14:58:35.522056Z","submitted_at":"2026-08-04T11:32:10Z","title":"Beyond Initialization Loss: A Systematic Study of Token Embedding Initialization Strategies for LLM Vocabulary Extension","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-05T18:04:07.880367Z"},"links":{"cited_paper":"/paper/2304.08177","citing_paper":"/paper/2608.03494"},"observation_digest":"sha256:67cc3b62ecf0257245cc589a1c9034bab707a6d5bc990e4c4a9db243c36667c2","observation_id":"9f4df639-bacd-4aa8-afa7-49500daaaaec","resolution":{"observed_at":"2026-08-05T18:04:07.880367Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.14815","last_updated":"2025-04-21T05:29:01Z","snapshot_observed_at":"2026-08-08T14:58:04.830848Z","submitted_at":"2024-10-18T18:35:19Z","title":"Adapting Multilingual LLMs to Low-Resource Languages using Continued Pre-training and Synthetic Corpus","version":2},"cited_work":{"arxiv_id":"2410.14815","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.14815","snapshot_observed_at":"2026-08-05T18:04:09.703530Z","title":"Adapting Multilingual LLMs to Low-Resource Languages using Continued Pre-training and Synthetic Corpus","venue":"cs.CL","work_id":"04a7ee81-40d8-4b5b-a3a4-bdfc25017069","year":2024},"citing_paper":{"arxiv_id":"2608.03494","last_updated":"2026-08-04T11:32:10Z","snapshot_observed_at":"2026-08-08T14:58:35.522056Z","submitted_at":"2026-08-04T11:32:10Z","title":"Beyond Initialization Loss: A Systematic Study of Token Embedding Initialization Strategies for LLM Vocabulary Extension","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-05T18:04:07.964375Z"},"links":{"cited_paper":"/paper/2410.14815","citing_paper":"/paper/2608.03494"},"observation_digest":"sha256:7c790b63c76f1f48f3c2963fefc385b871e8157e8f56a0f4cc83056c8d751495","observation_id":"ef2cb03c-07e0-4b09-a6ca-f8fe6c7ad425","resolution":{"observed_at":"2026-08-05T18:04:09.748618Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T18:04:11.748239Z","title":"Proceedings of the 62nd Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers) , pages=","venue":null,"work_id":"17cba9b7-a878-4d25-b8bd-7df8b5f31e88","year":null},"citing_paper":{"arxiv_id":"2608.03494","last_updated":"2026-08-04T11:32:10Z","snapshot_observed_at":"2026-08-08T14:58:35.522056Z","submitted_at":"2026-08-04T11:32:10Z","title":"Beyond Initialization Loss: A Systematic Study of Token Embedding Initialization Strategies for LLM Vocabulary Extension","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-05T18:04:08.107025Z"},"links":{"citing_paper":"/paper/2608.03494"},"observation_digest":"sha256:03737296b8fc3793b2ef48137b1958674e4efc9c34ba4190e2a484c68305c29b","observation_id":"520e40d5-8301-4d9f-b706-480d6a5a5615","resolution":{"observed_at":"2026-08-05T18:04:11.907107Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T18:04:11.526322Z","title":"Findings of the Association for Computational Linguistics: EMNLP 2024 , pages=","venue":null,"work_id":"cec85d80-b39b-4fc9-91c7-7cc84f4f83d8","year":2024},"citing_paper":{"arxiv_id":"2608.03494","last_updated":"2026-08-04T11:32:10Z","snapshot_observed_at":"2026-08-08T14:58:35.522056Z","submitted_at":"2026-08-04T11:32:10Z","title":"Beyond Initialization Loss: A Systematic Study of Token Embedding Initialization Strategies for LLM Vocabulary Extension","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-05T18:04:08.174380Z"},"links":{"citing_paper":"/paper/2608.03494"},"observation_digest":"sha256:3e0a5df912d31b73ef325110221b6f499516992ed60a20f6c952e5120ca3efb4","observation_id":"a0f2891b-e9be-4dca-b54c-51b749e8f389","resolution":{"observed_at":"2026-08-05T18:04:11.629348Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T18:04:08.262578Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03494","last_updated":"2026-08-04T11:32:10Z","snapshot_observed_at":"2026-08-08T14:58:35.522056Z","submitted_at":"2026-08-04T11:32:10Z","title":"Beyond Initialization Loss: A Systematic Study of Token Embedding Initialization Strategies for LLM Vocabulary Extension","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-05T18:04:08.262578Z"},"links":{"citing_paper":"/paper/2608.03494"},"observation_digest":"sha256:3a820e3d99dff8fd7a1c410a4bbc3c6d3d01e757e783df3a9484b8a8a1f2a3fd","observation_id":"361a5373-cdf1-411f-8fb7-7365fb25847d","resolution":{"observed_at":"2026-08-05T18:04:08.262578Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T18:04:11.196283Z","title":"Findings of the Association for Computational Linguistics: NAACL 2024 , pages=","venue":null,"work_id":"117c165a-dbc4-4d87-bb60-1349431caaef","year":2024},"citing_paper":{"arxiv_id":"2608.03494","last_updated":"2026-08-04T11:32:10Z","snapshot_observed_at":"2026-08-08T14:58:35.522056Z","submitted_at":"2026-08-04T11:32:10Z","title":"Beyond Initialization Loss: A Systematic Study of Token Embedding Initialization Strategies for LLM Vocabulary Extension","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-05T18:04:08.372065Z"},"links":{"citing_paper":"/paper/2608.03494"},"observation_digest":"sha256:23eb2adc9bf3dd178b644eb844925768b906dedbe0d98f00f3ea0e28b0f37631","observation_id":"64d1270a-9562-4f6e-a326-a0eb946718eb","resolution":{"observed_at":"2026-08-05T18:04:11.359385Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19693","last_updated":"2025-08-01T10:53:31Z","snapshot_observed_at":"2026-08-07T16:38:15.895611Z","submitted_at":"2025-03-25T14:18:21Z","title":"AdaptiVocab: Enhancing LLM Efficiency in Focused Domains through Lightweight Vocabulary Adaptation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.19693","snapshot_observed_at":"2026-08-05T18:04:08.446006Z","title":"arXiv preprint arXiv:2503.19693 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03494","last_updated":"2026-08-04T11:32:10Z","snapshot_observed_at":"2026-08-08T14:58:35.522056Z","submitted_at":"2026-08-04T11:32:10Z","title":"Beyond Initialization Loss: A Systematic Study of Token Embedding Initialization Strategies for LLM Vocabulary Extension","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-05T18:04:08.446006Z"},"links":{"cited_paper":"/paper/2503.19693","citing_paper":"/paper/2608.03494"},"observation_digest":"sha256:0e372382a8cb68bd0c3061f613f5d3ec700972cb0fe750966b5b326f0e67c28b","observation_id":"9def8cf2-ff97-4c0b-bb8b-a049ec39b31a","resolution":{"observed_at":"2026-08-05T18:04:08.446006Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T18:04:10.956110Z","title":"Proceedings of the Fourth Workshop on Multilingual Representation Learning (MRL 2024) , pages=","venue":null,"work_id":"7697c300-3e9c-48ab-9a68-2701d817cbe2","year":2024},"citing_paper":{"arxiv_id":"2608.03494","last_updated":"2026-08-04T11:32:10Z","snapshot_observed_at":"2026-08-08T14:58:35.522056Z","submitted_at":"2026-08-04T11:32:10Z","title":"Beyond Initialization Loss: A Systematic Study of Token Embedding Initialization Strategies for LLM Vocabulary Extension","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-05T18:04:08.543667Z"},"links":{"citing_paper":"/paper/2608.03494"},"observation_digest":"sha256:b63e4d94a7503a5f11d051d9ef4b14e05a7736fe0fa753b25bf1d22d3cd62419","observation_id":"d274d7bf-7241-40cf-928b-87de2615cee8","resolution":{"observed_at":"2026-08-05T18:04:11.026131Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T18:04:10.636186Z","title":"Proceedings of the 2023 conference on empirical methods in natural language processing , pages=","venue":null,"work_id":"211df23e-3483-423c-9152-224681f33640","year":2023},"citing_paper":{"arxiv_id":"2608.03494","last_updated":"2026-08-04T11:32:10Z","snapshot_observed_at":"2026-08-08T14:58:35.522056Z","submitted_at":"2026-08-04T11:32:10Z","title":"Beyond Initialization Loss: A Systematic Study of Token Embedding Initialization Strategies for LLM Vocabulary Extension","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-05T18:04:08.641709Z"},"links":{"citing_paper":"/paper/2608.03494"},"observation_digest":"sha256:5f64705351ed27fde0de5e4dd27aec9c32ef2a6da59bf99fdbc0480f92b10cfa","observation_id":"5fbf3770-9236-4db0-b4c7-eee90f0ac706","resolution":{"observed_at":"2026-08-05T18:04:10.763481Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.11294","last_updated":"2024-08-21T02:49:41Z","snapshot_observed_at":"2026-08-05T14:12:18.647534Z","submitted_at":"2024-08-21T02:49:41Z","title":"RedWhale: An Adapted Korean LLM Through Efficient Continual Pretraining","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.11294","snapshot_observed_at":"2026-08-05T18:04:08.718342Z","title":"arXiv preprint arXiv:2408.11294 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03494","last_updated":"2026-08-04T11:32:10Z","snapshot_observed_at":"2026-08-08T14:58:35.522056Z","submitted_at":"2026-08-04T11:32:10Z","title":"Beyond Initialization Loss: A Systematic Study of Token Embedding Initialization Strategies for LLM Vocabulary Extension","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-05T18:04:08.718342Z"},"links":{"cited_paper":"/paper/2408.11294","citing_paper":"/paper/2608.03494"},"observation_digest":"sha256:6cbc45de5e92e04119f3054dbbb62172969b332dc2f9bb35cef3e545c51fae82","observation_id":"e16d83c3-8f87-4b95-a631-bb9bff1f1afb","resolution":{"observed_at":"2026-08-05T18:04:08.718342Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.17790","last_updated":"2024-04-27T06:07:55Z","snapshot_observed_at":"2026-08-08T18:13:53.924315Z","submitted_at":"2024-04-27T06:07:55Z","title":"Continual Pre-Training for Cross-Lingual LLM Adaptation: Enhancing Japanese Language Capabilities","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.17790","snapshot_observed_at":"2026-08-05T18:04:08.811711Z","title":"arXiv preprint arXiv:2404.17790 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03494","last_updated":"2026-08-04T11:32:10Z","snapshot_observed_at":"2026-08-08T14:58:35.522056Z","submitted_at":"2026-08-04T11:32:10Z","title":"Beyond Initialization Loss: A Systematic Study of Token Embedding Initialization Strategies for LLM Vocabulary Extension","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-05T18:04:08.811711Z"},"links":{"cited_paper":"/paper/2404.17790","citing_paper":"/paper/2608.03494"},"observation_digest":"sha256:b9deac1f98475e06ee646e80c8855f20ab7624c0de81f93eb03845cd6f4b8d80","observation_id":"0c95670c-c80e-4f8f-a4d8-e53dd1156534","resolution":{"observed_at":"2026-08-05T18:04:08.811711Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T18:04:08.887390Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03494","last_updated":"2026-08-04T11:32:10Z","snapshot_observed_at":"2026-08-08T14:58:35.522056Z","submitted_at":"2026-08-04T11:32:10Z","title":"Beyond Initialization Loss: A Systematic Study of Token Embedding Initialization Strategies for LLM Vocabulary Extension","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-05T18:04:08.887390Z"},"links":{"citing_paper":"/paper/2608.03494"},"observation_digest":"sha256:9c2b4bd48276ea8a38f80bbd440c91254fb4a6b16f280dc841305b51fed04e43","observation_id":"cff7c091-3e1e-4ad8-825c-3b4fa125cd4b","resolution":{"observed_at":"2026-08-05T18:04:08.887390Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T18:04:10.372910Z","title":null,"venue":null,"work_id":"05cde1be-babc-4263-8ad2-1d55117e8279","year":null},"citing_paper":{"arxiv_id":"2608.03494","last_updated":"2026-08-04T11:32:10Z","snapshot_observed_at":"2026-08-08T14:58:35.522056Z","submitted_at":"2026-08-04T11:32:10Z","title":"Beyond Initialization Loss: A Systematic Study of Token Embedding Initialization Strategies for LLM Vocabulary Extension","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-05T18:04:09.004379Z"},"links":{"citing_paper":"/paper/2608.03494"},"observation_digest":"sha256:7c05c01dc0317bd9ba57d0216256ea24d673336e012bd8029102f8b26234d963","observation_id":"6e1e6be7-9933-4bc4-b837-ad6ce46f279c","resolution":{"observed_at":"2026-08-05T18:04:10.443566Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T18:04:10.159780Z","title":"2024 , address =","venue":null,"work_id":"97105a4c-4ed9-42fb-8272-15da3e7a6911","year":2024},"citing_paper":{"arxiv_id":"2608.03494","last_updated":"2026-08-04T11:32:10Z","snapshot_observed_at":"2026-08-08T14:58:35.522056Z","submitted_at":"2026-08-04T11:32:10Z","title":"Beyond Initialization Loss: A Systematic Study of Token Embedding Initialization Strategies for LLM Vocabulary Extension","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-05T18:04:09.104671Z"},"links":{"citing_paper":"/paper/2608.03494"},"observation_digest":"sha256:4bbfaa1b4a78d1fb46c1259ba5138cdd44e92e2b1554195b851558b24f309763","observation_id":"81186828-4a64-4465-8955-7251692e7903","resolution":{"observed_at":"2026-08-05T18:04:10.275986Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00118","last_updated":"2024-10-02T15:22:49Z","snapshot_observed_at":"2026-08-02T16:20:09.773989Z","submitted_at":"2024-07-31T19:13:07Z","title":"Gemma 2: Improving Open Language Models at a Practical Size","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00118","snapshot_observed_at":"2026-08-05T18:04:09.199589Z","title":"arXiv preprint arXiv:2408.00118 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03494","last_updated":"2026-08-04T11:32:10Z","snapshot_observed_at":"2026-08-08T14:58:35.522056Z","submitted_at":"2026-08-04T11:32:10Z","title":"Beyond Initialization Loss: A Systematic Study of Token Embedding Initialization Strategies for LLM Vocabulary Extension","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-05T18:04:09.199589Z"},"links":{"cited_paper":"/paper/2408.00118","citing_paper":"/paper/2608.03494"},"observation_digest":"sha256:659a38fe63e297475b0a6bbfff068cc8b1326a1062a35260d58284648cf60fd3","observation_id":"61a24d51-7e72-4256-be47-76456eef77c9","resolution":{"observed_at":"2026-08-05T18:04:09.199589Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.06011","last_updated":"2025-04-08T13:16:54Z","snapshot_observed_at":"2026-08-09T12:50:37.439030Z","submitted_at":"2025-04-08T13:16:54Z","title":"Llama-3-Nanda-10B-Chat: An Open Generative Large Language Model for Hindi","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.06011","snapshot_observed_at":"2026-08-05T18:04:09.305017Z","title":"arXiv preprint arXiv:2504.06011 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03494","last_updated":"2026-08-04T11:32:10Z","snapshot_observed_at":"2026-08-08T14:58:35.522056Z","submitted_at":"2026-08-04T11:32:10Z","title":"Beyond Initialization Loss: A Systematic Study of Token Embedding Initialization Strategies for LLM Vocabulary Extension","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-05T18:04:09.305017Z"},"links":{"cited_paper":"/paper/2504.06011","citing_paper":"/paper/2608.03494"},"observation_digest":"sha256:f421cc7601edc4ba773eeb92b6448da31351002ae59282c95629d00c7116cbdd","observation_id":"e6e18b76-1f20-4705-9eb1-1bab47f4f061","resolution":{"observed_at":"2026-08-05T18:04:09.305017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T18:04:09.908060Z","title":null,"venue":null,"work_id":"e4a8b99a-5eec-4abc-a6fc-ee7bfc1259df","year":2025},"citing_paper":{"arxiv_id":"2608.03494","last_updated":"2026-08-04T11:32:10Z","snapshot_observed_at":"2026-08-08T14:58:35.522056Z","submitted_at":"2026-08-04T11:32:10Z","title":"Beyond Initialization Loss: A Systematic Study of Token Embedding Initialization Strategies for LLM Vocabulary Extension","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-05T18:04:09.409577Z"},"links":{"citing_paper":"/paper/2608.03494"},"observation_digest":"sha256:08cfb54088a939a9bed7e512d85ad7a90c9270dbee8f95ba61d6f345012e614d","observation_id":"fdb533b5-db61-446c-9d19-874763f0d459","resolution":{"observed_at":"2026-08-05T18:04:09.985622Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T18:04:09.494559Z","title":"Transactions of the association for computational linguistics , volume=","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2608.03494","last_updated":"2026-08-04T11:32:10Z","snapshot_observed_at":"2026-08-08T14:58:35.522056Z","submitted_at":"2026-08-04T11:32:10Z","title":"Beyond Initialization Loss: A Systematic Study of Token Embedding Initialization Strategies for LLM Vocabulary Extension","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-05T18:04:09.494559Z"},"links":{"citing_paper":"/paper/2608.03494"},"observation_digest":"sha256:d439a5f6741356e379af64ade68b8bbeaa57fbbda80a8f53f106602b03ee6d85","observation_id":"1f05b4f2-71dc-4bda-ae86-07c8f5c626ee","resolution":{"observed_at":"2026-08-05T18:04:09.494559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.03494","last_updated":"2026-08-04T11:32:10Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-08T14:58:35.522056Z","submitted_at":"2026-08-04T11:32:10Z","title":"Beyond Initialization Loss: A Systematic Study of Token Embedding Initialization Strategies for LLM Vocabulary Extension"},"reference_resolution":{"displayed":28,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":15,"verified_exact":0,"verified_fuzzy":12},"total_outbound_references":28},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 28 of 28 outbound references and 0 inbound Pith citation observations for arXiv:2608.03494."}