{"as_of":"2026-08-14T18:20:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:9eb1a6d5f4f7fc56f489fa6c4898a57a67f8da739178b75afd77490c08ad0f31","coverage":[{"denominator":43,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":43,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T23:50:17.987906Z","state":"measured"},{"denominator":43,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":43,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.15232/citation-record","integrity":"/paper/2607.15232/integrity","json":"/paper/2607.15232/citation-record.json","paper":"/paper/2607.15232"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2404.14219","last_updated":"2024-08-30T21:17:17Z","snapshot_observed_at":"2026-08-10T14:07:02.234322Z","submitted_at":"2024-04-22T14:32:33Z","title":"Phi-3 Technical Report: A Highly Capable Language Model Locally on Your Phone","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14219","snapshot_observed_at":"2026-08-01T23:50:14.205257Z","title":"Phi-3 technical report: A highly capable language model locally on your phone.arXiv preprint arXiv:2404.14219,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15232","last_updated":"2026-07-16T17:32:38Z","snapshot_observed_at":"2026-08-14T04:48:33.090408Z","submitted_at":"2026-07-16T17:32:38Z","title":"In-Place Tokenizer Expansion for Pre-trained LLMs","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-01T23:50:14.205257Z"},"links":{"cited_paper":"/paper/2404.14219","citing_paper":"/paper/2607.15232"},"observation_digest":"sha256:427b8070a389ca0e49580925a4e52ee6868420557229c0c5318c98b685f58c83","observation_id":"cf5b3712-064f-4da3-af85-7839bd8ff29d","resolution":{"observed_at":"2026-08-01T23:50:14.205257Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-14T02:43:01.480086Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-01T23:50:14.519304Z","title":"Training verifiers to solve math word problems.arXiv preprint arXiv:2110.14168,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15232","last_updated":"2026-07-16T17:32:38Z","snapshot_observed_at":"2026-08-14T04:48:33.090408Z","submitted_at":"2026-07-16T17:32:38Z","title":"In-Place Tokenizer Expansion for Pre-trained LLMs","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-01T23:50:14.519304Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2607.15232"},"observation_digest":"sha256:2531fba01f5b543381aa5787332e042527b62031d5a8dea41cd512702e8a1c43","observation_id":"388f9141-6904-4258-aa13-eb0a526551ad","resolution":{"observed_at":"2026-08-01T23:50:14.519304Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01035","last_updated":"2024-02-07T10:51:11Z","snapshot_observed_at":"2026-08-13T04:28:50.593476Z","submitted_at":"2024-02-01T21:49:34Z","title":"Getting the most out of your tokenizer for pre-training and domain adaptation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01035","snapshot_observed_at":"2026-08-01T23:50:14.734727Z","title":"Konstantin Dobler and Gerard de Melo","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.15232","last_updated":"2026-07-16T17:32:38Z","snapshot_observed_at":"2026-08-14T04:48:33.090408Z","submitted_at":"2026-07-16T17:32:38Z","title":"In-Place Tokenizer Expansion for Pre-trained LLMs","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-01T23:50:14.734727Z"},"links":{"cited_paper":"/paper/2402.01035","citing_paper":"/paper/2607.15232"},"observation_digest":"sha256:f2e42e76925b1178b6758037b276ac3a0a759084bca962eba41d885d37f44c58","observation_id":"d04aa6d4-4a75-48c0-8333-d70e8c144124","resolution":{"observed_at":"2026-08-01T23:50:14.734727Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:50:14.831833Z","title":"Token distillation: Attention-aware input em- beddings for new tokens.arXiv preprint arXiv:2505.20133,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15232","last_updated":"2026-07-16T17:32:38Z","snapshot_observed_at":"2026-08-14T04:48:33.090408Z","submitted_at":"2026-07-16T17:32:38Z","title":"In-Place Tokenizer Expansion for Pre-trained LLMs","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-01T23:50:14.831833Z"},"links":{"citing_paper":"/paper/2607.15232"},"observation_digest":"sha256:73c880b5bb0dfbd342b4410e5543e8bd67429aa91632de9677cfbc530fe9af83","observation_id":"a9ac9973-c0d4-46de-a51f-ccbd3f3e8d61","resolution":{"observed_at":"2026-08-01T23:50:14.831833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.03608","last_updated":"2024-04-04T17:31:32Z","snapshot_observed_at":"2026-08-13T00:37:32.915029Z","submitted_at":"2024-04-04T17:31:32Z","title":"Sailor: Open Language Models for South-East Asia","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.03608","snapshot_observed_at":"2026-08-01T23:50:15.036700Z","title":"arXiv:2404.03608","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15232","last_updated":"2026-07-16T17:32:38Z","snapshot_observed_at":"2026-08-14T04:48:33.090408Z","submitted_at":"2026-07-16T17:32:38Z","title":"In-Place Tokenizer Expansion for Pre-trained LLMs","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-01T23:50:15.036700Z"},"links":{"cited_paper":"/paper/2404.03608","citing_paper":"/paper/2607.15232"},"observation_digest":"sha256:9c78934df08ae49dd4680f8eb09f6a775d1bc3cbb4e5022f9d1e367449d44c2a","observation_id":"1b8d0d90-5de9-4746-96ec-4f0e3608f8da","resolution":{"observed_at":"2026-08-01T23:50:15.036700Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.17790","last_updated":"2024-04-27T06:07:55Z","snapshot_observed_at":"2026-08-13T00:20:29.800331Z","submitted_at":"2024-04-27T06:07:55Z","title":"Continual Pre-Training for Cross-Lingual LLM Adaptation: Enhancing Japanese Language Capabilities","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.17790","snapshot_observed_at":"2026-08-01T23:50:15.109835Z","title":"Gemma Team","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15232","last_updated":"2026-07-16T17:32:38Z","snapshot_observed_at":"2026-08-14T04:48:33.090408Z","submitted_at":"2026-07-16T17:32:38Z","title":"In-Place Tokenizer Expansion for Pre-trained LLMs","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-01T23:50:15.109835Z"},"links":{"cited_paper":"/paper/2404.17790","citing_paper":"/paper/2607.15232"},"observation_digest":"sha256:ae8caeeeb7fc88b88f28f3bce0670c2cb6d0f80ba45ac712c07ad5ba3bcfed3b","observation_id":"04464007-c7da-4791-9430-4eb37113238b","resolution":{"observed_at":"2026-08-01T23:50:15.109835Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.06607","last_updated":"2025-06-07T00:51:27Z","snapshot_observed_at":"2026-08-10T08:17:59.450807Z","submitted_at":"2025-06-07T00:51:27Z","title":"Training-Free Tokenizer Transplantation via Orthogonal Matching Pursuit","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.06607","snapshot_observed_at":"2026-08-01T23:50:15.197912Z","title":"Charles Goddard and Fernando Fernandes Neto","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15232","last_updated":"2026-07-16T17:32:38Z","snapshot_observed_at":"2026-08-14T04:48:33.090408Z","submitted_at":"2026-07-16T17:32:38Z","title":"In-Place Tokenizer Expansion for Pre-trained LLMs","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-01T23:50:15.197912Z"},"links":{"cited_paper":"/paper/2506.06607","citing_paper":"/paper/2607.15232"},"observation_digest":"sha256:2ac2d557f6bb40265485554bb4fca02a3c532db78f3b8329802be60abdfb8c02","observation_id":"0900b006-84b7-4846-a024-4497586a2d37","resolution":{"observed_at":"2026-08-01T23:50:15.197912Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-01T23:50:15.276274Z","title":"The Llama 3 herd of models.arXiv preprint arXiv:2407.21783,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15232","last_updated":"2026-07-16T17:32:38Z","snapshot_observed_at":"2026-08-14T04:48:33.090408Z","submitted_at":"2026-07-16T17:32:38Z","title":"In-Place Tokenizer Expansion for Pre-trained LLMs","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-01T23:50:15.276274Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2607.15232"},"observation_digest":"sha256:cef9d5403098809e8b0341979123a8e9ef3376cc11fa7a41e146c466f7a0586d","observation_id":"1948917c-3699-49d6-85c4-5440c92a8391","resolution":{"observed_at":"2026-08-01T23:50:15.276274Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.04335","last_updated":"2024-10-06T03:01:07Z","snapshot_observed_at":"2026-08-12T22:29:55.996464Z","submitted_at":"2024-10-06T03:01:07Z","title":"ReTok: Replacing Tokenizer to Enhance Representation Efficiency in Large Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.04335","snapshot_observed_at":"2026-08-01T23:50:15.357730Z","title":"ReTok: Replacing tokenizer to enhance representation efficiency in large language model.arXiv preprint arXiv:2410.04335,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15232","last_updated":"2026-07-16T17:32:38Z","snapshot_observed_at":"2026-08-14T04:48:33.090408Z","submitted_at":"2026-07-16T17:32:38Z","title":"In-Place Tokenizer Expansion for Pre-trained LLMs","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-01T23:50:15.357730Z"},"links":{"cited_paper":"/paper/2410.04335","citing_paper":"/paper/2607.15232"},"observation_digest":"sha256:db0103a3df80a73c2a6fe1cb3abdd9ea78275596eff302a049fbaaad5a192894","observation_id":"938266b8-643d-4ffd-92d1-7230a5756e4d","resolution":{"observed_at":"2026-08-01T23:50:15.357730Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.15553","last_updated":"2024-11-13T04:26:13Z","snapshot_observed_at":"2026-08-12T22:19:04.052792Z","submitted_at":"2024-10-21T00:59:47Z","title":"Multi-IF: Benchmarking LLMs on Multi-Turn and Multilingual Instructions Following","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.15553","snapshot_observed_at":"2026-08-01T23:50:15.426936Z","title":"Multi-IF: Benchmarking LLMs on multi-turn and multilingual instruction following","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15232","last_updated":"2026-07-16T17:32:38Z","snapshot_observed_at":"2026-08-14T04:48:33.090408Z","submitted_at":"2026-07-16T17:32:38Z","title":"In-Place Tokenizer Expansion for Pre-trained LLMs","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-01T23:50:15.426936Z"},"links":{"cited_paper":"/paper/2410.15553","citing_paper":"/paper/2607.15232"},"observation_digest":"sha256:1c36fcf410044a35c3582dde1ea4af205afaa322df0afcee3751f0312b365f1d","observation_id":"cab3315e-dfe5-43a9-830d-37610feac956","resolution":{"observed_at":"2026-08-01T23:50:15.426936Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.03874","last_updated":"2021-11-08T21:30:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-03-05T18:59:39Z","title":"Measuring Mathematical Problem Solving With the MATH Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.03874","snapshot_observed_at":"2026-08-01T23:50:15.518068Z","title":"Measuring mathematical problem solving with the MATH dataset.arXiv preprint arXiv:2103.03874,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15232","last_updated":"2026-07-16T17:32:38Z","snapshot_observed_at":"2026-08-14T04:48:33.090408Z","submitted_at":"2026-07-16T17:32:38Z","title":"In-Place Tokenizer Expansion for Pre-trained LLMs","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-01T23:50:15.518068Z"},"links":{"cited_paper":"/paper/2103.03874","citing_paper":"/paper/2607.15232"},"observation_digest":"sha256:739e5e23f281484acaddf0c9b5d1d1114ad3f5f3dfdf7800ce40f0e6fc1d005c","observation_id":"94c09525-8a6c-4248-b807-1a8bab64d848","resolution":{"observed_at":"2026-08-01T23:50:15.518068Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.07974","last_updated":"2024-06-06T17:41:21Z","snapshot_observed_at":"2026-08-13T09:04:30.125777Z","submitted_at":"2024-03-12T17:58:04Z","title":"LiveCodeBench: Holistic and Contamination Free Evaluation of Large Language Models for Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.07974","snapshot_observed_at":"2026-08-01T23:50:15.611343Z","title":"Naman Jain, King Han, Alex Gu, Wen-Ding Li, Fanjia Yan, Tianjun Zhang, Sida Wang, Armando Solar- Lezama, Koushik Sen, and Ion Stoica","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.15232","last_updated":"2026-07-16T17:32:38Z","snapshot_observed_at":"2026-08-14T04:48:33.090408Z","submitted_at":"2026-07-16T17:32:38Z","title":"In-Place Tokenizer Expansion for Pre-trained LLMs","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-01T23:50:15.611343Z"},"links":{"cited_paper":"/paper/2403.07974","citing_paper":"/paper/2607.15232"},"observation_digest":"sha256:22353ef16e2efed3a995428f792945d6d526bb28e46394f3ce4cef00512f0427","observation_id":"3293b783-0028-4a41-b754-8b7453a8ef18","resolution":{"observed_at":"2026-08-01T23:50:15.611343Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14714","last_updated":"2024-02-22T17:12:39Z","snapshot_observed_at":"2026-08-14T02:11:49.030808Z","submitted_at":"2024-02-22T17:12:39Z","title":"Efficient and Effective Vocabulary Expansion Towards Multilingual Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14714","snapshot_observed_at":"2026-08-01T23:50:15.667569Z","title":"Efficient and effective vocabulary expansion to- wards multilingual large language models.arXiv preprint arXiv:2402.14714,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15232","last_updated":"2026-07-16T17:32:38Z","snapshot_observed_at":"2026-08-14T04:48:33.090408Z","submitted_at":"2026-07-16T17:32:38Z","title":"In-Place Tokenizer Expansion for Pre-trained LLMs","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-01T23:50:15.667569Z"},"links":{"cited_paper":"/paper/2402.14714","citing_paper":"/paper/2607.15232"},"observation_digest":"sha256:363214033bd341ace10a5e7be0674f7c7c6c9cbd687de53f18bdfc70c47c6044","observation_id":"fd963db7-8803-49aa-b137-ec61ab57d8d8","resolution":{"observed_at":"2026-08-01T23:50:15.667569Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03523","last_updated":"2025-06-04T03:15:57Z","snapshot_observed_at":"2026-08-13T14:52:07.390437Z","submitted_at":"2025-06-04T03:15:57Z","title":"TokAlign: Efficient Vocabulary Adaptation via Token Alignment","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.03523","snapshot_observed_at":"2026-08-01T23:50:15.766936Z","title":"arXiv:2506.03523","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15232","last_updated":"2026-07-16T17:32:38Z","snapshot_observed_at":"2026-08-14T04:48:33.090408Z","submitted_at":"2026-07-16T17:32:38Z","title":"In-Place Tokenizer Expansion for Pre-trained LLMs","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-01T23:50:15.766936Z"},"links":{"cited_paper":"/paper/2506.03523","citing_paper":"/paper/2607.15232"},"observation_digest":"sha256:8bd8ea04eb7bb19443c8e41523a191822e2bb54955021363e0b562d17ecd7397","observation_id":"c3e2d6db-0ba2-426c-8812-52262f7417e0","resolution":{"observed_at":"2026-08-01T23:50:15.766936Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:50:15.828568Z","title":"doi: 10.18653/v1/2024.acl-long","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.15232","last_updated":"2026-07-16T17:32:38Z","snapshot_observed_at":"2026-08-14T04:48:33.090408Z","submitted_at":"2026-07-16T17:32:38Z","title":"In-Place Tokenizer Expansion for Pre-trained LLMs","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-01T23:50:15.828568Z"},"links":{"citing_paper":"/paper/2607.15232"},"observation_digest":"sha256:672975bbc65b31eb544480dccf7eb78b5b6f06a473d0e55ab609eb09fc55b3eb","observation_id":"106f1fc8-3e33-4744-a3a2-939966ea043e","resolution":{"observed_at":"2026-08-01T23:50:15.828568Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.20050","last_updated":"2023-05-31T17:24:00Z","snapshot_observed_at":"2026-08-11T17:22:43.545531Z","submitted_at":"2023-05-31T17:24:00Z","title":"Let's Verify Step by Step","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.20050","snapshot_observed_at":"2026-08-01T23:50:15.916953Z","title":"Peiqin Lin, Shaoxiong Ji, J ¨org Tiedemann, Andr ´e F T Martins, and Hinrich Sch ¨utze","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15232","last_updated":"2026-07-16T17:32:38Z","snapshot_observed_at":"2026-08-14T04:48:33.090408Z","submitted_at":"2026-07-16T17:32:38Z","title":"In-Place Tokenizer Expansion for Pre-trained LLMs","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-01T23:50:15.916953Z"},"links":{"cited_paper":"/paper/2305.20050","citing_paper":"/paper/2607.15232"},"observation_digest":"sha256:ec0f4e69552e7285fab4df16cc5c15e32c731fc8ebf79f00d96ac418d0dee5b0","observation_id":"61ab653b-ccb1-46df-93d9-de795a0531f5","resolution":{"observed_at":"2026-08-01T23:50:15.916953Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:50:16.013219Z","title":"LFM2 technical report.arXiv preprint arXiv:2511.23404,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15232","last_updated":"2026-07-16T17:32:38Z","snapshot_observed_at":"2026-08-14T04:48:33.090408Z","submitted_at":"2026-07-16T17:32:38Z","title":"In-Place Tokenizer Expansion for Pre-trained LLMs","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-01T23:50:16.013219Z"},"links":{"citing_paper":"/paper/2607.15232"},"observation_digest":"sha256:e2626248228e4d9f30bf6c5346764dfe61915ee9227a56d0843353705ef9f9fc","observation_id":"a553e361-61d8-44dc-b874-88787803b766","resolution":{"observed_at":"2026-08-01T23:50:16.013219Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.01210","last_updated":"2023-10-30T19:37:09Z","snapshot_observed_at":"2026-08-12T18:11:04.754824Z","submitted_at":"2023-05-02T05:46:48Z","title":"Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.01210","snapshot_observed_at":"2026-08-01T23:50:16.078214Z","title":"Benjamin Minixhofer, Fabian Paischer, and Navid Rekabsaz","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.15232","last_updated":"2026-07-16T17:32:38Z","snapshot_observed_at":"2026-08-14T04:48:33.090408Z","submitted_at":"2026-07-16T17:32:38Z","title":"In-Place Tokenizer Expansion for Pre-trained LLMs","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-01T23:50:16.078214Z"},"links":{"cited_paper":"/paper/2305.01210","citing_paper":"/paper/2607.15232"},"observation_digest":"sha256:0ed2af25acd2445206d7943141216004cdcb20da8c84d1843213516a9df987ea","observation_id":"5acf4e6d-2eaa-4133-858a-412334be0a1d","resolution":{"observed_at":"2026-08-01T23:50:16.078214Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:50:16.200437Z","title":"Nandini Mundra, Aditya Nanda Kishore Khandavally, Raj Dabre, Ratish Puduppully, Anoop Kunchukut- tan, and Mitesh M","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15232","last_updated":"2026-07-16T17:32:38Z","snapshot_observed_at":"2026-08-14T04:48:33.090408Z","submitted_at":"2026-07-16T17:32:38Z","title":"In-Place Tokenizer Expansion for Pre-trained LLMs","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-01T23:50:16.200437Z"},"links":{"citing_paper":"/paper/2607.15232"},"observation_digest":"sha256:9f6b8c7841846d825292d863879a9f24c8857f6ee8b15709e8f9d3b188a71e52","observation_id":"1b05f5d2-02e8-4df7-9b44-3ff484999259","resolution":{"observed_at":"2026-08-01T23:50:16.200437Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05841","last_updated":"2024-10-22T00:16:21Z","snapshot_observed_at":"2026-08-13T05:31:58.644228Z","submitted_at":"2024-07-08T11:38:49Z","title":"An Empirical Comparison of Vocabulary Expansion and Initialization Approaches for Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.05841","snapshot_observed_at":"2026-08-01T23:50:16.259225Z","title":"arXiv:2407.05841","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15232","last_updated":"2026-07-16T17:32:38Z","snapshot_observed_at":"2026-08-14T04:48:33.090408Z","submitted_at":"2026-07-16T17:32:38Z","title":"In-Place Tokenizer Expansion for Pre-trained LLMs","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-01T23:50:16.259225Z"},"links":{"cited_paper":"/paper/2407.05841","citing_paper":"/paper/2607.15232"},"observation_digest":"sha256:8797f0fb341e6c8b379d72a63dce81d7792d0b7ae9bc9dca513cb5576db9dc35","observation_id":"892cae98-8bbc-446a-9d92-c75d44097134","resolution":{"observed_at":"2026-08-01T23:50:16.259225Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19693","last_updated":"2025-08-01T10:53:31Z","snapshot_observed_at":"2026-08-12T10:05:31.600361Z","submitted_at":"2025-03-25T14:18:21Z","title":"AdaptiVocab: Enhancing LLM Efficiency in Focused Domains through Lightweight Vocabulary Adaptation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.19693","snapshot_observed_at":"2026-08-01T23:50:16.366515Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15232","last_updated":"2026-07-16T17:32:38Z","snapshot_observed_at":"2026-08-14T04:48:33.090408Z","submitted_at":"2026-07-16T17:32:38Z","title":"In-Place Tokenizer Expansion for Pre-trained LLMs","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-01T23:50:16.366515Z"},"links":{"cited_paper":"/paper/2503.19693","citing_paper":"/paper/2607.15232"},"observation_digest":"sha256:9c4868c21296ed06d428599a58740ff9bb3da14d2f31022b3093ca178d00a22e","observation_id":"cd508f2c-7658-47dd-b894-9c75674811c2","resolution":{"observed_at":"2026-08-01T23:50:16.366515Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.09626","last_updated":"2023-01-23T18:56:12Z","snapshot_observed_at":"2026-08-13T12:59:25.584811Z","submitted_at":"2023-01-23T18:56:12Z","title":"Efficient Language Model Training through Cross-Lingual and Progressive Transfer Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.09626","snapshot_observed_at":"2026-08-01T23:50:16.551996Z","title":"Malte Ostendorff and Georg Rehm","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15232","last_updated":"2026-07-16T17:32:38Z","snapshot_observed_at":"2026-08-14T04:48:33.090408Z","submitted_at":"2026-07-16T17:32:38Z","title":"In-Place Tokenizer Expansion for Pre-trained LLMs","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-01T23:50:16.551996Z"},"links":{"cited_paper":"/paper/2301.09626","citing_paper":"/paper/2607.15232"},"observation_digest":"sha256:76a65b17eba27d9151eee6b5be85a05b8310c0221d5a7b105026b808d90dfe64","observation_id":"91b7392c-684f-4381-84d1-860805078905","resolution":{"observed_at":"2026-08-01T23:50:16.551996Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.20920","last_updated":"2025-06-26T01:01:47Z","snapshot_observed_at":"2026-08-13T04:59:54.179036Z","submitted_at":"2025-06-26T01:01:47Z","title":"FineWeb2: One Pipeline to Scale Them All -- Adapting Pre-Training Data Processing to Every Language","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.20920","snapshot_observed_at":"2026-08-01T23:50:16.706422Z","title":"FineWeb2: One pipeline to scale them all – adapting pre-training data processing to every language.arXiv preprint arXiv:2506.20920,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15232","last_updated":"2026-07-16T17:32:38Z","snapshot_observed_at":"2026-08-14T04:48:33.090408Z","submitted_at":"2026-07-16T17:32:38Z","title":"In-Place Tokenizer Expansion for Pre-trained LLMs","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-01T23:50:16.706422Z"},"links":{"cited_paper":"/paper/2506.20920","citing_paper":"/paper/2607.15232"},"observation_digest":"sha256:5e109823d66bad77d4882333ca98a69337fc40bec3c7c8ccde55d52b1bed8c5d","observation_id":"a12afaeb-34ce-473a-91f9-9ad1b79e3171","resolution":{"observed_at":"2026-08-01T23:50:16.706422Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:50:16.828605Z","title":"Yamshchikov, and Mark Fishel","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.15232","last_updated":"2026-07-16T17:32:38Z","snapshot_observed_at":"2026-08-14T04:48:33.090408Z","submitted_at":"2026-07-16T17:32:38Z","title":"In-Place Tokenizer Expansion for Pre-trained LLMs","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-01T23:50:16.828605Z"},"links":{"citing_paper":"/paper/2607.15232"},"observation_digest":"sha256:1d285a621fcc700a60bb7c4f2d901baa59aeed1a948451aec2aae172474ccf84","observation_id":"9508b108-dc2a-4c07-9d6d-88c92ac8f8c9","resolution":{"observed_at":"2026-08-01T23:50:16.828605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.04303","last_updated":"2024-08-08T08:37:28Z","snapshot_observed_at":"2026-08-12T23:06:43.939890Z","submitted_at":"2024-08-08T08:37:28Z","title":"Trans-Tokenization and Cross-lingual Vocabulary Transfers: Language Adaptation of LLMs for Low-Resource NLP","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.04303","snapshot_observed_at":"2026-08-01T23:50:17.052920Z","title":"Phillip Rust, Jonas Pfeiffer, Ivan Vuli´c, Sebastian Ruder, and Iryna Gurevych","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15232","last_updated":"2026-07-16T17:32:38Z","snapshot_observed_at":"2026-08-14T04:48:33.090408Z","submitted_at":"2026-07-16T17:32:38Z","title":"In-Place Tokenizer Expansion for Pre-trained LLMs","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-01T23:50:17.052920Z"},"links":{"cited_paper":"/paper/2408.04303","citing_paper":"/paper/2607.15232"},"observation_digest":"sha256:39baa3774b60dd3bdce7053aac714743725ca9ded6fa4f25a988b9c078f11f2c","observation_id":"1b58d0ec-ee68-4219-8ae6-7c166a46e79f","resolution":{"observed_at":"2026-08-01T23:50:17.052920Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03304","last_updated":"2025-02-19T13:30:23Z","snapshot_observed_at":"2026-08-11T22:30:47.514883Z","submitted_at":"2024-12-04T13:27:09Z","title":"Global MMLU: Understanding and Addressing Cultural and Linguistic Biases in Multilingual Evaluation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03304","snapshot_observed_at":"2026-08-01T23:50:17.232027Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15232","last_updated":"2026-07-16T17:32:38Z","snapshot_observed_at":"2026-08-14T04:48:33.090408Z","submitted_at":"2026-07-16T17:32:38Z","title":"In-Place Tokenizer Expansion for Pre-trained LLMs","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-01T23:50:17.232027Z"},"links":{"cited_paper":"/paper/2412.03304","citing_paper":"/paper/2607.15232"},"observation_digest":"sha256:c10a344c0da44c30ce9c01f046c56319053c5b50c8b8bec7ba73bcc950e39631","observation_id":"40fb040e-78e9-4687-8003-0f6170f7b558","resolution":{"observed_at":"2026-08-01T23:50:17.232027Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.07827","last_updated":"2024-02-12T17:34:13Z","snapshot_observed_at":"2026-08-13T04:20:25.932319Z","submitted_at":"2024-02-12T17:34:13Z","title":"Aya Model: An Instruction Finetuned Open-Access Multilingual Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.07827","snapshot_observed_at":"2026-08-01T23:50:17.306885Z","title":"Aya model: An instruction finetuned open- access multilingual language model.arXiv preprint arXiv:2402.07827,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15232","last_updated":"2026-07-16T17:32:38Z","snapshot_observed_at":"2026-08-14T04:48:33.090408Z","submitted_at":"2026-07-16T17:32:38Z","title":"In-Place Tokenizer Expansion for Pre-trained LLMs","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-01T23:50:17.306885Z"},"links":{"cited_paper":"/paper/2402.07827","citing_paper":"/paper/2607.15232"},"observation_digest":"sha256:c657e233166274400071a0b86dec363ee4a85f0fe38e0b70c0eb9cb584b283be","observation_id":"b73e10c2-9ce7-4601-b604-06344521055a","resolution":{"observed_at":"2026-08-01T23:50:17.306885Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.00088","last_updated":"2024-09-14T04:01:09Z","snapshot_observed_at":"2026-08-12T22:57:42.454673Z","submitted_at":"2024-08-26T03:33:36Z","title":"On-Device Language Models: A Comprehensive Review","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.00088","snapshot_observed_at":"2026-08-01T23:50:17.391198Z","title":"On-device language models: A comprehensive review.arXiv preprint arXiv:2409.00088,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15232","last_updated":"2026-07-16T17:32:38Z","snapshot_observed_at":"2026-08-14T04:48:33.090408Z","submitted_at":"2026-07-16T17:32:38Z","title":"In-Place Tokenizer Expansion for Pre-trained LLMs","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-01T23:50:17.391198Z"},"links":{"cited_paper":"/paper/2409.00088","citing_paper":"/paper/2607.15232"},"observation_digest":"sha256:2b643da97d7b81c51cf76c3bebcebc72d67614a3a0d86a21fe548695feb60114","observation_id":"d6679158-4ec1-4fb8-ada4-164eca059df1","resolution":{"observed_at":"2026-08-01T23:50:17.391198Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:50:17.453883Z","title":"An empirical study on cross-lingual vocab- ulary adaptation for efficient language model inference","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.15232","last_updated":"2026-07-16T17:32:38Z","snapshot_observed_at":"2026-08-14T04:48:33.090408Z","submitted_at":"2026-07-16T17:32:38Z","title":"In-Place Tokenizer Expansion for Pre-trained LLMs","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-01T23:50:17.453883Z"},"links":{"citing_paper":"/paper/2607.15232"},"observation_digest":"sha256:c5d4066faa5239805d214c58cc7c02811acc877c754e927696a0fcdd9022759f","observation_id":"099d2ab8-56c7-492f-8cad-0347b17c91ea","resolution":{"observed_at":"2026-08-01T23:50:17.453883Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.10712","last_updated":"2024-09-26T11:15:14Z","snapshot_observed_at":"2026-08-13T04:17:32.835419Z","submitted_at":"2024-02-16T14:15:15Z","title":"An Empirical Study on Cross-lingual Vocabulary Adaptation for Efficient Language Model Inference","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.10712","snapshot_observed_at":"2026-08-01T23:50:17.541365Z","title":"arXiv:2402.10712","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15232","last_updated":"2026-07-16T17:32:38Z","snapshot_observed_at":"2026-08-14T04:48:33.090408Z","submitted_at":"2026-07-16T17:32:38Z","title":"In-Place Tokenizer Expansion for Pre-trained LLMs","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-01T23:50:17.541365Z"},"links":{"cited_paper":"/paper/2402.10712","citing_paper":"/paper/2607.15232"},"observation_digest":"sha256:f63db4c2cb39b8cda7450d1f26a5b23ab06d3d97f9079f1cc62a9b724bcc4f16","observation_id":"250276d5-f2ef-4e92-b32b-46eb7cd802b6","resolution":{"observed_at":"2026-08-01T23:50:17.541365Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:50:17.601724Z","title":"arXiv:2406.11477","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15232","last_updated":"2026-07-16T17:32:38Z","snapshot_observed_at":"2026-08-14T04:48:33.090408Z","submitted_at":"2026-07-16T17:32:38Z","title":"In-Place Tokenizer Expansion for Pre-trained LLMs","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-01T23:50:17.601724Z"},"links":{"citing_paper":"/paper/2607.15232"},"observation_digest":"sha256:5a4998b41a0932e64715b53de71cd82df0b110d37b1abd9505385445b61baa54","observation_id":"98690ae9-4327-4c8d-9400-abb96731d278","resolution":{"observed_at":"2026-08-01T23:50:17.601724Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07911","last_updated":"2023-11-14T05:13:55Z","snapshot_observed_at":"2026-07-06T16:47:08.877195Z","submitted_at":"2023-11-14T05:13:55Z","title":"Instruction-Following Evaluation for Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07911","snapshot_observed_at":"2026-08-01T23:50:17.660388Z","title":"Instruction-following evaluation for large language models.arXiv preprint arXiv:2311.07911,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15232","last_updated":"2026-07-16T17:32:38Z","snapshot_observed_at":"2026-08-14T04:48:33.090408Z","submitted_at":"2026-07-16T17:32:38Z","title":"In-Place Tokenizer Expansion for Pre-trained LLMs","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-01T23:50:17.660388Z"},"links":{"cited_paper":"/paper/2311.07911","citing_paper":"/paper/2607.15232"},"observation_digest":"sha256:f5a273a6435cc5d4ef7fa1cf9e4caa25b203e494cf1c050640509a0b8e5fe139","observation_id":"2ff7ab0b-4cec-4b2e-9778-d73b7da54a1d","resolution":{"observed_at":"2026-08-01T23:50:17.660388Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:50:17.708762Z","title":"•Math (3 benchmarks).GSM8K (Cobbe et al., 2021), MATH500 (the 500-problem test subset of MATH (Hendrycks et al.,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.15232","last_updated":"2026-07-16T17:32:38Z","snapshot_observed_at":"2026-08-14T04:48:33.090408Z","submitted_at":"2026-07-16T17:32:38Z","title":"In-Place Tokenizer Expansion for Pre-trained LLMs","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-01T23:50:17.708762Z"},"links":{"citing_paper":"/paper/2607.15232"},"observation_digest":"sha256:7d1a327ae45c01334ee92f623f8324ea2d253eaf315f35c406ca46019c8e1718","observation_id":"23905fa8-91f9-46ec-8343-c9477964fadd","resolution":{"observed_at":"2026-08-01T23:50:17.708762Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:50:17.762279Z","title":"(2024)), and GSM-Plus (Li et al., 2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.15232","last_updated":"2026-07-16T17:32:38Z","snapshot_observed_at":"2026-08-14T04:48:33.090408Z","submitted_at":"2026-07-16T17:32:38Z","title":"In-Place Tokenizer Expansion for Pre-trained LLMs","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-01T23:50:17.762279Z"},"links":{"citing_paper":"/paper/2607.15232"},"observation_digest":"sha256:774545dc3875faddd0ee1f3273c9f7aaf86739566bbb8a984b3e04a83910db93","observation_id":"93dc6229-83cb-4524-8f91-561589b41875","resolution":{"observed_at":"2026-08-01T23:50:17.762279Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:50:17.846638Z","title":"•Multilingual (2 benchmarks).MMMLU (OpenAI,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.15232","last_updated":"2026-07-16T17:32:38Z","snapshot_observed_at":"2026-08-14T04:48:33.090408Z","submitted_at":"2026-07-16T17:32:38Z","title":"In-Place Tokenizer Expansion for Pre-trained LLMs","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-01T23:50:17.846638Z"},"links":{"citing_paper":"/paper/2607.15232"},"observation_digest":"sha256:ca215db70be881722ee7ae8d65dfb8f288017bb20ac81af88b752aef3bec240c","observation_id":"5069654b-6246-4b0b-8d39-45a06169958b","resolution":{"observed_at":"2026-08-01T23:50:17.846638Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:50:17.925297Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.15232","last_updated":"2026-07-16T17:32:38Z","snapshot_observed_at":"2026-08-14T04:48:33.090408Z","submitted_at":"2026-07-16T17:32:38Z","title":"In-Place Tokenizer Expansion for Pre-trained LLMs","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-01T23:50:17.925297Z"},"links":{"citing_paper":"/paper/2607.15232"},"observation_digest":"sha256:51a0133f9bd9e046294f5886ee53daf8cf3d9c17c380a7d43906e3d002e46d68","observation_id":"ff637248-d043-442d-89d3-9bf1d2562fa7","resolution":{"observed_at":"2026-08-01T23:50:17.925297Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:50:17.987906Z","title":"Zero-shot","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.15232","last_updated":"2026-07-16T17:32:38Z","snapshot_observed_at":"2026-08-14T04:48:33.090408Z","submitted_at":"2026-07-16T17:32:38Z","title":"In-Place Tokenizer Expansion for Pre-trained LLMs","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-01T23:50:17.987906Z"},"links":{"citing_paper":"/paper/2607.15232"},"observation_digest":"sha256:6a6ea9934340223333409d902a2cb50cfa5557ec4dddf79ff96a04cd39d7c922","observation_id":"9a12a49f-824c-44c2-9ad7-50cfbcafca57","resolution":{"observed_at":"2026-08-01T23:50:17.987906Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09738","last_updated":"2025-05-14T19:00:27Z","snapshot_observed_at":"2026-08-07T15:45:19.248619Z","submitted_at":"2025-05-14T19:00:27Z","title":"Achieving Tokenizer Flexibility in Language Models through Heuristic Adaptation and Supertoken Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09738","snapshot_observed_at":"2026-08-01T23:50:17.166923Z","title":"Achieving tokenizer flexibility in language models through heuristic adaptation and supertoken learning.arXiv preprint arXiv:2505.09738,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15232","last_updated":"2026-07-16T17:32:38Z","snapshot_observed_at":"2026-08-14T04:48:33.090408Z","submitted_at":"2026-07-16T17:32:38Z","title":"In-Place Tokenizer Expansion for Pre-trained LLMs","version":1},"reference_index":2016,"source":"pdf_text","source_observed_at":"2026-08-01T23:50:17.166923Z"},"links":{"cited_paper":"/paper/2505.09738","citing_paper":"/paper/2607.15232"},"observation_digest":"sha256:3ef3b13fc3bdd7f562dfa5f1c151b2af66552039dda9a15902752ad8630d7049","observation_id":"566d3c34-cc63-4f5f-b2ea-a9eae8368a52","resolution":{"observed_at":"2026-08-01T23:50:17.166923Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.08177","last_updated":"2024-02-23T02:22:36Z","snapshot_observed_at":"2026-08-13T12:01:03.836071Z","submitted_at":"2023-04-17T11:39:53Z","title":"Efficient and Effective Text Encoding for Chinese LLaMA and Alpaca","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.08177","snapshot_observed_at":"2026-08-01T23:50:14.638495Z","title":"Efficient and effective text encoding for Chinese LLaMA and Alpaca","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15232","last_updated":"2026-07-16T17:32:38Z","snapshot_observed_at":"2026-08-14T04:48:33.090408Z","submitted_at":"2026-07-16T17:32:38Z","title":"In-Place Tokenizer Expansion for Pre-trained LLMs","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-01T23:50:14.638495Z"},"links":{"cited_paper":"/paper/2304.08177","citing_paper":"/paper/2607.15232"},"observation_digest":"sha256:714d67ed3b0f1c42fe132fa31fdbe4c0296b8faf72bb71b946ebfde04ea10055","observation_id":"4719273d-bfbc-449d-908e-435d491b0555","resolution":{"observed_at":"2026-08-01T23:50:14.638495Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17733","last_updated":"2024-02-27T18:09:36Z","snapshot_observed_at":"2026-08-13T04:08:52.914747Z","submitted_at":"2024-02-27T18:09:36Z","title":"Tower: An Open Multilingual Large Language Model for Translation-Related Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.17733","snapshot_observed_at":"2026-08-01T23:50:14.394538Z","title":"doi: 10.18653/v1/2023.emnlp-main.614","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.15232","last_updated":"2026-07-16T17:32:38Z","snapshot_observed_at":"2026-08-14T04:48:33.090408Z","submitted_at":"2026-07-16T17:32:38Z","title":"In-Place Tokenizer Expansion for Pre-trained LLMs","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-01T23:50:14.394538Z"},"links":{"cited_paper":"/paper/2402.17733","citing_paper":"/paper/2607.15232"},"observation_digest":"sha256:a46e5b4f787a7601119f91bc49a21a90df90be1d6e49568e63bbfb618ac6796c","observation_id":"8c3bb9c1-032c-4457-8e07-62f919a85f61","resolution":{"observed_at":"2026-08-01T23:50:14.394538Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:50:14.276234Z","title":"Do all languages cost the same? Tokenization in the era of commercial language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.15232","last_updated":"2026-07-16T17:32:38Z","snapshot_observed_at":"2026-08-14T04:48:33.090408Z","submitted_at":"2026-07-16T17:32:38Z","title":"In-Place Tokenizer Expansion for Pre-trained LLMs","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-01T23:50:14.276234Z"},"links":{"citing_paper":"/paper/2607.15232"},"observation_digest":"sha256:d139b07636d2a6a1838f62aeb293895d783f6b71f1cb300155bd76c0e169eb44","observation_id":"7869ccf8-b4d6-47e5-b8f2-960106574478","resolution":{"observed_at":"2026-08-01T23:50:14.276234Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:50:14.948905Z","title":"Sailor: Open language models for South-East Asia","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.15232","last_updated":"2026-07-16T17:32:38Z","snapshot_observed_at":"2026-08-14T04:48:33.090408Z","submitted_at":"2026-07-16T17:32:38Z","title":"In-Place Tokenizer Expansion for Pre-trained LLMs","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-01T23:50:14.948905Z"},"links":{"citing_paper":"/paper/2607.15232"},"observation_digest":"sha256:a5ee2e1c24eee55dd7f65cb2a2260104c3106959ca77cd0a8fe89aa50c94db5d","observation_id":"13e07e81-f001-498f-b758-7bdd1108e15b","resolution":{"observed_at":"2026-08-01T23:50:14.948905Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:50:16.948239Z","title":"doi: 10.18653/v1/2026.findings-eacl.341","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.15232","last_updated":"2026-07-16T17:32:38Z","snapshot_observed_at":"2026-08-14T04:48:33.090408Z","submitted_at":"2026-07-16T17:32:38Z","title":"In-Place Tokenizer Expansion for Pre-trained LLMs","version":1},"reference_index":2026,"source":"pdf_text","source_observed_at":"2026-08-01T23:50:16.948239Z"},"links":{"citing_paper":"/paper/2607.15232"},"observation_digest":"sha256:f39a876f55c23b24fe78195452cf497dde5960af123d880f1380bf581ed072f9","observation_id":"cda33b7d-680d-4834-b29b-413bed8bdb87","resolution":{"observed_at":"2026-08-01T23:50:16.948239Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.15232","last_updated":"2026-07-16T17:32:38Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-14T04:48:33.090408Z","submitted_at":"2026-07-16T17:32:38Z","title":"In-Place Tokenizer Expansion for Pre-trained LLMs"},"reference_resolution":{"displayed":43,"state_counts":{"malformed_identifier":2,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":41,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":43},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 43 of 43 outbound references and 0 inbound Pith citation observations for arXiv:2607.15232."}