{"as_of":"2026-08-10T16:00:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:9ef52ec3f00e013989194f3ff3fd1d626dbe094f439e34365a528b4b14b01e18","coverage":[{"denominator":19,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":19,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:35:32.474459Z","state":"measured"},{"denominator":23,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":23,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":4,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":4,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-26T04:59:05.057552Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T13:39:51.284729Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.24689","last_updated":"2025-05-30T15:12:41Z","snapshot_observed_at":"2026-08-09T23:06:02.394151Z","submitted_at":"2025-05-30T15:12:41Z","title":"BPE Stays on SCRIPT: Structured Encoding for Robust Multilingual Pretokenization","version":1},"cited_work":{"arxiv_id":"2505.24689","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.24689","snapshot_observed_at":"2026-07-04T13:39:51.284729Z","title":"Tatsuki Kuribayashi, Ryo Ueda, Ryo Yoshida, Yohei Oseki, Ted Briscoe, and Timothy Baldwin","venue":null,"work_id":"ff289642-ef1d-4b56-ae94-d6f53a516ce0","year":2025},"citing_paper":{"arxiv_id":"2601.07220","last_updated":"2026-04-10T02:04:44Z","snapshot_observed_at":"2026-07-06T22:41:24.948774Z","submitted_at":"2026-01-12T05:25:39Z","title":"The Roots of Performance Disparity in Multilingual Language Models: Intrinsic Modeling Difficulty or Design Choices?","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-16T14:59:02.533789Z"},"links":{"cited_paper":"/paper/2505.24689","citing_paper":"/paper/2601.07220"},"observation_digest":"sha256:51e56d663da165492cbe9e0026e3aaf3582232fac290d1c5b32fbac9b05886d1","observation_id":"b68c0b5c-de20-4d1d-bbf6-9cd03a316395","resolution":{"observed_at":"2026-05-16T15:01:03.843494Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24689","last_updated":"2025-05-30T15:12:41Z","snapshot_observed_at":"2026-08-09T23:06:02.394151Z","submitted_at":"2025-05-30T15:12:41Z","title":"BPE Stays on SCRIPT: Structured Encoding for Robust Multilingual Pretokenization","version":1},"cited_work":{"arxiv_id":"2505.24689","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.24689","snapshot_observed_at":"2026-07-04T13:39:51.284729Z","title":"Tatsuki Kuribayashi, Ryo Ueda, Ryo Yoshida, Yohei Oseki, Ted Briscoe, and Timothy Baldwin","venue":null,"work_id":"ff289642-ef1d-4b56-ae94-d6f53a516ce0","year":2025},"citing_paper":{"arxiv_id":"2604.05192","last_updated":"2026-04-06T21:43:48Z","snapshot_observed_at":"2026-08-07T07:27:45.035220Z","submitted_at":"2026-04-06T21:43:48Z","title":"Faster Superword Tokenization","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-10T18:51:20.043728Z"},"links":{"cited_paper":"/paper/2505.24689","citing_paper":"/paper/2604.05192"},"observation_digest":"sha256:fe4a28ba833fe84fbfa10175f171b715a4126b81ae83d19531bce1a5ffc89fe5","observation_id":"b68a1932-1dc9-4a72-ad55-2add4357d734","resolution":{"observed_at":"2026-05-10T23:50:52.391000Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24689","last_updated":"2025-05-30T15:12:41Z","snapshot_observed_at":"2026-08-09T23:06:02.394151Z","submitted_at":"2025-05-30T15:12:41Z","title":"BPE Stays on SCRIPT: Structured Encoding for Robust Multilingual Pretokenization","version":1},"cited_work":{"arxiv_id":"2505.24689","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.24689","snapshot_observed_at":"2026-07-04T13:39:51.284729Z","title":"Tatsuki Kuribayashi, Ryo Ueda, Ryo Yoshida, Yohei Oseki, Ted Briscoe, and Timothy Baldwin","venue":null,"work_id":"ff289642-ef1d-4b56-ae94-d6f53a516ce0","year":2025},"citing_paper":{"arxiv_id":"2605.22705","last_updated":"2026-05-26T17:59:39Z","snapshot_observed_at":"2026-07-06T23:32:59.663926Z","submitted_at":"2026-05-21T16:46:23Z","title":"Tokenization with Split Trees","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-05-22T05:48:29.391178Z"},"links":{"cited_paper":"/paper/2505.24689","citing_paper":"/paper/2605.22705"},"observation_digest":"sha256:e2c3a8c03ff649188d4f33b518c520027650f4a6c404a304695fafe6663800ed","observation_id":"618faa9c-7d08-47b9-95d7-9ac0d9b94422","resolution":{"observed_at":"2026-05-22T05:51:08.813261Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24689","last_updated":"2025-05-30T15:12:41Z","snapshot_observed_at":"2026-08-09T23:06:02.394151Z","submitted_at":"2025-05-30T15:12:41Z","title":"BPE Stays on SCRIPT: Structured Encoding for Robust Multilingual Pretokenization","version":1},"cited_work":{"arxiv_id":"2505.24689","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.24689","snapshot_observed_at":"2026-07-04T13:39:51.284729Z","title":"Tatsuki Kuribayashi, Ryo Ueda, Ryo Yoshida, Yohei Oseki, Ted Briscoe, and Timothy Baldwin","venue":null,"work_id":"ff289642-ef1d-4b56-ae94-d6f53a516ce0","year":2025},"citing_paper":{"arxiv_id":"2606.27019","last_updated":"2026-06-25T13:31:02Z","snapshot_observed_at":"2026-08-08T12:03:49.972169Z","submitted_at":"2026-06-25T13:31:02Z","title":"MinGram: A Minimalist Unigram Tokenizer with High Compression and Competitive Morphological Alignment","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-06-26T04:59:05.057552Z"},"links":{"cited_paper":"/paper/2505.24689","citing_paper":"/paper/2606.27019"},"observation_digest":"sha256:bf0b431ae95ed8d5d939180496e0716b90592c06dc643d03804144019d0b0151","observation_id":"f703090f-7e4b-4f8c-8fda-69f47db258d3","resolution":{"observed_at":"2026-07-04T13:39:51.286390Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.24689/citation-record","integrity":"/paper/2505.24689/integrity","json":"/paper/2505.24689/citation-record.json","paper":"/paper/2505.24689"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:35:33.979068Z","title":"wHy DoNt YoU jUsT uSe ThE lLaMa ToKeNiZeR?? Blog Post, 2024","venue":null,"work_id":"17d556fc-6f37-41ce-b64c-0d43f3605d07","year":2024},"citing_paper":{"arxiv_id":"2505.24689","last_updated":"2025-05-30T15:12:41Z","snapshot_observed_at":"2026-08-09T23:06:02.394151Z","submitted_at":"2025-05-30T15:12:41Z","title":"BPE Stays on SCRIPT: Structured Encoding for Robust Multilingual Pretokenization","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T12:35:30.862476Z"},"links":{"citing_paper":"/paper/2505.24689"},"observation_digest":"sha256:24900a64d641aac16598ae5366d79ceec12c0571e60a0049b62a6ceacaba6c2e","observation_id":"5be79990-594a-4478-8015-eac45e8ea966","resolution":{"observed_at":"2026-08-07T12:35:34.054036Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:35:33.827541Z","title":"A., and Bergen, B","venue":null,"work_id":"352a7ad9-bb03-4394-98b1-95f274734440","year":2024},"citing_paper":{"arxiv_id":"2505.24689","last_updated":"2025-05-30T15:12:41Z","snapshot_observed_at":"2026-08-09T23:06:02.394151Z","submitted_at":"2025-05-30T15:12:41Z","title":"BPE Stays on SCRIPT: Structured Encoding for Robust Multilingual Pretokenization","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T12:35:30.933039Z"},"links":{"citing_paper":"/paper/2505.24689"},"observation_digest":"sha256:6ea25eee6b560b69c107a59173b9cd744d7b4df4305242312efeeee8d5d92878","observation_id":"f773043d-85f6-4efb-99b4-ccc543d3f8e9","resolution":{"observed_at":"2026-08-07T12:35:33.913134Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.10441","last_updated":"2026-05-28T20:26:19Z","snapshot_observed_at":"2026-07-06T19:03:09.004554Z","submitted_at":"2024-08-19T22:31:21Z","title":"Goldfish: Monolingual Language Models for 350 Languages","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.10441","snapshot_observed_at":"2026-08-07T12:35:31.015765Z","title":"A., Arnett, C., Tu, Z., and Bergen, B","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24689","last_updated":"2025-05-30T15:12:41Z","snapshot_observed_at":"2026-08-09T23:06:02.394151Z","submitted_at":"2025-05-30T15:12:41Z","title":"BPE Stays on SCRIPT: Structured Encoding for Robust Multilingual Pretokenization","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T12:35:31.015765Z"},"links":{"cited_paper":"/paper/2408.10441","citing_paper":"/paper/2505.24689"},"observation_digest":"sha256:e63821e15b4628fc144aa067dedb1a95ebec36e673b05dbcb1e7d3d8bd0d19af","observation_id":"5565fcc0-4489-454f-a936-9bacc3db0cd8","resolution":{"observed_at":"2026-08-07T12:35:31.015765Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:35:33.652629Z","title":"Getting the most out of your tokenizer for pre-training and domain adaptation","venue":null,"work_id":"8c71c05e-1709-4b9a-9f99-ce8517b2aa1d","year":2024},"citing_paper":{"arxiv_id":"2505.24689","last_updated":"2025-05-30T15:12:41Z","snapshot_observed_at":"2026-08-09T23:06:02.394151Z","submitted_at":"2025-05-30T15:12:41Z","title":"BPE Stays on SCRIPT: Structured Encoding for Robust Multilingual Pretokenization","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T12:35:31.103587Z"},"links":{"citing_paper":"/paper/2505.24689"},"observation_digest":"sha256:40c0988aca991f4ea8fda902baecda89dfc20238e8913d02b0f74eea534378db","observation_id":"b38b5f1a-a44d-4e1d-8741-cdcee7495e3c","resolution":{"observed_at":"2026-08-07T12:35:33.746255Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:35:31.176037Z","title":"and Richardson, J","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.24689","last_updated":"2025-05-30T15:12:41Z","snapshot_observed_at":"2026-08-09T23:06:02.394151Z","submitted_at":"2025-05-30T15:12:41Z","title":"BPE Stays on SCRIPT: Structured Encoding for Robust Multilingual Pretokenization","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T12:35:31.176037Z"},"links":{"citing_paper":"/paper/2505.24689"},"observation_digest":"sha256:39ac10838415ecb80c8b6400473e42607bec6bcaad1fd7f87d12e6e1f24ae1b7","observation_id":"347ba6a1-3b47-4d95-9413-fdd8b9dbe24b","resolution":{"observed_at":"2026-08-07T12:35:31.176037Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:35:33.488711Z","title":"Pre-tokenization on punctuation in GPT-4","venue":null,"work_id":"2c03c41f-5893-4e2b-a3f5-16dbdd11cb5e","year":2024},"citing_paper":{"arxiv_id":"2505.24689","last_updated":"2025-05-30T15:12:41Z","snapshot_observed_at":"2026-08-09T23:06:02.394151Z","submitted_at":"2025-05-30T15:12:41Z","title":"BPE Stays on SCRIPT: Structured Encoding for Robust Multilingual Pretokenization","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T12:35:31.252667Z"},"links":{"citing_paper":"/paper/2505.24689"},"observation_digest":"sha256:e0a65fcdfeeaa55b825d8f8b9bb7cf1e9c588c93e878ee9c17e52ee7097180e7","observation_id":"ffdf01f4-2f88-4f96-812a-2f9fc00b3dfc","resolution":{"observed_at":"2026-08-07T12:35:33.549888Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:35:31.346827Z","title":"and Bartolo, M","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24689","last_updated":"2025-05-30T15:12:41Z","snapshot_observed_at":"2026-08-09T23:06:02.394151Z","submitted_at":"2025-05-30T15:12:41Z","title":"BPE Stays on SCRIPT: Structured Encoding for Robust Multilingual Pretokenization","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T12:35:31.346827Z"},"links":{"citing_paper":"/paper/2505.24689"},"observation_digest":"sha256:9d4520c27ce626c655622693d1ae7d8781bf73bf72a42632f31bcf06900ce69e","observation_id":"695861cb-3e5c-40d0-be88-d0be71ce415f","resolution":{"observed_at":"2026-08-07T12:35:31.346827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:35:33.369145Z","title":"Jamo-level subword tokenization in low-resource K orean machine translation","venue":null,"work_id":"ceedea87-1fd1-4255-a259-8da64a3dda74","year":2025},"citing_paper":{"arxiv_id":"2505.24689","last_updated":"2025-05-30T15:12:41Z","snapshot_observed_at":"2026-08-09T23:06:02.394151Z","submitted_at":"2025-05-30T15:12:41Z","title":"BPE Stays on SCRIPT: Structured Encoding for Robust Multilingual Pretokenization","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T12:35:31.416495Z"},"links":{"citing_paper":"/paper/2505.24689"},"observation_digest":"sha256:901735a810805a622cd9514635967ae9a561c1978a54ed932747b35dbc0177e2","observation_id":"86811bd3-5338-4fc9-8c91-85a671863659","resolution":{"observed_at":"2026-08-07T12:35:33.424934Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:35:31.489268Z","title":"MYTE : Morphology-driven byte encoding for better and fairer multilingual language modeling","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24689","last_updated":"2025-05-30T15:12:41Z","snapshot_observed_at":"2026-08-09T23:06:02.394151Z","submitted_at":"2025-05-30T15:12:41Z","title":"BPE Stays on SCRIPT: Structured Encoding for Robust Multilingual Pretokenization","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T12:35:31.489268Z"},"links":{"citing_paper":"/paper/2505.24689"},"observation_digest":"sha256:af400a2070c56ab59c703fef1c2ab0f85c4ce0032a07acc3b786e9343cbf5d89","observation_id":"04a8363d-9535-4fe4-b6db-7d737cc6d8b8","resolution":{"observed_at":"2026-08-07T12:35:31.489268Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.13423","last_updated":"2025-08-26T18:43:00Z","snapshot_observed_at":"2026-08-09T19:39:35.500768Z","submitted_at":"2025-03-17T17:53:23Z","title":"SuperBPE: Space Travel for Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.13423","snapshot_observed_at":"2026-08-07T12:35:31.585952Z","title":"A., and Choi, Y","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24689","last_updated":"2025-05-30T15:12:41Z","snapshot_observed_at":"2026-08-09T23:06:02.394151Z","submitted_at":"2025-05-30T15:12:41Z","title":"BPE Stays on SCRIPT: Structured Encoding for Robust Multilingual Pretokenization","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T12:35:31.585952Z"},"links":{"cited_paper":"/paper/2503.13423","citing_paper":"/paper/2505.24689"},"observation_digest":"sha256:abd6be3c95e69a715125c960bfb40dac4c3d9e85593b36c546b8762ac01382a4","observation_id":"6acc0685-ed55-4527-9244-d5d224f8072a","resolution":{"observed_at":"2026-08-07T12:35:31.585952Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14201","last_updated":"2023-05-23T16:20:30Z","snapshot_observed_at":"2026-07-06T15:31:36.425535Z","submitted_at":"2023-05-23T16:20:30Z","title":"Goat: Fine-tuned LLaMA Outperforms GPT-4 on Arithmetic Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.14201","snapshot_observed_at":"2026-08-07T12:35:31.632279Z","title":"and Low, B","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24689","last_updated":"2025-05-30T15:12:41Z","snapshot_observed_at":"2026-08-09T23:06:02.394151Z","submitted_at":"2025-05-30T15:12:41Z","title":"BPE Stays on SCRIPT: Structured Encoding for Robust Multilingual Pretokenization","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T12:35:31.632279Z"},"links":{"cited_paper":"/paper/2305.14201","citing_paper":"/paper/2505.24689"},"observation_digest":"sha256:f40281fbec0e223278c7232924bcda103edb406933484caac68a6ea6001e85b4","observation_id":"35cf48fb-1851-44aa-8ba6-f35f1941364b","resolution":{"observed_at":"2026-08-07T12:35:31.632279Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.09400","last_updated":"2023-09-17T23:49:10Z","snapshot_observed_at":"2026-07-06T16:19:41.722419Z","submitted_at":"2023-09-17T23:49:10Z","title":"CulturaX: A Cleaned, Enormous, and Multilingual Dataset for Large Language Models in 167 Languages","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.09400","snapshot_observed_at":"2026-08-07T12:35:31.714800Z","title":"V., Lai, V","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24689","last_updated":"2025-05-30T15:12:41Z","snapshot_observed_at":"2026-08-09T23:06:02.394151Z","submitted_at":"2025-05-30T15:12:41Z","title":"BPE Stays on SCRIPT: Structured Encoding for Robust Multilingual Pretokenization","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T12:35:31.714800Z"},"links":{"cited_paper":"/paper/2309.09400","citing_paper":"/paper/2505.24689"},"observation_digest":"sha256:03c85e81164d387640e5c9d0bd94c162eea08a8ebd0f6af7fa281f335c83712c","observation_id":"8503dc19-4009-46da-8a76-2c49283237d5","resolution":{"observed_at":"2026-08-07T12:35:31.714800Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:35:33.195163Z","title":"tiktoken: a fast BPE tokeniser for use with OpenAI 's models., 2024","venue":null,"work_id":"33f87147-6812-4473-b15e-86d914b21311","year":2024},"citing_paper":{"arxiv_id":"2505.24689","last_updated":"2025-05-30T15:12:41Z","snapshot_observed_at":"2026-08-09T23:06:02.394151Z","submitted_at":"2025-05-30T15:12:41Z","title":"BPE Stays on SCRIPT: Structured Encoding for Robust Multilingual Pretokenization","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T12:35:31.793837Z"},"links":{"citing_paper":"/paper/2505.24689"},"observation_digest":"sha256:ac25c93fbba2caf9b676e8edfe9de7334f7e7118fb928a7cf0bf56bb633aa53c","observation_id":"a325186d-7afe-4afa-b405-9a59de9cc8b8","resolution":{"observed_at":"2026-08-07T12:35:33.296193Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:35:31.950493Z","title":"W., Reddy, V., Zhang, H., Alameddine, A., Uzan, O., Pinter, Y., and Tanner, C","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24689","last_updated":"2025-05-30T15:12:41Z","snapshot_observed_at":"2026-08-09T23:06:02.394151Z","submitted_at":"2025-05-30T15:12:41Z","title":"BPE Stays on SCRIPT: Structured Encoding for Robust Multilingual Pretokenization","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T12:35:31.950493Z"},"links":{"citing_paper":"/paper/2505.24689"},"observation_digest":"sha256:668dbed359285b72ceccf3537221234c89fefd1475826411d57e8efe82fe5efb","observation_id":"604f266a-a7ed-4c85-bebb-055b730458f7","resolution":{"observed_at":"2026-08-07T12:35:31.950493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:35:32.081870Z","title":"W., Reddy, V., Tanner, C., and Pinter, Y","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24689","last_updated":"2025-05-30T15:12:41Z","snapshot_observed_at":"2026-08-09T23:06:02.394151Z","submitted_at":"2025-05-30T15:12:41Z","title":"BPE Stays on SCRIPT: Structured Encoding for Robust Multilingual Pretokenization","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T12:35:32.081870Z"},"links":{"citing_paper":"/paper/2505.24689"},"observation_digest":"sha256:016a1c58f1318b18d77fd0c13de908f0bf171bd6408b21a62b55eb44bf33e671","observation_id":"eb6e5d96-f3b0-4391-9da3-508daa9aea51","resolution":{"observed_at":"2026-08-07T12:35:32.081870Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:35:32.199547Z","title":"Neural Machine Translation of Rare Words with Subword Units","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.24689","last_updated":"2025-05-30T15:12:41Z","snapshot_observed_at":"2026-08-09T23:06:02.394151Z","submitted_at":"2025-05-30T15:12:41Z","title":"BPE Stays on SCRIPT: Structured Encoding for Robust Multilingual Pretokenization","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T12:35:32.199547Z"},"links":{"citing_paper":"/paper/2505.24689"},"observation_digest":"sha256:2048da5ff49656f9fcdc72e6f8c40e84799fa9349f9e025b000e8e69cf9d1bfc","observation_id":"3579a6d8-e900-442e-a668-957d4445eaa4","resolution":{"observed_at":"2026-08-07T12:35:32.199547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14903","last_updated":"2024-02-22T18:14:09Z","snapshot_observed_at":"2026-08-10T14:44:14.983162Z","submitted_at":"2024-02-22T18:14:09Z","title":"Tokenization counts: the impact of tokenization on arithmetic in frontier LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14903","snapshot_observed_at":"2026-08-07T12:35:32.293186Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24689","last_updated":"2025-05-30T15:12:41Z","snapshot_observed_at":"2026-08-09T23:06:02.394151Z","submitted_at":"2025-05-30T15:12:41Z","title":"BPE Stays on SCRIPT: Structured Encoding for Robust Multilingual Pretokenization","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T12:35:32.293186Z"},"links":{"cited_paper":"/paper/2402.14903","citing_paper":"/paper/2505.24689"},"observation_digest":"sha256:7b11bfa2045857cda7f282cba1e2dc659b154b7bf1ee39b3cd9601cd89fba2b6","observation_id":"9cf2b8b7-b08a-427a-b738-aa698ae8fc7f","resolution":{"observed_at":"2026-08-07T12:35:32.293186Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:35:33.061518Z","title":"and Sarveswaran, K","venue":null,"work_id":"44015796-2956-4b0b-a0a3-58dd4174f556","year":2025},"citing_paper":{"arxiv_id":"2505.24689","last_updated":"2025-05-30T15:12:41Z","snapshot_observed_at":"2026-08-09T23:06:02.394151Z","submitted_at":"2025-05-30T15:12:41Z","title":"BPE Stays on SCRIPT: Structured Encoding for Robust Multilingual Pretokenization","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T12:35:32.385325Z"},"links":{"citing_paper":"/paper/2505.24689"},"observation_digest":"sha256:665e4045f02dfc36312e42091ae9143877dfe4ab787b294b64f93cf56039ab12","observation_id":"faeebed8-e5c5-43f3-b969-cfe30ae3249d","resolution":{"observed_at":"2026-08-07T12:35:33.100922Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.15343","last_updated":"2025-07-04T09:27:43Z","snapshot_observed_at":"2026-08-07T17:59:12.373358Z","submitted_at":"2025-02-21T09:58:54Z","title":"Tokenization is Sensitive to Language Variation","version":2},"cited_work":{"arxiv_id":"2502.15343","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.15343","snapshot_observed_at":"2026-08-07T12:35:32.643300Z","title":"Tokenization is Sensitive to Language Variation","venue":"cs.CL","work_id":"a93e90e6-c614-442b-acaf-c3bff5c4c065","year":2025},"citing_paper":{"arxiv_id":"2505.24689","last_updated":"2025-05-30T15:12:41Z","snapshot_observed_at":"2026-08-09T23:06:02.394151Z","submitted_at":"2025-05-30T15:12:41Z","title":"BPE Stays on SCRIPT: Structured Encoding for Robust Multilingual Pretokenization","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T12:35:32.474459Z"},"links":{"cited_paper":"/paper/2502.15343","citing_paper":"/paper/2505.24689"},"observation_digest":"sha256:5a552a04afcabd1a4ae4faecc688a39a9023926e88906fd9794fa1a06363ca96","observation_id":"e497e40d-f5e0-4bc2-891a-9938e1d9faf5","resolution":{"observed_at":"2026-08-07T12:35:32.734006Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.24689","last_updated":"2025-05-30T15:12:41Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-09T23:06:02.394151Z","submitted_at":"2025-05-30T15:12:41Z","title":"BPE Stays on SCRIPT: Structured Encoding for Robust Multilingual Pretokenization"},"reference_resolution":{"displayed":19,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":11,"verified_exact":1,"verified_fuzzy":7},"total_outbound_references":19},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 19 of 19 outbound references and 4 inbound Pith citation observations for arXiv:2505.24689."}