{"as_of":"2026-08-22T12:41:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:13603a2cbfdeaee6662071a04ac9d2617686cbb35b1604525a14e56ee45559a8","coverage":[{"denominator":23,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":23,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T13:58:58.597059Z","state":"measured"},{"denominator":25,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":25,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-22T06:32:14.747728+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T10:55:55.418419Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T00:49:19.438760Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.07057","last_updated":"2025-07-21T14:05:14Z","snapshot_observed_at":"2026-08-18T21:55:43.054844Z","submitted_at":"2025-02-10T21:47:49Z","title":"Tokenization Standards for Linguistic Integrity: Turkish as a Benchmark","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.07057","snapshot_observed_at":"2026-08-16T10:55:55.418419Z","title":"Tokenization standards for linguistic integrity: Turkish as a benchmark,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.16977","last_updated":"2025-04-23T17:28:38Z","snapshot_observed_at":"2026-08-18T21:46:11.534440Z","submitted_at":"2025-04-23T17:28:38Z","title":"Tokenization Matters: Improving Zero-Shot NER for Indic Languages","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-16T10:55:55.418419Z"},"links":{"cited_paper":"/paper/2502.07057","citing_paper":"/paper/2504.16977"},"observation_digest":"sha256:364edb4bae07308539b4c19e3b7aab34b1a9d7a20f359f336ac3025a59b4c6b4","observation_id":"a092e4ed-44e1-46e1-b0ae-cb18ff71aaa6","resolution":{"observed_at":"2026-08-16T10:55:55.418419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.07057","last_updated":"2025-07-21T14:05:14Z","snapshot_observed_at":"2026-08-18T21:55:43.054844Z","submitted_at":"2025-02-10T21:47:49Z","title":"Tokenization Standards for Linguistic Integrity: Turkish as a Benchmark","version":2},"cited_work":{"arxiv_id":"2502.07057","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.07057","snapshot_observed_at":"2026-07-04T00:49:19.438760Z","title":"Ali Bayram, Ali Arda Fincan, Ahmet Semih G \\\"u m \\\"u s , Sercan Karaka s , Banu Diri, and Sava s Y ld r m","venue":null,"work_id":"a4ded22f-a474-4a52-bac4-ca17254eddba","year":null},"citing_paper":{"arxiv_id":"2606.18717","last_updated":"2026-06-17T05:55:50Z","snapshot_observed_at":"2026-08-18T21:56:17.615504Z","submitted_at":"2026-06-17T05:55:50Z","title":"Morpheus: A Morphology-Aware Neural Tokenizer and Word Embedder for Turkish","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-06-26T20:53:57.646472Z"},"links":{"cited_paper":"/paper/2502.07057","citing_paper":"/paper/2606.18717"},"observation_digest":"sha256:24b905542d20a3e9c9dd9c22dd91122b47483e93a22f92262b825bd287d8efc0","observation_id":"9c59362a-d240-4fc7-96b8-55705f8931c1","resolution":{"observed_at":"2026-07-04T00:49:19.441232Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2502.07057/citation-record","integrity":"/paper/2502.07057/integrity","json":"/paper/2502.07057/citation-record.json","paper":"/paper/2502.07057"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:58:58.888343Z","title":"Tokenization Is More Than Compression","venue":null,"work_id":"e7ead1b0-4e23-43eb-9714-34b41642e171","year":2024},"citing_paper":{"arxiv_id":"2502.07057","last_updated":"2025-07-21T14:05:14Z","snapshot_observed_at":"2026-08-18T21:55:43.054844Z","submitted_at":"2025-02-10T21:47:49Z","title":"Tokenization Standards for Linguistic Integrity: Turkish as a Benchmark","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-08T13:58:58.514018Z"},"links":{"citing_paper":"/paper/2502.07057"},"observation_digest":"sha256:dd643328fad6cef4aade0c85b0df6eb7aeb1e3b424a4e2ebf66ab0c4ef48afd7","observation_id":"e8435d93-5282-4c6e-976b-0d38f7f10bbc","resolution":{"observed_at":"2026-08-08T13:58:58.892514Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:58:58.876977Z","title":null,"venue":null,"work_id":"a03a50f7-3c96-402e-adfc-5167bfea8a8f","year":2019},"citing_paper":{"arxiv_id":"2502.07057","last_updated":"2025-07-21T14:05:14Z","snapshot_observed_at":"2026-08-18T21:55:43.054844Z","submitted_at":"2025-02-10T21:47:49Z","title":"Tokenization Standards for Linguistic Integrity: Turkish as a Benchmark","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-08T13:58:58.518772Z"},"links":{"citing_paper":"/paper/2502.07057"},"observation_digest":"sha256:35bf5c8039d3837a32b1aa97b21f20e2ff76ebf7620c8a76f9e0b011f0f53dc5","observation_id":"d374156d-3e5b-47e0-86a6-10cce3c7338e","resolution":{"observed_at":"2026-08-08T13:58:58.881244Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:58:58.865034Z","title":"How do different tokenizers perform on downstream tasks in scriptio continua languages?: A case study in japanese","venue":null,"work_id":"e9daa43f-f867-4b1d-8c7a-87c85b0cf273","year":2023},"citing_paper":{"arxiv_id":"2502.07057","last_updated":"2025-07-21T14:05:14Z","snapshot_observed_at":"2026-08-18T21:55:43.054844Z","submitted_at":"2025-02-10T21:47:49Z","title":"Tokenization Standards for Linguistic Integrity: Turkish as a Benchmark","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-08T13:58:58.522901Z"},"links":{"citing_paper":"/paper/2502.07057"},"observation_digest":"sha256:54628676ea30ef7ed8549d9f138317107f2221d5d33ecd3d16a1503789cc4f83","observation_id":"ddbab64a-6d8f-43eb-bb42-51dfb39d4943","resolution":{"observed_at":"2026-08-08T13:58:58.869782Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:58:58.853862Z","title":"Critical tokenization and its properties","venue":null,"work_id":"c25c83dd-4e53-4d86-a960-3c4648e0f809","year":1997},"citing_paper":{"arxiv_id":"2502.07057","last_updated":"2025-07-21T14:05:14Z","snapshot_observed_at":"2026-08-18T21:55:43.054844Z","submitted_at":"2025-02-10T21:47:49Z","title":"Tokenization Standards for Linguistic Integrity: Turkish as a Benchmark","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-08T13:58:58.526306Z"},"links":{"citing_paper":"/paper/2502.07057"},"observation_digest":"sha256:aeb9979cc38d04cd34c01efcfdc6bcf09342e42b0ba82bd03c558cdb05033ad2","observation_id":"4da0aa48-8e4f-490b-9630-431a09e54865","resolution":{"observed_at":"2026-08-08T13:58:58.857711Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1808.06226","last_updated":"2018-08-19T16:49:06Z","snapshot_observed_at":"2026-07-06T06:56:20.935388Z","submitted_at":"2018-08-19T16:49:06Z","title":"SentencePiece: A simple and language independent subword tokenizer and detokenizer for Neural Text Processing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1808.06226","snapshot_observed_at":"2026-08-08T13:58:58.530907Z","title":"SentencePiece: A simple and language independent subword tokenizer and detokenizer for Neural Text Processing, August 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.07057","last_updated":"2025-07-21T14:05:14Z","snapshot_observed_at":"2026-08-18T21:55:43.054844Z","submitted_at":"2025-02-10T21:47:49Z","title":"Tokenization Standards for Linguistic Integrity: Turkish as a Benchmark","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-08T13:58:58.530907Z"},"links":{"cited_paper":"/paper/1808.06226","citing_paper":"/paper/2502.07057"},"observation_digest":"sha256:3895b909567b860927bed8aa18ee476865dcc0fbefa7ec4893047118411f81bb","observation_id":"5f10b29d-b30a-42b0-bc2f-ae8cdf34b639","resolution":{"observed_at":"2026-08-08T13:58:58.530907Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12345","last_updated":"2023-01-29T03:59:33Z","snapshot_observed_at":"2026-08-21T12:39:08.856054Z","submitted_at":"2023-01-29T03:59:33Z","title":"Chemotactic motility-induced phase separation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.12345","snapshot_observed_at":"2026-08-08T13:58:58.535300Z","title":"Formal properties of tokenization in neural language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.07057","last_updated":"2025-07-21T14:05:14Z","snapshot_observed_at":"2026-08-18T21:55:43.054844Z","submitted_at":"2025-02-10T21:47:49Z","title":"Tokenization Standards for Linguistic Integrity: Turkish as a Benchmark","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-08T13:58:58.535300Z"},"links":{"cited_paper":"/paper/2301.12345","citing_paper":"/paper/2502.07057"},"observation_digest":"sha256:009e3d7f2585e457674ee912990fa6d8d56d495bc8453c6516c3b9d3ca457e6d","observation_id":"5926943e-bc6e-4ab8-afe4-06ef4863c5d4","resolution":{"observed_at":"2026-08-08T13:58:58.535300Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.08715","last_updated":"2023-09-15T19:10:42Z","snapshot_observed_at":"2026-08-21T23:05:34.421704Z","submitted_at":"2023-09-15T19:10:42Z","title":"Formalizing BPE Tokenization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.08715","snapshot_observed_at":"2026-08-08T13:58:58.539958Z","title":"Formalizing BPE Tokenization","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.07057","last_updated":"2025-07-21T14:05:14Z","snapshot_observed_at":"2026-08-18T21:55:43.054844Z","submitted_at":"2025-02-10T21:47:49Z","title":"Tokenization Standards for Linguistic Integrity: Turkish as a Benchmark","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-08T13:58:58.539958Z"},"links":{"cited_paper":"/paper/2309.08715","citing_paper":"/paper/2502.07057"},"observation_digest":"sha256:278aee2f1787179400c5416dedda41fec220f71ead565fa487da4e8e86f73fd0","observation_id":"2f903b61-5838-4090-a979-bd945a6b9c11","resolution":{"observed_at":"2026-08-08T13:58:58.539958Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:58:58.841882Z","title":"The Technical User’s Introduction to LLM Tokenization","venue":null,"work_id":"f620ff8b-8a26-4f7f-8b9e-318bdc0fc594","year":null},"citing_paper":{"arxiv_id":"2502.07057","last_updated":"2025-07-21T14:05:14Z","snapshot_observed_at":"2026-08-18T21:55:43.054844Z","submitted_at":"2025-02-10T21:47:49Z","title":"Tokenization Standards for Linguistic Integrity: Turkish as a Benchmark","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-08T13:58:58.544214Z"},"links":{"citing_paper":"/paper/2502.07057"},"observation_digest":"sha256:9f7617b9d61ebcfee25b001fab4ba7e91183ba29bb9ad9ec81a0c352b0cc4423","observation_id":"af1abc08-fbc1-4fbf-aa29-71647036cd41","resolution":{"observed_at":"2026-08-08T13:58:58.846367Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:58:58.830631Z","title":"A New Algorithm for Data Compression, 1994","venue":null,"work_id":"bad30c38-9c61-4642-90c2-c85e22a154f3","year":1994},"citing_paper":{"arxiv_id":"2502.07057","last_updated":"2025-07-21T14:05:14Z","snapshot_observed_at":"2026-08-18T21:55:43.054844Z","submitted_at":"2025-02-10T21:47:49Z","title":"Tokenization Standards for Linguistic Integrity: Turkish as a Benchmark","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-08T13:58:58.548336Z"},"links":{"citing_paper":"/paper/2502.07057"},"observation_digest":"sha256:6808d38956ba73da4e3c8973a7c7a2316b87579e8631951ccffbb42d3c8b5b39","observation_id":"3335b46e-21c7-45a8-9e96-c7d68c67edff","resolution":{"observed_at":"2026-08-08T13:58:58.834784Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:58:58.818292Z","title":"github.com/riotu-lab/aranizer, December 2024","venue":null,"work_id":"aa6a1b10-04b0-4613-8c5a-ce812b8fe19a","year":2024},"citing_paper":{"arxiv_id":"2502.07057","last_updated":"2025-07-21T14:05:14Z","snapshot_observed_at":"2026-08-18T21:55:43.054844Z","submitted_at":"2025-02-10T21:47:49Z","title":"Tokenization Standards for Linguistic Integrity: Turkish as a Benchmark","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-08T13:58:58.551338Z"},"links":{"citing_paper":"/paper/2502.07057"},"observation_digest":"sha256:356b57ad8d0515f3b5ca13f78fe1caa6d2602f27153eba2202b91cb67ae6ad79","observation_id":"4a6da132-4bf4-4a48-881b-c155a60e938c","resolution":{"observed_at":"2026-08-08T13:58:58.822901Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:58:58.806396Z","title":"So many tokens, so little time: Introducing a faster, more flexible byte-pair tokenizer, December 2024","venue":null,"work_id":"747b6076-810d-4017-ad41-f73417516267","year":2024},"citing_paper":{"arxiv_id":"2502.07057","last_updated":"2025-07-21T14:05:14Z","snapshot_observed_at":"2026-08-18T21:55:43.054844Z","submitted_at":"2025-02-10T21:47:49Z","title":"Tokenization Standards for Linguistic Integrity: Turkish as a Benchmark","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-08T13:58:58.554589Z"},"links":{"citing_paper":"/paper/2502.07057"},"observation_digest":"sha256:17dd495e42247bf8cb2d997b123a829e30b0f0bc118e2b5724bca1d4c0c99a91","observation_id":"06daf0fe-fe4f-4285-82de-016854153ab7","resolution":{"observed_at":"2026-08-08T13:58:58.810188Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:58:58.789831Z","title":"Arabic Tokenizers Leaderboard - a Hugging Face Space by MohamedRashad","venue":null,"work_id":"1c5afc08-846b-4c09-af85-ff5b750bcf8a","year":null},"citing_paper":{"arxiv_id":"2502.07057","last_updated":"2025-07-21T14:05:14Z","snapshot_observed_at":"2026-08-18T21:55:43.054844Z","submitted_at":"2025-02-10T21:47:49Z","title":"Tokenization Standards for Linguistic Integrity: Turkish as a Benchmark","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-08T13:58:58.558056Z"},"links":{"citing_paper":"/paper/2502.07057"},"observation_digest":"sha256:09701e637d89a0dd6a63b759fafd3bd23616402137d15ce29c0bb33a275564d7","observation_id":"1e9a9452-5499-4bf5-905d-83e47c234d98","resolution":{"observed_at":"2026-08-08T13:58:58.793754Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:58:58.776940Z","title":"NbAiLab/tokenizer-benchmark, November 2024","venue":null,"work_id":"c06115ea-cacd-483a-9eab-cedbe7b71b6f","year":2024},"citing_paper":{"arxiv_id":"2502.07057","last_updated":"2025-07-21T14:05:14Z","snapshot_observed_at":"2026-08-18T21:55:43.054844Z","submitted_at":"2025-02-10T21:47:49Z","title":"Tokenization Standards for Linguistic Integrity: Turkish as a Benchmark","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-08T13:58:58.561881Z"},"links":{"citing_paper":"/paper/2502.07057"},"observation_digest":"sha256:e37dc20d9c95bc64647f79ef2a223bcc3d02bafc2fe71c8af122bf5b20a5eb19","observation_id":"fb2149e2-4a93-417c-994c-ca0684d2ef07","resolution":{"observed_at":"2026-08-08T13:58:58.782283Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:58:58.763683Z","title":"Tokenizing on scale.Preprocessing large text corpora on the lexical and sentence level","venue":null,"work_id":"ce9ebe10-b386-49ba-a714-6c65d03b7023","year":2022},"citing_paper":{"arxiv_id":"2502.07057","last_updated":"2025-07-21T14:05:14Z","snapshot_observed_at":"2026-08-18T21:55:43.054844Z","submitted_at":"2025-02-10T21:47:49Z","title":"Tokenization Standards for Linguistic Integrity: Turkish as a Benchmark","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-08T13:58:58.565542Z"},"links":{"citing_paper":"/paper/2502.07057"},"observation_digest":"sha256:7d0d7a842abd3242c52bc6ac4c57c8e929702ff48eeb92d814ab20e0a8062ab6","observation_id":"099c238d-30de-48db-8698-9fb6448049b4","resolution":{"observed_at":"2026-08-08T13:58:58.768447Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:58:58.750791Z","title":"Analysis of Subword Tokenization Approaches for Turkish Language","venue":null,"work_id":"e646a24c-5c07-4c4e-aa62-14be70f08e8e","year":2023},"citing_paper":{"arxiv_id":"2502.07057","last_updated":"2025-07-21T14:05:14Z","snapshot_observed_at":"2026-08-18T21:55:43.054844Z","submitted_at":"2025-02-10T21:47:49Z","title":"Tokenization Standards for Linguistic Integrity: Turkish as a Benchmark","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-08T13:58:58.568407Z"},"links":{"citing_paper":"/paper/2502.07057"},"observation_digest":"sha256:0e7c6b87cce13533a689100ff24ce17cdbc12801f09302c470e981ca949da0f1","observation_id":"128c76ba-c58e-4c16-bb51-c43d74aab12c","resolution":{"observed_at":"2026-08-08T13:58:58.754936Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.16235","last_updated":"2024-09-24T16:51:36Z","snapshot_observed_at":"2026-08-18T21:53:43.143439Z","submitted_at":"2024-09-24T16:51:36Z","title":"EuroLLM: Multilingual Language Models for Europe","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.16235","snapshot_observed_at":"2026-08-08T13:58:58.571329Z","title":"Guerreiro, Ricardo Rei, Duarte M","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.07057","last_updated":"2025-07-21T14:05:14Z","snapshot_observed_at":"2026-08-18T21:55:43.054844Z","submitted_at":"2025-02-10T21:47:49Z","title":"Tokenization Standards for Linguistic Integrity: Turkish as a Benchmark","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-08T13:58:58.571329Z"},"links":{"cited_paper":"/paper/2409.16235","citing_paper":"/paper/2502.07057"},"observation_digest":"sha256:d1dc184b3a0af52cfa7fe287159a767c431eda3c66c3b4ae84490d4d8984b225","observation_id":"89aab7e3-7877-4b3d-9daf-13b67e6a345f","resolution":{"observed_at":"2026-08-08T13:58:58.571329Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:58:58.738180Z","title":"How Good is Your Tokenizer? On the Monolingual Performance of Multilingual Language Models, June","venue":null,"work_id":"435c22cc-8366-42d3-bf5f-0813ec134d5e","year":null},"citing_paper":{"arxiv_id":"2502.07057","last_updated":"2025-07-21T14:05:14Z","snapshot_observed_at":"2026-08-18T21:55:43.054844Z","submitted_at":"2025-02-10T21:47:49Z","title":"Tokenization Standards for Linguistic Integrity: Turkish as a Benchmark","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-08T13:58:58.575667Z"},"links":{"citing_paper":"/paper/2502.07057"},"observation_digest":"sha256:90b0fe074910975f198ab1963a1d7deb248ccbbbb6f71e7477db6b2e9f728024","observation_id":"2a8a8885-e358-415a-b3dd-2f010c29951e","resolution":{"observed_at":"2026-08-08T13:58:58.742478Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:58:58.726392Z","title":"Not All Tokens Are What You Need for Pretraining","venue":null,"work_id":"8b4c0934-e5ea-4fdb-9575-47456548a930","year":null},"citing_paper":{"arxiv_id":"2502.07057","last_updated":"2025-07-21T14:05:14Z","snapshot_observed_at":"2026-08-18T21:55:43.054844Z","submitted_at":"2025-02-10T21:47:49Z","title":"Tokenization Standards for Linguistic Integrity: Turkish as a Benchmark","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-08T13:58:58.583279Z"},"links":{"citing_paper":"/paper/2502.07057"},"observation_digest":"sha256:0e6e7da278b0beb4ef391f588cd3cdb9c7f332ce7817b511fdbda05841d8cf5e","observation_id":"da76be89-48bc-459d-93d1-f78fcf1932b6","resolution":{"observed_at":"2026-08-08T13:58:58.730830Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00593","last_updated":"2025-01-04T20:42:33Z","snapshot_observed_at":"2026-08-10T22:44:49.784357Z","submitted_at":"2024-12-31T18:43:49Z","title":"Setting Standards in Turkish NLP: TR-MMLU for Large Language Model Evaluation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.00593","snapshot_observed_at":"2026-08-08T13:58:58.586474Z","title":"Ali Bayram, Ali Arda Fincan, Ahmet Semih Gümü¸ s, Banu Diri, Sava¸ s Yıldırım, and Öner Ayta¸ s","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2502.07057","last_updated":"2025-07-21T14:05:14Z","snapshot_observed_at":"2026-08-18T21:55:43.054844Z","submitted_at":"2025-02-10T21:47:49Z","title":"Tokenization Standards for Linguistic Integrity: Turkish as a Benchmark","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-08T13:58:58.586474Z"},"links":{"cited_paper":"/paper/2501.00593","citing_paper":"/paper/2502.07057"},"observation_digest":"sha256:65f6efbe1bbb9f60cff37b624c19c27b486717d59b1eea6a091189e16242cf81","observation_id":"2cfa602c-f3d2-4591-929f-7b3963a6b6ef","resolution":{"observed_at":"2026-08-08T13:58:58.586474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:58:58.714273Z","title":"ITU Turkish NLP Web Service","venue":null,"work_id":"43c02d3b-c97b-41bf-9955-1a5ae9d751e9","year":2014},"citing_paper":{"arxiv_id":"2502.07057","last_updated":"2025-07-21T14:05:14Z","snapshot_observed_at":"2026-08-18T21:55:43.054844Z","submitted_at":"2025-02-10T21:47:49Z","title":"Tokenization Standards for Linguistic Integrity: Turkish as a Benchmark","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-08T13:58:58.590224Z"},"links":{"citing_paper":"/paper/2502.07057"},"observation_digest":"sha256:d6902eb0502cf5cbe82b4af6ba7692693f97b80325af5f35a2ee1ea952faa4dd","observation_id":"a9daa4db-dbf0-47ca-b0c4-818c15cd2366","resolution":{"observed_at":"2026-08-08T13:58:58.718416Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:58:58.702028Z","title":"ahmetax/kalbur, October 2024","venue":null,"work_id":"6473d38d-9722-4ada-a345-2c4f906a3691","year":2024},"citing_paper":{"arxiv_id":"2502.07057","last_updated":"2025-07-21T14:05:14Z","snapshot_observed_at":"2026-08-18T21:55:43.054844Z","submitted_at":"2025-02-10T21:47:49Z","title":"Tokenization Standards for Linguistic Integrity: Turkish as a Benchmark","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-08T13:58:58.593375Z"},"links":{"citing_paper":"/paper/2502.07057"},"observation_digest":"sha256:b151965078718deb83cc139b9982a0a9672f9d62ac77feb07148d133c4916823","observation_id":"617aa5f9-e6b1-4558-b0ff-741e6ce74e0b","resolution":{"observed_at":"2026-08-08T13:58:58.706260Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:58:58.689652Z","title":"Ali Bayram","venue":null,"work_id":"e474d0c7-4b48-49ff-a025-b90e382342e5","year":2024},"citing_paper":{"arxiv_id":"2502.07057","last_updated":"2025-07-21T14:05:14Z","snapshot_observed_at":"2026-08-18T21:55:43.054844Z","submitted_at":"2025-02-10T21:47:49Z","title":"Tokenization Standards for Linguistic Integrity: Turkish as a Benchmark","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-08T13:58:58.597059Z"},"links":{"citing_paper":"/paper/2502.07057"},"observation_digest":"sha256:867a0a5f421b2802c21bcdc1e10fe55c0535212f9fee1de41896b8a6bc0d66fc","observation_id":"10db0fcf-e5b1-4566-a060-6c33370a1828","resolution":{"observed_at":"2026-08-08T13:58:58.694284Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2012.15613","last_updated":"2021-06-01T18:17:59Z","snapshot_observed_at":"2026-08-20T15:53:07.887528Z","submitted_at":"2020-12-31T14:11:00Z","title":"How Good is Your Tokenizer? On the Monolingual Performance of Multilingual Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2012.15613","snapshot_observed_at":"2026-08-08T13:58:58.579433Z","title":null,"venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2502.07057","last_updated":"2025-07-21T14:05:14Z","snapshot_observed_at":"2026-08-18T21:55:43.054844Z","submitted_at":"2025-02-10T21:47:49Z","title":"Tokenization Standards for Linguistic Integrity: Turkish as a Benchmark","version":2},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-08T13:58:58.579433Z"},"links":{"cited_paper":"/paper/2012.15613","citing_paper":"/paper/2502.07057"},"observation_digest":"sha256:2a91efc9a1405c7174700e68f44f57e6b397012dfd8b6348bafcc36231e57880","observation_id":"87669eec-12e7-4ce2-b555-855d4fbc350a","resolution":{"observed_at":"2026-08-08T13:58:58.579433Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2502.07057","last_updated":"2025-07-21T14:05:14Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-18T21:55:43.054844Z","submitted_at":"2025-02-10T21:47:49Z","title":"Tokenization Standards for Linguistic Integrity: Turkish as a Benchmark"},"reference_resolution":{"displayed":23,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":7,"verified_exact":0,"verified_fuzzy":16},"total_outbound_references":23},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"thesis":"As of 22 August 2026, this Paper Citation Record lists 23 of 23 outbound references and 2 inbound Pith citation observations for arXiv:2502.07057."}