{"as_of":"2026-08-13T04:51:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:48c05126ce629e455331dcf65620f3b8e617bd9d97c11430886e0943483cfd4c","coverage":[{"denominator":32,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":32,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T18:35:44.562542Z","state":"measured"},{"denominator":32,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":32,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.07824/citation-record","integrity":"/paper/2507.07824/integrity","json":"/paper/2507.07824/citation-record.json","paper":"/paper/2507.07824"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:35:44.414116Z","title":"Do all languages cost the same? tokenization in the era of commercial language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.07824","last_updated":"2025-07-10T14:53:59Z","snapshot_observed_at":"2026-08-08T14:59:14.998398Z","submitted_at":"2025-07-10T14:53:59Z","title":"Conditional Unigram Tokenization with Parallel Data","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-06T18:35:44.414116Z"},"links":{"citing_paper":"/paper/2507.07824"},"observation_digest":"sha256:b559408daf78c7ac9e2fd40542428aafa2a717b3208d4a8a8b88828d46cc0417","observation_id":"77f33ca5-ac96-401e-bcd2-7dc775b95995","resolution":{"observed_at":"2026-08-06T18:35:44.414116Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:35:44.419221Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.07824","last_updated":"2025-07-10T14:53:59Z","snapshot_observed_at":"2026-08-08T14:59:14.998398Z","submitted_at":"2025-07-10T14:53:59Z","title":"Conditional Unigram Tokenization with Parallel Data","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-06T18:35:44.419221Z"},"links":{"citing_paper":"/paper/2507.07824"},"observation_digest":"sha256:3b3a7a6e5386b94b5f14db669ca6e91b478583e2317bf7801284ba7ac5a5e4aa","observation_id":"c0ec52fd-c846-4712-a59d-ba7485d6131d","resolution":{"observed_at":"2026-08-06T18:35:44.419221Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:35:45.082197Z","title":"F., Della-Pietra, S","venue":null,"work_id":"f535efa3-7fd6-40b6-a88f-934697cb7a5c","year":1993},"citing_paper":{"arxiv_id":"2507.07824","last_updated":"2025-07-10T14:53:59Z","snapshot_observed_at":"2026-08-08T14:59:14.998398Z","submitted_at":"2025-07-10T14:53:59Z","title":"Conditional Unigram Tokenization with Parallel Data","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-06T18:35:44.424228Z"},"links":{"citing_paper":"/paper/2507.07824"},"observation_digest":"sha256:3bd466ad8bd312e5f815027973d11c58f5cec7a87d62e70b9545758833de641d","observation_id":"c245d5f8-f3c1-4ebf-9d18-c209eee0b1f3","resolution":{"observed_at":"2026-08-06T18:35:45.086897Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:35:45.065829Z","title":"and Gildea, D","venue":null,"work_id":"107e0603-00f0-4e3e-bd7e-726e970cf1c2","year":2009},"citing_paper":{"arxiv_id":"2507.07824","last_updated":"2025-07-10T14:53:59Z","snapshot_observed_at":"2026-08-08T14:59:14.998398Z","submitted_at":"2025-07-10T14:53:59Z","title":"Conditional Unigram Tokenization with Parallel Data","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-06T18:35:44.428765Z"},"links":{"citing_paper":"/paper/2507.07824"},"observation_digest":"sha256:1cdec79a77553ed604b4ab5e0bf6b44fc307dd86348ea0b1da9b1a9415e1a071","observation_id":"214d5a65-0d0a-422e-9db2-5db2ca7ec439","resolution":{"observed_at":"2026-08-06T18:35:45.070376Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2020.coling-main.378","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":"Bilingual subword segmentation for neural machine translation","venue":null,"work_id":"ceb95f74-8f14-44e6-bc76-9f6a91c9ae38","year":2020},"citing_paper":{"arxiv_id":"2507.07824","last_updated":"2025-07-10T14:53:59Z","snapshot_observed_at":"2026-08-08T14:59:14.998398Z","submitted_at":"2025-07-10T14:53:59Z","title":"Conditional Unigram Tokenization with Parallel Data","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-06T18:35:44.433757Z"},"links":{"citing_paper":"/paper/2507.07824"},"observation_digest":"sha256:70f2bcf3cb56d611cda8ff6ae9f2d523f087d7cd0c6facb0d2925538e3b6aab8","observation_id":"1d9f4ebb-be58-4a70-9ca1-ec0eebed4b2a","resolution":{"observed_at":"2026-08-06T18:35:44.741472Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:35:45.048500Z","title":"and Neubig, G","venue":null,"work_id":"4a7ade0b-7031-4f03-a5ed-5cb7ccf3182a","year":2021},"citing_paper":{"arxiv_id":"2507.07824","last_updated":"2025-07-10T14:53:59Z","snapshot_observed_at":"2026-08-08T14:59:14.998398Z","submitted_at":"2025-07-10T14:53:59Z","title":"Conditional Unigram Tokenization with Parallel Data","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-06T18:35:44.439497Z"},"links":{"citing_paper":"/paper/2507.07824"},"observation_digest":"sha256:520a0c4a780e7f3cf352db6661a30db657ffe1618c8531c413256f6b7a81a0b3","observation_id":"dcf4f5e6-da66-4b00-b4a9-83dd15f92d57","resolution":{"observed_at":"2026-08-06T18:35:45.053862Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:35:45.033737Z","title":null,"venue":null,"work_id":"a5f24eda-284a-4fd9-8178-7fa051c6a976","year":2013},"citing_paper":{"arxiv_id":"2507.07824","last_updated":"2025-07-10T14:53:59Z","snapshot_observed_at":"2026-08-08T14:59:14.998398Z","submitted_at":"2025-07-10T14:53:59Z","title":"Conditional Unigram Tokenization with Parallel Data","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-06T18:35:44.444591Z"},"links":{"citing_paper":"/paper/2507.07824"},"observation_digest":"sha256:ab63545e1b5a597804388bc3bb13d4b4c83a140ecd3e809153f0df583a4c6862","observation_id":"404e8589-a896-4f62-9b0b-2032ad944587","resolution":{"observed_at":"2026-08-06T18:35:45.038191Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:35:45.018151Z","title":"Beyond literal token overlap: Token alignability for multilinguality","venue":null,"work_id":"6468f1a2-8f48-4690-87a9-8b11b40596df","year":2025},"citing_paper":{"arxiv_id":"2507.07824","last_updated":"2025-07-10T14:53:59Z","snapshot_observed_at":"2026-08-08T14:59:14.998398Z","submitted_at":"2025-07-10T14:53:59Z","title":"Conditional Unigram Tokenization with Parallel Data","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-06T18:35:44.448841Z"},"links":{"citing_paper":"/paper/2507.07824"},"observation_digest":"sha256:593063549dc3a0cb24dae79face607719ec9aae8ca8d347b9a6b95d18bbd5f49","observation_id":"66a952df-1706-40f5-b815-ed49da267573","resolution":{"observed_at":"2026-08-06T18:35:45.023443Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:35:44.453373Z","title":"The state and fate of linguistic diversity and inclusion in the NLP world","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.07824","last_updated":"2025-07-10T14:53:59Z","snapshot_observed_at":"2026-08-08T14:59:14.998398Z","submitted_at":"2025-07-10T14:53:59Z","title":"Conditional Unigram Tokenization with Parallel Data","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-06T18:35:44.453373Z"},"links":{"citing_paper":"/paper/2507.07824"},"observation_digest":"sha256:4560e282a9b5390a1634ca4a22ae55966a33982fd693c9eea5262a083c57ec57","observation_id":"276acd2e-72af-4633-882e-c661f88495cb","resolution":{"observed_at":"2026-08-06T18:35:44.453373Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:35:45.002827Z","title":null,"venue":null,"work_id":"7eeb8960-002e-4891-906e-54c3bb367d71","year":2018},"citing_paper":{"arxiv_id":"2507.07824","last_updated":"2025-07-10T14:53:59Z","snapshot_observed_at":"2026-08-08T14:59:14.998398Z","submitted_at":"2025-07-10T14:53:59Z","title":"Conditional Unigram Tokenization with Parallel Data","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-06T18:35:44.457758Z"},"links":{"citing_paper":"/paper/2507.07824"},"observation_digest":"sha256:29da7d917ff73fba701d8c6064dd181381cc0bc1f07eec27cecac415a77b6dc3","observation_id":"c8b25ad3-8890-4910-85d3-930965c088a9","resolution":{"observed_at":"2026-08-06T18:35:45.007365Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:35:44.462215Z","title":"Subword regularization: Improving neural network translation models with multiple subword candidates","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.07824","last_updated":"2025-07-10T14:53:59Z","snapshot_observed_at":"2026-08-08T14:59:14.998398Z","submitted_at":"2025-07-10T14:53:59Z","title":"Conditional Unigram Tokenization with Parallel Data","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-06T18:35:44.462215Z"},"links":{"citing_paper":"/paper/2507.07824"},"observation_digest":"sha256:a442f3a77763b2ccb3c424636cce3ee412286d837ea524b93231e0f7655119fe","observation_id":"104eb6a3-2c41-427f-bcca-2142750e42a1","resolution":{"observed_at":"2026-08-06T18:35:44.462215Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:35:44.988145Z","title":"and Fraser, A","venue":null,"work_id":"f3f1f220-3652-4c2c-800b-a4755136cfe3","year":2021},"citing_paper":{"arxiv_id":"2507.07824","last_updated":"2025-07-10T14:53:59Z","snapshot_observed_at":"2026-08-08T14:59:14.998398Z","submitted_at":"2025-07-10T14:53:59Z","title":"Conditional Unigram Tokenization with Parallel Data","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-06T18:35:44.466444Z"},"links":{"citing_paper":"/paper/2507.07824"},"observation_digest":"sha256:4b014394287c4fd9b2be62e46e273d5e50a945d0c7c888ca015791ac16387df4","observation_id":"8e576d87-52e5-4f1c-8f53-f258c86fc470","resolution":{"observed_at":"2026-08-06T18:35:44.992392Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2024.emnlp-main.421","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":"and Helcl, J","venue":null,"work_id":"a90e9515-2ea2-4f2b-bd49-006cd3c0d8d5","year":2024},"citing_paper":{"arxiv_id":"2507.07824","last_updated":"2025-07-10T14:53:59Z","snapshot_observed_at":"2026-08-08T14:59:14.998398Z","submitted_at":"2025-07-10T14:53:59Z","title":"Conditional Unigram Tokenization with Parallel Data","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-06T18:35:44.474029Z"},"links":{"citing_paper":"/paper/2507.07824"},"observation_digest":"sha256:96f70299e5c2086da562a561c1f00d1417a10840d1e28685aee76b2d166b6f97","observation_id":"7d48bc60-255f-4c9b-96e7-59f6277e529e","resolution":{"observed_at":"2026-08-06T18:35:44.703806Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:35:44.478471Z","title":"Tokenization impacts multilingual language modeling: Assessing vocabulary allocation and overlap across languages","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.07824","last_updated":"2025-07-10T14:53:59Z","snapshot_observed_at":"2026-08-08T14:59:14.998398Z","submitted_at":"2025-07-10T14:53:59Z","title":"Conditional Unigram Tokenization with Parallel Data","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-06T18:35:44.478471Z"},"links":{"citing_paper":"/paper/2507.07824"},"observation_digest":"sha256:e53e598ec97fa811a5632454552fe0d84f7aea0ca7b1ee7d586839441577af32","observation_id":"51fb6002-29ca-41f8-859a-392575ab6711","resolution":{"observed_at":"2026-08-06T18:35:44.478471Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:35:44.483452Z","title":"WECHSEL : Effective initialization of subword embeddings for cross-lingual transfer of monolingual language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.07824","last_updated":"2025-07-10T14:53:59Z","snapshot_observed_at":"2026-08-08T14:59:14.998398Z","submitted_at":"2025-07-10T14:53:59Z","title":"Conditional Unigram Tokenization with Parallel Data","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-06T18:35:44.483452Z"},"links":{"citing_paper":"/paper/2507.07824"},"observation_digest":"sha256:1451765c1c2fe0e67fef6decb39b5ab59d34423b5e3937eda5075420a9fe3077","observation_id":"9f61a3ec-f325-4bd5-ac86-9cf12dbc240c","resolution":{"observed_at":"2026-08-06T18:35:44.483452Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.04672","last_updated":"2022-08-25T17:10:53Z","snapshot_observed_at":"2026-07-06T13:29:47.927628Z","submitted_at":"2022-07-11T07:33:36Z","title":"No Language Left Behind: Scaling Human-Centered Machine Translation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.04672","snapshot_observed_at":"2026-08-06T18:35:44.488511Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.07824","last_updated":"2025-07-10T14:53:59Z","snapshot_observed_at":"2026-08-08T14:59:14.998398Z","submitted_at":"2025-07-10T14:53:59Z","title":"Conditional Unigram Tokenization with Parallel Data","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-06T18:35:44.488511Z"},"links":{"cited_paper":"/paper/2207.04672","citing_paper":"/paper/2507.07824"},"observation_digest":"sha256:0bb18df8ebebc7ef731f371fcf1238afdf856adc8fe7e141ef5b781d60f1d974","observation_id":"d5700e42-f094-4b92-bf54-2cde7530d9cc","resolution":{"observed_at":"2026-08-06T18:35:44.488511Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:35:44.971989Z","title":"and Tiedemann, J","venue":null,"work_id":"157b51fe-dc00-4417-b76f-648ac898e925","year":2016},"citing_paper":{"arxiv_id":"2507.07824","last_updated":"2025-07-10T14:53:59Z","snapshot_observed_at":"2026-08-08T14:59:14.998398Z","submitted_at":"2025-07-10T14:53:59Z","title":"Conditional Unigram Tokenization with Parallel Data","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-06T18:35:44.493537Z"},"links":{"citing_paper":"/paper/2507.07824"},"observation_digest":"sha256:7d27dc5d6ec98a99ea37dc442c8f3643eb9292e7a1547e91998c6085c259c780","observation_id":"875828a4-f630-4df6-8355-c065c47909c7","resolution":{"observed_at":"2026-08-06T18:35:44.976947Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:35:44.497932Z","title":"Bleu: a Method for Automatic Evaluation of Machine Translation","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2507.07824","last_updated":"2025-07-10T14:53:59Z","snapshot_observed_at":"2026-08-08T14:59:14.998398Z","submitted_at":"2025-07-10T14:53:59Z","title":"Conditional Unigram Tokenization with Parallel Data","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-06T18:35:44.497932Z"},"links":{"citing_paper":"/paper/2507.07824"},"observation_digest":"sha256:c4b8396e80ae6014f66d9e27124523325585df7c40f24504c5cfbbb30b9b9c97","observation_id":"22083a4d-4dde-4c6a-8c77-f23e0616f09d","resolution":{"observed_at":"2026-08-06T18:35:44.497932Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:35:44.955110Z","title":"Language Model Tokenizers Introduce Unfairness Between Languages","venue":null,"work_id":"9c3711c8-b536-4303-8b10-0063dc417bda","year":2023},"citing_paper":{"arxiv_id":"2507.07824","last_updated":"2025-07-10T14:53:59Z","snapshot_observed_at":"2026-08-08T14:59:14.998398Z","submitted_at":"2025-07-10T14:53:59Z","title":"Conditional Unigram Tokenization with Parallel Data","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-06T18:35:44.502188Z"},"links":{"citing_paper":"/paper/2507.07824"},"observation_digest":"sha256:3f38de7e0e90970a6eb86e91083f262c113fcf33e9b75d664fd12b1ab82d0b65","observation_id":"c66bfc7a-f612-472e-89ff-d201b26e7cc8","resolution":{"observed_at":"2026-08-06T18:35:44.960471Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:35:44.506406Z","title":"How multilingual is multilingual BERT ? In Korhonen, A., Traum, D., and M \\`a rquez, L","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.07824","last_updated":"2025-07-10T14:53:59Z","snapshot_observed_at":"2026-08-08T14:59:14.998398Z","submitted_at":"2025-07-10T14:53:59Z","title":"Conditional Unigram Tokenization with Parallel Data","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-06T18:35:44.506406Z"},"links":{"citing_paper":"/paper/2507.07824"},"observation_digest":"sha256:292fad2a3f7561e34a7a596d2751d883b34d6ec0b3f4c61c02eb873ac6e139df","observation_id":"c4060262-5718-436e-ba8a-0be7214a3df2","resolution":{"observed_at":"2026-08-06T18:35:44.506406Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:35:44.511081Z","title":"A call for clarity in reporting BLEU scores","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.07824","last_updated":"2025-07-10T14:53:59Z","snapshot_observed_at":"2026-08-08T14:59:14.998398Z","submitted_at":"2025-07-10T14:53:59Z","title":"Conditional Unigram Tokenization with Parallel Data","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-06T18:35:44.511081Z"},"links":{"citing_paper":"/paper/2507.07824"},"observation_digest":"sha256:4ff9b4faf5ca692895224b05794efa2672bd99cfd12344ad9af4607935e9d6bd","observation_id":"d298363c-ce56-40f3-868a-575b745537f2","resolution":{"observed_at":"2026-08-06T18:35:44.511081Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:35:44.939727Z","title":"Language models are unsupervised multitask learners","venue":null,"work_id":"ba546311-5467-402b-9498-938ebd780b79","year":2019},"citing_paper":{"arxiv_id":"2507.07824","last_updated":"2025-07-10T14:53:59Z","snapshot_observed_at":"2026-08-08T14:59:14.998398Z","submitted_at":"2025-07-10T14:53:59Z","title":"Conditional Unigram Tokenization with Parallel Data","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-06T18:35:44.515339Z"},"links":{"citing_paper":"/paper/2507.07824"},"observation_digest":"sha256:fe3e622d1baa65bf33f4d252e6a4e84fcb1f6e48c86ad7b2fabefa6abfd6cf8f","observation_id":"5fa5563b-b172-4b29-96a3-2fc1dbeb3c5a","resolution":{"observed_at":"2026-08-06T18:35:44.944507Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:35:44.519581Z","title":"C., and Lavie, A","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.07824","last_updated":"2025-07-10T14:53:59Z","snapshot_observed_at":"2026-08-08T14:59:14.998398Z","submitted_at":"2025-07-10T14:53:59Z","title":"Conditional Unigram Tokenization with Parallel Data","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-06T18:35:44.519581Z"},"links":{"citing_paper":"/paper/2507.07824"},"observation_digest":"sha256:a8c5b4b407b5343d25692a6a0e1edcec688e836c9b972850281bfb9e1905b9bf","observation_id":"9c0ae07a-b9d7-4497-acd9-a27346c868f9","resolution":{"observed_at":"2026-08-06T18:35:44.519581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03477","last_updated":"2023-10-05T11:45:29Z","snapshot_observed_at":"2026-08-08T14:57:03.855266Z","submitted_at":"2023-10-05T11:45:29Z","title":"Tik-to-Tok: Translating Language Models One Token at a Time: An Embedding Initialization Strategy for Efficient Language Adaptation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.03477","snapshot_observed_at":"2026-08-06T18:35:44.523916Z","title":"Tik-to- Tok : Translating Language Models One Token at a Time : An Embedding Initialization Strategy for Efficient Language Adaptation , October 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.07824","last_updated":"2025-07-10T14:53:59Z","snapshot_observed_at":"2026-08-08T14:59:14.998398Z","submitted_at":"2025-07-10T14:53:59Z","title":"Conditional Unigram Tokenization with Parallel Data","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-06T18:35:44.523916Z"},"links":{"cited_paper":"/paper/2310.03477","citing_paper":"/paper/2507.07824"},"observation_digest":"sha256:03bf3621219746675a245ffb1d09c50815f533fa335f7a2a6b89023b01fdd5a1","observation_id":"a8665cf7-5cfd-4b4a-929e-248b00747615","resolution":{"observed_at":"2026-08-06T18:35:44.523916Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.04303","last_updated":"2024-08-08T08:37:28Z","snapshot_observed_at":"2026-08-12T23:06:43.939890Z","submitted_at":"2024-08-08T08:37:28Z","title":"Trans-Tokenization and Cross-lingual Vocabulary Transfers: Language Adaptation of LLMs for Low-Resource NLP","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.04303","snapshot_observed_at":"2026-08-06T18:35:44.528703Z","title":"Trans- Tokenization and Cross -lingual Vocabulary Transfers : Language Adaptation of LLMs for Low - Resource NLP , August 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07824","last_updated":"2025-07-10T14:53:59Z","snapshot_observed_at":"2026-08-08T14:59:14.998398Z","submitted_at":"2025-07-10T14:53:59Z","title":"Conditional Unigram Tokenization with Parallel Data","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-06T18:35:44.528703Z"},"links":{"cited_paper":"/paper/2408.04303","citing_paper":"/paper/2507.07824"},"observation_digest":"sha256:d1006139725e3fb2517ac881f5d5e5d8c90302e444a651bfc8c7c820e07ea84a","observation_id":"4d79e9c4-25fe-4109-b931-7409933b5139","resolution":{"observed_at":"2026-08-06T18:35:44.528703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:35:44.533454Z","title":"How Good is Your Tokenizer ? On the Monolingual Performance of Multilingual Language Models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.07824","last_updated":"2025-07-10T14:53:59Z","snapshot_observed_at":"2026-08-08T14:59:14.998398Z","submitted_at":"2025-07-10T14:53:59Z","title":"Conditional Unigram Tokenization with Parallel Data","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-06T18:35:44.533454Z"},"links":{"citing_paper":"/paper/2507.07824"},"observation_digest":"sha256:455c254ce3f564ed761c6019261ee91f3acc34f2e4027ea9b785a4bcd9a802a1","observation_id":"7bb0fe1d-d9b0-45db-95ca-30cfd322eb58","resolution":{"observed_at":"2026-08-06T18:35:44.533454Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:35:44.923191Z","title":"W., Reddy, V., Zhang, H., Alameddine, A., Uzan, O., Pinter, Y., and Tanner, C","venue":null,"work_id":"e4c4dfbc-b7de-4c6c-9f5d-e4eac7bff7de","year":2024},"citing_paper":{"arxiv_id":"2507.07824","last_updated":"2025-07-10T14:53:59Z","snapshot_observed_at":"2026-08-08T14:59:14.998398Z","submitted_at":"2025-07-10T14:53:59Z","title":"Conditional Unigram Tokenization with Parallel Data","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-06T18:35:44.538629Z"},"links":{"citing_paper":"/paper/2507.07824"},"observation_digest":"sha256:9ea95a0f0ca9d9b59b177fba4289d0db1366ee021c4fa62b9d3bfd8e394f741e","observation_id":"8df6990b-ccaf-428f-8535-be850487643d","resolution":{"observed_at":"2026-08-06T18:35:44.928832Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:35:44.542993Z","title":"Neural machine translation of rare words with subword units","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2507.07824","last_updated":"2025-07-10T14:53:59Z","snapshot_observed_at":"2026-08-08T14:59:14.998398Z","submitted_at":"2025-07-10T14:53:59Z","title":"Conditional Unigram Tokenization with Parallel Data","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-06T18:35:44.542993Z"},"links":{"citing_paper":"/paper/2507.07824"},"observation_digest":"sha256:0a56c278a06158613fc92e1d8d19da5128c34db565b50fcac1bce28eb0397b7c","observation_id":"41589531-8b84-4d7b-945a-ea26408c880e","resolution":{"observed_at":"2026-08-06T18:35:44.542993Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:35:44.907904Z","title":"N., Kaiser, ., and Polosukhin, I","venue":null,"work_id":"5c379876-c43a-4269-b90e-ca75b9c9bd71","year":2017},"citing_paper":{"arxiv_id":"2507.07824","last_updated":"2025-07-10T14:53:59Z","snapshot_observed_at":"2026-08-08T14:59:14.998398Z","submitted_at":"2025-07-10T14:53:59Z","title":"Conditional Unigram Tokenization with Parallel Data","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-06T18:35:44.548767Z"},"links":{"citing_paper":"/paper/2507.07824"},"observation_digest":"sha256:0abf2626d71fb46447af3fb8a41b97ce02ebecbc92b9a9ae7cfffa13b1368edc","observation_id":"457187fc-0531-45c3-883e-f8340b0676e3","resolution":{"observed_at":"2026-08-06T18:35:44.912397Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/w19-5441","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":"The U niversity of H elsinki submission to the WMT 19 parallel corpus filtering task","venue":null,"work_id":"05c5db0e-da77-42cf-a2a3-cda90e272905","year":2019},"citing_paper":{"arxiv_id":"2507.07824","last_updated":"2025-07-10T14:53:59Z","snapshot_observed_at":"2026-08-08T14:59:14.998398Z","submitted_at":"2025-07-10T14:53:59Z","title":"Conditional Unigram Tokenization with Parallel Data","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-06T18:35:44.553635Z"},"links":{"citing_paper":"/paper/2507.07824"},"observation_digest":"sha256:df517e196ef8b1928df6ba32370e50dc262e6716e1b123decc88a1c1caa9a1cd","observation_id":"b25b0c18-afce-4873-96ec-1c3513c7fb28","resolution":{"observed_at":"2026-08-06T18:35:44.897215Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:35:44.557893Z","title":"Vocabulary learning via optimal transport for neural machine translation","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.07824","last_updated":"2025-07-10T14:53:59Z","snapshot_observed_at":"2026-08-08T14:59:14.998398Z","submitted_at":"2025-07-10T14:53:59Z","title":"Conditional Unigram Tokenization with Parallel Data","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-06T18:35:44.557893Z"},"links":{"citing_paper":"/paper/2507.07824"},"observation_digest":"sha256:f9bb16fde699863ec89097484d880b09b9d67f5086f03dd70fa630ad7f5350a6","observation_id":"84b8d306-3a99-4b72-a2fc-cd6d3be95d2a","resolution":{"observed_at":"2026-08-06T18:35:44.557893Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:35:44.562542Z","title":"Tokenization and the Noiseless Channel","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.07824","last_updated":"2025-07-10T14:53:59Z","snapshot_observed_at":"2026-08-08T14:59:14.998398Z","submitted_at":"2025-07-10T14:53:59Z","title":"Conditional Unigram Tokenization with Parallel Data","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-06T18:35:44.562542Z"},"links":{"citing_paper":"/paper/2507.07824"},"observation_digest":"sha256:8b8b01f8136d11d27be2e176b354762f6770a023a7553e0881e0725f58f7d7e5","observation_id":"ff2a1ee5-93e3-4856-ae44-ed3d73095443","resolution":{"observed_at":"2026-08-06T18:35:44.562542Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.07824","last_updated":"2025-07-10T14:53:59Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-08T14:59:14.998398Z","submitted_at":"2025-07-10T14:53:59Z","title":"Conditional Unigram Tokenization with Parallel Data"},"reference_resolution":{"displayed":32,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":18,"verified_exact":3,"verified_fuzzy":10},"total_outbound_references":32},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 32 of 32 outbound references and 0 inbound Pith citation observations for arXiv:2507.07824."}