{"as_of":"2026-08-12T04:03:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:1529324f9c9349f04da35ba607b898ded634539e17015621c63643eb4235f5d5","coverage":[{"denominator":14,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":14,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T23:19:15.885007Z","state":"measured"},{"denominator":14,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":14,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.18674/citation-record","integrity":"/paper/2506.18674/integrity","json":"/paper/2506.18674/citation-record.json","paper":"/paper/2506.18674"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:19:17.172797Z","title":"https://allenai.org/","venue":null,"work_id":"8a3b7ad6-f76e-4c02-ac2c-6944994603b4","year":2025},"citing_paper":{"arxiv_id":"2506.18674","last_updated":"2025-06-23T14:18:46Z","snapshot_observed_at":"2026-08-09T08:04:35.326521Z","submitted_at":"2025-06-23T14:18:46Z","title":"Is There a Case for Conversation Optimized Tokenizers in Large Language Models?","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T23:19:14.640456Z"},"links":{"citing_paper":"/paper/2506.18674"},"observation_digest":"sha256:1a3cdc92746576c4481fe49a3eaec339700db77558d460cb6c8de5cae880002f","observation_id":"725f6711-9b46-4f34-b203-63df23ab2765","resolution":{"observed_at":"2026-08-06T23:19:17.302133Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:19:16.974469Z","title":"Accessed: 2024-06-08","venue":null,"work_id":"8354807b-f91b-4db9-afdb-07c958abeab4","year":2024},"citing_paper":{"arxiv_id":"2506.18674","last_updated":"2025-06-23T14:18:46Z","snapshot_observed_at":"2026-08-09T08:04:35.326521Z","submitted_at":"2025-06-23T14:18:46Z","title":"Is There a Case for Conversation Optimized Tokenizers in Large Language Models?","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T23:19:14.785714Z"},"links":{"citing_paper":"/paper/2506.18674"},"observation_digest":"sha256:e59268d8e49d56680dcd1e86eab7cb6d22fe11a7aa620a3f01339718df6ad40b","observation_id":"95586cea-cfea-4675-9341-53c8a8900702","resolution":{"observed_at":"2026-08-06T23:19:17.076164Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02954","last_updated":"2024-01-05T18:59:13Z","snapshot_observed_at":"2026-08-10T17:03:38.042994Z","submitted_at":"2024-01-05T18:59:13Z","title":"DeepSeek LLM: Scaling Open-Source Language Models with Longtermism","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.02954","snapshot_observed_at":"2026-08-06T23:19:14.869810Z","title":"arXiv preprint arXiv:2401.02954","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.18674","last_updated":"2025-06-23T14:18:46Z","snapshot_observed_at":"2026-08-09T08:04:35.326521Z","submitted_at":"2025-06-23T14:18:46Z","title":"Is There a Case for Conversation Optimized Tokenizers in Large Language Models?","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T23:19:14.869810Z"},"links":{"cited_paper":"/paper/2401.02954","citing_paper":"/paper/2506.18674"},"observation_digest":"sha256:cfb4505ab74f893eebd5becbb9cca49f643d38361af53cf099968d90d14213c8","observation_id":"ed8f7381-cfaf-4990-9304-42eb9b4ac645","resolution":{"observed_at":"2026-08-06T23:19:14.869810Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:19:16.307284Z","title":"https://huggingface","venue":null,"work_id":"af28d045-6eb2-4a29-92b5-78b6c73cfc99","year":2025},"citing_paper":{"arxiv_id":"2506.18674","last_updated":"2025-06-23T14:18:46Z","snapshot_observed_at":"2026-08-09T08:04:35.326521Z","submitted_at":"2025-06-23T14:18:46Z","title":"Is There a Case for Conversation Optimized Tokenizers in Large Language Models?","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T23:19:15.296021Z"},"links":{"citing_paper":"/paper/2506.18674"},"observation_digest":"sha256:5a7a308f6dcfb54d6790fd3bb0e03527ef59cb4f8f030d379937b41b81769e70","observation_id":"0f8b2201-94f5-481a-b4fd-b4565cd64973","resolution":{"observed_at":"2026-08-06T23:19:16.429621Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2012.15613","last_updated":"2021-06-01T18:17:59Z","snapshot_observed_at":"2026-07-06T10:29:01.682011Z","submitted_at":"2020-12-31T14:11:00Z","title":"How Good is Your Tokenizer? On the Monolingual Performance of Multilingual Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2012.15613","snapshot_observed_at":"2026-08-06T23:19:15.359114Z","title":"Preprint, arXiv:2012.15613","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2506.18674","last_updated":"2025-06-23T14:18:46Z","snapshot_observed_at":"2026-08-09T08:04:35.326521Z","submitted_at":"2025-06-23T14:18:46Z","title":"Is There a Case for Conversation Optimized Tokenizers in Large Language Models?","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T23:19:15.359114Z"},"links":{"cited_paper":"/paper/2012.15613","citing_paper":"/paper/2506.18674"},"observation_digest":"sha256:f440d333dcc6647dc6886c1b15b5deefec78f4be9bc9ca1b0be7525e052010c0","observation_id":"4bd3b149-c04f-4bea-a3c6-e77e24d1dd7c","resolution":{"observed_at":"2026-08-06T23:19:15.359114Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.20306","last_updated":"2024-03-29T17:22:48Z","snapshot_observed_at":"2026-08-10T13:32:41.965262Z","submitted_at":"2024-03-29T17:22:48Z","title":"Towards Greener LLMs: Bringing Energy-Efficiency to the Forefront of LLM Inference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.20306","snapshot_observed_at":"2026-08-06T23:19:15.550305Z","title":"arXiv preprint arXiv:2403.20306","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.18674","last_updated":"2025-06-23T14:18:46Z","snapshot_observed_at":"2026-08-09T08:04:35.326521Z","submitted_at":"2025-06-23T14:18:46Z","title":"Is There a Case for Conversation Optimized Tokenizers in Large Language Models?","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T23:19:15.550305Z"},"links":{"cited_paper":"/paper/2403.20306","citing_paper":"/paper/2506.18674"},"observation_digest":"sha256:ff4f4ea698eae7d45a704ab6470ad548c51db24df00fd5553eb723ec5d595d45","observation_id":"0e2288a8-c6bb-474d-80dc-8905e470c649","resolution":{"observed_at":"2026-08-06T23:19:15.550305Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.05100","last_updated":"2023-06-27T09:57:58Z","snapshot_observed_at":"2026-08-04T18:56:03.233715Z","submitted_at":"2022-11-09T18:48:09Z","title":"BLOOM: A 176B-Parameter Open-Access Multilingual Language Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.05100","snapshot_observed_at":"2026-08-06T23:19:15.802586Z","title":"Preprint, arXiv:2211.05100","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.18674","last_updated":"2025-06-23T14:18:46Z","snapshot_observed_at":"2026-08-09T08:04:35.326521Z","submitted_at":"2025-06-23T14:18:46Z","title":"Is There a Case for Conversation Optimized Tokenizers in Large Language Models?","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T23:19:15.802586Z"},"links":{"cited_paper":"/paper/2211.05100","citing_paper":"/paper/2506.18674"},"observation_digest":"sha256:d8a877120bddf547820bc46e862ba46834d9f06a4922384b67cca88bb9c1ae08","observation_id":"b6552b5f-5d64-46e9-9c13-6d3acd288c70","resolution":{"observed_at":"2026-08-06T23:19:15.802586Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.11998","last_updated":"2024-03-10T19:34:57Z","snapshot_observed_at":"2026-07-06T16:21:45.588487Z","submitted_at":"2023-09-21T12:13:55Z","title":"LMSYS-Chat-1M: A Large-Scale Real-World LLM Conversation Dataset","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.11998","snapshot_observed_at":"2026-08-06T23:19:15.885007Z","title":"Preprint, arXiv:2309.11998","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.18674","last_updated":"2025-06-23T14:18:46Z","snapshot_observed_at":"2026-08-09T08:04:35.326521Z","submitted_at":"2025-06-23T14:18:46Z","title":"Is There a Case for Conversation Optimized Tokenizers in Large Language Models?","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T23:19:15.885007Z"},"links":{"cited_paper":"/paper/2309.11998","citing_paper":"/paper/2506.18674"},"observation_digest":"sha256:71c9c151bcbf4277f22313937a21a44940bfd018342711e8942d1b7207ba410f","observation_id":"da335835-1b20-4270-b1cf-b13241b3ddce","resolution":{"observed_at":"2026-08-06T23:19:15.885007Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.03341","last_updated":"2019-12-05T19:29:29Z","snapshot_observed_at":"2026-08-08T12:15:34.687355Z","submitted_at":"2019-09-07T21:29:46Z","title":"Neural Machine Translation with Byte-Level Subwords","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.03341","snapshot_observed_at":"2026-08-06T23:19:15.667006Z","title":"Preprint, arXiv:1909.03341","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2506.18674","last_updated":"2025-06-23T14:18:46Z","snapshot_observed_at":"2026-08-09T08:04:35.326521Z","submitted_at":"2025-06-23T14:18:46Z","title":"Is There a Case for Conversation Optimized Tokenizers in Large Language Models?","version":1},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-06T23:19:15.667006Z"},"links":{"cited_paper":"/paper/1909.03341","citing_paper":"/paper/2506.18674"},"observation_digest":"sha256:b29166739a7758e1216c15c6e680844c1dcf3ffbb2e8d4dfa23f7f1123741c5b","observation_id":"4341cc1e-cde5-4471-a04b-606ce150088b","resolution":{"observed_at":"2026-08-06T23:19:15.667006Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:19:16.721454Z","title":"https://pile.eleuther.ai/","venue":null,"work_id":"79a3725e-d6ef-4ead-99b5-9c1741071a0b","year":2025},"citing_paper":{"arxiv_id":"2506.18674","last_updated":"2025-06-23T14:18:46Z","snapshot_observed_at":"2026-08-09T08:04:35.326521Z","submitted_at":"2025-06-23T14:18:46Z","title":"Is There a Case for Conversation Optimized Tokenizers in Large Language Models?","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-06T23:19:14.959868Z"},"links":{"citing_paper":"/paper/2506.18674"},"observation_digest":"sha256:79ac8f004576dc9346d35fa63d4d1190c1e1fe6862373a837d9d5dc5947308ca","observation_id":"04343bb5-875a-4885-925b-9b6921216121","resolution":{"observed_at":"2026-08-06T23:19:16.814416Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.10508","last_updated":"2021-12-20T13:04:18Z","snapshot_observed_at":"2026-07-06T12:20:36.165718Z","submitted_at":"2021-12-20T13:04:18Z","title":"Between words and characters: A Brief History of Open-Vocabulary Modeling and Tokenization in NLP","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.10508","snapshot_observed_at":"2026-08-06T23:19:15.192201Z","title":"arXiv preprint arXiv:2112.10508","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.18674","last_updated":"2025-06-23T14:18:46Z","snapshot_observed_at":"2026-08-09T08:04:35.326521Z","submitted_at":"2025-06-23T14:18:46Z","title":"Is There a Case for Conversation Optimized Tokenizers in Large Language Models?","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-06T23:19:15.192201Z"},"links":{"cited_paper":"/paper/2112.10508","citing_paper":"/paper/2506.18674"},"observation_digest":"sha256:f4ef80fdab5bea0c92e27007f255af412c51001af3a05a01851f0e85330b459d","observation_id":"c4f9ba5f-e3f0-4321-a224-fd5e3daa375c","resolution":{"observed_at":"2026-08-06T23:19:15.192201Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:19:16.141873Z","title":"In 2023 IEEE High Performance Extreme Computing Conference (HPEC), pages 1–9","venue":null,"work_id":"e8f9bece-7a2c-4f04-acf8-c71b5a7c6f9c","year":2023},"citing_paper":{"arxiv_id":"2506.18674","last_updated":"2025-06-23T14:18:46Z","snapshot_observed_at":"2026-08-09T08:04:35.326521Z","submitted_at":"2025-06-23T14:18:46Z","title":"Is There a Case for Conversation Optimized Tokenizers in Large Language Models?","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-06T23:19:15.459801Z"},"links":{"citing_paper":"/paper/2506.18674"},"observation_digest":"sha256:4c66ebf70e823901aaa2210faed96afb474fbb362b54dcfe690ff9207eaa72a6","observation_id":"be4c696a-12d2-40ed-935d-ebe6b5a460a2","resolution":{"observed_at":"2026-08-06T23:19:16.191426Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:19:17.403659Z","title":"Associa- tion for Computational Linguistics","venue":null,"work_id":"8bdd2414-d832-4c80-bb03-33103bf534cf","year":2024},"citing_paper":{"arxiv_id":"2506.18674","last_updated":"2025-06-23T14:18:46Z","snapshot_observed_at":"2026-08-09T08:04:35.326521Z","submitted_at":"2025-06-23T14:18:46Z","title":"Is There a Case for Conversation Optimized Tokenizers in Large Language Models?","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-06T23:19:14.564604Z"},"links":{"citing_paper":"/paper/2506.18674"},"observation_digest":"sha256:01b37ddf0d4e00023fe21ceaa4c2bed03bfd8d4f240573843dc1bd4ac1154064","observation_id":"72344704-6d8c-46f2-b5e6-1b11d0c1550e","resolution":{"observed_at":"2026-08-06T23:19:17.538945Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:19:16.542687Z","title":"https://www.demandsage.com/chatbot-statistics/","venue":null,"work_id":"ba33c211-b57e-4de7-9826-627596efba42","year":2025},"citing_paper":{"arxiv_id":"2506.18674","last_updated":"2025-06-23T14:18:46Z","snapshot_observed_at":"2026-08-09T08:04:35.326521Z","submitted_at":"2025-06-23T14:18:46Z","title":"Is There a Case for Conversation Optimized Tokenizers in Large Language Models?","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-06T23:19:15.082079Z"},"links":{"citing_paper":"/paper/2506.18674"},"observation_digest":"sha256:3823e3041e2b309dca338ede8d51824640267c3082de682236440e09413f4b00","observation_id":"d8ac7d09-d05a-4675-9bc9-932cf9f107f6","resolution":{"observed_at":"2026-08-06T23:19:16.614492Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.18674","last_updated":"2025-06-23T14:18:46Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-09T08:04:35.326521Z","submitted_at":"2025-06-23T14:18:46Z","title":"Is There a Case for Conversation Optimized Tokenizers in Large Language Models?"},"reference_resolution":{"displayed":14,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":7,"verified_exact":0,"verified_fuzzy":7},"total_outbound_references":14},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 12 August 2026, this Paper Citation Record lists 14 of 14 outbound references and 0 inbound Pith citation observations for arXiv:2506.18674."}