{"as_of":"2026-08-09T08:24:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:83f28cac8f3f646a31683c328221c9acead6d0fc7c87fa281af1399c705ea55c","coverage":[{"denominator":12,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":12,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-31T23:47:06.742089Z","state":"measured"},{"denominator":12,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":12,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.23362/citation-record","integrity":"/paper/2607.23362/integrity","json":"/paper/2607.23362/citation-record.json","paper":"/paper/2607.23362"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2605.22821","last_updated":"2026-05-21T17:59:56Z","snapshot_observed_at":"2026-08-06T15:51:18.878044Z","submitted_at":"2026-05-21T17:59:56Z","title":"Tokenisation via Convex Relaxations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.22821","snapshot_observed_at":"2026-07-31T23:47:06.556648Z","title":"Omri Uzan, Craig W","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23362","last_updated":"2026-07-25T21:01:14Z","snapshot_observed_at":"2026-08-09T05:28:37.742931Z","submitted_at":"2026-07-25T21:01:14Z","title":"Joint Optimization for Greedy Longest-match Tokenization","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-31T23:47:06.556648Z"},"links":{"cited_paper":"/paper/2605.22821","citing_paper":"/paper/2607.23362"},"observation_digest":"sha256:c28c9de68c9c5742e09b3545af215b00f4bd0dae81f54717fcf41c1c50449926","observation_id":"4092ac2a-57ec-4a94-a346-aed0413543ec","resolution":{"observed_at":"2026-07-31T23:47:06.556648Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:47:05.889619Z","title":"Investigating the effectiveness of BPE: The power of shorter sequences","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.23362","last_updated":"2026-07-25T21:01:14Z","snapshot_observed_at":"2026-08-09T05:28:37.742931Z","submitted_at":"2026-07-25T21:01:14Z","title":"Joint Optimization for Greedy Longest-match Tokenization","version":1},"reference_index":1994,"source":"pdf_text","source_observed_at":"2026-07-31T23:47:05.889619Z"},"links":{"citing_paper":"/paper/2607.23362"},"observation_digest":"sha256:877923952a3d161cb2a1ed0f183055ecfb0e1b6e00f356c9bcc2de2288d735f1","observation_id":"e9458aed-d5c8-4209-9411-6acda6a26eb1","resolution":{"observed_at":"2026-07-31T23:47:05.889619Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:47:06.320172Z","title":"Rico Sennrich, Barry Haddow, and Alexandra Birch","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2607.23362","last_updated":"2026-07-25T21:01:14Z","snapshot_observed_at":"2026-08-09T05:28:37.742931Z","submitted_at":"2026-07-25T21:01:14Z","title":"Joint Optimization for Greedy Longest-match Tokenization","version":1},"reference_index":2012,"source":"pdf_text","source_observed_at":"2026-07-31T23:47:06.320172Z"},"links":{"citing_paper":"/paper/2607.23362"},"observation_digest":"sha256:48abde37247977f2c149ce609126145f82657e50c8b01d8c6fac6fe620f11d3d","observation_id":"f77dfd79-13e5-4287-ae8d-c88f4d3203d1","resolution":{"observed_at":"2026-07-31T23:47:06.320172Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:47:06.434499Z","title":"doi: 10.18653/v1/P16-1162","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23362","last_updated":"2026-07-25T21:01:14Z","snapshot_observed_at":"2026-08-09T05:28:37.742931Z","submitted_at":"2026-07-25T21:01:14Z","title":"Joint Optimization for Greedy Longest-match Tokenization","version":1},"reference_index":2016,"source":"pdf_text","source_observed_at":"2026-07-31T23:47:06.434499Z"},"links":{"citing_paper":"/paper/2607.23362"},"observation_digest":"sha256:7c3509e5ea0567597604d749a338fad0d0763dea277fc0b59213692a6031c1ad","observation_id":"b48aa0dc-6bab-4c72-833c-45cf93d5415b","resolution":{"observed_at":"2026-07-31T23:47:06.434499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:47:05.991961Z","title":"doi: 10.18653/v1/P18-1007","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23362","last_updated":"2026-07-25T21:01:14Z","snapshot_observed_at":"2026-08-09T05:28:37.742931Z","submitted_at":"2026-07-25T21:01:14Z","title":"Joint Optimization for Greedy Longest-match Tokenization","version":1},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-07-31T23:47:05.991961Z"},"links":{"citing_paper":"/paper/2607.23362"},"observation_digest":"sha256:d7ce0a2498e8afbb0f904b35649ad31721cb18bc85ffb97ddd35a7a6e832dadf","observation_id":"5a077309-7bad-4637-8fdc-b343f0e82a0a","resolution":{"observed_at":"2026-07-31T23:47:05.991961Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2101.00027","last_updated":"2020-12-31T19:00:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-12-31T19:00:10Z","title":"The Pile: An 800GB Dataset of Diverse Text for Language Modeling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2101.00027","snapshot_observed_at":"2026-07-31T23:47:05.933613Z","title":"Leo Gao, Stella Biderman, Sid Black, Laurence Golding, Travis Hoppe, Charles Foster, Jason Phang, Horace He, Anish Thite, Noa Nabeshima, et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23362","last_updated":"2026-07-25T21:01:14Z","snapshot_observed_at":"2026-08-09T05:28:37.742931Z","submitted_at":"2026-07-25T21:01:14Z","title":"Joint Optimization for Greedy Longest-match Tokenization","version":1},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-07-31T23:47:05.933613Z"},"links":{"cited_paper":"/paper/2101.00027","citing_paper":"/paper/2607.23362"},"observation_digest":"sha256:cf6af48b58656b267bc5a5861914faf223c1e289130c23b910c78fee2a484290","observation_id":"30fc9a84-404c-4155-bbaa-b2b0471bf8e1","resolution":{"observed_at":"2026-07-31T23:47:05.933613Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:47:05.966490Z","title":"Unpacking tokenization: Evaluating text compression and its correlation with model performance","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.23362","last_updated":"2026-07-25T21:01:14Z","snapshot_observed_at":"2026-08-09T05:28:37.742931Z","submitted_at":"2026-07-25T21:01:14Z","title":"Joint Optimization for Greedy Longest-match Tokenization","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-07-31T23:47:05.966490Z"},"links":{"citing_paper":"/paper/2607.23362"},"observation_digest":"sha256:89c6b7b0a5639834ea0fc1fc725efbda7b1bbbfb72f6d29fb8b8d01bddc63517","observation_id":"db153934-f928-45f1-a7a6-1b14f1cf5a92","resolution":{"observed_at":"2026-07-31T23:47:05.966490Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:47:06.132820Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.23362","last_updated":"2026-07-25T21:01:14Z","snapshot_observed_at":"2026-08-09T05:28:37.742931Z","submitted_at":"2026-07-25T21:01:14Z","title":"Joint Optimization for Greedy Longest-match Tokenization","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-07-31T23:47:06.132820Z"},"links":{"citing_paper":"/paper/2607.23362"},"observation_digest":"sha256:796efb1efcc3ed5b952d3cfefdd7237bda18d85047ea7d30d67af3b6e4083c59","observation_id":"bc047323-f1b6-40d9-ae76-35c726c71891","resolution":{"observed_at":"2026-07-31T23:47:06.132820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.08442","last_updated":"2023-04-17T17:03:56Z","snapshot_observed_at":"2026-07-06T15:16:38.500909Z","submitted_at":"2023-04-17T17:03:56Z","title":"The MiniPile Challenge for Data-Efficient Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.08442","snapshot_observed_at":"2026-07-31T23:47:05.969487Z","title":"Violeta Kastreva, Philip Whittington, Dennis Komm, and Tiago Pimentel","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23362","last_updated":"2026-07-25T21:01:14Z","snapshot_observed_at":"2026-08-09T05:28:37.742931Z","submitted_at":"2026-07-25T21:01:14Z","title":"Joint Optimization for Greedy Longest-match Tokenization","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-07-31T23:47:05.969487Z"},"links":{"cited_paper":"/paper/2304.08442","citing_paper":"/paper/2607.23362"},"observation_digest":"sha256:d67a9b44e57e8057e4ffec93b186a5e7451aa0d94bb301ca1eac303b2902b67e","observation_id":"5414b1d7-748e-44f5-81c1-a6a9601f70c5","resolution":{"observed_at":"2026-07-31T23:47:05.969487Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:47:06.662766Z","title":"doi: 10.18653/v1/2024.acl-short.73","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.23362","last_updated":"2026-07-25T21:01:14Z","snapshot_observed_at":"2026-08-09T05:28:37.742931Z","submitted_at":"2026-07-25T21:01:14Z","title":"Joint Optimization for Greedy Longest-match Tokenization","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-07-31T23:47:06.662766Z"},"links":{"citing_paper":"/paper/2607.23362"},"observation_digest":"sha256:0999b71ef66eca52066e985e393504a233498b231d8ff69a4092b91608e25c27","observation_id":"1ce15b56-4d14-445c-8540-eca1e9074cbb","resolution":{"observed_at":"2026-07-31T23:47:06.662766Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:47:06.742089Z","title":"ISBN 979-8-89176-251-0","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23362","last_updated":"2026-07-25T21:01:14Z","snapshot_observed_at":"2026-08-09T05:28:37.742931Z","submitted_at":"2026-07-25T21:01:14Z","title":"Joint Optimization for Greedy Longest-match Tokenization","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-07-31T23:47:06.742089Z"},"links":{"citing_paper":"/paper/2607.23362"},"observation_digest":"sha256:315a81fd1c8eb490cbd657c41b05ad6f8bf2a3ca631a68eec3f436dab15bfa66","observation_id":"fb2e9b0d-6bc5-4868-9aa6-66fbee0a0bfc","resolution":{"observed_at":"2026-07-31T23:47:06.742089Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.22705","last_updated":"2026-05-26T17:59:39Z","snapshot_observed_at":"2026-07-06T23:32:59.663926Z","submitted_at":"2026-05-21T16:46:23Z","title":"Tokenization with Split Trees","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.22705","snapshot_observed_at":"2026-07-31T23:47:06.221583Z","title":"org/abs/2605.22705","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23362","last_updated":"2026-07-25T21:01:14Z","snapshot_observed_at":"2026-08-09T05:28:37.742931Z","submitted_at":"2026-07-25T21:01:14Z","title":"Joint Optimization for Greedy Longest-match Tokenization","version":1},"reference_index":2026,"source":"pdf_text","source_observed_at":"2026-07-31T23:47:06.221583Z"},"links":{"cited_paper":"/paper/2605.22705","citing_paper":"/paper/2607.23362"},"observation_digest":"sha256:518cec2c4c33efc0ad4268f422e4fc8bbdbc8d3dfef97ced1e5aba163e32324e","observation_id":"75672a02-3d38-4fc5-bfb8-62a6ca7593cc","resolution":{"observed_at":"2026-07-31T23:47:06.221583Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.23362","last_updated":"2026-07-25T21:01:14Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-09T05:28:37.742931Z","submitted_at":"2026-07-25T21:01:14Z","title":"Joint Optimization for Greedy Longest-match Tokenization"},"reference_resolution":{"displayed":12,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":11,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":12},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 12 of 12 outbound references and 0 inbound Pith citation observations for arXiv:2607.23362."}