{"as_of":"2026-08-10T13:33:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:4f4ffa40e256f286f961bc63765e931142a15e0b54729b9326c5b3725d7d7acb","coverage":[{"denominator":119,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T11:18:14.155802Z","state":"measured"},{"denominator":100,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":100,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.03101/citation-record","integrity":"/paper/2506.03101/integrity","json":"/paper/2506.03101/citation-record.json","paper":"/paper/2506.03101"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2404.14219","last_updated":"2024-08-30T21:17:17Z","snapshot_observed_at":"2026-07-06T18:03:47.096406Z","submitted_at":"2024-04-22T14:32:33Z","title":"Phi-3 Technical Report: A Highly Capable Language Model Locally on Your Phone","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14219","snapshot_observed_at":"2026-08-07T11:18:05.003786Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03101","last_updated":"2025-06-03T17:35:56Z","snapshot_observed_at":"2026-08-08T07:38:04.360811Z","submitted_at":"2025-06-03T17:35:56Z","title":"Beyond Text Compression: Evaluating Tokenizers Across Scales","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T11:18:05.003786Z"},"links":{"cited_paper":"/paper/2404.14219","citing_paper":"/paper/2506.03101"},"observation_digest":"sha256:050506fd441889cf65adc17a25e5ed234311ac9d720ca4a5a10d41844648e266","observation_id":"4f722f28-c588-4ea1-950f-547f3c326203","resolution":{"observed_at":"2026-08-07T11:18:05.003786Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:18:05.061663Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03101","last_updated":"2025-06-03T17:35:56Z","snapshot_observed_at":"2026-08-08T07:38:04.360811Z","submitted_at":"2025-06-03T17:35:56Z","title":"Beyond Text Compression: Evaluating Tokenizers Across Scales","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T11:18:05.061663Z"},"links":{"citing_paper":"/paper/2506.03101"},"observation_digest":"sha256:2a65db00c515ab9e9aebd92c5b4b00e920acdd9e6cfc5c913554b485df4e242f","observation_id":"b33c2e22-7b59-485b-97a4-970b83a69d0c","resolution":{"observed_at":"2026-08-07T11:18:05.061663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:18:05.136662Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.03101","last_updated":"2025-06-03T17:35:56Z","snapshot_observed_at":"2026-08-08T07:38:04.360811Z","submitted_at":"2025-06-03T17:35:56Z","title":"Beyond Text Compression: Evaluating Tokenizers Across Scales","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T11:18:05.136662Z"},"links":{"citing_paper":"/paper/2506.03101"},"observation_digest":"sha256:3ee2f8c3e61db6523b5f94704d0b92e943588da1288e7065b930f98b78ad5023","observation_id":"6b84f0e6-ca3c-46d3-a69b-ef1de24f82cd","resolution":{"observed_at":"2026-08-07T11:18:05.136662Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:18:05.209178Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03101","last_updated":"2025-06-03T17:35:56Z","snapshot_observed_at":"2026-08-08T07:38:04.360811Z","submitted_at":"2025-06-03T17:35:56Z","title":"Beyond Text Compression: Evaluating Tokenizers Across Scales","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T11:18:05.209178Z"},"links":{"citing_paper":"/paper/2506.03101"},"observation_digest":"sha256:fff73f4e035a1c79af4d816fe99910328f771be3bef71ff760197ed66ae17814","observation_id":"b178247d-d95c-41e0-a57b-cc475475cbd5","resolution":{"observed_at":"2026-08-07T11:18:05.209178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.16867","last_updated":"2023-11-29T19:45:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-28T15:12:47Z","title":"The Falcon Series of Open Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.16867","snapshot_observed_at":"2026-08-07T11:18:05.279695Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03101","last_updated":"2025-06-03T17:35:56Z","snapshot_observed_at":"2026-08-08T07:38:04.360811Z","submitted_at":"2025-06-03T17:35:56Z","title":"Beyond Text Compression: Evaluating Tokenizers Across Scales","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T11:18:05.279695Z"},"links":{"cited_paper":"/paper/2311.16867","citing_paper":"/paper/2506.03101"},"observation_digest":"sha256:1ceab201b200b2c0fff68f1e021a52909989b2b04882b62294b3d7cb71dbc921","observation_id":"4b57c19f-79f2-40ff-abf3-b710a1690ea0","resolution":{"observed_at":"2026-08-07T11:18:05.279695Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:18:05.358249Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03101","last_updated":"2025-06-03T17:35:56Z","snapshot_observed_at":"2026-08-08T07:38:04.360811Z","submitted_at":"2025-06-03T17:35:56Z","title":"Beyond Text Compression: Evaluating Tokenizers Across Scales","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T11:18:05.358249Z"},"links":{"citing_paper":"/paper/2506.03101"},"observation_digest":"sha256:f4c41a4be3407e98bd9fdfd38237f118498d7e2184f877d1be30d1b4ca5baea0","observation_id":"d22059dd-b857-48db-89f9-3e3cc66bb6e2","resolution":{"observed_at":"2026-08-07T11:18:05.358249Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:18:05.433759Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03101","last_updated":"2025-06-03T17:35:56Z","snapshot_observed_at":"2026-08-08T07:38:04.360811Z","submitted_at":"2025-06-03T17:35:56Z","title":"Beyond Text Compression: Evaluating Tokenizers Across Scales","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T11:18:05.433759Z"},"links":{"citing_paper":"/paper/2506.03101"},"observation_digest":"sha256:73ad3509b15c39c1bac6fb6b3147e574d0a6fa881894d2417c459512333c2dec","observation_id":"53c51576-d05d-4ed2-b1d8-d63319849633","resolution":{"observed_at":"2026-08-07T11:18:05.433759Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14619","last_updated":"2024-05-02T00:30:57Z","snapshot_observed_at":"2026-07-06T18:04:04.541434Z","submitted_at":"2024-04-22T23:12:03Z","title":"OpenELM: An Efficient Language Model Family with Open Training and Inference Framework","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14619","snapshot_observed_at":"2026-08-07T11:18:05.514145Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03101","last_updated":"2025-06-03T17:35:56Z","snapshot_observed_at":"2026-08-08T07:38:04.360811Z","submitted_at":"2025-06-03T17:35:56Z","title":"Beyond Text Compression: Evaluating Tokenizers Across Scales","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T11:18:05.514145Z"},"links":{"cited_paper":"/paper/2404.14619","citing_paper":"/paper/2506.03101"},"observation_digest":"sha256:6ceca8bbc2c9d110baed7fe123784439b94fa43afa9859ca9cb8c0d5a8bdb432","observation_id":"a885699d-6d29-48a5-8fc5-59fb12c13d4b","resolution":{"observed_at":"2026-08-07T11:18:05.514145Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.00861","last_updated":"2021-12-09T21:40:22Z","snapshot_observed_at":"2026-08-10T12:03:10.373653Z","submitted_at":"2021-12-01T22:24:34Z","title":"A General Language Assistant as a Laboratory for Alignment","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.00861","snapshot_observed_at":"2026-08-07T11:18:05.550641Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.03101","last_updated":"2025-06-03T17:35:56Z","snapshot_observed_at":"2026-08-08T07:38:04.360811Z","submitted_at":"2025-06-03T17:35:56Z","title":"Beyond Text Compression: Evaluating Tokenizers Across Scales","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T11:18:05.550641Z"},"links":{"cited_paper":"/paper/2112.00861","citing_paper":"/paper/2506.03101"},"observation_digest":"sha256:00046e7ecd0ee444d12af98396b53d5aba395b896cdc8dd0724ffa2aa6917624","observation_id":"d70730f7-07e1-4b9b-b1ed-d81742a704a3","resolution":{"observed_at":"2026-08-07T11:18:05.550641Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.05862","last_updated":"2022-04-12T15:02:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-12T15:02:38Z","title":"Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.05862","snapshot_observed_at":"2026-08-07T11:18:05.607712Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.03101","last_updated":"2025-06-03T17:35:56Z","snapshot_observed_at":"2026-08-08T07:38:04.360811Z","submitted_at":"2025-06-03T17:35:56Z","title":"Beyond Text Compression: Evaluating Tokenizers Across Scales","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T11:18:05.607712Z"},"links":{"cited_paper":"/paper/2204.05862","citing_paper":"/paper/2506.03101"},"observation_digest":"sha256:6ee29f74b8899904787febb89a6b4d02875459ea7889110b7bbcc9bf6ed7f24c","observation_id":"46960b5e-09f2-494b-8a6e-7152598fdfab","resolution":{"observed_at":"2026-08-07T11:18:05.607712Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:18:05.679240Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.03101","last_updated":"2025-06-03T17:35:56Z","snapshot_observed_at":"2026-08-08T07:38:04.360811Z","submitted_at":"2025-06-03T17:35:56Z","title":"Beyond Text Compression: Evaluating Tokenizers Across Scales","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T11:18:05.679240Z"},"links":{"citing_paper":"/paper/2506.03101"},"observation_digest":"sha256:b441baf5c4ab9eaf2ef668b00feabde252eb54ccea7c332b68e5002a85b91b9f","observation_id":"dde45e0d-36f7-44a4-ad88-3fa111912b88","resolution":{"observed_at":"2026-08-07T11:18:05.679240Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:18:05.729950Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.03101","last_updated":"2025-06-03T17:35:56Z","snapshot_observed_at":"2026-08-08T07:38:04.360811Z","submitted_at":"2025-06-03T17:35:56Z","title":"Beyond Text Compression: Evaluating Tokenizers Across Scales","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T11:18:05.729950Z"},"links":{"citing_paper":"/paper/2506.03101"},"observation_digest":"sha256:906f5de5bec1f516552a0c9114bcc8b27e9ce0f3528e3d3ae0b24cc58734ccd9","observation_id":"ab01704a-4a6e-444e-af04-57be7b472536","resolution":{"observed_at":"2026-08-07T11:18:05.729950Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:18:05.800509Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03101","last_updated":"2025-06-03T17:35:56Z","snapshot_observed_at":"2026-08-08T07:38:04.360811Z","submitted_at":"2025-06-03T17:35:56Z","title":"Beyond Text Compression: Evaluating Tokenizers Across Scales","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T11:18:05.800509Z"},"links":{"citing_paper":"/paper/2506.03101"},"observation_digest":"sha256:3906f8b323aa5b6dc8b6b541caf460824e8c4b8baf673eca2c618f66ad2fb7c5","observation_id":"aa07b61f-506e-4618-89e3-3c3826277049","resolution":{"observed_at":"2026-08-07T11:18:05.800509Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.10102","last_updated":"2024-05-15T00:57:23Z","snapshot_observed_at":"2026-08-08T21:54:19.231644Z","submitted_at":"2024-04-15T19:19:56Z","title":"Chinchilla Scaling: A replication attempt","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.10102","snapshot_observed_at":"2026-08-07T11:18:05.875330Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03101","last_updated":"2025-06-03T17:35:56Z","snapshot_observed_at":"2026-08-08T07:38:04.360811Z","submitted_at":"2025-06-03T17:35:56Z","title":"Beyond Text Compression: Evaluating Tokenizers Across Scales","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T11:18:05.875330Z"},"links":{"cited_paper":"/paper/2404.10102","citing_paper":"/paper/2506.03101"},"observation_digest":"sha256:05aa88de1c6cbbbedb15302870c8a43882d0683248464d57d84162822fc8cc14","observation_id":"448cd705-652d-45d9-b596-7f5c2e36200b","resolution":{"observed_at":"2026-08-07T11:18:05.875330Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:18:05.936291Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03101","last_updated":"2025-06-03T17:35:56Z","snapshot_observed_at":"2026-08-08T07:38:04.360811Z","submitted_at":"2025-06-03T17:35:56Z","title":"Beyond Text Compression: Evaluating Tokenizers Across Scales","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T11:18:05.936291Z"},"links":{"citing_paper":"/paper/2506.03101"},"observation_digest":"sha256:c94916e8417e456693d7f1fa9769b3c5516357160b733364dc294d6d4ab8a418","observation_id":"9c4bd12c-c541-4c4d-9a21-76d4f330225b","resolution":{"observed_at":"2026-08-07T11:18:05.936291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.05100","last_updated":"2023-06-27T09:57:58Z","snapshot_observed_at":"2026-08-04T18:56:03.233715Z","submitted_at":"2022-11-09T18:48:09Z","title":"BLOOM: A 176B-Parameter Open-Access Multilingual Language Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.05100","snapshot_observed_at":"2026-08-07T11:18:05.968985Z","title":"Rush, Stella Biderman, Albert Webson, Pawan Sasanka Ammanamanchi, Thomas Wang, Benoît Sagot, Niklas Muennighoff, and 374 others","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03101","last_updated":"2025-06-03T17:35:56Z","snapshot_observed_at":"2026-08-08T07:38:04.360811Z","submitted_at":"2025-06-03T17:35:56Z","title":"Beyond Text Compression: Evaluating Tokenizers Across Scales","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T11:18:05.968985Z"},"links":{"cited_paper":"/paper/2211.05100","citing_paper":"/paper/2506.03101"},"observation_digest":"sha256:ad9c14c5aed69d18651440ae5eb909e227d329ba237f5c8b5a1dec5e75fee007","observation_id":"0149b0bf-4c0a-4bd0-9936-5e2e08580923","resolution":{"observed_at":"2026-08-07T11:18:05.968985Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:18:06.054844Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.03101","last_updated":"2025-06-03T17:35:56Z","snapshot_observed_at":"2026-08-08T07:38:04.360811Z","submitted_at":"2025-06-03T17:35:56Z","title":"Beyond Text Compression: Evaluating Tokenizers Across Scales","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T11:18:06.054844Z"},"links":{"citing_paper":"/paper/2506.03101"},"observation_digest":"sha256:3fd158282373dd48fcdf4385266479590f1c88943b27f7588749d6d73c1f7ea1","observation_id":"d79e9ac7-37d0-43c3-8417-38586b3c2da6","resolution":{"observed_at":"2026-08-07T11:18:06.054844Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:18:06.058538Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.03101","last_updated":"2025-06-03T17:35:56Z","snapshot_observed_at":"2026-08-08T07:38:04.360811Z","submitted_at":"2025-06-03T17:35:56Z","title":"Beyond Text Compression: Evaluating Tokenizers Across Scales","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T11:18:06.058538Z"},"links":{"citing_paper":"/paper/2506.03101"},"observation_digest":"sha256:6047b3f8da34401014b039f333a706361ef9fbcf588aa72d89c82df195e6c3f0","observation_id":"50a0f69a-d54b-4836-9c0c-9f54318c78dd","resolution":{"observed_at":"2026-08-07T11:18:06.058538Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:18:06.067253Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.03101","last_updated":"2025-06-03T17:35:56Z","snapshot_observed_at":"2026-08-08T07:38:04.360811Z","submitted_at":"2025-06-03T17:35:56Z","title":"Beyond Text Compression: Evaluating Tokenizers Across Scales","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T11:18:06.067253Z"},"links":{"citing_paper":"/paper/2506.03101"},"observation_digest":"sha256:e8186c530731ab94786168f4b2f78f110da0e33cd326cd725b6a3120a64187c3","observation_id":"09e85320-1a8c-474f-98a4-740dbe500ff3","resolution":{"observed_at":"2026-08-07T11:18:06.067253Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:18:06.210566Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.03101","last_updated":"2025-06-03T17:35:56Z","snapshot_observed_at":"2026-08-08T07:38:04.360811Z","submitted_at":"2025-06-03T17:35:56Z","title":"Beyond Text Compression: Evaluating Tokenizers Across Scales","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T11:18:06.210566Z"},"links":{"citing_paper":"/paper/2506.03101"},"observation_digest":"sha256:29df08b1f99790704b6955fdaa304fe6aba95e2177726cc8e14aa2f0e28a969f","observation_id":"dea69fa7-c750-47c6-93ff-850aa9ed5ae7","resolution":{"observed_at":"2026-08-07T11:18:06.210566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:18:06.292149Z","title":null,"venue":null,"work_id":null,"year":1952},"citing_paper":{"arxiv_id":"2506.03101","last_updated":"2025-06-03T17:35:56Z","snapshot_observed_at":"2026-08-08T07:38:04.360811Z","submitted_at":"2025-06-03T17:35:56Z","title":"Beyond Text Compression: Evaluating Tokenizers Across Scales","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T11:18:06.292149Z"},"links":{"citing_paper":"/paper/2506.03101"},"observation_digest":"sha256:bb233773fda928a11d124cea07f9dcf07ab64927098d00d6b6a5caf9d75c7db0","observation_id":"ee80d871-165b-4cd4-a525-c9c56e777a3b","resolution":{"observed_at":"2026-08-07T11:18:06.292149Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:18:06.346314Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.03101","last_updated":"2025-06-03T17:35:56Z","snapshot_observed_at":"2026-08-08T07:38:04.360811Z","submitted_at":"2025-06-03T17:35:56Z","title":"Beyond Text Compression: Evaluating Tokenizers Across Scales","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T11:18:06.346314Z"},"links":{"citing_paper":"/paper/2506.03101"},"observation_digest":"sha256:79b69b4d46e69320da8a42222ce0edbb618f11699fca69f57f505f5635a52849","observation_id":"0de0b97c-c426-4e07-943c-2cae86d409dc","resolution":{"observed_at":"2026-08-07T11:18:06.346314Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:18:06.433622Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03101","last_updated":"2025-06-03T17:35:56Z","snapshot_observed_at":"2026-08-08T07:38:04.360811Z","submitted_at":"2025-06-03T17:35:56Z","title":"Beyond Text Compression: Evaluating Tokenizers Across Scales","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T11:18:06.433622Z"},"links":{"citing_paper":"/paper/2506.03101"},"observation_digest":"sha256:9beb9ddf0ef638506eaedba842d6cd1dd17474a503cd92b181922650650289c1","observation_id":"eb9776f5-a857-474e-ad5e-4aaac5fd26e8","resolution":{"observed_at":"2026-08-07T11:18:06.433622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:18:06.589336Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03101","last_updated":"2025-06-03T17:35:56Z","snapshot_observed_at":"2026-08-08T07:38:04.360811Z","submitted_at":"2025-06-03T17:35:56Z","title":"Beyond Text Compression: Evaluating Tokenizers Across Scales","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T11:18:06.589336Z"},"links":{"citing_paper":"/paper/2506.03101"},"observation_digest":"sha256:df1ea2af5499afd1aca62d66f81b5af2bc86e963151264b07790c5237ade53a3","observation_id":"bcb5c067-917d-4255-8f3f-ec76470f3756","resolution":{"observed_at":"2026-08-07T11:18:06.589336Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.10509","last_updated":"2019-04-23T19:29:47Z","snapshot_observed_at":"2026-08-09T19:46:04.857927Z","submitted_at":"2019-04-23T19:29:47Z","title":"Generating Long Sequences with Sparse Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.10509","snapshot_observed_at":"2026-08-07T11:18:06.732776Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.03101","last_updated":"2025-06-03T17:35:56Z","snapshot_observed_at":"2026-08-08T07:38:04.360811Z","submitted_at":"2025-06-03T17:35:56Z","title":"Beyond Text Compression: Evaluating Tokenizers Across Scales","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T11:18:06.732776Z"},"links":{"cited_paper":"/paper/1904.10509","citing_paper":"/paper/2506.03101"},"observation_digest":"sha256:ae1e7c0e779c7c68892e3cd313b59f2338f80623f9ffb656ba19cd6cb5a0e790","observation_id":"d86143a8-bdfb-4831-97fb-d07dbb9eb522","resolution":{"observed_at":"2026-08-07T11:18:06.732776Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.11840","last_updated":"2025-06-02T19:33:41Z","snapshot_observed_at":"2026-08-10T03:07:33.450117Z","submitted_at":"2024-10-15T17:59:10Z","title":"A Hitchhiker's Guide to Scaling Law Estimation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.11840","snapshot_observed_at":"2026-08-07T11:18:06.831760Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03101","last_updated":"2025-06-03T17:35:56Z","snapshot_observed_at":"2026-08-08T07:38:04.360811Z","submitted_at":"2025-06-03T17:35:56Z","title":"Beyond Text Compression: Evaluating Tokenizers Across Scales","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T11:18:06.831760Z"},"links":{"cited_paper":"/paper/2410.11840","citing_paper":"/paper/2506.03101"},"observation_digest":"sha256:622f6ebdcfb6fbfa98013808d3018e76ec2f70b75046541717f77fdd39e7bbfd","observation_id":"31b97626-9971-4b1b-bffd-8f987e8ec9d2","resolution":{"observed_at":"2026-08-07T11:18:06.831760Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:18:06.916815Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03101","last_updated":"2025-06-03T17:35:56Z","snapshot_observed_at":"2026-08-08T07:38:04.360811Z","submitted_at":"2025-06-03T17:35:56Z","title":"Beyond Text Compression: Evaluating Tokenizers Across Scales","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T11:18:06.916815Z"},"links":{"citing_paper":"/paper/2506.03101"},"observation_digest":"sha256:2bdc961d94f1031ba5268b74cd0054635c3dff03a2df90762ad071f8f61ffdb7","observation_id":"7769dd7f-7cb4-4d82-96b1-04622c85d705","resolution":{"observed_at":"2026-08-07T11:18:06.916815Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:18:07.005116Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.03101","last_updated":"2025-06-03T17:35:56Z","snapshot_observed_at":"2026-08-08T07:38:04.360811Z","submitted_at":"2025-06-03T17:35:56Z","title":"Beyond Text Compression: Evaluating Tokenizers Across Scales","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T11:18:07.005116Z"},"links":{"citing_paper":"/paper/2506.03101"},"observation_digest":"sha256:f1aac9755d1d3c23646e8bb2fc4e1e68bc5ff86b9baff96a2af8b11537ca15f4","observation_id":"ae2273cd-051d-4ffc-968a-f1289b1e3178","resolution":{"observed_at":"2026-08-07T11:18:07.005116Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.05457","last_updated":"2018-03-14T18:04:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2018-03-14T18:04:21Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.05457","snapshot_observed_at":"2026-08-07T11:18:07.088585Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.03101","last_updated":"2025-06-03T17:35:56Z","snapshot_observed_at":"2026-08-08T07:38:04.360811Z","submitted_at":"2025-06-03T17:35:56Z","title":"Beyond Text Compression: Evaluating Tokenizers Across Scales","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T11:18:07.088585Z"},"links":{"cited_paper":"/paper/1803.05457","citing_paper":"/paper/2506.03101"},"observation_digest":"sha256:43694a06182b74411e6133dceb5efde43feceb16a21c075696a8da5d38d31ce5","observation_id":"cb58c326-6ced-42a6-8b67-f3632272032d","resolution":{"observed_at":"2026-08-07T11:18:07.088585Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:18:07.189595Z","title":null,"venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2506.03101","last_updated":"2025-06-03T17:35:56Z","snapshot_observed_at":"2026-08-08T07:38:04.360811Z","submitted_at":"2025-06-03T17:35:56Z","title":"Beyond Text Compression: Evaluating Tokenizers Across Scales","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T11:18:07.189595Z"},"links":{"citing_paper":"/paper/2506.03101"},"observation_digest":"sha256:718e2edbdc4cf664afdb7de66769785f6c1e793dffeff8790a26ce7a08fb1219","observation_id":"f6f21d32-fe7a-4c3c-953e-a1e89e3f0656","resolution":{"observed_at":"2026-08-07T11:18:07.189595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:18:07.286069Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03101","last_updated":"2025-06-03T17:35:56Z","snapshot_observed_at":"2026-08-08T07:38:04.360811Z","submitted_at":"2025-06-03T17:35:56Z","title":"Beyond Text Compression: Evaluating Tokenizers Across Scales","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T11:18:07.286069Z"},"links":{"citing_paper":"/paper/2506.03101"},"observation_digest":"sha256:02de3b5c80c68095b8a619d243390edd788ce042c62f0c8c38faabdbe66030a3","observation_id":"38d5cd2f-64f2-4e65-b054-3fdbe7eab680","resolution":{"observed_at":"2026-08-07T11:18:07.286069Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:18:07.355507Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03101","last_updated":"2025-06-03T17:35:56Z","snapshot_observed_at":"2026-08-08T07:38:04.360811Z","submitted_at":"2025-06-03T17:35:56Z","title":"Beyond Text Compression: Evaluating Tokenizers Across Scales","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T11:18:07.355507Z"},"links":{"citing_paper":"/paper/2506.03101"},"observation_digest":"sha256:e625e00b600271e23119ba052807b1d2d37f1559992e1febf42af1248dfa4257","observation_id":"283c60c0-de6d-422a-9e2b-c6c208bc049c","resolution":{"observed_at":"2026-08-07T11:18:07.355507Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1007/978-3-031-24337-0_38","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T00:03:45.533247Z","title":null,"venue":"Lecture notes in computer science","work_id":"08e59959-6153-4cc2-94e1-e37523d71a36","year":2019},"citing_paper":{"arxiv_id":"2506.03101","last_updated":"2025-06-03T17:35:56Z","snapshot_observed_at":"2026-08-08T07:38:04.360811Z","submitted_at":"2025-06-03T17:35:56Z","title":"Beyond Text Compression: Evaluating Tokenizers Across Scales","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T11:18:07.493609Z"},"links":{"citing_paper":"/paper/2506.03101"},"observation_digest":"sha256:74584de0f84b34ecf6e87cda3bbfd3f511c5041bb28120ef590edaf97a8a56ab","observation_id":"ba6986bc-c4ec-4fe3-9bf5-bac6bd6cfae2","resolution":{"observed_at":"2026-08-07T11:18:18.458667Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-07T11:18:07.585016Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03101","last_updated":"2025-06-03T17:35:56Z","snapshot_observed_at":"2026-08-08T07:38:04.360811Z","submitted_at":"2025-06-03T17:35:56Z","title":"Beyond Text Compression: Evaluating Tokenizers Across Scales","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T11:18:07.585016Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2506.03101"},"observation_digest":"sha256:c03ae94bd3f692ccf2bfcaa49e80f631595c32e7379fcc209b9575e4ceae2c9c","observation_id":"9d1afc3f-0469-4889-90eb-125cc9da77e2","resolution":{"observed_at":"2026-08-07T11:18:07.585016Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:18:07.666603Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03101","last_updated":"2025-06-03T17:35:56Z","snapshot_observed_at":"2026-08-08T07:38:04.360811Z","submitted_at":"2025-06-03T17:35:56Z","title":"Beyond Text Compression: Evaluating Tokenizers Across Scales","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T11:18:07.666603Z"},"links":{"citing_paper":"/paper/2506.03101"},"observation_digest":"sha256:3a703f91682e737c50ae0e0278084dfbc441773112f163458407498bd7728d60","observation_id":"5206d088-e72a-4e59-9318-231358ea5e69","resolution":{"observed_at":"2026-08-07T11:18:07.666603Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:18:07.751641Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.03101","last_updated":"2025-06-03T17:35:56Z","snapshot_observed_at":"2026-08-08T07:38:04.360811Z","submitted_at":"2025-06-03T17:35:56Z","title":"Beyond Text Compression: Evaluating Tokenizers Across Scales","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T11:18:07.751641Z"},"links":{"citing_paper":"/paper/2506.03101"},"observation_digest":"sha256:8f2ddf84adc1f05e4d813f796cf45ac4edfe0ca8369ff48c9a7c38c1cd4af499","observation_id":"26d23ea1-5964-4fbd-ab4b-6c5c7a9e0c61","resolution":{"observed_at":"2026-08-07T11:18:07.751641Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:18:07.823668Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03101","last_updated":"2025-06-03T17:35:56Z","snapshot_observed_at":"2026-08-08T07:38:04.360811Z","submitted_at":"2025-06-03T17:35:56Z","title":"Beyond Text Compression: Evaluating Tokenizers Across Scales","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T11:18:07.823668Z"},"links":{"citing_paper":"/paper/2506.03101"},"observation_digest":"sha256:153ae7d67581fc1d262e94c545a1a15e973d9ca9bc7d773786d488cb5aaae4eb","observation_id":"4cad5739-2bff-4ec8-904e-273ed7626e81","resolution":{"observed_at":"2026-08-07T11:18:07.823668Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:18:07.892507Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03101","last_updated":"2025-06-03T17:35:56Z","snapshot_observed_at":"2026-08-08T07:38:04.360811Z","submitted_at":"2025-06-03T17:35:56Z","title":"Beyond Text Compression: Evaluating Tokenizers Across Scales","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T11:18:07.892507Z"},"links":{"citing_paper":"/paper/2506.03101"},"observation_digest":"sha256:b7172b9f747d014d4a3d2727dd4ee49ba73e180e594db62db2ec0120ef413db6","observation_id":"15685760-aede-48b8-bb82-a339cfb8a4a8","resolution":{"observed_at":"2026-08-07T11:18:07.892507Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/d18-1029","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":null,"venue":null,"work_id":"820284af-223d-4da8-ba90-bf8d52935d72","year":2018},"citing_paper":{"arxiv_id":"2506.03101","last_updated":"2025-06-03T17:35:56Z","snapshot_observed_at":"2026-08-08T07:38:04.360811Z","submitted_at":"2025-06-03T17:35:56Z","title":"Beyond Text Compression: Evaluating Tokenizers Across Scales","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T11:18:07.974551Z"},"links":{"citing_paper":"/paper/2506.03101"},"observation_digest":"sha256:7193f0f63529d48018ca168322b5ed22817d7feadb5d2ae651749c334f83a9a7","observation_id":"74911a81-cadd-4554-a25f-d92b95090825","resolution":{"observed_at":"2026-08-07T11:18:18.252141Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:18:08.036387Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03101","last_updated":"2025-06-03T17:35:56Z","snapshot_observed_at":"2026-08-08T07:38:04.360811Z","submitted_at":"2025-06-03T17:35:56Z","title":"Beyond Text Compression: Evaluating Tokenizers Across Scales","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T11:18:08.036387Z"},"links":{"citing_paper":"/paper/2506.03101"},"observation_digest":"sha256:e481250dc88a883fe6e27cb0414a31590a74c76e98d3b802c7420f4d7f998fb4","observation_id":"da5d1d79-2ee2-44fe-bd74-f25bcff46402","resolution":{"observed_at":"2026-08-07T11:18:08.036387Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:18:08.117686Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.03101","last_updated":"2025-06-03T17:35:56Z","snapshot_observed_at":"2026-08-08T07:38:04.360811Z","submitted_at":"2025-06-03T17:35:56Z","title":"Beyond Text Compression: Evaluating Tokenizers Across Scales","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-07T11:18:08.117686Z"},"links":{"citing_paper":"/paper/2506.03101"},"observation_digest":"sha256:214a9c90071981e69f3a3220d658dc585f3696cf4a0dfbdd5b63b767ed9d754e","observation_id":"c55b8ebf-fe9a-44b8-9552-f7ac219781b0","resolution":{"observed_at":"2026-08-07T11:18:08.117686Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1007/978-94-015-9273-4_9","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T00:03:45.533247Z","title":null,"venue":"Text, speech and language technology","work_id":"a9c7fac1-4f87-4648-93dc-3fec8080f63f","year":1999},"citing_paper":{"arxiv_id":"2506.03101","last_updated":"2025-06-03T17:35:56Z","snapshot_observed_at":"2026-08-08T07:38:04.360811Z","submitted_at":"2025-06-03T17:35:56Z","title":"Beyond Text Compression: Evaluating Tokenizers Across Scales","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-07T11:18:08.247627Z"},"links":{"citing_paper":"/paper/2506.03101"},"observation_digest":"sha256:958d4f9605e42925d32f8634dcc91cfded23b7e09b7e778fc307a618210d2d19","observation_id":"740cdedb-83ad-472f-888d-0dc4fe9cf351","resolution":{"observed_at":"2026-08-07T11:18:17.988894Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:18:08.342932Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03101","last_updated":"2025-06-03T17:35:56Z","snapshot_observed_at":"2026-08-08T07:38:04.360811Z","submitted_at":"2025-06-03T17:35:56Z","title":"Beyond Text Compression: Evaluating Tokenizers Across Scales","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-07T11:18:08.342932Z"},"links":{"citing_paper":"/paper/2506.03101"},"observation_digest":"sha256:535e839cd3c2165b3a7b1c5cdd90859fa8457103f951eacc8df3cc849178679f","observation_id":"e44f1d44-8dfb-4867-bbe1-483cc4b8146c","resolution":{"observed_at":"2026-08-07T11:18:08.342932Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.11644","last_updated":"2023-10-02T06:12:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-20T16:14:25Z","title":"Textbooks Are All You Need","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.11644","snapshot_observed_at":"2026-08-07T11:18:08.440449Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03101","last_updated":"2025-06-03T17:35:56Z","snapshot_observed_at":"2026-08-08T07:38:04.360811Z","submitted_at":"2025-06-03T17:35:56Z","title":"Beyond Text Compression: Evaluating Tokenizers Across Scales","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-07T11:18:08.440449Z"},"links":{"cited_paper":"/paper/2306.11644","citing_paper":"/paper/2506.03101"},"observation_digest":"sha256:7441d55633ef2ad100071fff885bd1c6c9f513c13b01de68c0a56df6c792b093","observation_id":"63a22720-bf90-40fc-b953-dd5df9d4ee02","resolution":{"observed_at":"2026-08-07T11:18:08.440449Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:18:08.561372Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03101","last_updated":"2025-06-03T17:35:56Z","snapshot_observed_at":"2026-08-08T07:38:04.360811Z","submitted_at":"2025-06-03T17:35:56Z","title":"Beyond Text Compression: Evaluating Tokenizers Across Scales","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-07T11:18:08.561372Z"},"links":{"citing_paper":"/paper/2506.03101"},"observation_digest":"sha256:2c28fc0cca10007a052306641aed1b32ab3848daae19d41f60ee7f6cfeb44bbb","observation_id":"5c9278dd-a2de-4a63-ad11-1a1676bbd6c8","resolution":{"observed_at":"2026-08-07T11:18:08.561372Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:18:08.675351Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.03101","last_updated":"2025-06-03T17:35:56Z","snapshot_observed_at":"2026-08-08T07:38:04.360811Z","submitted_at":"2025-06-03T17:35:56Z","title":"Beyond Text Compression: Evaluating Tokenizers Across Scales","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-07T11:18:08.675351Z"},"links":{"citing_paper":"/paper/2506.03101"},"observation_digest":"sha256:3a3955fad1aa89c093104167dd63554c58fb1ece985cbc03de4c438ac69fc506","observation_id":"a6914ab0-9bcb-4dd9-bbdf-8dde1acaac99","resolution":{"observed_at":"2026-08-07T11:18:08.675351Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:18:08.791173Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.03101","last_updated":"2025-06-03T17:35:56Z","snapshot_observed_at":"2026-08-08T07:38:04.360811Z","submitted_at":"2025-06-03T17:35:56Z","title":"Beyond Text Compression: Evaluating Tokenizers Across Scales","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-07T11:18:08.791173Z"},"links":{"citing_paper":"/paper/2506.03101"},"observation_digest":"sha256:dc1efe070015f0344568ffb47bf29d34d2a30b7a9f6327cca112fa8f77396f3c","observation_id":"52c2e28f-c152-4e4a-9c41-6b3bf3b4912f","resolution":{"observed_at":"2026-08-07T11:18:08.791173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:18:08.882270Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.03101","last_updated":"2025-06-03T17:35:56Z","snapshot_observed_at":"2026-08-08T07:38:04.360811Z","submitted_at":"2025-06-03T17:35:56Z","title":"Beyond Text Compression: Evaluating Tokenizers Across Scales","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-07T11:18:08.882270Z"},"links":{"citing_paper":"/paper/2506.03101"},"observation_digest":"sha256:6109424c00065e650e69fbbd925d67ca9394dd104f89a1eb4b27199a141ff97b","observation_id":"24caf797-10b0-4587-9305-4a66b7c9515c","resolution":{"observed_at":"2026-08-07T11:18:08.882270Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:18:08.980622Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.03101","last_updated":"2025-06-03T17:35:56Z","snapshot_observed_at":"2026-08-08T07:38:04.360811Z","submitted_at":"2025-06-03T17:35:56Z","title":"Beyond Text Compression: Evaluating Tokenizers Across Scales","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-07T11:18:08.980622Z"},"links":{"citing_paper":"/paper/2506.03101"},"observation_digest":"sha256:5f87e4fc1ee59600186b086a2c4977c5226b16f41b2cc1281db669cabdd4f7e5","observation_id":"565c93fb-a92d-438a-9a1d-c3905e22582e","resolution":{"observed_at":"2026-08-07T11:18:08.980622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06825","last_updated":"2023-10-10T17:54:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-10T17:54:58Z","title":"Mistral 7B","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06825","snapshot_observed_at":"2026-08-07T11:18:09.106642Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03101","last_updated":"2025-06-03T17:35:56Z","snapshot_observed_at":"2026-08-08T07:38:04.360811Z","submitted_at":"2025-06-03T17:35:56Z","title":"Beyond Text Compression: Evaluating Tokenizers Across Scales","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-07T11:18:09.106642Z"},"links":{"cited_paper":"/paper/2310.06825","citing_paper":"/paper/2506.03101"},"observation_digest":"sha256:7d63044bedde126c8b0c74e389684e4c740dcfdbbf9d0768b5e6d07ee24813e7","observation_id":"e25dc7b8-e07c-4fbf-87f7-50d5a27dbb91","resolution":{"observed_at":"2026-08-07T11:18:09.106642Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:18:09.225849Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03101","last_updated":"2025-06-03T17:35:56Z","snapshot_observed_at":"2026-08-08T07:38:04.360811Z","submitted_at":"2025-06-03T17:35:56Z","title":"Beyond Text Compression: Evaluating Tokenizers Across Scales","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-07T11:18:09.225849Z"},"links":{"citing_paper":"/paper/2506.03101"},"observation_digest":"sha256:39143ee315214e59dba7ea3deb62e0be3dca0863bc6c856a179304e97fe14436","observation_id":"8f0de661-2f62-465a-982a-d27d765933e6","resolution":{"observed_at":"2026-08-07T11:18:09.225849Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-07-06T08:52:12.656082Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-08-07T11:18:09.372380Z","title":"Brown, Benjamin Chess, Rewon Child, Scott Gray, Alec Radford, Jeffrey Wu, and Dario Amodei","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.03101","last_updated":"2025-06-03T17:35:56Z","snapshot_observed_at":"2026-08-08T07:38:04.360811Z","submitted_at":"2025-06-03T17:35:56Z","title":"Beyond Text Compression: Evaluating Tokenizers Across Scales","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-07T11:18:09.372380Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2506.03101"},"observation_digest":"sha256:e370242548fb5d6f7fdb6af23a1d939f3ff08524316fb502e7f3f6e0509c149e","observation_id":"319d5dd3-d24c-4af6-8023-647eb87e158d","resolution":{"observed_at":"2026-08-07T11:18:09.372380Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:18:09.484927Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.03101","last_updated":"2025-06-03T17:35:56Z","snapshot_observed_at":"2026-08-08T07:38:04.360811Z","submitted_at":"2025-06-03T17:35:56Z","title":"Beyond Text Compression: Evaluating Tokenizers Across Scales","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-07T11:18:09.484927Z"},"links":{"citing_paper":"/paper/2506.03101"},"observation_digest":"sha256:f48b4b8d02cbc13ec4c9a20a4cc2c067c5db9d9464125e3380387fb0ae861cdc","observation_id":"8b502fea-09fe-4b0c-ae30-f4ebc6a4dcbf","resolution":{"observed_at":"2026-08-07T11:18:09.484927Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:18:09.591834Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.03101","last_updated":"2025-06-03T17:35:56Z","snapshot_observed_at":"2026-08-08T07:38:04.360811Z","submitted_at":"2025-06-03T17:35:56Z","title":"Beyond Text Compression: Evaluating Tokenizers Across Scales","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-07T11:18:09.591834Z"},"links":{"citing_paper":"/paper/2506.03101"},"observation_digest":"sha256:db767b3267bb9c295664e09a649c5822f140f7655113e964ee5d6bc45fae488b","observation_id":"00090f23-7f6b-4275-bc0e-af616f420ff9","resolution":{"observed_at":"2026-08-07T11:18:09.591834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:18:09.689848Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.03101","last_updated":"2025-06-03T17:35:56Z","snapshot_observed_at":"2026-08-08T07:38:04.360811Z","submitted_at":"2025-06-03T17:35:56Z","title":"Beyond Text Compression: Evaluating Tokenizers Across Scales","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-07T11:18:09.689848Z"},"links":{"citing_paper":"/paper/2506.03101"},"observation_digest":"sha256:eea1850d6f4a41f87eed5415e6c43589a5915dc61779b7e4925b1326a253f6aa","observation_id":"3cf2ae28-bdf9-4405-b793-a4c57564b18a","resolution":{"observed_at":"2026-08-07T11:18:09.689848Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:18:09.787713Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.03101","last_updated":"2025-06-03T17:35:56Z","snapshot_observed_at":"2026-08-08T07:38:04.360811Z","submitted_at":"2025-06-03T17:35:56Z","title":"Beyond Text Compression: Evaluating Tokenizers Across Scales","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-07T11:18:09.787713Z"},"links":{"citing_paper":"/paper/2506.03101"},"observation_digest":"sha256:1d01e0b5ca022ab6112af513514df86b134ac5e4f331eb2259fffd6d6d31ff68","observation_id":"7fe6aad3-7e27-4d94-871d-0a2900370592","resolution":{"observed_at":"2026-08-07T11:18:09.787713Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:18:09.895410Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03101","last_updated":"2025-06-03T17:35:56Z","snapshot_observed_at":"2026-08-08T07:38:04.360811Z","submitted_at":"2025-06-03T17:35:56Z","title":"Beyond Text Compression: Evaluating Tokenizers Across Scales","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-07T11:18:09.895410Z"},"links":{"citing_paper":"/paper/2506.03101"},"observation_digest":"sha256:5ad94b9eebd8c40eae438dec02ba23f2f76040c188bc425f60bfecd3c647775e","observation_id":"ab06eed3-e6c9-43e3-9696-2e31176b49f5","resolution":{"observed_at":"2026-08-07T11:18:09.895410Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2022.findings-emnlp.54","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":null,"venue":null,"work_id":"b72c6bac-e3b2-4505-a2db-12753cd14a6b","year":2022},"citing_paper":{"arxiv_id":"2506.03101","last_updated":"2025-06-03T17:35:56Z","snapshot_observed_at":"2026-08-08T07:38:04.360811Z","submitted_at":"2025-06-03T17:35:56Z","title":"Beyond Text Compression: Evaluating Tokenizers Across Scales","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-07T11:18:09.987544Z"},"links":{"citing_paper":"/paper/2506.03101"},"observation_digest":"sha256:364b531ba724828e697e194eaff621464e2773534a6120bae6d26cdd31077e8d","observation_id":"a6943edd-5246-483c-a5f0-183314b689c6","resolution":{"observed_at":"2026-08-07T11:18:17.734264Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:18:10.068738Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03101","last_updated":"2025-06-03T17:35:56Z","snapshot_observed_at":"2026-08-08T07:38:04.360811Z","submitted_at":"2025-06-03T17:35:56Z","title":"Beyond Text Compression: Evaluating Tokenizers Across Scales","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-07T11:18:10.068738Z"},"links":{"citing_paper":"/paper/2506.03101"},"observation_digest":"sha256:e18f39cb686358ef152a50b0e5a21d0f7a98211ccf0a93f0829f5456869f7cb5","observation_id":"e8cd2a43-6669-4255-ac03-3b6dc1feda00","resolution":{"observed_at":"2026-08-07T11:18:10.068738Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.05463","last_updated":"2023-09-11T14:01:45Z","snapshot_observed_at":"2026-08-02T22:47:03.212781Z","submitted_at":"2023-09-11T14:01:45Z","title":"Textbooks Are All You Need II: phi-1.5 technical report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.05463","snapshot_observed_at":"2026-08-07T11:18:10.145613Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03101","last_updated":"2025-06-03T17:35:56Z","snapshot_observed_at":"2026-08-08T07:38:04.360811Z","submitted_at":"2025-06-03T17:35:56Z","title":"Beyond Text Compression: Evaluating Tokenizers Across Scales","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-07T11:18:10.145613Z"},"links":{"cited_paper":"/paper/2309.05463","citing_paper":"/paper/2506.03101"},"observation_digest":"sha256:31e72ce2f78f56e41cd86adac92ccb1d3de514ae252e0389526b2639ccf4dff8","observation_id":"8d2abf67-cb9e-4412-8cee-d854bf49b495","resolution":{"observed_at":"2026-08-07T11:18:10.145613Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:18:10.256134Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.03101","last_updated":"2025-06-03T17:35:56Z","snapshot_observed_at":"2026-08-08T07:38:04.360811Z","submitted_at":"2025-06-03T17:35:56Z","title":"Beyond Text Compression: Evaluating Tokenizers Across Scales","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-07T11:18:10.256134Z"},"links":{"citing_paper":"/paper/2506.03101"},"observation_digest":"sha256:fc62471ae57b25e36e63ac6b1f1327233e06d8074e0c562e3ad87d8271c8deab","observation_id":"e230d674-e1cc-4504-84f8-5f03ea259358","resolution":{"observed_at":"2026-08-07T11:18:10.256134Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1907.11692","last_updated":"2019-07-26T17:48:29Z","snapshot_observed_at":"2026-07-31T22:31:37.910868Z","submitted_at":"2019-07-26T17:48:29Z","title":"RoBERTa: A Robustly Optimized BERT Pretraining Approach","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.11692","snapshot_observed_at":"2026-08-07T11:18:10.369296Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.03101","last_updated":"2025-06-03T17:35:56Z","snapshot_observed_at":"2026-08-08T07:38:04.360811Z","submitted_at":"2025-06-03T17:35:56Z","title":"Beyond Text Compression: Evaluating Tokenizers Across Scales","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-07T11:18:10.369296Z"},"links":{"cited_paper":"/paper/1907.11692","citing_paper":"/paper/2506.03101"},"observation_digest":"sha256:b075f9a86b1572a675c7fd4b1cde431820553ce8d8bc6975667d4a69c9226b9f","observation_id":"4a290e74-e832-4dc5-b9bb-bc142b51dc30","resolution":{"observed_at":"2026-08-07T11:18:10.369296Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:18:10.479679Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03101","last_updated":"2025-06-03T17:35:56Z","snapshot_observed_at":"2026-08-08T07:38:04.360811Z","submitted_at":"2025-06-03T17:35:56Z","title":"Beyond Text Compression: Evaluating Tokenizers Across Scales","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-07T11:18:10.479679Z"},"links":{"citing_paper":"/paper/2506.03101"},"observation_digest":"sha256:ed44920fea4d93c0ee276dd95d06bd110065e3842c70d57184767eba9a241b5f","observation_id":"6ecbbf51-9fd6-48d2-abd0-8e4c18719ba1","resolution":{"observed_at":"2026-08-07T11:18:10.479679Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:18:10.561782Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.03101","last_updated":"2025-06-03T17:35:56Z","snapshot_observed_at":"2026-08-08T07:38:04.360811Z","submitted_at":"2025-06-03T17:35:56Z","title":"Beyond Text Compression: Evaluating Tokenizers Across Scales","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-07T11:18:10.561782Z"},"links":{"citing_paper":"/paper/2506.03101"},"observation_digest":"sha256:e88587dc19d65d492bf29da89421a163da1836f93804773340a2ae5c4260a14f","observation_id":"31ce1af2-af14-454f-8f8f-83a10cf34168","resolution":{"observed_at":"2026-08-07T11:18:10.561782Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:18:10.668349Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.03101","last_updated":"2025-06-03T17:35:56Z","snapshot_observed_at":"2026-08-08T07:38:04.360811Z","submitted_at":"2025-06-03T17:35:56Z","title":"Beyond Text Compression: Evaluating Tokenizers Across Scales","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-07T11:18:10.668349Z"},"links":{"citing_paper":"/paper/2506.03101"},"observation_digest":"sha256:7bdd8cbe199ee3e0ce12876013dddcfe701735eb183b6bd6987a2e130170f9ec","observation_id":"bebf1104-eb83-4e40-9812-f0a6f533e587","resolution":{"observed_at":"2026-08-07T11:18:10.668349Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10229","last_updated":"2024-06-14T17:59:54Z","snapshot_observed_at":"2026-08-08T08:53:15.205653Z","submitted_at":"2024-06-14T17:59:54Z","title":"Quantifying Variance in Evaluation Benchmarks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10229","snapshot_observed_at":"2026-08-07T11:18:10.760594Z","title":"Singh, Rylan Schaeffer, Andrew Poulton, Sanmi Koyejo, Pontus Stenetorp, Sharan Narang, and Dieuwke Hupkes","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03101","last_updated":"2025-06-03T17:35:56Z","snapshot_observed_at":"2026-08-08T07:38:04.360811Z","submitted_at":"2025-06-03T17:35:56Z","title":"Beyond Text Compression: Evaluating Tokenizers Across Scales","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-07T11:18:10.760594Z"},"links":{"cited_paper":"/paper/2406.10229","citing_paper":"/paper/2506.03101"},"observation_digest":"sha256:ca5f252ecfdc350479993c0e40924ef0b91d09dc8d6a3ce3ae1e2d72ab04448b","observation_id":"5238fcf6-3d49-42d7-95d7-957763d3bf49","resolution":{"observed_at":"2026-08-07T11:18:10.760594Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.16235","last_updated":"2024-09-24T16:51:36Z","snapshot_observed_at":"2026-07-06T19:21:20.826877Z","submitted_at":"2024-09-24T16:51:36Z","title":"EuroLLM: Multilingual Language Models for Europe","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.16235","snapshot_observed_at":"2026-08-07T11:18:10.846695Z","title":"Guerreiro, Ricardo Rei, Duarte M","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03101","last_updated":"2025-06-03T17:35:56Z","snapshot_observed_at":"2026-08-08T07:38:04.360811Z","submitted_at":"2025-06-03T17:35:56Z","title":"Beyond Text Compression: Evaluating Tokenizers Across Scales","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-07T11:18:10.846695Z"},"links":{"cited_paper":"/paper/2409.16235","citing_paper":"/paper/2506.03101"},"observation_digest":"sha256:5650edf304245ac3023609a3e6a4a30d5c1b2f8066b42e1c96bfea614b599a5f","observation_id":"540dc138-6d8f-400e-b5f5-07af25a2348c","resolution":{"observed_at":"2026-08-07T11:18:10.846695Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14619","last_updated":"2024-05-02T00:30:57Z","snapshot_observed_at":"2026-07-06T18:04:04.541434Z","submitted_at":"2024-04-22T23:12:03Z","title":"OpenELM: An Efficient Language Model Family with Open Training and Inference Framework","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14619","snapshot_observed_at":"2026-08-07T11:18:10.936438Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03101","last_updated":"2025-06-03T17:35:56Z","snapshot_observed_at":"2026-08-08T07:38:04.360811Z","submitted_at":"2025-06-03T17:35:56Z","title":"Beyond Text Compression: Evaluating Tokenizers Across Scales","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-07T11:18:10.936438Z"},"links":{"cited_paper":"/paper/2404.14619","citing_paper":"/paper/2506.03101"},"observation_digest":"sha256:9f7ea5f541bb73c8a09acfbd52ae0971c7b2aca93ad34c5ac439ca538f1a326e","observation_id":"bfa69431-9363-4bd4-b25d-0489ac2f9b6f","resolution":{"observed_at":"2026-08-07T11:18:10.936438Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.10508","last_updated":"2021-12-20T13:04:18Z","snapshot_observed_at":"2026-07-06T12:20:36.165718Z","submitted_at":"2021-12-20T13:04:18Z","title":"Between words and characters: A Brief History of Open-Vocabulary Modeling and Tokenization in NLP","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.10508","snapshot_observed_at":"2026-08-07T11:18:11.036474Z","title":"Mielke, Zaid Alyafeai, Elizabeth Salesky, Colin Raffel, Manan Dey, Matthias Gallé, Arun Raja, Chenglei Si, Wilson Y","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.03101","last_updated":"2025-06-03T17:35:56Z","snapshot_observed_at":"2026-08-08T07:38:04.360811Z","submitted_at":"2025-06-03T17:35:56Z","title":"Beyond Text Compression: Evaluating Tokenizers Across Scales","version":1},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-07T11:18:11.036474Z"},"links":{"cited_paper":"/paper/2112.10508","citing_paper":"/paper/2506.03101"},"observation_digest":"sha256:993a23060ded33275b82b28cbb01a9d5675c9235f482beb7ad6da65327835a1b","observation_id":"1f1860a8-eae6-4cc5-b178-70030171147b","resolution":{"observed_at":"2026-08-07T11:18:11.036474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1371/journal.pone.0147073","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":null,"venue":"PLoS ONE","work_id":"670881ee-c3af-4630-8052-cd9d46846947","year":2016},"citing_paper":{"arxiv_id":"2506.03101","last_updated":"2025-06-03T17:35:56Z","snapshot_observed_at":"2026-08-08T07:38:04.360811Z","submitted_at":"2025-06-03T17:35:56Z","title":"Beyond Text Compression: Evaluating Tokenizers Across Scales","version":1},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-07T11:18:11.112991Z"},"links":{"citing_paper":"/paper/2506.03101"},"observation_digest":"sha256:9265dfbb9aa992b1a740502280924cf25a1b295af8e70328b93dd7d96e53fd49","observation_id":"73f5ce08-3ac2-48b4-beaa-405c1d880c4f","resolution":{"observed_at":"2026-08-07T11:18:17.499233Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:18:11.209487Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.03101","last_updated":"2025-06-03T17:35:56Z","snapshot_observed_at":"2026-08-08T07:38:04.360811Z","submitted_at":"2025-06-03T17:35:56Z","title":"Beyond Text Compression: Evaluating Tokenizers Across Scales","version":1},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-07T11:18:11.209487Z"},"links":{"citing_paper":"/paper/2506.03101"},"observation_digest":"sha256:5033c579e1b80a0bb177642be9915f5f2c14ca885af6887ae79322920566c439","observation_id":"359e57fe-4196-460a-adcc-612268ad0af8","resolution":{"observed_at":"2026-08-07T11:18:11.209487Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:18:11.280660Z","title":"Cohen, and Mirella Lapata","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.03101","last_updated":"2025-06-03T17:35:56Z","snapshot_observed_at":"2026-08-08T07:38:04.360811Z","submitted_at":"2025-06-03T17:35:56Z","title":"Beyond Text Compression: Evaluating Tokenizers Across Scales","version":1},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-08-07T11:18:11.280660Z"},"links":{"citing_paper":"/paper/2506.03101"},"observation_digest":"sha256:3c8416752602c7eb4236b67e241139d567fdf0909d579f155b1f99823ec8f032","observation_id":"fc4f68f0-f8a2-42ea-bd7d-817258cdd395","resolution":{"observed_at":"2026-08-07T11:18:11.280660Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:18:11.367081Z","title":null,"venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2506.03101","last_updated":"2025-06-03T17:35:56Z","snapshot_observed_at":"2026-08-08T07:38:04.360811Z","submitted_at":"2025-06-03T17:35:56Z","title":"Beyond Text Compression: Evaluating Tokenizers Across Scales","version":1},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-08-07T11:18:11.367081Z"},"links":{"citing_paper":"/paper/2506.03101"},"observation_digest":"sha256:aaa5524304964c5be70f489cf70880d33c17897f42b70b6f2704848336f0757b","observation_id":"21b50d60-b4ff-4870-9cb1-45d6fbacc392","resolution":{"observed_at":"2026-08-07T11:18:11.367081Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:18:11.463249Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03101","last_updated":"2025-06-03T17:35:56Z","snapshot_observed_at":"2026-08-08T07:38:04.360811Z","submitted_at":"2025-06-03T17:35:56Z","title":"Beyond Text Compression: Evaluating Tokenizers Across Scales","version":1},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-08-07T11:18:11.463249Z"},"links":{"citing_paper":"/paper/2506.03101"},"observation_digest":"sha256:481afe97fa37b442ab83811702338a0c66505e7a0f61c76f0b68d7fdbccdb876","observation_id":"6cf5af2f-124d-4960-abf0-5f5c303fc6b5","resolution":{"observed_at":"2026-08-07T11:18:11.463249Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:18:11.661232Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.03101","last_updated":"2025-06-03T17:35:56Z","snapshot_observed_at":"2026-08-08T07:38:04.360811Z","submitted_at":"2025-06-03T17:35:56Z","title":"Beyond Text Compression: Evaluating Tokenizers Across Scales","version":1},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-08-07T11:18:11.661232Z"},"links":{"citing_paper":"/paper/2506.03101"},"observation_digest":"sha256:c0529444bfd2085826c07db83269538d91861900ab5b15885838a2dc1607c083","observation_id":"3d0884be-3e9b-49a5-89ea-c6b1bc45d5d2","resolution":{"observed_at":"2026-08-07T11:18:11.661232Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:18:11.805599Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03101","last_updated":"2025-06-03T17:35:56Z","snapshot_observed_at":"2026-08-08T07:38:04.360811Z","submitted_at":"2025-06-03T17:35:56Z","title":"Beyond Text Compression: Evaluating Tokenizers Across Scales","version":1},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-08-07T11:18:11.805599Z"},"links":{"citing_paper":"/paper/2506.03101"},"observation_digest":"sha256:f8d297651580559e36c2050d3c0377c7be86e9559cde7cd3ad81c76ad2009790","observation_id":"b6d973b2-7966-418d-bc12-7115fd51a42d","resolution":{"observed_at":"2026-08-07T11:18:11.805599Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:18:11.932518Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03101","last_updated":"2025-06-03T17:35:56Z","snapshot_observed_at":"2026-08-08T07:38:04.360811Z","submitted_at":"2025-06-03T17:35:56Z","title":"Beyond Text Compression: Evaluating Tokenizers Across Scales","version":1},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-08-07T11:18:11.932518Z"},"links":{"citing_paper":"/paper/2506.03101"},"observation_digest":"sha256:2a730860e37af54de8f27cfe0f2a3ff88d2d1e30852be39b2ed2b061c0d958e8","observation_id":"0ae96064-5f7d-4959-8f02-bc3fd4eabfed","resolution":{"observed_at":"2026-08-07T11:18:11.932518Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:18:12.033622Z","title":"Piantadosi","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2506.03101","last_updated":"2025-06-03T17:35:56Z","snapshot_observed_at":"2026-08-08T07:38:04.360811Z","submitted_at":"2025-06-03T17:35:56Z","title":"Beyond Text Compression: Evaluating Tokenizers Across Scales","version":1},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-08-07T11:18:12.033622Z"},"links":{"citing_paper":"/paper/2506.03101"},"observation_digest":"sha256:0fab7326f582a2444917e23de574b6d881b56840b319e7b2dbf8b3953e06c75f","observation_id":"26fa3877-586e-4652-8c59-1cb7928bc5e4","resolution":{"observed_at":"2026-08-07T11:18:12.033622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:18:12.183114Z","title":null,"venue":null,"work_id":null,"year":1999},"citing_paper":{"arxiv_id":"2506.03101","last_updated":"2025-06-03T17:35:56Z","snapshot_observed_at":"2026-08-08T07:38:04.360811Z","submitted_at":"2025-06-03T17:35:56Z","title":"Beyond Text Compression: Evaluating Tokenizers Across Scales","version":1},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-08-07T11:18:12.183114Z"},"links":{"citing_paper":"/paper/2506.03101"},"observation_digest":"sha256:c057713fdde041ef53315dda444b6d7f2db51e9e12961b9783f8cc7057356d30","observation_id":"9d2c61dd-a140-432e-879d-f32c93683d5b","resolution":{"observed_at":"2026-08-07T11:18:12.183114Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:18:12.258769Z","title":null,"venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.03101","last_updated":"2025-06-03T17:35:56Z","snapshot_observed_at":"2026-08-08T07:38:04.360811Z","submitted_at":"2025-06-03T17:35:56Z","title":"Beyond Text Compression: Evaluating Tokenizers Across Scales","version":1},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-08-07T11:18:12.258769Z"},"links":{"citing_paper":"/paper/2506.03101"},"observation_digest":"sha256:f3e6ff9a79fa6f3f54d2e8d099708ba9aca23f4796dfe3aa0fba07d8ea0c83b0","observation_id":"3ebb3c47-936a-42ee-bb09-488a0d7d3e0b","resolution":{"observed_at":"2026-08-07T11:18:12.258769Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:18:12.413526Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.03101","last_updated":"2025-06-03T17:35:56Z","snapshot_observed_at":"2026-08-08T07:38:04.360811Z","submitted_at":"2025-06-03T17:35:56Z","title":"Beyond Text Compression: Evaluating Tokenizers Across Scales","version":1},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-08-07T11:18:12.413526Z"},"links":{"citing_paper":"/paper/2506.03101"},"observation_digest":"sha256:fa0465fc1e3c69c8e903f2ac2cc8f005ffe1052ed55b2e11f48ad9ec720d19f2","observation_id":"937aa1cb-69c9-4a93-95f9-15293de41560","resolution":{"observed_at":"2026-08-07T11:18:12.413526Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:18:12.561226Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.03101","last_updated":"2025-06-03T17:35:56Z","snapshot_observed_at":"2026-08-08T07:38:04.360811Z","submitted_at":"2025-06-03T17:35:56Z","title":"Beyond Text Compression: Evaluating Tokenizers Across Scales","version":1},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-08-07T11:18:12.561226Z"},"links":{"citing_paper":"/paper/2506.03101"},"observation_digest":"sha256:8861be5064d66e9b84d6edaae032318291c692ec53b176c62663c2838d7303ee","observation_id":"d9b3bb16-4262-4e2b-b92a-9aba614bce3b","resolution":{"observed_at":"2026-08-07T11:18:12.561226Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:18:12.632455Z","title":"Lotz, Emanuele Bugliarello, Elizabeth Salesky, Miryam de Lhoneux, and Desmond Elliott","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03101","last_updated":"2025-06-03T17:35:56Z","snapshot_observed_at":"2026-08-08T07:38:04.360811Z","submitted_at":"2025-06-03T17:35:56Z","title":"Beyond Text Compression: Evaluating Tokenizers Across Scales","version":1},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-08-07T11:18:12.632455Z"},"links":{"citing_paper":"/paper/2506.03101"},"observation_digest":"sha256:2b34ad48a73d34d170be112c6442a9def93681c002c2152a4feacf82f8f15766","observation_id":"ae30daef-99fc-4d8d-a055-e266d800569c","resolution":{"observed_at":"2026-08-07T11:18:12.632455Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:18:12.695399Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.03101","last_updated":"2025-06-03T17:35:56Z","snapshot_observed_at":"2026-08-08T07:38:04.360811Z","submitted_at":"2025-06-03T17:35:56Z","title":"Beyond Text Compression: Evaluating Tokenizers Across Scales","version":1},"reference_index":84,"source":"arxiv_source","source_observed_at":"2026-08-07T11:18:12.695399Z"},"links":{"citing_paper":"/paper/2506.03101"},"observation_digest":"sha256:f58ec11f34f0ea209a4c4685e4aafc5c080db0d2942884cd4eb43f2faa76bb22","observation_id":"a365935b-c168-4afa-8a0a-48007419994e","resolution":{"observed_at":"2026-08-07T11:18:12.695399Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:18:12.764203Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.03101","last_updated":"2025-06-03T17:35:56Z","snapshot_observed_at":"2026-08-08T07:38:04.360811Z","submitted_at":"2025-06-03T17:35:56Z","title":"Beyond Text Compression: Evaluating Tokenizers Across Scales","version":1},"reference_index":85,"source":"arxiv_source","source_observed_at":"2026-08-07T11:18:12.764203Z"},"links":{"citing_paper":"/paper/2506.03101"},"observation_digest":"sha256:64ad4fecef7316b2792d22a469918ee047dd182b5f86bad9a60ee39da2285e72","observation_id":"9627f0f7-968b-455b-a339-0e5c5a63250b","resolution":{"observed_at":"2026-08-07T11:18:12.764203Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:18:12.845798Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.03101","last_updated":"2025-06-03T17:35:56Z","snapshot_observed_at":"2026-08-08T07:38:04.360811Z","submitted_at":"2025-06-03T17:35:56Z","title":"Beyond Text Compression: Evaluating Tokenizers Across Scales","version":1},"reference_index":86,"source":"arxiv_source","source_observed_at":"2026-08-07T11:18:12.845798Z"},"links":{"citing_paper":"/paper/2506.03101"},"observation_digest":"sha256:e61b9e8b0f510a1a739d40760a93dc78e7e80e705a19ec5f846ef8c968e8395b","observation_id":"2b06034d-63d7-4b84-a4c5-23f6180324ee","resolution":{"observed_at":"2026-08-07T11:18:12.845798Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:18:12.896255Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03101","last_updated":"2025-06-03T17:35:56Z","snapshot_observed_at":"2026-08-08T07:38:04.360811Z","submitted_at":"2025-06-03T17:35:56Z","title":"Beyond Text Compression: Evaluating Tokenizers Across Scales","version":1},"reference_index":87,"source":"arxiv_source","source_observed_at":"2026-08-07T11:18:12.896255Z"},"links":{"citing_paper":"/paper/2506.03101"},"observation_digest":"sha256:08343ec77eebe5ce04498709e562337bac921b85f8e78d4dc64e3eba2148ff3a","observation_id":"52deed35-d3df-4ac0-b813-0ed484c08f11","resolution":{"observed_at":"2026-08-07T11:18:12.896255Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:18:12.947600Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03101","last_updated":"2025-06-03T17:35:56Z","snapshot_observed_at":"2026-08-08T07:38:04.360811Z","submitted_at":"2025-06-03T17:35:56Z","title":"Beyond Text Compression: Evaluating Tokenizers Across Scales","version":1},"reference_index":88,"source":"arxiv_source","source_observed_at":"2026-08-07T11:18:12.947600Z"},"links":{"citing_paper":"/paper/2506.03101"},"observation_digest":"sha256:a89f72382d484b02fd3482efc0c02480f9c72ad2d9ab66f4e3b4acbc05423c42","observation_id":"b4346a01-bb6f-4b4a-8594-f175d1180668","resolution":{"observed_at":"2026-08-07T11:18:12.947600Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:18:13.032957Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.03101","last_updated":"2025-06-03T17:35:56Z","snapshot_observed_at":"2026-08-08T07:38:04.360811Z","submitted_at":"2025-06-03T17:35:56Z","title":"Beyond Text Compression: Evaluating Tokenizers Across Scales","version":1},"reference_index":89,"source":"arxiv_source","source_observed_at":"2026-08-07T11:18:13.032957Z"},"links":{"citing_paper":"/paper/2506.03101"},"observation_digest":"sha256:b49c04fb32e9c995d02b64fa7d8423cdac5ced4e1fcadd07203657d86271415c","observation_id":"c3b2e0b9-5bb3-4061-bf0f-e5084cc5207b","resolution":{"observed_at":"2026-08-07T11:18:13.032957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:18:13.126730Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.03101","last_updated":"2025-06-03T17:35:56Z","snapshot_observed_at":"2026-08-08T07:38:04.360811Z","submitted_at":"2025-06-03T17:35:56Z","title":"Beyond Text Compression: Evaluating Tokenizers Across Scales","version":1},"reference_index":90,"source":"arxiv_source","source_observed_at":"2026-08-07T11:18:13.126730Z"},"links":{"citing_paper":"/paper/2506.03101"},"observation_digest":"sha256:bf602f605b20ccfc0b3be19d5f6fc4839edefc96f7c482c9881cb7b5fbc75046","observation_id":"157e39f0-044c-4f50-8206-b17679b21e52","resolution":{"observed_at":"2026-08-07T11:18:13.126730Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:18:13.229601Z","title":null,"venue":null,"work_id":null,"year":1948},"citing_paper":{"arxiv_id":"2506.03101","last_updated":"2025-06-03T17:35:56Z","snapshot_observed_at":"2026-08-08T07:38:04.360811Z","submitted_at":"2025-06-03T17:35:56Z","title":"Beyond Text Compression: Evaluating Tokenizers Across Scales","version":1},"reference_index":91,"source":"arxiv_source","source_observed_at":"2026-08-07T11:18:13.229601Z"},"links":{"citing_paper":"/paper/2506.03101"},"observation_digest":"sha256:829b886798548c7479491df7700d7897202a394b879cdf0c7276b557033dcec0","observation_id":"ff192319-338f-4b77-b107-51e05a8d64ba","resolution":{"observed_at":"2026-08-07T11:18:13.229601Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.08053","last_updated":"2020-03-13T23:45:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-09-17T19:42:54Z","title":"Megatron-LM: Training Multi-Billion Parameter Language Models Using Model Parallelism","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.08053","snapshot_observed_at":"2026-08-07T11:18:13.316578Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.03101","last_updated":"2025-06-03T17:35:56Z","snapshot_observed_at":"2026-08-08T07:38:04.360811Z","submitted_at":"2025-06-03T17:35:56Z","title":"Beyond Text Compression: Evaluating Tokenizers Across Scales","version":1},"reference_index":92,"source":"arxiv_source","source_observed_at":"2026-08-07T11:18:13.316578Z"},"links":{"cited_paper":"/paper/1909.08053","citing_paper":"/paper/2506.03101"},"observation_digest":"sha256:541770238dbe71477e1b2d6a61599a8f59efc6cad31cb7a66248b8c0f185da56","observation_id":"6288b364-35b9-47af-a6bd-1f54380af221","resolution":{"observed_at":"2026-08-07T11:18:13.316578Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.14780","last_updated":"2023-04-28T11:40:48Z","snapshot_observed_at":"2026-07-06T15:21:12.034373Z","submitted_at":"2023-04-28T11:40:48Z","title":"Training and Evaluation of a Multilingual Tokenizer for GPT-SW3","version":1},"cited_work":{"arxiv_id":"2304.14780","doi":"10.48550/arxiv.2304.14780","metadata_source":"pith","pith_arxiv_id":"2304.14780","snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":"Training and Evaluation of a Multilingual Tokenizer for GPT-SW3","venue":"cs.CL","work_id":"39e6ea91-5073-4821-9c64-47881bc5eae3","year":2023},"citing_paper":{"arxiv_id":"2506.03101","last_updated":"2025-06-03T17:35:56Z","snapshot_observed_at":"2026-08-08T07:38:04.360811Z","submitted_at":"2025-06-03T17:35:56Z","title":"Beyond Text Compression: Evaluating Tokenizers Across Scales","version":1},"reference_index":93,"source":"arxiv_source","source_observed_at":"2026-08-07T11:18:13.420166Z"},"links":{"cited_paper":"/paper/2304.14780","citing_paper":"/paper/2506.03101"},"observation_digest":"sha256:c5142b4d70668bb7e35e9f000e6c3949185b58b827e74bfbc5820eada402c0bd","observation_id":"66597624-627e-4980-bbd1-62be5e071e4c","resolution":{"observed_at":"2026-08-07T11:18:17.225577Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2023.findings-eacl.128","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":null,"venue":null,"work_id":"81179dee-0581-4237-833b-966a675df425","year":2023},"citing_paper":{"arxiv_id":"2506.03101","last_updated":"2025-06-03T17:35:56Z","snapshot_observed_at":"2026-08-08T07:38:04.360811Z","submitted_at":"2025-06-03T17:35:56Z","title":"Beyond Text Compression: Evaluating Tokenizers Across Scales","version":1},"reference_index":94,"source":"arxiv_source","source_observed_at":"2026-08-07T11:18:13.506836Z"},"links":{"citing_paper":"/paper/2506.03101"},"observation_digest":"sha256:4abbe8078bd54915034ece458f868aa87858c55a834ba31906ae1ca0b3739e62","observation_id":"cff0d630-19eb-4d4c-a31f-49bc8c2a0299","resolution":{"observed_at":"2026-08-07T11:18:16.997488Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:18:13.575370Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03101","last_updated":"2025-06-03T17:35:56Z","snapshot_observed_at":"2026-08-08T07:38:04.360811Z","submitted_at":"2025-06-03T17:35:56Z","title":"Beyond Text Compression: Evaluating Tokenizers Across Scales","version":1},"reference_index":95,"source":"arxiv_source","source_observed_at":"2026-08-07T11:18:13.575370Z"},"links":{"citing_paper":"/paper/2506.03101"},"observation_digest":"sha256:08bec329e89d67629dac81f50c3ebb4a2749a3892fd41b7f98bae232e1612653","observation_id":"a9a9e660-378f-46fd-9522-9896d2781b27","resolution":{"observed_at":"2026-08-07T11:18:13.575370Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.16903","last_updated":"2025-07-25T05:09:17Z","snapshot_observed_at":"2026-08-10T02:05:33.826494Z","submitted_at":"2023-12-28T08:53:27Z","title":"Spike No More: Stabilizing the Pre-training of Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.16903","snapshot_observed_at":"2026-08-07T11:18:13.667569Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03101","last_updated":"2025-06-03T17:35:56Z","snapshot_observed_at":"2026-08-08T07:38:04.360811Z","submitted_at":"2025-06-03T17:35:56Z","title":"Beyond Text Compression: Evaluating Tokenizers Across Scales","version":1},"reference_index":96,"source":"arxiv_source","source_observed_at":"2026-08-07T11:18:13.667569Z"},"links":{"cited_paper":"/paper/2312.16903","citing_paper":"/paper/2506.03101"},"observation_digest":"sha256:4e4bb3c6caaf648696181bd0106bf2dbc1b89ead3590a0ac3e89f96ec9d567dd","observation_id":"6184a1d1-ae4a-47ff-ae75-e7bbb2156631","resolution":{"observed_at":"2026-08-07T11:18:13.667569Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:18:13.751835Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03101","last_updated":"2025-06-03T17:35:56Z","snapshot_observed_at":"2026-08-08T07:38:04.360811Z","submitted_at":"2025-06-03T17:35:56Z","title":"Beyond Text Compression: Evaluating Tokenizers Across Scales","version":1},"reference_index":97,"source":"arxiv_source","source_observed_at":"2026-08-07T11:18:13.751835Z"},"links":{"citing_paper":"/paper/2506.03101"},"observation_digest":"sha256:4121848a69be96fabfcfc49261ef8c22c2ff82d2b71453a06ae7901efd38ad38","observation_id":"30f482d7-3ba4-4b5f-8646-0b21723ac92a","resolution":{"observed_at":"2026-08-07T11:18:13.751835Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:18:13.817233Z","title":"Tran, Xavier Garcia, Jason Wei, Xuezhi Wang, Hyung Won Chung, Dara Bahri, Tal Schuster, Steven Zheng, Denny Zhou, Neil Houlsby, and Donald Metzler","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03101","last_updated":"2025-06-03T17:35:56Z","snapshot_observed_at":"2026-08-08T07:38:04.360811Z","submitted_at":"2025-06-03T17:35:56Z","title":"Beyond Text Compression: Evaluating Tokenizers Across Scales","version":1},"reference_index":98,"source":"arxiv_source","source_observed_at":"2026-08-07T11:18:13.817233Z"},"links":{"citing_paper":"/paper/2506.03101"},"observation_digest":"sha256:c0d8f0e4919a7920ba0ac4b0cb5a9a7f72458f06a1105b9d2e9ca309cdb290b2","observation_id":"06a37afa-c99d-4ce0-9d38-5c48ecc72ae6","resolution":{"observed_at":"2026-08-07T11:18:13.817233Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-07T11:18:13.951819Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03101","last_updated":"2025-06-03T17:35:56Z","snapshot_observed_at":"2026-08-08T07:38:04.360811Z","submitted_at":"2025-06-03T17:35:56Z","title":"Beyond Text Compression: Evaluating Tokenizers Across Scales","version":1},"reference_index":99,"source":"arxiv_source","source_observed_at":"2026-08-07T11:18:13.951819Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2506.03101"},"observation_digest":"sha256:54c24428e0d082067d07a293639142d70ad14ca3868aeb70549a50d602dbf06e","observation_id":"18775b14-1548-48d7-b1c9-fbff31dac10b","resolution":{"observed_at":"2026-08-07T11:18:13.951819Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-07T11:18:14.155802Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03101","last_updated":"2025-06-03T17:35:56Z","snapshot_observed_at":"2026-08-08T07:38:04.360811Z","submitted_at":"2025-06-03T17:35:56Z","title":"Beyond Text Compression: Evaluating Tokenizers Across Scales","version":1},"reference_index":100,"source":"arxiv_source","source_observed_at":"2026-08-07T11:18:14.155802Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2506.03101"},"observation_digest":"sha256:edb34225ab9db2218b9460b29d16454d609c9c2b3eee7320ff8982b1779b9cd5","observation_id":"4a2ceeba-c8bd-4043-8243-a873666a5673","resolution":{"observed_at":"2026-08-07T11:18:14.155802Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.03101","last_updated":"2025-06-03T17:35:56Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-08T07:38:04.360811Z","submitted_at":"2025-06-03T17:35:56Z","title":"Beyond Text Compression: Evaluating Tokenizers Across Scales"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":93,"verified_exact":7,"verified_fuzzy":0},"total_outbound_references":119},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 100 of 119 outbound references and 0 inbound Pith citation observations for arXiv:2506.03101."}