{"as_of":"2026-08-15T19:00:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:74f2cba6f12aeefedd9bea2d13756ec9af6ff11277235fd2c34449c9974d2892","coverage":[{"denominator":35,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":35,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T15:19:17.012836Z","state":"measured"},{"denominator":35,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":35,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.16323/citation-record","integrity":"/paper/2507.16323/integrity","json":"/paper/2507.16323/citation-record.json","paper":"/paper/2507.16323"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"7910.17791","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:19:17.298690Z","title":"A new algorithm for data compression","venue":null,"work_id":"87376890-f570-46c1-b574-259c48a15667","year":1994},"citing_paper":{"arxiv_id":"2507.16323","last_updated":"2025-07-22T08:07:06Z","snapshot_observed_at":"2026-08-13T03:19:43.429475Z","submitted_at":"2025-07-22T08:07:06Z","title":"SpeLLM: Character-Level Multi-Head Decoding","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T15:19:16.918735Z"},"links":{"citing_paper":"/paper/2507.16323"},"observation_digest":"sha256:03cca46fc048ad444e2fd7897544721a6807a9c234f295feb836e3f3ed070682","observation_id":"5ebcf8dc-70f1-4854-b083-3987f5d9a141","resolution":{"observed_at":"2026-08-06T15:19:17.302442Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1508.07909","last_updated":"2016-06-10T14:45:08Z","snapshot_observed_at":"2026-08-13T18:41:35.355818Z","submitted_at":"2015-08-31T16:37:31Z","title":"Neural Machine Translation of Rare Words with Subword Units","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1508.07909","snapshot_observed_at":"2026-08-06T15:19:16.922411Z","title":"Neural Machine Translation of Rare Words with Subword Units","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2507.16323","last_updated":"2025-07-22T08:07:06Z","snapshot_observed_at":"2026-08-13T03:19:43.429475Z","submitted_at":"2025-07-22T08:07:06Z","title":"SpeLLM: Character-Level Multi-Head Decoding","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T15:19:16.922411Z"},"links":{"cited_paper":"/paper/1508.07909","citing_paper":"/paper/2507.16323"},"observation_digest":"sha256:f3143f2a8dde28df1c55992d2fb57025634f2ea73d2338be9a94024369b73053","observation_id":"186c0948-d305-433c-97e0-694897ad8467","resolution":{"observed_at":"2026-08-06T15:19:16.922411Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-06T15:19:16.925226Z","title":"The Llama 3 Herd of Models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.16323","last_updated":"2025-07-22T08:07:06Z","snapshot_observed_at":"2026-08-13T03:19:43.429475Z","submitted_at":"2025-07-22T08:07:06Z","title":"SpeLLM: Character-Level Multi-Head Decoding","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T15:19:16.925226Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2507.16323"},"observation_digest":"sha256:b94838a8d5b00f77e2ef00d43839b9f79fd198c121daca159e243b1e8a894685","observation_id":"270fd262-2d24-4068-a12c-90dcd69305b1","resolution":{"observed_at":"2026-08-06T15:19:16.925226Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:19:16.928045Z","title":"Gemma 2: Improv- ing Open Language Models at a Practical Size","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.16323","last_updated":"2025-07-22T08:07:06Z","snapshot_observed_at":"2026-08-13T03:19:43.429475Z","submitted_at":"2025-07-22T08:07:06Z","title":"SpeLLM: Character-Level Multi-Head Decoding","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T15:19:16.928045Z"},"links":{"citing_paper":"/paper/2507.16323"},"observation_digest":"sha256:092b5d357db4d282f3e8bf2865f4dbebff2679f8708ead3a324604462371f924","observation_id":"7261426e-2a4c-4606-9029-5c0cc507b9ef","resolution":{"observed_at":"2026-08-06T15:19:16.928045Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:19:16.931347Z","title":"Do all languages cost the same? tokenization in the era of commercial language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.16323","last_updated":"2025-07-22T08:07:06Z","snapshot_observed_at":"2026-08-13T03:19:43.429475Z","submitted_at":"2025-07-22T08:07:06Z","title":"SpeLLM: Character-Level Multi-Head Decoding","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T15:19:16.931347Z"},"links":{"citing_paper":"/paper/2507.16323"},"observation_digest":"sha256:8c7971e9b543f8ef93e266d76d135f47cbbc23b6d6dcc6e25bddfd6cb564c202","observation_id":"5e0db424-262a-4df7-a490-4d1d5b4a2c45","resolution":{"observed_at":"2026-08-06T15:19:16.931347Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.16149","last_updated":"2023-09-29T11:51:51Z","snapshot_observed_at":"2026-08-13T10:24:03.359877Z","submitted_at":"2023-08-30T17:07:17Z","title":"Jais and Jais-chat: Arabic-Centric Foundation and Instruction-Tuned Open Generative Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.16149","snapshot_observed_at":"2026-08-06T15:19:16.934493Z","title":"Jais and jais-chat: Arabic-centric foundation and instruction-tuned open generative large language models, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.16323","last_updated":"2025-07-22T08:07:06Z","snapshot_observed_at":"2026-08-13T03:19:43.429475Z","submitted_at":"2025-07-22T08:07:06Z","title":"SpeLLM: Character-Level Multi-Head Decoding","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T15:19:16.934493Z"},"links":{"cited_paper":"/paper/2308.16149","citing_paper":"/paper/2507.16323"},"observation_digest":"sha256:1ca9122a9ae78a906572d9ab72f26157d1b2c14af6a2625565f4033baf251c22","observation_id":"c8c8da7a-cc3c-4150-8d43-ae6a796e6743","resolution":{"observed_at":"2026-08-06T15:19:16.934493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:19:17.345855Z","title":"Language model tokenizers introduce unfairness between languages","venue":null,"work_id":"f498ebe3-acb0-46c5-a0dd-149af515d2ad","year":2023},"citing_paper":{"arxiv_id":"2507.16323","last_updated":"2025-07-22T08:07:06Z","snapshot_observed_at":"2026-08-13T03:19:43.429475Z","submitted_at":"2025-07-22T08:07:06Z","title":"SpeLLM: Character-Level Multi-Head Decoding","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T15:19:16.937949Z"},"links":{"citing_paper":"/paper/2507.16323"},"observation_digest":"sha256:14db56d8a2f396c74109e5689ce7cd15f4097d9820bc43c2cf9097dad208519d","observation_id":"5c3ac7fe-313c-4a4d-82a4-ae89033ee9eb","resolution":{"observed_at":"2026-08-06T15:19:17.348538Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.07185","last_updated":"2023-05-19T21:09:11Z","snapshot_observed_at":"2026-08-13T11:44:04.808593Z","submitted_at":"2023-05-12T00:55:41Z","title":"MEGABYTE: Predicting Million-byte Sequences with Multiscale Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.07185","snapshot_observed_at":"2026-08-06T15:19:16.940215Z","title":"MEGABYTE: Predicting Million-byte Sequences with Multiscale Transformers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.16323","last_updated":"2025-07-22T08:07:06Z","snapshot_observed_at":"2026-08-13T03:19:43.429475Z","submitted_at":"2025-07-22T08:07:06Z","title":"SpeLLM: Character-Level Multi-Head Decoding","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T15:19:16.940215Z"},"links":{"cited_paper":"/paper/2305.07185","citing_paper":"/paper/2507.16323"},"observation_digest":"sha256:2a29b248f9d22bee94c481878f302b762fe52cdf0148c8c1da7eb9c26dd34339","observation_id":"f7c98384-9b4d-475c-b113-1333c85bd11e","resolution":{"observed_at":"2026-08-06T15:19:16.940215Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09871","last_updated":"2024-12-13T05:33:32Z","snapshot_observed_at":"2026-08-15T13:45:11.226724Z","submitted_at":"2024-12-13T05:33:32Z","title":"Byte Latent Transformer: Patches Scale Better Than Tokens","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.09871","snapshot_observed_at":"2026-08-06T15:19:16.943166Z","title":"Byte Latent Transformer: Patches Scale Better Than Tokens","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.16323","last_updated":"2025-07-22T08:07:06Z","snapshot_observed_at":"2026-08-13T03:19:43.429475Z","submitted_at":"2025-07-22T08:07:06Z","title":"SpeLLM: Character-Level Multi-Head Decoding","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T15:19:16.943166Z"},"links":{"cited_paper":"/paper/2412.09871","citing_paper":"/paper/2507.16323"},"observation_digest":"sha256:67cb12da9686efab7a1865dbd0cd1fca6a5b7a0f31860efc2543f5ee796f47ee","observation_id":"245cef04-c4a6-4041-b171-e7fca218e328","resolution":{"observed_at":"2026-08-06T15:19:16.943166Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.11193","last_updated":"2022-06-08T09:10:07Z","snapshot_observed_at":"2026-08-14T19:57:36.464469Z","submitted_at":"2021-08-25T11:48:05Z","title":"Models In a Spelling Bee: Language Models Implicitly Learn the Character Composition of Tokens","version":2},"cited_work":{"arxiv_id":"2108.11193","doi":"10.48550/arxiv.2108.11193","metadata_source":"pith","pith_arxiv_id":"2108.11193","snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":"Models In a Spelling Bee: Language Models Implicitly Learn the Character Composition of Tokens","venue":"cs.CL","work_id":"a7aa9648-3bcd-43bf-b51d-bfee36e401a8","year":2021},"citing_paper":{"arxiv_id":"2507.16323","last_updated":"2025-07-22T08:07:06Z","snapshot_observed_at":"2026-08-13T03:19:43.429475Z","submitted_at":"2025-07-22T08:07:06Z","title":"SpeLLM: Character-Level Multi-Head Decoding","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T15:19:16.945692Z"},"links":{"cited_paper":"/paper/2108.11193","citing_paper":"/paper/2507.16323"},"observation_digest":"sha256:07008d9135daef78bbd9675e58e0c40d51b61c4d377b490e7fc9176d5080bd64","observation_id":"0cb5616c-25cc-486e-aac7-191873976f6d","resolution":{"observed_at":"2026-08-06T15:19:17.186769Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.02608","last_updated":"2022-06-06T13:27:26Z","snapshot_observed_at":"2026-08-13T15:29:27.670839Z","submitted_at":"2022-06-06T13:27:26Z","title":"What do tokens know about their characters and how do they know it?","version":1},"cited_work":{"arxiv_id":"2206.02608","doi":null,"metadata_source":"pith","pith_arxiv_id":"2206.02608","snapshot_observed_at":"2026-08-06T15:19:17.231673Z","title":"What do tokens know about their characters and how do they know it?","venue":"cs.CL","work_id":"a816b9a8-0e09-453a-bc87-679fbbc5ca9b","year":2022},"citing_paper":{"arxiv_id":"2507.16323","last_updated":"2025-07-22T08:07:06Z","snapshot_observed_at":"2026-08-13T03:19:43.429475Z","submitted_at":"2025-07-22T08:07:06Z","title":"SpeLLM: Character-Level Multi-Head Decoding","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T15:19:16.948956Z"},"links":{"cited_paper":"/paper/2206.02608","citing_paper":"/paper/2507.16323"},"observation_digest":"sha256:307686cc51d834d8f324b8364928190f79f3aff64078e28eebef4ec1638c3f00","observation_id":"9192d1c9-37cf-4b15-b38a-64929256038e","resolution":{"observed_at":"2026-08-06T15:19:17.234460Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-14T02:43:01.480086Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-06T15:19:16.951711Z","title":"Training Verifiers to Solve Math Word Problems","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.16323","last_updated":"2025-07-22T08:07:06Z","snapshot_observed_at":"2026-08-13T03:19:43.429475Z","submitted_at":"2025-07-22T08:07:06Z","title":"SpeLLM: Character-Level Multi-Head Decoding","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T15:19:16.951711Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2507.16323"},"observation_digest":"sha256:580af1c1dd6c230bf083ff538879935395296f8b59b08e0ddac2b85f08041010","observation_id":"97039f1e-3c11-485f-ac59-9ddf20a39391","resolution":{"observed_at":"2026-08-06T15:19:16.951711Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1506.03340","last_updated":"2015-11-19T15:43:23Z","snapshot_observed_at":"2026-08-14T22:44:59.964244Z","submitted_at":"2015-06-10T14:54:39Z","title":"Teaching Machines to Read and Comprehend","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1506.03340","snapshot_observed_at":"2026-08-06T15:19:16.954054Z","title":"Teaching Machines to Read and Comprehend","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2507.16323","last_updated":"2025-07-22T08:07:06Z","snapshot_observed_at":"2026-08-13T03:19:43.429475Z","submitted_at":"2025-07-22T08:07:06Z","title":"SpeLLM: Character-Level Multi-Head Decoding","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T15:19:16.954054Z"},"links":{"cited_paper":"/paper/1506.03340","citing_paper":"/paper/2507.16323"},"observation_digest":"sha256:95da62d6e8ada36b7b4a6be7ee0565c9f82e445a8d3c7dffa7fa3d6f5b1278b7","observation_id":"3c03c5fc-4e5b-4ccf-a9a2-469a1174ba39","resolution":{"observed_at":"2026-08-06T15:19:16.954054Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.08351","last_updated":"2023-09-15T12:20:00Z","snapshot_observed_at":"2026-08-15T09:28:04.005538Z","submitted_at":"2023-09-15T12:20:00Z","title":"Headless Language Models: Learning without Predicting with Contrastive Weight Tying","version":1},"cited_work":{"arxiv_id":"2309.08351","doi":"10.48550/arxiv.2309.08351","metadata_source":"pith","pith_arxiv_id":"2309.08351","snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":"Headless Language Models: Learning without Predicting with Contrastive Weight Tying","venue":"cs.CL","work_id":"17d140e3-2d02-4866-bbd8-95b6694f0955","year":2023},"citing_paper":{"arxiv_id":"2507.16323","last_updated":"2025-07-22T08:07:06Z","snapshot_observed_at":"2026-08-13T03:19:43.429475Z","submitted_at":"2025-07-22T08:07:06Z","title":"SpeLLM: Character-Level Multi-Head Decoding","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T15:19:16.956368Z"},"links":{"cited_paper":"/paper/2309.08351","citing_paper":"/paper/2507.16323"},"observation_digest":"sha256:f6dbadd49489131618cdb51225ea6ea6f2fe208f538b1b209e01c82875389238","observation_id":"1326b273-1c82-4c7d-a75f-6deb4246d885","resolution":{"observed_at":"2026-08-06T15:19:17.162960Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.17557","last_updated":"2024-10-31T11:37:49Z","snapshot_observed_at":"2026-08-14T14:43:02.130172Z","submitted_at":"2024-06-25T13:50:56Z","title":"The FineWeb Datasets: Decanting the Web for the Finest Text Data at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.17557","snapshot_observed_at":"2026-08-06T15:19:16.958966Z","title":"The FineWeb Datasets: Decanting the Web for the Finest Text Data at Scale","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.16323","last_updated":"2025-07-22T08:07:06Z","snapshot_observed_at":"2026-08-13T03:19:43.429475Z","submitted_at":"2025-07-22T08:07:06Z","title":"SpeLLM: Character-Level Multi-Head Decoding","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T15:19:16.958966Z"},"links":{"cited_paper":"/paper/2406.17557","citing_paper":"/paper/2507.16323"},"observation_digest":"sha256:889b6f1d717411722dc21a4efe7bb4d558589bbc0c2fab37781be570a8cd5b84","observation_id":"7144c661-b181-4a4d-86bb-7b1d37f95d2a","resolution":{"observed_at":"2026-08-06T15:19:16.958966Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1905.10044","last_updated":"2019-05-24T05:48:49Z","snapshot_observed_at":"2026-08-14T15:52:43.138964Z","submitted_at":"2019-05-24T05:48:49Z","title":"BoolQ: Exploring the Surprising Difficulty of Natural Yes/No Questions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.10044","snapshot_observed_at":"2026-08-06T15:19:16.961408Z","title":"BoolQ: Exploring the Surprising Difficulty of Natural Yes/No Questions","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.16323","last_updated":"2025-07-22T08:07:06Z","snapshot_observed_at":"2026-08-13T03:19:43.429475Z","submitted_at":"2025-07-22T08:07:06Z","title":"SpeLLM: Character-Level Multi-Head Decoding","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T15:19:16.961408Z"},"links":{"cited_paper":"/paper/1905.10044","citing_paper":"/paper/2507.16323"},"observation_digest":"sha256:35f438bb8d2467f83c50d7de259c1b149a6ef421ef7c8152d40b6fb18baa562d","observation_id":"6da07750-1c17-4ac1-a0a1-5da691814834","resolution":{"observed_at":"2026-08-06T15:19:16.961408Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.05457","last_updated":"2018-03-14T18:04:21Z","snapshot_observed_at":"2026-08-14T19:36:07.505691Z","submitted_at":"2018-03-14T18:04:21Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.05457","snapshot_observed_at":"2026-08-06T15:19:16.964358Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.16323","last_updated":"2025-07-22T08:07:06Z","snapshot_observed_at":"2026-08-13T03:19:43.429475Z","submitted_at":"2025-07-22T08:07:06Z","title":"SpeLLM: Character-Level Multi-Head Decoding","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T15:19:16.964358Z"},"links":{"cited_paper":"/paper/1803.05457","citing_paper":"/paper/2507.16323"},"observation_digest":"sha256:573072fff97e49c94407b80a47982329534257976ee9c0a872cf442758bf7f58","observation_id":"8a199f57-e1fd-403e-bf94-d32da6b3a2ba","resolution":{"observed_at":"2026-08-06T15:19:16.964358Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:19:17.338615Z","title":"Efficient vocabulary reduction for small language models","venue":null,"work_id":"18fb4b03-ee65-4906-9500-db0288a3a91b","year":2025},"citing_paper":{"arxiv_id":"2507.16323","last_updated":"2025-07-22T08:07:06Z","snapshot_observed_at":"2026-08-13T03:19:43.429475Z","submitted_at":"2025-07-22T08:07:06Z","title":"SpeLLM: Character-Level Multi-Head Decoding","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T15:19:16.966931Z"},"links":{"citing_paper":"/paper/2507.16323"},"observation_digest":"sha256:7e087168f60ae0d513d322176aee61b776a335b9a3d2148aef76a147b1e787fc","observation_id":"a2572573-efdc-481f-aa99-3d907ebf5d58","resolution":{"observed_at":"2026-08-06T15:19:17.341045Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.19223","last_updated":"2025-01-07T16:20:17Z","snapshot_observed_at":"2026-08-13T23:15:13.862539Z","submitted_at":"2024-06-27T14:49:08Z","title":"T-FREE: Subword Tokenizer-Free Generative LLMs via Sparse Representations for Memory-Efficient Embeddings","version":2},"cited_work":{"arxiv_id":"2406.19223","doi":"10.48550/arxiv.2406.19223","metadata_source":"pith","pith_arxiv_id":"2406.19223","snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":"T-FREE: Subword Tokenizer-Free Generative LLMs via Sparse Representations for Memory-Efficient Embeddings","venue":"cs.CL","work_id":"5cbf50e3-8a40-4895-baea-a44650339caa","year":2024},"citing_paper":{"arxiv_id":"2507.16323","last_updated":"2025-07-22T08:07:06Z","snapshot_observed_at":"2026-08-13T03:19:43.429475Z","submitted_at":"2025-07-22T08:07:06Z","title":"SpeLLM: Character-Level Multi-Head Decoding","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T15:19:16.969137Z"},"links":{"cited_paper":"/paper/2406.19223","citing_paper":"/paper/2507.16323"},"observation_digest":"sha256:cd90779ea6894d30fc0bc77af3ca941d6b97ac2eb60aaffa63d813b0659cbfea","observation_id":"167698e1-f1d5-43b3-919a-c46c3cced097","resolution":{"observed_at":"2026-08-06T15:19:17.131959Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14856","last_updated":"2025-03-11T08:54:55Z","snapshot_observed_at":"2026-08-07T18:00:57.897767Z","submitted_at":"2025-02-20T18:58:10Z","title":"FR-Spec: Accelerating Large-Vocabulary Language Models via Frequency-Ranked Speculative Sampling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.14856","snapshot_observed_at":"2026-08-06T15:19:16.971760Z","title":"FR-Spec: Accelerating Large-V ocabulary Language Models via Frequency-Ranked Speculative Sampling","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.16323","last_updated":"2025-07-22T08:07:06Z","snapshot_observed_at":"2026-08-13T03:19:43.429475Z","submitted_at":"2025-07-22T08:07:06Z","title":"SpeLLM: Character-Level Multi-Head Decoding","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T15:19:16.971760Z"},"links":{"cited_paper":"/paper/2502.14856","citing_paper":"/paper/2507.16323"},"observation_digest":"sha256:4ec7975a06e9e1f9818a6f8bf5888ca9550a959d6b7e56f48844e4d7573d5627","observation_id":"04412551-b22f-4a0b-8434-2f666041544b","resolution":{"observed_at":"2026-08-06T15:19:16.971760Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.06371","last_updated":"2024-11-10T06:39:10Z","snapshot_observed_at":"2026-08-12T22:04:04.818615Z","submitted_at":"2024-11-10T06:39:10Z","title":"LLM Vocabulary Compression for Low-Compute Environments","version":1},"cited_work":{"arxiv_id":"2411.06371","doi":"10.48550/arxiv.2411.06371","metadata_source":"pith","pith_arxiv_id":"2411.06371","snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":"LLM Vocabulary Compression for Low-Compute Environments","venue":"cs.CL","work_id":"17a725f8-cb60-4c0f-bae9-3c5805ca1a54","year":2024},"citing_paper":{"arxiv_id":"2507.16323","last_updated":"2025-07-22T08:07:06Z","snapshot_observed_at":"2026-08-13T03:19:43.429475Z","submitted_at":"2025-07-22T08:07:06Z","title":"SpeLLM: Character-Level Multi-Head Decoding","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T15:19:16.974995Z"},"links":{"cited_paper":"/paper/2411.06371","citing_paper":"/paper/2507.16323"},"observation_digest":"sha256:6e10fec91df10a255fbe36db21a94de0b70c869d59a6f40b1fb0d004f598eae2","observation_id":"7fab0aa4-c7af-4c6a-abf5-cffd343c0568","resolution":{"observed_at":"2026-08-06T15:19:17.114501Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:19:16.977758Z","title":"Fast V ocabulary Transfer for Language Model Compression","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.16323","last_updated":"2025-07-22T08:07:06Z","snapshot_observed_at":"2026-08-13T03:19:43.429475Z","submitted_at":"2025-07-22T08:07:06Z","title":"SpeLLM: Character-Level Multi-Head Decoding","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T15:19:16.977758Z"},"links":{"citing_paper":"/paper/2507.16323"},"observation_digest":"sha256:e5e7aab741d75b74da4295f697fc8ed57a625ec422fb8bf7c644d86064e2f1b6","observation_id":"3c850fcb-1bc5-4df0-9620-536487f792ae","resolution":{"observed_at":"2026-08-06T15:19:16.977758Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.08708","last_updated":"2025-03-25T13:30:00Z","snapshot_observed_at":"2026-08-14T08:25:06.734024Z","submitted_at":"2023-09-15T19:00:00Z","title":"Vocabulary-level Memory Efficiency for Language Model Fine-tuning","version":2},"cited_work":{"arxiv_id":"2309.08708","doi":"10.48550/arxiv.2309.08708","metadata_source":"pith","pith_arxiv_id":"2309.08708","snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":"Vocabulary-level Memory Efficiency for Language Model Fine-tuning","venue":"cs.CL","work_id":"788dfac2-e62f-49b7-ba5f-80016c4e6d18","year":2023},"citing_paper":{"arxiv_id":"2507.16323","last_updated":"2025-07-22T08:07:06Z","snapshot_observed_at":"2026-08-13T03:19:43.429475Z","submitted_at":"2025-07-22T08:07:06Z","title":"SpeLLM: Character-Level Multi-Head Decoding","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T15:19:16.980301Z"},"links":{"cited_paper":"/paper/2309.08708","citing_paper":"/paper/2507.16323"},"observation_digest":"sha256:aff07db8b252dd667e86b0267611bedbcba67fa3a572cb7e95ea52f725a73a07","observation_id":"33cc0c51-4968-4207-9c29-89d452e39af1","resolution":{"observed_at":"2026-08-06T15:19:17.099342Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1609.04309","last_updated":"2017-06-19T16:33:04Z","snapshot_observed_at":"2026-08-14T21:39:52.788731Z","submitted_at":"2016-09-14T15:15:08Z","title":"Efficient softmax approximation for GPUs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.04309","snapshot_observed_at":"2026-08-06T15:19:16.982992Z","title":"Efficient softmax approximation for GPUs","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2507.16323","last_updated":"2025-07-22T08:07:06Z","snapshot_observed_at":"2026-08-13T03:19:43.429475Z","submitted_at":"2025-07-22T08:07:06Z","title":"SpeLLM: Character-Level Multi-Head Decoding","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T15:19:16.982992Z"},"links":{"cited_paper":"/paper/1609.04309","citing_paper":"/paper/2507.16323"},"observation_digest":"sha256:6c7d9a2c608179df59a0d74ed9bafc680a1060d6dcf43f8d415cb7fff0f6e477","observation_id":"29f02703-7b4f-4211-bcfe-ce376e4cd92f","resolution":{"observed_at":"2026-08-06T15:19:16.982992Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.09301","last_updated":"2021-03-16T20:04:09Z","snapshot_observed_at":"2026-08-13T19:57:16.704950Z","submitted_at":"2021-03-16T20:04:09Z","title":"Softermax: Hardware/Software Co-Design of an Efficient Softmax for Transformers","version":1},"cited_work":{"arxiv_id":"2103.09301","doi":"10.48550/arxiv.2103.09301","metadata_source":"pith","pith_arxiv_id":"2103.09301","snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":"Softermax: Hardware/Software Co-Design of an Efficient Softmax for Transformers","venue":"cs.AR","work_id":"e520ac58-0b3d-4a9f-bc32-40944716aad4","year":2021},"citing_paper":{"arxiv_id":"2507.16323","last_updated":"2025-07-22T08:07:06Z","snapshot_observed_at":"2026-08-13T03:19:43.429475Z","submitted_at":"2025-07-22T08:07:06Z","title":"SpeLLM: Character-Level Multi-Head Decoding","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T15:19:16.986067Z"},"links":{"cited_paper":"/paper/2103.09301","citing_paper":"/paper/2507.16323"},"observation_digest":"sha256:b9a56ef92fa8e5a7c9490e602e44b989051560be394f55aa81c45ee7c4721dab","observation_id":"3c189951-7a1c-414b-81d8-caf044f6a757","resolution":{"observed_at":"2026-08-06T15:19:17.081790Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:19:17.331249Z","title":"Baharav, Ryan Kang, Colin Sullivan, Mo Tiwari, Eric Luxenberg, David Tse, and Mert Pilanci","venue":null,"work_id":"75d9321d-849c-4807-bfcb-d34ebe32f09b","year":null},"citing_paper":{"arxiv_id":"2507.16323","last_updated":"2025-07-22T08:07:06Z","snapshot_observed_at":"2026-08-13T03:19:43.429475Z","submitted_at":"2025-07-22T08:07:06Z","title":"SpeLLM: Character-Level Multi-Head Decoding","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T15:19:16.989283Z"},"links":{"citing_paper":"/paper/2507.16323"},"observation_digest":"sha256:100f67494dd37186ab58726ac1469a0d9e231e6bd79763fed43c1e6e63a2d15a","observation_id":"27ef0d46-9eba-4202-b173-f7a08e14c87e","resolution":{"observed_at":"2026-08-06T15:19:17.333809Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.19737","last_updated":"2024-04-30T17:33:57Z","snapshot_observed_at":"2026-08-12T13:06:04.804423Z","submitted_at":"2024-04-30T17:33:57Z","title":"Better & Faster Large Language Models via Multi-token Prediction","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.19737","snapshot_observed_at":"2026-08-06T15:19:16.994757Z","title":"Better & Faster Large Language Models via Multi-token Prediction","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.16323","last_updated":"2025-07-22T08:07:06Z","snapshot_observed_at":"2026-08-13T03:19:43.429475Z","submitted_at":"2025-07-22T08:07:06Z","title":"SpeLLM: Character-Level Multi-Head Decoding","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T15:19:16.994757Z"},"links":{"cited_paper":"/paper/2404.19737","citing_paper":"/paper/2507.16323"},"observation_digest":"sha256:ca9ea18425edcf0ad0b111d0976af91960c2e8730018fac666978e5c3dff62b5","observation_id":"95158648-9b5a-422d-ae41-9f01732ae97f","resolution":{"observed_at":"2026-08-06T15:19:16.994757Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.10774","last_updated":"2024-06-14T23:32:32Z","snapshot_observed_at":"2026-07-06T17:17:56.276857Z","submitted_at":"2024-01-19T15:48:40Z","title":"Medusa: Simple LLM Inference Acceleration Framework with Multiple Decoding Heads","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.10774","snapshot_observed_at":"2026-08-06T15:19:16.997333Z","title":"Medusa: Simple LLM Inference Acceleration Framework with Multiple Decoding Heads","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.16323","last_updated":"2025-07-22T08:07:06Z","snapshot_observed_at":"2026-08-13T03:19:43.429475Z","submitted_at":"2025-07-22T08:07:06Z","title":"SpeLLM: Character-Level Multi-Head Decoding","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T15:19:16.997333Z"},"links":{"cited_paper":"/paper/2401.10774","citing_paper":"/paper/2507.16323"},"observation_digest":"sha256:97f4fefb5a3005c69ecf768aba2726473b339b79f030ef7eddd2e6f3f552c9d4","observation_id":"df19124a-1058-4bb8-8244-87eca278ffcb","resolution":{"observed_at":"2026-08-06T15:19:16.997333Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.12777","last_updated":"2020-10-24T04:49:15Z","snapshot_observed_at":"2026-07-06T10:08:08.004416Z","submitted_at":"2020-10-24T04:49:15Z","title":"Improving Multilingual Models with Language-Clustered Vocabularies","version":1},"cited_work":{"arxiv_id":"2010.12777","doi":"10.48550/arxiv.2010.12777","metadata_source":"pith","pith_arxiv_id":"2010.12777","snapshot_observed_at":"2026-08-06T18:16:30.548575Z","title":"Improving Multilingual Models with Language-Clustered Vocabularies","venue":"cs.CL","work_id":"ee59da73-a030-4c6d-b300-9040f035eafc","year":2020},"citing_paper":{"arxiv_id":"2507.16323","last_updated":"2025-07-22T08:07:06Z","snapshot_observed_at":"2026-08-13T03:19:43.429475Z","submitted_at":"2025-07-22T08:07:06Z","title":"SpeLLM: Character-Level Multi-Head Decoding","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T15:19:17.000545Z"},"links":{"cited_paper":"/paper/2010.12777","citing_paper":"/paper/2507.16323"},"observation_digest":"sha256:af27c292395fdce08d7260a41eb011cc3c480f64c0d922e84c9f97c07b7d62c2","observation_id":"ce70b2e4-cfa9-400a-86c1-3b9912224178","resolution":{"observed_at":"2026-08-06T15:19:17.056539Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2105.13626","last_updated":"2022-03-08T02:18:51Z","snapshot_observed_at":"2026-08-13T19:14:43.200030Z","submitted_at":"2021-05-28T07:03:22Z","title":"ByT5: Towards a token-free future with pre-trained byte-to-byte models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.13626","snapshot_observed_at":"2026-08-06T15:19:17.002827Z","title":"ByT5: Towards a token-free future with pre-trained byte-to-byte models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.16323","last_updated":"2025-07-22T08:07:06Z","snapshot_observed_at":"2026-08-13T03:19:43.429475Z","submitted_at":"2025-07-22T08:07:06Z","title":"SpeLLM: Character-Level Multi-Head Decoding","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T15:19:17.002827Z"},"links":{"cited_paper":"/paper/2105.13626","citing_paper":"/paper/2507.16323"},"observation_digest":"sha256:e93f22e4327da89bfc14fd990280bea2d1d4a69790d746a3a432070e5478c684","observation_id":"9535f0fe-a3e9-452d-9c20-9fa2f60d2380","resolution":{"observed_at":"2026-08-06T15:19:17.002827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:19:17.005211Z","title":"Clark, Dan Garrette, Iulia Turc, and John Wieting","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.16323","last_updated":"2025-07-22T08:07:06Z","snapshot_observed_at":"2026-08-13T03:19:43.429475Z","submitted_at":"2025-07-22T08:07:06Z","title":"SpeLLM: Character-Level Multi-Head Decoding","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T15:19:17.005211Z"},"links":{"citing_paper":"/paper/2507.16323"},"observation_digest":"sha256:b29c3351e02d0f11e600d7a5663b60cf525a8cf48d97025d05bf0566c07816f2","observation_id":"c058ad57-4d09-4a1e-b962-1e36c8def3ec","resolution":{"observed_at":"2026-08-06T15:19:17.005211Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:19:17.316021Z","title":"Decoupled Weight Decay Regularization","venue":null,"work_id":"d3df338a-ad0d-4686-8075-7c29e0309f1f","year":null},"citing_paper":{"arxiv_id":"2507.16323","last_updated":"2025-07-22T08:07:06Z","snapshot_observed_at":"2026-08-13T03:19:43.429475Z","submitted_at":"2025-07-22T08:07:06Z","title":"SpeLLM: Character-Level Multi-Head Decoding","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T15:19:17.007608Z"},"links":{"citing_paper":"/paper/2507.16323"},"observation_digest":"sha256:3ae1863af125c0e10c8334bdfc23bdf9609e447d3998aaa56782ff0afb3fb5dc","observation_id":"d340e217-b17a-47d7-9b39-0580177e4155","resolution":{"observed_at":"2026-08-06T15:19:17.318960Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:19:17.307121Z","title":"All models are trained on a single GPU: smaller models on Nvidia L40S, and larger models on Nvidia A100","venue":null,"work_id":"241d9ed5-596e-4221-bd86-9b78d3029106","year":null},"citing_paper":{"arxiv_id":"2507.16323","last_updated":"2025-07-22T08:07:06Z","snapshot_observed_at":"2026-08-13T03:19:43.429475Z","submitted_at":"2025-07-22T08:07:06Z","title":"SpeLLM: Character-Level Multi-Head Decoding","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T15:19:17.012836Z"},"links":{"citing_paper":"/paper/2507.16323"},"observation_digest":"sha256:27b4c828b3ab6e0ee2b4a79387dbf7994a4098fed1807fa29da6e278de7f3434","observation_id":"e7cccba9-6784-417d-af24-624aab0e5b2a","resolution":{"observed_at":"2026-08-06T15:19:17.309902Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-08-14T20:13:52.872565Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-06T15:19:17.010080Z","title":"A Appendix Accuracy over various token lengths In Section 5.2, we analyze the accuracy of models with varying number of character-level heads across different token lengths","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.16323","last_updated":"2025-07-22T08:07:06Z","snapshot_observed_at":"2026-08-13T03:19:43.429475Z","submitted_at":"2025-07-22T08:07:06Z","title":"SpeLLM: Character-Level Multi-Head Decoding","version":1},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-06T15:19:17.010080Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2507.16323"},"observation_digest":"sha256:d5da056ba05fb5dea7fba4d4390bb87b54f7e46ff3fdb35aea09191d856236c6","observation_id":"d179371d-a7c4-4021-bad6-9b35891e93ca","resolution":{"observed_at":"2026-08-06T15:19:17.010080Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:19:17.324338Z","title":null,"venue":null,"work_id":"2e87fb37-b27e-4a39-a7fa-a3305bca34d1","year":2024},"citing_paper":{"arxiv_id":"2507.16323","last_updated":"2025-07-22T08:07:06Z","snapshot_observed_at":"2026-08-13T03:19:43.429475Z","submitted_at":"2025-07-22T08:07:06Z","title":"SpeLLM: Character-Level Multi-Head Decoding","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-06T15:19:16.992044Z"},"links":{"citing_paper":"/paper/2507.16323"},"observation_digest":"sha256:d58531c83f526db13fcacee169eaac140121d61704679125b3b12ee62d5c52d8","observation_id":"ea75a3c5-db19-4383-bcfe-3ed4949d5877","resolution":{"observed_at":"2026-08-06T15:19:17.326714Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.16323","last_updated":"2025-07-22T08:07:06Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-13T03:19:43.429475Z","submitted_at":"2025-07-22T08:07:06Z","title":"SpeLLM: Character-Level Multi-Head Decoding"},"reference_resolution":{"displayed":35,"state_counts":{"malformed_identifier":0,"metadata_mismatch":2,"parse_uncertain":0,"unresolved":21,"verified_exact":7,"verified_fuzzy":5},"total_outbound_references":35},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 35 of 35 outbound references and 0 inbound Pith citation observations for arXiv:2507.16323."}