Pith. sign in

Paper Citation Record · LEDGER

SpeLLM: Character-Level Multi-Head Decoding

As of 7 August 2026, this Paper Citation Record lists 35 of 35 outbound references and 0 inbound Pith citation observations for arXiv:2507.16323.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2507.16323 v1

Coverage vector

measured 35 of 35 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-06T15:19:17.012836Z

measured 35 of 35 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-07T06:34:17.273281+00:00

measured 0 of 0 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: cited_works

Reference resolution

35 of 35 outbound references displayed

  • verified exact7
  • verified fuzzy5
  • unresolved21
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch2

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 5ebcf8dc-70f1-4854-b083-3987f5d9a141 · outbound

This paper cites A new algorithm for data compression.

SpeLLM: Character-Level Multi-Head Decoding A new algorithm for data compression

Reference 1

Resolution
metadata mismatch
raw_fallback, observed 2026-08-06T15:19:17.302442Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T15:19:16.918735Z digest=sha256:a1e21ff58a442a8b3ec36b2315656530b7839015eb50bc5c824ab2fa9abfdda5

Observation 186c0948-d305-433c-97e0-694897ad8467 · outbound

This paper cites Neural Machine Translation of Rare Words with Subword Units.

SpeLLM: Character-Level Multi-Head Decoding Neural Machine Translation of Rare Words with Subword Units

Reference 2

Resolution
unresolved
no resolver link, observed 2026-08-06T15:19:16.922411Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T15:19:16.922411Z digest=sha256:34654881b00819e1b577ab0f7d393985aca0d1ca2d4dffc2be2d5470623f15b4

Observation 270fd262-2d24-4068-a12c-90dcd69305b1 · outbound

This paper cites The Llama 3 Herd of Models.

SpeLLM: Character-Level Multi-Head Decoding The Llama 3 Herd of Models

Reference 3

Resolution
unresolved
no resolver link, observed 2026-08-06T15:19:16.925226Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T15:19:16.925226Z digest=sha256:24129b55fffb290058b75844ea7c367f04b9fea31ae4b25a01a7cc9890b214ed

Observation 7261426e-2a4c-4606-9029-5c0cc507b9ef · outbound

This paper cites Gemma 2: Improv- ing Open Language Models at a Practical Size.

SpeLLM: Character-Level Multi-Head Decoding Gemma 2: Improv- ing Open Language Models at a Practical Size

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-06T15:19:16.928045Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T15:19:16.928045Z digest=sha256:f82bc506a85b116656d068ee1f5b03ac707e084512d32adfe1676df5706cfefa

Observation 5e0db424-262a-4df7-a490-4d1d5b4a2c45 · outbound

This paper cites Do all languages cost the same? tokenization in the era of commercial language models.

SpeLLM: Character-Level Multi-Head Decoding Do all languages cost the same? tokenization in the era of commercial language models

Reference 5

Resolution
unresolved
no resolver link, observed 2026-08-06T15:19:16.931347Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T15:19:16.931347Z digest=sha256:c60085b216eeda45a0276c4d7e5252ed285345a4d188d816ce342080bd98e521

Observation c8c8da7a-cc3c-4150-8d43-ae6a796e6743 · outbound

This paper cites Jais and Jais-chat: Arabic-Centric Foundation and Instruction-Tuned Open Generative Large Language Models.

SpeLLM: Character-Level Multi-Head Decoding Jais and Jais-chat: Arabic-Centric Foundation and Instruction-Tuned Open Generative Large Language Models

Reference 6

Resolution
unresolved
no resolver link, observed 2026-08-06T15:19:16.934493Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T15:19:16.934493Z digest=sha256:607906a919e1a9cc643a81613e9a2c472f078c6bfe859cebb7424610b231155a

Observation 5c3ac7fe-313c-4a4d-82a4-ae89033ee9eb · outbound

This paper cites Language model tokenizers introduce unfairness between languages.

SpeLLM: Character-Level Multi-Head Decoding Language model tokenizers introduce unfairness between languages

Reference 7

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T15:19:17.348538Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T15:19:16.937949Z digest=sha256:025440d88e5506d2ec9b8c0c306595171177e58521acb144f7508af4c240ced2

Observation f7c98384-9b4d-475c-b113-1333c85bd11e · outbound

This paper cites MEGABYTE: Predicting Million-byte Sequences with Multiscale Transformers.

SpeLLM: Character-Level Multi-Head Decoding MEGABYTE: Predicting Million-byte Sequences with Multiscale Transformers

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-06T15:19:16.940215Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T15:19:16.940215Z digest=sha256:0161cb8058fa4cbac1bae521c0f43ad52788edd44a2230866058d953bacc793e

Observation 245cef04-c4a6-4041-b171-e7fca218e328 · outbound

This paper cites Byte Latent Transformer: Patches Scale Better Than Tokens.

SpeLLM: Character-Level Multi-Head Decoding Byte Latent Transformer: Patches Scale Better Than Tokens

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-06T15:19:16.943166Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T15:19:16.943166Z digest=sha256:46eda11c1ace7a14d7372cb7eaf429384d2d786a668ecd05619bdddef2c38a63

Observation 0cb5616c-25cc-486e-aac7-191873976f6d · outbound

This paper cites Models In a Spelling Bee: Language Models Implicitly Learn the Character Composition of Tokens.

SpeLLM: Character-Level Multi-Head Decoding Models In a Spelling Bee: Language Models Implicitly Learn the Character Composition of Tokens

Reference 10

Resolution
verified exact
local_arxiv, observed 2026-08-06T15:19:17.186769Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T15:19:16.945692Z digest=sha256:a99e065b3d58ca1d6076e16f4d90a7674ffc3446b2bc241e386e4b131c27d509

Observation 9192d1c9-37cf-4b15-b38a-64929256038e · outbound

This paper cites What do tokens know about their characters and how do they know it?.

SpeLLM: Character-Level Multi-Head Decoding What do tokens know about their characters and how do they know it?

Reference 11

Resolution
verified exact
local_arxiv, observed 2026-08-06T15:19:17.234460Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T15:19:16.948956Z digest=sha256:e9e4110cd4aa1886c8aba9c13751e2a4141ce69f20940e944d872d0c154ccea0

Observation 97039f1e-3c11-485f-ac59-9ddf20a39391 · outbound

This paper cites Training Verifiers to Solve Math Word Problems.

SpeLLM: Character-Level Multi-Head Decoding Training Verifiers to Solve Math Word Problems

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-06T15:19:16.951711Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T15:19:16.951711Z digest=sha256:fb05b53c673a8f3781069207f245718eb6b6f32f3d702efa1e78ba59b84e6e63

Observation 3c03c5fc-4e5b-4ccf-a9a2-469a1174ba39 · outbound

This paper cites Teaching Machines to Read and Comprehend.

SpeLLM: Character-Level Multi-Head Decoding Teaching Machines to Read and Comprehend

Reference 13

Resolution
unresolved
no resolver link, observed 2026-08-06T15:19:16.954054Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T15:19:16.954054Z digest=sha256:69d012b348085a3f9f525974b3c8cefb85ec0ca653e713394be90863146cb81c

Observation 1326b273-1c82-4c7d-a75f-6deb4246d885 · outbound

This paper cites Headless Language Models: Learning without Predicting with Contrastive Weight Tying.

SpeLLM: Character-Level Multi-Head Decoding Headless Language Models: Learning without Predicting with Contrastive Weight Tying

Reference 14

Resolution
verified exact
local_arxiv, observed 2026-08-06T15:19:17.162960Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T15:19:16.956368Z digest=sha256:6eb9a4df78f7e0d4e5dee40cf3615eba3937e9311568a8f64acbb23bb17f8d0b

Observation 7144c661-b181-4a4d-86bb-7b1d37f95d2a · outbound

This paper cites The FineWeb Datasets: Decanting the Web for the Finest Text Data at Scale.

SpeLLM: Character-Level Multi-Head Decoding The FineWeb Datasets: Decanting the Web for the Finest Text Data at Scale

Reference 15

Resolution
unresolved
no resolver link, observed 2026-08-06T15:19:16.958966Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T15:19:16.958966Z digest=sha256:484f37796c1705f9c8b819ec4f7a2953f4453d65da1f6321b2095e926df8e897

Observation 6da07750-1c17-4ac1-a0a1-5da691814834 · outbound

This paper cites BoolQ: Exploring the Surprising Difficulty of Natural Yes/No Questions.

SpeLLM: Character-Level Multi-Head Decoding BoolQ: Exploring the Surprising Difficulty of Natural Yes/No Questions

Reference 16

Resolution
unresolved
no resolver link, observed 2026-08-06T15:19:16.961408Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T15:19:16.961408Z digest=sha256:6f3c6090229184269a72985fb70f368edbb811d0f735d29cb424d5efde31b14a

Observation 8a199f57-e1fd-403e-bf94-d32da6b3a2ba · outbound

This paper cites Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge.

SpeLLM: Character-Level Multi-Head Decoding Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge

Reference 17

Resolution
unresolved
no resolver link, observed 2026-08-06T15:19:16.964358Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T15:19:16.964358Z digest=sha256:e9c6d368d841836c0986c066e0ba4666b76305ab44e9b4af32a66c86d7abae25

Observation a2572573-efdc-481f-aa99-3d907ebf5d58 · outbound

This paper cites Efficient vocabulary reduction for small language models.

SpeLLM: Character-Level Multi-Head Decoding Efficient vocabulary reduction for small language models

Reference 18

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T15:19:17.341045Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T15:19:16.966931Z digest=sha256:b959e1a87bf905bab8e2dbaa1e30b0b2e186e4f562d39522830480d1c81c3052

Observation 167698e1-f1d5-43b3-919a-c46c3cced097 · outbound

This paper cites T-FREE: Subword Tokenizer-Free Generative LLMs via Sparse Representations for Memory-Efficient Embeddings.

SpeLLM: Character-Level Multi-Head Decoding T-FREE: Subword Tokenizer-Free Generative LLMs via Sparse Representations for Memory-Efficient Embeddings

Reference 19

Resolution
verified exact
local_arxiv, observed 2026-08-06T15:19:17.131959Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T15:19:16.969137Z digest=sha256:0dd6e1f498863a894c376ed06a728131f04233536b40aaf5caedbc7584ac1420

Observation 04412551-b22f-4a0b-8434-2f666041544b · outbound

This paper cites FR-Spec: Accelerating Large-Vocabulary Language Models via Frequency-Ranked Speculative Sampling.

SpeLLM: Character-Level Multi-Head Decoding FR-Spec: Accelerating Large-Vocabulary Language Models via Frequency-Ranked Speculative Sampling

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-06T15:19:16.971760Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T15:19:16.971760Z digest=sha256:e2547908b3175c89d72d7e9c7dd9c12754053393ea6ea708dadcebb8659fc9dc

Observation 7fab0aa4-c7af-4c6a-abf5-cffd343c0568 · outbound

This paper cites LLM Vocabulary Compression for Low-Compute Environments.

SpeLLM: Character-Level Multi-Head Decoding LLM Vocabulary Compression for Low-Compute Environments

Reference 21

Resolution
verified exact
local_arxiv, observed 2026-08-06T15:19:17.114501Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T15:19:16.974995Z digest=sha256:206e05ddae4900cf4ecd6ebc16b6579ecce9d25e0f3c3671d664e20798b3c2c3

Observation 3c850fcb-1bc5-4df0-9620-536487f792ae · outbound

This paper cites Fast V ocabulary Transfer for Language Model Compression.

SpeLLM: Character-Level Multi-Head Decoding Fast V ocabulary Transfer for Language Model Compression

Reference 22

Resolution
unresolved
no resolver link, observed 2026-08-06T15:19:16.977758Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T15:19:16.977758Z digest=sha256:890947b897ceeef28af3bebb5dc7d788cea6bba8844ec71e9dc98b147de9732f

Observation 33cc0c51-4968-4207-9c29-89d452e39af1 · outbound

This paper cites Vocabulary-level Memory Efficiency for Language Model Fine-tuning.

SpeLLM: Character-Level Multi-Head Decoding Vocabulary-level Memory Efficiency for Language Model Fine-tuning

Reference 23

Resolution
verified exact
local_arxiv, observed 2026-08-06T15:19:17.099342Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T15:19:16.980301Z digest=sha256:c947c8508c933fcad9d19eb28561b636655b21a45c8eb02acac2c870ecdd17b1

Observation 29f02703-7b4f-4211-bcfe-ce376e4cd92f · outbound

This paper cites Efficient softmax approximation for GPUs.

SpeLLM: Character-Level Multi-Head Decoding Efficient softmax approximation for GPUs

Reference 24

Resolution
unresolved
no resolver link, observed 2026-08-06T15:19:16.982992Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T15:19:16.982992Z digest=sha256:9166c622edde811f05a2ebf1932460a3f18c9cb6340a8b21814b28d90dc27d21

Observation 3c189951-7a1c-414b-81d8-caf044f6a757 · outbound

This paper cites Softermax: Hardware/Software Co-Design of an Efficient Softmax for Transformers.

SpeLLM: Character-Level Multi-Head Decoding Softermax: Hardware/Software Co-Design of an Efficient Softmax for Transformers

Reference 25

Resolution
metadata mismatch
local_arxiv, observed 2026-08-06T15:19:17.081790Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T15:19:16.986067Z digest=sha256:8488aeaa665d1a48e3e79ddc4e54d2b4d16cfb2deff461712b7c0bca045dd2be

Observation 27ef0d46-9eba-4202-b173-f7a08e14c87e · outbound

This paper cites Baharav, Ryan Kang, Colin Sullivan, Mo Tiwari, Eric Luxenberg, David Tse, and Mert Pilanci.

SpeLLM: Character-Level Multi-Head Decoding Baharav, Ryan Kang, Colin Sullivan, Mo Tiwari, Eric Luxenberg, David Tse, and Mert Pilanci

Reference 26

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T15:19:17.333809Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T15:19:16.989283Z digest=sha256:4724e4ab9754b64f417715230c4f9b2096febcd0d921df2cd5f16db7e3dbc78b

Observation 95158648-9b5a-422d-ae41-9f01732ae97f · outbound

This paper cites Better & Faster Large Language Models via Multi-token Prediction.

SpeLLM: Character-Level Multi-Head Decoding Better & Faster Large Language Models via Multi-token Prediction

Reference 27

Resolution
unresolved
no resolver link, observed 2026-08-06T15:19:16.994757Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T15:19:16.994757Z digest=sha256:addd5f5322dceb1a5a09370c3743480b1a8c20fd288c75d010989b50fbe94362

Observation df19124a-1058-4bb8-8244-87eca278ffcb · outbound

This paper cites Medusa: Simple LLM Inference Acceleration Framework with Multiple Decoding Heads.

SpeLLM: Character-Level Multi-Head Decoding Medusa: Simple LLM Inference Acceleration Framework with Multiple Decoding Heads

Reference 28

Resolution
unresolved
no resolver link, observed 2026-08-06T15:19:16.997333Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T15:19:16.997333Z digest=sha256:f9684be96556cdf94f021584ba6c4896c43f11279d87f3c259ae318f76f3a7ab

Observation ce70b2e4-cfa9-400a-86c1-3b9912224178 · outbound

This paper cites Improving Multilingual Models with Language-Clustered Vocabularies.

SpeLLM: Character-Level Multi-Head Decoding Improving Multilingual Models with Language-Clustered Vocabularies

Reference 29

Resolution
verified exact
local_arxiv, observed 2026-08-06T15:19:17.056539Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T15:19:17.000545Z digest=sha256:8fa2fa79c8cd57b4b66db7d85274a787551607c2ad155bd250ecadae37c55ccf

Observation 9535f0fe-a3e9-452d-9c20-9fa2f60d2380 · outbound

This paper cites ByT5: Towards a token-free future with pre-trained byte-to-byte models.

SpeLLM: Character-Level Multi-Head Decoding ByT5: Towards a token-free future with pre-trained byte-to-byte models

Reference 30

Resolution
unresolved
no resolver link, observed 2026-08-06T15:19:17.002827Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T15:19:17.002827Z digest=sha256:106896902e1a5d0ca89061aab68f7d3adb937617ae1e0fc96e6f9fa14c077eb4

Observation c058ad57-4d09-4a1e-b962-1e36c8def3ec · outbound

This paper cites Clark, Dan Garrette, Iulia Turc, and John Wieting.

SpeLLM: Character-Level Multi-Head Decoding Clark, Dan Garrette, Iulia Turc, and John Wieting

Reference 31

Resolution
unresolved
no resolver link, observed 2026-08-06T15:19:17.005211Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T15:19:17.005211Z digest=sha256:9f87de15b15b8844e130b34c425eb12434441dd83f57b49fb542f1c710214f12

Observation d340e217-b17a-47d7-9b39-0580177e4155 · outbound

This paper cites Decoupled Weight Decay Regularization.

SpeLLM: Character-Level Multi-Head Decoding Decoupled Weight Decay Regularization

Reference 32

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T15:19:17.318960Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T15:19:17.007608Z digest=sha256:875fd438cb4d957c3ae4be2a1645754d9c0f85571a8c9e98efc8b52c75859cd1

Observation e7cccba9-6784-417d-af24-624aab0e5b2a · outbound

This paper cites All models are trained on a single GPU: smaller models on Nvidia L40S, and larger models on Nvidia A100.

SpeLLM: Character-Level Multi-Head Decoding All models are trained on a single GPU: smaller models on Nvidia L40S, and larger models on Nvidia A100

Reference 35

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T15:19:17.309902Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T15:19:17.012836Z digest=sha256:012bcda2d7bff4a0d15d7c11289fdaf641c35edfd589e0b80895be51431c3195

Observation d179371d-a7c4-4021-bad6-9b35891e93ca · outbound

This paper cites Decoupled Weight Decay Regularization.

SpeLLM: Character-Level Multi-Head Decoding Decoupled Weight Decay Regularization

Reference 2017

Resolution
unresolved
no resolver link, observed 2026-08-06T15:19:17.010080Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T15:19:17.010080Z digest=sha256:38ef2cd12be05c2dd5f87219fed9827f06c69ce803d0f208b08ba34f154a7eed

Observation ea75a3c5-db19-4383-bcfe-3ed4949d5877 · outbound

This paper cites an unresolved cited work.

SpeLLM: Character-Level Multi-Head Decoding Unresolved cited work

Reference 2024

Resolution
unresolved
raw_fallback, observed 2026-08-06T15:19:17.326714Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T15:19:16.992044Z digest=sha256:1399712fa8a6de33bb62008b54e3d5d99e32eaf4ede0b203c6d2c983ec3769af

Pith citing papers

No inbound Pith citation observations are available.