Pith. sign in

Paper Citation Record · LEDGER

SemToken: Semantic-Aware Tokenization for Efficient Long-Context Language Modeling

As of 22 August 2026, this Paper Citation Record lists 35 of 35 outbound references and 0 inbound Pith citation observations for arXiv:2508.15190.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2508.15190 v1

Coverage vector

measured 35 of 35 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-05T18:07:41.620884Z

measured 35 of 35 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-22T06:32:14.747728+00:00

measured 0 of 0 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: cited_works

Reference resolution

35 of 35 outbound references displayed

  • verified exact5
  • verified fuzzy1
  • unresolved29
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation bc6b2515-b39d-43e6-ae51-6e33c688dbf4 · outbound

This paper cites URL: " 'urlintro :=.

SemToken: Semantic-Aware Tokenization for Efficient Long-Context Language Modeling URL: " 'urlintro :=

Reference 1

Resolution
unresolved
no resolver link, observed 2026-08-05T18:07:37.702547Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T18:07:37.702547Z digest=sha256:1bb57433a2eba23700877a641b6cb75026b011c33004e10714059df45d368335

Observation c2ee23a1-dd8d-4e1a-930e-098a85da92d6 · outbound

This paper cites write newline.

SemToken: Semantic-Aware Tokenization for Efficient Long-Context Language Modeling write newline

Reference 2

Resolution
unresolved
no resolver link, observed 2026-08-05T18:07:37.818997Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T18:07:37.818997Z digest=sha256:1989224bb4dd274a786d8ed26b726c4b6f9883f9a3b74b79b8e50cc9381a0ba4

Observation 17a9bd0e-08d7-4897-9f50-39f7bd9a0ed8 · outbound

This paper cites write newline.

SemToken: Semantic-Aware Tokenization for Efficient Long-Context Language Modeling write newline

Reference 3

Resolution
unresolved
no resolver link, observed 2026-08-05T18:07:37.989006Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T18:07:37.989006Z digest=sha256:983b29264587b2f168303e0c73f22e68725b67c88c50e07bedfb77f8f751b09a

Observation cae37ac2-9563-4ddf-8242-04849e1be2f6 · outbound

This paper cites LongBench: A Bilingual, Multitask Benchmark for Long Context Understanding.

SemToken: Semantic-Aware Tokenization for Efficient Long-Context Language Modeling LongBench: A Bilingual, Multitask Benchmark for Long Context Understanding

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-05T18:07:38.087352Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T18:07:38.087352Z digest=sha256:4d070b676ca56f50978cc57a45d69286c32f3e00fc36a6c9329baea46ac82a21

Observation d63e078c-a1b5-4155-b924-cf874720bb9b · outbound

This paper cites Longformer: The Long-Document Transformer.

SemToken: Semantic-Aware Tokenization for Efficient Long-Context Language Modeling Longformer: The Long-Document Transformer

Reference 5

Resolution
unresolved
no resolver link, observed 2026-08-05T18:07:38.172306Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T18:07:38.172306Z digest=sha256:819cb084e4af39e440e7afcf3bec2a780aff02116a85a54eea9a8446c207b01f

Observation ba37e8dd-908c-49b5-80b4-1145ef7ce8ee · outbound

This paper cites Rethinking Attention with Performers.

SemToken: Semantic-Aware Tokenization for Efficient Long-Context Language Modeling Rethinking Attention with Performers

Reference 6

Resolution
unresolved
no resolver link, observed 2026-08-05T18:07:38.304671Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T18:07:38.304671Z digest=sha256:a59a31dd773cb88434fe68edd201cfdac35f81d2bceb80401b468bb8b6137f94

Observation a5eba188-0cd9-498c-a42f-1855bc88e910 · outbound

This paper cites an unresolved cited work.

SemToken: Semantic-Aware Tokenization for Efficient Long-Context Language Modeling Unresolved cited work

Reference 7

Resolution
unresolved
raw_fallback, observed 2026-08-05T18:07:43.920401Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=arxiv_source observed=2026-08-05T18:07:38.421542Z digest=sha256:66f6bc35e8d48f6b750d2705f9234ffd464c7f4b595fe6f91c8474e537f7b80b

Observation 9457f708-cd6d-4f19-9497-710ad78f8529 · outbound

This paper cites FlashAttention-2: Faster Attention with Better Parallelism and Work Partitioning.

SemToken: Semantic-Aware Tokenization for Efficient Long-Context Language Modeling FlashAttention-2: Faster Attention with Better Parallelism and Work Partitioning

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-05T18:07:38.547812Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T18:07:38.547812Z digest=sha256:60d68f96c20677f37cc09bdb49283a7b65d28824eb0712af7058c73fc14071b2

Observation 85ada825-88a6-496d-b8f1-1a9fce6c9643 · outbound

This paper cites VIOLET : End-to-End Video-Language Transformers with Masked Visual-token Modeling.

SemToken: Semantic-Aware Tokenization for Efficient Long-Context Language Modeling VIOLET : End-to-End Video-Language Transformers with Masked Visual-token Modeling

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-05T18:07:38.649205Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T18:07:38.649205Z digest=sha256:af3ef8fa6b79bdc036f29497f2155ac0c32c6e5aaf9dc4218b0726730a33fb26

Observation 211541c3-9676-404d-a13d-6b8e034b8658 · outbound

This paper cites Learned Token Pruning for Transformers.

SemToken: Semantic-Aware Tokenization for Efficient Long-Context Language Modeling Learned Token Pruning for Transformers

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-05T18:07:38.793573Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T18:07:38.793573Z digest=sha256:44725ac1958b0b202cef281bb1ed2acf8fd170bd5743ad193cf82d0211b79155

Observation 633dd6e5-4628-4dc7-bcaa-536ef4cc85fc · outbound

This paper cites BookSum: A Collection of Datasets for Long-form Narrative Summarization.

SemToken: Semantic-Aware Tokenization for Efficient Long-Context Language Modeling BookSum: A Collection of Datasets for Long-form Narrative Summarization

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-05T18:07:38.945155Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T18:07:38.945155Z digest=sha256:ddbbcc6b46c1a61fd25b794b2b7f847f1552b7b01bdefa7352396a58b5f1c091

Observation b5f858e3-f0c2-4f86-b749-1a863314f112 · outbound

This paper cites Subword Regularization: Improving Neural Network Translation Models with Multiple Subword Candidates.

SemToken: Semantic-Aware Tokenization for Efficient Long-Context Language Modeling Subword Regularization: Improving Neural Network Translation Models with Multiple Subword Candidates

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-05T18:07:39.022747Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T18:07:39.022747Z digest=sha256:de76cd65f469fd7709b15cfb0551352792c939c4b79360b6a2e6a3484363d070

Observation 8dfbe177-8eae-498f-a04b-eceb46252b89 · outbound

This paper cites https://openreview.net/pdf?id=dMdxHd0tRf Quickmerge++: Token merging with autoregressive prior.

SemToken: Semantic-Aware Tokenization for Efficient Long-Context Language Modeling https://openreview.net/pdf?id=dMdxHd0tRf Quickmerge++: Token merging with autoregressive prior

Reference 13

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T18:07:43.761348Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=arxiv_source observed=2026-08-05T18:07:39.092834Z digest=sha256:53a2f0dfb2c5c16ec993d6cdc490bead633595d2936fecf52084879e2680e947

Observation 3b9abf43-6eea-466c-9ef6-ad8a45aa48de · outbound

This paper cites an unresolved cited work.

SemToken: Semantic-Aware Tokenization for Efficient Long-Context Language Modeling Unresolved cited work

Reference 14

Resolution
unresolved
no resolver link, observed 2026-08-05T18:07:39.177536Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T18:07:39.177536Z digest=sha256:9530930cf92e74b9094ae7e499683ebccc01a285bf53fff7cc186e1a7afc3921

Observation 41153489-9e05-4651-9026-bd74d5bd1e68 · outbound

This paper cites an unresolved cited work.

SemToken: Semantic-Aware Tokenization for Efficient Long-Context Language Modeling Unresolved cited work

Reference 15

Resolution
unresolved
raw_fallback, observed 2026-08-05T18:07:43.620220Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=arxiv_source observed=2026-08-05T18:07:39.228050Z digest=sha256:3a6477b77f70dd70b715bf499efa13e93d4773f9b8f2128c99d7047e6a4ebb3b

Observation 47b2d7a1-683e-4c20-bbb3-14cf45a646df · outbound

This paper cites an unresolved cited work.

SemToken: Semantic-Aware Tokenization for Efficient Long-Context Language Modeling Unresolved cited work

Reference 16

Resolution
unresolved
raw_fallback, observed 2026-08-05T18:07:43.472315Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=arxiv_source observed=2026-08-05T18:07:39.312620Z digest=sha256:bd7dfcaf91bd9969a48f482ca149ff02d66557efb130e62f11d1c6169ba75674

Observation 6137810e-75b5-4683-aae1-2d1c0367ea6a · outbound

This paper cites an unresolved cited work.

SemToken: Semantic-Aware Tokenization for Efficient Long-Context Language Modeling Unresolved cited work

Reference 17

Resolution
unresolved
raw_fallback, observed 2026-08-05T18:07:43.279772Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=arxiv_source observed=2026-08-05T18:07:39.414089Z digest=sha256:263dce732a96d4d392a466bfb9aa7242d46c3d8c552c4084692084c64cd644c4

Observation 25f22337-0668-46b0-ac68-ce0c46574b32 · outbound

This paper cites Designing Large Foundation Models for Efficient Training and Inference: A Survey.

SemToken: Semantic-Aware Tokenization for Efficient Long-Context Language Modeling Designing Large Foundation Models for Efficient Training and Inference: A Survey

Reference 18

Resolution
unresolved
no resolver link, observed 2026-08-05T18:07:39.465068Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T18:07:39.465068Z digest=sha256:3e64d5021b7b6646d410b3ed198e5f8bdfb7f7dd55f3f9486620e43e510b1530

Observation a1e4f6fd-6f74-4c7b-a216-3e02a848e7c5 · outbound

This paper cites an unresolved cited work.

SemToken: Semantic-Aware Tokenization for Efficient Long-Context Language Modeling Unresolved cited work

Reference 19

Resolution
unresolved
no resolver link, observed 2026-08-05T18:07:39.562301Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T18:07:39.562301Z digest=sha256:b9d84dbf9a02d4f86aeb16ac255f4de95e54d2d885c6ba8b94aa99c8b333d2ee

Observation 914e7f33-327e-477c-ad22-87460706b8f3 · outbound

This paper cites Neural Machine Translation with Supervised Attention.

SemToken: Semantic-Aware Tokenization for Efficient Long-Context Language Modeling Neural Machine Translation with Supervised Attention

Reference 20

Resolution
verified exact
local_arxiv, observed 2026-08-05T18:07:42.713806Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=arxiv_source observed=2026-08-05T18:07:39.657701Z digest=sha256:0d0c1fb0574e1d5cb8041d77767972107eed67206c0908edc56afb3e85bf6152

Observation f9a8f315-4927-4ae4-a80d-cc0bbc8bad66 · outbound

This paper cites an unresolved cited work.

SemToken: Semantic-Aware Tokenization for Efficient Long-Context Language Modeling Unresolved cited work

Reference 21

Resolution
unresolved
raw_fallback, observed 2026-08-05T18:07:43.148584Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=arxiv_source observed=2026-08-05T18:07:39.788284Z digest=sha256:d6eb26656dc9b245d39c494de57eda9d36fc25d197701bcdc1f984bb5408a5a5

Observation ef6da243-5754-45dc-8108-8302b450bd7d · outbound

This paper cites World Models with Hints of Large Language Models for Goal Achieving.

SemToken: Semantic-Aware Tokenization for Efficient Long-Context Language Modeling World Models with Hints of Large Language Models for Goal Achieving

Reference 22

Resolution
verified exact
local_arxiv, observed 2026-08-05T18:07:42.561711Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=arxiv_source observed=2026-08-05T18:07:39.860495Z digest=sha256:d6ef9b94315777d9f61d366f887c0c593ee1a5d4a57fba99b209ca01f0a290b1

Observation 72a97c64-3a18-42af-a6a4-58988929efcc · outbound

This paper cites ChartQA: A Benchmark for Question Answering about Charts with Visual and Logical Reasoning.

SemToken: Semantic-Aware Tokenization for Efficient Long-Context Language Modeling ChartQA: A Benchmark for Question Answering about Charts with Visual and Logical Reasoning

Reference 23

Resolution
unresolved
no resolver link, observed 2026-08-05T18:07:39.947367Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T18:07:39.947367Z digest=sha256:065e132c67689eccd3ac694f8819f5e7f0c7e6d4f4e8c705e376ddd804f0051b

Observation 6227270c-a6fe-4f36-a384-70365be32d0a · outbound

This paper cites YaRN: Efficient Context Window Extension of Large Language Models.

SemToken: Semantic-Aware Tokenization for Efficient Long-Context Language Modeling YaRN: Efficient Context Window Extension of Large Language Models

Reference 24

Resolution
unresolved
no resolver link, observed 2026-08-05T18:07:39.994180Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T18:07:39.994180Z digest=sha256:7e6f64c622685587c102cef98c255ebe35d377afd46452f0dc0f80e00d19166f

Observation adb9c764-4364-469c-80c3-c8b0d9920fde · outbound

This paper cites Compressive Transformers for Long-Range Sequence Modelling.

SemToken: Semantic-Aware Tokenization for Efficient Long-Context Language Modeling Compressive Transformers for Long-Range Sequence Modelling

Reference 25

Resolution
unresolved
no resolver link, observed 2026-08-05T18:07:40.090807Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T18:07:40.090807Z digest=sha256:468ae37c435787195af8268bc78f7ec2407e161c5f246888b16357237214f6b8

Observation 068104a3-15f0-473a-b2bc-307fa8026d00 · outbound

This paper cites Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer.

SemToken: Semantic-Aware Tokenization for Efficient Long-Context Language Modeling Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer

Reference 26

Resolution
unresolved
no resolver link, observed 2026-08-05T18:07:40.170338Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T18:07:40.170338Z digest=sha256:fe8340f57bedec0431e2c0c826094e521335915851914c332b35297087518bd3

Observation b70de1e4-31e7-4325-9763-547d31e2aca4 · outbound

This paper cites Vision Transformers with Mixed-Resolution Tokenization.

SemToken: Semantic-Aware Tokenization for Efficient Long-Context Language Modeling Vision Transformers with Mixed-Resolution Tokenization

Reference 27

Resolution
verified exact
local_arxiv, observed 2026-08-05T18:07:42.339253Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=arxiv_source observed=2026-08-05T18:07:40.279621Z digest=sha256:b39b4eb68e233ca92060077536ae4a894ccb9bdaebe37f47313ce77fe1df9063

Observation aaccd53e-7f9f-48b2-89c8-5ef44f339107 · outbound

This paper cites an unresolved cited work.

SemToken: Semantic-Aware Tokenization for Efficient Long-Context Language Modeling Unresolved cited work

Reference 29

Resolution
unresolved
no resolver link, observed 2026-08-05T18:07:40.641184Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T18:07:40.641184Z digest=sha256:b2bdd303312152b1895eb9a0854df30ecc4c36835de8a615ccab073f46060f1b

Observation 0b7f72e8-50da-4880-8c67-cf34321f7a87 · outbound

This paper cites an unresolved cited work.

SemToken: Semantic-Aware Tokenization for Efficient Long-Context Language Modeling Unresolved cited work

Reference 30

Resolution
unresolved
no resolver link, observed 2026-08-05T18:07:40.769200Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T18:07:40.769200Z digest=sha256:9d2dd5747246e02c4b07c2951fc6e9cab000472361ece8b6c412035f7939be9a

Observation 2e501358-530b-4f59-9587-505e06c45fdd · outbound

This paper cites LLaMA: Open and Efficient Foundation Language Models.

SemToken: Semantic-Aware Tokenization for Efficient Long-Context Language Modeling LLaMA: Open and Efficient Foundation Language Models

Reference 31

Resolution
unresolved
no resolver link, observed 2026-08-05T18:07:40.934995Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T18:07:40.934995Z digest=sha256:cb3760cf61a5036da17dd924ad331ad7dc9327392fdfa30d84b1e4c6b42e7771

Observation e0246169-7889-49bb-9dbf-ac7b22468975 · outbound

This paper cites Focused Transformer: Contrastive Training for Context Scaling.

SemToken: Semantic-Aware Tokenization for Efficient Long-Context Language Modeling Focused Transformer: Contrastive Training for Context Scaling

Reference 32

Resolution
unresolved
no resolver link, observed 2026-08-05T18:07:41.031022Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T18:07:41.031022Z digest=sha256:aa27cabc394b8e089c1b2c764542a3aeb1b46153802cc519db6c11a63e188232

Observation e6095f0d-720c-45aa-977f-91d4e2df6d41 · outbound

This paper cites Google's Neural Machine Translation System: Bridging the Gap between Human and Machine Translation.

SemToken: Semantic-Aware Tokenization for Efficient Long-Context Language Modeling Google's Neural Machine Translation System: Bridging the Gap between Human and Machine Translation

Reference 33

Resolution
unresolved
no resolver link, observed 2026-08-05T18:07:41.102041Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T18:07:41.102041Z digest=sha256:182a53c4e8edfd471ca697264dc1a393251845c0e5af572ea3a196b4ad7af401

Observation 46facd0f-7b7f-4d97-b492-cc068625d9c3 · outbound

This paper cites Discourse-Aware Neural Extractive Text Summarization.

SemToken: Semantic-Aware Tokenization for Efficient Long-Context Language Modeling Discourse-Aware Neural Extractive Text Summarization

Reference 34

Resolution
verified exact
local_arxiv, observed 2026-08-05T18:07:42.147315Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=arxiv_source observed=2026-08-05T18:07:41.270987Z digest=sha256:eae04d7cc18970da1f0377547aef165cfc3989c678f39718aebbde7878a279bd

Observation aee5a756-cf6e-4a66-947d-ce91c80f51df · outbound

This paper cites TR-BERT: Dynamic Token Reduction for Accelerating BERT Inference.

SemToken: Semantic-Aware Tokenization for Efficient Long-Context Language Modeling TR-BERT: Dynamic Token Reduction for Accelerating BERT Inference

Reference 35

Resolution
verified exact
local_arxiv, observed 2026-08-05T18:07:41.928491Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=arxiv_source observed=2026-08-05T18:07:41.473560Z digest=sha256:668d8c44ae85dd45e20e99be57ffed0844ade4857e066c6d923b52f0d76122aa

Observation a10cb385-0e8f-4ad3-a298-d0579c54ee75 · outbound

This paper cites H$_2$O: Heavy-Hitter Oracle for Efficient Generative Inference of Large Language Models.

SemToken: Semantic-Aware Tokenization for Efficient Long-Context Language Modeling H$_2$O: Heavy-Hitter Oracle for Efficient Generative Inference of Large Language Models

Reference 36

Resolution
unresolved
no resolver link, observed 2026-08-05T18:07:41.620884Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T18:07:41.620884Z digest=sha256:1c9550715d32734fb994eeb150e8bbadf50a7b43babab769cf96dab0096fed49

Pith citing papers

No inbound Pith citation observations are available.