Pith. sign in

Paper Citation Record · LEDGER

Crisp Attention: Regularizing Transformers via Structured Sparsity

As of 10 August 2026, this Paper Citation Record lists 23 of 23 outbound references and 0 inbound Pith citation observations for arXiv:2508.06016.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2508.06016 v1

Coverage vector

measured 23 of 23 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-05T23:03:07.949630Z

measured 23 of 23 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-10T06:31:04.303077+00:00

measured 0 of 0 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: cited_works

Reference resolution

23 of 23 outbound references displayed

  • verified exact1
  • verified fuzzy16
  • unresolved6
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 7fffd0f1-c1c2-4559-aff7-3ba47c27c151 · outbound

This paper cites Efficient Transformers: A Survey.

Crisp Attention: Regularizing Transformers via Structured Sparsity Efficient Transformers: A Survey

Reference 1

Resolution
unresolved
no resolver link, observed 2026-08-05T23:03:05.668093Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T23:03:05.668093Z digest=sha256:9cec7e9dd2d458c0c6b568a3316348fe18513e6127c2f736080f98dc852f50ea

Observation 5f24f36c-f3d7-40fd-8f01-535d012ff957 · outbound

This paper cites A Survey on Efficient Vision Transformers: Algorithms, Techniques, and Performance Benchmarking.

Crisp Attention: Regularizing Transformers via Structured Sparsity A Survey on Efficient Vision Transformers: Algorithms, Techniques, and Performance Benchmarking

Reference 2

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T23:03:10.221239Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-05T23:03:05.749437Z digest=sha256:25a9244a5696db8f061783727ae5e38b5482b460ecc1dbbb9131990f88578a66

Observation 76053760-67b4-4837-b54e-f599bb30a7ee · outbound

This paper cites A Comprehensive Survey on Efficient Transformers.

Crisp Attention: Regularizing Transformers via Structured Sparsity A Comprehensive Survey on Efficient Transformers

Reference 3

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T23:03:10.205663Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-05T23:03:05.858961Z digest=sha256:dc4bb8be133652a182839c9455ba68433c942a5a17ee8ac4046d03ff4c461a3d

Observation 34f5365f-a17d-4889-929f-3de44ef7289b · outbound

This paper cites Generating Long Sequences with Sparse Transformers.

Crisp Attention: Regularizing Transformers via Structured Sparsity Generating Long Sequences with Sparse Transformers

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-05T23:03:05.962611Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T23:03:05.962611Z digest=sha256:6987f3d6dca5205b1cdae243ce6f6fc42c32f2af10bbc0791e51029ec8c16b15

Observation 2f40eee7-7f4d-48f0-bf3e-253f8a34a663 · outbound

This paper cites Linformer: Self-Attention with Linear Complexity.

Crisp Attention: Regularizing Transformers via Structured Sparsity Linformer: Self-Attention with Linear Complexity

Reference 5

Resolution
unresolved
no resolver link, observed 2026-08-05T23:03:06.089159Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T23:03:06.089159Z digest=sha256:ae70af2e3545ac38a61af1efa1ecd0c577cdac7a41a7cfc729b0097436bcdc0c

Observation 1b0fa903-8afa-4b92-8e89-65e7e7487d76 · outbound

This paper cites Reformer: The Efficient Transformer.

Crisp Attention: Regularizing Transformers via Structured Sparsity Reformer: The Efficient Transformer

Reference 6

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T23:03:10.190725Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-05T23:03:06.155923Z digest=sha256:453443f4ccbf25a3b13ec42b945a17f01ceabf5289f7c463fdfb4fd93de8d98e

Observation 4d1d91db-3b0a-4bf9-a6e9-ab09186e09f9 · outbound

This paper cites FlashAttention: Fast and Memory-Efficient Exact Attention with IO-Awareness.

Crisp Attention: Regularizing Transformers via Structured Sparsity FlashAttention: Fast and Memory-Efficient Exact Attention with IO-Awareness

Reference 7

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T23:03:10.174720Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-05T23:03:06.247275Z digest=sha256:34c9f85c6e181142c54d3aa3dc76de560f3165eafc052626716c510e0debcc46

Observation b5bd0adf-4c83-4337-8832-4cb18da2f8eb · outbound

This paper cites Smarter, Better, Faster, Longer: A Modern Bidirectional Encoder for Fast, Memory Efficient, and Long Context Finetuning and Inference.

Crisp Attention: Regularizing Transformers via Structured Sparsity Smarter, Better, Faster, Longer: A Modern Bidirectional Encoder for Fast, Memory Efficient, and Long Context Finetuning and Inference

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-05T23:03:06.339230Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T23:03:06.339230Z digest=sha256:72ab7961c94d7e0b7c54f4390a37e9ff802bb8b2292b88afeb75cea59c080c7d

Observation 4f4b114b-0756-4489-baf5-1fa75e11a079 · outbound

This paper cites TKwinFormer: Top k Window Attention in Vision Transformers for Feature Matching.

Crisp Attention: Regularizing Transformers via Structured Sparsity TKwinFormer: Top k Window Attention in Vision Transformers for Feature Matching

Reference 9

Resolution
verified exact
local_arxiv, observed 2026-08-05T23:03:08.141171Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-05T23:03:06.459688Z digest=sha256:ab5388f3b0f39b9f0af69e0516e984d6e5e507b8a101c2a91277480ca79a1e95

Observation 749df25a-84b9-4afc-b24b-fd98749a21e3 · outbound

This paper cites Optimal Brain Damage.

Crisp Attention: Regularizing Transformers via Structured Sparsity Optimal Brain Damage

Reference 10

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T23:03:10.158462Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-05T23:03:06.534693Z digest=sha256:f00c866fa30dc80ae161be02d1deb70f9263a4460fd33fc2c0f0460be3a5e529

Observation 1a8393dc-0b4b-4469-86c3-67fd192e9e16 · outbound

This paper cites Learning Both Weights and Connections for Efficient Neural Networks.

Crisp Attention: Regularizing Transformers via Structured Sparsity Learning Both Weights and Connections for Efficient Neural Networks

Reference 11

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T23:03:10.142970Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-05T23:03:06.610248Z digest=sha256:aa7f7287e8e562db021e5322a1b3bd00e7cff0629d0ff84bddd7e37551f3427a

Observation 647913a3-26cc-4b37-aeb7-5054b7fd23b9 · outbound

This paper cites Sparsity in Transformers: A Systematic Literature Review.

Crisp Attention: Regularizing Transformers via Structured Sparsity Sparsity in Transformers: A Systematic Literature Review

Reference 12

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T23:03:10.128210Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-05T23:03:06.826890Z digest=sha256:5cee71127b42e1f3ae0c0a34a3ccf895583c9acdae1db595012193e1f281708b

Observation da8118e9-8423-4fe8-aa3a-c625c09fdc46 · outbound

This paper cites Graph-based Vision Transformer with Sparsity for Training on Small Datasets from Scratch.

Crisp Attention: Regularizing Transformers via Structured Sparsity Graph-based Vision Transformer with Sparsity for Training on Small Datasets from Scratch

Reference 13

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T23:03:10.113318Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-05T23:03:06.902196Z digest=sha256:fa511796bb0383775f3e8b0cb2ac4357dd16941014c7c8257e1673c552effd48

Observation 40003f6b-26d0-4f5f-a1e7-c31c326c5863 · outbound

This paper cites Dropout: A Simple Way to Prevent Neural Networks from Overfitting.

Crisp Attention: Regularizing Transformers via Structured Sparsity Dropout: A Simple Way to Prevent Neural Networks from Overfitting

Reference 14

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T23:03:09.990591Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-05T23:03:07.062723Z digest=sha256:e3fd5206d938e6ebfa780bc1740533cb9ba31455b48f5146e8e89cfa68d1cc7c

Observation 9cb59707-cc0d-4b93-a2d6-65fba0d82139 · outbound

This paper cites L1 Norm Regularization and Sparsity Explained for Dummies.

Crisp Attention: Regularizing Transformers via Structured Sparsity L1 Norm Regularization and Sparsity Explained for Dummies

Reference 15

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T23:03:09.721271Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-05T23:03:07.170445Z digest=sha256:33efc4c11467c8291a862f4d96e941cd9e651d94b482acd71e21025bd8757a16

Observation 098f4f08-f02f-4eb7-8fab-1c0aa1301bbd · outbound

This paper cites Regularizing Transformers with Deep Probabilistic Layers.

Crisp Attention: Regularizing Transformers via Structured Sparsity Regularizing Transformers with Deep Probabilistic Layers

Reference 16

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T23:03:09.419354Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-05T23:03:07.247530Z digest=sha256:ce1abf012ef894da4bae9da0cfdd5b14e5f8ddb04401cb4b1816828b3d32e96d

Observation d861836e-8089-4566-beca-6917e7ef7dce · outbound

This paper cites Double Consistency Regularization for Transformer Networks.

Crisp Attention: Regularizing Transformers via Structured Sparsity Double Consistency Regularization for Transformer Networks

Reference 17

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T23:03:09.169349Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-05T23:03:07.347374Z digest=sha256:fb66ef2ab5db6ba511a7aaab2030637ee7bf805da8d93b287a96e5a54f6a8634

Observation e31e9b2d-2c6b-4703-ab7b-274c0b4f0c06 · outbound

This paper cites The Lazy Neuron Phenomenon: On Emergence of Activation Sparsity in Transformers.

Crisp Attention: Regularizing Transformers via Structured Sparsity The Lazy Neuron Phenomenon: On Emergence of Activation Sparsity in Transformers

Reference 18

Resolution
unresolved
no resolver link, observed 2026-08-05T23:03:07.440296Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T23:03:07.440296Z digest=sha256:39dbbbd4741dabd0c32af445e5605cc87cd4dc54a3367ea06ef89627e8dae181

Observation 1a646dc4-551f-4f76-a7da-ce782628441c · outbound

This paper cites Efficient Algorithms for PDE Solving and Network Pruning.

Crisp Attention: Regularizing Transformers via Structured Sparsity Efficient Algorithms for PDE Solving and Network Pruning

Reference 19

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T23:03:08.881383Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-05T23:03:07.548135Z digest=sha256:6ec09b3c7a476a6b4a0869a287a9083df1c1e578b842e9b611af6a79cfcf797f

Observation 78f330da-2995-4fb3-94fa-4bbf9f978dde · outbound

This paper cites Memory-efficient Transformers via Top-k Attention.

Crisp Attention: Regularizing Transformers via Structured Sparsity Memory-efficient Transformers via Top-k Attention

Reference 20

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T23:03:08.696543Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-05T23:03:07.634059Z digest=sha256:263627309918bf2993c9897af1e71a967da1c1f55570c3fd8ed651d66a979ffc

Observation 1eb117d8-3312-42b3-84fe-11d6d8e5cbdf · outbound

This paper cites Sparse Transformer: Concentrated Attention Through Explicit Selection.

Crisp Attention: Regularizing Transformers via Structured Sparsity Sparse Transformer: Concentrated Attention Through Explicit Selection

Reference 21

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T23:03:08.517028Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-05T23:03:07.735820Z digest=sha256:6f17db912ef00aef70506e022a7608b77c5e84fa16d836338d5b44032d594056

Observation cd89a3ed-35f5-434a-b3af-665cc7116768 · outbound

This paper cites Sparser is Faster and Less is More: Efficient Sparse Attention for Long-Range Transformers.

Crisp Attention: Regularizing Transformers via Structured Sparsity Sparser is Faster and Less is More: Efficient Sparse Attention for Long-Range Transformers

Reference 22

Resolution
unresolved
no resolver link, observed 2026-08-05T23:03:07.855081Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T23:03:07.855081Z digest=sha256:531012327e2c834209dad2942db01803503ff0ab9c6513e12a8b32ae97d12e22

Observation f2c1e29f-26df-434b-a2c8-51b13e2c95a6 · outbound

This paper cites Zoology: Measuring and Improving Recall in Efficient Language Models.

Crisp Attention: Regularizing Transformers via Structured Sparsity Zoology: Measuring and Improving Recall in Efficient Language Models

Reference 23

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T23:03:08.364987Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-05T23:03:07.949630Z digest=sha256:e24a2c9c8bb72c3b903af7a16f63e842bf0ee9ba92268abe65665e94171f0fd4

Pith citing papers

No inbound Pith citation observations are available.