{"as_of":"2026-08-09T21:55:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d36573022eca638e80465a1d44aa5e51b0370373ac8edb760207b51c6ec57542","coverage":[{"denominator":23,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":23,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T23:03:07.949630Z","state":"measured"},{"denominator":23,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":23,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2508.06016/citation-record","integrity":"/paper/2508.06016/integrity","json":"/paper/2508.06016/citation-record.json","paper":"/paper/2508.06016"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2009.06732","last_updated":"2022-03-14T10:35:35Z","snapshot_observed_at":"2026-08-05T21:57:04.021766Z","submitted_at":"2020-09-14T20:38:14Z","title":"Efficient Transformers: A Survey","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.06732","snapshot_observed_at":"2026-08-05T23:03:05.668093Z","title":"Efficient Transformers: A Survey","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2508.06016","last_updated":"2025-08-08T05:04:28Z","snapshot_observed_at":"2026-08-09T19:21:19.472219Z","submitted_at":"2025-08-08T05:04:28Z","title":"Crisp Attention: Regularizing Transformers via Structured Sparsity","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-05T23:03:05.668093Z"},"links":{"cited_paper":"/paper/2009.06732","citing_paper":"/paper/2508.06016"},"observation_digest":"sha256:76b1c216c0b678d27b4dd76ca194046776f0dc8f2735b6690fb0bbfea89f4d63","observation_id":"7fffd0f1-c1c2-4559-aff7-3ba47c27c151","resolution":{"observed_at":"2026-08-05T23:03:05.668093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:03:10.216769Z","title":"A Survey on Efficient Vision Transformers: Algorithms, Techniques, and Performance Benchmarking","venue":null,"work_id":"051d4911-261f-489d-b340-cfac191e4506","year":2024},"citing_paper":{"arxiv_id":"2508.06016","last_updated":"2025-08-08T05:04:28Z","snapshot_observed_at":"2026-08-09T19:21:19.472219Z","submitted_at":"2025-08-08T05:04:28Z","title":"Crisp Attention: Regularizing Transformers via Structured Sparsity","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-05T23:03:05.749437Z"},"links":{"citing_paper":"/paper/2508.06016"},"observation_digest":"sha256:9a400a317eaac986ec660dbfd722a8154e1feb8110b864c2a149ffbbcb4a4219","observation_id":"5f24f36c-f3d7-40fd-8f01-535d012ff957","resolution":{"observed_at":"2026-08-05T23:03:10.221239Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:03:10.201035Z","title":"A Comprehensive Survey on Efficient Transformers","venue":null,"work_id":"15d1a983-42ae-4391-a80e-a25553a13169","year":2023},"citing_paper":{"arxiv_id":"2508.06016","last_updated":"2025-08-08T05:04:28Z","snapshot_observed_at":"2026-08-09T19:21:19.472219Z","submitted_at":"2025-08-08T05:04:28Z","title":"Crisp Attention: Regularizing Transformers via Structured Sparsity","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-05T23:03:05.858961Z"},"links":{"citing_paper":"/paper/2508.06016"},"observation_digest":"sha256:490bdc38af22b868535c59d24348fbda52412872af9982f4c474741508896ba0","observation_id":"76053760-67b4-4837-b54e-f599bb30a7ee","resolution":{"observed_at":"2026-08-05T23:03:10.205663Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1904.10509","last_updated":"2019-04-23T19:29:47Z","snapshot_observed_at":"2026-08-09T19:46:04.857927Z","submitted_at":"2019-04-23T19:29:47Z","title":"Generating Long Sequences with Sparse Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.10509","snapshot_observed_at":"2026-08-05T23:03:05.962611Z","title":"Generating Long Sequences with Sparse Transformers","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2508.06016","last_updated":"2025-08-08T05:04:28Z","snapshot_observed_at":"2026-08-09T19:21:19.472219Z","submitted_at":"2025-08-08T05:04:28Z","title":"Crisp Attention: Regularizing Transformers via Structured Sparsity","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-05T23:03:05.962611Z"},"links":{"cited_paper":"/paper/1904.10509","citing_paper":"/paper/2508.06016"},"observation_digest":"sha256:6987f3d6dca5205b1cdae243ce6f6fc42c32f2af10bbc0791e51029ec8c16b15","observation_id":"34f5365f-a17d-4889-929f-3de44ef7289b","resolution":{"observed_at":"2026-08-05T23:03:05.962611Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.04768","last_updated":"2020-06-14T08:15:54Z","snapshot_observed_at":"2026-07-06T09:27:03.809621Z","submitted_at":"2020-06-08T17:37:52Z","title":"Linformer: Self-Attention with Linear Complexity","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.04768","snapshot_observed_at":"2026-08-05T23:03:06.089159Z","title":"Linformer: Self-Attention with Linear Complexity","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2508.06016","last_updated":"2025-08-08T05:04:28Z","snapshot_observed_at":"2026-08-09T19:21:19.472219Z","submitted_at":"2025-08-08T05:04:28Z","title":"Crisp Attention: Regularizing Transformers via Structured Sparsity","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-05T23:03:06.089159Z"},"links":{"cited_paper":"/paper/2006.04768","citing_paper":"/paper/2508.06016"},"observation_digest":"sha256:ae70af2e3545ac38a61af1efa1ecd0c577cdac7a41a7cfc729b0097436bcdc0c","observation_id":"2f40eee7-7f4d-48f0-bf3e-253f8a34a663","resolution":{"observed_at":"2026-08-05T23:03:06.089159Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:03:10.185445Z","title":"Reformer: The Efficient Transformer","venue":null,"work_id":"029d3665-f59d-47cf-9940-adb4d5705cd2","year":2020},"citing_paper":{"arxiv_id":"2508.06016","last_updated":"2025-08-08T05:04:28Z","snapshot_observed_at":"2026-08-09T19:21:19.472219Z","submitted_at":"2025-08-08T05:04:28Z","title":"Crisp Attention: Regularizing Transformers via Structured Sparsity","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T23:03:06.155923Z"},"links":{"citing_paper":"/paper/2508.06016"},"observation_digest":"sha256:e9afdb4d8867cfb37f51462b23be0611f34fca0a3fa60c873dff54b5d719adbf","observation_id":"1b0fa903-8afa-4b92-8e89-65e7e7487d76","resolution":{"observed_at":"2026-08-05T23:03:10.190725Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:03:10.170151Z","title":"FlashAttention: Fast and Memory-Efficient Exact Attention with IO-Awareness","venue":null,"work_id":"a1c07183-d7e4-4f12-86d7-4e5580f76cf4","year":2022},"citing_paper":{"arxiv_id":"2508.06016","last_updated":"2025-08-08T05:04:28Z","snapshot_observed_at":"2026-08-09T19:21:19.472219Z","submitted_at":"2025-08-08T05:04:28Z","title":"Crisp Attention: Regularizing Transformers via Structured Sparsity","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-05T23:03:06.247275Z"},"links":{"citing_paper":"/paper/2508.06016"},"observation_digest":"sha256:2f28699bc3b821bbc3e8a90afed017e5140af4be120acf352544082c9487c23b","observation_id":"4d1d91db-3b0a-4bf9-a6e9-ab09186e09f9","resolution":{"observed_at":"2026-08-05T23:03:10.174720Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.13663","last_updated":"2024-12-19T06:32:26Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T09:39:44Z","title":"Smarter, Better, Faster, Longer: A Modern Bidirectional Encoder for Fast, Memory Efficient, and Long Context Finetuning and Inference","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.13663","snapshot_observed_at":"2026-08-05T23:03:06.339230Z","title":"Smarter, Better, Faster, Longer: A Modern Bidirectional Encoder for Fast, Memory Efficient, and Long Context Finetuning and Inference","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.06016","last_updated":"2025-08-08T05:04:28Z","snapshot_observed_at":"2026-08-09T19:21:19.472219Z","submitted_at":"2025-08-08T05:04:28Z","title":"Crisp Attention: Regularizing Transformers via Structured Sparsity","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-05T23:03:06.339230Z"},"links":{"cited_paper":"/paper/2412.13663","citing_paper":"/paper/2508.06016"},"observation_digest":"sha256:72ab7961c94d7e0b7c54f4390a37e9ff802bb8b2292b88afeb75cea59c080c7d","observation_id":"b5bd0adf-4c83-4337-8832-4cb18da2f8eb","resolution":{"observed_at":"2026-08-05T23:03:06.339230Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.15144","last_updated":"2025-03-31T02:56:26Z","snapshot_observed_at":"2026-07-06T16:11:39.571786Z","submitted_at":"2023-08-29T09:22:42Z","title":"TKwinFormer: Top k Window Attention in Vision Transformers for Feature Matching","version":2},"cited_work":{"arxiv_id":"2308.15144","doi":null,"metadata_source":"pith","pith_arxiv_id":"2308.15144","snapshot_observed_at":"2026-08-05T23:03:08.083307Z","title":"TKwinFormer: Top k Window Attention in Vision Transformers for Feature Matching","venue":"eess.IV","work_id":"a2f9e1fa-efad-4597-a0e8-9c4a2f3bf332","year":2023},"citing_paper":{"arxiv_id":"2508.06016","last_updated":"2025-08-08T05:04:28Z","snapshot_observed_at":"2026-08-09T19:21:19.472219Z","submitted_at":"2025-08-08T05:04:28Z","title":"Crisp Attention: Regularizing Transformers via Structured Sparsity","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-05T23:03:06.459688Z"},"links":{"cited_paper":"/paper/2308.15144","citing_paper":"/paper/2508.06016"},"observation_digest":"sha256:67c48bf9e53c1ace967d49a916c600db6da52de18406ee737d9ea1977065080d","observation_id":"4f4b114b-0756-4489-baf5-1fa75e11a079","resolution":{"observed_at":"2026-08-05T23:03:08.141171Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:03:10.154069Z","title":"Optimal Brain Damage","venue":null,"work_id":"a96cdebf-5f1b-42c9-aab4-c573da632a78","year":1990},"citing_paper":{"arxiv_id":"2508.06016","last_updated":"2025-08-08T05:04:28Z","snapshot_observed_at":"2026-08-09T19:21:19.472219Z","submitted_at":"2025-08-08T05:04:28Z","title":"Crisp Attention: Regularizing Transformers via Structured Sparsity","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T23:03:06.534693Z"},"links":{"citing_paper":"/paper/2508.06016"},"observation_digest":"sha256:43d1a9010bdcdb7817e1e3727da3b662257bca8e5971916ac4f57b159483f9b2","observation_id":"749df25a-84b9-4afc-b24b-fd98749a21e3","resolution":{"observed_at":"2026-08-05T23:03:10.158462Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:03:10.138486Z","title":"Learning Both Weights and Connections for Efficient Neural Networks","venue":null,"work_id":"708f231e-03cb-4ced-afd7-b371f0df9049","year":2015},"citing_paper":{"arxiv_id":"2508.06016","last_updated":"2025-08-08T05:04:28Z","snapshot_observed_at":"2026-08-09T19:21:19.472219Z","submitted_at":"2025-08-08T05:04:28Z","title":"Crisp Attention: Regularizing Transformers via Structured Sparsity","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T23:03:06.610248Z"},"links":{"citing_paper":"/paper/2508.06016"},"observation_digest":"sha256:9191dccc801a6e96ad135d6282eb9eeef3bfa78750bfb954d3ae675df5267942","observation_id":"1a8393dc-0b4b-4469-86c3-67fd192e9e16","resolution":{"observed_at":"2026-08-05T23:03:10.142970Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:03:10.123810Z","title":"Sparsity in Transformers: A Systematic Literature Review","venue":null,"work_id":"32215476-ffb9-4486-aa0a-9dd61019300f","year":2024},"citing_paper":{"arxiv_id":"2508.06016","last_updated":"2025-08-08T05:04:28Z","snapshot_observed_at":"2026-08-09T19:21:19.472219Z","submitted_at":"2025-08-08T05:04:28Z","title":"Crisp Attention: Regularizing Transformers via Structured Sparsity","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-05T23:03:06.826890Z"},"links":{"citing_paper":"/paper/2508.06016"},"observation_digest":"sha256:18498273066d122c2a940c677e9bb0d87b7f9a0f6cb92a3e3061d75d20d24012","observation_id":"647913a3-26cc-4b37-aeb7-5054b7fd23b9","resolution":{"observed_at":"2026-08-05T23:03:10.128210Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:03:10.108511Z","title":"Graph-based Vision Transformer with Sparsity for Training on Small Datasets from Scratch","venue":null,"work_id":"313b024d-7ef5-41fc-8dd1-8b7f82dd6f94","year":2025},"citing_paper":{"arxiv_id":"2508.06016","last_updated":"2025-08-08T05:04:28Z","snapshot_observed_at":"2026-08-09T19:21:19.472219Z","submitted_at":"2025-08-08T05:04:28Z","title":"Crisp Attention: Regularizing Transformers via Structured Sparsity","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-05T23:03:06.902196Z"},"links":{"citing_paper":"/paper/2508.06016"},"observation_digest":"sha256:c5311fa48a2957fdde4d49d325bef16beede785cc678bfcafaf09e315e49a2b0","observation_id":"da8118e9-8423-4fe8-aa3a-c625c09fdc46","resolution":{"observed_at":"2026-08-05T23:03:10.113318Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:03:09.899007Z","title":"Dropout: A Simple Way to Prevent Neural Networks from Overfitting","venue":null,"work_id":"ec3d8ee8-5da6-414d-aebd-becbf760f6bf","year":1929},"citing_paper":{"arxiv_id":"2508.06016","last_updated":"2025-08-08T05:04:28Z","snapshot_observed_at":"2026-08-09T19:21:19.472219Z","submitted_at":"2025-08-08T05:04:28Z","title":"Crisp Attention: Regularizing Transformers via Structured Sparsity","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-05T23:03:07.062723Z"},"links":{"citing_paper":"/paper/2508.06016"},"observation_digest":"sha256:3253c893c0fa0a841520fa184a5691d6c3fa191c0cd78f0da0ff55c635b0ea08","observation_id":"40003f6b-26d0-4f5f-a1e7-c31c326c5863","resolution":{"observed_at":"2026-08-05T23:03:09.990591Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:03:09.592548Z","title":"L1 Norm Regularization and Sparsity Explained for Dummies","venue":null,"work_id":"5f34abfa-781d-4349-aa86-38c0cfed4119","year":2016},"citing_paper":{"arxiv_id":"2508.06016","last_updated":"2025-08-08T05:04:28Z","snapshot_observed_at":"2026-08-09T19:21:19.472219Z","submitted_at":"2025-08-08T05:04:28Z","title":"Crisp Attention: Regularizing Transformers via Structured Sparsity","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-05T23:03:07.170445Z"},"links":{"citing_paper":"/paper/2508.06016"},"observation_digest":"sha256:7690b413ca730abe8bbaa71e6970577ce082e96dcb608fa8ed2318dfbb3ad390","observation_id":"9cb59707-cc0d-4b93-a2d6-65fba0d82139","resolution":{"observed_at":"2026-08-05T23:03:09.721271Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:03:09.308173Z","title":"Regularizing Transformers with Deep Probabilistic Layers","venue":null,"work_id":"14b13f27-11e8-4a61-b36b-4cb31f7c178a","year":2023},"citing_paper":{"arxiv_id":"2508.06016","last_updated":"2025-08-08T05:04:28Z","snapshot_observed_at":"2026-08-09T19:21:19.472219Z","submitted_at":"2025-08-08T05:04:28Z","title":"Crisp Attention: Regularizing Transformers via Structured Sparsity","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-05T23:03:07.247530Z"},"links":{"citing_paper":"/paper/2508.06016"},"observation_digest":"sha256:8c26fcbe7aa898ffef3957edf6b157901d98730c112fdcca2a9fbcffb8e5b9be","observation_id":"098f4f08-f02f-4eb7-8fab-1c0aa1301bbd","resolution":{"observed_at":"2026-08-05T23:03:09.419354Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:03:09.011151Z","title":"Double Consistency Regularization for Transformer Networks","venue":null,"work_id":"b5ac9fd8-a3c7-4040-9415-6caab3ed4f92","year":2023},"citing_paper":{"arxiv_id":"2508.06016","last_updated":"2025-08-08T05:04:28Z","snapshot_observed_at":"2026-08-09T19:21:19.472219Z","submitted_at":"2025-08-08T05:04:28Z","title":"Crisp Attention: Regularizing Transformers via Structured Sparsity","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-05T23:03:07.347374Z"},"links":{"citing_paper":"/paper/2508.06016"},"observation_digest":"sha256:9a460cf70294f2ee58759aac143a12a9cec5d186ee9960d22d64476c4c13589e","observation_id":"d861836e-8089-4566-beca-6917e7ef7dce","resolution":{"observed_at":"2026-08-05T23:03:09.169349Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.06313","last_updated":"2023-06-09T21:53:43Z","snapshot_observed_at":"2026-08-09T19:21:20.628465Z","submitted_at":"2022-10-12T15:25:19Z","title":"The Lazy Neuron Phenomenon: On Emergence of Activation Sparsity in Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.06313","snapshot_observed_at":"2026-08-05T23:03:07.440296Z","title":"The Lazy Neuron Phenomenon: On Emergence of Activation Sparsity in Transformers","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.06016","last_updated":"2025-08-08T05:04:28Z","snapshot_observed_at":"2026-08-09T19:21:19.472219Z","submitted_at":"2025-08-08T05:04:28Z","title":"Crisp Attention: Regularizing Transformers via Structured Sparsity","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-05T23:03:07.440296Z"},"links":{"cited_paper":"/paper/2210.06313","citing_paper":"/paper/2508.06016"},"observation_digest":"sha256:39dbbbd4741dabd0c32af445e5605cc87cd4dc54a3367ea06ef89627e8dae181","observation_id":"e31e9b2d-2c6b-4703-ab7b-274c0b4f0c06","resolution":{"observed_at":"2026-08-05T23:03:07.440296Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:03:08.787013Z","title":"Efficient Algorithms for PDE Solving and Network Pruning","venue":null,"work_id":"d201fba8-1100-4a7b-a25c-6132f1fa6b0c","year":2023},"citing_paper":{"arxiv_id":"2508.06016","last_updated":"2025-08-08T05:04:28Z","snapshot_observed_at":"2026-08-09T19:21:19.472219Z","submitted_at":"2025-08-08T05:04:28Z","title":"Crisp Attention: Regularizing Transformers via Structured Sparsity","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-05T23:03:07.548135Z"},"links":{"citing_paper":"/paper/2508.06016"},"observation_digest":"sha256:d5565dee4578eb9011033581fb56179b9a5d121e27d5324c7bb4b939957af25c","observation_id":"1a646dc4-551f-4f76-a7da-ce782628441c","resolution":{"observed_at":"2026-08-05T23:03:08.881383Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:03:08.612857Z","title":"Memory-efficient Transformers via Top-k Attention","venue":null,"work_id":"5158b9cb-c884-4d79-a326-10526a39528e","year":2021},"citing_paper":{"arxiv_id":"2508.06016","last_updated":"2025-08-08T05:04:28Z","snapshot_observed_at":"2026-08-09T19:21:19.472219Z","submitted_at":"2025-08-08T05:04:28Z","title":"Crisp Attention: Regularizing Transformers via Structured Sparsity","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-05T23:03:07.634059Z"},"links":{"citing_paper":"/paper/2508.06016"},"observation_digest":"sha256:9673ece23bbbaada603025bd1bdb8a79dc5c6a346ede56123fc26e4d2ae3b564","observation_id":"78f330da-2995-4fb3-94fa-4bbf9f978dde","resolution":{"observed_at":"2026-08-05T23:03:08.696543Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:03:08.442719Z","title":"Sparse Transformer: Concentrated Attention Through Explicit Selection","venue":null,"work_id":"088dfc5c-482b-462f-ac67-53152c10cf1a","year":2019},"citing_paper":{"arxiv_id":"2508.06016","last_updated":"2025-08-08T05:04:28Z","snapshot_observed_at":"2026-08-09T19:21:19.472219Z","submitted_at":"2025-08-08T05:04:28Z","title":"Crisp Attention: Regularizing Transformers via Structured Sparsity","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-05T23:03:07.735820Z"},"links":{"citing_paper":"/paper/2508.06016"},"observation_digest":"sha256:cf0953beb46235590d3c8cd709ca991a2125d44ca8f87727a6975f7703bcb141","observation_id":"1eb117d8-3312-42b3-84fe-11d6d8e5cbdf","resolution":{"observed_at":"2026-08-05T23:03:08.517028Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16747","last_updated":"2024-06-24T15:55:59Z","snapshot_observed_at":"2026-08-09T13:46:52.979974Z","submitted_at":"2024-06-24T15:55:59Z","title":"Sparser is Faster and Less is More: Efficient Sparse Attention for Long-Range Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16747","snapshot_observed_at":"2026-08-05T23:03:07.855081Z","title":"Sparser is Faster and Less is More: Efficient Sparse Attention for Long-Range Transformers","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.06016","last_updated":"2025-08-08T05:04:28Z","snapshot_observed_at":"2026-08-09T19:21:19.472219Z","submitted_at":"2025-08-08T05:04:28Z","title":"Crisp Attention: Regularizing Transformers via Structured Sparsity","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-05T23:03:07.855081Z"},"links":{"cited_paper":"/paper/2406.16747","citing_paper":"/paper/2508.06016"},"observation_digest":"sha256:531012327e2c834209dad2942db01803503ff0ab9c6513e12a8b32ae97d12e22","observation_id":"cd89a3ed-35f5-434a-b3af-665cc7116768","resolution":{"observed_at":"2026-08-05T23:03:07.855081Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:03:08.305548Z","title":"Zoology: Measuring and Improving Recall in Efficient Language Models","venue":null,"work_id":"cb7b4216-5ac2-4cac-bc81-0c21854fb858","year":2023},"citing_paper":{"arxiv_id":"2508.06016","last_updated":"2025-08-08T05:04:28Z","snapshot_observed_at":"2026-08-09T19:21:19.472219Z","submitted_at":"2025-08-08T05:04:28Z","title":"Crisp Attention: Regularizing Transformers via Structured Sparsity","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-05T23:03:07.949630Z"},"links":{"citing_paper":"/paper/2508.06016"},"observation_digest":"sha256:a84300d292ea89b5c18b2dda3db2761db77a491441ac16a7e6af1ef3d290f433","observation_id":"f2c1e29f-26df-434b-a2c8-51b13e2c95a6","resolution":{"observed_at":"2026-08-05T23:03:08.364987Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2508.06016","last_updated":"2025-08-08T05:04:28Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-09T19:21:19.472219Z","submitted_at":"2025-08-08T05:04:28Z","title":"Crisp Attention: Regularizing Transformers via Structured Sparsity"},"reference_resolution":{"displayed":23,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":6,"verified_exact":1,"verified_fuzzy":16},"total_outbound_references":23},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 23 of 23 outbound references and 0 inbound Pith citation observations for arXiv:2508.06016."}