{"as_of":"2026-08-18T17:58:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:52f7ab1a2e73056fcb98ede300ae38e9525709b50e09ec9b17a62689b883ac60","coverage":[{"denominator":35,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":35,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T00:18:35.310454Z","state":"measured"},{"denominator":35,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":35,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.12149/citation-record","integrity":"/paper/2608.12149/integrity","json":"/paper/2608.12149/citation-record.json","paper":"/paper/2608.12149"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.06415","last_updated":"2025-02-26T01:59:40Z","snapshot_observed_at":"2026-08-17T00:55:48.139522Z","submitted_at":"2025-02-10T12:54:17Z","title":"Systematic Outliers in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.06415","snapshot_observed_at":"2026-08-16T00:18:34.644968Z","title":"Systematic outliers in large language models.arXiv preprint arXiv:2502.06415,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12149","last_updated":"2026-08-12T15:11:18Z","snapshot_observed_at":"2026-08-18T07:34:07.636387Z","submitted_at":"2026-08-12T15:11:18Z","title":"Massive Activations in Hybrid Linear Attention Large Language Models: Pre-Attention Spikes and Inter-Spike Plateaus","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-16T00:18:34.644968Z"},"links":{"cited_paper":"/paper/2502.06415","citing_paper":"/paper/2608.12149"},"observation_digest":"sha256:8fe6c1b1ee44f584908af70527d9d244b296aed88140e26075284c949f5e768e","observation_id":"a3e4f8ee-7b0c-442d-a198-3843e0ce60c1","resolution":{"observed_at":"2026-08-16T00:18:34.644968Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2603.00729","last_updated":"2026-02-28T16:25:04Z","snapshot_observed_at":"2026-08-14T11:50:51.747505Z","submitted_at":"2026-02-28T16:25:04Z","title":"Qwen3-Coder-Next Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2603.00729","snapshot_observed_at":"2026-08-16T00:18:34.722302Z","title":"Qwen3-coder-next technical report.arXiv preprint arXiv:2603.00729,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12149","last_updated":"2026-08-12T15:11:18Z","snapshot_observed_at":"2026-08-18T07:34:07.636387Z","submitted_at":"2026-08-12T15:11:18Z","title":"Massive Activations in Hybrid Linear Attention Large Language Models: Pre-Attention Spikes and Inter-Spike Plateaus","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-16T00:18:34.722302Z"},"links":{"cited_paper":"/paper/2603.00729","citing_paper":"/paper/2608.12149"},"observation_digest":"sha256:74841471168e67bb0c1c93b2ef291eddb25f098596b0fcfc0304059b680ba6f3","observation_id":"3112966e-095e-4839-aad6-95f7a8001afb","resolution":{"observed_at":"2026-08-16T00:18:34.722302Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:18:35.781976Z","title":null,"venue":null,"work_id":"3e9dee46-fc0e-41a1-b8d8-9b12bc40f99e","year":2025},"citing_paper":{"arxiv_id":"2608.12149","last_updated":"2026-08-12T15:11:18Z","snapshot_observed_at":"2026-08-18T07:34:07.636387Z","submitted_at":"2026-08-12T15:11:18Z","title":"Massive Activations in Hybrid Linear Attention Large Language Models: Pre-Attention Spikes and Inter-Spike Plateaus","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-16T00:18:35.261058Z"},"links":{"citing_paper":"/paper/2608.12149"},"observation_digest":"sha256:9863a2b0453c04dde12f1b6c89e005996e6d786fda891059e4c0c7cfe9008985","observation_id":"e5ebc945-e599-412a-8cab-0aaef105baa3","resolution":{"observed_at":"2026-08-16T00:18:35.865952Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2207.04672","last_updated":"2022-08-25T17:10:53Z","snapshot_observed_at":"2026-07-06T13:29:47.927628Z","submitted_at":"2022-07-11T07:33:36Z","title":"No Language Left Behind: Scaling Human-Centered Machine Translation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.04672","snapshot_observed_at":"2026-08-16T00:18:34.740775Z","title":"No language left behind: Scaling human-centered machine translation.arXiv preprint arXiv:2207.04672,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12149","last_updated":"2026-08-12T15:11:18Z","snapshot_observed_at":"2026-08-18T07:34:07.636387Z","submitted_at":"2026-08-12T15:11:18Z","title":"Massive Activations in Hybrid Linear Attention Large Language Models: Pre-Attention Spikes and Inter-Spike Plateaus","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-16T00:18:34.740775Z"},"links":{"cited_paper":"/paper/2207.04672","citing_paper":"/paper/2608.12149"},"observation_digest":"sha256:b705f2825c0482a67c61228685f6662d71e0e8c8416ac24afff8f6bf501407ff","observation_id":"81e1fd05-f38e-46e3-8916-68448e4f8859","resolution":{"observed_at":"2026-08-16T00:18:34.740775Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15242","last_updated":"2024-11-22T02:55:20Z","snapshot_observed_at":"2026-08-14T05:08:15.609977Z","submitted_at":"2024-11-22T02:55:20Z","title":"The Zamba2 Suite: Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15242","snapshot_observed_at":"2026-08-16T00:18:34.748692Z","title":"The zamba2 suite: Technical report.arXiv preprint arXiv:2411.15242,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12149","last_updated":"2026-08-12T15:11:18Z","snapshot_observed_at":"2026-08-18T07:34:07.636387Z","submitted_at":"2026-08-12T15:11:18Z","title":"Massive Activations in Hybrid Linear Attention Large Language Models: Pre-Attention Spikes and Inter-Spike Plateaus","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-16T00:18:34.748692Z"},"links":{"cited_paper":"/paper/2411.15242","citing_paper":"/paper/2608.12149"},"observation_digest":"sha256:cad079f7a218b91b84ad5fc07e53e80b3ef3eb563a874ca8335a5d8ce26fa8ad","observation_id":"7d39d2e4-ab2e-4fa0-807e-4b3fc554fa30","resolution":{"observed_at":"2026-08-16T00:18:34.748692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:18:35.755311Z","title":"Summer is warm. Winter is cold","venue":null,"work_id":"1c3d7523-33d9-4e4e-9c4c-305846026421","year":2026},"citing_paper":{"arxiv_id":"2608.12149","last_updated":"2026-08-12T15:11:18Z","snapshot_observed_at":"2026-08-18T07:34:07.636387Z","submitted_at":"2026-08-12T15:11:18Z","title":"Massive Activations in Hybrid Linear Attention Large Language Models: Pre-Attention Spikes and Inter-Spike Plateaus","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-16T00:18:35.310454Z"},"links":{"citing_paper":"/paper/2608.12149"},"observation_digest":"sha256:ae60311d39509cc2b320e0d4332574b68b478b18dbcbc11bb5238966050fe1a5","observation_id":"9d5a2055-c360-44c3-9db5-5998aee115e3","resolution":{"observed_at":"2026-08-16T00:18:35.760141Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1909.09436","last_updated":"2020-06-08T09:09:28Z","snapshot_observed_at":"2026-08-15T20:39:17.343191Z","submitted_at":"2019-09-20T11:52:45Z","title":"CodeSearchNet Challenge: Evaluating the State of Semantic Code Search","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.09436","snapshot_observed_at":"2026-08-16T00:18:34.887327Z","title":"Codesearchnet challenge: Evaluating the state of semantic code search.arXiv preprint arXiv:1909.09436,","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2608.12149","last_updated":"2026-08-12T15:11:18Z","snapshot_observed_at":"2026-08-18T07:34:07.636387Z","submitted_at":"2026-08-12T15:11:18Z","title":"Massive Activations in Hybrid Linear Attention Large Language Models: Pre-Attention Spikes and Inter-Spike Plateaus","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-16T00:18:34.887327Z"},"links":{"cited_paper":"/paper/1909.09436","citing_paper":"/paper/2608.12149"},"observation_digest":"sha256:31c4d5ec338a89a1b5b7594711facca066737868c94d3ae180e6ac05dce64270","observation_id":"7ee92d5a-5642-4717-b0ee-d0a87341525a","resolution":{"observed_at":"2026-08-16T00:18:34.887327Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.19887","last_updated":"2024-07-03T14:30:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-28T23:55:06Z","title":"Jamba: A Hybrid Transformer-Mamba Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.19887","snapshot_observed_at":"2026-08-16T00:18:34.897393Z","title":"Jamba: A hybrid transformer- mamba language model.arXiv preprint arXiv:2403.19887,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12149","last_updated":"2026-08-12T15:11:18Z","snapshot_observed_at":"2026-08-18T07:34:07.636387Z","submitted_at":"2026-08-12T15:11:18Z","title":"Massive Activations in Hybrid Linear Attention Large Language Models: Pre-Attention Spikes and Inter-Spike Plateaus","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-16T00:18:34.897393Z"},"links":{"cited_paper":"/paper/2403.19887","citing_paper":"/paper/2608.12149"},"observation_digest":"sha256:06f7714fa6c2ff9554d1fd3631ead68a8c2b128ad78298af4a8b4db83e1897d1","observation_id":"7bb65d9d-9b7b-4688-a475-873bb44e2299","resolution":{"observed_at":"2026-08-16T00:18:34.897393Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:18:36.360872Z","title":"Openceres: When open information extrac- tion meets the semi-structured web","venue":null,"work_id":"ea671b4d-c817-41bf-ba56-206f81b714de","year":2019},"citing_paper":{"arxiv_id":"2608.12149","last_updated":"2026-08-12T15:11:18Z","snapshot_observed_at":"2026-08-18T07:34:07.636387Z","submitted_at":"2026-08-12T15:11:18Z","title":"Massive Activations in Hybrid Linear Attention Large Language Models: Pre-Attention Spikes and Inter-Spike Plateaus","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-16T00:18:34.901381Z"},"links":{"citing_paper":"/paper/2608.12149"},"observation_digest":"sha256:4907db3127136d9ea931996c2a521b7228cc8bb36b679fc2a41ca954d182b757","observation_id":"a302ee69-6b44-45a7-adb1-7f83887a5629","resolution":{"observed_at":"2026-08-16T00:18:36.388985Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1609.07843","last_updated":"2016-09-26T04:06:13Z","snapshot_observed_at":"2026-08-17T01:46:43.513643Z","submitted_at":"2016-09-26T04:06:13Z","title":"Pointer Sentinel Mixture Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.07843","snapshot_observed_at":"2026-08-16T00:18:34.905921Z","title":"Pointer sentinel mixture models.arXiv preprint arXiv:1609.07843,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12149","last_updated":"2026-08-12T15:11:18Z","snapshot_observed_at":"2026-08-18T07:34:07.636387Z","submitted_at":"2026-08-12T15:11:18Z","title":"Massive Activations in Hybrid Linear Attention Large Language Models: Pre-Attention Spikes and Inter-Spike Plateaus","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-16T00:18:34.905921Z"},"links":{"cited_paper":"/paper/1609.07843","citing_paper":"/paper/2608.12149"},"observation_digest":"sha256:9b5e632a47715706d49828680611720ef386821a37b1e1faf45f44c9b09d6f93","observation_id":"fafa363d-1695-48a8-bb41-1f8f3d0a9ef1","resolution":{"observed_at":"2026-08-16T00:18:34.905921Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.08504","last_updated":"2026-05-12T18:33:07Z","snapshot_observed_at":"2026-08-15T07:10:24.839341Z","submitted_at":"2026-05-08T21:37:27Z","title":"A Single Layer to Explain Them All:Understanding Massive Activations in Large Language Models","version":2},"cited_work":{"arxiv_id":"2605.08504","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.08504","snapshot_observed_at":"2026-08-16T00:18:35.500750Z","title":"A Single Layer to Explain Them All:Understanding Massive Activations in Large Language Models","venue":"cs.CL","work_id":"93cb395b-5ad8-4917-8414-9e5dcac7ee10","year":2026},"citing_paper":{"arxiv_id":"2608.12149","last_updated":"2026-08-12T15:11:18Z","snapshot_observed_at":"2026-08-18T07:34:07.636387Z","submitted_at":"2026-08-12T15:11:18Z","title":"Massive Activations in Hybrid Linear Attention Large Language Models: Pre-Attention Spikes and Inter-Spike Plateaus","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-16T00:18:34.910736Z"},"links":{"cited_paper":"/paper/2605.08504","citing_paper":"/paper/2608.12149"},"observation_digest":"sha256:95436cdebe81e28dcac63b64fbd8b4d634495c11094b26ffbfb11ac908d845f1","observation_id":"9db1afc5-9de9-47e2-a091-0ae47a10a8e1","resolution":{"observed_at":"2026-08-16T00:18:35.528311Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:18:36.206771Z","title":"Kvsink: Understanding and enhancing the preservation of attention sinks in kv cache quantization for llms","venue":null,"work_id":"dd23aef3-ace3-4f3e-879d-8bbaec777276","year":2025},"citing_paper":{"arxiv_id":"2608.12149","last_updated":"2026-08-12T15:11:18Z","snapshot_observed_at":"2026-08-18T07:34:07.636387Z","submitted_at":"2026-08-12T15:11:18Z","title":"Massive Activations in Hybrid Linear Attention Large Language Models: Pre-Attention Spikes and Inter-Spike Plateaus","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-16T00:18:34.987375Z"},"links":{"citing_paper":"/paper/2608.12149"},"observation_digest":"sha256:e5efba980600979a7de464ca2737d92d2f1ff117f07597d754fda3e45b7f8364","observation_id":"0995e174-6174-4423-8e46-36b4fc2fec4d","resolution":{"observed_at":"2026-08-16T00:18:36.264822Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17762","last_updated":"2024-08-14T16:00:49Z","snapshot_observed_at":"2026-08-16T07:45:21.406264Z","submitted_at":"2024-02-27T18:55:17Z","title":"Massive Activations in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.17762","snapshot_observed_at":"2026-08-16T00:18:35.048113Z","title":"Rotatekv: Accurate and robust 2-bit kv cache quantization for llms via outlier-aware adaptive rotations","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.12149","last_updated":"2026-08-12T15:11:18Z","snapshot_observed_at":"2026-08-18T07:34:07.636387Z","submitted_at":"2026-08-12T15:11:18Z","title":"Massive Activations in Hybrid Linear Attention Large Language Models: Pre-Attention Spikes and Inter-Spike Plateaus","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-16T00:18:35.048113Z"},"links":{"cited_paper":"/paper/2402.17762","citing_paper":"/paper/2608.12149"},"observation_digest":"sha256:6564b78d41d45b86cf8d6246cc4bf806ab1e98d4bfa67fcd5613d7e644f3c24a","observation_id":"5d2fe05f-6c5f-44c8-a6b7-39cba0231592","resolution":{"observed_at":"2026-08-16T00:18:35.048113Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:18:35.070942Z","title":"The spike, the sparse and the sink: Anatomy of massive activations and attention sinks.arXiv preprint arXiv:2603.05498,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12149","last_updated":"2026-08-12T15:11:18Z","snapshot_observed_at":"2026-08-18T07:34:07.636387Z","submitted_at":"2026-08-12T15:11:18Z","title":"Massive Activations in Hybrid Linear Attention Large Language Models: Pre-Attention Spikes and Inter-Spike Plateaus","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-16T00:18:35.070942Z"},"links":{"citing_paper":"/paper/2608.12149"},"observation_digest":"sha256:4695990099290ffaf429efe1c6a8378e7efa614516b00eb5a6e552fa59b99fe7","observation_id":"acc87cef-edfd-409a-922c-52d187060696","resolution":{"observed_at":"2026-08-16T00:18:35.070942Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.08621","last_updated":"2023-08-09T08:53:08Z","snapshot_observed_at":"2026-08-02T13:21:32.251959Z","submitted_at":"2023-07-17T16:40:01Z","title":"Retentive Network: A Successor to Transformer for Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.08621","snapshot_observed_at":"2026-08-16T00:18:35.075087Z","title":"Retentive network: A successor to transformer for large language models.arXiv preprint arXiv:2307.08621,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12149","last_updated":"2026-08-12T15:11:18Z","snapshot_observed_at":"2026-08-18T07:34:07.636387Z","submitted_at":"2026-08-12T15:11:18Z","title":"Massive Activations in Hybrid Linear Attention Large Language Models: Pre-Attention Spikes and Inter-Spike Plateaus","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-16T00:18:35.075087Z"},"links":{"cited_paper":"/paper/2307.08621","citing_paper":"/paper/2608.12149"},"observation_digest":"sha256:ccd2d0e23a8b771d86853eb9298024e467804e33966a67c8c6bc24f255f30844","observation_id":"14dddc32-3e14-45a6-8519-315543d69a32","resolution":{"observed_at":"2026-08-16T00:18:35.075087Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.26692","last_updated":"2025-11-01T12:05:18Z","snapshot_observed_at":"2026-08-07T19:30:34.681869Z","submitted_at":"2025-10-30T16:59:43Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.26692","snapshot_observed_at":"2026-08-16T00:18:35.080028Z","title":"Kimi linear: An expressive, efficient attention architecture","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12149","last_updated":"2026-08-12T15:11:18Z","snapshot_observed_at":"2026-08-18T07:34:07.636387Z","submitted_at":"2026-08-12T15:11:18Z","title":"Massive Activations in Hybrid Linear Attention Large Language Models: Pre-Attention Spikes and Inter-Spike Plateaus","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-16T00:18:35.080028Z"},"links":{"cited_paper":"/paper/2510.26692","citing_paper":"/paper/2608.12149"},"observation_digest":"sha256:a22e3f53b436189b8d12cc6337e6ac873ac1ce8ebab757476ba20f5c70968b84","observation_id":"f92748c3-ef65-44b7-b624-05681a460ac4","resolution":{"observed_at":"2026-08-16T00:18:35.080028Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:18:36.193121Z","title":"Efficient streaming language models with attention sinks","venue":null,"work_id":"e43a5fdc-c2cd-4129-acad-f9ebd22c8b78","year":2024},"citing_paper":{"arxiv_id":"2608.12149","last_updated":"2026-08-12T15:11:18Z","snapshot_observed_at":"2026-08-18T07:34:07.636387Z","submitted_at":"2026-08-12T15:11:18Z","title":"Massive Activations in Hybrid Linear Attention Large Language Models: Pre-Attention Spikes and Inter-Spike Plateaus","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-16T00:18:35.088973Z"},"links":{"citing_paper":"/paper/2608.12149"},"observation_digest":"sha256:ae5c65b4bc20c339fdfe508861ed162bcc06a23687ffeac6f3e3ff05a89c4136","observation_id":"63c1c30f-70c4-4998-bb6c-5a09dc94086e","resolution":{"observed_at":"2026-08-16T00:18:36.197953Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:18:36.177928Z","title":"Exploring layer-wise information effectiveness for post- training quantization in small language models","venue":null,"work_id":"295b779a-2047-4f11-9913-d1531f2eda92","year":2026},"citing_paper":{"arxiv_id":"2608.12149","last_updated":"2026-08-12T15:11:18Z","snapshot_observed_at":"2026-08-18T07:34:07.636387Z","submitted_at":"2026-08-12T15:11:18Z","title":"Massive Activations in Hybrid Linear Attention Large Language Models: Pre-Attention Spikes and Inter-Spike Plateaus","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-16T00:18:35.095465Z"},"links":{"citing_paper":"/paper/2608.12149"},"observation_digest":"sha256:4114d8b6f526e83aec3fb59991ef2ae663b7ccf1947568d308bfda4309f44985","observation_id":"2c8b2b09-17d6-415c-a2f3-ee992ed281fc","resolution":{"observed_at":"2026-08-16T00:18:36.183353Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-16T00:18:35.100093Z","title":"Qwen3 technical report.arXiv preprint arXiv:2505.09388, 2025a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12149","last_updated":"2026-08-12T15:11:18Z","snapshot_observed_at":"2026-08-18T07:34:07.636387Z","submitted_at":"2026-08-12T15:11:18Z","title":"Massive Activations in Hybrid Linear Attention Large Language Models: Pre-Attention Spikes and Inter-Spike Plateaus","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-16T00:18:35.100093Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2608.12149"},"observation_digest":"sha256:c135f0888c437b11fdedc41900b20b3510063503613fd586c2e4aa111f821ee0","observation_id":"84c599d5-2be7-49f9-a228-95e0a16947ef","resolution":{"observed_at":"2026-08-16T00:18:35.100093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06635","last_updated":"2024-08-27T01:27:29Z","snapshot_observed_at":"2026-08-17T21:47:46.144942Z","submitted_at":"2023-12-11T18:51:59Z","title":"Gated Linear Attention Transformers with Hardware-Efficient Training","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06635","snapshot_observed_at":"2026-08-16T00:18:35.103875Z","title":"Songlin Yang, Bailin Wang, Yikang Shen, Rameswar Panda, and Yoon Kim","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12149","last_updated":"2026-08-12T15:11:18Z","snapshot_observed_at":"2026-08-18T07:34:07.636387Z","submitted_at":"2026-08-12T15:11:18Z","title":"Massive Activations in Hybrid Linear Attention Large Language Models: Pre-Attention Spikes and Inter-Spike Plateaus","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-16T00:18:35.103875Z"},"links":{"cited_paper":"/paper/2312.06635","citing_paper":"/paper/2608.12149"},"observation_digest":"sha256:0a93f4dd8baac886fcdcf9732571d125bcda383fd152028e4acf02c910f76f2d","observation_id":"ffbc3440-38ca-4ee5-981b-2cf3dcb09cf8","resolution":{"observed_at":"2026-08-16T00:18:35.103875Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:18:36.133660Z","title":"Gated delta networks: Improving mamba2 with delta rule","venue":null,"work_id":"064c66a4-95ae-4ddb-913a-6be7aa4d3e93","year":2025},"citing_paper":{"arxiv_id":"2608.12149","last_updated":"2026-08-12T15:11:18Z","snapshot_observed_at":"2026-08-18T07:34:07.636387Z","submitted_at":"2026-08-12T15:11:18Z","title":"Massive Activations in Hybrid Linear Attention Large Language Models: Pre-Attention Spikes and Inter-Spike Plateaus","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-16T00:18:35.108529Z"},"links":{"citing_paper":"/paper/2608.12149"},"observation_digest":"sha256:c421ffb191b7cd20d287cede6a5ce0f206afe6a5137a49b042a461f5fa1b785c","observation_id":"b90a2a02-babf-40a6-bf41-50c4cc34ca8c","resolution":{"observed_at":"2026-08-16T00:18:36.168168Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:18:35.950591Z","title":"Beyond outliers: A data-free layer-wise mixed- precision quantization approach driven by numerical and structural dual-sensitivity.Under review, 2026a","venue":null,"work_id":"edc5fe8c-45d6-42d6-a33d-edb402bbdd57","year":2025},"citing_paper":{"arxiv_id":"2608.12149","last_updated":"2026-08-12T15:11:18Z","snapshot_observed_at":"2026-08-18T07:34:07.636387Z","submitted_at":"2026-08-12T15:11:18Z","title":"Massive Activations in Hybrid Linear Attention Large Language Models: Pre-Attention Spikes and Inter-Spike Plateaus","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-16T00:18:35.112582Z"},"links":{"citing_paper":"/paper/2608.12149"},"observation_digest":"sha256:4ea008b357675fd60d954538111d1b71215215584343bb558f2aea18fa4db13f","observation_id":"27f9d213-eb58-45fd-8c30-31fe6e1d74e4","resolution":{"observed_at":"2026-08-16T00:18:36.053575Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:18:35.934203Z","title":"Summer is warm. Winter is cold","venue":null,"work_id":"3f2e9168-6ef1-4e2f-8edd-30bba0918f2d","year":2024},"citing_paper":{"arxiv_id":"2608.12149","last_updated":"2026-08-12T15:11:18Z","snapshot_observed_at":"2026-08-18T07:34:07.636387Z","submitted_at":"2026-08-12T15:11:18Z","title":"Massive Activations in Hybrid Linear Attention Large Language Models: Pre-Attention Spikes and Inter-Spike Plateaus","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-16T00:18:35.135314Z"},"links":{"citing_paper":"/paper/2608.12149"},"observation_digest":"sha256:9b70b9101640088dfc68bca12b57a37b51c2c94c72a34fc6efb8fcd19df179ff","observation_id":"e1b6f645-94c0-43a0-9a7d-a478ae67af47","resolution":{"observed_at":"2026-08-16T00:18:35.939669Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:18:35.918881Z","title":"Pronounced MAs concentrate at attention-sink positions, particu- larly the initial token, “Summer,” and the first period","venue":null,"work_id":"dd7476c1-c79d-49bb-b7dd-f83da0126885","year":2016},"citing_paper":{"arxiv_id":"2608.12149","last_updated":"2026-08-12T15:11:18Z","snapshot_observed_at":"2026-08-18T07:34:07.636387Z","submitted_at":"2026-08-12T15:11:18Z","title":"Massive Activations in Hybrid Linear Attention Large Language Models: Pre-Attention Spikes and Inter-Spike Plateaus","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-16T00:18:35.168683Z"},"links":{"citing_paper":"/paper/2608.12149"},"observation_digest":"sha256:502f67d38055d9860677ddc86347dc95d6fd95a2d7abe7aae5fb6283eaad0368","observation_id":"be2d2464-8e88-4fd1-aa93-5d11a0f77b69","resolution":{"observed_at":"2026-08-16T00:18:35.924118Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:18:35.768958Z","title":"Summer is warm. Winter is cold","venue":null,"work_id":"dc9d6e46-b242-46de-b147-01021699281c","year":2025},"citing_paper":{"arxiv_id":"2608.12149","last_updated":"2026-08-12T15:11:18Z","snapshot_observed_at":"2026-08-18T07:34:07.636387Z","submitted_at":"2026-08-12T15:11:18Z","title":"Massive Activations in Hybrid Linear Attention Large Language Models: Pre-Attention Spikes and Inter-Spike Plateaus","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-16T00:18:35.305557Z"},"links":{"citing_paper":"/paper/2608.12149"},"observation_digest":"sha256:2a45deb4dd8da5a28abbda7bff855e9c933c5a5c059ed5b0ed0c97d5db730e24","observation_id":"2cfc315c-9fcc-4277-802e-3c3332daa3c4","resolution":{"observed_at":"2026-08-16T00:18:35.773289Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06457","last_updated":"2026-06-24T00:07:31Z","snapshot_observed_at":"2026-08-14T00:11:56.379317Z","submitted_at":"2025-07-08T23:54:11Z","title":"A Systematic Analysis of Hybrid Linear Attention","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.06457","snapshot_observed_at":"2026-08-16T00:18:35.084650Z","title":"A systematic analysis of hybrid linear attention.arXiv preprint arXiv:2507.06457,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12149","last_updated":"2026-08-12T15:11:18Z","snapshot_observed_at":"2026-08-18T07:34:07.636387Z","submitted_at":"2026-08-12T15:11:18Z","title":"Massive Activations in Hybrid Linear Attention Large Language Models: Pre-Attention Spikes and Inter-Spike Plateaus","version":1},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-16T00:18:35.084650Z"},"links":{"cited_paper":"/paper/2507.06457","citing_paper":"/paper/2608.12149"},"observation_digest":"sha256:e81bc2490d80326f82ed451d66c0c23a703a4571b47fa2b1c6403cd6536270a9","observation_id":"f27c287a-5beb-4819-a9db-1393a63cfd01","resolution":{"observed_at":"2026-08-16T00:18:35.084650Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-14T02:43:01.480086Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-16T00:18:34.731704Z","title":"Training verifiers to solve math word problems.arXiv preprint arXiv:2110.14168,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12149","last_updated":"2026-08-12T15:11:18Z","snapshot_observed_at":"2026-08-18T07:34:07.636387Z","submitted_at":"2026-08-12T15:11:18Z","title":"Massive Activations in Hybrid Linear Attention Large Language Models: Pre-Attention Spikes and Inter-Spike Plateaus","version":1},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-16T00:18:34.731704Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2608.12149"},"observation_digest":"sha256:e0cc539d8ac6119c748a6c9a8087fa8e45264361b7a4179b5842c06b3ff7f6cf","observation_id":"18b9ebf3-aa6b-4d70-8e6d-9ca211bb544f","resolution":{"observed_at":"2026-08-16T00:18:34.731704Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.08313","last_updated":"2025-01-14T18:50:05Z","snapshot_observed_at":"2026-08-13T08:34:05.764059Z","submitted_at":"2025-01-14T18:50:05Z","title":"MiniMax-01: Scaling Foundation Models with Lightning Attention","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.08313","snapshot_observed_at":"2026-08-16T00:18:34.892512Z","title":"Minimax-01: Scaling foundation models with lightning attention","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12149","last_updated":"2026-08-12T15:11:18Z","snapshot_observed_at":"2026-08-18T07:34:07.636387Z","submitted_at":"2026-08-12T15:11:18Z","title":"Massive Activations in Hybrid Linear Attention Large Language Models: Pre-Attention Spikes and Inter-Spike Plateaus","version":1},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-16T00:18:34.892512Z"},"links":{"cited_paper":"/paper/2501.08313","citing_paper":"/paper/2608.12149"},"observation_digest":"sha256:0f772cea5d4f6181a781d3f114c6c1bc316788b2ed5da39c6188f06a0702a370","observation_id":"857cc832-55c3-4e70-9512-ac5beb451c75","resolution":{"observed_at":"2026-08-16T00:18:34.892512Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.03624","last_updated":"2025-09-05T17:58:38Z","snapshot_observed_at":"2026-08-17T15:01:29.160915Z","submitted_at":"2025-04-04T17:41:58Z","title":"Nemotron-H: A Family of Accurate and Efficient Hybrid Mamba-Transformer Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.03624","snapshot_observed_at":"2026-08-16T00:18:34.717169Z","title":"Nemotron-h: A family of accurate and efficient hybrid mamba-transformer models.arXiv preprint arXiv:2504.03624,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12149","last_updated":"2026-08-12T15:11:18Z","snapshot_observed_at":"2026-08-18T07:34:07.636387Z","submitted_at":"2026-08-12T15:11:18Z","title":"Massive Activations in Hybrid Linear Attention Large Language Models: Pre-Attention Spikes and Inter-Spike Plateaus","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-16T00:18:34.717169Z"},"links":{"cited_paper":"/paper/2504.03624","citing_paper":"/paper/2608.12149"},"observation_digest":"sha256:4150262c4ddf54c992566bd7ac78f44ec68cd4697b765709d7ca3d318d594ab2","observation_id":"10db5d10-1117-4b87-81fd-f27751b72f8d","resolution":{"observed_at":"2026-08-16T00:18:34.717169Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:18:36.397304Z","title":"A discourse-aware attention model for abstractive summarization of long documents","venue":null,"work_id":"11b95a72-20d8-4b27-a82e-346ed8bde797","year":2018},"citing_paper":{"arxiv_id":"2608.12149","last_updated":"2026-08-12T15:11:18Z","snapshot_observed_at":"2026-08-18T07:34:07.636387Z","submitted_at":"2026-08-12T15:11:18Z","title":"Massive Activations in Hybrid Linear Attention Large Language Models: Pre-Attention Spikes and Inter-Spike Plateaus","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-16T00:18:34.736891Z"},"links":{"citing_paper":"/paper/2608.12149"},"observation_digest":"sha256:0f8587075775ab00cac3530b47cff030626e50f0f26872acfdd59906794879ba","observation_id":"18342080-f70e-42a4-8dfd-c51c76f33186","resolution":{"observed_at":"2026-08-16T00:18:36.401741Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:18:34.744844Z","title":"Hidden dynamics of massive activations in transformer training.arXiv preprint arXiv:2508.03616,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12149","last_updated":"2026-08-12T15:11:18Z","snapshot_observed_at":"2026-08-18T07:34:07.636387Z","submitted_at":"2026-08-12T15:11:18Z","title":"Massive Activations in Hybrid Linear Attention Large Language Models: Pre-Attention Spikes and Inter-Spike Plateaus","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-16T00:18:34.744844Z"},"links":{"citing_paper":"/paper/2608.12149"},"observation_digest":"sha256:03e7328dcf1100be7c0be44e6bd2c671c71630f16c27ccd7f7c620b7bab3c421","observation_id":"95ea3654-2dba-4d5b-bcf2-7d3ea87be02f","resolution":{"observed_at":"2026-08-16T00:18:34.744844Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06654","last_updated":"2024-08-06T21:48:58Z","snapshot_observed_at":"2026-08-18T14:33:16.365411Z","submitted_at":"2024-04-09T23:41:27Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.06654","snapshot_observed_at":"2026-08-16T00:18:34.882892Z","title":"Ruler: What’s the real context size of your long-context language models?arXiv preprint arXiv:2404.06654,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12149","last_updated":"2026-08-12T15:11:18Z","snapshot_observed_at":"2026-08-18T07:34:07.636387Z","submitted_at":"2026-08-12T15:11:18Z","title":"Massive Activations in Hybrid Linear Attention Large Language Models: Pre-Attention Spikes and Inter-Spike Plateaus","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-16T00:18:34.882892Z"},"links":{"cited_paper":"/paper/2404.06654","citing_paper":"/paper/2608.12149"},"observation_digest":"sha256:70c3b1790d140fe20a79a871c76f35936ed0e7b09f7ae49a743ac4947bc46164","observation_id":"de5391b3-9799-4432-a250-c305d3960c86","resolution":{"observed_at":"2026-08-16T00:18:34.882892Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.00752","last_updated":"2024-05-31T17:55:27Z","snapshot_observed_at":"2026-08-17T20:47:46.242385Z","submitted_at":"2023-12-01T18:01:34Z","title":"Mamba: Linear-Time Sequence Modeling with Selective State Spaces","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.00752","snapshot_observed_at":"2026-08-16T00:18:34.790267Z","title":"Mamba: Linear-time sequence modeling with selective state spaces.arXiv preprint arXiv:2312.00752,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12149","last_updated":"2026-08-12T15:11:18Z","snapshot_observed_at":"2026-08-18T07:34:07.636387Z","submitted_at":"2026-08-12T15:11:18Z","title":"Massive Activations in Hybrid Linear Attention Large Language Models: Pre-Attention Spikes and Inter-Spike Plateaus","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-16T00:18:34.790267Z"},"links":{"cited_paper":"/paper/2312.00752","citing_paper":"/paper/2608.12149"},"observation_digest":"sha256:6c28dfff516c77482a2a80989aa65aea4ebb22e380205748412bcf52ce9263e4","observation_id":"f7a8fe65-24aa-4ba7-b896-2672290f103c","resolution":{"observed_at":"2026-08-16T00:18:34.790267Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05483","last_updated":"2024-07-07T19:55:09Z","snapshot_observed_at":"2026-08-18T06:12:44.766149Z","submitted_at":"2024-07-07T19:55:09Z","title":"Just read twice: closing the recall gap for recurrent language models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.05483","snapshot_observed_at":"2026-08-16T00:18:34.712201Z","title":"Just read twice: closing the recall gap for recurrent language models.arXiv preprint arXiv:2407.05483,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12149","last_updated":"2026-08-12T15:11:18Z","snapshot_observed_at":"2026-08-18T07:34:07.636387Z","submitted_at":"2026-08-12T15:11:18Z","title":"Massive Activations in Hybrid Linear Attention Large Language Models: Pre-Attention Spikes and Inter-Spike Plateaus","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-16T00:18:34.712201Z"},"links":{"cited_paper":"/paper/2407.05483","citing_paper":"/paper/2608.12149"},"observation_digest":"sha256:db5ec52a220d56c1a5559a6037a1f6df14b11606c982501f27e020603caae0f5","observation_id":"cde16a2e-2a9b-48ae-b816-d593fcaf3994","resolution":{"observed_at":"2026-08-16T00:18:34.712201Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.05457","last_updated":"2018-03-14T18:04:21Z","snapshot_observed_at":"2026-08-14T19:36:07.505691Z","submitted_at":"2018-03-14T18:04:21Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.05457","snapshot_observed_at":"2026-08-16T00:18:34.726669Z","title":"Think you have solved question answering? try arc, the ai2 reasoning challenge","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12149","last_updated":"2026-08-12T15:11:18Z","snapshot_observed_at":"2026-08-18T07:34:07.636387Z","submitted_at":"2026-08-12T15:11:18Z","title":"Massive Activations in Hybrid Linear Attention Large Language Models: Pre-Attention Spikes and Inter-Spike Plateaus","version":1},"reference_index":2026,"source":"pdf_text","source_observed_at":"2026-08-16T00:18:34.726669Z"},"links":{"cited_paper":"/paper/1803.05457","citing_paper":"/paper/2608.12149"},"observation_digest":"sha256:d76b85b6312ea8ae50526ae0715785dd50981256a36335eb60105adf6f101a62","observation_id":"32abbfe9-7ab3-4e07-bba0-b54781aa3997","resolution":{"observed_at":"2026-08-16T00:18:34.726669Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.12149","last_updated":"2026-08-12T15:11:18Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-18T07:34:07.636387Z","submitted_at":"2026-08-12T15:11:18Z","title":"Massive Activations in Hybrid Linear Attention Large Language Models: Pre-Attention Spikes and Inter-Spike Plateaus"},"reference_resolution":{"displayed":35,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":23,"verified_exact":1,"verified_fuzzy":11},"total_outbound_references":35},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 35 of 35 outbound references and 0 inbound Pith citation observations for arXiv:2608.12149."}