{"as_of":"2026-08-16T16:30:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:7fda7d028c076289888ead7bc72b8598f5690b514faa2b50b8e9900aef1ce2f8","coverage":[{"denominator":41,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":41,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T06:03:19.387482Z","state":"measured"},{"denominator":42,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":42,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T05:13:27.644720Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-06T05:13:28.150379Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.11104","last_updated":"2025-06-06T20:24:36Z","snapshot_observed_at":"2026-08-07T20:41:32.031099Z","submitted_at":"2025-06-06T20:24:36Z","title":"DAM: Dynamic Attention Mask for Long-Context Large Language Model Inference Acceleration","version":1},"cited_work":{"arxiv_id":"2506.11104","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.11104","snapshot_observed_at":"2026-08-06T05:13:28.150379Z","title":"DAM: Dynamic Attention Mask for Long-Context Large Language Model Inference Acceleration","venue":"cs.CL","work_id":"edb9e462-8aee-44a9-8a94-23a88c065cab","year":2025},"citing_paper":{"arxiv_id":"2508.02122","last_updated":"2025-08-04T07:03:35Z","snapshot_observed_at":"2026-08-14T17:06:16.002227Z","submitted_at":"2025-08-04T07:03:35Z","title":"An Overview of Algorithms for Contactless Cardiac Feature Extraction from Radar Signals: Advances and Challenges","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T05:13:27.644720Z"},"links":{"cited_paper":"/paper/2506.11104","citing_paper":"/paper/2508.02122"},"observation_digest":"sha256:105dcc7405e915d652bc91f39a4645a94288330659c3fc259469ada103084236","observation_id":"3d0b4a51-b3ee-462f-9e79-f2da65fab369","resolution":{"observed_at":"2026-08-06T05:13:28.210636Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.11104/citation-record","integrity":"/paper/2506.11104/integrity","json":"/paper/2506.11104/citation-record.json","paper":"/paper/2506.11104"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:03:19.872798Z","title":null,"venue":null,"work_id":"34418bf2-3f18-4a8e-b871-430d691c928c","year":2024},"citing_paper":{"arxiv_id":"2506.11104","last_updated":"2025-06-06T20:24:36Z","snapshot_observed_at":"2026-08-07T20:41:32.031099Z","submitted_at":"2025-06-06T20:24:36Z","title":"DAM: Dynamic Attention Mask for Long-Context Large Language Model Inference Acceleration","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T06:03:19.265408Z"},"links":{"citing_paper":"/paper/2506.11104"},"observation_digest":"sha256:09f254092aef752f3c0fc5fb4562d69ee097dea64ce8fd50bbf35b2c8ba82177","observation_id":"39b75541-84d0-436c-a687-1d832d3d8a51","resolution":{"observed_at":"2026-08-07T06:03:19.875957Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:03:19.863672Z","title":null,"venue":null,"work_id":"33a55e1d-c270-458a-aac5-94dc87ef258b","year":2024},"citing_paper":{"arxiv_id":"2506.11104","last_updated":"2025-06-06T20:24:36Z","snapshot_observed_at":"2026-08-07T20:41:32.031099Z","submitted_at":"2025-06-06T20:24:36Z","title":"DAM: Dynamic Attention Mask for Long-Context Large Language Model Inference Acceleration","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T06:03:19.269172Z"},"links":{"citing_paper":"/paper/2506.11104"},"observation_digest":"sha256:a48d78d8fb099a148eb6bb2d0d93fca8b4b3d1fa4a063b38b66aaa7024e0ccc9","observation_id":"fd441fa5-0ea3-4132-a475-96c32bb8aacd","resolution":{"observed_at":"2026-08-07T06:03:19.866737Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:03:19.855052Z","title":null,"venue":null,"work_id":"b564e8df-eb75-4e40-9e36-61b30c77e8f1","year":2004},"citing_paper":{"arxiv_id":"2506.11104","last_updated":"2025-06-06T20:24:36Z","snapshot_observed_at":"2026-08-07T20:41:32.031099Z","submitted_at":"2025-06-06T20:24:36Z","title":"DAM: Dynamic Attention Mask for Long-Context Large Language Model Inference Acceleration","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T06:03:19.272325Z"},"links":{"citing_paper":"/paper/2506.11104"},"observation_digest":"sha256:e845a7f4ecef5441b4dbf6d2921bcaeb9ecfc923c2bf039c4bb7cf93fc8a3ac8","observation_id":"3260fa7d-8bec-493d-a95d-2eb25927ded6","resolution":{"observed_at":"2026-08-07T06:03:19.857783Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.05150","last_updated":"2020-12-02T17:52:35Z","snapshot_observed_at":"2026-07-31T17:17:17.205582Z","submitted_at":"2020-04-10T17:54:09Z","title":"Longformer: The Long-Document Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.05150","snapshot_observed_at":"2026-08-07T06:03:19.278649Z","title":"Peters, and Arman Cohan","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.11104","last_updated":"2025-06-06T20:24:36Z","snapshot_observed_at":"2026-08-07T20:41:32.031099Z","submitted_at":"2025-06-06T20:24:36Z","title":"DAM: Dynamic Attention Mask for Long-Context Large Language Model Inference Acceleration","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T06:03:19.278649Z"},"links":{"cited_paper":"/paper/2004.05150","citing_paper":"/paper/2506.11104"},"observation_digest":"sha256:5df291450f9f3d07ea0dfc2097d3f3bed0c3851dec05507af92738cf26c3a027","observation_id":"0aa85b62-32dd-445b-8034-ac4fda8bcde0","resolution":{"observed_at":"2026-08-07T06:03:19.278649Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:03:19.281563Z","title":null,"venue":null,"work_id":null,"year":1964},"citing_paper":{"arxiv_id":"2506.11104","last_updated":"2025-06-06T20:24:36Z","snapshot_observed_at":"2026-08-07T20:41:32.031099Z","submitted_at":"2025-06-06T20:24:36Z","title":"DAM: Dynamic Attention Mask for Long-Context Large Language Model Inference Acceleration","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T06:03:19.281563Z"},"links":{"citing_paper":"/paper/2506.11104"},"observation_digest":"sha256:146f349fbc7714bb7f848a2e35549e3d0f6429fc19de254a14ab1c4011554899","observation_id":"2a75ea7a-6630-4698-aa96-2d9059574388","resolution":{"observed_at":"2026-08-07T06:03:19.281563Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03675","last_updated":"2024-08-08T01:20:13Z","snapshot_observed_at":"2026-08-16T13:28:00.366504Z","submitted_at":"2024-08-07T10:31:07Z","title":"NACL: A General and Effective KV Cache Eviction Framework for LLMs at Inference Time","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03675","snapshot_observed_at":"2026-08-07T06:03:19.284561Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11104","last_updated":"2025-06-06T20:24:36Z","snapshot_observed_at":"2026-08-07T20:41:32.031099Z","submitted_at":"2025-06-06T20:24:36Z","title":"DAM: Dynamic Attention Mask for Long-Context Large Language Model Inference Acceleration","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T06:03:19.284561Z"},"links":{"cited_paper":"/paper/2408.03675","citing_paper":"/paper/2506.11104"},"observation_digest":"sha256:e7a4aefb006ec66b02c714e7722031c9564517a776e83ea4e6e1591deec2b558","observation_id":"109f8c1b-18d4-40e9-9e3d-309081fc6931","resolution":{"observed_at":"2026-08-07T06:03:19.284561Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.10509","last_updated":"2019-04-23T19:29:47Z","snapshot_observed_at":"2026-08-16T10:03:03.268538Z","submitted_at":"2019-04-23T19:29:47Z","title":"Generating Long Sequences with Sparse Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.10509","snapshot_observed_at":"2026-08-07T06:03:19.287621Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.11104","last_updated":"2025-06-06T20:24:36Z","snapshot_observed_at":"2026-08-07T20:41:32.031099Z","submitted_at":"2025-06-06T20:24:36Z","title":"DAM: Dynamic Attention Mask for Long-Context Large Language Model Inference Acceleration","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T06:03:19.287621Z"},"links":{"cited_paper":"/paper/1904.10509","citing_paper":"/paper/2506.11104"},"observation_digest":"sha256:05ce3e858e371d73ded9bb155ca898f18a969b3a19baaaa9cc557434ebba46e9","observation_id":"b5e93402-0bcf-4b35-aa7d-d1b0f66e2241","resolution":{"observed_at":"2026-08-07T06:03:19.287621Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.03555","last_updated":"2020-10-01T00:41:49Z","snapshot_observed_at":"2026-08-14T17:43:11.894850Z","submitted_at":"2020-06-05T17:09:16Z","title":"Masked Language Modeling for Proteins via Linearly Scalable Long-Context Transformers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.03555","snapshot_observed_at":"2026-08-07T06:03:19.290731Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.11104","last_updated":"2025-06-06T20:24:36Z","snapshot_observed_at":"2026-08-07T20:41:32.031099Z","submitted_at":"2025-06-06T20:24:36Z","title":"DAM: Dynamic Attention Mask for Long-Context Large Language Model Inference Acceleration","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T06:03:19.290731Z"},"links":{"cited_paper":"/paper/2006.03555","citing_paper":"/paper/2506.11104"},"observation_digest":"sha256:f1128d03b7b804b723bf643c3434d813e7ee8b2d24dd7b56e0fffa1d2dc5e702","observation_id":"ace05112-41fc-445a-8fff-53ea8b05380c","resolution":{"observed_at":"2026-08-07T06:03:19.290731Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.00015","last_updated":"2019-09-06T16:55:20Z","snapshot_observed_at":"2026-08-15T16:08:53.189680Z","submitted_at":"2019-08-30T18:06:14Z","title":"Adaptively Sparse Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.00015","snapshot_observed_at":"2026-08-07T06:03:19.293695Z","title":"Correia, Vlad Niculae, and André F","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.11104","last_updated":"2025-06-06T20:24:36Z","snapshot_observed_at":"2026-08-07T20:41:32.031099Z","submitted_at":"2025-06-06T20:24:36Z","title":"DAM: Dynamic Attention Mask for Long-Context Large Language Model Inference Acceleration","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T06:03:19.293695Z"},"links":{"cited_paper":"/paper/1909.00015","citing_paper":"/paper/2506.11104"},"observation_digest":"sha256:f0e69b81f8e26cc32a8890f5d5c23fd462706f91587a18c3e342b6097994966f","observation_id":"2ed08cd9-9e48-4ab4-a16c-a33e2b3f3383","resolution":{"observed_at":"2026-08-07T06:03:19.293695Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.08691","last_updated":"2023-07-17T17:50:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-17T17:50:36Z","title":"FlashAttention-2: Faster Attention with Better Parallelism and Work Partitioning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.08691","snapshot_observed_at":"2026-08-07T06:03:19.296945Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.11104","last_updated":"2025-06-06T20:24:36Z","snapshot_observed_at":"2026-08-07T20:41:32.031099Z","submitted_at":"2025-06-06T20:24:36Z","title":"DAM: Dynamic Attention Mask for Long-Context Large Language Model Inference Acceleration","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T06:03:19.296945Z"},"links":{"cited_paper":"/paper/2307.08691","citing_paper":"/paper/2506.11104"},"observation_digest":"sha256:e2b54d45bbdc2726a49155c727c1dea5326e65c6fdf5b3b7435edd166e738418","observation_id":"72b51fed-4cae-4cf4-a006-764cc2c0b555","resolution":{"observed_at":"2026-08-07T06:03:19.296945Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1906.01749","last_updated":"2019-06-19T20:26:03Z","snapshot_observed_at":"2026-08-16T03:02:48.146902Z","submitted_at":"2019-06-04T23:00:43Z","title":"Multi-News: a Large-Scale Multi-Document Summarization Dataset and Abstractive Hierarchical Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1906.01749","snapshot_observed_at":"2026-08-07T06:03:19.299889Z","title":"Fabbri, Irene Li, Tianwei She, Suyi Li, and Dragomir R","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.11104","last_updated":"2025-06-06T20:24:36Z","snapshot_observed_at":"2026-08-07T20:41:32.031099Z","submitted_at":"2025-06-06T20:24:36Z","title":"DAM: Dynamic Attention Mask for Long-Context Large Language Model Inference Acceleration","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T06:03:19.299889Z"},"links":{"cited_paper":"/paper/1906.01749","citing_paper":"/paper/2506.11104"},"observation_digest":"sha256:b77cb9494fa1106b1b849dc6701e2a9ae938eb0c725b2e3ec41738027c046db5","observation_id":"f462fe05-3d87-4621-b1b1-f213bc3d6e00","resolution":{"observed_at":"2026-08-07T06:03:19.299889Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:03:19.302732Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11104","last_updated":"2025-06-06T20:24:36Z","snapshot_observed_at":"2026-08-07T20:41:32.031099Z","submitted_at":"2025-06-06T20:24:36Z","title":"DAM: Dynamic Attention Mask for Long-Context Large Language Model Inference Acceleration","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T06:03:19.302732Z"},"links":{"citing_paper":"/paper/2506.11104"},"observation_digest":"sha256:d211da54056a966172172dbed538e4b7c258c457fc9419ddbb0ffaa94e9ab1d6","observation_id":"a38fa083-ed9b-4ed8-9083-7a3cbef28524","resolution":{"observed_at":"2026-08-07T06:03:19.302732Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:03:19.846215Z","title":"Semsa: Semantic sparse attention is hidden in large language models","venue":null,"work_id":"67ffd689-f2a3-4c8a-9ecb-f7ed2553c75a","year":null},"citing_paper":{"arxiv_id":"2506.11104","last_updated":"2025-06-06T20:24:36Z","snapshot_observed_at":"2026-08-07T20:41:32.031099Z","submitted_at":"2025-06-06T20:24:36Z","title":"DAM: Dynamic Attention Mask for Long-Context Large Language Model Inference Acceleration","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T06:03:19.305392Z"},"links":{"citing_paper":"/paper/2506.11104"},"observation_digest":"sha256:6430c0abb1d5fb4ee55086d9528d767fc880373182a248f2a149d9db5afb20be","observation_id":"b593f040-8eea-4bca-9588-07bbd603a0e1","resolution":{"observed_at":"2026-08-07T06:03:19.849396Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:03:19.837239Z","title":null,"venue":null,"work_id":"3b2e67a1-8ad8-4c94-9046-c5c1cbc497a1","year":2024},"citing_paper":{"arxiv_id":"2506.11104","last_updated":"2025-06-06T20:24:36Z","snapshot_observed_at":"2026-08-07T20:41:32.031099Z","submitted_at":"2025-06-06T20:24:36Z","title":"DAM: Dynamic Attention Mask for Long-Context Large Language Model Inference Acceleration","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T06:03:19.308260Z"},"links":{"citing_paper":"/paper/2506.11104"},"observation_digest":"sha256:dc0253a4544d5cb9eb3c9c303b96fb7bae6fa07bb9fbf819cc52d81a7af2c532","observation_id":"38126815-345c-449c-97d8-caf3610bff33","resolution":{"observed_at":"2026-08-07T06:03:19.840241Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01801","last_updated":"2024-10-29T18:26:09Z","snapshot_observed_at":"2026-08-14T11:45:47.400186Z","submitted_at":"2023-10-03T05:17:08Z","title":"Model Tells You What to Discard: Adaptive KV Cache Compression for LLMs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01801","snapshot_observed_at":"2026-08-07T06:03:19.311000Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.11104","last_updated":"2025-06-06T20:24:36Z","snapshot_observed_at":"2026-08-07T20:41:32.031099Z","submitted_at":"2025-06-06T20:24:36Z","title":"DAM: Dynamic Attention Mask for Long-Context Large Language Model Inference Acceleration","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T06:03:19.311000Z"},"links":{"cited_paper":"/paper/2310.01801","citing_paper":"/paper/2506.11104"},"observation_digest":"sha256:4317b32eeba6d7128eb7ed52105d955e9b48ec689f21242406206a0eff1a2bf9","observation_id":"11123903-98f1-4399-8696-71a83d51e448","resolution":{"observed_at":"2026-08-07T06:03:19.311000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.01377","last_updated":"2021-08-03T09:16:55Z","snapshot_observed_at":"2026-08-13T18:34:49.075516Z","submitted_at":"2021-08-03T09:16:55Z","title":"A Dynamic Head Importance Computation Mechanism for Neural Machine Translation","version":1},"cited_work":{"arxiv_id":"2108.01377","doi":null,"metadata_source":"pith","pith_arxiv_id":"2108.01377","snapshot_observed_at":"2026-08-07T06:03:19.613071Z","title":"A Dynamic Head Importance Computation Mechanism for Neural Machine Translation","venue":"cs.CL","work_id":"4901fbaa-700d-4aab-bf6a-6ba70d8f078f","year":2021},"citing_paper":{"arxiv_id":"2506.11104","last_updated":"2025-06-06T20:24:36Z","snapshot_observed_at":"2026-08-07T20:41:32.031099Z","submitted_at":"2025-06-06T20:24:36Z","title":"DAM: Dynamic Attention Mask for Long-Context Large Language Model Inference Acceleration","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T06:03:19.313839Z"},"links":{"cited_paper":"/paper/2108.01377","citing_paper":"/paper/2506.11104"},"observation_digest":"sha256:450d42dbb0d9fdc9b57f5ce57f709dfa30f804a5adc2e83e8fb7318571329d59","observation_id":"7dfb9399-0a44-4a50-9657-3da18bb4e273","resolution":{"observed_at":"2026-08-07T06:03:19.616366Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1912.12180","last_updated":"2019-12-20T13:27:27Z","snapshot_observed_at":"2026-08-15T02:08:46.249033Z","submitted_at":"2019-12-20T13:27:27Z","title":"Axial Attention in Multidimensional Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.12180","snapshot_observed_at":"2026-08-07T06:03:19.316871Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.11104","last_updated":"2025-06-06T20:24:36Z","snapshot_observed_at":"2026-08-07T20:41:32.031099Z","submitted_at":"2025-06-06T20:24:36Z","title":"DAM: Dynamic Attention Mask for Long-Context Large Language Model Inference Acceleration","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T06:03:19.316871Z"},"links":{"cited_paper":"/paper/1912.12180","citing_paper":"/paper/2506.11104"},"observation_digest":"sha256:9fb60c10087f587d20e2d18ff0cd7898f7a674d358ed45c7e610892874523999","observation_id":"a9404664-de59-48ed-99fe-06cc174f009e","resolution":{"observed_at":"2026-08-07T06:03:19.316871Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.17565","last_updated":"2024-12-21T13:55:49Z","snapshot_observed_at":"2026-08-16T13:39:45.718789Z","submitted_at":"2024-06-25T14:02:08Z","title":"MemServe: Context Caching for Disaggregated LLM Serving with Elastic Memory Pool","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.17565","snapshot_observed_at":"2026-08-07T06:03:19.319925Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11104","last_updated":"2025-06-06T20:24:36Z","snapshot_observed_at":"2026-08-07T20:41:32.031099Z","submitted_at":"2025-06-06T20:24:36Z","title":"DAM: Dynamic Attention Mask for Long-Context Large Language Model Inference Acceleration","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T06:03:19.319925Z"},"links":{"cited_paper":"/paper/2406.17565","citing_paper":"/paper/2506.11104"},"observation_digest":"sha256:d224fef8fcc5243f48ed8da2f3f01ef52f2a8f71ba4ec53072ff359f53c3a42b","observation_id":"964a02ee-e3b0-467c-b77d-b3cd16ae2297","resolution":{"observed_at":"2026-08-07T06:03:19.319925Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2001.04451","last_updated":"2020-02-18T16:01:18Z","snapshot_observed_at":"2026-07-06T08:50:12.690900Z","submitted_at":"2020-01-13T18:38:28Z","title":"Reformer: The Efficient Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.04451","snapshot_observed_at":"2026-08-07T06:03:19.322704Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.11104","last_updated":"2025-06-06T20:24:36Z","snapshot_observed_at":"2026-08-07T20:41:32.031099Z","submitted_at":"2025-06-06T20:24:36Z","title":"DAM: Dynamic Attention Mask for Long-Context Large Language Model Inference Acceleration","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T06:03:19.322704Z"},"links":{"cited_paper":"/paper/2001.04451","citing_paper":"/paper/2506.11104"},"observation_digest":"sha256:07381c199bb6bbe6111bbe39004bffc34553fa1a3614e43ee5b780abaf01a13b","observation_id":"60a43518-9018-4fbb-a493-0f4020fed5a6","resolution":{"observed_at":"2026-08-07T06:03:19.322704Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.13298","last_updated":"2023-01-30T21:31:48Z","snapshot_observed_at":"2026-08-16T15:59:00.928059Z","submitted_at":"2023-01-30T21:31:48Z","title":"LongEval: Guidelines for Human Evaluation of Faithfulness in Long-form Summarization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.13298","snapshot_observed_at":"2026-08-07T06:03:19.325755Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.11104","last_updated":"2025-06-06T20:24:36Z","snapshot_observed_at":"2026-08-07T20:41:32.031099Z","submitted_at":"2025-06-06T20:24:36Z","title":"DAM: Dynamic Attention Mask for Long-Context Large Language Model Inference Acceleration","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T06:03:19.325755Z"},"links":{"cited_paper":"/paper/2301.13298","citing_paper":"/paper/2506.11104"},"observation_digest":"sha256:0baf1a6bb24039b18c558a8422072f8c996efa71771697765dd23c11e23f1089","observation_id":"77f0c218-0e94-4bb1-80cc-3958813350b3","resolution":{"observed_at":"2026-08-07T06:03:19.325755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14469","last_updated":"2024-06-17T03:01:58Z","snapshot_observed_at":"2026-08-14T12:21:04.886717Z","submitted_at":"2024-04-22T17:42:58Z","title":"SnapKV: LLM Knows What You are Looking for Before Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14469","snapshot_observed_at":"2026-08-07T06:03:19.328603Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11104","last_updated":"2025-06-06T20:24:36Z","snapshot_observed_at":"2026-08-07T20:41:32.031099Z","submitted_at":"2025-06-06T20:24:36Z","title":"DAM: Dynamic Attention Mask for Long-Context Large Language Model Inference Acceleration","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T06:03:19.328603Z"},"links":{"cited_paper":"/paper/2404.14469","citing_paper":"/paper/2506.11104"},"observation_digest":"sha256:b9431ef628528f89af54ca10b6d4525397f564ad786a331b217e5466165839bc","observation_id":"dff2d4cb-47cf-4d2b-82dc-4e4ec51871a2","resolution":{"observed_at":"2026-08-07T06:03:19.328603Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.05561","last_updated":"2021-12-10T14:12:32Z","snapshot_observed_at":"2026-08-15T17:19:32.290227Z","submitted_at":"2021-12-10T14:12:32Z","title":"Global Attention Mechanism: Retain Information to Enhance Channel-Spatial Interactions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.05561","snapshot_observed_at":"2026-08-07T06:03:19.331633Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.11104","last_updated":"2025-06-06T20:24:36Z","snapshot_observed_at":"2026-08-07T20:41:32.031099Z","submitted_at":"2025-06-06T20:24:36Z","title":"DAM: Dynamic Attention Mask for Long-Context Large Language Model Inference Acceleration","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T06:03:19.331633Z"},"links":{"cited_paper":"/paper/2112.05561","citing_paper":"/paper/2506.11104"},"observation_digest":"sha256:b92f9a113a273362d6b9d59973297996480e9bda8a0b454e3f74e3e9836b2fa7","observation_id":"c5eacb4a-1b9d-4430-91be-00d18496f4a5","resolution":{"observed_at":"2026-08-07T06:03:19.331633Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:03:19.828602Z","title":null,"venue":null,"work_id":"7f0ee529-5407-4433-9a24-487331481b35","year":2024},"citing_paper":{"arxiv_id":"2506.11104","last_updated":"2025-06-06T20:24:36Z","snapshot_observed_at":"2026-08-07T20:41:32.031099Z","submitted_at":"2025-06-06T20:24:36Z","title":"DAM: Dynamic Attention Mask for Long-Context Large Language Model Inference Acceleration","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T06:03:19.334602Z"},"links":{"citing_paper":"/paper/2506.11104"},"observation_digest":"sha256:c6b1099d3afd087e34883019c7db18d7c337426e74625b94a082bde0f560c6c0","observation_id":"e8386c03-f072-4bf1-82c1-b59efe1bbb23","resolution":{"observed_at":"2026-08-07T06:03:19.831550Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:03:19.819696Z","title":null,"venue":null,"work_id":"3aaaecda-b714-4645-a08f-4b3d75bd8aa5","year":2025},"citing_paper":{"arxiv_id":"2506.11104","last_updated":"2025-06-06T20:24:36Z","snapshot_observed_at":"2026-08-07T20:41:32.031099Z","submitted_at":"2025-06-06T20:24:36Z","title":"DAM: Dynamic Attention Mask for Long-Context Large Language Model Inference Acceleration","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T06:03:19.337352Z"},"links":{"citing_paper":"/paper/2506.11104"},"observation_digest":"sha256:c89c2a03264c503d3c2cbd7daa0313710027e67ef8ab3a8144b4c63699b8a621","observation_id":"47463b5e-831e-45b2-a3ba-4524dcb270d4","resolution":{"observed_at":"2026-08-07T06:03:19.822960Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:03:19.340101Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.11104","last_updated":"2025-06-06T20:24:36Z","snapshot_observed_at":"2026-08-07T20:41:32.031099Z","submitted_at":"2025-06-06T20:24:36Z","title":"DAM: Dynamic Attention Mask for Long-Context Large Language Model Inference Acceleration","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T06:03:19.340101Z"},"links":{"citing_paper":"/paper/2506.11104"},"observation_digest":"sha256:ddbc00a15838b856c1192fbe5a4036570b95d34baaa64f2dc5e03243c25c1a70","observation_id":"b849773a-ef26-49c0-b491-92f618feca64","resolution":{"observed_at":"2026-08-07T06:03:19.340101Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1906.04393","last_updated":"2019-06-11T04:56:17Z","snapshot_observed_at":"2026-08-14T16:17:41.627936Z","submitted_at":"2019-06-11T04:56:17Z","title":"Lightweight and Efficient Neural Natural Language Processing with Quaternion Networks","version":1},"cited_work":{"arxiv_id":"1906.04393","doi":null,"metadata_source":"pith","pith_arxiv_id":"1906.04393","snapshot_observed_at":"2026-08-07T06:03:19.554211Z","title":"Lightweight and Efficient Neural Natural Language Processing with Quaternion Networks","venue":"cs.CL","work_id":"178f0358-71f6-4159-915f-78f59d7390bc","year":2019},"citing_paper":{"arxiv_id":"2506.11104","last_updated":"2025-06-06T20:24:36Z","snapshot_observed_at":"2026-08-07T20:41:32.031099Z","submitted_at":"2025-06-06T20:24:36Z","title":"DAM: Dynamic Attention Mask for Long-Context Large Language Model Inference Acceleration","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T06:03:19.342944Z"},"links":{"cited_paper":"/paper/1906.04393","citing_paper":"/paper/2506.11104"},"observation_digest":"sha256:9ae2168c757ba3cc2ef091c54952602aa48f6816de898fad82cf2ef433233319","observation_id":"723e7c91-852a-4b51-baeb-20f365ac3591","resolution":{"observed_at":"2026-08-07T06:03:19.557693Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:03:19.345983Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.11104","last_updated":"2025-06-06T20:24:36Z","snapshot_observed_at":"2026-08-07T20:41:32.031099Z","submitted_at":"2025-06-06T20:24:36Z","title":"DAM: Dynamic Attention Mask for Long-Context Large Language Model Inference Acceleration","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T06:03:19.345983Z"},"links":{"citing_paper":"/paper/2506.11104"},"observation_digest":"sha256:0ffcbc6c0508ee965abac1fba5f0164eec0d314524bc670dffe1a11ba5911086","observation_id":"aee541e8-2104-418f-88f2-f80226d18deb","resolution":{"observed_at":"2026-08-07T06:03:19.345983Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2012.12366","last_updated":"2020-12-22T21:34:02Z","snapshot_observed_at":"2026-08-10T13:32:26.242589Z","submitted_at":"2020-12-22T21:34:02Z","title":"Multi-Head Self-Attention with Role-Guided Masks","version":1},"cited_work":{"arxiv_id":"2012.12366","doi":null,"metadata_source":"pith","pith_arxiv_id":"2012.12366","snapshot_observed_at":"2026-08-07T06:03:19.539671Z","title":"Multi-Head Self-Attention with Role-Guided Masks","venue":"cs.CL","work_id":"752ee9cc-805f-4247-8cdf-ec77ed084d17","year":2020},"citing_paper":{"arxiv_id":"2506.11104","last_updated":"2025-06-06T20:24:36Z","snapshot_observed_at":"2026-08-07T20:41:32.031099Z","submitted_at":"2025-06-06T20:24:36Z","title":"DAM: Dynamic Attention Mask for Long-Context Large Language Model Inference Acceleration","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T06:03:19.348741Z"},"links":{"cited_paper":"/paper/2012.12366","citing_paper":"/paper/2506.11104"},"observation_digest":"sha256:62166b77d4f39c67193fd4d55be7cada7762e0b0fb295fd9edef44821eed0d36","observation_id":"53206f46-2ae0-49ae-9df8-68285976e6a3","resolution":{"observed_at":"2026-08-07T06:03:19.545146Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08553","last_updated":"2024-06-04T14:49:36Z","snapshot_observed_at":"2026-08-16T13:52:50.305445Z","submitted_at":"2024-05-14T12:41:11Z","title":"Improving Transformers with Dynamically Composable Multi-Head Attention","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.08553","snapshot_observed_at":"2026-08-07T06:03:19.353231Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11104","last_updated":"2025-06-06T20:24:36Z","snapshot_observed_at":"2026-08-07T20:41:32.031099Z","submitted_at":"2025-06-06T20:24:36Z","title":"DAM: Dynamic Attention Mask for Long-Context Large Language Model Inference Acceleration","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T06:03:19.353231Z"},"links":{"cited_paper":"/paper/2405.08553","citing_paper":"/paper/2506.11104"},"observation_digest":"sha256:9a91a486aba97000f2d9cbf0191ceb8495c104f83aa389cb7f1b5ee788d414e3","observation_id":"78a2e262-6928-4375-ae3e-d37f98c80da9","resolution":{"observed_at":"2026-08-07T06:03:19.353231Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17453","last_updated":"2024-04-07T00:56:53Z","snapshot_observed_at":"2026-08-14T06:01:54.549199Z","submitted_at":"2023-09-29T17:59:56Z","title":"Efficient Streaming Language Models with Attention Sinks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.17453","snapshot_observed_at":"2026-08-07T06:03:19.357102Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11104","last_updated":"2025-06-06T20:24:36Z","snapshot_observed_at":"2026-08-07T20:41:32.031099Z","submitted_at":"2025-06-06T20:24:36Z","title":"DAM: Dynamic Attention Mask for Long-Context Large Language Model Inference Acceleration","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T06:03:19.357102Z"},"links":{"cited_paper":"/paper/2309.17453","citing_paper":"/paper/2506.11104"},"observation_digest":"sha256:5108a1b4349796a9ca57b460f02ca8ce6d39c6153ed1b7f36b23c61ee4795c61","observation_id":"4ad6a6f0-2888-4cc0-bc53-f5b9ee758c26","resolution":{"observed_at":"2026-08-07T06:03:19.357102Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.00428","last_updated":"2024-10-09T11:40:31Z","snapshot_observed_at":"2026-08-16T13:13:51.541559Z","submitted_at":"2024-10-01T06:23:17Z","title":"LayerKV: Optimizing Large Language Model Serving with Layer-wise KV Cache Management","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.00428","snapshot_observed_at":"2026-08-07T06:03:19.359687Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11104","last_updated":"2025-06-06T20:24:36Z","snapshot_observed_at":"2026-08-07T20:41:32.031099Z","submitted_at":"2025-06-06T20:24:36Z","title":"DAM: Dynamic Attention Mask for Long-Context Large Language Model Inference Acceleration","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T06:03:19.359687Z"},"links":{"cited_paper":"/paper/2410.00428","citing_paper":"/paper/2506.11104"},"observation_digest":"sha256:003685e1e4db948374bb43c974ed772760d1bc94d964881e9c9bd4c88aaffdbb","observation_id":"f770c5da-57e3-4456-a076-a60800a339bf","resolution":{"observed_at":"2026-08-07T06:03:19.359687Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.15220","last_updated":"2024-08-01T07:51:25Z","snapshot_observed_at":"2026-08-16T14:15:57.940906Z","submitted_at":"2024-02-23T09:29:19Z","title":"ChunkAttention: Efficient Self-Attention with Prefix-Aware KV Cache and Two-Phase Partition","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.15220","snapshot_observed_at":"2026-08-07T06:03:19.362463Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11104","last_updated":"2025-06-06T20:24:36Z","snapshot_observed_at":"2026-08-07T20:41:32.031099Z","submitted_at":"2025-06-06T20:24:36Z","title":"DAM: Dynamic Attention Mask for Long-Context Large Language Model Inference Acceleration","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T06:03:19.362463Z"},"links":{"cited_paper":"/paper/2402.15220","citing_paper":"/paper/2506.11104"},"observation_digest":"sha256:2fa0e83bb947231366992b4a7369daf08e4d8f4506e78b057ca5051e9d92284a","observation_id":"d96aaaba-19ec-46e6-b609-794c52746810","resolution":{"observed_at":"2026-08-07T06:03:19.362463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:03:19.365339Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11104","last_updated":"2025-06-06T20:24:36Z","snapshot_observed_at":"2026-08-07T20:41:32.031099Z","submitted_at":"2025-06-06T20:24:36Z","title":"DAM: Dynamic Attention Mask for Long-Context Large Language Model Inference Acceleration","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T06:03:19.365339Z"},"links":{"citing_paper":"/paper/2506.11104"},"observation_digest":"sha256:87007d52320bc1d3c6a81d2d961de79365c87676db069d5af2b82a87ffc36e75","observation_id":"582542cf-e636-4fcf-a262-cdc2a48eb119","resolution":{"observed_at":"2026-08-07T06:03:19.365339Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:03:19.800359Z","title":null,"venue":null,"work_id":"543e01f9-3624-4f8d-b204-5a6aa72239f6","year":2020},"citing_paper":{"arxiv_id":"2506.11104","last_updated":"2025-06-06T20:24:36Z","snapshot_observed_at":"2026-08-07T20:41:32.031099Z","submitted_at":"2025-06-06T20:24:36Z","title":"DAM: Dynamic Attention Mask for Long-Context Large Language Model Inference Acceleration","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T06:03:19.368297Z"},"links":{"citing_paper":"/paper/2506.11104"},"observation_digest":"sha256:2fa59ff2bec72132614946138675b171df96eb3f0ad2f112bde91aaa73e722be","observation_id":"92cf65c7-5490-460f-8c4f-d8e12ac71434","resolution":{"observed_at":"2026-08-07T06:03:19.803606Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:03:19.370887Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.11104","last_updated":"2025-06-06T20:24:36Z","snapshot_observed_at":"2026-08-07T20:41:32.031099Z","submitted_at":"2025-06-06T20:24:36Z","title":"DAM: Dynamic Attention Mask for Long-Context Large Language Model Inference Acceleration","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T06:03:19.370887Z"},"links":{"citing_paper":"/paper/2506.11104"},"observation_digest":"sha256:c3a4d20d374f157e16199f93553b36d286c7e026e6dc8745c1205362346e80ff","observation_id":"6af78f03-c580-41bb-a8e2-244859840541","resolution":{"observed_at":"2026-08-07T06:03:19.370887Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03131","last_updated":"2025-08-30T09:35:22Z","snapshot_observed_at":"2026-08-16T15:49:09.109279Z","submitted_at":"2024-12-04T08:51:23Z","title":"DiffKV: Differentiated Memory Management for Large Language Models with Parallel KV Compaction","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03131","snapshot_observed_at":"2026-08-07T06:03:19.373594Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11104","last_updated":"2025-06-06T20:24:36Z","snapshot_observed_at":"2026-08-07T20:41:32.031099Z","submitted_at":"2025-06-06T20:24:36Z","title":"DAM: Dynamic Attention Mask for Long-Context Large Language Model Inference Acceleration","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T06:03:19.373594Z"},"links":{"cited_paper":"/paper/2412.03131","citing_paper":"/paper/2506.11104"},"observation_digest":"sha256:8250aecde726d7d87970d8eae34abd0be91958b5b6ffdb46cd46762a1bf1cf76","observation_id":"5814662f-8955-4c90-9230-7afdb02297a1","resolution":{"observed_at":"2026-08-07T06:03:19.373594Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:03:19.376481Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.11104","last_updated":"2025-06-06T20:24:36Z","snapshot_observed_at":"2026-08-07T20:41:32.031099Z","submitted_at":"2025-06-06T20:24:36Z","title":"DAM: Dynamic Attention Mask for Long-Context Large Language Model Inference Acceleration","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T06:03:19.376481Z"},"links":{"citing_paper":"/paper/2506.11104"},"observation_digest":"sha256:8c8d4bf637bbb2f47169209a7b440e8f036fecef13a7724d5fb2a33d310c543b","observation_id":"e15d8fcf-d490-405b-bfa2-f6f4f5218f1c","resolution":{"observed_at":"2026-08-07T06:03:19.376481Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:03:19.781176Z","title":null,"venue":null,"work_id":"c20b2be8-b1ac-4853-babc-bea2e9d4a6ee","year":2024},"citing_paper":{"arxiv_id":"2506.11104","last_updated":"2025-06-06T20:24:36Z","snapshot_observed_at":"2026-08-07T20:41:32.031099Z","submitted_at":"2025-06-06T20:24:36Z","title":"DAM: Dynamic Attention Mask for Long-Context Large Language Model Inference Acceleration","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T06:03:19.379033Z"},"links":{"citing_paper":"/paper/2506.11104"},"observation_digest":"sha256:98c27ef5dd46a4fa81688e8c631abeda65037e7cfa1eca0eaa4856210bba3a2b","observation_id":"ac3977f9-50d3-4bac-a657-5d6f08e176a4","resolution":{"observed_at":"2026-08-07T06:03:19.784410Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.23079","last_updated":"2024-10-30T14:53:37Z","snapshot_observed_at":"2026-08-16T13:04:31.330891Z","submitted_at":"2024-10-30T14:53:37Z","title":"BUZZ: Beehive-structured Sparse KV Cache with Segmented Heavy Hitters for Efficient LLM Inference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.23079","snapshot_observed_at":"2026-08-07T06:03:19.381771Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11104","last_updated":"2025-06-06T20:24:36Z","snapshot_observed_at":"2026-08-07T20:41:32.031099Z","submitted_at":"2025-06-06T20:24:36Z","title":"DAM: Dynamic Attention Mask for Long-Context Large Language Model Inference Acceleration","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T06:03:19.381771Z"},"links":{"cited_paper":"/paper/2410.23079","citing_paper":"/paper/2506.11104"},"observation_digest":"sha256:a1fdd26aee64f12cb4828779534b1b22d3440bb5ac9c76de20eaf143ebad39b0","observation_id":"0fa2375a-4a90-4325-82ad-523cb12c7c76","resolution":{"observed_at":"2026-08-07T06:03:19.381771Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.07104","last_updated":"2024-06-06T00:10:06Z","snapshot_observed_at":"2026-08-11T10:42:54.633244Z","submitted_at":"2023-12-12T09:34:27Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.07104","snapshot_observed_at":"2026-08-07T06:03:19.384593Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11104","last_updated":"2025-06-06T20:24:36Z","snapshot_observed_at":"2026-08-07T20:41:32.031099Z","submitted_at":"2025-06-06T20:24:36Z","title":"DAM: Dynamic Attention Mask for Long-Context Large Language Model Inference Acceleration","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-07T06:03:19.384593Z"},"links":{"cited_paper":"/paper/2312.07104","citing_paper":"/paper/2506.11104"},"observation_digest":"sha256:39d53c52d0b3a091b831fc835bf2b45b46f7ead289eaff9acc050d52b1bed37d","observation_id":"8ad58d27-eea1-4510-8dc9-59d415f56a26","resolution":{"observed_at":"2026-08-07T06:03:19.384593Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03594","last_updated":"2026-04-22T15:33:51Z","snapshot_observed_at":"2026-08-15T02:09:13.690958Z","submitted_at":"2024-11-29T05:57:37Z","title":"BatchLLM: Optimizing Large Batched LLM Inference with Global Prefix Sharing and Throughput-oriented Token Batching","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03594","snapshot_observed_at":"2026-08-07T06:03:19.387482Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11104","last_updated":"2025-06-06T20:24:36Z","snapshot_observed_at":"2026-08-07T20:41:32.031099Z","submitted_at":"2025-06-06T20:24:36Z","title":"DAM: Dynamic Attention Mask for Long-Context Large Language Model Inference Acceleration","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-07T06:03:19.387482Z"},"links":{"cited_paper":"/paper/2412.03594","citing_paper":"/paper/2506.11104"},"observation_digest":"sha256:4a24048510c690991331c19244d10c7664263566ebf0c02e35138031d9d22f84","observation_id":"a6411a1e-082c-4e41-a447-5238a7d44b9c","resolution":{"observed_at":"2026-08-07T06:03:19.387482Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.11104","last_updated":"2025-06-06T20:24:36Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-07T20:41:32.031099Z","submitted_at":"2025-06-06T20:24:36Z","title":"DAM: Dynamic Attention Mask for Long-Context Large Language Model Inference Acceleration"},"reference_resolution":{"displayed":41,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":37,"verified_exact":3,"verified_fuzzy":1},"total_outbound_references":41},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 41 of 41 outbound references and 1 inbound Pith citation observation for arXiv:2506.11104."}