{"as_of":"2026-08-09T11:43:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:27fa5d4970cc3481575a820466e87f184820da9b5bb299b306bab5a727e91b29","coverage":[{"denominator":29,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":29,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T13:46:11.464371Z","state":"measured"},{"denominator":30,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":30,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-18T13:17:57.627009Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-18T13:21:24.216191Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.09647","last_updated":"2025-03-05T16:14:16Z","snapshot_observed_at":"2026-08-09T11:20:27.104492Z","submitted_at":"2025-02-11T00:04:32Z","title":"Unveiling Simplicities of Attention: Adaptive Long-Context Head Identification","version":2},"cited_work":{"arxiv_id":"2502.09647","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.09647","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Unveiling simplicities of attention: Adaptive long-context head identification","venue":null,"work_id":"6e565c86-9511-4866-9225-7a247df759e2","year":2025},"citing_paper":{"arxiv_id":"2509.24328","last_updated":"2026-04-20T02:54:34Z","snapshot_observed_at":"2026-07-06T22:31:00.843452Z","submitted_at":"2025-09-29T06:25:54Z","title":"Speculative Verification: Exploiting Information Gain to Refine Speculative Decoding","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-18T13:17:57.627009Z"},"links":{"cited_paper":"/paper/2502.09647","citing_paper":"/paper/2509.24328"},"observation_digest":"sha256:c725bf3744ad2becbacbd0215508bc45657c35907a4b4efa866c944022e79e5d","observation_id":"2cb2a063-772e-4b2d-8e67-99c4953ce8be","resolution":{"observed_at":"2026-05-18T13:21:24.218559Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2502.09647/citation-record","integrity":"/paper/2502.09647/integrity","json":"/paper/2502.09647/citation-record.json","paper":"/paper/2502.09647"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2305.13245","last_updated":"2023-12-23T17:55:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-22T17:16:38Z","title":"GQA: Training Generalized Multi-Query Transformer Models from Multi-Head Checkpoints","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13245","snapshot_observed_at":"2026-08-08T13:46:11.343368Z","title":"Gqa: Training generalized multi-query transformer models from multi-head checkpoints.arXiv preprint arXiv:2305.13245 ,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.09647","last_updated":"2025-03-05T16:14:16Z","snapshot_observed_at":"2026-08-09T11:20:27.104492Z","submitted_at":"2025-02-11T00:04:32Z","title":"Unveiling Simplicities of Attention: Adaptive Long-Context Head Identification","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-08T13:46:11.343368Z"},"links":{"cited_paper":"/paper/2305.13245","citing_paper":"/paper/2502.09647"},"observation_digest":"sha256:c416555148ec3ef7c3b934bb6290c95193294630c0c2ffd5989bf224c0e4f8ab","observation_id":"5e8dbd32-4477-423b-9cf2-da50db8eeae2","resolution":{"observed_at":"2026-08-08T13:46:11.343368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02069","last_updated":"2025-05-15T17:18:12Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-04T07:51:30Z","title":"PyramidKV: Dynamic KV Cache Compression based on Pyramidal Information Funneling","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02069","snapshot_observed_at":"2026-08-08T13:46:11.362705Z","title":"doi: 10.18653/v1/2024.acl-long.172","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.09647","last_updated":"2025-03-05T16:14:16Z","snapshot_observed_at":"2026-08-09T11:20:27.104492Z","submitted_at":"2025-02-11T00:04:32Z","title":"Unveiling Simplicities of Attention: Adaptive Long-Context Head Identification","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-08T13:46:11.362705Z"},"links":{"cited_paper":"/paper/2406.02069","citing_paper":"/paper/2502.09647"},"observation_digest":"sha256:4cabe0e3d2a0f3e280bf0d8c85a65d5c00a8a14ced3402b82f6ff73395f1c4be","observation_id":"a3ae2c5c-deaf-485d-b45a-53cead37c47e","resolution":{"observed_at":"2026-08-08T13:46:11.362705Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.16179","last_updated":"2024-12-18T17:36:36Z","snapshot_observed_at":"2026-07-06T19:37:11.636987Z","submitted_at":"2024-10-21T16:44:51Z","title":"MagicPIG: LSH Sampling for Efficient LLM Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.16179","snapshot_observed_at":"2026-08-08T13:46:11.366865Z","title":"Magicpig: Lsh sampling for efficient llm generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.09647","last_updated":"2025-03-05T16:14:16Z","snapshot_observed_at":"2026-08-09T11:20:27.104492Z","submitted_at":"2025-02-11T00:04:32Z","title":"Unveiling Simplicities of Attention: Adaptive Long-Context Head Identification","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-08T13:46:11.366865Z"},"links":{"cited_paper":"/paper/2410.16179","citing_paper":"/paper/2502.09647"},"observation_digest":"sha256:dafc4cd87fc5419f795ba4100918347b51c5771ae9f336eeb57a6af734212870","observation_id":"210a51f4-a9b1-4d1c-bb8a-fa88c98b3879","resolution":{"observed_at":"2026-08-08T13:46:11.366865Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-07T01:45:38.840969Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-08T13:46:11.370692Z","title":"Training verifiers to solve math word problems.arXiv preprint arXiv:2110.14168,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.09647","last_updated":"2025-03-05T16:14:16Z","snapshot_observed_at":"2026-08-09T11:20:27.104492Z","submitted_at":"2025-02-11T00:04:32Z","title":"Unveiling Simplicities of Attention: Adaptive Long-Context Head Identification","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-08T13:46:11.370692Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2502.09647"},"observation_digest":"sha256:bac768d9041c099196032e31b7e4ffc466048b44dbb2739e7f85fcb5a4019b03","observation_id":"7e67fef2-d988-42db-b8e1-78c4b474c4bd","resolution":{"observed_at":"2026-08-08T13:46:11.370692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-08T13:46:11.374583Z","title":"The llama 3 herd of models.arXiv preprint arXiv:2407.21783 ,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.09647","last_updated":"2025-03-05T16:14:16Z","snapshot_observed_at":"2026-08-09T11:20:27.104492Z","submitted_at":"2025-02-11T00:04:32Z","title":"Unveiling Simplicities of Attention: Adaptive Long-Context Head Identification","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-08T13:46:11.374583Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2502.09647"},"observation_digest":"sha256:d01440d0a849042e6f77a1f16f7e3618226286fdd34d89491d0c4e36a79f04b4","observation_id":"4d1a736f-6e03-4e41-a732-64618d141386","resolution":{"observed_at":"2026-08-08T13:46:11.374583Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10781","last_updated":"2025-03-02T14:37:53Z","snapshot_observed_at":"2026-08-02T20:46:05.666977Z","submitted_at":"2024-10-14T17:50:28Z","title":"When Attention Sink Emerges in Language Models: An Empirical View","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10781","snapshot_observed_at":"2026-08-08T13:46:11.379308Z","title":"When attention sink emerges in language models: An empirical view.arXiv preprint arXiv:2410.10781 ,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.09647","last_updated":"2025-03-05T16:14:16Z","snapshot_observed_at":"2026-08-09T11:20:27.104492Z","submitted_at":"2025-02-11T00:04:32Z","title":"Unveiling Simplicities of Attention: Adaptive Long-Context Head Identification","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-08T13:46:11.379308Z"},"links":{"cited_paper":"/paper/2410.10781","citing_paper":"/paper/2502.09647"},"observation_digest":"sha256:3728eeb865251ea5b39675ac134cc0b160da1f3e5ad8d5f87323390d32325a0b","observation_id":"7cdedb49-90d8-40ec-bf61-b7844b04b5ea","resolution":{"observed_at":"2026-08-08T13:46:11.379308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.15113","last_updated":"2025-01-25T07:28:13Z","snapshot_observed_at":"2026-08-09T11:20:18.232150Z","submitted_at":"2025-01-25T07:28:13Z","title":"Task-KV: Task-aware KV Cache Optimization via Semantic Differentiation of Attention Heads","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.15113","snapshot_observed_at":"2026-08-08T13:46:11.383126Z","title":"Task-kv: Task-aware kv cache optimization via semantic differentiation of attention heads","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.09647","last_updated":"2025-03-05T16:14:16Z","snapshot_observed_at":"2026-08-09T11:20:27.104492Z","submitted_at":"2025-02-11T00:04:32Z","title":"Unveiling Simplicities of Attention: Adaptive Long-Context Head Identification","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-08T13:46:11.383126Z"},"links":{"cited_paper":"/paper/2501.15113","citing_paper":"/paper/2502.09647"},"observation_digest":"sha256:e2cc445959abf172e5147b33345d8042aaa0bb80a71b630694b9281ed701d480","observation_id":"1b23ff28-9c93-44f8-b1d1-d7b36a38705d","resolution":{"observed_at":"2026-08-08T13:46:11.383126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06654","last_updated":"2024-08-06T21:48:58Z","snapshot_observed_at":"2026-07-06T17:58:00.820879Z","submitted_at":"2024-04-09T23:41:27Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.06654","snapshot_observed_at":"2026-08-08T13:46:11.391132Z","title":"Ruler: What’s the real context size of your long-context language models?arXiv preprint arXiv:2404.06654,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.09647","last_updated":"2025-03-05T16:14:16Z","snapshot_observed_at":"2026-08-09T11:20:27.104492Z","submitted_at":"2025-02-11T00:04:32Z","title":"Unveiling Simplicities of Attention: Adaptive Long-Context Head Identification","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-08T13:46:11.391132Z"},"links":{"cited_paper":"/paper/2404.06654","citing_paper":"/paper/2502.09647"},"observation_digest":"sha256:adbaf0241e62d1c8c91f42f0c6bfc76c8e2145b05b04da93dc7af0f12be55c91","observation_id":"b0d34772-fb1e-462e-a094-5c7c29496126","resolution":{"observed_at":"2026-08-08T13:46:11.391132Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06825","last_updated":"2023-10-10T17:54:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-10T17:54:58Z","title":"Mistral 7B","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06825","snapshot_observed_at":"2026-08-08T13:46:11.394908Z","title":"Mistral 7b.arXiv preprint arXiv:2310.06825,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.09647","last_updated":"2025-03-05T16:14:16Z","snapshot_observed_at":"2026-08-09T11:20:27.104492Z","submitted_at":"2025-02-11T00:04:32Z","title":"Unveiling Simplicities of Attention: Adaptive Long-Context Head Identification","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-08T13:46:11.394908Z"},"links":{"cited_paper":"/paper/2310.06825","citing_paper":"/paper/2502.09647"},"observation_digest":"sha256:49beaa64dd24d06f10fb175d6175718e003aea157ff7164ee1e88f522904b322","observation_id":"e5a635cf-9922-4b56-b3e5-eca0ad66b825","resolution":{"observed_at":"2026-08-08T13:46:11.394908Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14469","last_updated":"2024-06-17T03:01:58Z","snapshot_observed_at":"2026-08-07T22:57:56.263839Z","submitted_at":"2024-04-22T17:42:58Z","title":"SnapKV: LLM Knows What You are Looking for Before Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14469","snapshot_observed_at":"2026-08-08T13:46:11.398714Z","title":"Snapkv: Llm knows what you are looking for before generation.arXiv preprint arXiv:2404.14469,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.09647","last_updated":"2025-03-05T16:14:16Z","snapshot_observed_at":"2026-08-09T11:20:27.104492Z","submitted_at":"2025-02-11T00:04:32Z","title":"Unveiling Simplicities of Attention: Adaptive Long-Context Head Identification","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-08T13:46:11.398714Z"},"links":{"cited_paper":"/paper/2404.14469","citing_paper":"/paper/2502.09647"},"observation_digest":"sha256:416c0e491b9c74b4a76c0d2776d425bbd1f2871612d012e34e7c582da62034a2","observation_id":"85ee0a17-706f-4b77-bee4-a04e7c72add4","resolution":{"observed_at":"2026-08-08T13:46:11.398714Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-08T13:46:11.402637Z","title":"Deepseek-v3 technical report.arXiv preprint arXiv:2412.19437 ,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.09647","last_updated":"2025-03-05T16:14:16Z","snapshot_observed_at":"2026-08-09T11:20:27.104492Z","submitted_at":"2025-02-11T00:04:32Z","title":"Unveiling Simplicities of Attention: Adaptive Long-Context Head Identification","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-08T13:46:11.402637Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2502.09647"},"observation_digest":"sha256:95572db67df084ee883959d5f65d0cacbfe793bbd4041e849e50668913513c34","observation_id":"2d344b57-1caa-4697-9de6-70177ce76f36","resolution":{"observed_at":"2026-08-08T13:46:11.402637Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.11895","last_updated":"2022-09-24T00:43:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-09-24T00:43:19Z","title":"In-context Learning and Induction Heads","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.11895","snapshot_observed_at":"2026-08-08T13:46:11.407058Z","title":"In-context learning and induction heads.arXiv preprint arXiv:2209.11895 ,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.09647","last_updated":"2025-03-05T16:14:16Z","snapshot_observed_at":"2026-08-09T11:20:27.104492Z","submitted_at":"2025-02-11T00:04:32Z","title":"Unveiling Simplicities of Attention: Adaptive Long-Context Head Identification","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-08T13:46:11.407058Z"},"links":{"cited_paper":"/paper/2209.11895","citing_paper":"/paper/2502.09647"},"observation_digest":"sha256:96ad7fb4b830628b4bc55013d0af68a6a8311bd19c56dd8af1b9b0030ead4103","observation_id":"7085e3eb-6652-4322-a50b-b0d1814b0118","resolution":{"observed_at":"2026-08-08T13:46:11.407058Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1606.05250","last_updated":"2016-10-11T02:42:36Z","snapshot_observed_at":"2026-08-08T11:05:45.903773Z","submitted_at":"2016-06-16T16:36:00Z","title":"SQuAD: 100,000+ Questions for Machine Comprehension of Text","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.05250","snapshot_observed_at":"2026-08-08T13:46:11.415240Z","title":"Squad: 100,000+ questions for machine comprehension of text.arXiv preprint arXiv:1606.05250 ,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.09647","last_updated":"2025-03-05T16:14:16Z","snapshot_observed_at":"2026-08-09T11:20:27.104492Z","submitted_at":"2025-02-11T00:04:32Z","title":"Unveiling Simplicities of Attention: Adaptive Long-Context Head Identification","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-08T13:46:11.415240Z"},"links":{"cited_paper":"/paper/1606.05250","citing_paper":"/paper/2502.09647"},"observation_digest":"sha256:055aedcbcb45c89c4a3df23e322c1aef6e71ef2cc073e3e8f87380c02cdcf6d8","observation_id":"10e161f8-1e4c-413d-8d14-22e51e458da2","resolution":{"observed_at":"2026-08-08T13:46:11.415240Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21465","last_updated":"2025-04-25T19:40:54Z","snapshot_observed_at":"2026-08-01T20:33:25.557711Z","submitted_at":"2024-10-28T19:08:12Z","title":"ShadowKV: KV Cache in Shadows for High-Throughput Long-Context LLM Inference","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21465","snapshot_observed_at":"2026-08-08T13:46:11.424138Z","title":"Shadowkv: Kv cache in shadows for high-throughput long-context llm inference.arXiv preprint arXiv:2410.21465 , 2024a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.09647","last_updated":"2025-03-05T16:14:16Z","snapshot_observed_at":"2026-08-09T11:20:27.104492Z","submitted_at":"2025-02-11T00:04:32Z","title":"Unveiling Simplicities of Attention: Adaptive Long-Context Head Identification","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-08T13:46:11.424138Z"},"links":{"cited_paper":"/paper/2410.21465","citing_paper":"/paper/2502.09647"},"observation_digest":"sha256:b291d1bb8519cadd9f7827271fdab13b2c4df1fe9615b7af7bc6623c0c4166e7","observation_id":"e9cacb04-604f-45c6-97e3-80b3e285eaeb","resolution":{"observed_at":"2026-08-08T13:46:11.424138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.15574","last_updated":"2024-04-24T00:24:03Z","snapshot_observed_at":"2026-08-06T03:07:12.026697Z","submitted_at":"2024-04-24T00:24:03Z","title":"Retrieval Head Mechanistically Explains Long-Context Factuality","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.15574","snapshot_observed_at":"2026-08-08T13:46:11.433213Z","title":"Retrieval head mechanistically explains long-context factuality","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.09647","last_updated":"2025-03-05T16:14:16Z","snapshot_observed_at":"2026-08-09T11:20:27.104492Z","submitted_at":"2025-02-11T00:04:32Z","title":"Unveiling Simplicities of Attention: Adaptive Long-Context Head Identification","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-08T13:46:11.433213Z"},"links":{"cited_paper":"/paper/2404.15574","citing_paper":"/paper/2502.09647"},"observation_digest":"sha256:48c24de2b50f80cfd1f6823211a6df5294977fd20c76688935fcc966d57630df","observation_id":"2883a270-e414-4807-909d-47b065b6dd6b","resolution":{"observed_at":"2026-08-08T13:46:11.433213Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17453","last_updated":"2024-04-07T00:56:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-29T17:59:56Z","title":"Efficient Streaming Language Models with Attention Sinks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.17453","snapshot_observed_at":"2026-08-08T13:46:11.437333Z","title":"Efficient streaming language models with attention sinks","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.09647","last_updated":"2025-03-05T16:14:16Z","snapshot_observed_at":"2026-08-09T11:20:27.104492Z","submitted_at":"2025-02-11T00:04:32Z","title":"Unveiling Simplicities of Attention: Adaptive Long-Context Head Identification","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-08T13:46:11.437333Z"},"links":{"cited_paper":"/paper/2309.17453","citing_paper":"/paper/2502.09647"},"observation_digest":"sha256:d43e47ab874479731656ca78bdb3821751a38afbcebc6e54f62bdbe568182e99","observation_id":"139f1823-1281-4720-991a-971bac5260ef","resolution":{"observed_at":"2026-08-08T13:46:11.437333Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10819","last_updated":"2024-10-14T17:59:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-14T17:59:58Z","title":"DuoAttention: Efficient Long-Context LLM Inference with Retrieval and Streaming Heads","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10819","snapshot_observed_at":"2026-08-08T13:46:11.441263Z","title":"Duoat- tention: Efficient long-context llm inference with retrieval and streaming heads.arXiv preprint arXiv:2410.10819 ,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.09647","last_updated":"2025-03-05T16:14:16Z","snapshot_observed_at":"2026-08-09T11:20:27.104492Z","submitted_at":"2025-02-11T00:04:32Z","title":"Unveiling Simplicities of Attention: Adaptive Long-Context Head Identification","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-08T13:46:11.441263Z"},"links":{"cited_paper":"/paper/2410.10819","citing_paper":"/paper/2502.09647"},"observation_digest":"sha256:92651f286b26f6e806b1fb093e0132fd6d13b558257e786026ba873acf598aa4","observation_id":"008df740-affe-4a11-a002-85932160f87c","resolution":{"observed_at":"2026-08-08T13:46:11.441263Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.03752","last_updated":"2024-12-23T17:57:29Z","snapshot_observed_at":"2026-08-09T07:37:01.932557Z","submitted_at":"2024-09-05T17:59:12Z","title":"Attention Heads of Large Language Models: A Survey","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.03752","snapshot_observed_at":"2026-08-08T13:46:11.446469Z","title":"Attention heads of large language models: A survey.arXiv preprint arXiv:2409.03752 ,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.09647","last_updated":"2025-03-05T16:14:16Z","snapshot_observed_at":"2026-08-09T11:20:27.104492Z","submitted_at":"2025-02-11T00:04:32Z","title":"Unveiling Simplicities of Attention: Adaptive Long-Context Head Identification","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-08T13:46:11.446469Z"},"links":{"cited_paper":"/paper/2409.03752","citing_paper":"/paper/2502.09647"},"observation_digest":"sha256:1f5f2594c96d36fda001cb085ecbafa4fde65f7632698dfd1e2de70b4c46affb","observation_id":"02ec2ad8-0dd1-4c47-9c1a-0b9dbffcc7da","resolution":{"observed_at":"2026-08-08T13:46:11.446469Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:46:11.768858Z","title":"(2024); Tang et al","venue":null,"work_id":"f1c2a52d-2228-4fe9-aa26-9a1c293e8ea4","year":2024},"citing_paper":{"arxiv_id":"2502.09647","last_updated":"2025-03-05T16:14:16Z","snapshot_observed_at":"2026-08-09T11:20:27.104492Z","submitted_at":"2025-02-11T00:04:32Z","title":"Unveiling Simplicities of Attention: Adaptive Long-Context Head Identification","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-08T13:46:11.451445Z"},"links":{"citing_paper":"/paper/2502.09647"},"observation_digest":"sha256:8e21c574efac6b92329f1411a6f919dd27cfcb253bac248eba58f4dc7abb0bcd","observation_id":"3b08fee2-2923-4f2e-849d-c6c8b4f77bc1","resolution":{"observed_at":"2026-08-08T13:46:11.773078Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:46:11.756525Z","title":"qa-1” and “qa-2","venue":null,"work_id":"bbd30ebb-eab4-4f20-b6d2-ea1fd1d0062d","year":2024},"citing_paper":{"arxiv_id":"2502.09647","last_updated":"2025-03-05T16:14:16Z","snapshot_observed_at":"2026-08-09T11:20:27.104492Z","submitted_at":"2025-02-11T00:04:32Z","title":"Unveiling Simplicities of Attention: Adaptive Long-Context Head Identification","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-08T13:46:11.455913Z"},"links":{"citing_paper":"/paper/2502.09647"},"observation_digest":"sha256:a77a84aefa3ed13725352a73a918c83ff6ffc2f6ea34b3296ee2d4a696eb4328","observation_id":"f95a754a-db31-4341-b0d2-d7808e626bf5","resolution":{"observed_at":"2026-08-08T13:46:11.760733Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:46:11.745337Z","title":null,"venue":null,"work_id":"74b2ad0a-4c70-46a8-b833-194da6fc26a0","year":2021},"citing_paper":{"arxiv_id":"2502.09647","last_updated":"2025-03-05T16:14:16Z","snapshot_observed_at":"2026-08-09T11:20:27.104492Z","submitted_at":"2025-02-11T00:04:32Z","title":"Unveiling Simplicities of Attention: Adaptive Long-Context Head Identification","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-08T13:46:11.460284Z"},"links":{"citing_paper":"/paper/2502.09647"},"observation_digest":"sha256:41e2ebb10dd236a2b501943264745e90c579ea00f6d49fc462e17421f2b19afe","observation_id":"b52d1065-85d1-41a5-b1a0-59cbbdd4747a","resolution":{"observed_at":"2026-08-08T13:46:11.749185Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:46:11.732211Z","title":"observation","venue":null,"work_id":"7c0d0471-362f-4885-8761-25fef888b051","year":2024},"citing_paper":{"arxiv_id":"2502.09647","last_updated":"2025-03-05T16:14:16Z","snapshot_observed_at":"2026-08-09T11:20:27.104492Z","submitted_at":"2025-02-11T00:04:32Z","title":"Unveiling Simplicities of Attention: Adaptive Long-Context Head Identification","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-08T13:46:11.464371Z"},"links":{"citing_paper":"/paper/2502.09647"},"observation_digest":"sha256:bc2cec416e68a59c1f8a183455b5572352a4e5f52c8b2fddf030e716a5410294","observation_id":"654e4c44-559e-44a3-9442-9f1820fcbcad","resolution":{"observed_at":"2026-08-08T13:46:11.737206Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.04985","last_updated":"2024-09-04T10:04:52Z","snapshot_observed_at":"2026-07-06T16:58:47.790985Z","submitted_at":"2023-12-08T11:47:35Z","title":"SparQ Attention: Bandwidth-Efficient LLM Inference","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.04985","snapshot_observed_at":"2026-08-08T13:46:11.419712Z","title":"Sparq attention: Bandwidth-efficient llm inference","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.09647","last_updated":"2025-03-05T16:14:16Z","snapshot_observed_at":"2026-08-09T11:20:27.104492Z","submitted_at":"2025-02-11T00:04:32Z","title":"Unveiling Simplicities of Attention: Adaptive Long-Context Head Identification","version":2},"reference_index":2016,"source":"pdf_text","source_observed_at":"2026-08-08T13:46:11.419712Z"},"links":{"cited_paper":"/paper/2312.04985","citing_paper":"/paper/2502.09647"},"observation_digest":"sha256:1b7b92a3e7454e90e2e45353c3be526676c45540ff954159b250ea8cd36e2551","observation_id":"870ee56a-545b-4041-89b2-ff0acca5654d","resolution":{"observed_at":"2026-08-08T13:46:11.419712Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.03863","last_updated":"2024-05-23T06:08:37Z","snapshot_observed_at":"2026-08-02T01:09:26.116796Z","submitted_at":"2023-12-06T19:18:42Z","title":"Efficient Large Language Models: A Survey","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.03863","snapshot_observed_at":"2026-08-08T13:46:11.428921Z","title":"Efficient large language models: A survey.arXiv preprint arXiv:2312.03863 ,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.09647","last_updated":"2025-03-05T16:14:16Z","snapshot_observed_at":"2026-08-09T11:20:27.104492Z","submitted_at":"2025-02-11T00:04:32Z","title":"Unveiling Simplicities of Attention: Adaptive Long-Context Head Identification","version":2},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-08T13:46:11.428921Z"},"links":{"cited_paper":"/paper/2312.03863","citing_paper":"/paper/2502.09647"},"observation_digest":"sha256:abe05f919c411330d382794a4cf9df79950aaad371fa3126da4424b58109330c","observation_id":"dc37a957-0548-46d9-ab98-bf9802b373e6","resolution":{"observed_at":"2026-08-08T13:46:11.428921Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-08-08T13:46:11.358715Z","title":"Qwen technical report.arXiv preprint arXiv:2309.16609 ,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.09647","last_updated":"2025-03-05T16:14:16Z","snapshot_observed_at":"2026-08-09T11:20:27.104492Z","submitted_at":"2025-02-11T00:04:32Z","title":"Unveiling Simplicities of Attention: Adaptive Long-Context Head Identification","version":2},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-08T13:46:11.358715Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2502.09647"},"observation_digest":"sha256:687209e71db9d01f29d6fbe91a92593da99fefef8a1925075d3c93dd2d01678b","observation_id":"decf2b0b-31c7-418f-b8d3-0a81247d7f17","resolution":{"observed_at":"2026-08-08T13:46:11.358715Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06104","last_updated":"2024-06-18T09:16:14Z","snapshot_observed_at":"2026-08-07T11:50:21.011836Z","submitted_at":"2024-01-11T18:35:26Z","title":"Transformers are Multi-State RNNs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.06104","snapshot_observed_at":"2026-08-08T13:46:11.411181Z","title":"Transformers are multi-state rnns.arXiv preprint arXiv:2401.06104,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.09647","last_updated":"2025-03-05T16:14:16Z","snapshot_observed_at":"2026-08-09T11:20:27.104492Z","submitted_at":"2025-02-11T00:04:32Z","title":"Unveiling Simplicities of Attention: Adaptive Long-Context Head Identification","version":2},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-08T13:46:11.411181Z"},"links":{"cited_paper":"/paper/2401.06104","citing_paper":"/paper/2502.09647"},"observation_digest":"sha256:f2a79790f287e53bc9336dabd076360fefbc2e969751f4149e0c0f0681ffe884","observation_id":"00232cfb-b8d0-4ffd-92b7-ac3239210597","resolution":{"observed_at":"2026-08-08T13:46:11.411181Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16635","last_updated":"2024-10-17T15:45:10Z","snapshot_observed_at":"2026-07-06T18:36:03.601696Z","submitted_at":"2024-06-24T13:41:08Z","title":"ShadowLLM: Predictor-based Contextual Sparsity for Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16635","snapshot_observed_at":"2026-08-08T13:46:11.348797Z","title":"Shadowllm: Predictor-based contextual sparsity for large language models.arXiv preprint arXiv:2406.16635,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.09647","last_updated":"2025-03-05T16:14:16Z","snapshot_observed_at":"2026-08-09T11:20:27.104492Z","submitted_at":"2025-02-11T00:04:32Z","title":"Unveiling Simplicities of Attention: Adaptive Long-Context Head Identification","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-08T13:46:11.348797Z"},"links":{"cited_paper":"/paper/2406.16635","citing_paper":"/paper/2502.09647"},"observation_digest":"sha256:c1fe9d96949a370cfbaa8c6cc85c6d1399fa69431923003e7110c0fdc4e98f7c","observation_id":"9d1b1eb3-2eb3-4236-a4f4-eef2411fa7f7","resolution":{"observed_at":"2026-08-08T13:46:11.348797Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.07732","last_updated":"2021-08-16T03:57:30Z","snapshot_observed_at":"2026-08-02T19:23:53.535075Z","submitted_at":"2021-08-16T03:57:30Z","title":"Program Synthesis with Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.07732","snapshot_observed_at":"2026-08-08T13:46:11.353983Z","title":"Program synthesis with large language models.arXiv preprint arXiv:2108.07732 ,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.09647","last_updated":"2025-03-05T16:14:16Z","snapshot_observed_at":"2026-08-09T11:20:27.104492Z","submitted_at":"2025-02-11T00:04:32Z","title":"Unveiling Simplicities of Attention: Adaptive Long-Context Head Identification","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-08T13:46:11.353983Z"},"links":{"cited_paper":"/paper/2108.07732","citing_paper":"/paper/2502.09647"},"observation_digest":"sha256:aff41ef16ab35b0a4cba06e29de17f16576442eb56b9863597bf3b935bc15b5d","observation_id":"8ea75401-2c1b-4358-8536-c1d5d5a5fd8d","resolution":{"observed_at":"2026-08-08T13:46:11.353983Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.08703","last_updated":"2024-10-21T08:49:18Z","snapshot_observed_at":"2026-07-06T19:31:44.631136Z","submitted_at":"2024-10-11T10:47:02Z","title":"On the token distance modeling ability of higher RoPE attention dimension","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.08703","snapshot_observed_at":"2026-08-08T13:46:11.387098Z","title":"On the token distance modeling ability of higher rope attention dimension.arXiv preprint arXiv:2410.08703 ,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.09647","last_updated":"2025-03-05T16:14:16Z","snapshot_observed_at":"2026-08-09T11:20:27.104492Z","submitted_at":"2025-02-11T00:04:32Z","title":"Unveiling Simplicities of Attention: Adaptive Long-Context Head Identification","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-08T13:46:11.387098Z"},"links":{"cited_paper":"/paper/2410.08703","citing_paper":"/paper/2502.09647"},"observation_digest":"sha256:431e254b7cc664d3ec84a03567b255922d33ce05c18e8a43fbde0b4452d52d5d","observation_id":"fc685a8a-5258-401e-b729-4d8d8067d15f","resolution":{"observed_at":"2026-08-08T13:46:11.387098Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2502.09647","last_updated":"2025-03-05T16:14:16Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-09T11:20:27.104492Z","submitted_at":"2025-02-11T00:04:32Z","title":"Unveiling Simplicities of Attention: Adaptive Long-Context Head Identification"},"reference_resolution":{"displayed":29,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":26,"verified_exact":0,"verified_fuzzy":3},"total_outbound_references":29},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 29 of 29 outbound references and 1 inbound Pith citation observation for arXiv:2502.09647."}