{"as_of":"2026-08-18T05:42:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:011b2cb85313b5fd4ddffd5d7f3790e064f89ecd7959990896ea3d4ceea66e49","coverage":[{"denominator":108,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T16:14:06.284069Z","state":"measured"},{"denominator":118,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":118,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":18,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":18,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T00:38:46.746093Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"pith","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":1,"observed_at":"2026-08-05T02:28:24.338817Z","source":"pith"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.10319","last_updated":"2025-03-11T14:02:04Z","snapshot_observed_at":"2026-08-13T16:34:08.378180Z","submitted_at":"2024-12-13T17:59:52Z","title":"SCBench: A KV Cache-Centric Analysis of Long-Context Methods","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10319","snapshot_observed_at":"2026-08-11T00:38:46.746093Z","title":"Scbench: A kv cache-centric analysis of long-context methods,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.19442","last_updated":"2025-07-30T05:24:46Z","snapshot_observed_at":"2026-08-15T13:24:51.697670Z","submitted_at":"2024-12-27T04:17:57Z","title":"A Survey on Large Language Model Acceleration based on KV Cache Management","version":3},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-11T00:38:46.746093Z"},"links":{"cited_paper":"/paper/2412.10319","citing_paper":"/paper/2412.19442"},"observation_digest":"sha256:d49113277ce022630133cdaba93e4a7efdceb32e40ba17ffad19489b07692051","observation_id":"7b080277-58e4-4e45-8560-57bac9655726","resolution":{"observed_at":"2026-08-11T00:38:46.746093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10319","last_updated":"2025-03-11T14:02:04Z","snapshot_observed_at":"2026-08-13T16:34:08.378180Z","submitted_at":"2024-12-13T17:59:52Z","title":"SCBench: A KV Cache-Centric Analysis of Long-Context Methods","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10319","snapshot_observed_at":"2026-08-09T20:34:01.265626Z","title":"H., Li, D., Gao, J., Yang, Y., et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.19392","last_updated":"2025-02-28T18:04:52Z","snapshot_observed_at":"2026-08-17T23:13:00.428494Z","submitted_at":"2025-01-31T18:47:42Z","title":"Cache Me If You Must: Adaptive Key-Value Quantization for Large Language Models","version":4},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-09T20:34:01.265626Z"},"links":{"cited_paper":"/paper/2412.10319","citing_paper":"/paper/2501.19392"},"observation_digest":"sha256:803eefe3a81fa5daa1daee9f4de66c0feb4d567117b33f030b9b7fd3dda6c97d","observation_id":"ef36e9a9-22d8-4947-a948-1d7fb234a758","resolution":{"observed_at":"2026-08-09T20:34:01.265626Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10319","last_updated":"2025-03-11T14:02:04Z","snapshot_observed_at":"2026-08-13T16:34:08.378180Z","submitted_at":"2024-12-13T17:59:52Z","title":"SCBench: A KV Cache-Centric Analysis of Long-Context Methods","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10319","snapshot_observed_at":"2026-08-09T11:11:17.722512Z","title":"H., Li, D., Gao, J., Yang, Y., and Qiu, L","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2502.02789","last_updated":"2025-05-19T18:24:50Z","snapshot_observed_at":"2026-08-17T01:39:21.989668Z","submitted_at":"2025-02-05T00:22:06Z","title":"Speculative Prefill: Turbocharging TTFT with Lightweight and Training-Free Token Importance Estimation","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-09T11:11:17.722512Z"},"links":{"cited_paper":"/paper/2412.10319","citing_paper":"/paper/2502.02789"},"observation_digest":"sha256:bead6def32e1a679ad3ec17b81704634d47752205f53397f5842e1bffbd479f9","observation_id":"73f6391c-4166-407d-973e-5850a203fe1f","resolution":{"observed_at":"2026-08-09T11:11:17.722512Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10319","last_updated":"2025-03-11T14:02:04Z","snapshot_observed_at":"2026-08-13T16:34:08.378180Z","submitted_at":"2024-12-13T17:59:52Z","title":"SCBench: A KV Cache-Centric Analysis of Long-Context Methods","version":2},"cited_work":{"arxiv_id":"2412.10319","doi":"10.48550/arxiv.2412.10319","metadata_source":"pith","pith_arxiv_id":"2412.10319","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"H.; Li, D.; Gao, J.; Yang, Y.; and Qiu, L","venue":"cs.CL","work_id":"846c0629-2f5a-462b-a768-28cf4efbb4ee","year":2024},"citing_paper":{"arxiv_id":"2504.02181","last_updated":"2026-04-22T01:49:17Z","snapshot_observed_at":"2026-07-30T09:24:14.725185Z","submitted_at":"2025-04-02T23:51:27Z","title":"A Survey of Scaling in Large Language Model Reasoning","version":2},"reference_index":101,"source":"pdf_text","source_observed_at":"2026-05-22T21:20:07.238992Z"},"links":{"cited_paper":"/paper/2412.10319","citing_paper":"/paper/2504.02181"},"observation_digest":"sha256:51f2fab1a6afb7ff4d28d5575d35901c45ea7faf8cacafe4954bb0cd2fb0a49b","observation_id":"59b9fc34-209f-4705-a7f5-c96c010a895c","resolution":{"observed_at":"2026-05-22T21:22:09.420903Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10319","last_updated":"2025-03-11T14:02:04Z","snapshot_observed_at":"2026-08-13T16:34:08.378180Z","submitted_at":"2024-12-13T17:59:52Z","title":"SCBench: A KV Cache-Centric Analysis of Long-Context Methods","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10319","snapshot_observed_at":"2026-08-07T05:06:32.642988Z","title":"Scbench: A kv cache-centric analysis of long-context methods.arXiv preprint arXiv:2412.10319, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08889","last_updated":"2025-06-10T15:17:26Z","snapshot_observed_at":"2026-08-18T03:43:14.193832Z","submitted_at":"2025-06-10T15:17:26Z","title":"SeerAttention-R: Sparse Attention Adaptation for Long Reasoning","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T05:06:32.642988Z"},"links":{"cited_paper":"/paper/2412.10319","citing_paper":"/paper/2506.08889"},"observation_digest":"sha256:d55113bdac5874549ea05af2e696ea52209a403fc2b955b0e8d882644fde016a","observation_id":"1d7ae517-d409-4357-b5c4-6d3b18cdd479","resolution":{"observed_at":"2026-08-07T05:06:32.642988Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10319","last_updated":"2025-03-11T14:02:04Z","snapshot_observed_at":"2026-08-13T16:34:08.378180Z","submitted_at":"2024-12-13T17:59:52Z","title":"SCBench: A KV Cache-Centric Analysis of Long-Context Methods","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10319","snapshot_observed_at":"2026-08-07T04:10:46.759948Z","title":"arXiv preprint arXiv:2412.10319 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11498","last_updated":"2025-06-13T06:49:53Z","snapshot_observed_at":"2026-08-10T13:22:21.396028Z","submitted_at":"2025-06-13T06:49:53Z","title":"Lag-Relative Sparse Attention In Long Context Training","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T04:10:46.759948Z"},"links":{"cited_paper":"/paper/2412.10319","citing_paper":"/paper/2506.11498"},"observation_digest":"sha256:154159f7bb065a1e4b3fe057edc36f5097f605d4b80910f49dd0ea1a659e9727","observation_id":"e5d9f31e-b613-4a3c-8b4c-a3c8fbe621df","resolution":{"observed_at":"2026-08-07T04:10:46.759948Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10319","last_updated":"2025-03-11T14:02:04Z","snapshot_observed_at":"2026-08-13T16:34:08.378180Z","submitted_at":"2024-12-13T17:59:52Z","title":"SCBench: A KV Cache-Centric Analysis of Long-Context Methods","version":2},"cited_work":{"arxiv_id":"2412.10319","doi":"10.48550/arxiv.2412.10319","metadata_source":"pith","pith_arxiv_id":"2412.10319","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"H.; Li, D.; Gao, J.; Yang, Y.; and Qiu, L","venue":"cs.CL","work_id":"846c0629-2f5a-462b-a768-28cf4efbb4ee","year":2024},"citing_paper":{"arxiv_id":"2507.21433","last_updated":"2026-05-14T02:27:46Z","snapshot_observed_at":"2026-08-17T11:18:04.705860Z","submitted_at":"2025-07-29T02:05:51Z","title":"ReasonCache: Accelerating Large Reasoning Model Serving through KV Cache Sharing","version":3},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-05-19T03:14:05.109011Z"},"links":{"cited_paper":"/paper/2412.10319","citing_paper":"/paper/2507.21433"},"observation_digest":"sha256:c6903f386367c2c15aaf4f5c73ef8f4d412b651c4021cc85974e2565884b5899","observation_id":"a7cc8d2f-75ec-4ffa-8fc0-5f5277e9658c","resolution":{"observed_at":"2026-05-19T03:17:00.821916Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10319","last_updated":"2025-03-11T14:02:04Z","snapshot_observed_at":"2026-08-13T16:34:08.378180Z","submitted_at":"2024-12-13T17:59:52Z","title":"SCBench: A KV Cache-Centric Analysis of Long-Context Methods","version":2},"cited_work":{"arxiv_id":"2412.10319","doi":"10.48550/arxiv.2412.10319","metadata_source":"pith","pith_arxiv_id":"2412.10319","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"H.; Li, D.; Gao, J.; Yang, Y.; and Qiu, L","venue":"cs.CL","work_id":"846c0629-2f5a-462b-a768-28cf4efbb4ee","year":2024},"citing_paper":{"arxiv_id":"2604.10539","last_updated":"2026-04-12T09:02:20Z","snapshot_observed_at":"2026-08-16T11:27:14.582242Z","submitted_at":"2026-04-12T09:02:20Z","title":"IceCache: Memory-efficient KV-cache Management for Long-Sequence LLMs","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-10T15:46:43.682254Z"},"links":{"cited_paper":"/paper/2412.10319","citing_paper":"/paper/2604.10539"},"observation_digest":"sha256:848872947f08792c72577ef4e1b77a736a48b48301f99d1e1addb1d90b226c75","observation_id":"6805502c-372d-4a5c-9805-371e773c449f","resolution":{"observed_at":"2026-05-11T09:51:01.223918Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10319","last_updated":"2025-03-11T14:02:04Z","snapshot_observed_at":"2026-08-13T16:34:08.378180Z","submitted_at":"2024-12-13T17:59:52Z","title":"SCBench: A KV Cache-Centric Analysis of Long-Context Methods","version":2},"cited_work":{"arxiv_id":"2412.10319","doi":"10.48550/arxiv.2412.10319","metadata_source":"pith","pith_arxiv_id":"2412.10319","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"H.; Li, D.; Gao, J.; Yang, Y.; and Qiu, L","venue":"cs.CL","work_id":"846c0629-2f5a-462b-a768-28cf4efbb4ee","year":2024},"citing_paper":{"arxiv_id":"2604.15732","last_updated":"2026-04-17T06:16:32Z","snapshot_observed_at":"2026-08-11T13:49:45.064663Z","submitted_at":"2026-04-17T06:16:32Z","title":"Accuracy Is Speed: Towards Long-Context-Aware Routing for Distributed LLM Serving","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-10T08:15:45.474618Z"},"links":{"cited_paper":"/paper/2412.10319","citing_paper":"/paper/2604.15732"},"observation_digest":"sha256:178d8d494933cef2b20a86e16e7b1171d0864dc0549ebcf62e04aeb3d87ffb4b","observation_id":"dd591b7a-ea57-429c-adbd-4eb123ac75b4","resolution":{"observed_at":"2026-05-10T08:17:37.454956Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10319","last_updated":"2025-03-11T14:02:04Z","snapshot_observed_at":"2026-08-13T16:34:08.378180Z","submitted_at":"2024-12-13T17:59:52Z","title":"SCBench: A KV Cache-Centric Analysis of Long-Context Methods","version":2},"cited_work":{"arxiv_id":"2412.10319","doi":"10.48550/arxiv.2412.10319","metadata_source":"pith","pith_arxiv_id":"2412.10319","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"H.; Li, D.; Gao, J.; Yang, Y.; and Qiu, L","venue":"cs.CL","work_id":"846c0629-2f5a-462b-a768-28cf4efbb4ee","year":2024},"citing_paper":{"arxiv_id":"2604.22117","last_updated":"2026-04-28T07:34:34Z","snapshot_observed_at":"2026-08-15T11:55:29.491078Z","submitted_at":"2026-04-23T23:32:36Z","title":"PermaFrost-Attack: Stealth Pretraining Seeding(SPS) for planting Logic Landmines During LLM Training","version":2},"reference_index":120,"source":"arxiv_source","source_observed_at":"2026-05-09T21:42:16.848186Z"},"links":{"cited_paper":"/paper/2412.10319","citing_paper":"/paper/2604.22117"},"observation_digest":"sha256:c2f093d640b4383563907adf7af444d8f36ca3f4ad9fac640e45de2c6dcbd433","observation_id":"2cefd318-562d-4ea8-802c-06367d0fedfc","resolution":{"observed_at":"2026-05-09T21:43:30.254592Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10319","last_updated":"2025-03-11T14:02:04Z","snapshot_observed_at":"2026-08-13T16:34:08.378180Z","submitted_at":"2024-12-13T17:59:52Z","title":"SCBench: A KV Cache-Centric Analysis of Long-Context Methods","version":2},"cited_work":{"arxiv_id":"2412.10319","doi":"10.48550/arxiv.2412.10319","metadata_source":"pith","pith_arxiv_id":"2412.10319","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"H.; Li, D.; Gao, J.; Yang, Y.; and Qiu, L","venue":"cs.CL","work_id":"846c0629-2f5a-462b-a768-28cf4efbb4ee","year":2024},"citing_paper":{"arxiv_id":"2604.22117","last_updated":"2026-04-28T07:34:34Z","snapshot_observed_at":"2026-08-15T11:55:29.491078Z","submitted_at":"2026-04-23T23:32:36Z","title":"PermaFrost-Attack: Stealth Pretraining Seeding(SPS) for planting Logic Landmines During LLM Training","version":2},"reference_index":131,"source":"arxiv_source","source_observed_at":"2026-05-09T21:42:16.848186Z"},"links":{"cited_paper":"/paper/2412.10319","citing_paper":"/paper/2604.22117"},"observation_digest":"sha256:d6f0a08f80b7c7494da51b1a066852fdafc9115d71a6ddb88920331dc1b2b4e8","observation_id":"ab6cb96e-8163-4cda-b3d5-5d1bab322634","resolution":{"observed_at":"2026-05-11T14:31:06.204775Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10319","last_updated":"2025-03-11T14:02:04Z","snapshot_observed_at":"2026-08-13T16:34:08.378180Z","submitted_at":"2024-12-13T17:59:52Z","title":"SCBench: A KV Cache-Centric Analysis of Long-Context Methods","version":2},"cited_work":{"arxiv_id":"2412.10319","doi":"10.48550/arxiv.2412.10319","metadata_source":"pith","pith_arxiv_id":"2412.10319","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"H.; Li, D.; Gao, J.; Yang, Y.; and Qiu, L","venue":"cs.CL","work_id":"846c0629-2f5a-462b-a768-28cf4efbb4ee","year":2024},"citing_paper":{"arxiv_id":"2604.25975","last_updated":"2026-08-10T08:59:48Z","snapshot_observed_at":"2026-08-13T23:39:00.094820Z","submitted_at":"2026-04-28T12:28:04Z","title":"Rethinking KV Cache Eviction via a Unified Information-Theoretic Objective","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-05-07T16:41:23.234607Z"},"links":{"cited_paper":"/paper/2412.10319","citing_paper":"/paper/2604.25975"},"observation_digest":"sha256:53c25adb19005d9930492c93efd433e487c744b70a45d83b2f6efba472a1f012","observation_id":"eb610b38-d85c-4f9d-b2ec-fe3f114e1d93","resolution":{"observed_at":"2026-05-09T01:54:34.022760Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10319","last_updated":"2025-03-11T14:02:04Z","snapshot_observed_at":"2026-08-13T16:34:08.378180Z","submitted_at":"2024-12-13T17:59:52Z","title":"SCBench: A KV Cache-Centric Analysis of Long-Context Methods","version":2},"cited_work":{"arxiv_id":"2412.10319","doi":"10.48550/arxiv.2412.10319","metadata_source":"pith","pith_arxiv_id":"2412.10319","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"H.; Li, D.; Gao, J.; Yang, Y.; and Qiu, L","venue":"cs.CL","work_id":"846c0629-2f5a-462b-a768-28cf4efbb4ee","year":2024},"citing_paper":{"arxiv_id":"2606.06302","last_updated":"2026-06-04T15:41:27Z","snapshot_observed_at":"2026-08-12T15:57:41.088886Z","submitted_at":"2026-06-04T15:41:27Z","title":"Tangram: Unlocking Non-Uniform KV Cache for Efficient Multi-turn LLM Serving","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-28T02:25:46.234576Z"},"links":{"cited_paper":"/paper/2412.10319","citing_paper":"/paper/2606.06302"},"observation_digest":"sha256:94d03d8ed80d70f6d0fb36e846c9ebeb48145be58a203141f4892c5068abc50e","observation_id":"a5420cf9-fe87-4123-bd0a-133290fc9353","resolution":{"observed_at":"2026-07-02T12:06:56.130137Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10319","last_updated":"2025-03-11T14:02:04Z","snapshot_observed_at":"2026-08-13T16:34:08.378180Z","submitted_at":"2024-12-13T17:59:52Z","title":"SCBench: A KV Cache-Centric Analysis of Long-Context Methods","version":2},"cited_work":{"arxiv_id":"2412.10319","doi":"10.48550/arxiv.2412.10319","metadata_source":"pith","pith_arxiv_id":"2412.10319","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"H.; Li, D.; Gao, J.; Yang, Y.; and Qiu, L","venue":"cs.CL","work_id":"846c0629-2f5a-462b-a768-28cf4efbb4ee","year":2024},"citing_paper":{"arxiv_id":"2606.09659","last_updated":"2026-06-08T15:43:16Z","snapshot_observed_at":"2026-08-12T15:15:53.592161Z","submitted_at":"2026-06-08T15:43:16Z","title":"End-to-End Context Compression at Scale","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-06-27T16:36:54.699174Z"},"links":{"cited_paper":"/paper/2412.10319","citing_paper":"/paper/2606.09659"},"observation_digest":"sha256:ddc06dd5f5ce20741935d498309dfd4137839f2a55fc6ce8a7219471ebefb454","observation_id":"5f1e4339-8f7e-41f6-b85b-7663bea7bd5b","resolution":{"observed_at":"2026-07-03T01:17:31.591780Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10319","last_updated":"2025-03-11T14:02:04Z","snapshot_observed_at":"2026-08-13T16:34:08.378180Z","submitted_at":"2024-12-13T17:59:52Z","title":"SCBench: A KV Cache-Centric Analysis of Long-Context Methods","version":2},"cited_work":{"arxiv_id":"2412.10319","doi":"10.48550/arxiv.2412.10319","metadata_source":"pith","pith_arxiv_id":"2412.10319","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"H.; Li, D.; Gao, J.; Yang, Y.; and Qiu, L","venue":"cs.CL","work_id":"846c0629-2f5a-462b-a768-28cf4efbb4ee","year":2024},"citing_paper":{"arxiv_id":"2607.08032","last_updated":"2026-07-09T01:15:03Z","snapshot_observed_at":"2026-08-15T04:39:02.467469Z","submitted_at":"2026-07-09T01:15:03Z","title":"What to Keep, What to Forget: A Rate--Distortion View of Memory Compaction in LLMs and Agents","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-07-10T01:26:59.421158Z"},"links":{"cited_paper":"/paper/2412.10319","citing_paper":"/paper/2607.08032"},"observation_digest":"sha256:8d99161ba53b477f80d36c3e9b5a247ed7b8269dd81f8b84029809101d946209","observation_id":"200ced63-88ec-4fe5-803b-61f3175d24dd","resolution":{"observed_at":"2026-07-10T01:36:44.018523Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10319","last_updated":"2025-03-11T14:02:04Z","snapshot_observed_at":"2026-08-13T16:34:08.378180Z","submitted_at":"2024-12-13T17:59:52Z","title":"SCBench: A KV Cache-Centric Analysis of Long-Context Methods","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10319","snapshot_observed_at":"2026-08-04T23:14:59.988064Z","title":"Abdi and Dongsheng Li and Jianfeng Gao and Yuqing Yang and Lili Qiu , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01676","last_updated":"2026-08-03T04:12:02Z","snapshot_observed_at":"2026-08-16T04:55:19.191723Z","submitted_at":"2026-08-03T04:12:02Z","title":"Understanding Sparse Attention Selectivity in Long-Context Foundation Models via Counterfactual Evaluation","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-04T23:14:59.988064Z"},"links":{"cited_paper":"/paper/2412.10319","citing_paper":"/paper/2608.01676"},"observation_digest":"sha256:11ff0293b28777a9e40405b7d07e9f427fcf6f37f4b801d3fa6c93dbfc7f4d64","observation_id":"e4281599-93db-4aae-92a1-5122263b59ed","resolution":{"observed_at":"2026-08-04T23:14:59.988064Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10319","last_updated":"2025-03-11T14:02:04Z","snapshot_observed_at":"2026-08-13T16:34:08.378180Z","submitted_at":"2024-12-13T17:59:52Z","title":"SCBench: A KV Cache-Centric Analysis of Long-Context Methods","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10319","snapshot_observed_at":"2026-08-04T13:43:50.964348Z","title":"arXiv preprint arXiv:2412.10319 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02150","last_updated":"2026-08-05T06:57:37Z","snapshot_observed_at":"2026-08-15T14:31:12.914781Z","submitted_at":"2026-08-03T12:34:31Z","title":"PhyCheck: Fine-Grained Evidence-Grounded Dataset for Physical Law Understanding in Video-LLMs","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-04T13:43:50.964348Z"},"links":{"cited_paper":"/paper/2412.10319","citing_paper":"/paper/2608.02150"},"observation_digest":"sha256:6d8fcd033b764b732fb92133e2c8ffa8af3ca3eeb48c80d4ab16cba379412c33","observation_id":"e9ba8123-f1c0-410d-9398-a20799742211","resolution":{"observed_at":"2026-08-04T13:43:50.964348Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10319","last_updated":"2025-03-11T14:02:04Z","snapshot_observed_at":"2026-08-13T16:34:08.378180Z","submitted_at":"2024-12-13T17:59:52Z","title":"SCBench: A KV Cache-Centric Analysis of Long-Context Methods","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10319","snapshot_observed_at":"2026-08-07T00:11:48.319572Z","title":"arXiv preprint arXiv:2412.10319 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02150","last_updated":"2026-08-05T06:57:37Z","snapshot_observed_at":"2026-08-15T14:31:12.914781Z","submitted_at":"2026-08-03T12:34:31Z","title":"PhyCheck: Fine-Grained Evidence-Grounded Dataset for Physical Law Understanding in Video-LLMs","version":3},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T00:11:48.319572Z"},"links":{"cited_paper":"/paper/2412.10319","citing_paper":"/paper/2608.02150"},"observation_digest":"sha256:7becfdfaeacdbe86f731cbcc13c29ec72e066049bf2938758ad2dc4a01f1ea2f","observation_id":"f0409599-70a5-44b9-9c7f-193024812f5b","resolution":{"observed_at":"2026-08-07T00:11:48.319572Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2412.10319/citation-record","integrity":"/paper/2412.10319/integrity","json":"/paper/2412.10319/citation-record.json","paper":"/paper/2412.10319"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2411.17116","last_updated":"2025-05-30T00:36:37Z","snapshot_observed_at":"2026-08-15T23:29:30.087978Z","submitted_at":"2024-11-26T05:10:04Z","title":"Star Attention: Efficient LLM Inference over Long Sequences","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.17116","snapshot_observed_at":"2026-08-11T16:14:05.493385Z","title":"Star attention: Efficient llm inference over long sequences","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.10319","last_updated":"2025-03-11T14:02:04Z","snapshot_observed_at":"2026-08-13T16:34:08.378180Z","submitted_at":"2024-12-13T17:59:52Z","title":"SCBench: A KV Cache-Centric Analysis of Long-Context Methods","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-11T16:14:05.493385Z"},"links":{"cited_paper":"/paper/2411.17116","citing_paper":"/paper/2412.10319"},"observation_digest":"sha256:29dd12feb700e6c7f5eef8b3431db06668fcbbd202a40bc966e4ee5cccfd0b5a","observation_id":"18bfbac8-1a26-4962-a053-34f6e6c8b3d8","resolution":{"observed_at":"2026-08-11T16:14:05.493385Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:14:05.503321Z","title":"Chan, Biao Zhang, Ankesh Anand, Zaheer Abbas, Azade Nova, John D Co-Reyes, Eric Chu, Feryal Behbahani, Aleksandra Faust, and Hugo Larochelle","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.10319","last_updated":"2025-03-11T14:02:04Z","snapshot_observed_at":"2026-08-13T16:34:08.378180Z","submitted_at":"2024-12-13T17:59:52Z","title":"SCBench: A KV Cache-Centric Analysis of Long-Context Methods","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-11T16:14:05.503321Z"},"links":{"citing_paper":"/paper/2412.10319"},"observation_digest":"sha256:b702b6a79b5637df90e89c1ffb6af71cd0d620fc01f105646c5bfc1bf90f8e27","observation_id":"fe095b35-d5b3-4ae7-9bb4-449b65ffcff4","resolution":{"observed_at":"2026-08-11T16:14:05.503321Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:14:05.508289Z","title":"GQA : Training generalized multi-query transformer models from multi-head checkpoints","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.10319","last_updated":"2025-03-11T14:02:04Z","snapshot_observed_at":"2026-08-13T16:34:08.378180Z","submitted_at":"2024-12-13T17:59:52Z","title":"SCBench: A KV Cache-Centric Analysis of Long-Context Methods","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-11T16:14:05.508289Z"},"links":{"citing_paper":"/paper/2412.10319"},"observation_digest":"sha256:b83ff064cc5b91890c5e8cccb7b2d0e5e034689fef3691f143b00b571c7e4789","observation_id":"f3d474b6-4284-4ba3-956c-71b50c3013e0","resolution":{"observed_at":"2026-08-11T16:14:05.508289Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05483","last_updated":"2024-07-07T19:55:09Z","snapshot_observed_at":"2026-08-16T13:36:22.859101Z","submitted_at":"2024-07-07T19:55:09Z","title":"Just read twice: closing the recall gap for recurrent language models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.05483","snapshot_observed_at":"2026-08-11T16:14:05.513213Z","title":"Just read twice: closing the recall gap for recurrent language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.10319","last_updated":"2025-03-11T14:02:04Z","snapshot_observed_at":"2026-08-13T16:34:08.378180Z","submitted_at":"2024-12-13T17:59:52Z","title":"SCBench: A KV Cache-Centric Analysis of Long-Context Methods","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-11T16:14:05.513213Z"},"links":{"cited_paper":"/paper/2407.05483","citing_paper":"/paper/2412.10319"},"observation_digest":"sha256:ab0891467a25ec6950fbd14bcec5b5c08b7124611f8c23b2783fb645f3a3326f","observation_id":"7e4e5e93-2df0-4c68-8909-a77e8e23a17c","resolution":{"observed_at":"2026-08-11T16:14:05.513213Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:14:05.525308Z","title":"Prompt caching","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.10319","last_updated":"2025-03-11T14:02:04Z","snapshot_observed_at":"2026-08-13T16:34:08.378180Z","submitted_at":"2024-12-13T17:59:52Z","title":"SCBench: A KV Cache-Centric Analysis of Long-Context Methods","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-11T16:14:05.525308Z"},"links":{"citing_paper":"/paper/2412.10319"},"observation_digest":"sha256:bff66e70b3f4e9bf637b16badfe96d565172dd3dc45bf5c1d39a42fc707a9137","observation_id":"778e19cc-45a0-4def-ae16-b81f1c555fad","resolution":{"observed_at":"2026-08-11T16:14:05.525308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:14:05.529601Z","title":"MT -bench-101: A fine-grained benchmark for evaluating large language models in multi-turn dialogues","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.10319","last_updated":"2025-03-11T14:02:04Z","snapshot_observed_at":"2026-08-13T16:34:08.378180Z","submitted_at":"2024-12-13T17:59:52Z","title":"SCBench: A KV Cache-Centric Analysis of Long-Context Methods","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-11T16:14:05.529601Z"},"links":{"citing_paper":"/paper/2412.10319"},"observation_digest":"sha256:85be678f4b9c4cea3d3b555c0aec85fc23868727d0857a54abb102bf513beac4","observation_id":"80301961-0e49-4895-b67b-ec1c15b0f668","resolution":{"observed_at":"2026-08-11T16:14:05.529601Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:14:05.534148Z","title":"L ong B ench: A bilingual, multitask benchmark for long context understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.10319","last_updated":"2025-03-11T14:02:04Z","snapshot_observed_at":"2026-08-13T16:34:08.378180Z","submitted_at":"2024-12-13T17:59:52Z","title":"SCBench: A KV Cache-Centric Analysis of Long-Context Methods","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-11T16:14:05.534148Z"},"links":{"citing_paper":"/paper/2412.10319"},"observation_digest":"sha256:bcc6fecb517ae6ce1c95f4828aaf013e776148a0c51d5cbf2ecb9280008f8509","observation_id":"2d8fde69-847a-4c0c-848e-abd4a8714e7a","resolution":{"observed_at":"2026-08-11T16:14:05.534148Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:14:05.538651Z","title":"Codeplan: Repository-level coding using llms and planning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.10319","last_updated":"2025-03-11T14:02:04Z","snapshot_observed_at":"2026-08-13T16:34:08.378180Z","submitted_at":"2024-12-13T17:59:52Z","title":"SCBench: A KV Cache-Centric Analysis of Long-Context Methods","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-11T16:14:05.538651Z"},"links":{"citing_paper":"/paper/2412.10319"},"observation_digest":"sha256:9701d6fc608141578788ed3e558860d37d58ea61edf85578ada3148b47716999","observation_id":"17b9cd6d-5fb8-4c25-84d3-7230803902e4","resolution":{"observed_at":"2026-08-11T16:14:05.538651Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2004.05150","last_updated":"2020-12-02T17:52:35Z","snapshot_observed_at":"2026-07-31T17:17:17.205582Z","submitted_at":"2020-04-10T17:54:09Z","title":"Longformer: The Long-Document Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.05150","snapshot_observed_at":"2026-08-11T16:14:05.545976Z","title":"Longformer: The long-document transformer","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2412.10319","last_updated":"2025-03-11T14:02:04Z","snapshot_observed_at":"2026-08-13T16:34:08.378180Z","submitted_at":"2024-12-13T17:59:52Z","title":"SCBench: A KV Cache-Centric Analysis of Long-Context Methods","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-11T16:14:05.545976Z"},"links":{"cited_paper":"/paper/2004.05150","citing_paper":"/paper/2412.10319"},"observation_digest":"sha256:448ecdf0a05a20bbc2da0e796ba4426c410ff5f738575f793e835a3cc36817be","observation_id":"aa38c05d-75a8-4446-a94f-03b638986935","resolution":{"observed_at":"2026-08-11T16:14:05.545976Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:14:05.552095Z","title":"Peek across: Improving multi-document modeling via cross-document question-answering","venue":null,"work_id":null,"year":1970},"citing_paper":{"arxiv_id":"2412.10319","last_updated":"2025-03-11T14:02:04Z","snapshot_observed_at":"2026-08-13T16:34:08.378180Z","submitted_at":"2024-12-13T17:59:52Z","title":"SCBench: A KV Cache-Centric Analysis of Long-Context Methods","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-11T16:14:05.552095Z"},"links":{"citing_paper":"/paper/2412.10319"},"observation_digest":"sha256:94f30965bfc5b188e7c6227574874cfce6632068456cba1f18b7305412a70752","observation_id":"0ed946b5-9a6f-4b91-99ed-b776ff242134","resolution":{"observed_at":"2026-08-11T16:14:05.552095Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02069","last_updated":"2025-05-15T17:18:12Z","snapshot_observed_at":"2026-08-13T04:39:30.300015Z","submitted_at":"2024-06-04T07:51:30Z","title":"PyramidKV: Dynamic KV Cache Compression based on Pyramidal Information Funneling","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02069","snapshot_observed_at":"2026-08-11T16:14:05.559074Z","title":"Pyramidkv: Dynamic kv cache compression based on pyramidal information funneling","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.10319","last_updated":"2025-03-11T14:02:04Z","snapshot_observed_at":"2026-08-13T16:34:08.378180Z","submitted_at":"2024-12-13T17:59:52Z","title":"SCBench: A KV Cache-Centric Analysis of Long-Context Methods","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-11T16:14:05.559074Z"},"links":{"cited_paper":"/paper/2406.02069","citing_paper":"/paper/2412.10319"},"observation_digest":"sha256:2ccba3a82067376334914ce81ace28654872fd1b0df54a602a4b5300ba83a8f8","observation_id":"73932485-a9cf-43e2-b151-a82d3efaa9b2","resolution":{"observed_at":"2026-08-11T16:14:05.559074Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:14:05.569975Z","title":"Magic PIG : LSH sampling for efficient LLM generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2412.10319","last_updated":"2025-03-11T14:02:04Z","snapshot_observed_at":"2026-08-13T16:34:08.378180Z","submitted_at":"2024-12-13T17:59:52Z","title":"SCBench: A KV Cache-Centric Analysis of Long-Context Methods","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-11T16:14:05.569975Z"},"links":{"citing_paper":"/paper/2412.10319"},"observation_digest":"sha256:c8d3e35a12c77360a6669b19903d4a57fd1af3a5c140628109a5cefe25981a0c","observation_id":"3c7b7770-b0a0-42dd-8a93-46b381e2c2c9","resolution":{"observed_at":"2026-08-11T16:14:05.569975Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.10509","last_updated":"2019-04-23T19:29:47Z","snapshot_observed_at":"2026-08-16T10:03:03.268538Z","submitted_at":"2019-04-23T19:29:47Z","title":"Generating Long Sequences with Sparse Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.10509","snapshot_observed_at":"2026-08-11T16:14:05.581212Z","title":"Generating long sequences with sparse transformers","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2412.10319","last_updated":"2025-03-11T14:02:04Z","snapshot_observed_at":"2026-08-13T16:34:08.378180Z","submitted_at":"2024-12-13T17:59:52Z","title":"SCBench: A KV Cache-Centric Analysis of Long-Context Methods","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-11T16:14:05.581212Z"},"links":{"cited_paper":"/paper/1904.10509","citing_paper":"/paper/2412.10319"},"observation_digest":"sha256:0681580532539694f7d080ade1e39b2b3e39054c9824d573ebdb9ac6050ad1e3","observation_id":"d706461c-637b-47df-aaff-cc0366b35892","resolution":{"observed_at":"2026-08-11T16:14:05.581212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:14:05.587485Z","title":"Prompt caching with claude","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.10319","last_updated":"2025-03-11T14:02:04Z","snapshot_observed_at":"2026-08-13T16:34:08.378180Z","submitted_at":"2024-12-13T17:59:52Z","title":"SCBench: A KV Cache-Centric Analysis of Long-Context Methods","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-11T16:14:05.587485Z"},"links":{"citing_paper":"/paper/2412.10319"},"observation_digest":"sha256:60f21ab623645485fece965619fe4a523bec9eceb82dfee89efc8077df377bf8","observation_id":"7bf95e5c-4ba6-4af8-a9e8-a30482e60893","resolution":{"observed_at":"2026-08-11T16:14:05.587485Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.15949","last_updated":"2024-06-21T11:44:17Z","snapshot_observed_at":"2026-08-16T13:58:10.395510Z","submitted_at":"2024-04-24T16:11:54Z","title":"CORM: Cache Optimization with Recent Message for Large Language Model Inference","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.15949","snapshot_observed_at":"2026-08-11T16:14:05.592172Z","title":"Sequence can secretly tell you what to discard","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.10319","last_updated":"2025-03-11T14:02:04Z","snapshot_observed_at":"2026-08-13T16:34:08.378180Z","submitted_at":"2024-12-13T17:59:52Z","title":"SCBench: A KV Cache-Centric Analysis of Long-Context Methods","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-11T16:14:05.592172Z"},"links":{"cited_paper":"/paper/2404.15949","citing_paper":"/paper/2412.10319"},"observation_digest":"sha256:9f766656449f90d730cfed7c924a0aee12703d9cdb9d610ddc7dded5c74e4740","observation_id":"10688121-8db5-442a-8783-bade2f68d766","resolution":{"observed_at":"2026-08-11T16:14:05.592172Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:14:05.597645Z","title":"Flashattention-2: Faster attention with better parallelism and work partitioning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.10319","last_updated":"2025-03-11T14:02:04Z","snapshot_observed_at":"2026-08-13T16:34:08.378180Z","submitted_at":"2024-12-13T17:59:52Z","title":"SCBench: A KV Cache-Centric Analysis of Long-Context Methods","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-11T16:14:05.597645Z"},"links":{"citing_paper":"/paper/2412.10319"},"observation_digest":"sha256:18a2d42d06217a3753d81790f3a7bd94f763d99803fe03b0cc6b13fad239da0c","observation_id":"40383359-a7e9-456b-8b68-d751478e04a3","resolution":{"observed_at":"2026-08-11T16:14:05.597645Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:14:05.602037Z","title":"Transformers are SSM s: Generalized models and efficient algorithms through structured state space duality","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.10319","last_updated":"2025-03-11T14:02:04Z","snapshot_observed_at":"2026-08-13T16:34:08.378180Z","submitted_at":"2024-12-13T17:59:52Z","title":"SCBench: A KV Cache-Centric Analysis of Long-Context Methods","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-11T16:14:05.602037Z"},"links":{"citing_paper":"/paper/2412.10319"},"observation_digest":"sha256:2f231fee8388088c07877f6527e4ca3325ce9def0b65e7a52c537461d3d026d3","observation_id":"177686b2-3b3b-456e-8163-95a03c989e42","resolution":{"observed_at":"2026-08-11T16:14:05.602037Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02690","last_updated":"2025-02-12T14:32:46Z","snapshot_observed_at":"2026-08-16T14:03:58.527377Z","submitted_at":"2024-04-03T12:37:34Z","title":"How Sparse Attention Approximates Exact Attention? Your Attention is Naturally $n^C$-Sparse","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02690","snapshot_observed_at":"2026-08-11T16:14:05.607282Z","title":"Attention is naturally sparse with gaussian distributed input","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.10319","last_updated":"2025-03-11T14:02:04Z","snapshot_observed_at":"2026-08-13T16:34:08.378180Z","submitted_at":"2024-12-13T17:59:52Z","title":"SCBench: A KV Cache-Centric Analysis of Long-Context Methods","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-11T16:14:05.607282Z"},"links":{"cited_paper":"/paper/2404.02690","citing_paper":"/paper/2412.10319"},"observation_digest":"sha256:8ff709af1d14c0ef8b31841ad4d7f5243b12e77e654579b8be470e3fa25c5f54","observation_id":"271fafd0-d81b-455e-a805-d2108fa7a407","resolution":{"observed_at":"2026-08-11T16:14:05.607282Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14468","last_updated":"2025-06-03T21:55:57Z","snapshot_observed_at":"2026-08-15T15:39:14.128434Z","submitted_at":"2024-12-19T02:34:15Z","title":"HashAttention: Semantic Sparsity for Faster Inference","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14468","snapshot_observed_at":"2026-08-11T16:14:05.613937Z","title":"Hashattention: Semantic sparsity for faster inference","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.10319","last_updated":"2025-03-11T14:02:04Z","snapshot_observed_at":"2026-08-13T16:34:08.378180Z","submitted_at":"2024-12-13T17:59:52Z","title":"SCBench: A KV Cache-Centric Analysis of Long-Context Methods","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-11T16:14:05.613937Z"},"links":{"cited_paper":"/paper/2412.14468","citing_paper":"/paper/2412.10319"},"observation_digest":"sha256:167495682f8bd5c2fb0161d7fe7e517c2775f0b67418877482e15982f1b697e0","observation_id":"ec997631-019a-481a-a033-8cbb04b67af7","resolution":{"observed_at":"2026-08-11T16:14:05.613937Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:14:05.619168Z","title":"Domeccleston/sharegpt: Easily share permanent links to chatgpt conversations with your friends","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.10319","last_updated":"2025-03-11T14:02:04Z","snapshot_observed_at":"2026-08-13T16:34:08.378180Z","submitted_at":"2024-12-13T17:59:52Z","title":"SCBench: A KV Cache-Centric Analysis of Long-Context Methods","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-11T16:14:05.619168Z"},"links":{"citing_paper":"/paper/2412.10319"},"observation_digest":"sha256:1c3db7525b44af8004c0ce912b40a2ed94ae93970756093a4e7ab73066a80f01","observation_id":"798bc6bc-32cf-45df-979d-45d6da57d34b","resolution":{"observed_at":"2026-08-11T16:14:05.619168Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-11T16:14:05.623861Z","title":"The llama 3 herd of models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.10319","last_updated":"2025-03-11T14:02:04Z","snapshot_observed_at":"2026-08-13T16:34:08.378180Z","submitted_at":"2024-12-13T17:59:52Z","title":"SCBench: A KV Cache-Centric Analysis of Long-Context Methods","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-11T16:14:05.623861Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2412.10319"},"observation_digest":"sha256:b52d010be40eae8c99ba512a4cb3ebc281e9339e25b46a6ba1eeb35a965eedda","observation_id":"08aea4bc-d5c9-464e-a316-4f81c94c17c1","resolution":{"observed_at":"2026-08-11T16:14:05.623861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:14:05.629895Z","title":"Finch, James D","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.10319","last_updated":"2025-03-11T14:02:04Z","snapshot_observed_at":"2026-08-13T16:34:08.378180Z","submitted_at":"2024-12-13T17:59:52Z","title":"SCBench: A KV Cache-Centric Analysis of Long-Context Methods","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-11T16:14:05.629895Z"},"links":{"citing_paper":"/paper/2412.10319"},"observation_digest":"sha256:18300af7a65b62475fd9887d45c890ba32df9666ab0c4fa1df5e4157cc757fed","observation_id":"26e6dfca-560a-45fb-a6fc-12cb7371dd4f","resolution":{"observed_at":"2026-08-11T16:14:05.629895Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:14:05.635486Z","title":"Moa: Mixture of sparse attention for automatic large language model compression","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.10319","last_updated":"2025-03-11T14:02:04Z","snapshot_observed_at":"2026-08-13T16:34:08.378180Z","submitted_at":"2024-12-13T17:59:52Z","title":"SCBench: A KV Cache-Centric Analysis of Long-Context Methods","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-11T16:14:05.635486Z"},"links":{"citing_paper":"/paper/2412.10319"},"observation_digest":"sha256:69604f0fe1629a0df1364db0c6b08d2ef571d0136af9aa982e710eb1f81aca70","observation_id":"d15a8e5f-af64-4ccf-9c5d-0fad4fefbf19","resolution":{"observed_at":"2026-08-11T16:14:05.635486Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08944","last_updated":"2024-05-14T20:17:22Z","snapshot_observed_at":"2026-08-16T13:52:41.078933Z","submitted_at":"2024-05-14T20:17:22Z","title":"Challenges in Deploying Long-Context Transformers: A Theoretical Peak Performance Analysis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.08944","snapshot_observed_at":"2026-08-11T16:14:05.640877Z","title":"Challenges in deploying long-context transformers: A theoretical peak performance analysis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.10319","last_updated":"2025-03-11T14:02:04Z","snapshot_observed_at":"2026-08-13T16:34:08.378180Z","submitted_at":"2024-12-13T17:59:52Z","title":"SCBench: A KV Cache-Centric Analysis of Long-Context Methods","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-11T16:14:05.640877Z"},"links":{"cited_paper":"/paper/2405.08944","citing_paper":"/paper/2412.10319"},"observation_digest":"sha256:8d5e2eafc5324f2be3a8352d8a2232464a3d968e65cb7026d481c7be06e812bb","observation_id":"f1c321da-c372-4aae-a834-93fbed9de7a6","resolution":{"observed_at":"2026-08-11T16:14:05.640877Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:14:05.647156Z","title":"Model tells you what to discard: Adaptive kv cache compression for llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.10319","last_updated":"2025-03-11T14:02:04Z","snapshot_observed_at":"2026-08-13T16:34:08.378180Z","submitted_at":"2024-12-13T17:59:52Z","title":"SCBench: A KV Cache-Centric Analysis of Long-Context Methods","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-11T16:14:05.647156Z"},"links":{"citing_paper":"/paper/2412.10319"},"observation_digest":"sha256:4dd147b3ae591450d61cfcebfded136f4c0d6e1069e1582499c420ae4abac32a","observation_id":"511a06ce-6c18-463f-930b-602a4d9d3434","resolution":{"observed_at":"2026-08-11T16:14:05.647156Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:14:05.652480Z","title":"Context caching","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.10319","last_updated":"2025-03-11T14:02:04Z","snapshot_observed_at":"2026-08-13T16:34:08.378180Z","submitted_at":"2024-12-13T17:59:52Z","title":"SCBench: A KV Cache-Centric Analysis of Long-Context Methods","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-11T16:14:05.652480Z"},"links":{"citing_paper":"/paper/2412.10319"},"observation_digest":"sha256:e0755b8fc714af901f5e60776154a582d98bd387a522944ecd011d6a86bce26b","observation_id":"d30ef9fe-2a14-4169-9ae6-8e330e7e30e3","resolution":{"observed_at":"2026-08-11T16:14:05.652480Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:14:05.657245Z","title":"Prompt cache: Modular attention reuse for low-latency inference","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.10319","last_updated":"2025-03-11T14:02:04Z","snapshot_observed_at":"2026-08-13T16:34:08.378180Z","submitted_at":"2024-12-13T17:59:52Z","title":"SCBench: A KV Cache-Centric Analysis of Long-Context Methods","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-11T16:14:05.657245Z"},"links":{"citing_paper":"/paper/2412.10319"},"observation_digest":"sha256:042474128e98d8c553e3bf1bd7dcff6a71313ed07a18d9d8e786dbe6b87e1698","observation_id":"1a7dda80-cd62-457f-ac49-5dd93d54be83","resolution":{"observed_at":"2026-08-11T16:14:05.657245Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12793","last_updated":"2024-07-30T03:58:11Z","snapshot_observed_at":"2026-08-14T09:56:00.692687Z","submitted_at":"2024-06-18T16:58:21Z","title":"ChatGLM: A Family of Large Language Models from GLM-130B to GLM-4 All Tools","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.12793","snapshot_observed_at":"2026-08-11T16:14:05.665083Z","title":"Chatglm: A family of large language models from glm-130b to glm-4 all tools","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.10319","last_updated":"2025-03-11T14:02:04Z","snapshot_observed_at":"2026-08-13T16:34:08.378180Z","submitted_at":"2024-12-13T17:59:52Z","title":"SCBench: A KV Cache-Centric Analysis of Long-Context Methods","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-11T16:14:05.665083Z"},"links":{"cited_paper":"/paper/2406.12793","citing_paper":"/paper/2412.10319"},"observation_digest":"sha256:4fb23fab1661666af756cec74b4a772829ad50f95a9b180e530e0f7d63c49b07","observation_id":"1c18c550-1c1e-4c77-9fb3-a4e1570cf463","resolution":{"observed_at":"2026-08-11T16:14:05.665083Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:14:05.672513Z","title":"Llama-3 8b instruct gradient 4194k (v0.1), 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.10319","last_updated":"2025-03-11T14:02:04Z","snapshot_observed_at":"2026-08-13T16:34:08.378180Z","submitted_at":"2024-12-13T17:59:52Z","title":"SCBench: A KV Cache-Centric Analysis of Long-Context Methods","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-11T16:14:05.672513Z"},"links":{"citing_paper":"/paper/2412.10319"},"observation_digest":"sha256:ff8bbefd9842df31620b7024e66eca39d2cb02d9344fcb2209afa68c8be5dd91","observation_id":"fdb52d04-7c0a-44a2-8ffb-3a156f50195b","resolution":{"observed_at":"2026-08-11T16:14:05.672513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:14:05.678164Z","title":"Mamba: Linear-time sequence modeling with selective state spaces","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.10319","last_updated":"2025-03-11T14:02:04Z","snapshot_observed_at":"2026-08-13T16:34:08.378180Z","submitted_at":"2024-12-13T17:59:52Z","title":"SCBench: A KV Cache-Centric Analysis of Long-Context Methods","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-11T16:14:05.678164Z"},"links":{"citing_paper":"/paper/2412.10319"},"observation_digest":"sha256:3a61b312a198ed13c42369c1449d7c7b96cdfe1e1ac70994bd6f0098156ee82e","observation_id":"988a1d49-9e67-410c-bc1b-fb2154793c53","resolution":{"observed_at":"2026-08-11T16:14:05.678164Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:14:05.683448Z","title":"Efficiently modeling long sequences with structured state spaces","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.10319","last_updated":"2025-03-11T14:02:04Z","snapshot_observed_at":"2026-08-13T16:34:08.378180Z","submitted_at":"2024-12-13T17:59:52Z","title":"SCBench: A KV Cache-Centric Analysis of Long-Context Methods","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-11T16:14:05.683448Z"},"links":{"citing_paper":"/paper/2412.10319"},"observation_digest":"sha256:dbb313d37fb0f933d0ab967a803fff7c41191d33a015c387deafc8bf7f10a7d6","observation_id":"2840c81b-80dc-4b34-87ca-5cc2f189b002","resolution":{"observed_at":"2026-08-11T16:14:05.683448Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:14:05.690698Z","title":"LM -infinite: Zero-shot extreme length generalization for large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.10319","last_updated":"2025-03-11T14:02:04Z","snapshot_observed_at":"2026-08-13T16:34:08.378180Z","submitted_at":"2024-12-13T17:59:52Z","title":"SCBench: A KV Cache-Centric Analysis of Long-Context Methods","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-11T16:14:05.690698Z"},"links":{"citing_paper":"/paper/2412.10319"},"observation_digest":"sha256:ff875ebc628710724ed937db16d1957fc0296d3ba00dd8b07f43048f9bc2461c","observation_id":"39ff0f01-ef68-4669-9e3f-bfa802775362","resolution":{"observed_at":"2026-08-11T16:14:05.690698Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.06713","last_updated":"2022-12-13T16:31:21Z","snapshot_observed_at":"2026-08-17T16:18:22.448116Z","submitted_at":"2022-12-13T16:31:21Z","title":"Structured Prompting: Scaling In-Context Learning to 1,000 Examples","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.06713","snapshot_observed_at":"2026-08-11T16:14:05.700159Z","title":"Structured prompting: Scaling in-context learning to 1,000 examples","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.10319","last_updated":"2025-03-11T14:02:04Z","snapshot_observed_at":"2026-08-13T16:34:08.378180Z","submitted_at":"2024-12-13T17:59:52Z","title":"SCBench: A KV Cache-Centric Analysis of Long-Context Methods","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-11T16:14:05.700159Z"},"links":{"cited_paper":"/paper/2212.06713","citing_paper":"/paper/2412.10319"},"observation_digest":"sha256:dc87643f4d3dda253e3aa2cc4b14ac84bc927565cfa01e50f8e174bc8d34d279","observation_id":"25bf92da-2bfa-4482-b0fe-fd924d4b3a86","resolution":{"observed_at":"2026-08-11T16:14:05.700159Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:14:05.720243Z","title":"Liquid structural state-space models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.10319","last_updated":"2025-03-11T14:02:04Z","snapshot_observed_at":"2026-08-13T16:34:08.378180Z","submitted_at":"2024-12-13T17:59:52Z","title":"SCBench: A KV Cache-Centric Analysis of Long-Context Methods","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-11T16:14:05.720243Z"},"links":{"citing_paper":"/paper/2412.10319"},"observation_digest":"sha256:1523b2265787a6de045b9f34ad7db1c2142789c162708ca54eeea2d1362e8d99","observation_id":"25410f7b-8665-4a5a-b8cb-112703d47632","resolution":{"observed_at":"2026-08-11T16:14:05.720243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:14:05.735108Z","title":"Block transformer: Global-to-local language modeling for fast inference","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.10319","last_updated":"2025-03-11T14:02:04Z","snapshot_observed_at":"2026-08-13T16:34:08.378180Z","submitted_at":"2024-12-13T17:59:52Z","title":"SCBench: A KV Cache-Centric Analysis of Long-Context Methods","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-11T16:14:05.735108Z"},"links":{"citing_paper":"/paper/2412.10319"},"observation_digest":"sha256:8a9bec27c5d8be615c779ef85d0d5d98d4cb7b790a55f450b83358915df2584e","observation_id":"42757b06-926f-4a90-8808-b624a3571c08","resolution":{"observed_at":"2026-08-11T16:14:05.735108Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:14:05.745921Z","title":"Squeezed attention: Accelerating long context length llm inference","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.10319","last_updated":"2025-03-11T14:02:04Z","snapshot_observed_at":"2026-08-13T16:34:08.378180Z","submitted_at":"2024-12-13T17:59:52Z","title":"SCBench: A KV Cache-Centric Analysis of Long-Context Methods","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-11T16:14:05.745921Z"},"links":{"citing_paper":"/paper/2412.10319"},"observation_digest":"sha256:46f50b6e51cf71fab7fffe974af7d36a8af69c3a15339fdd2a8436ca56506636","observation_id":"23d9cb6d-f612-4719-b520-b8d8907a0ddc","resolution":{"observed_at":"2026-08-11T16:14:05.745921Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:14:05.753247Z","title":"RULER : What s the real context size of your long-context language models? In First Conference on Language Modeling, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.10319","last_updated":"2025-03-11T14:02:04Z","snapshot_observed_at":"2026-08-13T16:34:08.378180Z","submitted_at":"2024-12-13T17:59:52Z","title":"SCBench: A KV Cache-Centric Analysis of Long-Context Methods","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-11T16:14:05.753247Z"},"links":{"citing_paper":"/paper/2412.10319"},"observation_digest":"sha256:8ac876aa24576926700a84012e5dd43e67b553d726d913f1472171af75f949a2","observation_id":"b651caa1-ee07-4f2a-9acd-2c460a63bf33","resolution":{"observed_at":"2026-08-11T16:14:05.753247Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:14:05.759270Z","title":"Kakade, and eran malach","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.10319","last_updated":"2025-03-11T14:02:04Z","snapshot_observed_at":"2026-08-13T16:34:08.378180Z","submitted_at":"2024-12-13T17:59:52Z","title":"SCBench: A KV Cache-Centric Analysis of Long-Context Methods","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-11T16:14:05.759270Z"},"links":{"citing_paper":"/paper/2412.10319"},"observation_digest":"sha256:6130c9d146577cc42ebb5a71de9407da02521ad21c0cdc5672d8b492e1ad5e36","observation_id":"b41d645b-fac8-422c-a97e-7963cec17c38","resolution":{"observed_at":"2026-08-11T16:14:05.759270Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:14:05.766023Z","title":"LLML ingua: Compressing prompts for accelerated inference of large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.10319","last_updated":"2025-03-11T14:02:04Z","snapshot_observed_at":"2026-08-13T16:34:08.378180Z","submitted_at":"2024-12-13T17:59:52Z","title":"SCBench: A KV Cache-Centric Analysis of Long-Context Methods","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-11T16:14:05.766023Z"},"links":{"citing_paper":"/paper/2412.10319"},"observation_digest":"sha256:0c67afe0d7714a356225e19e08ef0bcadbdaf299c4cbcf7817b07036c8633ea7","observation_id":"9cef39e2-c13b-4ca8-81e8-75edb810893e","resolution":{"observed_at":"2026-08-11T16:14:05.766023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:14:05.783041Z","title":"Abdi, Dongsheng Li, Chin-Yew Lin, Yuqing Yang, and Lili Qiu","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.10319","last_updated":"2025-03-11T14:02:04Z","snapshot_observed_at":"2026-08-13T16:34:08.378180Z","submitted_at":"2024-12-13T17:59:52Z","title":"SCBench: A KV Cache-Centric Analysis of Long-Context Methods","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-11T16:14:05.783041Z"},"links":{"citing_paper":"/paper/2412.10319"},"observation_digest":"sha256:0decbae9dc5e60dfe9d6a859942968bfb7f5115a27572e070b579546aec7d4b8","observation_id":"8bb5c15d-81cb-48e1-91d0-6474f38e97f7","resolution":{"observed_at":"2026-08-11T16:14:05.783041Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:14:05.792099Z","title":"SWE -bench: Can language models resolve real-world github issues? In The Twelfth International Conference on Learning Representations, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.10319","last_updated":"2025-03-11T14:02:04Z","snapshot_observed_at":"2026-08-13T16:34:08.378180Z","submitted_at":"2024-12-13T17:59:52Z","title":"SCBench: A KV Cache-Centric Analysis of Long-Context Methods","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-11T16:14:05.792099Z"},"links":{"citing_paper":"/paper/2412.10319"},"observation_digest":"sha256:dbbde4f4b3ef3f9c0fedf3ff9f5f271372578a0fbd6292758c72f723691561cf","observation_id":"8d3ddb03-18bc-483b-b4e9-cfdf9b52352b","resolution":{"observed_at":"2026-08-11T16:14:05.792099Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12457","last_updated":"2024-04-25T06:47:57Z","snapshot_observed_at":"2026-08-16T13:59:39.031764Z","submitted_at":"2024-04-18T18:32:30Z","title":"RAGCache: Efficient Knowledge Caching for Retrieval-Augmented Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.12457","snapshot_observed_at":"2026-08-11T16:14:05.801823Z","title":"Ragcache: Efficient knowledge caching for retrieval-augmented generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.10319","last_updated":"2025-03-11T14:02:04Z","snapshot_observed_at":"2026-08-13T16:34:08.378180Z","submitted_at":"2024-12-13T17:59:52Z","title":"SCBench: A KV Cache-Centric Analysis of Long-Context Methods","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-11T16:14:05.801823Z"},"links":{"cited_paper":"/paper/2404.12457","citing_paper":"/paper/2412.10319"},"observation_digest":"sha256:1f1b9ebf50247bfa5cd443a68d973d27b0c48baeb9f2bb6ced97020a8fdab8e9","observation_id":"d56d8df0-3248-4452-b84f-35c3115b04bd","resolution":{"observed_at":"2026-08-11T16:14:05.801823Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.05099","last_updated":"2024-05-13T08:49:44Z","snapshot_observed_at":"2026-08-16T14:20:29.685940Z","submitted_at":"2024-02-07T18:53:01Z","title":"Hydragen: High-Throughput LLM Inference with Shared Prefixes","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.05099","snapshot_observed_at":"2026-08-11T16:14:05.806863Z","title":"Hydragen: High-throughput llm inference with shared prefixes","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.10319","last_updated":"2025-03-11T14:02:04Z","snapshot_observed_at":"2026-08-13T16:34:08.378180Z","submitted_at":"2024-12-13T17:59:52Z","title":"SCBench: A KV Cache-Centric Analysis of Long-Context Methods","version":2},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-11T16:14:05.806863Z"},"links":{"cited_paper":"/paper/2402.05099","citing_paper":"/paper/2412.10319"},"observation_digest":"sha256:896028029b68bd72484b6263f81d9899435f096e46826a39aa2f4ab228412f9a","observation_id":"c69b9e64-bd9a-49ad-892b-78695d0c61ba","resolution":{"observed_at":"2026-08-11T16:14:05.806863Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:14:05.815247Z","title":"Needle in a haystack - pressure testing llms, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.10319","last_updated":"2025-03-11T14:02:04Z","snapshot_observed_at":"2026-08-13T16:34:08.378180Z","submitted_at":"2024-12-13T17:59:52Z","title":"SCBench: A KV Cache-Centric Analysis of Long-Context Methods","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-11T16:14:05.815247Z"},"links":{"citing_paper":"/paper/2412.10319"},"observation_digest":"sha256:75231b9ebd5333131259c3992744fbd455ee6b7bb5926f85bed45a311a106754","observation_id":"4c4f7554-03f9-4849-a93e-f6ca12eb31bb","resolution":{"observed_at":"2026-08-11T16:14:05.815247Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:14:05.825768Z","title":"MT -eval: A multi-turn capabilities evaluation benchmark for large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.10319","last_updated":"2025-03-11T14:02:04Z","snapshot_observed_at":"2026-08-13T16:34:08.378180Z","submitted_at":"2024-12-13T17:59:52Z","title":"SCBench: A KV Cache-Centric Analysis of Long-Context Methods","version":2},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-11T16:14:05.825768Z"},"links":{"citing_paper":"/paper/2412.10319"},"observation_digest":"sha256:47784cb61c819f384c7c0710792667b8000ead19529aae26f1b904ac3cb0d804","observation_id":"9d8f3ddb-240e-4c67-87e2-8732c273e502","resolution":{"observed_at":"2026-08-11T16:14:05.825768Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:14:05.844002Z","title":"Flexprefill: A context-aware sparse attention mechanism for efficient long-sequence inference","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2412.10319","last_updated":"2025-03-11T14:02:04Z","snapshot_observed_at":"2026-08-13T16:34:08.378180Z","submitted_at":"2024-12-13T17:59:52Z","title":"SCBench: A KV Cache-Centric Analysis of Long-Context Methods","version":2},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-11T16:14:05.844002Z"},"links":{"citing_paper":"/paper/2412.10319"},"observation_digest":"sha256:aae159852278548551787090355d30aed16774755c37b2e7b7d71217b8760fae","observation_id":"b17a2e77-4efd-492c-b86d-abc664291541","resolution":{"observed_at":"2026-08-11T16:14:05.844002Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:14:05.849167Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.10319","last_updated":"2025-03-11T14:02:04Z","snapshot_observed_at":"2026-08-13T16:34:08.378180Z","submitted_at":"2024-12-13T17:59:52Z","title":"SCBench: A KV Cache-Centric Analysis of Long-Context Methods","version":2},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-11T16:14:05.849167Z"},"links":{"citing_paper":"/paper/2412.10319"},"observation_digest":"sha256:e6d4452e9a746078c560dfed32fcb730f4ec150ead3fc4ba89289c0962addf48","observation_id":"91252970-082f-436a-b988-b8afdb9de1d0","resolution":{"observed_at":"2026-08-11T16:14:05.849167Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02060","last_updated":"2024-06-12T02:46:16Z","snapshot_observed_at":"2026-08-16T14:04:15.185911Z","submitted_at":"2024-04-02T15:59:11Z","title":"Long-context LLMs Struggle with Long In-context Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02060","snapshot_observed_at":"2026-08-11T16:14:05.857578Z","title":"Long-context llms struggle with long in-context learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.10319","last_updated":"2025-03-11T14:02:04Z","snapshot_observed_at":"2026-08-13T16:34:08.378180Z","submitted_at":"2024-12-13T17:59:52Z","title":"SCBench: A KV Cache-Centric Analysis of Long-Context Methods","version":2},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-11T16:14:05.857578Z"},"links":{"cited_paper":"/paper/2404.02060","citing_paper":"/paper/2412.10319"},"observation_digest":"sha256:a6a9d0a21cddfc6a3261be59fbd3f1fdcb11cf70a18d459ef8a265d719a43583","observation_id":"22c5b984-f9f3-48c7-94db-7e96b6bac95e","resolution":{"observed_at":"2026-08-11T16:14:05.857578Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:14:05.863375Z","title":"Alpacaeval: An automatic evaluator of instruction-following models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.10319","last_updated":"2025-03-11T14:02:04Z","snapshot_observed_at":"2026-08-13T16:34:08.378180Z","submitted_at":"2024-12-13T17:59:52Z","title":"SCBench: A KV Cache-Centric Analysis of Long-Context Methods","version":2},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-11T16:14:05.863375Z"},"links":{"citing_paper":"/paper/2412.10319"},"observation_digest":"sha256:bb02bb0c0dffeed74910ecea32f74abe1cd242df86047c98221f7ba6ef42fa44","observation_id":"1e06a6e8-1e1f-48d2-9422-5b606cd61a2f","resolution":{"observed_at":"2026-08-11T16:14:05.863375Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:14:05.869749Z","title":"Compressing context to enhance inference efficiency of large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.10319","last_updated":"2025-03-11T14:02:04Z","snapshot_observed_at":"2026-08-13T16:34:08.378180Z","submitted_at":"2024-12-13T17:59:52Z","title":"SCBench: A KV Cache-Centric Analysis of Long-Context Methods","version":2},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-11T16:14:05.869749Z"},"links":{"citing_paper":"/paper/2412.10319"},"observation_digest":"sha256:abb2042dfb91b4550bada0e16430e4591404856d6021766e0465667c76698f79","observation_id":"d02dc9c8-06c0-4244-9eb8-390e0182d5dd","resolution":{"observed_at":"2026-08-11T16:14:05.869749Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:14:05.874814Z","title":"Snap KV : LLM knows what you are looking for before generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.10319","last_updated":"2025-03-11T14:02:04Z","snapshot_observed_at":"2026-08-13T16:34:08.378180Z","submitted_at":"2024-12-13T17:59:52Z","title":"SCBench: A KV Cache-Centric Analysis of Long-Context Methods","version":2},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-11T16:14:05.874814Z"},"links":{"citing_paper":"/paper/2412.10319"},"observation_digest":"sha256:6c83ea943a8a6b653aa2d00b8e579e2e21be949a66d971fa846f3223d3b3bd8c","observation_id":"6a8e5304-f31f-400a-99ea-92ac8fbcce98","resolution":{"observed_at":"2026-08-11T16:14:05.874814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.19887","last_updated":"2024-07-03T14:30:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-28T23:55:06Z","title":"Jamba: A Hybrid Transformer-Mamba Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.19887","snapshot_observed_at":"2026-08-11T16:14:05.881945Z","title":"Jamba: A hybrid transformer-mamba language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.10319","last_updated":"2025-03-11T14:02:04Z","snapshot_observed_at":"2026-08-13T16:34:08.378180Z","submitted_at":"2024-12-13T17:59:52Z","title":"SCBench: A KV Cache-Centric Analysis of Long-Context Methods","version":2},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-11T16:14:05.881945Z"},"links":{"cited_paper":"/paper/2403.19887","citing_paper":"/paper/2412.10319"},"observation_digest":"sha256:e40d84489dcee2e6ecda2cca72898c797cfeef10ff507d3c11f713968232f38c","observation_id":"658faf26-dac0-465a-b45c-4a31b19df96a","resolution":{"observed_at":"2026-08-11T16:14:05.881945Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04434","snapshot_observed_at":"2026-08-11T16:14:05.889712Z","title":"Deepseek-v2: A strong, economical, and efficient mixture-of-experts language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.10319","last_updated":"2025-03-11T14:02:04Z","snapshot_observed_at":"2026-08-13T16:34:08.378180Z","submitted_at":"2024-12-13T17:59:52Z","title":"SCBench: A KV Cache-Centric Analysis of Long-Context Methods","version":2},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-11T16:14:05.889712Z"},"links":{"cited_paper":"/paper/2405.04434","citing_paper":"/paper/2412.10319"},"observation_digest":"sha256:5b1c647cc733a4f4442927a781607196972b8d23424c32f9175c0188a7d2854b","observation_id":"c225df22-e0e7-48de-b586-3e2de20edeba","resolution":{"observed_at":"2026-08-11T16:14:05.889712Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.10516","last_updated":"2024-12-31T07:11:00Z","snapshot_observed_at":"2026-08-17T15:34:12.654681Z","submitted_at":"2024-09-16T17:59:52Z","title":"RetrievalAttention: Accelerating Long-Context LLM Inference via Vector Retrieval","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.10516","snapshot_observed_at":"2026-08-11T16:14:05.896609Z","title":"Retrievalattention: Accelerating long-context llm inference via vector retrieval","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.10319","last_updated":"2025-03-11T14:02:04Z","snapshot_observed_at":"2026-08-13T16:34:08.378180Z","submitted_at":"2024-12-13T17:59:52Z","title":"SCBench: A KV Cache-Centric Analysis of Long-Context Methods","version":2},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-11T16:14:05.896609Z"},"links":{"cited_paper":"/paper/2409.10516","citing_paper":"/paper/2412.10319"},"observation_digest":"sha256:bdbb3e441712641e46ba9f1d90df3b42f37ae57743e53831dfb797a94d0d6cb1","observation_id":"527ca086-9439-4b0c-a600-1840b4307bc6","resolution":{"observed_at":"2026-08-11T16:14:05.896609Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06025","last_updated":"2024-06-10T05:15:30Z","snapshot_observed_at":"2026-08-16T13:44:40.596735Z","submitted_at":"2024-06-10T05:15:30Z","title":"RepoQA: Evaluating Long Context Code Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.06025","snapshot_observed_at":"2026-08-11T16:14:05.900988Z","title":"Repoqa: Evaluating long context code understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.10319","last_updated":"2025-03-11T14:02:04Z","snapshot_observed_at":"2026-08-13T16:34:08.378180Z","submitted_at":"2024-12-13T17:59:52Z","title":"SCBench: A KV Cache-Centric Analysis of Long-Context Methods","version":2},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-11T16:14:05.900988Z"},"links":{"cited_paper":"/paper/2406.06025","citing_paper":"/paper/2412.10319"},"observation_digest":"sha256:af95af42e14e1926bb1bb9f4e7cca05e26ad36a71ff844682776a7c9821a55f6","observation_id":"b80d5d13-cd3d-472b-90b4-69eccce7945f","resolution":{"observed_at":"2026-08-11T16:14:05.900988Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:14:05.908218Z","title":"Liu, Kevin Lin, John Hewitt, Ashwin Paranjape, Michele Bevilacqua, Fabio Petroni, and Percy Liang","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.10319","last_updated":"2025-03-11T14:02:04Z","snapshot_observed_at":"2026-08-13T16:34:08.378180Z","submitted_at":"2024-12-13T17:59:52Z","title":"SCBench: A KV Cache-Centric Analysis of Long-Context Methods","version":2},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-11T16:14:05.908218Z"},"links":{"citing_paper":"/paper/2412.10319"},"observation_digest":"sha256:7ba27c4bfbca3847ba7915164a2c468a93af1e39f82a784ec53461b5efd8d10b","observation_id":"528e4dd8-7aea-4814-8304-7e4008d8eec8","resolution":{"observed_at":"2026-08-11T16:14:05.908218Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:14:05.915658Z","title":"Scissorhands: Exploiting the persistence of importance hypothesis for LLM KV cache compression at test time","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.10319","last_updated":"2025-03-11T14:02:04Z","snapshot_observed_at":"2026-08-13T16:34:08.378180Z","submitted_at":"2024-12-13T17:59:52Z","title":"SCBench: A KV Cache-Centric Analysis of Long-Context Methods","version":2},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-11T16:14:05.915658Z"},"links":{"citing_paper":"/paper/2412.10319"},"observation_digest":"sha256:0cad05ba94d5f8e844077a94bf381ff6b62f6f2d9e4562a8007d47b6e600be6d","observation_id":"f85d36f6-f265-4014-8850-9183cf7a44dc","resolution":{"observed_at":"2026-08-11T16:14:05.915658Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:14:05.925832Z","title":"KIVI : A tuning-free asymmetric 2bit quantization for KV cache","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.10319","last_updated":"2025-03-11T14:02:04Z","snapshot_observed_at":"2026-08-13T16:34:08.378180Z","submitted_at":"2024-12-13T17:59:52Z","title":"SCBench: A KV Cache-Centric Analysis of Long-Context Methods","version":2},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-11T16:14:05.925832Z"},"links":{"citing_paper":"/paper/2412.10319"},"observation_digest":"sha256:9986e8d080838bb8f343828b805998fde5eed1d3e2f5ebbf49858c5988414bc2","observation_id":"889c9ea3-8860-4e6d-9b37-0aba53f14722","resolution":{"observed_at":"2026-08-11T16:14:05.925832Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13189","last_updated":"2025-02-18T14:06:05Z","snapshot_observed_at":"2026-08-12T19:30:23.025771Z","submitted_at":"2025-02-18T14:06:05Z","title":"MoBA: Mixture of Block Attention for Long-Context LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13189","snapshot_observed_at":"2026-08-11T16:14:05.931089Z","title":"Moba: Mixture of block attention for long-context llms","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2412.10319","last_updated":"2025-03-11T14:02:04Z","snapshot_observed_at":"2026-08-13T16:34:08.378180Z","submitted_at":"2024-12-13T17:59:52Z","title":"SCBench: A KV Cache-Centric Analysis of Long-Context Methods","version":2},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-11T16:14:05.931089Z"},"links":{"cited_paper":"/paper/2502.13189","citing_paper":"/paper/2412.10319"},"observation_digest":"sha256:514eb0670074f19d53df5a313fa05b7456df8f8cb65f853362a6648580daaab5","observation_id":"198d9c45-aebe-4cf7-94b8-19a502c710ed","resolution":{"observed_at":"2026-08-11T16:14:05.931089Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07143","last_updated":"2024-08-09T22:37:25Z","snapshot_observed_at":"2026-08-17T19:41:15.885170Z","submitted_at":"2024-04-10T16:18:42Z","title":"Leave No Context Behind: Efficient Infinite Context Transformers with Infini-attention","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.07143","snapshot_observed_at":"2026-08-11T16:14:05.937098Z","title":"Leave no context behind: Efficient infinite context transformers with infini-attention","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.10319","last_updated":"2025-03-11T14:02:04Z","snapshot_observed_at":"2026-08-13T16:34:08.378180Z","submitted_at":"2024-12-13T17:59:52Z","title":"SCBench: A KV Cache-Centric Analysis of Long-Context Methods","version":2},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-11T16:14:05.937098Z"},"links":{"cited_paper":"/paper/2404.07143","citing_paper":"/paper/2412.10319"},"observation_digest":"sha256:116c5aed8f72124d77ae518c5e57841699bd5803737489b9c1488ecbf39f7f4c","observation_id":"e1793aa7-df82-4c94-bfbb-173c9766c5d5","resolution":{"observed_at":"2026-08-11T16:14:05.937098Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:14:08.805593Z","title":"Dynamic memory compression: Retrofitting LLM s for accelerated inference","venue":null,"work_id":"bec56df2-e87b-4fa9-b61c-249e1e02b87f","year":2024},"citing_paper":{"arxiv_id":"2412.10319","last_updated":"2025-03-11T14:02:04Z","snapshot_observed_at":"2026-08-13T16:34:08.378180Z","submitted_at":"2024-12-13T17:59:52Z","title":"SCBench: A KV Cache-Centric Analysis of Long-Context Methods","version":2},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-11T16:14:05.941952Z"},"links":{"citing_paper":"/paper/2412.10319"},"observation_digest":"sha256:0b828be23e1986e73137d471b8bcc520267a656f26399505bfe0a4c757387a54","observation_id":"9c22a376-d722-4ce0-a32e-563170ac771f","resolution":{"observed_at":"2026-08-11T16:14:08.817249Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.11895","last_updated":"2022-09-24T00:43:19Z","snapshot_observed_at":"2026-08-15T09:43:59.961298Z","submitted_at":"2022-09-24T00:43:19Z","title":"In-context Learning and Induction Heads","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.11895","snapshot_observed_at":"2026-08-11T16:14:05.947431Z","title":"In-context learning and induction heads","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.10319","last_updated":"2025-03-11T14:02:04Z","snapshot_observed_at":"2026-08-13T16:34:08.378180Z","submitted_at":"2024-12-13T17:59:52Z","title":"SCBench: A KV Cache-Centric Analysis of Long-Context Methods","version":2},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-11T16:14:05.947431Z"},"links":{"cited_paper":"/paper/2209.11895","citing_paper":"/paper/2412.10319"},"observation_digest":"sha256:8175f10ab7d3dcb1ebad564ad79a6357b7262e2b3c1bca242d6458ab247bf107","observation_id":"2deae104-22b9-4784-98a1-a821e77acbf0","resolution":{"observed_at":"2026-08-11T16:14:05.947431Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:14:05.955388Z","title":"Learning to reason with llms, 2024 a","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.10319","last_updated":"2025-03-11T14:02:04Z","snapshot_observed_at":"2026-08-13T16:34:08.378180Z","submitted_at":"2024-12-13T17:59:52Z","title":"SCBench: A KV Cache-Centric Analysis of Long-Context Methods","version":2},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-11T16:14:05.955388Z"},"links":{"citing_paper":"/paper/2412.10319"},"observation_digest":"sha256:0f1d4f44a7381f1568b490386f8d56d1cc954dff1c1e63cb9b4c87d68dbd2d76","observation_id":"17ac8824-9b32-44bc-9055-29430d43b639","resolution":{"observed_at":"2026-08-11T16:14:05.955388Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:14:08.762746Z","title":"Prompt caching in the api","venue":null,"work_id":"59b9f9b0-c9b3-4ef5-ba9b-e40e0e8a464e","year":2024},"citing_paper":{"arxiv_id":"2412.10319","last_updated":"2025-03-11T14:02:04Z","snapshot_observed_at":"2026-08-13T16:34:08.378180Z","submitted_at":"2024-12-13T17:59:52Z","title":"SCBench: A KV Cache-Centric Analysis of Long-Context Methods","version":2},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-11T16:14:05.964250Z"},"links":{"citing_paper":"/paper/2412.10319"},"observation_digest":"sha256:e90e0550788f5682d3dc3aa992545db40687de7712feb4805fd9cceff394fa3a","observation_id":"2969f56b-40b0-46e9-ba54-2f456969c045","resolution":{"observed_at":"2026-08-11T16:14:08.768455Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:14:05.971476Z","title":"Vicky Zhao, Lili Qiu, and Dongmei Zhang","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.10319","last_updated":"2025-03-11T14:02:04Z","snapshot_observed_at":"2026-08-13T16:34:08.378180Z","submitted_at":"2024-12-13T17:59:52Z","title":"SCBench: A KV Cache-Centric Analysis of Long-Context Methods","version":2},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-11T16:14:05.971476Z"},"links":{"citing_paper":"/paper/2412.10319"},"observation_digest":"sha256:b63e525c920359baf53a12bfdf51e7d820ee54ebbacb3456f00dd06e4368de97","observation_id":"440829c8-ba64-465d-80c8-b0e52d2a7e6c","resolution":{"observed_at":"2026-08-11T16:14:05.971476Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:14:08.721552Z","title":"O'Brien, Carrie J","venue":null,"work_id":"793095ea-f87a-4bc3-946d-77d8610b8715","year":2023},"citing_paper":{"arxiv_id":"2412.10319","last_updated":"2025-03-11T14:02:04Z","snapshot_observed_at":"2026-08-13T16:34:08.378180Z","submitted_at":"2024-12-13T17:59:52Z","title":"SCBench: A KV Cache-Centric Analysis of Long-Context Methods","version":2},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-11T16:14:05.979232Z"},"links":{"citing_paper":"/paper/2412.10319"},"observation_digest":"sha256:e6e00a4df5a6dbc47054c4b7376cb31710f3682644e0005c8f0f0f0fcb01c023","observation_id":"b4462b04-5a87-40b8-9c9f-3f69d08ad7f7","resolution":{"observed_at":"2026-08-11T16:14:08.726914Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:14:08.696093Z","title":"Wind, Stanis aw Wo \\'z niak, Zhenyuan Zhang, Qinghua Zhou, Jian Zhu, and Rui-Jie Zhu","venue":null,"work_id":"b570ab50-9393-4acb-9796-0911dcddbb29","year":2023},"citing_paper":{"arxiv_id":"2412.10319","last_updated":"2025-03-11T14:02:04Z","snapshot_observed_at":"2026-08-13T16:34:08.378180Z","submitted_at":"2024-12-13T17:59:52Z","title":"SCBench: A KV Cache-Centric Analysis of Long-Context Methods","version":2},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-11T16:14:05.984994Z"},"links":{"citing_paper":"/paper/2412.10319"},"observation_digest":"sha256:65dce18e97b98a4de95062e456fe072a59cc3c1841b7f9ff8e45a84c624ade5b","observation_id":"8943bcd6-a291-471e-9472-6c713bc89683","resolution":{"observed_at":"2026-08-11T16:14:08.705590Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:14:08.572500Z","title":"Mooncake: Trading more storage for less computation a KVCache-centric architecture for serving LLM chatbot","venue":null,"work_id":"4154973d-f266-4ab4-85ac-e4960cb97882","year":2025},"citing_paper":{"arxiv_id":"2412.10319","last_updated":"2025-03-11T14:02:04Z","snapshot_observed_at":"2026-08-13T16:34:08.378180Z","submitted_at":"2024-12-13T17:59:52Z","title":"SCBench: A KV Cache-Centric Analysis of Long-Context Methods","version":2},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-11T16:14:05.992398Z"},"links":{"citing_paper":"/paper/2412.10319"},"observation_digest":"sha256:1a0e25407f5557a445bb8b04b107a66f8dfe991b296fbeddb4c5bf9b60828905","observation_id":"f24dec16-aa6e-42a6-a9aa-ed107cb8f74e","resolution":{"observed_at":"2026-08-11T16:14:08.619077Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-08-14T18:15:53.516440Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-11T16:14:05.996739Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.10319","last_updated":"2025-03-11T14:02:04Z","snapshot_observed_at":"2026-08-13T16:34:08.378180Z","submitted_at":"2024-12-13T17:59:52Z","title":"SCBench: A KV Cache-Centric Analysis of Long-Context Methods","version":2},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-11T16:14:05.996739Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2412.10319"},"observation_digest":"sha256:bb75275357c195322231c6138623fe4fcb4feddd00a0e6b94eafba2a9d277ba5","observation_id":"3ff945e3-5e2c-469c-bde2-1663884c73e6","resolution":{"observed_at":"2026-08-11T16:14:05.996739Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:14:06.006947Z","title":"Samba: Simple hybrid state space models for efficient unlimited context language modeling","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2412.10319","last_updated":"2025-03-11T14:02:04Z","snapshot_observed_at":"2026-08-13T16:34:08.378180Z","submitted_at":"2024-12-13T17:59:52Z","title":"SCBench: A KV Cache-Centric Analysis of Long-Context Methods","version":2},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-11T16:14:06.006947Z"},"links":{"citing_paper":"/paper/2412.10319"},"observation_digest":"sha256:1449a391432e23527ffb0b24fc0277f1d0f5e198d71e72ac6e3755e1a30a1c92","observation_id":"a65b7ef8-78f9-455b-ab0e-e1f3982b3294","resolution":{"observed_at":"2026-08-11T16:14:06.006947Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:14:08.477870Z","title":"Sparq attention: Bandwidth-efficient LLM inference","venue":null,"work_id":"36334f56-8b65-4db5-a91b-c841707fc0c4","year":2024},"citing_paper":{"arxiv_id":"2412.10319","last_updated":"2025-03-11T14:02:04Z","snapshot_observed_at":"2026-08-13T16:34:08.378180Z","submitted_at":"2024-12-13T17:59:52Z","title":"SCBench: A KV Cache-Centric Analysis of Long-Context Methods","version":2},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-08-11T16:14:06.011708Z"},"links":{"citing_paper":"/paper/2412.10319"},"observation_digest":"sha256:2264ca2b3d8fe17ab50353725eca775656c1ced069be3a8076625be414067576","observation_id":"494b5aa1-fe8b-4634-bfdb-73fd36a4771f","resolution":{"observed_at":"2026-08-11T16:14:08.485959Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1911.02150","last_updated":"2019-11-06T00:19:05Z","snapshot_observed_at":"2026-07-06T08:35:01.386074Z","submitted_at":"2019-11-06T00:19:05Z","title":"Fast Transformer Decoding: One Write-Head is All You Need","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.02150","snapshot_observed_at":"2026-08-11T16:14:06.017822Z","title":"Fast transformer decoding: One write-head is all you need","venue":null,"work_id":null,"year":1911},"citing_paper":{"arxiv_id":"2412.10319","last_updated":"2025-03-11T14:02:04Z","snapshot_observed_at":"2026-08-13T16:34:08.378180Z","submitted_at":"2024-12-13T17:59:52Z","title":"SCBench: A KV Cache-Centric Analysis of Long-Context Methods","version":2},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-08-11T16:14:06.017822Z"},"links":{"cited_paper":"/paper/1911.02150","citing_paper":"/paper/2412.10319"},"observation_digest":"sha256:95585183768d24447c7a1bc955de4031901e2a93d84400711d0ed42099ff81ad","observation_id":"4587d32f-fbb7-401d-9932-70542f847662","resolution":{"observed_at":"2026-08-11T16:14:06.017822Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:14:08.432125Z","title":"F lex G en: High-throughput generative inference of large language models with a single GPU","venue":null,"work_id":"e97ac72e-a55b-4309-9393-64f4e2fb0323","year":2023},"citing_paper":{"arxiv_id":"2412.10319","last_updated":"2025-03-11T14:02:04Z","snapshot_observed_at":"2026-08-13T16:34:08.378180Z","submitted_at":"2024-12-13T17:59:52Z","title":"SCBench: A KV Cache-Centric Analysis of Long-Context Methods","version":2},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-08-11T16:14:06.023125Z"},"links":{"citing_paper":"/paper/2412.10319"},"observation_digest":"sha256:d44f72e2affb352ef23e488af8449e70d9657d0f874e18353da7b20ee1a43057","observation_id":"222e6612-2b0c-494e-8b0d-08ba82ccf2bf","resolution":{"observed_at":"2026-08-11T16:14:08.437291Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03314","last_updated":"2024-08-06T17:35:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:35:05Z","title":"Scaling LLM Test-Time Compute Optimally can be More Effective than Scaling Model Parameters","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03314","snapshot_observed_at":"2026-08-11T16:14:06.031774Z","title":"Scaling llm test-time compute optimally can be more effective than scaling model parameters","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.10319","last_updated":"2025-03-11T14:02:04Z","snapshot_observed_at":"2026-08-13T16:34:08.378180Z","submitted_at":"2024-12-13T17:59:52Z","title":"SCBench: A KV Cache-Centric Analysis of Long-Context Methods","version":2},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-08-11T16:14:06.031774Z"},"links":{"cited_paper":"/paper/2408.03314","citing_paper":"/paper/2412.10319"},"observation_digest":"sha256:c383bcf53be3d5e9ef482a38f16fe13b5dfbf3c713e53edfc5a7229951664a48","observation_id":"b7c57564-bfa8-40c4-a9eb-b1c323735f24","resolution":{"observed_at":"2026-08-11T16:14:06.031774Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:14:08.399741Z","title":"Beyond the imitation game: Quantifying and extrapolating the capabilities of language models","venue":null,"work_id":"6efaf793-3563-48d4-a4f8-1d3895599ed4","year":2023},"citing_paper":{"arxiv_id":"2412.10319","last_updated":"2025-03-11T14:02:04Z","snapshot_observed_at":"2026-08-13T16:34:08.378180Z","submitted_at":"2024-12-13T17:59:52Z","title":"SCBench: A KV Cache-Centric Analysis of Long-Context Methods","version":2},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-08-11T16:14:06.045641Z"},"links":{"citing_paper":"/paper/2412.10319"},"observation_digest":"sha256:026f95af67efe988b5f8c0d92dfdc898905d34e8d0e0a0ff741b0e5d27d9abd9","observation_id":"ab500c6e-b0ee-429e-a6cc-3c8966cf4871","resolution":{"observed_at":"2026-08-11T16:14:08.419525Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21465","last_updated":"2025-04-25T19:40:54Z","snapshot_observed_at":"2026-08-16T13:05:14.451211Z","submitted_at":"2024-10-28T19:08:12Z","title":"ShadowKV: KV Cache in Shadows for High-Throughput Long-Context LLM Inference","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21465","snapshot_observed_at":"2026-08-11T16:14:06.050044Z","title":"Shadowkv: Kv cache in shadows for high-throughput long-context llm inference","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.10319","last_updated":"2025-03-11T14:02:04Z","snapshot_observed_at":"2026-08-13T16:34:08.378180Z","submitted_at":"2024-12-13T17:59:52Z","title":"SCBench: A KV Cache-Centric Analysis of Long-Context Methods","version":2},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-08-11T16:14:06.050044Z"},"links":{"cited_paper":"/paper/2410.21465","citing_paper":"/paper/2412.10319"},"observation_digest":"sha256:953acc3fb66a854199fb7b45c65a12aa8ee2b77eff2e6940b992c851237c8052","observation_id":"26a87e2a-968c-4121-9028-452a777bf42d","resolution":{"observed_at":"2026-08-11T16:14:06.050044Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:14:08.382350Z","title":"Triforce: Lossless acceleration of long sequence generation with hierarchical speculative decoding","venue":null,"work_id":"1f6448ee-c4cb-426e-8aba-93b4a99a1552","year":2024},"citing_paper":{"arxiv_id":"2412.10319","last_updated":"2025-03-11T14:02:04Z","snapshot_observed_at":"2026-08-13T16:34:08.378180Z","submitted_at":"2024-12-13T17:59:52Z","title":"SCBench: A KV Cache-Centric Analysis of Long-Context Methods","version":2},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-08-11T16:14:06.057656Z"},"links":{"citing_paper":"/paper/2412.10319"},"observation_digest":"sha256:eed34f9d1c2e03dcb78890958c82a1747dead6829f0634f4528c2b1407ddd5d8","observation_id":"05320c79-bdd3-476b-bc40-cd0afe5fecd7","resolution":{"observed_at":"2026-08-11T16:14:08.388689Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.08621","last_updated":"2023-08-09T08:53:08Z","snapshot_observed_at":"2026-08-02T13:21:32.251959Z","submitted_at":"2023-07-17T16:40:01Z","title":"Retentive Network: A Successor to Transformer for Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.08621","snapshot_observed_at":"2026-08-11T16:14:06.064028Z","title":"Retentive network: A successor to transformer for large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.10319","last_updated":"2025-03-11T14:02:04Z","snapshot_observed_at":"2026-08-13T16:34:08.378180Z","submitted_at":"2024-12-13T17:59:52Z","title":"SCBench: A KV Cache-Centric Analysis of Long-Context Methods","version":2},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-08-11T16:14:06.064028Z"},"links":{"cited_paper":"/paper/2307.08621","citing_paper":"/paper/2412.10319"},"observation_digest":"sha256:ea9b506dc690982ec4a359e4b46d59efb3ecc071420a21dc29270e24e92f2dca","observation_id":"fb10823b-db14-4a4f-a061-1da966191dec","resolution":{"observed_at":"2026-08-11T16:14:06.064028Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:14:08.360262Z","title":"You only cache once: Decoder-decoder architectures for language models","venue":null,"work_id":"183d10fe-fd64-4ddf-b576-1a41af3e4537","year":2024},"citing_paper":{"arxiv_id":"2412.10319","last_updated":"2025-03-11T14:02:04Z","snapshot_observed_at":"2026-08-13T16:34:08.378180Z","submitted_at":"2024-12-13T17:59:52Z","title":"SCBench: A KV Cache-Centric Analysis of Long-Context Methods","version":2},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-08-11T16:14:06.071191Z"},"links":{"citing_paper":"/paper/2412.10319"},"observation_digest":"sha256:e8822bb33854a92d3e572ee03739737767b7ebe86f7b420a8b6a59cd65e148df","observation_id":"6adc473c-32e0-46bf-9f20-d770813298b6","resolution":{"observed_at":"2026-08-11T16:14:08.364731Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:14:06.080839Z","title":"QUEST : Query-aware sparsity for efficient long-context LLM inference","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.10319","last_updated":"2025-03-11T14:02:04Z","snapshot_observed_at":"2026-08-13T16:34:08.378180Z","submitted_at":"2024-12-13T17:59:52Z","title":"SCBench: A KV Cache-Centric Analysis of Long-Context Methods","version":2},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-08-11T16:14:06.080839Z"},"links":{"citing_paper":"/paper/2412.10319"},"observation_digest":"sha256:c97332b911eff701f6def8aad546a7814c506ee7382600a8ca173da88e19aa5b","observation_id":"569071c9-4b33-432f-900c-ea4174e6cbd3","resolution":{"observed_at":"2026-08-11T16:14:06.080839Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:14:08.297705Z","title":"Codestral mamba, 2024","venue":null,"work_id":"19a9ea16-63d0-4d23-bcff-2f93fc8cc73e","year":2024},"citing_paper":{"arxiv_id":"2412.10319","last_updated":"2025-03-11T14:02:04Z","snapshot_observed_at":"2026-08-13T16:34:08.378180Z","submitted_at":"2024-12-13T17:59:52Z","title":"SCBench: A KV Cache-Centric Analysis of Long-Context Methods","version":2},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-08-11T16:14:06.089393Z"},"links":{"citing_paper":"/paper/2412.10319"},"observation_digest":"sha256:d76d4d89ba8daf6f56bf34d1f1bacc2c61bfbde204e80d5fa0ff3bcf49550004","observation_id":"bdfa4aaa-db5f-4930-88ae-08d1bfb603ac","resolution":{"observed_at":"2026-08-11T16:14:08.312561Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:14:08.274221Z","title":"Qwen2.5: A party of foundation models, 2024","venue":null,"work_id":"8914b37c-372e-47c8-8a89-5616d74ce6f0","year":2024},"citing_paper":{"arxiv_id":"2412.10319","last_updated":"2025-03-11T14:02:04Z","snapshot_observed_at":"2026-08-13T16:34:08.378180Z","submitted_at":"2024-12-13T17:59:52Z","title":"SCBench: A KV Cache-Centric Analysis of Long-Context Methods","version":2},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-08-11T16:14:06.098248Z"},"links":{"citing_paper":"/paper/2412.10319"},"observation_digest":"sha256:43524c8bca8bd01ac499fa8d32b440a2bfc9fc794d0062251d2ca41c4107c8da","observation_id":"c5483b3e-6342-483b-85f1-8874d6af226b","resolution":{"observed_at":"2026-08-11T16:14:08.285181Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:14:06.104081Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.10319","last_updated":"2025-03-11T14:02:04Z","snapshot_observed_at":"2026-08-13T16:34:08.378180Z","submitted_at":"2024-12-13T17:59:52Z","title":"SCBench: A KV Cache-Centric Analysis of Long-Context Methods","version":2},"reference_index":84,"source":"arxiv_source","source_observed_at":"2026-08-11T16:14:06.104081Z"},"links":{"citing_paper":"/paper/2412.10319"},"observation_digest":"sha256:ed751bb6e437fcf2ba9711db8e5fcb01e97f7c696ea711221f6d26a22e0292e8","observation_id":"6686e7be-bda2-46e4-8e3c-7538d5f4cd44","resolution":{"observed_at":"2026-08-11T16:14:06.104081Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:14:08.245172Z","title":"Automatic prefix caching","venue":null,"work_id":"0d129482-2fdb-4bfc-96b3-95a7620bd307","year":2024},"citing_paper":{"arxiv_id":"2412.10319","last_updated":"2025-03-11T14:02:04Z","snapshot_observed_at":"2026-08-13T16:34:08.378180Z","submitted_at":"2024-12-13T17:59:52Z","title":"SCBench: A KV Cache-Centric Analysis of Long-Context Methods","version":2},"reference_index":85,"source":"arxiv_source","source_observed_at":"2026-08-11T16:14:06.110138Z"},"links":{"citing_paper":"/paper/2412.10319"},"observation_digest":"sha256:5fc015aa3a2638f6ae47f18d4d310b27def7c0e901b82dddfa2a9695b8ca71af","observation_id":"d2efaf0b-cc4c-46aa-893e-ef2e967eb006","resolution":{"observed_at":"2026-08-11T16:14:08.254447Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12640","last_updated":"2024-09-20T00:47:33Z","snapshot_observed_at":"2026-08-16T13:17:13.467633Z","submitted_at":"2024-09-19T10:38:01Z","title":"Michelangelo: Long Context Evaluations Beyond Haystacks via Latent Structure Queries","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12640","snapshot_observed_at":"2026-08-11T16:14:06.121591Z","title":"Michelangelo: Long context evaluations beyond haystacks via latent structure queries","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.10319","last_updated":"2025-03-11T14:02:04Z","snapshot_observed_at":"2026-08-13T16:34:08.378180Z","submitted_at":"2024-12-13T17:59:52Z","title":"SCBench: A KV Cache-Centric Analysis of Long-Context Methods","version":2},"reference_index":86,"source":"arxiv_source","source_observed_at":"2026-08-11T16:14:06.121591Z"},"links":{"cited_paper":"/paper/2409.12640","citing_paper":"/paper/2412.10319"},"observation_digest":"sha256:37d0e4912566c10f343b65b8b7978bf7439227b79832d26e5e248a8a834784e7","observation_id":"2dece6c6-3f32-4f9d-8fa0-3a181e4607b1","resolution":{"observed_at":"2026-08-11T16:14:06.121591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07887","last_updated":"2024-06-12T05:25:15Z","snapshot_observed_at":"2026-07-06T18:29:21.709395Z","submitted_at":"2024-06-12T05:25:15Z","title":"An Empirical Study of Mamba-based Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07887","snapshot_observed_at":"2026-08-11T16:14:06.129767Z","title":"An empirical study of mamba-based language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.10319","last_updated":"2025-03-11T14:02:04Z","snapshot_observed_at":"2026-08-13T16:34:08.378180Z","submitted_at":"2024-12-13T17:59:52Z","title":"SCBench: A KV Cache-Centric Analysis of Long-Context Methods","version":2},"reference_index":87,"source":"arxiv_source","source_observed_at":"2026-08-11T16:14:06.129767Z"},"links":{"cited_paper":"/paper/2406.07887","citing_paper":"/paper/2412.10319"},"observation_digest":"sha256:eb7d27c71dc215a3d43cf871e89c7ee5b7aaefa6dd763541e2b743539f6f5a0f","observation_id":"4524286c-7793-4a71-b162-50af9049f9d4","resolution":{"observed_at":"2026-08-11T16:14:06.129767Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:14:08.229436Z","title":"MINT : Evaluating LLM s in multi-turn interaction with tools and language feedback","venue":null,"work_id":"9101fd81-a0ed-4534-a664-faa9989dbe4a","year":2024},"citing_paper":{"arxiv_id":"2412.10319","last_updated":"2025-03-11T14:02:04Z","snapshot_observed_at":"2026-08-13T16:34:08.378180Z","submitted_at":"2024-12-13T17:59:52Z","title":"SCBench: A KV Cache-Centric Analysis of Long-Context Methods","version":2},"reference_index":88,"source":"arxiv_source","source_observed_at":"2026-08-11T16:14:06.136052Z"},"links":{"citing_paper":"/paper/2412.10319"},"observation_digest":"sha256:a5e397eacb5ca7ba5c1681ce50f9714d1dcadbe56ab3fc0160916a5f46f67456","observation_id":"c9d6a03d-a463-4065-aa62-e37f107167b5","resolution":{"observed_at":"2026-08-11T16:14:08.234551Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:14:06.145396Z","title":"Efficient streaming language models with attention sinks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.10319","last_updated":"2025-03-11T14:02:04Z","snapshot_observed_at":"2026-08-13T16:34:08.378180Z","submitted_at":"2024-12-13T17:59:52Z","title":"SCBench: A KV Cache-Centric Analysis of Long-Context Methods","version":2},"reference_index":89,"source":"arxiv_source","source_observed_at":"2026-08-11T16:14:06.145396Z"},"links":{"citing_paper":"/paper/2412.10319"},"observation_digest":"sha256:8cef4ae13155755e6f1364b72fbd9f3b2dfc31987a904c378472bb918430119c","observation_id":"96ffaab2-c48c-4ab8-af55-f441d82bd9cf","resolution":{"observed_at":"2026-08-11T16:14:06.145396Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:14:08.163929Z","title":"Duoattention: Efficient long-context LLM inference with retrieval and streaming heads","venue":null,"work_id":"b6f46fca-4b3f-4001-abfa-c02f17211057","year":2025},"citing_paper":{"arxiv_id":"2412.10319","last_updated":"2025-03-11T14:02:04Z","snapshot_observed_at":"2026-08-13T16:34:08.378180Z","submitted_at":"2024-12-13T17:59:52Z","title":"SCBench: A KV Cache-Centric Analysis of Long-Context Methods","version":2},"reference_index":90,"source":"arxiv_source","source_observed_at":"2026-08-11T16:14:06.152536Z"},"links":{"citing_paper":"/paper/2412.10319"},"observation_digest":"sha256:e276b899978fab63d5d25fd600dade6157fae4f2bd50a2fe0fa8eb0578d03708","observation_id":"4fe1dbbf-88fe-4b1f-8e35-874bba0b8c44","resolution":{"observed_at":"2026-08-11T16:14:08.178682Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14866","last_updated":"2025-04-21T15:13:44Z","snapshot_observed_at":"2026-08-17T00:49:25.414576Z","submitted_at":"2025-02-20T18:59:52Z","title":"LServe: Efficient Long-sequence LLM Serving with Unified Sparse Attention","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.14866","snapshot_observed_at":"2026-08-11T16:14:06.161696Z","title":"Lserve: Efficient long-sequence llm serving with unified sparse attention","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2412.10319","last_updated":"2025-03-11T14:02:04Z","snapshot_observed_at":"2026-08-13T16:34:08.378180Z","submitted_at":"2024-12-13T17:59:52Z","title":"SCBench: A KV Cache-Centric Analysis of Long-Context Methods","version":2},"reference_index":91,"source":"arxiv_source","source_observed_at":"2026-08-11T16:14:06.161696Z"},"links":{"cited_paper":"/paper/2502.14866","citing_paper":"/paper/2412.10319"},"observation_digest":"sha256:f378bf40cd7f1088d656fa032406b9b288b826bbd4362b16cf9963315b2edda1","observation_id":"ff884504-f70b-4e81-b39e-a6ec9928ad9b","resolution":{"observed_at":"2026-08-11T16:14:06.161696Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.16444","last_updated":"2025-04-03T22:49:22Z","snapshot_observed_at":"2026-08-16T13:49:22.714428Z","submitted_at":"2024-05-26T06:00:17Z","title":"CacheBlend: Fast Large Language Model Serving for RAG with Cached Knowledge Fusion","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.16444","snapshot_observed_at":"2026-08-11T16:14:06.173124Z","title":"Cacheblend: Fast large language model serving with cached knowledge fusion","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.10319","last_updated":"2025-03-11T14:02:04Z","snapshot_observed_at":"2026-08-13T16:34:08.378180Z","submitted_at":"2024-12-13T17:59:52Z","title":"SCBench: A KV Cache-Centric Analysis of Long-Context Methods","version":2},"reference_index":92,"source":"arxiv_source","source_observed_at":"2026-08-11T16:14:06.173124Z"},"links":{"cited_paper":"/paper/2405.16444","citing_paper":"/paper/2412.10319"},"observation_digest":"sha256:c52c9fe3fed3e900393066ee6cff8e699a12946d67558f519a63e2a51f128466","observation_id":"353866e5-2091-459b-b15f-85bdcc7a0be0","resolution":{"observed_at":"2026-08-11T16:14:06.173124Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:14:06.189873Z","title":"Tree of thoughts: Deliberate problem solving with large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.10319","last_updated":"2025-03-11T14:02:04Z","snapshot_observed_at":"2026-08-13T16:34:08.378180Z","submitted_at":"2024-12-13T17:59:52Z","title":"SCBench: A KV Cache-Centric Analysis of Long-Context Methods","version":2},"reference_index":93,"source":"arxiv_source","source_observed_at":"2026-08-11T16:14:06.189873Z"},"links":{"citing_paper":"/paper/2412.10319"},"observation_digest":"sha256:f636aa7b1c10d97a10c6f5ac562270bb7757e319536d1e94c94aa52ece834c2e","observation_id":"68bef232-e66d-465d-97c5-ca891e8d482a","resolution":{"observed_at":"2026-08-11T16:14:06.189873Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:14:08.110593Z","title":"Cascade inference: Memory bandwidth efficient shared prefix batch decoding, 2024","venue":null,"work_id":"a6206219-1bdf-4c86-a69d-775f993cc25e","year":2024},"citing_paper":{"arxiv_id":"2412.10319","last_updated":"2025-03-11T14:02:04Z","snapshot_observed_at":"2026-08-13T16:34:08.378180Z","submitted_at":"2024-12-13T17:59:52Z","title":"SCBench: A KV Cache-Centric Analysis of Long-Context Methods","version":2},"reference_index":94,"source":"arxiv_source","source_observed_at":"2026-08-11T16:14:06.215053Z"},"links":{"citing_paper":"/paper/2412.10319"},"observation_digest":"sha256:157f436924edce14a3b4a940ca3ad776656f436842cc55a3d2eba71129cfc5e0","observation_id":"0f393cad-5ce7-45e6-a2d5-9b7e224cf771","resolution":{"observed_at":"2026-08-11T16:14:08.117891Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02694","last_updated":"2025-03-06T18:41:54Z","snapshot_observed_at":"2026-08-16T21:34:35.394829Z","submitted_at":"2024-10-03T17:20:11Z","title":"HELMET: How to Evaluate Long-Context Language Models Effectively and Thoroughly","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02694","snapshot_observed_at":"2026-08-11T16:14:06.222150Z","title":"Helmet: How to evaluate long-context language models effectively and thoroughly","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.10319","last_updated":"2025-03-11T14:02:04Z","snapshot_observed_at":"2026-08-13T16:34:08.378180Z","submitted_at":"2024-12-13T17:59:52Z","title":"SCBench: A KV Cache-Centric Analysis of Long-Context Methods","version":2},"reference_index":95,"source":"arxiv_source","source_observed_at":"2026-08-11T16:14:06.222150Z"},"links":{"cited_paper":"/paper/2410.02694","citing_paper":"/paper/2412.10319"},"observation_digest":"sha256:120fd121922c1b3febc31e6af96f873b98c6c3578d6bedfd4482779bbdc3f1cc","observation_id":"9a1d06c3-cacf-4c4b-a352-842dc6d3a7de","resolution":{"observed_at":"2026-08-11T16:14:06.222150Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2020.acl-main.444","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:14:06.408964Z","title":"Dialogue-based relation extraction","venue":null,"work_id":"ef2b3aa9-c3df-4620-9eb6-7c85bbe570f6","year":2020},"citing_paper":{"arxiv_id":"2412.10319","last_updated":"2025-03-11T14:02:04Z","snapshot_observed_at":"2026-08-13T16:34:08.378180Z","submitted_at":"2024-12-13T17:59:52Z","title":"SCBench: A KV Cache-Centric Analysis of Long-Context Methods","version":2},"reference_index":96,"source":"arxiv_source","source_observed_at":"2026-08-11T16:14:06.248401Z"},"links":{"citing_paper":"/paper/2412.10319"},"observation_digest":"sha256:642b39ffcafb55043e119cbf09b816c1dbf519328792c8750193f61d73ad490e","observation_id":"8468a9e5-3470-401c-9df6-18a13595b0e3","resolution":{"observed_at":"2026-08-11T16:14:06.420317Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:14:06.252705Z","title":"KV cache compression, but what must we give in return? a comprehensive benchmark of long context capable approaches","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.10319","last_updated":"2025-03-11T14:02:04Z","snapshot_observed_at":"2026-08-13T16:34:08.378180Z","submitted_at":"2024-12-13T17:59:52Z","title":"SCBench: A KV Cache-Centric Analysis of Long-Context Methods","version":2},"reference_index":97,"source":"arxiv_source","source_observed_at":"2026-08-11T16:14:06.252705Z"},"links":{"citing_paper":"/paper/2412.10319"},"observation_digest":"sha256:10c82843728485cd0564d0b60359d88918d6fc7b87884a5a771e9d07fd581fee","observation_id":"fe36ebce-ce0a-402f-b777-c622d49dfa7b","resolution":{"observed_at":"2026-08-11T16:14:06.252705Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11089","last_updated":"2025-02-27T09:01:21Z","snapshot_observed_at":"2026-08-16T16:29:35.500686Z","submitted_at":"2025-02-16T11:53:44Z","title":"Native Sparse Attention: Hardware-Aligned and Natively Trainable Sparse Attention","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.11089","snapshot_observed_at":"2026-08-11T16:14:06.258692Z","title":"Native sparse attention: Hardware-aligned and natively trainable sparse attention","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2412.10319","last_updated":"2025-03-11T14:02:04Z","snapshot_observed_at":"2026-08-13T16:34:08.378180Z","submitted_at":"2024-12-13T17:59:52Z","title":"SCBench: A KV Cache-Centric Analysis of Long-Context Methods","version":2},"reference_index":98,"source":"arxiv_source","source_observed_at":"2026-08-11T16:14:06.258692Z"},"links":{"cited_paper":"/paper/2502.11089","citing_paper":"/paper/2412.10319"},"observation_digest":"sha256:b3997e4e5a7b1ccf5f283698908fffae312a92c6666458cca6dd8a46b49965ca","observation_id":"11bb78d4-17cc-4a5f-97d9-7ff4be83815c","resolution":{"observed_at":"2026-08-11T16:14:06.258692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:14:08.076482Z","title":"Reddi, and Sanjiv Kumar","venue":null,"work_id":"d3fde099-a314-4643-b8b5-b5fc0308ce4b","year":2020},"citing_paper":{"arxiv_id":"2412.10319","last_updated":"2025-03-11T14:02:04Z","snapshot_observed_at":"2026-08-13T16:34:08.378180Z","submitted_at":"2024-12-13T17:59:52Z","title":"SCBench: A KV Cache-Centric Analysis of Long-Context Methods","version":2},"reference_index":99,"source":"arxiv_source","source_observed_at":"2026-08-11T16:14:06.269118Z"},"links":{"citing_paper":"/paper/2412.10319"},"observation_digest":"sha256:8762cd253446f11646fd4b9e7d360c47bcacd46f8efe1e36f4adbf3f0cc49175","observation_id":"05cdc766-3668-4039-ab4d-41075a5500cc","resolution":{"observed_at":"2026-08-11T16:14:08.081543Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:14:08.051142Z","title":"Infinitebench: Extending long context evaluation beyond 100 K tokens","venue":null,"work_id":"758f3a00-2ab9-4bdb-8076-ef2bb072b4d5","year":2024},"citing_paper":{"arxiv_id":"2412.10319","last_updated":"2025-03-11T14:02:04Z","snapshot_observed_at":"2026-08-13T16:34:08.378180Z","submitted_at":"2024-12-13T17:59:52Z","title":"SCBench: A KV Cache-Centric Analysis of Long-Context Methods","version":2},"reference_index":100,"source":"arxiv_source","source_observed_at":"2026-08-11T16:14:06.279971Z"},"links":{"citing_paper":"/paper/2412.10319"},"observation_digest":"sha256:49a7c3b00182fa70f2d578ef160cc746b80053ef1bfaa647208445e805fd572a","observation_id":"20c3e22f-3acc-4b9c-8b39-c99bea5ed461","resolution":{"observed_at":"2026-08-11T16:14:08.060930Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:14:06.284069Z","title":"H2o: Heavy-hitter oracle for efficient generative inference of large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.10319","last_updated":"2025-03-11T14:02:04Z","snapshot_observed_at":"2026-08-13T16:34:08.378180Z","submitted_at":"2024-12-13T17:59:52Z","title":"SCBench: A KV Cache-Centric Analysis of Long-Context Methods","version":2},"reference_index":101,"source":"arxiv_source","source_observed_at":"2026-08-11T16:14:06.284069Z"},"links":{"citing_paper":"/paper/2412.10319"},"observation_digest":"sha256:e756c9b04585af10d259b128776ed36769b5f9c4a7fc7b5eee0be91680af5be1","observation_id":"f847b6cc-af3e-4ab0-ad3d-f1195fb45c2b","resolution":{"observed_at":"2026-08-11T16:14:06.284069Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2412.10319","last_updated":"2025-03-11T14:02:04Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-13T16:34:08.378180Z","submitted_at":"2024-12-13T17:59:52Z","title":"SCBench: A KV Cache-Centric Analysis of Long-Context Methods"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":81,"verified_exact":1,"verified_fuzzy":18},"total_outbound_references":108},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 100 of 108 outbound references and 18 inbound Pith citation observations for arXiv:2412.10319."}