{"as_of":"2026-08-22T11:44:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:fa8511d687958217d07ffdecd80d088075943ccfa43b035d5bd7700c9c2ca09d","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":45,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":45,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-22T06:32:14.747728+00:00","state":"measured"},{"denominator":45,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":45,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T11:39:53.787340Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T09:39:46.796077Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2401.02669","last_updated":"2024-07-04T15:12:54Z","snapshot_observed_at":"2026-08-17T04:58:55.259763Z","submitted_at":"2024-01-05T06:53:00Z","title":"Infinite-LLM: Efficient LLM Service for Long Context with DistAttention and Distributed KVCache","version":2},"cited_work":{"arxiv_id":"2401.02669","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2401.02669","snapshot_observed_at":"2026-07-04T09:39:46.796077Z","title":"Infinite-llm: Efficient llm service for long context with distattention and distributed kvcache","venue":null,"work_id":"e075e559-850d-40cb-9934-6995d4bf4c06","year":2024},"citing_paper":{"arxiv_id":"2404.14294","last_updated":"2024-07-19T04:47:36Z","snapshot_observed_at":"2026-07-06T18:03:47.096406Z","submitted_at":"2024-04-22T15:53:08Z","title":"A Survey on Efficient Inference for Large Language Models","version":3},"reference_index":276,"source":"pdf_text","source_observed_at":"2026-05-15T02:39:33.007894Z"},"links":{"cited_paper":"/paper/2401.02669","citing_paper":"/paper/2404.14294"},"observation_digest":"sha256:695d031f2ca6eb706775cc47fb0987d0b01a38d442b27fcb96419cf6d473cf0d","observation_id":"912586e1-1021-474c-b5a2-23ca6d36c563","resolution":{"observed_at":"2026-05-15T02:39:33.479689Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02669","last_updated":"2024-07-04T15:12:54Z","snapshot_observed_at":"2026-08-17T04:58:55.259763Z","submitted_at":"2024-01-05T06:53:00Z","title":"Infinite-LLM: Efficient LLM Service for Long Context with DistAttention and Distributed KVCache","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.02669","snapshot_observed_at":"2026-08-12T20:53:26.655414Z","title":"Infinite-llm: Efficient llm service for long context with distattention and distributed kvcache","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.09317","last_updated":"2024-11-14T09:50:41Z","snapshot_observed_at":"2026-08-21T11:26:04.852209Z","submitted_at":"2024-11-14T09:50:41Z","title":"Pie: Pooling CPU Memory for LLM Inference","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T20:53:26.655414Z"},"links":{"cited_paper":"/paper/2401.02669","citing_paper":"/paper/2411.09317"},"observation_digest":"sha256:260ef2175024568406605212b93f1a08fb2ba1e3401a6177491efe3494f72875","observation_id":"8452f46f-dc76-404c-b737-f368d1906b84","resolution":{"observed_at":"2026-08-12T20:53:26.655414Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02669","last_updated":"2024-07-04T15:12:54Z","snapshot_observed_at":"2026-08-17T04:58:55.259763Z","submitted_at":"2024-01-05T06:53:00Z","title":"Infinite-LLM: Efficient LLM Service for Long Context with DistAttention and Distributed KVCache","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.02669","snapshot_observed_at":"2026-08-12T17:00:04.076364Z","title":"Infinite-llm: Efficient llm service for long context with distattention and distributed kvcache","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.13009","last_updated":"2024-11-21T16:49:51Z","snapshot_observed_at":"2026-08-18T05:16:39.450049Z","submitted_at":"2024-11-20T03:17:51Z","title":"LLMSteer: Improving Long-Context LLM Inference by Steering Attention on Reused Contexts","version":2},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-12T17:00:04.076364Z"},"links":{"cited_paper":"/paper/2401.02669","citing_paper":"/paper/2411.13009"},"observation_digest":"sha256:60ff37fad929fa77272afe9d6fdecfc4f7d572095259d87579f0ab986152c976","observation_id":"1b35285d-3aec-4217-85d3-054aaf04163c","resolution":{"observed_at":"2026-08-12T17:00:04.076364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02669","last_updated":"2024-07-04T15:12:54Z","snapshot_observed_at":"2026-08-17T04:58:55.259763Z","submitted_at":"2024-01-05T06:53:00Z","title":"Infinite-LLM: Efficient LLM Service for Long Context with DistAttention and Distributed KVCache","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.02669","snapshot_observed_at":"2026-08-11T20:18:17.762149Z","title":"Infinite-llm: Efficient llm service for long context with distattention and distributed kvcache,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.05896","last_updated":"2024-12-08T11:32:08Z","snapshot_observed_at":"2026-08-14T18:25:06.915616Z","submitted_at":"2024-12-08T11:32:08Z","title":"XKV: Personalized KV Cache Memory Reduction for Long-Context LLM Inference","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T20:18:17.762149Z"},"links":{"cited_paper":"/paper/2401.02669","citing_paper":"/paper/2412.05896"},"observation_digest":"sha256:44a1b95e817470d8cfb02a0b968b4692f9993bbd9c6742ece023981f26691ef3","observation_id":"4bc970ca-837e-4ab2-907a-dc13a6579332","resolution":{"observed_at":"2026-08-11T20:18:17.762149Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02669","last_updated":"2024-07-04T15:12:54Z","snapshot_observed_at":"2026-08-17T04:58:55.259763Z","submitted_at":"2024-01-05T06:53:00Z","title":"Infinite-LLM: Efficient LLM Service for Long Context with DistAttention and Distributed KVCache","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.02669","snapshot_observed_at":"2026-08-11T17:32:39.956930Z","title":"Infinite-llm: Efficient llm service for long context with distattention and distributed kvcache","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.08890","last_updated":"2024-12-12T03:00:29Z","snapshot_observed_at":"2026-08-14T16:44:06.126162Z","submitted_at":"2024-12-12T03:00:29Z","title":"Lexico: Extreme KV Cache Compression via Sparse Coding over Universal Dictionaries","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T17:32:39.956930Z"},"links":{"cited_paper":"/paper/2401.02669","citing_paper":"/paper/2412.08890"},"observation_digest":"sha256:bb4a4094b84b5da3abf3405082a694d472b7147b7a54262d9053dffd2908f5b4","observation_id":"3ff7a8d3-7e33-4302-a0d9-1ceac9c3347d","resolution":{"observed_at":"2026-08-11T17:32:39.956930Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02669","last_updated":"2024-07-04T15:12:54Z","snapshot_observed_at":"2026-08-17T04:58:55.259763Z","submitted_at":"2024-01-05T06:53:00Z","title":"Infinite-LLM: Efficient LLM Service for Long Context with DistAttention and Distributed KVCache","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.02669","snapshot_observed_at":"2026-08-11T14:05:01.827674Z","title":"Liu, Y ., Li, H., Cheng, Y ., Ray, S., Huang, Y ., Zhang, Q., Du, K., Yao, J., Lu, S., Ananthanarayanan, G., Maire, M., Hoffmann, H., Holtzman, A., and Jiang, J","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.12488","last_updated":"2024-12-17T02:44:43Z","snapshot_observed_at":"2026-08-14T19:21:18.649075Z","submitted_at":"2024-12-17T02:44:43Z","title":"A System for Microserving of LLMs","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T14:05:01.827674Z"},"links":{"cited_paper":"/paper/2401.02669","citing_paper":"/paper/2412.12488"},"observation_digest":"sha256:10f136a4e8109f3040ba4f6745f48f9a50967f3f8b468f65f1ff00dba9eac42f","observation_id":"1f0dbb30-0e8d-4c50-8c02-f067624bfa82","resolution":{"observed_at":"2026-08-11T14:05:01.827674Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02669","last_updated":"2024-07-04T15:12:54Z","snapshot_observed_at":"2026-08-17T04:58:55.259763Z","submitted_at":"2024-01-05T06:53:00Z","title":"Infinite-LLM: Efficient LLM Service for Long Context with DistAttention and Distributed KVCache","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.02669","snapshot_observed_at":"2026-08-10T21:16:23.940987Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.05554","last_updated":"2025-01-09T20:01:15Z","snapshot_observed_at":"2026-08-13T08:29:41.229641Z","submitted_at":"2025-01-09T20:01:15Z","title":"LLMQuoter: Enhancing RAG Capabilities Through Efficient Quote Extraction From Large Contexts","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-10T21:16:23.940987Z"},"links":{"cited_paper":"/paper/2401.02669","citing_paper":"/paper/2501.05554"},"observation_digest":"sha256:f42d6ebfb9b47004a0bb0e8b14ed080fdecf25b7809617afb05f5bcb03f6aa3d","observation_id":"51337c04-f5fd-47fc-96e1-641a79f20b87","resolution":{"observed_at":"2026-08-10T21:16:23.940987Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02669","last_updated":"2024-07-04T15:12:54Z","snapshot_observed_at":"2026-08-17T04:58:55.259763Z","submitted_at":"2024-01-05T06:53:00Z","title":"Infinite-LLM: Efficient LLM Service for Long Context with DistAttention and Distributed KVCache","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.02669","snapshot_observed_at":"2026-08-10T20:13:42.886796Z","title":"Infinite-llm: Efficient llm service for long context with distattention and distributed kvcache,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.09367","last_updated":"2025-01-16T08:25:07Z","snapshot_observed_at":"2026-08-19T14:46:40.859188Z","submitted_at":"2025-01-16T08:25:07Z","title":"PICE: A Semantic-Driven Progressive Inference System for LLM Serving in Cloud-Edge Networks","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T20:13:42.886796Z"},"links":{"cited_paper":"/paper/2401.02669","citing_paper":"/paper/2501.09367"},"observation_digest":"sha256:12efc957878dac4db4ccd958db1303faf98bb8d93710ce0f3856b37483600740","observation_id":"7bdd7da9-b375-422f-ae2e-922c8fea5844","resolution":{"observed_at":"2026-08-10T20:13:42.886796Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02669","last_updated":"2024-07-04T15:12:54Z","snapshot_observed_at":"2026-08-17T04:58:55.259763Z","submitted_at":"2024-01-05T06:53:00Z","title":"Infinite-LLM: Efficient LLM Service for Long Context with DistAttention and Distributed KVCache","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.02669","snapshot_observed_at":"2026-08-10T18:01:46.293818Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.11779","last_updated":"2025-02-11T17:36:32Z","snapshot_observed_at":"2026-08-17T14:25:14.988730Z","submitted_at":"2025-01-20T23:10:13Z","title":"Glinthawk: A Two-Tiered Architecture for Offline LLM Inference","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-10T18:01:46.293818Z"},"links":{"cited_paper":"/paper/2401.02669","citing_paper":"/paper/2501.11779"},"observation_digest":"sha256:aeaeb139ce6c9db89fcbebccc29a146cdb88037985847e886df4df05957e8db6","observation_id":"fa98683e-5b9a-43f0-a904-6183b0d6c34c","resolution":{"observed_at":"2026-08-10T18:01:46.293818Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02669","last_updated":"2024-07-04T15:12:54Z","snapshot_observed_at":"2026-08-17T04:58:55.259763Z","submitted_at":"2024-01-05T06:53:00Z","title":"Infinite-LLM: Efficient LLM Service for Long Context with DistAttention and Distributed KVCache","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.02669","snapshot_observed_at":"2026-08-08T14:13:38.164388Z","title":"Infinite-llm: Efficient llm service for long context with distattention and distributed kvcache, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06975","last_updated":"2025-02-10T19:14:51Z","snapshot_observed_at":"2026-08-14T08:32:12.525435Z","submitted_at":"2025-02-10T19:14:51Z","title":"Position: Episodic Memory is the Missing Piece for Long-Term LLM Agents","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-08T14:13:38.164388Z"},"links":{"cited_paper":"/paper/2401.02669","citing_paper":"/paper/2502.06975"},"observation_digest":"sha256:e1de16204941e8e6687812b082452f62b17973c9c9263dfdc31d001eefde73f6","observation_id":"e7f5fa46-7422-4d21-b0e6-525f8bb50e48","resolution":{"observed_at":"2026-08-08T14:13:38.164388Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02669","last_updated":"2024-07-04T15:12:54Z","snapshot_observed_at":"2026-08-17T04:58:55.259763Z","submitted_at":"2024-01-05T06:53:00Z","title":"Infinite-LLM: Efficient LLM Service for Long Context with DistAttention and Distributed KVCache","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.02669","snapshot_observed_at":"2026-08-08T10:10:22.973785Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.08182","last_updated":"2025-02-12T07:42:45Z","snapshot_observed_at":"2026-08-17T11:57:14.492319Z","submitted_at":"2025-02-12T07:42:45Z","title":"Memory Offloading for Large Language Model Inference with Latency SLO Guarantees","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-08T10:10:22.973785Z"},"links":{"cited_paper":"/paper/2401.02669","citing_paper":"/paper/2502.08182"},"observation_digest":"sha256:49659fba367c8356ab167554281938cb7e4ce4035315e746b1ba0ce301cab5af","observation_id":"2edf95f3-8250-47f2-b3ef-aa5241ad9e9d","resolution":{"observed_at":"2026-08-08T10:10:22.973785Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02669","last_updated":"2024-07-04T15:12:54Z","snapshot_observed_at":"2026-08-17T04:58:55.259763Z","submitted_at":"2024-01-05T06:53:00Z","title":"Infinite-LLM: Efficient LLM Service for Long Context with DistAttention and Distributed KVCache","version":2},"cited_work":{"arxiv_id":"2401.02669","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2401.02669","snapshot_observed_at":"2026-07-04T09:39:46.796077Z","title":"Infinite-llm: Efficient llm service for long context with distattention and distributed kvcache","venue":null,"work_id":"e075e559-850d-40cb-9934-6995d4bf4c06","year":2024},"citing_paper":{"arxiv_id":"2504.09844","last_updated":"2026-04-27T14:30:20Z","snapshot_observed_at":"2026-08-15T15:11:04.897624Z","submitted_at":"2025-04-14T03:31:22Z","title":"MegaScale-Data: Scaling Dataloader for Multisource Large Foundation Model Training","version":4},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-22T21:12:22.201810Z"},"links":{"cited_paper":"/paper/2401.02669","citing_paper":"/paper/2504.09844"},"observation_digest":"sha256:402b9547d00eb968ec311afdb797d76529746c61337f9fec27d704301ef6dd0a","observation_id":"5bb54491-cfd1-4fae-a01e-7b66d48df701","resolution":{"observed_at":"2026-05-22T21:15:09.596423Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02669","last_updated":"2024-07-04T15:12:54Z","snapshot_observed_at":"2026-08-17T04:58:55.259763Z","submitted_at":"2024-01-05T06:53:00Z","title":"Infinite-LLM: Efficient LLM Service for Long Context with DistAttention and Distributed KVCache","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.02669","snapshot_observed_at":"2026-08-16T11:39:53.787340Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.14966","last_updated":"2025-06-12T01:39:50Z","snapshot_observed_at":"2026-08-20T16:23:29.314751Z","submitted_at":"2025-04-21T08:48:48Z","title":"SLO-Aware Scheduling for Large Language Model Inferences","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-16T11:39:53.787340Z"},"links":{"cited_paper":"/paper/2401.02669","citing_paper":"/paper/2504.14966"},"observation_digest":"sha256:50b9566fb87268ed0e4fcb2b0c3e68969da08de80bc2096a27770bb4241a1e02","observation_id":"732bb2dd-06db-4c48-af6f-edd9c20bb846","resolution":{"observed_at":"2026-08-16T11:39:53.787340Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02669","last_updated":"2024-07-04T15:12:54Z","snapshot_observed_at":"2026-08-17T04:58:55.259763Z","submitted_at":"2024-01-05T06:53:00Z","title":"Infinite-LLM: Efficient LLM Service for Long Context with DistAttention and Distributed KVCache","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.02669","snapshot_observed_at":"2026-08-16T10:28:52.452135Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.18154","last_updated":"2025-04-25T08:06:22Z","snapshot_observed_at":"2026-08-18T18:55:10.997004Z","submitted_at":"2025-04-25T08:06:22Z","title":"EcoServe: Enabling Cost-effective LLM Serving with Proactive Intra- and Inter-Instance Orchestration","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-16T10:28:52.452135Z"},"links":{"cited_paper":"/paper/2401.02669","citing_paper":"/paper/2504.18154"},"observation_digest":"sha256:7c7dee746b57482d8f3d3aa9e647f616d309c2a05f317d39ffbf7fa9ff7c2269","observation_id":"0c40a79b-c316-4493-b732-015a2ccfaa86","resolution":{"observed_at":"2026-08-16T10:28:52.452135Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02669","last_updated":"2024-07-04T15:12:54Z","snapshot_observed_at":"2026-08-17T04:58:55.259763Z","submitted_at":"2024-01-05T06:53:00Z","title":"Infinite-LLM: Efficient LLM Service for Long Context with DistAttention and Distributed KVCache","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.02669","snapshot_observed_at":"2026-08-16T05:49:09.959910Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.19720","last_updated":"2025-04-28T12:14:02Z","snapshot_observed_at":"2026-08-19T00:58:17.913230Z","submitted_at":"2025-04-28T12:14:02Z","title":"Taming the Titans: A Survey of Efficient LLM Inference Serving","version":1},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-16T05:49:09.959910Z"},"links":{"cited_paper":"/paper/2401.02669","citing_paper":"/paper/2504.19720"},"observation_digest":"sha256:e410b21c1b0f6982238770c79f0635e53090ed539d4efa84e9eac3e0d0d809df","observation_id":"d0a7575e-9c4d-4e48-afa1-13cff7c187d9","resolution":{"observed_at":"2026-08-16T05:49:09.959910Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02669","last_updated":"2024-07-04T15:12:54Z","snapshot_observed_at":"2026-08-17T04:58:55.259763Z","submitted_at":"2024-01-05T06:53:00Z","title":"Infinite-LLM: Efficient LLM Service for Long Context with DistAttention and Distributed KVCache","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.02669","snapshot_observed_at":"2026-08-15T22:15:13.711912Z","title":"Infinite-llm: Efficient llm service for long context with distattention and distributed kvcache.arXiv preprint arXiv:2401.02669 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.07680","last_updated":"2025-05-12T15:46:28Z","snapshot_observed_at":"2026-08-20T23:36:15.106411Z","submitted_at":"2025-05-12T15:46:28Z","title":"SpecRouter: Adaptive Routing for Multi-Level Speculative Decoding in Large Language Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-15T22:15:13.711912Z"},"links":{"cited_paper":"/paper/2401.02669","citing_paper":"/paper/2505.07680"},"observation_digest":"sha256:05540a6b84affa9ea7d5624043c3c934767825dc1b018b7b8bca6107bd31b0e9","observation_id":"3d83a165-af28-4402-96b4-3953b225a919","resolution":{"observed_at":"2026-08-15T22:15:13.711912Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02669","last_updated":"2024-07-04T15:12:54Z","snapshot_observed_at":"2026-08-17T04:58:55.259763Z","submitted_at":"2024-01-05T06:53:00Z","title":"Infinite-LLM: Efficient LLM Service for Long Context with DistAttention and Distributed KVCache","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.02669","snapshot_observed_at":"2026-08-07T15:42:21.786114Z","title":"Infinite-llm: Efficient llm service for long context with distattention and distributed kvcache,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14085","last_updated":"2025-05-20T08:46:23Z","snapshot_observed_at":"2026-08-17T19:40:52.481713Z","submitted_at":"2025-05-20T08:46:23Z","title":"CE-LSLM: Efficient Large-Small Language Model Inference and Communication via Cloud-Edge Collaboration","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:21.786114Z"},"links":{"cited_paper":"/paper/2401.02669","citing_paper":"/paper/2505.14085"},"observation_digest":"sha256:77a0055f054ee30a9122fb1d9ececab4005dd9ab4587c06d691685bee7e5966f","observation_id":"c6e991f7-3307-4c1a-9155-e0b38881e6c1","resolution":{"observed_at":"2026-08-07T15:42:21.786114Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02669","last_updated":"2024-07-04T15:12:54Z","snapshot_observed_at":"2026-08-17T04:58:55.259763Z","submitted_at":"2024-01-05T06:53:00Z","title":"Infinite-LLM: Efficient LLM Service for Long Context with DistAttention and Distributed KVCache","version":2},"cited_work":{"arxiv_id":"2401.02669","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2401.02669","snapshot_observed_at":"2026-07-04T09:39:46.796077Z","title":"Infinite-llm: Efficient llm service for long context with distattention and distributed kvcache","venue":null,"work_id":"e075e559-850d-40cb-9934-6995d4bf4c06","year":2024},"citing_paper":{"arxiv_id":"2506.04565","last_updated":"2026-05-08T15:50:43Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-05T02:34:43Z","title":"From Standalone LLMs to Integrated Intelligence: A Survey of Compound Al Systems","version":2},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-05-19T11:49:36.574471Z"},"links":{"cited_paper":"/paper/2401.02669","citing_paper":"/paper/2506.04565"},"observation_digest":"sha256:5fbefe91e6044659421e78e05f220ae61ef866489ff1fc84f543d124fcc358f8","observation_id":"d76d718f-dd07-4cee-b791-352a709d5d03","resolution":{"observed_at":"2026-05-19T11:52:16.207614Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02669","last_updated":"2024-07-04T15:12:54Z","snapshot_observed_at":"2026-08-17T04:58:55.259763Z","submitted_at":"2024-01-05T06:53:00Z","title":"Infinite-LLM: Efficient LLM Service for Long Context with DistAttention and Distributed KVCache","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.02669","snapshot_observed_at":"2026-08-15T19:59:46.533712Z","title":"Infinite-llm: Efficient llm service for long context with distattention and distributed kvcache","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.14851","last_updated":"2025-06-17T03:49:25Z","snapshot_observed_at":"2026-08-19T12:55:39.450477Z","submitted_at":"2025-06-17T03:49:25Z","title":"Efficient Serving of LLM Applications with Probabilistic Demand Modeling","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-15T19:59:46.533712Z"},"links":{"cited_paper":"/paper/2401.02669","citing_paper":"/paper/2506.14851"},"observation_digest":"sha256:651994ced7292b2387b74267392e713e61e818d57fd2ef4ef049cf9450b3f2bc","observation_id":"ffa105b3-9b42-401d-9e69-c943be07b538","resolution":{"observed_at":"2026-08-15T19:59:46.533712Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02669","last_updated":"2024-07-04T15:12:54Z","snapshot_observed_at":"2026-08-17T04:58:55.259763Z","submitted_at":"2024-01-05T06:53:00Z","title":"Infinite-LLM: Efficient LLM Service for Long Context with DistAttention and Distributed KVCache","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.02669","snapshot_observed_at":"2026-08-06T23:00:11.123886Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20187","last_updated":"2025-07-02T05:12:29Z","snapshot_observed_at":"2026-08-18T03:21:35.999027Z","submitted_at":"2025-06-25T07:26:42Z","title":"Breaking the Boundaries of Long-Context LLM Inference: Adaptive KV Management on a Single Commodity GPU","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T23:00:11.123886Z"},"links":{"cited_paper":"/paper/2401.02669","citing_paper":"/paper/2506.20187"},"observation_digest":"sha256:f3a522cf533d2360db67040b4f43549ac9044bbbbb4b934494d8d3c02a401d82","observation_id":"3ef143eb-2b8a-420b-8be2-f182a9b87772","resolution":{"observed_at":"2026-08-06T23:00:11.123886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02669","last_updated":"2024-07-04T15:12:54Z","snapshot_observed_at":"2026-08-17T04:58:55.259763Z","submitted_at":"2024-01-05T06:53:00Z","title":"Infinite-LLM: Efficient LLM Service for Long Context with DistAttention and Distributed KVCache","version":2},"cited_work":{"arxiv_id":"2401.02669","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2401.02669","snapshot_observed_at":"2026-07-04T09:39:46.796077Z","title":"Infinite-llm: Efficient llm service for long context with distattention and distributed kvcache","venue":null,"work_id":"e075e559-850d-40cb-9934-6995d4bf4c06","year":2024},"citing_paper":{"arxiv_id":"2507.09025","last_updated":"2026-04-18T10:36:33Z","snapshot_observed_at":"2026-08-16T17:15:59.946268Z","submitted_at":"2025-07-11T21:19:18Z","title":"Lizard: An Efficient Linearization Framework for Large Language Models","version":4},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-19T04:37:55.034479Z"},"links":{"cited_paper":"/paper/2401.02669","citing_paper":"/paper/2507.09025"},"observation_digest":"sha256:d5f90513e61a052d1f70454407aac504926a3953b2b95906672546b92cc14318","observation_id":"2acfbd89-7815-46b2-8aaa-613e3183c044","resolution":{"observed_at":"2026-05-19T04:42:04.568701Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02669","last_updated":"2024-07-04T15:12:54Z","snapshot_observed_at":"2026-08-17T04:58:55.259763Z","submitted_at":"2024-01-05T06:53:00Z","title":"Infinite-LLM: Efficient LLM Service for Long Context with DistAttention and Distributed KVCache","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.02669","snapshot_observed_at":"2026-08-05T18:46:59.973133Z","title":"Infinite-llm: Efficient llm service for long context with distattention and distributed kvcache,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.14239","last_updated":"2025-08-19T19:57:34Z","snapshot_observed_at":"2026-08-20T04:36:33.045310Z","submitted_at":"2025-08-19T19:57:34Z","title":"A Distributed Learned Hash Table","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-05T18:46:59.973133Z"},"links":{"cited_paper":"/paper/2401.02669","citing_paper":"/paper/2508.14239"},"observation_digest":"sha256:6988c19920a91c68c5b103e1f6d1ce947bb180d73992967fc44729f8abe982b0","observation_id":"ed2d8fec-9b06-4bf3-9a06-6b3beb397a16","resolution":{"observed_at":"2026-08-05T18:46:59.973133Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02669","last_updated":"2024-07-04T15:12:54Z","snapshot_observed_at":"2026-08-17T04:58:55.259763Z","submitted_at":"2024-01-05T06:53:00Z","title":"Infinite-LLM: Efficient LLM Service for Long Context with DistAttention and Distributed KVCache","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.02669","snapshot_observed_at":"2026-08-04T20:53:32.388187Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08309","last_updated":"2025-09-10T06:06:51Z","snapshot_observed_at":"2026-08-19T23:55:02.608495Z","submitted_at":"2025-09-10T06:06:51Z","title":"Hetis: Serving LLMs in Heterogeneous GPU Clusters with Fine-grained and Dynamic Parallelism","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-04T20:53:32.388187Z"},"links":{"cited_paper":"/paper/2401.02669","citing_paper":"/paper/2509.08309"},"observation_digest":"sha256:414ae5bad51a8b2c414d52349eeddd31d166dc5fa0a3e1a6586e80b000f00b46","observation_id":"9bb1337b-8b54-4029-a2da-6816ad942ff8","resolution":{"observed_at":"2026-08-04T20:53:32.388187Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02669","last_updated":"2024-07-04T15:12:54Z","snapshot_observed_at":"2026-08-17T04:58:55.259763Z","submitted_at":"2024-01-05T06:53:00Z","title":"Infinite-LLM: Efficient LLM Service for Long Context with DistAttention and Distributed KVCache","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.02669","snapshot_observed_at":"2026-08-04T18:00:22.906958Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.10372","last_updated":"2025-09-12T16:05:27Z","snapshot_observed_at":"2026-08-22T04:18:27.202820Z","submitted_at":"2025-09-12T16:05:27Z","title":"MCBP: A Memory-Compute Efficient LLM Inference Accelerator Leveraging Bit-Slice-enabled Sparsity and Repetitiveness","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-04T18:00:22.906958Z"},"links":{"cited_paper":"/paper/2401.02669","citing_paper":"/paper/2509.10372"},"observation_digest":"sha256:d6e7ab6f5e4544afa1ad5d803f0130f4410fd2be886530252ba68d8eeb83f24b","observation_id":"ad07febf-f548-439d-87dc-15467a593779","resolution":{"observed_at":"2026-08-04T18:00:22.906958Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02669","last_updated":"2024-07-04T15:12:54Z","snapshot_observed_at":"2026-08-17T04:58:55.259763Z","submitted_at":"2024-01-05T06:53:00Z","title":"Infinite-LLM: Efficient LLM Service for Long Context with DistAttention and Distributed KVCache","version":2},"cited_work":{"arxiv_id":"2401.02669","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2401.02669","snapshot_observed_at":"2026-07-04T09:39:46.796077Z","title":"Infinite-llm: Efficient llm service for long context with distattention and distributed kvcache","venue":null,"work_id":"e075e559-850d-40cb-9934-6995d4bf4c06","year":2024},"citing_paper":{"arxiv_id":"2509.19729","last_updated":"2026-04-22T06:30:11Z","snapshot_observed_at":"2026-08-17T01:45:13.088196Z","submitted_at":"2025-09-24T03:15:37Z","title":"Amoeba: Runtime Tensor Parallel Transformation for LLM Inference Services","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-18T14:59:38.194894Z"},"links":{"cited_paper":"/paper/2401.02669","citing_paper":"/paper/2509.19729"},"observation_digest":"sha256:91874035dce9e453015173501de12fcf3a423e8e8120561b848bf3ac4dbe5c6a","observation_id":"e70b8795-08b9-425e-b467-d9aee185cbda","resolution":{"observed_at":"2026-05-18T15:01:31.480503Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02669","last_updated":"2024-07-04T15:12:54Z","snapshot_observed_at":"2026-08-17T04:58:55.259763Z","submitted_at":"2024-01-05T06:53:00Z","title":"Infinite-LLM: Efficient LLM Service for Long Context with DistAttention and Distributed KVCache","version":2},"cited_work":{"arxiv_id":"2401.02669","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2401.02669","snapshot_observed_at":"2026-07-04T09:39:46.796077Z","title":"Infinite-llm: Efficient llm service for long context with distattention and distributed kvcache","venue":null,"work_id":"e075e559-850d-40cb-9934-6995d4bf4c06","year":2024},"citing_paper":{"arxiv_id":"2512.09427","last_updated":"2026-04-21T07:27:04Z","snapshot_observed_at":"2026-08-11T09:16:38.842446Z","submitted_at":"2025-12-10T08:52:20Z","title":"ODMA: On-Demand Memory Allocation Strategy for LLM Serving on LPDDR-Class Accelerators","version":5},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-16T23:54:08.052482Z"},"links":{"cited_paper":"/paper/2401.02669","citing_paper":"/paper/2512.09427"},"observation_digest":"sha256:5eeece9e8238209827e6e97b193bb674b0d4aa9e2dc3db3b5593ce152bb67ea8","observation_id":"f8f9b874-4417-4e32-b77f-ac415e417089","resolution":{"observed_at":"2026-05-16T23:58:43.002547Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02669","last_updated":"2024-07-04T15:12:54Z","snapshot_observed_at":"2026-08-17T04:58:55.259763Z","submitted_at":"2024-01-05T06:53:00Z","title":"Infinite-LLM: Efficient LLM Service for Long Context with DistAttention and Distributed KVCache","version":2},"cited_work":{"arxiv_id":"2401.02669","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2401.02669","snapshot_observed_at":"2026-07-04T09:39:46.796077Z","title":"Infinite-llm: Efficient llm service for long context with distattention and distributed kvcache","venue":null,"work_id":"e075e559-850d-40cb-9934-6995d4bf4c06","year":2024},"citing_paper":{"arxiv_id":"2512.09472","last_updated":"2026-05-21T07:26:42Z","snapshot_observed_at":"2026-08-16T23:12:24.297266Z","submitted_at":"2025-12-10T09:47:40Z","title":"WarmServe: Enabling One-for-Many GPU Prewarming for Multi-LLM Serving","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-22T12:22:56.972437Z"},"links":{"cited_paper":"/paper/2401.02669","citing_paper":"/paper/2512.09472"},"observation_digest":"sha256:09940322217675b82fdcded0d025745dcd246fc0a4b72161f86c6d481df15d67","observation_id":"16bb11fb-fa06-4431-8ca8-766fd9eaa14a","resolution":{"observed_at":"2026-05-22T12:24:51.260073Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02669","last_updated":"2024-07-04T15:12:54Z","snapshot_observed_at":"2026-08-17T04:58:55.259763Z","submitted_at":"2024-01-05T06:53:00Z","title":"Infinite-LLM: Efficient LLM Service for Long Context with DistAttention and Distributed KVCache","version":2},"cited_work":{"arxiv_id":"2401.02669","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2401.02669","snapshot_observed_at":"2026-07-04T09:39:46.796077Z","title":"Infinite-llm: Efficient llm service for long context with distattention and distributed kvcache","venue":null,"work_id":"e075e559-850d-40cb-9934-6995d4bf4c06","year":2024},"citing_paper":{"arxiv_id":"2602.09725","last_updated":"2026-05-12T14:12:11Z","snapshot_observed_at":"2026-08-21T22:05:56.055986Z","submitted_at":"2026-02-10T12:29:02Z","title":"Efficient Remote KV Cache Reuse with GPU-native Video Codec","version":3},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-16T05:21:04.555356Z"},"links":{"cited_paper":"/paper/2401.02669","citing_paper":"/paper/2602.09725"},"observation_digest":"sha256:67c31da8cc393f6cc026e727d5151714956e48597ae1c375f9d1f3b354709042","observation_id":"da0b93bd-fe80-43ac-b4df-b32a3ef2febc","resolution":{"observed_at":"2026-05-16T05:22:22.746402Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02669","last_updated":"2024-07-04T15:12:54Z","snapshot_observed_at":"2026-08-17T04:58:55.259763Z","submitted_at":"2024-01-05T06:53:00Z","title":"Infinite-LLM: Efficient LLM Service for Long Context with DistAttention and Distributed KVCache","version":2},"cited_work":{"arxiv_id":"2401.02669","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2401.02669","snapshot_observed_at":"2026-07-04T09:39:46.796077Z","title":"Infinite-llm: Efficient llm service for long context with distattention and distributed kvcache","venue":null,"work_id":"e075e559-850d-40cb-9934-6995d4bf4c06","year":2024},"citing_paper":{"arxiv_id":"2603.27960","last_updated":"2026-04-11T06:07:02Z","snapshot_observed_at":"2026-08-11T16:23:12.824554Z","submitted_at":"2026-03-30T02:23:37Z","title":"Towards Efficient Large Vision-Language Models: A Comprehensive Survey on Inference Strategies","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-14T21:40:55.343169Z"},"links":{"cited_paper":"/paper/2401.02669","citing_paper":"/paper/2603.27960"},"observation_digest":"sha256:4fc4d444d8a06d60be0947a1276432a4b5f5d7703f451c96abfc949b36660702","observation_id":"2579936f-e5c7-486b-8930-e7604ba86662","resolution":{"observed_at":"2026-05-14T21:43:00.683591Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02669","last_updated":"2024-07-04T15:12:54Z","snapshot_observed_at":"2026-08-17T04:58:55.259763Z","submitted_at":"2024-01-05T06:53:00Z","title":"Infinite-LLM: Efficient LLM Service for Long Context with DistAttention and Distributed KVCache","version":2},"cited_work":{"arxiv_id":"2401.02669","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2401.02669","snapshot_observed_at":"2026-07-04T09:39:46.796077Z","title":"Infinite-llm: Efficient llm service for long context with distattention and distributed kvcache","venue":null,"work_id":"e075e559-850d-40cb-9934-6995d4bf4c06","year":2024},"citing_paper":{"arxiv_id":"2604.26103","last_updated":"2026-04-30T09:10:31Z","snapshot_observed_at":"2026-08-15T09:19:00.888874Z","submitted_at":"2026-04-28T20:36:50Z","title":"AMMA: A Multi-Chiplet Memory-Centric Architecture for Low-Latency 1M Context Attention Serving","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-07T14:16:46.241126Z"},"links":{"cited_paper":"/paper/2401.02669","citing_paper":"/paper/2604.26103"},"observation_digest":"sha256:e9ca06edd74c8664b6f09afeffaaf9d66e7a3e4bef955207b815b9cfc5adbb80","observation_id":"75e5528a-0793-4a57-b499-daede83601df","resolution":{"observed_at":"2026-05-12T00:46:13.115621Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02669","last_updated":"2024-07-04T15:12:54Z","snapshot_observed_at":"2026-08-17T04:58:55.259763Z","submitted_at":"2024-01-05T06:53:00Z","title":"Infinite-LLM: Efficient LLM Service for Long Context with DistAttention and Distributed KVCache","version":2},"cited_work":{"arxiv_id":"2401.02669","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2401.02669","snapshot_observed_at":"2026-07-04T09:39:46.796077Z","title":"Infinite-llm: Efficient llm service for long context with distattention and distributed kvcache","venue":null,"work_id":"e075e559-850d-40cb-9934-6995d4bf4c06","year":2024},"citing_paper":{"arxiv_id":"2604.26837","last_updated":"2026-04-29T16:02:00Z","snapshot_observed_at":"2026-08-13T12:10:20.507385Z","submitted_at":"2026-04-29T16:02:00Z","title":"Unifying Sparse Attention with Hierarchical Memory for Scalable Long-Context LLM Serving","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-07T13:15:21.201950Z"},"links":{"cited_paper":"/paper/2401.02669","citing_paper":"/paper/2604.26837"},"observation_digest":"sha256:dfc13b8e891a022b0bd25d50c6274394e542379b33721de9e952c8d0db48dd66","observation_id":"c04477b0-eb27-4ef1-9abb-3cff65fd2872","resolution":{"observed_at":"2026-05-12T09:01:25.951780Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02669","last_updated":"2024-07-04T15:12:54Z","snapshot_observed_at":"2026-08-17T04:58:55.259763Z","submitted_at":"2024-01-05T06:53:00Z","title":"Infinite-LLM: Efficient LLM Service for Long Context with DistAttention and Distributed KVCache","version":2},"cited_work":{"arxiv_id":"2401.02669","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2401.02669","snapshot_observed_at":"2026-07-04T09:39:46.796077Z","title":"Infinite-llm: Efficient llm service for long context with distattention and distributed kvcache","venue":null,"work_id":"e075e559-850d-40cb-9934-6995d4bf4c06","year":2024},"citing_paper":{"arxiv_id":"2604.26968","last_updated":"2026-08-07T13:10:21Z","snapshot_observed_at":"2026-08-12T23:12:24.109119Z","submitted_at":"2026-04-19T21:34:09Z","title":"Predictive Multi-Tier Memory Management for KV Cache in Large-Scale GPU Inference","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-10T05:01:02.726796Z"},"links":{"cited_paper":"/paper/2401.02669","citing_paper":"/paper/2604.26968"},"observation_digest":"sha256:c9181d99b507713eae2e411df24a6ba055d01b053ccae87b3d8cfe36d22b4a0b","observation_id":"6bad24d2-0ff9-4487-916c-a8d753e716db","resolution":{"observed_at":"2026-05-10T10:14:10.664745Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02669","last_updated":"2024-07-04T15:12:54Z","snapshot_observed_at":"2026-08-17T04:58:55.259763Z","submitted_at":"2024-01-05T06:53:00Z","title":"Infinite-LLM: Efficient LLM Service for Long Context with DistAttention and Distributed KVCache","version":2},"cited_work":{"arxiv_id":"2401.02669","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2401.02669","snapshot_observed_at":"2026-07-04T09:39:46.796077Z","title":"Infinite-llm: Efficient llm service for long context with distattention and distributed kvcache","venue":null,"work_id":"e075e559-850d-40cb-9934-6995d4bf4c06","year":2024},"citing_paper":{"arxiv_id":"2605.05888","last_updated":"2026-05-07T08:58:51Z","snapshot_observed_at":"2026-08-08T16:00:07.637523Z","submitted_at":"2026-05-07T08:58:51Z","title":"MoE-Hub: Taming Software Complexity for Seamless MoE Overlap with Hardware-Accelerated Communication on Multi-GPU Systems","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-08T04:29:57.548702Z"},"links":{"cited_paper":"/paper/2401.02669","citing_paper":"/paper/2605.05888"},"observation_digest":"sha256:2b5b0b223908267e4df971d6fafb8dab5278c70b2f27a353dec67f6d345c6cb0","observation_id":"faf9b1b0-c28a-4933-83fb-b86bdfbc2e54","resolution":{"observed_at":"2026-05-11T21:46:21.116269Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02669","last_updated":"2024-07-04T15:12:54Z","snapshot_observed_at":"2026-08-17T04:58:55.259763Z","submitted_at":"2024-01-05T06:53:00Z","title":"Infinite-LLM: Efficient LLM Service for Long Context with DistAttention and Distributed KVCache","version":2},"cited_work":{"arxiv_id":"2401.02669","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2401.02669","snapshot_observed_at":"2026-07-04T09:39:46.796077Z","title":"Infinite-llm: Efficient llm service for long context with distattention and distributed kvcache","venue":null,"work_id":"e075e559-850d-40cb-9934-6995d4bf4c06","year":2024},"citing_paper":{"arxiv_id":"2605.21100","last_updated":"2026-05-20T12:28:51Z","snapshot_observed_at":"2026-08-15T15:35:40.421490Z","submitted_at":"2026-05-20T12:28:51Z","title":"NanoCP: Request-Level Dynamic Context Parallelism for Data-Expert Parallel Decoding","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-21T01:51:38.671365Z"},"links":{"cited_paper":"/paper/2401.02669","citing_paper":"/paper/2605.21100"},"observation_digest":"sha256:ceb416bd1b0e0cd2e1e9d8659e9133f881c720d2efa7c41c61e91e79cae4caec","observation_id":"ff5cb41f-8c9e-4ce2-9dc4-d41dc71083a0","resolution":{"observed_at":"2026-05-21T01:53:54.623374Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02669","last_updated":"2024-07-04T15:12:54Z","snapshot_observed_at":"2026-08-17T04:58:55.259763Z","submitted_at":"2024-01-05T06:53:00Z","title":"Infinite-LLM: Efficient LLM Service for Long Context with DistAttention and Distributed KVCache","version":2},"cited_work":{"arxiv_id":"2401.02669","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2401.02669","snapshot_observed_at":"2026-07-04T09:39:46.796077Z","title":"Infinite-llm: Efficient llm service for long context with distattention and distributed kvcache","venue":null,"work_id":"e075e559-850d-40cb-9934-6995d4bf4c06","year":2024},"citing_paper":{"arxiv_id":"2606.01502","last_updated":"2026-05-31T23:53:24Z","snapshot_observed_at":"2026-08-13T17:07:29.514916Z","submitted_at":"2026-05-31T23:53:24Z","title":"Move the Query, Not the Cache: Characterizing Cross-Instance Latent Attention Redistribution Across GPU Fabrics","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-28T16:02:53.294235Z"},"links":{"cited_paper":"/paper/2401.02669","citing_paper":"/paper/2606.01502"},"observation_digest":"sha256:de28d43b9c837b8d333ea36a985908cffdad87b7d506af82ef12ba4cf8d09eda","observation_id":"20d0172d-b5cc-4067-9b60-c9f16ce82159","resolution":{"observed_at":"2026-07-01T21:56:15.745685Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02669","last_updated":"2024-07-04T15:12:54Z","snapshot_observed_at":"2026-08-17T04:58:55.259763Z","submitted_at":"2024-01-05T06:53:00Z","title":"Infinite-LLM: Efficient LLM Service for Long Context with DistAttention and Distributed KVCache","version":2},"cited_work":{"arxiv_id":"2401.02669","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2401.02669","snapshot_observed_at":"2026-07-04T09:39:46.796077Z","title":"Infinite-llm: Efficient llm service for long context with distattention and distributed kvcache","venue":null,"work_id":"e075e559-850d-40cb-9934-6995d4bf4c06","year":2024},"citing_paper":{"arxiv_id":"2606.06453","last_updated":"2026-06-04T17:48:17Z","snapshot_observed_at":"2026-08-08T14:28:58.546665Z","submitted_at":"2026-06-04T17:48:17Z","title":"Vortex: Efficient and Programmable Sparse Attention Serving for AI Agents","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-28T01:07:14.691347Z"},"links":{"cited_paper":"/paper/2401.02669","citing_paper":"/paper/2606.06453"},"observation_digest":"sha256:178674aa7a3d584a44d2585d3554a63b8e4a7eea25c987b4ef32069083cd950b","observation_id":"b602a9ce-8789-45ed-ad4b-bb55206c23d4","resolution":{"observed_at":"2026-07-02T13:36:59.487421Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02669","last_updated":"2024-07-04T15:12:54Z","snapshot_observed_at":"2026-08-17T04:58:55.259763Z","submitted_at":"2024-01-05T06:53:00Z","title":"Infinite-LLM: Efficient LLM Service for Long Context with DistAttention and Distributed KVCache","version":2},"cited_work":{"arxiv_id":"2401.02669","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2401.02669","snapshot_observed_at":"2026-07-04T09:39:46.796077Z","title":"Infinite-llm: Efficient llm service for long context with distattention and distributed kvcache","venue":null,"work_id":"e075e559-850d-40cb-9934-6995d4bf4c06","year":2024},"citing_paper":{"arxiv_id":"2606.21842","last_updated":"2026-06-20T02:28:28Z","snapshot_observed_at":"2026-08-16T15:37:03.611031Z","submitted_at":"2026-06-20T02:28:28Z","title":"Agent-Assisted Side-Channel Attacks on Non-Prefix KV Cache in RAG","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-26T12:19:30.666750Z"},"links":{"cited_paper":"/paper/2401.02669","citing_paper":"/paper/2606.21842"},"observation_digest":"sha256:47684530fda1fd017e09ad3f237ff307ab8e51661fa8086a318e7e39bf26a03f","observation_id":"8eac129a-9c81-4126-9857-e480cfe8c2a0","resolution":{"observed_at":"2026-07-04T07:59:40.406576Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02669","last_updated":"2024-07-04T15:12:54Z","snapshot_observed_at":"2026-08-17T04:58:55.259763Z","submitted_at":"2024-01-05T06:53:00Z","title":"Infinite-LLM: Efficient LLM Service for Long Context with DistAttention and Distributed KVCache","version":2},"cited_work":{"arxiv_id":"2401.02669","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2401.02669","snapshot_observed_at":"2026-07-04T09:39:46.796077Z","title":"Infinite-llm: Efficient llm service for long context with distattention and distributed kvcache","venue":null,"work_id":"e075e559-850d-40cb-9934-6995d4bf4c06","year":2024},"citing_paper":{"arxiv_id":"2606.22175","last_updated":"2026-06-20T18:02:59Z","snapshot_observed_at":"2026-08-14T02:57:15.523407Z","submitted_at":"2026-06-20T18:02:59Z","title":"StickyInvoc: Rethinking Task Models for High-throughput Workflows in the LLM Era","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-06-26T11:16:53.967397Z"},"links":{"cited_paper":"/paper/2401.02669","citing_paper":"/paper/2606.22175"},"observation_digest":"sha256:ab599e3d252789070c4de44ef06ff03f15b828f05f374b588132fb818077ec9a","observation_id":"f99d961d-bf9f-4f77-a8b2-35589c7ddf1a","resolution":{"observed_at":"2026-07-04T08:39:42.046455Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02669","last_updated":"2024-07-04T15:12:54Z","snapshot_observed_at":"2026-08-17T04:58:55.259763Z","submitted_at":"2024-01-05T06:53:00Z","title":"Infinite-LLM: Efficient LLM Service for Long Context with DistAttention and Distributed KVCache","version":2},"cited_work":{"arxiv_id":"2401.02669","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2401.02669","snapshot_observed_at":"2026-07-04T09:39:46.796077Z","title":"Infinite-llm: Efficient llm service for long context with distattention and distributed kvcache","venue":null,"work_id":"e075e559-850d-40cb-9934-6995d4bf4c06","year":2024},"citing_paper":{"arxiv_id":"2606.22541","last_updated":"2026-06-21T14:57:45Z","snapshot_observed_at":"2026-08-15T02:15:13.395465Z","submitted_at":"2026-06-21T14:57:45Z","title":"ASAP: A Disaggregated and Asynchronous Inference System for MoE Prefill","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-26T09:42:39.573568Z"},"links":{"cited_paper":"/paper/2401.02669","citing_paper":"/paper/2606.22541"},"observation_digest":"sha256:8a5082a0eec2b262805a3a623d02ae232ecfaad6183c1befb00f759cf182248a","observation_id":"5178e071-885e-44f4-8fed-b50993fa7318","resolution":{"observed_at":"2026-07-04T09:39:46.797595Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02669","last_updated":"2024-07-04T15:12:54Z","snapshot_observed_at":"2026-08-17T04:58:55.259763Z","submitted_at":"2024-01-05T06:53:00Z","title":"Infinite-LLM: Efficient LLM Service for Long Context with DistAttention and Distributed KVCache","version":2},"cited_work":{"arxiv_id":"2401.02669","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2401.02669","snapshot_observed_at":"2026-07-04T09:39:46.796077Z","title":"Infinite-llm: Efficient llm service for long context with distattention and distributed kvcache","venue":null,"work_id":"e075e559-850d-40cb-9934-6995d4bf4c06","year":2024},"citing_paper":{"arxiv_id":"2606.29207","last_updated":"2026-06-28T05:16:17Z","snapshot_observed_at":"2026-08-12T17:05:18.584525Z","submitted_at":"2026-06-28T05:16:17Z","title":"KernelFlume: Elastic Core-Attention Scaling for Agentic Long-Context Decoding","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-30T02:54:11.777615Z"},"links":{"cited_paper":"/paper/2401.02669","citing_paper":"/paper/2606.29207"},"observation_digest":"sha256:230928d3b00746ba088e5601d6a2acd032f01193e8d58a6627152a35a3935161","observation_id":"0c43c7c5-d02a-4706-991e-1671fce3e692","resolution":{"observed_at":"2026-06-30T03:04:14.208841Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02669","last_updated":"2024-07-04T15:12:54Z","snapshot_observed_at":"2026-08-17T04:58:55.259763Z","submitted_at":"2024-01-05T06:53:00Z","title":"Infinite-LLM: Efficient LLM Service for Long Context with DistAttention and Distributed KVCache","version":2},"cited_work":{"arxiv_id":"2401.02669","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2401.02669","snapshot_observed_at":"2026-07-04T09:39:46.796077Z","title":"Infinite-llm: Efficient llm service for long context with distattention and distributed kvcache","venue":null,"work_id":"e075e559-850d-40cb-9934-6995d4bf4c06","year":2024},"citing_paper":{"arxiv_id":"2606.31093","last_updated":"2026-06-30T03:29:21Z","snapshot_observed_at":"2026-08-13T01:02:25.506222Z","submitted_at":"2026-06-30T03:29:21Z","title":"Omni-Flow: A Unified Workflow Orchestration and Distributed KV Cache Sharing Framework for Multimodal Inference","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-07-01T04:13:53.722933Z"},"links":{"cited_paper":"/paper/2401.02669","citing_paper":"/paper/2606.31093"},"observation_digest":"sha256:b7704fd2ba322c6f1c60fb9d39aa94c6383da543e9edfddacc9b368288fa44e2","observation_id":"47df7295-932e-4ec0-850d-898b84ec05d2","resolution":{"observed_at":"2026-07-01T11:35:43.654306Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02669","last_updated":"2024-07-04T15:12:54Z","snapshot_observed_at":"2026-08-17T04:58:55.259763Z","submitted_at":"2024-01-05T06:53:00Z","title":"Infinite-LLM: Efficient LLM Service for Long Context with DistAttention and Distributed KVCache","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.02669","snapshot_observed_at":"2026-07-12T09:50:23.266920Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02574","last_updated":"2026-06-30T16:12:40Z","snapshot_observed_at":"2026-08-13T16:31:58.188253Z","submitted_at":"2026-06-30T16:12:40Z","title":"From Tensor Buffer to Distributed Memory Hierarchy: A Survey of KV Cache Management for LLM Serving","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-07-12T09:50:23.266920Z"},"links":{"cited_paper":"/paper/2401.02669","citing_paper":"/paper/2607.02574"},"observation_digest":"sha256:9e6d9e635fd341d16ba40165c9857115252afc129b69dccd23c2a50730580543","observation_id":"1beb5909-efba-4ad6-bee9-51a4df9b23de","resolution":{"observed_at":"2026-07-12T09:50:23.266920Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02669","last_updated":"2024-07-04T15:12:54Z","snapshot_observed_at":"2026-08-17T04:58:55.259763Z","submitted_at":"2024-01-05T06:53:00Z","title":"Infinite-LLM: Efficient LLM Service for Long Context with DistAttention and Distributed KVCache","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.02669","snapshot_observed_at":"2026-08-01T20:54:14.172249Z","title":"Infinite-llm: Efficient llm service for long context with distattention and distributed kvcache,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16488","last_updated":"2026-07-17T20:27:26Z","snapshot_observed_at":"2026-08-18T11:45:42.205768Z","submitted_at":"2026-07-17T20:27:26Z","title":"Auto-Scaling Heterogeneous Neural Processing Units for Energy and Cost-Efficient LLM Serving","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-01T20:54:14.172249Z"},"links":{"cited_paper":"/paper/2401.02669","citing_paper":"/paper/2607.16488"},"observation_digest":"sha256:1e67afa508cd96608da87f6c24e55718d633d72f12de0f5a49dfba1d94400e18","observation_id":"6a4c2f96-f166-4bb8-a67b-e77b4b5cb1a8","resolution":{"observed_at":"2026-08-01T20:54:14.172249Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02669","last_updated":"2024-07-04T15:12:54Z","snapshot_observed_at":"2026-08-17T04:58:55.259763Z","submitted_at":"2024-01-05T06:53:00Z","title":"Infinite-LLM: Efficient LLM Service for Long Context with DistAttention and Distributed KVCache","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.02669","snapshot_observed_at":"2026-08-01T17:16:38.402742Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.17715","last_updated":"2026-07-20T09:09:23Z","snapshot_observed_at":"2026-08-06T08:28:52.422763Z","submitted_at":"2026-07-20T09:09:23Z","title":"C$^2$KV: Compressed and Composable KV Cache Reuse for Efficient LLM Inference","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-01T17:16:38.402742Z"},"links":{"cited_paper":"/paper/2401.02669","citing_paper":"/paper/2607.17715"},"observation_digest":"sha256:c9c65765d9b1b0016287acd1b8b2df5e4905c60dcec1718889b04c87e74df20f","observation_id":"e28df95a-227a-46d1-95a5-62f39a064cc7","resolution":{"observed_at":"2026-08-01T17:16:38.402742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02669","last_updated":"2024-07-04T15:12:54Z","snapshot_observed_at":"2026-08-17T04:58:55.259763Z","submitted_at":"2024-01-05T06:53:00Z","title":"Infinite-LLM: Efficient LLM Service for Long Context with DistAttention and Distributed KVCache","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.02669","snapshot_observed_at":"2026-08-03T00:55:34.973260Z","title":"Infinite-LLM: Efficient LLM Ser- vice with DistAttention and Distributed KVCache,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.28633","last_updated":"2026-08-07T12:49:40Z","snapshot_observed_at":"2026-08-16T23:08:00.523537Z","submitted_at":"2026-04-19T22:46:57Z","title":"Topology-Aware Data Movement for Disaggregated GPU Inference","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-03T00:55:34.973260Z"},"links":{"cited_paper":"/paper/2401.02669","citing_paper":"/paper/2607.28633"},"observation_digest":"sha256:55943523d48ea0fc5ff1d63d1cf74552305ec4b9ff70dc774447131dcf362ddc","observation_id":"91a2a6e7-f1be-498c-b55a-0a1f766c954f","resolution":{"observed_at":"2026-08-03T00:55:34.973260Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2401.02669/citation-record","integrity":"/paper/2401.02669/integrity","json":"/paper/2401.02669/citation-record.json","paper":"/paper/2401.02669"},"outbound":[],"paper":{"arxiv_id":"2401.02669","last_updated":"2024-07-04T15:12:54Z","latest_version":2,"primary_category":"cs.DC","snapshot_observed_at":"2026-08-17T04:58:55.259763Z","submitted_at":"2024-01-05T06:53:00Z","title":"Infinite-LLM: Efficient LLM Service for Long Context with DistAttention and Distributed KVCache"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"thesis":"As of 22 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 45 inbound Pith citation observations for arXiv:2401.02669."}