{"as_of":"2026-08-22T19:30:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f2eb40bbf3f7f7fb7f4390a3628d338a191d484b22b7b3e517e6fbb0580dceb7","coverage":[{"denominator":63,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":63,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T17:55:12.532975Z","state":"measured"},{"denominator":66,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":66,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-22T06:32:14.747728+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T17:32:37.642188Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-11T01:57:51.549825Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2508.15881","last_updated":"2025-08-25T02:24:20Z","snapshot_observed_at":"2026-08-19T17:54:54.763717Z","submitted_at":"2025-08-21T15:25:40Z","title":"TPLA: Tensor Parallel Latent Attention for Efficient Disaggregated Prefill and Decode Inference","version":2},"cited_work":{"arxiv_id":"2508.15881","doi":null,"metadata_source":"pith","pith_arxiv_id":"2508.15881","snapshot_observed_at":"2026-07-11T01:57:51.549825Z","title":"TPLA: Tensor Parallel Latent Attention for Efficient Disaggregated Prefill and Decode Inference","venue":"cs.LG","work_id":"e46d236d-5d93-4da9-8236-fd22cd1117a0","year":2025},"citing_paper":{"arxiv_id":"2607.05876","last_updated":"2026-07-08T02:47:41Z","snapshot_observed_at":"2026-08-20T02:52:02.866492Z","submitted_at":"2026-07-07T06:11:54Z","title":"Think Before You Grid-Search: Floor-First Triage for LLM Serving","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-08T22:38:12.637901Z"},"links":{"cited_paper":"/paper/2508.15881","citing_paper":"/paper/2607.05876"},"observation_digest":"sha256:604771c05ab71a98eca997a4bbe238f96d8f1f02b203583bff1eda3446bb4ec5","observation_id":"bb906a33-09fe-4c7b-bf98-729123df890d","resolution":{"observed_at":"2026-07-08T22:45:40.138975Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.15881","last_updated":"2025-08-25T02:24:20Z","snapshot_observed_at":"2026-08-19T17:54:54.763717Z","submitted_at":"2025-08-21T15:25:40Z","title":"TPLA: Tensor Parallel Latent Attention for Efficient Disaggregated Prefill and Decode Inference","version":2},"cited_work":{"arxiv_id":"2508.15881","doi":null,"metadata_source":"pith","pith_arxiv_id":"2508.15881","snapshot_observed_at":"2026-07-11T01:57:51.549825Z","title":"TPLA: Tensor Parallel Latent Attention for Efficient Disaggregated Prefill and Decode Inference","venue":"cs.LG","work_id":"e46d236d-5d93-4da9-8236-fd22cd1117a0","year":2025},"citing_paper":{"arxiv_id":"2607.05876","last_updated":"2026-07-08T02:47:41Z","snapshot_observed_at":"2026-08-20T02:52:02.866492Z","submitted_at":"2026-07-07T06:11:54Z","title":"Think Before You Grid-Search: Floor-First Triage for LLM Serving","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-11T01:55:09.658053Z"},"links":{"cited_paper":"/paper/2508.15881","citing_paper":"/paper/2607.05876"},"observation_digest":"sha256:f0ba0200e3112ce7199885f9b0b9702e962a264094c9b673a1b7428489524ee8","observation_id":"f560a902-6b34-41e3-84c4-5b085714bdde","resolution":{"observed_at":"2026-07-11T01:57:51.582428Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.15881","last_updated":"2025-08-25T02:24:20Z","snapshot_observed_at":"2026-08-19T17:54:54.763717Z","submitted_at":"2025-08-21T15:25:40Z","title":"TPLA: Tensor Parallel Latent Attention for Efficient Disaggregated Prefill and Decode Inference","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.15881","snapshot_observed_at":"2026-08-01T17:32:37.642188Z","title":"Inference/decode only","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17644","last_updated":"2026-07-20T07:57:34Z","snapshot_observed_at":"2026-08-17T12:59:56.886335Z","submitted_at":"2026-07-20T07:57:34Z","title":"A Training-Memory Regression in MLA Sequence Parallelism: Why Megatron-Core Forbids Absorption, and LAGA -- a Communication-Efficient Fix","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-01T17:32:37.642188Z"},"links":{"cited_paper":"/paper/2508.15881","citing_paper":"/paper/2607.17644"},"observation_digest":"sha256:0610828d9d90025699776875788731483a910c937cf2c433a9267c2e3ae65101","observation_id":"6107027a-ed16-41c6-ab09-fbc260fc3daa","resolution":{"observed_at":"2026-08-01T17:32:37.642188Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2508.15881/citation-record","integrity":"/paper/2508.15881/integrity","json":"/paper/2508.15881/citation-record.json","paper":"/paper/2508.15881"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:55:05.969609Z","title":"Hello GPT-4o, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.15881","last_updated":"2025-08-25T02:24:20Z","snapshot_observed_at":"2026-08-19T17:54:54.763717Z","submitted_at":"2025-08-21T15:25:40Z","title":"TPLA: Tensor Parallel Latent Attention for Efficient Disaggregated Prefill and Decode Inference","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-05T17:55:05.969609Z"},"links":{"citing_paper":"/paper/2508.15881"},"observation_digest":"sha256:285f4439bd6a4a615e27791789a1174d90a54cd12f6db4a6521afeec1cb77ee6","observation_id":"6edc2b6b-c2c2-4309-9ccc-ad3b0e024c57","resolution":{"observed_at":"2026-08-05T17:55:05.969609Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:55:06.070966Z","title":"Claude 3.5 sonnet, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.15881","last_updated":"2025-08-25T02:24:20Z","snapshot_observed_at":"2026-08-19T17:54:54.763717Z","submitted_at":"2025-08-21T15:25:40Z","title":"TPLA: Tensor Parallel Latent Attention for Efficient Disaggregated Prefill and Decode Inference","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-05T17:55:06.070966Z"},"links":{"citing_paper":"/paper/2508.15881"},"observation_digest":"sha256:fe33faee1efd2b4e28a42f3cfa43b2186e75680f2cdd2378cf08ddff165ba1b9","observation_id":"fa797d20-45f1-49d0-a11c-81497eb6b47f","resolution":{"observed_at":"2026-08-05T17:55:06.070966Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-08-14T18:15:53.516440Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-05T17:55:06.170024Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.15881","last_updated":"2025-08-25T02:24:20Z","snapshot_observed_at":"2026-08-19T17:54:54.763717Z","submitted_at":"2025-08-21T15:25:40Z","title":"TPLA: Tensor Parallel Latent Attention for Efficient Disaggregated Prefill and Decode Inference","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-05T17:55:06.170024Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2508.15881"},"observation_digest":"sha256:2d13b0f4af74c4eed822159fb52253e3db617a3d21cbc7b60c1519bc5e11bc41","observation_id":"965d0c1e-df52-49f4-ba11-53487b71ee5c","resolution":{"observed_at":"2026-08-05T17:55:06.170024Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:55:06.200705Z","title":"Improving language understanding by generative pre-training","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2508.15881","last_updated":"2025-08-25T02:24:20Z","snapshot_observed_at":"2026-08-19T17:54:54.763717Z","submitted_at":"2025-08-21T15:25:40Z","title":"TPLA: Tensor Parallel Latent Attention for Efficient Disaggregated Prefill and Decode Inference","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-05T17:55:06.200705Z"},"links":{"citing_paper":"/paper/2508.15881"},"observation_digest":"sha256:c2c1693fb662dcf1391a31133d82c8acaf48c7519da0e2947dd4ae1b0edb3d89","observation_id":"7f5385e1-57fc-40a2-9fbf-8c44ec7646e5","resolution":{"observed_at":"2026-08-05T17:55:06.200705Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:55:06.281785Z","title":"Language models are few-shot learners","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2508.15881","last_updated":"2025-08-25T02:24:20Z","snapshot_observed_at":"2026-08-19T17:54:54.763717Z","submitted_at":"2025-08-21T15:25:40Z","title":"TPLA: Tensor Parallel Latent Attention for Efficient Disaggregated Prefill and Decode Inference","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-05T17:55:06.281785Z"},"links":{"citing_paper":"/paper/2508.15881"},"observation_digest":"sha256:04f0754022227b25ce3329482e58e212108b93fb51e5512ba81cbfb8ce9104b8","observation_id":"340b23cc-06af-434f-8069-893f1b047482","resolution":{"observed_at":"2026-08-05T17:55:06.281785Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21118","last_updated":"2024-11-04T02:08:55Z","snapshot_observed_at":"2026-08-16T13:29:46.132956Z","submitted_at":"2024-07-30T18:19:38Z","title":"Palu: Compressing KV-Cache with Low-Rank Projection","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21118","snapshot_observed_at":"2026-08-05T17:55:06.348432Z","title":"Palu: Compressing kv-cache with low-rank projection","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.15881","last_updated":"2025-08-25T02:24:20Z","snapshot_observed_at":"2026-08-19T17:54:54.763717Z","submitted_at":"2025-08-21T15:25:40Z","title":"TPLA: Tensor Parallel Latent Attention for Efficient Disaggregated Prefill and Decode Inference","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T17:55:06.348432Z"},"links":{"cited_paper":"/paper/2407.21118","citing_paper":"/paper/2508.15881"},"observation_digest":"sha256:df5efa8e746b9015bc17c88bcf851ae7fac96e47a12ab2cad588845f67ae6652","observation_id":"f929d593-9219-4713-9a8b-eef18834e01c","resolution":{"observed_at":"2026-08-05T17:55:06.348432Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.18893","last_updated":"2026-05-27T05:57:00Z","snapshot_observed_at":"2026-08-17T13:00:02.325853Z","submitted_at":"2025-03-24T17:06:37Z","title":"xKV: Cross-Layer KV-Cache Compression via Aligned Singular Vector Extraction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.18893","snapshot_observed_at":"2026-08-05T17:55:06.405836Z","title":"xkv: Cross-layer svd for kv-cache compression","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.15881","last_updated":"2025-08-25T02:24:20Z","snapshot_observed_at":"2026-08-19T17:54:54.763717Z","submitted_at":"2025-08-21T15:25:40Z","title":"TPLA: Tensor Parallel Latent Attention for Efficient Disaggregated Prefill and Decode Inference","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-05T17:55:06.405836Z"},"links":{"cited_paper":"/paper/2503.18893","citing_paper":"/paper/2508.15881"},"observation_digest":"sha256:e9078ef4b5eff73e642db188eb264c03d200c2e8c7bfcbdaff401f1d2e0e96fe","observation_id":"ec240f3a-ad6f-416e-a183-1e108f27f7a8","resolution":{"observed_at":"2026-08-05T17:55:06.405836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06104","last_updated":"2024-06-18T09:16:14Z","snapshot_observed_at":"2026-08-16T14:28:08.030037Z","submitted_at":"2024-01-11T18:35:26Z","title":"Transformers are Multi-State RNNs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.06104","snapshot_observed_at":"2026-08-05T17:55:06.525852Z","title":"Transformers are multi-state rnns","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.15881","last_updated":"2025-08-25T02:24:20Z","snapshot_observed_at":"2026-08-19T17:54:54.763717Z","submitted_at":"2025-08-21T15:25:40Z","title":"TPLA: Tensor Parallel Latent Attention for Efficient Disaggregated Prefill and Decode Inference","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-05T17:55:06.525852Z"},"links":{"cited_paper":"/paper/2401.06104","citing_paper":"/paper/2508.15881"},"observation_digest":"sha256:c4e50b178a83b03c8318a791de0c7991393770228e1aab33bf5361adbafa43ab","observation_id":"9a51bea7-5360-48d8-995f-7b83e8aec3b8","resolution":{"observed_at":"2026-08-05T17:55:06.525852Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.02750","last_updated":"2024-07-25T09:16:05Z","snapshot_observed_at":"2026-08-12T17:03:50.984887Z","submitted_at":"2024-02-05T06:06:47Z","title":"KIVI: A Tuning-Free Asymmetric 2bit Quantization for KV Cache","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.02750","snapshot_observed_at":"2026-08-05T17:55:06.637672Z","title":"Kivi: A tuning-free asymmetric 2bit quantization for kv cache","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.15881","last_updated":"2025-08-25T02:24:20Z","snapshot_observed_at":"2026-08-19T17:54:54.763717Z","submitted_at":"2025-08-21T15:25:40Z","title":"TPLA: Tensor Parallel Latent Attention for Efficient Disaggregated Prefill and Decode Inference","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-05T17:55:06.637672Z"},"links":{"cited_paper":"/paper/2402.02750","citing_paper":"/paper/2508.15881"},"observation_digest":"sha256:d4ad9e1ab33b04733fd8cb680d01e2adac76813026b0d9914c804ba265b8dd94","observation_id":"1c7d8e1c-4d26-40de-a192-56676940206f","resolution":{"observed_at":"2026-08-05T17:55:06.637672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.06589","last_updated":"2025-06-19T06:06:08Z","snapshot_observed_at":"2026-08-16T12:59:10.445036Z","submitted_at":"2025-01-11T17:06:30Z","title":"Ladder-residual: parallelism-aware architecture for accelerating large model inference with communication overlapping","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.06589","snapshot_observed_at":"2026-08-05T17:55:06.756104Z","title":"Ladder-residual: parallelism-aware architecture for accelerating large model inference with communication overlapping","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.15881","last_updated":"2025-08-25T02:24:20Z","snapshot_observed_at":"2026-08-19T17:54:54.763717Z","submitted_at":"2025-08-21T15:25:40Z","title":"TPLA: Tensor Parallel Latent Attention for Efficient Disaggregated Prefill and Decode Inference","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T17:55:06.756104Z"},"links":{"cited_paper":"/paper/2501.06589","citing_paper":"/paper/2508.15881"},"observation_digest":"sha256:7c86ac0dbb26ae5f031e669a3de6fa57c6ec35f5e38bfe8e841e6f4087e93c0d","observation_id":"f9d7552b-b5c9-49af-b04f-21d5462056a3","resolution":{"observed_at":"2026-08-05T17:55:06.756104Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.20727","last_updated":"2025-06-01T00:33:25Z","snapshot_observed_at":"2026-08-21T03:28:31.728962Z","submitted_at":"2025-02-28T05:20:48Z","title":"SPD: Sync-Point Drop for Efficient Tensor Parallelism of Large Language Models","version":4},"cited_work":{"arxiv_id":"2502.20727","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.20727","snapshot_observed_at":"2026-08-05T17:55:15.131238Z","title":"SPD: Sync-Point Drop for Efficient Tensor Parallelism of Large Language Models","venue":"cs.DC","work_id":"305a4388-6626-4053-b8ef-431a4f7b393c","year":2025},"citing_paper":{"arxiv_id":"2508.15881","last_updated":"2025-08-25T02:24:20Z","snapshot_observed_at":"2026-08-19T17:54:54.763717Z","submitted_at":"2025-08-21T15:25:40Z","title":"TPLA: Tensor Parallel Latent Attention for Efficient Disaggregated Prefill and Decode Inference","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T17:55:06.872252Z"},"links":{"cited_paper":"/paper/2502.20727","citing_paper":"/paper/2508.15881"},"observation_digest":"sha256:17cb6d7d752dd0d953651dfbcfe506680c8897e34a6b54affe271e86dc9fd7ef","observation_id":"d9e895fb-9fb8-4df6-b298-9f9d347da560","resolution":{"observed_at":"2026-08-05T17:55:15.253571Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2506.19645","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:55:14.835775Z","title":"Tensor-parallelism with partially synchronized activations","venue":null,"work_id":"2c0da626-2202-4b62-8600-23030dbdcdc4","year":2025},"citing_paper":{"arxiv_id":"2508.15881","last_updated":"2025-08-25T02:24:20Z","snapshot_observed_at":"2026-08-19T17:54:54.763717Z","submitted_at":"2025-08-21T15:25:40Z","title":"TPLA: Tensor Parallel Latent Attention for Efficient Disaggregated Prefill and Decode Inference","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-05T17:55:06.984488Z"},"links":{"citing_paper":"/paper/2508.15881"},"observation_digest":"sha256:06e66b8101038e6808ea9821426fa064e117ef28564aa73f81697784fc904c2c","observation_id":"d5560a2c-a598-4adb-8bf2-445f2ebf7791","resolution":{"observed_at":"2026-08-05T17:55:14.958729Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04964","last_updated":"2024-12-11T13:27:00Z","snapshot_observed_at":"2026-08-18T12:58:44.217063Z","submitted_at":"2024-12-06T11:29:32Z","title":"Flash Communication: Reducing Tensor Parallelization Bottleneck for Fast Large Language Model Inference","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04964","snapshot_observed_at":"2026-08-05T17:55:07.138663Z","title":"Flash com- munication: Reducing tensor parallelization bottleneck for fast large language model inference","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.15881","last_updated":"2025-08-25T02:24:20Z","snapshot_observed_at":"2026-08-19T17:54:54.763717Z","submitted_at":"2025-08-21T15:25:40Z","title":"TPLA: Tensor Parallel Latent Attention for Efficient Disaggregated Prefill and Decode Inference","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-05T17:55:07.138663Z"},"links":{"cited_paper":"/paper/2412.04964","citing_paper":"/paper/2508.15881"},"observation_digest":"sha256:2d76fe238e5d95deefa4d574b7c1318793f98e68e360337815b62193a40c3c4c","observation_id":"cdaf4a06-f029-4ae2-8f28-43a37df27a65","resolution":{"observed_at":"2026-08-05T17:55:07.138663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.11990","last_updated":"2022-02-04T18:02:23Z","snapshot_observed_at":"2026-08-20T20:09:31.615952Z","submitted_at":"2022-01-28T08:59:57Z","title":"Using DeepSpeed and Megatron to Train Megatron-Turing NLG 530B, A Large-Scale Generative Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.11990","snapshot_observed_at":"2026-08-05T17:55:07.250063Z","title":"Using deepspeed and megatron to train megatron-turing nlg 530b, a large-scale generative language model","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.15881","last_updated":"2025-08-25T02:24:20Z","snapshot_observed_at":"2026-08-19T17:54:54.763717Z","submitted_at":"2025-08-21T15:25:40Z","title":"TPLA: Tensor Parallel Latent Attention for Efficient Disaggregated Prefill and Decode Inference","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-05T17:55:07.250063Z"},"links":{"cited_paper":"/paper/2201.11990","citing_paper":"/paper/2508.15881"},"observation_digest":"sha256:afeda0d9a0ecd74e19e64448e01020c7f084524af5e9b118780a8cffdead76f0","observation_id":"90d1014f-f333-4cb1-9c37-0284d893ebb7","resolution":{"observed_at":"2026-08-05T17:55:07.250063Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13245","last_updated":"2023-12-23T17:55:11Z","snapshot_observed_at":"2026-08-15T06:28:09.529747Z","submitted_at":"2023-05-22T17:16:38Z","title":"GQA: Training Generalized Multi-Query Transformer Models from Multi-Head Checkpoints","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13245","snapshot_observed_at":"2026-08-05T17:55:07.365952Z","title":"Gqa: Training generalized multi-query transformer models from multi-head checkpoints","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.15881","last_updated":"2025-08-25T02:24:20Z","snapshot_observed_at":"2026-08-19T17:54:54.763717Z","submitted_at":"2025-08-21T15:25:40Z","title":"TPLA: Tensor Parallel Latent Attention for Efficient Disaggregated Prefill and Decode Inference","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-05T17:55:07.365952Z"},"links":{"cited_paper":"/paper/2305.13245","citing_paper":"/paper/2508.15881"},"observation_digest":"sha256:a74a8ac767f1f82f3023ec93db6f2af02d5290800771e4e3f0261bd979a64e87","observation_id":"e348d791-4afe-4c49-ae5b-11306a7fa47e","resolution":{"observed_at":"2026-08-05T17:55:07.365952Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.07864","last_updated":"2025-06-12T11:45:57Z","snapshot_observed_at":"2026-08-10T11:58:20.177769Z","submitted_at":"2025-02-11T18:20:18Z","title":"TransMLA: Multi-Head Latent Attention Is All You Need","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.07864","snapshot_observed_at":"2026-08-05T17:55:07.508723Z","title":"Transmla: Multi-head latent attention is all you need","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.15881","last_updated":"2025-08-25T02:24:20Z","snapshot_observed_at":"2026-08-19T17:54:54.763717Z","submitted_at":"2025-08-21T15:25:40Z","title":"TPLA: Tensor Parallel Latent Attention for Efficient Disaggregated Prefill and Decode Inference","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-05T17:55:07.508723Z"},"links":{"cited_paper":"/paper/2502.07864","citing_paper":"/paper/2508.15881"},"observation_digest":"sha256:9b2f3e1420c79e174c04a0a0b92cb4a20d520c7d33463f7560b69b7c99e999aa","observation_id":"63dff6cf-7348-463e-be2b-411436252875","resolution":{"observed_at":"2026-08-05T17:55:07.508723Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04434","snapshot_observed_at":"2026-08-05T17:55:07.673578Z","title":"Deepseek-v2: A strong, economical, and efficient mixture-of-experts language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.15881","last_updated":"2025-08-25T02:24:20Z","snapshot_observed_at":"2026-08-19T17:54:54.763717Z","submitted_at":"2025-08-21T15:25:40Z","title":"TPLA: Tensor Parallel Latent Attention for Efficient Disaggregated Prefill and Decode Inference","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-05T17:55:07.673578Z"},"links":{"cited_paper":"/paper/2405.04434","citing_paper":"/paper/2508.15881"},"observation_digest":"sha256:3a678f28c9015f845542a5b96741035906c319e51e85447eb9c19af3fb9e5b4d","observation_id":"975fa342-94ee-49e6-911b-192190c4e5a3","resolution":{"observed_at":"2026-08-05T17:55:07.673578Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:55:07.854166Z","title":"Llama 3 model card, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.15881","last_updated":"2025-08-25T02:24:20Z","snapshot_observed_at":"2026-08-19T17:54:54.763717Z","submitted_at":"2025-08-21T15:25:40Z","title":"TPLA: Tensor Parallel Latent Attention for Efficient Disaggregated Prefill and Decode Inference","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-05T17:55:07.854166Z"},"links":{"citing_paper":"/paper/2508.15881"},"observation_digest":"sha256:c56404211854e50033aed02e21cbd2ed3f6a2bb41f7b656862f3f972ca94c2c1","observation_id":"0065ab31-3123-4b57-b276-47b67095ef55","resolution":{"observed_at":"2026-08-05T17:55:07.854166Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-08-18T18:18:37.449517Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-05T17:55:07.985138Z","title":"Deepseek-v3 technical report","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.15881","last_updated":"2025-08-25T02:24:20Z","snapshot_observed_at":"2026-08-19T17:54:54.763717Z","submitted_at":"2025-08-21T15:25:40Z","title":"TPLA: Tensor Parallel Latent Attention for Efficient Disaggregated Prefill and Decode Inference","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-05T17:55:07.985138Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2508.15881"},"observation_digest":"sha256:eb0c7940cbad12739dc0388cf8cc338704b497fe56dde98be0d3055469f84854","observation_id":"c2c7fda1-37fe-49d8-a9a4-a5142ac201f7","resolution":{"observed_at":"2026-08-05T17:55:07.985138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.21487","last_updated":"2025-05-27T17:54:07Z","snapshot_observed_at":"2026-08-07T13:24:37.243429Z","submitted_at":"2025-05-27T17:54:07Z","title":"Hardware-Efficient Attention for Fast Decoding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.21487","snapshot_observed_at":"2026-08-05T17:55:08.095113Z","title":"Hardware-efficient attention for fast decoding","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.15881","last_updated":"2025-08-25T02:24:20Z","snapshot_observed_at":"2026-08-19T17:54:54.763717Z","submitted_at":"2025-08-21T15:25:40Z","title":"TPLA: Tensor Parallel Latent Attention for Efficient Disaggregated Prefill and Decode Inference","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-05T17:55:08.095113Z"},"links":{"cited_paper":"/paper/2505.21487","citing_paper":"/paper/2508.15881"},"observation_digest":"sha256:ab0c4b9297b294b7cb42317a7f36dce9edde2562b369ed8d93d1b90be7fb3b71","observation_id":"3a655ef5-cf0b-481a-a0e3-b783519b25c6","resolution":{"observed_at":"2026-08-05T17:55:08.095113Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01801","last_updated":"2024-10-29T18:26:09Z","snapshot_observed_at":"2026-08-20T18:20:17.447831Z","submitted_at":"2023-10-03T05:17:08Z","title":"Model Tells You What to Discard: Adaptive KV Cache Compression for LLMs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01801","snapshot_observed_at":"2026-08-05T17:55:08.179444Z","title":"Model tells you what to discard: Adaptive kv cache compression for llms","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.15881","last_updated":"2025-08-25T02:24:20Z","snapshot_observed_at":"2026-08-19T17:54:54.763717Z","submitted_at":"2025-08-21T15:25:40Z","title":"TPLA: Tensor Parallel Latent Attention for Efficient Disaggregated Prefill and Decode Inference","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-05T17:55:08.179444Z"},"links":{"cited_paper":"/paper/2310.01801","citing_paper":"/paper/2508.15881"},"observation_digest":"sha256:4350eab624e025596346f6d8c2457629a0937584246d5170269bb964a4e585dc","observation_id":"bf4903d4-8734-4d1d-8c41-e98c273649d9","resolution":{"observed_at":"2026-08-05T17:55:08.179444Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14838","last_updated":"2025-05-27T03:08:57Z","snapshot_observed_at":"2026-08-21T02:11:05.377768Z","submitted_at":"2024-12-19T13:28:42Z","title":"DynamicKV: Task-Aware Adaptive KV Cache Compression for Long Context LLMs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14838","snapshot_observed_at":"2026-08-05T17:55:08.261078Z","title":"Dynamickv: Task-aware adaptive kv cache compression for long context llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.15881","last_updated":"2025-08-25T02:24:20Z","snapshot_observed_at":"2026-08-19T17:54:54.763717Z","submitted_at":"2025-08-21T15:25:40Z","title":"TPLA: Tensor Parallel Latent Attention for Efficient Disaggregated Prefill and Decode Inference","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-05T17:55:08.261078Z"},"links":{"cited_paper":"/paper/2412.14838","citing_paper":"/paper/2508.15881"},"observation_digest":"sha256:3255a9a3b7d625320db802fcbb178973d030207ba72e8de4b3546f6f15dae932","observation_id":"bb8e1ff1-35dd-4b7e-bb30-414854bdeb30","resolution":{"observed_at":"2026-08-05T17:55:08.261078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.02401","last_updated":"2025-08-04T13:26:16Z","snapshot_observed_at":"2026-08-13T07:44:07.312192Z","submitted_at":"2025-08-04T13:26:16Z","title":"CompressKV: Semantic Retrieval Heads Know What Tokens are Not Important Before Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.02401","snapshot_observed_at":"2026-08-05T17:55:08.361255Z","title":"Compresskv: Semantic retrieval heads know what tokens are not important before generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.15881","last_updated":"2025-08-25T02:24:20Z","snapshot_observed_at":"2026-08-19T17:54:54.763717Z","submitted_at":"2025-08-21T15:25:40Z","title":"TPLA: Tensor Parallel Latent Attention for Efficient Disaggregated Prefill and Decode Inference","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-05T17:55:08.361255Z"},"links":{"cited_paper":"/paper/2508.02401","citing_paper":"/paper/2508.15881"},"observation_digest":"sha256:a9628d292e5ec64c28b1fe7590efae860dd9569b56ecbeebf9114ff633ff5488","observation_id":"74ef57b3-bd3a-4e58-9d51-25808beb877d","resolution":{"observed_at":"2026-08-05T17:55:08.361255Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14469","last_updated":"2024-06-17T03:01:58Z","snapshot_observed_at":"2026-08-14T12:21:04.886717Z","submitted_at":"2024-04-22T17:42:58Z","title":"SnapKV: LLM Knows What You are Looking for Before Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14469","snapshot_observed_at":"2026-08-05T17:55:08.477550Z","title":"Snapkv: Llm knows what you are looking for before generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.15881","last_updated":"2025-08-25T02:24:20Z","snapshot_observed_at":"2026-08-19T17:54:54.763717Z","submitted_at":"2025-08-21T15:25:40Z","title":"TPLA: Tensor Parallel Latent Attention for Efficient Disaggregated Prefill and Decode Inference","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-05T17:55:08.477550Z"},"links":{"cited_paper":"/paper/2404.14469","citing_paper":"/paper/2508.15881"},"observation_digest":"sha256:9209b5b3ae9947225e83c588347caa7a423d790323a09e4e1b7aae900ba21b0b","observation_id":"01c6fd89-3438-408f-9755-0f5b15e2ed3f","resolution":{"observed_at":"2026-08-05T17:55:08.477550Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.14057","last_updated":"2024-07-19T06:34:45Z","snapshot_observed_at":"2026-08-19T22:54:34.890320Z","submitted_at":"2024-07-19T06:34:45Z","title":"LazyLLM: Dynamic Token Pruning for Efficient Long Context LLM Inference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.14057","snapshot_observed_at":"2026-08-05T17:55:08.556414Z","title":"Lazyllm: Dynamic token pruning for efficient long context llm inference","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.15881","last_updated":"2025-08-25T02:24:20Z","snapshot_observed_at":"2026-08-19T17:54:54.763717Z","submitted_at":"2025-08-21T15:25:40Z","title":"TPLA: Tensor Parallel Latent Attention for Efficient Disaggregated Prefill and Decode Inference","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-05T17:55:08.556414Z"},"links":{"cited_paper":"/paper/2407.14057","citing_paper":"/paper/2508.15881"},"observation_digest":"sha256:0c9d73c939743f7af976cb35c9fd38a321cc21c1447694ca1442a363f7b6db26","observation_id":"d7ec6af8-00c3-42e1-aba7-a1a71f7b5545","resolution":{"observed_at":"2026-08-05T17:55:08.556414Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14048","last_updated":"2023-12-18T19:10:00Z","snapshot_observed_at":"2026-08-20T21:36:51.212852Z","submitted_at":"2023-06-24T20:11:14Z","title":"H$_2$O: Heavy-Hitter Oracle for Efficient Generative Inference of Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.14048","snapshot_observed_at":"2026-08-05T17:55:08.677974Z","title":"H2o: Heavy-hitter oracle for efficient generative inference of large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.15881","last_updated":"2025-08-25T02:24:20Z","snapshot_observed_at":"2026-08-19T17:54:54.763717Z","submitted_at":"2025-08-21T15:25:40Z","title":"TPLA: Tensor Parallel Latent Attention for Efficient Disaggregated Prefill and Decode Inference","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-05T17:55:08.677974Z"},"links":{"cited_paper":"/paper/2306.14048","citing_paper":"/paper/2508.15881"},"observation_digest":"sha256:e0ed6bf3064d0f993806928ed2568d6a419774bec5cc46229dd6335ff0075976","observation_id":"f9828a0e-fcb4-4bdf-be76-030d6eaa0a87","resolution":{"observed_at":"2026-08-05T17:55:08.677974Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.08454","last_updated":"2024-07-21T02:37:11Z","snapshot_observed_at":"2026-08-19T22:31:41.606680Z","submitted_at":"2024-07-11T12:50:42Z","title":"Model Tells You Where to Merge: Adaptive KV Cache Merging for LLMs on Long-Context Tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.08454","snapshot_observed_at":"2026-08-05T17:55:08.753827Z","title":"Model tells you where to merge: Adaptive kv cache merging for llms on long-context tasks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.15881","last_updated":"2025-08-25T02:24:20Z","snapshot_observed_at":"2026-08-19T17:54:54.763717Z","submitted_at":"2025-08-21T15:25:40Z","title":"TPLA: Tensor Parallel Latent Attention for Efficient Disaggregated Prefill and Decode Inference","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-05T17:55:08.753827Z"},"links":{"cited_paper":"/paper/2407.08454","citing_paper":"/paper/2508.15881"},"observation_digest":"sha256:29b22823bcdc87d168e0a12d174ecf45dede10b135c2d50b2201fb3b5d61ebd5","observation_id":"53b418c4-ede0-4354-bc8b-8640b51de096","resolution":{"observed_at":"2026-08-05T17:55:08.753827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:55:08.857090Z","title":"Zsmerge: Zero-shot kv cache compression for memory-efficient long-context llms","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.15881","last_updated":"2025-08-25T02:24:20Z","snapshot_observed_at":"2026-08-19T17:54:54.763717Z","submitted_at":"2025-08-21T15:25:40Z","title":"TPLA: Tensor Parallel Latent Attention for Efficient Disaggregated Prefill and Decode Inference","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-05T17:55:08.857090Z"},"links":{"citing_paper":"/paper/2508.15881"},"observation_digest":"sha256:d612a5d2cfa1e71fde1b0bf3ca5b39d09607b4fd88b0ad209a4fc1fc68f14c8c","observation_id":"64f9f956-7c89-4b28-920a-cdc8de6a3b42","resolution":{"observed_at":"2026-08-05T17:55:08.857090Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2506.11418","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:55:14.270235Z","title":"Efficient long-context llm inference via kv cache clustering","venue":null,"work_id":"78c6d959-e17d-414e-b254-b9b73264e5da","year":2025},"citing_paper":{"arxiv_id":"2508.15881","last_updated":"2025-08-25T02:24:20Z","snapshot_observed_at":"2026-08-19T17:54:54.763717Z","submitted_at":"2025-08-21T15:25:40Z","title":"TPLA: Tensor Parallel Latent Attention for Efficient Disaggregated Prefill and Decode Inference","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-05T17:55:08.971911Z"},"links":{"citing_paper":"/paper/2508.15881"},"observation_digest":"sha256:b1437de8914b0bd35bb7d97b43dbfe10e9fd8f30cddc254fcb985054387a2669","observation_id":"f168205e-0307-4026-8c99-cef1defffce9","resolution":{"observed_at":"2026-08-05T17:55:14.366584Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.18517","last_updated":"2024-10-24T08:06:41Z","snapshot_observed_at":"2026-08-22T08:39:43.996705Z","submitted_at":"2024-10-24T08:06:41Z","title":"KVSharer: Efficient Inference via Layer-Wise Dissimilar KV Cache Sharing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.18517","snapshot_observed_at":"2026-08-05T17:55:09.149968Z","title":"Kvsharer: Efficient inference via layer-wise dissimilar kv cache sharing","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.15881","last_updated":"2025-08-25T02:24:20Z","snapshot_observed_at":"2026-08-19T17:54:54.763717Z","submitted_at":"2025-08-21T15:25:40Z","title":"TPLA: Tensor Parallel Latent Attention for Efficient Disaggregated Prefill and Decode Inference","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-05T17:55:09.149968Z"},"links":{"cited_paper":"/paper/2410.18517","citing_paper":"/paper/2508.15881"},"observation_digest":"sha256:f88e6b44c5a28abcbfc37b1a74116373c69de5be535cd0033ca675e73f59a4cf","observation_id":"9d040f08-9e60-418b-ae63-6fe5022c1419","resolution":{"observed_at":"2026-08-05T17:55:09.149968Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.15012","last_updated":"2024-09-23T13:37:25Z","snapshot_observed_at":"2026-08-20T08:39:51.593892Z","submitted_at":"2024-09-23T13:37:25Z","title":"Inference-Friendly Models With MixAttention","version":1},"cited_work":{"arxiv_id":"2409.15012","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.15012","snapshot_observed_at":"2026-08-05T17:55:13.970681Z","title":"Inference-Friendly Models With MixAttention","venue":"cs.CL","work_id":"f3d29a3e-48bf-44f4-9b90-25c5a30ff5b1","year":2024},"citing_paper":{"arxiv_id":"2508.15881","last_updated":"2025-08-25T02:24:20Z","snapshot_observed_at":"2026-08-19T17:54:54.763717Z","submitted_at":"2025-08-21T15:25:40Z","title":"TPLA: Tensor Parallel Latent Attention for Efficient Disaggregated Prefill and Decode Inference","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-05T17:55:09.267444Z"},"links":{"cited_paper":"/paper/2409.15012","citing_paper":"/paper/2508.15881"},"observation_digest":"sha256:51878559ecd556683fb9f5b73e930e21b14d3389954abbe522ec82a327a2e32f","observation_id":"0279807a-455a-42b3-9ac9-00da505464b2","resolution":{"observed_at":"2026-08-05T17:55:14.064205Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.10637","last_updated":"2024-06-04T00:08:10Z","snapshot_observed_at":"2026-08-19T16:34:01.744867Z","submitted_at":"2024-05-17T08:59:46Z","title":"Layer-Condensed KV Cache for Efficient Inference of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.10637","snapshot_observed_at":"2026-08-05T17:55:09.408451Z","title":"Layer-condensed kv cache for efficient inference of large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.15881","last_updated":"2025-08-25T02:24:20Z","snapshot_observed_at":"2026-08-19T17:54:54.763717Z","submitted_at":"2025-08-21T15:25:40Z","title":"TPLA: Tensor Parallel Latent Attention for Efficient Disaggregated Prefill and Decode Inference","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-05T17:55:09.408451Z"},"links":{"cited_paper":"/paper/2405.10637","citing_paper":"/paper/2508.15881"},"observation_digest":"sha256:ed3463a8a05e3936d5173c223a2521dd8e7b1c91cb6659117a445412452cd634","observation_id":"60be5ed8-16ce-4a7e-941f-1cd3df3493bf","resolution":{"observed_at":"2026-08-05T17:55:09.408451Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.14442","last_updated":"2025-02-05T08:22:05Z","snapshot_observed_at":"2026-08-19T02:50:35.095088Z","submitted_at":"2024-10-18T13:01:14Z","title":"A Systematic Study of Cross-Layer KV Sharing for Efficient LLM Inference","version":2},"cited_work":{"arxiv_id":"2410.14442","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.14442","snapshot_observed_at":"2026-08-05T17:55:13.769817Z","title":"A Systematic Study of Cross-Layer KV Sharing for Efficient LLM Inference","venue":"cs.CL","work_id":"5d6339d1-83b4-4ae1-b1b4-c76128fc4f2d","year":2024},"citing_paper":{"arxiv_id":"2508.15881","last_updated":"2025-08-25T02:24:20Z","snapshot_observed_at":"2026-08-19T17:54:54.763717Z","submitted_at":"2025-08-21T15:25:40Z","title":"TPLA: Tensor Parallel Latent Attention for Efficient Disaggregated Prefill and Decode Inference","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-05T17:55:09.555984Z"},"links":{"cited_paper":"/paper/2410.14442","citing_paper":"/paper/2508.15881"},"observation_digest":"sha256:bdeae598bcec404c0efe155e0d2c8351bdc64ae87c35f6a18e08f4806380cbbb","observation_id":"e62bd1eb-86d9-4cb8-8820-9fec1ed413d2","resolution":{"observed_at":"2026-08-05T17:55:13.833354Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.12981","last_updated":"2024-05-21T17:59:29Z","snapshot_observed_at":"2026-08-20T10:03:23.466960Z","submitted_at":"2024-05-21T17:59:29Z","title":"Reducing Transformer Key-Value Cache Size with Cross-Layer Attention","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.12981","snapshot_observed_at":"2026-08-05T17:55:09.661574Z","title":"Reducing transformer key-value cache size with cross-layer attention","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.15881","last_updated":"2025-08-25T02:24:20Z","snapshot_observed_at":"2026-08-19T17:54:54.763717Z","submitted_at":"2025-08-21T15:25:40Z","title":"TPLA: Tensor Parallel Latent Attention for Efficient Disaggregated Prefill and Decode Inference","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-05T17:55:09.661574Z"},"links":{"cited_paper":"/paper/2405.12981","citing_paper":"/paper/2508.15881"},"observation_digest":"sha256:039c4ef224296f1fd207d669df61ad91e96a86f2424f790639d809bda036aaec","observation_id":"6d5022ab-4df1-4ddb-b02e-098ef4e89e67","resolution":{"observed_at":"2026-08-05T17:55:09.661574Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03111","last_updated":"2024-10-04T03:10:53Z","snapshot_observed_at":"2026-08-18T04:29:41.960690Z","submitted_at":"2024-10-04T03:10:53Z","title":"LoRC: Low-Rank Compression for LLMs KV Cache with a Progressive Compression Strategy","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.03111","snapshot_observed_at":"2026-08-05T17:55:09.743965Z","title":"Lorc: Low-rank compression for llms kv cache with a progressive compression strategy","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.15881","last_updated":"2025-08-25T02:24:20Z","snapshot_observed_at":"2026-08-19T17:54:54.763717Z","submitted_at":"2025-08-21T15:25:40Z","title":"TPLA: Tensor Parallel Latent Attention for Efficient Disaggregated Prefill and Decode Inference","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-05T17:55:09.743965Z"},"links":{"cited_paper":"/paper/2410.03111","citing_paper":"/paper/2508.15881"},"observation_digest":"sha256:f68aabad0e67156d1651788bfb1b29a18a374362ceb9053d5000bc5f7ad0a7ad","observation_id":"0c0fb4e1-5587-4190-a412-ac69e2e71b3b","resolution":{"observed_at":"2026-08-05T17:55:09.743965Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.14731","last_updated":"2025-05-16T09:40:01Z","snapshot_observed_at":"2026-08-16T13:08:53.566354Z","submitted_at":"2024-10-16T08:34:51Z","title":"MatryoshkaKV: Adaptive KV Compression via Trainable Orthogonal Projection","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.14731","snapshot_observed_at":"2026-08-05T17:55:09.824153Z","title":"Matryoshkakv: Adaptive kv compression via trainable orthogonal projection","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.15881","last_updated":"2025-08-25T02:24:20Z","snapshot_observed_at":"2026-08-19T17:54:54.763717Z","submitted_at":"2025-08-21T15:25:40Z","title":"TPLA: Tensor Parallel Latent Attention for Efficient Disaggregated Prefill and Decode Inference","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-05T17:55:09.824153Z"},"links":{"cited_paper":"/paper/2410.14731","citing_paper":"/paper/2508.15881"},"observation_digest":"sha256:da58d3278f64bffe8e4c2c331669f336aa6de21036bf0676a74c834499dc28cc","observation_id":"2434c60e-8e4b-408c-8625-af96bc073b3c","resolution":{"observed_at":"2026-08-05T17:55:09.824153Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07056","last_updated":"2024-06-11T08:37:33Z","snapshot_observed_at":"2026-08-16T13:44:16.024792Z","submitted_at":"2024-06-11T08:37:33Z","title":"Effectively Compress KV Heads for LLM","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07056","snapshot_observed_at":"2026-08-05T17:55:09.928919Z","title":"Effectively compress kv heads for llm.arXiv preprint arXiv:2406.07056, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.15881","last_updated":"2025-08-25T02:24:20Z","snapshot_observed_at":"2026-08-19T17:54:54.763717Z","submitted_at":"2025-08-21T15:25:40Z","title":"TPLA: Tensor Parallel Latent Attention for Efficient Disaggregated Prefill and Decode Inference","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-05T17:55:09.928919Z"},"links":{"cited_paper":"/paper/2406.07056","citing_paper":"/paper/2508.15881"},"observation_digest":"sha256:d2d52ae531097f0c4a7b189654488f79457f80dc6877c6f9410dba5f03839ef1","observation_id":"129d056b-aa76-4449-8ef0-fd01fe67112e","resolution":{"observed_at":"2026-08-05T17:55:09.928919Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.18079","last_updated":"2025-05-28T18:58:29Z","snapshot_observed_at":"2026-08-20T02:16:11.463896Z","submitted_at":"2024-01-31T18:58:14Z","title":"KVQuant: Towards 10 Million Context Length LLM Inference with KV Cache Quantization","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.18079","snapshot_observed_at":"2026-08-05T17:55:10.035877Z","title":"Kvquant: Towards 10 million context length llm inference with kv cache quantization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.15881","last_updated":"2025-08-25T02:24:20Z","snapshot_observed_at":"2026-08-19T17:54:54.763717Z","submitted_at":"2025-08-21T15:25:40Z","title":"TPLA: Tensor Parallel Latent Attention for Efficient Disaggregated Prefill and Decode Inference","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-05T17:55:10.035877Z"},"links":{"cited_paper":"/paper/2401.18079","citing_paper":"/paper/2508.15881"},"observation_digest":"sha256:4d13bd7839a5be488adf72988031ea7bb26d357c31d344bc7d68f9198ccecefc","observation_id":"30df9cd3-da21-4b66-94cc-6e529e1f16c4","resolution":{"observed_at":"2026-08-05T17:55:10.035877Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.03661","last_updated":"2025-04-08T04:34:44Z","snapshot_observed_at":"2026-08-16T12:50:44.231369Z","submitted_at":"2025-03-12T13:32:50Z","title":"MILLION: Mastering Long-Context LLM Inference Via Outlier-Immunized KV Product Quantization","version":2},"cited_work":{"arxiv_id":"2504.03661","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.03661","snapshot_observed_at":"2026-08-05T17:55:13.472060Z","title":"MILLION: Mastering Long-Context LLM Inference Via Outlier-Immunized KV Product Quantization","venue":"cs.DC","work_id":"7af03136-e09a-43c9-883d-f1d7db832e41","year":2025},"citing_paper":{"arxiv_id":"2508.15881","last_updated":"2025-08-25T02:24:20Z","snapshot_observed_at":"2026-08-19T17:54:54.763717Z","submitted_at":"2025-08-21T15:25:40Z","title":"TPLA: Tensor Parallel Latent Attention for Efficient Disaggregated Prefill and Decode Inference","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-05T17:55:10.191982Z"},"links":{"cited_paper":"/paper/2504.03661","citing_paper":"/paper/2508.15881"},"observation_digest":"sha256:b800c3b018bd079adcf1ad5fb2ded0ebd6b082c400aea33d92e89566016e08f8","observation_id":"406bcb6e-4a11-4d5f-a52a-d2c81af75543","resolution":{"observed_at":"2026-08-05T17:55:13.570436Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04643","last_updated":"2024-04-12T13:00:25Z","snapshot_observed_at":"2026-08-16T14:11:54.298010Z","submitted_at":"2024-03-07T16:42:37Z","title":"QAQ: Quality Adaptive Quantization for LLM KV Cache","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.04643","snapshot_observed_at":"2026-08-05T17:55:10.297309Z","title":"Qaq: Quality adaptive quantization for llm kv cache","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.15881","last_updated":"2025-08-25T02:24:20Z","snapshot_observed_at":"2026-08-19T17:54:54.763717Z","submitted_at":"2025-08-21T15:25:40Z","title":"TPLA: Tensor Parallel Latent Attention for Efficient Disaggregated Prefill and Decode Inference","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-05T17:55:10.297309Z"},"links":{"cited_paper":"/paper/2403.04643","citing_paper":"/paper/2508.15881"},"observation_digest":"sha256:617ae1cb7607e8172a62d44bc9888a9b42e48ca50c41cff74be3e157c2a595b3","observation_id":"4e4f6c27-5b95-414c-8f31-40f5ea2c1fff","resolution":{"observed_at":"2026-08-05T17:55:10.297309Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.19586","last_updated":"2025-05-27T03:16:32Z","snapshot_observed_at":"2026-08-15T13:57:58.824655Z","submitted_at":"2025-05-26T07:00:04Z","title":"TailorKV: A Hybrid Framework for Long-Context Inference via Tailored KV Cache Optimization","version":2},"cited_work":{"arxiv_id":"2505.19586","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.19586","snapshot_observed_at":"2026-08-05T17:55:13.328095Z","title":"TailorKV: A Hybrid Framework for Long-Context Inference via Tailored KV Cache Optimization","venue":"cs.CL","work_id":"5513fbf1-372d-4b64-a37e-eafa041e9116","year":2025},"citing_paper":{"arxiv_id":"2508.15881","last_updated":"2025-08-25T02:24:20Z","snapshot_observed_at":"2026-08-19T17:54:54.763717Z","submitted_at":"2025-08-21T15:25:40Z","title":"TPLA: Tensor Parallel Latent Attention for Efficient Disaggregated Prefill and Decode Inference","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-05T17:55:10.372511Z"},"links":{"cited_paper":"/paper/2505.19586","citing_paper":"/paper/2508.15881"},"observation_digest":"sha256:17b7aacdd19f613220a9477da710877f77a4534cd2bc89283030c44d8d560913","observation_id":"06792c92-3127-4413-b66c-d107532327c0","resolution":{"observed_at":"2026-08-05T17:55:13.365091Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:55:10.478577Z","title":"Large scale distributed deep networks","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2508.15881","last_updated":"2025-08-25T02:24:20Z","snapshot_observed_at":"2026-08-19T17:54:54.763717Z","submitted_at":"2025-08-21T15:25:40Z","title":"TPLA: Tensor Parallel Latent Attention for Efficient Disaggregated Prefill and Decode Inference","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-05T17:55:10.478577Z"},"links":{"citing_paper":"/paper/2508.15881"},"observation_digest":"sha256:24a43fa208e05e686d62feade10307c9ef07ecbd8eeea8e123a32d3c0d5eb92e","observation_id":"06455c16-75ee-45b9-a55e-80ba7532ad83","resolution":{"observed_at":"2026-08-05T17:55:10.478577Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1802.05799","last_updated":"2018-02-21T04:30:30Z","snapshot_observed_at":"2026-08-21T21:00:15.966497Z","submitted_at":"2018-02-15T23:36:51Z","title":"Horovod: fast and easy distributed deep learning in TensorFlow","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1802.05799","snapshot_observed_at":"2026-08-05T17:55:10.614756Z","title":"Horovod: fast and easy distributed deep learning in tensorflow","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2508.15881","last_updated":"2025-08-25T02:24:20Z","snapshot_observed_at":"2026-08-19T17:54:54.763717Z","submitted_at":"2025-08-21T15:25:40Z","title":"TPLA: Tensor Parallel Latent Attention for Efficient Disaggregated Prefill and Decode Inference","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-05T17:55:10.614756Z"},"links":{"cited_paper":"/paper/1802.05799","citing_paper":"/paper/2508.15881"},"observation_digest":"sha256:72978e9123b08400f44d8ac9a4e15791a1aac98b39e0188e313cee38fa76e9c9","observation_id":"5ed51e7b-2b70-4475-a962-b76d80725d2e","resolution":{"observed_at":"2026-08-05T17:55:10.614756Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:55:10.743554Z","title":"Gpipe: Efficient training of giant neural networks using pipeline parallelism","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2508.15881","last_updated":"2025-08-25T02:24:20Z","snapshot_observed_at":"2026-08-19T17:54:54.763717Z","submitted_at":"2025-08-21T15:25:40Z","title":"TPLA: Tensor Parallel Latent Attention for Efficient Disaggregated Prefill and Decode Inference","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-05T17:55:10.743554Z"},"links":{"citing_paper":"/paper/2508.15881"},"observation_digest":"sha256:215cef54c5e179f3e34227db47225cf860732d3abaabdcddef621cca8e86a504","observation_id":"1925cf9e-10c1-4370-867c-5a8b2a871581","resolution":{"observed_at":"2026-08-05T17:55:10.743554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:55:10.818690Z","title":"Pipedream: Generalized pipeline parallelism for dnn training","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2508.15881","last_updated":"2025-08-25T02:24:20Z","snapshot_observed_at":"2026-08-19T17:54:54.763717Z","submitted_at":"2025-08-21T15:25:40Z","title":"TPLA: Tensor Parallel Latent Attention for Efficient Disaggregated Prefill and Decode Inference","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-05T17:55:10.818690Z"},"links":{"citing_paper":"/paper/2508.15881"},"observation_digest":"sha256:63d64ddee1133cd25192ac36b01d394b81039adf0fac46d48ced2f8308624e0b","observation_id":"7396cf27-1e60-4aa8-96ba-124365c1f946","resolution":{"observed_at":"2026-08-05T17:55:10.818690Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.08053","last_updated":"2020-03-13T23:45:18Z","snapshot_observed_at":"2026-08-12T10:50:46.357243Z","submitted_at":"2019-09-17T19:42:54Z","title":"Megatron-LM: Training Multi-Billion Parameter Language Models Using Model Parallelism","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.08053","snapshot_observed_at":"2026-08-05T17:55:10.957633Z","title":"Megatron-lm: Training multi-billion parameter language models using model parallelism","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2508.15881","last_updated":"2025-08-25T02:24:20Z","snapshot_observed_at":"2026-08-19T17:54:54.763717Z","submitted_at":"2025-08-21T15:25:40Z","title":"TPLA: Tensor Parallel Latent Attention for Efficient Disaggregated Prefill and Decode Inference","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-05T17:55:10.957633Z"},"links":{"cited_paper":"/paper/1909.08053","citing_paper":"/paper/2508.15881"},"observation_digest":"sha256:60eb8e5f30aad90f0c705c168872b18f61bc46c3690784889312e477a50755ab","observation_id":"69d8ba3e-4312-4cc6-a132-ffc9930d9915","resolution":{"observed_at":"2026-08-05T17:55:10.957633Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.05343","last_updated":"2021-04-12T10:47:16Z","snapshot_observed_at":"2026-08-16T18:32:17.870609Z","submitted_at":"2021-04-12T10:47:16Z","title":"An Efficient 2D Method for Training Super-Large Deep Learning Models","version":1},"cited_work":{"arxiv_id":"2104.05343","doi":null,"metadata_source":"pith","pith_arxiv_id":"2104.05343","snapshot_observed_at":"2026-08-05T17:55:13.097943Z","title":"An Efficient 2D Method for Training Super-Large Deep Learning Models","venue":"cs.LG","work_id":"0599e45c-292a-415f-93ac-4571a29ee09b","year":2021},"citing_paper":{"arxiv_id":"2508.15881","last_updated":"2025-08-25T02:24:20Z","snapshot_observed_at":"2026-08-19T17:54:54.763717Z","submitted_at":"2025-08-21T15:25:40Z","title":"TPLA: Tensor Parallel Latent Attention for Efficient Disaggregated Prefill and Decode Inference","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-05T17:55:11.079164Z"},"links":{"cited_paper":"/paper/2104.05343","citing_paper":"/paper/2508.15881"},"observation_digest":"sha256:36259e7770279cf5b8229b1283ac7b15ef21f5bed4278880cb6c3e09f4abb40e","observation_id":"1771d614-49e7-4410-b557-3a488ece433a","resolution":{"observed_at":"2026-08-05T17:55:13.186945Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2105.14450","last_updated":"2021-05-30T07:41:08Z","snapshot_observed_at":"2026-08-20T09:37:50.464347Z","submitted_at":"2021-05-30T07:41:08Z","title":"Maximizing Parallelism in Distributed Training for Huge Neural Networks","version":1},"cited_work":{"arxiv_id":"2105.14450","doi":null,"metadata_source":"pith","pith_arxiv_id":"2105.14450","snapshot_observed_at":"2026-08-05T17:55:12.935227Z","title":"Maximizing Parallelism in Distributed Training for Huge Neural Networks","venue":"cs.DC","work_id":"1cc87e93-4224-4a25-a565-b04a8bbb632f","year":2021},"citing_paper":{"arxiv_id":"2508.15881","last_updated":"2025-08-25T02:24:20Z","snapshot_observed_at":"2026-08-19T17:54:54.763717Z","submitted_at":"2025-08-21T15:25:40Z","title":"TPLA: Tensor Parallel Latent Attention for Efficient Disaggregated Prefill and Decode Inference","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-05T17:55:11.149864Z"},"links":{"cited_paper":"/paper/2105.14450","citing_paper":"/paper/2508.15881"},"observation_digest":"sha256:d276a5062b49462e943a52e81847eea42ecc3e3eb5edcb444d1fbcb6b0b96adb","observation_id":"16c73e13-a6d2-4f21-b730-3382a05f53b1","resolution":{"observed_at":"2026-08-05T17:55:13.001003Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2105.13120","last_updated":"2022-05-21T06:03:54Z","snapshot_observed_at":"2026-08-21T08:30:55.898402Z","submitted_at":"2021-05-26T13:40:58Z","title":"Sequence Parallelism: Long Sequence Training from System Perspective","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.13120","snapshot_observed_at":"2026-08-05T17:55:11.234042Z","title":"Sequence parallelism: Long sequence training from system perspective","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.15881","last_updated":"2025-08-25T02:24:20Z","snapshot_observed_at":"2026-08-19T17:54:54.763717Z","submitted_at":"2025-08-21T15:25:40Z","title":"TPLA: Tensor Parallel Latent Attention for Efficient Disaggregated Prefill and Decode Inference","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-05T17:55:11.234042Z"},"links":{"cited_paper":"/paper/2105.13120","citing_paper":"/paper/2508.15881"},"observation_digest":"sha256:cb1e569d34499f5dd87705baf78b0c4479cf27655cbdd17224a9de9e27974e40","observation_id":"dc945350-74c7-40d7-a7fe-22216310527c","resolution":{"observed_at":"2026-08-05T17:55:11.234042Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:55:16.866247Z","title":"NVIDIA dynamo, a low-latency distributed inference framework for scaling reasoning ai models","venue":null,"work_id":"07b79281-14a2-4709-a234-3cd24b266c22","year":2025},"citing_paper":{"arxiv_id":"2508.15881","last_updated":"2025-08-25T02:24:20Z","snapshot_observed_at":"2026-08-19T17:54:54.763717Z","submitted_at":"2025-08-21T15:25:40Z","title":"TPLA: Tensor Parallel Latent Attention for Efficient Disaggregated Prefill and Decode Inference","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-05T17:55:11.341384Z"},"links":{"citing_paper":"/paper/2508.15881"},"observation_digest":"sha256:5aa98d21ae3a2b865b08839ea9ba2d26aa27d1a0a6cf54c24be99e128b990a2e","observation_id":"70ef7060-1cc4-4fb6-a21a-afd6fa062cb5","resolution":{"observed_at":"2026-08-05T17:55:16.949194Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.18454","last_updated":"2026-04-15T08:07:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-19T06:37:29Z","title":"Sandwich: Joint Configuration Search and Hot-Switching for Efficient CPU LLM Serving","version":2},"cited_work":{"arxiv_id":"2507.18454","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.18454","snapshot_observed_at":"2026-08-05T17:55:12.700761Z","title":"Sandwich: Joint Configuration Search and Hot-Switching for Efficient CPU LLM Serving","venue":"cs.AR","work_id":"cbf89c26-41e9-48df-afaa-de05f7d9279e","year":2025},"citing_paper":{"arxiv_id":"2508.15881","last_updated":"2025-08-25T02:24:20Z","snapshot_observed_at":"2026-08-19T17:54:54.763717Z","submitted_at":"2025-08-21T15:25:40Z","title":"TPLA: Tensor Parallel Latent Attention for Efficient Disaggregated Prefill and Decode Inference","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-05T17:55:11.419047Z"},"links":{"cited_paper":"/paper/2507.18454","citing_paper":"/paper/2508.15881"},"observation_digest":"sha256:34fc90f915222c9c2c5245917b5e964fbba4b95a9270f57e789dbd18343c1ac1","observation_id":"0ef47a78-7883-4088-bfe2-a993c0cb07fa","resolution":{"observed_at":"2026-08-05T17:55:12.797644Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:55:11.497826Z","title":"{DistServe}: Disaggregating prefill and decoding for goodput-optimized large language model serving","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.15881","last_updated":"2025-08-25T02:24:20Z","snapshot_observed_at":"2026-08-19T17:54:54.763717Z","submitted_at":"2025-08-21T15:25:40Z","title":"TPLA: Tensor Parallel Latent Attention for Efficient Disaggregated Prefill and Decode Inference","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-05T17:55:11.497826Z"},"links":{"citing_paper":"/paper/2508.15881"},"observation_digest":"sha256:e2a2186cb09b6f068a9aca8d7979abd17f8bd8c25301e5b86aa6a5724d28fa57","observation_id":"5ae5a0c8-de1c-46c6-ae05-062650b6c4ca","resolution":{"observed_at":"2026-08-05T17:55:11.497826Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02954","last_updated":"2024-01-05T18:59:13Z","snapshot_observed_at":"2026-08-14T19:47:04.330126Z","submitted_at":"2024-01-05T18:59:13Z","title":"DeepSeek LLM: Scaling Open-Source Language Models with Longtermism","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.02954","snapshot_observed_at":"2026-08-05T17:55:11.586104Z","title":"Deepseek LLM: scaling open-source language models with longtermism","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.15881","last_updated":"2025-08-25T02:24:20Z","snapshot_observed_at":"2026-08-19T17:54:54.763717Z","submitted_at":"2025-08-21T15:25:40Z","title":"TPLA: Tensor Parallel Latent Attention for Efficient Disaggregated Prefill and Decode Inference","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-05T17:55:11.586104Z"},"links":{"cited_paper":"/paper/2401.02954","citing_paper":"/paper/2508.15881"},"observation_digest":"sha256:c635237c55bfeed6c114d49a94a983659e24cd2f560d72797b9f94b19d806a5f","observation_id":"2bb093de-5471-4821-a6ec-228d975ac973","resolution":{"observed_at":"2026-08-05T17:55:11.586104Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.20534","last_updated":"2026-02-03T04:57:00Z","snapshot_observed_at":"2026-08-16T14:37:33.548231Z","submitted_at":"2025-07-28T05:35:43Z","title":"Kimi K2: Open Agentic Intelligence","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.20534","snapshot_observed_at":"2026-08-05T17:55:11.656509Z","title":"Kimi k2: Open agentic intelligence","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.15881","last_updated":"2025-08-25T02:24:20Z","snapshot_observed_at":"2026-08-19T17:54:54.763717Z","submitted_at":"2025-08-21T15:25:40Z","title":"TPLA: Tensor Parallel Latent Attention for Efficient Disaggregated Prefill and Decode Inference","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-05T17:55:11.656509Z"},"links":{"cited_paper":"/paper/2507.20534","citing_paper":"/paper/2508.15881"},"observation_digest":"sha256:985cb933ec44aba8310e19198196779d0c79453c291d3d6008baac6c398d96d4","observation_id":"f1dab253-a3ef-4535-9418-2b625967db27","resolution":{"observed_at":"2026-08-05T17:55:11.656509Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:55:16.629238Z","title":"Mea- suring massive multitask language understanding","venue":null,"work_id":"a27b779a-3979-4960-a050-88cc628165f2","year":2021},"citing_paper":{"arxiv_id":"2508.15881","last_updated":"2025-08-25T02:24:20Z","snapshot_observed_at":"2026-08-19T17:54:54.763717Z","submitted_at":"2025-08-21T15:25:40Z","title":"TPLA: Tensor Parallel Latent Attention for Efficient Disaggregated Prefill and Decode Inference","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-05T17:55:11.777292Z"},"links":{"citing_paper":"/paper/2508.15881"},"observation_digest":"sha256:c6ba884832c739ce725c43d1222552eb7e927054c100786e6cd174bdbcf56e7f","observation_id":"986acead-968f-4d81-a5cd-48dded46847d","resolution":{"observed_at":"2026-08-05T17:55:16.735462Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1803.05457","last_updated":"2018-03-14T18:04:21Z","snapshot_observed_at":"2026-08-14T19:36:07.505691Z","submitted_at":"2018-03-14T18:04:21Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.05457","snapshot_observed_at":"2026-08-05T17:55:11.883455Z","title":"Think you have solved question answering? try arc, the AI2 reasoning challenge","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2508.15881","last_updated":"2025-08-25T02:24:20Z","snapshot_observed_at":"2026-08-19T17:54:54.763717Z","submitted_at":"2025-08-21T15:25:40Z","title":"TPLA: Tensor Parallel Latent Attention for Efficient Disaggregated Prefill and Decode Inference","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-05T17:55:11.883455Z"},"links":{"cited_paper":"/paper/1803.05457","citing_paper":"/paper/2508.15881"},"observation_digest":"sha256:76066606770a053cccc612d6f70edd9e0debd2f72a9a265619da6d03e5c81308","observation_id":"62c1e467-c512-4891-a383-774e9c6755cc","resolution":{"observed_at":"2026-08-05T17:55:11.883455Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:55:16.427608Z","title":"PIQA: reasoning about physical commonsense in natural language","venue":null,"work_id":"a7540ebd-8fb5-4b66-95d8-712f61a24689","year":2020},"citing_paper":{"arxiv_id":"2508.15881","last_updated":"2025-08-25T02:24:20Z","snapshot_observed_at":"2026-08-19T17:54:54.763717Z","submitted_at":"2025-08-21T15:25:40Z","title":"TPLA: Tensor Parallel Latent Attention for Efficient Disaggregated Prefill and Decode Inference","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-05T17:55:11.978403Z"},"links":{"citing_paper":"/paper/2508.15881"},"observation_digest":"sha256:00cf68be032789afce1c0ddbf4337c20b883830545e8deb970d8851c8b334a93","observation_id":"ce74745c-520b-4f95-a0a1-213aede0a115","resolution":{"observed_at":"2026-08-05T17:55:16.503922Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:55:16.156908Z","title":"Hellaswag: Can a machine really finish your sentence? In Anna Korhonen, David R","venue":null,"work_id":"145b57fb-56b4-42bc-af52-ef77cb51f3ab","year":2019},"citing_paper":{"arxiv_id":"2508.15881","last_updated":"2025-08-25T02:24:20Z","snapshot_observed_at":"2026-08-19T17:54:54.763717Z","submitted_at":"2025-08-21T15:25:40Z","title":"TPLA: Tensor Parallel Latent Attention for Efficient Disaggregated Prefill and Decode Inference","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-05T17:55:12.075515Z"},"links":{"citing_paper":"/paper/2508.15881"},"observation_digest":"sha256:b87bc7128280ecfcf44b80dd5be066bc77470baf1b272af93357d50d88cb9ad0","observation_id":"8dfad646-0691-4224-80fa-631e4c3e4c13","resolution":{"observed_at":"2026-08-05T17:55:16.307242Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:55:15.963327Z","title":"Can a suit of armor conduct electricity? A new dataset for open book question answering","venue":null,"work_id":"01b9d21b-3444-4633-ad1c-a8de0fc2a660","year":2018},"citing_paper":{"arxiv_id":"2508.15881","last_updated":"2025-08-25T02:24:20Z","snapshot_observed_at":"2026-08-19T17:54:54.763717Z","submitted_at":"2025-08-21T15:25:40Z","title":"TPLA: Tensor Parallel Latent Attention for Efficient Disaggregated Prefill and Decode Inference","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-05T17:55:12.167299Z"},"links":{"citing_paper":"/paper/2508.15881"},"observation_digest":"sha256:f31557192414d224dbf41e899c52877b004fca83ead7e912c5e22a086d68cbfd","observation_id":"7a14dcce-2508-4c20-9d78-59ed1a8a7e84","resolution":{"observed_at":"2026-08-05T17:55:16.074606Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:55:15.705659Z","title":"Winogrande: an adversarial winograd schema challenge at scale","venue":null,"work_id":"52284a49-3f0d-474e-a3ce-6f945e8c284a","year":2021},"citing_paper":{"arxiv_id":"2508.15881","last_updated":"2025-08-25T02:24:20Z","snapshot_observed_at":"2026-08-19T17:54:54.763717Z","submitted_at":"2025-08-21T15:25:40Z","title":"TPLA: Tensor Parallel Latent Attention for Efficient Disaggregated Prefill and Decode Inference","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-05T17:55:12.240880Z"},"links":{"citing_paper":"/paper/2508.15881"},"observation_digest":"sha256:a55633dd281968bf5734d7da4a63899b48ceb041f7a33fab8122a419ec1f3a05","observation_id":"f753b1f5-1f3a-4978-ae79-f8259aa643e9","resolution":{"observed_at":"2026-08-05T17:55:15.841490Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:55:12.333239Z","title":"Pointer sentinel mixture models, 2016","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2508.15881","last_updated":"2025-08-25T02:24:20Z","snapshot_observed_at":"2026-08-19T17:54:54.763717Z","submitted_at":"2025-08-21T15:25:40Z","title":"TPLA: Tensor Parallel Latent Attention for Efficient Disaggregated Prefill and Decode Inference","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-05T17:55:12.333239Z"},"links":{"citing_paper":"/paper/2508.15881"},"observation_digest":"sha256:9529146c30c379ac2d0b66f891e26d69086507858b4296a21063f6f158635731","observation_id":"e9d15e7c-55ff-4312-b58a-8c29caef111c","resolution":{"observed_at":"2026-08-05T17:55:12.333239Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:55:15.473433Z","title":"Smollm-corpus","venue":null,"work_id":"2d3c6e57-54d9-452c-9c98-1d1a4df5050f","year":2024},"citing_paper":{"arxiv_id":"2508.15881","last_updated":"2025-08-25T02:24:20Z","snapshot_observed_at":"2026-08-19T17:54:54.763717Z","submitted_at":"2025-08-21T15:25:40Z","title":"TPLA: Tensor Parallel Latent Attention for Efficient Disaggregated Prefill and Decode Inference","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-05T17:55:12.427182Z"},"links":{"citing_paper":"/paper/2508.15881"},"observation_digest":"sha256:06c7b25788da1f14beb5946c44aad2261c2f1fbecb87ed1d1c55ec82ffe6a710","observation_id":"4bcaf792-9df4-4cac-a2a0-7e6b2e80661b","resolution":{"observed_at":"2026-08-05T17:55:15.579058Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.14508","last_updated":"2024-06-19T04:00:32Z","snapshot_observed_at":"2026-08-08T03:49:18.086396Z","submitted_at":"2023-08-28T11:53:40Z","title":"LongBench: A Bilingual, Multitask Benchmark for Long Context Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.14508","snapshot_observed_at":"2026-08-05T17:55:12.532975Z","title":"Longbench: A bilingual, multitask benchmark for long context understanding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.15881","last_updated":"2025-08-25T02:24:20Z","snapshot_observed_at":"2026-08-19T17:54:54.763717Z","submitted_at":"2025-08-21T15:25:40Z","title":"TPLA: Tensor Parallel Latent Attention for Efficient Disaggregated Prefill and Decode Inference","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-05T17:55:12.532975Z"},"links":{"cited_paper":"/paper/2308.14508","citing_paper":"/paper/2508.15881"},"observation_digest":"sha256:ad58833825c5e60800fb8c868c46f36d91fdcaaef7a3917fa69b56c1e58cdc75","observation_id":"150c8a9f-d5b0-4fb1-9061-5f6866b520a0","resolution":{"observed_at":"2026-08-05T17:55:12.532975Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2508.15881","last_updated":"2025-08-25T02:24:20Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-19T17:54:54.763717Z","submitted_at":"2025-08-21T15:25:40Z","title":"TPLA: Tensor Parallel Latent Attention for Efficient Disaggregated Prefill and Decode Inference"},"reference_resolution":{"displayed":63,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":46,"verified_exact":10,"verified_fuzzy":7},"total_outbound_references":63},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"thesis":"As of 22 August 2026, this Paper Citation Record lists 63 of 63 outbound references and 3 inbound Pith citation observations for arXiv:2508.15881."}