{"as_of":"2026-08-20T21:50:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:4f401452512b7cf059ec275e3d6563eeb473ded6d675e28bbbf5d9e998796d48","coverage":[{"denominator":44,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":44,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T20:58:08.498820Z","state":"measured"},{"denominator":48,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":48,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-20T06:33:59.587034+00:00","state":"measured"},{"denominator":4,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":4,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T23:45:32.847427Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.06709","last_updated":"2025-01-12T04:29:39Z","snapshot_observed_at":"2026-08-20T12:30:06.726974Z","submitted_at":"2025-01-12T04:29:39Z","title":"Mell: Memory-Efficient Large Language Model Serving via Multi-GPU KV Cache Management","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.06709","snapshot_observed_at":"2026-08-11T00:38:49.523271Z","title":"Mell: Memory-efficient large language model serving via multi-gpu kv cache management,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2412.19442","last_updated":"2025-07-30T05:24:46Z","snapshot_observed_at":"2026-08-20T14:01:46.841630Z","submitted_at":"2024-12-27T04:17:57Z","title":"A Survey on Large Language Model Acceleration based on KV Cache Management","version":3},"reference_index":260,"source":"pdf_text","source_observed_at":"2026-08-11T00:38:49.523271Z"},"links":{"cited_paper":"/paper/2501.06709","citing_paper":"/paper/2412.19442"},"observation_digest":"sha256:adcd4fba053c763c27c6dcd224e3aeb196fad9607760ff41240d9aa1fd1a5d74","observation_id":"01ad7691-2c93-438b-9311-2acf41d527b1","resolution":{"observed_at":"2026-08-11T00:38:49.523271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.06709","last_updated":"2025-01-12T04:29:39Z","snapshot_observed_at":"2026-08-20T12:30:06.726974Z","submitted_at":"2025-01-12T04:29:39Z","title":"Mell: Memory-Efficient Large Language Model Serving via Multi-GPU KV Cache Management","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.06709","snapshot_observed_at":"2026-08-15T23:45:32.847427Z","title":"Qianli, H","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.04021","last_updated":"2026-06-10T23:04:53Z","snapshot_observed_at":"2026-08-19T19:56:05.689621Z","submitted_at":"2025-05-06T23:38:33Z","title":"Prism: Cost-Efficient Multi-LLM Serving via GPU Memory Ballooning","version":3},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-15T23:45:32.847427Z"},"links":{"cited_paper":"/paper/2501.06709","citing_paper":"/paper/2505.04021"},"observation_digest":"sha256:ac8228605212aad99cff26a358e6670f0a9f269b75822ee6399e82ef0c92a649","observation_id":"80459404-6387-4874-b2a6-aef638b43d33","resolution":{"observed_at":"2026-08-15T23:45:32.847427Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.06709","last_updated":"2025-01-12T04:29:39Z","snapshot_observed_at":"2026-08-20T12:30:06.726974Z","submitted_at":"2025-01-12T04:29:39Z","title":"Mell: Memory-Efficient Large Language Model Serving via Multi-GPU KV Cache Management","version":1},"cited_work":{"arxiv_id":"2501.06709","doi":"10.48550/arxiv.2501.06709","metadata_source":"arxiv_reference","pith_arxiv_id":"2501.06709","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":null,"venue":"arXiv (Cornell University)","work_id":"3a5377c6-8e21-42fc-930b-39fd97462c75","year":2025},"citing_paper":{"arxiv_id":"2604.06370","last_updated":"2026-04-07T18:52:25Z","snapshot_observed_at":"2026-08-20T00:33:38.965438Z","submitted_at":"2026-04-07T18:52:25Z","title":"ForkKV: Scaling Multi-LoRA Agent Serving via Copy-on-Write Disaggregated KV Cache","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-10T18:16:49.292491Z"},"links":{"cited_paper":"/paper/2501.06709","citing_paper":"/paper/2604.06370"},"observation_digest":"sha256:b9732d945d47f48857d1b377dd716ffc9f89cd2c2052ea339dab4c3b1ca18f6f","observation_id":"0b31f61f-9a83-4899-bc23-8de4f04438e7","resolution":{"observed_at":"2026-05-10T20:25:46.874022Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.06709","last_updated":"2025-01-12T04:29:39Z","snapshot_observed_at":"2026-08-20T12:30:06.726974Z","submitted_at":"2025-01-12T04:29:39Z","title":"Mell: Memory-Efficient Large Language Model Serving via Multi-GPU KV Cache Management","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.06709","snapshot_observed_at":"2026-08-15T14:55:56.631328Z","title":"Mell: Memory-efficient large language model serving via multi-gpu kv cache management,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03036","last_updated":"2026-08-04T02:33:16Z","snapshot_observed_at":"2026-08-18T00:36:33.289315Z","submitted_at":"2026-08-04T02:33:16Z","title":"LLM Serving in the Wild: An Empirical Study of Frameworks, Methods, and System Designs","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-15T14:55:56.631328Z"},"links":{"cited_paper":"/paper/2501.06709","citing_paper":"/paper/2608.03036"},"observation_digest":"sha256:3cbcb0786d71e645aa02911265a592896be516245e6c9fd0dbc36942039c6dab","observation_id":"87c72b18-1423-4970-92e9-e9b572cdfcb1","resolution":{"observed_at":"2026-08-15T14:55:56.631328Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2501.06709/citation-record","integrity":"/paper/2501.06709/integrity","json":"/paper/2501.06709/citation-record.json","paper":"/paper/2501.06709"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:58:09.646596Z","title":"Brown, B","venue":null,"work_id":"b9edf9dd-8977-4749-a5a9-54c20fcf3f86","year":2020},"citing_paper":{"arxiv_id":"2501.06709","last_updated":"2025-01-12T04:29:39Z","snapshot_observed_at":"2026-08-20T12:30:06.726974Z","submitted_at":"2025-01-12T04:29:39Z","title":"Mell: Memory-Efficient Large Language Model Serving via Multi-GPU KV Cache Management","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T20:58:08.213684Z"},"links":{"citing_paper":"/paper/2501.06709"},"observation_digest":"sha256:20720e8582667fcbb95ad85bf7db96ebfd9c07e3e6ae329bfe15896066bc0661","observation_id":"70838d38-4447-49df-a558-80af7a61cc6b","resolution":{"observed_at":"2026-08-10T20:58:09.653172Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-17T09:58:46.058102Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-10T20:58:08.221119Z","title":"Gpt-4 technical report,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.06709","last_updated":"2025-01-12T04:29:39Z","snapshot_observed_at":"2026-08-20T12:30:06.726974Z","submitted_at":"2025-01-12T04:29:39Z","title":"Mell: Memory-Efficient Large Language Model Serving via Multi-GPU KV Cache Management","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-10T20:58:08.221119Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2501.06709"},"observation_digest":"sha256:a54a0ee6907126d53a520f25e3c23baf964ed2db0582a5dcda005adbf036f1c2","observation_id":"e9b3d3ab-052a-46ce-b479-6114c41f6f03","resolution":{"observed_at":"2026-08-10T20:58:08.221119Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-10T20:58:08.227140Z","title":"Llama: Open and efficient foundation language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.06709","last_updated":"2025-01-12T04:29:39Z","snapshot_observed_at":"2026-08-20T12:30:06.726974Z","submitted_at":"2025-01-12T04:29:39Z","title":"Mell: Memory-Efficient Large Language Model Serving via Multi-GPU KV Cache Management","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-10T20:58:08.227140Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2501.06709"},"observation_digest":"sha256:6d2650c69ac424be9b1f55891e15e4a37e8a9d4f7a7d9372d9a45edf3ac7542b","observation_id":"2642f22a-d560-412d-a3b7-041a69b91997","resolution":{"observed_at":"2026-08-10T20:58:08.227140Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:58:09.613807Z","title":"Characterization of large language model development in the datacenter,","venue":null,"work_id":"c497ca14-d488-471e-8123-f877a7ad2696","year":2024},"citing_paper":{"arxiv_id":"2501.06709","last_updated":"2025-01-12T04:29:39Z","snapshot_observed_at":"2026-08-20T12:30:06.726974Z","submitted_at":"2025-01-12T04:29:39Z","title":"Mell: Memory-Efficient Large Language Model Serving via Multi-GPU KV Cache Management","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-10T20:58:08.234544Z"},"links":{"citing_paper":"/paper/2501.06709"},"observation_digest":"sha256:a7a3535f9416da2e65eea080062ca4d56e3b428cd2e7c3ce86b693daadb33bfd","observation_id":"c8b27bae-ca69-4c32-aab8-045993c3a9e1","resolution":{"observed_at":"2026-08-10T20:58:09.623471Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:58:09.591757Z","title":"Orca: A distributed serving system for Transformer-Based generative models,","venue":null,"work_id":"2f4bad8c-acf7-46f7-997e-febe67bcf744","year":2022},"citing_paper":{"arxiv_id":"2501.06709","last_updated":"2025-01-12T04:29:39Z","snapshot_observed_at":"2026-08-20T12:30:06.726974Z","submitted_at":"2025-01-12T04:29:39Z","title":"Mell: Memory-Efficient Large Language Model Serving via Multi-GPU KV Cache Management","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T20:58:08.240643Z"},"links":{"citing_paper":"/paper/2501.06709"},"observation_digest":"sha256:d61d08b78f0089dc2fdb0857e8ac2808b5161937b847bfd86b29eed45ae96061","observation_id":"a9b7d5f8-4f80-4113-9703-d45e9911c44a","resolution":{"observed_at":"2026-08-10T20:58:09.600018Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:58:09.570194Z","title":"Splitwise: Efficient generative llm inference using phase splitting,","venue":null,"work_id":"d86285b9-0039-4067-bc14-15c12a98bd77","year":2024},"citing_paper":{"arxiv_id":"2501.06709","last_updated":"2025-01-12T04:29:39Z","snapshot_observed_at":"2026-08-20T12:30:06.726974Z","submitted_at":"2025-01-12T04:29:39Z","title":"Mell: Memory-Efficient Large Language Model Serving via Multi-GPU KV Cache Management","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-10T20:58:08.248315Z"},"links":{"citing_paper":"/paper/2501.06709"},"observation_digest":"sha256:e6eaca4fd68518ac43884ac50d6ca689273d0b80ca201ca01b0954313cb42c54","observation_id":"5a53d823-1a65-4e4a-859f-72126ad12211","resolution":{"observed_at":"2026-08-10T20:58:09.576977Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:58:09.542380Z","title":"Optimus: Warming serverless ml inference via inter-function model transformation,","venue":null,"work_id":"9f9d0fc4-4ddd-4d99-ac6a-18d8453057a1","year":2024},"citing_paper":{"arxiv_id":"2501.06709","last_updated":"2025-01-12T04:29:39Z","snapshot_observed_at":"2026-08-20T12:30:06.726974Z","submitted_at":"2025-01-12T04:29:39Z","title":"Mell: Memory-Efficient Large Language Model Serving via Multi-GPU KV Cache Management","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T20:58:08.254850Z"},"links":{"citing_paper":"/paper/2501.06709"},"observation_digest":"sha256:e1a4d439bf6c0b8b7b1cf81240a4eb0f9a6d289984eae10ba970fd8032660843","observation_id":"d3401967-7f6b-4079-82e4-878eb18686a4","resolution":{"observed_at":"2026-08-10T20:58:09.552481Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:58:09.522576Z","title":"Otas: An elastic transformer serving system via token adaptation,","venue":null,"work_id":"9d260880-57e1-4464-b561-41ecb81d299f","year":2024},"citing_paper":{"arxiv_id":"2501.06709","last_updated":"2025-01-12T04:29:39Z","snapshot_observed_at":"2026-08-20T12:30:06.726974Z","submitted_at":"2025-01-12T04:29:39Z","title":"Mell: Memory-Efficient Large Language Model Serving via Multi-GPU KV Cache Management","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T20:58:08.262315Z"},"links":{"citing_paper":"/paper/2501.06709"},"observation_digest":"sha256:cbb1e25216ce175e62fd67c68796bd69dddae6f716055daf60aa76693324ccbe","observation_id":"995dcd7f-b0f1-4a81-8ef3-f9f7b29ef31b","resolution":{"observed_at":"2026-08-10T20:58:09.528062Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:58:09.499829Z","title":"Galaxy: A resource-efficient collaborative edge ai system for in-situ transformer inference,","venue":null,"work_id":"0a1880b4-2d68-49a2-b404-f67e0392fbf8","year":2024},"citing_paper":{"arxiv_id":"2501.06709","last_updated":"2025-01-12T04:29:39Z","snapshot_observed_at":"2026-08-20T12:30:06.726974Z","submitted_at":"2025-01-12T04:29:39Z","title":"Mell: Memory-Efficient Large Language Model Serving via Multi-GPU KV Cache Management","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T20:58:08.267931Z"},"links":{"citing_paper":"/paper/2501.06709"},"observation_digest":"sha256:ca5bccfde725e40f655c011ae9e8544870b1cff886d159bf2527cad748f85236","observation_id":"c51ead8a-cd79-482f-9ad7-581802a112da","resolution":{"observed_at":"2026-08-10T20:58:09.507764Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:58:09.476962Z","title":"Efficiently scaling transformer inference,","venue":null,"work_id":"30a1b858-7508-4b93-a995-eacd5808be1c","year":2023},"citing_paper":{"arxiv_id":"2501.06709","last_updated":"2025-01-12T04:29:39Z","snapshot_observed_at":"2026-08-20T12:30:06.726974Z","submitted_at":"2025-01-12T04:29:39Z","title":"Mell: Memory-Efficient Large Language Model Serving via Multi-GPU KV Cache Management","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T20:58:08.276900Z"},"links":{"citing_paper":"/paper/2501.06709"},"observation_digest":"sha256:1dacc968733bb64d2147ca8086e1339812adeff9cc17ee42e749b00b4d901d87","observation_id":"49e0f30b-0397-499f-9da2-81df2420cc4a","resolution":{"observed_at":"2026-08-10T20:58:09.484082Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:58:09.454230Z","title":"LongloRA: Efficient fine-tuning of long-context large language models,","venue":null,"work_id":"fb5cc8ea-dd03-44e7-8f22-9f662bf2b36a","year":2024},"citing_paper":{"arxiv_id":"2501.06709","last_updated":"2025-01-12T04:29:39Z","snapshot_observed_at":"2026-08-20T12:30:06.726974Z","submitted_at":"2025-01-12T04:29:39Z","title":"Mell: Memory-Efficient Large Language Model Serving via Multi-GPU KV Cache Management","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T20:58:08.287438Z"},"links":{"citing_paper":"/paper/2501.06709"},"observation_digest":"sha256:62669ba6f0247a306ae599affd2e7054c46dd44a698692c7d7f8c268ac0e8680","observation_id":"b98744f7-ea30-4b0f-8c29-375784e0e37e","resolution":{"observed_at":"2026-08-10T20:58:09.461417Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:58:09.423395Z","title":"Efficient memory management for large lan- guage model serving with pagedattention,","venue":null,"work_id":"16223fe2-c22e-4016-8c73-d2e73f77e857","year":2023},"citing_paper":{"arxiv_id":"2501.06709","last_updated":"2025-01-12T04:29:39Z","snapshot_observed_at":"2026-08-20T12:30:06.726974Z","submitted_at":"2025-01-12T04:29:39Z","title":"Mell: Memory-Efficient Large Language Model Serving via Multi-GPU KV Cache Management","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T20:58:08.293309Z"},"links":{"citing_paper":"/paper/2501.06709"},"observation_digest":"sha256:138ff4e80c978eaff946803c12e7cc989c565eb2cfbaeda9f83e60211f6b2e99","observation_id":"c4a6f511-e017-42b4-aa5f-014cac17659c","resolution":{"observed_at":"2026-08-10T20:58:09.433817Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:58:09.400666Z","title":"Keyformer: Kv cache reduction through key tokens selection for efficient generative inference,","venue":null,"work_id":"c7cbad49-4eff-4814-9348-6e7d016289c7","year":2024},"citing_paper":{"arxiv_id":"2501.06709","last_updated":"2025-01-12T04:29:39Z","snapshot_observed_at":"2026-08-20T12:30:06.726974Z","submitted_at":"2025-01-12T04:29:39Z","title":"Mell: Memory-Efficient Large Language Model Serving via Multi-GPU KV Cache Management","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-10T20:58:08.298553Z"},"links":{"citing_paper":"/paper/2501.06709"},"observation_digest":"sha256:c099e2b9dcbb7f9b250b022f0eef256afd245f98ced4d9249279ffcbb8203c9b","observation_id":"36fe6834-c623-4a4a-b6ee-baf3aa39282c","resolution":{"observed_at":"2026-08-10T20:58:09.408044Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:58:09.378271Z","title":"H2o: Heavy-hitter oracle for efficient generative inference of large language models,","venue":null,"work_id":"61d47fe9-49cf-4c57-9d2d-1f6ea7aa934d","year":2023},"citing_paper":{"arxiv_id":"2501.06709","last_updated":"2025-01-12T04:29:39Z","snapshot_observed_at":"2026-08-20T12:30:06.726974Z","submitted_at":"2025-01-12T04:29:39Z","title":"Mell: Memory-Efficient Large Language Model Serving via Multi-GPU KV Cache Management","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-10T20:58:08.305038Z"},"links":{"citing_paper":"/paper/2501.06709"},"observation_digest":"sha256:3847cbdad2b11be9f07b9c1b4364053f44d7bc56f76fa3f795de9196dac275ce","observation_id":"d00bb195-ef32-4aaa-85a2-30ee35428d73","resolution":{"observed_at":"2026-08-10T20:58:09.386345Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:58:09.351778Z","title":"Efficient streaming language models with attention sinks,","venue":null,"work_id":"68d2465c-53e6-48fd-9c22-4a45c669879f","year":2024},"citing_paper":{"arxiv_id":"2501.06709","last_updated":"2025-01-12T04:29:39Z","snapshot_observed_at":"2026-08-20T12:30:06.726974Z","submitted_at":"2025-01-12T04:29:39Z","title":"Mell: Memory-Efficient Large Language Model Serving via Multi-GPU KV Cache Management","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T20:58:08.312308Z"},"links":{"citing_paper":"/paper/2501.06709"},"observation_digest":"sha256:cfae5fcaecf09c582e5777c7815b2cd2fab1f4341c43eb9afef916b20ce09d59","observation_id":"f871c23b-05d6-4ad8-9056-f3344e591c07","resolution":{"observed_at":"2026-08-10T20:58:09.359107Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:58:09.333995Z","title":"Scissorhands: Exploiting the persistence of importance hypothesis for LLM KV cache compression at test time,","venue":null,"work_id":"58daef13-e2a7-44b0-8bf4-7cd0667f1773","year":2023},"citing_paper":{"arxiv_id":"2501.06709","last_updated":"2025-01-12T04:29:39Z","snapshot_observed_at":"2026-08-20T12:30:06.726974Z","submitted_at":"2025-01-12T04:29:39Z","title":"Mell: Memory-Efficient Large Language Model Serving via Multi-GPU KV Cache Management","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T20:58:08.317601Z"},"links":{"citing_paper":"/paper/2501.06709"},"observation_digest":"sha256:78a11e7d9101d6b296cdbf5594b6df181a151c926696f7c1d45c50168b9aa819","observation_id":"c370e43a-eb65-47c6-908d-b817162cd06d","resolution":{"observed_at":"2026-08-10T20:58:09.339682Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.02750","last_updated":"2024-07-25T09:16:05Z","snapshot_observed_at":"2026-08-12T17:03:50.984887Z","submitted_at":"2024-02-05T06:06:47Z","title":"KIVI: A Tuning-Free Asymmetric 2bit Quantization for KV Cache","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.02750","snapshot_observed_at":"2026-08-10T20:58:08.323613Z","title":"Kivi: A tuning-free asymmetric 2bit quantization for kv cache,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.06709","last_updated":"2025-01-12T04:29:39Z","snapshot_observed_at":"2026-08-20T12:30:06.726974Z","submitted_at":"2025-01-12T04:29:39Z","title":"Mell: Memory-Efficient Large Language Model Serving via Multi-GPU KV Cache Management","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T20:58:08.323613Z"},"links":{"cited_paper":"/paper/2402.02750","citing_paper":"/paper/2501.06709"},"observation_digest":"sha256:fd47557c4aef5f3da280aef520f60819605d26d72332a6555dc6740ac0a1ad4f","observation_id":"f6791e28-2a64-42b7-901d-bd756b1bba73","resolution":{"observed_at":"2026-08-10T20:58:08.323613Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:58:09.307668Z","title":"Model tells you what to discard: Adaptive KV cache compression for LLMs,","venue":null,"work_id":"6f67a291-0e27-4d6c-826c-8e186eeff548","year":2024},"citing_paper":{"arxiv_id":"2501.06709","last_updated":"2025-01-12T04:29:39Z","snapshot_observed_at":"2026-08-20T12:30:06.726974Z","submitted_at":"2025-01-12T04:29:39Z","title":"Mell: Memory-Efficient Large Language Model Serving via Multi-GPU KV Cache Management","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-10T20:58:08.335736Z"},"links":{"citing_paper":"/paper/2501.06709"},"observation_digest":"sha256:e1fc155f4c85c352e81a75ca420a6aba41f286e2771e7ee1f798f938ef5708ee","observation_id":"d7d8c44a-c3e6-421b-9e35-83e93800a937","resolution":{"observed_at":"2026-08-10T20:58:09.320919Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:58:09.282029Z","title":"Flexgen: high-throughput generative inference of large language models with a single gpu,","venue":null,"work_id":"864d3fcc-260d-4166-a9cd-748d86753ea4","year":2023},"citing_paper":{"arxiv_id":"2501.06709","last_updated":"2025-01-12T04:29:39Z","snapshot_observed_at":"2026-08-20T12:30:06.726974Z","submitted_at":"2025-01-12T04:29:39Z","title":"Mell: Memory-Efficient Large Language Model Serving via Multi-GPU KV Cache Management","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-10T20:58:08.342949Z"},"links":{"citing_paper":"/paper/2501.06709"},"observation_digest":"sha256:b0124003e0b937ed37a360c1c6ccfd59daa565a896ca5d2e0b2406f41c094016","observation_id":"92d5fa76-fd6b-45b5-8513-c5cddeeb8fac","resolution":{"observed_at":"2026-08-10T20:58:09.289777Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:58:09.257689Z","title":"Infinigen: Efficient generative in- ference of large language models with dynamic kv cache management,","venue":null,"work_id":"e5a17aa4-df23-415b-a172-2c53a607331e","year":2024},"citing_paper":{"arxiv_id":"2501.06709","last_updated":"2025-01-12T04:29:39Z","snapshot_observed_at":"2026-08-20T12:30:06.726974Z","submitted_at":"2025-01-12T04:29:39Z","title":"Mell: Memory-Efficient Large Language Model Serving via Multi-GPU KV Cache Management","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-10T20:58:08.349106Z"},"links":{"citing_paper":"/paper/2501.06709"},"observation_digest":"sha256:eedb434ff14a571473c4837aed125df6f72a4fdfccda5d40611ebad13f314a5f","observation_id":"21a3dae1-09ea-4da9-9f75-686ecf9d61e7","resolution":{"observed_at":"2026-08-10T20:58:09.265498Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:58:09.232829Z","title":"Cost-Efficient large language model serving for multi-turn conversations with CachedAttention,","venue":null,"work_id":"87917f8c-76c4-4b95-82c0-ee0f464d1567","year":2024},"citing_paper":{"arxiv_id":"2501.06709","last_updated":"2025-01-12T04:29:39Z","snapshot_observed_at":"2026-08-20T12:30:06.726974Z","submitted_at":"2025-01-12T04:29:39Z","title":"Mell: Memory-Efficient Large Language Model Serving via Multi-GPU KV Cache Management","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-10T20:58:08.356264Z"},"links":{"citing_paper":"/paper/2501.06709"},"observation_digest":"sha256:1c741b1417ff503a95aad9c02c78fbc7fab2bc69a5b6ed9a09c5397bc1ff8615","observation_id":"1668b1ff-fff7-482d-9975-177f6099fe7d","resolution":{"observed_at":"2026-08-10T20:58:09.241225Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:58:09.211513Z","title":"Deepspeed- inference: enabling efficient inference of transformer models at unprece- dented scale,","venue":null,"work_id":"33177218-d3e4-4b40-bd6e-a7526d8eb0e1","year":2022},"citing_paper":{"arxiv_id":"2501.06709","last_updated":"2025-01-12T04:29:39Z","snapshot_observed_at":"2026-08-20T12:30:06.726974Z","submitted_at":"2025-01-12T04:29:39Z","title":"Mell: Memory-Efficient Large Language Model Serving via Multi-GPU KV Cache Management","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-10T20:58:08.363065Z"},"links":{"citing_paper":"/paper/2501.06709"},"observation_digest":"sha256:b0f206d474655c3d3345b0f41a7f2d37912b99cd3038cc4f9a06061141d8f365","observation_id":"17a3a078-f1d3-4e2a-a5b9-b39cccd494d5","resolution":{"observed_at":"2026-08-10T20:58:09.218362Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:58:09.187230Z","title":"Llumnix: Dynamic scheduling for large language model serving,","venue":null,"work_id":"32c1325c-b5ab-4b85-b607-2b077a0d7678","year":2024},"citing_paper":{"arxiv_id":"2501.06709","last_updated":"2025-01-12T04:29:39Z","snapshot_observed_at":"2026-08-20T12:30:06.726974Z","submitted_at":"2025-01-12T04:29:39Z","title":"Mell: Memory-Efficient Large Language Model Serving via Multi-GPU KV Cache Management","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-10T20:58:08.369100Z"},"links":{"citing_paper":"/paper/2501.06709"},"observation_digest":"sha256:077e52ce80a281bdce5ebb418884e8d63753b8119db8d5e8f64f226f8a42f524","observation_id":"e7f660de-3832-4453-8725-a33dbb518132","resolution":{"observed_at":"2026-08-10T20:58:09.193397Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:58:09.166339Z","title":"Serverlessllm: Low-latency serverless inference for large language models,","venue":null,"work_id":"d3c06352-eb25-4970-b405-0044fac1143f","year":2024},"citing_paper":{"arxiv_id":"2501.06709","last_updated":"2025-01-12T04:29:39Z","snapshot_observed_at":"2026-08-20T12:30:06.726974Z","submitted_at":"2025-01-12T04:29:39Z","title":"Mell: Memory-Efficient Large Language Model Serving via Multi-GPU KV Cache Management","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-10T20:58:08.374194Z"},"links":{"citing_paper":"/paper/2501.06709"},"observation_digest":"sha256:8409742f50cf732eb5c4d4f2d061ab62f54015c6f8b38561f11117b85852b1fa","observation_id":"9057a506-236a-438c-90e5-4d64452995a6","resolution":{"observed_at":"2026-08-10T20:58:09.173370Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:58:09.139862Z","title":"Turbotransformers: an efficient gpu serving system for transformer models,","venue":null,"work_id":"af5d4a00-0a8f-4bdd-a976-4620b0fc14fb","year":2021},"citing_paper":{"arxiv_id":"2501.06709","last_updated":"2025-01-12T04:29:39Z","snapshot_observed_at":"2026-08-20T12:30:06.726974Z","submitted_at":"2025-01-12T04:29:39Z","title":"Mell: Memory-Efficient Large Language Model Serving via Multi-GPU KV Cache Management","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-10T20:58:08.379805Z"},"links":{"citing_paper":"/paper/2501.06709"},"observation_digest":"sha256:4eb108b633df0e71d204bd82ea2972cc3d4b0230ecfb23c77cf989e2629d837c","observation_id":"19df26f4-727a-4b8a-b54f-a3a7326ff70c","resolution":{"observed_at":"2026-08-10T20:58:09.146756Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:58:09.107459Z","title":"Taming throughput-latency tradeoff in llm inference with sarathi-serve,","venue":null,"work_id":"b74639ea-fac4-4a46-8941-173685d9f747","year":2024},"citing_paper":{"arxiv_id":"2501.06709","last_updated":"2025-01-12T04:29:39Z","snapshot_observed_at":"2026-08-20T12:30:06.726974Z","submitted_at":"2025-01-12T04:29:39Z","title":"Mell: Memory-Efficient Large Language Model Serving via Multi-GPU KV Cache Management","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-10T20:58:08.385167Z"},"links":{"citing_paper":"/paper/2501.06709"},"observation_digest":"sha256:8fefacceeedcd33c185ccf5cf116e62b0f4c75a37cf18016fab343f2b97cb5b5","observation_id":"7e83071a-3a68-4526-94d9-b8d3d42306be","resolution":{"observed_at":"2026-08-10T20:58:09.122150Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:58:09.079487Z","title":"Distserve: Disaggregating prefill and decoding for goodput-optimized large language model serving,","venue":null,"work_id":"e6e4c96a-4f70-4a31-a74b-a2ddf550411b","year":2024},"citing_paper":{"arxiv_id":"2501.06709","last_updated":"2025-01-12T04:29:39Z","snapshot_observed_at":"2026-08-20T12:30:06.726974Z","submitted_at":"2025-01-12T04:29:39Z","title":"Mell: Memory-Efficient Large Language Model Serving via Multi-GPU KV Cache Management","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-10T20:58:08.394284Z"},"links":{"citing_paper":"/paper/2501.06709"},"observation_digest":"sha256:c8eb7d477a99dd09b4d74b79f817460bb67409b93ae7189b3f2ba465b375440c","observation_id":"3cc9f462-3e53-4d19-876a-a09fa998e019","resolution":{"observed_at":"2026-08-10T20:58:09.086283Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.11181","last_updated":"2024-01-20T09:43:36Z","snapshot_observed_at":"2026-08-16T14:25:57.735259Z","submitted_at":"2024-01-20T09:43:36Z","title":"Inference without Interference: Disaggregate LLM Inference for Mixed Downstream Workloads","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.11181","snapshot_observed_at":"2026-08-10T20:58:08.401041Z","title":"Inference without interference: Disaggregate llm inference for mixed downstream workloads,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.06709","last_updated":"2025-01-12T04:29:39Z","snapshot_observed_at":"2026-08-20T12:30:06.726974Z","submitted_at":"2025-01-12T04:29:39Z","title":"Mell: Memory-Efficient Large Language Model Serving via Multi-GPU KV Cache Management","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-10T20:58:08.401041Z"},"links":{"cited_paper":"/paper/2401.11181","citing_paper":"/paper/2501.06709"},"observation_digest":"sha256:18478dc48aaea2c819cdd892a110ea9099cbb78b75514dad9c23b041a1ef8f73","observation_id":"a9042608-ac4d-4cde-97b3-35f7cd5fc350","resolution":{"observed_at":"2026-08-10T20:58:08.401041Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:58:09.050196Z","title":"dLoRA: Dynam- ically orchestrating requests and adapters for LoRA LLM serving,","venue":null,"work_id":"a1f884d5-007e-403c-b037-0213331cb62a","year":2024},"citing_paper":{"arxiv_id":"2501.06709","last_updated":"2025-01-12T04:29:39Z","snapshot_observed_at":"2026-08-20T12:30:06.726974Z","submitted_at":"2025-01-12T04:29:39Z","title":"Mell: Memory-Efficient Large Language Model Serving via Multi-GPU KV Cache Management","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-10T20:58:08.406766Z"},"links":{"citing_paper":"/paper/2501.06709"},"observation_digest":"sha256:d71fd8d7cf156868f37ae62fb2b10f2c09005e688f194d4d8f37889fcc4b52fa","observation_id":"3405f68f-6281-44eb-ba11-2d40878f4747","resolution":{"observed_at":"2026-08-10T20:58:09.061030Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:58:09.026973Z","title":"LMSYS- chat-1m: A large-scale real-world LLM conversation dataset,","venue":null,"work_id":"db1afe38-7f0a-4cb8-bf78-451bcf32f627","year":2024},"citing_paper":{"arxiv_id":"2501.06709","last_updated":"2025-01-12T04:29:39Z","snapshot_observed_at":"2026-08-20T12:30:06.726974Z","submitted_at":"2025-01-12T04:29:39Z","title":"Mell: Memory-Efficient Large Language Model Serving via Multi-GPU KV Cache Management","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-10T20:58:08.411772Z"},"links":{"citing_paper":"/paper/2501.06709"},"observation_digest":"sha256:ff819de117446ad802c9a9cb46066cc5265d2b04581a96cb87e973f49b38ca50","observation_id":"7546fca3-7b42-40bd-9489-c5b6ea9e92ce","resolution":{"observed_at":"2026-08-10T20:58:09.033618Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:58:09.009407Z","title":"Wildchat: 1m chatGPT interaction logs in the wild,","venue":null,"work_id":"7918c284-59e7-4470-b1ae-2ab051830d1f","year":2024},"citing_paper":{"arxiv_id":"2501.06709","last_updated":"2025-01-12T04:29:39Z","snapshot_observed_at":"2026-08-20T12:30:06.726974Z","submitted_at":"2025-01-12T04:29:39Z","title":"Mell: Memory-Efficient Large Language Model Serving via Multi-GPU KV Cache Management","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-10T20:58:08.417714Z"},"links":{"citing_paper":"/paper/2501.06709"},"observation_digest":"sha256:c432222a82cc49ad971195357dbd28fb635f67bf8c332d427c403733f90b709b","observation_id":"2f10efc9-75f1-4584-8455-1b3a8a0032fb","resolution":{"observed_at":"2026-08-10T20:58:09.014848Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:58:08.990139Z","title":"Judging LLM-as-a-judge with MT-bench and chatbot arena,","venue":null,"work_id":"b2eeb4ce-6995-4e25-b4a6-1920ba4699b8","year":2023},"citing_paper":{"arxiv_id":"2501.06709","last_updated":"2025-01-12T04:29:39Z","snapshot_observed_at":"2026-08-20T12:30:06.726974Z","submitted_at":"2025-01-12T04:29:39Z","title":"Mell: Memory-Efficient Large Language Model Serving via Multi-GPU KV Cache Management","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-10T20:58:08.423055Z"},"links":{"citing_paper":"/paper/2501.06709"},"observation_digest":"sha256:cc3b3ed86b7c311a5b54e97fc6de52cc083ce81719e2699218ee3957a1cf809d","observation_id":"207f5195-686a-466c-a0d1-ae5395559b42","resolution":{"observed_at":"2026-08-10T20:58:08.995713Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:58:08.429322Z","title":"Koala: A dialogue model for academic research,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.06709","last_updated":"2025-01-12T04:29:39Z","snapshot_observed_at":"2026-08-20T12:30:06.726974Z","submitted_at":"2025-01-12T04:29:39Z","title":"Mell: Memory-Efficient Large Language Model Serving via Multi-GPU KV Cache Management","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-10T20:58:08.429322Z"},"links":{"citing_paper":"/paper/2501.06709"},"observation_digest":"sha256:121e1470b44cebfc7752c313dbe71e615554fedc5f1148f6673b35b7378567ba","observation_id":"7b768cf5-06c4-4aab-8dc5-4266b15924aa","resolution":{"observed_at":"2026-08-10T20:58:08.429322Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:58:08.959430Z","title":"Response length perception and sequence scheduling: An LLM-empowered LLM inference pipeline,","venue":null,"work_id":"b08948e1-5391-4c73-a470-209f31cdeed9","year":2023},"citing_paper":{"arxiv_id":"2501.06709","last_updated":"2025-01-12T04:29:39Z","snapshot_observed_at":"2026-08-20T12:30:06.726974Z","submitted_at":"2025-01-12T04:29:39Z","title":"Mell: Memory-Efficient Large Language Model Serving via Multi-GPU KV Cache Management","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-10T20:58:08.435506Z"},"links":{"citing_paper":"/paper/2501.06709"},"observation_digest":"sha256:da3650a4d2589de23ae8c4dcc43cb315dfe8ef33f82cdfe66963ad306c3b2142","observation_id":"37831d52-d151-4bfd-b0d0-10ecd0a38cdc","resolution":{"observed_at":"2026-08-10T20:58:08.965068Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:58:08.940933Z","title":null,"venue":null,"work_id":"a76d6939-7c90-41b2-a7ef-d913c287f47f","year":1972},"citing_paper":{"arxiv_id":"2501.06709","last_updated":"2025-01-12T04:29:39Z","snapshot_observed_at":"2026-08-20T12:30:06.726974Z","submitted_at":"2025-01-12T04:29:39Z","title":"Mell: Memory-Efficient Large Language Model Serving via Multi-GPU KV Cache Management","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-10T20:58:08.442068Z"},"links":{"citing_paper":"/paper/2501.06709"},"observation_digest":"sha256:b1ef65f687a1090136466fe2483ec07c59248f615b8f02edb53a7847f57db27a","observation_id":"53e40a07-cfdc-4642-8716-f2bc105a4cce","resolution":{"observed_at":"2026-08-10T20:58:08.946688Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:58:08.922158Z","title":"Adaptive resource provi- sioning for the cloud using online bin packing,","venue":null,"work_id":"891e31d6-5ee8-4591-a06b-f7a7b0d82eca","year":2014},"citing_paper":{"arxiv_id":"2501.06709","last_updated":"2025-01-12T04:29:39Z","snapshot_observed_at":"2026-08-20T12:30:06.726974Z","submitted_at":"2025-01-12T04:29:39Z","title":"Mell: Memory-Efficient Large Language Model Serving via Multi-GPU KV Cache Management","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-10T20:58:08.448959Z"},"links":{"citing_paper":"/paper/2501.06709"},"observation_digest":"sha256:e25ec7a767b2479c57f1e3d3b020d32ba389eda9ccd410d5248b76a9a375418d","observation_id":"f145516f-1315-48cf-b63d-90fa4948dcbb","resolution":{"observed_at":"2026-08-10T20:58:08.928833Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:58:08.902236Z","title":"Efficient online strategies for renting servers in the cloud,","venue":null,"work_id":"6db3e78a-3ed8-4577-8a67-d66be6f92645","year":2015},"citing_paper":{"arxiv_id":"2501.06709","last_updated":"2025-01-12T04:29:39Z","snapshot_observed_at":"2026-08-20T12:30:06.726974Z","submitted_at":"2025-01-12T04:29:39Z","title":"Mell: Memory-Efficient Large Language Model Serving via Multi-GPU KV Cache Management","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-10T20:58:08.454685Z"},"links":{"citing_paper":"/paper/2501.06709"},"observation_digest":"sha256:385d6383109e5fdd9938a1c75fb653b3927bfaa77c72e5e2097560a270d7e9df","observation_id":"4abe209a-994f-41df-9d29-5bf5a9aac970","resolution":{"observed_at":"2026-08-10T20:58:08.908341Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:58:08.460910Z","title":"Powernap: eliminating server idle power,","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2501.06709","last_updated":"2025-01-12T04:29:39Z","snapshot_observed_at":"2026-08-20T12:30:06.726974Z","submitted_at":"2025-01-12T04:29:39Z","title":"Mell: Memory-Efficient Large Language Model Serving via Multi-GPU KV Cache Management","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-10T20:58:08.460910Z"},"links":{"citing_paper":"/paper/2501.06709"},"observation_digest":"sha256:a2bb1d7092c800be2c568abc661c59935a1c6265d4fcced0de131d8143144508","observation_id":"71d93163-586b-4e8f-8e20-fef44de7b11d","resolution":{"observed_at":"2026-08-10T20:58:08.460910Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:58:08.875119Z","title":"Easy, fast, and cheap llm serving for everyone,","venue":null,"work_id":"1955e038-66be-4cf6-aed7-0096c7c8a022","year":2024},"citing_paper":{"arxiv_id":"2501.06709","last_updated":"2025-01-12T04:29:39Z","snapshot_observed_at":"2026-08-20T12:30:06.726974Z","submitted_at":"2025-01-12T04:29:39Z","title":"Mell: Memory-Efficient Large Language Model Serving via Multi-GPU KV Cache Management","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-10T20:58:08.466106Z"},"links":{"citing_paper":"/paper/2501.06709"},"observation_digest":"sha256:398efb90b05015a94781dc397a2b3c0a314e4d907135bd73022942f748dbe20b","observation_id":"99c54bf0-4ef5-498b-9932-3f39f792bc10","resolution":{"observed_at":"2026-08-10T20:58:08.885991Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:58:08.853701Z","title":"Ray: a unified framework for scaling ai and python applications,","venue":null,"work_id":"07b9aeb7-415e-4068-818c-7b86d4dcec8c","year":null},"citing_paper":{"arxiv_id":"2501.06709","last_updated":"2025-01-12T04:29:39Z","snapshot_observed_at":"2026-08-20T12:30:06.726974Z","submitted_at":"2025-01-12T04:29:39Z","title":"Mell: Memory-Efficient Large Language Model Serving via Multi-GPU KV Cache Management","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-10T20:58:08.474077Z"},"links":{"citing_paper":"/paper/2501.06709"},"observation_digest":"sha256:fc2ba78c5b1cadb7ed1542faeea3213866554ac138088e896419cfcbc73869c2","observation_id":"e58c2e49-e9eb-416a-a8f6-336b99cdc3ec","resolution":{"observed_at":"2026-08-10T20:58:08.859845Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:58:08.803441Z","title":"Gloo: Collective communications library with various primitives for multi-machine training,","venue":null,"work_id":"dae3d649-9550-4ede-9556-e1265b1b32b8","year":2024},"citing_paper":{"arxiv_id":"2501.06709","last_updated":"2025-01-12T04:29:39Z","snapshot_observed_at":"2026-08-20T12:30:06.726974Z","submitted_at":"2025-01-12T04:29:39Z","title":"Mell: Memory-Efficient Large Language Model Serving via Multi-GPU KV Cache Management","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-10T20:58:08.486606Z"},"links":{"citing_paper":"/paper/2501.06709"},"observation_digest":"sha256:4a9f53da4c1014e98385f1324ee529d362c345ce1cceb3a20b476432b11923a3","observation_id":"8ecb158a-0e6c-4f84-a2c1-6053038575de","resolution":{"observed_at":"2026-08-10T20:58:08.810006Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:58:08.784105Z","title":"Openai platform document,","venue":null,"work_id":"9bc027d9-248b-4dc0-be8b-02c3a081bc4c","year":2024},"citing_paper":{"arxiv_id":"2501.06709","last_updated":"2025-01-12T04:29:39Z","snapshot_observed_at":"2026-08-20T12:30:06.726974Z","submitted_at":"2025-01-12T04:29:39Z","title":"Mell: Memory-Efficient Large Language Model Serving via Multi-GPU KV Cache Management","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-10T20:58:08.491510Z"},"links":{"citing_paper":"/paper/2501.06709"},"observation_digest":"sha256:e193cdf0dce9418a12993cec24ea5b52f58fec1e3b531a0242553bec76507b51","observation_id":"a36461d3-72c8-4209-b669-8f95285db950","resolution":{"observed_at":"2026-08-10T20:58:08.790533Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:58:08.761323Z","title":"Anthropic platform document,","venue":null,"work_id":"6d6306be-e3c6-41ea-a7be-8d2dcc074827","year":2024},"citing_paper":{"arxiv_id":"2501.06709","last_updated":"2025-01-12T04:29:39Z","snapshot_observed_at":"2026-08-20T12:30:06.726974Z","submitted_at":"2025-01-12T04:29:39Z","title":"Mell: Memory-Efficient Large Language Model Serving via Multi-GPU KV Cache Management","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-10T20:58:08.498820Z"},"links":{"citing_paper":"/paper/2501.06709"},"observation_digest":"sha256:bf4c3e7dd6f5c7a42b94c83791f3828ea2acee66c0fdeb6ec884107ec4e23b3c","observation_id":"8f967afb-874f-4d4b-957e-8dee2255b2e4","resolution":{"observed_at":"2026-08-10T20:58:08.769470Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:58:08.829320Z","title":"Available: https://github.com/ray-project/ray","venue":null,"work_id":"1a62ebd2-dc2e-4944-a9a5-5c21e12af5b5","year":null},"citing_paper":{"arxiv_id":"2501.06709","last_updated":"2025-01-12T04:29:39Z","snapshot_observed_at":"2026-08-20T12:30:06.726974Z","submitted_at":"2025-01-12T04:29:39Z","title":"Mell: Memory-Efficient Large Language Model Serving via Multi-GPU KV Cache Management","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-10T20:58:08.479825Z"},"links":{"citing_paper":"/paper/2501.06709"},"observation_digest":"sha256:c90f334a6ef2bd3565ba97fa3e19c6f96f3aec61c682d169d2cbf42b23fcf0ec","observation_id":"4a2d838e-b267-4d3b-8d9e-a7e1500860a8","resolution":{"observed_at":"2026-08-10T20:58:08.836802Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2501.06709","last_updated":"2025-01-12T04:29:39Z","latest_version":1,"primary_category":"cs.DC","snapshot_observed_at":"2026-08-20T12:30:06.726974Z","submitted_at":"2025-01-12T04:29:39Z","title":"Mell: Memory-Efficient Large Language Model Serving via Multi-GPU KV Cache Management"},"reference_resolution":{"displayed":44,"state_counts":{"malformed_identifier":2,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":5,"verified_exact":0,"verified_fuzzy":37},"total_outbound_references":44},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"thesis":"As of 20 August 2026, this Paper Citation Record lists 44 of 44 outbound references and 4 inbound Pith citation observations for arXiv:2501.06709."}