{"as_of":"2026-08-18T07:21:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:cd5937a0101fdeab419c8a2659e740dc48535e328dceccfbc05a12059e37ee02","coverage":[{"denominator":51,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":51,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T14:37:20.782815Z","state":"measured"},{"denominator":51,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":51,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.06557/citation-record","integrity":"/paper/2608.06557/integrity","json":"/paper/2608.06557/citation-record.json","paper":"/paper/2608.06557"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:37:20.614826Z","title":"Qwen2 technical report,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.06557","last_updated":"2026-08-06T20:14:21Z","snapshot_observed_at":"2026-08-15T22:55:47.932345Z","submitted_at":"2026-08-06T20:14:21Z","title":"Cascade: Exploiting SLO-Aware latency budget for fair and high goodput LLM inference serving","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T14:37:20.614826Z"},"links":{"citing_paper":"/paper/2608.06557"},"observation_digest":"sha256:5a3341174a1340325215571e6a05902a558ff89dcdc7644b8208098c14eb3374","observation_id":"f7c086e7-da91-4cf2-9e73-416473ca3692","resolution":{"observed_at":"2026-08-15T14:37:20.614826Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:37:21.993068Z","title":"Vidur: A large-scale simulation framework for llm inference,","venue":null,"work_id":"32bea8e5-1a50-44a3-bcc3-4138ee2f5b21","year":2024},"citing_paper":{"arxiv_id":"2608.06557","last_updated":"2026-08-06T20:14:21Z","snapshot_observed_at":"2026-08-15T22:55:47.932345Z","submitted_at":"2026-08-06T20:14:21Z","title":"Cascade: Exploiting SLO-Aware latency budget for fair and high goodput LLM inference serving","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-15T14:37:20.619844Z"},"links":{"citing_paper":"/paper/2608.06557"},"observation_digest":"sha256:fd3996e0d26d62a02e8bad4a06cd26c81b0c46b51f4977ac638af4a16704b525","observation_id":"6df7e7c6-661c-4448-829f-664448a2ff39","resolution":{"observed_at":"2026-08-15T14:37:21.996527Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:37:20.623715Z","title":"Taming throughput-latency tradeoff in llm inference with sarathi-serve,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.06557","last_updated":"2026-08-06T20:14:21Z","snapshot_observed_at":"2026-08-15T22:55:47.932345Z","submitted_at":"2026-08-06T20:14:21Z","title":"Cascade: Exploiting SLO-Aware latency budget for fair and high goodput LLM inference serving","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-15T14:37:20.623715Z"},"links":{"citing_paper":"/paper/2608.06557"},"observation_digest":"sha256:b22631557f18092863086a006fc2dea59b6aff1ca0e48a49ecd41ba1783a0918","observation_id":"e40999ce-2470-470b-a2f0-1178eb087af6","resolution":{"observed_at":"2026-08-15T14:37:20.623715Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:37:21.976796Z","title":"No request left behind: Tackling heterogeneity in long-context llm inference with medha,","venue":null,"work_id":"c796e237-0d8b-4075-97af-036066965165","year":null},"citing_paper":{"arxiv_id":"2608.06557","last_updated":"2026-08-06T20:14:21Z","snapshot_observed_at":"2026-08-15T22:55:47.932345Z","submitted_at":"2026-08-06T20:14:21Z","title":"Cascade: Exploiting SLO-Aware latency budget for fair and high goodput LLM inference serving","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-15T14:37:20.627580Z"},"links":{"citing_paper":"/paper/2608.06557"},"observation_digest":"sha256:7aceec6ad82aa169dbe38dd2343a4a5242d9a8c3331c345dd5356b4775b41d4f","observation_id":"31e0c590-f737-4ce3-8d93-0fcd5148538c","resolution":{"observed_at":"2026-08-15T14:37:21.981307Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:37:21.966271Z","title":"Llama 3 model card,","venue":null,"work_id":"e2d43ce6-54e9-4273-b5e2-e7462d298118","year":2024},"citing_paper":{"arxiv_id":"2608.06557","last_updated":"2026-08-06T20:14:21Z","snapshot_observed_at":"2026-08-15T22:55:47.932345Z","submitted_at":"2026-08-06T20:14:21Z","title":"Cascade: Exploiting SLO-Aware latency budget for fair and high goodput LLM inference serving","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-15T14:37:20.634509Z"},"links":{"citing_paper":"/paper/2608.06557"},"observation_digest":"sha256:35681a85cc4e1d70f405b78310c7be05a23e699f929a411bc3899259f0e96594","observation_id":"2c8554d3-2816-43c6-90f4-9db367884daa","resolution":{"observed_at":"2026-08-15T14:37:21.969707Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:37:20.638243Z","title":"GQA: Training generalized multi-query transformer models from multi-head checkpoints,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.06557","last_updated":"2026-08-06T20:14:21Z","snapshot_observed_at":"2026-08-15T22:55:47.932345Z","submitted_at":"2026-08-06T20:14:21Z","title":"Cascade: Exploiting SLO-Aware latency budget for fair and high goodput LLM inference serving","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-15T14:37:20.638243Z"},"links":{"citing_paper":"/paper/2608.06557"},"observation_digest":"sha256:256768bc2137bec2b5535713acaa3bab038301e18cb153ce9df42de1f513d554","observation_id":"d35df27b-d3f1-4666-867e-a1851c6c7424","resolution":{"observed_at":"2026-08-15T14:37:20.638243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:37:21.950801Z","title":"Qwen-bailian anonymous dataset,","venue":null,"work_id":"0e1f92f5-b9ce-454c-864a-a42a942dccc3","year":2025},"citing_paper":{"arxiv_id":"2608.06557","last_updated":"2026-08-06T20:14:21Z","snapshot_observed_at":"2026-08-15T22:55:47.932345Z","submitted_at":"2026-08-06T20:14:21Z","title":"Cascade: Exploiting SLO-Aware latency budget for fair and high goodput LLM inference serving","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-15T14:37:20.641506Z"},"links":{"citing_paper":"/paper/2608.06557"},"observation_digest":"sha256:190fe1cba46dc181bef6ae874a7f88b13440d4e981c627d19b52c60e816fe362","observation_id":"09985aab-a5fe-4d0a-b00c-c0fca85c91eb","resolution":{"observed_at":"2026-08-15T14:37:21.954386Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03374","last_updated":"2021-07-14T17:16:02Z","snapshot_observed_at":"2026-08-08T11:58:24.516369Z","submitted_at":"2021-07-07T17:41:24Z","title":"Evaluating Large Language Models Trained on Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.03374","snapshot_observed_at":"2026-08-15T14:37:20.644989Z","title":"Evaluating large language models trained on code,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.06557","last_updated":"2026-08-06T20:14:21Z","snapshot_observed_at":"2026-08-15T22:55:47.932345Z","submitted_at":"2026-08-06T20:14:21Z","title":"Cascade: Exploiting SLO-Aware latency budget for fair and high goodput LLM inference serving","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T14:37:20.644989Z"},"links":{"cited_paper":"/paper/2107.03374","citing_paper":"/paper/2608.06557"},"observation_digest":"sha256:1d605b506f0b0523c6c81de6b5be263974ef87b0fd3e0dfc02f911f259dfca4f","observation_id":"0b689cdd-67dd-48e1-8f04-25bec86b029b","resolution":{"observed_at":"2026-08-15T14:37:20.644989Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.08784","last_updated":"2025-04-05T17:41:26Z","snapshot_observed_at":"2026-08-16T12:43:43.014719Z","submitted_at":"2025-04-05T17:41:26Z","title":"SLOs-Serve: Optimized Serving of Multi-SLO LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.08784","snapshot_observed_at":"2026-08-15T14:37:20.648215Z","title":"Slos-serve: Optimized serving of multi-slo llms,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06557","last_updated":"2026-08-06T20:14:21Z","snapshot_observed_at":"2026-08-15T22:55:47.932345Z","submitted_at":"2026-08-06T20:14:21Z","title":"Cascade: Exploiting SLO-Aware latency budget for fair and high goodput LLM inference serving","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T14:37:20.648215Z"},"links":{"cited_paper":"/paper/2504.08784","citing_paper":"/paper/2608.06557"},"observation_digest":"sha256:195e61ed94834b00f84428deca324c11aade122e580919b8fe07db1684831b45","observation_id":"10c15315-24f1-4f0c-8d2d-322151282dd5","resolution":{"observed_at":"2026-08-15T14:37:20.648215Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.08658","last_updated":"2023-01-20T16:06:59Z","snapshot_observed_at":"2026-08-16T16:01:08.066346Z","submitted_at":"2023-01-20T16:06:59Z","title":"ATP: Adaptive Tensor Parallelism for Foundation Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.08658","snapshot_observed_at":"2026-08-15T14:37:20.651825Z","title":"Atp: Adaptive tensor parallelism for foundation models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.06557","last_updated":"2026-08-06T20:14:21Z","snapshot_observed_at":"2026-08-15T22:55:47.932345Z","submitted_at":"2026-08-06T20:14:21Z","title":"Cascade: Exploiting SLO-Aware latency budget for fair and high goodput LLM inference serving","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-15T14:37:20.651825Z"},"links":{"cited_paper":"/paper/2301.08658","citing_paper":"/paper/2608.06557"},"observation_digest":"sha256:87daee70b6f8249444665057b84001f24b8b40f06161b32c9272fb4cbb93ef08","observation_id":"b5a122f2-266f-42e2-9cab-25cc238628ab","resolution":{"observed_at":"2026-08-15T14:37:20.651825Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:37:20.655496Z","title":"Jockey: guaranteed job latency in data parallel clusters,","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2608.06557","last_updated":"2026-08-06T20:14:21Z","snapshot_observed_at":"2026-08-15T22:55:47.932345Z","submitted_at":"2026-08-06T20:14:21Z","title":"Cascade: Exploiting SLO-Aware latency budget for fair and high goodput LLM inference serving","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T14:37:20.655496Z"},"links":{"citing_paper":"/paper/2608.06557"},"observation_digest":"sha256:8c5fb33e8962849d55d3d586951ae7f15728eb80c996ff6ed5f2cb11b8d1337c","observation_id":"293345e1-d02f-42ba-b9db-730dc9fa4821","resolution":{"observed_at":"2026-08-15T14:37:20.655496Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:37:20.658651Z","title":"Prompt cache: Modular attention reuse for low-latency inference,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06557","last_updated":"2026-08-06T20:14:21Z","snapshot_observed_at":"2026-08-15T22:55:47.932345Z","submitted_at":"2026-08-06T20:14:21Z","title":"Cascade: Exploiting SLO-Aware latency budget for fair and high goodput LLM inference serving","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T14:37:20.658651Z"},"links":{"citing_paper":"/paper/2608.06557"},"observation_digest":"sha256:9f82aecec548902dd96593cb71400a3381ee3470d6f1f611dd65d6c6e8c1865e","observation_id":"c648caa0-8e40-47cf-afd1-8f33e914deb2","resolution":{"observed_at":"2026-08-15T14:37:20.658651Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:37:20.665753Z","title":"Qoserve: Breaking the silos of llm inference serving,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.06557","last_updated":"2026-08-06T20:14:21Z","snapshot_observed_at":"2026-08-15T22:55:47.932345Z","submitted_at":"2026-08-06T20:14:21Z","title":"Cascade: Exploiting SLO-Aware latency budget for fair and high goodput LLM inference serving","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T14:37:20.665753Z"},"links":{"citing_paper":"/paper/2608.06557"},"observation_digest":"sha256:dae36de8c4ded848234ef59ec058b5c2af8c96c4c34e4711a14bea64fc269a91","observation_id":"a4c25151-548c-47f8-8a7e-89bac272047a","resolution":{"observed_at":"2026-08-15T14:37:20.665753Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:37:21.935887Z","title":"[Online]","venue":null,"work_id":"9592cda6-1743-41e8-badf-995008f1cd9b","year":2025},"citing_paper":{"arxiv_id":"2608.06557","last_updated":"2026-08-06T20:14:21Z","snapshot_observed_at":"2026-08-15T22:55:47.932345Z","submitted_at":"2026-08-06T20:14:21Z","title":"Cascade: Exploiting SLO-Aware latency budget for fair and high goodput LLM inference serving","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-15T14:37:20.669126Z"},"links":{"citing_paper":"/paper/2608.06557"},"observation_digest":"sha256:e3d4c35182cb2c9c79a2160321907d220295979ba2f745146250d4c7ca317b49","observation_id":"84208f07-9b5c-4c1c-9016-7f977104d077","resolution":{"observed_at":"2026-08-15T14:37:21.939258Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:37:21.926717Z","title":"Kvquant: towards 10 million context length llm inference with kv cache quantization,","venue":null,"work_id":"2a59ba5c-d977-4b36-bb7b-b87ecf277c09","year":2024},"citing_paper":{"arxiv_id":"2608.06557","last_updated":"2026-08-06T20:14:21Z","snapshot_observed_at":"2026-08-15T22:55:47.932345Z","submitted_at":"2026-08-06T20:14:21Z","title":"Cascade: Exploiting SLO-Aware latency budget for fair and high goodput LLM inference serving","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T14:37:20.672231Z"},"links":{"citing_paper":"/paper/2608.06557"},"observation_digest":"sha256:8beb478198c733b33c0be05ea4b999a6136b9412eb05e90deda0ede494c704a3","observation_id":"c7baa3a3-8134-4d35-9bb9-30ab31b8392e","resolution":{"observed_at":"2026-08-15T14:37:21.930056Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.11181","last_updated":"2024-01-20T09:43:36Z","snapshot_observed_at":"2026-08-16T14:25:57.735259Z","submitted_at":"2024-01-20T09:43:36Z","title":"Inference without Interference: Disaggregate LLM Inference for Mixed Downstream Workloads","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.11181","snapshot_observed_at":"2026-08-15T14:37:20.675426Z","title":"Inference without interference: Disaggregate llm inference for mixed downstream workloads,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.06557","last_updated":"2026-08-06T20:14:21Z","snapshot_observed_at":"2026-08-15T22:55:47.932345Z","submitted_at":"2026-08-06T20:14:21Z","title":"Cascade: Exploiting SLO-Aware latency budget for fair and high goodput LLM inference serving","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T14:37:20.675426Z"},"links":{"cited_paper":"/paper/2401.11181","citing_paper":"/paper/2608.06557"},"observation_digest":"sha256:23c5cb6cdedb4083750a228a1e90025533cb4c0b27dc60e31a2012fdd23c431c","observation_id":"6c523305-35dd-42e4-a6ee-e89a4984e8a5","resolution":{"observed_at":"2026-08-15T14:37:20.675426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:37:21.917376Z","title":"A quantitative measure of fairness and discrimination for resource allocation in shared computer systems,","venue":null,"work_id":"6102c14f-a117-450f-84fe-4c6c37a4ede2","year":null},"citing_paper":{"arxiv_id":"2608.06557","last_updated":"2026-08-06T20:14:21Z","snapshot_observed_at":"2026-08-15T22:55:47.932345Z","submitted_at":"2026-08-06T20:14:21Z","title":"Cascade: Exploiting SLO-Aware latency budget for fair and high goodput LLM inference serving","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-15T14:37:20.678834Z"},"links":{"citing_paper":"/paper/2608.06557"},"observation_digest":"sha256:10fcec7219b2be6759c2d4d0a47fd4d52dc760fcbcda08dda5d9835836bbcdfc","observation_id":"7c541652-eada-4457-8dda-348ec2c2091c","resolution":{"observed_at":"2026-08-15T14:37:21.921044Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:37:20.686402Z","title":"Sageserve: Optimizing llm serving on cloud data centers with forecast aware auto-scaling,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06557","last_updated":"2026-08-06T20:14:21Z","snapshot_observed_at":"2026-08-15T22:55:47.932345Z","submitted_at":"2026-08-06T20:14:21Z","title":"Cascade: Exploiting SLO-Aware latency budget for fair and high goodput LLM inference serving","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T14:37:20.686402Z"},"links":{"citing_paper":"/paper/2608.06557"},"observation_digest":"sha256:777bd6fd755ae92a559fba0122f12543a132752cc5521197347a89c10be97f06","observation_id":"666e0fd2-14f4-44d4-9676-d687734bee90","resolution":{"observed_at":"2026-08-15T14:37:20.686402Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.07886","last_updated":"2024-07-15T03:54:20Z","snapshot_observed_at":"2026-08-16T14:27:21.818959Z","submitted_at":"2024-01-15T18:28:17Z","title":"Learned Best-Effort LLM Serving","version":2},"cited_work":{"arxiv_id":"2401.07886","doi":null,"metadata_source":"pith","pith_arxiv_id":"2401.07886","snapshot_observed_at":"2026-08-15T14:37:21.553258Z","title":"Learned Best-Effort LLM Serving","venue":"cs.LG","work_id":"c3b60c76-5032-4bb8-b628-3362eec16916","year":2024},"citing_paper":{"arxiv_id":"2608.06557","last_updated":"2026-08-06T20:14:21Z","snapshot_observed_at":"2026-08-15T22:55:47.932345Z","submitted_at":"2026-08-06T20:14:21Z","title":"Cascade: Exploiting SLO-Aware latency budget for fair and high goodput LLM inference serving","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T14:37:20.689429Z"},"links":{"cited_paper":"/paper/2401.07886","citing_paper":"/paper/2608.06557"},"observation_digest":"sha256:051238206aa347c1cbb01cec06f1e9bd03f7e70fd96bea4e0d60763612cc3776","observation_id":"638bcc91-5ef2-475b-a47f-6f2599c2e29d","resolution":{"observed_at":"2026-08-15T14:37:21.557527Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:37:20.692788Z","title":"Efficient memory management for large language model serving with pagedattention,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.06557","last_updated":"2026-08-06T20:14:21Z","snapshot_observed_at":"2026-08-15T22:55:47.932345Z","submitted_at":"2026-08-06T20:14:21Z","title":"Cascade: Exploiting SLO-Aware latency budget for fair and high goodput LLM inference serving","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-15T14:37:20.692788Z"},"links":{"citing_paper":"/paper/2608.06557"},"observation_digest":"sha256:a4952df0ca1e380ac8bde424ffe0d30fcbeab31b7457eff0aee3156547918f47","observation_id":"8870396d-c2fa-4414-909d-9ff6483b0ca2","resolution":{"observed_at":"2026-08-15T14:37:20.692788Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:37:20.696067Z","title":"Tokenscale: Timely and accurate autoscaling for disaggregated llm serving with token velocity,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06557","last_updated":"2026-08-06T20:14:21Z","snapshot_observed_at":"2026-08-15T22:55:47.932345Z","submitted_at":"2026-08-06T20:14:21Z","title":"Cascade: Exploiting SLO-Aware latency budget for fair and high goodput LLM inference serving","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-15T14:37:20.696067Z"},"links":{"citing_paper":"/paper/2608.06557"},"observation_digest":"sha256:a9783b0bdbc3c75adf2777ef3f0c0b67d357f4c3cebf33b1468527eb24a944c3","observation_id":"c75f11ff-066f-45bc-97cd-339a9e211cd0","resolution":{"observed_at":"2026-08-15T14:37:20.696067Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"5621.38076","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:37:21.428989Z","title":"Revisiting disaggregated large language model serving for performance and energy implications,","venue":null,"work_id":"37b271d5-3bf0-4df9-a322-d3c29b4dea91","year":2026},"citing_paper":{"arxiv_id":"2608.06557","last_updated":"2026-08-06T20:14:21Z","snapshot_observed_at":"2026-08-15T22:55:47.932345Z","submitted_at":"2026-08-06T20:14:21Z","title":"Cascade: Exploiting SLO-Aware latency budget for fair and high goodput LLM inference serving","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-15T14:37:20.699193Z"},"links":{"citing_paper":"/paper/2608.06557"},"observation_digest":"sha256:32a5290b372922d143bc9c9fb82b5078333528a2abf44c042ab542389a9da6e2","observation_id":"0075d4b1-e848-48d3-8f0e-b3bc98dd3a63","resolution":{"observed_at":"2026-08-15T14:37:21.434037Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:37:21.907968Z","title":"AlpaServe: Statistical multiplexing with model parallelism for deep learning serving,","venue":null,"work_id":"ba561fa3-3c11-4d83-bfc3-4bf4f431af37","year":2023},"citing_paper":{"arxiv_id":"2608.06557","last_updated":"2026-08-06T20:14:21Z","snapshot_observed_at":"2026-08-15T22:55:47.932345Z","submitted_at":"2026-08-06T20:14:21Z","title":"Cascade: Exploiting SLO-Aware latency budget for fair and high goodput LLM inference serving","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-15T14:37:20.702290Z"},"links":{"citing_paper":"/paper/2608.06557"},"observation_digest":"sha256:598b834b4541f25567e489311f62be5f2762718a27be2390cd5efb2cac20f0a1","observation_id":"35e1ccb2-db4c-417a-b66f-869f1f0a0f41","resolution":{"observed_at":"2026-08-15T14:37:21.911478Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:37:20.705254Z","title":"Scheduling algorithms for multiprogramming in a hard-real-time environment,","venue":null,"work_id":null,"year":1973},"citing_paper":{"arxiv_id":"2608.06557","last_updated":"2026-08-06T20:14:21Z","snapshot_observed_at":"2026-08-15T22:55:47.932345Z","submitted_at":"2026-08-06T20:14:21Z","title":"Cascade: Exploiting SLO-Aware latency budget for fair and high goodput LLM inference serving","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-15T14:37:20.705254Z"},"links":{"citing_paper":"/paper/2608.06557"},"observation_digest":"sha256:52fad03b043326a5d896e5a1ad368331d9ba4cb7eb1e681ffbb3b7d3a352bf63","observation_id":"09a2ad14-8c11-4154-931d-55f0e279e7c7","resolution":{"observed_at":"2026-08-15T14:37:20.705254Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:37:20.708627Z","title":"Lmcache: An efficient kv cache layer for enterprise-scale llm inference,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06557","last_updated":"2026-08-06T20:14:21Z","snapshot_observed_at":"2026-08-15T22:55:47.932345Z","submitted_at":"2026-08-06T20:14:21Z","title":"Cascade: Exploiting SLO-Aware latency budget for fair and high goodput LLM inference serving","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-15T14:37:20.708627Z"},"links":{"citing_paper":"/paper/2608.06557"},"observation_digest":"sha256:c95339e30c972afb7bf0253f7df2f05f862e21a4989b96860e373e499d424cb0","observation_id":"2c7146dc-68e0-4829-9115-ddf59a1a2310","resolution":{"observed_at":"2026-08-15T14:37:20.708627Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:37:21.898776Z","title":"Ai-dynamo,","venue":null,"work_id":"02c2a903-03ba-4303-b356-c68151bf5ce8","year":2025},"citing_paper":{"arxiv_id":"2608.06557","last_updated":"2026-08-06T20:14:21Z","snapshot_observed_at":"2026-08-15T22:55:47.932345Z","submitted_at":"2026-08-06T20:14:21Z","title":"Cascade: Exploiting SLO-Aware latency budget for fair and high goodput LLM inference serving","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-15T14:37:20.711621Z"},"links":{"citing_paper":"/paper/2608.06557"},"observation_digest":"sha256:ab712aedbe12a3d789ffd8fdcfa834b40b95da79ced707a4f5932f6bb355d17d","observation_id":"9bac5c43-334a-4fb1-9e22-81af19b95c07","resolution":{"observed_at":"2026-08-15T14:37:21.902193Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:37:21.888938Z","title":"Nvidia gb200 nvl partition,","venue":null,"work_id":"f8e2d190-f7c1-413c-97ca-81406e8518e0","year":2025},"citing_paper":{"arxiv_id":"2608.06557","last_updated":"2026-08-06T20:14:21Z","snapshot_observed_at":"2026-08-15T22:55:47.932345Z","submitted_at":"2026-08-06T20:14:21Z","title":"Cascade: Exploiting SLO-Aware latency budget for fair and high goodput LLM inference serving","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-15T14:37:20.714811Z"},"links":{"citing_paper":"/paper/2608.06557"},"observation_digest":"sha256:543994e035f076054e7a4c76389c989e4024b930623b979323cfeb74ea32ad9c","observation_id":"8427720a-7675-417a-85e9-870ec2923103","resolution":{"observed_at":"2026-08-15T14:37:21.892252Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:37:21.879133Z","title":"Nvidia gb200 nvl72 delivers trillion-parameter llm training and real-time inference,","venue":null,"work_id":"fc2faddb-85aa-45cc-ba5f-69d8f8ab7c77","year":2025},"citing_paper":{"arxiv_id":"2608.06557","last_updated":"2026-08-06T20:14:21Z","snapshot_observed_at":"2026-08-15T22:55:47.932345Z","submitted_at":"2026-08-06T20:14:21Z","title":"Cascade: Exploiting SLO-Aware latency budget for fair and high goodput LLM inference serving","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-15T14:37:20.718007Z"},"links":{"citing_paper":"/paper/2608.06557"},"observation_digest":"sha256:4e78bbe5fe9813fef8e0bb01a3f102217d6edc47a0bad13a9d572b11a80f1931","observation_id":"61c4a06c-d981-41cb-8d49-e3032ab53b05","resolution":{"observed_at":"2026-08-15T14:37:21.882768Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:37:20.721320Z","title":"Splitwise: Efficient generative llm inference using phase splitting,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06557","last_updated":"2026-08-06T20:14:21Z","snapshot_observed_at":"2026-08-15T22:55:47.932345Z","submitted_at":"2026-08-06T20:14:21Z","title":"Cascade: Exploiting SLO-Aware latency budget for fair and high goodput LLM inference serving","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-15T14:37:20.721320Z"},"links":{"citing_paper":"/paper/2608.06557"},"observation_digest":"sha256:ac7aa715b6185a67a4a9488ce24139328cf505a70890e5b18e2a85684b35ec92","observation_id":"503f3e8e-a236-4824-8677-3a68d0798b69","resolution":{"observed_at":"2026-08-15T14:37:20.721320Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:37:21.869328Z","title":"Conserve: Fine-grained gpu harvesting for llm online and offline co-serving,","venue":null,"work_id":"482d2515-89a8-4302-9ec2-b459d087668c","year":null},"citing_paper":{"arxiv_id":"2608.06557","last_updated":"2026-08-06T20:14:21Z","snapshot_observed_at":"2026-08-15T22:55:47.932345Z","submitted_at":"2026-08-06T20:14:21Z","title":"Cascade: Exploiting SLO-Aware latency budget for fair and high goodput LLM inference serving","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-15T14:37:20.724311Z"},"links":{"citing_paper":"/paper/2608.06557"},"observation_digest":"sha256:6a57a51f91090be6f8cb8594ed158694fbb3de2bc18edaf5343eb5af39e48d09","observation_id":"536b8c62-c3b9-4e5d-81ac-a0e129befb8b","resolution":{"observed_at":"2026-08-15T14:37:21.872872Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:37:21.859030Z","title":"Mooncake: trading more storage for less computation — a kvcache-centric architecture for serving llm chatbot,","venue":null,"work_id":"bbf061c2-f0d0-4082-ac71-8b7f45e1eef3","year":2025},"citing_paper":{"arxiv_id":"2608.06557","last_updated":"2026-08-06T20:14:21Z","snapshot_observed_at":"2026-08-15T22:55:47.932345Z","submitted_at":"2026-08-06T20:14:21Z","title":"Cascade: Exploiting SLO-Aware latency budget for fair and high goodput LLM inference serving","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-15T14:37:20.730929Z"},"links":{"citing_paper":"/paper/2608.06557"},"observation_digest":"sha256:b180efe4e6f871a407ebba045d3210ecc211b569d9b4c9ac53b0c89d2f14d1e2","observation_id":"4541a13c-fa37-471c-9027-06615b4e1c41","resolution":{"observed_at":"2026-08-15T14:37:21.862931Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.03375","last_updated":"2026-05-05T05:33:11Z","snapshot_observed_at":"2026-08-14T04:30:49.919579Z","submitted_at":"2026-05-05T05:33:11Z","title":"Tutti: Making SSD-Backed KV Cache Practical for Long-Context LLM Serving","version":1},"cited_work":{"arxiv_id":"2605.03375","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.03375","snapshot_observed_at":"2026-08-15T14:37:21.203209Z","title":"Tutti: Making SSD-Backed KV Cache Practical for Long-Context LLM Serving","venue":"cs.OS","work_id":"77bb632f-ced4-4337-85db-7b3f48425321","year":2026},"citing_paper":{"arxiv_id":"2608.06557","last_updated":"2026-08-06T20:14:21Z","snapshot_observed_at":"2026-08-15T22:55:47.932345Z","submitted_at":"2026-08-06T20:14:21Z","title":"Cascade: Exploiting SLO-Aware latency budget for fair and high goodput LLM inference serving","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-15T14:37:20.733967Z"},"links":{"cited_paper":"/paper/2605.03375","citing_paper":"/paper/2608.06557"},"observation_digest":"sha256:8cc2511e8201aff7d2a3c1c339ebf08837d9884451dff0f2a78ec39f8895b860","observation_id":"39b8a3ff-44f9-43c0-b4e8-e3347737ddb0","resolution":{"observed_at":"2026-08-15T14:37:21.206726Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:37:20.737451Z","title":"Timecard: controlling user-perceived delays in server-based mobile applications,","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2608.06557","last_updated":"2026-08-06T20:14:21Z","snapshot_observed_at":"2026-08-15T22:55:47.932345Z","submitted_at":"2026-08-06T20:14:21Z","title":"Cascade: Exploiting SLO-Aware latency budget for fair and high goodput LLM inference serving","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-15T14:37:20.737451Z"},"links":{"citing_paper":"/paper/2608.06557"},"observation_digest":"sha256:4866b7765b4942fd93a27677140a869f40dec6cd8457b7ed6b8cf8a636c77e2b","observation_id":"651a8d8a-658b-4efc-a648-8015e9df3fe2","resolution":{"observed_at":"2026-08-15T14:37:20.737451Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.01228","last_updated":"2025-09-03T20:54:57Z","snapshot_observed_at":"2026-08-16T13:13:30.755733Z","submitted_at":"2024-10-02T04:12:13Z","title":"ConServe: Fine-Grained GPU Harvesting for LLM Online and Offline Co-Serving","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.01228","snapshot_observed_at":"2026-08-15T14:37:20.727436Z","title":"Available: https://arxiv.org/abs/2410.01228","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06557","last_updated":"2026-08-06T20:14:21Z","snapshot_observed_at":"2026-08-15T22:55:47.932345Z","submitted_at":"2026-08-06T20:14:21Z","title":"Cascade: Exploiting SLO-Aware latency budget for fair and high goodput LLM inference serving","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-15T14:37:20.727436Z"},"links":{"cited_paper":"/paper/2410.01228","citing_paper":"/paper/2608.06557"},"observation_digest":"sha256:24dd3c632c70842e9e09fe95d0ea5fd8e1f3095833d3dc4bd22eca08c9ec02e1","observation_id":"a41a1345-3f21-4cee-b901-5143ae3a48ea","resolution":{"observed_at":"2026-08-15T14:37:20.727436Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.05467","last_updated":"2026-05-06T21:42:55Z","snapshot_observed_at":"2026-08-15T11:42:47.340987Z","submitted_at":"2026-05-06T21:42:55Z","title":"Nitsum: Serving Tiered LLM Requests with Adaptive Tensor Parallelism","version":1},"cited_work":{"arxiv_id":"2605.05467","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.05467","snapshot_observed_at":"2026-08-15T14:37:21.109684Z","title":"Nitsum: Serving Tiered LLM Requests with Adaptive Tensor Parallelism","venue":"cs.DC","work_id":"fe25c87e-d52d-4097-bf30-5d74c1bbe392","year":2026},"citing_paper":{"arxiv_id":"2608.06557","last_updated":"2026-08-06T20:14:21Z","snapshot_observed_at":"2026-08-15T22:55:47.932345Z","submitted_at":"2026-08-06T20:14:21Z","title":"Cascade: Exploiting SLO-Aware latency budget for fair and high goodput LLM inference serving","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-15T14:37:20.743928Z"},"links":{"cited_paper":"/paper/2605.05467","citing_paper":"/paper/2608.06557"},"observation_digest":"sha256:784108e3eb55db1892bdd42a161f2467a18fbf4eecf148e071f636304ea5bdc9","observation_id":"df6804cb-9c70-46ad-9ab9-a7373a2c6000","resolution":{"observed_at":"2026-08-15T14:37:21.116238Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:37:21.849164Z","title":"Kvcache cache in the wild: Characterizing and optimizing kvcache cache at a large cloud provider,","venue":null,"work_id":"79ac9273-b473-4f70-b21c-7b7199cfdd6a","year":2025},"citing_paper":{"arxiv_id":"2608.06557","last_updated":"2026-08-06T20:14:21Z","snapshot_observed_at":"2026-08-15T22:55:47.932345Z","submitted_at":"2026-08-06T20:14:21Z","title":"Cascade: Exploiting SLO-Aware latency budget for fair and high goodput LLM inference serving","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-15T14:37:20.747222Z"},"links":{"citing_paper":"/paper/2608.06557"},"observation_digest":"sha256:1fbcf1b8873920fd65f3daae760e053732396f8afc97ff11d498f63630925561","observation_id":"b3e2c9db-a907-49e0-80fc-9c80050748cc","resolution":{"observed_at":"2026-08-15T14:37:21.852825Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:37:20.750430Z","title":"Better never than late: meeting deadlines in datacenter networks,","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2608.06557","last_updated":"2026-08-06T20:14:21Z","snapshot_observed_at":"2026-08-15T22:55:47.932345Z","submitted_at":"2026-08-06T20:14:21Z","title":"Cascade: Exploiting SLO-Aware latency budget for fair and high goodput LLM inference serving","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-15T14:37:20.750430Z"},"links":{"citing_paper":"/paper/2608.06557"},"observation_digest":"sha256:28f50cc06d06fdfddd0cef558a02abff80d78490a93d9eb753b447c731a4ca1e","observation_id":"3b7e6a22-325d-42ac-8e81-ba10fa374696","resolution":{"observed_at":"2026-08-15T14:37:20.750430Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.00023","last_updated":"2024-10-03T17:50:33Z","snapshot_observed_at":"2026-08-18T06:51:43.246724Z","submitted_at":"2024-05-08T06:30:58Z","title":"Preble: Efficient Distributed Prompt Scheduling for LLM Serving","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.00023","snapshot_observed_at":"2026-08-15T14:37:20.740627Z","title":"Preble: Efficient distributed prompt scheduling for llm serving,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.06557","last_updated":"2026-08-06T20:14:21Z","snapshot_observed_at":"2026-08-15T22:55:47.932345Z","submitted_at":"2026-08-06T20:14:21Z","title":"Cascade: Exploiting SLO-Aware latency budget for fair and high goodput LLM inference serving","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-15T14:37:20.740627Z"},"links":{"cited_paper":"/paper/2407.00023","citing_paper":"/paper/2608.06557"},"observation_digest":"sha256:ac988de85631f37067dbbc4ea766e3a928882491e34ae23c9864225ff022880f","observation_id":"9c690888-fb43-4994-b527-8f98516dfc4c","resolution":{"observed_at":"2026-08-15T14:37:20.740627Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:37:20.757321Z","title":"Aegaeon: Effective gpu pooling for concurrent llm serving on the market,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06557","last_updated":"2026-08-06T20:14:21Z","snapshot_observed_at":"2026-08-15T22:55:47.932345Z","submitted_at":"2026-08-06T20:14:21Z","title":"Cascade: Exploiting SLO-Aware latency budget for fair and high goodput LLM inference serving","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-15T14:37:20.757321Z"},"links":{"citing_paper":"/paper/2608.06557"},"observation_digest":"sha256:d318357f84d980004741352b9089b08a736778db3a7efd3ecbb430bdd6a60296","observation_id":"6fd0007d-fff8-4e4c-b1d6-3162977ac553","resolution":{"observed_at":"2026-08-15T14:37:20.757321Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:37:21.827981Z","title":"Orca: A distributed serving system for transformer-based generative models,","venue":null,"work_id":"00396c2e-1db4-4485-86f6-cf7146783e13","year":2022},"citing_paper":{"arxiv_id":"2608.06557","last_updated":"2026-08-06T20:14:21Z","snapshot_observed_at":"2026-08-15T22:55:47.932345Z","submitted_at":"2026-08-06T20:14:21Z","title":"Cascade: Exploiting SLO-Aware latency budget for fair and high goodput LLM inference serving","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-15T14:37:20.760766Z"},"links":{"citing_paper":"/paper/2608.06557"},"observation_digest":"sha256:4bd551d9e894c8e0277919b5d80ff4af34b1076666795f35b98da255e38998c9","observation_id":"613b04c9-77a8-40b0-98c2-98966bceb4b5","resolution":{"observed_at":"2026-08-15T14:37:21.831594Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:37:21.817954Z","title":"Superinfer: Slo-aware rotary scheduling and memory management for llm inference on superchips,","venue":null,"work_id":"6648a39f-3a2e-4bc6-9e4c-64e74cc0a66b","year":null},"citing_paper":{"arxiv_id":"2608.06557","last_updated":"2026-08-06T20:14:21Z","snapshot_observed_at":"2026-08-15T22:55:47.932345Z","submitted_at":"2026-08-06T20:14:21Z","title":"Cascade: Exploiting SLO-Aware latency budget for fair and high goodput LLM inference serving","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-15T14:37:20.763697Z"},"links":{"citing_paper":"/paper/2608.06557"},"observation_digest":"sha256:a242995ea5878eb08ae7d7414b6753357246e1824d7f86fb338005ef2f102602","observation_id":"8c723fcd-c9af-4d71-9627-8c8a942f1dd0","resolution":{"observed_at":"2026-08-15T14:37:21.821546Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:37:21.838830Z","title":"FastServe: Iteration-Level preemptive scheduling for large language model inference,","venue":null,"work_id":"6bf029a2-c56e-45fd-aa1b-4933e82c95df","year":2026},"citing_paper":{"arxiv_id":"2608.06557","last_updated":"2026-08-06T20:14:21Z","snapshot_observed_at":"2026-08-15T22:55:47.932345Z","submitted_at":"2026-08-06T20:14:21Z","title":"Cascade: Exploiting SLO-Aware latency budget for fair and high goodput LLM inference serving","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-15T14:37:20.754259Z"},"links":{"citing_paper":"/paper/2608.06557"},"observation_digest":"sha256:2cb55aaa6237eadd65750ee6853e53d423ba59d644d6640c29aded3996dcea00","observation_id":"9c7f6120-152e-4850-ad47-5545febf8105","resolution":{"observed_at":"2026-08-15T14:37:21.842741Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:37:21.797743Z","title":"Sglang: efficient execution of structured language model programs,","venue":null,"work_id":"b7d14fa3-1ecd-4827-bd73-559ec079d3c6","year":2024},"citing_paper":{"arxiv_id":"2608.06557","last_updated":"2026-08-06T20:14:21Z","snapshot_observed_at":"2026-08-15T22:55:47.932345Z","submitted_at":"2026-08-06T20:14:21Z","title":"Cascade: Exploiting SLO-Aware latency budget for fair and high goodput LLM inference serving","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-15T14:37:20.776514Z"},"links":{"citing_paper":"/paper/2608.06557"},"observation_digest":"sha256:8b100d8ebbd06aa636708d6f001d1c05b22644b1cc3ba14b3d0aad19165a1fd8","observation_id":"3485f82c-ef46-496b-8e9d-8a9e3430313f","resolution":{"observed_at":"2026-08-15T14:37:21.801320Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:37:21.786984Z","title":"Distserve: Disaggregating prefill and decoding for goodput-optimized large language model serving,","venue":null,"work_id":"53e0ab26-d7d4-44ab-8bf2-0aefe50ba27c","year":2024},"citing_paper":{"arxiv_id":"2608.06557","last_updated":"2026-08-06T20:14:21Z","snapshot_observed_at":"2026-08-15T22:55:47.932345Z","submitted_at":"2026-08-06T20:14:21Z","title":"Cascade: Exploiting SLO-Aware latency budget for fair and high goodput LLM inference serving","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-15T14:37:20.779425Z"},"links":{"citing_paper":"/paper/2608.06557"},"observation_digest":"sha256:69dccd0ca50d5827bd770701348f5d1b5c936af61bed3ae1940c845ce2864304","observation_id":"d1cdf254-95b2-4983-8adf-992d781c83ce","resolution":{"observed_at":"2026-08-15T14:37:21.791256Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.17769","last_updated":"2025-07-17T05:54:42Z","snapshot_observed_at":"2026-08-15T22:55:07.819991Z","submitted_at":"2025-07-17T05:54:42Z","title":"PolyServe: Efficient Multi-SLO Serving at Scale","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.17769","snapshot_observed_at":"2026-08-15T14:37:20.782815Z","title":"Polyserve: Efficient multi-slo serving at scale,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06557","last_updated":"2026-08-06T20:14:21Z","snapshot_observed_at":"2026-08-15T22:55:47.932345Z","submitted_at":"2026-08-06T20:14:21Z","title":"Cascade: Exploiting SLO-Aware latency budget for fair and high goodput LLM inference serving","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-15T14:37:20.782815Z"},"links":{"cited_paper":"/paper/2507.17769","citing_paper":"/paper/2608.06557"},"observation_digest":"sha256:803b664161dc42606be6980c63a04aec3f68525e598e6e2f84c6e044aec7a45a","observation_id":"1d212a09-726c-41d7-bfa2-d0fa4512fd9f","resolution":{"observed_at":"2026-08-15T14:37:20.782815Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:37:21.807686Z","title":"Jitserve: Slo-aware llm serving with imprecise request information,","venue":null,"work_id":"3c628f13-24c9-475f-95c2-063f3365918a","year":null},"citing_paper":{"arxiv_id":"2608.06557","last_updated":"2026-08-06T20:14:21Z","snapshot_observed_at":"2026-08-15T22:55:47.932345Z","submitted_at":"2026-08-06T20:14:21Z","title":"Cascade: Exploiting SLO-Aware latency budget for fair and high goodput LLM inference serving","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-15T14:37:20.770173Z"},"links":{"citing_paper":"/paper/2608.06557"},"observation_digest":"sha256:77cb2580e44ea33ba3c2430893f6be3e364d3d0e70efe279ff8d1fcca55b1ae2","observation_id":"db9f465e-5014-4f7e-b25d-6a60a126d96f","resolution":{"observed_at":"2026-08-15T14:37:21.811217Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:37:20.773331Z","title":"Available: https://arxiv.org/abs/2504.20068","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06557","last_updated":"2026-08-06T20:14:21Z","snapshot_observed_at":"2026-08-15T22:55:47.932345Z","submitted_at":"2026-08-06T20:14:21Z","title":"Cascade: Exploiting SLO-Aware latency budget for fair and high goodput LLM inference serving","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-15T14:37:20.773331Z"},"links":{"citing_paper":"/paper/2608.06557"},"observation_digest":"sha256:c0c498d9684ce821219b201109e6cddf614660c5932c8d2fd0cb6b480b894997","observation_id":"a4fb85d8-adb6-42b8-aaff-e03ec7b03973","resolution":{"observed_at":"2026-08-15T14:37:20.773331Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"cs/9809099","last_updated":"1998-09-24T05:27:34Z","snapshot_observed_at":"2026-07-07T03:10:16.020076Z","submitted_at":"1998-09-24T05:27:34Z","title":"A Quantitative Measure Of Fairness And Discrimination For Resource Allocation In Shared Computer Systems","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"cs/9809099","snapshot_observed_at":"2026-08-15T14:37:20.682201Z","title":"Available: https://arxiv.org/abs/cs/9809099","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06557","last_updated":"2026-08-06T20:14:21Z","snapshot_observed_at":"2026-08-15T22:55:47.932345Z","submitted_at":"2026-08-06T20:14:21Z","title":"Cascade: Exploiting SLO-Aware latency budget for fair and high goodput LLM inference serving","version":1},"reference_index":1998,"source":"pdf_text","source_observed_at":"2026-08-15T14:37:20.682201Z"},"links":{"cited_paper":"/paper/cs/9809099","citing_paper":"/paper/2608.06557"},"observation_digest":"sha256:6c52b8c69f001a4fbdc4f60c70895d44207a4c6e72a68d0ecd46a19b9313461d","observation_id":"950d1db5-909a-46ba-b81d-2e1bfa2e58ac","resolution":{"observed_at":"2026-08-15T14:37:20.682201Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.04934","last_updated":"2024-04-25T15:45:19Z","snapshot_observed_at":"2026-08-16T14:45:11.773509Z","submitted_at":"2023-11-07T18:17:05Z","title":"Prompt Cache: Modular Attention Reuse for Low-Latency Inference","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.04934","snapshot_observed_at":"2026-08-15T14:37:20.662090Z","title":"Available: https://arxiv.org/abs/2311.04934","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06557","last_updated":"2026-08-06T20:14:21Z","snapshot_observed_at":"2026-08-15T22:55:47.932345Z","submitted_at":"2026-08-06T20:14:21Z","title":"Cascade: Exploiting SLO-Aware latency budget for fair and high goodput LLM inference serving","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-15T14:37:20.662090Z"},"links":{"cited_paper":"/paper/2311.04934","citing_paper":"/paper/2608.06557"},"observation_digest":"sha256:3e4ed9cab705a739fce1e2124f0053cd338f08bbb52ca61421f87a7cee2c4ca5","observation_id":"5490f1a0-917e-4e28-9f39-e4d82775af4e","resolution":{"observed_at":"2026-08-15T14:37:20.662090Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:37:20.631206Z","title":"Available: https://arxiv.org/abs/2409.17264","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06557","last_updated":"2026-08-06T20:14:21Z","snapshot_observed_at":"2026-08-15T22:55:47.932345Z","submitted_at":"2026-08-06T20:14:21Z","title":"Cascade: Exploiting SLO-Aware latency budget for fair and high goodput LLM inference serving","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-15T14:37:20.631206Z"},"links":{"citing_paper":"/paper/2608.06557"},"observation_digest":"sha256:3621aab7ac171454cde9de2f8d1329d780ee57ab3d734d60f4064bc5ec87f1a5","observation_id":"75f0e0c6-d426-4116-b53f-a4db4bc05a15","resolution":{"observed_at":"2026-08-15T14:37:20.631206Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.20309","last_updated":"2026-05-18T19:51:16Z","snapshot_observed_at":"2026-08-15T21:56:42.156725Z","submitted_at":"2026-01-28T07:01:46Z","title":"SuperInfer: SLO-Aware Rotary Scheduling and Memory Management for LLM Inference on Superchips","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.20309","snapshot_observed_at":"2026-08-15T14:37:20.766968Z","title":"Available: https://arxiv.org/abs/2601.20309","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06557","last_updated":"2026-08-06T20:14:21Z","snapshot_observed_at":"2026-08-15T22:55:47.932345Z","submitted_at":"2026-08-06T20:14:21Z","title":"Cascade: Exploiting SLO-Aware latency budget for fair and high goodput LLM inference serving","version":1},"reference_index":2026,"source":"pdf_text","source_observed_at":"2026-08-15T14:37:20.766968Z"},"links":{"cited_paper":"/paper/2601.20309","citing_paper":"/paper/2608.06557"},"observation_digest":"sha256:1dae02c0b966207d1171b361abda2915c9491505ca5e7a335e5c1a2d6e2649bb","observation_id":"84c5990a-d01b-4f37-a842-c87d29bd2cc4","resolution":{"observed_at":"2026-08-15T14:37:20.766968Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.06557","last_updated":"2026-08-06T20:14:21Z","latest_version":1,"primary_category":"cs.DC","snapshot_observed_at":"2026-08-15T22:55:47.932345Z","submitted_at":"2026-08-06T20:14:21Z","title":"Cascade: Exploiting SLO-Aware latency budget for fair and high goodput LLM inference serving"},"reference_resolution":{"displayed":51,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":27,"verified_exact":3,"verified_fuzzy":20},"total_outbound_references":51},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 51 of 51 outbound references and 0 inbound Pith citation observations for arXiv:2608.06557."}