{"as_of":"2026-08-14T20:42:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f5e6e522d5dd0ee7a92ff46974a78e8889a2ad80ce48e733ad5d9137fd566b3d","coverage":[{"denominator":60,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":60,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T15:45:41.645133Z","state":"measured"},{"denominator":62,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":62,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-26T19:23:10.356881Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T02:39:25.590182Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2508.19559","last_updated":"2025-08-27T04:22:02Z","snapshot_observed_at":"2026-08-12T00:57:48.234044Z","submitted_at":"2025-08-27T04:22:02Z","title":"Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference","version":1},"cited_work":{"arxiv_id":"2508.19559","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.19559","snapshot_observed_at":"2026-07-04T02:39:25.590182Z","title":"Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference.arXiv preprint arXiv:2508.19559.2025","venue":null,"work_id":"363b745c-6b1b-4dbf-9be7-79cbb2b32379","year":2025},"citing_paper":{"arxiv_id":"2604.17227","last_updated":"2026-04-19T03:20:30Z","snapshot_observed_at":"2026-08-13T01:42:20.600768Z","submitted_at":"2026-04-19T03:20:30Z","title":"Cloud-native and Distributed Systems for Efficient and Scalable Large Language Models -- A Research Agenda","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-05-10T06:27:23.580445Z"},"links":{"cited_paper":"/paper/2508.19559","citing_paper":"/paper/2604.17227"},"observation_digest":"sha256:eb7b3d2e2d68346b052bbae3ae276a3945a225f1281024868c547a8bdc5bf162","observation_id":"cf870d12-d482-4314-8454-4d57614fcc5a","resolution":{"observed_at":"2026-05-10T06:31:30.854890Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.19559","last_updated":"2025-08-27T04:22:02Z","snapshot_observed_at":"2026-08-12T00:57:48.234044Z","submitted_at":"2025-08-27T04:22:02Z","title":"Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference","version":1},"cited_work":{"arxiv_id":"2508.19559","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.19559","snapshot_observed_at":"2026-07-04T02:39:25.590182Z","title":"Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference.arXiv preprint arXiv:2508.19559.2025","venue":null,"work_id":"363b745c-6b1b-4dbf-9be7-79cbb2b32379","year":2025},"citing_paper":{"arxiv_id":"2606.19271","last_updated":"2026-06-17T16:48:36Z","snapshot_observed_at":"2026-08-05T21:43:31.886249Z","submitted_at":"2026-06-17T16:48:36Z","title":"TurboServe: Serving Streaming Video Generation Efficiently and Economically","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-26T19:23:10.356881Z"},"links":{"cited_paper":"/paper/2508.19559","citing_paper":"/paper/2606.19271"},"observation_digest":"sha256:4d8a00d436d3986a841557a0ec42da20fa91496d50ad78cfe2b33b24ada908c9","observation_id":"63695de3-9746-4158-9525-4fb243846207","resolution":{"observed_at":"2026-07-04T02:39:25.592664Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2508.19559/citation-record","integrity":"/paper/2508.19559/integrity","json":"/paper/2508.19559/citation-record.json","paper":"/paper/2508.19559"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:45:51.684739Z","title":"Accessed 2025-7-24","venue":null,"work_id":"3d86b173-73da-40fa-bcdd-b26d4e18fe67","year":2025},"citing_paper":{"arxiv_id":"2508.19559","last_updated":"2025-08-27T04:22:02Z","snapshot_observed_at":"2026-08-12T00:57:48.234044Z","submitted_at":"2025-08-27T04:22:02Z","title":"Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-05T15:45:35.064123Z"},"links":{"citing_paper":"/paper/2508.19559"},"observation_digest":"sha256:ff99178b6031df93a2e48b3007e22b00385cdbf287d3b530cc18480ab9dc0b3b","observation_id":"5296e3ec-05ea-4bcd-aa64-18062ea8bf1e","resolution":{"observed_at":"2026-08-05T15:45:51.734750Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:45:51.554738Z","title":"https:// developer.nvidia.com/docs,","venue":null,"work_id":"10b4a840-c9f3-47b2-9681-6aa2caa3d089","year":null},"citing_paper":{"arxiv_id":"2508.19559","last_updated":"2025-08-27T04:22:02Z","snapshot_observed_at":"2026-08-12T00:57:48.234044Z","submitted_at":"2025-08-27T04:22:02Z","title":"Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-05T15:45:35.204902Z"},"links":{"citing_paper":"/paper/2508.19559"},"observation_digest":"sha256:f8eeb61f38b8497d5063270be3085f9cd8fcbc9e7dffeaf3bd81b1d97371a5b1","observation_id":"e9a84438-7d06-4387-9d3f-3117c7e02ccb","resolution":{"observed_at":"2026-08-05T15:45:51.572255Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:45:51.409153Z","title":null,"venue":null,"work_id":"5001aaf8-7857-4a53-a07f-41417907cc94","year":2023},"citing_paper":{"arxiv_id":"2508.19559","last_updated":"2025-08-27T04:22:02Z","snapshot_observed_at":"2026-08-12T00:57:48.234044Z","submitted_at":"2025-08-27T04:22:02Z","title":"Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-05T15:45:35.294236Z"},"links":{"citing_paper":"/paper/2508.19559"},"observation_digest":"sha256:8b2570b6081fe8d7796a0d35743b5246c8bcaf7968db19aa875f8eefad3d88ed","observation_id":"b1aa73c1-0094-43ae-acc1-44eaa0ef514c","resolution":{"observed_at":"2026-08-05T15:45:51.434810Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.02310","last_updated":"2024-06-17T21:10:46Z","snapshot_observed_at":"2026-08-13T10:27:49.020507Z","submitted_at":"2024-03-04T18:47:08Z","title":"Taming Throughput-Latency Tradeoff in LLM Inference with Sarathi-Serve","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.02310","snapshot_observed_at":"2026-08-05T15:45:35.454834Z","title":"Gula- vani, Alexey Tumanov, and Ramachandran Ram- jee","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.19559","last_updated":"2025-08-27T04:22:02Z","snapshot_observed_at":"2026-08-12T00:57:48.234044Z","submitted_at":"2025-08-27T04:22:02Z","title":"Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-05T15:45:35.454834Z"},"links":{"cited_paper":"/paper/2403.02310","citing_paper":"/paper/2508.19559"},"observation_digest":"sha256:bb804ebb1a79207aaaee078077fe55dae1f53f7c7d9bc57269f92fd4d96744b5","observation_id":"2be6c643-712a-4b5b-b3c2-5aaacc822daa","resolution":{"observed_at":"2026-08-05T15:45:35.454834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:45:51.266670Z","title":"Deepspeed-inference: enabling efficient inference of transformer models at unprecedented scale","venue":null,"work_id":"78e6bc95-7816-4b64-b948-1ab90bd09d95","year":2022},"citing_paper":{"arxiv_id":"2508.19559","last_updated":"2025-08-27T04:22:02Z","snapshot_observed_at":"2026-08-12T00:57:48.234044Z","submitted_at":"2025-08-27T04:22:02Z","title":"Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-05T15:45:35.576172Z"},"links":{"citing_paper":"/paper/2508.19559"},"observation_digest":"sha256:d5c495a59de4f5f604b84e2e8d2363d2b2ba75c9b6e329f87b9ebb211556f8d1","observation_id":"b78d49da-ca7c-4f1d-93d6-27b0c2b84725","resolution":{"observed_at":"2026-08-05T15:45:51.304744Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:45:51.124725Z","title":"Gpu utilization is a misleading metric, 2025","venue":null,"work_id":"225198d8-3ae3-4f01-8f67-05ae858c7cb1","year":2025},"citing_paper":{"arxiv_id":"2508.19559","last_updated":"2025-08-27T04:22:02Z","snapshot_observed_at":"2026-08-12T00:57:48.234044Z","submitted_at":"2025-08-27T04:22:02Z","title":"Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T15:45:35.614837Z"},"links":{"citing_paper":"/paper/2508.19559"},"observation_digest":"sha256:a5ffdf2290f550214143208dd7d72891df728b1ddb02d475142ef19fee34e2f5","observation_id":"005f0de8-1e5a-4f39-9539-e06fb5d312ae","resolution":{"observed_at":"2026-08-05T15:45:51.165591Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.14743","last_updated":"2024-12-13T21:54:16Z","snapshot_observed_at":"2026-08-13T11:30:30.407590Z","submitted_at":"2024-12-13T21:54:16Z","title":"KVDirect: Distributed Disaggregated LLM Inference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.14743","snapshot_observed_at":"2026-08-05T15:45:35.674883Z","title":"Kvdirect: Dis- tributed disaggregated llm inference.arXiv preprint arXiv:2501.14743, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.19559","last_updated":"2025-08-27T04:22:02Z","snapshot_observed_at":"2026-08-12T00:57:48.234044Z","submitted_at":"2025-08-27T04:22:02Z","title":"Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-05T15:45:35.674883Z"},"links":{"cited_paper":"/paper/2501.14743","citing_paper":"/paper/2508.19559"},"observation_digest":"sha256:9ef26d081c15c370e8bdf4135d8d713dc3502b06c657d4d6c46f161dade70096","observation_id":"37415a6e-20ca-453a-88e9-92b47eab4bc4","resolution":{"observed_at":"2026-08-05T15:45:35.674883Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:45:50.998231Z","title":"Leveraging endpoint flexibility in data- intensive clusters","venue":null,"work_id":"9603220c-2c0c-4fa3-be24-ba308aacc502","year":2013},"citing_paper":{"arxiv_id":"2508.19559","last_updated":"2025-08-27T04:22:02Z","snapshot_observed_at":"2026-08-12T00:57:48.234044Z","submitted_at":"2025-08-27T04:22:02Z","title":"Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-05T15:45:35.722485Z"},"links":{"citing_paper":"/paper/2508.19559"},"observation_digest":"sha256:889510b4bafae8312d51deccfdca47aac9e04c94a972393fbcd8a2912e68cb39","observation_id":"917bc262-3221-4a86-ba8c-68677aa20ce7","resolution":{"observed_at":"2026-08-05T15:45:51.044949Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:45:50.881065Z","title":"Efficient coflow scheduling with varys","venue":null,"work_id":"e068b87c-99c2-41fa-93e0-2f7dd3e67803","year":2014},"citing_paper":{"arxiv_id":"2508.19559","last_updated":"2025-08-27T04:22:02Z","snapshot_observed_at":"2026-08-12T00:57:48.234044Z","submitted_at":"2025-08-27T04:22:02Z","title":"Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-05T15:45:35.785050Z"},"links":{"citing_paper":"/paper/2508.19559"},"observation_digest":"sha256:81de9771ef5e26310337c23d64afa092388e6959c8941862b6bc50150c0e776b","observation_id":"434850f0-8903-417f-b7a6-ffd26b851236","resolution":{"observed_at":"2026-08-05T15:45:50.913622Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:45:50.734979Z","title":"Resource central: Understanding and predict- ing workloads for improved resource management in large cloud platforms","venue":null,"work_id":"aa1de879-daf2-45b8-ae63-816592bcacba","year":2017},"citing_paper":{"arxiv_id":"2508.19559","last_updated":"2025-08-27T04:22:02Z","snapshot_observed_at":"2026-08-12T00:57:48.234044Z","submitted_at":"2025-08-27T04:22:02Z","title":"Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T15:45:35.845065Z"},"links":{"citing_paper":"/paper/2508.19559"},"observation_digest":"sha256:1594efb82275007d244343b077ca209a1e90d051c8c351df43bcdd7caf192841","observation_id":"409d0484-5e32-410c-a5e0-104957c72a60","resolution":{"observed_at":"2026-08-05T15:45:50.784886Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16937","last_updated":"2024-11-18T12:36:13Z","snapshot_observed_at":"2026-08-13T01:00:15.602253Z","submitted_at":"2024-06-17T09:39:34Z","title":"A Complete Survey on LLM-based AI Chatbots","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16937","snapshot_observed_at":"2026-08-05T15:45:35.905253Z","title":"A complete survey on llm- based ai chatbots.arXiv preprint arXiv:2406.16937, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.19559","last_updated":"2025-08-27T04:22:02Z","snapshot_observed_at":"2026-08-12T00:57:48.234044Z","submitted_at":"2025-08-27T04:22:02Z","title":"Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T15:45:35.905253Z"},"links":{"cited_paper":"/paper/2406.16937","citing_paper":"/paper/2508.19559"},"observation_digest":"sha256:2aab9c0fd4ddd3e1c22ce472e88faaed44de9c4a624fcd9dcad56badac937e70","observation_id":"e875fca2-10f5-4384-852b-1a3a117d8998","resolution":{"observed_at":"2026-08-05T15:45:35.905253Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:45:50.604765Z","title":"Paragon: Qos-aware scheduling for heterogeneous datacenters","venue":null,"work_id":"bdd61825-c2ca-41f3-8506-994e9c340270","year":2013},"citing_paper":{"arxiv_id":"2508.19559","last_updated":"2025-08-27T04:22:02Z","snapshot_observed_at":"2026-08-12T00:57:48.234044Z","submitted_at":"2025-08-27T04:22:02Z","title":"Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-05T15:45:35.954752Z"},"links":{"citing_paper":"/paper/2508.19559"},"observation_digest":"sha256:69ec361a1429c00d6fa882cd4b2e268a99a7f58c064869ba6c1a7d19cab78b9b","observation_id":"475ceb66-0e2a-402e-9b23-87108b8374f7","resolution":{"observed_at":"2026-08-05T15:45:50.634811Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:45:50.424837Z","title":"Deploy DeepSeek-V3/R1 671b on 8 × H100 and throughput bench- marks","venue":null,"work_id":"60a59d71-70ee-4013-9b19-2f63470d54a6","year":2025},"citing_paper":{"arxiv_id":"2508.19559","last_updated":"2025-08-27T04:22:02Z","snapshot_observed_at":"2026-08-12T00:57:48.234044Z","submitted_at":"2025-08-27T04:22:02Z","title":"Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-05T15:45:36.004833Z"},"links":{"citing_paper":"/paper/2508.19559"},"observation_digest":"sha256:894c86fb3ba7ef3bcf673f1f4256abd69a8348fa2d80eba803d309cebc7bf862","observation_id":"6a2343fd-7f22-4243-9541-5ab22adf0c5c","resolution":{"observed_at":"2026-08-05T15:45:50.484742Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:45:50.245147Z","title":"Autoscale: Dynamic, robust capacity management for multi-tier data centers","venue":null,"work_id":"366d560c-b54e-4d21-84e2-022b0d993a9b","year":2012},"citing_paper":{"arxiv_id":"2508.19559","last_updated":"2025-08-27T04:22:02Z","snapshot_observed_at":"2026-08-12T00:57:48.234044Z","submitted_at":"2025-08-27T04:22:02Z","title":"Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-05T15:45:36.049734Z"},"links":{"citing_paper":"/paper/2508.19559"},"observation_digest":"sha256:7d1532014564dbb4d05e33e7d34f9b7d5f3e759ae40e2d28b5adf2e57c102a33","observation_id":"5bbc3669-7426-4e42-b71e-95fbe657eed6","resolution":{"observed_at":"2026-08-05T15:45:50.292762Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:45:50.124829Z","title":"Firmament: Fast, centralized cluster scheduling at scale","venue":null,"work_id":"54a1be86-d7b0-4050-bce0-86583a5812f3","year":2016},"citing_paper":{"arxiv_id":"2508.19559","last_updated":"2025-08-27T04:22:02Z","snapshot_observed_at":"2026-08-12T00:57:48.234044Z","submitted_at":"2025-08-27T04:22:02Z","title":"Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-05T15:45:36.105424Z"},"links":{"citing_paper":"/paper/2508.19559"},"observation_digest":"sha256:75b3228ec261b80467142792ab76b89f02b52e3cb9246a10f3da9c4f71a6e42b","observation_id":"be13370d-eb17-418d-ba53-bd1ecfdce013","resolution":{"observed_at":"2026-08-05T15:45:50.155912Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14527","last_updated":"2024-07-22T10:56:19Z","snapshot_observed_at":"2026-08-13T00:24:22.042480Z","submitted_at":"2024-04-22T18:56:18Z","title":"M\\'elange: Cost Efficient Large Language Model Serving by Exploiting GPU Heterogeneity","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14527","snapshot_observed_at":"2026-08-05T15:45:36.145048Z","title":"M\\’elange: Cost efficient large language model serv- ing by exploiting gpu heterogeneity.arXiv preprint arXiv:2404.14527, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.19559","last_updated":"2025-08-27T04:22:02Z","snapshot_observed_at":"2026-08-12T00:57:48.234044Z","submitted_at":"2025-08-27T04:22:02Z","title":"Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-05T15:45:36.145048Z"},"links":{"cited_paper":"/paper/2404.14527","citing_paper":"/paper/2508.19559"},"observation_digest":"sha256:1be817757d9a74a98b28c1f08c0f5ebb2afa483e2ed9ee07dbaf7e73398e9b82","observation_id":"6a74bdda-0d75-4dff-865e-b99caede7018","resolution":{"observed_at":"2026-08-05T15:45:36.145048Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:45:49.964746Z","title":"Tiresias: A {GPU} cluster manager for distributed deep learning","venue":null,"work_id":"67fb910a-14f4-409a-a586-a20845b156c3","year":2019},"citing_paper":{"arxiv_id":"2508.19559","last_updated":"2025-08-27T04:22:02Z","snapshot_observed_at":"2026-08-12T00:57:48.234044Z","submitted_at":"2025-08-27T04:22:02Z","title":"Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-05T15:45:36.184753Z"},"links":{"citing_paper":"/paper/2508.19559"},"observation_digest":"sha256:3d8f71e38e1073a34fecc54cfdf0fa4de33c293edabacebdda49736d9a3f73ed","observation_id":"8aeedfa4-c07d-4dfe-8f40-33f896f9b853","resolution":{"observed_at":"2026-08-05T15:45:50.014740Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-13T15:58:13.809876Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-05T15:45:36.234753Z","title":"Deepseek-r1: Incen- tivizingreasoningcapabilityinllmsviareinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.19559","last_updated":"2025-08-27T04:22:02Z","snapshot_observed_at":"2026-08-12T00:57:48.234044Z","submitted_at":"2025-08-27T04:22:02Z","title":"Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-05T15:45:36.234753Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2508.19559"},"observation_digest":"sha256:06ad19128c436c46075e1df341e05ad3d3949af03ce1f25fe5c6e225da811237","observation_id":"39312223-c144-4967-ba9d-d17370826359","resolution":{"observed_at":"2026-08-05T15:45:36.234753Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.17565","last_updated":"2024-12-21T13:55:49Z","snapshot_observed_at":"2026-08-14T20:09:25.600087Z","submitted_at":"2024-06-25T14:02:08Z","title":"MemServe: Context Caching for Disaggregated LLM Serving with Elastic Memory Pool","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.17565","snapshot_observed_at":"2026-08-05T15:45:36.304749Z","title":"Mem- serve: Flexible mem pool for building disaggre- gated llm serving with caching, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.19559","last_updated":"2025-08-27T04:22:02Z","snapshot_observed_at":"2026-08-12T00:57:48.234044Z","submitted_at":"2025-08-27T04:22:02Z","title":"Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-05T15:45:36.304749Z"},"links":{"cited_paper":"/paper/2406.17565","citing_paper":"/paper/2508.19559"},"observation_digest":"sha256:43f63cefda5355fdae6fb06a44a674409b886d36a77de2befc451253f1f338f3","observation_id":"3b62d94d-a129-4d69-9b26-5a56356e42ca","resolution":{"observed_at":"2026-08-05T15:45:36.304749Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.11181","last_updated":"2024-01-20T09:43:36Z","snapshot_observed_at":"2026-08-13T09:16:06.205073Z","submitted_at":"2024-01-20T09:43:36Z","title":"Inference without Interference: Disaggregate LLM Inference for Mixed Downstream Workloads","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.11181","snapshot_observed_at":"2026-08-05T15:45:36.345043Z","title":"Infer- ence without interference: Disaggregate llm inference for mixed downstream workloads","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.19559","last_updated":"2025-08-27T04:22:02Z","snapshot_observed_at":"2026-08-12T00:57:48.234044Z","submitted_at":"2025-08-27T04:22:02Z","title":"Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-05T15:45:36.345043Z"},"links":{"cited_paper":"/paper/2401.11181","citing_paper":"/paper/2508.19559"},"observation_digest":"sha256:e089feb56d1671a5d54f649187f4c29765a4bf374f9cf73c51b6a62957fe7202","observation_id":"f33f8277-8b6a-4991-b6f4-b43908aa318b","resolution":{"observed_at":"2026-08-05T15:45:36.345043Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:45:49.801321Z","title":"Quincy: fair scheduling for distributed computing clusters","venue":null,"work_id":"eaa87a55-197d-420a-96d8-f4c185dd70ed","year":2009},"citing_paper":{"arxiv_id":"2508.19559","last_updated":"2025-08-27T04:22:02Z","snapshot_observed_at":"2026-08-12T00:57:48.234044Z","submitted_at":"2025-08-27T04:22:02Z","title":"Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-05T15:45:36.394846Z"},"links":{"citing_paper":"/paper/2508.19559"},"observation_digest":"sha256:e76c8dab8ed3405574f9471977ef7e486926bdadeae61b192a402a1eed4dcca2","observation_id":"45d01c18-09d5-4c7f-ba03-31439aed0250","resolution":{"observed_at":"2026-08-05T15:45:49.844745Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:45:36.468687Z","title":"Amant, Chetan Bansal, Victor Rühle, Anoop Kulkarni, Steve Kofsky, and Saravan Rajmohan","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.19559","last_updated":"2025-08-27T04:22:02Z","snapshot_observed_at":"2026-08-12T00:57:48.234044Z","submitted_at":"2025-08-27T04:22:02Z","title":"Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-05T15:45:36.468687Z"},"links":{"citing_paper":"/paper/2508.19559"},"observation_digest":"sha256:7f65895ef3a9d2ba00c34e956a2acb328e5010a7a43acc211d9506bd872b6f76","observation_id":"4440eb5b-1899-4b27-825d-5f28883f0231","resolution":{"observed_at":"2026-08-05T15:45:36.468687Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.11514","last_updated":"2024-05-27T15:55:22Z","snapshot_observed_at":"2026-08-13T05:22:13.139047Z","submitted_at":"2023-11-20T03:28:57Z","title":"HexGen: Generative Inference of Large Language Model over Heterogeneous Environment","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.11514","snapshot_observed_at":"2026-08-05T15:45:36.495152Z","title":"Hexgen: Generative inference of large language model over heterogeneous environment","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.19559","last_updated":"2025-08-27T04:22:02Z","snapshot_observed_at":"2026-08-12T00:57:48.234044Z","submitted_at":"2025-08-27T04:22:02Z","title":"Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-05T15:45:36.495152Z"},"links":{"cited_paper":"/paper/2311.11514","citing_paper":"/paper/2508.19559"},"observation_digest":"sha256:bd3cd85e66cb93d8d4cbc1a847a891b44aa9679cb1226a56d253ad48362cdf77","observation_id":"f8e7c6e4-e32f-40d6-b289-aa0fb5da0410","resolution":{"observed_at":"2026-08-05T15:45:36.495152Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:45:49.674401Z","title":"Netcache: Balancing key-value stores with fast in-network caching","venue":null,"work_id":"148cb772-e7db-4903-b788-03239df86843","year":2017},"citing_paper":{"arxiv_id":"2508.19559","last_updated":"2025-08-27T04:22:02Z","snapshot_observed_at":"2026-08-12T00:57:48.234044Z","submitted_at":"2025-08-27T04:22:02Z","title":"Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-05T15:45:36.534752Z"},"links":{"citing_paper":"/paper/2508.19559"},"observation_digest":"sha256:4ed6c57ac6d4d4409583e00fc16bbfced4a6e2fe13a835f8acd3f5917dca8104","observation_id":"59ce4631-00ea-4533-a7ba-7c080344900d","resolution":{"observed_at":"2026-08-05T15:45:49.705565Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:45:49.494749Z","title":"P/d- serve: Serving disaggregated large language model at scale, 2024","venue":null,"work_id":"09415c84-ef56-4934-b96f-e193ee904f49","year":2024},"citing_paper":{"arxiv_id":"2508.19559","last_updated":"2025-08-27T04:22:02Z","snapshot_observed_at":"2026-08-12T00:57:48.234044Z","submitted_at":"2025-08-27T04:22:02Z","title":"Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-05T15:45:36.585452Z"},"links":{"citing_paper":"/paper/2508.19559"},"observation_digest":"sha256:16f9a69ce841e6642af20f5ce3e993961f0e9e56d827a2b6af75e6a949247497","observation_id":"617bfea6-471a-425a-bf6a-44dcb80fa309","resolution":{"observed_at":"2026-08-05T15:45:49.544746Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:45:49.314804Z","title":"Morpheus: Towards automated {SLOs} for en- terprise clusters","venue":null,"work_id":"9173d991-9dcb-4c94-beac-6d667ce99b0e","year":2016},"citing_paper":{"arxiv_id":"2508.19559","last_updated":"2025-08-27T04:22:02Z","snapshot_observed_at":"2026-08-12T00:57:48.234044Z","submitted_at":"2025-08-27T04:22:02Z","title":"Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-05T15:45:36.696297Z"},"links":{"citing_paper":"/paper/2508.19559"},"observation_digest":"sha256:cb31647d26fd9694703b6ea66c8de8fe406ff64536b72e074344a3cb0d87a5d4","observation_id":"21b1a28a-61fe-4592-9c44-72ab951f3b18","resolution":{"observed_at":"2026-08-05T15:45:49.356334Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:45:49.154752Z","title":"Pod-attention: Unlocking full prefill-decode overlap for faster llm inference","venue":null,"work_id":"18742511-1481-4a16-853e-7ea85c500d15","year":2025},"citing_paper":{"arxiv_id":"2508.19559","last_updated":"2025-08-27T04:22:02Z","snapshot_observed_at":"2026-08-12T00:57:48.234044Z","submitted_at":"2025-08-27T04:22:02Z","title":"Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-05T15:45:36.845133Z"},"links":{"citing_paper":"/paper/2508.19559"},"observation_digest":"sha256:732f6b8c960b4c7d88e0912b5dfadd3807f93df94bc47e747fdd958a9a2016e8","observation_id":"d890f1f7-c6ea-4e78-9a31-aa1b0b2ff789","resolution":{"observed_at":"2026-08-05T15:45:49.204747Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:45:48.984747Z","title":"Keda: Kubernetes event-driven autoscaling","venue":null,"work_id":"53bf2a0e-a99f-4a69-a409-d065b55f1f1b","year":2023},"citing_paper":{"arxiv_id":"2508.19559","last_updated":"2025-08-27T04:22:02Z","snapshot_observed_at":"2026-08-12T00:57:48.234044Z","submitted_at":"2025-08-27T04:22:02Z","title":"Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-05T15:45:36.964911Z"},"links":{"citing_paper":"/paper/2508.19559"},"observation_digest":"sha256:98385587ebdea1a322bbfd73b75e68358e601d693e655e954df941c6916b6a8c","observation_id":"cbeeca16-12c9-4573-a9b3-c7050b81c92a","resolution":{"observed_at":"2026-08-05T15:45:49.020411Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:45:48.816463Z","title":"Kubernetes horizontal pod au- toscaler","venue":null,"work_id":"b5a2155b-409c-4064-972d-943b684fc0b8","year":null},"citing_paper":{"arxiv_id":"2508.19559","last_updated":"2025-08-27T04:22:02Z","snapshot_observed_at":"2026-08-12T00:57:48.234044Z","submitted_at":"2025-08-27T04:22:02Z","title":"Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-05T15:45:37.095704Z"},"links":{"citing_paper":"/paper/2508.19559"},"observation_digest":"sha256:715e640ce4097f62474a6b1bda5af2ee83449a3c896bc2b631e62cf5699207f8","observation_id":"322f0d49-79c5-449f-a8c1-166f093df45f","resolution":{"observed_at":"2026-08-05T15:45:48.854745Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:45:48.464747Z","title":"Kubernetes vertical pod autoscaler","venue":null,"work_id":"a1cf2239-c893-4e5c-af94-6da010c860cf","year":2023},"citing_paper":{"arxiv_id":"2508.19559","last_updated":"2025-08-27T04:22:02Z","snapshot_observed_at":"2026-08-12T00:57:48.234044Z","submitted_at":"2025-08-27T04:22:02Z","title":"Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-05T15:45:37.394751Z"},"links":{"citing_paper":"/paper/2508.19559"},"observation_digest":"sha256:ea16af3b2deda9f90efda1f0e6d4cfe9f100af857eca83126378754a75850277","observation_id":"efaff735-3754-4881-bab5-24bbd0938ddb","resolution":{"observed_at":"2026-08-05T15:45:48.524829Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:45:48.334886Z","title":"Kubernetes: Production-grade container orchestration","venue":null,"work_id":"8be70081-a0db-4eab-b62b-7ef50ac93499","year":null},"citing_paper":{"arxiv_id":"2508.19559","last_updated":"2025-08-27T04:22:02Z","snapshot_observed_at":"2026-08-12T00:57:48.234044Z","submitted_at":"2025-08-27T04:22:02Z","title":"Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-05T15:45:37.514840Z"},"links":{"citing_paper":"/paper/2508.19559"},"observation_digest":"sha256:343fc667276e6e8301d98a08f4e07b5fbf531b084952eaa9f86ab8742577b067","observation_id":"61e57b32-a9c4-4e53-b13d-a709948684c1","resolution":{"observed_at":"2026-08-05T15:45:48.374746Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.06180","last_updated":"2023-09-12T12:50:04Z","snapshot_observed_at":"2026-08-02T09:51:08.145755Z","submitted_at":"2023-09-12T12:50:04Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.06180","snapshot_observed_at":"2026-08-05T15:45:37.797229Z","title":"Gonzalez, Hao Zhang, and Ion Stoica","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.19559","last_updated":"2025-08-27T04:22:02Z","snapshot_observed_at":"2026-08-12T00:57:48.234044Z","submitted_at":"2025-08-27T04:22:02Z","title":"Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-05T15:45:37.797229Z"},"links":{"cited_paper":"/paper/2309.06180","citing_paper":"/paper/2508.19559"},"observation_digest":"sha256:a02fbdc1237e3886f1bf52958d7a40241ce478f720264ae92bc7b898fb6b4fe0","observation_id":"c4311eac-23f7-4449-b276-c31f83235da3","resolution":{"observed_at":"2026-08-05T15:45:37.797229Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:45:48.644767Z","title":null,"venue":null,"work_id":"5565f992-911f-49d1-8fdf-0a5e155adb8b","year":2025},"citing_paper":{"arxiv_id":"2508.19559","last_updated":"2025-08-27T04:22:02Z","snapshot_observed_at":"2026-08-12T00:57:48.234044Z","submitted_at":"2025-08-27T04:22:02Z","title":"Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-05T15:45:37.644748Z"},"links":{"citing_paper":"/paper/2508.19559"},"observation_digest":"sha256:6d6131a136ace5f383b19d362747e08de5cd164abb3afa3ea62cab0e12763de6","observation_id":"34e5fb31-0986-4b91-8ebf-86c0b4eda6a6","resolution":{"observed_at":"2026-08-05T15:45:48.684744Z","resolver_source":"raw_fallback","status":"parse_uncertain"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:45:48.006841Z","title":"Themis: Fair and efficient {GPU} cluster scheduling","venue":null,"work_id":"f0dcb4a2-4128-4b66-8684-d8ade10ed508","year":2020},"citing_paper":{"arxiv_id":"2508.19559","last_updated":"2025-08-27T04:22:02Z","snapshot_observed_at":"2026-08-12T00:57:48.234044Z","submitted_at":"2025-08-27T04:22:02Z","title":"Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-05T15:45:38.045215Z"},"links":{"citing_paper":"/paper/2508.19559"},"observation_digest":"sha256:53dd820c22750ddfb54de3b30b65ee0711e50856a55f775640cad3a88875c1b4","observation_id":"24b6c890-27de-4af7-8f90-d3dffe6ba77a","resolution":{"observed_at":"2026-08-05T15:45:48.054753Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:45:48.184751Z","title":"Alpaserve: Statistical multiplexing with model parallelism for deep learning serving","venue":null,"work_id":"658afa2a-75ab-4e5d-b1e0-732167a00404","year":2023},"citing_paper":{"arxiv_id":"2508.19559","last_updated":"2025-08-27T04:22:02Z","snapshot_observed_at":"2026-08-12T00:57:48.234044Z","submitted_at":"2025-08-27T04:22:02Z","title":"Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-05T15:45:37.904754Z"},"links":{"citing_paper":"/paper/2508.19559"},"observation_digest":"sha256:20dc22e9c48c2d0c6b964b395f1f23dabb9153a460297afd5d8de8ec67b115a4","observation_id":"d9a25650-0111-4be7-94b2-9e8419d86b50","resolution":{"observed_at":"2026-08-05T15:45:48.224826Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:45:47.664815Z","title":"Mastering llm techniques: Inference optimization, 2023","venue":null,"work_id":"7077208a-0827-41a5-8007-0699614e6969","year":2023},"citing_paper":{"arxiv_id":"2508.19559","last_updated":"2025-08-27T04:22:02Z","snapshot_observed_at":"2026-08-12T00:57:48.234044Z","submitted_at":"2025-08-27T04:22:02Z","title":"Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-05T15:45:38.302511Z"},"links":{"citing_paper":"/paper/2508.19559"},"observation_digest":"sha256:71c7185e42f9b446513ff1f6a3b85462f6254dbbd657e881de8e847e551196b7","observation_id":"008c09e5-d21c-48c1-b5c1-7e835ca18425","resolution":{"observed_at":"2026-08-05T15:45:47.715097Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:45:47.846377Z","title":"{Heterogeneity-Aware} cluster scheduling policies for deep learning workloads","venue":null,"work_id":"e9bb5a2d-b7e5-4b3b-ac05-e6acc24c4e51","year":2020},"citing_paper":{"arxiv_id":"2508.19559","last_updated":"2025-08-27T04:22:02Z","snapshot_observed_at":"2026-08-12T00:57:48.234044Z","submitted_at":"2025-08-27T04:22:02Z","title":"Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-05T15:45:38.194756Z"},"links":{"citing_paper":"/paper/2508.19559"},"observation_digest":"sha256:9b93c626c95d11d9ae54781b04757c8aed8c97620e760b8e33ab2af228da548d","observation_id":"946a2472-09c5-4e0b-8c07-93415e59af99","resolution":{"observed_at":"2026-08-05T15:45:47.894357Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:45:47.325023Z","title":"Introducing chatgpt","venue":null,"work_id":"efe4fa49-0370-4399-adbd-767dd92f4fa9","year":2022},"citing_paper":{"arxiv_id":"2508.19559","last_updated":"2025-08-27T04:22:02Z","snapshot_observed_at":"2026-08-12T00:57:48.234044Z","submitted_at":"2025-08-27T04:22:02Z","title":"Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-05T15:45:38.568169Z"},"links":{"citing_paper":"/paper/2508.19559"},"observation_digest":"sha256:d2db85c5d4fb491e9378cf1acde61278a5c08172af30fd6fcf93ef41aaaa5ab7","observation_id":"e26c1d2a-85b5-4204-88f6-abbf66139cad","resolution":{"observed_at":"2026-08-05T15:45:47.374750Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:45:47.502196Z","title":"Tensorrt-llm: A deep learning compiler for large language models","venue":null,"work_id":"a4d73403-9f59-43d2-b2b1-42cd6f1be363","year":2023},"citing_paper":{"arxiv_id":"2508.19559","last_updated":"2025-08-27T04:22:02Z","snapshot_observed_at":"2026-08-12T00:57:48.234044Z","submitted_at":"2025-08-27T04:22:02Z","title":"Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-05T15:45:38.384930Z"},"links":{"citing_paper":"/paper/2508.19559"},"observation_digest":"sha256:913205e1a44782ea06ef8749b0419ba3eadd98feeb96a46e521cc05f890779a6","observation_id":"7dd67305-7e24-437b-b0e2-24a865b5d666","resolution":{"observed_at":"2026-08-05T15:45:47.543754Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.18677","last_updated":"2024-05-20T15:37:36Z","snapshot_observed_at":"2026-08-13T05:13:11.777067Z","submitted_at":"2023-11-30T16:24:42Z","title":"Splitwise: Efficient generative LLM inference using phase splitting","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.18677","snapshot_observed_at":"2026-08-05T15:45:38.815520Z","title":"Splitwise: Efficient generative llm inference using phase splitting, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.19559","last_updated":"2025-08-27T04:22:02Z","snapshot_observed_at":"2026-08-12T00:57:48.234044Z","submitted_at":"2025-08-27T04:22:02Z","title":"Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-05T15:45:38.815520Z"},"links":{"cited_paper":"/paper/2311.18677","citing_paper":"/paper/2508.19559"},"observation_digest":"sha256:4941afcd6fa2b795b766e34de8f654f0d509003510367cceba8add55623abc41","observation_id":"06e8cfb6-5051-45c5-8a5b-5b8ad9c2bdcf","resolution":{"observed_at":"2026-08-05T15:45:38.815520Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:45:46.944851Z","title":"Splitwise: Efficient generative llm inference using phase splitting","venue":null,"work_id":"c393cd4a-c75a-4c42-8fb3-d5ad98843a9c","year":2024},"citing_paper":{"arxiv_id":"2508.19559","last_updated":"2025-08-27T04:22:02Z","snapshot_observed_at":"2026-08-12T00:57:48.234044Z","submitted_at":"2025-08-27T04:22:02Z","title":"Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-05T15:45:38.684953Z"},"links":{"citing_paper":"/paper/2508.19559"},"observation_digest":"sha256:7489be4e1b68f407b53c3bdd8ee6acc89835e5a47500ca9251b514ac765e517c","observation_id":"10af1f55-f75b-4194-9f3e-e5ebe6d56cb1","resolution":{"observed_at":"2026-08-05T15:45:47.104828Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2201.05596","last_updated":"2022-07-21T18:21:36Z","snapshot_observed_at":"2026-08-13T16:59:05.099994Z","submitted_at":"2022-01-14T18:36:04Z","title":"DeepSpeed-MoE: Advancing Mixture-of-Experts Inference and Training to Power Next-Generation AI Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.05596","snapshot_observed_at":"2026-08-05T15:45:39.094750Z","title":"Deepspeed- moe: Advancing mixture-of-experts inference and trainingtopowernext-generationaiscale, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.19559","last_updated":"2025-08-27T04:22:02Z","snapshot_observed_at":"2026-08-12T00:57:48.234044Z","submitted_at":"2025-08-27T04:22:02Z","title":"Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-05T15:45:39.094750Z"},"links":{"cited_paper":"/paper/2201.05596","citing_paper":"/paper/2508.19559"},"observation_digest":"sha256:570df682ce467e2c3b689f77666f26ef8d5834f4e647134b8922eb79bf287b5d","observation_id":"add94ac0-d2e8-450f-beb4-56798e2c52e7","resolution":{"observed_at":"2026-08-05T15:45:39.094750Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.00079","last_updated":"2025-09-03T14:56:29Z","snapshot_observed_at":"2026-08-12T23:36:32.131457Z","submitted_at":"2024-06-24T02:05:32Z","title":"Mooncake: A KVCache-centric Disaggregated Architecture for LLM Serving","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.00079","snapshot_observed_at":"2026-08-05T15:45:38.950601Z","title":"Mooncake: A kvcache-centric disaggre- gated architecture for llm serving.arXiv preprint arXiv:2407.00079, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.19559","last_updated":"2025-08-27T04:22:02Z","snapshot_observed_at":"2026-08-12T00:57:48.234044Z","submitted_at":"2025-08-27T04:22:02Z","title":"Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-05T15:45:38.950601Z"},"links":{"cited_paper":"/paper/2407.00079","citing_paper":"/paper/2508.19559"},"observation_digest":"sha256:9fe295a4b508b7249284d0d254d1a25cd051c054e54f147dad099df3957de5de","observation_id":"92be0001-d2d4-4b27-b8bb-b84232124710","resolution":{"observed_at":"2026-08-05T15:45:38.950601Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.01876","last_updated":"2024-03-04T09:32:05Z","snapshot_observed_at":"2026-08-14T02:05:56.579091Z","submitted_at":"2024-03-04T09:32:05Z","title":"D\\'ej\\`aVu: KV-cache Streaming for Fast, Fault-tolerant Generative LLM Serving","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.01876","snapshot_observed_at":"2026-08-05T15:45:39.355105Z","title":"Déjàvu: Kv- cache streaming for fast, fault-tolerant generative llm serving, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.19559","last_updated":"2025-08-27T04:22:02Z","snapshot_observed_at":"2026-08-12T00:57:48.234044Z","submitted_at":"2025-08-27T04:22:02Z","title":"Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-05T15:45:39.355105Z"},"links":{"cited_paper":"/paper/2403.01876","citing_paper":"/paper/2508.19559"},"observation_digest":"sha256:fd7aba09636871bf630a9dbb204e39f0b814c271bcd56be94d048329792a2f18","observation_id":"fb9321c0-4d56-464b-bfc7-346b861a505f","resolution":{"observed_at":"2026-08-05T15:45:39.355105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:45:46.749666Z","title":"Dynamollm: Designing llm inference clusters for performance and energy ef- ficiency, 2024","venue":null,"work_id":"e512f6cc-03a6-40b9-ab92-8d360cc1f9fc","year":2024},"citing_paper":{"arxiv_id":"2508.19559","last_updated":"2025-08-27T04:22:02Z","snapshot_observed_at":"2026-08-12T00:57:48.234044Z","submitted_at":"2025-08-27T04:22:02Z","title":"Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-05T15:45:39.244748Z"},"links":{"citing_paper":"/paper/2508.19559"},"observation_digest":"sha256:cbc1676eac77053466a018f80ff7c59c71680ba55282dc6a6acfa43f69c7829f","observation_id":"cde3a46f-15b0-4b33-8203-5c39b29d5f5d","resolution":{"observed_at":"2026-08-05T15:45:46.790797Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:45:46.604737Z","title":"Burstgpt: A real-world workload dataset to optimize llm serving systems, 2025","venue":null,"work_id":"975037c1-7480-475f-a74d-3dee956b2b29","year":2025},"citing_paper":{"arxiv_id":"2508.19559","last_updated":"2025-08-27T04:22:02Z","snapshot_observed_at":"2026-08-12T00:57:48.234044Z","submitted_at":"2025-08-27T04:22:02Z","title":"Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-05T15:45:39.735447Z"},"links":{"citing_paper":"/paper/2508.19559"},"observation_digest":"sha256:424b47041c7e7ee6f6354e6130af1df187a3dba4f4924dbf179223016b9174bc","observation_id":"63815573-bf62-4253-a78e-11a2f9f2bee6","resolution":{"observed_at":"2026-08-05T15:45:46.662517Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:45:39.514903Z","title":"Attention is all you need","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2508.19559","last_updated":"2025-08-27T04:22:02Z","snapshot_observed_at":"2026-08-12T00:57:48.234044Z","submitted_at":"2025-08-27T04:22:02Z","title":"Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-05T15:45:39.514903Z"},"links":{"citing_paper":"/paper/2508.19559"},"observation_digest":"sha256:1d9f7a27b45a5fdb442c87d05b275b2aa79da5ff8896943a6c1e44a82a23058e","observation_id":"fd14e2a9-b054-4988-883c-e1bdcdeae13d","resolution":{"observed_at":"2026-08-05T15:45:39.514903Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.05920","last_updated":"2024-09-25T05:57:51Z","snapshot_observed_at":"2026-08-09T14:08:47.340904Z","submitted_at":"2023-05-10T06:17:50Z","title":"Fast Distributed Inference Serving for Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.05920","snapshot_observed_at":"2026-08-05T15:45:40.072783Z","title":"Fast distributed inference serving for large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.19559","last_updated":"2025-08-27T04:22:02Z","snapshot_observed_at":"2026-08-12T00:57:48.234044Z","submitted_at":"2025-08-27T04:22:02Z","title":"Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-05T15:45:40.072783Z"},"links":{"cited_paper":"/paper/2305.05920","citing_paper":"/paper/2508.19559"},"observation_digest":"sha256:cf09a008be1b2225a7d6218d1e894742c999bd075dd42eca77eae4f283a7143a","observation_id":"4e5c97bd-0af5-460d-b280-c1736cfdbb3d","resolution":{"observed_at":"2026-08-05T15:45:40.072783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:45:46.434738Z","title":"Deepscaling: mi- croservices autoscaling for stable cpu utilization in large scale cloud systems","venue":null,"work_id":"a862dde1-d462-4d88-8ae9-5540ae575996","year":2022},"citing_paper":{"arxiv_id":"2508.19559","last_updated":"2025-08-27T04:22:02Z","snapshot_observed_at":"2026-08-12T00:57:48.234044Z","submitted_at":"2025-08-27T04:22:02Z","title":"Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-05T15:45:39.874829Z"},"links":{"citing_paper":"/paper/2508.19559"},"observation_digest":"sha256:0a08acfae59eee3d5b0415107b816b0546dd9b309648cae1501150f9db2e6734","observation_id":"b6b5f8af-d27f-4efc-a55b-3e0e49cba8af","resolution":{"observed_at":"2026-08-05T15:45:46.484737Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:45:46.268787Z","title":"Gandiva: Introspec- tive cluster scheduling for deep learning","venue":null,"work_id":"0740ea2b-c643-4116-9cc2-bfe8d980cb67","year":2018},"citing_paper":{"arxiv_id":"2508.19559","last_updated":"2025-08-27T04:22:02Z","snapshot_observed_at":"2026-08-12T00:57:48.234044Z","submitted_at":"2025-08-27T04:22:02Z","title":"Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-05T15:45:40.384815Z"},"links":{"citing_paper":"/paper/2508.19559"},"observation_digest":"sha256:d3fbc0261c0220b3bcca2e7ec5419fc0a21d3c25495f50a6106e06f169717e6b","observation_id":"628fb8ca-daed-443a-9c09-98c934c15340","resolution":{"observed_at":"2026-08-05T15:45:46.304737Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:45:40.285526Z","title":"Skylb: A locality-aware cross-region load balancer for llm inference","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.19559","last_updated":"2025-08-27T04:22:02Z","snapshot_observed_at":"2026-08-12T00:57:48.234044Z","submitted_at":"2025-08-27T04:22:02Z","title":"Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-05T15:45:40.285526Z"},"links":{"citing_paper":"/paper/2508.19559"},"observation_digest":"sha256:bcb66599b83ebf56d2546b56f0f895cd312180a7255158fda987ebadbac82fd7","observation_id":"8029a4fa-940d-4270-8a33-34a1f2fbeb3c","resolution":{"observed_at":"2026-08-05T15:45:40.285526Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.00128","last_updated":"2024-06-28T03:52:13Z","snapshot_observed_at":"2026-08-12T23:33:08.668728Z","submitted_at":"2024-06-28T03:52:13Z","title":"When Search Engine Services meet Large Language Models: Visions and Challenges","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.00128","snapshot_observed_at":"2026-08-05T15:45:40.814751Z","title":"When search engine services meet large language models: Visions and challenges, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.19559","last_updated":"2025-08-27T04:22:02Z","snapshot_observed_at":"2026-08-12T00:57:48.234044Z","submitted_at":"2025-08-27T04:22:02Z","title":"Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-05T15:45:40.814751Z"},"links":{"cited_paper":"/paper/2407.00128","citing_paper":"/paper/2508.19559"},"observation_digest":"sha256:b688c066e3cc35abc4ea8390e35f9e28e6840936c3b51c3b2b0acd91a3f9e176","observation_id":"a5ca7c4f-3319-459b-b0ad-2f5dae35a1e0","resolution":{"observed_at":"2026-08-05T15:45:40.814751Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:45:46.084745Z","title":"{AntMan}: Dynamic scaling on {GPU} clusters for deep learning","venue":null,"work_id":"f1175d4b-0e24-4f30-a3b2-6c20891ae956","year":2020},"citing_paper":{"arxiv_id":"2508.19559","last_updated":"2025-08-27T04:22:02Z","snapshot_observed_at":"2026-08-12T00:57:48.234044Z","submitted_at":"2025-08-27T04:22:02Z","title":"Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-05T15:45:40.564835Z"},"links":{"citing_paper":"/paper/2508.19559"},"observation_digest":"sha256:7c671c8c7a99513728fd67f2998587cdc2953f16332f31953cf578f159274ad4","observation_id":"5a26dc84-0566-465a-b261-d159407ac033","resolution":{"observed_at":"2026-08-05T15:45:46.134894Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:45:45.934900Z","title":"Orca: A distributed serving system for transformer-based generative models","venue":null,"work_id":"6e3b8985-3886-49d3-b6aa-6a3032290bfb","year":2022},"citing_paper":{"arxiv_id":"2508.19559","last_updated":"2025-08-27T04:22:02Z","snapshot_observed_at":"2026-08-12T00:57:48.234044Z","submitted_at":"2025-08-27T04:22:02Z","title":"Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-05T15:45:41.054848Z"},"links":{"citing_paper":"/paper/2508.19559"},"observation_digest":"sha256:b6a5de20dca9146df03761309e0058e7da6add46dc34c77f87c502316e57e5a6","observation_id":"9c1753c7-4196-4eef-8c5d-9605fafc83cf","resolution":{"observed_at":"2026-08-05T15:45:45.984742Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-05T15:45:40.923132Z","title":"Qwen3 technical report","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.19559","last_updated":"2025-08-27T04:22:02Z","snapshot_observed_at":"2026-08-12T00:57:48.234044Z","submitted_at":"2025-08-27T04:22:02Z","title":"Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-05T15:45:40.923132Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2508.19559"},"observation_digest":"sha256:e594abc6bbaea8d2575c5de59d94b0f5f4ce963e5459f824a49c8855d4199e54","observation_id":"e003e517-1b64-4008-83bc-c1ef61bfa38c","resolution":{"observed_at":"2026-08-05T15:45:40.923132Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:45:45.206435Z","title":"Sglang: Efficient execution of structured language model programs","venue":null,"work_id":"3d674710-0c8d-4c37-98ae-791e788814ef","year":2024},"citing_paper":{"arxiv_id":"2508.19559","last_updated":"2025-08-27T04:22:02Z","snapshot_observed_at":"2026-08-12T00:57:48.234044Z","submitted_at":"2025-08-27T04:22:02Z","title":"Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-05T15:45:41.445649Z"},"links":{"citing_paper":"/paper/2508.19559"},"observation_digest":"sha256:8b538ee194452f7c06fa64557b8b74fe1a3bdc024d26b7cf94c46533a5670a0c","observation_id":"a2226b0d-482c-40e2-9ff5-95ac47053a60","resolution":{"observed_at":"2026-08-05T15:45:45.334854Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:45:45.795090Z","title":"Day zero benchmarks for qwen 3 with sglang on baseten","venue":null,"work_id":"dde960e0-d6bd-4f60-a801-3ba6c1f5aec0","year":null},"citing_paper":{"arxiv_id":"2508.19559","last_updated":"2025-08-27T04:22:02Z","snapshot_observed_at":"2026-08-12T00:57:48.234044Z","submitted_at":"2025-08-27T04:22:02Z","title":"Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-05T15:45:41.187832Z"},"links":{"citing_paper":"/paper/2508.19559"},"observation_digest":"sha256:3843e13cd1c0e4aab93405cdd99fd2d5bc4b4eea155fd2f55252ba37a6fc8d24","observation_id":"52c49da3-783b-4771-a9c6-28672a21f558","resolution":{"observed_at":"2026-08-05T15:45:45.832062Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.02263","last_updated":"2025-07-26T15:29:10Z","snapshot_observed_at":"2026-08-08T01:33:26.740871Z","submitted_at":"2025-04-03T04:20:44Z","title":"MegaScale-Infer: Serving Mixture-of-Experts at Scale with Disaggregated Expert Parallelism","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.02263","snapshot_observed_at":"2026-08-05T15:45:41.645133Z","title":"Megascale- infer: Serving mixture-of-experts at scale with disaggregated expert parallelism","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.19559","last_updated":"2025-08-27T04:22:02Z","snapshot_observed_at":"2026-08-12T00:57:48.234044Z","submitted_at":"2025-08-27T04:22:02Z","title":"Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-05T15:45:41.645133Z"},"links":{"cited_paper":"/paper/2504.02263","citing_paper":"/paper/2508.19559"},"observation_digest":"sha256:95c2c2db723d28b4a439e7226c0e797fad7e84a778c0c5d2744eae7f3e1b5093","observation_id":"e999b7ab-399e-41ac-b2a2-49922ad45b24","resolution":{"observed_at":"2026-08-05T15:45:41.645133Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:45:44.925668Z","title":"{DistServe}: Disaggregating prefill and decoding for goodput-optimized large language model serving","venue":null,"work_id":"1d371326-0772-4dc3-b533-a264e55c7957","year":2024},"citing_paper":{"arxiv_id":"2508.19559","last_updated":"2025-08-27T04:22:02Z","snapshot_observed_at":"2026-08-12T00:57:48.234044Z","submitted_at":"2025-08-27T04:22:02Z","title":"Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-05T15:45:41.584746Z"},"links":{"citing_paper":"/paper/2508.19559"},"observation_digest":"sha256:2b42ac999d9d13cb1b1ccca2fce287e26155bf04f7fd13dd10e80f58517a16cf","observation_id":"05f34593-b95c-4dbd-bc11-7220b48a6446","resolution":{"observed_at":"2026-08-05T15:45:45.064755Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:45:45.574763Z","title":null,"venue":null,"work_id":"150c71dc-6eaf-45a6-9760-5fbfb42f73f6","year":null},"citing_paper":{"arxiv_id":"2508.19559","last_updated":"2025-08-27T04:22:02Z","snapshot_observed_at":"2026-08-12T00:57:48.234044Z","submitted_at":"2025-08-27T04:22:02Z","title":"Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-05T15:45:41.297650Z"},"links":{"citing_paper":"/paper/2508.19559"},"observation_digest":"sha256:3136e8438f82a054140b8451c7a075f1fdac78626025a41ea644aac94d6bdd1d","observation_id":"7d6a797b-c5be-45c7-936a-a5d037fa6939","resolution":{"observed_at":"2026-08-05T15:45:45.694749Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2508.19559","last_updated":"2025-08-27T04:22:02Z","latest_version":1,"primary_category":"cs.DC","snapshot_observed_at":"2026-08-12T00:57:48.234044Z","submitted_at":"2025-08-27T04:22:02Z","title":"Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference"},"reference_resolution":{"displayed":60,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":1,"unresolved":22,"verified_exact":0,"verified_fuzzy":37},"total_outbound_references":60},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 60 of 60 outbound references and 2 inbound Pith citation observations for arXiv:2508.19559."}