Pith. sign in

Paper Citation Record · LEDGER

Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference

As of 20 August 2026, this Paper Citation Record lists 60 of 60 outbound references and 2 inbound Pith citation observations for arXiv:2508.19559.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2508.19559 v1

Coverage vector

measured 60 of 60 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-05T15:45:41.645133Z

measured 62 of 62 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-19T06:32:44.657259+00:00

measured 2 of 2 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-06-26T19:23:10.356881Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: arxiv_reference, observed 2026-07-04T02:39:25.590182Z

Reference resolution

60 of 60 outbound references displayed

  • verified exact0
  • verified fuzzy37
  • unresolved22
  • parse uncertain1
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 5296e3ec-05ea-4bcd-aa64-18062ea8bf1e · outbound

This paper cites Accessed 2025-7-24.

Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference Accessed 2025-7-24

Reference 1

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T15:45:51.734750Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-08-05T15:45:35.064123Z digest=sha256:7c69f05ac4a99f67acf179a4e82361fec77e189c767870f6ec4bedd76089d14b

Observation e9a84438-7d06-4387-9d3f-3117c7e02ccb · outbound

This paper cites https:// developer.nvidia.com/docs,.

Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference https:// developer.nvidia.com/docs,

Reference 2

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T15:45:51.572255Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-08-05T15:45:35.204902Z digest=sha256:c3215c782fd033e794d4f082519d7d9342597b820a8db58512ba1b8a5b88682c

Observation b1aa73c1-0094-43ae-acc1-44eaa0ef514c · outbound

This paper cites an unresolved cited work.

Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference Unresolved cited work

Reference 3

Resolution
unresolved
raw_fallback, observed 2026-08-05T15:45:51.434810Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-08-05T15:45:35.294236Z digest=sha256:ae1fdf3ad7bb5155fa0d1ddf8c2f33d1afd5b3f56e0f8260bd5ccfb21af3a606

Observation 2be6c643-712a-4b5b-b3c2-5aaacc822daa · outbound

This paper cites Taming Throughput-Latency Tradeoff in LLM Inference with Sarathi-Serve.

Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference Taming Throughput-Latency Tradeoff in LLM Inference with Sarathi-Serve

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-05T15:45:35.454834Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T15:45:35.454834Z digest=sha256:bd3aeff6b6d1a36c7295b5d0ddc863c6d239944a9be087562946414bb66b39be

Observation b78d49da-ca7c-4f1d-93d6-27b0c2b84725 · outbound

This paper cites Deepspeed-inference: enabling efficient inference of transformer models at unprecedented scale.

Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference Deepspeed-inference: enabling efficient inference of transformer models at unprecedented scale

Reference 5

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T15:45:51.304744Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-08-05T15:45:35.576172Z digest=sha256:0c7e86a6614bf28a8ded0ae5e1d5166a183954ef131413b45a3fbab037a1b5e4

Observation 005f0de8-1e5a-4f39-9539-e06fb5d312ae · outbound

This paper cites Gpu utilization is a misleading metric, 2025.

Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference Gpu utilization is a misleading metric, 2025

Reference 6

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T15:45:51.165591Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-08-05T15:45:35.614837Z digest=sha256:5d1b57031c6a4774a8d0543497a730add361537042cbdf1aef7b443583cce51c

Observation 37415a6e-20ca-453a-88e9-92b47eab4bc4 · outbound

This paper cites KVDirect: Distributed Disaggregated LLM Inference.

Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference KVDirect: Distributed Disaggregated LLM Inference

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-05T15:45:35.674883Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T15:45:35.674883Z digest=sha256:14d8ce81a30cfd2d21071433cc068d2c1153c359d599aba0df27822952ebb02d

Observation 917bc262-3221-4a86-ba8c-68677aa20ce7 · outbound

This paper cites Leveraging endpoint flexibility in data- intensive clusters.

Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference Leveraging endpoint flexibility in data- intensive clusters

Reference 8

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T15:45:51.044949Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-08-05T15:45:35.722485Z digest=sha256:4892bd2aab242326d01bbce2c6d1907ae8ccf88068322fafce61047cbc24dcc3

Observation 434850f0-8903-417f-b7a6-ffd26b851236 · outbound

This paper cites Efficient coflow scheduling with varys.

Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference Efficient coflow scheduling with varys

Reference 9

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T15:45:50.913622Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-08-05T15:45:35.785050Z digest=sha256:cc8f6301bc09fb6c6fe16ce68d4de1cbb3d301a3ecb0ad92a537bad857f0bbbf

Observation 409d0484-5e32-410c-a5e0-104957c72a60 · outbound

This paper cites Resource central: Understanding and predict- ing workloads for improved resource management in large cloud platforms.

Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference Resource central: Understanding and predict- ing workloads for improved resource management in large cloud platforms

Reference 10

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T15:45:50.784886Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-08-05T15:45:35.845065Z digest=sha256:eef778c4b496171732daa8998796713e21b222129abca098fb63e21a035b64d6

Observation e875fca2-10f5-4384-852b-1a3a117d8998 · outbound

This paper cites A Complete Survey on LLM-based AI Chatbots.

Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference A Complete Survey on LLM-based AI Chatbots

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-05T15:45:35.905253Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T15:45:35.905253Z digest=sha256:3136e45df03d934e3da24e806bbf6d531b9dc81dc399262fecbdf4556f7cf133

Observation 475ceb66-0e2a-402e-9b23-87108b8374f7 · outbound

This paper cites Paragon: Qos-aware scheduling for heterogeneous datacenters.

Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference Paragon: Qos-aware scheduling for heterogeneous datacenters

Reference 12

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T15:45:50.634811Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-08-05T15:45:35.954752Z digest=sha256:0351b3e6bd626cfd655555e23b829c4ba47d3ed7f22da75fd0d5995c0ac1df73

Observation 6a2343fd-7f22-4243-9541-5ab22adf0c5c · outbound

This paper cites Deploy DeepSeek-V3/R1 671b on 8 × H100 and throughput bench- marks.

Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference Deploy DeepSeek-V3/R1 671b on 8 × H100 and throughput bench- marks

Reference 13

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T15:45:50.484742Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-08-05T15:45:36.004833Z digest=sha256:1628342a56e93dd76aaaf0394f193e7f28f298611fec8964dc8c1ac49136253f

Observation 5bbc3669-7426-4e42-b71e-95fbe657eed6 · outbound

This paper cites Autoscale: Dynamic, robust capacity management for multi-tier data centers.

Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference Autoscale: Dynamic, robust capacity management for multi-tier data centers

Reference 14

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T15:45:50.292762Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-08-05T15:45:36.049734Z digest=sha256:c97f28beeeaa2a2e78774134599ca48e6e432ebdd6c9579d885043eee25471f1

Observation be13370d-eb17-418d-ba53-bd1ecfdce013 · outbound

This paper cites Firmament: Fast, centralized cluster scheduling at scale.

Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference Firmament: Fast, centralized cluster scheduling at scale

Reference 15

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T15:45:50.155912Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-08-05T15:45:36.105424Z digest=sha256:01dd6cab48dd4871bfef87db95863b2a9e01cf4bd7b816f76986f8ca33054222

Observation 6a74bdda-0d75-4dff-865e-b99caede7018 · outbound

This paper cites M\'elange: Cost Efficient Large Language Model Serving by Exploiting GPU Heterogeneity.

Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference M\'elange: Cost Efficient Large Language Model Serving by Exploiting GPU Heterogeneity

Reference 16

Resolution
unresolved
no resolver link, observed 2026-08-05T15:45:36.145048Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T15:45:36.145048Z digest=sha256:808f3c2d20ac8a098226e5677aacb23627daca908138c6bfa410dedc4509b8f2

Observation 8aeedfa4-c07d-4dfe-8f40-33f896f9b853 · outbound

This paper cites Tiresias: A {GPU} cluster manager for distributed deep learning.

Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference Tiresias: A {GPU} cluster manager for distributed deep learning

Reference 17

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T15:45:50.014740Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-08-05T15:45:36.184753Z digest=sha256:485994ffb2d9b5a1a8cf14a08f66ee5b6c699f27990f958e8098989c18888716

Observation 39312223-c144-4967-ba9d-d17370826359 · outbound

This paper cites DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning.

Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning

Reference 18

Resolution
unresolved
no resolver link, observed 2026-08-05T15:45:36.234753Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T15:45:36.234753Z digest=sha256:69ebf3abb2eb1a8af86a959701eccf6ddd29704074eea48c7155d3c917fd3349

Observation 3b62d94d-a129-4d69-9b26-5a56356e42ca · outbound

This paper cites MemServe: Context Caching for Disaggregated LLM Serving with Elastic Memory Pool.

Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference MemServe: Context Caching for Disaggregated LLM Serving with Elastic Memory Pool

Reference 19

Resolution
unresolved
no resolver link, observed 2026-08-05T15:45:36.304749Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T15:45:36.304749Z digest=sha256:ea164b5f94e7cb0ecc224b5603db8ca86ad3d578402382011cf0bda857497f90

Observation f33f8277-8b6a-4991-b6f4-b43908aa318b · outbound

This paper cites Inference without Interference: Disaggregate LLM Inference for Mixed Downstream Workloads.

Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference Inference without Interference: Disaggregate LLM Inference for Mixed Downstream Workloads

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-05T15:45:36.345043Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T15:45:36.345043Z digest=sha256:a8758705edebd0f860a287484943aaf3c4a9ad76e326872bd07becaed25b4ad3

Observation 45d01c18-09d5-4c7f-ba03-31439aed0250 · outbound

This paper cites Quincy: fair scheduling for distributed computing clusters.

Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference Quincy: fair scheduling for distributed computing clusters

Reference 21

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T15:45:49.844745Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-08-05T15:45:36.394846Z digest=sha256:5d9d85f0a78e13fa07b6366c4c7946dde4d0f54ca5ce067293d65f1b364277eb

Observation 4440eb5b-1899-4b27-825d-5f28883f0231 · outbound

This paper cites Amant, Chetan Bansal, Victor Rühle, Anoop Kulkarni, Steve Kofsky, and Saravan Rajmohan.

Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference Amant, Chetan Bansal, Victor Rühle, Anoop Kulkarni, Steve Kofsky, and Saravan Rajmohan

Reference 22

Resolution
unresolved
no resolver link, observed 2026-08-05T15:45:36.468687Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T15:45:36.468687Z digest=sha256:98eb1ffec629e9495c03b8023ec486c0b75f72c4932ce7706a2d6c26ee3e34d3

Observation f8e7c6e4-e32f-40d6-b289-aa0fb5da0410 · outbound

This paper cites HexGen: Generative Inference of Large Language Model over Heterogeneous Environment.

Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference HexGen: Generative Inference of Large Language Model over Heterogeneous Environment

Reference 23

Resolution
unresolved
no resolver link, observed 2026-08-05T15:45:36.495152Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T15:45:36.495152Z digest=sha256:28f1e88bf78a1e3257d79a03acb1263015553bc253a3c72da5f82bfa01ddb6f8

Observation 59ce4631-00ea-4533-a7ba-7c080344900d · outbound

This paper cites Netcache: Balancing key-value stores with fast in-network caching.

Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference Netcache: Balancing key-value stores with fast in-network caching

Reference 24

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T15:45:49.705565Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-08-05T15:45:36.534752Z digest=sha256:d61af57ae043e92da8fd426c223d2a5967b80cfb8a0928e5063a28b4efcc2ace

Observation 617bfea6-471a-425a-bf6a-44dcb80fa309 · outbound

This paper cites P/d- serve: Serving disaggregated large language model at scale, 2024.

Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference P/d- serve: Serving disaggregated large language model at scale, 2024

Reference 25

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T15:45:49.544746Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-08-05T15:45:36.585452Z digest=sha256:c03e12fd88092b5543383c8717154127529b1cd6d2e29e7bc1c990b10ba19617

Observation 21b1a28a-61fe-4592-9c44-72ab951f3b18 · outbound

This paper cites Morpheus: Towards automated {SLOs} for en- terprise clusters.

Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference Morpheus: Towards automated {SLOs} for en- terprise clusters

Reference 26

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T15:45:49.356334Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-08-05T15:45:36.696297Z digest=sha256:9708d06b43db83fee4b9724a63ccf0f0911e542cc3cecfb50f6aa1aca4f409ee

Observation d890f1f7-c6ea-4e78-9a31-aa1b0b2ff789 · outbound

This paper cites Pod-attention: Unlocking full prefill-decode overlap for faster llm inference.

Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference Pod-attention: Unlocking full prefill-decode overlap for faster llm inference

Reference 27

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T15:45:49.204747Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-08-05T15:45:36.845133Z digest=sha256:e22bb8dd80b142c749876f6c04cc102b80454bceb35e527021b401ea0dd302a8

Observation cbeeca16-12c9-4573-a9b3-c7050b81c92a · outbound

This paper cites Keda: Kubernetes event-driven autoscaling.

Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference Keda: Kubernetes event-driven autoscaling

Reference 28

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T15:45:49.020411Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-08-05T15:45:36.964911Z digest=sha256:c3417cae4855c610e91179b6e7709ceb82130fecf17ff1429e1cb578fed5a7c4

Observation 322f0d49-79c5-449f-a8c1-166f093df45f · outbound

This paper cites Kubernetes horizontal pod au- toscaler.

Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference Kubernetes horizontal pod au- toscaler

Reference 29

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T15:45:48.854745Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-08-05T15:45:37.095704Z digest=sha256:f79e1f40fb7076eef7b427a032533fe198ae09c91ba3131d879fbede9991114d

Observation efaff735-3754-4881-bab5-24bbd0938ddb · outbound

This paper cites Kubernetes vertical pod autoscaler.

Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference Kubernetes vertical pod autoscaler

Reference 30

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T15:45:48.524829Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-08-05T15:45:37.394751Z digest=sha256:895235b644bf791580634d129f5e2cc868964c5353108ed3b2272d13da7705bb

Observation 61e57b32-a9c4-4e53-b13d-a709948684c1 · outbound

This paper cites Kubernetes: Production-grade container orchestration.

Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference Kubernetes: Production-grade container orchestration

Reference 31

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T15:45:48.374746Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-08-05T15:45:37.514840Z digest=sha256:f83bc151334cef2d1c1df3eb22cd547d7cd46256fe2f191f73dcc4c536c76482

Observation c4311eac-23f7-4449-b276-c31f83235da3 · outbound

This paper cites Efficient Memory Management for Large Language Model Serving with PagedAttention.

Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference Efficient Memory Management for Large Language Model Serving with PagedAttention

Reference 32

Resolution
unresolved
no resolver link, observed 2026-08-05T15:45:37.797229Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T15:45:37.797229Z digest=sha256:34f87d3cdb15240e16a1fd0a6aa05a9819bcc562c0bdd4069a2ef18ffb7f3591

Observation 34e5fb31-0986-4b91-8ebf-86c0b4eda6a6 · outbound

This paper cites an unresolved cited work.

Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference Unresolved cited work

Reference 33

Resolution
parse uncertain
raw_fallback, observed 2026-08-05T15:45:48.684744Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-08-05T15:45:37.644748Z digest=sha256:c01b79e00986ee6687ce4e643fb2c4eb146bbcfe2c1a65275baa578cd9504832

Observation 24b6c890-27de-4af7-8f90-d3dffe6ba77a · outbound

This paper cites Themis: Fair and efficient {GPU} cluster scheduling.

Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference Themis: Fair and efficient {GPU} cluster scheduling

Reference 34

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T15:45:48.054753Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-08-05T15:45:38.045215Z digest=sha256:8fe5f6a0958764380738dab601151decd3224c26a8ef163517763248b5f7ef9f

Observation d9a25650-0111-4be7-94b2-9e8419d86b50 · outbound

This paper cites Alpaserve: Statistical multiplexing with model parallelism for deep learning serving.

Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference Alpaserve: Statistical multiplexing with model parallelism for deep learning serving

Reference 35

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T15:45:48.224826Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-08-05T15:45:37.904754Z digest=sha256:d0eaa95ab072d85f32d2dd94e922cd929d9137ea01f0067f014e4c363ba7e742

Observation 008c09e5-d21c-48c1-b5c1-7e835ca18425 · outbound

This paper cites Mastering llm techniques: Inference optimization, 2023.

Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference Mastering llm techniques: Inference optimization, 2023

Reference 36

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T15:45:47.715097Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-08-05T15:45:38.302511Z digest=sha256:b0ba355d9267a17ff80d27e336103e044227f6e45f708037fc6ff4efd7ea82aa

Observation 946a2472-09c5-4e0b-8c07-93415e59af99 · outbound

This paper cites {Heterogeneity-Aware} cluster scheduling policies for deep learning workloads.

Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference {Heterogeneity-Aware} cluster scheduling policies for deep learning workloads

Reference 37

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T15:45:47.894357Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-08-05T15:45:38.194756Z digest=sha256:0c386a0304315c66eeb4cd3e22c2b1561d494345cd32a049183d161e39fc24b0

Observation e26c1d2a-85b5-4204-88f6-abbf66139cad · outbound

This paper cites Introducing chatgpt.

Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference Introducing chatgpt

Reference 38

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T15:45:47.374750Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-08-05T15:45:38.568169Z digest=sha256:b5cfd7c5d084684f5550d5b0faa3d631a7cbd829291ff2d08696b6b37493a9a1

Observation 7dd67305-7e24-437b-b0e2-24a865b5d666 · outbound

This paper cites Tensorrt-llm: A deep learning compiler for large language models.

Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference Tensorrt-llm: A deep learning compiler for large language models

Reference 39

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T15:45:47.543754Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-08-05T15:45:38.384930Z digest=sha256:c0bfd51fdf672961c17675791a130783ae451bbfe79f00ba9f13e4326f46e89e

Observation 06e8cfb6-5051-45c5-8a5b-5b8ad9c2bdcf · outbound

This paper cites Splitwise: Efficient generative LLM inference using phase splitting.

Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference Splitwise: Efficient generative LLM inference using phase splitting

Reference 40

Resolution
unresolved
no resolver link, observed 2026-08-05T15:45:38.815520Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T15:45:38.815520Z digest=sha256:da3baf738179d6394ed091faa94a3728f1bf0721a5968bfb816791fa10060ed5

Observation 10af1f55-f75b-4194-9f3e-e5ebe6d56cb1 · outbound

This paper cites Splitwise: Efficient generative llm inference using phase splitting.

Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference Splitwise: Efficient generative llm inference using phase splitting

Reference 41

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T15:45:47.104828Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-08-05T15:45:38.684953Z digest=sha256:90ca8aed1d2b243fafc1f29cac689a7f2a51b06fde74ef1ce4c7dfdaea944322

Observation add94ac0-d2e8-450f-beb4-56798e2c52e7 · outbound

This paper cites DeepSpeed-MoE: Advancing Mixture-of-Experts Inference and Training to Power Next-Generation AI Scale.

Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference DeepSpeed-MoE: Advancing Mixture-of-Experts Inference and Training to Power Next-Generation AI Scale

Reference 42

Resolution
unresolved
no resolver link, observed 2026-08-05T15:45:39.094750Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T15:45:39.094750Z digest=sha256:6f0deca6aac00cc31c99670a2e6f010767829b6544f9db00ac67db2e32a8c5d5

Observation 92be0001-d2d4-4b27-b8bb-b84232124710 · outbound

This paper cites Mooncake: A KVCache-centric Disaggregated Architecture for LLM Serving.

Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference Mooncake: A KVCache-centric Disaggregated Architecture for LLM Serving

Reference 43

Resolution
unresolved
no resolver link, observed 2026-08-05T15:45:38.950601Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T15:45:38.950601Z digest=sha256:7077dcfa7e7a3da8cfb75652c455945a113e6f2abc74c3f2e72bcf073324dab3

Observation fb9321c0-4d56-464b-bfc7-346b861a505f · outbound

This paper cites D\'ej\`aVu: KV-cache Streaming for Fast, Fault-tolerant Generative LLM Serving.

Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference D\'ej\`aVu: KV-cache Streaming for Fast, Fault-tolerant Generative LLM Serving

Reference 44

Resolution
unresolved
no resolver link, observed 2026-08-05T15:45:39.355105Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T15:45:39.355105Z digest=sha256:5cfe9a7d7fdcc81bd81b55ece202826639e3b544bfe2aad94b29a4089cfd71de

Observation cde3a46f-15b0-4b33-8203-5c39b29d5f5d · outbound

This paper cites Dynamollm: Designing llm inference clusters for performance and energy ef- ficiency, 2024.

Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference Dynamollm: Designing llm inference clusters for performance and energy ef- ficiency, 2024

Reference 45

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T15:45:46.790797Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-08-05T15:45:39.244748Z digest=sha256:3b0df9e95fabffeaaafd4e04d346e99cc901b1b6947e905874827b5d86fd4527

Observation 63815573-bf62-4253-a78e-11a2f9f2bee6 · outbound

This paper cites Burstgpt: A real-world workload dataset to optimize llm serving systems, 2025.

Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference Burstgpt: A real-world workload dataset to optimize llm serving systems, 2025

Reference 46

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T15:45:46.662517Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-08-05T15:45:39.735447Z digest=sha256:22856c62b4d6128ea0ba8a39eb691edad7e44e8b201d527c22d3d7f21c98be4c

Observation fd14e2a9-b054-4988-883c-e1bdcdeae13d · outbound

This paper cites Attention is all you need.

Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference Attention is all you need

Reference 47

Resolution
unresolved
no resolver link, observed 2026-08-05T15:45:39.514903Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T15:45:39.514903Z digest=sha256:2e6ceef436fde2ba00939e87c534b7cd018653730684a22a3eb8a50ec25ad9de

Observation 4e5c97bd-0af5-460d-b280-c1736cfdbb3d · outbound

This paper cites Fast Distributed Inference Serving for Large Language Models.

Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference Fast Distributed Inference Serving for Large Language Models

Reference 48

Resolution
unresolved
no resolver link, observed 2026-08-05T15:45:40.072783Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T15:45:40.072783Z digest=sha256:7ab5defbf85eb23a6dc206efcbfe4fb744177abb7717b361c4ee90156071292c

Observation b6b5f8af-d27f-4efc-a55b-3e0e49cba8af · outbound

This paper cites Deepscaling: mi- croservices autoscaling for stable cpu utilization in large scale cloud systems.

Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference Deepscaling: mi- croservices autoscaling for stable cpu utilization in large scale cloud systems

Reference 49

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T15:45:46.484737Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-08-05T15:45:39.874829Z digest=sha256:58596194c6918698087646d611919dc986e08af05deffb465fcc7dd8028fb3fb

Observation 628fb8ca-daed-443a-9c09-98c934c15340 · outbound

This paper cites Gandiva: Introspec- tive cluster scheduling for deep learning.

Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference Gandiva: Introspec- tive cluster scheduling for deep learning

Reference 50

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T15:45:46.304737Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-08-05T15:45:40.384815Z digest=sha256:df5caaa5e216d8a8383e759d567e5d01d101d19eb7db6be0f6758f2a7d62099c

Observation 8029a4fa-940d-4270-8a33-34a1f2fbeb3c · outbound

This paper cites Skylb: A locality-aware cross-region load balancer for llm inference.

Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference Skylb: A locality-aware cross-region load balancer for llm inference

Reference 51

Resolution
unresolved
no resolver link, observed 2026-08-05T15:45:40.285526Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T15:45:40.285526Z digest=sha256:61e2b5a59fe2b4a51a6bc39ff52012cfea78998cb0b878a0639e841d6b7198e8

Observation a5ca7c4f-3319-459b-b0ad-2f5dae35a1e0 · outbound

This paper cites When Search Engine Services meet Large Language Models: Visions and Challenges.

Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference When Search Engine Services meet Large Language Models: Visions and Challenges

Reference 52

Resolution
unresolved
no resolver link, observed 2026-08-05T15:45:40.814751Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T15:45:40.814751Z digest=sha256:50209addb77cc558ae2e1ab5d7bc75f214a82984a8a6f51d7556e841e95d9f4f

Observation 5a26dc84-0566-465a-b261-d159407ac033 · outbound

This paper cites {AntMan}: Dynamic scaling on {GPU} clusters for deep learning.

Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference {AntMan}: Dynamic scaling on {GPU} clusters for deep learning

Reference 53

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T15:45:46.134894Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-08-05T15:45:40.564835Z digest=sha256:97e04811ae4ce647eddb1dfdc83001af2e4dbc5e88de8734143d32e437229726

Observation 9c1753c7-4196-4eef-8c5d-9605fafc83cf · outbound

This paper cites Orca: A distributed serving system for transformer-based generative models.

Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference Orca: A distributed serving system for transformer-based generative models

Reference 54

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T15:45:45.984742Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-08-05T15:45:41.054848Z digest=sha256:81bae8a200c004ba5eccaa422b73c7df67811831d5532a66b2e89cf2fa26b2ae

Observation e003e517-1b64-4008-83bc-c1ef61bfa38c · outbound

This paper cites Qwen3 Technical Report.

Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference Qwen3 Technical Report

Reference 55

Resolution
unresolved
no resolver link, observed 2026-08-05T15:45:40.923132Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T15:45:40.923132Z digest=sha256:286f3758711bc12c547fcc18cd43da286af4deb9ae3e17d980a8d863b16d8f4a

Observation a2226b0d-482c-40e2-9ff5-95ac47053a60 · outbound

This paper cites Sglang: Efficient execution of structured language model programs.

Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference Sglang: Efficient execution of structured language model programs

Reference 56

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T15:45:45.334854Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-08-05T15:45:41.445649Z digest=sha256:d232742fab1318b1699244a3c7afd0f82c7a1b34f3407dfabeb6457fbadc5618

Observation 52c49da3-783b-4771-a9c6-28672a21f558 · outbound

This paper cites Day zero benchmarks for qwen 3 with sglang on baseten.

Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference Day zero benchmarks for qwen 3 with sglang on baseten

Reference 57

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T15:45:45.832062Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-08-05T15:45:41.187832Z digest=sha256:c2777b431a1bb8c9f5e208602b39d6ae66663c5f75551969e2a1ce03a232dbb3

Observation e999b7ab-399e-41ac-b2a2-49922ad45b24 · outbound

This paper cites MegaScale-Infer: Serving Mixture-of-Experts at Scale with Disaggregated Expert Parallelism.

Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference MegaScale-Infer: Serving Mixture-of-Experts at Scale with Disaggregated Expert Parallelism

Reference 58

Resolution
unresolved
no resolver link, observed 2026-08-05T15:45:41.645133Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T15:45:41.645133Z digest=sha256:3a3a8e0a17529a292642fa12256283c84c872191230a31351949476596933c99

Observation 05f34593-b95c-4dbd-bc11-7220b48a6446 · outbound

This paper cites {DistServe}: Disaggregating prefill and decoding for goodput-optimized large language model serving.

Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference {DistServe}: Disaggregating prefill and decoding for goodput-optimized large language model serving

Reference 60

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T15:45:45.064755Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-08-05T15:45:41.584746Z digest=sha256:b9ef4f658174d228f8a69a96de322f852c86117b7d0c2d920ce241caf900e466

Observation 7d6a797b-c5be-45c7-936a-a5d037fa6939 · outbound

This paper cites an unresolved cited work.

Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference Unresolved cited work

Reference 2025

Resolution
unresolved
raw_fallback, observed 2026-08-05T15:45:45.694749Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-08-05T15:45:41.297650Z digest=sha256:09cacda9f34df0174017be6ac368adb819717204c3f3c852b4daf12a5fced321

Pith citing papers

Observation cf870d12-d482-4314-8454-4d57614fcc5a · inbound

Cloud-native and Distributed Systems for Efficient and Scalable Large Language Models -- A Research Agenda cites this paper.

Cloud-native and Distributed Systems for Efficient and Scalable Large Language Models -- A Research Agenda Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference

Reference 67

Resolution
verified exact
arxiv_id, observed 2026-05-10T06:31:30.854890Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-05-10T06:27:23.580445Z digest=sha256:5ff6400be95d37a8702e128a5598f97978b306159759af969de059a4e68e7ebd

Observation 63695de3-9746-4158-9525-4fb243846207 · inbound

TurboServe: Serving Streaming Video Generation Efficiently and Economically cites this paper.

TurboServe: Serving Streaming Video Generation Efficiently and Economically Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference

Reference 27

Resolution
verified exact
arxiv_id, observed 2026-07-04T02:39:25.592664Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-06-26T19:23:10.356881Z digest=sha256:4a58bf2ae84c994ff25d66c9dd0c49ea3120c4d4afe62793ee3046c006a934aa