Pith. sign in

Paper Citation Record · LEDGER

Efficiently Serving Large Multimodal Models Using EPD Disaggregation

As of 19 August 2026, this Paper Citation Record lists 22 of 22 outbound references and 5 inbound Pith citation observations for arXiv:2501.05460.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2501.05460 v4

Coverage vector

measured 22 of 22 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-11T04:29:34.814139Z

measured 27 of 27 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-19T06:32:44.657259+00:00

measured 5 of 5 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-08-14T05:50:05.847560Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: arxiv_reference, observed 2026-07-03T10:27:56.708993Z

Reference resolution

22 of 22 outbound references displayed

  • verified exact0
  • verified fuzzy8
  • unresolved14
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation c6a4cebb-9521-4820-ac94-9c94739b3328 · outbound

This paper cites write newline.

Efficiently Serving Large Multimodal Models Using EPD Disaggregation write newline

Reference 1

Resolution
unresolved
no resolver link, observed 2026-08-11T04:29:34.674265Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-11T04:29:34.674265Z digest=sha256:606e6dc21d117eaab02cdddd284bdb5aee02564c989fae260aeda3364bbb79e2

Observation 81c278c7-4849-44d0-9d21-2051357c10b3 · outbound

This paper cites GPT-4 Technical Report.

Efficiently Serving Large Multimodal Models Using EPD Disaggregation GPT-4 Technical Report

Reference 2

Resolution
unresolved
no resolver link, observed 2026-08-11T04:29:34.682023Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-11T04:29:34.682023Z digest=sha256:46973cecb29e2be34d43c1b531f32579519fc535f78b9d97950123b8810c28e9

Observation 159e985a-df5e-4fb8-895a-24eba915a341 · outbound

This paper cites SARATHI: Efficient LLM Inference by Piggybacking Decodes with Chunked Prefills.

Efficiently Serving Large Multimodal Models Using EPD Disaggregation SARATHI: Efficient LLM Inference by Piggybacking Decodes with Chunked Prefills

Reference 3

Resolution
unresolved
no resolver link, observed 2026-08-11T04:29:34.688512Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-11T04:29:34.688512Z digest=sha256:20e368f8ee6103b54be74c0d8eb7afb23f5185061bd82124bd0059b29e77b5a1

Observation d368e730-0f3a-4b4b-bf29-ddbf99e9d34c · outbound

This paper cites Bayesian performance analysis for black-box optimization benchmarking.

Efficiently Serving Large Multimodal Models Using EPD Disaggregation Bayesian performance analysis for black-box optimization benchmarking

Reference 4

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T04:29:35.332131Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=arxiv_source observed=2026-08-11T04:29:34.694287Z digest=sha256:8f0fdc7cef1a1743e20b83838f1cf658123c14c027984192e63f223d2b314d18

Observation 7115aa6f-977d-4886-a4fa-bf59f60a44de · outbound

This paper cites A survey on evaluation of large language models.

Efficiently Serving Large Multimodal Models Using EPD Disaggregation A survey on evaluation of large language models

Reference 5

Resolution
unresolved
no resolver link, observed 2026-08-11T04:29:34.702705Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-11T04:29:34.702705Z digest=sha256:540c77c0e22bc9ce698a628bfbae2bbd81b4eb54c229b1205e4e1eebde395a92

Observation 9b5c4a0e-3eb6-4663-9f5d-4bcc72741d2a · outbound

This paper cites an unresolved cited work.

Efficiently Serving Large Multimodal Models Using EPD Disaggregation Unresolved cited work

Reference 6

Resolution
unresolved
raw_fallback, observed 2026-08-11T04:29:35.290259Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=arxiv_source observed=2026-08-11T04:29:34.708988Z digest=sha256:4190a958980bd0d11dc0566b71e21598402e4ee3a7266791aeca23a1f731accc

Observation 4bfc5aba-9f8e-4f16-807a-02fa3f311093 · outbound

This paper cites Inference without Interference: Disaggregate LLM Inference for Mixed Downstream Workloads.

Efficiently Serving Large Multimodal Models Using EPD Disaggregation Inference without Interference: Disaggregate LLM Inference for Mixed Downstream Workloads

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-11T04:29:34.715304Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-11T04:29:34.715304Z digest=sha256:99a553d798f6fb06a6191956b3feed1b3c45f11fc6e7d5eb5bf9dd8b21abf61c

Observation a0117dca-f92c-49d7-9e15-5433c53e1873 · outbound

This paper cites P/D-Serve: Serving Disaggregated Large Language Model at Scale.

Efficiently Serving Large Multimodal Models Using EPD Disaggregation P/D-Serve: Serving Disaggregated Large Language Model at Scale

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-11T04:29:34.722701Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-11T04:29:34.722701Z digest=sha256:bcd81e709ea86164b6c7b565dac23021fc9a034b59bce10fe4abba628080fd9c

Observation 2377e117-9098-4867-96d4-78956e29de2a · outbound

This paper cites GEAR: An Efficient KV Cache Compression Recipe for Near-Lossless Generative Inference of LLM.

Efficiently Serving Large Multimodal Models Using EPD Disaggregation GEAR: An Efficient KV Cache Compression Recipe for Near-Lossless Generative Inference of LLM

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-11T04:29:34.728199Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-11T04:29:34.728199Z digest=sha256:f845aead4cf27a42e12f13de0418b82232cac8bda0c80c9da0c07c0bd6b3a92d

Observation 15dd31be-cc95-4cb3-ba54-d9daf26363bd · outbound

This paper cites Gonzalez, Hao Zhang, and Ion Stoica.

Efficiently Serving Large Multimodal Models Using EPD Disaggregation Gonzalez, Hao Zhang, and Ion Stoica

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-11T04:29:34.734734Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-11T04:29:34.734734Z digest=sha256:1649acbb556187f35c96d061605cbd8493f83b5e0c72f83df35d5ae132a22a9c

Observation 97a7ee87-fa7b-44fd-a5b2-3782d8931485 · outbound

This paper cites SnapKV: LLM Knows What You are Looking for Before Generation.

Efficiently Serving Large Multimodal Models Using EPD Disaggregation SnapKV: LLM Knows What You are Looking for Before Generation

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-11T04:29:34.741541Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-11T04:29:34.741541Z digest=sha256:8987bf6d3b99f33bb68734190e1362f6f53d5739b566f020bf7bb4dcaee5db39

Observation 73c28bde-86c0-41e9-9b92-df4fa936a110 · outbound

This paper cites Visual instruction tuning.

Efficiently Serving Large Multimodal Models Using EPD Disaggregation Visual instruction tuning

Reference 12

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T04:29:35.255190Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=arxiv_source observed=2026-08-11T04:29:34.747685Z digest=sha256:d6e184505399bede80f104686b5a42d595addc60bf99fa17868898bfacb6a5e0

Observation 6228cef4-4dd2-4c59-a563-b9bd40c58774 · outbound

This paper cites A Survey of Resource-efficient LLM and Multimodal Foundation Models.

Efficiently Serving Large Multimodal Models Using EPD Disaggregation A Survey of Resource-efficient LLM and Multimodal Foundation Models

Reference 13

Resolution
unresolved
no resolver link, observed 2026-08-11T04:29:34.754050Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-11T04:29:34.754050Z digest=sha256:3537bb0db0588a573b0d96017908a165a64a3cb041865836f359a6407749f35a

Observation dff5c09c-b35e-4453-a966-7649deab5b34 · outbound

This paper cites Inf-MLLM: Efficient Streaming Inference of Multimodal Large Language Models on a Single GPU.

Efficiently Serving Large Multimodal Models Using EPD Disaggregation Inf-MLLM: Efficient Streaming Inference of Multimodal Large Language Models on a Single GPU

Reference 14

Resolution
unresolved
no resolver link, observed 2026-08-11T04:29:34.761337Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-11T04:29:34.761337Z digest=sha256:1e5acfb3088702f8e6f02c4e3c69c921555922de548c7d18757a36a7fc532d76

Observation 3e71c408-6d18-48c6-b9ce-04c7d489c5c6 · outbound

This paper cites Splitwise: Efficient generative llm inference using phase splitting.

Efficiently Serving Large Multimodal Models Using EPD Disaggregation Splitwise: Efficient generative llm inference using phase splitting

Reference 15

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T04:29:35.230980Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=arxiv_source observed=2026-08-11T04:29:34.767357Z digest=sha256:74f2097e6ac0d575038f5ac64b5f4ec5a52e5e63c2c9a58ebc6da68d72e12e23

Observation 40f4ea5e-993e-4f6c-a998-6dfd33b497e4 · outbound

This paper cites Mooncake: A KVCache-centric Disaggregated Architecture for LLM Serving.

Efficiently Serving Large Multimodal Models Using EPD Disaggregation Mooncake: A KVCache-centric Disaggregated Architecture for LLM Serving

Reference 16

Resolution
unresolved
no resolver link, observed 2026-08-11T04:29:34.773621Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-11T04:29:34.773621Z digest=sha256:fc82c5708409e6eaef349c80672de61323a192550b53e50dffa06a3dc282d18e

Observation 94c49337-4b17-45cb-943c-27d8b7d00f4a · outbound

This paper cites Déjàvu: Kv-cache streaming for fast, fault-tolerant generative llm serving.

Efficiently Serving Large Multimodal Models Using EPD Disaggregation Déjàvu: Kv-cache streaming for fast, fault-tolerant generative llm serving

Reference 17

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T04:29:35.210047Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=arxiv_source observed=2026-08-11T04:29:34.780230Z digest=sha256:c1d5e52a2dff045ba8c2eeea86ede78c5419b77f164c127de1f1c396dad66826

Observation 338d2da4-22cc-4777-afe7-9b661fd0bbc2 · outbound

This paper cites Multimodal large language models: A survey.

Efficiently Serving Large Multimodal Models Using EPD Disaggregation Multimodal large language models: A survey

Reference 18

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T04:29:35.190521Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=arxiv_source observed=2026-08-11T04:29:34.787367Z digest=sha256:46bcaf70cb5c10c3e92697c8fc9d3720781b912def7fba37748135ab95d9042f

Observation fd044171-a942-48a2-b84e-255b46599e40 · outbound

This paper cites Next-qa: Next phase of question-answering to explaining temporal actions.

Efficiently Serving Large Multimodal Models Using EPD Disaggregation Next-qa: Next phase of question-answering to explaining temporal actions

Reference 19

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T04:29:35.167832Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=arxiv_source observed=2026-08-11T04:29:34.794908Z digest=sha256:916d18438fb8e9c21f3373b0ecc41fb680fa9c3f57572be08fcd740c955d261c

Observation 5e4a0f9a-7f97-42a2-893c-ebb612184070 · outbound

This paper cites MiniCPM-V: A GPT-4V Level MLLM on Your Phone.

Efficiently Serving Large Multimodal Models Using EPD Disaggregation MiniCPM-V: A GPT-4V Level MLLM on Your Phone

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-11T04:29:34.801288Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-11T04:29:34.801288Z digest=sha256:c0fe5dddac092b5b5e08b20bf4ca607084e902af8114f5db8cc011c96decd06f

Observation 67b3ed10-eb80-449a-9dbf-e10719527c3a · outbound

This paper cites Orca: A distributed serving system for Transformer-Based generative models.

Efficiently Serving Large Multimodal Models Using EPD Disaggregation Orca: A distributed serving system for Transformer-Based generative models

Reference 21

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T04:29:35.144618Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=arxiv_source observed=2026-08-11T04:29:34.807559Z digest=sha256:e1ee1bdd8b2094627fc78f6354e84ae8b75a76f22a20702e43bcb2b64ba0cbe7

Observation 22e01768-2e30-4e87-ac5c-33606952ea2c · outbound

This paper cites Distserve: Disaggregating prefill and decoding for goodput-optimized large language model serving.

Efficiently Serving Large Multimodal Models Using EPD Disaggregation Distserve: Disaggregating prefill and decoding for goodput-optimized large language model serving

Reference 22

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T04:29:35.124767Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=arxiv_source observed=2026-08-11T04:29:34.814139Z digest=sha256:f7d85992d0374331dfaad242039026a2624b49cf02d8c5341764dec8c918b4f3

Pith citing papers

Observation b31d7bd5-83c8-41cd-9bf8-4f1d994fd4cf · inbound

Taming Request Imbalance: SLO-Aware Scheduling for Disaggregated LLM Inference cites this paper.

Taming Request Imbalance: SLO-Aware Scheduling for Disaggregated LLM Inference Efficiently Serving Large Multimodal Models Using EPD Disaggregation

Reference 9

Resolution
verified exact
arxiv_id, observed 2026-05-09T06:25:46.433228Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-05-08T18:27:13.781231Z digest=sha256:be4319511528425c84559202f675712ad63af8c54cf41353584ffc12a808628b

Observation fbf9efa4-beef-43dd-a7d5-9b06a76d13ae · inbound

Taming Request Imbalance: SLO-Aware Scheduling for Disaggregated LLM Inference cites this paper.

Taming Request Imbalance: SLO-Aware Scheduling for Disaggregated LLM Inference Efficiently Serving Large Multimodal Models Using EPD Disaggregation

Reference 9

Resolution
verified exact
arxiv_id, observed 2026-07-01T00:35:10.220523Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-07-01T00:31:12.965178Z digest=sha256:16591c39eb71f10fa4baa085f2483d2460258b4abb63451774da7ea1388c5ea7

Observation 8f6663c9-ffdd-45ef-81fa-24d7aa46c2c0 · inbound

RTP-LLM: High-Performance Alibaba LLM Inference Engine cites this paper.

RTP-LLM: High-Performance Alibaba LLM Inference Engine Efficiently Serving Large Multimodal Models Using EPD Disaggregation

Reference 46

Resolution
metadata mismatch
arxiv_id, observed 2026-06-28T23:52:49.116085Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-06-28T23:52:40.763228Z digest=sha256:58df0ae1e138feeb40ba289b30b37608eed6148836af9b9b0314715e68618590

Observation 6dfd23c0-4950-4a8d-8547-2c2653179600 · inbound

M*: A Modular, Extensible, Serving System for Multimodal Models cites this paper.

M*: A Modular, Extensible, Serving System for Multimodal Models Efficiently Serving Large Multimodal Models Using EPD Disaggregation

Reference 34

Resolution
verified exact
arxiv_id, observed 2026-07-03T10:27:56.710430Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-06-27T10:01:04.153130Z digest=sha256:be0231ead413a91c9d414cb7774469f696207e75fe8ad1742f72c2d689ca83b7

Observation c9ad68a2-064b-453d-9a35-568e673923f5 · inbound

OpScale: Operator-level Provisioning and Autoscaling for LLM Serving cites this paper.

OpScale: Operator-level Provisioning and Autoscaling for LLM Serving Efficiently Serving Large Multimodal Models Using EPD Disaggregation

Reference 56

Resolution
unresolved
no resolver link, observed 2026-08-14T05:50:05.847560Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-14T05:50:05.847560Z digest=sha256:aa5a052a417b060b98dae9969303134e1dece77928db4ac2c04126e5ab5711d7