{"as_of":"2026-08-14T13:11:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d038522ff841149b8a19580353d230d0a550a111135ef02b79e07dfccf93dc90","coverage":[{"denominator":29,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":29,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T23:16:46.889804Z","state":"measured"},{"denominator":35,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":35,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":6,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":6,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-28T12:56:16.768455Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2602.14516","last_updated":"2026-07-21T08:53:51Z","snapshot_observed_at":"2026-08-09T07:31:56.117192Z","submitted_at":"2026-02-16T07:07:30Z","title":"Efficient Multi-round LLM Inference over Disaggregated Serving","version":2},"cited_work":{"arxiv_id":"2602.14516","doi":"10.48550/arxiv.2602.14516","metadata_source":"arxiv_reference","pith_arxiv_id":"2602.14516","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Efficient multi-round llm inference over disaggregated serving","venue":"Open MIND","work_id":"19d7de2c-3667-4fd5-b907-b00cd7fa5b67","year":2026},"citing_paper":{"arxiv_id":"2604.07144","last_updated":"2026-04-08T14:37:17Z","snapshot_observed_at":"2026-08-12T18:21:44.403037Z","submitted_at":"2026-04-08T14:37:17Z","title":"Autopoiesis: A Self-Evolving System Paradigm for LLM Serving Under Runtime Dynamics","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-10T17:30:40.021376Z"},"links":{"cited_paper":"/paper/2602.14516","citing_paper":"/paper/2604.07144"},"observation_digest":"sha256:2100548ae55ee42aa7c8b353ab193d185e368a647a263d8482a504c9f4048bd2","observation_id":"ff8791b6-7290-4405-9c08-178de7b687af","resolution":{"observed_at":"2026-07-22T03:22:04.971065Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.14516","last_updated":"2026-07-21T08:53:51Z","snapshot_observed_at":"2026-08-09T07:31:56.117192Z","submitted_at":"2026-02-16T07:07:30Z","title":"Efficient Multi-round LLM Inference over Disaggregated Serving","version":2},"cited_work":{"arxiv_id":"2602.14516","doi":"10.48550/arxiv.2602.14516","metadata_source":"arxiv_reference","pith_arxiv_id":"2602.14516","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Efficient multi-round llm inference over disaggregated serving","venue":"Open MIND","work_id":"19d7de2c-3667-4fd5-b907-b00cd7fa5b67","year":2026},"citing_paper":{"arxiv_id":"2604.16682","last_updated":"2026-04-17T20:39:25Z","snapshot_observed_at":"2026-08-13T14:18:37.204254Z","submitted_at":"2026-04-17T20:39:25Z","title":"KAIROS: Stateful, Context-Aware Power-Efficient Agentic Inference Serving","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-10T06:58:36.525442Z"},"links":{"cited_paper":"/paper/2602.14516","citing_paper":"/paper/2604.16682"},"observation_digest":"sha256:a54420c9e4135cebb7dbafb104f09e79dea514471a901dddfae28afa84f291ce","observation_id":"8dc64203-2e53-4cf6-8e55-7c48ed101993","resolution":{"observed_at":"2026-07-22T03:22:04.971065Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.14516","last_updated":"2026-07-21T08:53:51Z","snapshot_observed_at":"2026-08-09T07:31:56.117192Z","submitted_at":"2026-02-16T07:07:30Z","title":"Efficient Multi-round LLM Inference over Disaggregated Serving","version":2},"cited_work":{"arxiv_id":"2602.14516","doi":"10.48550/arxiv.2602.14516","metadata_source":"arxiv_reference","pith_arxiv_id":"2602.14516","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Efficient multi-round llm inference over disaggregated serving","venue":"Open MIND","work_id":"19d7de2c-3667-4fd5-b907-b00cd7fa5b67","year":2026},"citing_paper":{"arxiv_id":"2605.12555","last_updated":"2026-05-11T12:00:27Z","snapshot_observed_at":"2026-08-11T20:27:51.560121Z","submitted_at":"2026-05-11T12:00:27Z","title":"DelAC: A Multi-agent Reinforcement Learning of Team-Symmetric Stochastic Games","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-14T21:31:06.105461Z"},"links":{"cited_paper":"/paper/2602.14516","citing_paper":"/paper/2605.12555"},"observation_digest":"sha256:659fc537bbc752793c3c2b46230d49fac2c2b2dff7e928db051d286d653f85b8","observation_id":"ef758152-80f3-4f82-9375-0cd1f82e4ba4","resolution":{"observed_at":"2026-07-22T03:22:04.971065Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.14516","last_updated":"2026-07-21T08:53:51Z","snapshot_observed_at":"2026-08-09T07:31:56.117192Z","submitted_at":"2026-02-16T07:07:30Z","title":"Efficient Multi-round LLM Inference over Disaggregated Serving","version":2},"cited_work":{"arxiv_id":"2602.14516","doi":"10.48550/arxiv.2602.14516","metadata_source":"arxiv_reference","pith_arxiv_id":"2602.14516","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Efficient multi-round llm inference over disaggregated serving","venue":"Open MIND","work_id":"19d7de2c-3667-4fd5-b907-b00cd7fa5b67","year":2026},"citing_paper":{"arxiv_id":"2605.16637","last_updated":"2026-05-15T21:09:34Z","snapshot_observed_at":"2026-08-13T21:38:02.004754Z","submitted_at":"2026-05-15T21:09:34Z","title":"HexAGenT: Efficient Agentic LLM Serving via Workflow- and Heterogeneity-Aware Scheduling","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-19T20:58:51.630574Z"},"links":{"cited_paper":"/paper/2602.14516","citing_paper":"/paper/2605.16637"},"observation_digest":"sha256:1641c7e777ec85df1cb0741f282c58dd17cedef63d611a35138736efd99a1b8c","observation_id":"1511e2c0-23f1-439f-a641-fe8537a205ea","resolution":{"observed_at":"2026-07-22T03:22:04.971065Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.14516","last_updated":"2026-07-21T08:53:51Z","snapshot_observed_at":"2026-08-09T07:31:56.117192Z","submitted_at":"2026-02-16T07:07:30Z","title":"Efficient Multi-round LLM Inference over Disaggregated Serving","version":2},"cited_work":{"arxiv_id":"2602.14516","doi":"10.48550/arxiv.2602.14516","metadata_source":"arxiv_reference","pith_arxiv_id":"2602.14516","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Efficient multi-round llm inference over disaggregated serving","venue":"Open MIND","work_id":"19d7de2c-3667-4fd5-b907-b00cd7fa5b67","year":2026},"citing_paper":{"arxiv_id":"2606.01839","last_updated":"2026-06-01T07:51:09Z","snapshot_observed_at":"2026-07-06T23:42:21.252086Z","submitted_at":"2026-06-01T07:51:09Z","title":"Observation, Not Prediction: Conversation-Level Disaggregated Scheduling for Agentic Serving","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-06-28T12:56:16.768455Z"},"links":{"cited_paper":"/paper/2602.14516","citing_paper":"/paper/2606.01839"},"observation_digest":"sha256:d3abd475f5519b1e17d6b1a29e1cd22da7fe7875a021c6e576a5fce4c9d3ad45","observation_id":"8fe073dd-c74d-4740-bbf3-975126a37bb9","resolution":{"observed_at":"2026-07-22T03:22:04.971065Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.14516","last_updated":"2026-07-21T08:53:51Z","snapshot_observed_at":"2026-08-09T07:31:56.117192Z","submitted_at":"2026-02-16T07:07:30Z","title":"Efficient Multi-round LLM Inference over Disaggregated Serving","version":2},"cited_work":{"arxiv_id":"2602.14516","doi":"10.48550/arxiv.2602.14516","metadata_source":"arxiv_reference","pith_arxiv_id":"2602.14516","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Efficient multi-round llm inference over disaggregated serving","venue":"Open MIND","work_id":"19d7de2c-3667-4fd5-b907-b00cd7fa5b67","year":2026},"citing_paper":{"arxiv_id":"2606.19271","last_updated":"2026-06-17T16:48:36Z","snapshot_observed_at":"2026-08-05T21:43:31.886249Z","submitted_at":"2026-06-17T16:48:36Z","title":"TurboServe: Serving Streaming Video Generation Efficiently and Economically","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-26T19:23:10.356881Z"},"links":{"cited_paper":"/paper/2602.14516","citing_paper":"/paper/2606.19271"},"observation_digest":"sha256:a2c597a2bf4691ae12f5da7e4f99834052aa8c3d961802b2cd6a14710d055e2f","observation_id":"a7b292d0-99e6-45bb-8ab1-78b1769ba6d2","resolution":{"observed_at":"2026-07-22T03:22:04.971065Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2602.14516/citation-record","integrity":"/paper/2602.14516/integrity","json":"/paper/2602.14516/citation-record.json","paper":"/paper/2602.14516"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T23:16:44.025728Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.14516","last_updated":"2026-07-21T08:53:51Z","snapshot_observed_at":"2026-08-09T07:31:56.117192Z","submitted_at":"2026-02-16T07:07:30Z","title":"Efficient Multi-round LLM Inference over Disaggregated Serving","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-02T23:16:44.025728Z"},"links":{"citing_paper":"/paper/2602.14516"},"observation_digest":"sha256:c5204d005c2772a924dbb196dfbdb15a65aa31762db1974192256895814b8d11","observation_id":"555b6bfa-4922-4902-9880-e8402f78d693","resolution":{"observed_at":"2026-08-02T23:16:44.025728Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T23:16:44.082617Z","title":"Hydrainfer: Hybrid disaggregated scheduling for multimodal large language model serving.arXiv preprint arXiv:2505.12658,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.14516","last_updated":"2026-07-21T08:53:51Z","snapshot_observed_at":"2026-08-09T07:31:56.117192Z","submitted_at":"2026-02-16T07:07:30Z","title":"Efficient Multi-round LLM Inference over Disaggregated Serving","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-02T23:16:44.082617Z"},"links":{"citing_paper":"/paper/2602.14516"},"observation_digest":"sha256:3dc6afa57f8a9f2031e237b15d82f0275f35e7dae9a4599be42293eac69d91a3","observation_id":"d8783764-882b-4d78-b67e-3005a4749d0a","resolution":{"observed_at":"2026-08-02T23:16:44.082617Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.07714","last_updated":"2025-03-05T07:39:03Z","snapshot_observed_at":"2026-08-13T04:59:08.554752Z","submitted_at":"2024-03-12T14:57:40Z","title":"StableToolBench: Towards Stable Large-Scale Benchmarking on Tool Learning of Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.07714","snapshot_observed_at":"2026-08-02T23:16:44.239465Z","title":"Stabletoolbench: Towards stable large-scale benchmarking on tool learning of large lan- guage models.arXiv preprint arXiv:2403.07714,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.14516","last_updated":"2026-07-21T08:53:51Z","snapshot_observed_at":"2026-08-09T07:31:56.117192Z","submitted_at":"2026-02-16T07:07:30Z","title":"Efficient Multi-round LLM Inference over Disaggregated Serving","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-02T23:16:44.239465Z"},"links":{"cited_paper":"/paper/2403.07714","citing_paper":"/paper/2602.14516"},"observation_digest":"sha256:d616ff56242e7d87f3c34063d05568eafab65c0ec6f29dbd2fc5a72bd6ccf9a8","observation_id":"17d9d2fd-8810-4899-9066-72b2c9535641","resolution":{"observed_at":"2026-08-02T23:16:44.239465Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.09516","last_updated":"2025-08-05T19:08:38Z","snapshot_observed_at":"2026-07-06T20:51:28.022519Z","submitted_at":"2025-03-12T16:26:39Z","title":"Search-R1: Training LLMs to Reason and Leverage Search Engines with Reinforcement Learning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.09516","snapshot_observed_at":"2026-08-02T23:16:44.511270Z","title":"Thunderserve: High-performance and cost-efficient llm serving in cloud environments","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.14516","last_updated":"2026-07-21T08:53:51Z","snapshot_observed_at":"2026-08-09T07:31:56.117192Z","submitted_at":"2026-02-16T07:07:30Z","title":"Efficient Multi-round LLM Inference over Disaggregated Serving","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-02T23:16:44.511270Z"},"links":{"cited_paper":"/paper/2503.09516","citing_paper":"/paper/2602.14516"},"observation_digest":"sha256:343608540528dfd2be2c6e12cb2dfbb54f895000dde068f41cfd5055289747f1","observation_id":"f49d73c5-7804-4ea5-9e81-6b070a96660b","resolution":{"observed_at":"2026-08-02T23:16:44.511270Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.02230","last_updated":"2026-05-25T23:34:23Z","snapshot_observed_at":"2026-08-04T00:19:14.332924Z","submitted_at":"2025-11-04T03:43:05Z","title":"Continuum: Efficient and Robust Multi-Turn LLM Agent Scheduling with KV Cache Time-to-Live","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.02230","snapshot_observed_at":"2026-08-02T23:16:44.857124Z","title":"Continuum: Efficient and robust multi-turn llm agent scheduling with kv cache time-to-live.arXiv preprint arXiv:2511.02230,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.14516","last_updated":"2026-07-21T08:53:51Z","snapshot_observed_at":"2026-08-09T07:31:56.117192Z","submitted_at":"2026-02-16T07:07:30Z","title":"Efficient Multi-round LLM Inference over Disaggregated Serving","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-02T23:16:44.857124Z"},"links":{"cited_paper":"/paper/2511.02230","citing_paper":"/paper/2602.14516"},"observation_digest":"sha256:2f7128ac42769c82b6f95fb06a960c99f4cd88ba31b1818f6acfdf4543be37bb","observation_id":"d08313a1-b71c-4a19-8226-7c359e030f00","resolution":{"observed_at":"2026-08-02T23:16:44.857124Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-08-11T01:48:59.557045Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-02T23:16:44.971359Z","title":"Deepseek-v3 technical report.arXiv preprint arXiv:2412.19437,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.14516","last_updated":"2026-07-21T08:53:51Z","snapshot_observed_at":"2026-08-09T07:31:56.117192Z","submitted_at":"2026-02-16T07:07:30Z","title":"Efficient Multi-round LLM Inference over Disaggregated Serving","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-02T23:16:44.971359Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2602.14516"},"observation_digest":"sha256:1d551ce6767d4924c1c72287af3360677d92c066ac0d459a896578535f03575e","observation_id":"a4f233bb-a4d3-4a61-8f4a-cb42ccd4d76c","resolution":{"observed_at":"2026-08-02T23:16:44.971359Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.07842","last_updated":"2023-02-15T18:25:52Z","snapshot_observed_at":"2026-07-30T02:11:00.198428Z","submitted_at":"2023-02-15T18:25:52Z","title":"Augmented Language Models: a Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.07842","snapshot_observed_at":"2026-08-02T23:16:45.064125Z","title":"Augmented language mod- els: a survey.arXiv preprint arXiv:2302.07842,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.14516","last_updated":"2026-07-21T08:53:51Z","snapshot_observed_at":"2026-08-09T07:31:56.117192Z","submitted_at":"2026-02-16T07:07:30Z","title":"Efficient Multi-round LLM Inference over Disaggregated Serving","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-02T23:16:45.064125Z"},"links":{"cited_paper":"/paper/2302.07842","citing_paper":"/paper/2602.14516"},"observation_digest":"sha256:8f4de337f6ba25e5dc8cbd701317e415076bbc48ab2a098318dc6d8ebb19438e","observation_id":"3286a50a-54a8-4563-87bc-10b768a09779","resolution":{"observed_at":"2026-08-02T23:16:45.064125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T23:16:45.124383Z","title":"Gaia: a benchmark for general ai assistants","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.14516","last_updated":"2026-07-21T08:53:51Z","snapshot_observed_at":"2026-08-09T07:31:56.117192Z","submitted_at":"2026-02-16T07:07:30Z","title":"Efficient Multi-round LLM Inference over Disaggregated Serving","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-02T23:16:45.124383Z"},"links":{"citing_paper":"/paper/2602.14516"},"observation_digest":"sha256:2829a064d5db7f51e6365738eb575dca772b0dce900c5c8a3cdea47e0fa2aff4","observation_id":"9beb1252-5373-4c29-a425-ef6ab4d18e37","resolution":{"observed_at":"2026-08-02T23:16:45.124383Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T23:16:45.256552Z","title":"Nvidia dynamo documentation: Kv router","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.14516","last_updated":"2026-07-21T08:53:51Z","snapshot_observed_at":"2026-08-09T07:31:56.117192Z","submitted_at":"2026-02-16T07:07:30Z","title":"Efficient Multi-round LLM Inference over Disaggregated Serving","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-02T23:16:45.256552Z"},"links":{"citing_paper":"/paper/2602.14516"},"observation_digest":"sha256:711d30a9e3da66279ca3041e2f2580bf4aff25b3a06cde756f651c385927fc81","observation_id":"3b11e7e9-3526-48e5-a686-5cf746fc7b81","resolution":{"observed_at":"2026-08-02T23:16:45.256552Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T23:16:45.361663Z","title":"Splitwise: Efficient generative llm inference using phase splitting","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.14516","last_updated":"2026-07-21T08:53:51Z","snapshot_observed_at":"2026-08-09T07:31:56.117192Z","submitted_at":"2026-02-16T07:07:30Z","title":"Efficient Multi-round LLM Inference over Disaggregated Serving","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-02T23:16:45.361663Z"},"links":{"citing_paper":"/paper/2602.14516"},"observation_digest":"sha256:64044b9fd094e060ebe1e7777fae387b89d2a4d61497861d114258dbdef81019","observation_id":"8d67bad8-cc56-4a4c-bbf2-d3352db4b33e","resolution":{"observed_at":"2026-08-02T23:16:45.361663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T23:16:45.486415Z","title":"Fast inference for augmented large lan- guage models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.14516","last_updated":"2026-07-21T08:53:51Z","snapshot_observed_at":"2026-08-09T07:31:56.117192Z","submitted_at":"2026-02-16T07:07:30Z","title":"Efficient Multi-round LLM Inference over Disaggregated Serving","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-02T23:16:45.486415Z"},"links":{"citing_paper":"/paper/2602.14516"},"observation_digest":"sha256:c3a67febf3aa6c0b7e7d984815e5c837a8e148bc6d1eb2f6002a2edee7f91a74","observation_id":"35fcc53c-6442-42f1-a182-be498968b2f2","resolution":{"observed_at":"2026-08-02T23:16:45.486415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.15294","last_updated":"2023-10-23T09:58:13Z","snapshot_observed_at":"2026-08-13T11:34:17.087587Z","submitted_at":"2023-05-24T16:17:36Z","title":"Enhancing Retrieval-Augmented Large Language Models with Iterative Retrieval-Generation Synergy","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.15294","snapshot_observed_at":"2026-08-02T23:16:45.704349Z","title":"Enhancing retrieval-augmented large language models with iterative retrieval-generation synergy.arXiv preprint arXiv:2305.15294,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.14516","last_updated":"2026-07-21T08:53:51Z","snapshot_observed_at":"2026-08-09T07:31:56.117192Z","submitted_at":"2026-02-16T07:07:30Z","title":"Efficient Multi-round LLM Inference over Disaggregated Serving","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-02T23:16:45.704349Z"},"links":{"cited_paper":"/paper/2305.15294","citing_paper":"/paper/2602.14516"},"observation_digest":"sha256:45582d0964bc2ca89440fd0bf5b827057c0df3d8015734b3906f14de44300cea","observation_id":"2e335f2c-d89c-4958-8848-4d519209050a","resolution":{"observed_at":"2026-08-02T23:16:45.704349Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.08053","last_updated":"2020-03-13T23:45:18Z","snapshot_observed_at":"2026-08-12T10:50:46.357243Z","submitted_at":"2019-09-17T19:42:54Z","title":"Megatron-LM: Training Multi-Billion Parameter Language Models Using Model Parallelism","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.08053","snapshot_observed_at":"2026-08-02T23:16:45.823877Z","title":"Megatron-lm: Training multi- billion parameter language models using model paral- lelism.arXiv preprint arXiv:1909.08053,","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2602.14516","last_updated":"2026-07-21T08:53:51Z","snapshot_observed_at":"2026-08-09T07:31:56.117192Z","submitted_at":"2026-02-16T07:07:30Z","title":"Efficient Multi-round LLM Inference over Disaggregated Serving","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-02T23:16:45.823877Z"},"links":{"cited_paper":"/paper/1909.08053","citing_paper":"/paper/2602.14516"},"observation_digest":"sha256:c217778990f65bea54ffffcc7aa61a22fc9cc2bf21d64fa16632be9079518a41","observation_id":"48212ac5-9595-48bf-8a43-e0470ab94bfe","resolution":{"observed_at":"2026-08-02T23:16:45.823877Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T23:16:46.045201Z","title":"N., Kaiser, Ł., and Polosukhin, I","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2602.14516","last_updated":"2026-07-21T08:53:51Z","snapshot_observed_at":"2026-08-09T07:31:56.117192Z","submitted_at":"2026-02-16T07:07:30Z","title":"Efficient Multi-round LLM Inference over Disaggregated Serving","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-02T23:16:46.045201Z"},"links":{"citing_paper":"/paper/2602.14516"},"observation_digest":"sha256:74cb6ac8fe5f9277b8d8e341c97f5ae39acaacfb46979a7933ef8761dde5aafc","observation_id":"7922afca-e345-4fbe-9aa3-90b613a355d7","resolution":{"observed_at":"2026-08-02T23:16:46.045201Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-02T23:16:46.327419Z","title":"Qwen3 technical report.arXiv preprint arXiv:2505.09388,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.14516","last_updated":"2026-07-21T08:53:51Z","snapshot_observed_at":"2026-08-09T07:31:56.117192Z","submitted_at":"2026-02-16T07:07:30Z","title":"Efficient Multi-round LLM Inference over Disaggregated Serving","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-02T23:16:46.327419Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2602.14516"},"observation_digest":"sha256:9e2601a136a90a4c1d6a110f72dfe16c0c689a33476775777dd44674a6f9345d","observation_id":"cfc5ffd0-586f-437b-aba6-1d3e925c3830","resolution":{"observed_at":"2026-08-02T23:16:46.327419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T23:16:46.447356Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2602.14516","last_updated":"2026-07-21T08:53:51Z","snapshot_observed_at":"2026-08-09T07:31:56.117192Z","submitted_at":"2026-02-16T07:07:30Z","title":"Efficient Multi-round LLM Inference over Disaggregated Serving","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-02T23:16:46.447356Z"},"links":{"citing_paper":"/paper/2602.14516"},"observation_digest":"sha256:9503b204f130711ac7a338cdcc2ce33314836a84ae105e1037a4723808fd8906","observation_id":"3014c50a-7f7f-40ba-80ae-9ce98c722302","resolution":{"observed_at":"2026-08-02T23:16:46.447356Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T23:16:46.561275Z","title":"R., and Cao, Y","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.14516","last_updated":"2026-07-21T08:53:51Z","snapshot_observed_at":"2026-08-09T07:31:56.117192Z","submitted_at":"2026-02-16T07:07:30Z","title":"Efficient Multi-round LLM Inference over Disaggregated Serving","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-02T23:16:46.561275Z"},"links":{"citing_paper":"/paper/2602.14516"},"observation_digest":"sha256:d63268b32641738e3968d28cd78b065e976fb2b968b96876de66976e2bfcb69d","observation_id":"12a3dd87-6f0e-4bf7-b355-460bd5f095a2","resolution":{"observed_at":"2026-08-02T23:16:46.561275Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.15601","last_updated":"2026-05-15T15:18:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-21T14:24:52Z","title":"LMDeploy Accelerates Mixed-Precision LLM Inference with TurboMind","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.15601","snapshot_observed_at":"2026-08-02T23:16:46.765490Z","title":"Blitzscale: Fast and live large model autoscaling with o(1) host caching","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.14516","last_updated":"2026-07-21T08:53:51Z","snapshot_observed_at":"2026-08-09T07:31:56.117192Z","submitted_at":"2026-02-16T07:07:30Z","title":"Efficient Multi-round LLM Inference over Disaggregated Serving","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-02T23:16:46.765490Z"},"links":{"cited_paper":"/paper/2508.15601","citing_paper":"/paper/2602.14516"},"observation_digest":"sha256:cd5fe2ca997119fef5e0c0d5c7f444ebc5fd3b2cb36dfce89ee3acf3cc4e477d","observation_id":"cef83b54-dfa1-4400-9015-6fffa96b8af5","resolution":{"observed_at":"2026-08-02T23:16:46.765490Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T23:16:46.842880Z","title":"More Details about Offline Planning A.1","venue":null,"work_id":null,"year":1991},"citing_paper":{"arxiv_id":"2602.14516","last_updated":"2026-07-21T08:53:51Z","snapshot_observed_at":"2026-08-09T07:31:56.117192Z","submitted_at":"2026-02-16T07:07:30Z","title":"Efficient Multi-round LLM Inference over Disaggregated Serving","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-02T23:16:46.842880Z"},"links":{"citing_paper":"/paper/2602.14516"},"observation_digest":"sha256:f04856c53be939d93f9e2881bc0ec33a4293d0c4358a85401b8959c82cc53d3f","observation_id":"4a758c01-6db5-4171-942d-213606ed8ca3","resolution":{"observed_at":"2026-08-02T23:16:46.842880Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T23:16:46.889804Z","title":"More experimental results","venue":null,"work_id":null,"year":2000},"citing_paper":{"arxiv_id":"2602.14516","last_updated":"2026-07-21T08:53:51Z","snapshot_observed_at":"2026-08-09T07:31:56.117192Z","submitted_at":"2026-02-16T07:07:30Z","title":"Efficient Multi-round LLM Inference over Disaggregated Serving","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-02T23:16:46.889804Z"},"links":{"citing_paper":"/paper/2602.14516"},"observation_digest":"sha256:115076c9886d480e60774a262d26715920def49348feae4d92345759ae34ce9d","observation_id":"f34115de-a571-441f-a92f-d07ae8ed1b5d","resolution":{"observed_at":"2026-08-02T23:16:46.889804Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T23:16:44.631418Z","title":"H., Gonzalez, J., Zhang, H., and Stoica, I","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.14516","last_updated":"2026-07-21T08:53:51Z","snapshot_observed_at":"2026-08-09T07:31:56.117192Z","submitted_at":"2026-02-16T07:07:30Z","title":"Efficient Multi-round LLM Inference over Disaggregated Serving","version":2},"reference_index":1991,"source":"pdf_text","source_observed_at":"2026-08-02T23:16:44.631418Z"},"links":{"citing_paper":"/paper/2602.14516"},"observation_digest":"sha256:a657929f8772264d9faa88f3b2403175ac27f8e0556a15ee01f06c73456fb3ad","observation_id":"58273f0e-8fda-42c8-9cf4-085507b6335d","resolution":{"observed_at":"2026-08-02T23:16:44.631418Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.11181","last_updated":"2024-01-20T09:43:36Z","snapshot_observed_at":"2026-08-13T09:16:06.205073Z","submitted_at":"2024-01-20T09:43:36Z","title":"Inference without Interference: Disaggregate LLM Inference for Mixed Downstream Workloads","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.11181","snapshot_observed_at":"2026-08-02T23:16:44.283021Z","title":"Inference without interference: Disaggregate llm inference for mixed down- stream workloads.arXiv preprint arXiv:2401.11181,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.14516","last_updated":"2026-07-21T08:53:51Z","snapshot_observed_at":"2026-08-09T07:31:56.117192Z","submitted_at":"2026-02-16T07:07:30Z","title":"Efficient Multi-round LLM Inference over Disaggregated Serving","version":2},"reference_index":1994,"source":"pdf_text","source_observed_at":"2026-08-02T23:16:44.283021Z"},"links":{"cited_paper":"/paper/2401.11181","citing_paper":"/paper/2602.14516"},"observation_digest":"sha256:7db0ddd87667a52ffb8c13acbb4c9043c041f1ca9dee9ea7aa893fdf6f0ee035","observation_id":"d20fdeaf-85f2-4752-af64-7f07217c58e6","resolution":{"observed_at":"2026-08-02T23:16:44.283021Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2512.04013","last_updated":"2026-07-10T15:00:48Z","snapshot_observed_at":"2026-08-08T06:32:13.288719Z","submitted_at":"2025-12-03T17:49:38Z","title":"AugServe: Adaptive Request Scheduling for Augmented Large Language Model Inference Serving","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.04013","snapshot_observed_at":"2026-08-02T23:16:46.161659Z","title":"Augserve: Adaptive request scheduling for augmented large language model inference serving.arXiv preprint arXiv:2512.04013,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.14516","last_updated":"2026-07-21T08:53:51Z","snapshot_observed_at":"2026-08-09T07:31:56.117192Z","submitted_at":"2026-02-16T07:07:30Z","title":"Efficient Multi-round LLM Inference over Disaggregated Serving","version":2},"reference_index":2015,"source":"pdf_text","source_observed_at":"2026-08-02T23:16:46.161659Z"},"links":{"cited_paper":"/paper/2512.04013","citing_paper":"/paper/2602.14516"},"observation_digest":"sha256:5eec24bba588952fc3611394ce4c6cd2cc285a7b896c5a3ecbde942effa0b544","observation_id":"d157a2be-c120-415b-95a0-a02d4a444cc1","resolution":{"observed_at":"2026-08-02T23:16:46.161659Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.04088","last_updated":"2024-01-08T18:47:34Z","snapshot_observed_at":"2026-08-13T19:43:49.936776Z","submitted_at":"2024-01-08T18:47:34Z","title":"Mixtral of Experts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.04088","snapshot_observed_at":"2026-08-02T23:16:44.393382Z","title":"Q., Sablayrolles, A., Roux, A., Mensch, A., Savary, B., Bamford, C., Chaplot, D","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.14516","last_updated":"2026-07-21T08:53:51Z","snapshot_observed_at":"2026-08-09T07:31:56.117192Z","submitted_at":"2026-02-16T07:07:30Z","title":"Efficient Multi-round LLM Inference over Disaggregated Serving","version":2},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-02T23:16:44.393382Z"},"links":{"cited_paper":"/paper/2401.04088","citing_paper":"/paper/2602.14516"},"observation_digest":"sha256:470d0a866d78d63050585782c0727e2b159fb5ab4a106d5e2c95947a6ca1624a","observation_id":"c936e470-ab9d-4087-be4b-45c65b411738","resolution":{"observed_at":"2026-08-02T23:16:44.393382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T23:16:45.952855Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.14516","last_updated":"2026-07-21T08:53:51Z","snapshot_observed_at":"2026-08-09T07:31:56.117192Z","submitted_at":"2026-02-16T07:07:30Z","title":"Efficient Multi-round LLM Inference over Disaggregated Serving","version":2},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-02T23:16:45.952855Z"},"links":{"citing_paper":"/paper/2602.14516"},"observation_digest":"sha256:e5e66f1b7931e74eaea743332e08688f12145d4191be410954fc6718af21cb2c","observation_id":"3b891953-6f2e-4a5a-a8da-ad5283f6a874","resolution":{"observed_at":"2026-08-02T23:16:45.952855Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.04343","last_updated":"2025-03-02T19:44:37Z","snapshot_observed_at":"2026-08-14T09:51:36.459690Z","submitted_at":"2024-10-06T03:42:15Z","title":"Inference Scaling for Long-Context Retrieval Augmented Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.04343","snapshot_observed_at":"2026-08-02T23:16:46.676879Z","title":"Inference scaling for long-context retrieval augmented generation.arXiv preprint arXiv:2410.04343,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.14516","last_updated":"2026-07-21T08:53:51Z","snapshot_observed_at":"2026-08-09T07:31:56.117192Z","submitted_at":"2026-02-16T07:07:30Z","title":"Efficient Multi-round LLM Inference over Disaggregated Serving","version":2},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-02T23:16:46.676879Z"},"links":{"cited_paper":"/paper/2410.04343","citing_paper":"/paper/2602.14516"},"observation_digest":"sha256:c2ce21724e04dfba63447fd43709e958c738166ff2a7ba262e437c2f16b60162","observation_id":"019801e1-5b70-41dd-87ac-34b7899ae808","resolution":{"observed_at":"2026-08-02T23:16:46.676879Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T23:16:44.747173Z","title":"Tokenscale: Timely and accurate autoscaling for disaggregated llm serving with token velocity.arXiv preprint arXiv:2512.03416,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.14516","last_updated":"2026-07-21T08:53:51Z","snapshot_observed_at":"2026-08-09T07:31:56.117192Z","submitted_at":"2026-02-16T07:07:30Z","title":"Efficient Multi-round LLM Inference over Disaggregated Serving","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-02T23:16:44.747173Z"},"links":{"citing_paper":"/paper/2602.14516"},"observation_digest":"sha256:c03ec8161ed4ec7aded26cb7ab35e7b97d182338a8af96458f7fa15b31a1b701","observation_id":"fb4cc8f0-0779-45b1-af60-9f0a249f39a3","resolution":{"observed_at":"2026-08-02T23:16:44.747173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17702","last_updated":"2024-11-22T10:34:25Z","snapshot_observed_at":"2026-08-13T04:08:54.971331Z","submitted_at":"2024-02-27T17:27:47Z","title":"The SCIP Optimization Suite 9.0","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.17702","snapshot_observed_at":"2026-08-02T23:16:43.933864Z","title":"The scip optimiza- tion suite 9.0.arXiv preprint arXiv:2402.17702,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.14516","last_updated":"2026-07-21T08:53:51Z","snapshot_observed_at":"2026-08-09T07:31:56.117192Z","submitted_at":"2026-02-16T07:07:30Z","title":"Efficient Multi-round LLM Inference over Disaggregated Serving","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-02T23:16:43.933864Z"},"links":{"cited_paper":"/paper/2402.17702","citing_paper":"/paper/2602.14516"},"observation_digest":"sha256:4784d45b8b3ea0ccbdf717a90e45b4b7c199d3be4a31009d5627dde56856f8b1","observation_id":"3a04a370-a51b-4fbc-8faf-556e64023072","resolution":{"observed_at":"2026-08-02T23:16:43.933864Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-02T23:16:44.157699Z","title":"The llama 3 herd of models.arXiv preprint arXiv:2407.21783,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.14516","last_updated":"2026-07-21T08:53:51Z","snapshot_observed_at":"2026-08-09T07:31:56.117192Z","submitted_at":"2026-02-16T07:07:30Z","title":"Efficient Multi-round LLM Inference over Disaggregated Serving","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-02T23:16:44.157699Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2602.14516"},"observation_digest":"sha256:1c99a880e5d17ba23b94fe1269a43ddc7fb26adf3741eceed04c99b58568ced9","observation_id":"b5a6dc06-2d54-42b9-9b24-8a4969c84d56","resolution":{"observed_at":"2026-08-02T23:16:44.157699Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2602.14516","last_updated":"2026-07-21T08:53:51Z","latest_version":2,"primary_category":"cs.DC","snapshot_observed_at":"2026-08-09T07:31:56.117192Z","submitted_at":"2026-02-16T07:07:30Z","title":"Efficient Multi-round LLM Inference over Disaggregated Serving"},"reference_resolution":{"displayed":29,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":29,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":29},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 29 of 29 outbound references and 6 inbound Pith citation observations for arXiv:2602.14516."}