{"as_of":"2026-08-10T20:32:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:149c9d025c8c3feb2adafd65703d6d57ccc2e4019573078cb8737584777b460d","coverage":[{"denominator":59,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":59,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T14:08:03.850772Z","state":"measured"},{"denominator":59,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":59,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.18253/citation-record","integrity":"/paper/2607.18253/integrity","json":"/paper/2607.18253/citation-record.json","paper":"/paper/2607.18253"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T14:07:57.586536Z","title":"Gulavani, Ramachan- dran Ramjee, and Alexey Tumanov","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.18253","last_updated":"2026-05-13T20:29:09Z","snapshot_observed_at":"2026-08-08T22:52:01.648545Z","submitted_at":"2026-05-13T20:29:09Z","title":"Beyond Accuracy and Cost: Latency-Aware LLM Query Routing for Dynamic Workloads","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-02T14:07:57.586536Z"},"links":{"citing_paper":"/paper/2607.18253"},"observation_digest":"sha256:4236fecacf9cf0710c5b3e69dee7a18b062624a5ffeb04f3e8b530d543360984","observation_id":"94c272d0-7507-4284-b9b4-a1a0799f5355","resolution":{"observed_at":"2026-08-02T14:07:57.586536Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T14:07:57.664635Z","title":"Gulavani, Alexey Tumanov, and Ramachandran Ramjee","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.18253","last_updated":"2026-05-13T20:29:09Z","snapshot_observed_at":"2026-08-08T22:52:01.648545Z","submitted_at":"2026-05-13T20:29:09Z","title":"Beyond Accuracy and Cost: Latency-Aware LLM Query Routing for Dynamic Workloads","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-02T14:07:57.664635Z"},"links":{"citing_paper":"/paper/2607.18253"},"observation_digest":"sha256:e3eaaa6dbc6a93f10f6943ca88037f874bd183dbb36cd5880627685c7fa97e7c","observation_id":"9d553330-0b46-45dc-ae72-9ee05ce21503","resolution":{"observed_at":"2026-08-02T14:07:57.664635Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T14:07:57.765184Z","title":"Alibaba cloud model studio: Model invocation pricing, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.18253","last_updated":"2026-05-13T20:29:09Z","snapshot_observed_at":"2026-08-08T22:52:01.648545Z","submitted_at":"2026-05-13T20:29:09Z","title":"Beyond Accuracy and Cost: Latency-Aware LLM Query Routing for Dynamic Workloads","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-02T14:07:57.765184Z"},"links":{"citing_paper":"/paper/2607.18253"},"observation_digest":"sha256:96d5b3d997ec1c3edeb1e74ac6a9c50cd3193a8d99965ac108612428e8cbcccf","observation_id":"e50a210a-996c-4ce1-a368-50be045c6bfd","resolution":{"observed_at":"2026-08-02T14:07:57.765184Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T14:07:57.847003Z","title":"Federate the router: Learning language model routers with sparse and decentralized evaluations, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.18253","last_updated":"2026-05-13T20:29:09Z","snapshot_observed_at":"2026-08-08T22:52:01.648545Z","submitted_at":"2026-05-13T20:29:09Z","title":"Beyond Accuracy and Cost: Latency-Aware LLM Query Routing for Dynamic Workloads","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-02T14:07:57.847003Z"},"links":{"citing_paper":"/paper/2607.18253"},"observation_digest":"sha256:53297b196ce742febedd5900d376dccc9843ef0e38b29cba547398f9848a3016","observation_id":"1988d571-12fe-4f7b-ab32-c461e4bb4995","resolution":{"observed_at":"2026-08-02T14:07:57.847003Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T14:07:58.016742Z","title":"Optimal scheduling algorithms for llm inference: Theory and practice.Proc","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18253","last_updated":"2026-05-13T20:29:09Z","snapshot_observed_at":"2026-08-08T22:52:01.648545Z","submitted_at":"2026-05-13T20:29:09Z","title":"Beyond Accuracy and Cost: Latency-Aware LLM Query Routing for Dynamic Workloads","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-02T14:07:58.016742Z"},"links":{"citing_paper":"/paper/2607.18253"},"observation_digest":"sha256:b0f036ce0df3fac5677b7475504cdf06c54913c4d3f4671d03b9c4a8de1fccbe","observation_id":"9eb0e72a-3a9d-4516-ab25-f964eaa85f0f","resolution":{"observed_at":"2026-08-02T14:07:58.016742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T14:07:58.127113Z","title":"Boerner, Stephen Deems, Thomas R","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.18253","last_updated":"2026-05-13T20:29:09Z","snapshot_observed_at":"2026-08-08T22:52:01.648545Z","submitted_at":"2026-05-13T20:29:09Z","title":"Beyond Accuracy and Cost: Latency-Aware LLM Query Routing for Dynamic Workloads","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-02T14:07:58.127113Z"},"links":{"citing_paper":"/paper/2607.18253"},"observation_digest":"sha256:f29d142958a2c415886e69267a636d4d55a89b66bb3c192e9f7c13dce72665e9","observation_id":"2882e4c1-6b2d-4506-a53c-8b8f629b6bf4","resolution":{"observed_at":"2026-08-02T14:07:58.127113Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T14:07:58.214930Z","title":"Learning compact representations of llm abilities via item response theory, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18253","last_updated":"2026-05-13T20:29:09Z","snapshot_observed_at":"2026-08-08T22:52:01.648545Z","submitted_at":"2026-05-13T20:29:09Z","title":"Beyond Accuracy and Cost: Latency-Aware LLM Query Routing for Dynamic Workloads","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-02T14:07:58.214930Z"},"links":{"citing_paper":"/paper/2607.18253"},"observation_digest":"sha256:3181a8f2b6c64c6adf9a0f3de5a4128f1ebc6d5126994f2f25f03aecbcf359be","observation_id":"67cb3181-0b62-4b1a-a1b9-ac0a076d55d0","resolution":{"observed_at":"2026-08-02T14:07:58.214930Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T14:07:58.301940Z","title":"Frugalgpt: How to use large language models while reducing cost and improving performance.Transactions on Machine Learning Research, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.18253","last_updated":"2026-05-13T20:29:09Z","snapshot_observed_at":"2026-08-08T22:52:01.648545Z","submitted_at":"2026-05-13T20:29:09Z","title":"Beyond Accuracy and Cost: Latency-Aware LLM Query Routing for Dynamic Workloads","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-02T14:07:58.301940Z"},"links":{"citing_paper":"/paper/2607.18253"},"observation_digest":"sha256:6aa6e186504eacf81afd29f2b5a9f9f3220c81be01cdb5bb99e509f5186a5db9","observation_id":"337d635a-df40-4270-a9dc-06f8fabde3ef","resolution":{"observed_at":"2026-08-02T14:07:58.301940Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.03611","last_updated":"2025-08-13T17:17:46Z","snapshot_observed_at":"2026-08-06T15:38:57.571219Z","submitted_at":"2025-08-05T16:27:10Z","title":"Block: Balancing Load in LLM Serving with Context, Knowledge and Predictive Scheduling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.03611","snapshot_observed_at":"2026-08-02T14:07:58.436874Z","title":"Block: Balancing load in llm serving with context, knowledge and predictive scheduling, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18253","last_updated":"2026-05-13T20:29:09Z","snapshot_observed_at":"2026-08-08T22:52:01.648545Z","submitted_at":"2026-05-13T20:29:09Z","title":"Beyond Accuracy and Cost: Latency-Aware LLM Query Routing for Dynamic Workloads","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-02T14:07:58.436874Z"},"links":{"cited_paper":"/paper/2508.03611","citing_paper":"/paper/2607.18253"},"observation_digest":"sha256:40cdcc26da5eb606d71d57b19513d7015e2847610c65ab42fbc6448f39f811fb","observation_id":"53536e45-15f4-417e-937b-f5844c40d498","resolution":{"observed_at":"2026-08-02T14:07:58.436874Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T14:07:58.544887Z","title":"A unified approach to routing and cascading for LLMs","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18253","last_updated":"2026-05-13T20:29:09Z","snapshot_observed_at":"2026-08-08T22:52:01.648545Z","submitted_at":"2026-05-13T20:29:09Z","title":"Beyond Accuracy and Cost: Latency-Aware LLM Query Routing for Dynamic Workloads","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-02T14:07:58.544887Z"},"links":{"citing_paper":"/paper/2607.18253"},"observation_digest":"sha256:8a8226258001639e7dcd0505d4eed1b7b38a06813904c893d0513fcaafba3596","observation_id":"ee889630-be2c-4c54-ab3f-9c2fd95a559b","resolution":{"observed_at":"2026-08-02T14:07:58.544887Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T14:07:58.722462Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.18253","last_updated":"2026-05-13T20:29:09Z","snapshot_observed_at":"2026-08-08T22:52:01.648545Z","submitted_at":"2026-05-13T20:29:09Z","title":"Beyond Accuracy and Cost: Latency-Aware LLM Query Routing for Dynamic Workloads","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-02T14:07:58.722462Z"},"links":{"citing_paper":"/paper/2607.18253"},"observation_digest":"sha256:52e06ab4939bf95870e81a5bd562b8de815e8dad20f960c0b5f6b8744a0a49e5","observation_id":"ea5db281-1b53-4154-9325-4490bbd4262a","resolution":{"observed_at":"2026-08-02T14:07:58.722462Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T14:07:58.839066Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18253","last_updated":"2026-05-13T20:29:09Z","snapshot_observed_at":"2026-08-08T22:52:01.648545Z","submitted_at":"2026-05-13T20:29:09Z","title":"Beyond Accuracy and Cost: Latency-Aware LLM Query Routing for Dynamic Workloads","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-02T14:07:58.839066Z"},"links":{"citing_paper":"/paper/2607.18253"},"observation_digest":"sha256:41840b064a289347173cb859ec4651581a8a2f4a61a6c8a1afaeef7800edec5c","observation_id":"ba790edc-b622-499e-9cac-c33e551b1ba9","resolution":{"observed_at":"2026-08-02T14:07:58.839066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T14:07:58.952345Z","title":"Hierarchical neural story generation","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.18253","last_updated":"2026-05-13T20:29:09Z","snapshot_observed_at":"2026-08-08T22:52:01.648545Z","submitted_at":"2026-05-13T20:29:09Z","title":"Beyond Accuracy and Cost: Latency-Aware LLM Query Routing for Dynamic Workloads","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-02T14:07:58.952345Z"},"links":{"citing_paper":"/paper/2607.18253"},"observation_digest":"sha256:023b0b0613da568cc2c5edfb4a606ba51ca0c34cdcb60fce631242ff46bb6c1a","observation_id":"1427b21b-0e0a-4210-84ac-28623b2307ab","resolution":{"observed_at":"2026-08-02T14:07:58.952345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T14:07:59.046008Z","title":"The markov-modulated poisson process (mmpp) cookbook","venue":null,"work_id":null,"year":1993},"citing_paper":{"arxiv_id":"2607.18253","last_updated":"2026-05-13T20:29:09Z","snapshot_observed_at":"2026-08-08T22:52:01.648545Z","submitted_at":"2026-05-13T20:29:09Z","title":"Beyond Accuracy and Cost: Latency-Aware LLM Query Routing for Dynamic Workloads","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-02T14:07:59.046008Z"},"links":{"citing_paper":"/paper/2607.18253"},"observation_digest":"sha256:6cfdfefcf98b65fca63c91f427f2967809c8c98677f4c1f1f1a782cd09d0ad75","observation_id":"691c541f-f017-4fdf-a61d-6d2781a0ecbc","resolution":{"observed_at":"2026-08-02T14:07:59.046008Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T14:07:59.175611Z","title":"Efficient LLM scheduling by learning to rank","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.18253","last_updated":"2026-05-13T20:29:09Z","snapshot_observed_at":"2026-08-08T22:52:01.648545Z","submitted_at":"2026-05-13T20:29:09Z","title":"Beyond Accuracy and Cost: Latency-Aware LLM Query Routing for Dynamic Workloads","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-02T14:07:59.175611Z"},"links":{"citing_paper":"/paper/2607.18253"},"observation_digest":"sha256:bfc673e46a5d340d4ce560d75ccd3c8adebfcd0f777f564e162132590acb8b46","observation_id":"dd117b2c-c564-4712-be53-68089e231555","resolution":{"observed_at":"2026-08-02T14:07:59.175611Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-02T14:07:59.294487Z","title":"Gemini: A family of highly capable multimodal models, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18253","last_updated":"2026-05-13T20:29:09Z","snapshot_observed_at":"2026-08-08T22:52:01.648545Z","submitted_at":"2026-05-13T20:29:09Z","title":"Beyond Accuracy and Cost: Latency-Aware LLM Query Routing for Dynamic Workloads","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-02T14:07:59.294487Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2607.18253"},"observation_digest":"sha256:e952527ac9a5c1b56b14959e9f09a728b0a1f997b46be7a11dc7b3eb8a55cc13","observation_id":"c847f8e6-7bb2-40c9-b76c-0e84965261b6","resolution":{"observed_at":"2026-08-02T14:07:59.294487Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T14:07:59.382553Z","title":"Past-future scheduler for llm serving under sla guarantees","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18253","last_updated":"2026-05-13T20:29:09Z","snapshot_observed_at":"2026-08-08T22:52:01.648545Z","submitted_at":"2026-05-13T20:29:09Z","title":"Beyond Accuracy and Cost: Latency-Aware LLM Query Routing for Dynamic Workloads","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-02T14:07:59.382553Z"},"links":{"citing_paper":"/paper/2607.18253"},"observation_digest":"sha256:5da37b1b5084718887e95baaac9b77044c3ea580f24509cd2316bd67d942c51e","observation_id":"c323f8ff-94e5-47e9-ac67-271631dbec0d","resolution":{"observed_at":"2026-08-02T14:07:59.382553Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T14:07:59.462587Z","title":"Li, and Richard Socher","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.18253","last_updated":"2026-05-13T20:29:09Z","snapshot_observed_at":"2026-08-08T22:52:01.648545Z","submitted_at":"2026-05-13T20:29:09Z","title":"Beyond Accuracy and Cost: Latency-Aware LLM Query Routing for Dynamic Workloads","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-02T14:07:59.462587Z"},"links":{"citing_paper":"/paper/2607.18253"},"observation_digest":"sha256:7631a990559fb22060b65759f4413066ff8c6cd780d1eb2af77e9398b28b9938","observation_id":"7c3ddefb-1ac5-4aaa-a9b2-35192348b966","resolution":{"observed_at":"2026-08-02T14:07:59.462587Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T14:07:59.542939Z","title":"Routerbench: A benchmark for multi-LLM routing system","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.18253","last_updated":"2026-05-13T20:29:09Z","snapshot_observed_at":"2026-08-08T22:52:01.648545Z","submitted_at":"2026-05-13T20:29:09Z","title":"Beyond Accuracy and Cost: Latency-Aware LLM Query Routing for Dynamic Workloads","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-02T14:07:59.542939Z"},"links":{"citing_paper":"/paper/2607.18253"},"observation_digest":"sha256:f7962a2203c06c48b8c5e1c4c5c8c37a40098a7eae51023cc38eb716301b1a1a","observation_id":"26770c53-fb4b-4c55-86ba-cfa95541c43a","resolution":{"observed_at":"2026-08-02T14:07:59.542939Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.14966","last_updated":"2025-06-12T01:39:50Z","snapshot_observed_at":"2026-08-07T16:00:38.137237Z","submitted_at":"2025-04-21T08:48:48Z","title":"SLO-Aware Scheduling for Large Language Model Inferences","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.14966","snapshot_observed_at":"2026-08-02T14:07:59.627222Z","title":"Slo-aware scheduling for large language model inferences, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18253","last_updated":"2026-05-13T20:29:09Z","snapshot_observed_at":"2026-08-08T22:52:01.648545Z","submitted_at":"2026-05-13T20:29:09Z","title":"Beyond Accuracy and Cost: Latency-Aware LLM Query Routing for Dynamic Workloads","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-02T14:07:59.627222Z"},"links":{"cited_paper":"/paper/2504.14966","citing_paper":"/paper/2607.18253"},"observation_digest":"sha256:1843c9a38504c170c24b3b7068c13465bfa137d863d745e16f9c327de4adb294","observation_id":"03f5a96c-5519-45f6-9c5f-917449ee6274","resolution":{"observed_at":"2026-08-02T14:07:59.627222Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T14:07:59.709780Z","title":"Efficient attentions for long document summarization","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.18253","last_updated":"2026-05-13T20:29:09Z","snapshot_observed_at":"2026-08-08T22:52:01.648545Z","submitted_at":"2026-05-13T20:29:09Z","title":"Beyond Accuracy and Cost: Latency-Aware LLM Query Routing for Dynamic Workloads","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-02T14:07:59.709780Z"},"links":{"citing_paper":"/paper/2607.18253"},"observation_digest":"sha256:d2d60b2897e045beede51e96e97a6adc53dcfdbcae7dbffcfabd0c2b8c05b266","observation_id":"d3948040-18a7-42c1-8505-f1f0860984a3","resolution":{"observed_at":"2026-08-02T14:07:59.709780Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T14:07:59.792244Z","title":"Predicting llm inference latency: A roofline-driven ml method","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.18253","last_updated":"2026-05-13T20:29:09Z","snapshot_observed_at":"2026-08-08T22:52:01.648545Z","submitted_at":"2026-05-13T20:29:09Z","title":"Beyond Accuracy and Cost: Latency-Aware LLM Query Routing for Dynamic Workloads","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-02T14:07:59.792244Z"},"links":{"citing_paper":"/paper/2607.18253"},"observation_digest":"sha256:12ecaa9a646dd2bec44a909e5f477a40e98933a936fc2dda3984012b17bae51c","observation_id":"e6231b84-e9a5-44f9-a2bb-bab933f79809","resolution":{"observed_at":"2026-08-02T14:07:59.792244Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T14:07:59.951925Z","title":"Universal model routing for efficient LLM inference","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.18253","last_updated":"2026-05-13T20:29:09Z","snapshot_observed_at":"2026-08-08T22:52:01.648545Z","submitted_at":"2026-05-13T20:29:09Z","title":"Beyond Accuracy and Cost: Latency-Aware LLM Query Routing for Dynamic Workloads","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-02T14:07:59.951925Z"},"links":{"citing_paper":"/paper/2607.18253"},"observation_digest":"sha256:1079ad1481019dbe5d9773d154e5f768a800b36589d801b4f9e418e4874222c5","observation_id":"9c32df46-bcf5-4941-8ca6-0959b5d8e5d5","resolution":{"observed_at":"2026-08-02T14:07:59.951925Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T14:08:00.010405Z","title":"Lightgbm: A highly efficient gradient boosting decision tree","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.18253","last_updated":"2026-05-13T20:29:09Z","snapshot_observed_at":"2026-08-08T22:52:01.648545Z","submitted_at":"2026-05-13T20:29:09Z","title":"Beyond Accuracy and Cost: Latency-Aware LLM Query Routing for Dynamic Workloads","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-02T14:08:00.010405Z"},"links":{"citing_paper":"/paper/2607.18253"},"observation_digest":"sha256:fd62c098239105f6acbb6d084cd8216ec5637022b20bac91e35739f62826b342","observation_id":"99f356c4-6c66-46a0-b2a0-6dd908d90882","resolution":{"observed_at":"2026-08-02T14:08:00.010405Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T14:08:00.095071Z","title":"Efficient memory management for large language model serving with pagedattention","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.18253","last_updated":"2026-05-13T20:29:09Z","snapshot_observed_at":"2026-08-08T22:52:01.648545Z","submitted_at":"2026-05-13T20:29:09Z","title":"Beyond Accuracy and Cost: Latency-Aware LLM Query Routing for Dynamic Workloads","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-02T14:08:00.095071Z"},"links":{"citing_paper":"/paper/2607.18253"},"observation_digest":"sha256:eebdbe1d95463bf0c74d7c4986e0bf8cdc4480e941ccb0f370aad8453162940d","observation_id":"f6e95019-0927-4f7a-b511-8c979f44582d","resolution":{"observed_at":"2026-08-02T14:08:00.095071Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T14:08:00.184734Z","title":"Faster, cheaper, just as good: Cost- and latency constrained routing for llms","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18253","last_updated":"2026-05-13T20:29:09Z","snapshot_observed_at":"2026-08-08T22:52:01.648545Z","submitted_at":"2026-05-13T20:29:09Z","title":"Beyond Accuracy and Cost: Latency-Aware LLM Query Routing for Dynamic Workloads","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-02T14:08:00.184734Z"},"links":{"citing_paper":"/paper/2607.18253"},"observation_digest":"sha256:9bc2e109ec59de46036dfbf8946a3af63ea16dbc5d9986cf362dd91162f4a0d0","observation_id":"6f602431-65bb-43a2-96db-3f7d7097cbc2","resolution":{"observed_at":"2026-08-02T14:08:00.184734Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T14:08:00.264011Z","title":"Deterministic non-autoregressive neural sequence modeling by iterative refinement","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.18253","last_updated":"2026-05-13T20:29:09Z","snapshot_observed_at":"2026-08-08T22:52:01.648545Z","submitted_at":"2026-05-13T20:29:09Z","title":"Beyond Accuracy and Cost: Latency-Aware LLM Query Routing for Dynamic Workloads","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-02T14:08:00.264011Z"},"links":{"citing_paper":"/paper/2607.18253"},"observation_digest":"sha256:fe96f3babac26182e6fae8ca9bbaddc131ee38bdc85aaa661273da169ccaa04c","observation_id":"764717b5-0207-464d-a481-3ab4dfb704b5","resolution":{"observed_at":"2026-08-02T14:08:00.264011Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T14:08:00.349711Z","title":"Fromgenerationtojudgment: Oppor- tunities and challenges of LLM-as-a-judge","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18253","last_updated":"2026-05-13T20:29:09Z","snapshot_observed_at":"2026-08-08T22:52:01.648545Z","submitted_at":"2026-05-13T20:29:09Z","title":"Beyond Accuracy and Cost: Latency-Aware LLM Query Routing for Dynamic Workloads","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-02T14:08:00.349711Z"},"links":{"citing_paper":"/paper/2607.18253"},"observation_digest":"sha256:1a3a0236d95bcc17ed2112933b7929dae41eeca7523213e2fba8a2c591b7f635","observation_id":"9d90e6cd-18dc-4871-ad47-07d53163657f","resolution":{"observed_at":"2026-08-02T14:08:00.349711Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T14:08:00.435794Z","title":"Diffusion-LM improves controllable text generation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.18253","last_updated":"2026-05-13T20:29:09Z","snapshot_observed_at":"2026-08-08T22:52:01.648545Z","submitted_at":"2026-05-13T20:29:09Z","title":"Beyond Accuracy and Cost: Latency-Aware LLM Query Routing for Dynamic Workloads","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-02T14:08:00.435794Z"},"links":{"citing_paper":"/paper/2607.18253"},"observation_digest":"sha256:355e9b2be21e30711a64c407f23ff52187e6a062a0653a966e80284e11a1882d","observation_id":"eb4577bd-b575-4dae-b524-4eb83a24fdc2","resolution":{"observed_at":"2026-08-02T14:08:00.435794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T14:08:00.512272Z","title":"Throughput-optimal scheduling algorithms for llm inference and ai agents,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18253","last_updated":"2026-05-13T20:29:09Z","snapshot_observed_at":"2026-08-08T22:52:01.648545Z","submitted_at":"2026-05-13T20:29:09Z","title":"Beyond Accuracy and Cost: Latency-Aware LLM Query Routing for Dynamic Workloads","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-02T14:08:00.512272Z"},"links":{"citing_paper":"/paper/2607.18253"},"observation_digest":"sha256:40dfa9fa709bc807ca057ec9d545062607ecedb20f6cef1b4fbeedf33f98f085","observation_id":"5f5cfe90-3d48-48e0-8a55-7f22b2c44131","resolution":{"observed_at":"2026-08-02T14:08:00.512272Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T14:08:00.736056Z","title":"ROUGE: A package for automatic evaluation of summaries","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2607.18253","last_updated":"2026-05-13T20:29:09Z","snapshot_observed_at":"2026-08-08T22:52:01.648545Z","submitted_at":"2026-05-13T20:29:09Z","title":"Beyond Accuracy and Cost: Latency-Aware LLM Query Routing for Dynamic Workloads","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-02T14:08:00.736056Z"},"links":{"citing_paper":"/paper/2607.18253"},"observation_digest":"sha256:2fa1c89ea5b20865d59ff0a35dd6e783426eba1eeff4aca462ea1469fdc00de4","observation_id":"f20963aa-b673-40bb-b283-be782f28f27f","resolution":{"observed_at":"2026-08-02T14:08:00.736056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07545","last_updated":"2025-03-10T17:12:47Z","snapshot_observed_at":"2026-08-07T17:16:04.917614Z","submitted_at":"2025-03-10T17:12:47Z","title":"Queueing, Predictions, and LLMs: Challenges and Open Problems","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.07545","snapshot_observed_at":"2026-08-02T14:08:00.817791Z","title":"Queueing, predictions, and llms: Challenges and open problems, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18253","last_updated":"2026-05-13T20:29:09Z","snapshot_observed_at":"2026-08-08T22:52:01.648545Z","submitted_at":"2026-05-13T20:29:09Z","title":"Beyond Accuracy and Cost: Latency-Aware LLM Query Routing for Dynamic Workloads","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-02T14:08:00.817791Z"},"links":{"cited_paper":"/paper/2503.07545","citing_paper":"/paper/2607.18253"},"observation_digest":"sha256:cc551fa08b6530cbfa65d553680deed1ddea41402943de9614b405e1fa902739","observation_id":"b1a212d1-eb34-4a51-8ea6-a0bb161ed5b6","resolution":{"observed_at":"2026-08-02T14:08:00.817791Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T14:08:00.901084Z","title":"Deferred prefill for throughput maximization in llm inference","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18253","last_updated":"2026-05-13T20:29:09Z","snapshot_observed_at":"2026-08-08T22:52:01.648545Z","submitted_at":"2026-05-13T20:29:09Z","title":"Beyond Accuracy and Cost: Latency-Aware LLM Query Routing for Dynamic Workloads","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-02T14:08:00.901084Z"},"links":{"citing_paper":"/paper/2607.18253"},"observation_digest":"sha256:8376e81844484caa634c29cfc331be6c7ef3f89cc4512374a1fab92cb6d7cb65","observation_id":"6903b784-b2cf-416b-b325-7ff3bb088384","resolution":{"observed_at":"2026-08-02T14:08:00.901084Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T14:08:00.978274Z","title":"Nvidia h100 pcie gpu — product brief","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.18253","last_updated":"2026-05-13T20:29:09Z","snapshot_observed_at":"2026-08-08T22:52:01.648545Z","submitted_at":"2026-05-13T20:29:09Z","title":"Beyond Accuracy and Cost: Latency-Aware LLM Query Routing for Dynamic Workloads","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-02T14:08:00.978274Z"},"links":{"citing_paper":"/paper/2607.18253"},"observation_digest":"sha256:b68c4ef672b1fab92f94747dd21975062bb3abb3fabaacebca861eb44a6d5861","observation_id":"a693ce8b-4157-41f5-a9e0-2ba4dba9d6ca","resolution":{"observed_at":"2026-08-02T14:08:00.978274Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T14:08:01.058602Z","title":"Gonzalez, M Waleed Kadous, and Ion Stoica","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18253","last_updated":"2026-05-13T20:29:09Z","snapshot_observed_at":"2026-08-08T22:52:01.648545Z","submitted_at":"2026-05-13T20:29:09Z","title":"Beyond Accuracy and Cost: Latency-Aware LLM Query Routing for Dynamic Workloads","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-02T14:08:01.058602Z"},"links":{"citing_paper":"/paper/2607.18253"},"observation_digest":"sha256:5ff940c964e251a2ea53197f4acfd410165adfd3b6d3900d41d2fba630e19063","observation_id":"1a93cffa-6aa5-4d34-a6cb-474202ae568c","resolution":{"observed_at":"2026-08-02T14:08:01.058602Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T14:08:01.126930Z","title":"Proxrouter: Proximity-weighted llm query routing for improved robustness to outliers, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18253","last_updated":"2026-05-13T20:29:09Z","snapshot_observed_at":"2026-08-08T22:52:01.648545Z","submitted_at":"2026-05-13T20:29:09Z","title":"Beyond Accuracy and Cost: Latency-Aware LLM Query Routing for Dynamic Workloads","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-02T14:08:01.126930Z"},"links":{"citing_paper":"/paper/2607.18253"},"observation_digest":"sha256:dbfa38701b8bf6448a8ccf2cc791f1c712b5bf4f61f3e7c1080fd13ead1009c5","observation_id":"0f701194-cf7e-4204-ad78-c3bb7a650135","resolution":{"observed_at":"2026-08-02T14:08:01.126930Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T14:08:01.212956Z","title":"Locus: Low-dimensional model embeddings for efficient model exploration, comparison, and selection, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.18253","last_updated":"2026-05-13T20:29:09Z","snapshot_observed_at":"2026-08-08T22:52:01.648545Z","submitted_at":"2026-05-13T20:29:09Z","title":"Beyond Accuracy and Cost: Latency-Aware LLM Query Routing for Dynamic Workloads","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-02T14:08:01.212956Z"},"links":{"citing_paper":"/paper/2607.18253"},"observation_digest":"sha256:0ce0d612ceddd95bd9ffd732dca02058798cc5f285f4f7fceb9bd279a27f85ec","observation_id":"cab66dec-5dd7-49ed-90a2-d0afedfaaf6c","resolution":{"observed_at":"2026-08-02T14:08:01.212956Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T14:08:01.324988Z","title":"Queue management for slo-oriented large language model serving","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.18253","last_updated":"2026-05-13T20:29:09Z","snapshot_observed_at":"2026-08-08T22:52:01.648545Z","submitted_at":"2026-05-13T20:29:09Z","title":"Beyond Accuracy and Cost: Latency-Aware LLM Query Routing for Dynamic Workloads","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-02T14:08:01.324988Z"},"links":{"citing_paper":"/paper/2607.18253"},"observation_digest":"sha256:42ea4b41c49d81199b0e52bdf9789b85ff073492a86c40f6b458fecbe1c79da9","observation_id":"b10aa5f2-416a-42e3-b7e6-8d3c79555296","resolution":{"observed_at":"2026-08-02T14:08:01.324988Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T14:08:01.577296Z","title":"Efficiently scaling transformer inference","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.18253","last_updated":"2026-05-13T20:29:09Z","snapshot_observed_at":"2026-08-08T22:52:01.648545Z","submitted_at":"2026-05-13T20:29:09Z","title":"Beyond Accuracy and Cost: Latency-Aware LLM Query Routing for Dynamic Workloads","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-02T14:08:01.577296Z"},"links":{"citing_paper":"/paper/2607.18253"},"observation_digest":"sha256:85911d73baa0d340bbb11427bd70e662f61b1edb598d2be057645a3be04237a2","observation_id":"a0cc7d53-d048-4ecf-a8c3-fc982818a9df","resolution":{"observed_at":"2026-08-02T14:08:01.577296Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T14:08:01.708519Z","title":"Kalbarczyk, Tamer Başar, and Ravishankar K","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.18253","last_updated":"2026-05-13T20:29:09Z","snapshot_observed_at":"2026-08-08T22:52:01.648545Z","submitted_at":"2026-05-13T20:29:09Z","title":"Beyond Accuracy and Cost: Latency-Aware LLM Query Routing for Dynamic Workloads","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-02T14:08:01.708519Z"},"links":{"citing_paper":"/paper/2607.18253"},"observation_digest":"sha256:5430e22f57848b90e4819787394e0e1557ac8d30d979da188d45601be2947a98","observation_id":"40f7be56-8d81-42b3-9471-bc6ae3e318cb","resolution":{"observed_at":"2026-08-02T14:08:01.708519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-02T14:08:01.830316Z","title":"Qwen3 technical report, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18253","last_updated":"2026-05-13T20:29:09Z","snapshot_observed_at":"2026-08-08T22:52:01.648545Z","submitted_at":"2026-05-13T20:29:09Z","title":"Beyond Accuracy and Cost: Latency-Aware LLM Query Routing for Dynamic Workloads","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-02T14:08:01.830316Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2607.18253"},"observation_digest":"sha256:b40da6237007bf0e3fd28c5d2fa08dffc2c9519d5aa902051cfa9661661b1c38","observation_id":"02f6e61f-ed56-4469-83b8-2b901c125e57","resolution":{"observed_at":"2026-08-02T14:08:01.830316Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T14:08:01.966203Z","title":"Don’t stop me now: Embedding based scheduling for llms","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18253","last_updated":"2026-05-13T20:29:09Z","snapshot_observed_at":"2026-08-08T22:52:01.648545Z","submitted_at":"2026-05-13T20:29:09Z","title":"Beyond Accuracy and Cost: Latency-Aware LLM Query Routing for Dynamic Workloads","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-02T14:08:01.966203Z"},"links":{"citing_paper":"/paper/2607.18253"},"observation_digest":"sha256:2c6d9611ee1b41aaefbc52787215f5ef1fe5a98c4380248c78dd4ed82a72cf5c","observation_id":"f665b1b4-7509-415f-ace1-b0c105c6e4e8","resolution":{"observed_at":"2026-08-02T14:08:01.966203Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T14:08:02.164008Z","title":"IRT-router: Effective and interpretable multi-LLM routing via item response theory","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18253","last_updated":"2026-05-13T20:29:09Z","snapshot_observed_at":"2026-08-08T22:52:01.648545Z","submitted_at":"2026-05-13T20:29:09Z","title":"Beyond Accuracy and Cost: Latency-Aware LLM Query Routing for Dynamic Workloads","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-02T14:08:02.164008Z"},"links":{"citing_paper":"/paper/2607.18253"},"observation_digest":"sha256:d8aae5ce55f02713e6bf05287d0f90ac4a6d3b44fb361b17997dba8abf06902c","observation_id":"0f12ea98-663a-4c15-87ab-d9c99f031471","resolution":{"observed_at":"2026-08-02T14:08:02.164008Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T14:08:02.387731Z","title":"Llumnix: dynamic scheduling for large language model serving","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.18253","last_updated":"2026-05-13T20:29:09Z","snapshot_observed_at":"2026-08-08T22:52:01.648545Z","submitted_at":"2026-05-13T20:29:09Z","title":"Beyond Accuracy and Cost: Latency-Aware LLM Query Routing for Dynamic Workloads","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-02T14:08:02.387731Z"},"links":{"citing_paper":"/paper/2607.18253"},"observation_digest":"sha256:ed04c4b95bf715e761d3c448803a08b69bfbb130baca6c8e8cadd8e4e4130f5c","observation_id":"a89824c2-a1ff-47ec-aaa9-623a07dc700d","resolution":{"observed_at":"2026-08-02T14:08:02.387731Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T14:08:02.465271Z","title":"Hashimoto","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.18253","last_updated":"2026-05-13T20:29:09Z","snapshot_observed_at":"2026-08-08T22:52:01.648545Z","submitted_at":"2026-05-13T20:29:09Z","title":"Beyond Accuracy and Cost: Latency-Aware LLM Query Routing for Dynamic Workloads","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-02T14:08:02.465271Z"},"links":{"citing_paper":"/paper/2607.18253"},"observation_digest":"sha256:6fbaee9984ef679cd8fa483d34381974844db662bcd464557de110842a3b7a5a","observation_id":"9c3c6777-309f-45f6-9d8f-14a0c474dafa","resolution":{"observed_at":"2026-08-02T14:08:02.465271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T14:08:02.276883Z","title":"ISBN 979-8-89176-251-0","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18253","last_updated":"2026-05-13T20:29:09Z","snapshot_observed_at":"2026-08-08T22:52:01.648545Z","submitted_at":"2026-05-13T20:29:09Z","title":"Beyond Accuracy and Cost: Latency-Aware LLM Query Routing for Dynamic Workloads","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-02T14:08:02.276883Z"},"links":{"citing_paper":"/paper/2607.18253"},"observation_digest":"sha256:ad75a21ddf59201c6b97512d664e1c929d2db6ded8d165a75d937bd4a860ef24","observation_id":"d3331bd0-4fe6-44ea-a110-5a03fc6c2ef9","resolution":{"observed_at":"2026-08-02T14:08:02.276883Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T14:08:02.635380Z","title":null,"venue":null,"work_id":null,"year":1982},"citing_paper":{"arxiv_id":"2607.18253","last_updated":"2026-05-13T20:29:09Z","snapshot_observed_at":"2026-08-08T22:52:01.648545Z","submitted_at":"2026-05-13T20:29:09Z","title":"Beyond Accuracy and Cost: Latency-Aware LLM Query Routing for Dynamic Workloads","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-02T14:08:02.635380Z"},"links":{"citing_paper":"/paper/2607.18253"},"observation_digest":"sha256:12a1d445df92904ff36834e04f5707d22a656ed19ebff439d661f57e6074493d","observation_id":"a7cf780b-6b9f-4ce5-b1ba-9dbb71b7c262","resolution":{"observed_at":"2026-08-02T14:08:02.635380Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T14:08:02.730723Z","title":"Cohen, Ruslan Salakhutdinov, and Christo- pher D","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.18253","last_updated":"2026-05-13T20:29:09Z","snapshot_observed_at":"2026-08-08T22:52:01.648545Z","submitted_at":"2026-05-13T20:29:09Z","title":"Beyond Accuracy and Cost: Latency-Aware LLM Query Routing for Dynamic Workloads","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-02T14:08:02.730723Z"},"links":{"citing_paper":"/paper/2607.18253"},"observation_digest":"sha256:571cbd4637314f0a7c8eb001e996d3e16800024452d17f1ba9c17375a5d3a3d5","observation_id":"3137dcd9-e144-4847-99c0-fec1d0608697","resolution":{"observed_at":"2026-08-02T14:08:02.730723Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T14:08:02.540327Z","title":"Attention is all you need","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.18253","last_updated":"2026-05-13T20:29:09Z","snapshot_observed_at":"2026-08-08T22:52:01.648545Z","submitted_at":"2026-05-13T20:29:09Z","title":"Beyond Accuracy and Cost: Latency-Aware LLM Query Routing for Dynamic Workloads","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-02T14:08:02.540327Z"},"links":{"citing_paper":"/paper/2607.18253"},"observation_digest":"sha256:f4ed5830f29e929eeb888e64b38415987cfeed9298e3f4191345e58044349294","observation_id":"f67ff5dd-0810-487c-9c06-2b75c2e36288","resolution":{"observed_at":"2026-08-02T14:08:02.540327Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T14:08:02.980770Z","title":"BARTScore: Evaluating generated text as text generation","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.18253","last_updated":"2026-05-13T20:29:09Z","snapshot_observed_at":"2026-08-08T22:52:01.648545Z","submitted_at":"2026-05-13T20:29:09Z","title":"Beyond Accuracy and Cost: Latency-Aware LLM Query Routing for Dynamic Workloads","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-02T14:08:02.980770Z"},"links":{"citing_paper":"/paper/2607.18253"},"observation_digest":"sha256:09422b10d70cd994575ad31d61550f1ce98e6e8c902e41f6f15e905adad9d2c6","observation_id":"cd3715e1-a84c-4d96-8d8c-e88cbe7c0096","resolution":{"observed_at":"2026-08-02T14:08:02.980770Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T14:08:03.135243Z","title":"PhD thesis, Georgia Institute of Technology, August 2009","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2607.18253","last_updated":"2026-05-13T20:29:09Z","snapshot_observed_at":"2026-08-08T22:52:01.648545Z","submitted_at":"2026-05-13T20:29:09Z","title":"Beyond Accuracy and Cost: Latency-Aware LLM Query Routing for Dynamic Workloads","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-02T14:08:03.135243Z"},"links":{"citing_paper":"/paper/2607.18253"},"observation_digest":"sha256:59bea40b7444d501d606445994353fdf7aa0f721a7f129ada422f7d12ed53c63","observation_id":"e055f8cc-93bb-42a7-bcd9-de6894a6e278","resolution":{"observed_at":"2026-08-02T14:08:03.135243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T14:08:02.828169Z","title":"Orca: A distributed serving system for Transformer-Based generative models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.18253","last_updated":"2026-05-13T20:29:09Z","snapshot_observed_at":"2026-08-08T22:52:01.648545Z","submitted_at":"2026-05-13T20:29:09Z","title":"Beyond Accuracy and Cost: Latency-Aware LLM Query Routing for Dynamic Workloads","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-02T14:08:02.828169Z"},"links":{"citing_paper":"/paper/2607.18253"},"observation_digest":"sha256:7b9575eaa9bc628eb8e5941601b73a6afc9b93cda6ea12be09e9585bbaaa99f6","observation_id":"89d3d3f6-7723-41d2-a43f-f77cbf056a52","resolution":{"observed_at":"2026-08-02T14:08:02.828169Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T14:08:03.298249Z","title":"scores\". The","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18253","last_updated":"2026-05-13T20:29:09Z","snapshot_observed_at":"2026-08-08T22:52:01.648545Z","submitted_at":"2026-05-13T20:29:09Z","title":"Beyond Accuracy and Cost: Latency-Aware LLM Query Routing for Dynamic Workloads","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-02T14:08:03.298249Z"},"links":{"citing_paper":"/paper/2607.18253"},"observation_digest":"sha256:2750ab6b4043d8c2e07bd61b67b9b941b05f87fff83ab90a77b9a31ff4d18b80","observation_id":"817b5903-4bfd-4603-86f3-1b32786bc0ad","resolution":{"observed_at":"2026-08-02T14:08:03.298249Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T14:08:03.437194Z","title":"Alternatively, generation work for queries follows the memoryless distribution [34]","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18253","last_updated":"2026-05-13T20:29:09Z","snapshot_observed_at":"2026-08-08T22:52:01.648545Z","submitted_at":"2026-05-13T20:29:09Z","title":"Beyond Accuracy and Cost: Latency-Aware LLM Query Routing for Dynamic Workloads","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-02T14:08:03.437194Z"},"links":{"citing_paper":"/paper/2607.18253"},"observation_digest":"sha256:9c5c7b2c15bcdf5575696d4342110faea0a90700fab4c13b7ee64ef458bbbcc8","observation_id":"86558925-525d-475c-b668-498e388567fb","resolution":{"observed_at":"2026-08-02T14:08:03.437194Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T14:08:03.579451Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18253","last_updated":"2026-05-13T20:29:09Z","snapshot_observed_at":"2026-08-08T22:52:01.648545Z","submitted_at":"2026-05-13T20:29:09Z","title":"Beyond Accuracy and Cost: Latency-Aware LLM Query Routing for Dynamic Workloads","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-02T14:08:03.579451Z"},"links":{"citing_paper":"/paper/2607.18253"},"observation_digest":"sha256:06f26c87d503547a101e649de22f9941df47063edbaaa3ae8dcc20f70965d799","observation_id":"719892b6-9c99-490c-ac66-de7083f22cc2","resolution":{"observed_at":"2026-08-02T14:08:03.579451Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T14:08:03.701007Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18253","last_updated":"2026-05-13T20:29:09Z","snapshot_observed_at":"2026-08-08T22:52:01.648545Z","submitted_at":"2026-05-13T20:29:09Z","title":"Beyond Accuracy and Cost: Latency-Aware LLM Query Routing for Dynamic Workloads","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-02T14:08:03.701007Z"},"links":{"citing_paper":"/paper/2607.18253"},"observation_digest":"sha256:c70f6502891e07b35e22a065b4c5b2be63515612dfc66b18f90d3a704d18c1d4","observation_id":"0c522c42-823f-4001-8522-057759fabc73","resolution":{"observed_at":"2026-08-02T14:08:03.701007Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T14:08:03.850772Z","title":"State process and stationary distribution.Queries arrive according to a Poisson process of rateαj, so whenever a new query arrives, the state|Rj(t)| increases by one","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18253","last_updated":"2026-05-13T20:29:09Z","snapshot_observed_at":"2026-08-08T22:52:01.648545Z","submitted_at":"2026-05-13T20:29:09Z","title":"Beyond Accuracy and Cost: Latency-Aware LLM Query Routing for Dynamic Workloads","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-02T14:08:03.850772Z"},"links":{"citing_paper":"/paper/2607.18253"},"observation_digest":"sha256:e0aa0915709ab1c7d889d86f021ede09fd3808efbbd5bc8b96f9006e3b557e87","observation_id":"83887fa6-2f98-4762-a30d-28e258d74612","resolution":{"observed_at":"2026-08-02T14:08:03.850772Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T14:08:01.433404Z","title":"ISBN 9798400712869","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18253","last_updated":"2026-05-13T20:29:09Z","snapshot_observed_at":"2026-08-08T22:52:01.648545Z","submitted_at":"2026-05-13T20:29:09Z","title":"Beyond Accuracy and Cost: Latency-Aware LLM Query Routing for Dynamic Workloads","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-02T14:08:01.433404Z"},"links":{"citing_paper":"/paper/2607.18253"},"observation_digest":"sha256:02a311ef31fd5f89bd4555f2abce2dbf55443f92653f68b28ea94756c5fc85f9","observation_id":"4d867fb0-65e6-4968-8f07-0664ac952bbc","resolution":{"observed_at":"2026-08-02T14:08:01.433404Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07347","last_updated":"2026-05-18T01:04:46Z","snapshot_observed_at":"2026-08-04T04:26:27.630303Z","submitted_at":"2025-04-10T00:12:12Z","title":"Throughput-Optimal Scheduling Algorithms for LLM Inference and AI Agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.07347","snapshot_observed_at":"2026-08-02T14:08:00.632928Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18253","last_updated":"2026-05-13T20:29:09Z","snapshot_observed_at":"2026-08-08T22:52:01.648545Z","submitted_at":"2026-05-13T20:29:09Z","title":"Beyond Accuracy and Cost: Latency-Aware LLM Query Routing for Dynamic Workloads","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-02T14:08:00.632928Z"},"links":{"cited_paper":"/paper/2504.07347","citing_paper":"/paper/2607.18253"},"observation_digest":"sha256:efa9e1a1a6d9ab95fb7387dafbec3b4fa4d789cbbdab9e539c53939e4420b8fa","observation_id":"0dfe617e-386a-40c1-9950-183a1a62f5aa","resolution":{"observed_at":"2026-08-02T14:08:00.632928Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.18253","last_updated":"2026-05-13T20:29:09Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-08T22:52:01.648545Z","submitted_at":"2026-05-13T20:29:09Z","title":"Beyond Accuracy and Cost: Latency-Aware LLM Query Routing for Dynamic Workloads"},"reference_resolution":{"displayed":59,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":58,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":59},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 59 of 59 outbound references and 0 inbound Pith citation observations for arXiv:2607.18253."}