{"as_of":"2026-08-20T07:35:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f8c5b97bebdfe5451e1d320a25ec71ace7287c7e318234c250231d14caeb374b","coverage":[{"denominator":59,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":59,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T15:25:03.602010Z","state":"measured"},{"denominator":66,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":66,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-20T06:33:59.587034+00:00","state":"measured"},{"denominator":7,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":7,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T05:13:50.303760Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T07:29:39.047838Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.14312","last_updated":"2025-01-24T08:12:47Z","snapshot_observed_at":"2026-08-19T01:08:36.561666Z","submitted_at":"2025-01-24T08:12:47Z","title":"Locality-aware Fair Scheduling in LLM Serving","version":1},"cited_work":{"arxiv_id":"2501.14312","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.14312","snapshot_observed_at":"2026-07-04T07:29:39.047838Z","title":"Locality-aware fair scheduling in llm serving","venue":null,"work_id":"5062f5cf-3a0d-40d2-90ae-0a968d1c5258","year":2025},"citing_paper":{"arxiv_id":"2505.09999","last_updated":"2026-05-11T03:41:00Z","snapshot_observed_at":"2026-07-30T05:05:51.180006Z","submitted_at":"2025-05-15T06:24:08Z","title":"ServeGen: Workload Characterization and Generation of Large Language Model Serving in Production","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-22T15:42:05.266854Z"},"links":{"cited_paper":"/paper/2501.14312","citing_paper":"/paper/2505.09999"},"observation_digest":"sha256:1801d2150af70286e9e2d33515cce4f5f85858f103f0344e8f34cf91c29df02f","observation_id":"be1b53a0-fd3b-40e0-b162-faf220e64753","resolution":{"observed_at":"2026-05-22T15:44:58.174166Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.14312","last_updated":"2025-01-24T08:12:47Z","snapshot_observed_at":"2026-08-19T01:08:36.561666Z","submitted_at":"2025-01-24T08:12:47Z","title":"Locality-aware Fair Scheduling in LLM Serving","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.14312","snapshot_observed_at":"2026-08-06T18:16:49.848682Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.08954","last_updated":"2025-07-11T18:28:25Z","snapshot_observed_at":"2026-08-13T06:16:35.051443Z","submitted_at":"2025-07-11T18:28:25Z","title":"MQFQ-Sticky: Fair Queueing For Serverless GPU Functions","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T18:16:49.848682Z"},"links":{"cited_paper":"/paper/2501.14312","citing_paper":"/paper/2507.08954"},"observation_digest":"sha256:4bf65a37400bc94cc7bbf4316adaae80d144d65424394e3364670377549a7a19","observation_id":"2b2a4a07-aebe-4f29-834e-c3028398f480","resolution":{"observed_at":"2026-08-06T18:16:49.848682Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.14312","last_updated":"2025-01-24T08:12:47Z","snapshot_observed_at":"2026-08-19T01:08:36.561666Z","submitted_at":"2025-01-24T08:12:47Z","title":"Locality-aware Fair Scheduling in LLM Serving","version":1},"cited_work":{"arxiv_id":"2501.14312","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.14312","snapshot_observed_at":"2026-07-04T07:29:39.047838Z","title":"Locality-aware fair scheduling in llm serving","venue":null,"work_id":"5062f5cf-3a0d-40d2-90ae-0a968d1c5258","year":2025},"citing_paper":{"arxiv_id":"2512.19179","last_updated":"2026-05-15T11:32:47Z","snapshot_observed_at":"2026-08-03T00:09:02.053747Z","submitted_at":"2025-12-22T09:13:40Z","title":"CascadeInfer: Length-Aware Scheduling of LLM Serving with Low Latency and Load Balancing","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-21T17:24:59.556926Z"},"links":{"cited_paper":"/paper/2501.14312","citing_paper":"/paper/2512.19179"},"observation_digest":"sha256:a7a8b3e0f6f4d72bd31f01929834ce62e80d90b73994760b514e734b97b533a7","observation_id":"e6af1bdc-6072-4929-9cb7-fda60eb9d9b9","resolution":{"observed_at":"2026-05-21T17:25:25.292292Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.14312","last_updated":"2025-01-24T08:12:47Z","snapshot_observed_at":"2026-08-19T01:08:36.561666Z","submitted_at":"2025-01-24T08:12:47Z","title":"Locality-aware Fair Scheduling in LLM Serving","version":1},"cited_work":{"arxiv_id":"2501.14312","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.14312","snapshot_observed_at":"2026-07-04T07:29:39.047838Z","title":"Locality-aware fair scheduling in llm serving","venue":null,"work_id":"5062f5cf-3a0d-40d2-90ae-0a968d1c5258","year":2025},"citing_paper":{"arxiv_id":"2602.09725","last_updated":"2026-05-12T14:12:11Z","snapshot_observed_at":"2026-08-11T13:19:39.209270Z","submitted_at":"2026-02-10T12:29:02Z","title":"Efficient Remote KV Cache Reuse with GPU-native Video Codec","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-16T05:21:04.555356Z"},"links":{"cited_paper":"/paper/2501.14312","citing_paper":"/paper/2602.09725"},"observation_digest":"sha256:f4e87a6e673ab79e74dc0702e8481e91d5cbd37709bba3a92b6720ce057f3b3f","observation_id":"ec7be858-6faa-44cd-9403-22f9a60797da","resolution":{"observed_at":"2026-05-16T05:22:22.829821Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.14312","last_updated":"2025-01-24T08:12:47Z","snapshot_observed_at":"2026-08-19T01:08:36.561666Z","submitted_at":"2025-01-24T08:12:47Z","title":"Locality-aware Fair Scheduling in LLM Serving","version":1},"cited_work":{"arxiv_id":"2501.14312","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.14312","snapshot_observed_at":"2026-07-04T07:29:39.047838Z","title":"Locality-aware fair scheduling in llm serving","venue":null,"work_id":"5062f5cf-3a0d-40d2-90ae-0a968d1c5258","year":2025},"citing_paper":{"arxiv_id":"2606.09643","last_updated":"2026-06-08T15:38:16Z","snapshot_observed_at":"2026-07-06T23:48:58.206424Z","submitted_at":"2026-06-08T15:38:16Z","title":"FMplex: Model Virtualization for Serving Extensible Foundation Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-27T14:50:35.584259Z"},"links":{"cited_paper":"/paper/2501.14312","citing_paper":"/paper/2606.09643"},"observation_digest":"sha256:a406febe7c91708bf8a33ac1807e28761ccd2418f735ad4e768eb8e2d450b7ed","observation_id":"006f4cd1-3711-47d9-a179-d390ad8a3a80","resolution":{"observed_at":"2026-07-03T03:47:35.372686Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.14312","last_updated":"2025-01-24T08:12:47Z","snapshot_observed_at":"2026-08-19T01:08:36.561666Z","submitted_at":"2025-01-24T08:12:47Z","title":"Locality-aware Fair Scheduling in LLM Serving","version":1},"cited_work":{"arxiv_id":"2501.14312","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.14312","snapshot_observed_at":"2026-07-04T07:29:39.047838Z","title":"Locality-aware fair scheduling in llm serving","venue":null,"work_id":"5062f5cf-3a0d-40d2-90ae-0a968d1c5258","year":2025},"citing_paper":{"arxiv_id":"2606.21238","last_updated":"2026-06-19T09:05:01Z","snapshot_observed_at":"2026-08-07T12:20:29.118971Z","submitted_at":"2026-06-19T09:05:01Z","title":"Recency/Frequency Adaptive KV Caching for Large Language Model Serving","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-26T13:24:44.218871Z"},"links":{"cited_paper":"/paper/2501.14312","citing_paper":"/paper/2606.21238"},"observation_digest":"sha256:3bf45063d74123d0e2baccca6b5c22714aade7641fc19a7c196b45121e1e485a","observation_id":"cdf7d4ed-7260-49b5-b85e-2318034ef8ae","resolution":{"observed_at":"2026-07-04T07:29:39.049826Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.14312","last_updated":"2025-01-24T08:12:47Z","snapshot_observed_at":"2026-08-19T01:08:36.561666Z","submitted_at":"2025-01-24T08:12:47Z","title":"Locality-aware Fair Scheduling in LLM Serving","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.14312","snapshot_observed_at":"2026-08-12T05:13:50.303760Z","title":"Gonzalez, and Ion Stoica","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.11152","last_updated":"2026-08-11T17:10:50Z","snapshot_observed_at":"2026-08-19T02:53:12.179344Z","submitted_at":"2026-08-11T17:10:50Z","title":"Scheduling Mixed RL Rollouts Beyond Prefix Locality","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T05:13:50.303760Z"},"links":{"cited_paper":"/paper/2501.14312","citing_paper":"/paper/2608.11152"},"observation_digest":"sha256:f87a49904acc638fe92f2e40a2f5fe8d9f15d5f979686037d4684bdb07cc0998","observation_id":"33e088e5-c92f-4645-b6e3-a4810de06ce4","resolution":{"observed_at":"2026-08-12T05:13:50.303760Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2501.14312/citation-record","integrity":"/paper/2501.14312/integrity","json":"/paper/2501.14312/citation-record.json","paper":"/paper/2501.14312"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:25:04.588976Z","title":"Perplexity: Conversational Search Assis- tant","venue":null,"work_id":"325d6c2b-3ae2-4bce-923e-82975d7a8013","year":null},"citing_paper":{"arxiv_id":"2501.14312","last_updated":"2025-01-24T08:12:47Z","snapshot_observed_at":"2026-08-19T01:08:36.561666Z","submitted_at":"2025-01-24T08:12:47Z","title":"Locality-aware Fair Scheduling in LLM Serving","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T15:25:03.334599Z"},"links":{"citing_paper":"/paper/2501.14312"},"observation_digest":"sha256:c9320924c8b47ad63dfbfd2fbebd326e718126246492febf279f00e1c4cc8a60","observation_id":"cf59dafa-2447-4626-a08e-ebff14b04a9f","resolution":{"observed_at":"2026-08-10T15:25:04.594116Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:25:04.573531Z","title":"Fairness and load balancing in wireless lans using association control","venue":null,"work_id":"08784333-8e73-4ed9-b89f-7af4f9b450cc","year":2004},"citing_paper":{"arxiv_id":"2501.14312","last_updated":"2025-01-24T08:12:47Z","snapshot_observed_at":"2026-08-19T01:08:36.561666Z","submitted_at":"2025-01-24T08:12:47Z","title":"Locality-aware Fair Scheduling in LLM Serving","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-10T15:25:03.340290Z"},"links":{"citing_paper":"/paper/2501.14312"},"observation_digest":"sha256:b6826cb077e0d709305c4b064bc2c9fe52334974ab9c2e2a24b5ea150c8637ca","observation_id":"4b14ba8c-9f0f-4217-8318-82573fcf97b7","resolution":{"observed_at":"2026-08-10T15:25:04.578693Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21787","last_updated":"2024-12-30T19:03:24Z","snapshot_observed_at":"2026-08-14T10:00:52.343929Z","submitted_at":"2024-07-31T17:57:25Z","title":"Large Language Monkeys: Scaling Inference Compute with Repeated Sampling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21787","snapshot_observed_at":"2026-08-10T15:25:03.344995Z","title":"Large language monkeys: Scaling inference compute with repeated sampling","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.14312","last_updated":"2025-01-24T08:12:47Z","snapshot_observed_at":"2026-08-19T01:08:36.561666Z","submitted_at":"2025-01-24T08:12:47Z","title":"Locality-aware Fair Scheduling in LLM Serving","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-10T15:25:03.344995Z"},"links":{"cited_paper":"/paper/2407.21787","citing_paper":"/paper/2501.14312"},"observation_digest":"sha256:686f15a67897472795648200b8689cf0a4ee303726e87dace12fe2e6de43922f","observation_id":"2a124685-6739-489c-91cd-3d7563a5cd97","resolution":{"observed_at":"2026-08-10T15:25:03.344995Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:25:04.558211Z","title":"Bal- ancing efficiency and fairness in heterogeneous gpu clus- ters for deep learning","venue":null,"work_id":"ed213008-5b03-4cd0-a390-3568b3af1101","year":2020},"citing_paper":{"arxiv_id":"2501.14312","last_updated":"2025-01-24T08:12:47Z","snapshot_observed_at":"2026-08-19T01:08:36.561666Z","submitted_at":"2025-01-24T08:12:47Z","title":"Locality-aware Fair Scheduling in LLM Serving","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-10T15:25:03.350423Z"},"links":{"citing_paper":"/paper/2501.14312"},"observation_digest":"sha256:0e67f196285ff1ec3a12f0f8e787f0e8c52228828f867d9344eef6463b382db8","observation_id":"b295ddcc-7441-476f-b60a-b1e301f2b159","resolution":{"observed_at":"2026-08-10T15:25:04.563323Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:25:04.542471Z","title":"Unearthing Inter-Job Dependencies for Better Cluster Scheduling","venue":null,"work_id":"648642e6-5757-4f5d-b236-5e64060ba4fb","year":2020},"citing_paper":{"arxiv_id":"2501.14312","last_updated":"2025-01-24T08:12:47Z","snapshot_observed_at":"2026-08-19T01:08:36.561666Z","submitted_at":"2025-01-24T08:12:47Z","title":"Locality-aware Fair Scheduling in LLM Serving","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T15:25:03.355177Z"},"links":{"citing_paper":"/paper/2501.14312"},"observation_digest":"sha256:6fa912236597834330d2cf1f914cb6388abf9fda0f0d7c7b381fee3303c83de3","observation_id":"869e3ba9-499b-40fb-8c53-b9b51cbd585f","resolution":{"observed_at":"2026-08-10T15:25:04.547795Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-14T02:43:01.480086Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-10T15:25:03.360205Z","title":"Training verifiers to solve math word problems","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.14312","last_updated":"2025-01-24T08:12:47Z","snapshot_observed_at":"2026-08-19T01:08:36.561666Z","submitted_at":"2025-01-24T08:12:47Z","title":"Locality-aware Fair Scheduling in LLM Serving","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-10T15:25:03.360205Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2501.14312"},"observation_digest":"sha256:90dc41ac64696c85a87ba4a9e23b1e439a09739307d17d01e7d3ba31b680688a","observation_id":"2bc277ae-e83c-45db-8450-2bac902ce452","resolution":{"observed_at":"2026-08-10T15:25:03.360205Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06066","last_updated":"2024-01-11T17:31:42Z","snapshot_observed_at":"2026-08-18T13:55:31.813413Z","submitted_at":"2024-01-11T17:31:42Z","title":"DeepSeekMoE: Towards Ultimate Expert Specialization in Mixture-of-Experts Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.06066","snapshot_observed_at":"2026-08-10T15:25:03.365382Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.14312","last_updated":"2025-01-24T08:12:47Z","snapshot_observed_at":"2026-08-19T01:08:36.561666Z","submitted_at":"2025-01-24T08:12:47Z","title":"Locality-aware Fair Scheduling in LLM Serving","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T15:25:03.365382Z"},"links":{"cited_paper":"/paper/2401.06066","citing_paper":"/paper/2501.14312"},"observation_digest":"sha256:6b90b6a1557cf9663d0b1a4a7730ce9dcb6b67e5418a1d0c5faed16c1e7b4706","observation_id":"ad089401-1559-47d8-8fa1-a8356a837ae6","resolution":{"observed_at":"2026-08-10T15:25:03.365382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:25:04.526749Z","title":"Deepseek-r1-lite-preview release","venue":null,"work_id":"9d5603cd-848d-441d-8058-302590fdcb63","year":2024},"citing_paper":{"arxiv_id":"2501.14312","last_updated":"2025-01-24T08:12:47Z","snapshot_observed_at":"2026-08-19T01:08:36.561666Z","submitted_at":"2025-01-24T08:12:47Z","title":"Locality-aware Fair Scheduling in LLM Serving","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T15:25:03.370493Z"},"links":{"citing_paper":"/paper/2501.14312"},"observation_digest":"sha256:a44cbf3b6f4f54ca5c05fc022a8e4a8a714d277069f80bcde59f9dd00fa6aef3","observation_id":"d4fa5475-c8b6-46ef-95b8-7cc46ede0566","resolution":{"observed_at":"2026-08-10T15:25:04.532491Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:25:04.510823Z","title":"Demers, Srinivasan Keshav, and Scott Shenker","venue":null,"work_id":"df22be69-403c-46e0-913a-9d4aa54e8e55","year":1989},"citing_paper":{"arxiv_id":"2501.14312","last_updated":"2025-01-24T08:12:47Z","snapshot_observed_at":"2026-08-19T01:08:36.561666Z","submitted_at":"2025-01-24T08:12:47Z","title":"Locality-aware Fair Scheduling in LLM Serving","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T15:25:03.375673Z"},"links":{"citing_paper":"/paper/2501.14312"},"observation_digest":"sha256:4e19059ac4b6c2397a8081c8bb62a121240d3c454f4afc5736c5cdc182c14e3f","observation_id":"7e9448ee-139e-45a8-aec8-20000efd7740","resolution":{"observed_at":"2026-08-10T15:25:04.516366Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-10T15:25:03.380081Z","title":"The llama 3 herd of models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.14312","last_updated":"2025-01-24T08:12:47Z","snapshot_observed_at":"2026-08-19T01:08:36.561666Z","submitted_at":"2025-01-24T08:12:47Z","title":"Locality-aware Fair Scheduling in LLM Serving","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T15:25:03.380081Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2501.14312"},"observation_digest":"sha256:ca69e2131c54a68246f23a0040624ef1376385e7398d2231fcd8b1feb922990c","observation_id":"4ff89e7d-a5ec-4f88-9642-e08a0e13abc1","resolution":{"observed_at":"2026-08-10T15:25:03.380081Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:25:04.494564Z","title":"Dominant resource fairness: fair allocation of multiple resource types","venue":null,"work_id":"e0b1b4ad-7449-49b8-a90e-d0ba6bb76e3e","year":2011},"citing_paper":{"arxiv_id":"2501.14312","last_updated":"2025-01-24T08:12:47Z","snapshot_observed_at":"2026-08-19T01:08:36.561666Z","submitted_at":"2025-01-24T08:12:47Z","title":"Locality-aware Fair Scheduling in LLM Serving","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T15:25:03.385106Z"},"links":{"citing_paper":"/paper/2501.14312"},"observation_digest":"sha256:a207af431f07c515cbbc39b63da462a99bb0f38efcedb3e1d9aa7df1cd8e58c9","observation_id":"a3937722-ecd4-4c98-aab8-927ebad6d904","resolution":{"observed_at":"2026-08-10T15:25:04.500371Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:25:04.477251Z","title":"Github copilot: Your ai pair programmer","venue":null,"work_id":"5dd99bcf-68f6-4b02-ac00-5b95c2eb14d7","year":null},"citing_paper":{"arxiv_id":"2501.14312","last_updated":"2025-01-24T08:12:47Z","snapshot_observed_at":"2026-08-19T01:08:36.561666Z","submitted_at":"2025-01-24T08:12:47Z","title":"Locality-aware Fair Scheduling in LLM Serving","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T15:25:03.389826Z"},"links":{"citing_paper":"/paper/2501.14312"},"observation_digest":"sha256:e99d523988fc5e3b1b024e1eda9443712f91e62b369aea1e3ba1aa70c3df3752","observation_id":"13619809-d698-480b-97ab-10227b8720f5","resolution":{"observed_at":"2026-08-10T15:25:04.483326Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:25:04.461078Z","title":"Jamaloddin Golestani","venue":null,"work_id":"7f7de39e-4268-45c9-b044-2ed7b119cd3f","year":1994},"citing_paper":{"arxiv_id":"2501.14312","last_updated":"2025-01-24T08:12:47Z","snapshot_observed_at":"2026-08-19T01:08:36.561666Z","submitted_at":"2025-01-24T08:12:47Z","title":"Locality-aware Fair Scheduling in LLM Serving","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-10T15:25:03.394489Z"},"links":{"citing_paper":"/paper/2501.14312"},"observation_digest":"sha256:1a0999c427d4ef5de152032aab2581addf6de84a1929a68c0dddd253ec955c5b","observation_id":"36d8436f-6ad2-4af7-87dc-70d72a0fa2de","resolution":{"observed_at":"2026-08-10T15:25:04.466583Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:25:04.444732Z","title":"Vin, and Haichen Cheng","venue":null,"work_id":"034c3640-a14c-47a5-bb76-5c30423dd78b","year":1996},"citing_paper":{"arxiv_id":"2501.14312","last_updated":"2025-01-24T08:12:47Z","snapshot_observed_at":"2026-08-19T01:08:36.561666Z","submitted_at":"2025-01-24T08:12:47Z","title":"Locality-aware Fair Scheduling in LLM Serving","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-10T15:25:03.398962Z"},"links":{"citing_paper":"/paper/2501.14312"},"observation_digest":"sha256:e0a10e46b26e336f44449009fa680877d7843f243940d2afaa2a5129fbbf66b0","observation_id":"46bb8218-f1a7-4522-a892-cb44facd1a53","resolution":{"observed_at":"2026-08-10T15:25:04.450394Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:25:04.428190Z","title":"Altruistic scheduling in Multi-Resource clusters","venue":null,"work_id":"7f7765bf-d4d7-4387-ae7d-ea21442f7a6d","year":null},"citing_paper":{"arxiv_id":"2501.14312","last_updated":"2025-01-24T08:12:47Z","snapshot_observed_at":"2026-08-19T01:08:36.561666Z","submitted_at":"2025-01-24T08:12:47Z","title":"Locality-aware Fair Scheduling in LLM Serving","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T15:25:03.403473Z"},"links":{"citing_paper":"/paper/2501.14312"},"observation_digest":"sha256:8e5e7b3d71255ea3106200c4de8efeb4d285c2827c77d2ee7f4d837d4b4b3a9d","observation_id":"d4d28d76-41c1-4874-9646-a7a56949b465","resolution":{"observed_at":"2026-08-10T15:25:04.434229Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:25:04.411972Z","title":"Quincy: Fair scheduling for distributed computing clusters","venue":null,"work_id":"4337d0e4-ce4c-4cef-bd9e-2a940f251397","year":2009},"citing_paper":{"arxiv_id":"2501.14312","last_updated":"2025-01-24T08:12:47Z","snapshot_observed_at":"2026-08-19T01:08:36.561666Z","submitted_at":"2025-01-24T08:12:47Z","title":"Locality-aware Fair Scheduling in LLM Serving","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T15:25:03.408163Z"},"links":{"citing_paper":"/paper/2501.14312"},"observation_digest":"sha256:945cd539ed024e1c08983b7d2d6a08aad73245dbb9c2f3db76fb30bbaf9fa935","observation_id":"c14873f1-621a-4065-804c-85094fb44993","resolution":{"observed_at":"2026-08-10T15:25:04.417699Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:25:04.396018Z","title":"A quantitative measure of fairness and discrimina- tion","venue":null,"work_id":"e0c91fa3-fbf2-4610-b792-6717b77d9a30","year":1984},"citing_paper":{"arxiv_id":"2501.14312","last_updated":"2025-01-24T08:12:47Z","snapshot_observed_at":"2026-08-19T01:08:36.561666Z","submitted_at":"2025-01-24T08:12:47Z","title":"Locality-aware Fair Scheduling in LLM Serving","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T15:25:03.412641Z"},"links":{"citing_paper":"/paper/2501.14312"},"observation_digest":"sha256:4ae646fa6f2c05f49ff50c7712f7d31dc67366b6ffdc4f585723456dc170cf74","observation_id":"11080ce0-748e-4387-8b4f-a9b4a272b7b1","resolution":{"observed_at":"2026-08-10T15:25:04.401295Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06825","last_updated":"2023-10-10T17:54:58Z","snapshot_observed_at":"2026-08-17T20:30:34.016254Z","submitted_at":"2023-10-10T17:54:58Z","title":"Mistral 7B","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06825","snapshot_observed_at":"2026-08-10T15:25:03.417003Z","title":"Mistral 7b.arXiv preprint arXiv:2310.06825, 2023","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.14312","last_updated":"2025-01-24T08:12:47Z","snapshot_observed_at":"2026-08-19T01:08:36.561666Z","submitted_at":"2025-01-24T08:12:47Z","title":"Locality-aware Fair Scheduling in LLM Serving","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-10T15:25:03.417003Z"},"links":{"cited_paper":"/paper/2310.06825","citing_paper":"/paper/2501.14312"},"observation_digest":"sha256:f7b4d1b43d3641be00158669389e69ef691f66305d330c67b22856f018e82113","observation_id":"a55f14e9-a3b3-417c-8741-91e532e083e5","resolution":{"observed_at":"2026-08-10T15:25:03.417003Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:25:04.380018Z","title":"Chase, and Jasleen Kaur","venue":null,"work_id":"702abadd-e836-4376-9a72-62a89d9ed514","year":2004},"citing_paper":{"arxiv_id":"2501.14312","last_updated":"2025-01-24T08:12:47Z","snapshot_observed_at":"2026-08-19T01:08:36.561666Z","submitted_at":"2025-01-24T08:12:47Z","title":"Locality-aware Fair Scheduling in LLM Serving","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-10T15:25:03.422735Z"},"links":{"citing_paper":"/paper/2501.14312"},"observation_digest":"sha256:ae692818076e6836fc1330d20cfea09f48fd38e967c5885702ca8e0c32349281","observation_id":"2eab1ac7-7a84-4cfd-a383-cfc3c703923e","resolution":{"observed_at":"2026-08-10T15:25:04.385461Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:25:04.363559Z","title":"CFS Sched- uler","venue":null,"work_id":"91209272-3ff7-4725-9282-5338d428ac4d","year":null},"citing_paper":{"arxiv_id":"2501.14312","last_updated":"2025-01-24T08:12:47Z","snapshot_observed_at":"2026-08-19T01:08:36.561666Z","submitted_at":"2025-01-24T08:12:47Z","title":"Locality-aware Fair Scheduling in LLM Serving","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-10T15:25:03.427344Z"},"links":{"citing_paper":"/paper/2501.14312"},"observation_digest":"sha256:6941001605f5fad9e0360bbd9520249942b416f7db87d8d06712dd75dbd8d33f","observation_id":"0211ae51-6ef1-405b-9428-b37b9a0d23ec","resolution":{"observed_at":"2026-08-10T15:25:04.369249Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:25:04.347353Z","title":"Com- pletely fair scheduler","venue":null,"work_id":"b12d91df-bf70-4bbd-b61c-68b5221e0278","year":null},"citing_paper":{"arxiv_id":"2501.14312","last_updated":"2025-01-24T08:12:47Z","snapshot_observed_at":"2026-08-19T01:08:36.561666Z","submitted_at":"2025-01-24T08:12:47Z","title":"Locality-aware Fair Scheduling in LLM Serving","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-10T15:25:03.432542Z"},"links":{"citing_paper":"/paper/2501.14312"},"observation_digest":"sha256:5057aa72bea393decd2a23800a9edc0f6ee5827f201f0d2998865eb390bb7dca","observation_id":"bc3467a7-1c25-4045-bbcb-1412b949c9f7","resolution":{"observed_at":"2026-08-10T15:25:04.352673Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:25:04.331282Z","title":"Efficient memory man- agement for large language model serving with paged attention","venue":null,"work_id":"d99c3e37-facb-44ca-9fb5-6fa434ed4a56","year":2023},"citing_paper":{"arxiv_id":"2501.14312","last_updated":"2025-01-24T08:12:47Z","snapshot_observed_at":"2026-08-19T01:08:36.561666Z","submitted_at":"2025-01-24T08:12:47Z","title":"Locality-aware Fair Scheduling in LLM Serving","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-10T15:25:03.437298Z"},"links":{"citing_paper":"/paper/2501.14312"},"observation_digest":"sha256:e0e92dc8dd7f3334e6ee8804808e3af28def6feb142a34f5be97137603295640","observation_id":"65eb2b19-3e92-40a2-bf04-3fbeeaa8f514","resolution":{"observed_at":"2026-08-10T15:25:04.336870Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:25:04.314567Z","title":"An axiomatic theory of fairness in network resource allocation","venue":null,"work_id":"8e1e29e4-11c1-413d-b5a0-d3be00076d71","year":2010},"citing_paper":{"arxiv_id":"2501.14312","last_updated":"2025-01-24T08:12:47Z","snapshot_observed_at":"2026-08-19T01:08:36.561666Z","submitted_at":"2025-01-24T08:12:47Z","title":"Locality-aware Fair Scheduling in LLM Serving","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-10T15:25:03.441946Z"},"links":{"citing_paper":"/paper/2501.14312"},"observation_digest":"sha256:a8b3e3afc4d8bf6050558e648cd284019cd0e6666b59fb14a67a8484336dfa2f","observation_id":"5a1527df-7bd1-42be-ba15-014669aa89d5","resolution":{"observed_at":"2026-08-10T15:25:04.320778Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.04939","last_updated":"2024-09-06T05:06:51Z","snapshot_observed_at":"2026-08-16T14:45:06.045654Z","submitted_at":"2023-11-08T01:45:37Z","title":"LooGLE: Can Long-Context Language Models Understand Long Contexts?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.04939","snapshot_observed_at":"2026-08-10T15:25:03.446327Z","title":"Loogle: Can long-context language mod- els understand long contexts? arXiv preprint arXiv:2311.04939, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.14312","last_updated":"2025-01-24T08:12:47Z","snapshot_observed_at":"2026-08-19T01:08:36.561666Z","submitted_at":"2025-01-24T08:12:47Z","title":"Locality-aware Fair Scheduling in LLM Serving","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-10T15:25:03.446327Z"},"links":{"cited_paper":"/paper/2311.04939","citing_paper":"/paper/2501.14312"},"observation_digest":"sha256:074fde81fd2e18b052794cc887140d00aff5bf7b2970fa710e83962ce1641098","observation_id":"42c754b4-3301-46b0-9ad4-e9c0c4129abe","resolution":{"observed_at":"2026-08-10T15:25:03.446327Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:25:04.263148Z","title":"{AlpaServe}: Sta- tistical multiplexing with model parallelism for deep learning serving","venue":null,"work_id":"2a9a9613-3d04-435c-89a9-80e67abc16b3","year":2023},"citing_paper":{"arxiv_id":"2501.14312","last_updated":"2025-01-24T08:12:47Z","snapshot_observed_at":"2026-08-19T01:08:36.561666Z","submitted_at":"2025-01-24T08:12:47Z","title":"Locality-aware Fair Scheduling in LLM Serving","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-10T15:25:03.450974Z"},"links":{"citing_paper":"/paper/2501.14312"},"observation_digest":"sha256:4515175197bf80445b8d7ff3eed1c5a4f5b1d3bf2114d0fcfb56815d538fd1cc","observation_id":"306ee94c-d263-47d9-9266-82b70f0f0008","resolution":{"observed_at":"2026-08-10T15:25:04.283728Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:25:04.227048Z","title":"Self- refine: Iterative refinement with self-feedback.Advances in Neural Information Processing Systems, 36, 2024","venue":null,"work_id":"9754e19a-26e8-4159-9d94-f16d447b8816","year":2024},"citing_paper":{"arxiv_id":"2501.14312","last_updated":"2025-01-24T08:12:47Z","snapshot_observed_at":"2026-08-19T01:08:36.561666Z","submitted_at":"2025-01-24T08:12:47Z","title":"Locality-aware Fair Scheduling in LLM Serving","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-10T15:25:03.454953Z"},"links":{"citing_paper":"/paper/2501.14312"},"observation_digest":"sha256:30cb2d587ea375db960bd397ded654037a357cd85b7083734c5c09f5d908652c","observation_id":"8a7a9f29-0bfc-4657-af80-fa71b750a100","resolution":{"observed_at":"2026-08-10T15:25:04.240157Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:25:04.209336Z","title":"Themis: Fair and effi- cient gpu cluster scheduling","venue":null,"work_id":"2e4afd62-5fbe-4564-aec0-069b20733740","year":2020},"citing_paper":{"arxiv_id":"2501.14312","last_updated":"2025-01-24T08:12:47Z","snapshot_observed_at":"2026-08-19T01:08:36.561666Z","submitted_at":"2025-01-24T08:12:47Z","title":"Locality-aware Fair Scheduling in LLM Serving","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-10T15:25:03.458735Z"},"links":{"citing_paper":"/paper/2501.14312"},"observation_digest":"sha256:43d5eb3076baf1db5258c7c8154773f8bed13c38c46c83709951b57598d994bb","observation_id":"f2842205-be90-41d7-82d7-fea1187090ef","resolution":{"observed_at":"2026-08-10T15:25:04.215207Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:25:04.192269Z","title":"{Heterogeneity-Aware} cluster scheduling policies for deep learning workloads","venue":null,"work_id":"28b2159a-1db2-4e5c-abfc-11b8212c6b17","year":2020},"citing_paper":{"arxiv_id":"2501.14312","last_updated":"2025-01-24T08:12:47Z","snapshot_observed_at":"2026-08-19T01:08:36.561666Z","submitted_at":"2025-01-24T08:12:47Z","title":"Locality-aware Fair Scheduling in LLM Serving","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-10T15:25:03.462736Z"},"links":{"citing_paper":"/paper/2501.14312"},"observation_digest":"sha256:ecaef3bd17c522e6dafd0c4a676f2ecac31baf9e35a3c5c05ebd969cd8db68ee","observation_id":"1b5f8d37-2dbb-4192-ab63-7ce1a2bf239e","resolution":{"observed_at":"2026-08-10T15:25:04.198396Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:25:04.174318Z","title":"Nesbit, Nidhi Aggarwal, James Laudon, and James E","venue":null,"work_id":"e74dc5f0-aa89-4fbb-b1dc-15be5ca34dfa","year":2006},"citing_paper":{"arxiv_id":"2501.14312","last_updated":"2025-01-24T08:12:47Z","snapshot_observed_at":"2026-08-19T01:08:36.561666Z","submitted_at":"2025-01-24T08:12:47Z","title":"Locality-aware Fair Scheduling in LLM Serving","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-10T15:25:03.467032Z"},"links":{"citing_paper":"/paper/2501.14312"},"observation_digest":"sha256:8c1be7bb9e4799b653cb79b425bb6bdddd7682d733a63abfa9cb74accb852be6","observation_id":"42d5aeeb-3571-4453-a8a8-171c53c9f814","resolution":{"observed_at":"2026-08-10T15:25:04.180356Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:25:04.156779Z","title":"Skeleton-of-thought: Prompting LLMs for efficient parallel generation","venue":null,"work_id":"65bb2fb0-59b1-4d3f-9a4b-3e857d15ec04","year":2024},"citing_paper":{"arxiv_id":"2501.14312","last_updated":"2025-01-24T08:12:47Z","snapshot_observed_at":"2026-08-19T01:08:36.561666Z","submitted_at":"2025-01-24T08:12:47Z","title":"Locality-aware Fair Scheduling in LLM Serving","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-10T15:25:03.470799Z"},"links":{"citing_paper":"/paper/2501.14312"},"observation_digest":"sha256:a1abbd9cca151531912f657b2cab04d04e3305d8b5a9761e442ee5eb7f75f6d0","observation_id":"8c019aca-3e79-4625-b0fb-40d21fe6b0e4","resolution":{"observed_at":"2026-08-10T15:25:04.162454Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:25:03.474594Z","title":"Gpt-4 technical report, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.14312","last_updated":"2025-01-24T08:12:47Z","snapshot_observed_at":"2026-08-19T01:08:36.561666Z","submitted_at":"2025-01-24T08:12:47Z","title":"Locality-aware Fair Scheduling in LLM Serving","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-10T15:25:03.474594Z"},"links":{"citing_paper":"/paper/2501.14312"},"observation_digest":"sha256:ae5510e61045b54c4369e7e5062366f7e755255546b78e51bcfe18aa52b1416f","observation_id":"9fc8be8a-9e42-4147-a95e-dcccfe3a2b78","resolution":{"observed_at":"2026-08-10T15:25:03.474594Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:25:04.128524Z","title":"Rate limit","venue":null,"work_id":"9bc4cdf5-f412-4cc1-a5dc-734689f6a826","year":2023},"citing_paper":{"arxiv_id":"2501.14312","last_updated":"2025-01-24T08:12:47Z","snapshot_observed_at":"2026-08-19T01:08:36.561666Z","submitted_at":"2025-01-24T08:12:47Z","title":"Locality-aware Fair Scheduling in LLM Serving","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-10T15:25:03.478440Z"},"links":{"citing_paper":"/paper/2501.14312"},"observation_digest":"sha256:d2c7ad3b71b8e65a514fbc45eaa7904c2a99f62d0689ba1a28b118ce5b3e32e6","observation_id":"0be02ea0-a056-45b6-855a-51d709c40fad","resolution":{"observed_at":"2026-08-10T15:25:04.135747Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:25:04.111448Z","title":"Learning to reason with llms","venue":null,"work_id":"59b8cd61-54e4-4308-b44f-f6ba4b5cea64","year":2024},"citing_paper":{"arxiv_id":"2501.14312","last_updated":"2025-01-24T08:12:47Z","snapshot_observed_at":"2026-08-19T01:08:36.561666Z","submitted_at":"2025-01-24T08:12:47Z","title":"Locality-aware Fair Scheduling in LLM Serving","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-10T15:25:03.482651Z"},"links":{"citing_paper":"/paper/2501.14312"},"observation_digest":"sha256:cfcfa773844d70ed2bf2d31ee0a130bc453e20aeb00dd952668d59d58718fe1c","observation_id":"ac4a4d76-8bc7-4c05-97ce-e42439d68816","resolution":{"observed_at":"2026-08-10T15:25:04.116708Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:25:04.095762Z","title":"Parekh and R.G","venue":null,"work_id":"75dd6243-929a-4152-b6bc-4582e6ff4ee5","year":1993},"citing_paper":{"arxiv_id":"2501.14312","last_updated":"2025-01-24T08:12:47Z","snapshot_observed_at":"2026-08-19T01:08:36.561666Z","submitted_at":"2025-01-24T08:12:47Z","title":"Locality-aware Fair Scheduling in LLM Serving","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-10T15:25:03.486703Z"},"links":{"citing_paper":"/paper/2501.14312"},"observation_digest":"sha256:feb4331691ec4a34cd70cb3edd321daf5c49d0f544d64e13f349fd53b0c9553b","observation_id":"d65ccfa5-2b13-4943-ac46-901733a6a050","resolution":{"observed_at":"2026-08-10T15:25:04.101037Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:25:03.491063Z","title":"O’Brien, Carrie J","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.14312","last_updated":"2025-01-24T08:12:47Z","snapshot_observed_at":"2026-08-19T01:08:36.561666Z","submitted_at":"2025-01-24T08:12:47Z","title":"Locality-aware Fair Scheduling in LLM Serving","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-10T15:25:03.491063Z"},"links":{"citing_paper":"/paper/2501.14312"},"observation_digest":"sha256:d33f21c281e512809642c48732723f8689b269b30dead4abf9d1709b018c5704","observation_id":"8dfb0cfb-f548-4920-af8f-220b914ea3d8","resolution":{"observed_at":"2026-08-10T15:25:03.491063Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.15334","last_updated":"2023-05-24T16:48:11Z","snapshot_observed_at":"2026-08-14T14:07:14.900729Z","submitted_at":"2023-05-24T16:48:11Z","title":"Gorilla: Large Language Model Connected with Massive APIs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.15334","snapshot_observed_at":"2026-08-10T15:25:03.495555Z","title":"Patil, Tianjun Zhang, Xin Wang, and Joseph E","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.14312","last_updated":"2025-01-24T08:12:47Z","snapshot_observed_at":"2026-08-19T01:08:36.561666Z","submitted_at":"2025-01-24T08:12:47Z","title":"Locality-aware Fair Scheduling in LLM Serving","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-10T15:25:03.495555Z"},"links":{"cited_paper":"/paper/2305.15334","citing_paper":"/paper/2501.14312"},"observation_digest":"sha256:050bfc81671d7948b0d8f3a1a3e7ef5585c70d751bfce40f1accc9470db08de3","observation_id":"a0ae98b1-8efd-4fc3-9b18-5811345a0079","resolution":{"observed_at":"2026-08-10T15:25:03.495555Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:25:03.500011Z","title":"Efficiently scal- ing transformer inference","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.14312","last_updated":"2025-01-24T08:12:47Z","snapshot_observed_at":"2026-08-19T01:08:36.561666Z","submitted_at":"2025-01-24T08:12:47Z","title":"Locality-aware Fair Scheduling in LLM Serving","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-10T15:25:03.500011Z"},"links":{"citing_paper":"/paper/2501.14312"},"observation_digest":"sha256:cc933e708d3e3eea4df2272059ea41b152fbacf17243f802c7a00a6a62a08dbe","observation_id":"faee6205-5029-495d-93f1-caf1b84983b5","resolution":{"observed_at":"2026-08-10T15:25:03.500011Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.07199","last_updated":"2024-08-13T20:52:13Z","snapshot_observed_at":"2026-08-14T15:46:52.927758Z","submitted_at":"2024-08-13T20:52:13Z","title":"Agent Q: Advanced Reasoning and Learning for Autonomous AI Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.07199","snapshot_observed_at":"2026-08-10T15:25:03.504629Z","title":"Agent q: Advanced reasoning and learning for au- tonomous ai agents","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.14312","last_updated":"2025-01-24T08:12:47Z","snapshot_observed_at":"2026-08-19T01:08:36.561666Z","submitted_at":"2025-01-24T08:12:47Z","title":"Locality-aware Fair Scheduling in LLM Serving","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-10T15:25:03.504629Z"},"links":{"cited_paper":"/paper/2408.07199","citing_paper":"/paper/2501.14312"},"observation_digest":"sha256:849c4661803c9e618b87340f89109c8fddee37e8aaa422d83595fa4f724fdedc","observation_id":"fec3339f-f14e-485c-ae68-6b38cd66f9ab","resolution":{"observed_at":"2026-08-10T15:25:03.504629Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:25:04.060269Z","title":"Pollux: Co-adaptive cluster scheduling for goodput-optimized deep learning","venue":null,"work_id":"3c0f24b9-8a20-48aa-9281-ddfe76fc4558","year":2021},"citing_paper":{"arxiv_id":"2501.14312","last_updated":"2025-01-24T08:12:47Z","snapshot_observed_at":"2026-08-19T01:08:36.561666Z","submitted_at":"2025-01-24T08:12:47Z","title":"Locality-aware Fair Scheduling in LLM Serving","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-10T15:25:03.509352Z"},"links":{"citing_paper":"/paper/2501.14312"},"observation_digest":"sha256:f2883b921b35a841bfb9433bf0ccad1b8c28bc02ffb613d4df02a99fdfee5884","observation_id":"5dba6121-327f-47ac-9b32-2fc54391b45e","resolution":{"observed_at":"2026-08-10T15:25:04.065770Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.04761","last_updated":"2023-02-09T16:49:57Z","snapshot_observed_at":"2026-07-06T14:50:07.491434Z","submitted_at":"2023-02-09T16:49:57Z","title":"Toolformer: Language Models Can Teach Themselves to Use Tools","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.04761","snapshot_observed_at":"2026-08-10T15:25:03.513616Z","title":"Toolformer: Language models can teach themselves to use tools.arXiv preprint arXiv:2302.04761, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.14312","last_updated":"2025-01-24T08:12:47Z","snapshot_observed_at":"2026-08-19T01:08:36.561666Z","submitted_at":"2025-01-24T08:12:47Z","title":"Locality-aware Fair Scheduling in LLM Serving","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-10T15:25:03.513616Z"},"links":{"cited_paper":"/paper/2302.04761","citing_paper":"/paper/2501.14312"},"observation_digest":"sha256:6d53f6f6bed4de30487e509f8fd710b6b63e9e0c0df86336ca09afaca0c5572a","observation_id":"2c4bd1a2-bd40-488e-9465-79011aecbd48","resolution":{"observed_at":"2026-08-10T15:25:03.513616Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03285","last_updated":"2024-06-05T06:06:43Z","snapshot_observed_at":"2026-08-16T14:45:35.195361Z","submitted_at":"2023-11-06T17:26:17Z","title":"S-LoRA: Serving Thousands of Concurrent LoRA Adapters","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.03285","snapshot_observed_at":"2026-08-10T15:25:03.518208Z","title":"Gonzalez, and Ion Stoica","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.14312","last_updated":"2025-01-24T08:12:47Z","snapshot_observed_at":"2026-08-19T01:08:36.561666Z","submitted_at":"2025-01-24T08:12:47Z","title":"Locality-aware Fair Scheduling in LLM Serving","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-10T15:25:03.518208Z"},"links":{"cited_paper":"/paper/2311.03285","citing_paper":"/paper/2501.14312"},"observation_digest":"sha256:ba0efd07faa5966086218fdbc27f96490ccd2d65ab357c093414c727e833da63","observation_id":"6e8ed655-8260-47bb-8273-f228a6607ff5","resolution":{"observed_at":"2026-08-10T15:25:03.518208Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:25:04.043194Z","title":"Fairness in Serving Large Language Models","venue":null,"work_id":"84aad22f-5c0a-429b-a4f0-eff8929fa788","year":2024},"citing_paper":{"arxiv_id":"2501.14312","last_updated":"2025-01-24T08:12:47Z","snapshot_observed_at":"2026-08-19T01:08:36.561666Z","submitted_at":"2025-01-24T08:12:47Z","title":"Locality-aware Fair Scheduling in LLM Serving","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-10T15:25:03.523051Z"},"links":{"citing_paper":"/paper/2501.14312"},"observation_digest":"sha256:99b12e410650011610e9faa860a31e7a6db493fc7f6a0f7aa9ac7c077d0d9696","observation_id":"af8f2395-abae-42c6-9928-ce4d06fc1af5","resolution":{"observed_at":"2026-08-10T15:25:04.048689Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:25:04.027843Z","title":"Shreedhar and George Varghese","venue":null,"work_id":"c712c7ac-b7e6-4d51-a667-e02fa02e4126","year":1996},"citing_paper":{"arxiv_id":"2501.14312","last_updated":"2025-01-24T08:12:47Z","snapshot_observed_at":"2026-08-19T01:08:36.561666Z","submitted_at":"2025-01-24T08:12:47Z","title":"Locality-aware Fair Scheduling in LLM Serving","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-10T15:25:03.527566Z"},"links":{"citing_paper":"/paper/2501.14312"},"observation_digest":"sha256:da9f37aad33fd9d5ddc29acd71a828d25dfc63a26993e92236776189ffbf3f57","observation_id":"6b304e6c-60ab-4d6f-87eb-84f9f301462e","resolution":{"observed_at":"2026-08-10T15:25:04.032574Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03314","last_updated":"2024-08-06T17:35:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:35:05Z","title":"Scaling LLM Test-Time Compute Optimally can be More Effective than Scaling Model Parameters","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03314","snapshot_observed_at":"2026-08-10T15:25:03.532273Z","title":"Scaling llm test-time compute optimally can be more effective than scaling model parameters","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.14312","last_updated":"2025-01-24T08:12:47Z","snapshot_observed_at":"2026-08-19T01:08:36.561666Z","submitted_at":"2025-01-24T08:12:47Z","title":"Locality-aware Fair Scheduling in LLM Serving","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-10T15:25:03.532273Z"},"links":{"cited_paper":"/paper/2408.03314","citing_paper":"/paper/2501.14312"},"observation_digest":"sha256:1e4e629d89306c065b8e01a69644d05afff50093aec0177ee63bfb7094f7d021","observation_id":"a68e6c10-b96b-400b-9f59-91ff5c781f76","resolution":{"observed_at":"2026-08-10T15:25:03.532273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:25:04.012005Z","title":"Preble: Efficient Distributed Prompt Scheduling for LLM Serving","venue":null,"work_id":"a845fe48-dd3d-4b05-9f25-37558748a702","year":2024},"citing_paper":{"arxiv_id":"2501.14312","last_updated":"2025-01-24T08:12:47Z","snapshot_observed_at":"2026-08-19T01:08:36.561666Z","submitted_at":"2025-01-24T08:12:47Z","title":"Locality-aware Fair Scheduling in LLM Serving","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-10T15:25:03.537196Z"},"links":{"citing_paper":"/paper/2501.14312"},"observation_digest":"sha256:935194968002c8a63a295f050d395c8d2a85da5aebd8cd330cf00db474865782","observation_id":"18d5163c-02b9-49cc-8a0b-b9195e0ef83a","resolution":{"observed_at":"2026-08-10T15:25:04.017245Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:25:03.996900Z","title":"Can Scheduling Overhead Dom- inate LLM Inference Performance? A Study of CPU Scheduling Overhead on Two Popular LLM Infer- ence Systems","venue":null,"work_id":"d3bcf6f7-a86f-4ff9-8ed0-41383bdd7f5a","year":null},"citing_paper":{"arxiv_id":"2501.14312","last_updated":"2025-01-24T08:12:47Z","snapshot_observed_at":"2026-08-19T01:08:36.561666Z","submitted_at":"2025-01-24T08:12:47Z","title":"Locality-aware Fair Scheduling in LLM Serving","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-10T15:25:03.541833Z"},"links":{"citing_paper":"/paper/2501.14312"},"observation_digest":"sha256:ca3452d689dfb65d2dd60c1aa128b0503776ed453a6023df8a376e1d08a73c18","observation_id":"8bfeb0a3-68c7-453e-907b-cf0c6c9c3180","resolution":{"observed_at":"2026-08-10T15:25:04.001724Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:25:03.982207Z","title":"Earliest Eligi- ble Virtual Deadline First: A Flexible and Accurate Mechanism for Proportional Share Resource Allocation","venue":null,"work_id":"e67c5161-5bc9-47b8-96b1-6d291c48daba","year":1995},"citing_paper":{"arxiv_id":"2501.14312","last_updated":"2025-01-24T08:12:47Z","snapshot_observed_at":"2026-08-19T01:08:36.561666Z","submitted_at":"2025-01-24T08:12:47Z","title":"Locality-aware Fair Scheduling in LLM Serving","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-10T15:25:03.546376Z"},"links":{"citing_paper":"/paper/2501.14312"},"observation_digest":"sha256:6c5e85e1a3119c739230d2f1373b440f2844e434af5bf15d8c15ad943ff51465","observation_id":"f7976659-769c-4866-a405-31b3f98dbd42","resolution":{"observed_at":"2026-08-10T15:25:03.987385Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:25:03.550916Z","title":"Attention is all you need.Advances in neural information processing systems, 30, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.14312","last_updated":"2025-01-24T08:12:47Z","snapshot_observed_at":"2026-08-19T01:08:36.561666Z","submitted_at":"2025-01-24T08:12:47Z","title":"Locality-aware Fair Scheduling in LLM Serving","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-10T15:25:03.550916Z"},"links":{"citing_paper":"/paper/2501.14312"},"observation_digest":"sha256:edbf6dc7483c4f00bc7f9109fcae1cee32f25f13f46585cebb036f7e03e33ede","observation_id":"d179fdad-04ba-4d89-8685-b3b550354f0f","resolution":{"observed_at":"2026-08-10T15:25:03.550916Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.16291","last_updated":"2023-10-19T16:27:03Z","snapshot_observed_at":"2026-08-13T16:55:46.498156Z","submitted_at":"2023-05-25T17:46:38Z","title":"Voyager: An Open-Ended Embodied Agent with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.16291","snapshot_observed_at":"2026-08-10T15:25:03.555391Z","title":"V oyager: An open-ended embodied agent with large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.14312","last_updated":"2025-01-24T08:12:47Z","snapshot_observed_at":"2026-08-19T01:08:36.561666Z","submitted_at":"2025-01-24T08:12:47Z","title":"Locality-aware Fair Scheduling in LLM Serving","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-10T15:25:03.555391Z"},"links":{"cited_paper":"/paper/2305.16291","citing_paper":"/paper/2501.14312"},"observation_digest":"sha256:bd01ab9a707a106ab96d03b8ae65c31fea72ad329408753cffebb4eb90ba524b","observation_id":"90f1c285-2d6e-4cfb-b41b-666acaba818a","resolution":{"observed_at":"2026-08-10T15:25:03.555391Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:25:03.956638Z","title":"Max-min fairness","venue":null,"work_id":"ad49f3b6-2ac7-43c8-863f-7218e8e899ab","year":null},"citing_paper":{"arxiv_id":"2501.14312","last_updated":"2025-01-24T08:12:47Z","snapshot_observed_at":"2026-08-19T01:08:36.561666Z","submitted_at":"2025-01-24T08:12:47Z","title":"Locality-aware Fair Scheduling in LLM Serving","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-10T15:25:03.560139Z"},"links":{"citing_paper":"/paper/2501.14312"},"observation_digest":"sha256:5443ef7914980a1c7be60aeb50a0ac53613a32c60b183c4dc424b19475772e84","observation_id":"462e1a0a-d55c-4ba0-86e6-4c5e1346d1a3","resolution":{"observed_at":"2026-08-10T15:25:03.961380Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10671","last_updated":"2024-09-10T13:25:53Z","snapshot_observed_at":"2026-08-17T11:08:48.802438Z","submitted_at":"2024-07-15T12:35:42Z","title":"Qwen2 Technical Report","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10671","snapshot_observed_at":"2026-08-10T15:25:03.564609Z","title":"Qwen2 technical report","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.14312","last_updated":"2025-01-24T08:12:47Z","snapshot_observed_at":"2026-08-19T01:08:36.561666Z","submitted_at":"2025-01-24T08:12:47Z","title":"Locality-aware Fair Scheduling in LLM Serving","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-10T15:25:03.564609Z"},"links":{"cited_paper":"/paper/2407.10671","citing_paper":"/paper/2501.14312"},"observation_digest":"sha256:2a84b21c664dae4ec383a37c8ac40d7c63002f238de014b3595e360d4449352d","observation_id":"b79be891-407b-49d0-8282-da7c5ae3ac32","resolution":{"observed_at":"2026-08-10T15:25:03.564609Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:25:03.940397Z","title":"Tree of thoughts: Deliberate problem solving with large lan- guage models","venue":null,"work_id":"10c15849-dd0e-491a-b9cb-71a62c819696","year":2024},"citing_paper":{"arxiv_id":"2501.14312","last_updated":"2025-01-24T08:12:47Z","snapshot_observed_at":"2026-08-19T01:08:36.561666Z","submitted_at":"2025-01-24T08:12:47Z","title":"Locality-aware Fair Scheduling in LLM Serving","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-10T15:25:03.569883Z"},"links":{"citing_paper":"/paper/2501.14312"},"observation_digest":"sha256:f04b749ee712b9f059ba9b830082b5955243b74c12a00800ae598ac915962105","observation_id":"269ef925-2fb6-465c-88da-a721da077d3d","resolution":{"observed_at":"2026-08-10T15:25:03.945154Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:25:03.925469Z","title":"Orca: A distributed serving system for transformer-based generative mod- els","venue":null,"work_id":"da3f500d-c052-46ae-a2ef-4bcf13de34f0","year":2022},"citing_paper":{"arxiv_id":"2501.14312","last_updated":"2025-01-24T08:12:47Z","snapshot_observed_at":"2026-08-19T01:08:36.561666Z","submitted_at":"2025-01-24T08:12:47Z","title":"Locality-aware Fair Scheduling in LLM Serving","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-10T15:25:03.574352Z"},"links":{"citing_paper":"/paper/2501.14312"},"observation_digest":"sha256:e6c2a917dbeacc72309962cabe7215c4ceb116d08087e927e5bcee4f80c6ed20","observation_id":"f51f4cd1-13da-4091-8098-bd59d946b8cc","resolution":{"observed_at":"2026-08-10T15:25:03.930231Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:25:03.910181Z","title":"Delay Scheduling: a Simple Technique for Achieving Locality and Fairness in Cluster Scheduling","venue":null,"work_id":"f77f5d8e-3a27-4aa4-91d1-593f959db399","year":2010},"citing_paper":{"arxiv_id":"2501.14312","last_updated":"2025-01-24T08:12:47Z","snapshot_observed_at":"2026-08-19T01:08:36.561666Z","submitted_at":"2025-01-24T08:12:47Z","title":"Locality-aware Fair Scheduling in LLM Serving","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-10T15:25:03.579004Z"},"links":{"citing_paper":"/paper/2501.14312"},"observation_digest":"sha256:26789df65606227bceafb0df831421d73870f7573dd5f46803563526c863d486","observation_id":"3683dc28-3382-4270-a35f-9f76d1fd57ef","resolution":{"observed_at":"2026-08-10T15:25:03.915117Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.03816","last_updated":"2024-11-18T05:36:16Z","snapshot_observed_at":"2026-08-19T22:24:29.848660Z","submitted_at":"2024-06-06T07:40:00Z","title":"ReST-MCTS*: LLM Self-Training via Process Reward Guided Tree Search","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.03816","snapshot_observed_at":"2026-08-10T15:25:03.583593Z","title":"Rest-mcts*: Llm self- training via process reward guided tree search","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.14312","last_updated":"2025-01-24T08:12:47Z","snapshot_observed_at":"2026-08-19T01:08:36.561666Z","submitted_at":"2025-01-24T08:12:47Z","title":"Locality-aware Fair Scheduling in LLM Serving","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-10T15:25:03.583593Z"},"links":{"cited_paper":"/paper/2406.03816","citing_paper":"/paper/2501.14312"},"observation_digest":"sha256:66d7a7adb9d2a922b004d22c019cdb9ea576de7843ffda94315683ab6a6d9eee","observation_id":"1bc6ab0c-4925-41b2-aa0f-7f7ec2aca181","resolution":{"observed_at":"2026-08-10T15:25:03.583593Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.16102","last_updated":"2026-06-05T23:07:54Z","snapshot_observed_at":"2026-08-14T23:12:07.733477Z","submitted_at":"2024-11-25T05:24:53Z","title":"BlendServe: Optimizing Offline Inference for Auto-regressive Large Models with Resource-aware Batching","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.16102","snapshot_observed_at":"2026-08-10T15:25:03.588191Z","title":"BlendServe: Optimizing Offline Inference for Auto- regressive Large Models with Resource-aware Batching","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.14312","last_updated":"2025-01-24T08:12:47Z","snapshot_observed_at":"2026-08-19T01:08:36.561666Z","submitted_at":"2025-01-24T08:12:47Z","title":"Locality-aware Fair Scheduling in LLM Serving","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-10T15:25:03.588191Z"},"links":{"cited_paper":"/paper/2411.16102","citing_paper":"/paper/2501.14312"},"observation_digest":"sha256:56cc44252e5a468b46825fcc40adb1d9914eee4d82ea93f74bfcb4fca282b0cd","observation_id":"4b5675d2-efd7-41a8-81aa-e44b9bc6b865","resolution":{"observed_at":"2026-08-10T15:25:03.588191Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:25:03.894634Z","title":"P Xing, Hao Zhang, Joseph E","venue":null,"work_id":"d897c60d-b17d-48de-b5a1-5f8849e783d6","year":2023},"citing_paper":{"arxiv_id":"2501.14312","last_updated":"2025-01-24T08:12:47Z","snapshot_observed_at":"2026-08-19T01:08:36.561666Z","submitted_at":"2025-01-24T08:12:47Z","title":"Locality-aware Fair Scheduling in LLM Serving","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-10T15:25:03.592476Z"},"links":{"citing_paper":"/paper/2501.14312"},"observation_digest":"sha256:94aa8315093810a6944ccc1069301128e113eda041acc5af639a6689088cc2a1","observation_id":"1b801951-f9d4-48f1-a736-c78d4c86ffe6","resolution":{"observed_at":"2026-08-10T15:25:03.899256Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.07104","last_updated":"2024-06-06T00:10:06Z","snapshot_observed_at":"2026-08-18T16:18:58.765617Z","submitted_at":"2023-12-12T09:34:27Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.07104","snapshot_observed_at":"2026-08-10T15:25:03.596569Z","title":"Efficiently programming large language models using sglang","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.14312","last_updated":"2025-01-24T08:12:47Z","snapshot_observed_at":"2026-08-19T01:08:36.561666Z","submitted_at":"2025-01-24T08:12:47Z","title":"Locality-aware Fair Scheduling in LLM Serving","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-10T15:25:03.596569Z"},"links":{"cited_paper":"/paper/2312.07104","citing_paper":"/paper/2501.14312"},"observation_digest":"sha256:dd27f604b91bf83411be007b36d525e2c52e26b30da9ae7416bf535b179763a0","observation_id":"bb715e18-8dcb-4e96-9d6f-946e9a6fbce6","resolution":{"observed_at":"2026-08-10T15:25:03.596569Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:25:03.876559Z","title":"• Given that a is the lower bound of the server capacity, the dispatch time for f is therefore bounded: D(r f ) − A(r f ) ≤ 2 · (n − 1) · Qu+U a","venue":null,"work_id":"c77dd8b0-f323-44ae-b371-0abdad6d383b","year":null},"citing_paper":{"arxiv_id":"2501.14312","last_updated":"2025-01-24T08:12:47Z","snapshot_observed_at":"2026-08-19T01:08:36.561666Z","submitted_at":"2025-01-24T08:12:47Z","title":"Locality-aware Fair Scheduling in LLM Serving","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-10T15:25:03.602010Z"},"links":{"citing_paper":"/paper/2501.14312"},"observation_digest":"sha256:25d1a0ceb1db2d2fb54ad41093903cdbb567dce671c83900aa5f8db315970ed4","observation_id":"1671900f-6479-4065-9ad5-753f9265a002","resolution":{"observed_at":"2026-08-10T15:25:03.883466Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2501.14312","last_updated":"2025-01-24T08:12:47Z","latest_version":1,"primary_category":"cs.DC","snapshot_observed_at":"2026-08-19T01:08:36.561666Z","submitted_at":"2025-01-24T08:12:47Z","title":"Locality-aware Fair Scheduling in LLM Serving"},"reference_resolution":{"displayed":59,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":20,"verified_exact":0,"verified_fuzzy":39},"total_outbound_references":59},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"thesis":"As of 20 August 2026, this Paper Citation Record lists 59 of 59 outbound references and 7 inbound Pith citation observations for arXiv:2501.14312."}