{"as_of":"2026-08-09T10:34:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b391ead6edfa61b657e9cec1599c152284aa472895c2e2d49714e27713a2f178","coverage":[{"denominator":53,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":53,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T20:53:34.066002Z","state":"measured"},{"denominator":54,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":54,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-28T16:55:38.764173Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-06-28T17:02:24.553672Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2509.08309","last_updated":"2025-09-10T06:06:51Z","snapshot_observed_at":"2026-08-06T05:24:56.655402Z","submitted_at":"2025-09-10T06:06:51Z","title":"Hetis: Serving LLMs in Heterogeneous GPU Clusters with Fine-grained and Dynamic Parallelism","version":1},"cited_work":{"arxiv_id":"2509.08309","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.08309","snapshot_observed_at":"2026-06-28T17:02:24.553672Z","title":"Hetis: Serving LLMs in heterogeneous GPU clusters with fine-grained and dynamic parallelism","venue":null,"work_id":"6db5da0b-6198-4750-867a-778296c60994","year":2025},"citing_paper":{"arxiv_id":"2606.00946","last_updated":"2026-05-31T01:31:02Z","snapshot_observed_at":"2026-07-06T23:41:34.459700Z","submitted_at":"2026-05-31T01:31:02Z","title":"Lodestar: An Online-Learning LLM Inference Router","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-06-28T16:55:38.764173Z"},"links":{"cited_paper":"/paper/2509.08309","citing_paper":"/paper/2606.00946"},"observation_digest":"sha256:78e4008df77fca019e9bdec4f44b6612a2f939f1dcc8664f1b17b88ae5f91b39","observation_id":"38e3bb4d-7a66-4493-afca-66643d3f92db","resolution":{"observed_at":"2026-06-28T17:02:24.555133Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2509.08309/citation-record","integrity":"/paper/2509.08309/integrity","json":"/paper/2509.08309/citation-record.json","paper":"/paper/2509.08309"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:53:37.704481Z","title":"NCCL: accelerated multi-GPU collective communication","venue":null,"work_id":"210e21f6-7157-4b08-8d0b-1a5c97815279","year":2023},"citing_paper":{"arxiv_id":"2509.08309","last_updated":"2025-09-10T06:06:51Z","snapshot_observed_at":"2026-08-06T05:24:56.655402Z","submitted_at":"2025-09-10T06:06:51Z","title":"Hetis: Serving LLMs in Heterogeneous GPU Clusters with Fine-grained and Dynamic Parallelism","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-04T20:53:30.541035Z"},"links":{"citing_paper":"/paper/2509.08309"},"observation_digest":"sha256:ad78faa39e22580ecbf74b9357c983b054bdda23ae7ae13f1d8897f2ac2a0087","observation_id":"31875306-5efe-4012-9a2a-50618d5b531c","resolution":{"observed_at":"2026-08-04T20:53:37.756092Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:53:37.626474Z","title":"ShareGPT","venue":null,"work_id":"f8640104-f3a6-4675-a4fe-f279f1041c62","year":2023},"citing_paper":{"arxiv_id":"2509.08309","last_updated":"2025-09-10T06:06:51Z","snapshot_observed_at":"2026-08-06T05:24:56.655402Z","submitted_at":"2025-09-10T06:06:51Z","title":"Hetis: Serving LLMs in Heterogeneous GPU Clusters with Fine-grained and Dynamic Parallelism","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-04T20:53:30.595124Z"},"links":{"citing_paper":"/paper/2509.08309"},"observation_digest":"sha256:465467e5da5005fbfd8824d6246570bfd7abc428271382e9ffab0b9c2fd3285a","observation_id":"314d7857-8f3c-45cc-8158-b5bf6eedde3a","resolution":{"observed_at":"2026-08-04T20:53:37.660572Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-04T20:53:30.671849Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.08309","last_updated":"2025-09-10T06:06:51Z","snapshot_observed_at":"2026-08-06T05:24:56.655402Z","submitted_at":"2025-09-10T06:06:51Z","title":"Hetis: Serving LLMs in Heterogeneous GPU Clusters with Fine-grained and Dynamic Parallelism","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-04T20:53:30.671849Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2509.08309"},"observation_digest":"sha256:2c0fdc8f230bec6c6f688c4b042187492310108b790d0eb5079b2019714c9f28","observation_id":"41584052-a921-4839-8e82-d17e38fcea85","resolution":{"observed_at":"2026-08-04T20:53:30.671849Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.02310","last_updated":"2024-06-17T21:10:46Z","snapshot_observed_at":"2026-07-06T17:39:24.823145Z","submitted_at":"2024-03-04T18:47:08Z","title":"Taming Throughput-Latency Tradeoff in LLM Inference with Sarathi-Serve","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.02310","snapshot_observed_at":"2026-08-04T20:53:30.772845Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08309","last_updated":"2025-09-10T06:06:51Z","snapshot_observed_at":"2026-08-06T05:24:56.655402Z","submitted_at":"2025-09-10T06:06:51Z","title":"Hetis: Serving LLMs in Heterogeneous GPU Clusters with Fine-grained and Dynamic Parallelism","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-04T20:53:30.772845Z"},"links":{"cited_paper":"/paper/2403.02310","citing_paper":"/paper/2509.08309"},"observation_digest":"sha256:920e19f190fd32e79346ce83f4bfbed2240d84b1659fc303b99b6bb0cd208e0f","observation_id":"b80e34f7-c743-48f1-a56a-f98d807df92c","resolution":{"observed_at":"2026-08-04T20:53:30.772845Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:53:37.530317Z","title":null,"venue":null,"work_id":"973a53ac-b544-4b27-ba8e-56f839a47bd9","year":2020},"citing_paper":{"arxiv_id":"2509.08309","last_updated":"2025-09-10T06:06:51Z","snapshot_observed_at":"2026-08-06T05:24:56.655402Z","submitted_at":"2025-09-10T06:06:51Z","title":"Hetis: Serving LLMs in Heterogeneous GPU Clusters with Fine-grained and Dynamic Parallelism","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-04T20:53:30.844502Z"},"links":{"citing_paper":"/paper/2509.08309"},"observation_digest":"sha256:3070f0a900b877804c6a99eb117a83932769549863f8c2bc04580023a7564357","observation_id":"1863aa73-3f8a-40b5-a13b-626c4eba2caa","resolution":{"observed_at":"2026-08-04T20:53:37.575686Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:53:37.418898Z","title":null,"venue":null,"work_id":"c050f97f-42e0-4ec5-ad6b-2ebe7c3242a4","year":2025},"citing_paper":{"arxiv_id":"2509.08309","last_updated":"2025-09-10T06:06:51Z","snapshot_observed_at":"2026-08-06T05:24:56.655402Z","submitted_at":"2025-09-10T06:06:51Z","title":"Hetis: Serving LLMs in Heterogeneous GPU Clusters with Fine-grained and Dynamic Parallelism","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-04T20:53:30.953102Z"},"links":{"citing_paper":"/paper/2509.08309"},"observation_digest":"sha256:47e187d3879d99c96eb2f8f539e616cf8336513bac51e421871ff2f214f97ca9","observation_id":"fa23cd5c-5924-4ca4-9fa3-6bd67dbfc07b","resolution":{"observed_at":"2026-08-04T20:53:37.454601Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.14508","last_updated":"2024-06-19T04:00:32Z","snapshot_observed_at":"2026-08-08T03:49:18.086396Z","submitted_at":"2023-08-28T11:53:40Z","title":"LongBench: A Bilingual, Multitask Benchmark for Long Context Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.14508","snapshot_observed_at":"2026-08-04T20:53:31.024369Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.08309","last_updated":"2025-09-10T06:06:51Z","snapshot_observed_at":"2026-08-06T05:24:56.655402Z","submitted_at":"2025-09-10T06:06:51Z","title":"Hetis: Serving LLMs in Heterogeneous GPU Clusters with Fine-grained and Dynamic Parallelism","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-04T20:53:31.024369Z"},"links":{"cited_paper":"/paper/2308.14508","citing_paper":"/paper/2509.08309"},"observation_digest":"sha256:3ca32487dee704b94da0fc3bba0963dc6ecd0c976d52382031d97f5310820b13","observation_id":"8dd0b71f-7983-4b72-8380-9b0cc492b4ee","resolution":{"observed_at":"2026-08-04T20:53:31.024369Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:53:31.063237Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.08309","last_updated":"2025-09-10T06:06:51Z","snapshot_observed_at":"2026-08-06T05:24:56.655402Z","submitted_at":"2025-09-10T06:06:51Z","title":"Hetis: Serving LLMs in Heterogeneous GPU Clusters with Fine-grained and Dynamic Parallelism","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-04T20:53:31.063237Z"},"links":{"citing_paper":"/paper/2509.08309"},"observation_digest":"sha256:34aa8a6ec06882c153352663e8fc331521bb07600f578e9aa8390c5954e37868","observation_id":"ba04eae8-0604-4ca9-a88f-d4458ffd1816","resolution":{"observed_at":"2026-08-04T20:53:31.063237Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:53:37.308121Z","title":null,"venue":null,"work_id":"75874a2f-4598-4804-8466-cdae17f6281c","year":2020},"citing_paper":{"arxiv_id":"2509.08309","last_updated":"2025-09-10T06:06:51Z","snapshot_observed_at":"2026-08-06T05:24:56.655402Z","submitted_at":"2025-09-10T06:06:51Z","title":"Hetis: Serving LLMs in Heterogeneous GPU Clusters with Fine-grained and Dynamic Parallelism","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-04T20:53:31.134404Z"},"links":{"citing_paper":"/paper/2509.08309"},"observation_digest":"sha256:ca4ccab30753ce95fd84ff381abf9271a6a3801350cbcc809aedaa1bb142f3fa","observation_id":"5767af28-784d-4a6a-a5b7-0d5c36264212","resolution":{"observed_at":"2026-08-04T20:53:37.344324Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03374","last_updated":"2021-07-14T17:16:02Z","snapshot_observed_at":"2026-08-08T11:58:24.516369Z","submitted_at":"2021-07-07T17:41:24Z","title":"Evaluating Large Language Models Trained on Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.03374","snapshot_observed_at":"2026-08-04T20:53:31.189865Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.08309","last_updated":"2025-09-10T06:06:51Z","snapshot_observed_at":"2026-08-06T05:24:56.655402Z","submitted_at":"2025-09-10T06:06:51Z","title":"Hetis: Serving LLMs in Heterogeneous GPU Clusters with Fine-grained and Dynamic Parallelism","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-04T20:53:31.189865Z"},"links":{"cited_paper":"/paper/2107.03374","citing_paper":"/paper/2509.08309"},"observation_digest":"sha256:f72d906ea08c8e62f8c4a87cf644f2af5bf873c046ff91afbd5ecbf66942a7c1","observation_id":"51c3b14e-9f9a-4884-8d31-f9d5715d7568","resolution":{"observed_at":"2026-08-04T20:53:31.189865Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:53:37.133841Z","title":null,"venue":null,"work_id":"643001d7-5f3b-46f4-9cf0-455851f40090","year":2021},"citing_paper":{"arxiv_id":"2509.08309","last_updated":"2025-09-10T06:06:51Z","snapshot_observed_at":"2026-08-06T05:24:56.655402Z","submitted_at":"2025-09-10T06:06:51Z","title":"Hetis: Serving LLMs in Heterogeneous GPU Clusters with Fine-grained and Dynamic Parallelism","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-04T20:53:31.258524Z"},"links":{"citing_paper":"/paper/2509.08309"},"observation_digest":"sha256:50587c261338d1917b8772efcc3d0a9abd35a49da5c525773ee09a68d151f7fd","observation_id":"368ee591-7614-4a19-9f1b-ecba55b6c56c","resolution":{"observed_at":"2026-08-04T20:53:37.178582Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:53:37.054164Z","title":null,"venue":null,"work_id":"ebc0966f-9d83-4177-ad12-56fd43278b45","year":2021},"citing_paper":{"arxiv_id":"2509.08309","last_updated":"2025-09-10T06:06:51Z","snapshot_observed_at":"2026-08-06T05:24:56.655402Z","submitted_at":"2025-09-10T06:06:51Z","title":"Hetis: Serving LLMs in Heterogeneous GPU Clusters with Fine-grained and Dynamic Parallelism","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-04T20:53:31.342315Z"},"links":{"citing_paper":"/paper/2509.08309"},"observation_digest":"sha256:8132dfcdb5365670ab1df0817e45cfe2a21d23f054a097eb0af80a29af261be3","observation_id":"c6c10d33-4c23-45a4-9b59-a668c1319ea9","resolution":{"observed_at":"2026-08-04T20:53:37.090093Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:53:31.403578Z","title":"Fu, Stefano Ermon, Atri Rudra, and Christopher Ré","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.08309","last_updated":"2025-09-10T06:06:51Z","snapshot_observed_at":"2026-08-06T05:24:56.655402Z","submitted_at":"2025-09-10T06:06:51Z","title":"Hetis: Serving LLMs in Heterogeneous GPU Clusters with Fine-grained and Dynamic Parallelism","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-04T20:53:31.403578Z"},"links":{"citing_paper":"/paper/2509.08309"},"observation_digest":"sha256:de7f59e2b84ce2015459134e937eb647cf51258e4e9866ce5cfdd11348990ad8","observation_id":"d50ab370-f241-4da0-a763-77872ae9e7c8","resolution":{"observed_at":"2026-08-04T20:53:31.403578Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:53:36.917346Z","title":null,"venue":null,"work_id":"6896f50d-12ec-49f5-88ee-286cea547474","year":2016},"citing_paper":{"arxiv_id":"2509.08309","last_updated":"2025-09-10T06:06:51Z","snapshot_observed_at":"2026-08-06T05:24:56.655402Z","submitted_at":"2025-09-10T06:06:51Z","title":"Hetis: Serving LLMs in Heterogeneous GPU Clusters with Fine-grained and Dynamic Parallelism","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-04T20:53:31.462940Z"},"links":{"citing_paper":"/paper/2509.08309"},"observation_digest":"sha256:987ac7841ea74acc1736f5ed6da19b30cf8eaec4f9c767dc584517d5c2ba0216","observation_id":"7b65c049-19e5-40e2-be0c-6fe88f51a563","resolution":{"observed_at":"2026-08-04T20:53:36.961554Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:53:36.802555Z","title":null,"venue":null,"work_id":"6853aa23-1ded-4f31-bef6-71d7e7666005","year":null},"citing_paper":{"arxiv_id":"2509.08309","last_updated":"2025-09-10T06:06:51Z","snapshot_observed_at":"2026-08-06T05:24:56.655402Z","submitted_at":"2025-09-10T06:06:51Z","title":"Hetis: Serving LLMs in Heterogeneous GPU Clusters with Fine-grained and Dynamic Parallelism","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-04T20:53:31.542101Z"},"links":{"citing_paper":"/paper/2509.08309"},"observation_digest":"sha256:4db26ce5b2eb495e3606fcf0a52e1e6394ef91b6a4cb37d29e0e100e64138876","observation_id":"4b67af20-9e6e-4f06-b9d2-dfc50e67c675","resolution":{"observed_at":"2026-08-04T20:53:36.836867Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:53:36.732886Z","title":null,"venue":null,"work_id":"b40fbf65-19b9-4add-b25f-ffa317f1186e","year":1976},"citing_paper":{"arxiv_id":"2509.08309","last_updated":"2025-09-10T06:06:51Z","snapshot_observed_at":"2026-08-06T05:24:56.655402Z","submitted_at":"2025-09-10T06:06:51Z","title":"Hetis: Serving LLMs in Heterogeneous GPU Clusters with Fine-grained and Dynamic Parallelism","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-04T20:53:31.616944Z"},"links":{"citing_paper":"/paper/2509.08309"},"observation_digest":"sha256:176b58150eb10c2ecbd4aa0b9fad03447aafb108802a84db9706235f1af1d2f8","observation_id":"c6d2838c-0aa1-4ac1-a702-220978ae3875","resolution":{"observed_at":"2026-08-04T20:53:36.769021Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14527","last_updated":"2024-07-22T10:56:19Z","snapshot_observed_at":"2026-07-06T18:04:00.217896Z","submitted_at":"2024-04-22T18:56:18Z","title":"M\\'elange: Cost Efficient Large Language Model Serving by Exploiting GPU Heterogeneity","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14527","snapshot_observed_at":"2026-08-04T20:53:31.694454Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08309","last_updated":"2025-09-10T06:06:51Z","snapshot_observed_at":"2026-08-06T05:24:56.655402Z","submitted_at":"2025-09-10T06:06:51Z","title":"Hetis: Serving LLMs in Heterogeneous GPU Clusters with Fine-grained and Dynamic Parallelism","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-04T20:53:31.694454Z"},"links":{"cited_paper":"/paper/2404.14527","citing_paper":"/paper/2509.08309"},"observation_digest":"sha256:011d481bec29469174707c5856e463ba512aee5c61d5c0c57fa97a9fde169090","observation_id":"8e3d6901-d154-496e-8359-f7975f57057b","resolution":{"observed_at":"2026-08-04T20:53:31.694454Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:53:36.585596Z","title":null,"venue":null,"work_id":"3f2f74f0-4afc-4c98-ac8f-19c34bc93da6","year":2020},"citing_paper":{"arxiv_id":"2509.08309","last_updated":"2025-09-10T06:06:51Z","snapshot_observed_at":"2026-08-06T05:24:56.655402Z","submitted_at":"2025-09-10T06:06:51Z","title":"Hetis: Serving LLMs in Heterogeneous GPU Clusters with Fine-grained and Dynamic Parallelism","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-04T20:53:31.733099Z"},"links":{"citing_paper":"/paper/2509.08309"},"observation_digest":"sha256:06676758aaa998c9bc5d85ba45d60266e492148c2a1637020d9f0a28b4283d4c","observation_id":"fb76c67a-a3bd-4a00-8f44-7e60074990db","resolution":{"observed_at":"2026-08-04T20:53:36.667598Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.11421","last_updated":"2024-03-18T02:30:23Z","snapshot_observed_at":"2026-08-09T07:19:27.126976Z","submitted_at":"2024-03-18T02:30:23Z","title":"FastDecode: High-Throughput GPU-Efficient LLM Serving using Heterogeneous Pipelines","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.11421","snapshot_observed_at":"2026-08-04T20:53:31.847951Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08309","last_updated":"2025-09-10T06:06:51Z","snapshot_observed_at":"2026-08-06T05:24:56.655402Z","submitted_at":"2025-09-10T06:06:51Z","title":"Hetis: Serving LLMs in Heterogeneous GPU Clusters with Fine-grained and Dynamic Parallelism","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-04T20:53:31.847951Z"},"links":{"cited_paper":"/paper/2403.11421","citing_paper":"/paper/2509.08309"},"observation_digest":"sha256:19b2fa9c7a7af4e794ee3f8e71c4448e0de210da7a8be24389e47c21952f73e2","observation_id":"3e8225a2-deb0-4c9f-b07a-c421677e2b82","resolution":{"observed_at":"2026-08-04T20:53:31.847951Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.11181","last_updated":"2024-01-20T09:43:36Z","snapshot_observed_at":"2026-08-05T23:35:16.350557Z","submitted_at":"2024-01-20T09:43:36Z","title":"Inference without Interference: Disaggregate LLM Inference for Mixed Downstream Workloads","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.11181","snapshot_observed_at":"2026-08-04T20:53:31.939770Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08309","last_updated":"2025-09-10T06:06:51Z","snapshot_observed_at":"2026-08-06T05:24:56.655402Z","submitted_at":"2025-09-10T06:06:51Z","title":"Hetis: Serving LLMs in Heterogeneous GPU Clusters with Fine-grained and Dynamic Parallelism","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-04T20:53:31.939770Z"},"links":{"cited_paper":"/paper/2401.11181","citing_paper":"/paper/2509.08309"},"observation_digest":"sha256:d8faae2b5e54bcf98c94400ab1378346a8af24421c411e19b89bca4962fc815a","observation_id":"1f96ef1a-0a70-4f5b-96ed-3cd4aff33490","resolution":{"observed_at":"2026-08-04T20:53:31.939770Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:53:36.381002Z","title":null,"venue":null,"work_id":"575fbde6-f373-4556-921f-08be92240970","year":2023},"citing_paper":{"arxiv_id":"2509.08309","last_updated":"2025-09-10T06:06:51Z","snapshot_observed_at":"2026-08-06T05:24:56.655402Z","submitted_at":"2025-09-10T06:06:51Z","title":"Hetis: Serving LLMs in Heterogeneous GPU Clusters with Fine-grained and Dynamic Parallelism","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-04T20:53:31.975896Z"},"links":{"citing_paper":"/paper/2509.08309"},"observation_digest":"sha256:b13ceeac9d1f8578a08725dc9363e8b17c9ea01ea1da297b652964798fec5606","observation_id":"4b0a3e99-b266-44b6-a4a1-79e02060586d","resolution":{"observed_at":"2026-08-04T20:53:36.463932Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:53:36.266964Z","title":null,"venue":null,"work_id":"c8937928-c41f-4449-be68-7b6825ef7e60","year":2022},"citing_paper":{"arxiv_id":"2509.08309","last_updated":"2025-09-10T06:06:51Z","snapshot_observed_at":"2026-08-06T05:24:56.655402Z","submitted_at":"2025-09-10T06:06:51Z","title":"Hetis: Serving LLMs in Heterogeneous GPU Clusters with Fine-grained and Dynamic Parallelism","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-04T20:53:32.027110Z"},"links":{"citing_paper":"/paper/2509.08309"},"observation_digest":"sha256:feacb9bd9cc20166ff3f5725105423271895c11d10cd9f96fef1e7ea76d0cbb4","observation_id":"5e9d1c0e-bfc9-4061-9951-c827e77c27b1","resolution":{"observed_at":"2026-08-04T20:53:36.298639Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:53:36.169626Z","title":null,"venue":null,"work_id":"c983f575-4531-40ef-a086-b42d5a3709f5","year":null},"citing_paper":{"arxiv_id":"2509.08309","last_updated":"2025-09-10T06:06:51Z","snapshot_observed_at":"2026-08-06T05:24:56.655402Z","submitted_at":"2025-09-10T06:06:51Z","title":"Hetis: Serving LLMs in Heterogeneous GPU Clusters with Fine-grained and Dynamic Parallelism","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-04T20:53:32.088532Z"},"links":{"citing_paper":"/paper/2509.08309"},"observation_digest":"sha256:6542dca4079b77a914b059e1ea62e24240f5f36247499b63adeea0150d857d0e","observation_id":"3d92674d-fe92-4eb4-b448-ce72ff3e2b20","resolution":{"observed_at":"2026-08-04T20:53:36.224438Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-07-06T08:52:12.656082Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-08-04T20:53:32.137323Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.08309","last_updated":"2025-09-10T06:06:51Z","snapshot_observed_at":"2026-08-06T05:24:56.655402Z","submitted_at":"2025-09-10T06:06:51Z","title":"Hetis: Serving LLMs in Heterogeneous GPU Clusters with Fine-grained and Dynamic Parallelism","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-04T20:53:32.137323Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2509.08309"},"observation_digest":"sha256:c32515ca9fe16efc9ffb0e89abacb219f8d5e3af58c6488c7cf1856d6438e58d","observation_id":"b686db21-843e-411f-8a6c-c8487b734e0e","resolution":{"observed_at":"2026-08-04T20:53:32.137323Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:53:32.178971Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.08309","last_updated":"2025-09-10T06:06:51Z","snapshot_observed_at":"2026-08-06T05:24:56.655402Z","submitted_at":"2025-09-10T06:06:51Z","title":"Hetis: Serving LLMs in Heterogeneous GPU Clusters with Fine-grained and Dynamic Parallelism","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-04T20:53:32.178971Z"},"links":{"citing_paper":"/paper/2509.08309"},"observation_digest":"sha256:27fe879ff7068f5dc1adc12c4ebefa9c1138218beb0e6a2ca8aecff5e1719d78","observation_id":"6fb39267-e2b4-4deb-90a5-527f58a0a076","resolution":{"observed_at":"2026-08-04T20:53:32.178971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:53:35.850179Z","title":null,"venue":null,"work_id":"270cfe2f-85e1-4674-9f0b-16d9d6117e8a","year":2020},"citing_paper":{"arxiv_id":"2509.08309","last_updated":"2025-09-10T06:06:51Z","snapshot_observed_at":"2026-08-06T05:24:56.655402Z","submitted_at":"2025-09-10T06:06:51Z","title":"Hetis: Serving LLMs in Heterogeneous GPU Clusters with Fine-grained and Dynamic Parallelism","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-04T20:53:32.267712Z"},"links":{"citing_paper":"/paper/2509.08309"},"observation_digest":"sha256:a3b126f002c41913edd23941481e211e83c06fe436561627b0e1472fad3a5d3e","observation_id":"23e4405d-4b2d-428c-968d-51f0a60d82f1","resolution":{"observed_at":"2026-08-04T20:53:35.915257Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:53:35.774643Z","title":null,"venue":null,"work_id":"090e0272-a756-49bc-a9b0-2c9c5a82f4a6","year":2023},"citing_paper":{"arxiv_id":"2509.08309","last_updated":"2025-09-10T06:06:51Z","snapshot_observed_at":"2026-08-06T05:24:56.655402Z","submitted_at":"2025-09-10T06:06:51Z","title":"Hetis: Serving LLMs in Heterogeneous GPU Clusters with Fine-grained and Dynamic Parallelism","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-04T20:53:32.322858Z"},"links":{"citing_paper":"/paper/2509.08309"},"observation_digest":"sha256:30b310773f55e1a7db1fcac2ae63930f7fc9f0df38dd15647db4fc7f7b77b11b","observation_id":"da68e34e-dd69-442d-80c7-d32975ea42b2","resolution":{"observed_at":"2026-08-04T20:53:35.813704Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02669","last_updated":"2024-07-04T15:12:54Z","snapshot_observed_at":"2026-07-06T17:11:55.112404Z","submitted_at":"2024-01-05T06:53:00Z","title":"Infinite-LLM: Efficient LLM Service for Long Context with DistAttention and Distributed KVCache","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.02669","snapshot_observed_at":"2026-08-04T20:53:32.388187Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08309","last_updated":"2025-09-10T06:06:51Z","snapshot_observed_at":"2026-08-06T05:24:56.655402Z","submitted_at":"2025-09-10T06:06:51Z","title":"Hetis: Serving LLMs in Heterogeneous GPU Clusters with Fine-grained and Dynamic Parallelism","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-04T20:53:32.388187Z"},"links":{"cited_paper":"/paper/2401.02669","citing_paper":"/paper/2509.08309"},"observation_digest":"sha256:5cac9b5231fb3d1c8cbaa6529fe27c5ed6424a88acf78be01b0440c90709e2b8","observation_id":"9bb1337b-8b54-4029-a2da-6816ad942ff8","resolution":{"observed_at":"2026-08-04T20:53:32.388187Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:53:35.683677Z","title":null,"venue":null,"work_id":"1ad3e7c4-19b9-4730-858b-241d023aee3d","year":2023},"citing_paper":{"arxiv_id":"2509.08309","last_updated":"2025-09-10T06:06:51Z","snapshot_observed_at":"2026-08-06T05:24:56.655402Z","submitted_at":"2025-09-10T06:06:51Z","title":"Hetis: Serving LLMs in Heterogeneous GPU Clusters with Fine-grained and Dynamic Parallelism","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-04T20:53:32.491483Z"},"links":{"citing_paper":"/paper/2509.08309"},"observation_digest":"sha256:ece610e4a457344f20a4fe9349e188f7521bb3079c016ed38d0beac4a6f3106b","observation_id":"976d2ac0-de8a-4365-a28a-009492e9e362","resolution":{"observed_at":"2026-08-04T20:53:35.726862Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15566","last_updated":"2023-11-27T06:31:17Z","snapshot_observed_at":"2026-07-06T16:52:53.954856Z","submitted_at":"2023-11-27T06:31:17Z","title":"SpotServe: Serving Generative Large Language Models on Preemptible Instances","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15566","snapshot_observed_at":"2026-08-04T20:53:32.528246Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.08309","last_updated":"2025-09-10T06:06:51Z","snapshot_observed_at":"2026-08-06T05:24:56.655402Z","submitted_at":"2025-09-10T06:06:51Z","title":"Hetis: Serving LLMs in Heterogeneous GPU Clusters with Fine-grained and Dynamic Parallelism","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-04T20:53:32.528246Z"},"links":{"cited_paper":"/paper/2311.15566","citing_paper":"/paper/2509.08309"},"observation_digest":"sha256:cd14eef4e67727cbbc19ba57c8975be1075ec16f6059e5d0a6e78ed62ac17216","observation_id":"3dff3f13-9541-48f8-b411-ba022122b361","resolution":{"observed_at":"2026-08-04T20:53:32.528246Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:53:35.573792Z","title":null,"venue":null,"work_id":"a09d78f6-c065-4500-b2e0-cba2ec580a1e","year":2024},"citing_paper":{"arxiv_id":"2509.08309","last_updated":"2025-09-10T06:06:51Z","snapshot_observed_at":"2026-08-06T05:24:56.655402Z","submitted_at":"2025-09-10T06:06:51Z","title":"Hetis: Serving LLMs in Heterogeneous GPU Clusters with Fine-grained and Dynamic Parallelism","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-04T20:53:32.597113Z"},"links":{"citing_paper":"/paper/2509.08309"},"observation_digest":"sha256:a3062307702eb46eda6ba162d6c40e29103e233632656c1602a93d8b3080d283","observation_id":"4bf2362f-a818-490f-a10b-8b59998f0b5c","resolution":{"observed_at":"2026-08-04T20:53:35.608634Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:53:35.478693Z","title":null,"venue":null,"work_id":"0a141b13-3d55-4eb0-b557-b34a51f2161c","year":2025},"citing_paper":{"arxiv_id":"2509.08309","last_updated":"2025-09-10T06:06:51Z","snapshot_observed_at":"2026-08-06T05:24:56.655402Z","submitted_at":"2025-09-10T06:06:51Z","title":"Hetis: Serving LLMs in Heterogeneous GPU Clusters with Fine-grained and Dynamic Parallelism","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-04T20:53:32.674293Z"},"links":{"citing_paper":"/paper/2509.08309"},"observation_digest":"sha256:ae8af6f5eb6c85bd5d51c8599118882bb031fd1b30fedda23e338ff7b33bb00f","observation_id":"b9e7bb2d-d007-4a9f-8803-2415067f8a44","resolution":{"observed_at":"2026-08-04T20:53:35.508255Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:53:35.383957Z","title":null,"venue":null,"work_id":"4a30a81c-7c8b-4855-9003-170578df0e70","year":2024},"citing_paper":{"arxiv_id":"2509.08309","last_updated":"2025-09-10T06:06:51Z","snapshot_observed_at":"2026-08-06T05:24:56.655402Z","submitted_at":"2025-09-10T06:06:51Z","title":"Hetis: Serving LLMs in Heterogeneous GPU Clusters with Fine-grained and Dynamic Parallelism","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-04T20:53:32.700047Z"},"links":{"citing_paper":"/paper/2509.08309"},"observation_digest":"sha256:a905742592cd3f81a7d8bf4852c7fcd0bcab683ccb0c473f511c6a4814901187","observation_id":"5a22e5ab-74df-420a-a350-74313159d58f","resolution":{"observed_at":"2026-08-04T20:53:35.431599Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:53:35.214956Z","title":null,"venue":null,"work_id":"1853a1a7-a929-4b83-b445-c249ee880f6c","year":2020},"citing_paper":{"arxiv_id":"2509.08309","last_updated":"2025-09-10T06:06:51Z","snapshot_observed_at":"2026-08-06T05:24:56.655402Z","submitted_at":"2025-09-10T06:06:51Z","title":"Hetis: Serving LLMs in Heterogeneous GPU Clusters with Fine-grained and Dynamic Parallelism","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-04T20:53:32.817436Z"},"links":{"citing_paper":"/paper/2509.08309"},"observation_digest":"sha256:fc2a40bebd33d02b5e000a37bf71a05754836297f796284c7cd5e3ac43b5f8f6","observation_id":"f6ef0f0f-0b2e-43ee-a0be-3d6b451b1c9f","resolution":{"observed_at":"2026-08-04T20:53:35.276426Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:53:32.888698Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08309","last_updated":"2025-09-10T06:06:51Z","snapshot_observed_at":"2026-08-06T05:24:56.655402Z","submitted_at":"2025-09-10T06:06:51Z","title":"Hetis: Serving LLMs in Heterogeneous GPU Clusters with Fine-grained and Dynamic Parallelism","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-04T20:53:32.888698Z"},"links":{"citing_paper":"/paper/2509.08309"},"observation_digest":"sha256:a1f6ed169244751f2999feed24661990eff47ef01288330863f371ccad1fc8e9","observation_id":"2c772b5a-3f88-47a7-a971-2b7825104d01","resolution":{"observed_at":"2026-08-04T20:53:32.888698Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:53:32.916183Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.08309","last_updated":"2025-09-10T06:06:51Z","snapshot_observed_at":"2026-08-06T05:24:56.655402Z","submitted_at":"2025-09-10T06:06:51Z","title":"Hetis: Serving LLMs in Heterogeneous GPU Clusters with Fine-grained and Dynamic Parallelism","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-04T20:53:32.916183Z"},"links":{"citing_paper":"/paper/2509.08309"},"observation_digest":"sha256:50afba12d88860d505b288335b74b602a764753abf975e10c5636e59219bb6f4","observation_id":"329816e1-9715-4379-9556-2f2cbb18c181","resolution":{"observed_at":"2026-08-04T20:53:32.916183Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:53:35.092886Z","title":null,"venue":null,"work_id":"033fefe1-863d-4292-9547-66abf12ceb45","year":2014},"citing_paper":{"arxiv_id":"2509.08309","last_updated":"2025-09-10T06:06:51Z","snapshot_observed_at":"2026-08-06T05:24:56.655402Z","submitted_at":"2025-09-10T06:06:51Z","title":"Hetis: Serving LLMs in Heterogeneous GPU Clusters with Fine-grained and Dynamic Parallelism","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-04T20:53:32.957225Z"},"links":{"citing_paper":"/paper/2509.08309"},"observation_digest":"sha256:e861c1e2d182ef7c8fe68550b028bb8f68a881fe4d02e1f478d8b2422510732b","observation_id":"ac292109-23c6-468f-81f4-1390387279a7","resolution":{"observed_at":"2026-08-04T20:53:35.140565Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:53:35.022518Z","title":null,"venue":null,"work_id":"602b2f3b-4079-40a4-9592-ed797b0e08b4","year":2019},"citing_paper":{"arxiv_id":"2509.08309","last_updated":"2025-09-10T06:06:51Z","snapshot_observed_at":"2026-08-06T05:24:56.655402Z","submitted_at":"2025-09-10T06:06:51Z","title":"Hetis: Serving LLMs in Heterogeneous GPU Clusters with Fine-grained and Dynamic Parallelism","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-04T20:53:32.977810Z"},"links":{"citing_paper":"/paper/2509.08309"},"observation_digest":"sha256:22972ee261461e092b88bb9eafc8d4dadf8aad2fec1d5ee7ced31f5a9fe8b3a0","observation_id":"ddbbc322-4944-47ae-b67a-0857d2d3be03","resolution":{"observed_at":"2026-08-04T20:53:35.058157Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:53:33.021674Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.08309","last_updated":"2025-09-10T06:06:51Z","snapshot_observed_at":"2026-08-06T05:24:56.655402Z","submitted_at":"2025-09-10T06:06:51Z","title":"Hetis: Serving LLMs in Heterogeneous GPU Clusters with Fine-grained and Dynamic Parallelism","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-04T20:53:33.021674Z"},"links":{"citing_paper":"/paper/2509.08309"},"observation_digest":"sha256:0a6ddda825525eaeef82e14ea7e140088674caa563f3264fe102e2ef3abd0217","observation_id":"6095cc65-e929-4bb1-b1df-77ddac29c952","resolution":{"observed_at":"2026-08-04T20:53:33.021674Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-04T20:53:33.067355Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.08309","last_updated":"2025-09-10T06:06:51Z","snapshot_observed_at":"2026-08-06T05:24:56.655402Z","submitted_at":"2025-09-10T06:06:51Z","title":"Hetis: Serving LLMs in Heterogeneous GPU Clusters with Fine-grained and Dynamic Parallelism","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-04T20:53:33.067355Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2509.08309"},"observation_digest":"sha256:38adc58e347c17931cfbe66196689e5415738fd62cc347221e4d7166605772d9","observation_id":"dbb5ef4c-8faa-46a7-8869-978d9decfa69","resolution":{"observed_at":"2026-08-04T20:53:33.067355Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-04T20:53:33.187123Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.08309","last_updated":"2025-09-10T06:06:51Z","snapshot_observed_at":"2026-08-06T05:24:56.655402Z","submitted_at":"2025-09-10T06:06:51Z","title":"Hetis: Serving LLMs in Heterogeneous GPU Clusters with Fine-grained and Dynamic Parallelism","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-04T20:53:33.187123Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2509.08309"},"observation_digest":"sha256:aab31de7604e55647c875a91c85fad57ec1d92847027e8c58b1a9a0cb1f06e46","observation_id":"d986cac6-56e8-4fa6-8c8c-03a1c64b43e9","resolution":{"observed_at":"2026-08-04T20:53:33.187123Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:53:34.856866Z","title":null,"venue":null,"work_id":"1853b63e-dd33-4ecf-9278-561c22c159a6","year":2024},"citing_paper":{"arxiv_id":"2509.08309","last_updated":"2025-09-10T06:06:51Z","snapshot_observed_at":"2026-08-06T05:24:56.655402Z","submitted_at":"2025-09-10T06:06:51Z","title":"Hetis: Serving LLMs in Heterogeneous GPU Clusters with Fine-grained and Dynamic Parallelism","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-04T20:53:33.254465Z"},"links":{"citing_paper":"/paper/2509.08309"},"observation_digest":"sha256:e7bfa2d4c6f34f2731ddab761c51a961536e4a32c2068c272432042da4ac5b3a","observation_id":"df5b6a15-9425-4f83-8a43-786069b96793","resolution":{"observed_at":"2026-08-04T20:53:34.914683Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:53:33.343697Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2509.08309","last_updated":"2025-09-10T06:06:51Z","snapshot_observed_at":"2026-08-06T05:24:56.655402Z","submitted_at":"2025-09-10T06:06:51Z","title":"Hetis: Serving LLMs in Heterogeneous GPU Clusters with Fine-grained and Dynamic Parallelism","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-04T20:53:33.343697Z"},"links":{"citing_paper":"/paper/2509.08309"},"observation_digest":"sha256:ca529f57f8d1247822e021f4e84c22b1d0a83622c6812bc8db22cd0196acc19c","observation_id":"666ffacb-090f-433a-a9cd-74d0f8055985","resolution":{"observed_at":"2026-08-04T20:53:33.343697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.17644","last_updated":"2025-05-26T16:16:43Z","snapshot_observed_at":"2026-08-06T05:24:39.144385Z","submitted_at":"2024-01-31T07:52:48Z","title":"BurstGPT: A Real-world Workload Dataset to Optimize LLM Serving Systems","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.17644","snapshot_observed_at":"2026-08-04T20:53:33.420816Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08309","last_updated":"2025-09-10T06:06:51Z","snapshot_observed_at":"2026-08-06T05:24:56.655402Z","submitted_at":"2025-09-10T06:06:51Z","title":"Hetis: Serving LLMs in Heterogeneous GPU Clusters with Fine-grained and Dynamic Parallelism","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-04T20:53:33.420816Z"},"links":{"cited_paper":"/paper/2401.17644","citing_paper":"/paper/2509.08309"},"observation_digest":"sha256:33aab6ee36947e50a9f239ea0759872bebe3edec92a44437da8ff3f0a9fbf0b2","observation_id":"cf06d08f-ec08-47af-8b66-4e8f0b46a461","resolution":{"observed_at":"2026-08-04T20:53:33.420816Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:53:34.772807Z","title":null,"venue":null,"work_id":"be2b98ec-0c47-4c31-a99f-4ea50fe71ef2","year":2022},"citing_paper":{"arxiv_id":"2509.08309","last_updated":"2025-09-10T06:06:51Z","snapshot_observed_at":"2026-08-06T05:24:56.655402Z","submitted_at":"2025-09-10T06:06:51Z","title":"Hetis: Serving LLMs in Heterogeneous GPU Clusters with Fine-grained and Dynamic Parallelism","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-04T20:53:33.499490Z"},"links":{"citing_paper":"/paper/2509.08309"},"observation_digest":"sha256:8192453d1fed2e7dfa5363bb39ac26d2d453b6880bebb103def0b28bd9ab0a79","observation_id":"b93ecd0e-6ae3-406e-b1c5-8e65fcc55fc2","resolution":{"observed_at":"2026-08-04T20:53:34.803025Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:53:34.689363Z","title":null,"venue":null,"work_id":"243c7ba7-4e76-471c-b301-1cc6b6a0fe2f","year":2019},"citing_paper":{"arxiv_id":"2509.08309","last_updated":"2025-09-10T06:06:51Z","snapshot_observed_at":"2026-08-06T05:24:56.655402Z","submitted_at":"2025-09-10T06:06:51Z","title":"Hetis: Serving LLMs in Heterogeneous GPU Clusters with Fine-grained and Dynamic Parallelism","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-04T20:53:33.639354Z"},"links":{"citing_paper":"/paper/2509.08309"},"observation_digest":"sha256:754315c6068e903e9eb480c2a4e701af5863e9452957c1fdcafea7fbea17d75e","observation_id":"21f0cf2c-fd3a-40a0-8285-e4ed8df6999f","resolution":{"observed_at":"2026-08-04T20:53:34.730050Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:53:34.593086Z","title":null,"venue":null,"work_id":"b57d2766-2d3b-4660-a206-baf7c6221de8","year":2023},"citing_paper":{"arxiv_id":"2509.08309","last_updated":"2025-09-10T06:06:51Z","snapshot_observed_at":"2026-08-06T05:24:56.655402Z","submitted_at":"2025-09-10T06:06:51Z","title":"Hetis: Serving LLMs in Heterogeneous GPU Clusters with Fine-grained and Dynamic Parallelism","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-04T20:53:33.771263Z"},"links":{"citing_paper":"/paper/2509.08309"},"observation_digest":"sha256:52b0b8ce0b9e3b4c495d3164e564c29b74bb25c9a53a34cc7eb6b5e1ce149fb7","observation_id":"ec765750-2bd0-4111-9c42-1b624fd7f144","resolution":{"observed_at":"2026-08-04T20:53:34.626700Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:53:34.469265Z","title":null,"venue":null,"work_id":"0389b603-2aad-4fbc-a0b8-3ce2194d97db","year":null},"citing_paper":{"arxiv_id":"2509.08309","last_updated":"2025-09-10T06:06:51Z","snapshot_observed_at":"2026-08-06T05:24:56.655402Z","submitted_at":"2025-09-10T06:06:51Z","title":"Hetis: Serving LLMs in Heterogeneous GPU Clusters with Fine-grained and Dynamic Parallelism","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-04T20:53:33.845686Z"},"links":{"citing_paper":"/paper/2509.08309"},"observation_digest":"sha256:8470017431a1a699953b3a2a4dbb099f323967e47a94ff986bda160e9af67b94","observation_id":"c083b2f6-9138-4ff6-bfc9-eaafe3d262fc","resolution":{"observed_at":"2026-08-04T20:53:34.505073Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-08-06T03:13:37.403059Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.01068","snapshot_observed_at":"2026-08-04T20:53:34.002850Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.08309","last_updated":"2025-09-10T06:06:51Z","snapshot_observed_at":"2026-08-06T05:24:56.655402Z","submitted_at":"2025-09-10T06:06:51Z","title":"Hetis: Serving LLMs in Heterogeneous GPU Clusters with Fine-grained and Dynamic Parallelism","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-04T20:53:34.002850Z"},"links":{"cited_paper":"/paper/2205.01068","citing_paper":"/paper/2509.08309"},"observation_digest":"sha256:6f98f0b093f28b2ae0dd0119b647f55aab78bad8a06ec55b4536a6cac60fdca4","observation_id":"12c864f5-7e26-470e-a535-741ec6502ec5","resolution":{"observed_at":"2026-08-04T20:53:34.002850Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:53:34.356530Z","title":"InProceedings of the Nineteenth European Conference on Computer Systems","venue":null,"work_id":"d53ca48d-2a72-49ba-932c-8cd668af2c2b","year":2025},"citing_paper":{"arxiv_id":"2509.08309","last_updated":"2025-09-10T06:06:51Z","snapshot_observed_at":"2026-08-06T05:24:56.655402Z","submitted_at":"2025-09-10T06:06:51Z","title":"Hetis: Serving LLMs in Heterogeneous GPU Clusters with Fine-grained and Dynamic Parallelism","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-04T20:53:33.927177Z"},"links":{"citing_paper":"/paper/2509.08309"},"observation_digest":"sha256:d4ecb6df9b5f99166104e645b5ba0bfc0bd457d1876066dd057c554c98c193c4","observation_id":"6f810480-b13f-4aa8-a392-a9be854e583b","resolution":{"observed_at":"2026-08-04T20:53:34.396862Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.09670","last_updated":"2024-06-06T15:50:51Z","snapshot_observed_at":"2026-08-05T00:28:57.370523Z","submitted_at":"2024-01-18T01:03:38Z","title":"DistServe: Disaggregating Prefill and Decoding for Goodput-optimized Large Language Model Serving","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.09670","snapshot_observed_at":"2026-08-04T20:53:34.066002Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08309","last_updated":"2025-09-10T06:06:51Z","snapshot_observed_at":"2026-08-06T05:24:56.655402Z","submitted_at":"2025-09-10T06:06:51Z","title":"Hetis: Serving LLMs in Heterogeneous GPU Clusters with Fine-grained and Dynamic Parallelism","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-04T20:53:34.066002Z"},"links":{"cited_paper":"/paper/2401.09670","citing_paper":"/paper/2509.08309"},"observation_digest":"sha256:2a0f8d623bc3ca13dc478769808b454336d79010c188deed7d0c9e207dd2cd9d","observation_id":"9192a142-3d6c-4fce-86d3-d76f90c84f91","resolution":{"observed_at":"2026-08-04T20:53:34.066002Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.01136","last_updated":"2024-03-02T08:40:07Z","snapshot_observed_at":"2026-08-05T08:03:09.194343Z","submitted_at":"2024-03-02T08:40:07Z","title":"LLM-PQ: Serving LLM on Heterogeneous Clusters with Phase-Aware Partition and Adaptive Quantization","version":1},"cited_work":{"arxiv_id":"2403.01136","doi":null,"metadata_source":"pith","pith_arxiv_id":"2403.01136","snapshot_observed_at":"2026-08-04T20:53:34.132831Z","title":"LLM-PQ: Serving LLM on Heterogeneous Clusters with Phase-Aware Partition and Adaptive Quantization","venue":"cs.LG","work_id":"3f57085b-02d8-4add-850e-1b10c72bc15d","year":2024},"citing_paper":{"arxiv_id":"2509.08309","last_updated":"2025-09-10T06:06:51Z","snapshot_observed_at":"2026-08-06T05:24:56.655402Z","submitted_at":"2025-09-10T06:06:51Z","title":"Hetis: Serving LLMs in Heterogeneous GPU Clusters with Fine-grained and Dynamic Parallelism","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-04T20:53:34.032926Z"},"links":{"cited_paper":"/paper/2403.01136","citing_paper":"/paper/2509.08309"},"observation_digest":"sha256:5b37816d5f9308e01e3650af39423b88ef0cab18872bd151f94276059c6cdfb4","observation_id":"1348a3f9-69bb-46ae-9f58-35a695b08b7d","resolution":{"observed_at":"2026-08-04T20:53:34.170416Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:53:36.049543Z","title":"InForty-first International Conference on Machine Learning","venue":null,"work_id":"dee59275-fd31-4121-8355-fcee3fcc9b2c","year":null},"citing_paper":{"arxiv_id":"2509.08309","last_updated":"2025-09-10T06:06:51Z","snapshot_observed_at":"2026-08-06T05:24:56.655402Z","submitted_at":"2025-09-10T06:06:51Z","title":"Hetis: Serving LLMs in Heterogeneous GPU Clusters with Fine-grained and Dynamic Parallelism","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-04T20:53:32.113597Z"},"links":{"citing_paper":"/paper/2509.08309"},"observation_digest":"sha256:3f1b29061ffc88656fbcd21db8c00aa33ae5f782bb7b43fccebbd562419a9df5","observation_id":"08cad4e3-d216-4e00-b78e-5da19ee5768e","resolution":{"observed_at":"2026-08-04T20:53:36.130334Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2509.08309","last_updated":"2025-09-10T06:06:51Z","latest_version":1,"primary_category":"cs.DC","snapshot_observed_at":"2026-08-06T05:24:56.655402Z","submitted_at":"2025-09-10T06:06:51Z","title":"Hetis: Serving LLMs in Heterogeneous GPU Clusters with Fine-grained and Dynamic Parallelism"},"reference_resolution":{"displayed":53,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":48,"verified_exact":1,"verified_fuzzy":4},"total_outbound_references":53},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 53 of 53 outbound references and 1 inbound Pith citation observation for arXiv:2509.08309."}