{"as_of":"2026-08-19T19:56:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:07f9217d7dc53c2f8ef68a847b87ee76301a61fb47c3cd4931107127eff23e81","coverage":[{"denominator":56,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":56,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T11:27:17.414952Z","state":"measured"},{"denominator":59,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":59,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-21T08:39:31.911497Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-21T08:39:53.273252Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2504.15720","last_updated":"2025-04-22T09:08:46Z","snapshot_observed_at":"2026-08-19T18:36:48.696862Z","submitted_at":"2025-04-22T09:08:46Z","title":"SeaLLM: Service-Aware and Latency-Optimized Resource Sharing for Large Language Model Inference","version":1},"cited_work":{"arxiv_id":"2504.15720","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.15720","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"ea3138fc-a8be-4f50-8b8c-977e7c708a1a","year":2025},"citing_paper":{"arxiv_id":"2604.15186","last_updated":"2026-04-16T16:15:29Z","snapshot_observed_at":"2026-08-11T14:14:11.088453Z","submitted_at":"2026-04-16T16:15:29Z","title":"Scepsy: Serving Agentic Workflows Using Aggregate LLM Pipelines","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-05-10T09:52:40.057014Z"},"links":{"cited_paper":"/paper/2504.15720","citing_paper":"/paper/2604.15186"},"observation_digest":"sha256:ecc9d812f1ab8dcd5f721d45be22de5bb3982c3a3981d551f9634501cb6689f9","observation_id":"592b20dd-ebed-4ee1-aa86-bea085db47fc","resolution":{"observed_at":"2026-05-10T09:59:03.501623Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.15720","last_updated":"2025-04-22T09:08:46Z","snapshot_observed_at":"2026-08-19T18:36:48.696862Z","submitted_at":"2025-04-22T09:08:46Z","title":"SeaLLM: Service-Aware and Latency-Optimized Resource Sharing for Large Language Model Inference","version":1},"cited_work":{"arxiv_id":"2504.15720","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.15720","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"ea3138fc-a8be-4f50-8b8c-977e7c708a1a","year":2025},"citing_paper":{"arxiv_id":"2605.06534","last_updated":"2026-05-20T11:37:51Z","snapshot_observed_at":"2026-08-15T15:49:31.621402Z","submitted_at":"2026-05-07T16:33:40Z","title":"ROSE: Rollout On Serving GPUs via Cooperative Elasticity for Agentic RL","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-05-08T05:14:14.168753Z"},"links":{"cited_paper":"/paper/2504.15720","citing_paper":"/paper/2605.06534"},"observation_digest":"sha256:0522c525d8d295f2b38ca2db70e33d435abb387f45328f828e30361c353873a0","observation_id":"c5985ef2-03a5-4a08-9244-cc03e0a45768","resolution":{"observed_at":"2026-05-11T21:31:16.469748Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.15720","last_updated":"2025-04-22T09:08:46Z","snapshot_observed_at":"2026-08-19T18:36:48.696862Z","submitted_at":"2025-04-22T09:08:46Z","title":"SeaLLM: Service-Aware and Latency-Optimized Resource Sharing for Large Language Model Inference","version":1},"cited_work":{"arxiv_id":"2504.15720","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.15720","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"ea3138fc-a8be-4f50-8b8c-977e7c708a1a","year":2025},"citing_paper":{"arxiv_id":"2605.06534","last_updated":"2026-05-20T11:37:51Z","snapshot_observed_at":"2026-08-15T15:49:31.621402Z","submitted_at":"2026-05-07T16:33:40Z","title":"ROSE: Rollout On Serving GPUs via Cooperative Elasticity for Agentic RL","version":2},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-05-21T08:39:31.911497Z"},"links":{"cited_paper":"/paper/2504.15720","citing_paper":"/paper/2605.06534"},"observation_digest":"sha256:2fee22f2378365eaad3629f31aa21af5d3ea235945467809825807c722359ee5","observation_id":"e5689416-4417-4ade-b42a-f2ea026da362","resolution":{"observed_at":"2026-05-21T08:39:53.275321Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2504.15720/citation-record","integrity":"/paper/2504.15720/integrity","json":"/paper/2504.15720/citation-record.json","paper":"/paper/2504.15720"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:27:18.433083Z","title":"https://github.com/NVIDIA/ FasterTransformer, 2019","venue":null,"work_id":"30c7f983-3de9-4c61-b3ea-b55208417102","year":2019},"citing_paper":{"arxiv_id":"2504.15720","last_updated":"2025-04-22T09:08:46Z","snapshot_observed_at":"2026-08-19T18:36:48.696862Z","submitted_at":"2025-04-22T09:08:46Z","title":"SeaLLM: Service-Aware and Latency-Optimized Resource Sharing for Large Language Model Inference","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-16T11:27:17.165095Z"},"links":{"citing_paper":"/paper/2504.15720"},"observation_digest":"sha256:374a60f493a60a06421bcfdd8369414c997c6b56a9e5924dcdc52aa649a1438e","observation_id":"7340987e-080f-449a-9a66-6ac0cdbe4ecc","resolution":{"observed_at":"2026-08-16T11:27:18.437702Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:27:18.418358Z","title":"https://grpc.io, 2021","venue":null,"work_id":"d3efc271-e524-4bea-9cff-9bc0cb0dbabc","year":2021},"citing_paper":{"arxiv_id":"2504.15720","last_updated":"2025-04-22T09:08:46Z","snapshot_observed_at":"2026-08-19T18:36:48.696862Z","submitted_at":"2025-04-22T09:08:46Z","title":"SeaLLM: Service-Aware and Latency-Optimized Resource Sharing for Large Language Model Inference","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-16T11:27:17.170496Z"},"links":{"citing_paper":"/paper/2504.15720"},"observation_digest":"sha256:e83f279abe29d7e4da35ef639c808007e727f1d426925abcaccfb98954ee8167","observation_id":"6137fcf8-0bf5-47cf-a180-f172b67436dc","resolution":{"observed_at":"2026-08-16T11:27:18.422918Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:27:18.402801Z","title":"https://github.com/intel/ Multi-llms-Chatbot-CloudNative-LangChain , 2022","venue":null,"work_id":"d6cdce86-46d3-4116-99c3-ee26c6d1098b","year":2022},"citing_paper":{"arxiv_id":"2504.15720","last_updated":"2025-04-22T09:08:46Z","snapshot_observed_at":"2026-08-19T18:36:48.696862Z","submitted_at":"2025-04-22T09:08:46Z","title":"SeaLLM: Service-Aware and Latency-Optimized Resource Sharing for Large Language Model Inference","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-16T11:27:17.174815Z"},"links":{"citing_paper":"/paper/2504.15720"},"observation_digest":"sha256:9f8fde7d55fa6b3fb9b578a7534d77d92b2e59fcc39879d78d0f9ffc1a31fb8a","observation_id":"bfe8ab4c-5883-4dae-bdd5-b7c2a033375e","resolution":{"observed_at":"2026-08-16T11:27:18.407689Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:27:18.387690Z","title":"https://docs.nvidia.com/ deploy/mps/index.html, 2022","venue":null,"work_id":"b2925a5d-8a8b-4b3b-ad07-50d9f69d7918","year":2022},"citing_paper":{"arxiv_id":"2504.15720","last_updated":"2025-04-22T09:08:46Z","snapshot_observed_at":"2026-08-19T18:36:48.696862Z","submitted_at":"2025-04-22T09:08:46Z","title":"SeaLLM: Service-Aware and Latency-Optimized Resource Sharing for Large Language Model Inference","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-16T11:27:17.179061Z"},"links":{"citing_paper":"/paper/2504.15720"},"observation_digest":"sha256:58a1c942448bf26e81c85bc6b55f071b2203166ff3fd78b4222285dc3b808d7f","observation_id":"7cb0b10c-5c72-42c7-820a-23ae4df85cd2","resolution":{"observed_at":"2026-08-16T11:27:18.392475Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:27:18.372919Z","title":"https://sharegpt.com/, 2023","venue":null,"work_id":"5178c100-a74d-4071-8610-a31475c2f066","year":2023},"citing_paper":{"arxiv_id":"2504.15720","last_updated":"2025-04-22T09:08:46Z","snapshot_observed_at":"2026-08-19T18:36:48.696862Z","submitted_at":"2025-04-22T09:08:46Z","title":"SeaLLM: Service-Aware and Latency-Optimized Resource Sharing for Large Language Model Inference","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-16T11:27:17.183565Z"},"links":{"citing_paper":"/paper/2504.15720"},"observation_digest":"sha256:4e2f52217718fd31fe85c7045924012905767ce14aca45bfca08f25730f54ac4","observation_id":"f8e2f591-8374-4098-a8a6-4f439e3d9f51","resolution":{"observed_at":"2026-08-16T11:27:18.377688Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:27:18.358123Z","title":"https://github.com/NVIDIA/ TensorRT-LLM, 2023","venue":null,"work_id":"be873f81-eabe-4518-b0d4-c60d3656e400","year":2023},"citing_paper":{"arxiv_id":"2504.15720","last_updated":"2025-04-22T09:08:46Z","snapshot_observed_at":"2026-08-19T18:36:48.696862Z","submitted_at":"2025-04-22T09:08:46Z","title":"SeaLLM: Service-Aware and Latency-Optimized Resource Sharing for Large Language Model Inference","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-16T11:27:17.188222Z"},"links":{"citing_paper":"/paper/2504.15720"},"observation_digest":"sha256:79c5842bad6e8c089e17b27c37e55558b7b2a98529a383776b884330454fba31","observation_id":"0e2ffc21-970c-4021-ad09-c809c8a3fd76","resolution":{"observed_at":"2026-08-16T11:27:18.362918Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:27:18.343086Z","title":"https://github.com/ huggingface/text-generation-inference, 2023","venue":null,"work_id":"23365e69-7366-44b5-b2c4-c7650739aac8","year":2023},"citing_paper":{"arxiv_id":"2504.15720","last_updated":"2025-04-22T09:08:46Z","snapshot_observed_at":"2026-08-19T18:36:48.696862Z","submitted_at":"2025-04-22T09:08:46Z","title":"SeaLLM: Service-Aware and Latency-Optimized Resource Sharing for Large Language Model Inference","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-16T11:27:17.193938Z"},"links":{"citing_paper":"/paper/2504.15720"},"observation_digest":"sha256:53da3c959777344a5a03352375924004552ba6fbf78ef24e0095c7f1a7dbcb6b","observation_id":"30ee97f0-454d-4498-a683-085927b9d4cf","resolution":{"observed_at":"2026-08-16T11:27:18.348008Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-17T09:58:46.058102Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-16T11:27:17.199332Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.15720","last_updated":"2025-04-22T09:08:46Z","snapshot_observed_at":"2026-08-19T18:36:48.696862Z","submitted_at":"2025-04-22T09:08:46Z","title":"SeaLLM: Service-Aware and Latency-Optimized Resource Sharing for Large Language Model Inference","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-16T11:27:17.199332Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2504.15720"},"observation_digest":"sha256:b7c9ea115e67fe3d8d965fae359f20432579a7b0a5a96b3ef19d8672e6667dea","observation_id":"3f08bd48-9ae9-407b-8dae-d6a497397c42","resolution":{"observed_at":"2026-08-16T11:27:17.199332Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.16369","last_updated":"2023-08-31T00:03:02Z","snapshot_observed_at":"2026-08-15T04:42:28.752204Z","submitted_at":"2023-08-31T00:03:02Z","title":"SARATHI: Efficient LLM Inference by Piggybacking Decodes with Chunked Prefills","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.16369","snapshot_observed_at":"2026-08-16T11:27:17.203985Z","title":"Sarathi: Efficient llm inference by piggy- backing decodes with chunked prefills","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.15720","last_updated":"2025-04-22T09:08:46Z","snapshot_observed_at":"2026-08-19T18:36:48.696862Z","submitted_at":"2025-04-22T09:08:46Z","title":"SeaLLM: Service-Aware and Latency-Optimized Resource Sharing for Large Language Model Inference","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-16T11:27:17.203985Z"},"links":{"cited_paper":"/paper/2308.16369","citing_paper":"/paper/2504.15720"},"observation_digest":"sha256:fe20b7f3063daa1d28163a3482c90258751d3e8a1bf2526eb41446da279db8c9","observation_id":"86a07eb9-9c87-4048-8481-745792a8a018","resolution":{"observed_at":"2026-08-16T11:27:17.203985Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:27:18.327827Z","title":"pfabric: Minimal near-optimal datacenter transport","venue":null,"work_id":"becb0358-0503-4fed-9d6c-c3b075a46155","year":2013},"citing_paper":{"arxiv_id":"2504.15720","last_updated":"2025-04-22T09:08:46Z","snapshot_observed_at":"2026-08-19T18:36:48.696862Z","submitted_at":"2025-04-22T09:08:46Z","title":"SeaLLM: Service-Aware and Latency-Optimized Resource Sharing for Large Language Model Inference","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-16T11:27:17.208802Z"},"links":{"citing_paper":"/paper/2504.15720"},"observation_digest":"sha256:f0526dbe5c86f116ece8aaef70543b1fd22960e039253797195b4138e96accbc","observation_id":"d05bb618-29ef-4a9e-a683-2da7b9daee7d","resolution":{"observed_at":"2026-08-16T11:27:18.332789Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:27:18.312610Z","title":"Deepspeed-inference: enabling efficient inference of transformer models at unprecedented scale","venue":null,"work_id":"05564d49-bd88-4066-818d-23eaf4f6f246","year":2022},"citing_paper":{"arxiv_id":"2504.15720","last_updated":"2025-04-22T09:08:46Z","snapshot_observed_at":"2026-08-19T18:36:48.696862Z","submitted_at":"2025-04-22T09:08:46Z","title":"SeaLLM: Service-Aware and Latency-Optimized Resource Sharing for Large Language Model Inference","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-16T11:27:17.213120Z"},"links":{"citing_paper":"/paper/2504.15720"},"observation_digest":"sha256:6429c9d72558cd27a5f03ccd580400562889fa2c223e7e8f56f055e23c1c878e","observation_id":"45ceae2e-00af-42c3-8b54-fa97901524c5","resolution":{"observed_at":"2026-08-16T11:27:18.317402Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.14508","last_updated":"2024-06-19T04:00:32Z","snapshot_observed_at":"2026-08-08T03:49:18.086396Z","submitted_at":"2023-08-28T11:53:40Z","title":"LongBench: A Bilingual, Multitask Benchmark for Long Context Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.14508","snapshot_observed_at":"2026-08-16T11:27:17.217764Z","title":"Longbench: A bilingual, multi- task benchmark for long context understanding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.15720","last_updated":"2025-04-22T09:08:46Z","snapshot_observed_at":"2026-08-19T18:36:48.696862Z","submitted_at":"2025-04-22T09:08:46Z","title":"SeaLLM: Service-Aware and Latency-Optimized Resource Sharing for Large Language Model Inference","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-16T11:27:17.217764Z"},"links":{"cited_paper":"/paper/2308.14508","citing_paper":"/paper/2504.15720"},"observation_digest":"sha256:575b1a150d09a241df9f9d5ca02a92f48eebfad0f10f3529974b1ad6b00c66a4","observation_id":"74150bb5-c2f8-4f96-b4b7-3924b8695457","resolution":{"observed_at":"2026-08-16T11:27:17.217764Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:27:18.297497Z","title":"Language models are few-shot learners","venue":null,"work_id":"90f5fb74-7712-46ac-a264-e7ba909cb120","year":2020},"citing_paper":{"arxiv_id":"2504.15720","last_updated":"2025-04-22T09:08:46Z","snapshot_observed_at":"2026-08-19T18:36:48.696862Z","submitted_at":"2025-04-22T09:08:46Z","title":"SeaLLM: Service-Aware and Latency-Optimized Resource Sharing for Large Language Model Inference","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-16T11:27:17.222805Z"},"links":{"citing_paper":"/paper/2504.15720"},"observation_digest":"sha256:f9233e6b974005fe0f49cced4d4e349b20fb28ef873f09805387dd4d6132f387","observation_id":"8a423f4c-22be-4540-b5c4-3b861345263b","resolution":{"observed_at":"2026-08-16T11:27:18.302016Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:27:18.282844Z","title":"Round-robin syn- chronization: Mitigating communication bottlenecks in parameter servers","venue":null,"work_id":"39a458b7-1d8a-4c97-91ee-65e61fb9d02b","year":2019},"citing_paper":{"arxiv_id":"2504.15720","last_updated":"2025-04-22T09:08:46Z","snapshot_observed_at":"2026-08-19T18:36:48.696862Z","submitted_at":"2025-04-22T09:08:46Z","title":"SeaLLM: Service-Aware and Latency-Optimized Resource Sharing for Large Language Model Inference","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-16T11:27:17.227789Z"},"links":{"citing_paper":"/paper/2504.15720"},"observation_digest":"sha256:55c68e4d78ec4841cd70c3f2777a5950940c7280cab19247fcee51c15b13836b","observation_id":"12a6f59a-544e-4085-804c-2856e0574a86","resolution":{"observed_at":"2026-08-16T11:27:18.287280Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03374","last_updated":"2021-07-14T17:16:02Z","snapshot_observed_at":"2026-08-08T11:58:24.516369Z","submitted_at":"2021-07-07T17:41:24Z","title":"Evaluating Large Language Models Trained on Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.03374","snapshot_observed_at":"2026-08-16T11:27:17.232360Z","title":"Evaluating large language models trained on code","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.15720","last_updated":"2025-04-22T09:08:46Z","snapshot_observed_at":"2026-08-19T18:36:48.696862Z","submitted_at":"2025-04-22T09:08:46Z","title":"SeaLLM: Service-Aware and Latency-Optimized Resource Sharing for Large Language Model Inference","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-16T11:27:17.232360Z"},"links":{"cited_paper":"/paper/2107.03374","citing_paper":"/paper/2504.15720"},"observation_digest":"sha256:1e05c037bdc3dd30a67c1543b1a8afb5124c99cd75b3e9ec66940a6701539623","observation_id":"108fd049-8043-4ddb-8568-ed22aa21b78f","resolution":{"observed_at":"2026-08-16T11:27:17.232360Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:27:18.269521Z","title":"Gonzalez, Ion Sto- ica, and Eric P","venue":null,"work_id":"ae0d11c5-5b48-4afe-b17b-190e1b185842","year":2023},"citing_paper":{"arxiv_id":"2504.15720","last_updated":"2025-04-22T09:08:46Z","snapshot_observed_at":"2026-08-19T18:36:48.696862Z","submitted_at":"2025-04-22T09:08:46Z","title":"SeaLLM: Service-Aware and Latency-Optimized Resource Sharing for Large Language Model Inference","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-16T11:27:17.236934Z"},"links":{"citing_paper":"/paper/2504.15720"},"observation_digest":"sha256:3ba22b3e65a5e7e253fff3ba960eddb1671fa4ff1eb916b6fe54a4aba72d1297","observation_id":"6ae1a0f0-9cc4-4839-9fe7-67b4416419a4","resolution":{"observed_at":"2026-08-16T11:27:18.273477Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:27:18.255659Z","title":"Fu, Stefano Ermon, Atri Rudra, and Christopher Ré","venue":null,"work_id":"c1fbf909-b701-45c5-afd4-b9a69afc3b86","year":2022},"citing_paper":{"arxiv_id":"2504.15720","last_updated":"2025-04-22T09:08:46Z","snapshot_observed_at":"2026-08-19T18:36:48.696862Z","submitted_at":"2025-04-22T09:08:46Z","title":"SeaLLM: Service-Aware and Latency-Optimized Resource Sharing for Large Language Model Inference","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-16T11:27:17.241661Z"},"links":{"citing_paper":"/paper/2504.15720"},"observation_digest":"sha256:85960574a8f65c5969653316d677cb7396b9ecfab4a1f844e4c626c112cf0b1c","observation_id":"ebed2ad7-3604-4734-ab14-18343632a9ba","resolution":{"observed_at":"2026-08-16T11:27:18.260324Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:27:18.240926Z","title":"Muxserve: Flexible spatial-temporal multiplex- ing for multiple llm serving","venue":null,"work_id":"4647f6b9-0084-428f-ad4d-0dde1879cdb4","year":2024},"citing_paper":{"arxiv_id":"2504.15720","last_updated":"2025-04-22T09:08:46Z","snapshot_observed_at":"2026-08-19T18:36:48.696862Z","submitted_at":"2025-04-22T09:08:46Z","title":"SeaLLM: Service-Aware and Latency-Optimized Resource Sharing for Large Language Model Inference","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-16T11:27:17.246315Z"},"links":{"citing_paper":"/paper/2504.15720"},"observation_digest":"sha256:283e08a6d856451aeec07c654a37b28cf072dfb9380e337640136cdfde3d636c","observation_id":"4aca20fb-7ba0-4821-a637-cfb9847e78cf","resolution":{"observed_at":"2026-08-16T11:27:18.245593Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-16T11:27:17.251005Z","title":"The llama 3 herd of models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.15720","last_updated":"2025-04-22T09:08:46Z","snapshot_observed_at":"2026-08-19T18:36:48.696862Z","submitted_at":"2025-04-22T09:08:46Z","title":"SeaLLM: Service-Aware and Latency-Optimized Resource Sharing for Large Language Model Inference","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-16T11:27:17.251005Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2504.15720"},"observation_digest":"sha256:489e6fbfadf8ad153125f9bd882a3f91d0c8728eefee4da00f39ba0d030866ba","observation_id":"64b2057c-11b8-4c18-9e0e-77cd9ccde5b3","resolution":{"observed_at":"2026-08-16T11:27:17.251005Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:27:18.226102Z","title":"Turbotransformers: an efficient gpu serving system for transformer models","venue":null,"work_id":"cf47ce91-4854-4cd0-9f59-0b3e643fc1f7","year":2021},"citing_paper":{"arxiv_id":"2504.15720","last_updated":"2025-04-22T09:08:46Z","snapshot_observed_at":"2026-08-19T18:36:48.696862Z","submitted_at":"2025-04-22T09:08:46Z","title":"SeaLLM: Service-Aware and Latency-Optimized Resource Sharing for Large Language Model Inference","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-16T11:27:17.255630Z"},"links":{"citing_paper":"/paper/2504.15720"},"observation_digest":"sha256:9a89b70981fab5b1260e932c3fa63637c832ad0cf9bca3f3bafc97402d55a94e","observation_id":"964531ed-3e3d-4bc5-a3d5-2105cfc0a74d","resolution":{"observed_at":"2026-08-16T11:27:18.230830Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:27:18.210824Z","title":"Elasticflow: An elastic server- less training platform for distributed deep learning","venue":null,"work_id":"58ae5612-ee08-4615-a9c9-5a83d753ed71","year":2023},"citing_paper":{"arxiv_id":"2504.15720","last_updated":"2025-04-22T09:08:46Z","snapshot_observed_at":"2026-08-19T18:36:48.696862Z","submitted_at":"2025-04-22T09:08:46Z","title":"SeaLLM: Service-Aware and Latency-Optimized Resource Sharing for Large Language Model Inference","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-16T11:27:17.259691Z"},"links":{"citing_paper":"/paper/2504.15720"},"observation_digest":"sha256:668e13fa42ca0473a1f6656f15c53f4adc0c06cba085d4146374607393b6b2b4","observation_id":"561bcb60-52e4-4e30-8242-52a98e2b0249","resolution":{"observed_at":"2026-08-16T11:27:18.215724Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:27:18.194466Z","title":"Microsecond-scale preemption for concurrent gpu-accelerated dnn inferences","venue":null,"work_id":"fd88fe5f-6f1b-4cc4-b88f-d42ff6c4029e","year":2022},"citing_paper":{"arxiv_id":"2504.15720","last_updated":"2025-04-22T09:08:46Z","snapshot_observed_at":"2026-08-19T18:36:48.696862Z","submitted_at":"2025-04-22T09:08:46Z","title":"SeaLLM: Service-Aware and Latency-Optimized Resource Sharing for Large Language Model Inference","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-16T11:27:17.263861Z"},"links":{"citing_paper":"/paper/2504.15720"},"observation_digest":"sha256:c9ec2b21c4da4492c149947266bf8aa06b3d563f2bc9e070bf82d365ee852c84","observation_id":"ca31ddfd-51f7-4a7e-8a9a-c8f5cfa0e6e4","resolution":{"observed_at":"2026-08-16T11:27:18.199737Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.08671","last_updated":"2024-01-09T06:49:40Z","snapshot_observed_at":"2026-08-16T14:47:07.109022Z","submitted_at":"2024-01-09T06:49:40Z","title":"DeepSpeed-FastGen: High-throughput Text Generation for LLMs via MII and DeepSpeed-Inference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.08671","snapshot_observed_at":"2026-08-16T11:27:17.268072Z","title":"Deepspeed-fastgen: High-throughput text generation for llms via mii and deepspeed-inference","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.15720","last_updated":"2025-04-22T09:08:46Z","snapshot_observed_at":"2026-08-19T18:36:48.696862Z","submitted_at":"2025-04-22T09:08:46Z","title":"SeaLLM: Service-Aware and Latency-Optimized Resource Sharing for Large Language Model Inference","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-16T11:27:17.268072Z"},"links":{"cited_paper":"/paper/2401.08671","citing_paper":"/paper/2504.15720"},"observation_digest":"sha256:0fbda5ca86007f57b46114a1c0bb8dcfbc9fba70d229f147fc85bdf54c6877d8","observation_id":"d2c85ef4-c9e7-4393-b965-2be97d35296d","resolution":{"observed_at":"2026-08-16T11:27:17.268072Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:27:18.179769Z","title":"Flashdecod- ing++: Faster large language model inference with asyn- chronization, flat gemm optimization, and heuristics","venue":null,"work_id":"a8d74b5d-8b95-4139-9aac-f5146ff492f1","year":2024},"citing_paper":{"arxiv_id":"2504.15720","last_updated":"2025-04-22T09:08:46Z","snapshot_observed_at":"2026-08-19T18:36:48.696862Z","submitted_at":"2025-04-22T09:08:46Z","title":"SeaLLM: Service-Aware and Latency-Optimized Resource Sharing for Large Language Model Inference","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-16T11:27:17.272830Z"},"links":{"citing_paper":"/paper/2504.15720"},"observation_digest":"sha256:3431055e3a054e68473bdfd7f8f972733573b8921746d7badc4b9e53188a1615","observation_id":"ac7f61a9-07fa-4315-b3e7-bb5ad79f5fec","resolution":{"observed_at":"2026-08-16T11:27:18.184577Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.11181","last_updated":"2024-01-20T09:43:36Z","snapshot_observed_at":"2026-08-16T14:25:57.735259Z","submitted_at":"2024-01-20T09:43:36Z","title":"Inference without Interference: Disaggregate LLM Inference for Mixed Downstream Workloads","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.11181","snapshot_observed_at":"2026-08-16T11:27:17.277341Z","title":"Inference without interfer- ence: Disaggregate llm inference for mixed downstream workloads","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.15720","last_updated":"2025-04-22T09:08:46Z","snapshot_observed_at":"2026-08-19T18:36:48.696862Z","submitted_at":"2025-04-22T09:08:46Z","title":"SeaLLM: Service-Aware and Latency-Optimized Resource Sharing for Large Language Model Inference","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-16T11:27:17.277341Z"},"links":{"cited_paper":"/paper/2401.11181","citing_paper":"/paper/2504.15720"},"observation_digest":"sha256:c430b2c70ad5efb4aae74c8e574fbe879b523ac334e26e15a37cc0628d897540","observation_id":"e2a3d4bc-076a-42b9-bf77-696f2ed63a25","resolution":{"observed_at":"2026-08-16T11:27:17.277341Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:27:18.163745Z","title":"Gpipe: Effi- cient training of giant neural networks using pipeline parallelism","venue":null,"work_id":"7b9e063e-262c-4621-8335-bae86874f9af","year":2019},"citing_paper":{"arxiv_id":"2504.15720","last_updated":"2025-04-22T09:08:46Z","snapshot_observed_at":"2026-08-19T18:36:48.696862Z","submitted_at":"2025-04-22T09:08:46Z","title":"SeaLLM: Service-Aware and Latency-Optimized Resource Sharing for Large Language Model Inference","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-16T11:27:17.281992Z"},"links":{"citing_paper":"/paper/2504.15720"},"observation_digest":"sha256:314b37b0614054e1f99f7f650e610ddae16bf3dc1c14a52a6aaacba0fba04ca7","observation_id":"c7719e71-a5ac-471e-8d7e-3d7c26213d34","resolution":{"observed_at":"2026-08-16T11:27:18.168562Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:27:18.149158Z","title":"Shinjuku: Preemptive scheduling for µsecond-scale tail latency","venue":null,"work_id":"c92072c7-d53b-44c9-b140-26c3f8be78f8","year":2019},"citing_paper":{"arxiv_id":"2504.15720","last_updated":"2025-04-22T09:08:46Z","snapshot_observed_at":"2026-08-19T18:36:48.696862Z","submitted_at":"2025-04-22T09:08:46Z","title":"SeaLLM: Service-Aware and Latency-Optimized Resource Sharing for Large Language Model Inference","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-16T11:27:17.286445Z"},"links":{"citing_paper":"/paper/2504.15720"},"observation_digest":"sha256:03b988fa1a242e3efe7e844e9ce4f74415b8c0ed69aa0bb4c22b6fefbe113059","observation_id":"ecc4599a-b499-46bf-b337-5d25da035521","resolution":{"observed_at":"2026-08-16T11:27:18.153806Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:27:18.133711Z","title":"Reducing activation recomputation in large transformer models","venue":null,"work_id":"79e8d8da-94e4-4700-873b-bb9d949aace3","year":2023},"citing_paper":{"arxiv_id":"2504.15720","last_updated":"2025-04-22T09:08:46Z","snapshot_observed_at":"2026-08-19T18:36:48.696862Z","submitted_at":"2025-04-22T09:08:46Z","title":"SeaLLM: Service-Aware and Latency-Optimized Resource Sharing for Large Language Model Inference","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-16T11:27:17.291196Z"},"links":{"citing_paper":"/paper/2504.15720"},"observation_digest":"sha256:115a9cd7203e8fa44ee15a878857b7dd5997a83ddb8ef8a8c80a7d417db32e83","observation_id":"290c8da1-53d9-4015-94fb-2ea69faa371a","resolution":{"observed_at":"2026-08-16T11:27:18.138872Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:27:18.119456Z","title":"Gonza- lez, Hao Zhang, and Ion Stoica","venue":null,"work_id":"02abd407-ee53-4012-8e16-7576b80b8d82","year":2023},"citing_paper":{"arxiv_id":"2504.15720","last_updated":"2025-04-22T09:08:46Z","snapshot_observed_at":"2026-08-19T18:36:48.696862Z","submitted_at":"2025-04-22T09:08:46Z","title":"SeaLLM: Service-Aware and Latency-Optimized Resource Sharing for Large Language Model Inference","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-16T11:27:17.295780Z"},"links":{"citing_paper":"/paper/2504.15720"},"observation_digest":"sha256:79844994b41d459d03cedab62afe9652735aec29e5fb53230e9d82cbf4271980","observation_id":"13a05f4b-25dc-4ac6-9aaa-230fb6bc8c73","resolution":{"observed_at":"2026-08-16T11:27:18.123732Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:27:18.104842Z","title":"Sequence parallelism: Long sequence training from system perspective","venue":null,"work_id":"36fd2def-97bc-4280-8963-7b47d518a611","year":2023},"citing_paper":{"arxiv_id":"2504.15720","last_updated":"2025-04-22T09:08:46Z","snapshot_observed_at":"2026-08-19T18:36:48.696862Z","submitted_at":"2025-04-22T09:08:46Z","title":"SeaLLM: Service-Aware and Latency-Optimized Resource Sharing for Large Language Model Inference","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-16T11:27:17.300240Z"},"links":{"citing_paper":"/paper/2504.15720"},"observation_digest":"sha256:41a7d9505713a4a599bea06f1c23da819565fc6d3727a2808c0bdb2d0e9cfa01","observation_id":"15d34d5a-454c-40b0-a7d4-a61e1350e5fc","resolution":{"observed_at":"2026-08-16T11:27:18.109417Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:27:18.089846Z","title":"Competition-level code generation with alphacode","venue":null,"work_id":"e51d0e25-2123-4724-a8cb-276c4419a487","year":2022},"citing_paper":{"arxiv_id":"2504.15720","last_updated":"2025-04-22T09:08:46Z","snapshot_observed_at":"2026-08-19T18:36:48.696862Z","submitted_at":"2025-04-22T09:08:46Z","title":"SeaLLM: Service-Aware and Latency-Optimized Resource Sharing for Large Language Model Inference","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-16T11:27:17.304850Z"},"links":{"citing_paper":"/paper/2504.15720"},"observation_digest":"sha256:4ee04a893d6b71316a97f5c76cb65f6bcbf891a6aec2091f31979e27b76ebc58","observation_id":"993a94d8-7221-492f-b46e-c519cac68129","resolution":{"observed_at":"2026-08-16T11:27:18.094156Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:27:18.074954Z","title":"Alpaserve: Sta- tistical multiplexing with model parallelism for deep learning serving","venue":null,"work_id":"b8b3c32b-53e5-4512-a716-1a4c1f137dc7","year":2023},"citing_paper":{"arxiv_id":"2504.15720","last_updated":"2025-04-22T09:08:46Z","snapshot_observed_at":"2026-08-19T18:36:48.696862Z","submitted_at":"2025-04-22T09:08:46Z","title":"SeaLLM: Service-Aware and Latency-Optimized Resource Sharing for Large Language Model Inference","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-16T11:27:17.309266Z"},"links":{"citing_paper":"/paper/2504.15720"},"observation_digest":"sha256:1bd5529690a7a8f6b4b22499672dd845321ad2e0e64eed9598b3dffbba91b5ca","observation_id":"3b3d3043-2aeb-4426-aba0-bfea757543cd","resolution":{"observed_at":"2026-08-16T11:27:18.079789Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:27:18.059608Z","title":"Terapipe: Token-level pipeline parallelism for training large-scale language models","venue":null,"work_id":"704f56d9-0ed0-44ee-9ada-d805bbf24988","year":2021},"citing_paper":{"arxiv_id":"2504.15720","last_updated":"2025-04-22T09:08:46Z","snapshot_observed_at":"2026-08-19T18:36:48.696862Z","submitted_at":"2025-04-22T09:08:46Z","title":"SeaLLM: Service-Aware and Latency-Optimized Resource Sharing for Large Language Model Inference","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-16T11:27:17.313460Z"},"links":{"citing_paper":"/paper/2504.15720"},"observation_digest":"sha256:57ca2a14f19737e28b04a95d162200753838ccaa60e26aa9b99e1c5ec5b81917","observation_id":"7af6f457-8d82-43b7-a81d-c976d297061c","resolution":{"observed_at":"2026-08-16T11:27:18.064680Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:27:18.044247Z","title":"Zico: Efficient gpu memory sharing for concurrent dnn training","venue":null,"work_id":"e8481100-2810-4912-9e5e-94575c33b1c0","year":2021},"citing_paper":{"arxiv_id":"2504.15720","last_updated":"2025-04-22T09:08:46Z","snapshot_observed_at":"2026-08-19T18:36:48.696862Z","submitted_at":"2025-04-22T09:08:46Z","title":"SeaLLM: Service-Aware and Latency-Optimized Resource Sharing for Large Language Model Inference","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-16T11:27:17.317817Z"},"links":{"citing_paper":"/paper/2504.15720"},"observation_digest":"sha256:402d9d3dd083810b53cdba9973c624faa08b3e02ad31bb0218f9b5091863b035","observation_id":"24f35d1e-0f34-4aa3-8a44-83907a6554a9","resolution":{"observed_at":"2026-08-16T11:27:18.048956Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:27:18.028908Z","title":"Pipedream: Gen- eralized pipeline parallelism for dnn training","venue":null,"work_id":"da8b2a4d-4d5a-4923-ba04-e459389c3fec","year":2019},"citing_paper":{"arxiv_id":"2504.15720","last_updated":"2025-04-22T09:08:46Z","snapshot_observed_at":"2026-08-19T18:36:48.696862Z","submitted_at":"2025-04-22T09:08:46Z","title":"SeaLLM: Service-Aware and Latency-Optimized Resource Sharing for Large Language Model Inference","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-16T11:27:17.322245Z"},"links":{"citing_paper":"/paper/2504.15720"},"observation_digest":"sha256:2e1359dc4958c2bb70fc1ce3e385138e95acf19f0caab2146c814a06b45f0c24","observation_id":"10393a52-3a95-41f3-9c7c-3d58ce127f58","resolution":{"observed_at":"2026-08-16T11:27:18.033732Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:27:18.013295Z","title":"Splitwise: Efficient generative llm inference using phase splitting","venue":null,"work_id":"c22b91db-5a2f-4e48-b349-d177627cb6d3","year":2024},"citing_paper":{"arxiv_id":"2504.15720","last_updated":"2025-04-22T09:08:46Z","snapshot_observed_at":"2026-08-19T18:36:48.696862Z","submitted_at":"2025-04-22T09:08:46Z","title":"SeaLLM: Service-Aware and Latency-Optimized Resource Sharing for Large Language Model Inference","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-16T11:27:17.326827Z"},"links":{"citing_paper":"/paper/2504.15720"},"observation_digest":"sha256:34fb6f32de0e4a3891de7de3896a661efcfc09b5f68877309b84bc8ef95a6c99","observation_id":"1c598833-6275-46a8-a4b4-14eaddbebf7b","resolution":{"observed_at":"2026-08-16T11:27:18.018424Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:27:17.998046Z","title":"Efficiently scal- ing transformer inference","venue":null,"work_id":"c9d73563-185d-412d-981f-ef579d5aed3c","year":2023},"citing_paper":{"arxiv_id":"2504.15720","last_updated":"2025-04-22T09:08:46Z","snapshot_observed_at":"2026-08-19T18:36:48.696862Z","submitted_at":"2025-04-22T09:08:46Z","title":"SeaLLM: Service-Aware and Latency-Optimized Resource Sharing for Large Language Model Inference","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-16T11:27:17.331272Z"},"links":{"citing_paper":"/paper/2504.15720"},"observation_digest":"sha256:a0f777438e655eb59a0c44fd59563ed3783508e07ae771677fff14c8392deca1","observation_id":"680c6e61-5bc9-4070-9d7e-59aeacb5e1e8","resolution":{"observed_at":"2026-08-16T11:27:18.002764Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:27:17.983049Z","title":"Zero: Memory optimizations toward train- ing trillion parameter models","venue":null,"work_id":"04eba978-2fab-4a88-93fd-21fa53d786a6","year":2020},"citing_paper":{"arxiv_id":"2504.15720","last_updated":"2025-04-22T09:08:46Z","snapshot_observed_at":"2026-08-19T18:36:48.696862Z","submitted_at":"2025-04-22T09:08:46Z","title":"SeaLLM: Service-Aware and Latency-Optimized Resource Sharing for Large Language Model Inference","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-16T11:27:17.335903Z"},"links":{"citing_paper":"/paper/2504.15720"},"observation_digest":"sha256:be53d461fa1443551af74911b73bea2a02a9456615e358bb90872f4544599302","observation_id":"a6758c99-b124-4416-8159-45e92a8712b3","resolution":{"observed_at":"2026-08-16T11:27:17.987739Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:27:17.967395Z","title":"Serverless in the wild: Characterizing and optimizing the serverless workload at a large cloud provider","venue":null,"work_id":"f19932ff-7790-4d26-b0b5-03040f768dcc","year":2020},"citing_paper":{"arxiv_id":"2504.15720","last_updated":"2025-04-22T09:08:46Z","snapshot_observed_at":"2026-08-19T18:36:48.696862Z","submitted_at":"2025-04-22T09:08:46Z","title":"SeaLLM: Service-Aware and Latency-Optimized Resource Sharing for Large Language Model Inference","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-16T11:27:17.340171Z"},"links":{"citing_paper":"/paper/2504.15720"},"observation_digest":"sha256:d91b2fa79fafd7caba6b111be2de3b51d8e39784fb57efa28f608b06134f8077","observation_id":"418eeff4-2bb2-44d8-8635-3d86d76ec71a","resolution":{"observed_at":"2026-08-16T11:27:17.972262Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1909.08053","last_updated":"2020-03-13T23:45:18Z","snapshot_observed_at":"2026-08-12T10:50:46.357243Z","submitted_at":"2019-09-17T19:42:54Z","title":"Megatron-LM: Training Multi-Billion Parameter Language Models Using Model Parallelism","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.08053","snapshot_observed_at":"2026-08-16T11:27:17.344593Z","title":"Megatron-lm: Training multi-billion parameter lan- guage models using model parallelism","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2504.15720","last_updated":"2025-04-22T09:08:46Z","snapshot_observed_at":"2026-08-19T18:36:48.696862Z","submitted_at":"2025-04-22T09:08:46Z","title":"SeaLLM: Service-Aware and Latency-Optimized Resource Sharing for Large Language Model Inference","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-16T11:27:17.344593Z"},"links":{"cited_paper":"/paper/1909.08053","citing_paper":"/paper/2504.15720"},"observation_digest":"sha256:a337ba8931e22636fed02f11ffacfc73fd47b0520688cf20fcf56e01b45bb84a","observation_id":"28abbef3-c935-4056-99c5-e7b03e64a3c1","resolution":{"observed_at":"2026-08-16T11:27:17.344593Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:27:17.952245Z","title":"Llm-planner: Few-shot grounded planning for embodied agents with large language models","venue":null,"work_id":"9d075694-f946-4437-b1d1-05dab3a80bc4","year":2023},"citing_paper":{"arxiv_id":"2504.15720","last_updated":"2025-04-22T09:08:46Z","snapshot_observed_at":"2026-08-19T18:36:48.696862Z","submitted_at":"2025-04-22T09:08:46Z","title":"SeaLLM: Service-Aware and Latency-Optimized Resource Sharing for Large Language Model Inference","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-16T11:27:17.349303Z"},"links":{"citing_paper":"/paper/2504.15720"},"observation_digest":"sha256:4eb81023dc9ba758add4f009c03c775201794cd8460ee1299313b138a0eab7ed","observation_id":"686fb88e-7559-4346-b6b9-d5b9663b7f76","resolution":{"observed_at":"2026-08-16T11:27:17.956997Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:27:17.353326Z","title":"Dynamollm: Designing llm inference clusters for performance and energy efficiency","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.15720","last_updated":"2025-04-22T09:08:46Z","snapshot_observed_at":"2026-08-19T18:36:48.696862Z","submitted_at":"2025-04-22T09:08:46Z","title":"SeaLLM: Service-Aware and Latency-Optimized Resource Sharing for Large Language Model Inference","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-16T11:27:17.353326Z"},"links":{"citing_paper":"/paper/2504.15720"},"observation_digest":"sha256:87c2ff8547467a245e997ffda2acec6293cd95368b81c272d4e9df2e3cf9bb44","observation_id":"b6110508-98e0-496b-b71e-c1b844c56dbd","resolution":{"observed_at":"2026-08-16T11:27:17.353326Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:27:17.937026Z","title":"Llumnix: Dynamic scheduling for large language model serving","venue":null,"work_id":"d76bb02d-3e1b-4432-98d1-6dadb154a853","year":2024},"citing_paper":{"arxiv_id":"2504.15720","last_updated":"2025-04-22T09:08:46Z","snapshot_observed_at":"2026-08-19T18:36:48.696862Z","submitted_at":"2025-04-22T09:08:46Z","title":"SeaLLM: Service-Aware and Latency-Optimized Resource Sharing for Large Language Model Inference","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-16T11:27:17.357268Z"},"links":{"citing_paper":"/paper/2504.15720"},"observation_digest":"sha256:c080ecd88bb29913249d8163a2ab0bbac29e0ab8c412362e91b7b066638b0e67","observation_id":"a6e4fa56-6336-48b4-851b-aa1407346ef2","resolution":{"observed_at":"2026-08-16T11:27:17.941685Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-16T11:27:17.361613Z","title":"Llama 2: Open foundation and fine-tuned chat models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.15720","last_updated":"2025-04-22T09:08:46Z","snapshot_observed_at":"2026-08-19T18:36:48.696862Z","submitted_at":"2025-04-22T09:08:46Z","title":"SeaLLM: Service-Aware and Latency-Optimized Resource Sharing for Large Language Model Inference","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-16T11:27:17.361613Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2504.15720"},"observation_digest":"sha256:3d5a51d1539a530eb2f718ae7765c7a601bec9794406ee28117b6c5e5863b170","observation_id":"178d2813-11b0-4bd9-9b3e-677066d2c086","resolution":{"observed_at":"2026-08-16T11:27:17.361613Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.10073","last_updated":"2022-06-21T01:51:33Z","snapshot_observed_at":"2026-08-16T16:51:37.331618Z","submitted_at":"2022-06-21T01:51:33Z","title":"Finding Optimal Policy for Queueing Models: New Parameterization","version":1},"cited_work":{"arxiv_id":"2206.10073","doi":null,"metadata_source":"pith","pith_arxiv_id":"2206.10073","snapshot_observed_at":"2026-08-16T11:27:17.527767Z","title":"Finding Optimal Policy for Queueing Models: New Parameterization","venue":"math.OC","work_id":"9284a86f-59cc-4427-8084-47a73d008cac","year":2022},"citing_paper":{"arxiv_id":"2504.15720","last_updated":"2025-04-22T09:08:46Z","snapshot_observed_at":"2026-08-19T18:36:48.696862Z","submitted_at":"2025-04-22T09:08:46Z","title":"SeaLLM: Service-Aware and Latency-Optimized Resource Sharing for Large Language Model Inference","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-16T11:27:17.365401Z"},"links":{"cited_paper":"/paper/2206.10073","citing_paper":"/paper/2504.15720"},"observation_digest":"sha256:0ad3f5c7f9eaa1522dae0d7263bffc2cee401491f818fbf8f5fe2673c3d90102","observation_id":"80e70e61-a666-41bf-8b35-1fd428345ac4","resolution":{"observed_at":"2026-08-16T11:27:17.534781Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:27:17.919552Z","title":"Dynamic scheduling with convex delay costs: The generalized c| mu rule","venue":null,"work_id":"187d9368-364d-4af5-b5d9-2c3b13091d87","year":1995},"citing_paper":{"arxiv_id":"2504.15720","last_updated":"2025-04-22T09:08:46Z","snapshot_observed_at":"2026-08-19T18:36:48.696862Z","submitted_at":"2025-04-22T09:08:46Z","title":"SeaLLM: Service-Aware and Latency-Optimized Resource Sharing for Large Language Model Inference","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-16T11:27:17.369609Z"},"links":{"citing_paper":"/paper/2504.15720"},"observation_digest":"sha256:74faf0e8ec6d172e8ba745fe449cb88664bb580282f1dc5122a8c1c4ff59acc3","observation_id":"303f878a-d1b0-453a-adb6-f66e547d35bb","resolution":{"observed_at":"2026-08-16T11:27:17.924984Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.13887","last_updated":"2021-04-22T09:37:37Z","snapshot_observed_at":"2026-08-16T19:11:10.535638Z","submitted_at":"2020-10-23T13:45:26Z","title":"LightSeq: A High Performance Inference Library for Transformers","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.13887","snapshot_observed_at":"2026-08-16T11:27:17.373953Z","title":"Lightseq: A high performance inference library for transformers","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2504.15720","last_updated":"2025-04-22T09:08:46Z","snapshot_observed_at":"2026-08-19T18:36:48.696862Z","submitted_at":"2025-04-22T09:08:46Z","title":"SeaLLM: Service-Aware and Latency-Optimized Resource Sharing for Large Language Model Inference","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-16T11:27:17.373953Z"},"links":{"cited_paper":"/paper/2010.13887","citing_paper":"/paper/2504.15720"},"observation_digest":"sha256:0c47d81841e6faa9dd79b7ca206529fdf57c4830320cd5771347f8144c60b4f5","observation_id":"e519926c-c0b5-4239-a092-d6b098a22f3f","resolution":{"observed_at":"2026-08-16T11:27:17.373953Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.17644","last_updated":"2025-05-26T16:16:43Z","snapshot_observed_at":"2026-08-19T18:36:17.409674Z","submitted_at":"2024-01-31T07:52:48Z","title":"BurstGPT: A Real-world Workload Dataset to Optimize LLM Serving Systems","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.17644","snapshot_observed_at":"2026-08-16T11:27:17.378835Z","title":"Towards efficient and reliable llm serving: A real-world workload study","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.15720","last_updated":"2025-04-22T09:08:46Z","snapshot_observed_at":"2026-08-19T18:36:48.696862Z","submitted_at":"2025-04-22T09:08:46Z","title":"SeaLLM: Service-Aware and Latency-Optimized Resource Sharing for Large Language Model Inference","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-16T11:27:17.378835Z"},"links":{"cited_paper":"/paper/2401.17644","citing_paper":"/paper/2504.15720"},"observation_digest":"sha256:09c2a5c76bf59a377c049a01293a78f033243640b53fde66887c4808fed39b4e","observation_id":"4124632a-afae-4454-b462-ec55e7c25d5c","resolution":{"observed_at":"2026-08-16T11:27:17.378835Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.09526","last_updated":"2024-10-29T13:04:42Z","snapshot_observed_at":"2026-08-16T14:00:57.253637Z","submitted_at":"2024-04-15T07:45:04Z","title":"LoongServe: Efficiently Serving Long-Context Large Language Models with Elastic Sequence Parallelism","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.09526","snapshot_observed_at":"2026-08-16T11:27:17.383632Z","title":"Loongserve: Efficiently serv- ing long-context large language models with elastic se- quence parallelism","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.15720","last_updated":"2025-04-22T09:08:46Z","snapshot_observed_at":"2026-08-19T18:36:48.696862Z","submitted_at":"2025-04-22T09:08:46Z","title":"SeaLLM: Service-Aware and Latency-Optimized Resource Sharing for Large Language Model Inference","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-16T11:27:17.383632Z"},"links":{"cited_paper":"/paper/2404.09526","citing_paper":"/paper/2504.15720"},"observation_digest":"sha256:5d89f89ca26c42d4ec4718e97b8d89c93935b01c8912f68301b3a865ede5b40a","observation_id":"c26e7288-8978-4be1-a3cf-b83a1a225c51","resolution":{"observed_at":"2026-08-16T11:27:17.383632Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.05920","last_updated":"2024-09-25T05:57:51Z","snapshot_observed_at":"2026-08-16T21:53:57.298060Z","submitted_at":"2023-05-10T06:17:50Z","title":"Fast Distributed Inference Serving for Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.05920","snapshot_observed_at":"2026-08-16T11:27:17.388272Z","title":"Fast distributed inference serving for large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.15720","last_updated":"2025-04-22T09:08:46Z","snapshot_observed_at":"2026-08-19T18:36:48.696862Z","submitted_at":"2025-04-22T09:08:46Z","title":"SeaLLM: Service-Aware and Latency-Optimized Resource Sharing for Large Language Model Inference","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-16T11:27:17.388272Z"},"links":{"cited_paper":"/paper/2305.05920","citing_paper":"/paper/2504.15720"},"observation_digest":"sha256:c6fda4292ff8e38db8162a342d44eacbd640489a4b0266e4ce259a0096946194","observation_id":"38ed9563-9588-4085-b534-e9e980d893e1","resolution":{"observed_at":"2026-08-16T11:27:17.388272Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:27:17.902501Z","title":"dLoRA: Dynamically orches- trating requests and adapters for LoRA LLM serving","venue":null,"work_id":"4f5e70d4-dff3-4872-9e9c-58d861e6267f","year":2024},"citing_paper":{"arxiv_id":"2504.15720","last_updated":"2025-04-22T09:08:46Z","snapshot_observed_at":"2026-08-19T18:36:48.696862Z","submitted_at":"2025-04-22T09:08:46Z","title":"SeaLLM: Service-Aware and Latency-Optimized Resource Sharing for Large Language Model Inference","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-16T11:27:17.392963Z"},"links":{"citing_paper":"/paper/2504.15720"},"observation_digest":"sha256:b39bac6d8f64d46c85f169f942d205d181e4ef691f8160d78e81b3f63c6f4385","observation_id":"635dc22d-7d7d-4672-964a-1ad137728cf6","resolution":{"observed_at":"2026-08-16T11:27:17.907122Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:27:17.887986Z","title":"Antman: Dynamic scaling on gpu clusters for deep learning","venue":null,"work_id":"517cc843-e875-4524-9c57-243b5389a803","year":2020},"citing_paper":{"arxiv_id":"2504.15720","last_updated":"2025-04-22T09:08:46Z","snapshot_observed_at":"2026-08-19T18:36:48.696862Z","submitted_at":"2025-04-22T09:08:46Z","title":"SeaLLM: Service-Aware and Latency-Optimized Resource Sharing for Large Language Model Inference","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-16T11:27:17.397544Z"},"links":{"citing_paper":"/paper/2504.15720"},"observation_digest":"sha256:8587803f288562ac74df8132f34e25e2b8bf100db0d8a2722e0a1e6b3719fe84","observation_id":"8fbf48e9-723a-482d-87ef-10e42c1b0b70","resolution":{"observed_at":"2026-08-16T11:27:17.892653Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:27:17.873687Z","title":"Orca: A distributed serving system for Transformer-Based generative mod- els","venue":null,"work_id":"c8edd3ed-07a7-4c09-9dfa-5e5b26165963","year":2022},"citing_paper":{"arxiv_id":"2504.15720","last_updated":"2025-04-22T09:08:46Z","snapshot_observed_at":"2026-08-19T18:36:48.696862Z","submitted_at":"2025-04-22T09:08:46Z","title":"SeaLLM: Service-Aware and Latency-Optimized Resource Sharing for Large Language Model Inference","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-16T11:27:17.401771Z"},"links":{"citing_paper":"/paper/2504.15720"},"observation_digest":"sha256:626d3ce27c0d3f8bc23812a662dbec54f3c7c3774d0185d6e0f02302cab9b039","observation_id":"cf8516fd-f1f6-4a2b-bc5d-37625e1bc7ee","resolution":{"observed_at":"2026-08-16T11:27:17.878113Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-08-06T03:13:37.403059Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.01068","snapshot_observed_at":"2026-08-16T11:27:17.406179Z","title":"Opt: Open pre-trained transformer language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.15720","last_updated":"2025-04-22T09:08:46Z","snapshot_observed_at":"2026-08-19T18:36:48.696862Z","submitted_at":"2025-04-22T09:08:46Z","title":"SeaLLM: Service-Aware and Latency-Optimized Resource Sharing for Large Language Model Inference","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-16T11:27:17.406179Z"},"links":{"cited_paper":"/paper/2205.01068","citing_paper":"/paper/2504.15720"},"observation_digest":"sha256:5d54306984cb03c07daec7c148f6e36774dbc1eee5cec58c8ae6e692df3d555a","observation_id":"0f5f2a6b-ec18-4eee-ba3a-ac7b892d32a3","resolution":{"observed_at":"2026-08-16T11:27:17.406179Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:27:17.858873Z","title":"Multi- resource interleaving for deep learning training","venue":null,"work_id":"89e3f849-1fe9-4103-b520-741260969cfc","year":2022},"citing_paper":{"arxiv_id":"2504.15720","last_updated":"2025-04-22T09:08:46Z","snapshot_observed_at":"2026-08-19T18:36:48.696862Z","submitted_at":"2025-04-22T09:08:46Z","title":"SeaLLM: Service-Aware and Latency-Optimized Resource Sharing for Large Language Model Inference","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-16T11:27:17.410400Z"},"links":{"citing_paper":"/paper/2504.15720"},"observation_digest":"sha256:3628b10c5c0336663403ba903d143e5086c1084a46ddf432e9fb321e6e418c6b","observation_id":"316f5ec4-ee82-46ad-8360-c5da5ec6dd62","resolution":{"observed_at":"2026-08-16T11:27:17.863787Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:27:17.842545Z","title":"Dist- serve: Disaggregating prefill and decoding for goodput- optimized large language model serving","venue":null,"work_id":"e830484f-4562-4a04-90ab-55c47e9bb654","year":2024},"citing_paper":{"arxiv_id":"2504.15720","last_updated":"2025-04-22T09:08:46Z","snapshot_observed_at":"2026-08-19T18:36:48.696862Z","submitted_at":"2025-04-22T09:08:46Z","title":"SeaLLM: Service-Aware and Latency-Optimized Resource Sharing for Large Language Model Inference","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-16T11:27:17.414952Z"},"links":{"citing_paper":"/paper/2504.15720"},"observation_digest":"sha256:536fe9d34a355463790ea1faa8f426fa7d86ebdbb9ae43c22a7958a7a56b7394","observation_id":"f1052953-1145-48e7-b62c-76bc95815f9f","resolution":{"observed_at":"2026-08-16T11:27:17.847784Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2504.15720","last_updated":"2025-04-22T09:08:46Z","latest_version":1,"primary_category":"cs.DC","snapshot_observed_at":"2026-08-19T18:36:48.696862Z","submitted_at":"2025-04-22T09:08:46Z","title":"SeaLLM: Service-Aware and Latency-Optimized Resource Sharing for Large Language Model Inference"},"reference_resolution":{"displayed":56,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":15,"verified_exact":1,"verified_fuzzy":40},"total_outbound_references":56},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 56 of 56 outbound references and 3 inbound Pith citation observations for arXiv:2504.15720."}