{"as_of":"2026-08-18T00:44:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e887942ac4681c33bab2d8d5826b7dd1f72af4fd41b6b83b53fffa65b1b6eb3a","coverage":[{"denominator":55,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":55,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T22:15:13.851365Z","state":"measured"},{"denominator":56,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":56,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T20:56:29.078219Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-15T20:56:29.568260Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.07680","last_updated":"2025-05-12T15:46:28Z","snapshot_observed_at":"2026-08-16T23:08:06.180581Z","submitted_at":"2025-05-12T15:46:28Z","title":"SpecRouter: Adaptive Routing for Multi-Level Speculative Decoding in Large Language Models","version":1},"cited_work":{"arxiv_id":"2505.07680","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.07680","snapshot_observed_at":"2026-08-15T20:56:29.568260Z","title":"SpecRouter: Adaptive Routing for Multi-Level Speculative Decoding in Large Language Models","venue":"cs.LG","work_id":"53c8106e-dbf9-4f20-aeaa-b71ffbdfe7eb","year":2025},"citing_paper":{"arxiv_id":"2506.01986","last_updated":"2025-05-16T22:12:29Z","snapshot_observed_at":"2026-08-17T19:26:28.026855Z","submitted_at":"2025-05-16T22:12:29Z","title":"SpecMemo: Speculative Decoding is in Your Pocket","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-15T20:56:29.078219Z"},"links":{"cited_paper":"/paper/2505.07680","citing_paper":"/paper/2506.01986"},"observation_digest":"sha256:a71dfebd101c7deab09321c3e8e9dce0915d71ede2eec65aa4f50ff5d179da8c","observation_id":"1cd74e9e-5057-4edf-ae45-d6f027a4af6e","resolution":{"observed_at":"2026-08-15T20:56:29.575242Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.07680/citation-record","integrity":"/paper/2505.07680/integrity","json":"/paper/2505.07680/citation-record.json","paper":"/paper/2505.07680"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:15:15.097719Z","title":"Scaling laws for generative mixed-modal language models","venue":null,"work_id":"49c90d54-8814-492c-b16c-2001bd0521bd","year":2023},"citing_paper":{"arxiv_id":"2505.07680","last_updated":"2025-05-12T15:46:28Z","snapshot_observed_at":"2026-08-16T23:08:06.180581Z","submitted_at":"2025-05-12T15:46:28Z","title":"SpecRouter: Adaptive Routing for Multi-Level Speculative Decoding in Large Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T22:15:13.553760Z"},"links":{"citing_paper":"/paper/2505.07680"},"observation_digest":"sha256:827013a16f9b56429d077663eae7f794f85e6549586d3bc1bc88655a6360852b","observation_id":"d2995a8d-f036-4819-a308-32611d4ef6f6","resolution":{"observed_at":"2026-08-15T22:15:15.103664Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:15:15.067932Z","title":"S., Ramjee, R., and Tumanov, A","venue":null,"work_id":"3fe14e1e-8791-4553-8aaf-b3175a18952b","year":2024},"citing_paper":{"arxiv_id":"2505.07680","last_updated":"2025-05-12T15:46:28Z","snapshot_observed_at":"2026-08-16T23:08:06.180581Z","submitted_at":"2025-05-12T15:46:28Z","title":"SpecRouter: Adaptive Routing for Multi-Level Speculative Decoding in Large Language Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-15T22:15:13.559495Z"},"links":{"citing_paper":"/paper/2505.07680"},"observation_digest":"sha256:92e2de81954bb9254cba96142a2e4277ec429e25a16cdae1c16b6f561d8de702","observation_id":"51e7ce4e-9530-4bdd-8c55-dfab99b32278","resolution":{"observed_at":"2026-08-15T22:15:15.080205Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:15:15.046653Z","title":"In 18th USENIX Symposium on Operating Systems Design and Implementation (OSDI 24) (2024), pp","venue":null,"work_id":"c7589a1b-47f9-4883-9d25-3839ac42fa2c","year":2024},"citing_paper":{"arxiv_id":"2505.07680","last_updated":"2025-05-12T15:46:28Z","snapshot_observed_at":"2026-08-16T23:08:06.180581Z","submitted_at":"2025-05-12T15:46:28Z","title":"SpecRouter: Adaptive Routing for Multi-Level Speculative Decoding in Large Language Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-15T22:15:13.565871Z"},"links":{"citing_paper":"/paper/2505.07680"},"observation_digest":"sha256:4c4ff1195ec756bf7eca4dedc8fa5a41256000e5657fc9f646f03a409671b1fa","observation_id":"cd7a78cc-0220-445f-a606-f1bd28d5b8c3","resolution":{"observed_at":"2026-08-15T22:15:15.053511Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.10774","last_updated":"2024-06-14T23:32:32Z","snapshot_observed_at":"2026-08-17T10:13:54.763177Z","submitted_at":"2024-01-19T15:48:40Z","title":"Medusa: Simple LLM Inference Acceleration Framework with Multiple Decoding Heads","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.10774","snapshot_observed_at":"2026-08-15T22:15:13.571386Z","title":"D., Chen, D., and Dao, T","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.07680","last_updated":"2025-05-12T15:46:28Z","snapshot_observed_at":"2026-08-16T23:08:06.180581Z","submitted_at":"2025-05-12T15:46:28Z","title":"SpecRouter: Adaptive Routing for Multi-Level Speculative Decoding in Large Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-15T22:15:13.571386Z"},"links":{"cited_paper":"/paper/2401.10774","citing_paper":"/paper/2505.07680"},"observation_digest":"sha256:8e01cc6ebb9094504f880469a74abcf6198f1f35d44f8e7d61f8e8c666f5b305","observation_id":"6e03aba7-2a99-4de8-b68c-905a25151e7b","resolution":{"observed_at":"2026-08-15T22:15:13.571386Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:15:15.022362Z","title":"On the entropy of language models in getting semantic from tokens","venue":null,"work_id":"cfd76e26-14ea-4aa3-95b7-6490f47a4294","year":null},"citing_paper":{"arxiv_id":"2505.07680","last_updated":"2025-05-12T15:46:28Z","snapshot_observed_at":"2026-08-16T23:08:06.180581Z","submitted_at":"2025-05-12T15:46:28Z","title":"SpecRouter: Adaptive Routing for Multi-Level Speculative Decoding in Large Language Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-15T22:15:13.577705Z"},"links":{"citing_paper":"/paper/2505.07680"},"observation_digest":"sha256:2d1706cb5675f44a76a5f50e6def8024167d45844374f91de590ab3336b81232","observation_id":"3bd13680-5b00-4892-ba00-a6a56f0361de","resolution":{"observed_at":"2026-08-15T22:15:15.029177Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03374","last_updated":"2021-07-14T17:16:02Z","snapshot_observed_at":"2026-08-08T11:58:24.516369Z","submitted_at":"2021-07-07T17:41:24Z","title":"Evaluating Large Language Models Trained on Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.03374","snapshot_observed_at":"2026-08-15T22:15:13.583159Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.07680","last_updated":"2025-05-12T15:46:28Z","snapshot_observed_at":"2026-08-16T23:08:06.180581Z","submitted_at":"2025-05-12T15:46:28Z","title":"SpecRouter: Adaptive Routing for Multi-Level Speculative Decoding in Large Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-15T22:15:13.583159Z"},"links":{"cited_paper":"/paper/2107.03374","citing_paper":"/paper/2505.07680"},"observation_digest":"sha256:78396e537cf44ce2509ebe5e8f35b66114235b8cac00452bb909e560da4b0b7c","observation_id":"99f3d4a4-63b4-45a4-b8af-57f28d8c9084","resolution":{"observed_at":"2026-08-15T22:15:13.583159Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:15:15.003019Z","title":"Advances in Neural Information Processing Systems 37 (2024), 86226–86242","venue":null,"work_id":"7c659452-f2a4-4798-abc6-3081b966610e","year":2024},"citing_paper":{"arxiv_id":"2505.07680","last_updated":"2025-05-12T15:46:28Z","snapshot_observed_at":"2026-08-16T23:08:06.180581Z","submitted_at":"2025-05-12T15:46:28Z","title":"SpecRouter: Adaptive Routing for Multi-Level Speculative Decoding in Large Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-15T22:15:13.588329Z"},"links":{"citing_paper":"/paper/2505.07680"},"observation_digest":"sha256:71ee7354f780be56abd77cc30aaee59c9cbb98a6a07ecedcdc8e5867a79d50d8","observation_id":"fbb67b4f-8283-428e-a768-e65ff7139b35","resolution":{"observed_at":"2026-08-15T22:15:15.009246Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:15:14.984304Z","title":"Nvidia a100 gpu: Performance & innovation for gpu computing","venue":null,"work_id":"caa507da-cad4-4507-9024-9f14a38f1fd4","year":2020},"citing_paper":{"arxiv_id":"2505.07680","last_updated":"2025-05-12T15:46:28Z","snapshot_observed_at":"2026-08-16T23:08:06.180581Z","submitted_at":"2025-05-12T15:46:28Z","title":"SpecRouter: Adaptive Routing for Multi-Level Speculative Decoding in Large Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T22:15:13.594918Z"},"links":{"citing_paper":"/paper/2505.07680"},"observation_digest":"sha256:4c28f3e0846134f40f23bef96b5fd3b2512f205ec5265d28e8867857fcd22f95","observation_id":"054900d8-8fcd-4289-8adb-ba16e784ed72","resolution":{"observed_at":"2026-08-15T22:15:14.990425Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:15:14.966610Z","title":"W., Sutton, C., Gehrmann, S., et al","venue":null,"work_id":"ae096f48-4483-4755-aae0-596a8ee479ae","year":2023},"citing_paper":{"arxiv_id":"2505.07680","last_updated":"2025-05-12T15:46:28Z","snapshot_observed_at":"2026-08-16T23:08:06.180581Z","submitted_at":"2025-05-12T15:46:28Z","title":"SpecRouter: Adaptive Routing for Multi-Level Speculative Decoding in Large Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T22:15:13.600193Z"},"links":{"citing_paper":"/paper/2505.07680"},"observation_digest":"sha256:89263099d374687fdfbd10fe9deeddb74fd6c5946a565ed1e37b35822a8c4dcc","observation_id":"74c27c97-03d4-4224-883c-4c6c176fcbe5","resolution":{"observed_at":"2026-08-15T22:15:14.972225Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:15:14.950340Z","title":"Unified scaling laws for routed language models","venue":null,"work_id":"4f11eef4-52d7-43d3-95fb-484df090d646","year":2022},"citing_paper":{"arxiv_id":"2505.07680","last_updated":"2025-05-12T15:46:28Z","snapshot_observed_at":"2026-08-16T23:08:06.180581Z","submitted_at":"2025-05-12T15:46:28Z","title":"SpecRouter: Adaptive Routing for Multi-Level Speculative Decoding in Large Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-15T22:15:13.605893Z"},"links":{"citing_paper":"/paper/2505.07680"},"observation_digest":"sha256:3768542bd7aaa883b9eadb6c47175d96ef189f2a84d6666c470de111a12dd54c","observation_id":"11b0c632-31d9-43db-9df0-60dff021d1da","resolution":{"observed_at":"2026-08-15T22:15:14.955648Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-14T02:43:01.480086Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-15T22:15:13.611689Z","title":"Train- ing verifiers to solve math word problems, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.07680","last_updated":"2025-05-12T15:46:28Z","snapshot_observed_at":"2026-08-16T23:08:06.180581Z","submitted_at":"2025-05-12T15:46:28Z","title":"SpecRouter: Adaptive Routing for Multi-Level Speculative Decoding in Large Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T22:15:13.611689Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2505.07680"},"observation_digest":"sha256:63a5c0a332be343247326a6d7acacf7f7da17b00ef35bc4aae1604bb2b2f03e4","observation_id":"47e1aba1-1411-4734-a441-fb0c8731d684","resolution":{"observed_at":"2026-08-15T22:15:13.611689Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:15:14.931531Z","title":"J., Gonzalez, J","venue":null,"work_id":"91444502-3ad7-4356-816d-5c78dc89e28b","year":2017},"citing_paper":{"arxiv_id":"2505.07680","last_updated":"2025-05-12T15:46:28Z","snapshot_observed_at":"2026-08-16T23:08:06.180581Z","submitted_at":"2025-05-12T15:46:28Z","title":"SpecRouter: Adaptive Routing for Multi-Level Speculative Decoding in Large Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T22:15:13.617019Z"},"links":{"citing_paper":"/paper/2505.07680"},"observation_digest":"sha256:547272421a2d27ec82d6f6d837bc4e9ded68a67c74d30929e9c00b2eff4393e4","observation_id":"3d63a160-07f7-446b-a26d-ae2a40851224","resolution":{"observed_at":"2026-08-15T22:15:14.937357Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.10277","last_updated":"2024-08-17T15:47:39Z","snapshot_observed_at":"2026-08-16T13:25:49.911468Z","submitted_at":"2024-08-17T15:47:39Z","title":"Increasing transformer token length with a Maximum Entropy Principle Method","version":1},"cited_work":{"arxiv_id":"2408.10277","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.10277","snapshot_observed_at":"2026-08-15T22:15:14.264434Z","title":"Increasing transformer token length with a Maximum Entropy Principle Method","venue":"cs.LG","work_id":"0978416a-cd3b-4607-ac12-cd009e734907","year":2024},"citing_paper":{"arxiv_id":"2505.07680","last_updated":"2025-05-12T15:46:28Z","snapshot_observed_at":"2026-08-16T23:08:06.180581Z","submitted_at":"2025-05-12T15:46:28Z","title":"SpecRouter: Adaptive Routing for Multi-Level Speculative Decoding in Large Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T22:15:13.622247Z"},"links":{"cited_paper":"/paper/2408.10277","citing_paper":"/paper/2505.07680"},"observation_digest":"sha256:62ee32d4d96db5c8c3e32503f3b685618a52ce3395974d7c7e317bf69ced1d6b","observation_id":"28cd6802-0e0e-4d37-8765-71c051e19b11","resolution":{"observed_at":"2026-08-15T22:15:14.272768Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:15:14.912821Z","title":"Graphrouter: A graph-based router for llm selections","venue":null,"work_id":"a3f3de95-7e22-46da-af6e-75a74bfde46a","year":2024},"citing_paper":{"arxiv_id":"2505.07680","last_updated":"2025-05-12T15:46:28Z","snapshot_observed_at":"2026-08-16T23:08:06.180581Z","submitted_at":"2025-05-12T15:46:28Z","title":"SpecRouter: Adaptive Routing for Multi-Level Speculative Decoding in Large Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-15T22:15:13.627914Z"},"links":{"citing_paper":"/paper/2505.07680"},"observation_digest":"sha256:e39f3abf1a76c113d7b1843482d7347934e2cbf9e84ca8192dcd55994bd5da46","observation_id":"44e5dcae-d9db-4653-aafd-ccdfede57688","resolution":{"observed_at":"2026-08-15T22:15:14.918581Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:15:14.896435Z","title":"{ServerlessLLM}:{Low-Latency} serverless inference for large language models","venue":null,"work_id":"49e34deb-a2a0-437a-89d7-6621c4a7c738","year":2024},"citing_paper":{"arxiv_id":"2505.07680","last_updated":"2025-05-12T15:46:28Z","snapshot_observed_at":"2026-08-16T23:08:06.180581Z","submitted_at":"2025-05-12T15:46:28Z","title":"SpecRouter: Adaptive Routing for Multi-Level Speculative Decoding in Large Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T22:15:13.632648Z"},"links":{"citing_paper":"/paper/2505.07680"},"observation_digest":"sha256:6ebf7a7e941653e97260c2488679859f760375ff96b0fdbad6be5ca08652e015","observation_id":"f876072d-4cdb-4f27-853f-bd923e951340","resolution":{"observed_at":"2026-08-15T22:15:14.901868Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-15T22:15:13.637412Z","title":"The llama 3 herd of models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.07680","last_updated":"2025-05-12T15:46:28Z","snapshot_observed_at":"2026-08-16T23:08:06.180581Z","submitted_at":"2025-05-12T15:46:28Z","title":"SpecRouter: Adaptive Routing for Multi-Level Speculative Decoding in Large Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T22:15:13.637412Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2505.07680"},"observation_digest":"sha256:7cf53c6bdf647a3b81acd3994c91dd94cf41229306d861cb7b09c2aecfaa76bd","observation_id":"c795fa38-6b7c-4592-8de1-5c8294cff007","resolution":{"observed_at":"2026-08-15T22:15:13.637412Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:15:14.875966Z","title":"In 21st USENIX Symposium on Networked Systems Design and Implementation (NSDI 24) (2024), pp","venue":null,"work_id":"15793131-716c-46f6-90fa-aba7613f0b99","year":2024},"citing_paper":{"arxiv_id":"2505.07680","last_updated":"2025-05-12T15:46:28Z","snapshot_observed_at":"2026-08-16T23:08:06.180581Z","submitted_at":"2025-05-12T15:46:28Z","title":"SpecRouter: Adaptive Routing for Multi-Level Speculative Decoding in Large Language Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-15T22:15:13.642920Z"},"links":{"citing_paper":"/paper/2505.07680"},"observation_digest":"sha256:75233a1981b90642f6e7c41927903b44b18bf51a6a75fc4aa1b4b391c5754a72","observation_id":"da1d88a5-dcc1-4579-bea9-726441ed5dc3","resolution":{"observed_at":"2026-08-15T22:15:14.882826Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:15:13.647987Z","title":"Specserve: Efficient and slo-aware large language model serving with adaptive speculative decoding","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.07680","last_updated":"2025-05-12T15:46:28Z","snapshot_observed_at":"2026-08-16T23:08:06.180581Z","submitted_at":"2025-05-12T15:46:28Z","title":"SpecRouter: Adaptive Routing for Multi-Level Speculative Decoding in Large Language Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T22:15:13.647987Z"},"links":{"citing_paper":"/paper/2505.07680"},"observation_digest":"sha256:1c3a65208cd5bb2425d549936551465bb776fd2f312588de8f3755a208124650","observation_id":"9a354ea9-a7f3-41ee-b45f-0613632006cd","resolution":{"observed_at":"2026-08-15T22:15:13.647987Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:15:14.856562Z","title":null,"venue":null,"work_id":"c7614dc4-a03e-4dce-8089-1faf6858e192","year":1986},"citing_paper":{"arxiv_id":"2505.07680","last_updated":"2025-05-12T15:46:28Z","snapshot_observed_at":"2026-08-16T23:08:06.180581Z","submitted_at":"2025-05-12T15:46:28Z","title":"SpecRouter: Adaptive Routing for Multi-Level Speculative Decoding in Large Language Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T22:15:13.652985Z"},"links":{"citing_paper":"/paper/2505.07680"},"observation_digest":"sha256:c3e8b48490d33f003fd50b2c41275a271b1d7fd1ab2a886c7a2915f684f7a649","observation_id":"57506a0d-7b31-45ab-be90-760a58573601","resolution":{"observed_at":"2026-08-15T22:15:14.862814Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:15:14.840290Z","title":null,"venue":null,"work_id":"7fe1468a-1180-4e59-8054-81f19f45993b","year":2024},"citing_paper":{"arxiv_id":"2505.07680","last_updated":"2025-05-12T15:46:28Z","snapshot_observed_at":"2026-08-16T23:08:06.180581Z","submitted_at":"2025-05-12T15:46:28Z","title":"SpecRouter: Adaptive Routing for Multi-Level Speculative Decoding in Large Language Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-15T22:15:13.659048Z"},"links":{"citing_paper":"/paper/2505.07680"},"observation_digest":"sha256:d43c6c3e0fd25b277970b98f6ef226f538724eb57a28fa5f1c4678181554a194","observation_id":"b4fc5202-ea58-4a94-86d7-83e88ba75fa7","resolution":{"observed_at":"2026-08-15T22:15:14.845396Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-08-13T17:41:53.092611Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-08-15T22:15:13.664620Z","title":"B., Chess, B., Child, R., Gray, S., Radford, A., Wu, J., and Amodei, D.Scaling laws for neural language models","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.07680","last_updated":"2025-05-12T15:46:28Z","snapshot_observed_at":"2026-08-16T23:08:06.180581Z","submitted_at":"2025-05-12T15:46:28Z","title":"SpecRouter: Adaptive Routing for Multi-Level Speculative Decoding in Large Language Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-15T22:15:13.664620Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2505.07680"},"observation_digest":"sha256:ff0fd7948cadc468c5d9d4315fc85d207b9f2a42fb954a24047b2c3620e1a57e","observation_id":"c85f4f96-ec80-4b5c-8a18-36a0533d44e4","resolution":{"observed_at":"2026-08-15T22:15:13.664620Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:15:14.822872Z","title":"H., Gonza- lez, J","venue":null,"work_id":"449ecd4a-943f-4901-be92-371212a2d807","year":2023},"citing_paper":{"arxiv_id":"2505.07680","last_updated":"2025-05-12T15:46:28Z","snapshot_observed_at":"2026-08-16T23:08:06.180581Z","submitted_at":"2025-05-12T15:46:28Z","title":"SpecRouter: Adaptive Routing for Multi-Level Speculative Decoding in Large Language Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-15T22:15:13.670542Z"},"links":{"citing_paper":"/paper/2505.07680"},"observation_digest":"sha256:27c214c180326309d29230b3cfa22bd559096789189b49e0fb3de5e9d3ab94ea","observation_id":"63c2c6a9-3775-4983-bcfc-232358a10a72","resolution":{"observed_at":"2026-08-15T22:15:14.828587Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:15:14.803194Z","title":null,"venue":null,"work_id":"1dd08a61-f4d4-49c1-acfd-a38d2c8b9aaa","year":2023},"citing_paper":{"arxiv_id":"2505.07680","last_updated":"2025-05-12T15:46:28Z","snapshot_observed_at":"2026-08-16T23:08:06.180581Z","submitted_at":"2025-05-12T15:46:28Z","title":"SpecRouter: Adaptive Routing for Multi-Level Speculative Decoding in Large Language Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-15T22:15:13.676139Z"},"links":{"citing_paper":"/paper/2505.07680"},"observation_digest":"sha256:0a70b99368822e17f7108372629faab38fd65953669359dce7a63a8c207dd33e","observation_id":"80794bdd-b602-4d3d-8d05-6805d9ac8e73","resolution":{"observed_at":"2026-08-15T22:15:14.808680Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:15:14.786662Z","title":"In 18th USENIX Symposium on Operating Systems Design and Implementation (OSDI 24) (2024), pp","venue":null,"work_id":"0d04f655-0a6d-433b-9ee3-52c3ad7be9e9","year":2024},"citing_paper":{"arxiv_id":"2505.07680","last_updated":"2025-05-12T15:46:28Z","snapshot_observed_at":"2026-08-16T23:08:06.180581Z","submitted_at":"2025-05-12T15:46:28Z","title":"SpecRouter: Adaptive Routing for Multi-Level Speculative Decoding in Large Language Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-15T22:15:13.681405Z"},"links":{"citing_paper":"/paper/2505.07680"},"observation_digest":"sha256:0d6c2f6a5725be3f92ac23fdc33cd24a0fb6a64fceb732f9432dd6c5cc5ab715","observation_id":"03c90b20-eb62-403b-ac10-66239d09b33b","resolution":{"observed_at":"2026-08-15T22:15:14.792041Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:15:13.686186Z","title":"Fast inference from transformers via speculative decoding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.07680","last_updated":"2025-05-12T15:46:28Z","snapshot_observed_at":"2026-08-16T23:08:06.180581Z","submitted_at":"2025-05-12T15:46:28Z","title":"SpecRouter: Adaptive Routing for Multi-Level Speculative Decoding in Large Language Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-15T22:15:13.686186Z"},"links":{"citing_paper":"/paper/2505.07680"},"observation_digest":"sha256:36754383c499863f0d1fb1ef74cb411f4eef9b6ecdc0aa091fc259a98b79c4ca","observation_id":"f546f64c-c898-48d4-bf16-cecf5f431917","resolution":{"observed_at":"2026-08-15T22:15:13.686186Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:15:14.756645Z","title":"Static batching of irregular workloads on gpus: Framework and application to efficient moe model inference, 2025","venue":null,"work_id":"a4d376dd-59f1-4245-91ec-ba077eed66dc","year":2025},"citing_paper":{"arxiv_id":"2505.07680","last_updated":"2025-05-12T15:46:28Z","snapshot_observed_at":"2026-08-16T23:08:06.180581Z","submitted_at":"2025-05-12T15:46:28Z","title":"SpecRouter: Adaptive Routing for Multi-Level Speculative Decoding in Large Language Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-15T22:15:13.691282Z"},"links":{"citing_paper":"/paper/2505.07680"},"observation_digest":"sha256:f1ebe83532d46fa6fbe4a44fde609c4377cc5911a9c627e28def5c999f146ae8","observation_id":"b2e63812-374d-4dc8-9e00-d9f8644c0db3","resolution":{"observed_at":"2026-08-15T22:15:14.763032Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:15:14.738887Z","title":"In International Conference on Machine Learning (2024)","venue":null,"work_id":"b00765f3-1022-4c43-ac70-ab02462d3ce9","year":2024},"citing_paper":{"arxiv_id":"2505.07680","last_updated":"2025-05-12T15:46:28Z","snapshot_observed_at":"2026-08-16T23:08:06.180581Z","submitted_at":"2025-05-12T15:46:28Z","title":"SpecRouter: Adaptive Routing for Multi-Level Speculative Decoding in Large Language Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-15T22:15:13.696497Z"},"links":{"citing_paper":"/paper/2505.07680"},"observation_digest":"sha256:f242570edbb1019a8dd76763722618856ff3d1e98daa08e40ef71a2d7a47a429","observation_id":"00425c87-dad2-4973-920f-b39b6da1dfc8","resolution":{"observed_at":"2026-08-15T22:15:14.743595Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:15:14.721210Z","title":"EAGLE-3: Scaling up in- ference acceleration of large language models via training-time test, 2025","venue":null,"work_id":"b68103d7-ea0b-4147-8bcd-ae3973279f24","year":2025},"citing_paper":{"arxiv_id":"2505.07680","last_updated":"2025-05-12T15:46:28Z","snapshot_observed_at":"2026-08-16T23:08:06.180581Z","submitted_at":"2025-05-12T15:46:28Z","title":"SpecRouter: Adaptive Routing for Multi-Level Speculative Decoding in Large Language Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-15T22:15:13.701403Z"},"links":{"citing_paper":"/paper/2505.07680"},"observation_digest":"sha256:2ebbdc8449c92a0689f5b571d139c7d10e563b414280a6f815cc531f801a4646","observation_id":"8aab46b4-5e4a-4bbe-a148-bb81d92b6af3","resolution":{"observed_at":"2026-08-15T22:15:14.726931Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12162","last_updated":"2025-05-17T07:09:10Z","snapshot_observed_at":"2026-08-14T19:50:19.511079Z","submitted_at":"2025-01-21T14:15:01Z","title":"AdaServe: Accelerating Multi-SLO LLM Serving with SLO-Customized Speculative Decoding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12162","snapshot_observed_at":"2026-08-15T22:15:13.707025Z","title":"Adaserve: Slo-customized llm serving with fine-grained speculative decoding","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.07680","last_updated":"2025-05-12T15:46:28Z","snapshot_observed_at":"2026-08-16T23:08:06.180581Z","submitted_at":"2025-05-12T15:46:28Z","title":"SpecRouter: Adaptive Routing for Multi-Level Speculative Decoding in Large Language Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-15T22:15:13.707025Z"},"links":{"cited_paper":"/paper/2501.12162","citing_paper":"/paper/2505.07680"},"observation_digest":"sha256:ddcee032ee917a29b27fcac71c1d749b612294d04d1afa2b1e1c4b1e16ecba2a","observation_id":"0f9ab5f9-6cbb-49bd-a34e-65ac06638bbe","resolution":{"observed_at":"2026-08-15T22:15:13.707025Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02669","last_updated":"2024-07-04T15:12:54Z","snapshot_observed_at":"2026-08-17T04:58:55.259763Z","submitted_at":"2024-01-05T06:53:00Z","title":"Infinite-LLM: Efficient LLM Service for Long Context with DistAttention and Distributed KVCache","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.02669","snapshot_observed_at":"2026-08-15T22:15:13.711912Z","title":"Infinite-llm: Efficient llm service for long context with distattention and distributed kvcache.arXiv preprint arXiv:2401.02669 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.07680","last_updated":"2025-05-12T15:46:28Z","snapshot_observed_at":"2026-08-16T23:08:06.180581Z","submitted_at":"2025-05-12T15:46:28Z","title":"SpecRouter: Adaptive Routing for Multi-Level Speculative Decoding in Large Language Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-15T22:15:13.711912Z"},"links":{"cited_paper":"/paper/2401.02669","citing_paper":"/paper/2505.07680"},"observation_digest":"sha256:70a59fef1b27159053d64adba7ed3292bf9159d17b35bd893947fef1a3b6ad79","observation_id":"3d83a165-af28-4402-96b4-3953b225a919","resolution":{"observed_at":"2026-08-15T22:15:13.711912Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:15:14.700316Z","title":"Parrot: Efficient serving of{LLM-based} applications with semantic variable","venue":null,"work_id":"9c12d1fa-4e1b-4735-953a-34ee33570390","year":2024},"citing_paper":{"arxiv_id":"2505.07680","last_updated":"2025-05-12T15:46:28Z","snapshot_observed_at":"2026-08-16T23:08:06.180581Z","submitted_at":"2025-05-12T15:46:28Z","title":"SpecRouter: Adaptive Routing for Multi-Level Speculative Decoding in Large Language Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-15T22:15:13.717686Z"},"links":{"citing_paper":"/paper/2505.07680"},"observation_digest":"sha256:bd9acb9dad4f1bfd8608ac74021052efc05d2bb54f766a2cfdd18c1c8e67fb17","observation_id":"8cefd015-1403-487b-a0c4-3f0db079b6aa","resolution":{"observed_at":"2026-08-15T22:15:14.708536Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-08-15T17:27:11.980940Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-15T22:15:13.723164Z","title":"Deepseek-v3 technical report","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.07680","last_updated":"2025-05-12T15:46:28Z","snapshot_observed_at":"2026-08-16T23:08:06.180581Z","submitted_at":"2025-05-12T15:46:28Z","title":"SpecRouter: Adaptive Routing for Multi-Level Speculative Decoding in Large Language Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-15T22:15:13.723164Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2505.07680"},"observation_digest":"sha256:32d92fb9271f85b83ac730276ca7e4584e80a592f1f45c9926a24f4eea8c07c3","observation_id":"e9fe6c4a-47e6-4876-b6f9-f274be228282","resolution":{"observed_at":"2026-08-15T22:15:13.723164Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:15:14.681427Z","title":"In The Thirteenth International Conference on Learning Representations (2025)","venue":null,"work_id":"cb3473f9-2044-46fa-89dd-154ef2fa45b6","year":2025},"citing_paper":{"arxiv_id":"2505.07680","last_updated":"2025-05-12T15:46:28Z","snapshot_observed_at":"2026-08-16T23:08:06.180581Z","submitted_at":"2025-05-12T15:46:28Z","title":"SpecRouter: Adaptive Routing for Multi-Level Speculative Decoding in Large Language Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-15T22:15:13.729212Z"},"links":{"citing_paper":"/paper/2505.07680"},"observation_digest":"sha256:b606a30f881fb7fd08a4e6c456ab8f352f3b6debb32c6ca29451bda065a7edfb","observation_id":"c2989215-92c3-4a70-8037-c845dcfddde8","resolution":{"observed_at":"2026-08-15T22:15:14.686809Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:15:14.659236Z","title":"A., Xie, G., Zhan, J., Zhang, H., Hjálmt `ysson, G., and Greenberg, A","venue":null,"work_id":"507e3a11-cef4-4e3a-bc56-24f9f7399d15","year":2004},"citing_paper":{"arxiv_id":"2505.07680","last_updated":"2025-05-12T15:46:28Z","snapshot_observed_at":"2026-08-16T23:08:06.180581Z","submitted_at":"2025-05-12T15:46:28Z","title":"SpecRouter: Adaptive Routing for Multi-Level Speculative Decoding in Large Language Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-15T22:15:13.734325Z"},"links":{"citing_paper":"/paper/2505.07680"},"observation_digest":"sha256:dcb36897af74336012e4748959cbd20f344d8e339e9039e5ddc19102c891e06f","observation_id":"0d188986-b388-4c14-b1ef-744f74994c0d","resolution":{"observed_at":"2026-08-15T22:15:14.665357Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:15:14.636555Z","title":null,"venue":null,"work_id":"1b0b6bd3-67e5-49c6-978f-729c70d729d6","year":2024},"citing_paper":{"arxiv_id":"2505.07680","last_updated":"2025-05-12T15:46:28Z","snapshot_observed_at":"2026-08-16T23:08:06.180581Z","submitted_at":"2025-05-12T15:46:28Z","title":"SpecRouter: Adaptive Routing for Multi-Level Speculative Decoding in Large Language Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-15T22:15:13.740476Z"},"links":{"citing_paper":"/paper/2505.07680"},"observation_digest":"sha256:1d9d7fdbabf6c612b092ca60202b6374d5ca03754bd355271f52b2f6b96c44bf","observation_id":"cbdd3b13-c800-4b6f-96f9-632a2fbfd003","resolution":{"observed_at":"2026-08-15T22:15:14.642339Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:15:14.610645Z","title":"E., Kadous, M","venue":null,"work_id":"c1ddb295-9442-4ced-acb6-ebb506f057ba","year":2024},"citing_paper":{"arxiv_id":"2505.07680","last_updated":"2025-05-12T15:46:28Z","snapshot_observed_at":"2026-08-16T23:08:06.180581Z","submitted_at":"2025-05-12T15:46:28Z","title":"SpecRouter: Adaptive Routing for Multi-Level Speculative Decoding in Large Language Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-15T22:15:13.746940Z"},"links":{"citing_paper":"/paper/2505.07680"},"observation_digest":"sha256:2e6f641299ab7db398dfd98a4aa90404896c777a946156b56882738360c6b957","observation_id":"929e9577-67e5-4aa3-bb8b-17e59335794b","resolution":{"observed_at":"2026-08-15T22:15:14.615755Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1912.01703","last_updated":"2019-12-03T22:06:05Z","snapshot_observed_at":"2026-07-06T08:41:49.632205Z","submitted_at":"2019-12-03T22:06:05Z","title":"PyTorch: An Imperative Style, High-Performance Deep Learning Library","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.01703","snapshot_observed_at":"2026-08-15T22:15:13.752670Z","title":"Pytorch: An imperative style, high-performance deep learning library","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.07680","last_updated":"2025-05-12T15:46:28Z","snapshot_observed_at":"2026-08-16T23:08:06.180581Z","submitted_at":"2025-05-12T15:46:28Z","title":"SpecRouter: Adaptive Routing for Multi-Level Speculative Decoding in Large Language Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-15T22:15:13.752670Z"},"links":{"cited_paper":"/paper/1912.01703","citing_paper":"/paper/2505.07680"},"observation_digest":"sha256:bbc12902466c6ae57d67c589dcb813b3d38e8e21a97607d5b166040f9786b17a","observation_id":"69e60518-c607-4f91-87c7-b2fcb5e1152e","resolution":{"observed_at":"2026-08-15T22:15:13.752670Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:15:14.593096Z","title":"Mooncake: Trading more storage for less computation—a {KVCache-centric} architecture for serving{LLM} chatbot","venue":null,"work_id":"24ddc506-3498-4191-bbe1-b3b12fafcad0","year":2025},"citing_paper":{"arxiv_id":"2505.07680","last_updated":"2025-05-12T15:46:28Z","snapshot_observed_at":"2026-08-16T23:08:06.180581Z","submitted_at":"2025-05-12T15:46:28Z","title":"SpecRouter: Adaptive Routing for Multi-Level Speculative Decoding in Large Language Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-15T22:15:13.758219Z"},"links":{"citing_paper":"/paper/2505.07680"},"observation_digest":"sha256:3b3fa73300676484f89bcb4dcb0c116427f885c459090105d0836d5f3118620e","observation_id":"134d94a4-9a71-4a1a-8de2-3918edd1cbe4","resolution":{"observed_at":"2026-08-15T22:15:14.598715Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:15:14.575725Z","title":"S., Jha, S., Kalbarczyk, Z","venue":null,"work_id":"cf2e7297-f7de-4e9f-b9c8-1c54893adccc","year":2020},"citing_paper":{"arxiv_id":"2505.07680","last_updated":"2025-05-12T15:46:28Z","snapshot_observed_at":"2026-08-16T23:08:06.180581Z","submitted_at":"2025-05-12T15:46:28Z","title":"SpecRouter: Adaptive Routing for Multi-Level Speculative Decoding in Large Language Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-15T22:15:13.763812Z"},"links":{"citing_paper":"/paper/2505.07680"},"observation_digest":"sha256:c1b552338e37a06dbe3bd6b74d920e6efd660cc08233753bf3118e450caef6f6","observation_id":"109e5710-3256-4ac8-8fde-fb1d9ac954f4","resolution":{"observed_at":"2026-08-15T22:15:14.580875Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.03057","last_updated":"2022-10-06T17:03:34Z","snapshot_observed_at":"2026-07-06T14:00:37.875054Z","submitted_at":"2022-10-06T17:03:34Z","title":"Language Models are Multilingual Chain-of-Thought Reasoners","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.03057","snapshot_observed_at":"2026-08-15T22:15:13.770008Z","title":"W., Tay, Y., Ruder, S., Zhou, D., et al","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.07680","last_updated":"2025-05-12T15:46:28Z","snapshot_observed_at":"2026-08-16T23:08:06.180581Z","submitted_at":"2025-05-12T15:46:28Z","title":"SpecRouter: Adaptive Routing for Multi-Level Speculative Decoding in Large Language Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-15T22:15:13.770008Z"},"links":{"cited_paper":"/paper/2210.03057","citing_paper":"/paper/2505.07680"},"observation_digest":"sha256:826bbe3f19b08b1dc45331662fa8ae45fbd8a5509ad1a7875b9d6bae1ac1ea30","observation_id":"f33d1552-9d73-4d98-a5f2-64ffd0f1c1e6","resolution":{"observed_at":"2026-08-15T22:15:13.770008Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:15:14.557721Z","title":"In Proceedings of the ACM SIGOPS 30th Symposium on Operating Systems Principles(2024), pp","venue":null,"work_id":"86e81db4-58fe-467f-95f8-a62d5c1c7992","year":2024},"citing_paper":{"arxiv_id":"2505.07680","last_updated":"2025-05-12T15:46:28Z","snapshot_observed_at":"2026-08-16T23:08:06.180581Z","submitted_at":"2025-05-12T15:46:28Z","title":"SpecRouter: Adaptive Routing for Multi-Level Speculative Decoding in Large Language Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-15T22:15:13.775595Z"},"links":{"citing_paper":"/paper/2505.07680"},"observation_digest":"sha256:4767fc2710d72194383bef8734debea963ceeccc78432b99e6bce5c047b856ed","observation_id":"e425b137-2575-495e-9973-86f42dce87ac","resolution":{"observed_at":"2026-08-15T22:15:14.564202Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:15:14.540810Z","title":"Llumnix: Dynamic scheduling for large language model serving","venue":null,"work_id":"06744d78-cbab-4293-8dec-f077d35cdff9","year":2024},"citing_paper":{"arxiv_id":"2505.07680","last_updated":"2025-05-12T15:46:28Z","snapshot_observed_at":"2026-08-16T23:08:06.180581Z","submitted_at":"2025-05-12T15:46:28Z","title":"SpecRouter: Adaptive Routing for Multi-Level Speculative Decoding in Large Language Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-15T22:15:13.780511Z"},"links":{"citing_paper":"/paper/2505.07680"},"observation_digest":"sha256:cc1bd3a28acd4dd94677720d5a69829bc2f2b41b9df471289f32497adcc5ab48","observation_id":"6a6dc703-de01-4f34-ae88-a4ce4fb2e85b","resolution":{"observed_at":"2026-08-15T22:15:14.546263Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-15T22:15:13.786730Z","title":"Llama: Open and efficient foundation language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.07680","last_updated":"2025-05-12T15:46:28Z","snapshot_observed_at":"2026-08-16T23:08:06.180581Z","submitted_at":"2025-05-12T15:46:28Z","title":"SpecRouter: Adaptive Routing for Multi-Level Speculative Decoding in Large Language Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-15T22:15:13.786730Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2505.07680"},"observation_digest":"sha256:7cbe07858d7497e0aa2ea14f08b0f30560e8a19475b131158f6705b6f6e9947d","observation_id":"e14f3436-8cb5-40fd-8527-d71aff84aa03","resolution":{"observed_at":"2026-08-15T22:15:13.786730Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:15:14.520546Z","title":"N., Kaiser, Ł., and Polosukhin, I","venue":null,"work_id":"3e9b8c00-49e7-41fe-927e-2d3e0ee99c57","year":2017},"citing_paper":{"arxiv_id":"2505.07680","last_updated":"2025-05-12T15:46:28Z","snapshot_observed_at":"2026-08-16T23:08:06.180581Z","submitted_at":"2025-05-12T15:46:28Z","title":"SpecRouter: Adaptive Routing for Multi-Level Speculative Decoding in Large Language Models","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-15T22:15:13.791983Z"},"links":{"citing_paper":"/paper/2505.07680"},"observation_digest":"sha256:deaf233d20168b07f721512a83628d5579b4ed06079d43a791e9a96f7725030f","observation_id":"8a8beda3-dd0c-4dd6-b58d-2b3621bd4fc0","resolution":{"observed_at":"2026-08-15T22:15:14.526139Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:15:14.501756Z","title":"In Proceedings of the 2020 conference on empirical methods in natural language processing: system demonstrations (2020), pp","venue":null,"work_id":"0a40f02f-8217-45b2-bd19-401adaf325f3","year":2020},"citing_paper":{"arxiv_id":"2505.07680","last_updated":"2025-05-12T15:46:28Z","snapshot_observed_at":"2026-08-16T23:08:06.180581Z","submitted_at":"2025-05-12T15:46:28Z","title":"SpecRouter: Adaptive Routing for Multi-Level Speculative Decoding in Large Language Models","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-15T22:15:13.797021Z"},"links":{"citing_paper":"/paper/2505.07680"},"observation_digest":"sha256:ea39f8fbe076e290f05e1de32e1492ed7ed264dba9234f2b68a6b1dd4b1ff6b4","observation_id":"a004264e-896b-429b-9c36-1ce0ea5e3a8b","resolution":{"observed_at":"2026-08-15T22:15:14.507776Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:15:14.480867Z","title":"Loongserve: Efficiently serving long-context large language models with elastic se- quence parallelism","venue":null,"work_id":"13a06d7a-aee2-48fc-84f9-93195122b4b5","year":2024},"citing_paper":{"arxiv_id":"2505.07680","last_updated":"2025-05-12T15:46:28Z","snapshot_observed_at":"2026-08-16T23:08:06.180581Z","submitted_at":"2025-05-12T15:46:28Z","title":"SpecRouter: Adaptive Routing for Multi-Level Speculative Decoding in Large Language Models","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-15T22:15:13.802740Z"},"links":{"citing_paper":"/paper/2505.07680"},"observation_digest":"sha256:2fc84e354218070f5f3d14ce0fea3d6c121278f7f38e1563fed5f0c1e36386d0","observation_id":"5fc0c6f5-5a40-40b9-b4af-56e9949e3cb1","resolution":{"observed_at":"2026-08-15T22:15:14.489109Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:15:14.459924Z","title":"Advances in Neural Information Processing Systems 37 (2024), 128082–128117","venue":null,"work_id":"80e99d97-3268-4aef-86e1-058ce66f631c","year":2024},"citing_paper":{"arxiv_id":"2505.07680","last_updated":"2025-05-12T15:46:28Z","snapshot_observed_at":"2026-08-16T23:08:06.180581Z","submitted_at":"2025-05-12T15:46:28Z","title":"SpecRouter: Adaptive Routing for Multi-Level Speculative Decoding in Large Language Models","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-15T22:15:13.807607Z"},"links":{"citing_paper":"/paper/2505.07680"},"observation_digest":"sha256:a97960af0ff1f4b10dc7c5514e86db16ce01b4a9fe6107850ff6f5c50609a635","observation_id":"f7782d39-c43a-4d1c-93e2-9c6abe52c1a9","resolution":{"observed_at":"2026-08-15T22:15:14.466002Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:15:14.442540Z","title":"S., Kim, G.-W., Kim, S., and Chun, B.-G","venue":null,"work_id":"28e88b07-5770-4fcc-81ba-ff3d4ec60414","year":2022},"citing_paper":{"arxiv_id":"2505.07680","last_updated":"2025-05-12T15:46:28Z","snapshot_observed_at":"2026-08-16T23:08:06.180581Z","submitted_at":"2025-05-12T15:46:28Z","title":"SpecRouter: Adaptive Routing for Multi-Level Speculative Decoding in Large Language Models","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-15T22:15:13.812611Z"},"links":{"citing_paper":"/paper/2505.07680"},"observation_digest":"sha256:9f81da8aa8f8f53988b51328dfe43375b6c4f849017ebb36617803849148c2b9","observation_id":"66bbdaa8-5bcd-4e26-850e-7403018ef09d","resolution":{"observed_at":"2026-08-15T22:15:14.447709Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:15:14.423981Z","title":"Fast and live model auto scaling with o(1) host caching, 2024","venue":null,"work_id":"d5307826-7490-4ebf-8053-aca1335cad37","year":2024},"citing_paper":{"arxiv_id":"2505.07680","last_updated":"2025-05-12T15:46:28Z","snapshot_observed_at":"2026-08-16T23:08:06.180581Z","submitted_at":"2025-05-12T15:46:28Z","title":"SpecRouter: Adaptive Routing for Multi-Level Speculative Decoding in Large Language Models","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-15T22:15:13.817817Z"},"links":{"citing_paper":"/paper/2505.07680"},"observation_digest":"sha256:ca0179b98f4a0d9f66f7d27d20d57fc78744c3e0c0f268a2affe1589175b6039","observation_id":"51c3b9f8-a77b-4815-afb2-bc691f243a19","resolution":{"observed_at":"2026-08-15T22:15:14.430057Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11021","last_updated":"2025-02-16T07:08:47Z","snapshot_observed_at":"2026-08-16T12:58:03.551106Z","submitted_at":"2025-02-16T07:08:47Z","title":"Leveraging Uncertainty Estimation for Efficient LLM Routing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.11021","snapshot_observed_at":"2026-08-15T22:15:13.822890Z","title":"Leveraging uncertainty estimation for efficient llm routing","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.07680","last_updated":"2025-05-12T15:46:28Z","snapshot_observed_at":"2026-08-16T23:08:06.180581Z","submitted_at":"2025-05-12T15:46:28Z","title":"SpecRouter: Adaptive Routing for Multi-Level Speculative Decoding in Large Language Models","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-15T22:15:13.822890Z"},"links":{"cited_paper":"/paper/2502.11021","citing_paper":"/paper/2505.07680"},"observation_digest":"sha256:a7a02337fb643aa26b90f0a3ca1034de2c58f198d206885f955e460aec4d64e3","observation_id":"6739893d-ff97-475b-91e0-401f09fa0b41","resolution":{"observed_at":"2026-08-15T22:15:13.822890Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:15:14.403201Z","title":"Judging llm-as-a-judge with mt- bench and chatbot arena","venue":null,"work_id":"81c08571-9e35-4008-84eb-8a6cdcf245bc","year":2023},"citing_paper":{"arxiv_id":"2505.07680","last_updated":"2025-05-12T15:46:28Z","snapshot_observed_at":"2026-08-16T23:08:06.180581Z","submitted_at":"2025-05-12T15:46:28Z","title":"SpecRouter: Adaptive Routing for Multi-Level Speculative Decoding in Large Language Models","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-15T22:15:13.827969Z"},"links":{"citing_paper":"/paper/2505.07680"},"observation_digest":"sha256:009541142a751165c027d637fcdc94c58a0530af585aee52a8e42a6d5801f963","observation_id":"41c72e65-dc45-4332-8e6f-e4cbc9b76dab","resolution":{"observed_at":"2026-08-15T22:15:14.409915Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:15:14.385380Z","title":"L., Huang, J., Yu, C","venue":null,"work_id":"c7826d77-01ab-4e90-8eb2-7bd715584709","year":2024},"citing_paper":{"arxiv_id":"2505.07680","last_updated":"2025-05-12T15:46:28Z","snapshot_observed_at":"2026-08-16T23:08:06.180581Z","submitted_at":"2025-05-12T15:46:28Z","title":"SpecRouter: Adaptive Routing for Multi-Level Speculative Decoding in Large Language Models","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-15T22:15:13.833773Z"},"links":{"citing_paper":"/paper/2505.07680"},"observation_digest":"sha256:8024ad8fd6857ea589b38ecd8522ee7d4fa10cfb9b67a1a051cc67b5724f9625","observation_id":"c05f7756-4730-43c9-9071-9a9e784ab483","resolution":{"observed_at":"2026-08-15T22:15:14.391163Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:15:14.364493Z","title":"{DistServe}: Disaggregating prefill and decoding for goodput- optimized large language model serving","venue":null,"work_id":"2411cac4-3fd5-4fbe-868d-9a29db330377","year":2024},"citing_paper":{"arxiv_id":"2505.07680","last_updated":"2025-05-12T15:46:28Z","snapshot_observed_at":"2026-08-16T23:08:06.180581Z","submitted_at":"2025-05-12T15:46:28Z","title":"SpecRouter: Adaptive Routing for Multi-Level Speculative Decoding in Large Language Models","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-15T22:15:13.840499Z"},"links":{"citing_paper":"/paper/2505.07680"},"observation_digest":"sha256:7cfe60d5f9908587809f0137a025cbf8bda18cebafeefd85fb094d1744f9132f","observation_id":"3471d54a-77c1-469b-b20a-0bd0201c21c2","resolution":{"observed_at":"2026-08-15T22:15:14.371621Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14294","last_updated":"2024-07-19T04:47:36Z","snapshot_observed_at":"2026-07-06T18:03:47.096406Z","submitted_at":"2024-04-22T15:53:08Z","title":"A Survey on Efficient Inference for Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14294","snapshot_observed_at":"2026-08-15T22:15:13.845648Z","title":"A survey on efficient inference for large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.07680","last_updated":"2025-05-12T15:46:28Z","snapshot_observed_at":"2026-08-16T23:08:06.180581Z","submitted_at":"2025-05-12T15:46:28Z","title":"SpecRouter: Adaptive Routing for Multi-Level Speculative Decoding in Large Language Models","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-15T22:15:13.845648Z"},"links":{"cited_paper":"/paper/2404.14294","citing_paper":"/paper/2505.07680"},"observation_digest":"sha256:571db35d485ef64f4b0debe970452d54040b5fd5dcec0e5b6c5131b833675c87","observation_id":"f6701ae3-4171-4835-b23e-104270ec9493","resolution":{"observed_at":"2026-08-15T22:15:13.845648Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.08461","last_updated":"2025-03-11T14:10:58Z","snapshot_observed_at":"2026-08-16T13:46:00.829569Z","submitted_at":"2025-03-11T14:10:58Z","title":"FastCache: Optimizing Multimodal LLM Serving through Lightweight KV-Cache Compression Framework","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.08461","snapshot_observed_at":"2026-08-15T22:15:13.851365Z","title":"arXiv preprint arXiv:2503.08461 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.07680","last_updated":"2025-05-12T15:46:28Z","snapshot_observed_at":"2026-08-16T23:08:06.180581Z","submitted_at":"2025-05-12T15:46:28Z","title":"SpecRouter: Adaptive Routing for Multi-Level Speculative Decoding in Large Language Models","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-15T22:15:13.851365Z"},"links":{"cited_paper":"/paper/2503.08461","citing_paper":"/paper/2505.07680"},"observation_digest":"sha256:da17900a61e000c81564819bd3328720965464647074dd08ba22f07104b8e351","observation_id":"9493b1f5-425f-4d97-b9d1-ed847f7de737","resolution":{"observed_at":"2026-08-15T22:15:13.851365Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.07680","last_updated":"2025-05-12T15:46:28Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-16T23:08:06.180581Z","submitted_at":"2025-05-12T15:46:28Z","title":"SpecRouter: Adaptive Routing for Multi-Level Speculative Decoding in Large Language Models"},"reference_resolution":{"displayed":55,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":20,"verified_exact":1,"verified_fuzzy":34},"total_outbound_references":55},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 55 of 55 outbound references and 1 inbound Pith citation observation for arXiv:2505.07680."}