{"as_of":"2026-08-09T20:15:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:2e4bd10703985ec5c65dc4b6c5dd31c0e2d03411b992e7f44ec3d13fcf6b8ec7","coverage":[{"denominator":28,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":28,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T10:14:15.769111Z","state":"measured"},{"denominator":28,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":28,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.20327/citation-record","integrity":"/paper/2607.20327/integrity","json":"/paper/2607.20327/citation-record.json","paper":"/paper/2607.20327"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-01T10:14:12.383244Z","title":"Gpt-4 technical report.arXiv preprint arXiv:2303.08774,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.20327","last_updated":"2026-07-22T16:14:26Z","snapshot_observed_at":"2026-08-07T18:49:46.472241Z","submitted_at":"2026-07-22T16:14:26Z","title":"PyroDash: Cost-Efficient Token-Level Small-Large Language Model Collaborative Inference","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-01T10:14:12.383244Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2607.20327"},"observation_digest":"sha256:8095bcc8ea7d89d297e7e14b90d8d876c9018acaff58917c344229e403d9c7bc","observation_id":"7e6c972b-025f-4e46-90f7-24537d427c2d","resolution":{"observed_at":"2026-08-01T10:14:12.383244Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.01318","last_updated":"2023-02-02T18:44:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-02T18:44:11Z","title":"Accelerating Large Language Model Decoding with Speculative Sampling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.01318","snapshot_observed_at":"2026-08-01T10:14:12.591431Z","title":"Charlie Chen, Sebastian Borgeaud, Geoffrey Irving, et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.20327","last_updated":"2026-07-22T16:14:26Z","snapshot_observed_at":"2026-08-07T18:49:46.472241Z","submitted_at":"2026-07-22T16:14:26Z","title":"PyroDash: Cost-Efficient Token-Level Small-Large Language Model Collaborative Inference","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-01T10:14:12.591431Z"},"links":{"cited_paper":"/paper/2302.01318","citing_paper":"/paper/2607.20327"},"observation_digest":"sha256:34f53a60d5d6c036bfa9d9e2d98fdbe9a6cb9003f2308dcba9b854bde66ce680","observation_id":"0545cfab-e194-4e13-8ad2-0ea522a64c51","resolution":{"observed_at":"2026-08-01T10:14:12.591431Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.05176","last_updated":"2023-05-09T05:11:02Z","snapshot_observed_at":"2026-07-31T18:33:34.529799Z","submitted_at":"2023-05-09T05:11:02Z","title":"FrugalGPT: How to Use Large Language Models While Reducing Cost and Improving Performance","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.05176","snapshot_observed_at":"2026-08-01T10:14:12.721693Z","title":"Zhixiong Chen, Bingjie Zhu, Jiangzhou Wang, Hyundong Shin, Arumugam Nallanathan, and Dusit Niyato","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.20327","last_updated":"2026-07-22T16:14:26Z","snapshot_observed_at":"2026-08-07T18:49:46.472241Z","submitted_at":"2026-07-22T16:14:26Z","title":"PyroDash: Cost-Efficient Token-Level Small-Large Language Model Collaborative Inference","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-01T10:14:12.721693Z"},"links":{"cited_paper":"/paper/2305.05176","citing_paper":"/paper/2607.20327"},"observation_digest":"sha256:42ecb56ce1c1410455afe67c00b3db68ed13a2b9b15349df3eb35b81828a8a17","observation_id":"ac93d4e0-5e35-4490-885f-7b9d42ff64db","resolution":{"observed_at":"2026-08-01T10:14:12.721693Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14618","last_updated":"2024-04-22T23:06:42Z","snapshot_observed_at":"2026-08-08T18:42:25.777499Z","submitted_at":"2024-04-22T23:06:42Z","title":"Hybrid LLM: Cost-Efficient and Quality-Aware Query Routing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14618","snapshot_observed_at":"2026-08-01T10:14:13.051550Z","title":"Elias Frantar, Saleh Ashkboos, Torsten Hoefler, and Dan Alistarh","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.20327","last_updated":"2026-07-22T16:14:26Z","snapshot_observed_at":"2026-08-07T18:49:46.472241Z","submitted_at":"2026-07-22T16:14:26Z","title":"PyroDash: Cost-Efficient Token-Level Small-Large Language Model Collaborative Inference","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-01T10:14:13.051550Z"},"links":{"cited_paper":"/paper/2404.14618","citing_paper":"/paper/2607.20327"},"observation_digest":"sha256:56b408516a25d4213497ad02d04067753e2a3bb36a7960dd15e88258f9a017cf","observation_id":"c7222c22-3a5e-4dda-9082-13cbf2705f88","resolution":{"observed_at":"2026-08-01T10:14:13.051550Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.08543","last_updated":"2026-01-31T09:16:35Z","snapshot_observed_at":"2026-08-02T20:03:32.798288Z","submitted_at":"2023-06-14T14:44:03Z","title":"MiniLLM: On-Policy Distillation of Large Language Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.08543","snapshot_observed_at":"2026-08-01T10:14:13.380909Z","title":"ChaoqunHe, Renjie Luo, YuzhuoBai, Shengding Hu, ZhenThai, JunhaoShen, JinyiHu, XuHan, Yujie Huang, Yuxiang Zhang, Jie Liu, Lei Qi, Zhiyuan Liu, and Maosong Sun","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.20327","last_updated":"2026-07-22T16:14:26Z","snapshot_observed_at":"2026-08-07T18:49:46.472241Z","submitted_at":"2026-07-22T16:14:26Z","title":"PyroDash: Cost-Efficient Token-Level Small-Large Language Model Collaborative Inference","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-01T10:14:13.380909Z"},"links":{"cited_paper":"/paper/2306.08543","citing_paper":"/paper/2607.20327"},"observation_digest":"sha256:66660b3250b744f26a5abc5cce9e81dbc8bbf54d4cf28bc21c72bcd925cab029","observation_id":"2142e741-ccc8-4c55-82c7-e54f924f1ce9","resolution":{"observed_at":"2026-08-01T10:14:13.380909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:14:13.467160Z","title":"doi: 10.18653/v1/2024.acl-long.211","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.20327","last_updated":"2026-07-22T16:14:26Z","snapshot_observed_at":"2026-08-07T18:49:46.472241Z","submitted_at":"2026-07-22T16:14:26Z","title":"PyroDash: Cost-Efficient Token-Level Small-Large Language Model Collaborative Inference","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-01T10:14:13.467160Z"},"links":{"citing_paper":"/paper/2607.20327"},"observation_digest":"sha256:a65dc7a5314c15d8c05d61d27e1cb30afd810fe034c6b622a2124f2fc4a8092c","observation_id":"ad5fdaf3-25e9-4fd7-9e57-51fcfe9a1fd5","resolution":{"observed_at":"2026-08-01T10:14:13.467160Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:14:13.630835Z","title":"AIME 2024 dataset.https://huggingface.co/datasets/HuggingFaceH4/aime_2024,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.20327","last_updated":"2026-07-22T16:14:26Z","snapshot_observed_at":"2026-08-07T18:49:46.472241Z","submitted_at":"2026-07-22T16:14:26Z","title":"PyroDash: Cost-Efficient Token-Level Small-Large Language Model Collaborative Inference","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-01T10:14:13.630835Z"},"links":{"citing_paper":"/paper/2607.20327"},"observation_digest":"sha256:10c2e5f9f9618d3edd552da63e271339faa01e6bc4bf2c4a6c4a1f3e27989456","observation_id":"4a10967e-af6f-4723-9c09-c4f692f58998","resolution":{"observed_at":"2026-08-01T10:14:13.630835Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:14:13.802085Z","title":"arXiv:2309.06180","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.20327","last_updated":"2026-07-22T16:14:26Z","snapshot_observed_at":"2026-08-07T18:49:46.472241Z","submitted_at":"2026-07-22T16:14:26Z","title":"PyroDash: Cost-Efficient Token-Level Small-Large Language Model Collaborative Inference","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-01T10:14:13.802085Z"},"links":{"citing_paper":"/paper/2607.20327"},"observation_digest":"sha256:4140fb428348f18f5cefdc0c6074ae68e4d35ea7ed858f30eb4319c67dfe2d03","observation_id":"715ee1e4-58b9-4173-a258-1f06008d172c","resolution":{"observed_at":"2026-08-01T10:14:13.802085Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.17192","last_updated":"2023-05-18T20:28:20Z","snapshot_observed_at":"2026-08-08T11:03:33.403601Z","submitted_at":"2022-11-30T17:33:28Z","title":"Fast Inference from Transformers via Speculative Decoding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.17192","snapshot_observed_at":"2026-08-01T10:14:13.949395Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.20327","last_updated":"2026-07-22T16:14:26Z","snapshot_observed_at":"2026-08-07T18:49:46.472241Z","submitted_at":"2026-07-22T16:14:26Z","title":"PyroDash: Cost-Efficient Token-Level Small-Large Language Model Collaborative Inference","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-01T10:14:13.949395Z"},"links":{"cited_paper":"/paper/2211.17192","citing_paper":"/paper/2607.20327"},"observation_digest":"sha256:c303469d3faa2c7701943584f1a3ae470b0045c46f86ca5c77b3b735ecfabf6f","observation_id":"aa795d4c-df4d-440f-bea1-abce99604d42","resolution":{"observed_at":"2026-08-01T10:14:13.949395Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:14:14.246023Z","title":"AIME 2025 dataset.https://huggingface.co/datasets/yentinglin/aime_2025,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.20327","last_updated":"2026-07-22T16:14:26Z","snapshot_observed_at":"2026-08-07T18:49:46.472241Z","submitted_at":"2026-07-22T16:14:26Z","title":"PyroDash: Cost-Efficient Token-Level Small-Large Language Model Collaborative Inference","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-01T10:14:14.246023Z"},"links":{"citing_paper":"/paper/2607.20327"},"observation_digest":"sha256:26839b6cdcda048e7c1683c914418254a44311d8dcb3a88519afd1ce6c4f901b","observation_id":"e9e56ab1-c631-452a-9a7e-f119d3609eb5","resolution":{"observed_at":"2026-08-01T10:14:14.246023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:14:14.320563Z","title":"Isaac Ong, Amjad Almahairi, Vincent Wu, Wei-Lin Chiang, Tianhao Wu, Joseph E","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.20327","last_updated":"2026-07-22T16:14:26Z","snapshot_observed_at":"2026-08-07T18:49:46.472241Z","submitted_at":"2026-07-22T16:14:26Z","title":"PyroDash: Cost-Efficient Token-Level Small-Large Language Model Collaborative Inference","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-01T10:14:14.320563Z"},"links":{"citing_paper":"/paper/2607.20327"},"observation_digest":"sha256:060e940b41c2ca9ce74bd834d5b2b5f527601b71d51185dbfbf4513099bc9bbe","observation_id":"7b91f3a8-d83a-4312-9ee4-4266a104c688","resolution":{"observed_at":"2026-08-01T10:14:14.320563Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18665","last_updated":"2025-02-23T08:50:33Z","snapshot_observed_at":"2026-07-30T15:06:18.011623Z","submitted_at":"2024-06-26T18:10:22Z","title":"RouteLLM: Learning to Route LLMs with Preference Data","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.18665","snapshot_observed_at":"2026-08-01T10:14:14.391012Z","title":"PyroMind Dynamics","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.20327","last_updated":"2026-07-22T16:14:26Z","snapshot_observed_at":"2026-08-07T18:49:46.472241Z","submitted_at":"2026-07-22T16:14:26Z","title":"PyroDash: Cost-Efficient Token-Level Small-Large Language Model Collaborative Inference","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-01T10:14:14.391012Z"},"links":{"cited_paper":"/paper/2406.18665","citing_paper":"/paper/2607.20327"},"observation_digest":"sha256:594fb118610d7cf16ad6667cb679594d44d9135b773e973497f510894b9f5f94","observation_id":"530deb04-d18a-42bf-a086-9ff81f68fe40","resolution":{"observed_at":"2026-08-01T10:14:14.391012Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-01T10:14:14.449461Z","title":"Zhihong Shao, Peiyi Wang, Qihao Zhu, et al","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.20327","last_updated":"2026-07-22T16:14:26Z","snapshot_observed_at":"2026-08-07T18:49:46.472241Z","submitted_at":"2026-07-22T16:14:26Z","title":"PyroDash: Cost-Efficient Token-Level Small-Large Language Model Collaborative Inference","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-01T10:14:14.449461Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2607.20327"},"observation_digest":"sha256:021dbb09c8808d4e78af1fb9605ad95da9026d5dcb5437be85557927ba09d876","observation_id":"1410c7ab-d4e5-4fee-afb6-e11cc1348204","resolution":{"observed_at":"2026-08-01T10:14:14.449461Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03870","last_updated":"2024-08-27T08:31:04Z","snapshot_observed_at":"2026-07-06T17:40:33.769700Z","submitted_at":"2024-03-06T17:23:28Z","title":"Learning to Decode Collaboratively with Multiple Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.03870","snapshot_observed_at":"2026-08-01T10:14:14.517955Z","title":"arXiv:2403.03870","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.20327","last_updated":"2026-07-22T16:14:26Z","snapshot_observed_at":"2026-08-07T18:49:46.472241Z","submitted_at":"2026-07-22T16:14:26Z","title":"PyroDash: Cost-Efficient Token-Level Small-Large Language Model Collaborative Inference","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-01T10:14:14.517955Z"},"links":{"cited_paper":"/paper/2403.03870","citing_paper":"/paper/2607.20327"},"observation_digest":"sha256:63ec6999a6432f40d4d8dc4a9a60476ff5bc8933b66ac0e83409c9daa2900c62","observation_id":"a57438e5-8adf-41b2-a66c-fc8ac83177bc","resolution":{"observed_at":"2026-08-01T10:14:14.517955Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.18482","last_updated":"2025-02-09T02:26:15Z","snapshot_observed_at":"2026-08-08T23:22:32.437222Z","submitted_at":"2025-02-09T02:26:15Z","title":"MixLLM: Dynamic Routing in Mixed Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.18482","snapshot_observed_at":"2026-08-01T10:14:14.711685Z","title":"Jason Wei, Xuezhi Wang, Dale Schuurmans, Maarten Bosma, Brian Ichter, Fei Xia, Ed H","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.20327","last_updated":"2026-07-22T16:14:26Z","snapshot_observed_at":"2026-08-07T18:49:46.472241Z","submitted_at":"2026-07-22T16:14:26Z","title":"PyroDash: Cost-Efficient Token-Level Small-Large Language Model Collaborative Inference","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-01T10:14:14.711685Z"},"links":{"cited_paper":"/paper/2502.18482","citing_paper":"/paper/2607.20327"},"observation_digest":"sha256:fd1290aa4ae3cf92dfcc8bdbe0b3ac73e961ad859d9cf9b8c2147c5d5ad383c6","observation_id":"723212a3-74bc-4b8a-a9ae-27150fab658f","resolution":{"observed_at":"2026-08-01T10:14:14.711685Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:14:14.832244Z","title":"Heming Xia, Zhe Yang, Qingxiu Dong, Peiyi Wang, Yongqi Li, Tao Ge, Tianyu Liu, Wenjie Li, and Zhifang Sui","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.20327","last_updated":"2026-07-22T16:14:26Z","snapshot_observed_at":"2026-08-07T18:49:46.472241Z","submitted_at":"2026-07-22T16:14:26Z","title":"PyroDash: Cost-Efficient Token-Level Small-Large Language Model Collaborative Inference","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-01T10:14:14.832244Z"},"links":{"citing_paper":"/paper/2607.20327"},"observation_digest":"sha256:f359cf378e621e905c4e52d86f13cc8c0f25bb9d4526026ac65cae87d68a06c5","observation_id":"e9308cf6-41ea-4b30-9dfb-0195d6820f7c","resolution":{"observed_at":"2026-08-01T10:14:14.832244Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.07851","last_updated":"2024-06-04T17:08:37Z","snapshot_observed_at":"2026-07-06T17:15:46.395218Z","submitted_at":"2024-01-15T17:26:50Z","title":"Unlocking Efficiency in Large Language Model Inference: A Comprehensive Survey of Speculative Decoding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.07851","snapshot_observed_at":"2026-08-01T10:14:14.991489Z","title":"arXiv:2401.07851","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.20327","last_updated":"2026-07-22T16:14:26Z","snapshot_observed_at":"2026-08-07T18:49:46.472241Z","submitted_at":"2026-07-22T16:14:26Z","title":"PyroDash: Cost-Efficient Token-Level Small-Large Language Model Collaborative Inference","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-01T10:14:14.991489Z"},"links":{"cited_paper":"/paper/2401.07851","citing_paper":"/paper/2607.20327"},"observation_digest":"sha256:2dea8d93863527ea7219fcc5c0d2f4ec9ab4aa72bea4c5a3a6e50d7324201d48","observation_id":"3d44352d-c718-4c95-81c8-019008783cb1","resolution":{"observed_at":"2026-08-01T10:14:14.991489Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-01T10:14:15.165921Z","title":"DAPO: An open-source LLM rein- forcement learning system at scale.arXiv preprint arXiv:2503.14476,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.20327","last_updated":"2026-07-22T16:14:26Z","snapshot_observed_at":"2026-08-07T18:49:46.472241Z","submitted_at":"2026-07-22T16:14:26Z","title":"PyroDash: Cost-Efficient Token-Level Small-Large Language Model Collaborative Inference","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-01T10:14:15.165921Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2607.20327"},"observation_digest":"sha256:cce81cd5a1851d0a12f0626afb0ac212fe70ef118a203d9c4a046374ca4f4e14","observation_id":"5b676662-3a8c-4c5a-88bc-d3b92cbbcff0","resolution":{"observed_at":"2026-08-01T10:14:15.165921Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:14:15.345869Z","title":"GlimpRouter: Efficientcollaborativeinferencebyglimpsingonetokenofthoughts","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.20327","last_updated":"2026-07-22T16:14:26Z","snapshot_observed_at":"2026-08-07T18:49:46.472241Z","submitted_at":"2026-07-22T16:14:26Z","title":"PyroDash: Cost-Efficient Token-Level Small-Large Language Model Collaborative Inference","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-01T10:14:15.345869Z"},"links":{"citing_paper":"/paper/2607.20327"},"observation_digest":"sha256:7718dfe401b3ae354e98c2e385776689d3079e5aaf4176fd6f570e291c0a885c","observation_id":"7f84fa8b-bdc9-4553-88f3-5f5630551f5c","resolution":{"observed_at":"2026-08-01T10:14:15.345869Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.05110","last_updated":"2026-04-28T12:22:24Z","snapshot_observed_at":"2026-07-06T22:41:10.836235Z","submitted_at":"2026-01-08T16:58:07Z","title":"GlimpRouter: Efficient Collaborative Inference by Glimpsing One Token of Thoughts","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.05110","snapshot_observed_at":"2026-08-01T10:14:15.519244Z","title":"doi: 10.18653/v1/2026.findings-acl.885","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.20327","last_updated":"2026-07-22T16:14:26Z","snapshot_observed_at":"2026-08-07T18:49:46.472241Z","submitted_at":"2026-07-22T16:14:26Z","title":"PyroDash: Cost-Efficient Token-Level Small-Large Language Model Collaborative Inference","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-01T10:14:15.519244Z"},"links":{"cited_paper":"/paper/2601.05110","citing_paper":"/paper/2607.20327"},"observation_digest":"sha256:1d88c94630c17c37261f2fe86f10daf7990602b3ec2e7501a103a0f62024c0cb","observation_id":"d168707e-35fe-4e43-95d1-751aaff63efd","resolution":{"observed_at":"2026-08-01T10:14:15.519244Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.01976","last_updated":"2025-09-10T02:45:51Z","snapshot_observed_at":"2026-08-09T13:47:22.683119Z","submitted_at":"2025-02-04T03:36:44Z","title":"CITER: Collaborative Inference for Efficient Large Language Model Decoding with Token-Level Routing","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.01976","snapshot_observed_at":"2026-08-01T10:14:15.660311Z","title":"Work in Progress 16 PyroDash: Cost-Efficient Token-Level Small-Large Model Collaborative Inference A","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.20327","last_updated":"2026-07-22T16:14:26Z","snapshot_observed_at":"2026-08-07T18:49:46.472241Z","submitted_at":"2026-07-22T16:14:26Z","title":"PyroDash: Cost-Efficient Token-Level Small-Large Language Model Collaborative Inference","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-01T10:14:15.660311Z"},"links":{"cited_paper":"/paper/2502.01976","citing_paper":"/paper/2607.20327"},"observation_digest":"sha256:e69f50314e3d538376bb6585c9881745d6a8e314878963cbd594a6c56a99478b","observation_id":"9791e570-20ef-4b91-9855-395ec8fb6379","resolution":{"observed_at":"2026-08-01T10:14:15.660311Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:14:15.769111Z","title":"Takeaway.The trace separates model roles cleanly: the SLM supplies the governing equation, while the LLM completes the BCC-specific substitution, unit conversion, and rounding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.20327","last_updated":"2026-07-22T16:14:26Z","snapshot_observed_at":"2026-08-07T18:49:46.472241Z","submitted_at":"2026-07-22T16:14:26Z","title":"PyroDash: Cost-Efficient Token-Level Small-Large Language Model Collaborative Inference","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-01T10:14:15.769111Z"},"links":{"citing_paper":"/paper/2607.20327"},"observation_digest":"sha256:ee754fca8a2711132cb0b0cda5037a094205a6cafc646a20dd3fb836cb435a98","observation_id":"f8ef10d5-80c2-4f41-b327-f3fbafc0deb2","resolution":{"observed_at":"2026-08-01T10:14:15.769111Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:14:14.597267Z","title":"Xinyuan Wang, Yanchi Liu, Wei Cheng, Xujiang Zhao, Zhengzhang Chen, Wenchao Yu, Yanjie Fu, and Haifeng Chen","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.20327","last_updated":"2026-07-22T16:14:26Z","snapshot_observed_at":"2026-08-07T18:49:46.472241Z","submitted_at":"2026-07-22T16:14:26Z","title":"PyroDash: Cost-Efficient Token-Level Small-Large Language Model Collaborative Inference","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-01T10:14:14.597267Z"},"links":{"citing_paper":"/paper/2607.20327"},"observation_digest":"sha256:b90e2c4852cb7c2db0fbd71df1f2c080272c239385da7ab4742c88c41cdfdde2","observation_id":"f250f1a5-a5dd-4351-b8e0-89b29314acf0","resolution":{"observed_at":"2026-08-01T10:14:14.597267Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.16731","last_updated":"2025-07-22T16:13:43Z","snapshot_observed_at":"2026-08-07T22:15:08.576638Z","submitted_at":"2025-07-22T16:13:43Z","title":"Collaborative Inference and Learning between Edge SLMs and Cloud LLMs: A Survey of Algorithms, Execution, and Open Challenges","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.16731","snapshot_observed_at":"2026-08-01T10:14:14.063270Z","title":"Senyao Li, Haozhao Wang, Wenchao Xu, Rui Zhang, Song Guo, Jingling Yuan, Xian Zhong, Tianwei Zhang, and Ruixuan Li","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.20327","last_updated":"2026-07-22T16:14:26Z","snapshot_observed_at":"2026-08-07T18:49:46.472241Z","submitted_at":"2026-07-22T16:14:26Z","title":"PyroDash: Cost-Efficient Token-Level Small-Large Language Model Collaborative Inference","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-01T10:14:14.063270Z"},"links":{"cited_paper":"/paper/2507.16731","citing_paper":"/paper/2607.20327"},"observation_digest":"sha256:1157d2360b540e2f201ec6648bb770f92309d0b9fa3653a28e4748be4849b151","observation_id":"0a404b17-ab33-40ef-b445-4eff6cb665a6","resolution":{"observed_at":"2026-08-01T10:14:14.063270Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.17323","last_updated":"2023-03-22T13:10:47Z","snapshot_observed_at":"2026-08-07T08:38:54.025062Z","submitted_at":"2022-10-31T13:42:40Z","title":"GPTQ: Accurate Post-Training Quantization for Generative Pre-trained Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.17323","snapshot_observed_at":"2026-08-01T10:14:13.211948Z","title":"Gemma Team","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.20327","last_updated":"2026-07-22T16:14:26Z","snapshot_observed_at":"2026-08-07T18:49:46.472241Z","submitted_at":"2026-07-22T16:14:26Z","title":"PyroDash: Cost-Efficient Token-Level Small-Large Language Model Collaborative Inference","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-01T10:14:13.211948Z"},"links":{"cited_paper":"/paper/2210.17323","citing_paper":"/paper/2607.20327"},"observation_digest":"sha256:1654c31a4f859d51d6f45b7c860e02977bc6aa4a92ba296e3aecd836a88db5a6","observation_id":"550fd14e-acad-4d3e-8dde-855233cb7ced","resolution":{"observed_at":"2026-08-01T10:14:13.211948Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13649","last_updated":"2024-01-17T03:23:23Z","snapshot_observed_at":"2026-08-06T11:19:43.438106Z","submitted_at":"2023-06-23T17:56:26Z","title":"On-Policy Distillation of Language Models: Learning from Self-Generated Mistakes","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13649","snapshot_observed_at":"2026-08-01T10:14:12.501030Z","title":"Tianle Cai, Yuhong Li, Zhengyang Geng, Hongwu Peng, Jason D","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.20327","last_updated":"2026-07-22T16:14:26Z","snapshot_observed_at":"2026-08-07T18:49:46.472241Z","submitted_at":"2026-07-22T16:14:26Z","title":"PyroDash: Cost-Efficient Token-Level Small-Large Language Model Collaborative Inference","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-01T10:14:12.501030Z"},"links":{"cited_paper":"/paper/2306.13649","citing_paper":"/paper/2607.20327"},"observation_digest":"sha256:33486301b81f2128df2e5689512c6389b16e13088ba2b88724f6af77ab6103af","observation_id":"293ae174-3f07-4053-a5c8-0d0d8fdb048d","resolution":{"observed_at":"2026-08-01T10:14:12.501030Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.02743","last_updated":"2025-02-04T22:09:43Z","snapshot_observed_at":"2026-08-09T16:32:54.357740Z","submitted_at":"2025-02-04T22:09:43Z","title":"LLM Bandit: Cost-Efficient LLM Generation via Preference-Conditioned Dynamic Routing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.02743","snapshot_observed_at":"2026-08-01T10:14:14.184268Z","title":"LLMbandit: Cost-efficientLLMgenerationviapreference-conditioneddynamicrouting.arXivpreprint arXiv:2502.02743,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.20327","last_updated":"2026-07-22T16:14:26Z","snapshot_observed_at":"2026-08-07T18:49:46.472241Z","submitted_at":"2026-07-22T16:14:26Z","title":"PyroDash: Cost-Efficient Token-Level Small-Large Language Model Collaborative Inference","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-01T10:14:14.184268Z"},"links":{"cited_paper":"/paper/2502.02743","citing_paper":"/paper/2607.20327"},"observation_digest":"sha256:5c2c8eb94d1f2d105034c7eb29712cf79044aab9f395d2f49355e8a544f240e4","observation_id":"dc175f25-7347-46ce-9df0-4ad2217144d1","resolution":{"observed_at":"2026-08-01T10:14:14.184268Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.22906","last_updated":"2026-04-24T16:56:53Z","snapshot_observed_at":"2026-08-07T20:25:38.013655Z","submitted_at":"2026-04-24T16:56:53Z","title":"Network Edge Inference for Large Language Models: Principles, Techniques, and Opportunities","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.22906","snapshot_observed_at":"2026-08-01T10:14:12.873655Z","title":"arXiv:2604.22906","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.20327","last_updated":"2026-07-22T16:14:26Z","snapshot_observed_at":"2026-08-07T18:49:46.472241Z","submitted_at":"2026-07-22T16:14:26Z","title":"PyroDash: Cost-Efficient Token-Level Small-Large Language Model Collaborative Inference","version":1},"reference_index":2026,"source":"pdf_text","source_observed_at":"2026-08-01T10:14:12.873655Z"},"links":{"cited_paper":"/paper/2604.22906","citing_paper":"/paper/2607.20327"},"observation_digest":"sha256:c0e0bedef7e066ee73ba70e96a08e41645674cba0adb46b63a5b7c7e66c93127","observation_id":"3a15f6de-1c3f-45dc-a32c-53193cb650e6","resolution":{"observed_at":"2026-08-01T10:14:12.873655Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.20327","last_updated":"2026-07-22T16:14:26Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-07T18:49:46.472241Z","submitted_at":"2026-07-22T16:14:26Z","title":"PyroDash: Cost-Efficient Token-Level Small-Large Language Model Collaborative Inference"},"reference_resolution":{"displayed":28,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":27,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":28},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 28 of 28 outbound references and 0 inbound Pith citation observations for arXiv:2607.20327."}