Pith. sign in

Paper Citation Record · LEDGER

PyroDash: Cost-Efficient Token-Level Small-Large Language Model Collaborative Inference

As of 9 August 2026, this Paper Citation Record lists 28 of 28 outbound references and 0 inbound Pith citation observations for arXiv:2607.20327.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2607.20327 v1

Coverage vector

measured 28 of 28 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-01T10:14:15.769111Z

measured 28 of 28 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-09T06:31:02.800959+00:00

measured 0 of 0 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: cited_works

Reference resolution

28 of 28 outbound references displayed

  • verified exact0
  • verified fuzzy0
  • unresolved27
  • parse uncertain0
  • malformed identifier1
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 7e6c972b-025f-4e46-90f7-24537d427c2d · outbound

This paper cites GPT-4 Technical Report.

PyroDash: Cost-Efficient Token-Level Small-Large Language Model Collaborative Inference GPT-4 Technical Report

Reference 1

Resolution
unresolved
no resolver link, observed 2026-08-01T10:14:12.383244Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T10:14:12.383244Z digest=sha256:8095bcc8ea7d89d297e7e14b90d8d876c9018acaff58917c344229e403d9c7bc

Observation 0545cfab-e194-4e13-8ad2-0ea522a64c51 · outbound

This paper cites Accelerating Large Language Model Decoding with Speculative Sampling.

PyroDash: Cost-Efficient Token-Level Small-Large Language Model Collaborative Inference Accelerating Large Language Model Decoding with Speculative Sampling

Reference 3

Resolution
unresolved
no resolver link, observed 2026-08-01T10:14:12.591431Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T10:14:12.591431Z digest=sha256:34f53a60d5d6c036bfa9d9e2d98fdbe9a6cb9003f2308dcba9b854bde66ce680

Observation ac93d4e0-5e35-4490-885f-7b9d42ff64db · outbound

This paper cites FrugalGPT: How to Use Large Language Models While Reducing Cost and Improving Performance.

PyroDash: Cost-Efficient Token-Level Small-Large Language Model Collaborative Inference FrugalGPT: How to Use Large Language Models While Reducing Cost and Improving Performance

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-01T10:14:12.721693Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T10:14:12.721693Z digest=sha256:42ecb56ce1c1410455afe67c00b3db68ed13a2b9b15349df3eb35b81828a8a17

Observation c7222c22-3a5e-4dda-9082-13cbf2705f88 · outbound

This paper cites Hybrid LLM: Cost-Efficient and Quality-Aware Query Routing.

PyroDash: Cost-Efficient Token-Level Small-Large Language Model Collaborative Inference Hybrid LLM: Cost-Efficient and Quality-Aware Query Routing

Reference 6

Resolution
unresolved
no resolver link, observed 2026-08-01T10:14:13.051550Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T10:14:13.051550Z digest=sha256:56b408516a25d4213497ad02d04067753e2a3bb36a7960dd15e88258f9a017cf

Observation 2142e741-ccc8-4c55-82c7-e54f924f1ce9 · outbound

This paper cites MiniLLM: On-Policy Distillation of Large Language Models.

PyroDash: Cost-Efficient Token-Level Small-Large Language Model Collaborative Inference MiniLLM: On-Policy Distillation of Large Language Models

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-01T10:14:13.380909Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T10:14:13.380909Z digest=sha256:66660b3250b744f26a5abc5cce9e81dbc8bbf54d4cf28bc21c72bcd925cab029

Observation ad5fdaf3-25e9-4fd7-9e57-51fcfe9a1fd5 · outbound

This paper cites doi: 10.18653/v1/2024.acl-long.211.

PyroDash: Cost-Efficient Token-Level Small-Large Language Model Collaborative Inference doi: 10.18653/v1/2024.acl-long.211

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-01T10:14:13.467160Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T10:14:13.467160Z digest=sha256:a65dc7a5314c15d8c05d61d27e1cb30afd810fe034c6b622a2124f2fc4a8092c

Observation 4a10967e-af6f-4723-9c09-c4f692f58998 · outbound

This paper cites AIME 2024 dataset.https://huggingface.co/datasets/HuggingFaceH4/aime_2024,.

PyroDash: Cost-Efficient Token-Level Small-Large Language Model Collaborative Inference AIME 2024 dataset.https://huggingface.co/datasets/HuggingFaceH4/aime_2024,

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-01T10:14:13.630835Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T10:14:13.630835Z digest=sha256:10c2e5f9f9618d3edd552da63e271339faa01e6bc4bf2c4a6c4a1f3e27989456

Observation 715ee1e4-58b9-4173-a258-1f06008d172c · outbound

This paper cites arXiv:2309.06180.

PyroDash: Cost-Efficient Token-Level Small-Large Language Model Collaborative Inference arXiv:2309.06180

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-01T10:14:13.802085Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T10:14:13.802085Z digest=sha256:4140fb428348f18f5cefdc0c6074ae68e4d35ea7ed858f30eb4319c67dfe2d03

Observation aa795d4c-df4d-440f-bea1-abce99604d42 · outbound

This paper cites Fast Inference from Transformers via Speculative Decoding.

PyroDash: Cost-Efficient Token-Level Small-Large Language Model Collaborative Inference Fast Inference from Transformers via Speculative Decoding

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-01T10:14:13.949395Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T10:14:13.949395Z digest=sha256:c303469d3faa2c7701943584f1a3ae470b0045c46f86ca5c77b3b735ecfabf6f

Observation e9e56ab1-c631-452a-9a7e-f119d3609eb5 · outbound

This paper cites AIME 2025 dataset.https://huggingface.co/datasets/yentinglin/aime_2025,.

PyroDash: Cost-Efficient Token-Level Small-Large Language Model Collaborative Inference AIME 2025 dataset.https://huggingface.co/datasets/yentinglin/aime_2025,

Reference 15

Resolution
unresolved
no resolver link, observed 2026-08-01T10:14:14.246023Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T10:14:14.246023Z digest=sha256:26839b6cdcda048e7c1683c914418254a44311d8dcb3a88519afd1ce6c4f901b

Observation 7b91f3a8-d83a-4312-9ee4-4266a104c688 · outbound

This paper cites Isaac Ong, Amjad Almahairi, Vincent Wu, Wei-Lin Chiang, Tianhao Wu, Joseph E.

PyroDash: Cost-Efficient Token-Level Small-Large Language Model Collaborative Inference Isaac Ong, Amjad Almahairi, Vincent Wu, Wei-Lin Chiang, Tianhao Wu, Joseph E

Reference 16

Resolution
unresolved
no resolver link, observed 2026-08-01T10:14:14.320563Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T10:14:14.320563Z digest=sha256:060e940b41c2ca9ce74bd834d5b2b5f527601b71d51185dbfbf4513099bc9bbe

Observation 530deb04-d18a-42bf-a086-9ff81f68fe40 · outbound

This paper cites RouteLLM: Learning to Route LLMs with Preference Data.

PyroDash: Cost-Efficient Token-Level Small-Large Language Model Collaborative Inference RouteLLM: Learning to Route LLMs with Preference Data

Reference 17

Resolution
unresolved
no resolver link, observed 2026-08-01T10:14:14.391012Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T10:14:14.391012Z digest=sha256:594fb118610d7cf16ad6667cb679594d44d9135b773e973497f510894b9f5f94

Observation 1410c7ab-d4e5-4fee-afb6-e11cc1348204 · outbound

This paper cites DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models.

PyroDash: Cost-Efficient Token-Level Small-Large Language Model Collaborative Inference DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models

Reference 18

Resolution
unresolved
no resolver link, observed 2026-08-01T10:14:14.449461Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T10:14:14.449461Z digest=sha256:021dbb09c8808d4e78af1fb9605ad95da9026d5dcb5437be85557927ba09d876

Observation a57438e5-8adf-41b2-a66c-fc8ac83177bc · outbound

This paper cites Learning to Decode Collaboratively with Multiple Language Models.

PyroDash: Cost-Efficient Token-Level Small-Large Language Model Collaborative Inference Learning to Decode Collaboratively with Multiple Language Models

Reference 19

Resolution
unresolved
no resolver link, observed 2026-08-01T10:14:14.517955Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T10:14:14.517955Z digest=sha256:63ec6999a6432f40d4d8dc4a9a60476ff5bc8933b66ac0e83409c9daa2900c62

Observation 723212a3-74bc-4b8a-a9ae-27150fab658f · outbound

This paper cites MixLLM: Dynamic Routing in Mixed Large Language Models.

PyroDash: Cost-Efficient Token-Level Small-Large Language Model Collaborative Inference MixLLM: Dynamic Routing in Mixed Large Language Models

Reference 21

Resolution
unresolved
no resolver link, observed 2026-08-01T10:14:14.711685Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T10:14:14.711685Z digest=sha256:fd1290aa4ae3cf92dfcc8bdbe0b3ac73e961ad859d9cf9b8c2147c5d5ad383c6

Observation e9308cf6-41ea-4b30-9dfb-0195d6820f7c · outbound

This paper cites Heming Xia, Zhe Yang, Qingxiu Dong, Peiyi Wang, Yongqi Li, Tao Ge, Tianyu Liu, Wenjie Li, and Zhifang Sui.

PyroDash: Cost-Efficient Token-Level Small-Large Language Model Collaborative Inference Heming Xia, Zhe Yang, Qingxiu Dong, Peiyi Wang, Yongqi Li, Tao Ge, Tianyu Liu, Wenjie Li, and Zhifang Sui

Reference 22

Resolution
unresolved
no resolver link, observed 2026-08-01T10:14:14.832244Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T10:14:14.832244Z digest=sha256:f359cf378e621e905c4e52d86f13cc8c0f25bb9d4526026ac65cae87d68a06c5

Observation 3d44352d-c718-4c95-81c8-019008783cb1 · outbound

This paper cites Unlocking Efficiency in Large Language Model Inference: A Comprehensive Survey of Speculative Decoding.

PyroDash: Cost-Efficient Token-Level Small-Large Language Model Collaborative Inference Unlocking Efficiency in Large Language Model Inference: A Comprehensive Survey of Speculative Decoding

Reference 23

Resolution
unresolved
no resolver link, observed 2026-08-01T10:14:14.991489Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T10:14:14.991489Z digest=sha256:2dea8d93863527ea7219fcc5c0d2f4ec9ab4aa72bea4c5a3a6e50d7324201d48

Observation 5b676662-3a8c-4c5a-88bc-d3b92cbbcff0 · outbound

This paper cites DAPO: An Open-Source LLM Reinforcement Learning System at Scale.

PyroDash: Cost-Efficient Token-Level Small-Large Language Model Collaborative Inference DAPO: An Open-Source LLM Reinforcement Learning System at Scale

Reference 24

Resolution
unresolved
no resolver link, observed 2026-08-01T10:14:15.165921Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T10:14:15.165921Z digest=sha256:cce81cd5a1851d0a12f0626afb0ac212fe70ef118a203d9c4a046374ca4f4e14

Observation 7f84fa8b-bdc9-4553-88f3-5f5630551f5c · outbound

This paper cites GlimpRouter: Efficientcollaborativeinferencebyglimpsingonetokenofthoughts.

PyroDash: Cost-Efficient Token-Level Small-Large Language Model Collaborative Inference GlimpRouter: Efficientcollaborativeinferencebyglimpsingonetokenofthoughts

Reference 25

Resolution
unresolved
no resolver link, observed 2026-08-01T10:14:15.345869Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T10:14:15.345869Z digest=sha256:7718dfe401b3ae354e98c2e385776689d3079e5aaf4176fd6f570e291c0a885c

Observation d168707e-35fe-4e43-95d1-751aaff63efd · outbound

This paper cites GlimpRouter: Efficient Collaborative Inference by Glimpsing One Token of Thoughts.

PyroDash: Cost-Efficient Token-Level Small-Large Language Model Collaborative Inference GlimpRouter: Efficient Collaborative Inference by Glimpsing One Token of Thoughts

Reference 26

Resolution
unresolved
no resolver link, observed 2026-08-01T10:14:15.519244Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T10:14:15.519244Z digest=sha256:1d88c94630c17c37261f2fe86f10daf7990602b3ec2e7501a103a0f62024c0cb

Observation 9791e570-20ef-4b91-9855-395ec8fb6379 · outbound

This paper cites CITER: Collaborative Inference for Efficient Large Language Model Decoding with Token-Level Routing.

PyroDash: Cost-Efficient Token-Level Small-Large Language Model Collaborative Inference CITER: Collaborative Inference for Efficient Large Language Model Decoding with Token-Level Routing

Reference 27

Resolution
unresolved
no resolver link, observed 2026-08-01T10:14:15.660311Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T10:14:15.660311Z digest=sha256:e69f50314e3d538376bb6585c9881745d6a8e314878963cbd594a6c56a99478b

Observation f8ef10d5-80c2-4f41-b327-f3fbafc0deb2 · outbound

This paper cites Takeaway.The trace separates model roles cleanly: the SLM supplies the governing equation, while the LLM completes the BCC-specific substitution, unit conversion, and rounding.

PyroDash: Cost-Efficient Token-Level Small-Large Language Model Collaborative Inference Takeaway.The trace separates model roles cleanly: the SLM supplies the governing equation, while the LLM completes the BCC-specific substitution, unit conversion, and rounding

Reference 28

Resolution
malformed identifier
no resolver link, observed 2026-08-01T10:14:15.769111Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T10:14:15.769111Z digest=sha256:ee754fca8a2711132cb0b0cda5037a094205a6cafc646a20dd3fb836cb435a98

Observation f250f1a5-a5dd-4351-b8e0-89b29314acf0 · outbound

This paper cites Xinyuan Wang, Yanchi Liu, Wei Cheng, Xujiang Zhao, Zhengzhang Chen, Wenchao Yu, Yanjie Fu, and Haifeng Chen.

PyroDash: Cost-Efficient Token-Level Small-Large Language Model Collaborative Inference Xinyuan Wang, Yanchi Liu, Wei Cheng, Xujiang Zhao, Zhengzhang Chen, Wenchao Yu, Yanjie Fu, and Haifeng Chen

Reference 2020

Resolution
unresolved
no resolver link, observed 2026-08-01T10:14:14.597267Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T10:14:14.597267Z digest=sha256:b90e2c4852cb7c2db0fbd71df1f2c080272c239385da7ab4742c88c41cdfdde2

Observation 0a404b17-ab33-40ef-b445-4eff6cb665a6 · outbound

This paper cites Collaborative Inference and Learning between Edge SLMs and Cloud LLMs: A Survey of Algorithms, Execution, and Open Challenges.

PyroDash: Cost-Efficient Token-Level Small-Large Language Model Collaborative Inference Collaborative Inference and Learning between Edge SLMs and Cloud LLMs: A Survey of Algorithms, Execution, and Open Challenges

Reference 2022

Resolution
unresolved
no resolver link, observed 2026-08-01T10:14:14.063270Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T10:14:14.063270Z digest=sha256:1157d2360b540e2f201ec6648bb770f92309d0b9fa3653a28e4748be4849b151

Observation 550fd14e-acad-4d3e-8dde-855233cb7ced · outbound

This paper cites GPTQ: Accurate Post-Training Quantization for Generative Pre-trained Transformers.

PyroDash: Cost-Efficient Token-Level Small-Large Language Model Collaborative Inference GPTQ: Accurate Post-Training Quantization for Generative Pre-trained Transformers

Reference 2023

Resolution
unresolved
no resolver link, observed 2026-08-01T10:14:13.211948Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T10:14:13.211948Z digest=sha256:1654c31a4f859d51d6f45b7c860e02977bc6aa4a92ba296e3aecd836a88db5a6

Observation 293ae174-3f07-4053-a5c8-0d0d8fdb048d · outbound

This paper cites On-Policy Distillation of Language Models: Learning from Self-Generated Mistakes.

PyroDash: Cost-Efficient Token-Level Small-Large Language Model Collaborative Inference On-Policy Distillation of Language Models: Learning from Self-Generated Mistakes

Reference 2024

Resolution
unresolved
no resolver link, observed 2026-08-01T10:14:12.501030Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T10:14:12.501030Z digest=sha256:33486301b81f2128df2e5689512c6389b16e13088ba2b88724f6af77ab6103af

Observation dc175f25-7347-46ce-9df0-4ad2217144d1 · outbound

This paper cites LLM Bandit: Cost-Efficient LLM Generation via Preference-Conditioned Dynamic Routing.

PyroDash: Cost-Efficient Token-Level Small-Large Language Model Collaborative Inference LLM Bandit: Cost-Efficient LLM Generation via Preference-Conditioned Dynamic Routing

Reference 2025

Resolution
unresolved
no resolver link, observed 2026-08-01T10:14:14.184268Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T10:14:14.184268Z digest=sha256:5c2c8eb94d1f2d105034c7eb29712cf79044aab9f395d2f49355e8a544f240e4

Observation 3a15f6de-1c3f-45dc-a32c-53193cb650e6 · outbound

This paper cites Network Edge Inference for Large Language Models: Principles, Techniques, and Opportunities.

PyroDash: Cost-Efficient Token-Level Small-Large Language Model Collaborative Inference Network Edge Inference for Large Language Models: Principles, Techniques, and Opportunities

Reference 2026

Resolution
unresolved
no resolver link, observed 2026-08-01T10:14:12.873655Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T10:14:12.873655Z digest=sha256:c0e0bedef7e066ee73ba70e96a08e41645674cba0adb46b63a5b7c7e66c93127

Pith citing papers

No inbound Pith citation observations are available.