Pith. sign in

Paper Citation Record · LEDGER

Local-Splitter: A Measurement Study of Seven Tactics for Reducing Cloud LLM Token Usage on Coding-Agent Workloads

As of 6 August 2026, this Paper Citation Record lists 24 of 24 outbound references and 1 inbound Pith citation observation for arXiv:2604.12301.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2604.12301 v1

Coverage vector

measured 24 of 24 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-05-10T15:29:36.610491Z

measured 25 of 25 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-06T06:34:29.942622+00:00

measured 1 of 1 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-07-12T05:14:41.315225Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: cited_works

Reference resolution

24 of 24 outbound references displayed

  • verified exact9
  • verified fuzzy12
  • unresolved0
  • parse uncertain0
  • malformed identifier1
  • metadata mismatch2

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation dcb36fcd-88bf-4f8c-9349-98a38ceae22a · outbound

This paper cites Phi-3 Technical Report: A Highly Capable Language Model Locally on Your Phone.

Local-Splitter: A Measurement Study of Seven Tactics for Reducing Cloud LLM Token Usage on Coding-Agent Workloads Phi-3 Technical Report: A Highly Capable Language Model Locally on Your Phone

Reference 1

Resolution
verified exact
local_arxiv, observed 2026-05-11T10:26:01.815954Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-05-10T15:29:36.610491Z digest=sha256:e0bced863f4608e08f3619c49fd287e67fcb10930852dc5c86a8128784ae5d52

Observation 356e53bb-114d-4a33-8461-593375aef084 · outbound

This paper cites Prompt caching with Claude.

Local-Splitter: A Measurement Study of Seven Tactics for Reducing Cloud LLM Token Usage on Coding-Agent Workloads Prompt caching with Claude

Reference 2

Resolution
verified fuzzy
raw_fallback, observed 2026-05-17T23:22:14.376381Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-05-10T15:29:36.610491Z digest=sha256:27ca8abab811fc985acb87315124ecd776fc64998b44d06fa684225cb9365728

Observation 8862d6fc-3b64-491e-bc66-a5a933206425 · outbound

This paper cites Model context protocol specification.

Local-Splitter: A Measurement Study of Seven Tactics for Reducing Cloud LLM Token Usage on Coding-Agent Workloads Model context protocol specification

Reference 3

Resolution
verified fuzzy
raw_fallback, observed 2026-05-17T23:22:14.343062Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-05-10T15:29:36.610491Z digest=sha256:7ed38b5da51b30267a909ab0647733f0f4341aed51550d45b9cf04bd2a0937cf

Observation 4f03e472-b328-47d4-8d00-4120b95a7337 · outbound

This paper cites LongBench: A bilingual, multitask benchmark for long context understanding.

Local-Splitter: A Measurement Study of Seven Tactics for Reducing Cloud LLM Token Usage on Coding-Agent Workloads LongBench: A bilingual, multitask benchmark for long context understanding

Reference 4

Resolution
verified fuzzy
raw_fallback, observed 2026-05-17T23:22:14.350061Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-05-10T15:29:36.610491Z digest=sha256:0ecc20df3fd4b0a01359aa58ca854e1da1a3c65f9d8bfc4d4c76b7086b97f581

Observation 83f38bb9-3509-429d-a940-c7fb04edf6ed · outbound

This paper cites GPTCache: An open-source semantic cache for LLM applications enabling faster answers and cost savings.

Local-Splitter: A Measurement Study of Seven Tactics for Reducing Cloud LLM Token Usage on Coding-Agent Workloads GPTCache: An open-source semantic cache for LLM applications enabling faster answers and cost savings

Reference 5

Resolution
verified exact
doi, observed 2026-05-10T15:30:32.436098Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-05-10T15:29:36.610491Z digest=sha256:b45d908356b62ad50155d1fe905b4c1f8ba3077d476d7436e3ad82eaf70c9f6e

Observation 30ee5364-978c-40da-95eb-15874edea48d · outbound

This paper cites Lee, Deming Chen, and Tri Dao.

Local-Splitter: A Measurement Study of Seven Tactics for Reducing Cloud LLM Token Usage on Coding-Agent Workloads Lee, Deming Chen, and Tri Dao

Reference 6

Resolution
verified fuzzy
raw_fallback, observed 2026-05-17T23:22:14.373560Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-05-10T15:29:36.610491Z digest=sha256:cb6ea6c6189579d1097b170c2cd549e3f036f2873dc4f569a6505c808f7d0dd2

Observation 972bd370-8d43-49fa-97de-235fce4148cb · outbound

This paper cites FrugalGPT: How to use large language models while reducing cost and improving performance.Transactions on Machine Learning Research.

Local-Splitter: A Measurement Study of Seven Tactics for Reducing Cloud LLM Token Usage on Coding-Agent Workloads FrugalGPT: How to use large language models while reducing cost and improving performance.Transactions on Machine Learning Research

Reference 7

Resolution
verified fuzzy
raw_fallback, observed 2026-05-17T23:22:14.363753Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-05-10T15:29:36.610491Z digest=sha256:722a286900ce93fc12ebddd0f800c3bc5d0fcef5b88e228064567f7c05ac7303

Observation c96bbce6-4324-4413-8cf3-1be9bbf4d288 · outbound

This paper cites FrugalGPT: How to Use Large Language Models While Reducing Cost and Improving Performance.

Local-Splitter: A Measurement Study of Seven Tactics for Reducing Cloud LLM Token Usage on Coding-Agent Workloads FrugalGPT: How to Use Large Language Models While Reducing Cost and Improving Performance

Reference 8

Resolution
verified exact
arxiv_id, observed 2026-05-11T19:56:45.568475Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-05-10T15:29:36.610491Z digest=sha256:48bebcf385fbc59d26ca057f56dc24ff8ae5eac3be5af8a37b271575a60d7c1a

Observation 1afc6054-208e-4d7d-ae9f-7584c496d4a0 · outbound

This paper cites Gemma: Open Models Based on Gemini Research and Technology.

Local-Splitter: A Measurement Study of Seven Tactics for Reducing Cloud LLM Token Usage on Coding-Agent Workloads Gemma: Open Models Based on Gemini Research and Technology

Reference 9

Resolution
verified exact
local_arxiv, observed 2026-05-11T10:26:01.811647Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-05-10T15:29:36.610491Z digest=sha256:466fdb461a72b4bc0c779d8f1896b2f082816f61db7ad6930421149991dfcb55

Observation 9f86ba6f-52f6-4b8a-943c-59307cf49861 · outbound

This paper cites The Llama 3 Herd of Models.

Local-Splitter: A Measurement Study of Seven Tactics for Reducing Cloud LLM Token Usage on Coding-Agent Workloads The Llama 3 Herd of Models

Reference 10

Resolution
verified exact
local_arxiv, observed 2026-05-11T10:26:01.764284Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-05-10T15:29:36.610491Z digest=sha256:ce7fa061d619774d5969c76d01c09bb0bc81443f373fd32b05d8c402d8bf2942

Observation 7587500b-1108-4ddf-af3a-e3e104fad664 · outbound

This paper cites LLMLingua: Com- pressing prompts for accelerated inference of large language models.

Local-Splitter: A Measurement Study of Seven Tactics for Reducing Cloud LLM Token Usage on Coding-Agent Workloads LLMLingua: Com- pressing prompts for accelerated inference of large language models

Reference 11

Resolution
verified exact
doi, observed 2026-05-10T15:30:32.438379Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-05-10T15:29:36.610491Z digest=sha256:8184a20accab41b30434834befcaa21d1c3aaf8fa902765b68af5e70a464df20

Observation 8cca1ce9-1868-4b7e-8533-448adab09c79 · outbound

This paper cites Jimenez, John Yang, Alexander Wettig, Shunyu Yao, Kexin Pei, Ofir Press, and Karthik R.

Local-Splitter: A Measurement Study of Seven Tactics for Reducing Cloud LLM Token Usage on Coding-Agent Workloads Jimenez, John Yang, Alexander Wettig, Shunyu Yao, Kexin Pei, Ofir Press, and Karthik R

Reference 12

Resolution
verified fuzzy
raw_fallback, observed 2026-05-17T23:22:14.370702Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-05-10T15:29:36.610491Z digest=sha256:ee5e49410771681c2cf2e1636a064d0301ca89cfdee28512d9841524b1b6ed45

Observation a850a32a-c7be-4ad1-bdd2-aa197ea472fb · outbound

This paper cites Fast inference from transformers via speculative decoding.

Local-Splitter: A Measurement Study of Seven Tactics for Reducing Cloud LLM Token Usage on Coding-Agent Workloads Fast inference from transformers via speculative decoding

Reference 13

Resolution
verified fuzzy
raw_fallback, observed 2026-05-17T23:22:14.335881Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-05-10T15:29:36.610491Z digest=sha256:71c23865da8a2bc6e286d4405e9e905cc1006f0bb0d3259314e967416953d5c2

Observation 29f15dab-1af0-462c-b820-66479b6988c3 · outbound

This paper cites Retrieval-augmented generation for knowledge-intensive NLP tasks.

Local-Splitter: A Measurement Study of Seven Tactics for Reducing Cloud LLM Token Usage on Coding-Agent Workloads Retrieval-augmented generation for knowledge-intensive NLP tasks

Reference 14

Resolution
verified fuzzy
raw_fallback, observed 2026-05-17T23:22:14.353363Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-05-10T15:29:36.610491Z digest=sha256:bdf406048bb51a277d5fc396c61c47dfdfe1c417a4aeb447971df986228d9e0b

Observation aa709e96-19b6-459a-b076-09cd16aed5e1 · outbound

This paper cites Large Language Model-Based Agents for Software Engineering: A Survey.

Local-Splitter: A Measurement Study of Seven Tactics for Reducing Cloud LLM Token Usage on Coding-Agent Workloads Large Language Model-Based Agents for Software Engineering: A Survey

Reference 15

Resolution
verified exact
arxiv_id, observed 2026-05-17T12:35:49.024248Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-05-10T15:29:36.610491Z digest=sha256:081c63e03541eac3206f0bb6c7bc0fd8439c43cc425920735af77f54ddb17397

Observation fda3e460-b468-4d0a-b8f4-abe6a7ab3b69 · outbound

This paper cites Small Language Models: Survey, Measurements, and Insights.

Local-Splitter: A Measurement Study of Seven Tactics for Reducing Cloud LLM Token Usage on Coding-Agent Workloads Small Language Models: Survey, Measurements, and Insights

Reference 16

Resolution
metadata mismatch
arxiv_id, observed 2026-05-11T10:26:01.780655Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-05-10T15:29:36.610491Z digest=sha256:d51d5f7b563269249df4259b2e577206ed365fabc863733859e5220ce09b3bfe

Observation 984fa1eb-ce55-47d3-aada-3a175e816e2b · outbound

This paper cites Ollama: Get up and running with large language models locally.

Local-Splitter: A Measurement Study of Seven Tactics for Reducing Cloud LLM Token Usage on Coding-Agent Workloads Ollama: Get up and running with large language models locally

Reference 17

Resolution
verified fuzzy
raw_fallback, observed 2026-05-17T23:22:14.356704Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-05-10T15:29:36.610491Z digest=sha256:5c9c2ae12fb5f352eaf57af3c01457f84d09e55836fc85be941737559ddf848f

Observation 019e1d40-c81d-471d-9520-e1c42cf61e2d · outbound

This paper cites RouteLLM: Learning to Route LLMs with Preference Data.

Local-Splitter: A Measurement Study of Seven Tactics for Reducing Cloud LLM Token Usage on Coding-Agent Workloads RouteLLM: Learning to Route LLMs with Preference Data

Reference 18

Resolution
verified exact
arxiv_id, observed 2026-05-11T23:27:40.993552Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-05-10T15:29:36.610491Z digest=sha256:f65b54e3164fa6a703426f956b995473bb450c33f0bd373a0618f3da99847ea4

Observation 4b397e49-6698-4093-8187-41235307d4d4 · outbound

This paper cites Prompt caching in the API.

Local-Splitter: A Measurement Study of Seven Tactics for Reducing Cloud LLM Token Usage on Coding-Agent Workloads Prompt caching in the API

Reference 19

Resolution
verified fuzzy
raw_fallback, observed 2026-05-17T23:22:14.359698Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-05-10T15:29:36.610491Z digest=sha256:3db5f428910c7140030ddebaa1398ac679c011da5ad58b07f63560759e596481

Observation 6d3d14a4-c924-4bcf-88b3-4f48dae1e55c · outbound

This paper cites Vicky Zhao, Lili Qiu, and Dongmei Zhang.

Local-Splitter: A Measurement Study of Seven Tactics for Reducing Cloud LLM Token Usage on Coding-Agent Workloads Vicky Zhao, Lili Qiu, and Dongmei Zhang

Reference 20

Resolution
verified fuzzy
raw_fallback, observed 2026-05-17T23:22:14.367377Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-05-10T15:29:36.610491Z digest=sha256:cf1b3067b765d71235d25ccfc299d94e7539dc1a8d1cbd8bd83a74864f606854

Observation 3003816e-9886-43ac-94ee-e4ddd2fce904 · outbound

This paper cites Qwen2.5 Technical Report.

Local-Splitter: A Measurement Study of Seven Tactics for Reducing Cloud LLM Token Usage on Coding-Agent Workloads Qwen2.5 Technical Report

Reference 21

Resolution
verified exact
local_arxiv, observed 2026-05-11T10:26:01.760000Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-05-10T15:29:36.610491Z digest=sha256:df382572d39385b8b4ea918147d266f369cc3780afd3209453f5d57617be808f

Observation 1763e294-50f1-4fcd-86ab-444a0b459e82 · outbound

This paper cites Sentence-BERT: Sentence embeddings using siamese BERT- networks.

Local-Splitter: A Measurement Study of Seven Tactics for Reducing Cloud LLM Token Usage on Coding-Agent Workloads Sentence-BERT: Sentence embeddings using siamese BERT- networks

Reference 22

Resolution
malformed identifier
raw_fallback, observed 2026-05-17T23:22:14.339772Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-05-10T15:29:36.610491Z digest=sha256:e9f189357b1069a30eb695cacf9ea23fb37b475080ee24edc956f8e001e91300

Observation 0da7e975-147b-42f8-8a0e-deaa309cb627 · outbound

This paper cites Efficient Guided Generation for Large Language Models.

Local-Splitter: A Measurement Study of Seven Tactics for Reducing Cloud LLM Token Usage on Coding-Agent Workloads Efficient Guided Generation for Large Language Models

Reference 23

Resolution
metadata mismatch
arxiv_id, observed 2026-05-13T15:07:13.961671Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-05-10T15:29:36.610491Z digest=sha256:6e3f3897dcd48d21f51c1febb7c3c69666303c67ec69bce47f3d9f6d4ed3bddd

Observation 0120b1c7-6ea1-478a-bf51-182ebc17cbdb · outbound

This paper cites Xing, Hao Zhang, Joseph E.

Local-Splitter: A Measurement Study of Seven Tactics for Reducing Cloud LLM Token Usage on Coding-Agent Workloads Xing, Hao Zhang, Joseph E

Reference 24

Resolution
verified fuzzy
raw_fallback, observed 2026-05-17T23:22:14.346565Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-05-10T15:29:36.610491Z digest=sha256:4d981f15a6686d4ec24f5260665907d5ffcf3b3fe6045d2e3ade8f2ce5f50676

Pith citing papers

Observation 5a5b3af6-60d5-48f3-8d56-c485a1573f83 · inbound

Compression, structure, and executor capability: a controlled real-cost decomposition of language-model agent skill optimisation cites this paper.

Compression, structure, and executor capability: a controlled real-cost decomposition of language-model agent skill optimisation Local-Splitter: A Measurement Study of Seven Tactics for Reducing Cloud LLM Token Usage on Coding-Agent Workloads

Reference 16

Resolution
unresolved
no resolver link, observed 2026-07-12T05:14:41.315225Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-12T05:14:41.315225Z digest=sha256:7e1efd4b996fe932454372d2f913243ff7a64f8d8dc04739d8234858b44ec7ad