Pith. sign in

Paper Citation Record · LEDGER

Smarter and Cheaper at Once: Byte-Exact KV-Cache Grafting Turns a Frozen Small Model into a Verified-Knowledge Flywheel

As of 9 August 2026, this Paper Citation Record lists 9 of 9 outbound references and 0 inbound Pith citation observations for arXiv:2607.14431.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2607.14431 v1

Coverage vector

measured 9 of 9 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-02T02:10:50.027276Z

measured 9 of 9 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-09T06:31:02.800959+00:00

measured 0 of 0 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: cited_works

Reference resolution

9 of 9 outbound references displayed

  • verified exact0
  • verified fuzzy0
  • unresolved9
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation dcc0f714-5a6a-48f1-8a67-3630cf0085b9 · outbound

This paper cites CacheGen: KV Cache Compression and Streaming for Fast Large Language Model Serving.

Smarter and Cheaper at Once: Byte-Exact KV-Cache Grafting Turns a Frozen Small Model into a Verified-Knowledge Flywheel CacheGen: KV Cache Compression and Streaming for Fast Large Language Model Serving

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-02T02:10:49.534551Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T02:10:49.534551Z digest=sha256:47b782492a18e6b8107375dad0cc90ce6930625323f4b320903901dba4e42c88

Observation c9ca5997-fc7b-41b6-8a17-a805ad298c9b · outbound

This paper cites Self-Consistency Improves Chain of Thought Reasoning in Language Models.

Smarter and Cheaper at Once: Byte-Exact KV-Cache Grafting Turns a Frozen Small Model into a Verified-Knowledge Flywheel Self-Consistency Improves Chain of Thought Reasoning in Language Models

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-02T02:10:49.822456Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T02:10:49.822456Z digest=sha256:67472593834af1b66e592f4f59653158731fb630230db8f1f951984d8e387e0d

Observation e25a3900-d4c9-4931-848e-d733724b97b2 · outbound

This paper cites CacheBlend: Fast Large Language Model Serving for RAG with Cached Knowledge Fusion.

Smarter and Cheaper at Once: Byte-Exact KV-Cache Grafting Turns a Frozen Small Model into a Verified-Knowledge Flywheel CacheBlend: Fast Large Language Model Serving for RAG with Cached Knowledge Fusion

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-02T02:10:49.918894Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T02:10:49.918894Z digest=sha256:f8a370457f890d2c75c5411d75d9e11cc747abf541c48bb5438b60adfa5c911d

Observation 07fac811-4fb5-4a0f-974c-5002f3296a5c · outbound

This paper cites SGLang: Efficient Execution of Structured Language Model Programs.

Smarter and Cheaper at Once: Byte-Exact KV-Cache Grafting Turns a Frozen Small Model into a Verified-Knowledge Flywheel SGLang: Efficient Execution of Structured Language Model Programs

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-02T02:10:50.027276Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T02:10:50.027276Z digest=sha256:bb3d4e41bfa3ce37dbaa25d4066ba53c174359da64840831daeff1bd4fe443fd

Observation 2fd66561-b457-4214-926e-88c6a9ab89a0 · outbound

This paper cites Energy and Policy Considerations for Deep Learning in NLP.

Smarter and Cheaper at Once: Byte-Exact KV-Cache Grafting Turns a Frozen Small Model into a Verified-Knowledge Flywheel Energy and Policy Considerations for Deep Learning in NLP

Reference 2021

Resolution
unresolved
no resolver link, observed 2026-08-02T02:10:49.709223Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T02:10:49.709223Z digest=sha256:601bd407225b74150e92bdde716df5bbc6d1e194b6359e9732e94c3ce3400449

Observation 156c3498-366a-4eb3-8ae2-12a5cb9308ce · outbound

This paper cites Efficient Memory Management for Large Language Model Serving with PagedAttention.

Smarter and Cheaper at Once: Byte-Exact KV-Cache Grafting Turns a Frozen Small Model into a Verified-Knowledge Flywheel Efficient Memory Management for Large Language Model Serving with PagedAttention

Reference 2023

Resolution
unresolved
no resolver link, observed 2026-08-02T02:10:49.471962Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T02:10:49.471962Z digest=sha256:88dede349c9e6164e3325efe95b852c52acb2909b3ba4aba072c6f534859d3be

Observation a13ebabe-ba70-4929-aba6-63c486ffc31a · outbound

This paper cites Prompt Cache: Modular Attention Reuse for Low-Latency Inference.

Smarter and Cheaper at Once: Byte-Exact KV-Cache Grafting Turns a Frozen Small Model into a Verified-Knowledge Flywheel Prompt Cache: Modular Attention Reuse for Low-Latency Inference

Reference 2024

Resolution
unresolved
no resolver link, observed 2026-08-02T02:10:49.354541Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T02:10:49.354541Z digest=sha256:63553cc7d1be9cc8fcc6ad602355c5b86fa0e90002e4ae0cbcfb186d9db4da88

Observation 0d19c8ef-1365-4605-88ae-b3ed6e986b9f · outbound

This paper cites Merlin: Deterministic Byte-Exact Deduplication for Lossless Context Optimization in Large Language Model Inference.

Smarter and Cheaper at Once: Byte-Exact KV-Cache Grafting Turns a Frozen Small Model into a Verified-Knowledge Flywheel Merlin: Deterministic Byte-Exact Deduplication for Lossless Context Optimization in Large Language Model Inference

Reference 2025

Resolution
unresolved
no resolver link, observed 2026-08-02T02:10:49.607668Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T02:10:49.607668Z digest=sha256:8903824ea22da1c120d0a141997a97b08670633e97583a24a6cd4d14cc4e2c16

Observation cfbb21ea-747d-40fe-ae00-09e9c6d68dde · outbound

This paper cites Functional Cache Grafting: Robust and Rapid Code-Policy Synthesis for Embodied Agents.

Smarter and Cheaper at Once: Byte-Exact KV-Cache Grafting Turns a Frozen Small Model into a Verified-Knowledge Flywheel Functional Cache Grafting: Robust and Rapid Code-Policy Synthesis for Embodied Agents

Reference 2026

Resolution
unresolved
no resolver link, observed 2026-08-02T02:10:49.265127Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T02:10:49.265127Z digest=sha256:4700ecc2d45366e70d34d0d74e716ecfc357588cc37644eec0d59082e0c9b498

Pith citing papers

No inbound Pith citation observations are available.