Pith. sign in

Paper Citation Record · LEDGER

ARWKV: Pretrain is not what we need, an RNN-Attention-Based Language Model Born from Transformer

As of 18 August 2026, this Paper Citation Record lists 12 of 12 outbound references and 1 inbound Pith citation observation for arXiv:2501.15570.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2501.15570 v1

Coverage vector

measured 12 of 12 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-10T14:12:09.330745Z

measured 13 of 13 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-18T06:34:40.430872+00:00

measured 1 of 1 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-08-16T06:04:17.621560Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: pith, observed 2026-08-16T06:04:17.655039Z

Reference resolution

12 of 12 outbound references displayed

  • verified exact0
  • verified fuzzy1
  • unresolved11
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation fd45bb74-2fdf-41ca-9b0c-e68ed34e2115 · outbound

This paper cites Transformers to SSMs: Distilling Quadratic Knowledge to Subquadratic Models.

ARWKV: Pretrain is not what we need, an RNN-Attention-Based Language Model Born from Transformer Transformers to SSMs: Distilling Quadratic Knowledge to Subquadratic Models

Reference 1

Resolution
unresolved
no resolver link, observed 2026-08-10T14:12:09.274935Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T14:12:09.274935Z digest=sha256:1d3748257396c61bb6a3383f9b60c26698252d88c24ab1f75a4e9826bc289c19

Observation 3cf72c39-56e3-4580-92ce-4b5fb40f27dd · outbound

This paper cites Hymba: A Hybrid-head Architecture for Small Language Models.

ARWKV: Pretrain is not what we need, an RNN-Attention-Based Language Model Born from Transformer Hymba: A Hybrid-head Architecture for Small Language Models

Reference 3

Resolution
unresolved
no resolver link, observed 2026-08-10T14:12:09.285754Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T14:12:09.285754Z digest=sha256:27cc5cf3dba988691aedf404c2b20d49ebe176156366feb99927cca50623e78b

Observation 18d5dccf-1765-4ed5-81de-87a540fed9b1 · outbound

This paper cites Unlocking State-Tracking in Linear RNNs Through Negative Eigenvalues.

ARWKV: Pretrain is not what we need, an RNN-Attention-Based Language Model Born from Transformer Unlocking State-Tracking in Linear RNNs Through Negative Eigenvalues

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-10T14:12:09.290924Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T14:12:09.290924Z digest=sha256:0aae668341b7c7dfd313f7d054b0e71f6445ea7619170b693de885ee5c1a35a5

Observation 78e15a5c-d049-4bb8-9e1a-f3d13f650b40 · outbound

This paper cites DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning.

ARWKV: Pretrain is not what we need, an RNN-Attention-Based Language Model Born from Transformer DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning

Reference 5

Resolution
unresolved
no resolver link, observed 2026-08-10T14:12:09.295989Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T14:12:09.295989Z digest=sha256:dfd5d61773b30949d86b527df7d6bcb1f0555dfe88bff8eda1e6bd6ef7017e48

Observation 24283ca9-3110-4d8f-8cd4-f7c4a5bee0f7 · outbound

This paper cites Eagle and Finch: RWKV with Matrix-Valued States and Dynamic Recurrence.

ARWKV: Pretrain is not what we need, an RNN-Attention-Based Language Model Born from Transformer Eagle and Finch: RWKV with Matrix-Valued States and Dynamic Recurrence

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-10T14:12:09.305901Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T14:12:09.305901Z digest=sha256:fe107d9b3db7cb6d297127cc09139d3ed363dc89e7b983d4b6a204631d7276c6

Observation f7266d44-4367-4cd9-a15a-43d57ceda7f9 · outbound

This paper cites Does Representation Matter? Exploring Intermediate Layers in Large Language Models.

ARWKV: Pretrain is not what we need, an RNN-Attention-Based Language Model Born from Transformer Does Representation Matter? Exploring Intermediate Layers in Large Language Models

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-10T14:12:09.311351Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T14:12:09.311351Z digest=sha256:818813c17e4228d3d8b12ecadb328f8741563a14d5630bad51abc9d365c5b44f

Observation e9e7356a-b58e-43ec-9070-b21da643d96d · outbound

This paper cites The Mamba in the Llama: Distilling and Accelerating Hybrid Models.

ARWKV: Pretrain is not what we need, an RNN-Attention-Based Language Model Born from Transformer The Mamba in the Llama: Distilling and Accelerating Hybrid Models

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-10T14:12:09.316087Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T14:12:09.316087Z digest=sha256:d57680742043d458cc9b9339e0f39743f083518a4722b8a8d4266281bbd24f47

Observation dfdf35f7-d924-4c10-923a-abf2a84ecc06 · outbound

This paper cites A Survey on Knowledge Distillation of Large Language Models.

ARWKV: Pretrain is not what we need, an RNN-Attention-Based Language Model Born from Transformer A Survey on Knowledge Distillation of Large Language Models

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-10T14:12:09.321052Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T14:12:09.321052Z digest=sha256:9071acbb6f79a3de97e637518a4e9c2bde60a70484f93ae931e812fce2a6d9e7

Observation 1b88f967-2e68-46ea-b850-3de81b0e9cfd · outbound

This paper cites an unresolved cited work.

ARWKV: Pretrain is not what we need, an RNN-Attention-Based Language Model Born from Transformer Unresolved cited work

Reference 12

Resolution
unresolved
raw_fallback, observed 2026-08-10T14:12:09.524148Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-10T14:12:09.330745Z digest=sha256:9628c88403674de7aa342104b3bd1ec086321b9896c5b1d975fc89b0890e1fce

Observation 7d0bac67-8be8-45dc-b788-465f0ac245b9 · outbound

This paper cites The Illusion of State in State-Space Models.

ARWKV: Pretrain is not what we need, an RNN-Attention-Based Language Model Born from Transformer The Illusion of State in State-Space Models

Reference 2021

Resolution
unresolved
no resolver link, observed 2026-08-10T14:12:09.300831Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T14:12:09.300831Z digest=sha256:b738d7ff78dcc244c156f0a347b5f3bfdf968f1548382604a774e1186a39a83e

Observation fe699a78-8f89-4648-b91c-69a777607587 · outbound

This paper cites Parallelizing Linear Transformers with the Delta Rule over Sequence Length.

ARWKV: Pretrain is not what we need, an RNN-Attention-Based Language Model Born from Transformer Parallelizing Linear Transformers with the Delta Rule over Sequence Length

Reference 2023

Resolution
unresolved
no resolver link, observed 2026-08-10T14:12:09.325861Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T14:12:09.325861Z digest=sha256:803832a1c5d87642c6838c68f60569b07214364db25d474d691f0a8b5015629c

Observation 78a674c9-4d27-41dd-8a16-d7a1c867bfe3 · outbound

This paper cites Castin, P.

ARWKV: Pretrain is not what we need, an RNN-Attention-Based Language Model Born from Transformer Castin, P

Reference 2024

Resolution
verified fuzzy
raw_fallback, observed 2026-08-10T14:12:09.539210Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-10T14:12:09.280969Z digest=sha256:66a8b000bf6087dcfe14ec256806ece307f8b791e110e99a503868d7938f4b53

Pith citing papers

Observation 01396e12-3e86-4391-8b37-619868fd0920 · inbound

WuNeng: Hybrid State with Attention cites this paper.

WuNeng: Hybrid State with Attention ARWKV: Pretrain is not what we need, an RNN-Attention-Based Language Model Born from Transformer

Reference 17

Resolution
verified exact
local_arxiv, observed 2026-08-16T06:04:17.663113Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-16T06:04:17.621560Z digest=sha256:f997a8d39cea003bb13db0a7ed82b934bf8bc952fc1e74555d480f867a8f6a43