{"as_of":"2026-08-18T21:34:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:164142ab2debf4d9afa9bae20cd9c37d9c480d473eb067b82a54c931f766ac8e","coverage":[{"denominator":12,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":12,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T14:12:09.330745Z","state":"measured"},{"denominator":13,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":13,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T06:04:17.621560Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-16T06:04:17.655039Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.15570","last_updated":"2025-01-26T15:56:56Z","snapshot_observed_at":"2026-08-18T15:06:07.119058Z","submitted_at":"2025-01-26T15:56:56Z","title":"ARWKV: Pretrain is not what we need, an RNN-Attention-Based Language Model Born from Transformer","version":1},"cited_work":{"arxiv_id":"2501.15570","doi":null,"metadata_source":"pith","pith_arxiv_id":"2501.15570","snapshot_observed_at":"2026-08-16T06:04:17.655039Z","title":"ARWKV: Pretrain is not what we need, an RNN-Attention-Based Language Model Born from Transformer","venue":"cs.CL","work_id":"992fadc3-4e0f-4e87-8eab-a0f0b00039ea","year":2025},"citing_paper":{"arxiv_id":"2504.19191","last_updated":"2025-04-27T10:48:56Z","snapshot_observed_at":"2026-08-16T05:57:01.806757Z","submitted_at":"2025-04-27T10:48:56Z","title":"WuNeng: Hybrid State with Attention","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-16T06:04:17.621560Z"},"links":{"cited_paper":"/paper/2501.15570","citing_paper":"/paper/2504.19191"},"observation_digest":"sha256:f997a8d39cea003bb13db0a7ed82b934bf8bc952fc1e74555d480f867a8f6a43","observation_id":"01396e12-3e86-4391-8b37-619868fd0920","resolution":{"observed_at":"2026-08-16T06:04:17.663113Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2501.15570/citation-record","integrity":"/paper/2501.15570/integrity","json":"/paper/2501.15570/citation-record.json","paper":"/paper/2501.15570"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2408.10189","last_updated":"2025-02-08T20:53:16Z","snapshot_observed_at":"2026-08-18T18:45:02.408021Z","submitted_at":"2024-08-19T17:48:11Z","title":"Transformers to SSMs: Distilling Quadratic Knowledge to Subquadratic Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.10189","snapshot_observed_at":"2026-08-10T14:12:09.274935Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.15570","last_updated":"2025-01-26T15:56:56Z","snapshot_observed_at":"2026-08-18T15:06:07.119058Z","submitted_at":"2025-01-26T15:56:56Z","title":"ARWKV: Pretrain is not what we need, an RNN-Attention-Based Language Model Born from Transformer","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T14:12:09.274935Z"},"links":{"cited_paper":"/paper/2408.10189","citing_paper":"/paper/2501.15570"},"observation_digest":"sha256:1d3748257396c61bb6a3383f9b60c26698252d88c24ab1f75a4e9826bc289c19","observation_id":"fd45bb74-2fdf-41ca-9b0c-e68ed34e2115","resolution":{"observed_at":"2026-08-10T14:12:09.274935Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.13676","last_updated":"2024-11-20T19:51:25Z","snapshot_observed_at":"2026-08-14T20:26:44.533985Z","submitted_at":"2024-11-20T19:51:25Z","title":"Hymba: A Hybrid-head Architecture for Small Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.13676","snapshot_observed_at":"2026-08-10T14:12:09.285754Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.15570","last_updated":"2025-01-26T15:56:56Z","snapshot_observed_at":"2026-08-18T15:06:07.119058Z","submitted_at":"2025-01-26T15:56:56Z","title":"ARWKV: Pretrain is not what we need, an RNN-Attention-Based Language Model Born from Transformer","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-10T14:12:09.285754Z"},"links":{"cited_paper":"/paper/2411.13676","citing_paper":"/paper/2501.15570"},"observation_digest":"sha256:27cc5cf3dba988691aedf404c2b20d49ebe176156366feb99927cca50623e78b","observation_id":"3cf72c39-56e3-4580-92ce-4b5fb40f27dd","resolution":{"observed_at":"2026-08-10T14:12:09.285754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.12537","last_updated":"2025-03-18T13:13:18Z","snapshot_observed_at":"2026-08-12T17:22:15.928064Z","submitted_at":"2024-11-19T14:35:38Z","title":"Unlocking State-Tracking in Linear RNNs Through Negative Eigenvalues","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.12537","snapshot_observed_at":"2026-08-10T14:12:09.290924Z","title":"Grazzi, J","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.15570","last_updated":"2025-01-26T15:56:56Z","snapshot_observed_at":"2026-08-18T15:06:07.119058Z","submitted_at":"2025-01-26T15:56:56Z","title":"ARWKV: Pretrain is not what we need, an RNN-Attention-Based Language Model Born from Transformer","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-10T14:12:09.290924Z"},"links":{"cited_paper":"/paper/2411.12537","citing_paper":"/paper/2501.15570"},"observation_digest":"sha256:0aae668341b7c7dfd313f7d054b0e71f6445ea7619170b693de885ee5c1a35a5","observation_id":"18d5dccf-1765-4ed5-81de-87a540fed9b1","resolution":{"observed_at":"2026-08-10T14:12:09.290924Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-15T12:33:55.451951Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-10T14:12:09.295989Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.15570","last_updated":"2025-01-26T15:56:56Z","snapshot_observed_at":"2026-08-18T15:06:07.119058Z","submitted_at":"2025-01-26T15:56:56Z","title":"ARWKV: Pretrain is not what we need, an RNN-Attention-Based Language Model Born from Transformer","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T14:12:09.295989Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2501.15570"},"observation_digest":"sha256:dfd5d61773b30949d86b527df7d6bcb1f0555dfe88bff8eda1e6bd6ef7017e48","observation_id":"78e15a5c-d049-4bb8-9e1a-f3d13f650b40","resolution":{"observed_at":"2026-08-10T14:12:09.295989Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.05892","last_updated":"2024-09-26T22:39:08Z","snapshot_observed_at":"2026-08-12T16:03:56.235250Z","submitted_at":"2024-04-08T22:20:59Z","title":"Eagle and Finch: RWKV with Matrix-Valued States and Dynamic Recurrence","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.05892","snapshot_observed_at":"2026-08-10T14:12:09.305901Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.15570","last_updated":"2025-01-26T15:56:56Z","snapshot_observed_at":"2026-08-18T15:06:07.119058Z","submitted_at":"2025-01-26T15:56:56Z","title":"ARWKV: Pretrain is not what we need, an RNN-Attention-Based Language Model Born from Transformer","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T14:12:09.305901Z"},"links":{"cited_paper":"/paper/2404.05892","citing_paper":"/paper/2501.15570"},"observation_digest":"sha256:fe107d9b3db7cb6d297127cc09139d3ed363dc89e7b983d4b6a204631d7276c6","observation_id":"24283ca9-3110-4d8f-8cd4-f7c4a5bee0f7","resolution":{"observed_at":"2026-08-10T14:12:09.305901Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09563","last_updated":"2024-12-12T18:48:51Z","snapshot_observed_at":"2026-08-16T06:23:05.548435Z","submitted_at":"2024-12-12T18:48:51Z","title":"Does Representation Matter? Exploring Intermediate Layers in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.09563","snapshot_observed_at":"2026-08-10T14:12:09.311351Z","title":"Skean, M","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.15570","last_updated":"2025-01-26T15:56:56Z","snapshot_observed_at":"2026-08-18T15:06:07.119058Z","submitted_at":"2025-01-26T15:56:56Z","title":"ARWKV: Pretrain is not what we need, an RNN-Attention-Based Language Model Born from Transformer","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T14:12:09.311351Z"},"links":{"cited_paper":"/paper/2412.09563","citing_paper":"/paper/2501.15570"},"observation_digest":"sha256:818813c17e4228d3d8b12ecadb328f8741563a14d5630bad51abc9d365c5b44f","observation_id":"f7266d44-4367-4cd9-a15a-43d57ceda7f9","resolution":{"observed_at":"2026-08-10T14:12:09.311351Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.15237","last_updated":"2025-06-27T07:54:57Z","snapshot_observed_at":"2026-08-16T13:23:25.041410Z","submitted_at":"2024-08-27T17:56:11Z","title":"The Mamba in the Llama: Distilling and Accelerating Hybrid Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.15237","snapshot_observed_at":"2026-08-10T14:12:09.316087Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.15570","last_updated":"2025-01-26T15:56:56Z","snapshot_observed_at":"2026-08-18T15:06:07.119058Z","submitted_at":"2025-01-26T15:56:56Z","title":"ARWKV: Pretrain is not what we need, an RNN-Attention-Based Language Model Born from Transformer","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T14:12:09.316087Z"},"links":{"cited_paper":"/paper/2408.15237","citing_paper":"/paper/2501.15570"},"observation_digest":"sha256:d57680742043d458cc9b9339e0f39743f083518a4722b8a8d4266281bbd24f47","observation_id":"e9e7356a-b58e-43ec-9070-b21da643d96d","resolution":{"observed_at":"2026-08-10T14:12:09.316087Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.13116","last_updated":"2024-10-21T16:22:33Z","snapshot_observed_at":"2026-08-10T17:26:33.432994Z","submitted_at":"2024-02-20T16:17:37Z","title":"A Survey on Knowledge Distillation of Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.13116","snapshot_observed_at":"2026-08-10T14:12:09.321052Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.15570","last_updated":"2025-01-26T15:56:56Z","snapshot_observed_at":"2026-08-18T15:06:07.119058Z","submitted_at":"2025-01-26T15:56:56Z","title":"ARWKV: Pretrain is not what we need, an RNN-Attention-Based Language Model Born from Transformer","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T14:12:09.321052Z"},"links":{"cited_paper":"/paper/2402.13116","citing_paper":"/paper/2501.15570"},"observation_digest":"sha256:9071acbb6f79a3de97e637518a4e9c2bde60a70484f93ae931e812fce2a6d9e7","observation_id":"dfdf35f7-d924-4c10-923a-abf2a84ecc06","resolution":{"observed_at":"2026-08-10T14:12:09.321052Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:12:09.518538Z","title":null,"venue":null,"work_id":"e365d276-a6ce-4f09-9853-521289ff4c30","year":null},"citing_paper":{"arxiv_id":"2501.15570","last_updated":"2025-01-26T15:56:56Z","snapshot_observed_at":"2026-08-18T15:06:07.119058Z","submitted_at":"2025-01-26T15:56:56Z","title":"ARWKV: Pretrain is not what we need, an RNN-Attention-Based Language Model Born from Transformer","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T14:12:09.330745Z"},"links":{"citing_paper":"/paper/2501.15570"},"observation_digest":"sha256:9628c88403674de7aa342104b3bd1ec086321b9896c5b1d975fc89b0890e1fce","observation_id":"1b88f967-2e68-46ea-b850-3de81b0e9cfd","resolution":{"observed_at":"2026-08-10T14:12:09.524148Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.08819","last_updated":"2025-03-05T23:00:57Z","snapshot_observed_at":"2026-08-16T14:01:18.649299Z","submitted_at":"2024-04-12T21:30:06Z","title":"The Illusion of State in State-Space Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.08819","snapshot_observed_at":"2026-08-10T14:12:09.300831Z","title":"Merrill, J","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.15570","last_updated":"2025-01-26T15:56:56Z","snapshot_observed_at":"2026-08-18T15:06:07.119058Z","submitted_at":"2025-01-26T15:56:56Z","title":"ARWKV: Pretrain is not what we need, an RNN-Attention-Based Language Model Born from Transformer","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-10T14:12:09.300831Z"},"links":{"cited_paper":"/paper/2404.08819","citing_paper":"/paper/2501.15570"},"observation_digest":"sha256:b738d7ff78dcc244c156f0a347b5f3bfdf968f1548382604a774e1186a39a83e","observation_id":"7d0bac67-8be8-45dc-b788-465f0ac245b9","resolution":{"observed_at":"2026-08-10T14:12:09.300831Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06484","last_updated":"2025-01-15T10:41:40Z","snapshot_observed_at":"2026-08-16T13:44:27.642787Z","submitted_at":"2024-06-10T17:24:42Z","title":"Parallelizing Linear Transformers with the Delta Rule over Sequence Length","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.06484","snapshot_observed_at":"2026-08-10T14:12:09.325861Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.15570","last_updated":"2025-01-26T15:56:56Z","snapshot_observed_at":"2026-08-18T15:06:07.119058Z","submitted_at":"2025-01-26T15:56:56Z","title":"ARWKV: Pretrain is not what we need, an RNN-Attention-Based Language Model Born from Transformer","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-10T14:12:09.325861Z"},"links":{"cited_paper":"/paper/2406.06484","citing_paper":"/paper/2501.15570"},"observation_digest":"sha256:803832a1c5d87642c6838c68f60569b07214364db25d474d691f0a8b5015629c","observation_id":"fe699a78-8f89-4648-b91c-69a777607587","resolution":{"observed_at":"2026-08-10T14:12:09.325861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:12:09.534618Z","title":"Castin, P","venue":null,"work_id":"e806c7ea-bcc2-45b5-b633-9994bde3d0c7","year":2024},"citing_paper":{"arxiv_id":"2501.15570","last_updated":"2025-01-26T15:56:56Z","snapshot_observed_at":"2026-08-18T15:06:07.119058Z","submitted_at":"2025-01-26T15:56:56Z","title":"ARWKV: Pretrain is not what we need, an RNN-Attention-Based Language Model Born from Transformer","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-10T14:12:09.280969Z"},"links":{"citing_paper":"/paper/2501.15570"},"observation_digest":"sha256:66a8b000bf6087dcfe14ec256806ece307f8b791e110e99a503868d7938f4b53","observation_id":"78a674c9-4d27-41dd-8a16-d7a1c867bfe3","resolution":{"observed_at":"2026-08-10T14:12:09.539210Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2501.15570","last_updated":"2025-01-26T15:56:56Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-18T15:06:07.119058Z","submitted_at":"2025-01-26T15:56:56Z","title":"ARWKV: Pretrain is not what we need, an RNN-Attention-Based Language Model Born from Transformer"},"reference_resolution":{"displayed":12,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":11,"verified_exact":0,"verified_fuzzy":1},"total_outbound_references":12},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 12 of 12 outbound references and 1 inbound Pith citation observation for arXiv:2501.15570."}