{"as_of":"2026-08-09T01:09:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:07bed8b665176115e5c08405adfa1f392a7c69595bdc144e8a9868fe2938e72a","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":31,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":31,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":31,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":31,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T13:46:11.411181Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"pith","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":1,"observed_at":"2026-08-05T02:28:24.338817Z","source":"pith"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2401.06104","last_updated":"2024-06-18T09:16:14Z","snapshot_observed_at":"2026-08-07T11:50:21.011836Z","submitted_at":"2024-01-11T18:35:26Z","title":"Transformers are Multi-State RNNs","version":2},"cited_work":{"arxiv_id":"2401.06104","doi":"10.48550/arxiv.2401.06104","metadata_source":"pith","pith_arxiv_id":"2401.06104","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Transformers are multi-state rnns.arXiv preprint arXiv:2401.06104","venue":"cs.CL","work_id":"08b2eb3d-8a1b-454d-8785-7d3f2918642e","year":2024},"citing_paper":{"arxiv_id":"2312.06635","last_updated":"2024-08-27T01:27:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-11T18:51:59Z","title":"Gated Linear Attention Transformers with Hardware-Efficient Training","version":6},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-05-15T01:15:13.991219Z"},"links":{"cited_paper":"/paper/2401.06104","citing_paper":"/paper/2312.06635"},"observation_digest":"sha256:e172b145d786746646516a57148b4321cbece9d052a6cbe4074e8fda977d9f62","observation_id":"eb1af497-7763-481c-b9cc-695444dde576","resolution":{"observed_at":"2026-05-15T01:15:14.156799Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06104","last_updated":"2024-06-18T09:16:14Z","snapshot_observed_at":"2026-08-07T11:50:21.011836Z","submitted_at":"2024-01-11T18:35:26Z","title":"Transformers are Multi-State RNNs","version":2},"cited_work":{"arxiv_id":"2401.06104","doi":"10.48550/arxiv.2401.06104","metadata_source":"pith","pith_arxiv_id":"2401.06104","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Transformers are multi-state rnns.arXiv preprint arXiv:2401.06104","venue":"cs.CL","work_id":"08b2eb3d-8a1b-454d-8785-7d3f2918642e","year":2024},"citing_paper":{"arxiv_id":"2406.10774","last_updated":"2024-08-26T21:01:02Z","snapshot_observed_at":"2026-07-06T18:31:36.504766Z","submitted_at":"2024-06-16T01:33:02Z","title":"Quest: Query-Aware Sparsity for Efficient Long-Context LLM Inference","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-05-15T14:12:20.809594Z"},"links":{"cited_paper":"/paper/2401.06104","citing_paper":"/paper/2406.10774"},"observation_digest":"sha256:f7286fb1e4e05dbf8932381d8a1c1f9d4b9af4ff2600c5c3af19b3dcef4a380c","observation_id":"7b21014a-8b4f-447a-a90c-9c9e34f39312","resolution":{"observed_at":"2026-05-15T14:12:20.906064Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06104","last_updated":"2024-06-18T09:16:14Z","snapshot_observed_at":"2026-08-07T11:50:21.011836Z","submitted_at":"2024-01-11T18:35:26Z","title":"Transformers are Multi-State RNNs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.06104","snapshot_observed_at":"2026-08-07T23:19:37.902581Z","title":"Transformers are Multi - State RNNs , June 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08910","last_updated":"2025-02-13T02:52:01Z","snapshot_observed_at":"2026-08-07T23:12:54.397262Z","submitted_at":"2025-02-13T02:52:01Z","title":"InfiniteHiP: Extending Language Model Context Up to 3 Million Tokens on a Single GPU","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T23:19:37.902581Z"},"links":{"cited_paper":"/paper/2401.06104","citing_paper":"/paper/2502.08910"},"observation_digest":"sha256:6b9c429ffd6cadca801ddc7e7e166969bddd21b8ba491365be8a1c8b8832e19a","observation_id":"92e6b6c2-8183-4301-8eab-e3804da67195","resolution":{"observed_at":"2026-08-07T23:19:37.902581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06104","last_updated":"2024-06-18T09:16:14Z","snapshot_observed_at":"2026-08-07T11:50:21.011836Z","submitted_at":"2024-01-11T18:35:26Z","title":"Transformers are Multi-State RNNs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.06104","snapshot_observed_at":"2026-08-08T13:46:11.411181Z","title":"Transformers are multi-state rnns.arXiv preprint arXiv:2401.06104,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.09647","last_updated":"2025-03-05T16:14:16Z","snapshot_observed_at":"2026-08-08T13:40:02.070804Z","submitted_at":"2025-02-11T00:04:32Z","title":"Unveiling Simplicities of Attention: Adaptive Long-Context Head Identification","version":2},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-08T13:46:11.411181Z"},"links":{"cited_paper":"/paper/2401.06104","citing_paper":"/paper/2502.09647"},"observation_digest":"sha256:312dd276eb9486db6ca772c95ac832c83c2068f3da12c0ff82d08737be9936ad","observation_id":"00232cfb-b8d0-4ffd-92b7-ac3239210597","resolution":{"observed_at":"2026-08-08T13:46:11.411181Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06104","last_updated":"2024-06-18T09:16:14Z","snapshot_observed_at":"2026-08-07T11:50:21.011836Z","submitted_at":"2024-01-11T18:35:26Z","title":"Transformers are Multi-State RNNs","version":2},"cited_work":{"arxiv_id":"2401.06104","doi":"10.48550/arxiv.2401.06104","metadata_source":"pith","pith_arxiv_id":"2401.06104","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Transformers are multi-state rnns.arXiv preprint arXiv:2401.06104","venue":"cs.CL","work_id":"08b2eb3d-8a1b-454d-8785-7d3f2918642e","year":2024},"citing_paper":{"arxiv_id":"2502.13189","last_updated":"2025-02-18T14:06:05Z","snapshot_observed_at":"2026-07-06T20:38:48.725605Z","submitted_at":"2025-02-18T14:06:05Z","title":"MoBA: Mixture of Block Attention for Long-Context LLMs","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-05-16T06:15:46.085555Z"},"links":{"cited_paper":"/paper/2401.06104","citing_paper":"/paper/2502.13189"},"observation_digest":"sha256:fc092dd2c298a369fd964f1e1a6c35232ee4a43a96eb4324814758cf5f8094e6","observation_id":"f8187306-dc17-460f-b73e-463d1aec41f5","resolution":{"observed_at":"2026-05-16T06:15:46.269719Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06104","last_updated":"2024-06-18T09:16:14Z","snapshot_observed_at":"2026-08-07T11:50:21.011836Z","submitted_at":"2024-01-11T18:35:26Z","title":"Transformers are Multi-State RNNs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.06104","snapshot_observed_at":"2026-08-07T14:16:17.009571Z","title":"Transformers are multi-state rnns.arXiv preprint arXiv:2401.06104, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19602","last_updated":"2025-05-26T07:11:42Z","snapshot_observed_at":"2026-08-08T23:51:09.753030Z","submitted_at":"2025-05-26T07:11:42Z","title":"Memory-Efficient Visual Autoregressive Modeling with Scale-Aware KV Cache Compression","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:17.009571Z"},"links":{"cited_paper":"/paper/2401.06104","citing_paper":"/paper/2505.19602"},"observation_digest":"sha256:d20aa138ea4122128f42d504a98084ff85c09272255104bb4e01619cac47160c","observation_id":"c33b358f-77c5-4223-bb69-6eaff1831127","resolution":{"observed_at":"2026-08-07T14:16:17.009571Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06104","last_updated":"2024-06-18T09:16:14Z","snapshot_observed_at":"2026-08-07T11:50:21.011836Z","submitted_at":"2024-01-11T18:35:26Z","title":"Transformers are Multi-State RNNs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.06104","snapshot_observed_at":"2026-08-07T12:03:42.533672Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00773","last_updated":"2025-06-03T13:29:29Z","snapshot_observed_at":"2026-08-08T14:37:00.707617Z","submitted_at":"2025-06-01T01:42:40Z","title":"Dynamic Chunking and Selection for Reading Comprehension of Ultra-Long Context in Large Language Models","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T12:03:42.533672Z"},"links":{"cited_paper":"/paper/2401.06104","citing_paper":"/paper/2506.00773"},"observation_digest":"sha256:eae563068ee71fdf754ccbfc181a7af31aa59b15e6817d9a938bf82c0728ed4e","observation_id":"acd58307-ba1d-475d-989c-cde40fe46f23","resolution":{"observed_at":"2026-08-07T12:03:42.533672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06104","last_updated":"2024-06-18T09:16:14Z","snapshot_observed_at":"2026-08-07T11:50:21.011836Z","submitted_at":"2024-01-11T18:35:26Z","title":"Transformers are Multi-State RNNs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.06104","snapshot_observed_at":"2026-08-07T11:02:05.812475Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03762","last_updated":"2025-06-04T09:25:53Z","snapshot_observed_at":"2026-08-09T00:35:37.169620Z","submitted_at":"2025-06-04T09:25:53Z","title":"AhaKV: Adaptive Holistic Attention-Driven KV Cache Eviction for Efficient Inference of Large Language Models","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T11:02:05.812475Z"},"links":{"cited_paper":"/paper/2401.06104","citing_paper":"/paper/2506.03762"},"observation_digest":"sha256:3bf24107159d6e4e88ad0d637d2c084790b159c71f5c932647911b5eec8f8dd2","observation_id":"c0e8cf90-f4e9-4d22-b575-2d56dd548708","resolution":{"observed_at":"2026-08-07T11:02:05.812475Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06104","last_updated":"2024-06-18T09:16:14Z","snapshot_observed_at":"2026-08-07T11:50:21.011836Z","submitted_at":"2024-01-11T18:35:26Z","title":"Transformers are Multi-State RNNs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.06104","snapshot_observed_at":"2026-08-07T06:04:33.321894Z","title":"Transformers are multi-state rnns.arXiv preprint arXiv:2401.06104, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06266","last_updated":"2025-06-13T17:58:55Z","snapshot_observed_at":"2026-08-07T05:54:59.580995Z","submitted_at":"2025-06-06T17:48:23Z","title":"Cartridges: Lightweight and general-purpose long context representations via self-study","version":3},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-07T06:04:33.321894Z"},"links":{"cited_paper":"/paper/2401.06104","citing_paper":"/paper/2506.06266"},"observation_digest":"sha256:4f95d08edfed980b55bc338282ed37a3f613716358dbeea183075c4773689844","observation_id":"c4e08f49-c96b-4585-bffa-050c6b1f3ab3","resolution":{"observed_at":"2026-08-07T06:04:33.321894Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06104","last_updated":"2024-06-18T09:16:14Z","snapshot_observed_at":"2026-08-07T11:50:21.011836Z","submitted_at":"2024-01-11T18:35:26Z","title":"Transformers are Multi-State RNNs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.06104","snapshot_observed_at":"2026-08-07T00:23:18.564246Z","title":"Ben Prystawski, Michael Li, and Noah Goodman","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.08806","last_updated":"2025-06-17T06:04:01Z","snapshot_observed_at":"2026-08-08T13:44:26.014435Z","submitted_at":"2025-06-17T06:04:01Z","title":"Think Clearly: Improving Reasoning via Redundant Token Pruning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T00:23:18.564246Z"},"links":{"cited_paper":"/paper/2401.06104","citing_paper":"/paper/2507.08806"},"observation_digest":"sha256:1a6dd21d5b8bb0acf2b4331d686d538ee8143327af28a72d7d25af121b75651a","observation_id":"68a3ec76-a728-43d3-a209-688f3381f75f","resolution":{"observed_at":"2026-08-07T00:23:18.564246Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06104","last_updated":"2024-06-18T09:16:14Z","snapshot_observed_at":"2026-08-07T11:50:21.011836Z","submitted_at":"2024-01-11T18:35:26Z","title":"Transformers are Multi-State RNNs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.06104","snapshot_observed_at":"2026-08-06T17:33:20.696069Z","title":"Oren, M., Hassid, M., Adi, Y ., and Schwartz, R","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.14204","last_updated":"2025-07-14T19:09:57Z","snapshot_observed_at":"2026-08-07T13:12:08.750150Z","submitted_at":"2025-07-14T19:09:57Z","title":"LaCache: Ladder-Shaped KV Caching for Efficient Long-Context Modeling of Large Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T17:33:20.696069Z"},"links":{"cited_paper":"/paper/2401.06104","citing_paper":"/paper/2507.14204"},"observation_digest":"sha256:ad0a5622644d73a3ff2f37356633d95ddb549cdb412aa24faf228f1eae04d618","observation_id":"99117483-cd98-46ce-bc6c-8348b4157fd5","resolution":{"observed_at":"2026-08-06T17:33:20.696069Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06104","last_updated":"2024-06-18T09:16:14Z","snapshot_observed_at":"2026-08-07T11:50:21.011836Z","submitted_at":"2024-01-11T18:35:26Z","title":"Transformers are Multi-State RNNs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.06104","snapshot_observed_at":"2026-08-05T17:55:06.525852Z","title":"Transformers are multi-state rnns","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.15881","last_updated":"2025-08-25T02:24:20Z","snapshot_observed_at":"2026-08-05T17:55:04.790166Z","submitted_at":"2025-08-21T15:25:40Z","title":"TPLA: Tensor Parallel Latent Attention for Efficient Disaggregated Prefill and Decode Inference","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-05T17:55:06.525852Z"},"links":{"cited_paper":"/paper/2401.06104","citing_paper":"/paper/2508.15881"},"observation_digest":"sha256:8b6d8acd06ebcd7d0d175ea220d65461f38516e80d53eda0f4b20f66c6ec3e63","observation_id":"9a51bea7-5360-48d8-995f-7b83e8aec3b8","resolution":{"observed_at":"2026-08-05T17:55:06.525852Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06104","last_updated":"2024-06-18T09:16:14Z","snapshot_observed_at":"2026-08-07T11:50:21.011836Z","submitted_at":"2024-01-11T18:35:26Z","title":"Transformers are Multi-State RNNs","version":2},"cited_work":{"arxiv_id":"2401.06104","doi":"10.48550/arxiv.2401.06104","metadata_source":"pith","pith_arxiv_id":"2401.06104","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Transformers are multi-state rnns.arXiv preprint arXiv:2401.06104","venue":"cs.CL","work_id":"08b2eb3d-8a1b-454d-8785-7d3f2918642e","year":2024},"citing_paper":{"arxiv_id":"2510.00231","last_updated":"2026-05-13T19:46:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-30T19:55:26Z","title":"The Pitfalls of KV Cache Compression","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-18T11:31:57.865691Z"},"links":{"cited_paper":"/paper/2401.06104","citing_paper":"/paper/2510.00231"},"observation_digest":"sha256:33c1aa09890b0ed84448898222d15bea63f13bda41aeffee4244d7c5500c82bf","observation_id":"bc49c771-0dae-4a86-a69e-05b535178225","resolution":{"observed_at":"2026-05-18T11:32:35.105944Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06104","last_updated":"2024-06-18T09:16:14Z","snapshot_observed_at":"2026-08-07T11:50:21.011836Z","submitted_at":"2024-01-11T18:35:26Z","title":"Transformers are Multi-State RNNs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.06104","snapshot_observed_at":"2026-08-04T10:57:43.739935Z","title":"Transformers are multi- state rnns.arXiv preprint arXiv:2401.06104,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.07651","last_updated":"2026-05-28T18:28:06Z","snapshot_observed_at":"2026-08-04T10:57:42.002395Z","submitted_at":"2025-10-09T00:58:28Z","title":"OBCache: Optimal Brain KV Cache Pruning for Efficient Long-Context LLM Inference","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-04T10:57:43.739935Z"},"links":{"cited_paper":"/paper/2401.06104","citing_paper":"/paper/2510.07651"},"observation_digest":"sha256:fcc51c5c62aa59ec961cc0bd713c4b94b33c49e0a6cc75ad2709e08079d6da6c","observation_id":"0da759d6-e3a3-47f4-8bed-dee80839d12a","resolution":{"observed_at":"2026-08-04T10:57:43.739935Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06104","last_updated":"2024-06-18T09:16:14Z","snapshot_observed_at":"2026-08-07T11:50:21.011836Z","submitted_at":"2024-01-11T18:35:26Z","title":"Transformers are Multi-State RNNs","version":2},"cited_work":{"arxiv_id":"2401.06104","doi":"10.48550/arxiv.2401.06104","metadata_source":"pith","pith_arxiv_id":"2401.06104","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Transformers are multi-state rnns.arXiv preprint arXiv:2401.06104","venue":"cs.CL","work_id":"08b2eb3d-8a1b-454d-8785-7d3f2918642e","year":2024},"citing_paper":{"arxiv_id":"2510.09883","last_updated":"2026-05-02T01:10:22Z","snapshot_observed_at":"2026-08-02T19:55:25.209109Z","submitted_at":"2025-10-10T21:37:49Z","title":"DELTA: Dynamic Layer-Aware Token Attention for Efficient Long-Context Reasoning","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-18T07:25:56.953876Z"},"links":{"cited_paper":"/paper/2401.06104","citing_paper":"/paper/2510.09883"},"observation_digest":"sha256:c25236dbffd7e61a9424af7b734c586f68b8dd608ff73cac39be9c383fb94366","observation_id":"bbbe9cf3-856f-4f15-ae92-43e88bceab4c","resolution":{"observed_at":"2026-05-18T07:26:02.911734Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06104","last_updated":"2024-06-18T09:16:14Z","snapshot_observed_at":"2026-08-07T11:50:21.011836Z","submitted_at":"2024-01-11T18:35:26Z","title":"Transformers are Multi-State RNNs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.06104","snapshot_observed_at":"2026-08-03T01:18:04.039897Z","title":"Junyoung Park, Dalton Jones, Matthew J Morse, Raghavv Goel, Mingu Lee, and Chris Lott","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.10238","last_updated":"2026-06-26T10:01:58Z","snapshot_observed_at":"2026-08-07T12:13:56.561734Z","submitted_at":"2026-02-10T19:34:15Z","title":"Learning to Evict from Key-Value Cache","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-03T01:18:04.039897Z"},"links":{"cited_paper":"/paper/2401.06104","citing_paper":"/paper/2602.10238"},"observation_digest":"sha256:1b34e83cb7aacd9716cc8c7c27a6db2de485ccbce8d2fbc872ac87405969d3cf","observation_id":"5ebeb06c-dd57-482e-9dd1-c700f1f3d813","resolution":{"observed_at":"2026-08-03T01:18:04.039897Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06104","last_updated":"2024-06-18T09:16:14Z","snapshot_observed_at":"2026-08-07T11:50:21.011836Z","submitted_at":"2024-01-11T18:35:26Z","title":"Transformers are Multi-State RNNs","version":2},"cited_work":{"arxiv_id":"2401.06104","doi":"10.48550/arxiv.2401.06104","metadata_source":"pith","pith_arxiv_id":"2401.06104","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Transformers are multi-state rnns.arXiv preprint arXiv:2401.06104","venue":"cs.CL","work_id":"08b2eb3d-8a1b-454d-8785-7d3f2918642e","year":2024},"citing_paper":{"arxiv_id":"2602.18196","last_updated":"2026-05-28T10:28:00Z","snapshot_observed_at":"2026-08-02T22:05:41.622495Z","submitted_at":"2026-02-20T13:09:49Z","title":"RAT+: Train Dense, Infer Sparse -- Recurrence Augmented Attention for Dilated Inference","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-15T20:59:33.902420Z"},"links":{"cited_paper":"/paper/2401.06104","citing_paper":"/paper/2602.18196"},"observation_digest":"sha256:0f979002a3789cdd70f2b22bdcbf7fe34fdba03fc898a3b9931796e2d0cc41b5","observation_id":"493ee67c-1b0b-4b32-bb7b-885bdd991d67","resolution":{"observed_at":"2026-05-15T21:00:17.921407Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06104","last_updated":"2024-06-18T09:16:14Z","snapshot_observed_at":"2026-08-07T11:50:21.011836Z","submitted_at":"2024-01-11T18:35:26Z","title":"Transformers are Multi-State RNNs","version":2},"cited_work":{"arxiv_id":"2401.06104","doi":"10.48550/arxiv.2401.06104","metadata_source":"pith","pith_arxiv_id":"2401.06104","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Transformers are multi-state rnns.arXiv preprint arXiv:2401.06104","venue":"cs.CL","work_id":"08b2eb3d-8a1b-454d-8785-7d3f2918642e","year":2024},"citing_paper":{"arxiv_id":"2602.18196","last_updated":"2026-05-28T10:28:00Z","snapshot_observed_at":"2026-08-02T22:05:41.622495Z","submitted_at":"2026-02-20T13:09:49Z","title":"RAT+: Train Dense, Infer Sparse -- Recurrence Augmented Attention for Dilated Inference","version":4},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-21T12:45:27.150368Z"},"links":{"cited_paper":"/paper/2401.06104","citing_paper":"/paper/2602.18196"},"observation_digest":"sha256:a3aab72f9c4872301b4ccee0045a8b73b21ed011bca8f62aef771b15a23a2b6c","observation_id":"ae59597a-eb62-4a02-b206-5c0b9a19dbd7","resolution":{"observed_at":"2026-05-21T12:50:09.524907Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06104","last_updated":"2024-06-18T09:16:14Z","snapshot_observed_at":"2026-08-07T11:50:21.011836Z","submitted_at":"2024-01-11T18:35:26Z","title":"Transformers are Multi-State RNNs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.06104","snapshot_observed_at":"2026-08-02T22:05:43.031477Z","title":"Transformers are multi-state rnns.arXiv preprint arXiv:2401.06104,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.18196","last_updated":"2026-05-28T10:28:00Z","snapshot_observed_at":"2026-08-02T22:05:41.622495Z","submitted_at":"2026-02-20T13:09:49Z","title":"RAT+: Train Dense, Infer Sparse -- Recurrence Augmented Attention for Dilated Inference","version":5},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-02T22:05:43.031477Z"},"links":{"cited_paper":"/paper/2401.06104","citing_paper":"/paper/2602.18196"},"observation_digest":"sha256:3d71e75f15a1e9c1e93fc7a11fc2fab759675ce959095f4f9e9fa577f2ce951d","observation_id":"1a5cab8b-0878-4fba-aa6d-38b027148999","resolution":{"observed_at":"2026-08-02T22:05:43.031477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06104","last_updated":"2024-06-18T09:16:14Z","snapshot_observed_at":"2026-08-07T11:50:21.011836Z","submitted_at":"2024-01-11T18:35:26Z","title":"Transformers are Multi-State RNNs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.06104","snapshot_observed_at":"2026-08-03T02:39:29.428722Z","title":"Transformers are multi-state rnns.arXiv preprint arXiv:2401.06104,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.06274","last_updated":"2026-07-31T10:15:33Z","snapshot_observed_at":"2026-08-08T03:34:36.285584Z","submitted_at":"2026-03-06T13:33:29Z","title":"Stem: Rethinking Causal Information Flow in Sparse Attention","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-03T02:39:29.428722Z"},"links":{"cited_paper":"/paper/2401.06104","citing_paper":"/paper/2603.06274"},"observation_digest":"sha256:add1df5af3d2371b41fce5ba9af190c19629744d57270e9e4581ebb45233ec6c","observation_id":"ccc1e841-1654-4da3-bcbf-63cb8c3123b6","resolution":{"observed_at":"2026-08-03T02:39:29.428722Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06104","last_updated":"2024-06-18T09:16:14Z","snapshot_observed_at":"2026-08-07T11:50:21.011836Z","submitted_at":"2024-01-11T18:35:26Z","title":"Transformers are Multi-State RNNs","version":2},"cited_work":{"arxiv_id":"2401.06104","doi":"10.48550/arxiv.2401.06104","metadata_source":"pith","pith_arxiv_id":"2401.06104","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Transformers are multi-state rnns.arXiv preprint arXiv:2401.06104","venue":"cs.CL","work_id":"08b2eb3d-8a1b-454d-8785-7d3f2918642e","year":2024},"citing_paper":{"arxiv_id":"2604.11288","last_updated":"2026-04-13T10:51:46Z","snapshot_observed_at":"2026-07-06T22:59:45.139155Z","submitted_at":"2026-04-13T10:51:46Z","title":"Transactional Attention: Semantic Sponsorship for KV-Cache Retention","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-05-10T15:10:24.725639Z"},"links":{"cited_paper":"/paper/2401.06104","citing_paper":"/paper/2604.11288"},"observation_digest":"sha256:f949e9ac25a6126143ac82db873a3a91f4772726e79db48fdad65f6d13badc1e","observation_id":"74978e6a-de28-433d-a557-e81d6837965f","resolution":{"observed_at":"2026-05-10T15:10:30.674922Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06104","last_updated":"2024-06-18T09:16:14Z","snapshot_observed_at":"2026-08-07T11:50:21.011836Z","submitted_at":"2024-01-11T18:35:26Z","title":"Transformers are Multi-State RNNs","version":2},"cited_work":{"arxiv_id":"2401.06104","doi":"10.48550/arxiv.2401.06104","metadata_source":"pith","pith_arxiv_id":"2401.06104","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Transformers are multi-state rnns.arXiv preprint arXiv:2401.06104","venue":"cs.CL","work_id":"08b2eb3d-8a1b-454d-8785-7d3f2918642e","year":2024},"citing_paper":{"arxiv_id":"2604.18137","last_updated":"2026-04-20T12:04:51Z","snapshot_observed_at":"2026-07-06T23:05:04.279268Z","submitted_at":"2026-04-20T12:04:51Z","title":"AQPIM: Breaking the PIM Capacity Wall for LLMs with In-Memory Activation Quantization","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-10T04:09:11.684432Z"},"links":{"cited_paper":"/paper/2401.06104","citing_paper":"/paper/2604.18137"},"observation_digest":"sha256:2f6b6dbb27915706a0b979397e16ba643ad25bceb3d83c30b004cbc2c9e74ebe","observation_id":"68e5b953-cc61-4190-9508-23742921cc3e","resolution":{"observed_at":"2026-05-11T12:06:04.533339Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06104","last_updated":"2024-06-18T09:16:14Z","snapshot_observed_at":"2026-08-07T11:50:21.011836Z","submitted_at":"2024-01-11T18:35:26Z","title":"Transformers are Multi-State RNNs","version":2},"cited_work":{"arxiv_id":"2401.06104","doi":"10.48550/arxiv.2401.06104","metadata_source":"pith","pith_arxiv_id":"2401.06104","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Transformers are multi-state rnns.arXiv preprint arXiv:2401.06104","venue":"cs.CL","work_id":"08b2eb3d-8a1b-454d-8785-7d3f2918642e","year":2024},"citing_paper":{"arxiv_id":"2605.06554","last_updated":"2026-05-07T16:49:28Z","snapshot_observed_at":"2026-08-06T05:32:01.891597Z","submitted_at":"2026-05-07T16:49:28Z","title":"Long Context Pre-Training with Lighthouse Attention","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-08T10:10:38.610613Z"},"links":{"cited_paper":"/paper/2401.06104","citing_paper":"/paper/2605.06554"},"observation_digest":"sha256:d900dccca52e4cf4c91a7b506f40569f2757b7296b09cc6e0cea3a2d40d1d3b7","observation_id":"7d39eab4-515e-473e-84d7-78f822fabc8f","resolution":{"observed_at":"2026-05-11T20:11:09.305982Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06104","last_updated":"2024-06-18T09:16:14Z","snapshot_observed_at":"2026-08-07T11:50:21.011836Z","submitted_at":"2024-01-11T18:35:26Z","title":"Transformers are Multi-State RNNs","version":2},"cited_work":{"arxiv_id":"2401.06104","doi":"10.48550/arxiv.2401.06104","metadata_source":"pith","pith_arxiv_id":"2401.06104","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Transformers are multi-state rnns.arXiv preprint arXiv:2401.06104","venue":"cs.CL","work_id":"08b2eb3d-8a1b-454d-8785-7d3f2918642e","year":2024},"citing_paper":{"arxiv_id":"2605.08840","last_updated":"2026-05-09T09:49:32Z","snapshot_observed_at":"2026-07-06T23:21:02.177557Z","submitted_at":"2026-05-09T09:49:32Z","title":"ReST-KV: Robust KV Cache Eviction with Layer-wise Output Reconstruction and Spatial-Temporal Smoothing","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-12T02:52:33.076123Z"},"links":{"cited_paper":"/paper/2401.06104","citing_paper":"/paper/2605.08840"},"observation_digest":"sha256:e6f0a08f42e157019e15f274533dcf747ba82ebdde1394f12c5c1df195aa9311","observation_id":"3c6a7848-cc99-4c76-a756-5e0081d6b7d6","resolution":{"observed_at":"2026-05-12T07:26:30.124036Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06104","last_updated":"2024-06-18T09:16:14Z","snapshot_observed_at":"2026-08-07T11:50:21.011836Z","submitted_at":"2024-01-11T18:35:26Z","title":"Transformers are Multi-State RNNs","version":2},"cited_work":{"arxiv_id":"2401.06104","doi":"10.48550/arxiv.2401.06104","metadata_source":"pith","pith_arxiv_id":"2401.06104","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Transformers are multi-state rnns.arXiv preprint arXiv:2401.06104","venue":"cs.CL","work_id":"08b2eb3d-8a1b-454d-8785-7d3f2918642e","year":2024},"citing_paper":{"arxiv_id":"2605.25475","last_updated":"2026-05-25T06:29:43Z","snapshot_observed_at":"2026-08-02T08:45:15.831498Z","submitted_at":"2026-05-25T06:29:43Z","title":"IndexMem: Learned KV-Cache Eviction with Latent Memory for Long-Context LLM Inference","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-29T22:03:07.685253Z"},"links":{"cited_paper":"/paper/2401.06104","citing_paper":"/paper/2605.25475"},"observation_digest":"sha256:5c1ae2dd3732fb81c579bd87ab902120c37f4759c96621516e24ecb171ea7f9f","observation_id":"adbe79b1-3ddb-4618-b1fa-2d23c66e2ec8","resolution":{"observed_at":"2026-06-29T22:03:59.894407Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06104","last_updated":"2024-06-18T09:16:14Z","snapshot_observed_at":"2026-08-07T11:50:21.011836Z","submitted_at":"2024-01-11T18:35:26Z","title":"Transformers are Multi-State RNNs","version":2},"cited_work":{"arxiv_id":"2401.06104","doi":"10.48550/arxiv.2401.06104","metadata_source":"pith","pith_arxiv_id":"2401.06104","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Transformers are multi-state rnns.arXiv preprint arXiv:2401.06104","venue":"cs.CL","work_id":"08b2eb3d-8a1b-454d-8785-7d3f2918642e","year":2024},"citing_paper":{"arxiv_id":"2606.08302","last_updated":"2026-06-06T18:58:26Z","snapshot_observed_at":"2026-08-06T09:32:24.096311Z","submitted_at":"2026-06-06T18:58:26Z","title":"HACK++: Towards More Effective Head-Aware Key-Value Compression for Efficient Visual Autoregressive Modeling","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-06-27T19:46:43.514413Z"},"links":{"cited_paper":"/paper/2401.06104","citing_paper":"/paper/2606.08302"},"observation_digest":"sha256:76765e92baf5521adf76cbba8748a68f185b30a2ab5594e5c10d584c1af7a112","observation_id":"716d21de-9384-4131-aa96-0b597c708455","resolution":{"observed_at":"2026-07-02T21:27:24.380935Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06104","last_updated":"2024-06-18T09:16:14Z","snapshot_observed_at":"2026-08-07T11:50:21.011836Z","submitted_at":"2024-01-11T18:35:26Z","title":"Transformers are Multi-State RNNs","version":2},"cited_work":{"arxiv_id":"2401.06104","doi":"10.48550/arxiv.2401.06104","metadata_source":"pith","pith_arxiv_id":"2401.06104","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Transformers are multi-state rnns.arXiv preprint arXiv:2401.06104","venue":"cs.CL","work_id":"08b2eb3d-8a1b-454d-8785-7d3f2918642e","year":2024},"citing_paper":{"arxiv_id":"2606.24957","last_updated":"2026-06-23T08:51:20Z","snapshot_observed_at":"2026-08-06T21:01:25.213982Z","submitted_at":"2026-06-23T08:51:20Z","title":"Dustin: Draft-Augmented Sparse Verification for Efficient Long-Context Generation with Speculative Decoding","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-26T00:11:58.636939Z"},"links":{"cited_paper":"/paper/2401.06104","citing_paper":"/paper/2606.24957"},"observation_digest":"sha256:3430c25d6641f9c72455d3fa1bfb534d0d112d0162ad36d00decc31ca640c976","observation_id":"075db97b-afd7-43b0-ba76-71eb3d78ff6e","resolution":{"observed_at":"2026-07-04T16:49:58.011184Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06104","last_updated":"2024-06-18T09:16:14Z","snapshot_observed_at":"2026-08-07T11:50:21.011836Z","submitted_at":"2024-01-11T18:35:26Z","title":"Transformers are Multi-State RNNs","version":2},"cited_work":{"arxiv_id":"2401.06104","doi":"10.48550/arxiv.2401.06104","metadata_source":"pith","pith_arxiv_id":"2401.06104","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Transformers are multi-state rnns.arXiv preprint arXiv:2401.06104","venue":"cs.CL","work_id":"08b2eb3d-8a1b-454d-8785-7d3f2918642e","year":2024},"citing_paper":{"arxiv_id":"2607.08032","last_updated":"2026-07-09T01:15:03Z","snapshot_observed_at":"2026-08-02T16:38:21.894642Z","submitted_at":"2026-07-09T01:15:03Z","title":"What to Keep, What to Forget: A Rate--Distortion View of Memory Compaction in LLMs and Agents","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-07-10T01:26:59.421158Z"},"links":{"cited_paper":"/paper/2401.06104","citing_paper":"/paper/2607.08032"},"observation_digest":"sha256:e5c93c17afccea2a569fefc5308ac1f14ce0b0433355f4967e1299e0dc921c58","observation_id":"e953ea22-6f25-489a-86e2-59e1f78e8454","resolution":{"observed_at":"2026-07-10T01:36:44.005016Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06104","last_updated":"2024-06-18T09:16:14Z","snapshot_observed_at":"2026-08-07T11:50:21.011836Z","submitted_at":"2024-01-11T18:35:26Z","title":"Transformers are Multi-State RNNs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.06104","snapshot_observed_at":"2026-07-14T10:41:08.967261Z","title":"Transformers are multi-state RNNs,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.10582","last_updated":"2026-07-12T05:35:26Z","snapshot_observed_at":"2026-07-16T23:18:51.454376Z","submitted_at":"2026-07-12T05:35:26Z","title":"MemDecay: Region-Aware KV Cache Eviction for Efficient LLM Agent Inference","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-14T10:41:08.967261Z"},"links":{"cited_paper":"/paper/2401.06104","citing_paper":"/paper/2607.10582"},"observation_digest":"sha256:1763605e34c53bab48f829206ec18d03ed721f8c7ebf4aab63fe7ba0351e0688","observation_id":"ea27f054-3853-440c-a141-84780c5d90fd","resolution":{"observed_at":"2026-07-14T10:41:08.967261Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06104","last_updated":"2024-06-18T09:16:14Z","snapshot_observed_at":"2026-08-07T11:50:21.011836Z","submitted_at":"2024-01-11T18:35:26Z","title":"Transformers are Multi-State RNNs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.06104","snapshot_observed_at":"2026-08-01T07:23:39.162227Z","title":"Transformers are multi-state RNNs","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.21475","last_updated":"2026-07-25T14:37:35Z","snapshot_observed_at":"2026-08-07T14:07:35.910271Z","submitted_at":"2026-07-23T16:16:59Z","title":"Error Certificates for KV-Cache Eviction via Randomized Design","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-01T07:23:39.162227Z"},"links":{"cited_paper":"/paper/2401.06104","citing_paper":"/paper/2607.21475"},"observation_digest":"sha256:29f6c59c90db05d5d01f33867bd0649cb44aff133e192dc32f5cd6a8349e2d1a","observation_id":"5b2fe512-ee50-4301-acee-4e5e2a4cda4e","resolution":{"observed_at":"2026-08-01T07:23:39.162227Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06104","last_updated":"2024-06-18T09:16:14Z","snapshot_observed_at":"2026-08-07T11:50:21.011836Z","submitted_at":"2024-01-11T18:35:26Z","title":"Transformers are Multi-State RNNs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.06104","snapshot_observed_at":"2026-08-07T00:45:48.501586Z","title":"Transformers are multi-state rnns","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.04405","last_updated":"2026-08-05T03:19:21Z","snapshot_observed_at":"2026-08-08T23:11:36.041523Z","submitted_at":"2026-08-05T03:19:21Z","title":"Training-Free Hashing-Based Attention via Binary Principal Components","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-07T00:45:48.501586Z"},"links":{"cited_paper":"/paper/2401.06104","citing_paper":"/paper/2608.04405"},"observation_digest":"sha256:0d547987519d4a26f284a1c361d9c4fdba72a2a60fb3a9be0ec4912634a9c6fb","observation_id":"21c45e05-256e-4f45-aed1-31751a9dd61c","resolution":{"observed_at":"2026-08-07T00:45:48.501586Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2401.06104/citation-record","integrity":"/paper/2401.06104/integrity","json":"/paper/2401.06104/citation-record.json","paper":"/paper/2401.06104"},"outbound":[],"paper":{"arxiv_id":"2401.06104","last_updated":"2024-06-18T09:16:14Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-07T11:50:21.011836Z","submitted_at":"2024-01-11T18:35:26Z","title":"Transformers are Multi-State RNNs"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 31 inbound Pith citation observations for arXiv:2401.06104."}