{"as_of":"2026-08-10T01:13:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d3e0281528141809da8e8e1645811f2ff9a40e17023270ef84dcaa5ec0ba408a","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":36,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":36,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":36,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":36,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-09T13:05:31.626283Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T07:49:39.775848Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2402.01032","last_updated":"2024-06-03T22:22:15Z","snapshot_observed_at":"2026-08-09T22:32:41.851014Z","submitted_at":"2024-02-01T21:44:11Z","title":"Repeat After Me: Transformers are Better than State Space Models at Copying","version":2},"cited_work":{"arxiv_id":"2402.01032","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.01032","snapshot_observed_at":"2026-07-04T07:49:39.775848Z","title":"Repeat after me: Transformers are bet- ter than state space models at copying","venue":null,"work_id":"20142145-2ae1-401d-b482-0a9f3c17c750","year":2024},"citing_paper":{"arxiv_id":"2402.19427","last_updated":"2024-02-29T18:24:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-29T18:24:46Z","title":"Griffin: Mixing Gated Linear Recurrences with Local Attention for Efficient Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-15T06:58:17.370396Z"},"links":{"cited_paper":"/paper/2402.01032","citing_paper":"/paper/2402.19427"},"observation_digest":"sha256:dad1fe241bd6f17a5302a571cabab63a3a39c4e60c557680bf15dfb2434ade0d","observation_id":"4785e0e2-ffce-4e15-87fe-1fa1c43050d1","resolution":{"observed_at":"2026-05-15T06:58:17.519265Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01032","last_updated":"2024-06-03T22:22:15Z","snapshot_observed_at":"2026-08-09T22:32:41.851014Z","submitted_at":"2024-02-01T21:44:11Z","title":"Repeat After Me: Transformers are Better than State Space Models at Copying","version":2},"cited_work":{"arxiv_id":"2402.01032","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.01032","snapshot_observed_at":"2026-07-04T07:49:39.775848Z","title":"Repeat after me: Transformers are bet- ter than state space models at copying","venue":null,"work_id":"20142145-2ae1-401d-b482-0a9f3c17c750","year":2024},"citing_paper":{"arxiv_id":"2406.07887","last_updated":"2024-06-12T05:25:15Z","snapshot_observed_at":"2026-07-06T18:29:21.709395Z","submitted_at":"2024-06-12T05:25:15Z","title":"An Empirical Study of Mamba-based Language Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-18T10:31:03.777169Z"},"links":{"cited_paper":"/paper/2402.01032","citing_paper":"/paper/2406.07887"},"observation_digest":"sha256:639bb97b9de3a7bcb4b39f2f1e1d786d7a135681550e56bedae9e0ceb5d61669","observation_id":"f6b2ad84-3d20-4dd8-bc39-137bce7e2a5b","resolution":{"observed_at":"2026-05-18T10:31:03.861393Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01032","last_updated":"2024-06-03T22:22:15Z","snapshot_observed_at":"2026-08-09T22:32:41.851014Z","submitted_at":"2024-02-01T21:44:11Z","title":"Repeat After Me: Transformers are Better than State Space Models at Copying","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01032","snapshot_observed_at":"2026-08-09T13:05:31.626283Z","title":"M., and Malach, E","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.02209","last_updated":"2025-02-04T10:46:39Z","snapshot_observed_at":"2026-08-09T17:03:08.069652Z","submitted_at":"2025-02-04T10:46:39Z","title":"On the Expressivity of Selective State-Space Layers: A Multivariate Polynomial Approach","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-09T13:05:31.626283Z"},"links":{"cited_paper":"/paper/2402.01032","citing_paper":"/paper/2502.02209"},"observation_digest":"sha256:1c4e0e2fb564465a01a5874274d97efc26a88198d99fc2720e2235cf818423f7","observation_id":"7dfd5ca6-f645-4169-bae3-35077d083a7e","resolution":{"observed_at":"2026-08-09T13:05:31.626283Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01032","last_updated":"2024-06-03T22:22:15Z","snapshot_observed_at":"2026-08-09T22:32:41.851014Z","submitted_at":"2024-02-01T21:44:11Z","title":"Repeat After Me: Transformers are Better than State Space Models at Copying","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01032","snapshot_observed_at":"2026-08-08T12:25:42.671185Z","title":"M., and Malach, E","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.07563","last_updated":"2025-02-11T14:01:39Z","snapshot_observed_at":"2026-08-08T12:15:35.512720Z","submitted_at":"2025-02-11T14:01:39Z","title":"LASP-2: Rethinking Sequence Parallelism for Linear Attention and Its Hybrid","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-08T12:25:42.671185Z"},"links":{"cited_paper":"/paper/2402.01032","citing_paper":"/paper/2502.07563"},"observation_digest":"sha256:6dc5e54fbbbe11cc8317c62c02de40d04150b26ab13a33f9d2986353798cddaa","observation_id":"cc935757-5111-4368-955a-85e43c483e88","resolution":{"observed_at":"2026-08-08T12:25:42.671185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01032","last_updated":"2024-06-03T22:22:15Z","snapshot_observed_at":"2026-08-09T22:32:41.851014Z","submitted_at":"2024-02-01T21:44:11Z","title":"Repeat After Me: Transformers are Better than State Space Models at Copying","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01032","snapshot_observed_at":"2026-08-07T13:54:45.540484Z","title":"Repeat after me: Transformers are better than state space models at copying.arXiv preprint arXiv:2402.01032,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.20698","last_updated":"2025-05-27T04:07:23Z","snapshot_observed_at":"2026-08-09T20:42:35.268317Z","submitted_at":"2025-05-27T04:07:23Z","title":"Sparsified State-Space Models are Efficient Highway Networks","version":1},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-07T13:54:45.540484Z"},"links":{"cited_paper":"/paper/2402.01032","citing_paper":"/paper/2505.20698"},"observation_digest":"sha256:943a88312275f34f6b7ea5d690a92ac44e28fe7d7217e720ab0bb7caa73f80e5","observation_id":"cc493380-73bd-476e-97c9-16df01d2ce48","resolution":{"observed_at":"2026-08-07T13:54:45.540484Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01032","last_updated":"2024-06-03T22:22:15Z","snapshot_observed_at":"2026-08-09T22:32:41.851014Z","submitted_at":"2024-02-01T21:44:11Z","title":"Repeat After Me: Transformers are Better than State Space Models at Copying","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01032","snapshot_observed_at":"2026-08-07T12:46:36.145807Z","title":"Repeat after me: Transformers are better than state space models at copying.arXiv preprint arXiv:2402.01032, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23683","last_updated":"2025-05-29T17:22:00Z","snapshot_observed_at":"2026-08-07T21:59:35.039840Z","submitted_at":"2025-05-29T17:22:00Z","title":"Learning Compositional Functions with Transformers from Easy-to-Hard Data","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T12:46:36.145807Z"},"links":{"cited_paper":"/paper/2402.01032","citing_paper":"/paper/2505.23683"},"observation_digest":"sha256:c2f6da5b14d8e39107985965cccd70ca9e81edf73f34aaf0d4405b7085a9c744","observation_id":"7d3ab2f4-6822-4c76-afe7-47e5270748c0","resolution":{"observed_at":"2026-08-07T12:46:36.145807Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01032","last_updated":"2024-06-03T22:22:15Z","snapshot_observed_at":"2026-08-09T22:32:41.851014Z","submitted_at":"2024-02-01T21:44:11Z","title":"Repeat After Me: Transformers are Better than State Space Models at Copying","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01032","snapshot_observed_at":"2026-08-07T10:33:38.690738Z","title":"M., and Malach, E","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05200","last_updated":"2025-08-28T16:07:16Z","snapshot_observed_at":"2026-08-09T04:21:50.390154Z","submitted_at":"2025-06-05T16:12:51Z","title":"Transformers Meet In-Context Learning: A Universal Approximation Theory","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T10:33:38.690738Z"},"links":{"cited_paper":"/paper/2402.01032","citing_paper":"/paper/2506.05200"},"observation_digest":"sha256:2b5112267fe9aff59772bf8c5b312bb89aa64d22b0985291d9c7092a4e7afad9","observation_id":"ac4be71b-5e71-480c-9044-2122935aa254","resolution":{"observed_at":"2026-08-07T10:33:38.690738Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01032","last_updated":"2024-06-03T22:22:15Z","snapshot_observed_at":"2026-08-09T22:32:41.851014Z","submitted_at":"2024-02-01T21:44:11Z","title":"Repeat After Me: Transformers are Better than State Space Models at Copying","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01032","snapshot_observed_at":"2026-08-06T18:33:59.785532Z","title":"Repeat After Me: Transformers are Better Than State Space Models at Copying","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07955","last_updated":"2025-07-15T09:06:11Z","snapshot_observed_at":"2026-08-09T06:19:51.410938Z","submitted_at":"2025-07-10T17:39:37Z","title":"Dynamic Chunking for End-to-End Hierarchical Sequence Modeling","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T18:33:59.785532Z"},"links":{"cited_paper":"/paper/2402.01032","citing_paper":"/paper/2507.07955"},"observation_digest":"sha256:a36a76f83acfb023c792c8042a92ac2d781e7c41700052b634b474ff84176b49","observation_id":"9ae3ec0a-4294-471e-999e-c31d90f76e51","resolution":{"observed_at":"2026-08-06T18:33:59.785532Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01032","last_updated":"2024-06-03T22:22:15Z","snapshot_observed_at":"2026-08-09T22:32:41.851014Z","submitted_at":"2024-02-01T21:44:11Z","title":"Repeat After Me: Transformers are Better than State Space Models at Copying","version":2},"cited_work":{"arxiv_id":"2402.01032","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.01032","snapshot_observed_at":"2026-07-04T07:49:39.775848Z","title":"Repeat after me: Transformers are bet- ter than state space models at copying","venue":null,"work_id":"20142145-2ae1-401d-b482-0a9f3c17c750","year":2024},"citing_paper":{"arxiv_id":"2509.26645","last_updated":"2026-03-03T12:58:09Z","snapshot_observed_at":"2026-08-08T05:03:09.924311Z","submitted_at":"2025-09-30T17:59:51Z","title":"TTT3R: 3D Reconstruction as Test-Time Training","version":4},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-17T06:41:16.306593Z"},"links":{"cited_paper":"/paper/2402.01032","citing_paper":"/paper/2509.26645"},"observation_digest":"sha256:49158b687ccdf01dbff6b497d9481f01e3e1231c245bdf3f1a3e7be592fb6be1","observation_id":"5e71ee86-8927-4fc7-b8d0-87a84a262889","resolution":{"observed_at":"2026-05-17T06:41:16.436769Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01032","last_updated":"2024-06-03T22:22:15Z","snapshot_observed_at":"2026-08-09T22:32:41.851014Z","submitted_at":"2024-02-01T21:44:11Z","title":"Repeat After Me: Transformers are Better than State Space Models at Copying","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01032","snapshot_observed_at":"2026-08-04T12:55:17.799547Z","title":"M., and Malach, E","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.05141","last_updated":"2026-05-26T14:52:39Z","snapshot_observed_at":"2026-08-04T12:55:13.353234Z","submitted_at":"2025-10-01T21:53:42Z","title":"To model human linguistic prediction, make LLMs less superhuman","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-04T12:55:17.799547Z"},"links":{"cited_paper":"/paper/2402.01032","citing_paper":"/paper/2510.05141"},"observation_digest":"sha256:74a811cb61a94ca2aace7de535cc8449a984e40955f437532ebd79404c209fb4","observation_id":"4ec361f8-de23-415e-8b48-2abadecf5c13","resolution":{"observed_at":"2026-08-04T12:55:17.799547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01032","last_updated":"2024-06-03T22:22:15Z","snapshot_observed_at":"2026-08-09T22:32:41.851014Z","submitted_at":"2024-02-01T21:44:11Z","title":"Repeat After Me: Transformers are Better than State Space Models at Copying","version":2},"cited_work":{"arxiv_id":"2402.01032","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.01032","snapshot_observed_at":"2026-07-04T07:49:39.775848Z","title":"Repeat after me: Transformers are bet- ter than state space models at copying","venue":null,"work_id":"20142145-2ae1-401d-b482-0a9f3c17c750","year":2024},"citing_paper":{"arxiv_id":"2510.26692","last_updated":"2025-11-01T12:05:18Z","snapshot_observed_at":"2026-08-07T19:30:34.681869Z","submitted_at":"2025-10-30T16:59:43Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-13T23:49:10.555255Z"},"links":{"cited_paper":"/paper/2402.01032","citing_paper":"/paper/2510.26692"},"observation_digest":"sha256:22cd5ea9767364489168d20ce085a6f2ba8b4efa71077b1d246bb92ddd9fac3b","observation_id":"f3f7ac2c-eccf-44b4-984b-62f8888dbd4a","resolution":{"observed_at":"2026-05-13T23:49:11.163140Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01032","last_updated":"2024-06-03T22:22:15Z","snapshot_observed_at":"2026-08-09T22:32:41.851014Z","submitted_at":"2024-02-01T21:44:11Z","title":"Repeat After Me: Transformers are Better than State Space Models at Copying","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01032","snapshot_observed_at":"2026-08-03T23:33:56.548151Z","title":"Repeat after me: Transformers are better than state space models at copying","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.05313","last_updated":"2026-07-13T06:02:36Z","snapshot_observed_at":"2026-08-07T04:09:13.749315Z","submitted_at":"2025-11-07T15:13:28Z","title":"Controllably Efficient Language Models","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-03T23:33:56.548151Z"},"links":{"cited_paper":"/paper/2402.01032","citing_paper":"/paper/2511.05313"},"observation_digest":"sha256:659236f1261aebfc25c025dff3c80dcebec916c2f38ae809f6147fccb16beeee","observation_id":"8103b078-7df7-4329-8404-fb9a9755987a","resolution":{"observed_at":"2026-08-03T23:33:56.548151Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01032","last_updated":"2024-06-03T22:22:15Z","snapshot_observed_at":"2026-08-09T22:32:41.851014Z","submitted_at":"2024-02-01T21:44:11Z","title":"Repeat After Me: Transformers are Better than State Space Models at Copying","version":2},"cited_work":{"arxiv_id":"2402.01032","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.01032","snapshot_observed_at":"2026-07-04T07:49:39.775848Z","title":"Repeat after me: Transformers are bet- ter than state space models at copying","venue":null,"work_id":"20142145-2ae1-401d-b482-0a9f3c17c750","year":2024},"citing_paper":{"arxiv_id":"2511.21016","last_updated":"2026-05-17T20:43:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-26T03:26:37Z","title":"Gated KalmaNet: A Fading Memory Layer Through Test-Time Ridge Regression","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-21T17:59:23.826110Z"},"links":{"cited_paper":"/paper/2402.01032","citing_paper":"/paper/2511.21016"},"observation_digest":"sha256:0f9af06fff875944d83632c6088e070a9b9d1dd598985e7dd067f48d34076a1e","observation_id":"7cd71372-04b3-411a-86a3-38862c2577d6","resolution":{"observed_at":"2026-05-21T18:00:27.090936Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01032","last_updated":"2024-06-03T22:22:15Z","snapshot_observed_at":"2026-08-09T22:32:41.851014Z","submitted_at":"2024-02-01T21:44:11Z","title":"Repeat After Me: Transformers are Better than State Space Models at Copying","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01032","snapshot_observed_at":"2026-08-03T15:22:50.161253Z","title":"Repeat after me: Transformers are better than state space models at copying.arXiv preprint arXiv:2402.01032, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.17351","last_updated":"2026-07-28T16:53:50Z","snapshot_observed_at":"2026-08-03T18:14:53.588030Z","submitted_at":"2025-12-19T08:47:28Z","title":"Physics of Language Models: Part 4.1, Architecture Design and the Magic of Canon Layers","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-03T15:22:50.161253Z"},"links":{"cited_paper":"/paper/2402.01032","citing_paper":"/paper/2512.17351"},"observation_digest":"sha256:d8a49cbbde43e6c0e894df731b0e6814bc2e6229577d7ba955e0a6c9eff79e3d","observation_id":"31bba847-f7ed-4acd-9271-7a3a672b259d","resolution":{"observed_at":"2026-08-03T15:22:50.161253Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01032","last_updated":"2024-06-03T22:22:15Z","snapshot_observed_at":"2026-08-09T22:32:41.851014Z","submitted_at":"2024-02-01T21:44:11Z","title":"Repeat After Me: Transformers are Better than State Space Models at Copying","version":2},"cited_work":{"arxiv_id":"2402.01032","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.01032","snapshot_observed_at":"2026-07-04T07:49:39.775848Z","title":"Repeat after me: Transformers are bet- ter than state space models at copying","venue":null,"work_id":"20142145-2ae1-401d-b482-0a9f3c17c750","year":2024},"citing_paper":{"arxiv_id":"2512.22471","last_updated":"2026-05-16T15:25:03Z","snapshot_observed_at":"2026-08-07T00:58:48.915042Z","submitted_at":"2025-12-27T05:28:58Z","title":"The Bayesian Geometry of Transformer Attention","version":5},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-21T16:15:57.408685Z"},"links":{"cited_paper":"/paper/2402.01032","citing_paper":"/paper/2512.22471"},"observation_digest":"sha256:810d573d7bdaa8997d299c68c082e22f9695f35be74234142edbba83d0e6730e","observation_id":"31684462-8ffd-4905-adcd-93b9b894d592","resolution":{"observed_at":"2026-05-21T16:20:20.659781Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01032","last_updated":"2024-06-03T22:22:15Z","snapshot_observed_at":"2026-08-09T22:32:41.851014Z","submitted_at":"2024-02-01T21:44:11Z","title":"Repeat After Me: Transformers are Better than State Space Models at Copying","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01032","snapshot_observed_at":"2026-08-03T03:51:43.479561Z","title":"M., and Malach, E","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.06774","last_updated":"2026-06-16T19:54:13Z","snapshot_observed_at":"2026-08-09T22:33:44.935304Z","submitted_at":"2026-02-06T15:29:46Z","title":"Towards Understanding What State Space Models Learn About Code","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-03T03:51:43.479561Z"},"links":{"cited_paper":"/paper/2402.01032","citing_paper":"/paper/2602.06774"},"observation_digest":"sha256:97b230198aacfd9bb957c406ec0c81dc9bc254b692f78af13f01658d9b0996fd","observation_id":"52bab556-5e0a-451b-974f-9fde3c04def9","resolution":{"observed_at":"2026-08-03T03:51:43.479561Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01032","last_updated":"2024-06-03T22:22:15Z","snapshot_observed_at":"2026-08-09T22:32:41.851014Z","submitted_at":"2024-02-01T21:44:11Z","title":"Repeat After Me: Transformers are Better than State Space Models at Copying","version":2},"cited_work":{"arxiv_id":"2402.01032","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.01032","snapshot_observed_at":"2026-07-04T07:49:39.775848Z","title":"Repeat after me: Transformers are bet- ter than state space models at copying","venue":null,"work_id":"20142145-2ae1-401d-b482-0a9f3c17c750","year":2024},"citing_paper":{"arxiv_id":"2604.05923","last_updated":"2026-04-07T14:23:40Z","snapshot_observed_at":"2026-08-04T01:48:44.289003Z","submitted_at":"2026-04-07T14:23:40Z","title":"The UNDO Flip-Flop: A Controlled Probe for Reversible Semantic State Management in State Space Model","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-10T18:45:35.405345Z"},"links":{"cited_paper":"/paper/2402.01032","citing_paper":"/paper/2604.05923"},"observation_digest":"sha256:bc5d536177726e0247b8d7b6aa628527e09f782dd2fc2d6a32abb6f757049f40","observation_id":"effe2026-80e9-4099-9641-bacc9a687709","resolution":{"observed_at":"2026-05-11T00:00:52.709421Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01032","last_updated":"2024-06-03T22:22:15Z","snapshot_observed_at":"2026-08-09T22:32:41.851014Z","submitted_at":"2024-02-01T21:44:11Z","title":"Repeat After Me: Transformers are Better than State Space Models at Copying","version":2},"cited_work":{"arxiv_id":"2402.01032","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.01032","snapshot_observed_at":"2026-07-04T07:49:39.775848Z","title":"Repeat after me: Transformers are bet- ter than state space models at copying","venue":null,"work_id":"20142145-2ae1-401d-b482-0a9f3c17c750","year":2024},"citing_paper":{"arxiv_id":"2604.21215","last_updated":"2026-04-23T02:12:58Z","snapshot_observed_at":"2026-07-06T23:07:51.979267Z","submitted_at":"2026-04-23T02:12:58Z","title":"The Recurrent Transformer: Greater Effective Depth and Efficient Decoding","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-05-09T22:03:35.260373Z"},"links":{"cited_paper":"/paper/2402.01032","citing_paper":"/paper/2604.21215"},"observation_digest":"sha256:4a09a4a81d8442e12f561c5d9d01c5ed6e3c9ebd7b950da99bb2ff9ee25e321b","observation_id":"5215fe50-c4af-46e9-bf7e-663a5d4856ef","resolution":{"observed_at":"2026-05-11T14:21:04.627239Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01032","last_updated":"2024-06-03T22:22:15Z","snapshot_observed_at":"2026-08-09T22:32:41.851014Z","submitted_at":"2024-02-01T21:44:11Z","title":"Repeat After Me: Transformers are Better than State Space Models at Copying","version":2},"cited_work":{"arxiv_id":"2402.01032","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.01032","snapshot_observed_at":"2026-07-04T07:49:39.775848Z","title":"Repeat after me: Transformers are bet- ter than state space models at copying","venue":null,"work_id":"20142145-2ae1-401d-b482-0a9f3c17c750","year":2024},"citing_paper":{"arxiv_id":"2605.06683","last_updated":"2026-04-24T20:37:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-24T20:37:21Z","title":"Toeplitz MLP Mixers are Low Complexity, Information-Rich Sequence Models","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-05-11T01:07:33.756985Z"},"links":{"cited_paper":"/paper/2402.01032","citing_paper":"/paper/2605.06683"},"observation_digest":"sha256:0af213e25f6130fff0d80eca0d4512a97004694dcf898ad4b5b53e7ac3d87c4f","observation_id":"a966edb1-f8a6-4fb8-b3dd-aac28ccb0c79","resolution":{"observed_at":"2026-05-11T04:45:56.203904Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01032","last_updated":"2024-06-03T22:22:15Z","snapshot_observed_at":"2026-08-09T22:32:41.851014Z","submitted_at":"2024-02-01T21:44:11Z","title":"Repeat After Me: Transformers are Better than State Space Models at Copying","version":2},"cited_work":{"arxiv_id":"2402.01032","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.01032","snapshot_observed_at":"2026-07-04T07:49:39.775848Z","title":"Repeat after me: Transformers are bet- ter than state space models at copying","venue":null,"work_id":"20142145-2ae1-401d-b482-0a9f3c17c750","year":2024},"citing_paper":{"arxiv_id":"2605.06997","last_updated":"2026-05-07T22:26:27Z","snapshot_observed_at":"2026-08-02T23:31:22.583542Z","submitted_at":"2026-05-07T22:26:27Z","title":"Echo: KV-Cache-Free Associative Recall with Spectral Koopman Operators","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-11T01:26:48.026538Z"},"links":{"cited_paper":"/paper/2402.01032","citing_paper":"/paper/2605.06997"},"observation_digest":"sha256:644bbccb574bc3aaa9c979b6f80d975a5b96b3910cc44ad751be113e6c4093d9","observation_id":"ad50ff5c-3d7c-4fe5-bd79-3d8a57f0aca5","resolution":{"observed_at":"2026-05-11T04:25:56.325867Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01032","last_updated":"2024-06-03T22:22:15Z","snapshot_observed_at":"2026-08-09T22:32:41.851014Z","submitted_at":"2024-02-01T21:44:11Z","title":"Repeat After Me: Transformers are Better than State Space Models at Copying","version":2},"cited_work":{"arxiv_id":"2402.01032","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.01032","snapshot_observed_at":"2026-07-04T07:49:39.775848Z","title":"Repeat after me: Transformers are bet- ter than state space models at copying","venue":null,"work_id":"20142145-2ae1-401d-b482-0a9f3c17c750","year":2024},"citing_paper":{"arxiv_id":"2605.09472","last_updated":"2026-05-10T10:58:20Z","snapshot_observed_at":"2026-07-06T23:21:35.327066Z","submitted_at":"2026-05-10T10:58:20Z","title":"Positional LSH: Binary Block Matrix Approximation for Attention with Linear Biases","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-05-12T04:29:37.989500Z"},"links":{"cited_paper":"/paper/2402.01032","citing_paper":"/paper/2605.09472"},"observation_digest":"sha256:0fbd5ea62926a8167efae3379694a28953caef438d0a673070d87081d301257f","observation_id":"bc1e3a80-bddc-4fb0-b861-9bad26bb08db","resolution":{"observed_at":"2026-05-12T06:11:27.007244Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01032","last_updated":"2024-06-03T22:22:15Z","snapshot_observed_at":"2026-08-09T22:32:41.851014Z","submitted_at":"2024-02-01T21:44:11Z","title":"Repeat After Me: Transformers are Better than State Space Models at Copying","version":2},"cited_work":{"arxiv_id":"2402.01032","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.01032","snapshot_observed_at":"2026-07-04T07:49:39.775848Z","title":"Repeat after me: Transformers are bet- ter than state space models at copying","venue":null,"work_id":"20142145-2ae1-401d-b482-0a9f3c17c750","year":2024},"citing_paper":{"arxiv_id":"2605.13473","last_updated":"2026-05-13T12:59:26Z","snapshot_observed_at":"2026-08-02T14:44:34.058937Z","submitted_at":"2026-05-13T12:59:26Z","title":"OSDN: Improving Delta Rule with Provable Online Preconditioning in Linear Attention","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-14T19:08:18.768344Z"},"links":{"cited_paper":"/paper/2402.01032","citing_paper":"/paper/2605.13473"},"observation_digest":"sha256:0c7bac604f841bbc1ff15bc22a1f9879de19eb7b7a194c1b4b62ff4fd933c6c2","observation_id":"e827a593-b678-41e4-b8a5-15afeea5ad62","resolution":{"observed_at":"2026-05-14T19:09:23.228532Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01032","last_updated":"2024-06-03T22:22:15Z","snapshot_observed_at":"2026-08-09T22:32:41.851014Z","submitted_at":"2024-02-01T21:44:11Z","title":"Repeat After Me: Transformers are Better than State Space Models at Copying","version":2},"cited_work":{"arxiv_id":"2402.01032","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.01032","snapshot_observed_at":"2026-07-04T07:49:39.775848Z","title":"Repeat after me: Transformers are bet- ter than state space models at copying","venue":null,"work_id":"20142145-2ae1-401d-b482-0a9f3c17c750","year":2024},"citing_paper":{"arxiv_id":"2605.26099","last_updated":"2026-06-05T05:36:49Z","snapshot_observed_at":"2026-07-06T23:36:01.564747Z","submitted_at":"2026-05-25T17:55:39Z","title":"Do Language Models Need Sleep? Offline Recurrence for Improved Online Inference","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-29T21:37:51.638904Z"},"links":{"cited_paper":"/paper/2402.01032","citing_paper":"/paper/2605.26099"},"observation_digest":"sha256:79c83fada8f50d707c67b72c6ad620ef30bf0f7e8c8639384f418df29baa0ed6","observation_id":"7606210a-7535-4e13-a8d3-435571d897c7","resolution":{"observed_at":"2026-06-29T21:43:59.528847Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01032","last_updated":"2024-06-03T22:22:15Z","snapshot_observed_at":"2026-08-09T22:32:41.851014Z","submitted_at":"2024-02-01T21:44:11Z","title":"Repeat After Me: Transformers are Better than State Space Models at Copying","version":2},"cited_work":{"arxiv_id":"2402.01032","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.01032","snapshot_observed_at":"2026-07-04T07:49:39.775848Z","title":"Repeat after me: Transformers are bet- ter than state space models at copying","venue":null,"work_id":"20142145-2ae1-401d-b482-0a9f3c17c750","year":2024},"citing_paper":{"arxiv_id":"2606.00390","last_updated":"2026-05-29T22:12:40Z","snapshot_observed_at":"2026-07-06T23:41:05.637982Z","submitted_at":"2026-05-29T22:12:40Z","title":"Zamba2-VL Technical Report","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-06-28T22:34:20.970856Z"},"links":{"cited_paper":"/paper/2402.01032","citing_paper":"/paper/2606.00390"},"observation_digest":"sha256:de667a2e5f48086da744c2d7403c3975238ab905f9c4bfdb1d9226e6ada3ae8f","observation_id":"f65382ec-1ece-4ce6-9e6f-5f4802358b7d","resolution":{"observed_at":"2026-07-01T19:26:00.673759Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01032","last_updated":"2024-06-03T22:22:15Z","snapshot_observed_at":"2026-08-09T22:32:41.851014Z","submitted_at":"2024-02-01T21:44:11Z","title":"Repeat After Me: Transformers are Better than State Space Models at Copying","version":2},"cited_work":{"arxiv_id":"2402.01032","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.01032","snapshot_observed_at":"2026-07-04T07:49:39.775848Z","title":"Repeat after me: Transformers are bet- ter than state space models at copying","venue":null,"work_id":"20142145-2ae1-401d-b482-0a9f3c17c750","year":2024},"citing_paper":{"arxiv_id":"2606.11052","last_updated":"2026-06-09T16:17:19Z","snapshot_observed_at":"2026-08-05T14:17:36.486236Z","submitted_at":"2026-06-09T16:17:19Z","title":"Attention Amnesia in Hybrid LLMs: When CoT Fine-Tuning Breaks Long-Range Recall, and How to Fix It","version":1},"reference_index":112,"source":"arxiv_source","source_observed_at":"2026-06-27T13:08:57.218711Z"},"links":{"cited_paper":"/paper/2402.01032","citing_paper":"/paper/2606.11052"},"observation_digest":"sha256:9b1c34d32ac345b09eeaf6a18e36ff7b2d802753adc616082367d66243845d02","observation_id":"3c7b0e8c-ea93-4311-8fa3-f457973d9ff0","resolution":{"observed_at":"2026-07-03T05:37:40.365982Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01032","last_updated":"2024-06-03T22:22:15Z","snapshot_observed_at":"2026-08-09T22:32:41.851014Z","submitted_at":"2024-02-01T21:44:11Z","title":"Repeat After Me: Transformers are Better than State Space Models at Copying","version":2},"cited_work":{"arxiv_id":"2402.01032","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.01032","snapshot_observed_at":"2026-07-04T07:49:39.775848Z","title":"Repeat after me: Transformers are bet- ter than state space models at copying","venue":null,"work_id":"20142145-2ae1-401d-b482-0a9f3c17c750","year":2024},"citing_paper":{"arxiv_id":"2606.21884","last_updated":"2026-06-20T04:52:14Z","snapshot_observed_at":"2026-08-03T01:34:19.883808Z","submitted_at":"2026-06-20T04:52:14Z","title":"A Verifiable Search Is Not a Learnable Chain-of-Thought","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-26T12:35:20.698118Z"},"links":{"cited_paper":"/paper/2402.01032","citing_paper":"/paper/2606.21884"},"observation_digest":"sha256:4a7c5e12daa5158dc9505d5563762ad36576443d72b48aef6f4aa75c57ba09fd","observation_id":"dff055e0-ab10-4f46-938d-37dd97af1876","resolution":{"observed_at":"2026-07-04T07:49:39.777090Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01032","last_updated":"2024-06-03T22:22:15Z","snapshot_observed_at":"2026-08-09T22:32:41.851014Z","submitted_at":"2024-02-01T21:44:11Z","title":"Repeat After Me: Transformers are Better than State Space Models at Copying","version":2},"cited_work":{"arxiv_id":"2402.01032","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.01032","snapshot_observed_at":"2026-07-04T07:49:39.775848Z","title":"Repeat after me: Transformers are bet- ter than state space models at copying","venue":null,"work_id":"20142145-2ae1-401d-b482-0a9f3c17c750","year":2024},"citing_paper":{"arxiv_id":"2607.02303","last_updated":"2026-07-02T15:19:49Z","snapshot_observed_at":"2026-07-07T00:07:47.719699Z","submitted_at":"2026-07-02T15:19:49Z","title":"A Hippocampus for Linear Attention: An Exact Memory for What the Recurrent State Forgets","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-03T13:46:18.862925Z"},"links":{"cited_paper":"/paper/2402.01032","citing_paper":"/paper/2607.02303"},"observation_digest":"sha256:afcae164d54dd89f16782c930e7074228a400ee86f4edf863ceccbacd7185007","observation_id":"ed936055-c6b7-4404-84e4-ce80ef412ce5","resolution":{"observed_at":"2026-07-03T13:48:20.316429Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01032","last_updated":"2024-06-03T22:22:15Z","snapshot_observed_at":"2026-08-09T22:32:41.851014Z","submitted_at":"2024-02-01T21:44:11Z","title":"Repeat After Me: Transformers are Better than State Space Models at Copying","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01032","snapshot_observed_at":"2026-07-14T14:50:03.831572Z","title":"[Khandelwal et al.(2020)] U","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.09889","last_updated":"2026-07-10T18:28:21Z","snapshot_observed_at":"2026-08-02T12:00:29.141267Z","submitted_at":"2026-07-10T18:28:21Z","title":"Remembering Distinct Items, Not Tokens: A Learnable Dirichlet-Process Cache Between State-Space Models and Attention","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-14T14:50:03.831572Z"},"links":{"cited_paper":"/paper/2402.01032","citing_paper":"/paper/2607.09889"},"observation_digest":"sha256:c6457782a220f59afc1e861e83befaec8f8e417e7f0b67be7cdfd16ad746d094","observation_id":"c975545d-840b-4086-ad3b-027c90be10fd","resolution":{"observed_at":"2026-07-14T14:50:03.831572Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01032","last_updated":"2024-06-03T22:22:15Z","snapshot_observed_at":"2026-08-09T22:32:41.851014Z","submitted_at":"2024-02-01T21:44:11Z","title":"Repeat After Me: Transformers are Better than State Space Models at Copying","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01032","snapshot_observed_at":"2026-07-14T13:15:38.524121Z","title":"Kakade, and Eran Malach","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10244","last_updated":"2026-07-11T10:19:21Z","snapshot_observed_at":"2026-08-03T20:17:16.813949Z","submitted_at":"2026-07-11T10:19:21Z","title":"DSSMs: State Space Models with Explicit Memory via Delay Differential Equations","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-14T13:15:38.524121Z"},"links":{"cited_paper":"/paper/2402.01032","citing_paper":"/paper/2607.10244"},"observation_digest":"sha256:d993f1476daf2a558b77dc035300319aef04a689912a5246dd07c07326489fbf","observation_id":"0aea3c71-0acc-4a0a-831f-6f5ac09bd726","resolution":{"observed_at":"2026-07-14T13:15:38.524121Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01032","last_updated":"2024-06-03T22:22:15Z","snapshot_observed_at":"2026-08-09T22:32:41.851014Z","submitted_at":"2024-02-01T21:44:11Z","title":"Repeat After Me: Transformers are Better than State Space Models at Copying","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01032","snapshot_observed_at":"2026-07-14T11:45:09.424370Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10441","last_updated":"2026-07-11T18:58:22Z","snapshot_observed_at":"2026-08-08T12:08:13.956705Z","submitted_at":"2026-07-11T18:58:22Z","title":"Context by Distinct Information: An Auditable Dirichlet-Process Working Memory for Long, Redundant Context Streams","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-14T11:45:09.424370Z"},"links":{"cited_paper":"/paper/2402.01032","citing_paper":"/paper/2607.10441"},"observation_digest":"sha256:e862b258f01c0a6c42b407c5e90407edabb6cd0c2355b1500a47110d32c59d0b","observation_id":"1ce7cf71-0aa1-429a-acce-aae0ba99215a","resolution":{"observed_at":"2026-07-14T11:45:09.424370Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01032","last_updated":"2024-06-03T22:22:15Z","snapshot_observed_at":"2026-08-09T22:32:41.851014Z","submitted_at":"2024-02-01T21:44:11Z","title":"Repeat After Me: Transformers are Better than State Space Models at Copying","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01032","snapshot_observed_at":"2026-08-02T06:39:22.140957Z","title":"Kakade, and Eran Malach","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14144","last_updated":"2026-07-31T05:37:48Z","snapshot_observed_at":"2026-08-06T19:33:05.649205Z","submitted_at":"2026-07-14T05:52:12Z","title":"The Capability Convergence Hypothesis: Capability from Access Structure, Not Scale","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-02T06:39:22.140957Z"},"links":{"cited_paper":"/paper/2402.01032","citing_paper":"/paper/2607.14144"},"observation_digest":"sha256:c7e43bc7fbfecff1ba06180592ed2a346c6e49539608074e13464f9e35da248b","observation_id":"e90e7497-c8d5-4d09-bdfa-ee34ab6c017d","resolution":{"observed_at":"2026-08-02T06:39:22.140957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01032","last_updated":"2024-06-03T22:22:15Z","snapshot_observed_at":"2026-08-09T22:32:41.851014Z","submitted_at":"2024-02-01T21:44:11Z","title":"Repeat After Me: Transformers are Better than State Space Models at Copying","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01032","snapshot_observed_at":"2026-08-03T02:03:24.068474Z","title":"Kakade, and Eran Malach","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14144","last_updated":"2026-07-31T05:37:48Z","snapshot_observed_at":"2026-08-06T19:33:05.649205Z","submitted_at":"2026-07-14T05:52:12Z","title":"The Capability Convergence Hypothesis: Capability from Access Structure, Not Scale","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-03T02:03:24.068474Z"},"links":{"cited_paper":"/paper/2402.01032","citing_paper":"/paper/2607.14144"},"observation_digest":"sha256:b7b2665ec1ebe04a1217e7b6fbce5f7bdfd12e04e2097d3acab54526099598a9","observation_id":"a3aa00d8-fc6d-4ebf-b856-35e685c3f74f","resolution":{"observed_at":"2026-08-03T02:03:24.068474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01032","last_updated":"2024-06-03T22:22:15Z","snapshot_observed_at":"2026-08-09T22:32:41.851014Z","submitted_at":"2024-02-01T21:44:11Z","title":"Repeat After Me: Transformers are Better than State Space Models at Copying","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01032","snapshot_observed_at":"2026-08-01T18:06:48.827702Z","title":"arXiv preprint arXiv:2402.01032 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17419","last_updated":"2026-07-19T21:46:09Z","snapshot_observed_at":"2026-08-09T06:26:14.680789Z","submitted_at":"2026-07-19T21:46:09Z","title":"Kernelized Linear Attention: Breaking the Capacity Wall with Symmetric Cones","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-01T18:06:48.827702Z"},"links":{"cited_paper":"/paper/2402.01032","citing_paper":"/paper/2607.17419"},"observation_digest":"sha256:8a553106fb643f9b2ade9aae1e716448e67406e4f2c9e326a87949e266b16e6a","observation_id":"86d98c18-52eb-4932-92da-eaadab7a7c71","resolution":{"observed_at":"2026-08-01T18:06:48.827702Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01032","last_updated":"2024-06-03T22:22:15Z","snapshot_observed_at":"2026-08-09T22:32:41.851014Z","submitted_at":"2024-02-01T21:44:11Z","title":"Repeat After Me: Transformers are Better than State Space Models at Copying","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01032","snapshot_observed_at":"2026-08-01T17:31:47.771481Z","title":"Repeat after me: Trans- formers are better than state space models at copying.arXiv:2402.01032,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17624","last_updated":"2026-07-20T07:26:17Z","snapshot_observed_at":"2026-08-07T13:43:21.717264Z","submitted_at":"2026-07-20T07:26:17Z","title":"Can Transformers Really Do It All? On the Compatibility of Inductive Biases Across Tasks","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-01T17:31:47.771481Z"},"links":{"cited_paper":"/paper/2402.01032","citing_paper":"/paper/2607.17624"},"observation_digest":"sha256:bba5157a4ea7117f38284ac18138f42a4fae323eecc4d32eaba01d320d70bdb9","observation_id":"d26c5665-9749-4773-b242-650aa8297dc6","resolution":{"observed_at":"2026-08-01T17:31:47.771481Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01032","last_updated":"2024-06-03T22:22:15Z","snapshot_observed_at":"2026-08-09T22:32:41.851014Z","submitted_at":"2024-02-01T21:44:11Z","title":"Repeat After Me: Transformers are Better than State Space Models at Copying","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01032","snapshot_observed_at":"2026-08-01T02:44:01.258380Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25357","last_updated":"2026-07-28T07:04:32Z","snapshot_observed_at":"2026-08-08T15:38:21.711545Z","submitted_at":"2026-07-28T07:04:32Z","title":"Raven: High-Recall Sequence Modeling with Sparse Memory Routing","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-01T02:44:01.258380Z"},"links":{"cited_paper":"/paper/2402.01032","citing_paper":"/paper/2607.25357"},"observation_digest":"sha256:1a77b630c2a059f5ed1968a4b5ac65359e3b7f01728e1d3585dcfb639081e43d","observation_id":"653d6092-2031-4eaf-9b84-61e86a5c15f9","resolution":{"observed_at":"2026-08-01T02:44:01.258380Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01032","last_updated":"2024-06-03T22:22:15Z","snapshot_observed_at":"2026-08-09T22:32:41.851014Z","submitted_at":"2024-02-01T21:44:11Z","title":"Repeat After Me: Transformers are Better than State Space Models at Copying","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01032","snapshot_observed_at":"2026-08-04T16:23:14.385860Z","title":"Repeat after me: Trans- formers are better than state space models at copying.arXiv preprint arXiv:2402.01032,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02032","last_updated":"2026-08-03T10:30:27Z","snapshot_observed_at":"2026-08-06T23:36:35.371202Z","submitted_at":"2026-08-03T10:30:27Z","title":"DART: Decoded Attention over Recurrent States for Efficient Long-Context Sequence Modeling","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-04T16:23:14.385860Z"},"links":{"cited_paper":"/paper/2402.01032","citing_paper":"/paper/2608.02032"},"observation_digest":"sha256:941e3628931ae728baea6e25e866594dbd597b05f6d02dcc6d1c98a36b236cae","observation_id":"74de6bad-a1d0-4c22-af69-25568eff1569","resolution":{"observed_at":"2026-08-04T16:23:14.385860Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2402.01032/citation-record","integrity":"/paper/2402.01032/integrity","json":"/paper/2402.01032/citation-record.json","paper":"/paper/2402.01032"},"outbound":[],"paper":{"arxiv_id":"2402.01032","last_updated":"2024-06-03T22:22:15Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-09T22:32:41.851014Z","submitted_at":"2024-02-01T21:44:11Z","title":"Repeat After Me: Transformers are Better than State Space Models at Copying"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 36 inbound Pith citation observations for arXiv:2402.01032."}