{"as_of":"2026-08-09T17:50:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:5d5dbb237b099d984590884261c6d48dd9050e6cc2a0b3b54e7e97409030c29c","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":33,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":33,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":33,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":33,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T11:36:53.781579Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-10T01:36:44.169594Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2203.08913","last_updated":"2022-03-16T19:54:35Z","snapshot_observed_at":"2026-08-05T11:47:40.727016Z","submitted_at":"2022-03-16T19:54:35Z","title":"Memorizing Transformers","version":1},"cited_work":{"arxiv_id":"2203.08913","doi":null,"metadata_source":"pith","pith_arxiv_id":"2203.08913","snapshot_observed_at":"2026-07-10T01:36:44.169594Z","title":"arXiv preprint arXiv:2203.08913 , year =","venue":"cs.LG","work_id":"bdf3b953-d673-4dec-a588-e1e3613ee7fd","year":2022},"citing_paper":{"arxiv_id":"2206.07682","last_updated":"2022-10-26T05:06:24Z","snapshot_observed_at":"2026-08-02T15:56:35.249569Z","submitted_at":"2022-06-15T17:32:01Z","title":"Emergent Abilities of Large Language Models","version":2},"reference_index":97,"source":"arxiv_source","source_observed_at":"2026-05-11T07:38:37.734402Z"},"links":{"cited_paper":"/paper/2203.08913","citing_paper":"/paper/2206.07682"},"observation_digest":"sha256:16e2d88a0a31505195b38fa4f7a59ec39a0e4712ae5ca638455b82b5fbe0c2ae","observation_id":"f42611a2-16fb-4e45-85b4-79505600d3e4","resolution":{"observed_at":"2026-05-11T07:38:38.265155Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.08913","last_updated":"2022-03-16T19:54:35Z","snapshot_observed_at":"2026-08-05T11:47:40.727016Z","submitted_at":"2022-03-16T19:54:35Z","title":"Memorizing Transformers","version":1},"cited_work":{"arxiv_id":"2203.08913","doi":null,"metadata_source":"pith","pith_arxiv_id":"2203.08913","snapshot_observed_at":"2026-07-10T01:36:44.169594Z","title":"arXiv preprint arXiv:2203.08913 , year =","venue":"cs.LG","work_id":"bdf3b953-d673-4dec-a588-e1e3613ee7fd","year":2022},"citing_paper":{"arxiv_id":"2404.07143","last_updated":"2024-08-09T22:37:25Z","snapshot_observed_at":"2026-08-02T14:27:24.212588Z","submitted_at":"2024-04-10T16:18:42Z","title":"Leave No Context Behind: Efficient Infinite Context Transformers with Infini-attention","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-21T18:17:00.157129Z"},"links":{"cited_paper":"/paper/2203.08913","citing_paper":"/paper/2404.07143"},"observation_digest":"sha256:5424e31b1d983eb8d37fc993a1935dac30fe58478f72a0c26fb9087cf4a8350e","observation_id":"a1f0a221-d5e7-49bc-821c-52984e98469f","resolution":{"observed_at":"2026-05-21T18:17:00.293418Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.08913","last_updated":"2022-03-16T19:54:35Z","snapshot_observed_at":"2026-08-05T11:47:40.727016Z","submitted_at":"2022-03-16T19:54:35Z","title":"Memorizing Transformers","version":1},"cited_work":{"arxiv_id":"2203.08913","doi":null,"metadata_source":"pith","pith_arxiv_id":"2203.08913","snapshot_observed_at":"2026-07-10T01:36:44.169594Z","title":"arXiv preprint arXiv:2203.08913 , year =","venue":"cs.LG","work_id":"bdf3b953-d673-4dec-a588-e1e3613ee7fd","year":2022},"citing_paper":{"arxiv_id":"2410.10813","last_updated":"2025-03-04T22:19:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-14T17:59:44Z","title":"LongMemEval: Benchmarking Chat Assistants on Long-Term Interactive Memory","version":2},"reference_index":97,"source":"arxiv_source","source_observed_at":"2026-05-11T16:41:03.980064Z"},"links":{"cited_paper":"/paper/2203.08913","citing_paper":"/paper/2410.10813"},"observation_digest":"sha256:67fc46c93d3b5277a9efbd1db9b728b096cab37ddd90621e04845c4e90834ba9","observation_id":"9eb4dcc4-261c-4a62-a308-52fc1e6b0abd","resolution":{"observed_at":"2026-05-11T16:41:06.469604Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.08913","last_updated":"2022-03-16T19:54:35Z","snapshot_observed_at":"2026-08-05T11:47:40.727016Z","submitted_at":"2022-03-16T19:54:35Z","title":"Memorizing Transformers","version":1},"cited_work":{"arxiv_id":"2203.08913","doi":null,"metadata_source":"pith","pith_arxiv_id":"2203.08913","snapshot_observed_at":"2026-07-10T01:36:44.169594Z","title":"arXiv preprint arXiv:2203.08913 , year =","venue":"cs.LG","work_id":"bdf3b953-d673-4dec-a588-e1e3613ee7fd","year":2022},"citing_paper":{"arxiv_id":"2502.13189","last_updated":"2025-02-18T14:06:05Z","snapshot_observed_at":"2026-07-06T20:38:48.725605Z","submitted_at":"2025-02-18T14:06:05Z","title":"MoBA: Mixture of Block Attention for Long-Context LLMs","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-05-16T06:15:46.085555Z"},"links":{"cited_paper":"/paper/2203.08913","citing_paper":"/paper/2502.13189"},"observation_digest":"sha256:37d0c982c9eaab4bfa1c3972c30862472b24b01b079f62f78dd74be3cbb3e8bc","observation_id":"e9d33f26-8fdf-4aea-8ac7-b0d98759d246","resolution":{"observed_at":"2026-05-16T06:15:46.243639Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.08913","last_updated":"2022-03-16T19:54:35Z","snapshot_observed_at":"2026-08-05T11:47:40.727016Z","submitted_at":"2022-03-16T19:54:35Z","title":"Memorizing Transformers","version":1},"cited_work":{"arxiv_id":"2203.08913","doi":null,"metadata_source":"pith","pith_arxiv_id":"2203.08913","snapshot_observed_at":"2026-07-10T01:36:44.169594Z","title":"arXiv preprint arXiv:2203.08913 , year =","venue":"cs.LG","work_id":"bdf3b953-d673-4dec-a588-e1e3613ee7fd","year":2022},"citing_paper":{"arxiv_id":"2504.15965","last_updated":"2025-04-23T13:47:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T15:05:04Z","title":"From Human Memory to AI Memory: A Survey on Memory Mechanisms in the Era of LLMs","version":2},"reference_index":145,"source":"pdf_text","source_observed_at":"2026-05-17T11:05:09.588491Z"},"links":{"cited_paper":"/paper/2203.08913","citing_paper":"/paper/2504.15965"},"observation_digest":"sha256:fbeeb73e3469e893e0a26a22f810f5ac015fbed2851022638d87fe075304c37c","observation_id":"10afeedc-4a61-415a-94b0-9f3618d0a03b","resolution":{"observed_at":"2026-05-17T11:05:09.969040Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.08913","last_updated":"2022-03-16T19:54:35Z","snapshot_observed_at":"2026-08-05T11:47:40.727016Z","submitted_at":"2022-03-16T19:54:35Z","title":"Memorizing Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.08913","snapshot_observed_at":"2026-08-07T15:31:44.312581Z","title":"Rabe, DeLesley Hutchins, and Christian Szegedy","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.02000","last_updated":"2025-06-23T01:41:05Z","snapshot_observed_at":"2026-08-07T15:25:33.498661Z","submitted_at":"2025-05-20T20:54:37Z","title":"NovelHopQA: Diagnosing Multi-Hop Reasoning Failures in Long Narrative Contexts","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T15:31:44.312581Z"},"links":{"cited_paper":"/paper/2203.08913","citing_paper":"/paper/2506.02000"},"observation_digest":"sha256:b5b1aef7dbfcceeeded9cc5c3eaa70be4cd888024a01c46192ce71dd42822149","observation_id":"5ff3d9e1-8d88-46ad-9254-180582f74010","resolution":{"observed_at":"2026-08-07T15:31:44.312581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.08913","last_updated":"2022-03-16T19:54:35Z","snapshot_observed_at":"2026-08-05T11:47:40.727016Z","submitted_at":"2022-03-16T19:54:35Z","title":"Memorizing Transformers","version":1},"cited_work":{"arxiv_id":"2203.08913","doi":null,"metadata_source":"pith","pith_arxiv_id":"2203.08913","snapshot_observed_at":"2026-07-10T01:36:44.169594Z","title":"arXiv preprint arXiv:2203.08913 , year =","venue":"cs.LG","work_id":"bdf3b953-d673-4dec-a588-e1e3613ee7fd","year":2022},"citing_paper":{"arxiv_id":"2506.13674","last_updated":"2026-04-19T03:53:58Z","snapshot_observed_at":"2026-08-02T17:06:46.370930Z","submitted_at":"2025-06-16T16:30:26Z","title":"PrefixMemory-Tuning: Modernizing Prefix-Tuning by Decoupling the Prefix from Attention","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-19T09:24:04.289799Z"},"links":{"cited_paper":"/paper/2203.08913","citing_paper":"/paper/2506.13674"},"observation_digest":"sha256:7e8d98fc99faa48cceba5b1a471a94ed47df325ee21903c01e0e0fa060da31c3","observation_id":"dd6e6b0a-71f9-42eb-9f60-88aed271f0ca","resolution":{"observed_at":"2026-05-19T09:27:14.647203Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.08913","last_updated":"2022-03-16T19:54:35Z","snapshot_observed_at":"2026-08-05T11:47:40.727016Z","submitted_at":"2022-03-16T19:54:35Z","title":"Memorizing Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.08913","snapshot_observed_at":"2026-08-05T20:15:56.728996Z","title":"Memorizing transformers","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.10824","last_updated":"2025-08-16T03:17:35Z","snapshot_observed_at":"2026-08-06T02:00:57.019893Z","submitted_at":"2025-08-14T16:48:38Z","title":"Memory-Augmented Transformers: A Systematic Review from Neuroscience Principles to Enhanced Model Architectures","version":2},"reference_index":111,"source":"arxiv_source","source_observed_at":"2026-08-05T20:15:56.728996Z"},"links":{"cited_paper":"/paper/2203.08913","citing_paper":"/paper/2508.10824"},"observation_digest":"sha256:7dfbcb69fab481f0b5639c2be325266dcdb0d0f685a0bf0405e4ad50d4e7b2f7","observation_id":"8e68ca03-2888-4be7-abf0-77a45ab6c546","resolution":{"observed_at":"2026-08-05T20:15:56.728996Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.08913","last_updated":"2022-03-16T19:54:35Z","snapshot_observed_at":"2026-08-05T11:47:40.727016Z","submitted_at":"2022-03-16T19:54:35Z","title":"Memorizing Transformers","version":1},"cited_work":{"arxiv_id":"2203.08913","doi":null,"metadata_source":"pith","pith_arxiv_id":"2203.08913","snapshot_observed_at":"2026-07-10T01:36:44.169594Z","title":"arXiv preprint arXiv:2203.08913 , year =","venue":"cs.LG","work_id":"bdf3b953-d673-4dec-a588-e1e3613ee7fd","year":2022},"citing_paper":{"arxiv_id":"2510.26692","last_updated":"2025-11-01T12:05:18Z","snapshot_observed_at":"2026-08-07T19:30:34.681869Z","submitted_at":"2025-10-30T16:59:43Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","version":2},"reference_index":109,"source":"pdf_text","source_observed_at":"2026-05-13T23:49:10.555255Z"},"links":{"cited_paper":"/paper/2203.08913","citing_paper":"/paper/2510.26692"},"observation_digest":"sha256:69782b117a8c7632bd90cbe2e7d723186c4c6fd9bfec64cec5e91e6988d74bb2","observation_id":"d5cc8b17-5111-4dcc-8616-e37c1432f85e","resolution":{"observed_at":"2026-05-13T23:49:10.905932Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.08913","last_updated":"2022-03-16T19:54:35Z","snapshot_observed_at":"2026-08-05T11:47:40.727016Z","submitted_at":"2022-03-16T19:54:35Z","title":"Memorizing Transformers","version":1},"cited_work":{"arxiv_id":"2203.08913","doi":null,"metadata_source":"pith","pith_arxiv_id":"2203.08913","snapshot_observed_at":"2026-07-10T01:36:44.169594Z","title":"arXiv preprint arXiv:2203.08913 , year =","venue":"cs.LG","work_id":"bdf3b953-d673-4dec-a588-e1e3613ee7fd","year":2022},"citing_paper":{"arxiv_id":"2512.12602","last_updated":"2026-05-08T15:47:57Z","snapshot_observed_at":"2026-07-06T22:38:59.725645Z","submitted_at":"2025-12-14T08:51:02Z","title":"Exact Flow Linear Attention: Exact Solution from Continuous-Time Dynamics","version":4},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-16T23:06:27.535997Z"},"links":{"cited_paper":"/paper/2203.08913","citing_paper":"/paper/2512.12602"},"observation_digest":"sha256:c299683b4435d5becddc75ea165a85deb2ea6eaa53cf8bd36ffaf6d098a236d2","observation_id":"477592d6-d7f8-44c4-8bc9-1c2c9ade0e21","resolution":{"observed_at":"2026-05-16T23:08:39.713080Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.08913","last_updated":"2022-03-16T19:54:35Z","snapshot_observed_at":"2026-08-05T11:47:40.727016Z","submitted_at":"2022-03-16T19:54:35Z","title":"Memorizing Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.08913","snapshot_observed_at":"2026-08-02T18:47:15.232417Z","title":"N., Hutchins, D., and Szegedy, C","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.05353","last_updated":"2026-07-16T04:21:11Z","snapshot_observed_at":"2026-08-05T20:13:20.512147Z","submitted_at":"2026-03-05T16:33:20Z","title":"InfoFlow KV: Information-Flow-Aware KV Recomputation for Long Context","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-02T18:47:15.232417Z"},"links":{"cited_paper":"/paper/2203.08913","citing_paper":"/paper/2603.05353"},"observation_digest":"sha256:41d7692ff342880c5ff40d1f7aab19a9ccb3eac18f47b1d7a7f4f03597e2110f","observation_id":"3eb45f17-5f25-4239-bcc1-5d93d9dbf00b","resolution":{"observed_at":"2026-08-02T18:47:15.232417Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.08913","last_updated":"2022-03-16T19:54:35Z","snapshot_observed_at":"2026-08-05T11:47:40.727016Z","submitted_at":"2022-03-16T19:54:35Z","title":"Memorizing Transformers","version":1},"cited_work":{"arxiv_id":"2203.08913","doi":null,"metadata_source":"pith","pith_arxiv_id":"2203.08913","snapshot_observed_at":"2026-07-10T01:36:44.169594Z","title":"arXiv preprint arXiv:2203.08913 , year =","venue":"cs.LG","work_id":"bdf3b953-d673-4dec-a588-e1e3613ee7fd","year":2022},"citing_paper":{"arxiv_id":"2605.05066","last_updated":"2026-08-06T14:35:06Z","snapshot_observed_at":"2026-08-09T17:12:09.321853Z","submitted_at":"2026-05-06T16:01:43Z","title":"The Impossibility Triangle of Long-Context Modeling","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-08T17:17:44.033300Z"},"links":{"cited_paper":"/paper/2203.08913","citing_paper":"/paper/2605.05066"},"observation_digest":"sha256:81b4dd6ba59a2f90fd5d7ab949f518762fba110c9ef8efe5b04ea54ad07fbf80","observation_id":"b1e73572-dc42-4a1d-88f6-133708228c26","resolution":{"observed_at":"2026-05-11T17:41:09.036970Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.08913","last_updated":"2022-03-16T19:54:35Z","snapshot_observed_at":"2026-08-05T11:47:40.727016Z","submitted_at":"2022-03-16T19:54:35Z","title":"Memorizing Transformers","version":1},"cited_work":{"arxiv_id":"2203.08913","doi":null,"metadata_source":"pith","pith_arxiv_id":"2203.08913","snapshot_observed_at":"2026-07-10T01:36:44.169594Z","title":"arXiv preprint arXiv:2203.08913 , year =","venue":"cs.LG","work_id":"bdf3b953-d673-4dec-a588-e1e3613ee7fd","year":2022},"citing_paper":{"arxiv_id":"2605.06225","last_updated":"2026-05-09T16:46:54Z","snapshot_observed_at":"2026-08-08T19:29:40.390746Z","submitted_at":"2026-05-07T13:19:33Z","title":"Memory Inception: Latent-Space KV Cache Manipulation for Steering LLMs","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-05-08T13:28:41.166652Z"},"links":{"cited_paper":"/paper/2203.08913","citing_paper":"/paper/2605.06225"},"observation_digest":"sha256:07f2127661c812217f331eadde9ba5fd02a3a55a9381fb0728f8a94b4ae4d1bd","observation_id":"6056ec8d-97aa-44f3-99d4-5e248d038cbf","resolution":{"observed_at":"2026-05-11T18:56:05.733395Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.08913","last_updated":"2022-03-16T19:54:35Z","snapshot_observed_at":"2026-08-05T11:47:40.727016Z","submitted_at":"2022-03-16T19:54:35Z","title":"Memorizing Transformers","version":1},"cited_work":{"arxiv_id":"2203.08913","doi":null,"metadata_source":"pith","pith_arxiv_id":"2203.08913","snapshot_observed_at":"2026-07-10T01:36:44.169594Z","title":"arXiv preprint arXiv:2203.08913 , year =","venue":"cs.LG","work_id":"bdf3b953-d673-4dec-a588-e1e3613ee7fd","year":2022},"citing_paper":{"arxiv_id":"2605.06225","last_updated":"2026-05-09T16:46:54Z","snapshot_observed_at":"2026-08-08T19:29:40.390746Z","submitted_at":"2026-05-07T13:19:33Z","title":"Memory Inception: Latent-Space KV Cache Manipulation for Steering LLMs","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-05-12T01:58:30.870257Z"},"links":{"cited_paper":"/paper/2203.08913","citing_paper":"/paper/2605.06225"},"observation_digest":"sha256:8b05bdc3d5b6ba7e60d94f9ed8eaee90fae5c835861e88d7cb274479e308f2e0","observation_id":"20c36037-b55a-4aa4-b10f-5d84e32366aa","resolution":{"observed_at":"2026-05-12T02:01:15.336088Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.08913","last_updated":"2022-03-16T19:54:35Z","snapshot_observed_at":"2026-08-05T11:47:40.727016Z","submitted_at":"2022-03-16T19:54:35Z","title":"Memorizing Transformers","version":1},"cited_work":{"arxiv_id":"2203.08913","doi":null,"metadata_source":"pith","pith_arxiv_id":"2203.08913","snapshot_observed_at":"2026-07-10T01:36:44.169594Z","title":"arXiv preprint arXiv:2203.08913 , year =","venue":"cs.LG","work_id":"bdf3b953-d673-4dec-a588-e1e3613ee7fd","year":2022},"citing_paper":{"arxiv_id":"2605.10993","last_updated":"2026-05-09T13:06:33Z","snapshot_observed_at":"2026-07-06T23:22:52.369277Z","submitted_at":"2026-05-09T13:06:33Z","title":"ECHO: Continuous Hierarchical Memory for Vision-Language-Action Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-13T07:12:18.252249Z"},"links":{"cited_paper":"/paper/2203.08913","citing_paper":"/paper/2605.10993"},"observation_digest":"sha256:9575639e0e06ff0a9926d88755308491a2032aea7019e144044af4b66484862c","observation_id":"d27f00c1-828e-4198-9853-cb77ae41fb0f","resolution":{"observed_at":"2026-05-13T07:12:27.834282Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.08913","last_updated":"2022-03-16T19:54:35Z","snapshot_observed_at":"2026-08-05T11:47:40.727016Z","submitted_at":"2022-03-16T19:54:35Z","title":"Memorizing Transformers","version":1},"cited_work":{"arxiv_id":"2203.08913","doi":null,"metadata_source":"pith","pith_arxiv_id":"2203.08913","snapshot_observed_at":"2026-07-10T01:36:44.169594Z","title":"arXiv preprint arXiv:2203.08913 , year =","venue":"cs.LG","work_id":"bdf3b953-d673-4dec-a588-e1e3613ee7fd","year":2022},"citing_paper":{"arxiv_id":"2605.13370","last_updated":"2026-05-13T11:28:06Z","snapshot_observed_at":"2026-08-03T02:10:50.275997Z","submitted_at":"2026-05-13T11:28:06Z","title":"Phasor Memory Networks: Stable Backpropagation Through Time for Scalable Explicit Memory","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-14T20:36:12.321162Z"},"links":{"cited_paper":"/paper/2203.08913","citing_paper":"/paper/2605.13370"},"observation_digest":"sha256:3871ca07801bb37325a20698738e7e5df6486926e157b4a43a552988a89c8f57","observation_id":"e7ef4dd4-3f60-42e0-b59f-a058e1dcef36","resolution":{"observed_at":"2026-05-14T20:39:26.897332Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.08913","last_updated":"2022-03-16T19:54:35Z","snapshot_observed_at":"2026-08-05T11:47:40.727016Z","submitted_at":"2022-03-16T19:54:35Z","title":"Memorizing Transformers","version":1},"cited_work":{"arxiv_id":"2203.08913","doi":null,"metadata_source":"pith","pith_arxiv_id":"2203.08913","snapshot_observed_at":"2026-07-10T01:36:44.169594Z","title":"arXiv preprint arXiv:2203.08913 , year =","venue":"cs.LG","work_id":"bdf3b953-d673-4dec-a588-e1e3613ee7fd","year":2022},"citing_paper":{"arxiv_id":"2605.16893","last_updated":"2026-05-16T09:12:52Z","snapshot_observed_at":"2026-08-01T19:24:03.890902Z","submitted_at":"2026-05-16T09:12:52Z","title":"NGM: A Plug-and-Play Training-Free Memory Module for LLMs","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-19T20:47:50.356747Z"},"links":{"cited_paper":"/paper/2203.08913","citing_paper":"/paper/2605.16893"},"observation_digest":"sha256:378d0d7551cc71b269b5e2c525b54aabb0c0262a5d4edc70d3f85451b7679246","observation_id":"58702c8f-8d33-4def-a6eb-1b822024e3c7","resolution":{"observed_at":"2026-05-19T20:52:46.316062Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.08913","last_updated":"2022-03-16T19:54:35Z","snapshot_observed_at":"2026-08-05T11:47:40.727016Z","submitted_at":"2022-03-16T19:54:35Z","title":"Memorizing Transformers","version":1},"cited_work":{"arxiv_id":"2203.08913","doi":null,"metadata_source":"pith","pith_arxiv_id":"2203.08913","snapshot_observed_at":"2026-07-10T01:36:44.169594Z","title":"arXiv preprint arXiv:2203.08913 , year =","venue":"cs.LG","work_id":"bdf3b953-d673-4dec-a588-e1e3613ee7fd","year":2022},"citing_paper":{"arxiv_id":"2605.22884","last_updated":"2026-05-21T00:21:51Z","snapshot_observed_at":"2026-08-09T03:17:27.707172Z","submitted_at":"2026-05-21T00:21:51Z","title":"Tensor Cache: Eviction-conditioned Associative Memory for Transformers","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-05-25T05:49:43.160574Z"},"links":{"cited_paper":"/paper/2203.08913","citing_paper":"/paper/2605.22884"},"observation_digest":"sha256:97adae4bc7297294ab925118da6e759c7837c91635e31df6167aeef7a8a63b67","observation_id":"ca1660a1-f860-4ab1-aba1-bc8968b0ae84","resolution":{"observed_at":"2026-05-25T05:50:23.529272Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.08913","last_updated":"2022-03-16T19:54:35Z","snapshot_observed_at":"2026-08-05T11:47:40.727016Z","submitted_at":"2022-03-16T19:54:35Z","title":"Memorizing Transformers","version":1},"cited_work":{"arxiv_id":"2203.08913","doi":null,"metadata_source":"pith","pith_arxiv_id":"2203.08913","snapshot_observed_at":"2026-07-10T01:36:44.169594Z","title":"arXiv preprint arXiv:2203.08913 , year =","venue":"cs.LG","work_id":"bdf3b953-d673-4dec-a588-e1e3613ee7fd","year":2022},"citing_paper":{"arxiv_id":"2605.24051","last_updated":"2026-05-22T00:12:38Z","snapshot_observed_at":"2026-07-06T23:34:08.786038Z","submitted_at":"2026-05-22T00:12:38Z","title":"Memento: Personalized RAG-Style Long-Retention Data Scaling for META Ads Recommendation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-30T15:22:12.675862Z"},"links":{"cited_paper":"/paper/2203.08913","citing_paper":"/paper/2605.24051"},"observation_digest":"sha256:507c4709099e556120a228b4ac7449341a677fb3243bdde0d473ec8beb1aaceb","observation_id":"168c4908-7611-410f-bb4e-3bc5736b2d71","resolution":{"observed_at":"2026-06-30T15:24:49.899023Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.08913","last_updated":"2022-03-16T19:54:35Z","snapshot_observed_at":"2026-08-05T11:47:40.727016Z","submitted_at":"2022-03-16T19:54:35Z","title":"Memorizing Transformers","version":1},"cited_work":{"arxiv_id":"2203.08913","doi":null,"metadata_source":"pith","pith_arxiv_id":"2203.08913","snapshot_observed_at":"2026-07-10T01:36:44.169594Z","title":"arXiv preprint arXiv:2203.08913 , year =","venue":"cs.LG","work_id":"bdf3b953-d673-4dec-a588-e1e3613ee7fd","year":2022},"citing_paper":{"arxiv_id":"2605.24930","last_updated":"2026-05-24T08:22:05Z","snapshot_observed_at":"2026-08-06T09:55:24.394174Z","submitted_at":"2026-05-24T08:22:05Z","title":"H$^{2}$MT: Semantic Hierarchy-Aware Hierarchical Memory Transformer","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-30T12:26:57.520047Z"},"links":{"cited_paper":"/paper/2203.08913","citing_paper":"/paper/2605.24930"},"observation_digest":"sha256:0d59f105c407dad0db43acb357d65d076fb68b50914dc1508df5b52f499f7c9b","observation_id":"60568943-9e8b-489b-b824-5e762e5f88f5","resolution":{"observed_at":"2026-06-30T12:34:38.995626Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.08913","last_updated":"2022-03-16T19:54:35Z","snapshot_observed_at":"2026-08-05T11:47:40.727016Z","submitted_at":"2022-03-16T19:54:35Z","title":"Memorizing Transformers","version":1},"cited_work":{"arxiv_id":"2203.08913","doi":null,"metadata_source":"pith","pith_arxiv_id":"2203.08913","snapshot_observed_at":"2026-07-10T01:36:44.169594Z","title":"arXiv preprint arXiv:2203.08913 , year =","venue":"cs.LG","work_id":"bdf3b953-d673-4dec-a588-e1e3613ee7fd","year":2022},"citing_paper":{"arxiv_id":"2605.26797","last_updated":"2026-05-26T10:10:26Z","snapshot_observed_at":"2026-08-02T14:13:01.459974Z","submitted_at":"2026-05-26T10:10:26Z","title":"Latent Recurrent Transformer: Architecture Exploration, Training Strategies, and Scaling Behavior","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-29T19:36:13.559393Z"},"links":{"cited_paper":"/paper/2203.08913","citing_paper":"/paper/2605.26797"},"observation_digest":"sha256:14dbe00f88c6902abc337f01facce8a37b2fd4720f059f05eac25e38fae590ac","observation_id":"3f0b871a-b078-46b8-92de-780ac6053677","resolution":{"observed_at":"2026-06-29T19:43:54.966815Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.08913","last_updated":"2022-03-16T19:54:35Z","snapshot_observed_at":"2026-08-05T11:47:40.727016Z","submitted_at":"2022-03-16T19:54:35Z","title":"Memorizing Transformers","version":1},"cited_work":{"arxiv_id":"2203.08913","doi":null,"metadata_source":"pith","pith_arxiv_id":"2203.08913","snapshot_observed_at":"2026-07-10T01:36:44.169594Z","title":"arXiv preprint arXiv:2203.08913 , year =","venue":"cs.LG","work_id":"bdf3b953-d673-4dec-a588-e1e3613ee7fd","year":2022},"citing_paper":{"arxiv_id":"2606.20737","last_updated":"2026-06-23T11:42:49Z","snapshot_observed_at":"2026-08-08T19:22:18.275069Z","submitted_at":"2026-06-17T15:52:08Z","title":"Repeated Shared Access Enables Grokking, but Edit Propagation Depends on an Addressable Memory","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-26T20:43:55.740662Z"},"links":{"cited_paper":"/paper/2203.08913","citing_paper":"/paper/2606.20737"},"observation_digest":"sha256:b81b639a472f4bbc0b3a832bfd95af225ad847f066654889f4f7e15d86769fa3","observation_id":"6d528be4-19eb-4583-98b0-40ff6ce78920","resolution":{"observed_at":"2026-07-04T01:09:18.546200Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.08913","last_updated":"2022-03-16T19:54:35Z","snapshot_observed_at":"2026-08-05T11:47:40.727016Z","submitted_at":"2022-03-16T19:54:35Z","title":"Memorizing Transformers","version":1},"cited_work":{"arxiv_id":"2203.08913","doi":null,"metadata_source":"pith","pith_arxiv_id":"2203.08913","snapshot_observed_at":"2026-07-10T01:36:44.169594Z","title":"arXiv preprint arXiv:2203.08913 , year =","venue":"cs.LG","work_id":"bdf3b953-d673-4dec-a588-e1e3613ee7fd","year":2022},"citing_paper":{"arxiv_id":"2606.28876","last_updated":"2026-07-10T02:16:42Z","snapshot_observed_at":"2026-07-15T23:17:48.998907Z","submitted_at":"2026-06-27T11:38:43Z","title":"Memory-Managed Long-Context Attention: Bounded Editable Memory with a Hard Lifecycle and Calibrated Sparse Fallback","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-30T09:46:57.030469Z"},"links":{"cited_paper":"/paper/2203.08913","citing_paper":"/paper/2606.28876"},"observation_digest":"sha256:5c27e04234bcfb6ea001ef1fa1d56357822fadcdf63de9c608ebd9456e90e8c7","observation_id":"2b2022c0-a5eb-43b0-868a-777baa5fd57c","resolution":{"observed_at":"2026-06-30T09:54:35.254998Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.08913","last_updated":"2022-03-16T19:54:35Z","snapshot_observed_at":"2026-08-05T11:47:40.727016Z","submitted_at":"2022-03-16T19:54:35Z","title":"Memorizing Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.08913","snapshot_observed_at":"2026-07-13T07:16:45.194991Z","title":"Rabe, DeLesley Hutchins, and Christian Szegedy","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.28876","last_updated":"2026-07-10T02:16:42Z","snapshot_observed_at":"2026-07-15T23:17:48.998907Z","submitted_at":"2026-06-27T11:38:43Z","title":"Memory-Managed Long-Context Attention: Bounded Editable Memory with a Hard Lifecycle and Calibrated Sparse Fallback","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-13T07:16:45.194991Z"},"links":{"cited_paper":"/paper/2203.08913","citing_paper":"/paper/2606.28876"},"observation_digest":"sha256:2a6016fe5952b7e7e24c8f6cbd2b01c6a16e6c209827266e0166e8db1b4f65f0","observation_id":"60a0a399-6540-4672-9b68-bbdeabad8568","resolution":{"observed_at":"2026-07-13T07:16:45.194991Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.08913","last_updated":"2022-03-16T19:54:35Z","snapshot_observed_at":"2026-08-05T11:47:40.727016Z","submitted_at":"2022-03-16T19:54:35Z","title":"Memorizing Transformers","version":1},"cited_work":{"arxiv_id":"2203.08913","doi":null,"metadata_source":"pith","pith_arxiv_id":"2203.08913","snapshot_observed_at":"2026-07-10T01:36:44.169594Z","title":"arXiv preprint arXiv:2203.08913 , year =","venue":"cs.LG","work_id":"bdf3b953-d673-4dec-a588-e1e3613ee7fd","year":2022},"citing_paper":{"arxiv_id":"2607.02010","last_updated":"2026-07-02T10:45:28Z","snapshot_observed_at":"2026-07-07T00:07:28.231599Z","submitted_at":"2026-07-02T10:45:28Z","title":"InduceKV: Fixed-Footprint Continual Adaptation of Multimodal LLMs via Inducing KV Memories","version":1},"reference_index":203,"source":"arxiv_source","source_observed_at":"2026-07-03T13:43:07.756716Z"},"links":{"cited_paper":"/paper/2203.08913","citing_paper":"/paper/2607.02010"},"observation_digest":"sha256:2c363a24b42a8e3cb9a7347ad96c6b88d5396c6b8484e623755e0cbfaa4d21dc","observation_id":"67b9b039-226f-4de6-937c-5e233f910cf0","resolution":{"observed_at":"2026-07-03T13:48:20.412132Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.08913","last_updated":"2022-03-16T19:54:35Z","snapshot_observed_at":"2026-08-05T11:47:40.727016Z","submitted_at":"2022-03-16T19:54:35Z","title":"Memorizing Transformers","version":1},"cited_work":{"arxiv_id":"2203.08913","doi":null,"metadata_source":"pith","pith_arxiv_id":"2203.08913","snapshot_observed_at":"2026-07-10T01:36:44.169594Z","title":"arXiv preprint arXiv:2203.08913 , year =","venue":"cs.LG","work_id":"bdf3b953-d673-4dec-a588-e1e3613ee7fd","year":2022},"citing_paper":{"arxiv_id":"2607.02303","last_updated":"2026-07-02T15:19:49Z","snapshot_observed_at":"2026-07-07T00:07:47.719699Z","submitted_at":"2026-07-02T15:19:49Z","title":"A Hippocampus for Linear Attention: An Exact Memory for What the Recurrent State Forgets","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-03T13:46:18.862925Z"},"links":{"cited_paper":"/paper/2203.08913","citing_paper":"/paper/2607.02303"},"observation_digest":"sha256:5d0fdd01f4931de3471b43e959222e54ca16d1049d90929c5b0cf15f530b04e9","observation_id":"2229399f-ba83-41a4-a8aa-78f8d4d90011","resolution":{"observed_at":"2026-07-03T13:48:20.313713Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.08913","last_updated":"2022-03-16T19:54:35Z","snapshot_observed_at":"2026-08-05T11:47:40.727016Z","submitted_at":"2022-03-16T19:54:35Z","title":"Memorizing Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.08913","snapshot_observed_at":"2026-07-12T04:35:49.701061Z","title":"arXiv preprint arXiv:2203.08913 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03143","last_updated":"2026-07-03T09:32:01Z","snapshot_observed_at":"2026-08-06T13:28:44.113197Z","submitted_at":"2026-07-03T09:32:01Z","title":"Text as Partial Constraint: Core-Residual Alignment for Robust Vision-Language Learning","version":1},"reference_index":227,"source":"arxiv_source","source_observed_at":"2026-07-12T04:35:49.701061Z"},"links":{"cited_paper":"/paper/2203.08913","citing_paper":"/paper/2607.03143"},"observation_digest":"sha256:3a1cfdb7ced5ad1e0fe8108695d3d76d4e12f20dc41c15908f8005af29bfbb91","observation_id":"db58653d-51cd-4c20-a9fa-02980085c1cc","resolution":{"observed_at":"2026-07-12T04:35:49.701061Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.08913","last_updated":"2022-03-16T19:54:35Z","snapshot_observed_at":"2026-08-05T11:47:40.727016Z","submitted_at":"2022-03-16T19:54:35Z","title":"Memorizing Transformers","version":1},"cited_work":{"arxiv_id":"2203.08913","doi":null,"metadata_source":"pith","pith_arxiv_id":"2203.08913","snapshot_observed_at":"2026-07-10T01:36:44.169594Z","title":"arXiv preprint arXiv:2203.08913 , year =","venue":"cs.LG","work_id":"bdf3b953-d673-4dec-a588-e1e3613ee7fd","year":2022},"citing_paper":{"arxiv_id":"2607.08032","last_updated":"2026-07-09T01:15:03Z","snapshot_observed_at":"2026-08-02T16:38:21.894642Z","submitted_at":"2026-07-09T01:15:03Z","title":"What to Keep, What to Forget: A Rate--Distortion View of Memory Compaction in LLMs and Agents","version":1},"reference_index":128,"source":"pdf_text","source_observed_at":"2026-07-10T01:26:59.421158Z"},"links":{"cited_paper":"/paper/2203.08913","citing_paper":"/paper/2607.08032"},"observation_digest":"sha256:a5b26489d4e87b61548eb4320d38057ca983566480a4fc839d46e6b3257ec571","observation_id":"32816f83-d19c-468f-8f7e-bcb24463ee58","resolution":{"observed_at":"2026-07-10T01:36:44.170655Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.08913","last_updated":"2022-03-16T19:54:35Z","snapshot_observed_at":"2026-08-05T11:47:40.727016Z","submitted_at":"2022-03-16T19:54:35Z","title":"Memorizing Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.08913","snapshot_observed_at":"2026-07-14T14:50:03.831572Z","title":"[Xiao et al.(2024)] G","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.09889","last_updated":"2026-07-10T18:28:21Z","snapshot_observed_at":"2026-08-02T12:00:29.141267Z","submitted_at":"2026-07-10T18:28:21Z","title":"Remembering Distinct Items, Not Tokens: A Learnable Dirichlet-Process Cache Between State-Space Models and Attention","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-14T14:50:03.831572Z"},"links":{"cited_paper":"/paper/2203.08913","citing_paper":"/paper/2607.09889"},"observation_digest":"sha256:4d33f3c8013bf909dc7977a670f192ba6beecac0a39ef69a920fafcea5799916","observation_id":"b1876493-7afc-479b-bd98-11881ec25a72","resolution":{"observed_at":"2026-07-14T14:50:03.831572Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.08913","last_updated":"2022-03-16T19:54:35Z","snapshot_observed_at":"2026-08-05T11:47:40.727016Z","submitted_at":"2022-03-16T19:54:35Z","title":"Memorizing Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.08913","snapshot_observed_at":"2026-07-14T04:23:21.000846Z","title":"arXiv preprint arXiv:2203.08913 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.11614","last_updated":"2026-07-13T14:37:24Z","snapshot_observed_at":"2026-08-07T12:33:44.646398Z","submitted_at":"2026-07-13T14:37:24Z","title":"Extending LLM Context via Associative Recurrent Memory","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-07-14T04:23:21.000846Z"},"links":{"cited_paper":"/paper/2203.08913","citing_paper":"/paper/2607.11614"},"observation_digest":"sha256:27691c8b15edb36a43d3c4c00ab4cb2d84869e7b2d981e1a237f3c6e6ce8bffe","observation_id":"e024716c-986f-4b68-93f2-ec8900c24652","resolution":{"observed_at":"2026-07-14T04:23:21.000846Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.08913","last_updated":"2022-03-16T19:54:35Z","snapshot_observed_at":"2026-08-05T11:47:40.727016Z","submitted_at":"2022-03-16T19:54:35Z","title":"Memorizing Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.08913","snapshot_observed_at":"2026-08-01T09:25:24.808694Z","title":"Rabe, DeLesley Hutchins, and Christian Szegedy","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.20792","last_updated":"2026-07-22T23:34:56Z","snapshot_observed_at":"2026-08-03T08:26:10.984255Z","submitted_at":"2026-07-22T23:34:56Z","title":"Memoir: Should a Model Write to Its Memory While It Thinks?","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-01T09:25:24.808694Z"},"links":{"cited_paper":"/paper/2203.08913","citing_paper":"/paper/2607.20792"},"observation_digest":"sha256:7d819094ad88523b0c252040c7d8d0b77491decd26b7793a3b4730d259be83a0","observation_id":"66b9649c-6ff1-45cd-b1fe-220fa1d481c6","resolution":{"observed_at":"2026-08-01T09:25:24.808694Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.08913","last_updated":"2022-03-16T19:54:35Z","snapshot_observed_at":"2026-08-05T11:47:40.727016Z","submitted_at":"2022-03-16T19:54:35Z","title":"Memorizing Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.08913","snapshot_observed_at":"2026-08-01T01:59:49.839575Z","title":"Memorizing transformers","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25614","last_updated":"2026-07-28T11:45:34Z","snapshot_observed_at":"2026-08-09T01:33:49.293526Z","submitted_at":"2026-07-28T11:45:34Z","title":"MemSFT: Mitigating Alignment Tax with an External Parametric Memory","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-01T01:59:49.839575Z"},"links":{"cited_paper":"/paper/2203.08913","citing_paper":"/paper/2607.25614"},"observation_digest":"sha256:ab7b859859ef77556d7157321a6a02774788268d3749718328dfa5eeb7ca2997","observation_id":"df9d31c1-994e-48a6-85b2-5cb092d4baed","resolution":{"observed_at":"2026-08-01T01:59:49.839575Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.08913","last_updated":"2022-03-16T19:54:35Z","snapshot_observed_at":"2026-08-05T11:47:40.727016Z","submitted_at":"2022-03-16T19:54:35Z","title":"Memorizing Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.08913","snapshot_observed_at":"2026-08-08T11:36:53.781579Z","title":"N.; Hutchins, D.; and Szegedy, C","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.05523","last_updated":"2026-08-06T02:01:05Z","snapshot_observed_at":"2026-08-09T17:14:37.183274Z","submitted_at":"2026-08-06T02:01:05Z","title":"HERA: Historical Evidence Routing Adapter for Physical Prediction in Latent World Models","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-08T11:36:53.781579Z"},"links":{"cited_paper":"/paper/2203.08913","citing_paper":"/paper/2608.05523"},"observation_digest":"sha256:51412ed17b207792c741a000bf9c91d77b01a04b4a659f5e5cae641243d1bee2","observation_id":"78765031-8d68-4a7f-8125-e61cae75996d","resolution":{"observed_at":"2026-08-08T11:36:53.781579Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2203.08913/citation-record","integrity":"/paper/2203.08913/integrity","json":"/paper/2203.08913/citation-record.json","paper":"/paper/2203.08913"},"outbound":[],"paper":{"arxiv_id":"2203.08913","last_updated":"2022-03-16T19:54:35Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-05T11:47:40.727016Z","submitted_at":"2022-03-16T19:54:35Z","title":"Memorizing Transformers"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 33 inbound Pith citation observations for arXiv:2203.08913."}