{"as_of":"2026-08-20T06:52:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:1cc9c84849dbe0df5368bf6985108b10bbffe46f7060ef25584b357410736f09","coverage":[{"denominator":37,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":37,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T10:31:02.370982Z","state":"measured"},{"denominator":38,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":38,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-20T06:33:59.587034+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-14T04:23:21.000846Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.05229","last_updated":"2025-06-05T16:43:48Z","snapshot_observed_at":"2026-08-15T06:02:03.903854Z","submitted_at":"2025-06-05T16:43:48Z","title":"Diagonal Batching Unlocks Parallelism in Recurrent Memory Transformers for Long Contexts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.05229","snapshot_observed_at":"2026-07-14T04:23:21.000846Z","title":"arXiv preprint arXiv:2506.05229 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.11614","last_updated":"2026-07-13T14:37:24Z","snapshot_observed_at":"2026-08-15T06:02:40.856312Z","submitted_at":"2026-07-13T14:37:24Z","title":"Extending LLM Context via Associative Recurrent Memory","version":1},"reference_index":94,"source":"arxiv_source","source_observed_at":"2026-07-14T04:23:21.000846Z"},"links":{"cited_paper":"/paper/2506.05229","citing_paper":"/paper/2607.11614"},"observation_digest":"sha256:562db24c81893da0d77c1856fbf40745b07b79d16c59087af0a56b41b587d6ee","observation_id":"6e868c84-9a6f-493c-87e8-54a3935ed209","resolution":{"observed_at":"2026-07-14T04:23:21.000846Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.05229/citation-record","integrity":"/paper/2506.05229/integrity","json":"/paper/2506.05229/citation-record.json","paper":"/paper/2506.05229"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:31:02.261636Z","title":"Gqa: Training generalized multi-query transformer models from multi-head checkpoints","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.05229","last_updated":"2025-06-05T16:43:48Z","snapshot_observed_at":"2026-08-15T06:02:03.903854Z","submitted_at":"2025-06-05T16:43:48Z","title":"Diagonal Batching Unlocks Parallelism in Recurrent Memory Transformers for Long Contexts","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T10:31:02.261636Z"},"links":{"citing_paper":"/paper/2506.05229"},"observation_digest":"sha256:babef69158b8fd9ce086081726f2ec07fe11e2249103821f4d8527879e407ea6","observation_id":"9c374f95-e3d6-4386-a013-da46aa320767","resolution":{"observed_at":"2026-08-07T10:31:02.261636Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:31:02.701114Z","title":"Beyond attention: Breaking the limits of transformer context length with recurrent memory.Proceedings of the AAAI Conference on Artificial Intelligence, 38(16):17700–17708, Mar","venue":null,"work_id":"1ebbc9b9-65d9-44c0-99e3-8e0291d99116","year":2024},"citing_paper":{"arxiv_id":"2506.05229","last_updated":"2025-06-05T16:43:48Z","snapshot_observed_at":"2026-08-15T06:02:03.903854Z","submitted_at":"2025-06-05T16:43:48Z","title":"Diagonal Batching Unlocks Parallelism in Recurrent Memory Transformers for Long Contexts","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T10:31:02.265288Z"},"links":{"citing_paper":"/paper/2506.05229"},"observation_digest":"sha256:c341bc5568692f6b65fcbbcde8e13946578f3ced3ca0ced82ad6fbbd5a2e46e1","observation_id":"d25c1ec0-8669-4a9c-ac03-7a5797cc5036","resolution":{"observed_at":"2026-08-07T10:31:02.704827Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:31:02.268284Z","title":"Recurrent memory transformer.Advances in Neural Information Processing Systems, 35:11079–11091, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.05229","last_updated":"2025-06-05T16:43:48Z","snapshot_observed_at":"2026-08-15T06:02:03.903854Z","submitted_at":"2025-06-05T16:43:48Z","title":"Diagonal Batching Unlocks Parallelism in Recurrent Memory Transformers for Long Contexts","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T10:31:02.268284Z"},"links":{"citing_paper":"/paper/2506.05229"},"observation_digest":"sha256:7070645ecfb82ef5c3bc522bcd7f45cee9dc647d84cda115e73e3bdeb07ccdfa","observation_id":"4207d493-347a-4c55-ba5b-7be557c38d82","resolution":{"observed_at":"2026-08-07T10:31:02.268284Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:31:02.686094Z","title":"Transformer-XL: Attentive language models beyond a fixed-length context","venue":null,"work_id":"7f766239-1aa0-4a54-b3ee-2dad6afa340b","year":2019},"citing_paper":{"arxiv_id":"2506.05229","last_updated":"2025-06-05T16:43:48Z","snapshot_observed_at":"2026-08-15T06:02:03.903854Z","submitted_at":"2025-06-05T16:43:48Z","title":"Diagonal Batching Unlocks Parallelism in Recurrent Memory Transformers for Long Contexts","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T10:31:02.271595Z"},"links":{"citing_paper":"/paper/2506.05229"},"observation_digest":"sha256:2d5e4543092258a58461f342abfca1524f3f7de923b0613d1d141afc8d4b1ec5","observation_id":"c0f5ae5d-3fb9-4a5f-a95e-5094e969e936","resolution":{"observed_at":"2026-08-07T10:31:02.689314Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:31:02.274470Z","title":"FlashAttention-2: Faster attention with better parallelism and work partitioning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05229","last_updated":"2025-06-05T16:43:48Z","snapshot_observed_at":"2026-08-15T06:02:03.903854Z","submitted_at":"2025-06-05T16:43:48Z","title":"Diagonal Batching Unlocks Parallelism in Recurrent Memory Transformers for Long Contexts","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T10:31:02.274470Z"},"links":{"citing_paper":"/paper/2506.05229"},"observation_digest":"sha256:28df42d17aaf9d9c165234bd80f786fcd4041fa0f45985fe4aef53d729a35eca","observation_id":"659f308c-5d9b-45a7-b5b8-dd8a7bc1485c","resolution":{"observed_at":"2026-08-07T10:31:02.274470Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:31:02.278285Z","title":"Fu, Stefano Ermon, Atri Rudra, and Christopher Ré","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.05229","last_updated":"2025-06-05T16:43:48Z","snapshot_observed_at":"2026-08-15T06:02:03.903854Z","submitted_at":"2025-06-05T16:43:48Z","title":"Diagonal Batching Unlocks Parallelism in Recurrent Memory Transformers for Long Contexts","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T10:31:02.278285Z"},"links":{"citing_paper":"/paper/2506.05229"},"observation_digest":"sha256:96d0afccf4dfb24caf7f04844ab252f3ab307f62dca2fd48b8b6f37e7c9dfdb6","observation_id":"0d966adf-d81c-4b1e-b872-e3777f264d6b","resolution":{"observed_at":"2026-08-07T10:31:02.278285Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:31:02.281602Z","title":"Transformers are ssms: Generalized models and efficient algorithms through structured state space duality","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05229","last_updated":"2025-06-05T16:43:48Z","snapshot_observed_at":"2026-08-15T06:02:03.903854Z","submitted_at":"2025-06-05T16:43:48Z","title":"Diagonal Batching Unlocks Parallelism in Recurrent Memory Transformers for Long Contexts","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T10:31:02.281602Z"},"links":{"citing_paper":"/paper/2506.05229"},"observation_digest":"sha256:bea2874133d5f6fd4ebd3046b26d2507e7fb612ce218a37fc6667ef521abdb9b","observation_id":"9e69cc6b-8429-4fcf-beaf-703d096346a2","resolution":{"observed_at":"2026-08-07T10:31:02.281602Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:31:02.284382Z","title":"BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.05229","last_updated":"2025-06-05T16:43:48Z","snapshot_observed_at":"2026-08-15T06:02:03.903854Z","submitted_at":"2025-06-05T16:43:48Z","title":"Diagonal Batching Unlocks Parallelism in Recurrent Memory Transformers for Long Contexts","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T10:31:02.284382Z"},"links":{"citing_paper":"/paper/2506.05229"},"observation_digest":"sha256:415903f12222bf35f1596010afc02e29f2518938269f99f3aaff88a9e1f2308d","observation_id":"63e6efe4-47ff-4d86-96d6-56b831c19b84","resolution":{"observed_at":"2026-08-07T10:31:02.284382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.17323","last_updated":"2023-03-22T13:10:47Z","snapshot_observed_at":"2026-08-16T07:57:19.216626Z","submitted_at":"2022-10-31T13:42:40Z","title":"GPTQ: Accurate Post-Training Quantization for Generative Pre-trained Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.17323","snapshot_observed_at":"2026-08-07T10:31:02.290391Z","title":"GPTQ: Accurate post-training compression for generative pretrained transformers.arXiv preprint arXiv:2210.17323, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.05229","last_updated":"2025-06-05T16:43:48Z","snapshot_observed_at":"2026-08-15T06:02:03.903854Z","submitted_at":"2025-06-05T16:43:48Z","title":"Diagonal Batching Unlocks Parallelism in Recurrent Memory Transformers for Long Contexts","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T10:31:02.290391Z"},"links":{"cited_paper":"/paper/2210.17323","citing_paper":"/paper/2506.05229"},"observation_digest":"sha256:6f445516db93f194f56dd8b691313ae8aeffef71f9d3d841139c152949250df0","observation_id":"0dc6912a-8e4f-49e1-8186-aa6258447905","resolution":{"observed_at":"2026-08-07T10:31:02.290391Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-07T10:31:02.293278Z","title":"The llama 3 herd of models.arXiv preprint arXiv:2407.21783, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05229","last_updated":"2025-06-05T16:43:48Z","snapshot_observed_at":"2026-08-15T06:02:03.903854Z","submitted_at":"2025-06-05T16:43:48Z","title":"Diagonal Batching Unlocks Parallelism in Recurrent Memory Transformers for Long Contexts","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T10:31:02.293278Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2506.05229"},"observation_digest":"sha256:e07ed8bd39ee0382ad485fff7c87c5087d6ce183e174a75615757f81da5ee857","observation_id":"51970a9b-c773-4e5b-bb8a-4b182f3fecec","resolution":{"observed_at":"2026-08-07T10:31:02.293278Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.00752","last_updated":"2024-05-31T17:55:27Z","snapshot_observed_at":"2026-08-17T20:47:46.242385Z","submitted_at":"2023-12-01T18:01:34Z","title":"Mamba: Linear-Time Sequence Modeling with Selective State Spaces","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.00752","snapshot_observed_at":"2026-08-07T10:31:02.296240Z","title":"Mamba: Linear-time sequence modeling with selective state spaces","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.05229","last_updated":"2025-06-05T16:43:48Z","snapshot_observed_at":"2026-08-15T06:02:03.903854Z","submitted_at":"2025-06-05T16:43:48Z","title":"Diagonal Batching Unlocks Parallelism in Recurrent Memory Transformers for Long Contexts","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T10:31:02.296240Z"},"links":{"cited_paper":"/paper/2312.00752","citing_paper":"/paper/2506.05229"},"observation_digest":"sha256:1ded5c8e5392d1d178c699268c72fc990feb218c68111282c39a1dfe68f0d332","observation_id":"f4d68394-a45a-4269-83a1-47e8e8901c27","resolution":{"observed_at":"2026-08-07T10:31:02.296240Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:31:02.654135Z","title":"Efficiently modeling long sequences with structured state spaces","venue":null,"work_id":"933343b3-8a9b-498f-a310-ed73fe922ab5","year":2021},"citing_paper":{"arxiv_id":"2506.05229","last_updated":"2025-06-05T16:43:48Z","snapshot_observed_at":"2026-08-15T06:02:03.903854Z","submitted_at":"2025-06-05T16:43:48Z","title":"Diagonal Batching Unlocks Parallelism in Recurrent Memory Transformers for Long Contexts","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T10:31:02.299350Z"},"links":{"citing_paper":"/paper/2506.05229"},"observation_digest":"sha256:280ee206dd92f14a3ea6159842ea7d0a32a0f1f3e5f41fb4eaee634e14a2083c","observation_id":"3d6fd564-51f0-4b0b-a66d-81b81589be9e","resolution":{"observed_at":"2026-08-07T10:31:02.657276Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:31:02.645159Z","title":"Block- recurrent transformers","venue":null,"work_id":"3639f925-8384-4e77-8f13-438ad68d5c7c","year":2022},"citing_paper":{"arxiv_id":"2506.05229","last_updated":"2025-06-05T16:43:48Z","snapshot_observed_at":"2026-08-15T06:02:03.903854Z","submitted_at":"2025-06-05T16:43:48Z","title":"Diagonal Batching Unlocks Parallelism in Recurrent Memory Transformers for Long Contexts","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T10:31:02.302546Z"},"links":{"citing_paper":"/paper/2506.05229"},"observation_digest":"sha256:3c8dcaaa9cc3f10b8c3858a3d5cb466942da908b425cca453bce843ad773b9ba","observation_id":"58e1ae87-74e7-490f-937a-497772c33b52","resolution":{"observed_at":"2026-08-07T10:31:02.648133Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.14509","last_updated":"2023-10-04T16:51:13Z","snapshot_observed_at":"2026-08-20T06:29:44.483696Z","submitted_at":"2023-09-25T20:15:57Z","title":"DeepSpeed Ulysses: System Optimizations for Enabling Training of Extreme Long Sequence Transformer Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.14509","snapshot_observed_at":"2026-08-07T10:31:02.305339Z","title":"Deepspeed ulysses: System optimizations for enabling training of extreme long sequence transformer models.arXiv preprint arXiv:2309.14509, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.05229","last_updated":"2025-06-05T16:43:48Z","snapshot_observed_at":"2026-08-15T06:02:03.903854Z","submitted_at":"2025-06-05T16:43:48Z","title":"Diagonal Batching Unlocks Parallelism in Recurrent Memory Transformers for Long Contexts","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T10:31:02.305339Z"},"links":{"cited_paper":"/paper/2309.14509","citing_paper":"/paper/2506.05229"},"observation_digest":"sha256:068e6c702962012d407c5e07ed1bc1521a3a6239dd215d84e5c3afe0dc07c04d","observation_id":"838a27de-ef3e-4c4c-b721-907f0931281c","resolution":{"observed_at":"2026-08-07T10:31:02.305339Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:31:02.635092Z","title":"Repeat after me: Transformers are better than state space models at copying","venue":null,"work_id":"40fa4a06-c818-4459-8839-0ac7d7190c77","year":2024},"citing_paper":{"arxiv_id":"2506.05229","last_updated":"2025-06-05T16:43:48Z","snapshot_observed_at":"2026-08-15T06:02:03.903854Z","submitted_at":"2025-06-05T16:43:48Z","title":"Diagonal Batching Unlocks Parallelism in Recurrent Memory Transformers for Long Contexts","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T10:31:02.308340Z"},"links":{"citing_paper":"/paper/2506.05229"},"observation_digest":"sha256:919bae8ceb614eb27ba9bea23c9ee74d87d90961d0a7826f9935dc6fb2743f75","observation_id":"80358f58-bed7-4a71-b858-2d185d1c7717","resolution":{"observed_at":"2026-08-07T10:31:02.639062Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:31:02.310996Z","title":"Babilong: Testing the limits of llms with long context reasoning-in-a-haystack","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05229","last_updated":"2025-06-05T16:43:48Z","snapshot_observed_at":"2026-08-15T06:02:03.903854Z","submitted_at":"2025-06-05T16:43:48Z","title":"Diagonal Batching Unlocks Parallelism in Recurrent Memory Transformers for Long Contexts","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T10:31:02.310996Z"},"links":{"citing_paper":"/paper/2506.05229"},"observation_digest":"sha256:142caaa9541fe782e961fab6513abdc742fbd16d6c295b583c4e635d99b77369","observation_id":"ff8a7535-4026-4e19-9bf9-41e137e5ab77","resolution":{"observed_at":"2026-08-07T10:31:02.310996Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:31:02.313592Z","title":"xformers: A modular and hack- able transformer modelling library","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.05229","last_updated":"2025-06-05T16:43:48Z","snapshot_observed_at":"2026-08-15T06:02:03.903854Z","submitted_at":"2025-06-05T16:43:48Z","title":"Diagonal Batching Unlocks Parallelism in Recurrent Memory Transformers for Long Contexts","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T10:31:02.313592Z"},"links":{"citing_paper":"/paper/2506.05229"},"observation_digest":"sha256:b110a98c29aa1a24a147ac4b67c48ccad9c5629f094fa6afab3d06e9e1ec1011","observation_id":"82506dc2-3f32-43ab-afc1-26f89d91cc8f","resolution":{"observed_at":"2026-08-07T10:31:02.313592Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:31:02.316146Z","title":"Awq: Activation-aware weight quantization for on-device llm compression and acceleration.Proceedings of Machine Learning and Systems, 6:87–100, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05229","last_updated":"2025-06-05T16:43:48Z","snapshot_observed_at":"2026-08-15T06:02:03.903854Z","submitted_at":"2025-06-05T16:43:48Z","title":"Diagonal Batching Unlocks Parallelism in Recurrent Memory Transformers for Long Contexts","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T10:31:02.316146Z"},"links":{"citing_paper":"/paper/2506.05229"},"observation_digest":"sha256:a2ee083b1339d04765de92c9c70494b9763464d69b90d4af0e31deb8aa468b0b","observation_id":"1c4b4d5d-ac10-4b05-9d95-b8186f653680","resolution":{"observed_at":"2026-08-07T10:31:02.316146Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04434","snapshot_observed_at":"2026-08-07T10:31:02.319072Z","title":"Deepseek-v2: A strong, economical, and efficient mixture-of-experts language model.arXiv preprint arXiv:2405.04434, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05229","last_updated":"2025-06-05T16:43:48Z","snapshot_observed_at":"2026-08-15T06:02:03.903854Z","submitted_at":"2025-06-05T16:43:48Z","title":"Diagonal Batching Unlocks Parallelism in Recurrent Memory Transformers for Long Contexts","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T10:31:02.319072Z"},"links":{"cited_paper":"/paper/2405.04434","citing_paper":"/paper/2506.05229"},"observation_digest":"sha256:f743f06fc63a158d4bca538e08cd1f251f9141bf08575bcd5bdb1925d3417780","observation_id":"63fe8f27-6182-4581-9a47-0a261745935a","resolution":{"observed_at":"2026-08-07T10:31:02.319072Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:31:02.321821Z","title":"Ringattention with blockwise transformers for near-infinite context","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05229","last_updated":"2025-06-05T16:43:48Z","snapshot_observed_at":"2026-08-15T06:02:03.903854Z","submitted_at":"2025-06-05T16:43:48Z","title":"Diagonal Batching Unlocks Parallelism in Recurrent Memory Transformers for Long Contexts","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T10:31:02.321821Z"},"links":{"citing_paper":"/paper/2506.05229"},"observation_digest":"sha256:9067f2715b6558ba371b4a3e3e0588664f4ba2491d3a11fa42b45e0329d7b88c","observation_id":"effed22a-408b-42de-bfbf-bda5bc0ea91b","resolution":{"observed_at":"2026-08-07T10:31:02.321821Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:31:02.601550Z","title":"The illusion of state in state-space models","venue":null,"work_id":"cea5d088-e2c8-4095-871e-8f127ad4217d","year":2024},"citing_paper":{"arxiv_id":"2506.05229","last_updated":"2025-06-05T16:43:48Z","snapshot_observed_at":"2026-08-15T06:02:03.903854Z","submitted_at":"2025-06-05T16:43:48Z","title":"Diagonal Batching Unlocks Parallelism in Recurrent Memory Transformers for Long Contexts","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T10:31:02.324361Z"},"links":{"citing_paper":"/paper/2506.05229"},"observation_digest":"sha256:58a3695244721b08c601e84b3acea687d931791fab6dbf48f9d469c2ab934de4","observation_id":"561f52c1-139a-4dfc-87e3-f19d3f653d6e","resolution":{"observed_at":"2026-08-07T10:31:02.604978Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:31:02.327144Z","title":"Gpt-4 technical report, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.05229","last_updated":"2025-06-05T16:43:48Z","snapshot_observed_at":"2026-08-15T06:02:03.903854Z","submitted_at":"2025-06-05T16:43:48Z","title":"Diagonal Batching Unlocks Parallelism in Recurrent Memory Transformers for Long Contexts","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T10:31:02.327144Z"},"links":{"citing_paper":"/paper/2506.05229"},"observation_digest":"sha256:4eb70015466f8bfa375c5f7783589ae51ad107494c13346005f2a4b9e6710f2c","observation_id":"b28ec415-0f93-4bc1-b9e7-e5bce10bca77","resolution":{"observed_at":"2026-08-07T10:31:02.327144Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:31:02.585025Z","title":"RWKV: Reinventing RNNs for the transformer era","venue":null,"work_id":"e02b55ec-e9f1-4f19-a08d-0665c7c2244d","year":2023},"citing_paper":{"arxiv_id":"2506.05229","last_updated":"2025-06-05T16:43:48Z","snapshot_observed_at":"2026-08-15T06:02:03.903854Z","submitted_at":"2025-06-05T16:43:48Z","title":"Diagonal Batching Unlocks Parallelism in Recurrent Memory Transformers for Long Contexts","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T10:31:02.329928Z"},"links":{"citing_paper":"/paper/2506.05229"},"observation_digest":"sha256:5d0548fbe641c7d6f72283345c32dfca98e6e07539e0583f8557b21ffe0ebd75","observation_id":"5e691474-a32d-4afa-853f-9c51a8199840","resolution":{"observed_at":"2026-08-07T10:31:02.588670Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:31:02.332527Z","title":"Language models are unsupervised multitask learners","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.05229","last_updated":"2025-06-05T16:43:48Z","snapshot_observed_at":"2026-08-15T06:02:03.903854Z","submitted_at":"2025-06-05T16:43:48Z","title":"Diagonal Batching Unlocks Parallelism in Recurrent Memory Transformers for Long Contexts","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T10:31:02.332527Z"},"links":{"citing_paper":"/paper/2506.05229"},"observation_digest":"sha256:e3bc1d89e15d3e0b120a62e02cfff3d4f9f8c638c909f72d91962775606b694f","observation_id":"92ea202f-dcaf-4a77-9a63-5f1e94a4d52f","resolution":{"observed_at":"2026-08-07T10:31:02.332527Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:31:02.335195Z","title":"Rae, Anna Potapenko, Siddhant M","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.05229","last_updated":"2025-06-05T16:43:48Z","snapshot_observed_at":"2026-08-15T06:02:03.903854Z","submitted_at":"2025-06-05T16:43:48Z","title":"Diagonal Batching Unlocks Parallelism in Recurrent Memory Transformers for Long Contexts","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T10:31:02.335195Z"},"links":{"citing_paper":"/paper/2506.05229"},"observation_digest":"sha256:a24a749db963304482f744fe8a20564856a66e3ee97810b937674b53a57d7aa1","observation_id":"8e54fda5-a8c1-4c85-97ab-060e04e22d96","resolution":{"observed_at":"2026-08-07T10:31:02.335195Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-08-14T18:15:53.516440Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-07T10:31:02.337712Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context.arXiv preprint arXiv:2403.05530, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05229","last_updated":"2025-06-05T16:43:48Z","snapshot_observed_at":"2026-08-15T06:02:03.903854Z","submitted_at":"2025-06-05T16:43:48Z","title":"Diagonal Batching Unlocks Parallelism in Recurrent Memory Transformers for Long Contexts","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T10:31:02.337712Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2506.05229"},"observation_digest":"sha256:8346bbb0b357c87e452c0ffe7588ba833db1392b97ad3760a45724ae53ff4bc3","observation_id":"a3cae8ee-b43a-470c-b6dd-d7e64b398758","resolution":{"observed_at":"2026-08-07T10:31:02.337712Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:31:02.563166Z","title":"Associative recurrent memory transformer.CoRR, 2024","venue":null,"work_id":"28d13c00-5936-4aa4-a97f-48645ab9dac6","year":2024},"citing_paper":{"arxiv_id":"2506.05229","last_updated":"2025-06-05T16:43:48Z","snapshot_observed_at":"2026-08-15T06:02:03.903854Z","submitted_at":"2025-06-05T16:43:48Z","title":"Diagonal Batching Unlocks Parallelism in Recurrent Memory Transformers for Long Contexts","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T10:31:02.340860Z"},"links":{"citing_paper":"/paper/2506.05229"},"observation_digest":"sha256:670892b4db548d18305ef367bf289da450c3a9c5b5601006cfc2993830e7387c","observation_id":"09640ec0-9f58-4519-ac11-be5c07b70fa0","resolution":{"observed_at":"2026-08-07T10:31:02.566381Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:31:02.343585Z","title":"Linear transformers are secretly fast weight programmers, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.05229","last_updated":"2025-06-05T16:43:48Z","snapshot_observed_at":"2026-08-15T06:02:03.903854Z","submitted_at":"2025-06-05T16:43:48Z","title":"Diagonal Batching Unlocks Parallelism in Recurrent Memory Transformers for Long Contexts","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T10:31:02.343585Z"},"links":{"citing_paper":"/paper/2506.05229"},"observation_digest":"sha256:19b9070f9498a894f7cb8aa52668ad5e2f63b5fd0216ac5a68710d3240724dd0","observation_id":"80cbd136-aa13-4f71-a90f-9c87954801c4","resolution":{"observed_at":"2026-08-07T10:31:02.343585Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1911.02150","last_updated":"2019-11-06T00:19:05Z","snapshot_observed_at":"2026-07-06T08:35:01.386074Z","submitted_at":"2019-11-06T00:19:05Z","title":"Fast Transformer Decoding: One Write-Head is All You Need","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.02150","snapshot_observed_at":"2026-08-07T10:31:02.346313Z","title":"Fast transformer decoding: One write-head is all you need.arXiv preprint arXiv:1911.02150, 2019","venue":null,"work_id":null,"year":1911},"citing_paper":{"arxiv_id":"2506.05229","last_updated":"2025-06-05T16:43:48Z","snapshot_observed_at":"2026-08-15T06:02:03.903854Z","submitted_at":"2025-06-05T16:43:48Z","title":"Diagonal Batching Unlocks Parallelism in Recurrent Memory Transformers for Long Contexts","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T10:31:02.346313Z"},"links":{"cited_paper":"/paper/1911.02150","citing_paper":"/paper/2506.05229"},"observation_digest":"sha256:8d0e9bd81e2c8c55015cde89cde114314b4c56772e4cb42becf7ba25a0bd5b30","observation_id":"604e1b7b-7f8b-41d0-b1c3-17602df684f8","resolution":{"observed_at":"2026-08-07T10:31:02.346313Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:31:02.546574Z","title":"What formal lan- guages can transformers express? a survey.Transactions of the Association for Computational Linguistics, 12, 2024","venue":null,"work_id":"78ee7726-1137-4417-a880-7637824f2008","year":2024},"citing_paper":{"arxiv_id":"2506.05229","last_updated":"2025-06-05T16:43:48Z","snapshot_observed_at":"2026-08-15T06:02:03.903854Z","submitted_at":"2025-06-05T16:43:48Z","title":"Diagonal Batching Unlocks Parallelism in Recurrent Memory Transformers for Long Contexts","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T10:31:02.349251Z"},"links":{"citing_paper":"/paper/2506.05229"},"observation_digest":"sha256:7abd1ddff12d7d7a7ad8e0823f3b8d41622f42cd5eab9dbe5b66f1fef205f54c","observation_id":"d07d4554-56cf-44a1-8bbe-d551afe35423","resolution":{"observed_at":"2026-08-07T10:31:02.550155Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:31:02.535882Z","title":"End-to-end memory networks, 2015","venue":null,"work_id":"b5303fce-65ad-42e8-9e1b-adee34914df0","year":2015},"citing_paper":{"arxiv_id":"2506.05229","last_updated":"2025-06-05T16:43:48Z","snapshot_observed_at":"2026-08-15T06:02:03.903854Z","submitted_at":"2025-06-05T16:43:48Z","title":"Diagonal Batching Unlocks Parallelism in Recurrent Memory Transformers for Long Contexts","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T10:31:02.352422Z"},"links":{"citing_paper":"/paper/2506.05229"},"observation_digest":"sha256:ba09595ea1ebd9db1645a8235fc0b883fea62dc838d9c202f5445b1d53ca6869","observation_id":"7d893457-b33b-4d27-acc2-4715475cc229","resolution":{"observed_at":"2026-08-07T10:31:02.539030Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.08621","last_updated":"2023-08-09T08:53:08Z","snapshot_observed_at":"2026-08-18T21:18:20.077927Z","submitted_at":"2023-07-17T16:40:01Z","title":"Retentive Network: A Successor to Transformer for Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.08621","snapshot_observed_at":"2026-08-07T10:31:02.355443Z","title":"Retentive network: A successor to transformer for large language models.arXiv preprint arXiv:2307.08621, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.05229","last_updated":"2025-06-05T16:43:48Z","snapshot_observed_at":"2026-08-15T06:02:03.903854Z","submitted_at":"2025-06-05T16:43:48Z","title":"Diagonal Batching Unlocks Parallelism in Recurrent Memory Transformers for Long Contexts","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T10:31:02.355443Z"},"links":{"cited_paper":"/paper/2307.08621","citing_paper":"/paper/2506.05229"},"observation_digest":"sha256:7ad8d8e12def35ecc613c414b4c6788a5b33a1326aac65960b1b475e8a87024a","observation_id":"acd5a738-db6d-4c66-8f74-cb9716e631f6","resolution":{"observed_at":"2026-08-07T10:31:02.355443Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:31:02.525113Z","title":"Attention is All you Need","venue":null,"work_id":"d90f80f9-f626-498a-963e-de713b0f71c4","year":2017},"citing_paper":{"arxiv_id":"2506.05229","last_updated":"2025-06-05T16:43:48Z","snapshot_observed_at":"2026-08-15T06:02:03.903854Z","submitted_at":"2025-06-05T16:43:48Z","title":"Diagonal Batching Unlocks Parallelism in Recurrent Memory Transformers for Long Contexts","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T10:31:02.358877Z"},"links":{"citing_paper":"/paper/2506.05229"},"observation_digest":"sha256:80a4b3abcf910ce72590167982508cc4ba0307ac32b6f2360d4b089454ac44cf","observation_id":"d5f2c1da-f69c-4a4e-8155-165b9b29e6ab","resolution":{"observed_at":"2026-08-07T10:31:02.528492Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:31:02.514440Z","title":"Memory networks","venue":null,"work_id":"b5e3c68a-113d-4913-a8ac-2c956300a8c3","year":2015},"citing_paper":{"arxiv_id":"2506.05229","last_updated":"2025-06-05T16:43:48Z","snapshot_observed_at":"2026-08-15T06:02:03.903854Z","submitted_at":"2025-06-05T16:43:48Z","title":"Diagonal Batching Unlocks Parallelism in Recurrent Memory Transformers for Long Contexts","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T10:31:02.361912Z"},"links":{"citing_paper":"/paper/2506.05229"},"observation_digest":"sha256:89e0cf8ee2c42a95ca08f617739c8321485fa4110d96c2f7d68648a5f29b2d74","observation_id":"3bb27f15-881d-4c8e-8759-af8aa705d936","resolution":{"observed_at":"2026-08-07T10:31:02.517679Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:31:02.365308Z","title":"Roofline: an insightful visual performance model for multicore architectures.Communications of the ACM, 52(4):65–76, 2009","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2506.05229","last_updated":"2025-06-05T16:43:48Z","snapshot_observed_at":"2026-08-15T06:02:03.903854Z","submitted_at":"2025-06-05T16:43:48Z","title":"Diagonal Batching Unlocks Parallelism in Recurrent Memory Transformers for Long Contexts","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T10:31:02.365308Z"},"links":{"citing_paper":"/paper/2506.05229"},"observation_digest":"sha256:bd29725c55f2f6b15512e92a12346573bc6d0e5d420ab3d6af219f8691728810","observation_id":"2b09fa1b-27ad-45fd-9a55-eb962e66f1c4","resolution":{"observed_at":"2026-08-07T10:31:02.365308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:31:02.497060Z","title":"Speculative decoding: Exploiting speculative execution for accelerating seq2seq generation","venue":null,"work_id":"5b1ea154-7f4d-4ba8-a6cc-888428debf04","year":2023},"citing_paper":{"arxiv_id":"2506.05229","last_updated":"2025-06-05T16:43:48Z","snapshot_observed_at":"2026-08-15T06:02:03.903854Z","submitted_at":"2025-06-05T16:43:48Z","title":"Diagonal Batching Unlocks Parallelism in Recurrent Memory Transformers for Long Contexts","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T10:31:02.368282Z"},"links":{"citing_paper":"/paper/2506.05229"},"observation_digest":"sha256:4bf731f062bc13b27a9257ca40f98c717c3fcf56015cf6806fbd79e326f5c826","observation_id":"72989e82-49cf-416f-99ec-0fdee6f90879","resolution":{"observed_at":"2026-08-07T10:31:02.500498Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:31:02.485640Z","title":"Parallelizing linear transformers with the delta rule over sequence length","venue":null,"work_id":"a1de373d-e2bc-4101-b8fa-1a6a0f4fa936","year":null},"citing_paper":{"arxiv_id":"2506.05229","last_updated":"2025-06-05T16:43:48Z","snapshot_observed_at":"2026-08-15T06:02:03.903854Z","submitted_at":"2025-06-05T16:43:48Z","title":"Diagonal Batching Unlocks Parallelism in Recurrent Memory Transformers for Long Contexts","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T10:31:02.370982Z"},"links":{"citing_paper":"/paper/2506.05229"},"observation_digest":"sha256:8ebbd4c7b5a868a4b06481c3dce2bb980c3a36031d8f148e3e8ea7e9204bc6be","observation_id":"c11b898f-82bb-43a7-b71e-053a83de06c8","resolution":{"observed_at":"2026-08-07T10:31:02.490451Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.05229","last_updated":"2025-06-05T16:43:48Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-15T06:02:03.903854Z","submitted_at":"2025-06-05T16:43:48Z","title":"Diagonal Batching Unlocks Parallelism in Recurrent Memory Transformers for Long Contexts"},"reference_resolution":{"displayed":37,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":23,"verified_exact":0,"verified_fuzzy":14},"total_outbound_references":37},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"thesis":"As of 20 August 2026, this Paper Citation Record lists 37 of 37 outbound references and 1 inbound Pith citation observation for arXiv:2506.05229."}