{"as_of":"2026-08-10T02:16:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:eb4d7457517fd85a8269c71b9368473a8daf79e1994b6f31ab25d44449b7bc7f","coverage":[{"denominator":43,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":43,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-31T23:07:18.588999Z","state":"measured"},{"denominator":43,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":43,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.27919/citation-record","integrity":"/paper/2607.27919/integrity","json":"/paper/2607.27919/citation-record.json","paper":"/paper/2607.27919"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:07:18.237143Z","title":null,"venue":null,"work_id":null,"year":2034},"citing_paper":{"arxiv_id":"2607.27919","last_updated":"2026-07-30T09:30:03Z","snapshot_observed_at":"2026-08-08T06:34:17.309522Z","submitted_at":"2026-07-30T09:30:03Z","title":"Memory Decoder at Scale: A Pretrained, Parametric Long-Term Memory","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-31T23:07:18.237143Z"},"links":{"citing_paper":"/paper/2607.27919"},"observation_digest":"sha256:dbb089c6db57f0a1f0018dfc08bb2b254ed028ff6b030196713ee8b5c010daea","observation_id":"f3335169-b4d0-4f8c-928d-071e91f185e7","resolution":{"observed_at":"2026-07-31T23:07:18.237143Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:07:18.326633Z","title":"Output: number EC4.3.3","venue":null,"work_id":null,"year":1913},"citing_paper":{"arxiv_id":"2607.27919","last_updated":"2026-07-30T09:30:03Z","snapshot_observed_at":"2026-08-08T06:34:17.309522Z","submitted_at":"2026-07-30T09:30:03Z","title":"Memory Decoder at Scale: A Pretrained, Parametric Long-Term Memory","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-31T23:07:18.326633Z"},"links":{"citing_paper":"/paper/2607.27919"},"observation_digest":"sha256:0e3e38148f8eff7ee815cf471e94e8de3ef6afaf2e7e426de70dc5d36eb460e5","observation_id":"f33655f4-5c94-4c79-b548-75e8df3eceb1","resolution":{"observed_at":"2026-07-31T23:07:18.326633Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2101.00027","last_updated":"2020-12-31T19:00:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-12-31T19:00:10Z","title":"The Pile: An 800GB Dataset of Diverse Text for Language Modeling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2101.00027","snapshot_observed_at":"2026-07-31T23:07:18.027807Z","title":"The pile: An 800gb dataset of diverse text for language modeling.arXiv preprint arXiv:2101.00027,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27919","last_updated":"2026-07-30T09:30:03Z","snapshot_observed_at":"2026-08-08T06:34:17.309522Z","submitted_at":"2026-07-30T09:30:03Z","title":"Memory Decoder at Scale: A Pretrained, Parametric Long-Term Memory","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-31T23:07:18.027807Z"},"links":{"cited_paper":"/paper/2101.00027","citing_paper":"/paper/2607.27919"},"observation_digest":"sha256:b8cec1384ef5c683d88eccb0cde1beadc0abb8299e1af58f63f0b6713beb38e2","observation_id":"afc6430e-0aa1-4efd-8cfb-60f769502f09","resolution":{"observed_at":"2026-07-31T23:07:18.027807Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:07:18.222219Z","title":null,"venue":null,"work_id":null,"year":2048},"citing_paper":{"arxiv_id":"2607.27919","last_updated":"2026-07-30T09:30:03Z","snapshot_observed_at":"2026-08-08T06:34:17.309522Z","submitted_at":"2026-07-30T09:30:03Z","title":"Memory Decoder at Scale: A Pretrained, Parametric Long-Term Memory","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-31T23:07:18.222219Z"},"links":{"citing_paper":"/paper/2607.27919"},"observation_digest":"sha256:30634751e0bedc203842133e900bc26057d4e0a7293f13a039fa75c5f367bf31","observation_id":"d6e2000b-bdf5-45a0-a693-8ab7eeb68f05","resolution":{"observed_at":"2026-07-31T23:07:18.222219Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:07:18.040894Z","title":"Biology-instructions: A dataset and benchmark for multi-omics sequence understanding capability of large language models.arXiv preprint arXiv:2412.19191,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27919","last_updated":"2026-07-30T09:30:03Z","snapshot_observed_at":"2026-08-08T06:34:17.309522Z","submitted_at":"2026-07-30T09:30:03Z","title":"Memory Decoder at Scale: A Pretrained, Parametric Long-Term Memory","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-31T23:07:18.040894Z"},"links":{"citing_paper":"/paper/2607.27919"},"observation_digest":"sha256:227d8705cfa1d0afca7d1b46bdb70a06b65a8e25f94836e9227bcf1e146d8bee","observation_id":"d1783bd4-9bb7-4f53-8616-0f3f9c253f4a","resolution":{"observed_at":"2026-07-31T23:07:18.040894Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.03300","last_updated":"2021-01-12T18:57:11Z","snapshot_observed_at":"2026-08-09T10:28:06.906299Z","submitted_at":"2020-09-07T17:59:25Z","title":"Measuring Massive Multitask Language Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.03300","snapshot_observed_at":"2026-07-31T23:07:18.044920Z","title":"Measuring massive multitask language understanding.arXiv preprint arXiv:2009.03300,","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2607.27919","last_updated":"2026-07-30T09:30:03Z","snapshot_observed_at":"2026-08-08T06:34:17.309522Z","submitted_at":"2026-07-30T09:30:03Z","title":"Memory Decoder at Scale: A Pretrained, Parametric Long-Term Memory","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-31T23:07:18.044920Z"},"links":{"cited_paper":"/paper/2009.03300","citing_paper":"/paper/2607.27919"},"observation_digest":"sha256:0e47b4c4b12f98b9d587b76d94a6455701dbf34798c56c50707117ccf8efeced","observation_id":"341b64aa-0496-43df-82d8-94047934b1e7","resolution":{"observed_at":"2026-07-31T23:07:18.044920Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1911.00172","last_updated":"2020-02-15T01:04:52Z","snapshot_observed_at":"2026-07-06T08:33:58.970043Z","submitted_at":"2019-11-01T01:09:53Z","title":"Generalization through Memorization: Nearest Neighbor Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.00172","snapshot_observed_at":"2026-07-31T23:07:18.054189Z","title":"Generalization through memorization: Nearest neighbor language models.arXiv preprint arXiv:1911.00172,","venue":null,"work_id":null,"year":1911},"citing_paper":{"arxiv_id":"2607.27919","last_updated":"2026-07-30T09:30:03Z","snapshot_observed_at":"2026-08-08T06:34:17.309522Z","submitted_at":"2026-07-30T09:30:03Z","title":"Memory Decoder at Scale: A Pretrained, Parametric Long-Term Memory","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-31T23:07:18.054189Z"},"links":{"cited_paper":"/paper/1911.00172","citing_paper":"/paper/2607.27919"},"observation_digest":"sha256:51427b1e86c59533c152d0639279a0cf16e77cbb671e4c319c06b7f21ac9a4d1","observation_id":"423d9f94-45d4-4634-9169-fa4252f912f6","resolution":{"observed_at":"2026-07-31T23:07:18.054189Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:07:18.058658Z","title":"Halueval: A large-scale halluci- nation evaluation benchmark for large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.27919","last_updated":"2026-07-30T09:30:03Z","snapshot_observed_at":"2026-08-08T06:34:17.309522Z","submitted_at":"2026-07-30T09:30:03Z","title":"Memory Decoder at Scale: A Pretrained, Parametric Long-Term Memory","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-31T23:07:18.058658Z"},"links":{"citing_paper":"/paper/2607.27919"},"observation_digest":"sha256:ac4cfbac64ee61d6d8030494b50b0c2716cb164806f5360813b5894d68a33040","observation_id":"96cf3753-c46c-465d-90c0-498e0e1d7dc1","resolution":{"observed_at":"2026-07-31T23:07:18.058658Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2007.08124","last_updated":"2020-07-16T05:52:16Z","snapshot_observed_at":"2026-08-09T06:25:20.879304Z","submitted_at":"2020-07-16T05:52:16Z","title":"LogiQA: A Challenge Dataset for Machine Reading Comprehension with Logical Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2007.08124","snapshot_observed_at":"2026-07-31T23:07:18.062768Z","title":"Logiqa: A challenge datasetformachinereadingcomprehensionwithlogicalreasoning.arXivpreprintarXiv:2007.08124,","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2607.27919","last_updated":"2026-07-30T09:30:03Z","snapshot_observed_at":"2026-08-08T06:34:17.309522Z","submitted_at":"2026-07-30T09:30:03Z","title":"Memory Decoder at Scale: A Pretrained, Parametric Long-Term Memory","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-31T23:07:18.062768Z"},"links":{"cited_paper":"/paper/2007.08124","citing_paper":"/paper/2607.27919"},"observation_digest":"sha256:7b69d99e40da9f3c2a6f7180efafbb71329ac59eea326ab5b495d86a43212b0b","observation_id":"2cbe41f1-994d-42c5-b755-0e9569b9af4b","resolution":{"observed_at":"2026-07-31T23:07:18.062768Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-08-09T20:34:52.923500Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-07-31T23:07:18.066706Z","title":"Decoupled weight decay regularization.arXiv preprint arXiv:1711.05101,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27919","last_updated":"2026-07-30T09:30:03Z","snapshot_observed_at":"2026-08-08T06:34:17.309522Z","submitted_at":"2026-07-30T09:30:03Z","title":"Memory Decoder at Scale: A Pretrained, Parametric Long-Term Memory","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-31T23:07:18.066706Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2607.27919"},"observation_digest":"sha256:418a4b2c76d03c876756cfee23186cc14a83851a0e2b68cdf126ec5deea9e942","observation_id":"d7db37db-285e-4641-9eec-daa7e2f97f4d","resolution":{"observed_at":"2026-07-31T23:07:18.066706Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2512.13961","last_updated":"2026-04-14T15:12:44Z","snapshot_observed_at":"2026-08-07T08:18:31.274999Z","submitted_at":"2025-12-15T23:41:48Z","title":"Olmo 3","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.13961","snapshot_observed_at":"2026-07-31T23:07:18.075283Z","title":"Olmo 3.arXiv preprint arXiv:2512.13961,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27919","last_updated":"2026-07-30T09:30:03Z","snapshot_observed_at":"2026-08-08T06:34:17.309522Z","submitted_at":"2026-07-30T09:30:03Z","title":"Memory Decoder at Scale: A Pretrained, Parametric Long-Term Memory","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-31T23:07:18.075283Z"},"links":{"cited_paper":"/paper/2512.13961","citing_paper":"/paper/2607.27919"},"observation_digest":"sha256:ed9a09d713a3da83c0be48fd1233b2d2fe1e5800d12d419418699273cfd2a9af","observation_id":"378ba405-6464-41b8-8757-824308aa3560","resolution":{"observed_at":"2026-07-31T23:07:18.075283Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12022","last_updated":"2023-11-20T18:57:34Z","snapshot_observed_at":"2026-08-04T22:55:15.345443Z","submitted_at":"2023-11-20T18:57:34Z","title":"GPQA: A Graduate-Level Google-Proof Q&A Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.12022","snapshot_observed_at":"2026-07-31T23:07:18.083883Z","title":"Gpqa: A graduate-level google-proof q&a benchmark","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27919","last_updated":"2026-07-30T09:30:03Z","snapshot_observed_at":"2026-08-08T06:34:17.309522Z","submitted_at":"2026-07-30T09:30:03Z","title":"Memory Decoder at Scale: A Pretrained, Parametric Long-Term Memory","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-31T23:07:18.083883Z"},"links":{"cited_paper":"/paper/2311.12022","citing_paper":"/paper/2607.27919"},"observation_digest":"sha256:ad2598dc40f2d78273683f713d1e73e5a3f783b75946f84a31ee3f15f1812248","observation_id":"35be0422-3129-40e8-b6c8-dfae8f463175","resolution":{"observed_at":"2026-07-31T23:07:18.083883Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.03267","last_updated":"2026-05-01T23:55:43Z","snapshot_observed_at":"2026-08-02T10:52:10.211700Z","submitted_at":"2025-12-19T07:05:38Z","title":"OpenAI GPT-5 System Card","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.03267","snapshot_observed_at":"2026-07-31T23:07:18.092517Z","title":"Openai gpt-5 system card.arXiv preprint arXiv:2601.03267,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27919","last_updated":"2026-07-30T09:30:03Z","snapshot_observed_at":"2026-08-08T06:34:17.309522Z","submitted_at":"2026-07-30T09:30:03Z","title":"Memory Decoder at Scale: A Pretrained, Parametric Long-Term Memory","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-31T23:07:18.092517Z"},"links":{"cited_paper":"/paper/2601.03267","citing_paper":"/paper/2607.27919"},"observation_digest":"sha256:c831ab22e926e15ffed2849b98a37774241fb88b3e440bc0dc3318af0f62ec0b","observation_id":"b7d365a7-83a0-4e9a-b5c0-426545b4631a","resolution":{"observed_at":"2026-07-31T23:07:18.092517Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:07:18.096594Z","title":"Memoryandbrainsystems: 1969–2009.JournalofNeuroscience,29(41):12711–12716,","venue":null,"work_id":null,"year":1969},"citing_paper":{"arxiv_id":"2607.27919","last_updated":"2026-07-30T09:30:03Z","snapshot_observed_at":"2026-08-08T06:34:17.309522Z","submitted_at":"2026-07-30T09:30:03Z","title":"Memory Decoder at Scale: A Pretrained, Parametric Long-Term Memory","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-31T23:07:18.096594Z"},"links":{"citing_paper":"/paper/2607.27919"},"observation_digest":"sha256:397f9b4526904441d139d0fb5834832039f66823aa0080761597859e1a7f94c6","observation_id":"11195077-0009-4f00-bf43-05f7944218fb","resolution":{"observed_at":"2026-07-31T23:07:18.096594Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.15804","last_updated":"2026-04-21T03:35:14Z","snapshot_observed_at":"2026-08-01T22:56:50.755050Z","submitted_at":"2026-04-17T08:05:46Z","title":"Qwen3.5-Omni Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.15804","snapshot_observed_at":"2026-07-31T23:07:18.100553Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27919","last_updated":"2026-07-30T09:30:03Z","snapshot_observed_at":"2026-08-08T06:34:17.309522Z","submitted_at":"2026-07-30T09:30:03Z","title":"Memory Decoder at Scale: A Pretrained, Parametric Long-Term Memory","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-31T23:07:18.100553Z"},"links":{"cited_paper":"/paper/2604.15804","citing_paper":"/paper/2607.27919"},"observation_digest":"sha256:976f0d85265a617cc2c1245c5292409dedc504451022c0a8434fa3a59bb46318","observation_id":"52a03c36-fd7e-4d10-b040-e977c38cc231","resolution":{"observed_at":"2026-07-31T23:07:18.100553Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:07:18.108314Z","title":"Infllm: Training-free long-context extrapolation for llms with an efficient context memory.Advances in neural information processing systems, 37:119638–119661, 2024a","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.27919","last_updated":"2026-07-30T09:30:03Z","snapshot_observed_at":"2026-08-08T06:34:17.309522Z","submitted_at":"2026-07-30T09:30:03Z","title":"Memory Decoder at Scale: A Pretrained, Parametric Long-Term Memory","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-31T23:07:18.108314Z"},"links":{"citing_paper":"/paper/2607.27919"},"observation_digest":"sha256:950d6b8c5b3322909cf1e31f7113fcf295ad2397b0a4a89453e7e12d7fb8ad64","observation_id":"e5e3f4c1-ba32-4d5f-bf23-320064905b76","resolution":{"observed_at":"2026-07-31T23:07:18.108314Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:07:18.116807Z","title":"Hotpotqa: A dataset for diverse, explainable multi-hop question answering","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.27919","last_updated":"2026-07-30T09:30:03Z","snapshot_observed_at":"2026-08-08T06:34:17.309522Z","submitted_at":"2026-07-30T09:30:03Z","title":"Memory Decoder at Scale: A Pretrained, Parametric Long-Term Memory","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-31T23:07:18.116807Z"},"links":{"citing_paper":"/paper/2607.27919"},"observation_digest":"sha256:7bc546f315ea50343d37abde688b88712e6341222eb78ba9636d997e6e80c09c","observation_id":"22eb6e8b-7c22-4202-af09-2c36777c9400","resolution":{"observed_at":"2026-07-31T23:07:18.116807Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:07:18.121587Z","title":"Vismem: Latent vision memory unlocks potential of vision-language models.arXiv preprint arXiv:2511.11007,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27919","last_updated":"2026-07-30T09:30:03Z","snapshot_observed_at":"2026-08-08T06:34:17.309522Z","submitted_at":"2026-07-30T09:30:03Z","title":"Memory Decoder at Scale: A Pretrained, Parametric Long-Term Memory","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-31T23:07:18.121587Z"},"links":{"citing_paper":"/paper/2607.27919"},"observation_digest":"sha256:6b497dc2f50d5c94d00a51344aa9c374ccea24ac62c492f564f6e3e04daad2a8","observation_id":"b15debcf-38a5-438b-8e56-588ce5b5a5b0","resolution":{"observed_at":"2026-07-31T23:07:18.121587Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.11325","last_updated":"2023-09-23T18:36:21Z","snapshot_observed_at":"2026-07-06T16:21:17.180009Z","submitted_at":"2023-09-20T13:50:26Z","title":"DISC-LawLLM: Fine-tuning Large Language Models for Intelligent Legal Services","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.11325","snapshot_observed_at":"2026-07-31T23:07:18.133745Z","title":"Disc-lawllm: Fine-tuning large language models for intelligent legal services.arXiv preprint arXiv:2309.11325,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27919","last_updated":"2026-07-30T09:30:03Z","snapshot_observed_at":"2026-08-08T06:34:17.309522Z","submitted_at":"2026-07-30T09:30:03Z","title":"Memory Decoder at Scale: A Pretrained, Parametric Long-Term Memory","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-31T23:07:18.133745Z"},"links":{"cited_paper":"/paper/2309.11325","citing_paper":"/paper/2607.27919"},"observation_digest":"sha256:3f024cb3aea3ce9a7de0b4e5d8e5d4132ccbaa49ef90e7f3e6a4146a1d747305","observation_id":"83b901b2-45f7-4d04-86cf-772714be97c9","resolution":{"observed_at":"2026-07-31T23:07:18.133745Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.15763","last_updated":"2026-02-24T10:44:44Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-02-17T17:50:56Z","title":"GLM-5: from Vibe Coding to Agentic Engineering","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.15763","snapshot_observed_at":"2026-07-31T23:07:18.155008Z","title":"Glm-5: from vibe coding to agentic engineering.arXiv preprint arXiv:2602.15763,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27919","last_updated":"2026-07-30T09:30:03Z","snapshot_observed_at":"2026-08-08T06:34:17.309522Z","submitted_at":"2026-07-30T09:30:03Z","title":"Memory Decoder at Scale: A Pretrained, Parametric Long-Term Memory","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-31T23:07:18.155008Z"},"links":{"cited_paper":"/paper/2602.15763","citing_paper":"/paper/2607.27919"},"observation_digest":"sha256:a55098165cd4543edcf6cdd6fd684d622736e89c8b5f439a231f6471e82ace95","observation_id":"ca6e958a-2c2b-4beb-9635-29baa4eaf2c9","resolution":{"observed_at":"2026-07-31T23:07:18.155008Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.05176","last_updated":"2025-06-11T02:54:49Z","snapshot_observed_at":"2026-08-09T13:23:52.437582Z","submitted_at":"2025-06-05T15:49:48Z","title":"Qwen3 Embedding: Advancing Text Embedding and Reranking Through Foundation Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.05176","snapshot_observed_at":"2026-07-31T23:07:18.172943Z","title":"Qwen3 embedding: Advancing text embedding and reranking through foundation models.arXiv preprint arXiv:2506.05176,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27919","last_updated":"2026-07-30T09:30:03Z","snapshot_observed_at":"2026-08-08T06:34:17.309522Z","submitted_at":"2026-07-30T09:30:03Z","title":"Memory Decoder at Scale: A Pretrained, Parametric Long-Term Memory","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-31T23:07:18.172943Z"},"links":{"cited_paper":"/paper/2506.05176","citing_paper":"/paper/2607.27919"},"observation_digest":"sha256:a77434f96c6589e1696a214d6b067f00054b9b7e14a4e825ae7ec1310bf8ea5c","observation_id":"f558500c-4181-4514-a2d8-e928c771ae81","resolution":{"observed_at":"2026-07-31T23:07:18.172943Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:07:18.193327Z","title":"Pre-training limited memory language models with internal and external knowledge.arXiv preprint arXiv:2505.15962,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27919","last_updated":"2026-07-30T09:30:03Z","snapshot_observed_at":"2026-08-08T06:34:17.309522Z","submitted_at":"2026-07-30T09:30:03Z","title":"Memory Decoder at Scale: A Pretrained, Parametric Long-Term Memory","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-31T23:07:18.193327Z"},"links":{"citing_paper":"/paper/2607.27919"},"observation_digest":"sha256:b1aa06f113d1381e8007c326766e5ef2f60f646c1e8ccfa933a27eadc54a07a8","observation_id":"7c458226-6e37-426a-a863-7f406850b22b","resolution":{"observed_at":"2026-07-31T23:07:18.193327Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:07:18.205826Z","title":"Training language models with memory augmentation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.27919","last_updated":"2026-07-30T09:30:03Z","snapshot_observed_at":"2026-08-08T06:34:17.309522Z","submitted_at":"2026-07-30T09:30:03Z","title":"Memory Decoder at Scale: A Pretrained, Parametric Long-Term Memory","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-07-31T23:07:18.205826Z"},"links":{"citing_paper":"/paper/2607.27919"},"observation_digest":"sha256:b8d9ee19d0128faec96cba1f41518ce521303862664e99a7867c07515e5ab207","observation_id":"a7dc31d8-0c1c-406d-b7ab-0beee8b9ef3c","resolution":{"observed_at":"2026-07-31T23:07:18.205826Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:07:18.255922Z","title":"Table 14| Top-3 versus top-5 retrieval for the RAG baseline","venue":null,"work_id":null,"year":2000},"citing_paper":{"arxiv_id":"2607.27919","last_updated":"2026-07-30T09:30:03Z","snapshot_observed_at":"2026-08-08T06:34:17.309522Z","submitted_at":"2026-07-30T09:30:03Z","title":"Memory Decoder at Scale: A Pretrained, Parametric Long-Term Memory","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-07-31T23:07:18.255922Z"},"links":{"citing_paper":"/paper/2607.27919"},"observation_digest":"sha256:479adcf9a61967ef1690602216df1868011cba48d477b3c880a17e686e5a52d6","observation_id":"265d62b5-671d-4aa4-9d89-ae5fe79bebb8","resolution":{"observed_at":"2026-07-31T23:07:18.255922Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:07:18.276958Z","title":"Zaheer Khan, Yuvraj Singh and Marlon Samuels made their ODI debuts during the competition","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2607.27919","last_updated":"2026-07-30T09:30:03Z","snapshot_observed_at":"2026-08-08T06:34:17.309522Z","submitted_at":"2026-07-30T09:30:03Z","title":"Memory Decoder at Scale: A Pretrained, Parametric Long-Term Memory","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-07-31T23:07:18.276958Z"},"links":{"citing_paper":"/paper/2607.27919"},"observation_digest":"sha256:9fdefeffbde8badf803b2e7f4130773125a9e53f590a75136f3e1ac4886ee467","observation_id":"0b08c9d3-ac7e-4057-92d5-8fba4e260753","resolution":{"observed_at":"2026-07-31T23:07:18.276958Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:07:18.434809Z","title":"BioInst Table 21|Per-task domain memory results on BioInst for the Qwen3-0.6B-Base backbone","venue":null,"work_id":null,"year":1918},"citing_paper":{"arxiv_id":"2607.27919","last_updated":"2026-07-30T09:30:03Z","snapshot_observed_at":"2026-08-08T06:34:17.309522Z","submitted_at":"2026-07-30T09:30:03Z","title":"Memory Decoder at Scale: A Pretrained, Parametric Long-Term Memory","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-07-31T23:07:18.434809Z"},"links":{"citing_paper":"/paper/2607.27919"},"observation_digest":"sha256:f93cd2b0523d63a853511105a1ae1bb84df1aff8426187e70996821e3cd07a90","observation_id":"f28af8c7-e7f6-48a4-a693-a5666f186495","resolution":{"observed_at":"2026-07-31T23:07:18.434809Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:07:18.588999Z","title":"AVG is the macro average over the 25 task scores","venue":null,"work_id":null,"year":2065},"citing_paper":{"arxiv_id":"2607.27919","last_updated":"2026-07-30T09:30:03Z","snapshot_observed_at":"2026-08-08T06:34:17.309522Z","submitted_at":"2026-07-30T09:30:03Z","title":"Memory Decoder at Scale: A Pretrained, Parametric Long-Term Memory","version":1},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-07-31T23:07:18.588999Z"},"links":{"citing_paper":"/paper/2607.27919"},"observation_digest":"sha256:bceb96f3796d769ddd631b332ac943a8b5928767a46027f01ffc8f39e71692dc","observation_id":"f33e5e3d-d57a-4d2d-8148-3737ab225eb3","resolution":{"observed_at":"2026-07-31T23:07:18.588999Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:07:18.023589Z","title":"Lawbench: Benchmarking legal knowledge of large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.27919","last_updated":"2026-07-30T09:30:03Z","snapshot_observed_at":"2026-08-08T06:34:17.309522Z","submitted_at":"2026-07-30T09:30:03Z","title":"Memory Decoder at Scale: A Pretrained, Parametric Long-Term Memory","version":1},"reference_index":381,"source":"pdf_text","source_observed_at":"2026-07-31T23:07:18.023589Z"},"links":{"citing_paper":"/paper/2607.27919"},"observation_digest":"sha256:4b6b2f56ae241d254553479a052127b8ad644fc580cfeed97e2abb006f14b910","observation_id":"cb505e47-680a-46a1-9f1c-d4656644d17e","resolution":{"observed_at":"2026-07-31T23:07:18.023589Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1371/journal.pcbi.1000381","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"URL https://doi.org/10.1371/journal.pcbi.100","venue":"PLoS Computational Biology","work_id":"02aeaf08-6b3b-46d4-a68b-8c4777eff381","year":null},"citing_paper":{"arxiv_id":"2607.27919","last_updated":"2026-07-30T09:30:03Z","snapshot_observed_at":"2026-08-08T06:34:17.309522Z","submitted_at":"2026-07-30T09:30:03Z","title":"Memory Decoder at Scale: A Pretrained, Parametric Long-Term Memory","version":1},"reference_index":2009,"source":"pdf_text","source_observed_at":"2026-07-31T23:07:18.018810Z"},"links":{"citing_paper":"/paper/2607.27919"},"observation_digest":"sha256:fd00feb53de984b8b3b635fd0f76443b92aa694aca0cf9d2be97df57041ebda6","observation_id":"8b294cf3-c5d9-4b6b-9a7b-252e767cc263","resolution":{"observed_at":"2026-07-31T23:11:01.454730Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:07:18.300997Z","title":"Gimme Shelter","venue":null,"work_id":null,"year":1916},"citing_paper":{"arxiv_id":"2607.27919","last_updated":"2026-07-30T09:30:03Z","snapshot_observed_at":"2026-08-08T06:34:17.309522Z","submitted_at":"2026-07-30T09:30:03Z","title":"Memory Decoder at Scale: A Pretrained, Parametric Long-Term Memory","version":1},"reference_index":2011,"source":"pdf_text","source_observed_at":"2026-07-31T23:07:18.300997Z"},"links":{"citing_paper":"/paper/2607.27919"},"observation_digest":"sha256:120c96efbe8b5f41e22c6501ebadce631b46071219186cc6d084d6afbe43c08f","observation_id":"750f4510-084a-45a0-b847-f0ab59c62d15","resolution":{"observed_at":"2026-07-31T23:07:18.300997Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:07:18.032647Z","title":"Deepsieve: Information sieving via llm-as-a-knowledge-router","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.27919","last_updated":"2026-07-30T09:30:03Z","snapshot_observed_at":"2026-08-08T06:34:17.309522Z","submitted_at":"2026-07-30T09:30:03Z","title":"Memory Decoder at Scale: A Pretrained, Parametric Long-Term Memory","version":1},"reference_index":2013,"source":"pdf_text","source_observed_at":"2026-07-31T23:07:18.032647Z"},"links":{"citing_paper":"/paper/2607.27919"},"observation_digest":"sha256:6deaac1fa422cb34d9a018726187212d5d7beaa9508d7bbc4367f51ca03365d4","observation_id":"6f7cf464-a07f-4cb2-afde-046a4380e2c0","resolution":{"observed_at":"2026-07-31T23:07:18.032647Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:07:18.104442Z","title":"Mlp mem- ory: A retriever-pretrained memory for large language models.arXiv preprint arXiv:2508.01832,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27919","last_updated":"2026-07-30T09:30:03Z","snapshot_observed_at":"2026-08-08T06:34:17.309522Z","submitted_at":"2026-07-30T09:30:03Z","title":"Memory Decoder at Scale: A Pretrained, Parametric Long-Term Memory","version":1},"reference_index":2014,"source":"pdf_text","source_observed_at":"2026-07-31T23:07:18.104442Z"},"links":{"citing_paper":"/paper/2607.27919"},"observation_digest":"sha256:3bfb92d35d459dced6d74599c88267bdec6c6ebf4079d2f54500e71915b3b522","observation_id":"10935bf2-8bd0-4765-8873-8ba4feda3d39","resolution":{"observed_at":"2026-07-31T23:07:18.104442Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:07:18.080021Z","title":"Measuring and narrowing the compositionality gap in language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.27919","last_updated":"2026-07-30T09:30:03Z","snapshot_observed_at":"2026-08-08T06:34:17.309522Z","submitted_at":"2026-07-30T09:30:03Z","title":"Memory Decoder at Scale: A Pretrained, Parametric Long-Term Memory","version":1},"reference_index":2016,"source":"pdf_text","source_observed_at":"2026-07-31T23:07:18.080021Z"},"links":{"citing_paper":"/paper/2607.27919"},"observation_digest":"sha256:4a614f6c23e8bb28e9f2bab2cb9fbe1a8e7305e434a1add1fd11024661201e14","observation_id":"0f687444-f0ab-4b86-b9a6-2b67db7e77ae","resolution":{"observed_at":"2026-07-31T23:07:18.080021Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:07:18.049255Z","title":"Demystifying domain- adaptive post-training for financial llms","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.27919","last_updated":"2026-07-30T09:30:03Z","snapshot_observed_at":"2026-08-08T06:34:17.309522Z","submitted_at":"2026-07-30T09:30:03Z","title":"Memory Decoder at Scale: A Pretrained, Parametric Long-Term Memory","version":1},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-07-31T23:07:18.049255Z"},"links":{"citing_paper":"/paper/2607.27919"},"observation_digest":"sha256:70aeed996e067a81a809562b662c80745f9e8c697f1099402ce18c47e6a8ecf8","observation_id":"c13c17a5-33fd-4537-9958-6f3cf84b708a","resolution":{"observed_at":"2026-07-31T23:07:18.049255Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1901.02860","last_updated":"2019-06-02T21:21:48Z","snapshot_observed_at":"2026-07-06T07:25:48.468658Z","submitted_at":"2019-01-09T18:28:19Z","title":"Transformer-XL: Attentive Language Models Beyond a Fixed-Length Context","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1901.02860","snapshot_observed_at":"2026-07-31T23:07:18.005372Z","title":"Transformer-xl: Attentive language models beyond a fixed-length context.arXiv preprint arXiv:1901.02860,","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2607.27919","last_updated":"2026-07-30T09:30:03Z","snapshot_observed_at":"2026-08-08T06:34:17.309522Z","submitted_at":"2026-07-30T09:30:03Z","title":"Memory Decoder at Scale: A Pretrained, Parametric Long-Term Memory","version":1},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-07-31T23:07:18.005372Z"},"links":{"cited_paper":"/paper/1901.02860","citing_paper":"/paper/2607.27919"},"observation_digest":"sha256:4aa0d92112a4304ff02281300789b462a5b40ac2706e6550ebc11cd1594402b8","observation_id":"9ded397c-b5b0-4595-8dd4-ce7610ec1ad0","resolution":{"observed_at":"2026-07-31T23:07:18.005372Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.13753","last_updated":"2024-02-21T12:30:33Z","snapshot_observed_at":"2026-08-02T12:47:57.325302Z","submitted_at":"2024-02-21T12:30:33Z","title":"LongRoPE: Extending LLM Context Window Beyond 2 Million Tokens","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.13753","snapshot_observed_at":"2026-07-31T23:07:18.010236Z","title":"Longrope: Extending llm context window beyond 2 million tokens.arXiv preprint arXiv:2402.13753,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27919","last_updated":"2026-07-30T09:30:03Z","snapshot_observed_at":"2026-08-08T06:34:17.309522Z","submitted_at":"2026-07-30T09:30:03Z","title":"Memory Decoder at Scale: A Pretrained, Parametric Long-Term Memory","version":1},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-07-31T23:07:18.010236Z"},"links":{"cited_paper":"/paper/2402.13753","citing_paper":"/paper/2607.27919"},"observation_digest":"sha256:4985df48d43f6564fbdd593534fd5d4aea8998a558097132c4d6effce9b8abc2","observation_id":"0825969d-43f8-4d20-bd03-8d857dd9c58e","resolution":{"observed_at":"2026-07-31T23:07:18.010236Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:07:18.036737Z","title":"Measuring memorization in language models via probabilistic extraction","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.27919","last_updated":"2026-07-30T09:30:03Z","snapshot_observed_at":"2026-08-08T06:34:17.309522Z","submitted_at":"2026-07-30T09:30:03Z","title":"Memory Decoder at Scale: A Pretrained, Parametric Long-Term Memory","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-07-31T23:07:18.036737Z"},"links":{"citing_paper":"/paper/2607.27919"},"observation_digest":"sha256:2064bd37dc1750087df76d757235535ef70ca91f943078a39f63f878a2f7df79","observation_id":"049b80c2-e55b-45a9-86c7-d377d65bc0c6","resolution":{"observed_at":"2026-07-31T23:07:18.036737Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.08053","last_updated":"2020-03-13T23:45:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-09-17T19:42:54Z","title":"Megatron-LM: Training Multi-Billion Parameter Language Models Using Model Parallelism","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.08053","snapshot_observed_at":"2026-07-31T23:07:18.088076Z","title":"Megatron-lm: Training multi-billion parameter language models using model parallelism","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2607.27919","last_updated":"2026-07-30T09:30:03Z","snapshot_observed_at":"2026-08-08T06:34:17.309522Z","submitted_at":"2026-07-30T09:30:03Z","title":"Memory Decoder at Scale: A Pretrained, Parametric Long-Term Memory","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-07-31T23:07:18.088076Z"},"links":{"cited_paper":"/paper/1909.08053","citing_paper":"/paper/2607.27919"},"observation_digest":"sha256:8ef0f49b889cac59f8edfa81a7c551831078d86267a64a95e47326a45a791ae4","observation_id":"c8d0ba66-3540-460f-a7d9-5e957dc98f8a","resolution":{"observed_at":"2026-07-31T23:07:18.088076Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.05457","last_updated":"2018-03-14T18:04:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2018-03-14T18:04:21Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.05457","snapshot_observed_at":"2026-07-31T23:07:18.000927Z","title":"Think you have solved question answering? try arc, the ai2 reasoning challenge","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27919","last_updated":"2026-07-30T09:30:03Z","snapshot_observed_at":"2026-08-08T06:34:17.309522Z","submitted_at":"2026-07-30T09:30:03Z","title":"Memory Decoder at Scale: A Pretrained, Parametric Long-Term Memory","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-07-31T23:07:18.000927Z"},"links":{"cited_paper":"/paper/1803.05457","citing_paper":"/paper/2607.27919"},"observation_digest":"sha256:6e33730d97480d062eadb72740995089f8d110b14d4a87a3b2d632fc1e53f64c","observation_id":"6ea5ff70-16ff-4f12-88f1-714f37dbe741","resolution":{"observed_at":"2026-07-31T23:07:18.000927Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00656","last_updated":"2025-10-08T07:50:45Z","snapshot_observed_at":"2026-08-08T06:58:44.493777Z","submitted_at":"2024-12-31T21:55:10Z","title":"2 OLMo 2 Furious","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.00656","snapshot_observed_at":"2026-07-31T23:07:18.071026Z","title":"2 olmo 2 furious.arXiv preprint arXiv:2501.00656,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27919","last_updated":"2026-07-30T09:30:03Z","snapshot_observed_at":"2026-08-08T06:34:17.309522Z","submitted_at":"2026-07-30T09:30:03Z","title":"Memory Decoder at Scale: A Pretrained, Parametric Long-Term Memory","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-07-31T23:07:18.071026Z"},"links":{"cited_paper":"/paper/2501.00656","citing_paper":"/paper/2607.27919"},"observation_digest":"sha256:1221f1562d451a63b7ddfdb9fd6e1d99c96066f7ca95e9e494d3a7803a0cc288","observation_id":"4b3af424-dd33-4748-91ab-817261791c7a","resolution":{"observed_at":"2026-07-31T23:07:18.071026Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00663","last_updated":"2024-12-31T22:32:03Z","snapshot_observed_at":"2026-08-07T09:00:33.558814Z","submitted_at":"2024-12-31T22:32:03Z","title":"Titans: Learning to Memorize at Test Time","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.00663","snapshot_observed_at":"2026-07-31T23:07:17.996097Z","title":"Yoshua Bengio, Réjean Ducharme, Pascal Vincent, and Christian Jauvin","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27919","last_updated":"2026-07-30T09:30:03Z","snapshot_observed_at":"2026-08-08T06:34:17.309522Z","submitted_at":"2026-07-30T09:30:03Z","title":"Memory Decoder at Scale: A Pretrained, Parametric Long-Term Memory","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-07-31T23:07:17.996097Z"},"links":{"cited_paper":"/paper/2501.00663","citing_paper":"/paper/2607.27919"},"observation_digest":"sha256:5f883140244d2c7c542d56eb5b8a60adb594bf528ffa82f966567067a33aa79f","observation_id":"f26b7e36-ce8a-4fed-8507-96f858ff369a","resolution":{"observed_at":"2026-07-31T23:07:17.996097Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:07:18.014654Z","title":"Twinvoice: A multi-dimensional benchmark towards digital twins via llm persona simulation.arXiv preprint arXiv:2510.25536,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27919","last_updated":"2026-07-30T09:30:03Z","snapshot_observed_at":"2026-08-08T06:34:17.309522Z","submitted_at":"2026-07-30T09:30:03Z","title":"Memory Decoder at Scale: A Pretrained, Parametric Long-Term Memory","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-07-31T23:07:18.014654Z"},"links":{"citing_paper":"/paper/2607.27919"},"observation_digest":"sha256:9026bac0f08fd7fff714f9929cfc95af8151514ec8e98ba5f5d19c0dcc3719d1","observation_id":"f5233451-7b0a-4c15-871a-32b219e719f7","resolution":{"observed_at":"2026-07-31T23:07:18.014654Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-07-31T23:07:18.112592Z","title":"Qwen3 technical report.arXiv preprint arXiv:2505.09388,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27919","last_updated":"2026-07-30T09:30:03Z","snapshot_observed_at":"2026-08-08T06:34:17.309522Z","submitted_at":"2026-07-30T09:30:03Z","title":"Memory Decoder at Scale: A Pretrained, Parametric Long-Term Memory","version":1},"reference_index":2026,"source":"pdf_text","source_observed_at":"2026-07-31T23:07:18.112592Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2607.27919"},"observation_digest":"sha256:11776ff867057c81b2bf0871ba6a4bb21cf702647284b4257eaa81f715ac0f47","observation_id":"e4e18648-9f16-4944-b8bc-3051f0351567","resolution":{"observed_at":"2026-07-31T23:07:18.112592Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.27919","last_updated":"2026-07-30T09:30:03Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-08T06:34:17.309522Z","submitted_at":"2026-07-30T09:30:03Z","title":"Memory Decoder at Scale: A Pretrained, Parametric Long-Term Memory"},"reference_resolution":{"displayed":43,"state_counts":{"malformed_identifier":2,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":40,"verified_exact":1,"verified_fuzzy":0},"total_outbound_references":43},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 43 of 43 outbound references and 0 inbound Pith citation observations for arXiv:2607.27919."}