{"as_of":"2026-08-19T15:47:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:54133c4f87e63d679b0c644156fef9764f480e0a806eb3806fd66e80b707dbe0","coverage":[{"denominator":21,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":21,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T00:19:14.601846Z","state":"measured"},{"denominator":21,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":21,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.12218/citation-record","integrity":"/paper/2608.12218/integrity","json":"/paper/2608.12218/citation-record.json","paper":"/paper/2608.12218"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:19:15.136399Z","title":"Each task applies a unary bitwise operation to the input string, such as NOT, which maps each bit to its complement.5 The valid output tokens are0and1","venue":null,"work_id":"ed5b195e-b0af-48ec-8bae-b72ececf6616","year":null},"citing_paper":{"arxiv_id":"2608.12218","last_updated":"2026-08-13T14:44:33Z","snapshot_observed_at":"2026-08-19T04:27:44.811549Z","submitted_at":"2026-08-12T16:13:05Z","title":"Information Abundance Paradox: Long-Context Training Undermines Parametric Knowledge","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-16T00:19:14.562526Z"},"links":{"citing_paper":"/paper/2608.12218"},"observation_digest":"sha256:e85582b2cc4073a5119c0d055c814f0dce31ecf69ca9f41da9228f7aa36a0e68","observation_id":"bdf7361d-85fe-4867-8c25-cff95beb666d","resolution":{"observed_at":"2026-08-16T00:19:15.143312Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:19:15.116564Z","title":"Each task applies a deterministic string transformation, such as REVERSE","venue":null,"work_id":"2141c3a8-e2b8-4d92-b684-8e7dbd8903e7","year":null},"citing_paper":{"arxiv_id":"2608.12218","last_updated":"2026-08-13T14:44:33Z","snapshot_observed_at":"2026-08-19T04:27:44.811549Z","submitted_at":"2026-08-12T16:13:05Z","title":"Information Abundance Paradox: Long-Context Training Undermines Parametric Knowledge","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-16T00:19:14.568622Z"},"links":{"citing_paper":"/paper/2608.12218"},"observation_digest":"sha256:7088f308fa143371535e1fed74d09b5b18e0754bc64475c3688616b70207ef2c","observation_id":"a051f91a-2bc3-454b-9f40-ead1f2e791cc","resolution":{"observed_at":"2026-08-16T00:19:15.122625Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:19:15.097135Z","title":"Each task applies a digit-wise arithmetic operation modulo 10","venue":null,"work_id":"9191ff7e-c1cb-4885-9adf-e8c3f6cc146d","year":null},"citing_paper":{"arxiv_id":"2608.12218","last_updated":"2026-08-13T14:44:33Z","snapshot_observed_at":"2026-08-19T04:27:44.811549Z","submitted_at":"2026-08-12T16:13:05Z","title":"Information Abundance Paradox: Long-Context Training Undermines Parametric Knowledge","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-16T00:19:14.574485Z"},"links":{"citing_paper":"/paper/2608.12218"},"observation_digest":"sha256:710b003a211c44e9b4f124b1ebce69ca713aee81a12e32677346e0f870e0cb1b","observation_id":"0096ffbf-3a85-4ca6-98fc-420247e4346a","resolution":{"observed_at":"2026-08-16T00:19:15.102748Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:19:15.078666Z","title":"Each task shifts every digit by a global offset modulo","venue":null,"work_id":"6a13a1fa-0bf0-44d8-90d4-22974c3dc079","year":null},"citing_paper":{"arxiv_id":"2608.12218","last_updated":"2026-08-13T14:44:33Z","snapshot_observed_at":"2026-08-19T04:27:44.811549Z","submitted_at":"2026-08-12T16:13:05Z","title":"Information Abundance Paradox: Long-Context Training Undermines Parametric Knowledge","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-16T00:19:14.579511Z"},"links":{"citing_paper":"/paper/2608.12218"},"observation_digest":"sha256:200090fe80c018b9a5d17a32bd7bf8aae4ed6ad12d4726e3095815742bbf9110","observation_id":"c1ce9677-fd93-4cd0-80a8-2cc53a951226","resolution":{"observed_at":"2026-08-16T00:19:15.084674Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.03126","last_updated":"2022-06-07T09:07:24Z","snapshot_observed_at":"2026-08-19T06:28:48.234683Z","submitted_at":"2022-06-07T09:07:24Z","title":"Signal Propagation in Transformers: Theoretical Perspectives and the Role of Rank Collapse","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.03126","snapshot_observed_at":"2026-08-16T00:19:14.526462Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.12218","last_updated":"2026-08-13T14:44:33Z","snapshot_observed_at":"2026-08-19T04:27:44.811549Z","submitted_at":"2026-08-12T16:13:05Z","title":"Information Abundance Paradox: Long-Context Training Undermines Parametric Knowledge","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-16T00:19:14.526462Z"},"links":{"cited_paper":"/paper/2206.03126","citing_paper":"/paper/2608.12218"},"observation_digest":"sha256:b0b3bcda849d6169460ce209aa170832e55e05f12206c101591c5d79fa9d1f78","observation_id":"dad96c4b-2b3b-4027-ade1-e2ce5da0a84e","resolution":{"observed_at":"2026-08-16T00:19:14.526462Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-08-14T18:15:53.516440Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-16T00:19:14.531730Z","title":"Ian Tenney, Dipanjan Das, and Ellie Pavlick","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2608.12218","last_updated":"2026-08-13T14:44:33Z","snapshot_observed_at":"2026-08-19T04:27:44.811549Z","submitted_at":"2026-08-12T16:13:05Z","title":"Information Abundance Paradox: Long-Context Training Undermines Parametric Knowledge","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-16T00:19:14.531730Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2608.12218"},"observation_digest":"sha256:684d17853425fb5c489185e74cb841b682bda29947bf2bf4de5e148653dfe3a5","observation_id":"7c6a9532-3c50-4a66-b2d8-a098049d3a4b","resolution":{"observed_at":"2026-08-16T00:19:14.531730Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-16T00:19:14.537111Z","title":"17 Chandra Shekhara Kaushik Valmeekam, Krishna Narayanan, Dileep Kalathil, Jean-Francois Cham- berland, and Srinivas Shakkottai","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12218","last_updated":"2026-08-13T14:44:33Z","snapshot_observed_at":"2026-08-19T04:27:44.811549Z","submitted_at":"2026-08-12T16:13:05Z","title":"Information Abundance Paradox: Long-Context Training Undermines Parametric Knowledge","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-16T00:19:14.537111Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2608.12218"},"observation_digest":"sha256:b9714c8b27fce0df817a997a466564fc359a7042c578102486f5ae48075b8147","observation_id":"b2fedd67-f17a-4a45-804d-0fb2d63fe79d","resolution":{"observed_at":"2026-08-16T00:19:14.537111Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.04050","last_updated":"2023-06-26T18:03:12Z","snapshot_observed_at":"2026-08-16T15:26:00.666637Z","submitted_at":"2023-06-06T22:42:00Z","title":"LLMZip: Lossless Text Compression using Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.04050","snapshot_observed_at":"2026-08-16T00:19:14.542038Z","title":"Ashish Vaswani, Noam Shazeer, Niki Parmar, Jakob Uszkoreit, Llion Jones, Aidan N","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.12218","last_updated":"2026-08-13T14:44:33Z","snapshot_observed_at":"2026-08-19T04:27:44.811549Z","submitted_at":"2026-08-12T16:13:05Z","title":"Information Abundance Paradox: Long-Context Training Undermines Parametric Knowledge","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-16T00:19:14.542038Z"},"links":{"cited_paper":"/paper/2306.04050","citing_paper":"/paper/2608.12218"},"observation_digest":"sha256:622b97a1de7e49f18021033dd70aae2a77b9435077af5e612b5ed7f66cc8fefe","observation_id":"81f1e740-3244-431f-add7-e29cecc3ebf8","resolution":{"observed_at":"2026-08-16T00:19:14.542038Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.08913","last_updated":"2022-03-16T19:54:35Z","snapshot_observed_at":"2026-08-16T17:13:59.010242Z","submitted_at":"2022-03-16T19:54:35Z","title":"Memorizing Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.08913","snapshot_observed_at":"2026-08-16T00:19:14.547102Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.12218","last_updated":"2026-08-13T14:44:33Z","snapshot_observed_at":"2026-08-19T04:27:44.811549Z","submitted_at":"2026-08-12T16:13:05Z","title":"Information Abundance Paradox: Long-Context Training Undermines Parametric Knowledge","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-16T00:19:14.547102Z"},"links":{"cited_paper":"/paper/2203.08913","citing_paper":"/paper/2608.12218"},"observation_digest":"sha256:161dde38d70554eafc800f4f59dc8ab7032b96c844a71aad5d9c26bad62113fd","observation_id":"67e2ceff-6028-41b8-bd4f-3e47bfd6271a","resolution":{"observed_at":"2026-08-16T00:19:14.547102Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1810.12885","last_updated":"2018-10-30T17:32:16Z","snapshot_observed_at":"2026-08-14T18:06:55.722255Z","submitted_at":"2018-10-30T17:32:16Z","title":"ReCoRD: Bridging the Gap between Human and Machine Commonsense Reading Comprehension","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.12885","snapshot_observed_at":"2026-08-16T00:19:14.551979Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12218","last_updated":"2026-08-13T14:44:33Z","snapshot_observed_at":"2026-08-19T04:27:44.811549Z","submitted_at":"2026-08-12T16:13:05Z","title":"Information Abundance Paradox: Long-Context Training Undermines Parametric Knowledge","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-16T00:19:14.551979Z"},"links":{"cited_paper":"/paper/1810.12885","citing_paper":"/paper/2608.12218"},"observation_digest":"sha256:71c271fd62057109493810b923793d31427f6a5b18e93d32550210a655a2e528","observation_id":"79af68f6-f363-49b4-829b-d53b82194a8d","resolution":{"observed_at":"2026-08-16T00:19:14.551979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.00605","last_updated":"2024-06-02T03:34:41Z","snapshot_observed_at":"2026-08-16T13:47:04.780725Z","submitted_at":"2024-06-02T03:34:41Z","title":"LongSkywork: A Training Recipe for Efficiently Extending Context Length in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.00605","snapshot_observed_at":"2026-08-16T00:19:14.557284Z","title":"Shuyan Zhou, Frank F","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.12218","last_updated":"2026-08-13T14:44:33Z","snapshot_observed_at":"2026-08-19T04:27:44.811549Z","submitted_at":"2026-08-12T16:13:05Z","title":"Information Abundance Paradox: Long-Context Training Undermines Parametric Knowledge","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-16T00:19:14.557284Z"},"links":{"cited_paper":"/paper/2406.00605","citing_paper":"/paper/2608.12218"},"observation_digest":"sha256:5ef9a507bf68aebf69b3f11aa6f9aa5ff6d2ac540f19cd1ff503f3cf90dc288b","observation_id":"122cd1ac-e3fa-409c-ab99-ec6adfc05f81","resolution":{"observed_at":"2026-08-16T00:19:14.557284Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:19:15.061501Z","title":"We train each model for 10 epochs","venue":null,"work_id":"f37926a9-6e6b-4242-9865-88ccd3dcab68","year":null},"citing_paper":{"arxiv_id":"2608.12218","last_updated":"2026-08-13T14:44:33Z","snapshot_observed_at":"2026-08-19T04:27:44.811549Z","submitted_at":"2026-08-12T16:13:05Z","title":"Information Abundance Paradox: Long-Context Training Undermines Parametric Knowledge","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-16T00:19:14.585405Z"},"links":{"citing_paper":"/paper/2608.12218"},"observation_digest":"sha256:d67d5314e3cf1009df7abff37dded4c5e1acc71edb8d20bde0c2eafb52c069c5","observation_id":"23734d3e-3f21-49d5-8efc-91106e23ffd2","resolution":{"observed_at":"2026-08-16T00:19:15.066870Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:19:15.044540Z","title":"This condition measures performance when the model can rely on useful in-context evidence","venue":null,"work_id":"d3fa8817-8bb7-4242-bc92-4fb8ff2e500c","year":null},"citing_paper":{"arxiv_id":"2608.12218","last_updated":"2026-08-13T14:44:33Z","snapshot_observed_at":"2026-08-19T04:27:44.811549Z","submitted_at":"2026-08-12T16:13:05Z","title":"Information Abundance Paradox: Long-Context Training Undermines Parametric Knowledge","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-16T00:19:14.591183Z"},"links":{"citing_paper":"/paper/2608.12218"},"observation_digest":"sha256:0a8656950cf90caaff3711fd8b36a77c1de3bb6ecaa4f827597de03e7788b377","observation_id":"308ae936-b600-4c4d-ab5a-16e5f565befa","resolution":{"observed_at":"2026-08-16T00:19:15.050139Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:19:15.025773Z","title":"This condition measures whether the model follows the supplied context even when it conflicts with the parametrically correct rule","venue":null,"work_id":"627459fd-bf93-48c9-bf91-5305121f29a5","year":2016},"citing_paper":{"arxiv_id":"2608.12218","last_updated":"2026-08-13T14:44:33Z","snapshot_observed_at":"2026-08-19T04:27:44.811549Z","submitted_at":"2026-08-12T16:13:05Z","title":"Information Abundance Paradox: Long-Context Training Undermines Parametric Knowledge","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-16T00:19:14.596228Z"},"links":{"citing_paper":"/paper/2608.12218"},"observation_digest":"sha256:c41e6a0222c1a7162078424ada4b97b3eaad1e6121eab4d629dd60e772b406b1","observation_id":"228c9cb0-dc75-4a7e-9882-247fce2b1bbf","resolution":{"observed_at":"2026-08-16T00:19:15.032427Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1803.05457","last_updated":"2018-03-14T18:04:21Z","snapshot_observed_at":"2026-08-14T19:36:07.505691Z","submitted_at":"2018-03-14T18:04:21Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.05457","snapshot_observed_at":"2026-08-16T00:19:14.520177Z","title":"learning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.12218","last_updated":"2026-08-13T14:44:33Z","snapshot_observed_at":"2026-08-19T04:27:44.811549Z","submitted_at":"2026-08-12T16:13:05Z","title":"Information Abundance Paradox: Long-Context Training Undermines Parametric Knowledge","version":2},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-16T00:19:14.520177Z"},"links":{"cited_paper":"/paper/1803.05457","citing_paper":"/paper/2608.12218"},"observation_digest":"sha256:d2a7ce1e3534d28756f188276c369da418007554cefe0a1934c8d07479c60453","observation_id":"c78d98ac-edf1-4067-a78e-51a9774b7303","resolution":{"observed_at":"2026-08-16T00:19:14.520177Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2004.05150","last_updated":"2020-12-02T17:52:35Z","snapshot_observed_at":"2026-07-31T17:17:17.205582Z","submitted_at":"2020-04-10T17:54:09Z","title":"Longformer: The Long-Document Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.05150","snapshot_observed_at":"2026-08-16T00:19:14.504369Z","title":"11 Amanda Bertsch, Maor Ivgi, Emily Xiao, Uri Alon, Jonathan Berant, Matthew R","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2608.12218","last_updated":"2026-08-13T14:44:33Z","snapshot_observed_at":"2026-08-19T04:27:44.811549Z","submitted_at":"2026-08-12T16:13:05Z","title":"Information Abundance Paradox: Long-Context Training Undermines Parametric Knowledge","version":2},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-16T00:19:14.504369Z"},"links":{"cited_paper":"/paper/2004.05150","citing_paper":"/paper/2608.12218"},"observation_digest":"sha256:900dc82285ff84d89bf74dd2c5a7031bc012221f2ee83b8371a5c13ab1a58262","observation_id":"892f52c3-8a2c-4a52-b0a3-5765f95d31a2","resolution":{"observed_at":"2026-08-16T00:19:14.504369Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.05675","last_updated":"2022-10-13T14:06:09Z","snapshot_observed_at":"2026-08-18T22:42:07.740312Z","submitted_at":"2022-10-11T09:29:19Z","title":"Transformers generalize differently from information stored in context vs in weights","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.05675","snapshot_observed_at":"2026-08-16T00:19:14.514893Z","title":"Jianghao Chen, Junhong Wu, Yangyifan Xu, and Jiajun Zhang","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.12218","last_updated":"2026-08-13T14:44:33Z","snapshot_observed_at":"2026-08-19T04:27:44.811549Z","submitted_at":"2026-08-12T16:13:05Z","title":"Information Abundance Paradox: Long-Context Training Undermines Parametric Knowledge","version":2},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-16T00:19:14.514893Z"},"links":{"cited_paper":"/paper/2210.05675","citing_paper":"/paper/2608.12218"},"observation_digest":"sha256:336c0190f86d510c87840ed6d00f77a38a0b6a4204355eabfbdff830f7c830c5","observation_id":"e6f9e748-e2fe-413a-a370-58239cfe1272","resolution":{"observed_at":"2026-08-16T00:19:14.514893Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13245","last_updated":"2023-12-23T17:55:11Z","snapshot_observed_at":"2026-08-15T06:28:09.529747Z","submitted_at":"2023-05-22T17:16:38Z","title":"GQA: Training Generalized Multi-Query Transformer Models from Multi-Head Checkpoints","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13245","snapshot_observed_at":"2026-08-16T00:19:14.493028Z","title":"Chenxin An, Jun Zhang, Ming Zhong, Lei Li, Shansan Gong, Yao Luo, Jingjing Xu, and Lingpeng Kong","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.12218","last_updated":"2026-08-13T14:44:33Z","snapshot_observed_at":"2026-08-19T04:27:44.811549Z","submitted_at":"2026-08-12T16:13:05Z","title":"Information Abundance Paradox: Long-Context Training Undermines Parametric Knowledge","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-16T00:19:14.493028Z"},"links":{"cited_paper":"/paper/2305.13245","citing_paper":"/paper/2608.12218"},"observation_digest":"sha256:4ade739179df5e58c66e7041c6988f7bf3f58f5f5d85ecedd19bd46874519203","observation_id":"a3db998a-bf25-4439-b7b6-c12de98bcfec","resolution":{"observed_at":"2026-08-16T00:19:14.493028Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.11162","last_updated":"2022-07-18T20:57:25Z","snapshot_observed_at":"2026-08-14T22:17:56.692887Z","submitted_at":"2020-09-23T14:17:53Z","title":"Implicit Gradient Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.11162","snapshot_observed_at":"2026-08-16T00:19:14.499066Z","title":"doi: 10.18653/v1/2024.acl-long.172","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.12218","last_updated":"2026-08-13T14:44:33Z","snapshot_observed_at":"2026-08-19T04:27:44.811549Z","submitted_at":"2026-08-12T16:13:05Z","title":"Information Abundance Paradox: Long-Context Training Undermines Parametric Knowledge","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-16T00:19:14.499066Z"},"links":{"cited_paper":"/paper/2009.11162","citing_paper":"/paper/2608.12218"},"observation_digest":"sha256:ef511e9bfee75a71aef9df68ead74cd388cba96b5a77bc511f8282612d95b947","observation_id":"04dc6d74-d55d-4e0d-a757-e2410cf8dc95","resolution":{"observed_at":"2026-08-16T00:19:14.499066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:19:14.509319Z","title":"ISBN 979-8-89176-189-6","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.12218","last_updated":"2026-08-13T14:44:33Z","snapshot_observed_at":"2026-08-19T04:27:44.811549Z","submitted_at":"2026-08-12T16:13:05Z","title":"Information Abundance Paradox: Long-Context Training Undermines Parametric Knowledge","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-16T00:19:14.509319Z"},"links":{"citing_paper":"/paper/2608.12218"},"observation_digest":"sha256:e0b27cd117fb76c87f2d4fbeb25c35735852185983d843153416ee3134e59a93","observation_id":"4f828942-c7a5-442e-82d0-fa9bb2eeceea","resolution":{"observed_at":"2026-08-16T00:19:14.509319Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"4090.0037","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:19:14.720550Z","title":"furthermore","venue":null,"work_id":"8d9f68d5-9191-438b-8560-99720248f777","year":null},"citing_paper":{"arxiv_id":"2608.12218","last_updated":"2026-08-13T14:44:33Z","snapshot_observed_at":"2026-08-19T04:27:44.811549Z","submitted_at":"2026-08-12T16:13:05Z","title":"Information Abundance Paradox: Long-Context Training Undermines Parametric Knowledge","version":2},"reference_index":8192,"source":"pdf_text","source_observed_at":"2026-08-16T00:19:14.601846Z"},"links":{"citing_paper":"/paper/2608.12218"},"observation_digest":"sha256:b0475722beb36ac8760593bad4bacd1e37f72b02145c37806ca980638e578023","observation_id":"2ce557b1-30b1-4745-867c-e77d59d6dd79","resolution":{"observed_at":"2026-08-16T00:19:14.730177Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2608.12218","last_updated":"2026-08-13T14:44:33Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-19T04:27:44.811549Z","submitted_at":"2026-08-12T16:13:05Z","title":"Information Abundance Paradox: Long-Context Training Undermines Parametric Knowledge"},"reference_resolution":{"displayed":21,"state_counts":{"malformed_identifier":4,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":10,"verified_exact":0,"verified_fuzzy":7},"total_outbound_references":21},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 21 of 21 outbound references and 0 inbound Pith citation observations for arXiv:2608.12218."}