{"as_of":"2026-08-11T13:09:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:8fe913b39c90aebff41d31112140c77f300562bae9026c83e5928672b8083a2b","coverage":[{"denominator":14,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":14,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T05:04:55.962152Z","state":"measured"},{"denominator":15,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":15,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-12T02:02:06.788056Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-12T07:46:25.975143Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.09099","last_updated":"2025-06-17T19:17:29Z","snapshot_observed_at":"2026-08-09T23:42:25.878848Z","submitted_at":"2025-06-10T14:49:33Z","title":"Too Big to Think: Capacity, Memorization, and Generalization in Pre-Trained Transformers","version":2},"cited_work":{"arxiv_id":"2506.09099","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.09099","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Barron and D","venue":null,"work_id":"fafc30f5-968b-474d-9e9c-247f80740040","year":2025},"citing_paper":{"arxiv_id":"2605.09678","last_updated":"2026-05-10T17:55:38Z","snapshot_observed_at":"2026-07-06T23:21:44.900680Z","submitted_at":"2026-05-10T17:55:38Z","title":"Absurd World: A Simple Yet Powerful Method to Absurdify the Real-world for Probing LLM Reasoning Capabilities","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-12T02:02:06.788056Z"},"links":{"cited_paper":"/paper/2506.09099","citing_paper":"/paper/2605.09678"},"observation_digest":"sha256:988b6b87a8135e1564854e59876c8ced8feb9a0ba96a027b643c3bd4f3ce6b93","observation_id":"6a6da3b7-5808-4654-9ae7-d0e6edac71f7","resolution":{"observed_at":"2026-05-12T07:46:25.982733Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.09099/citation-record","integrity":"/paper/2506.09099/integrity","json":"/paper/2506.09099/citation-record.json","paper":"/paper/2506.09099"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-07T05:04:55.911995Z","title":"L., Almeida, D., Altenschmidt, J., Altman, S., Anadkat, S., et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.09099","last_updated":"2025-06-17T19:17:29Z","snapshot_observed_at":"2026-08-09T23:42:25.878848Z","submitted_at":"2025-06-10T14:49:33Z","title":"Too Big to Think: Capacity, Memorization, and Generalization in Pre-Trained Transformers","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T05:04:55.911995Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2506.09099"},"observation_digest":"sha256:39bd9991eeae9e3ab04e7ad24f965ea3b4c317cdff2a4b101d42dafe347d0fdd","observation_id":"8161e917-cecd-4e3a-a2a4-1c889c3a655e","resolution":{"observed_at":"2026-08-07T05:04:55.911995Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:04:56.164480Z","title":"9, 2024); accessed May 19,","venue":null,"work_id":"c99eb095-eeb6-471f-8c47-8e788f8e9776","year":2024},"citing_paper":{"arxiv_id":"2506.09099","last_updated":"2025-06-17T19:17:29Z","snapshot_observed_at":"2026-08-09T23:42:25.878848Z","submitted_at":"2025-06-10T14:49:33Z","title":"Too Big to Think: Capacity, Memorization, and Generalization in Pre-Trained Transformers","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T05:04:55.925247Z"},"links":{"citing_paper":"/paper/2506.09099"},"observation_digest":"sha256:bfba6f152a86f795743e4396b0c7d49182de5a7e35dc590084feaa95d4cb5fa1","observation_id":"57c1af3c-30f3-4ba1-8fa7-3fe26dac7beb","resolution":{"observed_at":"2026-08-07T05:04:56.167851Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:04:55.932743Z","title":"doi: 10.1016/j.neunet.2024.106550","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.09099","last_updated":"2025-06-17T19:17:29Z","snapshot_observed_at":"2026-08-09T23:42:25.878848Z","submitted_at":"2025-06-10T14:49:33Z","title":"Too Big to Think: Capacity, Memorization, and Generalization in Pre-Trained Transformers","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T05:04:55.932743Z"},"links":{"citing_paper":"/paper/2506.09099"},"observation_digest":"sha256:175635285b8810958dbb12fc63e8231ece37f28c397199b49e7de63aceee5086","observation_id":"04fcb939-cc24-4f4e-89c4-98b4e2b86369","resolution":{"observed_at":"2026-08-07T05:04:55.932743Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.02155","last_updated":"2022-03-04T07:04:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-03-04T07:04:42Z","title":"Training language models to follow instructions with human feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.02155","snapshot_observed_at":"2026-08-07T05:04:55.936614Z","title":"Pareja, A., Nayak, N","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.09099","last_updated":"2025-06-17T19:17:29Z","snapshot_observed_at":"2026-08-09T23:42:25.878848Z","submitted_at":"2025-06-10T14:49:33Z","title":"Too Big to Think: Capacity, Memorization, and Generalization in Pre-Trained Transformers","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T05:04:55.936614Z"},"links":{"cited_paper":"/paper/2203.02155","citing_paper":"/paper/2506.09099"},"observation_digest":"sha256:3fd8ca79300bb4b78a6d100f5e66db8a4081048a3a96f58babcae007695191bb","observation_id":"d55ccfad-9b27-495b-b0a9-0810362e5e9e","resolution":{"observed_at":"2026-08-07T05:04:55.936614Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.13337","last_updated":"2024-12-17T21:16:59Z","snapshot_observed_at":"2026-07-06T20:08:51.664923Z","submitted_at":"2024-12-17T21:16:59Z","title":"Unveiling the Secret Recipe: A Guide For Supervised Fine-Tuning Small LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.13337","snapshot_observed_at":"2026-08-07T05:04:55.940338Z","title":"Power, A., Burda, Y ., Edwards, H., Babuschkin, I., and Misra, V","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.09099","last_updated":"2025-06-17T19:17:29Z","snapshot_observed_at":"2026-08-09T23:42:25.878848Z","submitted_at":"2025-06-10T14:49:33Z","title":"Too Big to Think: Capacity, Memorization, and Generalization in Pre-Trained Transformers","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T05:04:55.940338Z"},"links":{"cited_paper":"/paper/2412.13337","citing_paper":"/paper/2506.09099"},"observation_digest":"sha256:1b44aa6a1454668ace01f4bfdcf0685d2a68a19c4cb6c2f75da7bda2f7adda87","observation_id":"e040c504-c48e-47f9-8502-6c11da144c51","resolution":{"observed_at":"2026-08-07T05:04:55.940338Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.02177","last_updated":"2022-01-06T18:43:37Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-01-06T18:43:37Z","title":"Grokking: Generalization Beyond Overfitting on Small Algorithmic Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.02177","snapshot_observed_at":"2026-08-07T05:04:55.944197Z","title":"Radford, A., Wu, J., Child, R., Luan, D., Amodei, D., Sutskever, I., et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.09099","last_updated":"2025-06-17T19:17:29Z","snapshot_observed_at":"2026-08-09T23:42:25.878848Z","submitted_at":"2025-06-10T14:49:33Z","title":"Too Big to Think: Capacity, Memorization, and Generalization in Pre-Trained Transformers","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T05:04:55.944197Z"},"links":{"cited_paper":"/paper/2201.02177","citing_paper":"/paper/2506.09099"},"observation_digest":"sha256:873441e78b724825c56812a051093a6b500d1312520f8a53ec3392ef30bac1e6","observation_id":"170e1a5b-513d-4023-b290-12eee9943dc2","resolution":{"observed_at":"2026-08-07T05:04:55.944197Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.10770","last_updated":"2022-11-02T19:53:44Z","snapshot_observed_at":"2026-08-09T02:57:37.630261Z","submitted_at":"2022-05-22T07:43:50Z","title":"Memorization Without Overfitting: Analyzing the Training Dynamics of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.10770","snapshot_observed_at":"2026-08-07T05:04:55.951254Z","title":"Vaswani, A., Shazeer, N., Parmar, N., Uszkoreit, J., Jones, L., Gomez, A","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.09099","last_updated":"2025-06-17T19:17:29Z","snapshot_observed_at":"2026-08-09T23:42:25.878848Z","submitted_at":"2025-06-10T14:49:33Z","title":"Too Big to Think: Capacity, Memorization, and Generalization in Pre-Trained Transformers","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T05:04:55.951254Z"},"links":{"cited_paper":"/paper/2205.10770","citing_paper":"/paper/2506.09099"},"observation_digest":"sha256:4655ff84e2d456bd885bb507056d7d4bd9ba0bbe4c370f4bc16d0fcd9eb7cd7d","observation_id":"d414a4b0-7877-4fb0-bf7d-2931d92c6792","resolution":{"observed_at":"2026-08-07T05:04:55.951254Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.15071","last_updated":"2024-10-30T18:47:53Z","snapshot_observed_at":"2026-08-11T00:54:35.296162Z","submitted_at":"2024-05-23T21:42:19Z","title":"Grokked Transformers are Implicit Reasoners: A Mechanistic Journey to the Edge of Generalization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.15071","snapshot_observed_at":"2026-08-07T05:04:55.954824Z","title":"Wang, X., Antoniades, A., Elazar, Y ., Amayuelas, A., Al- balak, A., Zhang, K., and Wang, W","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.09099","last_updated":"2025-06-17T19:17:29Z","snapshot_observed_at":"2026-08-09T23:42:25.878848Z","submitted_at":"2025-06-10T14:49:33Z","title":"Too Big to Think: Capacity, Memorization, and Generalization in Pre-Trained Transformers","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T05:04:55.954824Z"},"links":{"cited_paper":"/paper/2405.15071","citing_paper":"/paper/2506.09099"},"observation_digest":"sha256:818db7c07d181145a831aaadae2bbe867b4d89aac9fe5d5798587fa44ff27e78","observation_id":"43e43de8-b55d-4d46-8ce2-d425768a8620","resolution":{"observed_at":"2026-08-07T05:04:55.954824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06714","last_updated":"2024-02-22T21:19:59Z","snapshot_observed_at":"2026-07-06T16:30:33.889293Z","submitted_at":"2023-10-10T15:41:26Z","title":"Exploring Memorization in Fine-tuned Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06714","snapshot_observed_at":"2026-08-07T05:04:55.958433Z","title":"Controlled Regularization","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.09099","last_updated":"2025-06-17T19:17:29Z","snapshot_observed_at":"2026-08-09T23:42:25.878848Z","submitted_at":"2025-06-10T14:49:33Z","title":"Too Big to Think: Capacity, Memorization, and Generalization in Pre-Trained Transformers","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T05:04:55.958433Z"},"links":{"cited_paper":"/paper/2310.06714","citing_paper":"/paper/2506.09099"},"observation_digest":"sha256:db1addaf86e903b542ae670e638b62674b34096511aeb6bcad4c3de94ba6a67d","observation_id":"456e782f-fb2c-42de-9a69-8828c499f5c4","resolution":{"observed_at":"2026-08-07T05:04:55.958433Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:04:56.152607Z","title":"Goldilocks zone","venue":null,"work_id":"9683272c-b721-4ade-bffd-d0d9178ac8c2","year":null},"citing_paper":{"arxiv_id":"2506.09099","last_updated":"2025-06-17T19:17:29Z","snapshot_observed_at":"2026-08-09T23:42:25.878848Z","submitted_at":"2025-06-10T14:49:33Z","title":"Too Big to Think: Capacity, Memorization, and Generalization in Pre-Trained Transformers","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T05:04:55.962152Z"},"links":{"citing_paper":"/paper/2506.09099"},"observation_digest":"sha256:9c3a88b9274fb8ba6a7757bac39993381c0770108bcd0cad8b8bb81932607232","observation_id":"48de51b3-0a53-43ee-91df-0e18c07519cb","resolution":{"observed_at":"2026-08-07T05:04:56.157226Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-07T05:04:55.948019Z","title":"M., Hauth, A., Millican, K., et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.09099","last_updated":"2025-06-17T19:17:29Z","snapshot_observed_at":"2026-08-09T23:42:25.878848Z","submitted_at":"2025-06-10T14:49:33Z","title":"Too Big to Think: Capacity, Memorization, and Generalization in Pre-Trained Transformers","version":2},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-07T05:04:55.948019Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2506.09099"},"observation_digest":"sha256:7767fe46500b8c2c132822a2ce85e9b92ccf8b53261a269c235d2a693ef3c170","observation_id":"6083ae0c-f92c-4cd0-93e5-190a11b12064","resolution":{"observed_at":"2026-08-07T05:04:55.948019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.10343","last_updated":"2022-10-14T17:39:04Z","snapshot_observed_at":"2026-08-08T11:19:57.404379Z","submitted_at":"2022-05-20T17:56:17Z","title":"Towards Understanding Grokking: An Effective Theory of Representation Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.10343","snapshot_observed_at":"2026-08-07T05:04:55.929001Z","title":"Maltoni, D","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.09099","last_updated":"2025-06-17T19:17:29Z","snapshot_observed_at":"2026-08-09T23:42:25.878848Z","submitted_at":"2025-06-10T14:49:33Z","title":"Too Big to Think: Capacity, Memorization, and Generalization in Pre-Trained Transformers","version":2},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-07T05:04:55.929001Z"},"links":{"cited_paper":"/paper/2205.10343","citing_paper":"/paper/2506.09099"},"observation_digest":"sha256:481e382819f338d1540ccbb546b2ad8a9983f9ad9beb712d1d4819f1c951b08c","observation_id":"f86a55e6-0981-4687-a4ba-da29f92be046","resolution":{"observed_at":"2026-08-07T05:04:55.929001Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-07T05:04:55.921232Z","title":"2024 Edition","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.09099","last_updated":"2025-06-17T19:17:29Z","snapshot_observed_at":"2026-08-09T23:42:25.878848Z","submitted_at":"2025-06-10T14:49:33Z","title":"Too Big to Think: Capacity, Memorization, and Generalization in Pre-Trained Transformers","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-07T05:04:55.921232Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2506.09099"},"observation_digest":"sha256:0c1b9d2535117920fcfdec23ece1585965feb97d9486ddec5a65928f5936a308","observation_id":"7d4bf7da-300f-490b-b06e-29a15f30c65a","resolution":{"observed_at":"2026-08-07T05:04:55.921232Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17161","last_updated":"2025-05-26T17:16:45Z","snapshot_observed_at":"2026-08-09T18:26:12.869738Z","submitted_at":"2025-01-28T18:59:44Z","title":"SFT Memorizes, RL Generalizes: A Comparative Study of Foundation Model Post-training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.17161","snapshot_observed_at":"2026-08-07T05:04:55.916932Z","title":"org/abs/2501.17161","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.09099","last_updated":"2025-06-17T19:17:29Z","snapshot_observed_at":"2026-08-09T23:42:25.878848Z","submitted_at":"2025-06-10T14:49:33Z","title":"Too Big to Think: Capacity, Memorization, and Generalization in Pre-Trained Transformers","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-07T05:04:55.916932Z"},"links":{"cited_paper":"/paper/2501.17161","citing_paper":"/paper/2506.09099"},"observation_digest":"sha256:d462c0eb14d5116e02dba90c46f7660d0552c8564fc8f6342c88a30b2882e613","observation_id":"a0b355b9-aa0d-4b4d-9c9b-0e98309b49f6","resolution":{"observed_at":"2026-08-07T05:04:55.916932Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.09099","last_updated":"2025-06-17T19:17:29Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-09T23:42:25.878848Z","submitted_at":"2025-06-10T14:49:33Z","title":"Too Big to Think: Capacity, Memorization, and Generalization in Pre-Trained Transformers"},"reference_resolution":{"displayed":14,"state_counts":{"malformed_identifier":2,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":11,"verified_exact":0,"verified_fuzzy":1},"total_outbound_references":14},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 14 of 14 outbound references and 1 inbound Pith citation observation for arXiv:2506.09099."}