{"as_of":"2026-08-19T16:15:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d9d3590a6c6b8a52e8a021ec9d41e14de85a597b344217425f7937a7836c7965","coverage":[{"denominator":17,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":17,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:18:56.233445Z","state":"measured"},{"denominator":18,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":18,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-10T05:38:12.882914Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-10T05:41:02.181700Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.24788","last_updated":"2025-05-30T16:48:38Z","snapshot_observed_at":"2026-08-16T18:36:30.752724Z","submitted_at":"2025-05-30T16:48:38Z","title":"Drop Dropout on Single-Epoch Language Model Pretraining","version":1},"cited_work":{"arxiv_id":"2505.24788","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.24788","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Houjun Liu, John Bauer, and Christopher D","venue":null,"work_id":"986161a5-aa9a-4065-97e1-e2d883f427fe","year":2026},"citing_paper":{"arxiv_id":"2604.17465","last_updated":"2026-04-30T22:17:02Z","snapshot_observed_at":"2026-08-14T05:36:12.352116Z","submitted_at":"2026-04-19T14:30:13Z","title":"Language models recognize dropout and Gaussian noise applied to their activations","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-10T05:38:12.882914Z"},"links":{"cited_paper":"/paper/2505.24788","citing_paper":"/paper/2604.17465"},"observation_digest":"sha256:c762bc6022aeb2e5507ad6def8be1701c7fa958b0d3dbda68bbccc4bd16a0de3","observation_id":"09c0af84-9f63-4978-80fb-afcb9cce6080","resolution":{"observed_at":"2026-05-10T05:41:02.183113Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.24788/citation-record","integrity":"/paper/2505.24788/integrity","json":"/paper/2505.24788/citation-record.json","paper":"/paper/2505.24788"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:18:58.226689Z","title":"InProceedings of the 2021 Confer- ence on Empirical Methods in Natural Language Pro- cessing, pages 5484–5495, Online and Punta Cana, Dominican Republic","venue":null,"work_id":"88508c15-c3dc-46b0-a018-f1542e89a914","year":2021},"citing_paper":{"arxiv_id":"2505.24788","last_updated":"2025-05-30T16:48:38Z","snapshot_observed_at":"2026-08-16T18:36:30.752724Z","submitted_at":"2025-05-30T16:48:38Z","title":"Drop Dropout on Single-Epoch Language Model Pretraining","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T12:18:54.922866Z"},"links":{"citing_paper":"/paper/2505.24788"},"observation_digest":"sha256:ee92133f652ff111c2e882263f13b89f83ce8d91f40cc84ba7cf4ead2f8eb0bf","observation_id":"ec892921-0533-4864-8a44-1ec55ded0f7b","resolution":{"observed_at":"2026-08-07T12:18:58.303745Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:18:57.830195Z","title":"Association for Computational Linguistics","venue":null,"work_id":"d39c99bc-dc1b-4212-a7ca-e1168edcc3ec","year":2019},"citing_paper":{"arxiv_id":"2505.24788","last_updated":"2025-05-30T16:48:38Z","snapshot_observed_at":"2026-08-16T18:36:30.752724Z","submitted_at":"2025-05-30T16:48:38Z","title":"Drop Dropout on Single-Epoch Language Model Pretraining","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T12:18:55.307375Z"},"links":{"citing_paper":"/paper/2505.24788"},"observation_digest":"sha256:87e82288c0dd4404e1e3893ceb520140157624d10ca2c8cedcd947ae000793e4","observation_id":"d0fc1467-7b46-4b9d-8151-76d043095499","resolution":{"observed_at":"2026-08-07T12:18:57.917281Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:18:57.462857Z","title":null,"venue":null,"work_id":"763587b3-eda9-4c99-9035-5c57cce994a2","year":2018},"citing_paper":{"arxiv_id":"2505.24788","last_updated":"2025-05-30T16:48:38Z","snapshot_observed_at":"2026-08-16T18:36:30.752724Z","submitted_at":"2025-05-30T16:48:38Z","title":"Drop Dropout on Single-Epoch Language Model Pretraining","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T12:18:55.555633Z"},"links":{"citing_paper":"/paper/2505.24788"},"observation_digest":"sha256:13fa05ff335538d239019c18cc4b86f707f16bd9352023351a555104016a4470","observation_id":"8b9aed26-2221-4d6c-8020-ac3c1db84b21","resolution":{"observed_at":"2026-08-07T12:18:57.569992Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:18:57.296539Z","title":"InProceedings of the 2020 Conference on Empirical Methods in Natural Language Processing: System Demonstrations, pages 38–45, Online","venue":null,"work_id":"925e63ce-e98a-428f-b9a1-f38969336d07","year":2020},"citing_paper":{"arxiv_id":"2505.24788","last_updated":"2025-05-30T16:48:38Z","snapshot_observed_at":"2026-08-16T18:36:30.752724Z","submitted_at":"2025-05-30T16:48:38Z","title":"Drop Dropout on Single-Epoch Language Model Pretraining","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T12:18:55.697998Z"},"links":{"citing_paper":"/paper/2505.24788"},"observation_digest":"sha256:406ca1f7918d37549eefd91801d96fd71906c0a8ab468cdaed42c2d37594e407","observation_id":"9c845021-90ce-4769-b02e-54015936c838","resolution":{"observed_at":"2026-08-07T12:18:57.370618Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:18:56.474957Z","title":"An adapted version of the official evaluation script was used to obtain the dev-slice results reported in this work","venue":null,"work_id":"5939adcf-f210-48eb-977b-049925c6c1db","year":2019},"citing_paper":{"arxiv_id":"2505.24788","last_updated":"2025-05-30T16:48:38Z","snapshot_observed_at":"2026-08-16T18:36:30.752724Z","submitted_at":"2025-05-30T16:48:38Z","title":"Drop Dropout on Single-Epoch Language Model Pretraining","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T12:18:56.183766Z"},"links":{"citing_paper":"/paper/2505.24788"},"observation_digest":"sha256:0ee27971b12a03ce7c9159c47260041e4be69912e4fb21e24999dae42862af51","observation_id":"60612f92-7e0d-45af-a219-1073cb261708","resolution":{"observed_at":"2026-08-07T12:18:56.523414Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:18:57.087875Z","title":"When MLP dropout is used, p= 0.1","venue":null,"work_id":"644ff5b6-3643-4585-83aa-87fe27f64847","year":2019},"citing_paper":{"arxiv_id":"2505.24788","last_updated":"2025-05-30T16:48:38Z","snapshot_observed_at":"2026-08-16T18:36:30.752724Z","submitted_at":"2025-05-30T16:48:38Z","title":"Drop Dropout on Single-Epoch Language Model Pretraining","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T12:18:55.880575Z"},"links":{"citing_paper":"/paper/2505.24788"},"observation_digest":"sha256:8eb71cf4d07502bc6ff218e1a24e1881ce004167a045a15751d1ca40c4a44513","observation_id":"97e2a51e-cf1b-4b21-9de7-94b0fdac0da8","resolution":{"observed_at":"2026-08-07T12:18:57.207353Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:18:56.835795Z","title":"Batching was done sequentially with the Pytorch Data Loader, sequence lengths are capped at 512 tokens","venue":null,"work_id":"eb46b9aa-c593-448b-b88e-11acef89a49f","year":2024},"citing_paper":{"arxiv_id":"2505.24788","last_updated":"2025-05-30T16:48:38Z","snapshot_observed_at":"2026-08-16T18:36:30.752724Z","submitted_at":"2025-05-30T16:48:38Z","title":"Drop Dropout on Single-Epoch Language Model Pretraining","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T12:18:55.962071Z"},"links":{"citing_paper":"/paper/2505.24788"},"observation_digest":"sha256:e6dd6cc72837991a08b2504aeaadb26cc1858b4bf32502f13cc367b42d05f6e2","observation_id":"61ab845e-e8a5-4776-80d5-d0e8cf75666c","resolution":{"observed_at":"2026-08-07T12:18:56.970449Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:18:56.613494Z","title":"Optimization was donewith regulariza- tionusing AdamW (Loshchilov and Hutter,","venue":null,"work_id":"a20d4ea0-5a48-4ed3-b948-90258bd3fb31","year":2023},"citing_paper":{"arxiv_id":"2505.24788","last_updated":"2025-05-30T16:48:38Z","snapshot_observed_at":"2026-08-16T18:36:30.752724Z","submitted_at":"2025-05-30T16:48:38Z","title":"Drop Dropout on Single-Epoch Language Model Pretraining","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T12:18:56.060676Z"},"links":{"citing_paper":"/paper/2505.24788"},"observation_digest":"sha256:8f83033a6ad09a8559a8e4c2fc0363b3df4088e86a113bda02b00aeb4dcdd6fe","observation_id":"20f42294-0e67-46a4-8297-ab6a97aa1076","resolution":{"observed_at":"2026-08-07T12:18:56.712805Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:18:56.358021Z","title":"Batch size was set to 128, and dropout rate was set to 0.15 regardless of whether pretrain- ing the BERT model used dropout consistent with previous approaches","venue":null,"work_id":"c10854e4-8f74-42b6-8e8a-17c11f04654c","year":2023},"citing_paper":{"arxiv_id":"2505.24788","last_updated":"2025-05-30T16:48:38Z","snapshot_observed_at":"2026-08-16T18:36:30.752724Z","submitted_at":"2025-05-30T16:48:38Z","title":"Drop Dropout on Single-Epoch Language Model Pretraining","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T12:18:56.233445Z"},"links":{"citing_paper":"/paper/2505.24788"},"observation_digest":"sha256:cc7b4d8cecaf1c7b0c5654ab2d71e73cd5087b0c0bcb8d40a42c7b391baec975","observation_id":"6d2db1f3-db5b-493c-9e77-02120fb5abc2","resolution":{"observed_at":"2026-08-07T12:18:56.414228Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1207.0580","last_updated":"2012-07-03T06:35:15Z","snapshot_observed_at":"2026-08-15T00:54:35.320150Z","submitted_at":"2012-07-03T06:35:15Z","title":"Improving neural networks by preventing co-adaptation of feature detectors","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1207.0580","snapshot_observed_at":"2026-08-07T12:18:55.233415Z","title":"Geoffrey E Hinton","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24788","last_updated":"2025-05-30T16:48:38Z","snapshot_observed_at":"2026-08-16T18:36:30.752724Z","submitted_at":"2025-05-30T16:48:38Z","title":"Drop Dropout on Single-Epoch Language Model Pretraining","version":1},"reference_index":2012,"source":"pdf_text","source_observed_at":"2026-08-07T12:18:55.233415Z"},"links":{"cited_paper":"/paper/1207.0580","citing_paper":"/paper/2505.24788"},"observation_digest":"sha256:a5456ff64e8183ef11268197665071e40045da8b1a00ba532f87f9c074733511","observation_id":"c64bc1a1-f446-49a1-8444-2caa456e0456","resolution":{"observed_at":"2026-08-07T12:18:55.233415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:18:57.646097Z","title":"Hugo Touvron, Thibaut Lavril, Gautier Izacard, Xavier Martinet, Marie-Anne Lachaux, Timothée Lacroix, Baptiste Rozière, Naman Goyal, Eric Hambro, Faisal Azhar, et al","venue":null,"work_id":"3859167a-2352-4747-9193-dc704829c760","year":1929},"citing_paper":{"arxiv_id":"2505.24788","last_updated":"2025-05-30T16:48:38Z","snapshot_observed_at":"2026-08-16T18:36:30.752724Z","submitted_at":"2025-05-30T16:48:38Z","title":"Drop Dropout on Single-Epoch Language Model Pretraining","version":1},"reference_index":2014,"source":"pdf_text","source_observed_at":"2026-08-07T12:18:55.402456Z"},"links":{"citing_paper":"/paper/2505.24788"},"observation_digest":"sha256:d7a9e2a96665763c18a71301d57a2533d916b55a8cfe2d93cab875b9e527fbe4","observation_id":"24b0913e-3420-446b-9874-bdd1cad2b9f2","resolution":{"observed_at":"2026-08-07T12:18:57.722046Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:18:58.030097Z","title":"InProceedings of the 8th Workshop on Cognitive Modeling and Com- putational Linguistics (CMCL 2018), pages 10–18, Salt Lake City, Utah","venue":null,"work_id":"7979f18b-b30e-439c-86a2-4b8e2fbfd9a8","year":2018},"citing_paper":{"arxiv_id":"2505.24788","last_updated":"2025-05-30T16:48:38Z","snapshot_observed_at":"2026-08-16T18:36:30.752724Z","submitted_at":"2025-05-30T16:48:38Z","title":"Drop Dropout on Single-Epoch Language Model Pretraining","version":1},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-07T12:18:55.139696Z"},"links":{"citing_paper":"/paper/2505.24788"},"observation_digest":"sha256:9e04a8f522601d67eb4fd2b548fedfbb1dcfe98520a536fdcc12e7f82bdea367","observation_id":"8daa68c7-a906-4998-9fb2-58914a0172b7","resolution":{"observed_at":"2026-08-07T12:18:58.117199Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:18:58.417597Z","title":null,"venue":null,"work_id":"08a0e9af-e041-4d38-8ecf-c79d277bd822","year":2019},"citing_paper":{"arxiv_id":"2505.24788","last_updated":"2025-05-30T16:48:38Z","snapshot_observed_at":"2026-08-16T18:36:30.752724Z","submitted_at":"2025-05-30T16:48:38Z","title":"Drop Dropout on Single-Epoch Language Model Pretraining","version":1},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-07T12:18:54.555900Z"},"links":{"citing_paper":"/paper/2505.24788"},"observation_digest":"sha256:5aa958e9636a0cbf6d18faac366e91c9379db3e9e16a1e94a8135da4da0dcc98","observation_id":"a843f7c7-d1b9-4eec-8491-b4946b423fa7","resolution":{"observed_at":"2026-08-07T12:18:58.481051Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2101.00027","last_updated":"2020-12-31T19:00:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-12-31T19:00:10Z","title":"The Pile: An 800GB Dataset of Diverse Text for Language Modeling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2101.00027","snapshot_observed_at":"2026-08-07T12:18:54.703706Z","title":"Mor Geva, Roei Schuster, Jonathan Berant, and Omer Levy","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24788","last_updated":"2025-05-30T16:48:38Z","snapshot_observed_at":"2026-08-16T18:36:30.752724Z","submitted_at":"2025-05-30T16:48:38Z","title":"Drop Dropout on Single-Epoch Language Model Pretraining","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-07T12:18:54.703706Z"},"links":{"cited_paper":"/paper/2101.00027","citing_paper":"/paper/2505.24788"},"observation_digest":"sha256:424e712a4789cc274b1aaf8c68200bc5d289dbaa0ba6d8f697f77cebaedf6245","observation_id":"856c6ebb-6a4b-4186-ae65-14f8d09836ee","resolution":{"observed_at":"2026-08-07T12:18:54.703706Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:18:58.551249Z","title":"InPro- ceedings of the 2021 Conference on Empirical Meth- ods in Natural Language Processing, pages 6491– 6506, Online and Punta Cana, Dominican Republic","venue":null,"work_id":"48b2be60-f0a8-47ac-9f40-b4e18e3b77d7","year":2021},"citing_paper":{"arxiv_id":"2505.24788","last_updated":"2025-05-30T16:48:38Z","snapshot_observed_at":"2026-08-16T18:36:30.752724Z","submitted_at":"2025-05-30T16:48:38Z","title":"Drop Dropout on Single-Epoch Language Model Pretraining","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-07T12:18:54.415114Z"},"links":{"citing_paper":"/paper/2505.24788"},"observation_digest":"sha256:03733c49ebba173a711bd46dc9c14539770183d000f0fca1f7d4e20eff0059ac","observation_id":"5d8ec641-5d65-4c91-a58c-9eddb65b716e","resolution":{"observed_at":"2026-08-07T12:18:58.666912Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-07T12:18:55.499541Z","title":"Ashish Vaswani, Noam Shazeer, Niki Parmar, Jakob Uszkoreit, Llion Jones, Aidan N Gomez, Ł ukasz Kaiser, and Illia Polosukhin","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24788","last_updated":"2025-05-30T16:48:38Z","snapshot_observed_at":"2026-08-16T18:36:30.752724Z","submitted_at":"2025-05-30T16:48:38Z","title":"Drop Dropout on Single-Epoch Language Model Pretraining","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-07T12:18:55.499541Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2505.24788"},"observation_digest":"sha256:2d3061f46668b0cea37d3a312a77c04d52948b1c7c85b51ac424af9bbe434a2e","observation_id":"3fe71e64-6957-4a44-bb46-2f501760d989","resolution":{"observed_at":"2026-08-07T12:18:55.499541Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.03592","last_updated":"2024-05-22T17:52:31Z","snapshot_observed_at":"2026-08-16T14:03:33.898248Z","submitted_at":"2024-04-04T17:00:37Z","title":"ReFT: Representation Finetuning for Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.03592","snapshot_observed_at":"2026-08-07T12:18:55.792408Z","title":"A Motivating the Studying of Dropout Through Knowledge Storage The central claim of Hinton et al","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2505.24788","last_updated":"2025-05-30T16:48:38Z","snapshot_observed_at":"2026-08-16T18:36:30.752724Z","submitted_at":"2025-05-30T16:48:38Z","title":"Drop Dropout on Single-Epoch Language Model Pretraining","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-07T12:18:55.792408Z"},"links":{"cited_paper":"/paper/2404.03592","citing_paper":"/paper/2505.24788"},"observation_digest":"sha256:6ba550974041ac3b9ef6b617a0c7e1bded5a861138dff5678a52163e63417a87","observation_id":"3f795873-d19c-46f8-9103-0ee8f35cf793","resolution":{"observed_at":"2026-08-07T12:18:55.792408Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.24788","last_updated":"2025-05-30T16:48:38Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-16T18:36:30.752724Z","submitted_at":"2025-05-30T16:48:38Z","title":"Drop Dropout on Single-Epoch Language Model Pretraining"},"reference_resolution":{"displayed":17,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":6,"verified_exact":0,"verified_fuzzy":11},"total_outbound_references":17},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 17 of 17 outbound references and 1 inbound Pith citation observation for arXiv:2505.24788."}