{"as_of":"2026-08-09T11:44:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:769a93fab22080b60d3e8d6f9ffbfe97cf08683e3fe28387108e0c681e88047d","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":11,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":11,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":11,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":11,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T00:50:30.630441Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T23:59:07.430461Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2410.21676","last_updated":"2025-04-21T04:19:56Z","snapshot_observed_at":"2026-07-06T19:41:15.267950Z","submitted_at":"2024-10-29T02:54:06Z","title":"How Does Critical Batch Size Scale in Pre-training?","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21676","snapshot_observed_at":"2026-08-07T00:50:30.630441Z","title":"arXiv:2410.21676 [cs]","venue":null,"work_id":null,"year":1905},"citing_paper":{"arxiv_id":"2506.12543","last_updated":"2025-06-14T15:37:31Z","snapshot_observed_at":"2026-08-08T23:08:34.335687Z","submitted_at":"2025-06-14T15:37:31Z","title":"Is your batch size the problem? Revisiting the Adam-SGD gap in language modeling","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T00:50:30.630441Z"},"links":{"cited_paper":"/paper/2410.21676","citing_paper":"/paper/2506.12543"},"observation_digest":"sha256:ba5a046878978aebbd4dcbca8594e3dbb5e638a8e9159fa1cde8ae4de4ac34fa","observation_id":"37a5bffc-f69f-4701-ab14-eb9cf9c9450d","resolution":{"observed_at":"2026-08-07T00:50:30.630441Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21676","last_updated":"2025-04-21T04:19:56Z","snapshot_observed_at":"2026-07-06T19:41:15.267950Z","submitted_at":"2024-10-29T02:54:06Z","title":"How Does Critical Batch Size Scale in Pre-training?","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21676","snapshot_observed_at":"2026-08-06T16:53:16.446210Z","title":"How does critical batch size scale in pre-training? arXiv preprint arXiv:2410.21676, 2024 a","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.12466","last_updated":"2025-07-16T17:59:45Z","snapshot_observed_at":"2026-08-07T10:43:47.278118Z","submitted_at":"2025-07-16T17:59:45Z","title":"Language Models Improve When Pretraining Data Matches Target Tasks","version":1},"reference_index":119,"source":"arxiv_source","source_observed_at":"2026-08-06T16:53:16.446210Z"},"links":{"cited_paper":"/paper/2410.21676","citing_paper":"/paper/2507.12466"},"observation_digest":"sha256:b98103e004c04ba9316fa69f41fd9551af55ec73f1fbdfb41adbae461dc1c6ad","observation_id":"22cce5e8-b8cc-4de9-8795-51ff963b6b16","resolution":{"observed_at":"2026-08-06T16:53:16.446210Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21676","last_updated":"2025-04-21T04:19:56Z","snapshot_observed_at":"2026-07-06T19:41:15.267950Z","submitted_at":"2024-10-29T02:54:06Z","title":"How Does Critical Batch Size Scale in Pre-training?","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21676","snapshot_observed_at":"2026-08-06T10:23:52.031002Z","title":"How does critical batch size scale in pre-training? arXiv preprint arXiv:2410.21676, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.00180","last_updated":"2025-07-31T21:49:20Z","snapshot_observed_at":"2026-08-09T00:27:39.697134Z","submitted_at":"2025-07-31T21:49:20Z","title":"EMA Without the Lag: Bias-Corrected Iterate Averaging Schemes","version":1},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-08-06T10:23:52.031002Z"},"links":{"cited_paper":"/paper/2410.21676","citing_paper":"/paper/2508.00180"},"observation_digest":"sha256:9981586faa10ebaeea5e0b1a337c2d5abc637e68d00ceba35b2df66821b6613b","observation_id":"31cb124b-8863-4e1e-92e1-f0b93d1a78dd","resolution":{"observed_at":"2026-08-06T10:23:52.031002Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21676","last_updated":"2025-04-21T04:19:56Z","snapshot_observed_at":"2026-07-06T19:41:15.267950Z","submitted_at":"2024-10-29T02:54:06Z","title":"How Does Critical Batch Size Scale in Pre-training?","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21676","snapshot_observed_at":"2026-08-04T09:38:47.135094Z","title":"How does critical batch size scale in pre-training? arXiv preprint arXiv:2410.21676, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.14717","last_updated":"2026-07-27T17:12:10Z","snapshot_observed_at":"2026-08-07T22:51:49.378334Z","submitted_at":"2025-10-16T14:17:38Z","title":"Seesaw: Accelerating Training by Balancing Learning Rate and Batch Size Scheduling","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-04T09:38:47.135094Z"},"links":{"cited_paper":"/paper/2410.21676","citing_paper":"/paper/2510.14717"},"observation_digest":"sha256:4be4d6e1066c35a3461d27d63f4b625c087d8150d00bb8eec3748abf566735e7","observation_id":"8cbfc8fd-1707-4130-9735-3cf18834e1c2","resolution":{"observed_at":"2026-08-04T09:38:47.135094Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21676","last_updated":"2025-04-21T04:19:56Z","snapshot_observed_at":"2026-07-06T19:41:15.267950Z","submitted_at":"2024-10-29T02:54:06Z","title":"How Does Critical Batch Size Scale in Pre-training?","version":4},"cited_work":{"arxiv_id":"2410.21676","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.21676","snapshot_observed_at":"2026-07-03T23:59:07.430461Z","title":"Zhang, D","venue":null,"work_id":"ff070f01-8558-4662-ade8-c1a10ea2423f","year":2024},"citing_paper":{"arxiv_id":"2605.09154","last_updated":"2026-05-09T20:35:09Z","snapshot_observed_at":"2026-07-06T23:21:16.454273Z","submitted_at":"2026-05-09T20:35:09Z","title":"Predicting Large Model Test Losses with a Noisy Quadratic System","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-05-12T04:40:05.006583Z"},"links":{"cited_paper":"/paper/2410.21676","citing_paper":"/paper/2605.09154"},"observation_digest":"sha256:aa47a5dfb66b4112ffaaf4cb4ff0b97f7a1e0d615015132c94b93ae4283532e7","observation_id":"9db54e40-6023-4347-b63c-506c461349fc","resolution":{"observed_at":"2026-05-12T06:01:25.573125Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21676","last_updated":"2025-04-21T04:19:56Z","snapshot_observed_at":"2026-07-06T19:41:15.267950Z","submitted_at":"2024-10-29T02:54:06Z","title":"How Does Critical Batch Size Scale in Pre-training?","version":4},"cited_work":{"arxiv_id":"2410.21676","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.21676","snapshot_observed_at":"2026-07-03T23:59:07.430461Z","title":"Zhang, D","venue":null,"work_id":"ff070f01-8558-4662-ade8-c1a10ea2423f","year":2024},"citing_paper":{"arxiv_id":"2605.11215","last_updated":"2026-05-22T00:14:51Z","snapshot_observed_at":"2026-07-06T23:23:06.755816Z","submitted_at":"2026-05-11T20:28:31Z","title":"ReCoVer: Resilient LLM Pre-Training System via Fault-Tolerant Collective and Versatile Workload","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-13T01:59:28.408860Z"},"links":{"cited_paper":"/paper/2410.21676","citing_paper":"/paper/2605.11215"},"observation_digest":"sha256:8b8e3ca0b12a3149fc4fe329dd44599475e6c996f08286d2c62105631c3ba405","observation_id":"e4dfbb5e-9efa-42c3-9c40-a3717612f892","resolution":{"observed_at":"2026-05-13T02:02:06.468306Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21676","last_updated":"2025-04-21T04:19:56Z","snapshot_observed_at":"2026-07-06T19:41:15.267950Z","submitted_at":"2024-10-29T02:54:06Z","title":"How Does Critical Batch Size Scale in Pre-training?","version":4},"cited_work":{"arxiv_id":"2410.21676","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.21676","snapshot_observed_at":"2026-07-03T23:59:07.430461Z","title":"Zhang, D","venue":null,"work_id":"ff070f01-8558-4662-ade8-c1a10ea2423f","year":2024},"citing_paper":{"arxiv_id":"2605.11215","last_updated":"2026-05-22T00:14:51Z","snapshot_observed_at":"2026-07-06T23:23:06.755816Z","submitted_at":"2026-05-11T20:28:31Z","title":"ReCoVer: Resilient LLM Pre-Training System via Fault-Tolerant Collective and Versatile Workload","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-25T05:52:30.402478Z"},"links":{"cited_paper":"/paper/2410.21676","citing_paper":"/paper/2605.11215"},"observation_digest":"sha256:6a1e8c5f9db5fb5f817f2e2167a7f44da0e4223bafe2f9b55cce5463e35621cf","observation_id":"144ac853-5870-4d81-9e16-c5c21cdf1c26","resolution":{"observed_at":"2026-05-25T05:55:24.625480Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21676","last_updated":"2025-04-21T04:19:56Z","snapshot_observed_at":"2026-07-06T19:41:15.267950Z","submitted_at":"2024-10-29T02:54:06Z","title":"How Does Critical Batch Size Scale in Pre-training?","version":4},"cited_work":{"arxiv_id":"2410.21676","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.21676","snapshot_observed_at":"2026-07-03T23:59:07.430461Z","title":"Zhang, D","venue":null,"work_id":"ff070f01-8558-4662-ade8-c1a10ea2423f","year":2024},"citing_paper":{"arxiv_id":"2605.19095","last_updated":"2026-05-18T20:31:49Z","snapshot_observed_at":"2026-07-06T23:29:52.061489Z","submitted_at":"2026-05-18T20:31:49Z","title":"ScheduleFree+: Scaling Learning-Rate-Free & Schedule-Free Learning to Large Language Models","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-05-20T12:22:30.263086Z"},"links":{"cited_paper":"/paper/2410.21676","citing_paper":"/paper/2605.19095"},"observation_digest":"sha256:66004a83621c82f734ffd58816cf3852df38c4e126ccd7397936ef281652748f","observation_id":"dcfc156b-b9a1-4849-a977-f084f4a441a1","resolution":{"observed_at":"2026-05-20T12:23:16.775669Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21676","last_updated":"2025-04-21T04:19:56Z","snapshot_observed_at":"2026-07-06T19:41:15.267950Z","submitted_at":"2024-10-29T02:54:06Z","title":"How Does Critical Batch Size Scale in Pre-training?","version":4},"cited_work":{"arxiv_id":"2410.21676","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.21676","snapshot_observed_at":"2026-07-03T23:59:07.430461Z","title":"Zhang, D","venue":null,"work_id":"ff070f01-8558-4662-ade8-c1a10ea2423f","year":2024},"citing_paper":{"arxiv_id":"2606.19179","last_updated":"2026-06-17T15:19:20Z","snapshot_observed_at":"2026-08-02T17:17:56.626421Z","submitted_at":"2026-06-17T15:19:20Z","title":"Compute Efficiency and Serial Runtime Tradeoffs for Stochastic Momentum Methods","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-26T21:31:49.871520Z"},"links":{"cited_paper":"/paper/2410.21676","citing_paper":"/paper/2606.19179"},"observation_digest":"sha256:a188c8fa5a4e2c24a29bba746d344be6416921df7047af2ab11484c71fb65ef9","observation_id":"7e7692b0-c2a6-4ad9-9bb0-d8a88d208115","resolution":{"observed_at":"2026-07-03T23:59:07.432881Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21676","last_updated":"2025-04-21T04:19:56Z","snapshot_observed_at":"2026-07-06T19:41:15.267950Z","submitted_at":"2024-10-29T02:54:06Z","title":"How Does Critical Batch Size Scale in Pre-training?","version":4},"cited_work":{"arxiv_id":"2410.21676","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.21676","snapshot_observed_at":"2026-07-03T23:59:07.430461Z","title":"Zhang, D","venue":null,"work_id":"ff070f01-8558-4662-ade8-c1a10ea2423f","year":2024},"citing_paper":{"arxiv_id":"2606.30634","last_updated":"2026-06-29T17:57:50Z","snapshot_observed_at":"2026-08-08T07:12:14.083887Z","submitted_at":"2026-06-29T17:57:50Z","title":"One-Step Gradient Delay is Not a Barrier for Large-Scale Asynchronous Pipeline Parallel LLM Pretraining","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-06-30T06:41:55.732230Z"},"links":{"cited_paper":"/paper/2410.21676","citing_paper":"/paper/2606.30634"},"observation_digest":"sha256:6bad5ba5f2145a0994c33d8c373e1b50329addc2a87d9fd054445c0028542c60","observation_id":"0a6b880c-f5b9-4eb1-9285-6969038660ea","resolution":{"observed_at":"2026-06-30T06:44:18.850288Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21676","last_updated":"2025-04-21T04:19:56Z","snapshot_observed_at":"2026-07-06T19:41:15.267950Z","submitted_at":"2024-10-29T02:54:06Z","title":"How Does Critical Batch Size Scale in Pre-training?","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21676","snapshot_observed_at":"2026-08-01T03:02:01.026199Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25271","last_updated":"2026-07-28T04:18:49Z","snapshot_observed_at":"2026-08-08T08:44:07.330246Z","submitted_at":"2026-07-28T04:18:49Z","title":"Bridging Compute- and Data-Optimal Pretraining","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-01T03:02:01.026199Z"},"links":{"cited_paper":"/paper/2410.21676","citing_paper":"/paper/2607.25271"},"observation_digest":"sha256:44df8ced513936df9be0ec949493944a278c6746b763e17c5badec7505a1d485","observation_id":"4b332e82-0af7-4de7-a849-44aa9359d05d","resolution":{"observed_at":"2026-08-01T03:02:01.026199Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2410.21676/citation-record","integrity":"/paper/2410.21676/integrity","json":"/paper/2410.21676/citation-record.json","paper":"/paper/2410.21676"},"outbound":[],"paper":{"arxiv_id":"2410.21676","last_updated":"2025-04-21T04:19:56Z","latest_version":4,"primary_category":"cs.LG","snapshot_observed_at":"2026-07-06T19:41:15.267950Z","submitted_at":"2024-10-29T02:54:06Z","title":"How Does Critical Batch Size Scale in Pre-training?"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 11 inbound Pith citation observations for arXiv:2410.21676."}