{"as_of":"2026-08-10T10:52:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:83305ba3ac473445270273100a5f83bbdebb6ff6af45f4db0cfaa8e2fecd651d","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":19,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":19,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":19,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":19,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T20:06:23.521445Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":2,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2405.18392","last_updated":"2024-10-17T12:01:15Z","snapshot_observed_at":"2026-07-06T18:21:26.195207Z","submitted_at":"2024-05-28T17:33:54Z","title":"Scaling Laws and Compute-Optimal Training Beyond Fixed Training Durations","version":3},"cited_work":{"arxiv_id":"2405.18392","doi":"10.48550/arxiv.2405.18392","metadata_source":"arxiv_reference","pith_arxiv_id":"2405.18392","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Hägele, E","venue":"arXiv (Cornell University)","work_id":"c6841d36-b590-485b-8412-d23a10afac5f","year":2024},"citing_paper":{"arxiv_id":"2409.04777","last_updated":"2026-05-20T09:55:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-07T09:37:19Z","title":"Optimization Hyper-parameter Laws for Large Language Models","version":4},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-23T20:45:31.427677Z"},"links":{"cited_paper":"/paper/2405.18392","citing_paper":"/paper/2409.04777"},"observation_digest":"sha256:c308fd384fe30caca1dc9054f55f9934951a0552078e13c813cffc33812e7756","observation_id":"5c6e8e3e-a02d-4d8b-959e-cbcb79d340f2","resolution":{"observed_at":"2026-05-23T20:45:48.861142Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.18392","last_updated":"2024-10-17T12:01:15Z","snapshot_observed_at":"2026-07-06T18:21:26.195207Z","submitted_at":"2024-05-28T17:33:54Z","title":"Scaling Laws and Compute-Optimal Training Beyond Fixed Training Durations","version":3},"cited_work":{"arxiv_id":"2405.18392","doi":"10.48550/arxiv.2405.18392","metadata_source":"arxiv_reference","pith_arxiv_id":"2405.18392","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Hägele, E","venue":"arXiv (Cornell University)","work_id":"c6841d36-b590-485b-8412-d23a10afac5f","year":2024},"citing_paper":{"arxiv_id":"2412.13663","last_updated":"2024-12-19T06:32:26Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T09:39:44Z","title":"Smarter, Better, Faster, Longer: A Modern Bidirectional Encoder for Fast, Memory Efficient, and Long Context Finetuning and Inference","version":2},"reference_index":141,"source":"arxiv_source","source_observed_at":"2026-05-20T17:46:46.845424Z"},"links":{"cited_paper":"/paper/2405.18392","citing_paper":"/paper/2412.13663"},"observation_digest":"sha256:b6f5c70a46598eadd30139f9338d9265c5cfc03a8a66427432f074009e3cdfa6","observation_id":"d8d53b71-3169-4cce-ae0e-ce8fad15b0d4","resolution":{"observed_at":"2026-05-20T17:46:46.973215Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.18392","last_updated":"2024-10-17T12:01:15Z","snapshot_observed_at":"2026-07-06T18:21:26.195207Z","submitted_at":"2024-05-28T17:33:54Z","title":"Scaling Laws and Compute-Optimal Training Beyond Fixed Training Durations","version":3},"cited_work":{"arxiv_id":"2405.18392","doi":"10.48550/arxiv.2405.18392","metadata_source":"arxiv_reference","pith_arxiv_id":"2405.18392","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Hägele, E","venue":"arXiv (Cornell University)","work_id":"c6841d36-b590-485b-8412-d23a10afac5f","year":2024},"citing_paper":{"arxiv_id":"2412.13663","last_updated":"2024-12-19T06:32:26Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T09:39:44Z","title":"Smarter, Better, Faster, Longer: A Modern Bidirectional Encoder for Fast, Memory Efficient, and Long Context Finetuning and Inference","version":2},"reference_index":148,"source":"arxiv_source","source_observed_at":"2026-05-20T17:46:46.845424Z"},"links":{"cited_paper":"/paper/2405.18392","citing_paper":"/paper/2412.13663"},"observation_digest":"sha256:96e1723eb7d28123245a7d7cb263bb1e8092ef14a04082b39650f8de48a3ce9c","observation_id":"9faea4ab-6f22-4e48-8bd1-ffc020328510","resolution":{"observed_at":"2026-05-20T17:46:47.063757Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.18392","last_updated":"2024-10-17T12:01:15Z","snapshot_observed_at":"2026-07-06T18:21:26.195207Z","submitted_at":"2024-05-28T17:33:54Z","title":"Scaling Laws and Compute-Optimal Training Beyond Fixed Training Durations","version":3},"cited_work":{"arxiv_id":"2405.18392","doi":"10.48550/arxiv.2405.18392","metadata_source":"arxiv_reference","pith_arxiv_id":"2405.18392","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Hägele, E","venue":"arXiv (Cornell University)","work_id":"c6841d36-b590-485b-8412-d23a10afac5f","year":2024},"citing_paper":{"arxiv_id":"2502.02737","last_updated":"2025-02-04T21:43:16Z","snapshot_observed_at":"2026-08-10T04:07:56.506438Z","submitted_at":"2025-02-04T21:43:16Z","title":"SmolLM2: When Smol Goes Big -- Data-Centric Training of a Small Language Model","version":1},"reference_index":177,"source":"arxiv_source","source_observed_at":"2026-05-13T17:30:02.803757Z"},"links":{"cited_paper":"/paper/2405.18392","citing_paper":"/paper/2502.02737"},"observation_digest":"sha256:f447afd891c557dc8950cc9a5f068e4174c70d5f318d84f6d585138e5b91ed58","observation_id":"8481af53-3f09-4cf1-b860-802cd22b8d79","resolution":{"observed_at":"2026-05-13T17:30:02.959073Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.18392","last_updated":"2024-10-17T12:01:15Z","snapshot_observed_at":"2026-07-06T18:21:26.195207Z","submitted_at":"2024-05-28T17:33:54Z","title":"Scaling Laws and Compute-Optimal Training Beyond Fixed Training Durations","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.18392","snapshot_observed_at":"2026-08-08T20:06:23.521445Z","title":"B., Werra, L","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05172","last_updated":"2025-02-19T14:36:33Z","snapshot_observed_at":"2026-08-09T03:47:32.466460Z","submitted_at":"2025-02-07T18:55:38Z","title":"Joint MoE Scaling Laws: Mixture of Experts Can Be Memory Efficient","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-08T20:06:23.521445Z"},"links":{"cited_paper":"/paper/2405.18392","citing_paper":"/paper/2502.05172"},"observation_digest":"sha256:0a2adc4bb8ec8d9981e8d4b5b2f3cda10284d8607d4f707d7fb690e29bf7b506","observation_id":"50ca0f07-5562-4a8f-9e7f-74178882b260","resolution":{"observed_at":"2026-08-08T20:06:23.521445Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.18392","last_updated":"2024-10-17T12:01:15Z","snapshot_observed_at":"2026-07-06T18:21:26.195207Z","submitted_at":"2024-05-28T17:33:54Z","title":"Scaling Laws and Compute-Optimal Training Beyond Fixed Training Durations","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.18392","snapshot_observed_at":"2026-08-07T04:21:41.884536Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10896","last_updated":"2025-06-12T17:01:11Z","snapshot_observed_at":"2026-08-07T20:56:34.872687Z","submitted_at":"2025-06-12T17:01:11Z","title":"BioClinical ModernBERT: A State-of-the-Art Long-Context Encoder for Biomedical and Clinical NLP","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T04:21:41.884536Z"},"links":{"cited_paper":"/paper/2405.18392","citing_paper":"/paper/2506.10896"},"observation_digest":"sha256:70bac284f37c39e620a359028c20ccc2f1612e53e67259e56aa0a1e34fba0d1a","observation_id":"c1428323-a73c-4f23-8e36-d0a5ebcdb450","resolution":{"observed_at":"2026-08-07T04:21:41.884536Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.18392","last_updated":"2024-10-17T12:01:15Z","snapshot_observed_at":"2026-07-06T18:21:26.195207Z","submitted_at":"2024-05-28T17:33:54Z","title":"Scaling Laws and Compute-Optimal Training Beyond Fixed Training Durations","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.18392","snapshot_observed_at":"2026-08-07T00:50:30.555421Z","title":"org/abs/2405.18392","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.12543","last_updated":"2025-06-14T15:37:31Z","snapshot_observed_at":"2026-08-08T23:08:34.335687Z","submitted_at":"2025-06-14T15:37:31Z","title":"Is your batch size the problem? Revisiting the Adam-SGD gap in language modeling","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T00:50:30.555421Z"},"links":{"cited_paper":"/paper/2405.18392","citing_paper":"/paper/2506.12543"},"observation_digest":"sha256:58c51b399e0aa688ecce55d34e76f496ae4c26476aff57f7e295313f46f3e227","observation_id":"bbf646a2-602d-4105-bf75-187a47e1043a","resolution":{"observed_at":"2026-08-07T00:50:30.555421Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.18392","last_updated":"2024-10-17T12:01:15Z","snapshot_observed_at":"2026-07-06T18:21:26.195207Z","submitted_at":"2024-05-28T17:33:54Z","title":"Scaling Laws and Compute-Optimal Training Beyond Fixed Training Durations","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.18392","snapshot_observed_at":"2026-08-06T22:10:24.529827Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.22419","last_updated":"2025-06-30T21:56:29Z","snapshot_observed_at":"2026-08-06T22:01:35.496519Z","submitted_at":"2025-06-27T17:44:32Z","title":"The Automated LLM Speedrunning Benchmark: Reproducing NanoGPT Improvements","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T22:10:24.529827Z"},"links":{"cited_paper":"/paper/2405.18392","citing_paper":"/paper/2506.22419"},"observation_digest":"sha256:6d156df2807024f422b7abd38cc88d373a76f24bf1bda322f3bf8963c79208d2","observation_id":"a237938b-8a27-45c8-befd-83775802303a","resolution":{"observed_at":"2026-08-06T22:10:24.529827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.18392","last_updated":"2024-10-17T12:01:15Z","snapshot_observed_at":"2026-07-06T18:21:26.195207Z","submitted_at":"2024-05-28T17:33:54Z","title":"Scaling Laws and Compute-Optimal Training Beyond Fixed Training Durations","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.18392","snapshot_observed_at":"2026-08-06T18:24:51.960524Z","title":"Hägele, E","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.08567","last_updated":"2025-08-07T11:18:14Z","snapshot_observed_at":"2026-08-09T17:00:22.878553Z","submitted_at":"2025-07-11T13:11:11Z","title":"AbbIE: Autoregressive Block-Based Iterative Encoder for Efficient Sequence Modeling","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-06T18:24:51.960524Z"},"links":{"cited_paper":"/paper/2405.18392","citing_paper":"/paper/2507.08567"},"observation_digest":"sha256:534a4d9b2be2ab1b3148ad7f5962f841cd8987ced3ba30bfdd0526041f08c9cc","observation_id":"a50d57de-612e-4e2e-b028-99df93492290","resolution":{"observed_at":"2026-08-06T18:24:51.960524Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.18392","last_updated":"2024-10-17T12:01:15Z","snapshot_observed_at":"2026-07-06T18:21:26.195207Z","submitted_at":"2024-05-28T17:33:54Z","title":"Scaling Laws and Compute-Optimal Training Beyond Fixed Training Durations","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.18392","snapshot_observed_at":"2026-08-05T22:42:10.446190Z","title":"Scaling Laws and Compute-Optimal Training Beyond Fixed Training Durations","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.06743","last_updated":"2025-08-08T22:54:35Z","snapshot_observed_at":"2026-08-09T16:42:21.405998Z","submitted_at":"2025-08-08T22:54:35Z","title":"Analysis of Schedule-Free Nonconvex Optimization","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-05T22:42:10.446190Z"},"links":{"cited_paper":"/paper/2405.18392","citing_paper":"/paper/2508.06743"},"observation_digest":"sha256:317059dd1c987b4ae67d389bba27deb052cf2ee9a81c65dbd0ff3754218ce526","observation_id":"25ab7824-863b-428a-92a9-768cb60b62eb","resolution":{"observed_at":"2026-08-05T22:42:10.446190Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.18392","last_updated":"2024-10-17T12:01:15Z","snapshot_observed_at":"2026-07-06T18:21:26.195207Z","submitted_at":"2024-05-28T17:33:54Z","title":"Scaling Laws and Compute-Optimal Training Beyond Fixed Training Durations","version":3},"cited_work":{"arxiv_id":"2405.18392","doi":"10.48550/arxiv.2405.18392","metadata_source":"arxiv_reference","pith_arxiv_id":"2405.18392","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Hägele, E","venue":"arXiv (Cornell University)","work_id":"c6841d36-b590-485b-8412-d23a10afac5f","year":2024},"citing_paper":{"arxiv_id":"2510.18900","last_updated":"2026-05-01T16:43:26Z","snapshot_observed_at":"2026-07-30T11:11:40.179521Z","submitted_at":"2025-10-20T17:56:01Z","title":"Foundation Models for Discovery and Exploration in Chemical Space","version":2},"reference_index":281,"source":"pdf_text","source_observed_at":"2026-05-18T05:52:10.848118Z"},"links":{"cited_paper":"/paper/2405.18392","citing_paper":"/paper/2510.18900"},"observation_digest":"sha256:afb748fcfe948bf1a810af61e50101ab3aad73a250d2ed55cc927d7dc4d736cc","observation_id":"f919b332-930b-47ca-94f3-762fe9bce088","resolution":{"observed_at":"2026-05-18T05:52:24.910606Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.18392","last_updated":"2024-10-17T12:01:15Z","snapshot_observed_at":"2026-07-06T18:21:26.195207Z","submitted_at":"2024-05-28T17:33:54Z","title":"Scaling Laws and Compute-Optimal Training Beyond Fixed Training Durations","version":3},"cited_work":{"arxiv_id":"2405.18392","doi":"10.48550/arxiv.2405.18392","metadata_source":"arxiv_reference","pith_arxiv_id":"2405.18392","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Hägele, E","venue":"arXiv (Cornell University)","work_id":"c6841d36-b590-485b-8412-d23a10afac5f","year":2024},"citing_paper":{"arxiv_id":"2604.08366","last_updated":"2026-04-09T15:33:00Z","snapshot_observed_at":"2026-07-06T22:57:26.678728Z","submitted_at":"2026-04-09T15:33:00Z","title":"Scaling-Aware Data Selection for End-to-End Autonomous Driving Systems","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-10T17:22:25.943097Z"},"links":{"cited_paper":"/paper/2405.18392","citing_paper":"/paper/2604.08366"},"observation_digest":"sha256:e1c508c11ab04c48a879def479e224ad1007ad93eb0fbbe08c3a9e0bb45257f5","observation_id":"faa0eda6-b091-4192-941c-e878bdf1ea6c","resolution":{"observed_at":"2026-05-11T06:56:02.214483Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.18392","last_updated":"2024-10-17T12:01:15Z","snapshot_observed_at":"2026-07-06T18:21:26.195207Z","submitted_at":"2024-05-28T17:33:54Z","title":"Scaling Laws and Compute-Optimal Training Beyond Fixed Training Durations","version":3},"cited_work":{"arxiv_id":"2405.18392","doi":"10.48550/arxiv.2405.18392","metadata_source":"arxiv_reference","pith_arxiv_id":"2405.18392","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Hägele, E","venue":"arXiv (Cornell University)","work_id":"c6841d36-b590-485b-8412-d23a10afac5f","year":2024},"citing_paper":{"arxiv_id":"2605.12715","last_updated":"2026-05-15T17:01:07Z","snapshot_observed_at":"2026-07-06T23:24:23.402304Z","submitted_at":"2026-05-12T20:22:45Z","title":"Scaling Laws for Mixture Pretraining Under Data Constraints","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-05-14T21:44:31.429223Z"},"links":{"cited_paper":"/paper/2405.18392","citing_paper":"/paper/2605.12715"},"observation_digest":"sha256:dbe05b374b4b243b7aa0eb27c72180ca3680df1d81bbd0bbda67b41124d1a047","observation_id":"0d3a9710-b345-4969-9776-c3b3da0ec585","resolution":{"observed_at":"2026-05-14T21:48:00.932636Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.18392","last_updated":"2024-10-17T12:01:15Z","snapshot_observed_at":"2026-07-06T18:21:26.195207Z","submitted_at":"2024-05-28T17:33:54Z","title":"Scaling Laws and Compute-Optimal Training Beyond Fixed Training Durations","version":3},"cited_work":{"arxiv_id":"2405.18392","doi":"10.48550/arxiv.2405.18392","metadata_source":"arxiv_reference","pith_arxiv_id":"2405.18392","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Hägele, E","venue":"arXiv (Cornell University)","work_id":"c6841d36-b590-485b-8412-d23a10afac5f","year":2024},"citing_paper":{"arxiv_id":"2605.13225","last_updated":"2026-05-13T09:17:51Z","snapshot_observed_at":"2026-08-02T19:28:51.230887Z","submitted_at":"2026-05-13T09:17:51Z","title":"Mix, Don't Tune: Bilingual Pre-Training Outperforms Hyperparameter Search in Data-Constrained Settings","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-14T20:17:26.661595Z"},"links":{"cited_paper":"/paper/2405.18392","citing_paper":"/paper/2605.13225"},"observation_digest":"sha256:75e0f280d7b9fc63646eb475cd6305ee761137674e8df961f63ab9e82a118b0e","observation_id":"1c0c4aa7-a990-4f60-8fe7-430a2084560b","resolution":{"observed_at":"2026-05-14T20:19:27.369790Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.18392","last_updated":"2024-10-17T12:01:15Z","snapshot_observed_at":"2026-07-06T18:21:26.195207Z","submitted_at":"2024-05-28T17:33:54Z","title":"Scaling Laws and Compute-Optimal Training Beyond Fixed Training Durations","version":3},"cited_work":{"arxiv_id":"2405.18392","doi":"10.48550/arxiv.2405.18392","metadata_source":"arxiv_reference","pith_arxiv_id":"2405.18392","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Hägele, E","venue":"arXiv (Cornell University)","work_id":"c6841d36-b590-485b-8412-d23a10afac5f","year":2024},"citing_paper":{"arxiv_id":"2605.23061","last_updated":"2026-05-21T21:50:22Z","snapshot_observed_at":"2026-08-02T04:10:09.683333Z","submitted_at":"2026-05-21T21:50:22Z","title":"Anytime Training with Schedule-Free Spectral Optimization","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-25T05:38:16.958574Z"},"links":{"cited_paper":"/paper/2405.18392","citing_paper":"/paper/2605.23061"},"observation_digest":"sha256:fe9c6dc216adeede63d9fe5ad0901ecadea6a847c3f79744c80d368f3a75b221","observation_id":"bc7b8a2f-2565-494d-a659-9a50a5bd435c","resolution":{"observed_at":"2026-05-25T05:40:24.418964Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.18392","last_updated":"2024-10-17T12:01:15Z","snapshot_observed_at":"2026-07-06T18:21:26.195207Z","submitted_at":"2024-05-28T17:33:54Z","title":"Scaling Laws and Compute-Optimal Training Beyond Fixed Training Durations","version":3},"cited_work":{"arxiv_id":"2405.18392","doi":"10.48550/arxiv.2405.18392","metadata_source":"arxiv_reference","pith_arxiv_id":"2405.18392","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Hägele, E","venue":"arXiv (Cornell University)","work_id":"c6841d36-b590-485b-8412-d23a10afac5f","year":2024},"citing_paper":{"arxiv_id":"2605.31268","last_updated":"2026-05-29T13:01:11Z","snapshot_observed_at":"2026-07-06T23:40:27.543522Z","submitted_at":"2026-05-29T13:01:11Z","title":"Mellum2 Technical Report","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-28T22:58:35.397914Z"},"links":{"cited_paper":"/paper/2405.18392","citing_paper":"/paper/2605.31268"},"observation_digest":"sha256:55aa6d68800ececa0b4c4f0cf70f914d98822a841093030475370e00cf385aa1","observation_id":"96f3dcb0-b37b-470b-a982-57501ec69192","resolution":{"observed_at":"2026-06-28T23:02:46.500620Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.18392","last_updated":"2024-10-17T12:01:15Z","snapshot_observed_at":"2026-07-06T18:21:26.195207Z","submitted_at":"2024-05-28T17:33:54Z","title":"Scaling Laws and Compute-Optimal Training Beyond Fixed Training Durations","version":3},"cited_work":{"arxiv_id":"2405.18392","doi":"10.48550/arxiv.2405.18392","metadata_source":"arxiv_reference","pith_arxiv_id":"2405.18392","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Hägele, E","venue":"arXiv (Cornell University)","work_id":"c6841d36-b590-485b-8412-d23a10afac5f","year":2024},"citing_paper":{"arxiv_id":"2606.25971","last_updated":"2026-07-17T13:42:08Z","snapshot_observed_at":"2026-08-02T10:13:56.529128Z","submitted_at":"2026-06-24T15:40:26Z","title":"Improving Neural Network Training by Decoupling the Magnitude and Direction of Weight Vectors","version":1},"reference_index":103,"source":"arxiv_source","source_observed_at":"2026-06-25T20:05:09.179627Z"},"links":{"cited_paper":"/paper/2405.18392","citing_paper":"/paper/2606.25971"},"observation_digest":"sha256:4d20c4b10225ffdb323e11668387e52782ee7147e21a56e50c10f51483d75c97","observation_id":"137949ea-f578-451a-b46b-ffe82b532b32","resolution":{"observed_at":"2026-07-04T20:30:07.784468Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.18392","last_updated":"2024-10-17T12:01:15Z","snapshot_observed_at":"2026-07-06T18:21:26.195207Z","submitted_at":"2024-05-28T17:33:54Z","title":"Scaling Laws and Compute-Optimal Training Beyond Fixed Training Durations","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.18392","snapshot_observed_at":"2026-08-02T10:14:06.866381Z","title":"Scaling laws and compute-optimal training beyond fixed training durations","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.25971","last_updated":"2026-07-17T13:42:08Z","snapshot_observed_at":"2026-08-02T10:13:56.529128Z","submitted_at":"2026-06-24T15:40:26Z","title":"Improving Neural Network Training by Decoupling the Magnitude and Direction of Weight Vectors","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-02T10:14:06.866381Z"},"links":{"cited_paper":"/paper/2405.18392","citing_paper":"/paper/2606.25971"},"observation_digest":"sha256:91f426e78db3d05f610742783006e4abb0d53950a74dbd52a50808ff88d350cc","observation_id":"605173fd-8a1f-4072-8768-fee7b95d5b2d","resolution":{"observed_at":"2026-08-02T10:14:06.866381Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.18392","last_updated":"2024-10-17T12:01:15Z","snapshot_observed_at":"2026-07-06T18:21:26.195207Z","submitted_at":"2024-05-28T17:33:54Z","title":"Scaling Laws and Compute-Optimal Training Beyond Fixed Training Durations","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.18392","snapshot_observed_at":"2026-08-02T15:39:37.355927Z","title":"Scaling laws and compute-optimal training beyond fixed training durations","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.11889","last_updated":"2026-07-17T09:32:58Z","snapshot_observed_at":"2026-08-08T09:40:05.908022Z","submitted_at":"2026-04-24T17:00:53Z","title":"Scaling Point-in-Time Language Models","version":2},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-02T15:39:37.355927Z"},"links":{"cited_paper":"/paper/2405.18392","citing_paper":"/paper/2607.11889"},"observation_digest":"sha256:946830ca8e4b3daa66c018c93e341139d890ded4f136605e07d7ffdbfc0c3644","observation_id":"db6076a0-f5b2-49bf-89e4-fff2dbae6c71","resolution":{"observed_at":"2026-08-02T15:39:37.355927Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2405.18392/citation-record","integrity":"/paper/2405.18392/integrity","json":"/paper/2405.18392/citation-record.json","paper":"/paper/2405.18392"},"outbound":[],"paper":{"arxiv_id":"2405.18392","last_updated":"2024-10-17T12:01:15Z","latest_version":3,"primary_category":"cs.LG","snapshot_observed_at":"2026-07-06T18:21:26.195207Z","submitted_at":"2024-05-28T17:33:54Z","title":"Scaling Laws and Compute-Optimal Training Beyond Fixed Training Durations"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 19 inbound Pith citation observations for arXiv:2405.18392."}