{"as_of":"2026-08-20T00:46:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a6925fe44b213c17f6567170fc511d737e3a438e5e25e5b6ae6a4302e0e2f977","coverage":[{"denominator":47,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":47,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T22:14:19.319295Z","state":"measured"},{"denominator":48,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":48,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T04:19:10.282840Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-07T04:19:11.804438Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.07796","last_updated":"2025-06-19T10:38:17Z","snapshot_observed_at":"2026-08-18T13:14:20.005435Z","submitted_at":"2025-05-12T17:47:32Z","title":"Learning Dynamics in Continual Pre-Training for Large Language Models","version":2},"cited_work":{"arxiv_id":"2505.07796","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.07796","snapshot_observed_at":"2026-08-07T04:19:11.804438Z","title":"Learning Dynamics in Continual Pre-Training for Large Language Models","venue":"cs.CL","work_id":"80208eb8-f82b-4805-a610-4bc4fc307a2c","year":2025},"citing_paper":{"arxiv_id":"2506.10952","last_updated":"2025-06-12T17:53:51Z","snapshot_observed_at":"2026-08-14T13:55:40.774492Z","submitted_at":"2025-06-12T17:53:51Z","title":"Domain2Vec: Vectorizing Datasets to Find the Optimal Data Mixture without Training","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-07T04:19:10.282840Z"},"links":{"cited_paper":"/paper/2505.07796","citing_paper":"/paper/2506.10952"},"observation_digest":"sha256:8296ec5c4f3f72fb72016a12b37b35be27206a1de4db99c11c0846b5e4403c9b","observation_id":"f881e0e2-8d5b-4e42-93fc-65d87c471d6c","resolution":{"observed_at":"2026-08-07T04:19:11.911632Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.07796/citation-record","integrity":"/paper/2505.07796/integrity","json":"/paper/2505.07796/citation-record.json","paper":"/paper/2505.07796"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:14:20.406285Z","title":"G., and Bakshy, E","venue":null,"work_id":"d2dc694d-cd18-454c-af9d-de1831b6332d","year":2020},"citing_paper":{"arxiv_id":"2505.07796","last_updated":"2025-06-19T10:38:17Z","snapshot_observed_at":"2026-08-18T13:14:20.005435Z","submitted_at":"2025-05-12T17:47:32Z","title":"Learning Dynamics in Continual Pre-Training for Large Language Models","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-15T22:14:19.077192Z"},"links":{"citing_paper":"/paper/2505.07796"},"observation_digest":"sha256:4a58bbdfa757edb1c5c341530a9b6d3c1e68142b3000f9629f3636c9d034f94a","observation_id":"00532d16-4d10-4e2f-8e6b-d07cc7d4fae4","resolution":{"observed_at":"2026-08-15T22:14:20.411132Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16947","last_updated":"2024-08-30T00:06:29Z","snapshot_observed_at":"2026-08-16T13:22:46.932175Z","submitted_at":"2024-08-30T00:06:29Z","title":"An Empirical Study of Scaling Laws for Transfer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.16947","snapshot_observed_at":"2026-08-15T22:14:19.082887Z","title":"An empirical study of scaling laws for transfer, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.07796","last_updated":"2025-06-19T10:38:17Z","snapshot_observed_at":"2026-08-18T13:14:20.005435Z","submitted_at":"2025-05-12T17:47:32Z","title":"Learning Dynamics in Continual Pre-Training for Large Language Models","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-15T22:14:19.082887Z"},"links":{"cited_paper":"/paper/2408.16947","citing_paper":"/paper/2505.07796"},"observation_digest":"sha256:40df4baf76d21ac0d904a781e6bd6d5e5670bdbe9fa01b23726696e93961cf84","observation_id":"43576439-1807-48fe-b43a-972acdf4a1d6","resolution":{"observed_at":"2026-08-15T22:14:19.082887Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:14:19.088591Z","title":"and Bengio, Y","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2505.07796","last_updated":"2025-06-19T10:38:17Z","snapshot_observed_at":"2026-08-18T13:14:20.005435Z","submitted_at":"2025-05-12T17:47:32Z","title":"Learning Dynamics in Continual Pre-Training for Large Language Models","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-15T22:14:19.088591Z"},"links":{"citing_paper":"/paper/2505.07796"},"observation_digest":"sha256:a56e2f8cae111841cb75329c47956f0d6046ece65a357793771872c73ddbeacf","observation_id":"ebbd0cbc-f12b-499f-a7a1-f2f1a7a5d4e1","resolution":{"observed_at":"2026-08-15T22:14:19.088591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:14:20.377794Z","title":"Lifelong language pretraining with distribution-specialized experts","venue":null,"work_id":"6459df77-cf1f-4ffb-8590-d607f71af0c9","year":2023},"citing_paper":{"arxiv_id":"2505.07796","last_updated":"2025-06-19T10:38:17Z","snapshot_observed_at":"2026-08-18T13:14:20.005435Z","submitted_at":"2025-05-12T17:47:32Z","title":"Learning Dynamics in Continual Pre-Training for Large Language Models","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-15T22:14:19.093529Z"},"links":{"citing_paper":"/paper/2505.07796"},"observation_digest":"sha256:ce1290f00c8fec189a0f964f6c251a5881eaea22a0a807b9a95a89fea838ae02","observation_id":"5ecb05d9-559d-4b03-9bff-ee522d171bc5","resolution":{"observed_at":"2026-08-15T22:14:20.383663Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.16079","last_updated":"2023-11-27T18:49:43Z","snapshot_observed_at":"2026-07-06T16:53:18.275859Z","submitted_at":"2023-11-27T18:49:43Z","title":"MEDITRON-70B: Scaling Medical Pretraining for Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.16079","snapshot_observed_at":"2026-08-15T22:14:19.098691Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.07796","last_updated":"2025-06-19T10:38:17Z","snapshot_observed_at":"2026-08-18T13:14:20.005435Z","submitted_at":"2025-05-12T17:47:32Z","title":"Learning Dynamics in Continual Pre-Training for Large Language Models","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-15T22:14:19.098691Z"},"links":{"cited_paper":"/paper/2311.16079","citing_paper":"/paper/2505.07796"},"observation_digest":"sha256:52f82ec9675a8e8c5e1419fb589bac4b975c12cd539bc6d7bb1ba30c20843b1d","observation_id":"008670e1-7564-4fd7-b4f8-c6d11b176cf9","resolution":{"observed_at":"2026-08-15T22:14:19.098691Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03883","last_updated":"2024-03-07T06:39:32Z","snapshot_observed_at":"2026-08-16T14:12:13.721731Z","submitted_at":"2024-03-06T17:42:16Z","title":"SaulLM-7B: A pioneering Large Language Model for Law","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.03883","snapshot_observed_at":"2026-08-15T22:14:19.104299Z","title":"P., Boudiaf, M., Culver, D., Melo, R., Corro, C., Martins, A","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.07796","last_updated":"2025-06-19T10:38:17Z","snapshot_observed_at":"2026-08-18T13:14:20.005435Z","submitted_at":"2025-05-12T17:47:32Z","title":"Learning Dynamics in Continual Pre-Training for Large Language Models","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-15T22:14:19.104299Z"},"links":{"cited_paper":"/paper/2403.03883","citing_paper":"/paper/2505.07796"},"observation_digest":"sha256:ea7ae666710cf118c43899037ea106f5a550bada499f41e877f1aaa2a125af10","observation_id":"d739a6d0-6212-474e-926a-bcb0e6c93233","resolution":{"observed_at":"2026-08-15T22:14:19.104299Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11931","last_updated":"2024-06-17T13:51:35Z","snapshot_observed_at":"2026-08-14T04:42:19.578053Z","submitted_at":"2024-06-17T13:51:35Z","title":"DeepSeek-Coder-V2: Breaking the Barrier of Closed-Source Models in Code Intelligence","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11931","snapshot_observed_at":"2026-08-15T22:14:19.110481Z","title":"Deepseek-coder-v2: Breaking the barrier of closed-source models in code intelligence, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.07796","last_updated":"2025-06-19T10:38:17Z","snapshot_observed_at":"2026-08-18T13:14:20.005435Z","submitted_at":"2025-05-12T17:47:32Z","title":"Learning Dynamics in Continual Pre-Training for Large Language Models","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-15T22:14:19.110481Z"},"links":{"cited_paper":"/paper/2406.11931","citing_paper":"/paper/2505.07796"},"observation_digest":"sha256:1ee20f904369513c9a9cce95c43aab6804f7e44af1992dc7f419576caefcd9dc","observation_id":"0a8ef6e3-2820-47d0-bef0-7aa2fa8edb96","resolution":{"observed_at":"2026-08-15T22:14:19.110481Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.03608","last_updated":"2024-04-04T17:31:32Z","snapshot_observed_at":"2026-08-16T14:03:33.449889Z","submitted_at":"2024-04-04T17:31:32Z","title":"Sailor: Open Language Models for South-East Asia","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.03608","snapshot_observed_at":"2026-08-15T22:14:19.115873Z","title":"Sailor: Open language models for south-east asia","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.07796","last_updated":"2025-06-19T10:38:17Z","snapshot_observed_at":"2026-08-18T13:14:20.005435Z","submitted_at":"2025-05-12T17:47:32Z","title":"Learning Dynamics in Continual Pre-Training for Large Language Models","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-15T22:14:19.115873Z"},"links":{"cited_paper":"/paper/2404.03608","citing_paper":"/paper/2505.07796"},"observation_digest":"sha256:1c6356fec5cb8e8b8860ed9907a919631d80e67e903a74580632e40978e9f4ca","observation_id":"d0aa8343-9a9d-43f4-af2d-82d2479e046c","resolution":{"observed_at":"2026-08-15T22:14:19.115873Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-15T22:14:19.121164Z","title":"The llama 3 herd of models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.07796","last_updated":"2025-06-19T10:38:17Z","snapshot_observed_at":"2026-08-18T13:14:20.005435Z","submitted_at":"2025-05-12T17:47:32Z","title":"Learning Dynamics in Continual Pre-Training for Large Language Models","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-15T22:14:19.121164Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2505.07796"},"observation_digest":"sha256:a1a3b97e758fd2a30d39c5e53cd1034aeb54b13a930bb738d4eb3b95dcd8b858","observation_id":"b6215e37-1c44-43f5-812f-d573e6aceed3","resolution":{"observed_at":"2026-08-15T22:14:19.121164Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.14624","last_updated":"2025-05-24T06:22:30Z","snapshot_observed_at":"2026-08-16T14:24:21.935443Z","submitted_at":"2024-01-26T03:38:23Z","title":"Unearthing Large Scale Domain-Specific Knowledge from Public Corpora","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.14624","snapshot_observed_at":"2026-08-15T22:14:19.126804Z","title":"Query of cc: Unearthing large scale domain-specific knowledge from public corpora","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.07796","last_updated":"2025-06-19T10:38:17Z","snapshot_observed_at":"2026-08-18T13:14:20.005435Z","submitted_at":"2025-05-12T17:47:32Z","title":"Learning Dynamics in Continual Pre-Training for Large Language Models","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-15T22:14:19.126804Z"},"links":{"cited_paper":"/paper/2401.14624","citing_paper":"/paper/2505.07796"},"observation_digest":"sha256:cd916a609b9ce5928d692433217e86ddda732be91040e6b8d114715e15a68e7e","observation_id":"2d02dedf-45d9-4870-a968-728aa2f832cb","resolution":{"observed_at":"2026-08-15T22:14:19.126804Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:14:19.132108Z","title":null,"venue":null,"work_id":null,"year":1999},"citing_paper":{"arxiv_id":"2505.07796","last_updated":"2025-06-19T10:38:17Z","snapshot_observed_at":"2026-08-18T13:14:20.005435Z","submitted_at":"2025-05-12T17:47:32Z","title":"Learning Dynamics in Continual Pre-Training for Large Language Models","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-15T22:14:19.132108Z"},"links":{"citing_paper":"/paper/2505.07796"},"observation_digest":"sha256:c9fe51ca5aa289882f3e45bfe47c0a052bc6e18a856c9a879abcf7d4418348f6","observation_id":"81f49ded-fce9-4a5a-849c-2229406caf03","resolution":{"observed_at":"2026-08-15T22:14:19.132108Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2101.00027","last_updated":"2020-12-31T19:00:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-12-31T19:00:10Z","title":"The Pile: An 800GB Dataset of Diverse Text for Language Modeling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2101.00027","snapshot_observed_at":"2026-08-15T22:14:19.137187Z","title":"The P ile: An 800gb dataset of diverse text for language modeling","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.07796","last_updated":"2025-06-19T10:38:17Z","snapshot_observed_at":"2026-08-18T13:14:20.005435Z","submitted_at":"2025-05-12T17:47:32Z","title":"Learning Dynamics in Continual Pre-Training for Large Language Models","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-15T22:14:19.137187Z"},"links":{"cited_paper":"/paper/2101.00027","citing_paper":"/paper/2505.07796"},"observation_digest":"sha256:f96f539cdd4c62d6fe45635eb88be76477970e6d7373f8f94bf24bea0a18f07f","observation_id":"98878f17-b8be-4536-999a-06ac6f02c0c1","resolution":{"observed_at":"2026-08-15T22:14:19.137187Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:14:19.142025Z","title":"CMR scaling law: Predicting critical mixture ratios for continual pre-training of language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.07796","last_updated":"2025-06-19T10:38:17Z","snapshot_observed_at":"2026-08-18T13:14:20.005435Z","submitted_at":"2025-05-12T17:47:32Z","title":"Learning Dynamics in Continual Pre-Training for Large Language Models","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-15T22:14:19.142025Z"},"links":{"citing_paper":"/paper/2505.07796"},"observation_digest":"sha256:c53721e791977336d0467a01d4299b560acface9ff16464626b8632b54406821","observation_id":"f6f9a9fc-d37a-4aa5-aa03-fb9bb266a78d","resolution":{"observed_at":"2026-08-15T22:14:19.142025Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.04014","last_updated":"2023-09-06T23:13:07Z","snapshot_observed_at":"2026-08-18T13:13:10.840816Z","submitted_at":"2023-08-08T03:18:18Z","title":"Continual Pre-Training of Large Language Models: How to (re)warm your model?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.04014","snapshot_observed_at":"2026-08-15T22:14:19.146891Z","title":"L., Anthony, Q., Belilovsky, E., Rish, I., and Lesort, T","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.07796","last_updated":"2025-06-19T10:38:17Z","snapshot_observed_at":"2026-08-18T13:14:20.005435Z","submitted_at":"2025-05-12T17:47:32Z","title":"Learning Dynamics in Continual Pre-Training for Large Language Models","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-15T22:14:19.146891Z"},"links":{"cited_paper":"/paper/2308.04014","citing_paper":"/paper/2505.07796"},"observation_digest":"sha256:22100de51270769bd2a5bc2f46088ebc469e2791270ec1f1186c1a185da85664","observation_id":"8f197b83-e306-4a0c-9dcb-19b67cd9a90b","resolution":{"observed_at":"2026-08-15T22:14:19.146891Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.16607","last_updated":"2024-11-30T19:31:38Z","snapshot_observed_at":"2026-08-16T13:31:42.440812Z","submitted_at":"2024-07-23T16:13:22Z","title":"Data Mixture Inference: What do BPE Tokenizers Reveal about their Training Data?","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.16607","snapshot_observed_at":"2026-08-15T22:14:19.151913Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.07796","last_updated":"2025-06-19T10:38:17Z","snapshot_observed_at":"2026-08-18T13:14:20.005435Z","submitted_at":"2025-05-12T17:47:32Z","title":"Learning Dynamics in Continual Pre-Training for Large Language Models","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-15T22:14:19.151913Z"},"links":{"cited_paper":"/paper/2407.16607","citing_paper":"/paper/2505.07796"},"observation_digest":"sha256:09d3b4655a84fbc211ad2fe37811f76aae9641ee078a7f63475143c38cbe5296","observation_id":"aea6de6c-d97c-442a-ac0e-1e1a656a6954","resolution":{"observed_at":"2026-08-15T22:14:19.151913Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.00220","last_updated":"2022-11-29T08:59:40Z","snapshot_observed_at":"2026-08-16T16:49:03.108209Z","submitted_at":"2022-07-01T06:25:15Z","title":"Pile of Law: Learning Responsible Data Filtering from the Law and a 256GB Open-Source Legal Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.00220","snapshot_observed_at":"2026-08-15T22:14:19.156722Z","title":"S., Zheng, L., Guha, N., Manning, C","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.07796","last_updated":"2025-06-19T10:38:17Z","snapshot_observed_at":"2026-08-18T13:14:20.005435Z","submitted_at":"2025-05-12T17:47:32Z","title":"Learning Dynamics in Continual Pre-Training for Large Language Models","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-15T22:14:19.156722Z"},"links":{"cited_paper":"/paper/2207.00220","citing_paper":"/paper/2505.07796"},"observation_digest":"sha256:ab30112a80697193d250a25465a2ff7289e1d61922d7822a33bac30f7610e0c5","observation_id":"efb64f27-ea03-4570-afd7-15484ead5ddb","resolution":{"observed_at":"2026-08-15T22:14:19.156722Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2102.01293","last_updated":"2021-02-02T04:07:38Z","snapshot_observed_at":"2026-08-01T22:46:19.170916Z","submitted_at":"2021-02-02T04:07:38Z","title":"Scaling Laws for Transfer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.01293","snapshot_observed_at":"2026-08-15T22:14:19.166601Z","title":"Scaling laws for transfer, 2021 b","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.07796","last_updated":"2025-06-19T10:38:17Z","snapshot_observed_at":"2026-08-18T13:14:20.005435Z","submitted_at":"2025-05-12T17:47:32Z","title":"Learning Dynamics in Continual Pre-Training for Large Language Models","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-15T22:14:19.166601Z"},"links":{"cited_paper":"/paper/2102.01293","citing_paper":"/paper/2505.07796"},"observation_digest":"sha256:b0b3b60d00a4ddd8b2963e244dbc53c8b3ea1bd44c78a25791dd68ac6d64214e","observation_id":"c955415a-2ab1-4134-822e-bea0556c528a","resolution":{"observed_at":"2026-08-15T22:14:19.166601Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.15556","last_updated":"2022-03-29T13:38:03Z","snapshot_observed_at":"2026-08-09T19:52:33.533277Z","submitted_at":"2022-03-29T13:38:03Z","title":"Training Compute-Optimal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.15556","snapshot_observed_at":"2026-08-15T22:14:19.171347Z","title":"A., Welbl, J., Clark, A., Hennigan, T., Noland, E., Millican, K., van den Driessche, G., Damoc, B., Guy, A., Osindero, S., Simonyan, K., Elsen, E., Rae, J","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.07796","last_updated":"2025-06-19T10:38:17Z","snapshot_observed_at":"2026-08-18T13:14:20.005435Z","submitted_at":"2025-05-12T17:47:32Z","title":"Learning Dynamics in Continual Pre-Training for Large Language Models","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-15T22:14:19.171347Z"},"links":{"cited_paper":"/paper/2203.15556","citing_paper":"/paper/2505.07796"},"observation_digest":"sha256:9b49c94957a06ac64982aca6edc4282cb80bff666b11d73a7d637423aadf5382","observation_id":"924fd2e6-07e5-452f-9712-8f8363a75d86","resolution":{"observed_at":"2026-08-15T22:14:19.171347Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06395","last_updated":"2024-06-03T08:54:38Z","snapshot_observed_at":"2026-08-12T13:10:06.472493Z","submitted_at":"2024-04-09T15:36:50Z","title":"MiniCPM: Unveiling the Potential of Small Language Models with Scalable Training Strategies","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.06395","snapshot_observed_at":"2026-08-15T22:14:19.176388Z","title":"L., Zhang, K., Wang, C., Yao, Y., Zhao, C., Zhou, J., Cai, J., Zhai, Z., Ding, N., Jia, C., Zeng, G., Li, D., Liu, Z., and Sun, M","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.07796","last_updated":"2025-06-19T10:38:17Z","snapshot_observed_at":"2026-08-18T13:14:20.005435Z","submitted_at":"2025-05-12T17:47:32Z","title":"Learning Dynamics in Continual Pre-Training for Large Language Models","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-15T22:14:19.176388Z"},"links":{"cited_paper":"/paper/2404.06395","citing_paper":"/paper/2505.07796"},"observation_digest":"sha256:6305e4727535b61fa6bdfe769cf69f6738430bd3d72beae539592783fd94127d","observation_id":"d121661f-28b3-4877-aeae-050ecf8bd875","resolution":{"observed_at":"2026-08-15T22:14:19.176388Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:14:19.181367Z","title":null,"venue":null,"work_id":null,"year":1964},"citing_paper":{"arxiv_id":"2505.07796","last_updated":"2025-06-19T10:38:17Z","snapshot_observed_at":"2026-08-18T13:14:20.005435Z","submitted_at":"2025-05-12T17:47:32Z","title":"Learning Dynamics in Continual Pre-Training for Large Language Models","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-15T22:14:19.181367Z"},"links":{"citing_paper":"/paper/2505.07796"},"observation_digest":"sha256:f034ca195d0ce78ab674bc372220ad5d685758bc7e7a6882078e16998766b3d3","observation_id":"34833b2e-1659-4506-8777-22dbf7c8949e","resolution":{"observed_at":"2026-08-15T22:14:19.181367Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12186","last_updated":"2024-11-12T13:24:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-18T17:57:57Z","title":"Qwen2.5-Coder Technical Report","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12186","snapshot_observed_at":"2026-08-15T22:14:19.185976Z","title":"Qwen2.5-coder technical report, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.07796","last_updated":"2025-06-19T10:38:17Z","snapshot_observed_at":"2026-08-18T13:14:20.005435Z","submitted_at":"2025-05-12T17:47:32Z","title":"Learning Dynamics in Continual Pre-Training for Large Language Models","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-15T22:14:19.185976Z"},"links":{"cited_paper":"/paper/2409.12186","citing_paper":"/paper/2505.07796"},"observation_digest":"sha256:74e84b6e514c69b1047fce90c0b386896e6030d4679cb083b9400daa9371e969","observation_id":"5fe99d26-80ac-4698-9dac-b1857eb3ffc0","resolution":{"observed_at":"2026-08-15T22:14:19.185976Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:14:20.351043Z","title":"L., Anthony, Q","venue":null,"work_id":"ac72d9ff-8bfc-4551-bcc4-015b4129aa9d","year":2024},"citing_paper":{"arxiv_id":"2505.07796","last_updated":"2025-06-19T10:38:17Z","snapshot_observed_at":"2026-08-18T13:14:20.005435Z","submitted_at":"2025-05-12T17:47:32Z","title":"Learning Dynamics in Continual Pre-Training for Large Language Models","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-15T22:14:19.190850Z"},"links":{"citing_paper":"/paper/2505.07796"},"observation_digest":"sha256:107959759f6ec97c35c6e430c3ed3d3733486adad029087fc24c03ac7a176101","observation_id":"2e60ba88-dd35-4f19-aa2c-6ce5fc1e1df3","resolution":{"observed_at":"2026-08-15T22:14:20.355983Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-08-13T17:41:53.092611Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-08-15T22:14:19.195460Z","title":"B., Chess, B., Child, R., Gray, S., Radford, A., Wu, J., and Amodei, D","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2505.07796","last_updated":"2025-06-19T10:38:17Z","snapshot_observed_at":"2026-08-18T13:14:20.005435Z","submitted_at":"2025-05-12T17:47:32Z","title":"Learning Dynamics in Continual Pre-Training for Large Language Models","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-15T22:14:19.195460Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2505.07796"},"observation_digest":"sha256:66956a4a5b3c2bae388f508b922d579d648410f53a2794a2f85e7dc453083ffb","observation_id":"459ae38a-4482-428d-9128-83b4ab155c1d","resolution":{"observed_at":"2026-08-15T22:14:19.195460Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-08-17T19:26:44.032537Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-15T22:14:19.200692Z","title":null,"venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.07796","last_updated":"2025-06-19T10:38:17Z","snapshot_observed_at":"2026-08-18T13:14:20.005435Z","submitted_at":"2025-05-12T17:47:32Z","title":"Learning Dynamics in Continual Pre-Training for Large Language Models","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-15T22:14:19.200692Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/2505.07796"},"observation_digest":"sha256:7c6b4e60ff3a59251769260139804078d813735d947d65a7e2ca7be969502ba5","observation_id":"68069132-8bea-4109-b031-5cbd052be450","resolution":{"observed_at":"2026-08-15T22:14:19.200692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:14:20.334484Z","title":"D., van de Ven, G","venue":null,"work_id":"1abbedec-13de-4c9f-9293-19e2a8461a1c","year":2023},"citing_paper":{"arxiv_id":"2505.07796","last_updated":"2025-06-19T10:38:17Z","snapshot_observed_at":"2026-08-18T13:14:20.005435Z","submitted_at":"2025-05-12T17:47:32Z","title":"Learning Dynamics in Continual Pre-Training for Large Language Models","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-15T22:14:19.205364Z"},"links":{"citing_paper":"/paper/2505.07796"},"observation_digest":"sha256:82e5d9f6fac6c88bfb0bd07e5456ca19f41abed9de68ad594cfa9edc4d79114d","observation_id":"e8a86594-ef36-4e22-a423-6908413e4ed9","resolution":{"observed_at":"2026-08-15T22:14:20.339444Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:14:19.210233Z","title":"Crafting papers on machine learning","venue":null,"work_id":null,"year":2000},"citing_paper":{"arxiv_id":"2505.07796","last_updated":"2025-06-19T10:38:17Z","snapshot_observed_at":"2026-08-18T13:14:20.005435Z","submitted_at":"2025-05-12T17:47:32Z","title":"Learning Dynamics in Continual Pre-Training for Large Language Models","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-15T22:14:19.210233Z"},"links":{"citing_paper":"/paper/2505.07796"},"observation_digest":"sha256:0a1f18820cc729667e7c22243ed982ccdcca98aedff8626b5d954fa78c5b9348","observation_id":"9b3c9d46-f34f-41a5-9d27-fa350dd6b9bd","resolution":{"observed_at":"2026-08-15T22:14:19.210233Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:14:20.303740Z","title":"and Hutter, F","venue":null,"work_id":"c069db71-03b5-4f16-ae77-57b084b5a40d","year":2016},"citing_paper":{"arxiv_id":"2505.07796","last_updated":"2025-06-19T10:38:17Z","snapshot_observed_at":"2026-08-18T13:14:20.005435Z","submitted_at":"2025-05-12T17:47:32Z","title":"Learning Dynamics in Continual Pre-Training for Large Language Models","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-15T22:14:19.214951Z"},"links":{"citing_paper":"/paper/2505.07796"},"observation_digest":"sha256:1268da9abeb7dc913ad17330386785ca36b91c60d814e890de5c6a28383f0f5c","observation_id":"8d3ac477-eb42-470d-989a-cd4faea88925","resolution":{"observed_at":"2026-08-15T22:14:20.309928Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-08-14T20:13:52.872565Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-15T22:14:19.219560Z","title":"and Hutter, F","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.07796","last_updated":"2025-06-19T10:38:17Z","snapshot_observed_at":"2026-08-18T13:14:20.005435Z","submitted_at":"2025-05-12T17:47:32Z","title":"Learning Dynamics in Continual Pre-Training for Large Language Models","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-15T22:14:19.219560Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2505.07796"},"observation_digest":"sha256:f7c3deacc7cbc2912771c2361ef5e79b8b40d49b3a41250c5dd23a044e66ae81","observation_id":"2e51e396-b711-4e09-9e85-55a0c2fbbb37","resolution":{"observed_at":"2026-08-15T22:14:19.219560Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:14:20.284793Z","title":"A multi-power law for loss curve prediction across learning rate schedules","venue":null,"work_id":"5dd5e2fd-316c-476f-bda9-09206dcfa5fb","year":2025},"citing_paper":{"arxiv_id":"2505.07796","last_updated":"2025-06-19T10:38:17Z","snapshot_observed_at":"2026-08-18T13:14:20.005435Z","submitted_at":"2025-05-12T17:47:32Z","title":"Learning Dynamics in Continual Pre-Training for Large Language Models","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-15T22:14:19.224165Z"},"links":{"citing_paper":"/paper/2505.07796"},"observation_digest":"sha256:1301190777b1eb06972ec7c060b2dd07e606c63677b4c06d4c1456021f87f09e","observation_id":"7bd6e633-6962-47b5-b386-475c95976855","resolution":{"observed_at":"2026-08-15T22:14:20.290973Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:14:19.229110Z","title":"Updating quasi newton matrices with limited storage","venue":null,"work_id":null,"year":1980},"citing_paper":{"arxiv_id":"2505.07796","last_updated":"2025-06-19T10:38:17Z","snapshot_observed_at":"2026-08-18T13:14:20.005435Z","submitted_at":"2025-05-12T17:47:32Z","title":"Learning Dynamics in Continual Pre-Training for Large Language Models","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-15T22:14:19.229110Z"},"links":{"citing_paper":"/paper/2505.07796"},"observation_digest":"sha256:c3b0a241663876cb29d31d0d7210d5b632b4dc3ba9964cf39da340bc22a1376e","observation_id":"989c7cc4-f2b7-4702-b280-e8eb39b9ad2c","resolution":{"observed_at":"2026-08-15T22:14:19.229110Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-17T09:58:46.058102Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-15T22:14:19.233882Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.07796","last_updated":"2025-06-19T10:38:17Z","snapshot_observed_at":"2026-08-18T13:14:20.005435Z","submitted_at":"2025-05-12T17:47:32Z","title":"Learning Dynamics in Continual Pre-Training for Large Language Models","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-15T22:14:19.233882Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2505.07796"},"observation_digest":"sha256:f5477987ab6e24e4d311e0318a5c676fe10bc14bf763c285d80b0ebb26583ef3","observation_id":"fdee20b3-088e-4cd9-a63a-432b79da5f9e","resolution":{"observed_at":"2026-08-15T22:14:19.233882Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07263","last_updated":"2024-07-09T22:37:59Z","snapshot_observed_at":"2026-08-16T13:35:36.961982Z","submitted_at":"2024-07-09T22:37:59Z","title":"Reuse, Don't Retrain: A Recipe for Continued Pretraining of Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07263","snapshot_observed_at":"2026-08-15T22:14:19.238721Z","title":"Reuse, don't retrain: A recipe for continued pretraining of language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.07796","last_updated":"2025-06-19T10:38:17Z","snapshot_observed_at":"2026-08-18T13:14:20.005435Z","submitted_at":"2025-05-12T17:47:32Z","title":"Learning Dynamics in Continual Pre-Training for Large Language Models","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-15T22:14:19.238721Z"},"links":{"cited_paper":"/paper/2407.07263","citing_paper":"/paper/2505.07796"},"observation_digest":"sha256:c04879ef4dfb22211d1e051739c5b0fe289d02d250b7da4fd13d6a8fbff605d8","observation_id":"f9f86186-71aa-4f82-882d-d1a69542bfc8","resolution":{"observed_at":"2026-08-15T22:14:19.238721Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:14:20.267031Z","title":"D., Azerbayev, Z., and Ba, J","venue":null,"work_id":"6d304219-642d-4870-bb32-77e00b411011","year":2023},"citing_paper":{"arxiv_id":"2505.07796","last_updated":"2025-06-19T10:38:17Z","snapshot_observed_at":"2026-08-18T13:14:20.005435Z","submitted_at":"2025-05-12T17:47:32Z","title":"Learning Dynamics in Continual Pre-Training for Large Language Models","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-15T22:14:19.243666Z"},"links":{"citing_paper":"/paper/2505.07796"},"observation_digest":"sha256:4c315d41999da20a704fbde62a0e50ea7c4b544a055269db9607c46a150b9a4d","observation_id":"861df785-cb40-41e5-bb8b-024345a2a11c","resolution":{"observed_at":"2026-08-15T22:14:20.273507Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:14:19.249541Z","title":"B., Lozhkov, A., Mitchell, M., Raffel, C., Werra, L","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.07796","last_updated":"2025-06-19T10:38:17Z","snapshot_observed_at":"2026-08-18T13:14:20.005435Z","submitted_at":"2025-05-12T17:47:32Z","title":"Learning Dynamics in Continual Pre-Training for Large Language Models","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-15T22:14:19.249541Z"},"links":{"citing_paper":"/paper/2505.07796"},"observation_digest":"sha256:e8117d78fac035d3556c800b02949cb5334b5c9e17dbdac2fc5b1daa82a12513","observation_id":"1f09191e-1298-4fc4-aa62-52aa61bb9fad","resolution":{"observed_at":"2026-08-15T22:14:19.249541Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:14:20.238307Z","title":"D- CPT law: Domain-specific continual pre-training scaling law for large language models","venue":null,"work_id":"caf569dd-4452-4925-940b-4abaa985b3d5","year":2024},"citing_paper":{"arxiv_id":"2505.07796","last_updated":"2025-06-19T10:38:17Z","snapshot_observed_at":"2026-08-18T13:14:20.005435Z","submitted_at":"2025-05-12T17:47:32Z","title":"Learning Dynamics in Continual Pre-Training for Large Language Models","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-15T22:14:19.254361Z"},"links":{"citing_paper":"/paper/2505.07796"},"observation_digest":"sha256:2fdfd3a31014df34c28e66abebfc3b78f7d8a0881438573d82f6aac22b37824f","observation_id":"a2ef0944-f9cd-415d-b159-fe312a74b41a","resolution":{"observed_at":"2026-08-15T22:14:20.243990Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16789","last_updated":"2024-11-25T05:27:13Z","snapshot_observed_at":"2026-08-17T23:09:06.865859Z","submitted_at":"2024-04-25T17:38:57Z","title":"Continual Learning of Large Language Models: A Comprehensive Survey","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16789","snapshot_observed_at":"2026-08-15T22:14:19.259110Z","title":"Continual learning of large language models: A comprehensive survey, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.07796","last_updated":"2025-06-19T10:38:17Z","snapshot_observed_at":"2026-08-18T13:14:20.005435Z","submitted_at":"2025-05-12T17:47:32Z","title":"Learning Dynamics in Continual Pre-Training for Large Language Models","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-15T22:14:19.259110Z"},"links":{"cited_paper":"/paper/2404.16789","citing_paper":"/paper/2505.07796"},"observation_digest":"sha256:38c9b38f4d90ba9e3368440998c8e1252c771a1184315739a4a5d7cdb9c7dd74","observation_id":"85f9ac97-6833-42f3-987d-cddf4ef01bcf","resolution":{"observed_at":"2026-08-15T22:14:19.259110Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:14:19.264207Z","title":null,"venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2505.07796","last_updated":"2025-06-19T10:38:17Z","snapshot_observed_at":"2026-08-18T13:14:20.005435Z","submitted_at":"2025-05-12T17:47:32Z","title":"Learning Dynamics in Continual Pre-Training for Large Language Models","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-15T22:14:19.264207Z"},"links":{"citing_paper":"/paper/2505.07796"},"observation_digest":"sha256:1b23b386af3d10d4dc1570f31695f8082b064df65cbbf95b9cf8a07dfb49897a","observation_id":"a839d7a2-7450-47b5-9c0b-1a24bd2dda44","resolution":{"observed_at":"2026-08-15T22:14:19.264207Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:14:19.269275Z","title":"R., Hestness, J., and Dey, N","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.07796","last_updated":"2025-06-19T10:38:17Z","snapshot_observed_at":"2026-08-18T13:14:20.005435Z","submitted_at":"2025-05-12T17:47:32Z","title":"Learning Dynamics in Continual Pre-Training for Large Language Models","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-15T22:14:19.269275Z"},"links":{"citing_paper":"/paper/2505.07796"},"observation_digest":"sha256:c27300bdb69581e9faf6b0bb72b2516f61cf1892ce9d60c66caba6fb918b877d","observation_id":"321a79f9-b434-444b-8146-0f2629a50b16","resolution":{"observed_at":"2026-08-15T22:14:19.269275Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.11029","last_updated":"2024-10-24T17:56:14Z","snapshot_observed_at":"2026-08-17T03:33:10.772067Z","submitted_at":"2024-08-20T17:30:48Z","title":"Scaling Law with Learning Rate Annealing","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.11029","snapshot_observed_at":"2026-08-15T22:14:19.273955Z","title":"Scaling law with learning rate annealing, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.07796","last_updated":"2025-06-19T10:38:17Z","snapshot_observed_at":"2026-08-18T13:14:20.005435Z","submitted_at":"2025-05-12T17:47:32Z","title":"Learning Dynamics in Continual Pre-Training for Large Language Models","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-15T22:14:19.273955Z"},"links":{"cited_paper":"/paper/2408.11029","citing_paper":"/paper/2505.07796"},"observation_digest":"sha256:8e7d90cf8bc02ef5bc206ab2972e16ef33c82737c3f8c8b6ea020213f6e98196","observation_id":"7cbb1862-92dd-443b-af9b-41f1447b764f","resolution":{"observed_at":"2026-08-15T22:14:19.273955Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:14:19.279303Z","title":"Learning to prompt for continual learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.07796","last_updated":"2025-06-19T10:38:17Z","snapshot_observed_at":"2026-08-18T13:14:20.005435Z","submitted_at":"2025-05-12T17:47:32Z","title":"Learning Dynamics in Continual Pre-Training for Large Language Models","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-15T22:14:19.279303Z"},"links":{"citing_paper":"/paper/2505.07796"},"observation_digest":"sha256:9150e6eae9b1d4140b1b5d46ab94d4940d6d7e0e9d6179c941784516231663b3","observation_id":"5f722a6d-d6be-452a-a960-a2ed3c795b4c","resolution":{"observed_at":"2026-08-15T22:14:19.279303Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:14:20.196460Z","title":"A learning rate path switching training paradigm for version updates of large language models","venue":null,"work_id":"05604c6d-068c-4ec4-ac52-33c4f0c4b790","year":2024},"citing_paper":{"arxiv_id":"2505.07796","last_updated":"2025-06-19T10:38:17Z","snapshot_observed_at":"2026-08-18T13:14:20.005435Z","submitted_at":"2025-05-12T17:47:32Z","title":"Learning Dynamics in Continual Pre-Training for Large Language Models","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-15T22:14:19.284081Z"},"links":{"citing_paper":"/paper/2505.07796"},"observation_digest":"sha256:c266529fc6d37db24381d557663a0b2f7aa8ef923bdbf92584f11e79d3c3716b","observation_id":"58551376-09c2-48f3-af18-a0df838298b2","resolution":{"observed_at":"2026-08-15T22:14:20.202006Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:14:19.289495Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.07796","last_updated":"2025-06-19T10:38:17Z","snapshot_observed_at":"2026-08-18T13:14:20.005435Z","submitted_at":"2025-05-12T17:47:32Z","title":"Learning Dynamics in Continual Pre-Training for Large Language Models","version":2},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-15T22:14:19.289495Z"},"links":{"citing_paper":"/paper/2505.07796"},"observation_digest":"sha256:bc7e3e28cbf879fcb1358df02a45389a79ef4384f19545baa57d86b7db2d5b97","observation_id":"6676a362-fa8a-4ecc-a150-6af55c89abbf","resolution":{"observed_at":"2026-08-15T22:14:19.289495Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.04777","last_updated":"2026-05-20T09:55:40Z","snapshot_observed_at":"2026-08-18T12:19:50.366790Z","submitted_at":"2024-09-07T09:37:19Z","title":"Optimization Hyper-parameter Laws for Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.04777","snapshot_observed_at":"2026-08-15T22:14:19.295472Z","title":"Optimization hyper-parameter laws for large language models, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.07796","last_updated":"2025-06-19T10:38:17Z","snapshot_observed_at":"2026-08-18T13:14:20.005435Z","submitted_at":"2025-05-12T17:47:32Z","title":"Learning Dynamics in Continual Pre-Training for Large Language Models","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-15T22:14:19.295472Z"},"links":{"cited_paper":"/paper/2409.04777","citing_paper":"/paper/2505.07796"},"observation_digest":"sha256:c2f65543fdd05ed9f20a0e6050bd4632b00cbe72b19b151fd16ee9abf61cb11f","observation_id":"f304d238-6658-47b8-a1da-c9b68b70feff","resolution":{"observed_at":"2026-08-15T22:14:19.295472Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.16952","last_updated":"2025-03-20T03:31:27Z","snapshot_observed_at":"2026-08-16T14:06:35.643964Z","submitted_at":"2024-03-25T17:14:00Z","title":"Data Mixing Laws: Optimizing Data Mixtures by Predicting Language Modeling Performance","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.16952","snapshot_observed_at":"2026-08-15T22:14:19.300672Z","title":"Data mixing laws: Optimizing data mixtures by predicting language modeling performance, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.07796","last_updated":"2025-06-19T10:38:17Z","snapshot_observed_at":"2026-08-18T13:14:20.005435Z","submitted_at":"2025-05-12T17:47:32Z","title":"Learning Dynamics in Continual Pre-Training for Large Language Models","version":2},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-15T22:14:19.300672Z"},"links":{"cited_paper":"/paper/2403.16952","citing_paper":"/paper/2505.07796"},"observation_digest":"sha256:28032b6ea6ab791fd554109f9c75fd594dc45243160ca13d525ab1464f018baa","observation_id":"5971afbb-59ef-4cc7-8894-97b5c7ac19fd","resolution":{"observed_at":"2026-08-15T22:14:19.300672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:14:20.165667Z","title":"Domain2vec: Vectorizing datasets to find the optimal data mixture without training, 2025","venue":null,"work_id":"42dc55f7-59fb-4f27-a22c-a5e924ee894b","year":2025},"citing_paper":{"arxiv_id":"2505.07796","last_updated":"2025-06-19T10:38:17Z","snapshot_observed_at":"2026-08-18T13:14:20.005435Z","submitted_at":"2025-05-12T17:47:32Z","title":"Learning Dynamics in Continual Pre-Training for Large Language Models","version":2},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-15T22:14:19.307989Z"},"links":{"citing_paper":"/paper/2505.07796"},"observation_digest":"sha256:5471c17610a4aed8e0014683d0568a8142185f53660dc0f58e91e93abb991855","observation_id":"9d9b136e-0af0-43a8-8371-126b20a2042f","resolution":{"observed_at":"2026-08-15T22:14:20.172977Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17400","last_updated":"2025-02-12T14:46:43Z","snapshot_observed_at":"2026-08-16T14:14:57.567867Z","submitted_at":"2024-02-27T10:47:24Z","title":"Investigating Continual Pretraining in Large Language Models: Insights and Implications","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.17400","snapshot_observed_at":"2026-08-15T22:14:19.313213Z","title":"K., Punia, P., Bethge, M., and Ermis, B","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.07796","last_updated":"2025-06-19T10:38:17Z","snapshot_observed_at":"2026-08-18T13:14:20.005435Z","submitted_at":"2025-05-12T17:47:32Z","title":"Learning Dynamics in Continual Pre-Training for Large Language Models","version":2},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-15T22:14:19.313213Z"},"links":{"cited_paper":"/paper/2402.17400","citing_paper":"/paper/2505.07796"},"observation_digest":"sha256:93edb8361977c23dcbfaa7581ddc13bd53855c805de7e98253d5845f3f1f8be3","observation_id":"6563d047-ff19-4651-b5fc-a2132e7fe312","resolution":{"observed_at":"2026-08-15T22:14:19.313213Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:14:19.319295Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.07796","last_updated":"2025-06-19T10:38:17Z","snapshot_observed_at":"2026-08-18T13:14:20.005435Z","submitted_at":"2025-05-12T17:47:32Z","title":"Learning Dynamics in Continual Pre-Training for Large Language Models","version":2},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-15T22:14:19.319295Z"},"links":{"citing_paper":"/paper/2505.07796"},"observation_digest":"sha256:105a70bcceabf34b3a1ace398e133e3901a463a00a1e2d35bf7a329f4e18fe4c","observation_id":"396d8970-4cd2-4e07-8d1d-91227aeadf41","resolution":{"observed_at":"2026-08-15T22:14:19.319295Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.07796","last_updated":"2025-06-19T10:38:17Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-18T13:14:20.005435Z","submitted_at":"2025-05-12T17:47:32Z","title":"Learning Dynamics in Continual Pre-Training for Large Language Models"},"reference_resolution":{"displayed":47,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":37,"verified_exact":0,"verified_fuzzy":10},"total_outbound_references":47},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 20 August 2026, this Paper Citation Record lists 47 of 47 outbound references and 1 inbound Pith citation observation for arXiv:2505.07796."}