{"as_of":"2026-08-07T06:17:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ff56c449f254040d3e9a00326f1da746fd899b255c16bb5d0c0e138456607500","coverage":[{"denominator":46,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":46,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T17:56:44.153432Z","state":"measured"},{"denominator":46,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":46,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-06T06:34:29.942622+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.10613/citation-record","integrity":"/paper/2507.10613/integrity","json":"/paper/2507.10613/citation-record.json","paper":"/paper/2507.10613"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2401.04578","last_updated":"2024-03-12T10:35:56Z","snapshot_observed_at":"2026-07-06T17:13:17.263599Z","submitted_at":"2024-01-09T14:32:24Z","title":"Effective pruning of web-scale datasets based on complexity of concept clusters","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.04578","snapshot_observed_at":"2026-08-06T17:56:43.267479Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.10613","last_updated":"2025-07-13T15:15:24Z","snapshot_observed_at":"2026-08-06T17:47:49.655656Z","submitted_at":"2025-07-13T15:15:24Z","title":"Sub-Scaling Laws: On the Role of Data Density and Training Strategies in LLMs","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-06T17:56:43.267479Z"},"links":{"cited_paper":"/paper/2401.04578","citing_paper":"/paper/2507.10613"},"observation_digest":"sha256:8bcfc41bc4ed06e2e08037444802917bd30b89d70ca8e8c8a1e80fe69b1a8743","observation_id":"8066dc3e-8748-4e57-b3bc-5a27ea86a4ce","resolution":{"observed_at":"2026-08-06T17:56:43.267479Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2102.06701","last_updated":"2024-04-29T00:55:09Z","snapshot_observed_at":"2026-08-05T10:38:06.663419Z","submitted_at":"2021-02-12T18:57:46Z","title":"Explaining Neural Scaling Laws","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.06701","snapshot_observed_at":"2026-08-06T17:56:43.295193Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.10613","last_updated":"2025-07-13T15:15:24Z","snapshot_observed_at":"2026-08-06T17:47:49.655656Z","submitted_at":"2025-07-13T15:15:24Z","title":"Sub-Scaling Laws: On the Role of Data Density and Training Strategies in LLMs","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-06T17:56:43.295193Z"},"links":{"cited_paper":"/paper/2102.06701","citing_paper":"/paper/2507.10613"},"observation_digest":"sha256:307f8d21b825b90eb5cec0779dc2b10e59f24b7790d20bebe23cd3d23d7c8b82","observation_id":"bdd7c99d-7bb3-4ae9-83fc-0e71fea596a1","resolution":{"observed_at":"2026-08-06T17:56:43.295193Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:56:44.975745Z","title":null,"venue":null,"work_id":"0298bdef-ecec-4322-9373-7e4812e61f9a","year":2021},"citing_paper":{"arxiv_id":"2507.10613","last_updated":"2025-07-13T15:15:24Z","snapshot_observed_at":"2026-08-06T17:47:49.655656Z","submitted_at":"2025-07-13T15:15:24Z","title":"Sub-Scaling Laws: On the Role of Data Density and Training Strategies in LLMs","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-06T17:56:43.328965Z"},"links":{"citing_paper":"/paper/2507.10613"},"observation_digest":"sha256:04c8abf66801671abd7055aedad7d9f167bc51b17c8fae6d86611cddb12c139f","observation_id":"351d8134-db2b-471b-b267-b6752fed9911","resolution":{"observed_at":"2026-08-06T17:56:44.979859Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:56:44.961808Z","title":null,"venue":null,"work_id":"7ef1220b-09df-4e97-adf2-6f7c0f94e457","year":2021},"citing_paper":{"arxiv_id":"2507.10613","last_updated":"2025-07-13T15:15:24Z","snapshot_observed_at":"2026-08-06T17:47:49.655656Z","submitted_at":"2025-07-13T15:15:24Z","title":"Sub-Scaling Laws: On the Role of Data Density and Training Strategies in LLMs","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-06T17:56:43.364347Z"},"links":{"citing_paper":"/paper/2507.10613"},"observation_digest":"sha256:3aa826d13e3ed798fe85e26fc97cdd946a3d319ad8a9b84f12ef0bf32c2f3ecf","observation_id":"152a6975-968c-4c9f-9029-0c41b9f7b163","resolution":{"observed_at":"2026-08-06T17:56:44.966457Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.00027","last_updated":"2025-05-24T12:44:15Z","snapshot_observed_at":"2026-07-06T21:33:55.658995Z","submitted_at":"2025-05-24T12:44:15Z","title":"From Mathematical Reasoning to Code: Generalization of Process Reward Models in Test-Time Scaling","version":1},"cited_work":{"arxiv_id":"2506.00027","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.00027","snapshot_observed_at":"2026-08-06T17:56:44.691483Z","title":"From Mathematical Reasoning to Code: Generalization of Process Reward Models in Test-Time Scaling","venue":"cs.CL","work_id":"6cef77d9-2df6-4064-9a72-6d13456f776c","year":2025},"citing_paper":{"arxiv_id":"2507.10613","last_updated":"2025-07-13T15:15:24Z","snapshot_observed_at":"2026-08-06T17:47:49.655656Z","submitted_at":"2025-07-13T15:15:24Z","title":"Sub-Scaling Laws: On the Role of Data Density and Training Strategies in LLMs","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-06T17:56:43.392662Z"},"links":{"cited_paper":"/paper/2506.00027","citing_paper":"/paper/2507.10613"},"observation_digest":"sha256:5156b5a945f7f36a71029f38f5dc6c775da77989f87b806186f97fa0a954e85b","observation_id":"1d3a22a1-49e8-45c1-85e7-701a2f4f4e21","resolution":{"observed_at":"2026-08-06T17:56:44.698316Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:56:44.947176Z","title":null,"venue":null,"work_id":"83fcf7e7-2331-4906-ba26-830ad1e8d1dd","year":2022},"citing_paper":{"arxiv_id":"2507.10613","last_updated":"2025-07-13T15:15:24Z","snapshot_observed_at":"2026-08-06T17:47:49.655656Z","submitted_at":"2025-07-13T15:15:24Z","title":"Sub-Scaling Laws: On the Role of Data Density and Training Strategies in LLMs","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-06T17:56:43.419471Z"},"links":{"citing_paper":"/paper/2507.10613"},"observation_digest":"sha256:0e82d3cc2c7eaf2a0a3a2cbb475351aa4f5ccda20dc592347c709297ea942c37","observation_id":"df807588-e848-424b-aea1-695e37c467a3","resolution":{"observed_at":"2026-08-06T17:56:44.951580Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:56:44.932870Z","title":null,"venue":null,"work_id":"d9e165e0-aa7a-425c-ab8c-80a624a0672b","year":2024},"citing_paper":{"arxiv_id":"2507.10613","last_updated":"2025-07-13T15:15:24Z","snapshot_observed_at":"2026-08-06T17:47:49.655656Z","submitted_at":"2025-07-13T15:15:24Z","title":"Sub-Scaling Laws: On the Role of Data Density and Training Strategies in LLMs","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-06T17:56:43.455943Z"},"links":{"citing_paper":"/paper/2507.10613"},"observation_digest":"sha256:bf48b1a2f7ce6e70d65ec76ac02235b6d63d0930484f52f2e5b1c26acd462189","observation_id":"35c29b43-c5f6-4f55-9149-03cf68dc9f58","resolution":{"observed_at":"2026-08-06T17:56:44.938172Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:56:44.918946Z","title":null,"venue":null,"work_id":"a886e862-b3c7-4b60-abb4-12cb885783bd","year":2024},"citing_paper":{"arxiv_id":"2507.10613","last_updated":"2025-07-13T15:15:24Z","snapshot_observed_at":"2026-08-06T17:47:49.655656Z","submitted_at":"2025-07-13T15:15:24Z","title":"Sub-Scaling Laws: On the Role of Data Density and Training Strategies in LLMs","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-06T17:56:43.492114Z"},"links":{"citing_paper":"/paper/2507.10613"},"observation_digest":"sha256:06672d934aa8d434535686d14ef74f14fd29b2d2d7d2b0e2bae7c5c3accb9cab","observation_id":"85c3dc1e-d079-402c-b765-3c3b14f434f4","resolution":{"observed_at":"2026-08-06T17:56:44.923507Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:56:44.904787Z","title":null,"venue":null,"work_id":"5624caed-e2f6-4caa-8488-39d58ba3b66f","year":2021},"citing_paper":{"arxiv_id":"2507.10613","last_updated":"2025-07-13T15:15:24Z","snapshot_observed_at":"2026-08-06T17:47:49.655656Z","submitted_at":"2025-07-13T15:15:24Z","title":"Sub-Scaling Laws: On the Role of Data Density and Training Strategies in LLMs","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-06T17:56:43.518687Z"},"links":{"citing_paper":"/paper/2507.10613"},"observation_digest":"sha256:dd9f356f0dd901c7ba45e46357fb55043187b785cdc35a803848c0091d33f89e","observation_id":"448ab41a-a3ae-464c-ac60-03ccacd6c880","resolution":{"observed_at":"2026-08-06T17:56:44.909320Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:56:44.890251Z","title":null,"venue":null,"work_id":"50f129c8-c3cd-4ee7-a8f0-66a27619b9cf","year":2024},"citing_paper":{"arxiv_id":"2507.10613","last_updated":"2025-07-13T15:15:24Z","snapshot_observed_at":"2026-08-06T17:47:49.655656Z","submitted_at":"2025-07-13T15:15:24Z","title":"Sub-Scaling Laws: On the Role of Data Density and Training Strategies in LLMs","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-06T17:56:43.554697Z"},"links":{"citing_paper":"/paper/2507.10613"},"observation_digest":"sha256:66e120ebbb3425cbf8540820b4afe182f73a7e9627a8e9da4077290d799c4aff","observation_id":"f0d5ca0c-fda0-43e2-b216-553a3e5a3e38","resolution":{"observed_at":"2026-08-06T17:56:44.894632Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02954","last_updated":"2024-01-05T18:59:13Z","snapshot_observed_at":"2026-08-02T13:11:16.882565Z","submitted_at":"2024-01-05T18:59:13Z","title":"DeepSeek LLM: Scaling Open-Source Language Models with Longtermism","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.02954","snapshot_observed_at":"2026-08-06T17:56:43.581222Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.10613","last_updated":"2025-07-13T15:15:24Z","snapshot_observed_at":"2026-08-06T17:47:49.655656Z","submitted_at":"2025-07-13T15:15:24Z","title":"Sub-Scaling Laws: On the Role of Data Density and Training Strategies in LLMs","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-06T17:56:43.581222Z"},"links":{"cited_paper":"/paper/2401.02954","citing_paper":"/paper/2507.10613"},"observation_digest":"sha256:40108babcef945455aef4f0265e28f67ebebba7e17cf55a84152498977dd33fc","observation_id":"671c4fae-1622-4f4f-a9b0-1d9431ec75cf","resolution":{"observed_at":"2026-08-06T17:56:43.581222Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:56:44.875602Z","title":null,"venue":null,"work_id":"c66b231a-0160-453c-b7ac-d54dee80117b","year":2022},"citing_paper":{"arxiv_id":"2507.10613","last_updated":"2025-07-13T15:15:24Z","snapshot_observed_at":"2026-08-06T17:47:49.655656Z","submitted_at":"2025-07-13T15:15:24Z","title":"Sub-Scaling Laws: On the Role of Data Density and Training Strategies in LLMs","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-06T17:56:43.613110Z"},"links":{"citing_paper":"/paper/2507.10613"},"observation_digest":"sha256:29310bb6ad685256f588682eeb414c9b571d3717938c1bcdc9206448c621b56c","observation_id":"c3e4e2f2-b507-4f90-8038-a8dc4a2cce3a","resolution":{"observed_at":"2026-08-06T17:56:44.880101Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.08540","last_updated":"2024-06-14T20:21:05Z","snapshot_observed_at":"2026-07-06T17:43:56.860733Z","submitted_at":"2024-03-13T13:54:00Z","title":"Language models scale reliably with over-training and on downstream tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.08540","snapshot_observed_at":"2026-08-06T17:56:43.636617Z","title":"Dimakis, Gabriel Ilharco, Shuran Song, Thomas Kollar, Yair Carmon, Achal Dave, Reinhard Heckel, Niklas Muennighoff, and Ludwig Schmidt","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.10613","last_updated":"2025-07-13T15:15:24Z","snapshot_observed_at":"2026-08-06T17:47:49.655656Z","submitted_at":"2025-07-13T15:15:24Z","title":"Sub-Scaling Laws: On the Role of Data Density and Training Strategies in LLMs","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-06T17:56:43.636617Z"},"links":{"cited_paper":"/paper/2403.08540","citing_paper":"/paper/2507.10613"},"observation_digest":"sha256:48a2934aa5c18b448192548ed9181b069ebdaf5b4f17c51d6c8ef0ce0c855fa5","observation_id":"79a6fd3c-a6e1-4997-928a-cc2aca852b83","resolution":{"observed_at":"2026-08-06T17:56:43.636617Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:56:44.861593Z","title":null,"venue":null,"work_id":"fc068947-2d59-4653-b0b7-d92334c5a0fc","year":2020},"citing_paper":{"arxiv_id":"2507.10613","last_updated":"2025-07-13T15:15:24Z","snapshot_observed_at":"2026-08-06T17:47:49.655656Z","submitted_at":"2025-07-13T15:15:24Z","title":"Sub-Scaling Laws: On the Role of Data Density and Training Strategies in LLMs","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-06T17:56:43.660683Z"},"links":{"citing_paper":"/paper/2507.10613"},"observation_digest":"sha256:26161f54bce80be75f149907546b24690f771c89e92d89c4e83c46ecfd68304c","observation_id":"2a7b2c32-31db-43f0-bc5e-d78026609ee6","resolution":{"observed_at":"2026-08-06T17:56:44.866013Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.07740","last_updated":"2021-09-16T06:15:20Z","snapshot_observed_at":"2026-07-06T11:48:14.757537Z","submitted_at":"2021-09-16T06:15:20Z","title":"Scaling Laws for Neural Machine Translation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.07740","snapshot_observed_at":"2026-08-06T17:56:43.681631Z","title":"Ghorbani, Orhan Firat, Markus Freitag, Ankur Bapna, Maxim Krikun, Xavier Garc \\'i a, Ciprian Chelba, and Colin Cherry","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.10613","last_updated":"2025-07-13T15:15:24Z","snapshot_observed_at":"2026-08-06T17:47:49.655656Z","submitted_at":"2025-07-13T15:15:24Z","title":"Sub-Scaling Laws: On the Role of Data Density and Training Strategies in LLMs","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-06T17:56:43.681631Z"},"links":{"cited_paper":"/paper/2109.07740","citing_paper":"/paper/2507.10613"},"observation_digest":"sha256:bc857a4195354e3938ce94b894215fbbcf0b9a0e15b445cece4473b746d4cb24","observation_id":"a285115f-3246-4ba1-b8a4-261f5b57b4fd","resolution":{"observed_at":"2026-08-06T17:56:43.681631Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.14701","last_updated":"2020-11-06T04:16:36Z","snapshot_observed_at":"2026-07-06T10:09:17.078776Z","submitted_at":"2020-10-28T02:17:24Z","title":"Scaling Laws for Autoregressive Generative Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.14701","snapshot_observed_at":"2026-08-06T17:56:43.717878Z","title":"Brown, Prafulla Dhariwal, Scott Gray, Chris Hallacy, Benjamin Mann, Alec Radford, Aditya Ramesh, Nick Ryder, Daniel M","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.10613","last_updated":"2025-07-13T15:15:24Z","snapshot_observed_at":"2026-08-06T17:47:49.655656Z","submitted_at":"2025-07-13T15:15:24Z","title":"Sub-Scaling Laws: On the Role of Data Density and Training Strategies in LLMs","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-06T17:56:43.717878Z"},"links":{"cited_paper":"/paper/2010.14701","citing_paper":"/paper/2507.10613"},"observation_digest":"sha256:72bc9d16aafc657a7b59404bfb6d10aa8bd522f68e5f0e2042f3da47a53dddb8","observation_id":"84e2df13-ac46-4c94-b74e-20128916c624","resolution":{"observed_at":"2026-08-06T17:56:43.717878Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.10487","last_updated":"2022-05-21T02:14:27Z","snapshot_observed_at":"2026-08-04T13:21:32.121470Z","submitted_at":"2022-05-21T02:14:27Z","title":"Scaling Laws and Interpretability of Learning from Repeated Data","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.10487","snapshot_observed_at":"2026-08-06T17:56:43.788633Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.10613","last_updated":"2025-07-13T15:15:24Z","snapshot_observed_at":"2026-08-06T17:47:49.655656Z","submitted_at":"2025-07-13T15:15:24Z","title":"Sub-Scaling Laws: On the Role of Data Density and Training Strategies in LLMs","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-06T17:56:43.788633Z"},"links":{"cited_paper":"/paper/2205.10487","citing_paper":"/paper/2507.10613"},"observation_digest":"sha256:cd0bc59a6ede0428a945b3346ed04554d349232ba5eeb5b9a7e8fe917639794e","observation_id":"21b9fa81-02da-45de-8a0d-93fba2742c65","resolution":{"observed_at":"2026-08-06T17:56:43.788633Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2102.01293","last_updated":"2021-02-02T04:07:38Z","snapshot_observed_at":"2026-08-01T22:46:19.170916Z","submitted_at":"2021-02-02T04:07:38Z","title":"Scaling Laws for Transfer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.01293","snapshot_observed_at":"2026-08-06T17:56:43.818581Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.10613","last_updated":"2025-07-13T15:15:24Z","snapshot_observed_at":"2026-08-06T17:47:49.655656Z","submitted_at":"2025-07-13T15:15:24Z","title":"Sub-Scaling Laws: On the Role of Data Density and Training Strategies in LLMs","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-06T17:56:43.818581Z"},"links":{"cited_paper":"/paper/2102.01293","citing_paper":"/paper/2507.10613"},"observation_digest":"sha256:1514aa9b0ca078cba266a6ec71aaacbcc37e54f5ed9714d5165a7bad8c2fd6bb","observation_id":"f0d3a553-7835-494a-853c-c73fb912f5b0","resolution":{"observed_at":"2026-08-06T17:56:43.818581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.15556","last_updated":"2022-03-29T13:38:03Z","snapshot_observed_at":"2026-07-06T12:54:11.616335Z","submitted_at":"2022-03-29T13:38:03Z","title":"Training Compute-Optimal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.15556","snapshot_observed_at":"2026-08-06T17:56:43.845916Z","title":"Rae, Oriol Vinyals, and Laurent Sifre","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.10613","last_updated":"2025-07-13T15:15:24Z","snapshot_observed_at":"2026-08-06T17:47:49.655656Z","submitted_at":"2025-07-13T15:15:24Z","title":"Sub-Scaling Laws: On the Role of Data Density and Training Strategies in LLMs","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-06T17:56:43.845916Z"},"links":{"cited_paper":"/paper/2203.15556","citing_paper":"/paper/2507.10613"},"observation_digest":"sha256:72a95714c93182c99b479a6cb3dfbbd0cb7f56d36838e5774bb1a549278fa474","observation_id":"78d9b79f-b906-4925-8433-1e1d43685aa3","resolution":{"observed_at":"2026-08-06T17:56:43.845916Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:56:44.845831Z","title":null,"venue":null,"work_id":"8302ece4-25a3-462f-a1dc-f7554ab4dd0e","year":2023},"citing_paper":{"arxiv_id":"2507.10613","last_updated":"2025-07-13T15:15:24Z","snapshot_observed_at":"2026-08-06T17:47:49.655656Z","submitted_at":"2025-07-13T15:15:24Z","title":"Sub-Scaling Laws: On the Role of Data Density and Training Strategies in LLMs","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-06T17:56:43.860871Z"},"links":{"citing_paper":"/paper/2507.10613"},"observation_digest":"sha256:be996ee0cdce5fa58dc742e85adcf648025c86a65906e963963e84e30fb61699","observation_id":"5f3f0ba6-7cfe-4708-99a7-d16e2a51c914","resolution":{"observed_at":"2026-08-06T17:56:44.850720Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06395","last_updated":"2024-06-03T08:54:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-09T15:36:50Z","title":"MiniCPM: Unveiling the Potential of Small Language Models with Scalable Training Strategies","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.06395","snapshot_observed_at":"2026-08-06T17:56:43.895885Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.10613","last_updated":"2025-07-13T15:15:24Z","snapshot_observed_at":"2026-08-06T17:47:49.655656Z","submitted_at":"2025-07-13T15:15:24Z","title":"Sub-Scaling Laws: On the Role of Data Density and Training Strategies in LLMs","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-06T17:56:43.895885Z"},"links":{"cited_paper":"/paper/2404.06395","citing_paper":"/paper/2507.10613"},"observation_digest":"sha256:835ac9db89bd93e8c570661c4b4da4222d14627bd556f57f29cf3f2ae51c538f","observation_id":"91582163-4ee3-4840-a896-8387e86ebb33","resolution":{"observed_at":"2026-08-06T17:56:43.895885Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:56:43.932282Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.10613","last_updated":"2025-07-13T15:15:24Z","snapshot_observed_at":"2026-08-06T17:47:49.655656Z","submitted_at":"2025-07-13T15:15:24Z","title":"Sub-Scaling Laws: On the Role of Data Density and Training Strategies in LLMs","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-06T17:56:43.932282Z"},"links":{"citing_paper":"/paper/2507.10613"},"observation_digest":"sha256:f4fa6238f9284d9140fbdc5d2c6b16fec203c01aa5875c145e01f0ddb95d1844","observation_id":"15eff6fa-854f-4790-9053-31627e0d8b7d","resolution":{"observed_at":"2026-08-06T17:56:43.932282Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06825","last_updated":"2023-10-10T17:54:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-10T17:54:58Z","title":"Mistral 7B","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06825","snapshot_observed_at":"2026-08-06T17:56:43.968079Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.10613","last_updated":"2025-07-13T15:15:24Z","snapshot_observed_at":"2026-08-06T17:47:49.655656Z","submitted_at":"2025-07-13T15:15:24Z","title":"Sub-Scaling Laws: On the Role of Data Density and Training Strategies in LLMs","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-06T17:56:43.968079Z"},"links":{"cited_paper":"/paper/2310.06825","citing_paper":"/paper/2507.10613"},"observation_digest":"sha256:545921c6d8133e413c82a15a41c165273fb451b2d1393be13987987371ab2f93","observation_id":"a8b9a84f-b53a-4a72-9cd8-66cec7ada771","resolution":{"observed_at":"2026-08-06T17:56:43.968079Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-07-06T08:52:12.656082Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-08-06T17:56:44.004588Z","title":"Brown, Benjamin Chess, Rewon Child, Scott Gray, Alec Radford, Jeffrey Wu, and Dario Amodei","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.10613","last_updated":"2025-07-13T15:15:24Z","snapshot_observed_at":"2026-08-06T17:47:49.655656Z","submitted_at":"2025-07-13T15:15:24Z","title":"Sub-Scaling Laws: On the Role of Data Density and Training Strategies in LLMs","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-06T17:56:44.004588Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2507.10613"},"observation_digest":"sha256:db3bc383728fe70cf79ffad6983a86bd148f3d32a130119b30d80b3918f077c3","observation_id":"5ca80b30-e063-49c2-acce-b8069d921a4b","resolution":{"observed_at":"2026-08-06T17:56:44.004588Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1906.06669","last_updated":"2019-06-16T12:42:04Z","snapshot_observed_at":"2026-08-06T05:57:02.071677Z","submitted_at":"2019-06-16T12:42:04Z","title":"One Epoch Is All You Need","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1906.06669","snapshot_observed_at":"2026-08-06T17:56:44.038172Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.10613","last_updated":"2025-07-13T15:15:24Z","snapshot_observed_at":"2026-08-06T17:47:49.655656Z","submitted_at":"2025-07-13T15:15:24Z","title":"Sub-Scaling Laws: On the Role of Data Density and Training Strategies in LLMs","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-06T17:56:44.038172Z"},"links":{"cited_paper":"/paper/1906.06669","citing_paper":"/paper/2507.10613"},"observation_digest":"sha256:d40ee4fde62daa48770ebe4079f621c7e7d72eda155ae12440b780270b12e23a","observation_id":"e0a0890e-0db0-4ecb-89ed-4790428426f3","resolution":{"observed_at":"2026-08-06T17:56:44.038172Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1812.06162","last_updated":"2018-12-14T20:49:09Z","snapshot_observed_at":"2026-07-06T07:21:19.842962Z","submitted_at":"2018-12-14T20:49:09Z","title":"An Empirical Model of Large-Batch Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.06162","snapshot_observed_at":"2026-08-06T17:56:44.050082Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.10613","last_updated":"2025-07-13T15:15:24Z","snapshot_observed_at":"2026-08-06T17:47:49.655656Z","submitted_at":"2025-07-13T15:15:24Z","title":"Sub-Scaling Laws: On the Role of Data Density and Training Strategies in LLMs","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-06T17:56:44.050082Z"},"links":{"cited_paper":"/paper/1812.06162","citing_paper":"/paper/2507.10613"},"observation_digest":"sha256:e68dcab07ce08976a481d99333084d5385cce9a7bca5f604dd2d47cfcfed58d2","observation_id":"2e1d8f12-caa2-4425-b462-18b5a3111765","resolution":{"observed_at":"2026-08-06T17:56:44.050082Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:56:44.830042Z","title":null,"venue":null,"work_id":"e37c3efe-ec31-438d-9e69-ac471b18e335","year":2024},"citing_paper":{"arxiv_id":"2507.10613","last_updated":"2025-07-13T15:15:24Z","snapshot_observed_at":"2026-08-06T17:47:49.655656Z","submitted_at":"2025-07-13T15:15:24Z","title":"Sub-Scaling Laws: On the Role of Data Density and Training Strategies in LLMs","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-06T17:56:44.055776Z"},"links":{"citing_paper":"/paper/2507.10613"},"observation_digest":"sha256:9fb27184b6ef19b473091dbd8efa3fb850728d98b332a099148b987733a8b674","observation_id":"fc82bdec-2723-483e-8705-956fcc361219","resolution":{"observed_at":"2026-08-06T17:56:44.835046Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.16264","last_updated":"2025-06-28T00:00:06Z","snapshot_observed_at":"2026-07-06T15:33:27.761070Z","submitted_at":"2023-05-25T17:18:55Z","title":"Scaling Data-Constrained Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.16264","snapshot_observed_at":"2026-08-06T17:56:44.060494Z","title":"Rush, Boaz Barak, Teven Le Scao, Aleksandra Piktus, Nouamane Tazi, Sampo Pyysalo, Thomas Wolf, and Colin Raffel","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.10613","last_updated":"2025-07-13T15:15:24Z","snapshot_observed_at":"2026-08-06T17:47:49.655656Z","submitted_at":"2025-07-13T15:15:24Z","title":"Sub-Scaling Laws: On the Role of Data Density and Training Strategies in LLMs","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-06T17:56:44.060494Z"},"links":{"cited_paper":"/paper/2305.16264","citing_paper":"/paper/2507.10613"},"observation_digest":"sha256:bd3671d7e3bb83235ce57df5784b6b811e5ac1514987e1a33b74500a28af9165","observation_id":"29d6b882-e7eb-436e-84b6-841d96bc1aeb","resolution":{"observed_at":"2026-08-06T17:56:44.060494Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.19146","last_updated":"2025-01-19T10:34:08Z","snapshot_observed_at":"2026-07-06T18:37:55.945869Z","submitted_at":"2024-06-27T13:02:43Z","title":"Resolving Discrepancies in Compute-Optimal Scaling of Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.19146","snapshot_observed_at":"2026-08-06T17:56:44.065789Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.10613","last_updated":"2025-07-13T15:15:24Z","snapshot_observed_at":"2026-08-06T17:47:49.655656Z","submitted_at":"2025-07-13T15:15:24Z","title":"Sub-Scaling Laws: On the Role of Data Density and Training Strategies in LLMs","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-06T17:56:44.065789Z"},"links":{"cited_paper":"/paper/2406.19146","citing_paper":"/paper/2507.10613"},"observation_digest":"sha256:5c63f7044e895ec49928c095a6a266ffacf7481b7af43b3524587e20086d49df","observation_id":"3655e6a8-347f-4e19-8a15-b59acbea6277","resolution":{"observed_at":"2026-08-06T17:56:44.065789Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.11446","last_updated":"2022-01-21T18:39:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-12-08T19:41:47Z","title":"Scaling Language Models: Methods, Analysis & Insights from Training Gopher","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.11446","snapshot_observed_at":"2026-08-06T17:56:44.070629Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.10613","last_updated":"2025-07-13T15:15:24Z","snapshot_observed_at":"2026-08-06T17:47:49.655656Z","submitted_at":"2025-07-13T15:15:24Z","title":"Sub-Scaling Laws: On the Role of Data Density and Training Strategies in LLMs","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-06T17:56:44.070629Z"},"links":{"cited_paper":"/paper/2112.11446","citing_paper":"/paper/2507.10613"},"observation_digest":"sha256:12f669f7a93e0763ac924846834d81e5018b56e7bdbb99f7940f39c0cf0487f6","observation_id":"5166039b-3259-4516-85b1-28f1c0383c0e","resolution":{"observed_at":"2026-08-06T17:56:44.070629Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-07-06T17:41:42.995949Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-06T17:56:44.075710Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.10613","last_updated":"2025-07-13T15:15:24Z","snapshot_observed_at":"2026-08-06T17:47:49.655656Z","submitted_at":"2025-07-13T15:15:24Z","title":"Sub-Scaling Laws: On the Role of Data Density and Training Strategies in LLMs","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-06T17:56:44.075710Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2507.10613"},"observation_digest":"sha256:ed3dea0a910d9b3b6d3be40e530f7237ca9b7a3a3a29d887dad6d0353b96af34","observation_id":"fa4531ca-52e6-4bc8-aa33-49cab38727ca","resolution":{"observed_at":"2026-08-06T17:56:44.075710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.09668","last_updated":"2024-02-15T02:27:57Z","snapshot_observed_at":"2026-08-02T17:18:00.402118Z","submitted_at":"2024-02-15T02:27:57Z","title":"How to Train Data-Efficient LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.09668","snapshot_observed_at":"2026-08-06T17:56:44.081602Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.10613","last_updated":"2025-07-13T15:15:24Z","snapshot_observed_at":"2026-08-06T17:47:49.655656Z","submitted_at":"2025-07-13T15:15:24Z","title":"Sub-Scaling Laws: On the Role of Data Density and Training Strategies in LLMs","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-06T17:56:44.081602Z"},"links":{"cited_paper":"/paper/2402.09668","citing_paper":"/paper/2507.10613"},"observation_digest":"sha256:627eefaf22937959ded0356ce13bfd4f6af1fa8c29f2a9f93b13187540df0c0f","observation_id":"6d867eea-4249-4856-8592-b3db67339c98","resolution":{"observed_at":"2026-08-06T17:56:44.081602Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.11990","last_updated":"2022-02-04T18:02:23Z","snapshot_observed_at":"2026-07-06T12:32:10.267841Z","submitted_at":"2022-01-28T08:59:57Z","title":"Using DeepSpeed and Megatron to Train Megatron-Turing NLG 530B, A Large-Scale Generative Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.11990","snapshot_observed_at":"2026-08-06T17:56:44.086979Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.10613","last_updated":"2025-07-13T15:15:24Z","snapshot_observed_at":"2026-08-06T17:47:49.655656Z","submitted_at":"2025-07-13T15:15:24Z","title":"Sub-Scaling Laws: On the Role of Data Density and Training Strategies in LLMs","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-06T17:56:44.086979Z"},"links":{"cited_paper":"/paper/2201.11990","citing_paper":"/paper/2507.10613"},"observation_digest":"sha256:e7d8b0d25117ad9d430fad9c24acfb0c59c6625e61ea48e7b65898a1f41b8b6a","observation_id":"a6a6043a-eade-40ba-ba08-eb963eda6965","resolution":{"observed_at":"2026-08-06T17:56:44.086979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:56:44.814288Z","title":null,"venue":null,"work_id":"9f82155c-33af-4c32-b615-21b6c0487696","year":2022},"citing_paper":{"arxiv_id":"2507.10613","last_updated":"2025-07-13T15:15:24Z","snapshot_observed_at":"2026-08-06T17:47:49.655656Z","submitted_at":"2025-07-13T15:15:24Z","title":"Sub-Scaling Laws: On the Role of Data Density and Training Strategies in LLMs","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-06T17:56:44.092152Z"},"links":{"citing_paper":"/paper/2507.10613"},"observation_digest":"sha256:e8614c5984a2067089d691d1512073bbdb5578a919d0328357bb4775ef79cdb4","observation_id":"816b083e-38ea-41fe-9305-bc2590379163","resolution":{"observed_at":"2026-08-06T17:56:44.818943Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-06T17:56:44.097451Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.10613","last_updated":"2025-07-13T15:15:24Z","snapshot_observed_at":"2026-08-06T17:47:49.655656Z","submitted_at":"2025-07-13T15:15:24Z","title":"Sub-Scaling Laws: On the Role of Data Density and Training Strategies in LLMs","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-06T17:56:44.097451Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2507.10613"},"observation_digest":"sha256:fa96ec285266351cbfd68210dfd6af9bc62f618de0d6decbac0849b0e0f7fea8","observation_id":"44ce0db8-2ae9-4c04-8a75-6737770e5e17","resolution":{"observed_at":"2026-08-06T17:56:44.097451Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-02T11:57:18.735747Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-06T17:56:44.103874Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.10613","last_updated":"2025-07-13T15:15:24Z","snapshot_observed_at":"2026-08-06T17:47:49.655656Z","submitted_at":"2025-07-13T15:15:24Z","title":"Sub-Scaling Laws: On the Role of Data Density and Training Strategies in LLMs","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-06T17:56:44.103874Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2507.10613"},"observation_digest":"sha256:1ad20c1c17a594eb9a056d226bf4ac8b24803b912872ddce9e41a56b54a85d96","observation_id":"dce5d44c-b8b7-4d83-a43f-0566f84a1f5f","resolution":{"observed_at":"2026-08-06T17:56:44.103874Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:56:44.799371Z","title":null,"venue":null,"work_id":"c9f37545-6674-4e06-85a8-a040a9202bcc","year":2024},"citing_paper":{"arxiv_id":"2507.10613","last_updated":"2025-07-13T15:15:24Z","snapshot_observed_at":"2026-08-06T17:47:49.655656Z","submitted_at":"2025-07-13T15:15:24Z","title":"Sub-Scaling Laws: On the Role of Data Density and Training Strategies in LLMs","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-06T17:56:44.109512Z"},"links":{"citing_paper":"/paper/2507.10613"},"observation_digest":"sha256:bb9563f394ad950b00a0011a1afcb33e350f487ee240c7b5fb72988c28c00cf8","observation_id":"e0f9fe75-eb3b-44bf-b357-643109eaecb1","resolution":{"observed_at":"2026-08-06T17:56:44.804155Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.09895","last_updated":"2024-09-13T12:28:45Z","snapshot_observed_at":"2026-08-03T13:16:42.516608Z","submitted_at":"2024-08-19T11:09:12Z","title":"Performance Law of Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.09895","snapshot_observed_at":"2026-08-06T17:56:44.114496Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.10613","last_updated":"2025-07-13T15:15:24Z","snapshot_observed_at":"2026-08-06T17:47:49.655656Z","submitted_at":"2025-07-13T15:15:24Z","title":"Sub-Scaling Laws: On the Role of Data Density and Training Strategies in LLMs","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-06T17:56:44.114496Z"},"links":{"cited_paper":"/paper/2408.09895","citing_paper":"/paper/2507.10613"},"observation_digest":"sha256:bbc5fb39033a00c807dee9a2717dd9d5af325944e5206e1e1f612f9689bd6731","observation_id":"260463cc-8b0c-4f67-927b-6258f7fa70f3","resolution":{"observed_at":"2026-08-06T17:56:44.114496Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:56:44.784793Z","title":null,"venue":null,"work_id":"bc789d5a-1439-457f-b13b-4064f619650a","year":2025},"citing_paper":{"arxiv_id":"2507.10613","last_updated":"2025-07-13T15:15:24Z","snapshot_observed_at":"2026-08-06T17:47:49.655656Z","submitted_at":"2025-07-13T15:15:24Z","title":"Sub-Scaling Laws: On the Role of Data Density and Training Strategies in LLMs","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-06T17:56:44.119354Z"},"links":{"citing_paper":"/paper/2507.10613"},"observation_digest":"sha256:04426c3a8891a71fe97d022569fa86fa8fc6c1c1082e825d949060a6c314c8f2","observation_id":"0bf44740-4cb7-4ffb-b7f7-efa1549f4af9","resolution":{"observed_at":"2026-08-06T17:56:44.789353Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:56:44.769934Z","title":null,"venue":null,"work_id":"8982f45e-29d6-4387-abb3-58a98fe7386a","year":2025},"citing_paper":{"arxiv_id":"2507.10613","last_updated":"2025-07-13T15:15:24Z","snapshot_observed_at":"2026-08-06T17:47:49.655656Z","submitted_at":"2025-07-13T15:15:24Z","title":"Sub-Scaling Laws: On the Role of Data Density and Training Strategies in LLMs","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-06T17:56:44.124160Z"},"links":{"citing_paper":"/paper/2507.10613"},"observation_digest":"sha256:d18c1b7b727d8c5bf6661cf17ca4e1f4db9cad0b412d13ca9bf65c3201023979","observation_id":"2b99ccd6-39be-4acc-850b-10ac02ff53fc","resolution":{"observed_at":"2026-08-06T17:56:44.774464Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:56:44.756053Z","title":null,"venue":null,"work_id":"86bf64a1-444e-4ee2-87ba-c8692968c68b","year":2024},"citing_paper":{"arxiv_id":"2507.10613","last_updated":"2025-07-13T15:15:24Z","snapshot_observed_at":"2026-08-06T17:47:49.655656Z","submitted_at":"2025-07-13T15:15:24Z","title":"Sub-Scaling Laws: On the Role of Data Density and Training Strategies in LLMs","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-06T17:56:44.128702Z"},"links":{"citing_paper":"/paper/2507.10613"},"observation_digest":"sha256:e549ed708675e264ec7310df0dcf3a071d829d468ff42c4604a808442ebc0e90","observation_id":"2a75cae7-1cb6-490d-9bb0-590ba3184d7e","resolution":{"observed_at":"2026-08-06T17:56:44.760480Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01204","last_updated":"2024-11-06T12:02:52Z","snapshot_observed_at":"2026-07-06T17:54:03.923842Z","submitted_at":"2024-04-01T16:00:01Z","title":"The Fine Line: Navigating Large Language Model Pretraining with Down-streaming Capability Analysis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.01204","snapshot_observed_at":"2026-08-06T17:56:44.133665Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.10613","last_updated":"2025-07-13T15:15:24Z","snapshot_observed_at":"2026-08-06T17:47:49.655656Z","submitted_at":"2025-07-13T15:15:24Z","title":"Sub-Scaling Laws: On the Role of Data Density and Training Strategies in LLMs","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-06T17:56:44.133665Z"},"links":{"cited_paper":"/paper/2404.01204","citing_paper":"/paper/2507.10613"},"observation_digest":"sha256:e97ba2400d7838088f5da2de584c3b4b0a5a357d426b9bb206fab69184871aa8","observation_id":"e25b524f-8505-45fa-a843-9645bfc4b403","resolution":{"observed_at":"2026-08-06T17:56:44.133665Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.03466","last_updated":"2022-03-28T08:12:14Z","snapshot_observed_at":"2026-08-03T21:15:21.591567Z","submitted_at":"2022-03-07T15:37:35Z","title":"Tensor Programs V: Tuning Large Neural Networks via Zero-Shot Hyperparameter Transfer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.03466","snapshot_observed_at":"2026-08-06T17:56:44.138484Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.10613","last_updated":"2025-07-13T15:15:24Z","snapshot_observed_at":"2026-08-06T17:47:49.655656Z","submitted_at":"2025-07-13T15:15:24Z","title":"Sub-Scaling Laws: On the Role of Data Density and Training Strategies in LLMs","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-06T17:56:44.138484Z"},"links":{"cited_paper":"/paper/2203.03466","citing_paper":"/paper/2507.10613"},"observation_digest":"sha256:925eff47a34f2868da130d989c343a3cd12a15f234a80d4589a36b8797e79804","observation_id":"dc378ec0-4c39-468d-b6b5-76884dd7a08f","resolution":{"observed_at":"2026-08-06T17:56:44.138484Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02244","last_updated":"2023-10-12T17:50:31Z","snapshot_observed_at":"2026-08-06T03:52:25.161270Z","submitted_at":"2023-10-03T17:50:40Z","title":"Tensor Programs VI: Feature Learning in Infinite-Depth Neural Networks","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.02244","snapshot_observed_at":"2026-08-06T17:56:44.143579Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.10613","last_updated":"2025-07-13T15:15:24Z","snapshot_observed_at":"2026-08-06T17:47:49.655656Z","submitted_at":"2025-07-13T15:15:24Z","title":"Sub-Scaling Laws: On the Role of Data Density and Training Strategies in LLMs","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-06T17:56:44.143579Z"},"links":{"cited_paper":"/paper/2310.02244","citing_paper":"/paper/2507.10613"},"observation_digest":"sha256:783a65e36155a76bcfd91eb6f1b72885d110e845ae31292041f393adf51503c5","observation_id":"107d6887-7ae2-4a9e-bec6-70f8aee2ef48","resolution":{"observed_at":"2026-08-06T17:56:44.143579Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:56:44.148164Z","title":"online\" 'onlinestring :=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.10613","last_updated":"2025-07-13T15:15:24Z","snapshot_observed_at":"2026-08-06T17:47:49.655656Z","submitted_at":"2025-07-13T15:15:24Z","title":"Sub-Scaling Laws: On the Role of Data Density and Training Strategies in LLMs","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-06T17:56:44.148164Z"},"links":{"citing_paper":"/paper/2507.10613"},"observation_digest":"sha256:908b08202cb10629f0194edcdae245986052f6fd1cb31fcf7d0aeef622a6e93a","observation_id":"bc0ac68d-6cd9-4838-ab6d-b3524fa1b973","resolution":{"observed_at":"2026-08-06T17:56:44.148164Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:56:44.153432Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.10613","last_updated":"2025-07-13T15:15:24Z","snapshot_observed_at":"2026-08-06T17:47:49.655656Z","submitted_at":"2025-07-13T15:15:24Z","title":"Sub-Scaling Laws: On the Role of Data Density and Training Strategies in LLMs","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-06T17:56:44.153432Z"},"links":{"citing_paper":"/paper/2507.10613"},"observation_digest":"sha256:ad3555d69140ad65dd1dc99d904a0b4415759739ea563bcb6ca6241b7f5f9ffe","observation_id":"8ffd23bd-c565-4894-8db8-af64d1db8ddb","resolution":{"observed_at":"2026-08-06T17:56:44.153432Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.10613","last_updated":"2025-07-13T15:15:24Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-06T17:47:49.655656Z","submitted_at":"2025-07-13T15:15:24Z","title":"Sub-Scaling Laws: On the Role of Data Density and Training Strategies in LLMs"},"reference_resolution":{"displayed":46,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":45,"verified_exact":1,"verified_fuzzy":0},"total_outbound_references":46},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 46 of 46 outbound references and 0 inbound Pith citation observations for arXiv:2507.10613."}