{"as_of":"2026-08-09T13:15:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:aee6e0c356eb48880edbe32815a0c6f51e56fb01c2c14c56746938def9503c1e","coverage":[{"denominator":17,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":17,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T12:13:47.135221Z","state":"measured"},{"denominator":17,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":17,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2606.08167/citation-record","integrity":"/paper/2606.08167/integrity","json":"/paper/2606.08167/citation-record.json","paper":"/paper/2606.08167"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2312.02406","last_updated":"2023-12-09T00:27:18Z","snapshot_observed_at":"2026-08-09T06:28:25.884378Z","submitted_at":"2023-12-05T00:42:35Z","title":"Efficient Online Data Mixing For Language Model Pre-Training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.02406","snapshot_observed_at":"2026-08-02T12:13:45.639396Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.08167","last_updated":"2026-07-30T10:53:08Z","snapshot_observed_at":"2026-08-02T23:58:03.710099Z","submitted_at":"2026-06-06T13:31:38Z","title":"Explaining Data Mixing Scaling Laws","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-02T12:13:45.639396Z"},"links":{"cited_paper":"/paper/2312.02406","citing_paper":"/paper/2606.08167"},"observation_digest":"sha256:a39732d24517cc10d2b952b4eb026f7acc0760d0d265f0c03f58ad70b3d80340","observation_id":"fcbbb887-5ef7-4809-91a6-a7d7a2c0f8ee","resolution":{"observed_at":"2026-08-02T12:13:45.639396Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.00592","last_updated":"2025-06-30T15:11:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-01T15:59:00Z","title":"Scaling and renormalization in high-dimensional regression","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.00592","snapshot_observed_at":"2026-08-02T12:13:45.832399Z","title":"A., and Pehlevan, C","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.08167","last_updated":"2026-07-30T10:53:08Z","snapshot_observed_at":"2026-08-02T23:58:03.710099Z","submitted_at":"2026-06-06T13:31:38Z","title":"Explaining Data Mixing Scaling Laws","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-02T12:13:45.832399Z"},"links":{"cited_paper":"/paper/2405.00592","citing_paper":"/paper/2606.08167"},"observation_digest":"sha256:cdc3ff68b1a3a35f343ed1b5039fbe30f6f76415b7497bb39227450baf22a5ea","observation_id":"09ffce79-d991-44c8-9efb-2990774652f5","resolution":{"observed_at":"2026-08-02T12:13:45.832399Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T12:13:47.054898Z","title":"resolves","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.08167","last_updated":"2026-07-30T10:53:08Z","snapshot_observed_at":"2026-08-02T23:58:03.710099Z","submitted_at":"2026-06-06T13:31:38Z","title":"Explaining Data Mixing Scaling Laws","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-02T12:13:47.054898Z"},"links":{"citing_paper":"/paper/2606.08167"},"observation_digest":"sha256:3632ba93803c9e7ede1929b0fce6c309891726a06cac9b6fd3a92d2d74ddd90d","observation_id":"f3263734-1a33-46ca-aba1-54de74b1e831","resolution":{"observed_at":"2026-08-02T12:13:47.054898Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2101.00027","last_updated":"2020-12-31T19:00:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-12-31T19:00:10Z","title":"The Pile: An 800GB Dataset of Diverse Text for Language Modeling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2101.00027","snapshot_observed_at":"2026-08-02T12:13:46.217059Z","title":"The pile: An 800gb dataset of diverse text for language modeling.arXiv preprint arXiv:2101.00027,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.08167","last_updated":"2026-07-30T10:53:08Z","snapshot_observed_at":"2026-08-02T23:58:03.710099Z","submitted_at":"2026-06-06T13:31:38Z","title":"Explaining Data Mixing Scaling Laws","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-02T12:13:46.217059Z"},"links":{"cited_paper":"/paper/2101.00027","citing_paper":"/paper/2606.08167"},"observation_digest":"sha256:10ed5e6437da079225fae6045913b7f51dbde31002c731125d98890dee4e6e6f","observation_id":"49e44722-980b-436e-8a84-43e4dde13cca","resolution":{"observed_at":"2026-08-02T12:13:46.217059Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T12:13:46.325756Z","title":"16 Gu, X., Lyu, K., Li, J., and Zhang, J","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.08167","last_updated":"2026-07-30T10:53:08Z","snapshot_observed_at":"2026-08-02T23:58:03.710099Z","submitted_at":"2026-06-06T13:31:38Z","title":"Explaining Data Mixing Scaling Laws","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-02T12:13:46.325756Z"},"links":{"citing_paper":"/paper/2606.08167"},"observation_digest":"sha256:65e5b017ff1d34b0941c65ac455fee1daec6e34fd9cbb92bfdd32542735ddd4c","observation_id":"fdd404a7-b023-48c0-92cd-57ff1606dc5e","resolution":{"observed_at":"2026-08-02T12:13:46.325756Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.15556","last_updated":"2022-03-29T13:38:03Z","snapshot_observed_at":"2026-07-06T12:54:11.616335Z","submitted_at":"2022-03-29T13:38:03Z","title":"Training Compute-Optimal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.15556","snapshot_observed_at":"2026-08-02T12:13:46.430129Z","title":"Hoffmann, J., Borgeaud, S., Mensch, A., Buchatskaya, E., Cai, T., Rutherford, E., Casas, D","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.08167","last_updated":"2026-07-30T10:53:08Z","snapshot_observed_at":"2026-08-02T23:58:03.710099Z","submitted_at":"2026-06-06T13:31:38Z","title":"Explaining Data Mixing Scaling Laws","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-02T12:13:46.430129Z"},"links":{"cited_paper":"/paper/2203.15556","citing_paper":"/paper/2606.08167"},"observation_digest":"sha256:17b63770471e50cef34e1f89084cb3a09348a6e0a458658d265a5032a90018f7","observation_id":"c038491c-e9bb-4a92-a804-4ae2da064e40","resolution":{"observed_at":"2026-08-02T12:13:46.430129Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-07-06T08:52:12.656082Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-08-02T12:13:46.534086Z","title":"Kaplan, J., McCandlish, S., Henighan, T., Brown, T","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2606.08167","last_updated":"2026-07-30T10:53:08Z","snapshot_observed_at":"2026-08-02T23:58:03.710099Z","submitted_at":"2026-06-06T13:31:38Z","title":"Explaining Data Mixing Scaling Laws","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-02T12:13:46.534086Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2606.08167"},"observation_digest":"sha256:b59f27f63dbaa1cbf8b4e682d3623e715ac8824842e06d999024a179fc444e5f","observation_id":"910bea3d-c6df-46a3-ba0b-392768e364a0","resolution":{"observed_at":"2026-08-02T12:13:46.534086Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.16859","last_updated":"2022-10-30T15:13:18Z","snapshot_observed_at":"2026-07-06T14:12:14.561840Z","submitted_at":"2022-10-30T15:13:18Z","title":"A Solvable Model of Neural Scaling Laws","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.16859","snapshot_observed_at":"2026-08-02T12:13:46.679613Z","title":"Maloney, A., Roberts, D","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.08167","last_updated":"2026-07-30T10:53:08Z","snapshot_observed_at":"2026-08-02T23:58:03.710099Z","submitted_at":"2026-06-06T13:31:38Z","title":"Explaining Data Mixing Scaling Laws","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-02T12:13:46.679613Z"},"links":{"cited_paper":"/paper/2210.16859","citing_paper":"/paper/2606.08167"},"observation_digest":"sha256:2445fc35ceb850ad716fda90add1d4845ff8fb56d4cdd4df004e8ada7d1650e4","observation_id":"ba1ae0eb-8755-4317-8800-e76e3826fd45","resolution":{"observed_at":"2026-08-02T12:13:46.679613Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02385","last_updated":"2024-06-04T02:05:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-04T17:54:59Z","title":"TinyLlama: An Open-Source Small Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.02385","snapshot_observed_at":"2026-08-02T12:13:46.773603Z","title":"Zhang, P., Zeng, G., Wang, T., and Lu, W","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.08167","last_updated":"2026-07-30T10:53:08Z","snapshot_observed_at":"2026-08-02T23:58:03.710099Z","submitted_at":"2026-06-06T13:31:38Z","title":"Explaining Data Mixing Scaling Laws","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-02T12:13:46.773603Z"},"links":{"cited_paper":"/paper/2401.02385","citing_paper":"/paper/2606.08167"},"observation_digest":"sha256:b19491ae342f264482cd555bd0983150dbb95bcc3e22f45c224a2431528b1a3a","observation_id":"47c1c0bc-df2c-4a5b-aa1c-ecf084336fe2","resolution":{"observed_at":"2026-08-02T12:13:46.773603Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T12:13:46.844855Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.08167","last_updated":"2026-07-30T10:53:08Z","snapshot_observed_at":"2026-08-02T23:58:03.710099Z","submitted_at":"2026-06-06T13:31:38Z","title":"Explaining Data Mixing Scaling Laws","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-02T12:13:46.844855Z"},"links":{"citing_paper":"/paper/2606.08167"},"observation_digest":"sha256:352b9c06544737de7146ae1ca2c8736df57fd0fa4e5ca989bc3bcae2890388bd","observation_id":"2d381d7c-3f0d-4913-b690-537dd31dc64c","resolution":{"observed_at":"2026-08-02T12:13:46.844855Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T12:13:46.944129Z","title":"19 C Implementation Details For the experiments in Section 5.3, we implement our pretraining pipeline using the Megatron-LM framework in Korthikanti et al","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.08167","last_updated":"2026-07-30T10:53:08Z","snapshot_observed_at":"2026-08-02T23:58:03.710099Z","submitted_at":"2026-06-06T13:31:38Z","title":"Explaining Data Mixing Scaling Laws","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-02T12:13:46.944129Z"},"links":{"citing_paper":"/paper/2606.08167"},"observation_digest":"sha256:15c8b165a925037f4eac1fa64eafc28a9221776957dbf1cb87b17855d234cb32","observation_id":"a2dea185-f88b-4f4e-8bf9-35324f01e6bb","resolution":{"observed_at":"2026-08-02T12:13:46.944129Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T12:13:47.135221Z","title":"In the following section, λk denotes the eigenvalue associated with the eigenvector uk, i.e.H uk = λkuk (but not the k-th largest eigenvalue)","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2606.08167","last_updated":"2026-07-30T10:53:08Z","snapshot_observed_at":"2026-08-02T23:58:03.710099Z","submitted_at":"2026-06-06T13:31:38Z","title":"Explaining Data Mixing Scaling Laws","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-02T12:13:47.135221Z"},"links":{"citing_paper":"/paper/2606.08167"},"observation_digest":"sha256:52a220c10b6e8f86ea1eab88456c4a96250a72914db2947307173ea227f82160","observation_id":"38b9b370-71a3-49b9-b851-46b994c117e8","resolution":{"observed_at":"2026-08-02T12:13:47.135221Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T12:13:46.118358Z","title":"URL https: //opg.optica.org/josaa/abstract.cfm?URI=josaa-4-12-2379","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.08167","last_updated":"2026-07-30T10:53:08Z","snapshot_observed_at":"2026-08-02T23:58:03.710099Z","submitted_at":"2026-06-06T13:31:38Z","title":"Explaining Data Mixing Scaling Laws","version":3},"reference_index":1987,"source":"pdf_text","source_observed_at":"2026-08-02T12:13:46.118358Z"},"links":{"citing_paper":"/paper/2606.08167"},"observation_digest":"sha256:c69de30f7db5b8ea6da826714d4fc22e91aeecb94a1f96535e73d9150f2eea0f","observation_id":"a2ee0bdf-1c77-40bb-a1e5-ab59c1fc2c85","resolution":{"observed_at":"2026-08-02T12:13:46.118358Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.05198","last_updated":"2022-05-10T22:40:17Z","snapshot_observed_at":"2026-07-06T13:08:41.837840Z","submitted_at":"2022-05-10T22:40:17Z","title":"Reducing Activation Recomputation in Large Transformer Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.05198","snapshot_observed_at":"2026-08-02T12:13:46.609563Z","title":"Li, B., Chen, F., Huang, Z., Wang, L., and Wu, L","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.08167","last_updated":"2026-07-30T10:53:08Z","snapshot_observed_at":"2026-08-02T23:58:03.710099Z","submitted_at":"2026-06-06T13:31:38Z","title":"Explaining Data Mixing Scaling Laws","version":3},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-02T12:13:46.609563Z"},"links":{"cited_paper":"/paper/2205.05198","citing_paper":"/paper/2606.08167"},"observation_digest":"sha256:b87887405160e29eba7c4383641403824e53571511c52dfff2854dcc65f8a945","observation_id":"8d91bf9b-23e5-4d5a-98c0-f507144fa1b9","resolution":{"observed_at":"2026-08-02T12:13:46.609563Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15936","last_updated":"2023-11-06T00:36:24Z","snapshot_observed_at":"2026-07-06T16:00:08.643627Z","submitted_at":"2023-07-29T09:22:54Z","title":"A Theory for Emergence of Complex Skills in Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15936","snapshot_observed_at":"2026-08-02T12:13:45.730668Z","title":"and Goyal, A","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.08167","last_updated":"2026-07-30T10:53:08Z","snapshot_observed_at":"2026-08-02T23:58:03.710099Z","submitted_at":"2026-06-06T13:31:38Z","title":"Explaining Data Mixing Scaling Laws","version":3},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-02T12:13:45.730668Z"},"links":{"cited_paper":"/paper/2307.15936","citing_paper":"/paper/2606.08167"},"observation_digest":"sha256:d6dcee6c1a03e9b0f78db0c1d846ebebb6a8b6ef67d1ce74795adf0ac9404a93","observation_id":"706d1383-1cde-42e0-adce-325d4586ea3b","resolution":{"observed_at":"2026-08-02T12:13:45.730668Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T12:13:45.966591Z","title":"URL https://www.pnas.org/doi/abs/10.1073/pnas.2311878121","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.08167","last_updated":"2026-07-30T10:53:08Z","snapshot_observed_at":"2026-08-02T23:58:03.710099Z","submitted_at":"2026-06-06T13:31:38Z","title":"Explaining Data Mixing Scaling Laws","version":3},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-02T12:13:45.966591Z"},"links":{"citing_paper":"/paper/2606.08167"},"observation_digest":"sha256:7234fb0438192070b7e77c83e0bdfa53f48491adfe4d4656c1532deba58510f9","observation_id":"ea670dc4-bd2b-448d-bcb1-ebed50e7255b","resolution":{"observed_at":"2026-08-02T12:13:45.966591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T12:13:46.040154Z","title":"Brown, T., Mann, B., Ryder, N., Subbiah, M., Kaplan, J","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2606.08167","last_updated":"2026-07-30T10:53:08Z","snapshot_observed_at":"2026-08-02T23:58:03.710099Z","submitted_at":"2026-06-06T13:31:38Z","title":"Explaining Data Mixing Scaling Laws","version":3},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-02T12:13:46.040154Z"},"links":{"citing_paper":"/paper/2606.08167"},"observation_digest":"sha256:1c8a1f848506f188bada00802474ee91bdd3038937f6526deddccd003257a204","observation_id":"e35bec1f-4782-469f-b2c8-09b31e5c51e3","resolution":{"observed_at":"2026-08-02T12:13:46.040154Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2606.08167","last_updated":"2026-07-30T10:53:08Z","latest_version":3,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-02T23:58:03.710099Z","submitted_at":"2026-06-06T13:31:38Z","title":"Explaining Data Mixing Scaling Laws"},"reference_resolution":{"displayed":17,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":16,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":17},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 17 of 17 outbound references and 0 inbound Pith citation observations for arXiv:2606.08167."}