{"as_of":"2026-08-10T07:38:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e677c7a502b1e86ed1a7a2ce291422774009b2ce54e7c16b1c89b968a169b111","coverage":[{"denominator":41,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":41,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T05:43:18.024397Z","state":"measured"},{"denominator":41,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":41,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2508.01326/citation-record","integrity":"/paper/2508.01326/integrity","json":"/paper/2508.01326/citation-record.json","paper":"/paper/2508.01326"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:43:18.619524Z","title":", \" * write output.state after.block = add.period write newline","venue":null,"work_id":"c936f407-2e7f-4a32-8adf-3dda9417b9d1","year":null},"citing_paper":{"arxiv_id":"2508.01326","last_updated":"2025-08-02T11:37:16Z","snapshot_observed_at":"2026-08-09T13:11:08.815889Z","submitted_at":"2025-08-02T11:37:16Z","title":"Large-Scale Diverse Synthesis for Mid-Training","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-06T05:43:17.360158Z"},"links":{"citing_paper":"/paper/2508.01326"},"observation_digest":"sha256:23e8dcb37936ec8fea6313fd0b2272e002417e14474640659de57eb4526c85e0","observation_id":"79f74fa5-0bab-43ff-89a0-0a7ae353169f","resolution":{"observed_at":"2026-08-06T05:43:18.624163Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:43:17.422442Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.01326","last_updated":"2025-08-02T11:37:16Z","snapshot_observed_at":"2026-08-09T13:11:08.815889Z","submitted_at":"2025-08-02T11:37:16Z","title":"Large-Scale Diverse Synthesis for Mid-Training","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-06T05:43:17.422442Z"},"links":{"citing_paper":"/paper/2508.01326"},"observation_digest":"sha256:16f635ba4352d0ae05992c47e759db20e055e7acb238b125e53cd711af7cd73f","observation_id":"238770c2-8263-473a-8bba-c26e5679cf65","resolution":{"observed_at":"2026-08-06T05:43:17.422442Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:43:18.596128Z","title":"N.; Prabhumoye, S.; Kamalu, J.; Satheesh, S.; Nyberg, E.; Patwary, M.; Shoeybi, M.; and Catanzaro, B","venue":null,"work_id":"89397f95-865f-4fd8-ad84-d28f27c4a869","year":2025},"citing_paper":{"arxiv_id":"2508.01326","last_updated":"2025-08-02T11:37:16Z","snapshot_observed_at":"2026-08-09T13:11:08.815889Z","submitted_at":"2025-08-02T11:37:16Z","title":"Large-Scale Diverse Synthesis for Mid-Training","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-06T05:43:17.501050Z"},"links":{"citing_paper":"/paper/2508.01326"},"observation_digest":"sha256:9b8c12a077be346f88d3e711bbdbb4f6fb270f7ddb4fcc4164856be9341c2437","observation_id":"9e5bab42-a23e-44bf-944f-50ce343cc649","resolution":{"observed_at":"2026-08-06T05:43:18.600903Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:43:18.582474Z","title":null,"venue":null,"work_id":"ff2afd34-e353-4f58-a8cc-ec02cba294e1","year":2019},"citing_paper":{"arxiv_id":"2508.01326","last_updated":"2025-08-02T11:37:16Z","snapshot_observed_at":"2026-08-09T13:11:08.815889Z","submitted_at":"2025-08-02T11:37:16Z","title":"Large-Scale Diverse Synthesis for Mid-Training","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-06T05:43:17.579043Z"},"links":{"citing_paper":"/paper/2508.01326"},"observation_digest":"sha256:ecfe89ec82abbcceac233bc28b37db0486f257ec1462e12e7ca55ef48b65b247","observation_id":"29e46cb3-a30b-4891-9524-db88a30b211b","resolution":{"observed_at":"2026-08-06T05:43:18.586528Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03398","last_updated":"2024-12-04T15:27:39Z","snapshot_observed_at":"2026-08-09T08:21:20.931137Z","submitted_at":"2024-12-04T15:27:39Z","title":"RedStone: Curating General, Code, Math, and QA Data for Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03398","snapshot_observed_at":"2026-08-06T05:43:17.640566Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.01326","last_updated":"2025-08-02T11:37:16Z","snapshot_observed_at":"2026-08-09T13:11:08.815889Z","submitted_at":"2025-08-02T11:37:16Z","title":"Large-Scale Diverse Synthesis for Mid-Training","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-06T05:43:17.640566Z"},"links":{"cited_paper":"/paper/2412.03398","citing_paper":"/paper/2508.01326"},"observation_digest":"sha256:8f613f2c9927adb0ee1a609d4ec28344ba5b8a51e8ba004f2a5e5b170ca78ed1","observation_id":"8d97e217-668a-438d-a088-235ffe50bccf","resolution":{"observed_at":"2026-08-06T05:43:17.640566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:43:18.569127Z","title":null,"venue":null,"work_id":"1f7d56a3-e758-4cb9-8c34-6c6e6ab2095c","year":2025},"citing_paper":{"arxiv_id":"2508.01326","last_updated":"2025-08-02T11:37:16Z","snapshot_observed_at":"2026-08-09T13:11:08.815889Z","submitted_at":"2025-08-02T11:37:16Z","title":"Large-Scale Diverse Synthesis for Mid-Training","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-06T05:43:17.718476Z"},"links":{"citing_paper":"/paper/2508.01326"},"observation_digest":"sha256:a8f5ae5110d54fd9179f66df3b9e5207e770af0709fa3fbca5a7885cd5898724","observation_id":"2a0e962a-676b-4797-9264-0dcfbf07fd6e","resolution":{"observed_at":"2026-08-06T05:43:18.573193Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:43:18.553998Z","title":null,"venue":null,"work_id":"c0fdff0b-5324-423c-9331-f2cee944d7e5","year":2024},"citing_paper":{"arxiv_id":"2508.01326","last_updated":"2025-08-02T11:37:16Z","snapshot_observed_at":"2026-08-09T13:11:08.815889Z","submitted_at":"2025-08-02T11:37:16Z","title":"Large-Scale Diverse Synthesis for Mid-Training","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-06T05:43:17.772858Z"},"links":{"citing_paper":"/paper/2508.01326"},"observation_digest":"sha256:be7a6e15d162721a7d471cf9344559acc185c9884265ddeddd746397c5ac1c93","observation_id":"2f91434f-8a57-4d9c-83fd-41f878210c2b","resolution":{"observed_at":"2026-08-06T05:43:18.559055Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1803.05457","last_updated":"2018-03-14T18:04:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2018-03-14T18:04:21Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.05457","snapshot_observed_at":"2026-08-06T05:43:17.823503Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2508.01326","last_updated":"2025-08-02T11:37:16Z","snapshot_observed_at":"2026-08-09T13:11:08.815889Z","submitted_at":"2025-08-02T11:37:16Z","title":"Large-Scale Diverse Synthesis for Mid-Training","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-06T05:43:17.823503Z"},"links":{"cited_paper":"/paper/1803.05457","citing_paper":"/paper/2508.01326"},"observation_digest":"sha256:d8ff4e2c7c74fb32a9a06708b636f89d6e65d7252c84b5358be50d205e4a4fc6","observation_id":"d7b96382-4e1a-441c-aa44-526c7f023338","resolution":{"observed_at":"2026-08-06T05:43:17.823503Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-07T01:45:38.840969Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-06T05:43:17.888607Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.01326","last_updated":"2025-08-02T11:37:16Z","snapshot_observed_at":"2026-08-09T13:11:08.815889Z","submitted_at":"2025-08-02T11:37:16Z","title":"Large-Scale Diverse Synthesis for Mid-Training","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-06T05:43:17.888607Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2508.01326"},"observation_digest":"sha256:bbb7046037d4235694570ef5a4f744aebbf5552856704c08b8fb115c876e2a1f","observation_id":"2eb8152f-108e-4392-a0dc-b5be12bc7bca","resolution":{"observed_at":"2026-08-06T05:43:17.888607Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-06T05:43:17.893589Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.01326","last_updated":"2025-08-02T11:37:16Z","snapshot_observed_at":"2026-08-09T13:11:08.815889Z","submitted_at":"2025-08-02T11:37:16Z","title":"Large-Scale Diverse Synthesis for Mid-Training","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-06T05:43:17.893589Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2508.01326"},"observation_digest":"sha256:1e7b1591c44291f0e3b4932d09725029ef3dcf2985fed956e4876d42211ed72f","observation_id":"94130791-ad55-4b46-8fc3-11f79e64938c","resolution":{"observed_at":"2026-08-06T05:43:17.893589Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-06T05:43:17.898223Z","title":"L.; Liang, J.; Guo, J.; Ni, J.; Li, J.; Wang, J.; Chen, J","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.01326","last_updated":"2025-08-02T11:37:16Z","snapshot_observed_at":"2026-08-09T13:11:08.815889Z","submitted_at":"2025-08-02T11:37:16Z","title":"Large-Scale Diverse Synthesis for Mid-Training","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-06T05:43:17.898223Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2508.01326"},"observation_digest":"sha256:9e12aebac262f80591cf7c1e0ba08e69901d133a8aa2ae90843fe82aa4c91369","observation_id":"798ad934-d7c9-4064-9149-9b34d17a4d4a","resolution":{"observed_at":"2026-08-06T05:43:17.898223Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:43:18.539523Z","title":null,"venue":null,"work_id":"5cc73e8b-2ed4-4329-920e-9a40060acf65","year":2024},"citing_paper":{"arxiv_id":"2508.01326","last_updated":"2025-08-02T11:37:16Z","snapshot_observed_at":"2026-08-09T13:11:08.815889Z","submitted_at":"2025-08-02T11:37:16Z","title":"Large-Scale Diverse Synthesis for Mid-Training","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-06T05:43:17.902561Z"},"links":{"citing_paper":"/paper/2508.01326"},"observation_digest":"sha256:0b9535869a978e09676ade0d0c0eac60fa3019689262286f7cac150bec9f3b0e","observation_id":"b88cce04-2a42-44bf-bdce-c69ae18453a2","resolution":{"observed_at":"2026-08-06T05:43:18.543618Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:43:18.526052Z","title":null,"venue":null,"work_id":"0e448b1e-5b04-4be5-9afb-25fbb21df007","year":2019},"citing_paper":{"arxiv_id":"2508.01326","last_updated":"2025-08-02T11:37:16Z","snapshot_observed_at":"2026-08-09T13:11:08.815889Z","submitted_at":"2025-08-02T11:37:16Z","title":"Large-Scale Diverse Synthesis for Mid-Training","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-06T05:43:17.906588Z"},"links":{"citing_paper":"/paper/2508.01326"},"observation_digest":"sha256:6b73e1a9fd7ab14d566413385f39a389573aaadcd228d450c042fb3c4a947cfc","observation_id":"3954e2c4-4191-4b82-b739-10bedbcb7dd1","resolution":{"observed_at":"2026-08-06T05:43:18.530087Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-06T05:43:17.910572Z","title":"C.; Nikolaidis, C.; Allonsius, D.; Song, D.; Pintz, D","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.01326","last_updated":"2025-08-02T11:37:16Z","snapshot_observed_at":"2026-08-09T13:11:08.815889Z","submitted_at":"2025-08-02T11:37:16Z","title":"Large-Scale Diverse Synthesis for Mid-Training","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-06T05:43:17.910572Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2508.01326"},"observation_digest":"sha256:588af1450fbcb4c07f48d28df38e5b7ac29d79129ec26aec13c346ad23f61e3b","observation_id":"4b4f2355-7925-436a-9b2f-f3a8c24f7e6c","resolution":{"observed_at":"2026-08-06T05:43:17.910572Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2101.00027","last_updated":"2020-12-31T19:00:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-12-31T19:00:10Z","title":"The Pile: An 800GB Dataset of Diverse Text for Language Modeling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2101.00027","snapshot_observed_at":"2026-08-06T05:43:17.914725Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.01326","last_updated":"2025-08-02T11:37:16Z","snapshot_observed_at":"2026-08-09T13:11:08.815889Z","submitted_at":"2025-08-02T11:37:16Z","title":"Large-Scale Diverse Synthesis for Mid-Training","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-06T05:43:17.914725Z"},"links":{"cited_paper":"/paper/2101.00027","citing_paper":"/paper/2508.01326"},"observation_digest":"sha256:fd2d420286cc67588d88ee55fed9881c1356b716049add07e315bff50437d9c6","observation_id":"f511d552-bd24-4782-9a4a-b08555bb82c5","resolution":{"observed_at":"2026-08-06T05:43:17.914725Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:43:18.512342Z","title":null,"venue":null,"work_id":"6c7b7eec-b448-4437-a39d-1c408fc99c22","year":2021},"citing_paper":{"arxiv_id":"2508.01326","last_updated":"2025-08-02T11:37:16Z","snapshot_observed_at":"2026-08-09T13:11:08.815889Z","submitted_at":"2025-08-02T11:37:16Z","title":"Large-Scale Diverse Synthesis for Mid-Training","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-06T05:43:17.918721Z"},"links":{"citing_paper":"/paper/2508.01326"},"observation_digest":"sha256:ac32d8e806e014940100f09d8bedf4aac6b8c0d5c16179c9988f2ab3bfd6b7fb","observation_id":"d00723b9-be49-4940-8242-d058bb237439","resolution":{"observed_at":"2026-08-06T05:43:18.516510Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.20094","last_updated":"2025-05-08T00:24:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-28T17:59:01Z","title":"Scaling Synthetic Data Creation with 1,000,000,000 Personas","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.20094","snapshot_observed_at":"2026-08-06T05:43:17.922492Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.01326","last_updated":"2025-08-02T11:37:16Z","snapshot_observed_at":"2026-08-09T13:11:08.815889Z","submitted_at":"2025-08-02T11:37:16Z","title":"Large-Scale Diverse Synthesis for Mid-Training","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-06T05:43:17.922492Z"},"links":{"cited_paper":"/paper/2406.20094","citing_paper":"/paper/2508.01326"},"observation_digest":"sha256:934f6213583e3f607ca358fbff735a865f9ca76bbce789c2d50be6473e091969","observation_id":"575892e0-359d-40dd-b333-bcc903e1e1d8","resolution":{"observed_at":"2026-08-06T05:43:17.922492Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:43:18.498688Z","title":null,"venue":null,"work_id":"fd5a325f-79c3-459c-a7ce-0dcba351212c","year":2024},"citing_paper":{"arxiv_id":"2508.01326","last_updated":"2025-08-02T11:37:16Z","snapshot_observed_at":"2026-08-09T13:11:08.815889Z","submitted_at":"2025-08-02T11:37:16Z","title":"Large-Scale Diverse Synthesis for Mid-Training","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-06T05:43:17.926507Z"},"links":{"citing_paper":"/paper/2508.01326"},"observation_digest":"sha256:7065e0bbfe6d0ae3b6ae18f4651af3cdf7c7ef89efb177f7316b2a6d0400bea2","observation_id":"7828b917-7e2f-4526-a1ee-06409f66c56c","resolution":{"observed_at":"2026-08-06T05:43:18.502761Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:43:18.484953Z","title":null,"venue":null,"work_id":"74b08275-54e0-4e76-9c24-867119bcbe60","year":2021},"citing_paper":{"arxiv_id":"2508.01326","last_updated":"2025-08-02T11:37:16Z","snapshot_observed_at":"2026-08-09T13:11:08.815889Z","submitted_at":"2025-08-02T11:37:16Z","title":"Large-Scale Diverse Synthesis for Mid-Training","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-06T05:43:17.930979Z"},"links":{"citing_paper":"/paper/2508.01326"},"observation_digest":"sha256:e810a3abada724aed95cac59e7e574d01d4187c87ef2acf9361f509e7859028b","observation_id":"882d6aa5-b514-4ff6-916e-25259a582ed1","resolution":{"observed_at":"2026-08-06T05:43:18.489195Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:43:17.935176Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.01326","last_updated":"2025-08-02T11:37:16Z","snapshot_observed_at":"2026-08-09T13:11:08.815889Z","submitted_at":"2025-08-02T11:37:16Z","title":"Large-Scale Diverse Synthesis for Mid-Training","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-06T05:43:17.935176Z"},"links":{"citing_paper":"/paper/2508.01326"},"observation_digest":"sha256:5b9437c8dbfa2f54a95be3aa63cfbdab93d5778635a91b645bf97f0b60902d25","observation_id":"9bd46dfb-6d4d-4465-a2cc-448b5e8ec37a","resolution":{"observed_at":"2026-08-06T05:43:17.935176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:43:18.462422Z","title":null,"venue":null,"work_id":"c97668cb-3737-474d-a4d9-707f900b4a8c","year":2023},"citing_paper":{"arxiv_id":"2508.01326","last_updated":"2025-08-02T11:37:16Z","snapshot_observed_at":"2026-08-09T13:11:08.815889Z","submitted_at":"2025-08-02T11:37:16Z","title":"Large-Scale Diverse Synthesis for Mid-Training","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-06T05:43:17.939262Z"},"links":{"citing_paper":"/paper/2508.01326"},"observation_digest":"sha256:d8c301b62ec92f785cd9e731d91412f22507c13c1191a11e6e7de9b594ab5a64","observation_id":"5d03ad7b-ffcd-471e-bb32-83a0a7d0b5ba","resolution":{"observed_at":"2026-08-06T05:43:18.466401Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:43:18.449161Z","title":null,"venue":null,"work_id":"5ca9f40a-b51f-4dcc-ac24-37ca24566e2a","year":2025},"citing_paper":{"arxiv_id":"2508.01326","last_updated":"2025-08-02T11:37:16Z","snapshot_observed_at":"2026-08-09T13:11:08.815889Z","submitted_at":"2025-08-02T11:37:16Z","title":"Large-Scale Diverse Synthesis for Mid-Training","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-06T05:43:17.943464Z"},"links":{"citing_paper":"/paper/2508.01326"},"observation_digest":"sha256:1b015af9e69d7ecc6d07d932dac9d7e68aff3e8960c812fc6da5baba4523ee58","observation_id":"bf66800d-414c-4af9-84df-1344cc3aa1a7","resolution":{"observed_at":"2026-08-06T05:43:18.453309Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:43:18.435650Z","title":null,"venue":null,"work_id":"cc001c7e-20ae-4631-9b07-79af70ee461d","year":2024},"citing_paper":{"arxiv_id":"2508.01326","last_updated":"2025-08-02T11:37:16Z","snapshot_observed_at":"2026-08-09T13:11:08.815889Z","submitted_at":"2025-08-02T11:37:16Z","title":"Large-Scale Diverse Synthesis for Mid-Training","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-06T05:43:17.948408Z"},"links":{"citing_paper":"/paper/2508.01326"},"observation_digest":"sha256:ec992054ff1f1e14d0dcbadf109d27bbd64dc2fa61ca230e9e85b3bbd8f06a8b","observation_id":"d51bbd73-88a5-4dfb-a563-9ffe0b73e5ce","resolution":{"observed_at":"2026-08-06T05:43:18.439581Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1607.06275","last_updated":"2016-09-01T10:56:45Z","snapshot_observed_at":"2026-07-06T05:04:25.691401Z","submitted_at":"2016-07-21T11:40:50Z","title":"Dataset and Neural Recurrent Sequence Labeling Model for Open-Domain Factoid Question Answering","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1607.06275","snapshot_observed_at":"2026-08-06T05:43:17.952226Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2508.01326","last_updated":"2025-08-02T11:37:16Z","snapshot_observed_at":"2026-08-09T13:11:08.815889Z","submitted_at":"2025-08-02T11:37:16Z","title":"Large-Scale Diverse Synthesis for Mid-Training","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-06T05:43:17.952226Z"},"links":{"cited_paper":"/paper/1607.06275","citing_paper":"/paper/2508.01326"},"observation_digest":"sha256:ce6befcd58adb791f621603c55dd8c81ea56c68451fabb468b4abd4a93184ce7","observation_id":"eac285e1-0e6a-4f85-b88a-864c4d52ffd5","resolution":{"observed_at":"2026-08-06T05:43:17.952226Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:43:18.422095Z","title":null,"venue":null,"work_id":"c388aa4c-e986-44ad-b216-782453ff883b","year":2024},"citing_paper":{"arxiv_id":"2508.01326","last_updated":"2025-08-02T11:37:16Z","snapshot_observed_at":"2026-08-09T13:11:08.815889Z","submitted_at":"2025-08-02T11:37:16Z","title":"Large-Scale Diverse Synthesis for Mid-Training","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-06T05:43:17.956526Z"},"links":{"citing_paper":"/paper/2508.01326"},"observation_digest":"sha256:0f3137d5079d282c1afddf8b41dcf416e23bbc1fcda8c381d44b342ca905f160","observation_id":"9bd068ed-e8d0-4e4d-a3a4-0dcafb48e84c","resolution":{"observed_at":"2026-08-06T05:43:18.426274Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:43:18.408477Z","title":null,"venue":null,"work_id":"f549fee2-9fa1-475e-9596-055d4d9271ce","year":2021},"citing_paper":{"arxiv_id":"2508.01326","last_updated":"2025-08-02T11:37:16Z","snapshot_observed_at":"2026-08-09T13:11:08.815889Z","submitted_at":"2025-08-02T11:37:16Z","title":"Large-Scale Diverse Synthesis for Mid-Training","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-06T05:43:17.960436Z"},"links":{"citing_paper":"/paper/2508.01326"},"observation_digest":"sha256:1088e699e40f286ff22cfa95f2c5b602e26afb99c14537d8e8c603d55352a1b5","observation_id":"3bfe9d6a-1785-4ad3-b534-3ecadf902b39","resolution":{"observed_at":"2026-08-06T05:43:18.412569Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00656","last_updated":"2025-10-08T07:50:45Z","snapshot_observed_at":"2026-08-08T06:58:44.493777Z","submitted_at":"2024-12-31T21:55:10Z","title":"2 OLMo 2 Furious","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.00656","snapshot_observed_at":"2026-08-06T05:43:17.964372Z","title":"W.; Liu, J.; Malik, S.; Merrill, W.; Miranda, L","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.01326","last_updated":"2025-08-02T11:37:16Z","snapshot_observed_at":"2026-08-09T13:11:08.815889Z","submitted_at":"2025-08-02T11:37:16Z","title":"Large-Scale Diverse Synthesis for Mid-Training","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-06T05:43:17.964372Z"},"links":{"cited_paper":"/paper/2501.00656","citing_paper":"/paper/2508.01326"},"observation_digest":"sha256:f6c5d1dd10e14cb9c6c7bd9cde61e5bfb33e70af37d3b2805e55e5b9a4236257","observation_id":"a28123b8-e427-4432-b22d-cd957093d1eb","resolution":{"observed_at":"2026-08-06T05:43:17.964372Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07263","last_updated":"2024-07-09T22:37:59Z","snapshot_observed_at":"2026-08-07T09:28:48.845112Z","submitted_at":"2024-07-09T22:37:59Z","title":"Reuse, Don't Retrain: A Recipe for Continued Pretraining of Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07263","snapshot_observed_at":"2026-08-06T05:43:17.970063Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.01326","last_updated":"2025-08-02T11:37:16Z","snapshot_observed_at":"2026-08-09T13:11:08.815889Z","submitted_at":"2025-08-02T11:37:16Z","title":"Large-Scale Diverse Synthesis for Mid-Training","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-06T05:43:17.970063Z"},"links":{"cited_paper":"/paper/2407.07263","citing_paper":"/paper/2508.01326"},"observation_digest":"sha256:dcc31b16b0dcbfe5baae7d34d9e358615ced2616326bcd2a6d0b3ed7065f3ada","observation_id":"1d71aaed-b70c-4a6c-aaeb-70cc9479450e","resolution":{"observed_at":"2026-08-06T05:43:17.970063Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:43:18.393562Z","title":"B.; Lozhkov, A.; Mitchell, M.; Raffel, C.; Werra, L","venue":null,"work_id":"fbaa670b-1f3a-4f69-87ad-ce892b3c23b4","year":2024},"citing_paper":{"arxiv_id":"2508.01326","last_updated":"2025-08-02T11:37:16Z","snapshot_observed_at":"2026-08-09T13:11:08.815889Z","submitted_at":"2025-08-02T11:37:16Z","title":"Large-Scale Diverse Synthesis for Mid-Training","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-06T05:43:17.974303Z"},"links":{"citing_paper":"/paper/2508.01326"},"observation_digest":"sha256:fe24e3f8419e64aa201997ae739fbfc799c8955c0660e6f749e4939f9fa38b51","observation_id":"e4b6e2b6-38f2-47de-8da8-0f683a3a5134","resolution":{"observed_at":"2026-08-06T05:43:18.398730Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-06T05:43:17.978339Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.01326","last_updated":"2025-08-02T11:37:16Z","snapshot_observed_at":"2026-08-09T13:11:08.815889Z","submitted_at":"2025-08-02T11:37:16Z","title":"Large-Scale Diverse Synthesis for Mid-Training","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-06T05:43:17.978339Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2508.01326"},"observation_digest":"sha256:6b380314bf74a4c62aad6c13ed2b4084d5b35192a3de512934de81ecbed5f5de","observation_id":"720d3af0-3d1e-44c5-ab21-cbe5cbceb286","resolution":{"observed_at":"2026-08-06T05:43:17.978339Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:43:18.380161Z","title":"L.; Bhagavatula, C.; and Choi, Y","venue":null,"work_id":"d71f0172-f55a-4bca-93e6-f63caa7a798c","year":2021},"citing_paper":{"arxiv_id":"2508.01326","last_updated":"2025-08-02T11:37:16Z","snapshot_observed_at":"2026-08-09T13:11:08.815889Z","submitted_at":"2025-08-02T11:37:16Z","title":"Large-Scale Diverse Synthesis for Mid-Training","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-06T05:43:17.982796Z"},"links":{"citing_paper":"/paper/2508.01326"},"observation_digest":"sha256:f8e304a911d9cbe86ed6724ee22cbd52e4b5f62397b58c75f0d4a339a10abf9c","observation_id":"a9ac494f-86dc-4e8a-a95b-453d4b15543d","resolution":{"observed_at":"2026-08-06T05:43:18.384264Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-06T05:43:17.986876Z","title":"K.; Wu, Y.; and Guo, D","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.01326","last_updated":"2025-08-02T11:37:16Z","snapshot_observed_at":"2026-08-09T13:11:08.815889Z","submitted_at":"2025-08-02T11:37:16Z","title":"Large-Scale Diverse Synthesis for Mid-Training","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-06T05:43:17.986876Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2508.01326"},"observation_digest":"sha256:3409eeb2fb7a375c20516d38cfd802daf2c5b192e9a20a07f176e21e202cf364","observation_id":"013bde94-6e2a-44fc-b76e-ac1784dccc79","resolution":{"observed_at":"2026-08-06T05:43:17.986876Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:43:18.363890Z","title":null,"venue":null,"work_id":"1f9f2664-1e74-4243-a9e6-4a572d0508b1","year":2025},"citing_paper":{"arxiv_id":"2508.01326","last_updated":"2025-08-02T11:37:16Z","snapshot_observed_at":"2026-08-09T13:11:08.815889Z","submitted_at":"2025-08-02T11:37:16Z","title":"Large-Scale Diverse Synthesis for Mid-Training","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-06T05:43:17.991070Z"},"links":{"citing_paper":"/paper/2508.01326"},"observation_digest":"sha256:d9f961e9accb74782057227c54a639f9d91db82a40a65d3d0ff6e7ae69c7a008","observation_id":"f81ddd4f-f546-4d01-a1af-0bbfc0ea46af","resolution":{"observed_at":"2026-08-06T05:43:18.368512Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:43:18.349365Z","title":"W.; Chowdhery, A.; Le, Q.; Chi, E.; Zhou, D.; and Wei, J","venue":null,"work_id":"68ccbf90-5c8a-4eb6-8260-356c72cf194f","year":2023},"citing_paper":{"arxiv_id":"2508.01326","last_updated":"2025-08-02T11:37:16Z","snapshot_observed_at":"2026-08-09T13:11:08.815889Z","submitted_at":"2025-08-02T11:37:16Z","title":"Large-Scale Diverse Synthesis for Mid-Training","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-06T05:43:17.995256Z"},"links":{"citing_paper":"/paper/2508.01326"},"observation_digest":"sha256:fed813cef84a0548eb97f286c3207abfa7efc0d0c71bc5021efe4e82fa88dba6","observation_id":"ce633c39-22b8-4fb6-af8e-6e92ac03464a","resolution":{"observed_at":"2026-08-06T05:43:18.353426Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:43:18.335846Z","title":null,"venue":null,"work_id":"b562b5fc-7117-44dd-aad8-1b1e7cb9816b","year":2024},"citing_paper":{"arxiv_id":"2508.01326","last_updated":"2025-08-02T11:37:16Z","snapshot_observed_at":"2026-08-09T13:11:08.815889Z","submitted_at":"2025-08-02T11:37:16Z","title":"Large-Scale Diverse Synthesis for Mid-Training","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-06T05:43:17.999298Z"},"links":{"citing_paper":"/paper/2508.01326"},"observation_digest":"sha256:f0575bce93640003a8fa0c2630c18b48fc215993392d6bf9337d615b5ded7043","observation_id":"3a423114-7fff-40da-b277-1841b106b7a9","resolution":{"observed_at":"2026-08-06T05:43:18.340107Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.20512","last_updated":"2025-06-25T14:58:13Z","snapshot_observed_at":"2026-08-09T13:10:58.433740Z","submitted_at":"2025-06-25T14:58:13Z","title":"OctoThinker: Mid-training Incentivizes Reinforcement Learning Scaling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.20512","snapshot_observed_at":"2026-08-06T05:43:18.003368Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.01326","last_updated":"2025-08-02T11:37:16Z","snapshot_observed_at":"2026-08-09T13:11:08.815889Z","submitted_at":"2025-08-02T11:37:16Z","title":"Large-Scale Diverse Synthesis for Mid-Training","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-06T05:43:18.003368Z"},"links":{"cited_paper":"/paper/2506.20512","citing_paper":"/paper/2508.01326"},"observation_digest":"sha256:05573caf83d73494e9633c9008800e053d261b8f4a1bcb82c5ea2a1df390a858","observation_id":"b8317bc3-54de-4590-a75c-37df5c60a5d1","resolution":{"observed_at":"2026-08-06T05:43:18.003368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:43:18.322948Z","title":null,"venue":null,"work_id":"19e66d43-465a-4b1e-adeb-782e8367296b","year":2024},"citing_paper":{"arxiv_id":"2508.01326","last_updated":"2025-08-02T11:37:16Z","snapshot_observed_at":"2026-08-09T13:11:08.815889Z","submitted_at":"2025-08-02T11:37:16Z","title":"Large-Scale Diverse Synthesis for Mid-Training","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-06T05:43:18.007512Z"},"links":{"citing_paper":"/paper/2508.01326"},"observation_digest":"sha256:7da981d6e8b70f21612a9f9f2c73a4b669f4792c3337d5d47b3180ac028ee6d8","observation_id":"4c50b4ce-6913-49bb-bd78-272b1bea094a","resolution":{"observed_at":"2026-08-06T05:43:18.326735Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:43:18.309912Z","title":null,"venue":null,"work_id":"2279da19-e9f6-493f-8618-f6faa5d5d423","year":2019},"citing_paper":{"arxiv_id":"2508.01326","last_updated":"2025-08-02T11:37:16Z","snapshot_observed_at":"2026-08-09T13:11:08.815889Z","submitted_at":"2025-08-02T11:37:16Z","title":"Large-Scale Diverse Synthesis for Mid-Training","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-06T05:43:18.011444Z"},"links":{"citing_paper":"/paper/2508.01326"},"observation_digest":"sha256:fb54fa824abbab7c97cb50d2e49e7b6e3b1199432ff676523475267b4b591e7f","observation_id":"425bb079-e8d5-4c07-9ed9-92cf4d07d082","resolution":{"observed_at":"2026-08-06T05:43:18.313760Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.19327","last_updated":"2024-07-10T16:55:47Z","snapshot_observed_at":"2026-08-06T06:05:02.911714Z","submitted_at":"2024-05-29T17:57:16Z","title":"MAP-Neo: Highly Capable and Transparent Bilingual Large Language Model Series","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.19327","snapshot_observed_at":"2026-08-06T05:43:18.015462Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.01326","last_updated":"2025-08-02T11:37:16Z","snapshot_observed_at":"2026-08-09T13:11:08.815889Z","submitted_at":"2025-08-02T11:37:16Z","title":"Large-Scale Diverse Synthesis for Mid-Training","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-06T05:43:18.015462Z"},"links":{"cited_paper":"/paper/2405.19327","citing_paper":"/paper/2508.01326"},"observation_digest":"sha256:9b194af155564f24a957c65330f12f8f3200c508c3dc7cf4703108a6a0486b1a","observation_id":"e920973b-26f2-43ad-99d9-a0c335afcac7","resolution":{"observed_at":"2026-08-06T05:43:18.015462Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.02807","last_updated":"2025-04-03T17:52:07Z","snapshot_observed_at":"2026-08-07T16:10:45.135810Z","submitted_at":"2025-04-03T17:52:07Z","title":"MegaMath: Pushing the Limits of Open Math Corpora","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.02807","snapshot_observed_at":"2026-08-06T05:43:18.020122Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.01326","last_updated":"2025-08-02T11:37:16Z","snapshot_observed_at":"2026-08-09T13:11:08.815889Z","submitted_at":"2025-08-02T11:37:16Z","title":"Large-Scale Diverse Synthesis for Mid-Training","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-06T05:43:18.020122Z"},"links":{"cited_paper":"/paper/2504.02807","citing_paper":"/paper/2508.01326"},"observation_digest":"sha256:79257759813bb4819a754cfc125d2aca70ab9a5339e2ae80fd5360a25af83418","observation_id":"0463f911-4d86-4bbf-a55b-5f8430854840","resolution":{"observed_at":"2026-08-06T05:43:18.020122Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:43:18.294645Z","title":null,"venue":null,"work_id":"72444e98-f104-48ed-b63e-bc052bb4b32e","year":2024},"citing_paper":{"arxiv_id":"2508.01326","last_updated":"2025-08-02T11:37:16Z","snapshot_observed_at":"2026-08-09T13:11:08.815889Z","submitted_at":"2025-08-02T11:37:16Z","title":"Large-Scale Diverse Synthesis for Mid-Training","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-06T05:43:18.024397Z"},"links":{"citing_paper":"/paper/2508.01326"},"observation_digest":"sha256:155e1852b459762ef2bbe646667a93ab87b815e64817111141fb2ac3062d9a3c","observation_id":"0f9da73d-cd69-40b9-a3a1-12fb1fe31b38","resolution":{"observed_at":"2026-08-06T05:43:18.299584Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2508.01326","last_updated":"2025-08-02T11:37:16Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-09T13:11:08.815889Z","submitted_at":"2025-08-02T11:37:16Z","title":"Large-Scale Diverse Synthesis for Mid-Training"},"reference_resolution":{"displayed":41,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":36,"verified_exact":0,"verified_fuzzy":5},"total_outbound_references":41},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 41 of 41 outbound references and 0 inbound Pith citation observations for arXiv:2508.01326."}