{"as_of":"2026-08-13T22:07:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:18840c99d8a660a12f2d42314f2f531d8b84698f44c36b883616a7030ab5e49d","coverage":[{"denominator":20,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":20,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T16:18:47.814162Z","state":"measured"},{"denominator":21,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":21,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-31T07:01:45.787747Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2604.13977","last_updated":"2026-07-30T11:53:22Z","snapshot_observed_at":"2026-08-13T16:40:26.620615Z","submitted_at":"2026-04-15T15:24:59Z","title":"How Can We Synthesize High-Quality Pretraining Data? A Systematic Study of Prompt Design, Generator Model, and Source Data","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.13977","snapshot_observed_at":"2026-07-31T07:01:45.787747Z","title":"arXiv preprint arXiv:2604.13977 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24717","last_updated":"2026-07-27T17:54:12Z","snapshot_observed_at":"2026-08-08T00:53:22.078848Z","submitted_at":"2026-07-27T17:54:12Z","title":"DataOrchestra: Learning to Orchestrate Per-Example Curation of Pretraining Data","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-07-31T07:01:45.787747Z"},"links":{"cited_paper":"/paper/2604.13977","citing_paper":"/paper/2607.24717"},"observation_digest":"sha256:da966c482df14831a1996a0be8728dc854025ca0d11cb12b98c643e1ebde7de8","observation_id":"b6e24112-4dd5-4c61-bb1a-abd92d99e6d9","resolution":{"observed_at":"2026-07-31T07:01:45.787747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2604.13977/citation-record","integrity":"/paper/2604.13977/integrity","json":"/paper/2604.13977/citation-record.json","paper":"/paper/2604.13977"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T16:18:46.140236Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2604.13977","last_updated":"2026-07-30T11:53:22Z","snapshot_observed_at":"2026-08-13T16:40:26.620615Z","submitted_at":"2026-04-15T15:24:59Z","title":"How Can We Synthesize High-Quality Pretraining Data? A Systematic Study of Prompt Design, Generator Model, and Source Data","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-02T16:18:46.140236Z"},"links":{"citing_paper":"/paper/2604.13977"},"observation_digest":"sha256:5426a70cee4883b7886ef499899f244b71f7f67d8359ac22608013744f37e43f","observation_id":"a10b0e57-7add-492d-9c7e-cab17470ad36","resolution":{"observed_at":"2026-08-02T16:18:46.140236Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T16:18:46.927788Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2604.13977","last_updated":"2026-07-30T11:53:22Z","snapshot_observed_at":"2026-08-13T16:40:26.620615Z","submitted_at":"2026-04-15T15:24:59Z","title":"How Can We Synthesize High-Quality Pretraining Data? A Systematic Study of Prompt Design, Generator Model, and Source Data","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-02T16:18:46.927788Z"},"links":{"citing_paper":"/paper/2604.13977"},"observation_digest":"sha256:f779fe83d5ec0d4b7c7dd24fbd71114867b4a50a867b86023b6a944a5582cfb4","observation_id":"75217164-9a2f-46d8-aea9-8041f0de3439","resolution":{"observed_at":"2026-08-02T16:18:46.927788Z","resolver_source":null,"status":"parse_uncertain"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T16:18:47.063339Z","title":"SmolLM2 Representative Output","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2604.13977","last_updated":"2026-07-30T11:53:22Z","snapshot_observed_at":"2026-08-13T16:40:26.620615Z","submitted_at":"2026-04-15T15:24:59Z","title":"How Can We Synthesize High-Quality Pretraining Data? A Systematic Study of Prompt Design, Generator Model, and Source Data","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-02T16:18:47.063339Z"},"links":{"citing_paper":"/paper/2604.13977"},"observation_digest":"sha256:0406b7c0d917eb47465b7398ac7487d4f2b8a8bdd1eb4453712ba4278f573747","observation_id":"ffa987c4-70cb-422b-8e45-04a705166d34","resolution":{"observed_at":"2026-08-02T16:18:47.063339Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.05427","last_updated":"2025-05-08T17:15:20Z","snapshot_observed_at":"2026-08-13T04:45:22.174753Z","submitted_at":"2025-05-08T17:15:20Z","title":"Ultra-FineWeb: Efficient Data Filtering and Verification for High-Quality LLM Training Data","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.05427","snapshot_observed_at":"2026-08-02T16:18:45.891966Z","title":"Blog post","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.13977","last_updated":"2026-07-30T11:53:22Z","snapshot_observed_at":"2026-08-13T16:40:26.620615Z","submitted_at":"2026-04-15T15:24:59Z","title":"How Can We Synthesize High-Quality Pretraining Data? A Systematic Study of Prompt Design, Generator Model, and Source Data","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-02T16:18:45.891966Z"},"links":{"cited_paper":"/paper/2505.05427","citing_paper":"/paper/2604.13977"},"observation_digest":"sha256:932eb859222c448aa0d69ac9bd3caad60ef2285cc41eded9db50d94ba8093a72","observation_id":"4edaaaf3-ad91-44f1-ba25-031fa4c5e1dd","resolution":{"observed_at":"2026-08-02T16:18:45.891966Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T16:18:46.048371Z","title":"This approach underperforms every rephrasing approach in our analysis","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.13977","last_updated":"2026-07-30T11:53:22Z","snapshot_observed_at":"2026-08-13T16:40:26.620615Z","submitted_at":"2026-04-15T15:24:59Z","title":"How Can We Synthesize High-Quality Pretraining Data? A Systematic Study of Prompt Design, Generator Model, and Source Data","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-02T16:18:46.048371Z"},"links":{"citing_paper":"/paper/2604.13977"},"observation_digest":"sha256:676a31072d2e6b132acc8eba2c0f57ee4ae6658e4c5f74b9d947026d5d9c7316","observation_id":"b2cd4f3a-ea52-4276-94a8-8220be624408","resolution":{"observed_at":"2026-08-02T16:18:46.048371Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T16:18:46.284643Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2604.13977","last_updated":"2026-07-30T11:53:22Z","snapshot_observed_at":"2026-08-13T16:40:26.620615Z","submitted_at":"2026-04-15T15:24:59Z","title":"How Can We Synthesize High-Quality Pretraining Data? A Systematic Study of Prompt Design, Generator Model, and Source Data","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-02T16:18:46.284643Z"},"links":{"citing_paper":"/paper/2604.13977"},"observation_digest":"sha256:4358dd99cc9ce063afb9262756043b8d2a86966a78432b8ba36ec78e27854e04","observation_id":"ee8fa31b-b5c9-4862-ae41-a4f3643842cf","resolution":{"observed_at":"2026-08-02T16:18:46.284643Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T16:18:46.396781Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2604.13977","last_updated":"2026-07-30T11:53:22Z","snapshot_observed_at":"2026-08-13T16:40:26.620615Z","submitted_at":"2026-04-15T15:24:59Z","title":"How Can We Synthesize High-Quality Pretraining Data? A Systematic Study of Prompt Design, Generator Model, and Source Data","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-02T16:18:46.396781Z"},"links":{"citing_paper":"/paper/2604.13977"},"observation_digest":"sha256:cb05585090133e8938271a95985667982adda15cceffbd47360d43cf60ab7208","observation_id":"825ab0a5-f276-4572-b21b-d0c4241c8230","resolution":{"observed_at":"2026-08-02T16:18:46.396781Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T16:18:46.500186Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2604.13977","last_updated":"2026-07-30T11:53:22Z","snapshot_observed_at":"2026-08-13T16:40:26.620615Z","submitted_at":"2026-04-15T15:24:59Z","title":"How Can We Synthesize High-Quality Pretraining Data? A Systematic Study of Prompt Design, Generator Model, and Source Data","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-02T16:18:46.500186Z"},"links":{"citing_paper":"/paper/2604.13977"},"observation_digest":"sha256:b76023e894b9b969ce4f4ad3da8dda79180599d75be2564a5a8ce4fbadfe039b","observation_id":"1e691e5b-31b6-41aa-a9d9-cf3b28123e1e","resolution":{"observed_at":"2026-08-02T16:18:46.500186Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T16:18:46.637161Z","title":"Do not use Markdown","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2604.13977","last_updated":"2026-07-30T11:53:22Z","snapshot_observed_at":"2026-08-13T16:40:26.620615Z","submitted_at":"2026-04-15T15:24:59Z","title":"How Can We Synthesize High-Quality Pretraining Data? A Systematic Study of Prompt Design, Generator Model, and Source Data","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-02T16:18:46.637161Z"},"links":{"citing_paper":"/paper/2604.13977"},"observation_digest":"sha256:2f48caa41029debb46eecdd3ca193cddaa3111ea0fe635210b8c4fc7f8b1a72e","observation_id":"3af6c6d8-2b8a-46dd-8c35-6b5986e18baf","resolution":{"observed_at":"2026-08-02T16:18:46.637161Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T16:18:46.716171Z","title":"Question:","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2604.13977","last_updated":"2026-07-30T11:53:22Z","snapshot_observed_at":"2026-08-13T16:40:26.620615Z","submitted_at":"2026-04-15T15:24:59Z","title":"How Can We Synthesize High-Quality Pretraining Data? A Systematic Study of Prompt Design, Generator Model, and Source Data","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-02T16:18:46.716171Z"},"links":{"citing_paper":"/paper/2604.13977"},"observation_digest":"sha256:1454e55927c141740e20823a05fc2ea01810159424bbe575146ed900949c8ee7","observation_id":"acebbd2c-cd5f-4d07-8e43-c89561776b3b","resolution":{"observed_at":"2026-08-02T16:18:46.716171Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T16:18:46.835960Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2604.13977","last_updated":"2026-07-30T11:53:22Z","snapshot_observed_at":"2026-08-13T16:40:26.620615Z","submitted_at":"2026-04-15T15:24:59Z","title":"How Can We Synthesize High-Quality Pretraining Data? A Systematic Study of Prompt Design, Generator Model, and Source Data","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-02T16:18:46.835960Z"},"links":{"citing_paper":"/paper/2604.13977"},"observation_digest":"sha256:30bb39b86357b7c2a4e02310c40e698cdfc6340d5fbe046751f8d4f0a3db0c66","observation_id":"2db2957b-a2d1-49b6-943c-5a93eed0f668","resolution":{"observed_at":"2026-08-02T16:18:46.835960Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T16:18:47.465605Z","title":"Paul R. Williams: Classic Hollywood Style,","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2604.13977","last_updated":"2026-07-30T11:53:22Z","snapshot_observed_at":"2026-08-13T16:40:26.620615Z","submitted_at":"2026-04-15T15:24:59Z","title":"How Can We Synthesize High-Quality Pretraining Data? A Systematic Study of Prompt Design, Generator Model, and Source Data","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-02T16:18:47.465605Z"},"links":{"citing_paper":"/paper/2604.13977"},"observation_digest":"sha256:1a9d5f96b36f7d276c3c5c20dfb09f84f10b37806f501d632158e93778e9a4ef","observation_id":"42a5b6aa-b3ef-4f7f-b2a2-4fc4d6e2f19b","resolution":{"observed_at":"2026-08-02T16:18:47.465605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T16:18:47.569506Z","title":"It provides real-time data in seconds and can be done painlessly on the patient","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2604.13977","last_updated":"2026-07-30T11:53:22Z","snapshot_observed_at":"2026-08-13T16:40:26.620615Z","submitted_at":"2026-04-15T15:24:59Z","title":"How Can We Synthesize High-Quality Pretraining Data? A Systematic Study of Prompt Design, Generator Model, and Source Data","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-02T16:18:47.569506Z"},"links":{"citing_paper":"/paper/2604.13977"},"observation_digest":"sha256:cc187c944e6ee6b0a9b71465bf60f86a34879ee03d139201510b618c8ad66c49","observation_id":"3d4521dc-4c47-46ed-844b-311929de0df6","resolution":{"observed_at":"2026-08-02T16:18:47.569506Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T16:18:47.735619Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2604.13977","last_updated":"2026-07-30T11:53:22Z","snapshot_observed_at":"2026-08-13T16:40:26.620615Z","submitted_at":"2026-04-15T15:24:59Z","title":"How Can We Synthesize High-Quality Pretraining Data? A Systematic Study of Prompt Design, Generator Model, and Source Data","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-02T16:18:47.735619Z"},"links":{"citing_paper":"/paper/2604.13977"},"observation_digest":"sha256:10970c1e8aff6b9f56a46adb615938a060b46950056425b9e8db1b83e34e0814","observation_id":"3a2df2b5-5ebb-41d6-afd2-24f84eee4525","resolution":{"observed_at":"2026-08-02T16:18:47.735619Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T16:18:47.814162Z","title":",→ ,→ Answer: The NICOM, NICO2, and Respironic systems are noninvasive methods for monitoring cardiac output","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2604.13977","last_updated":"2026-07-30T11:53:22Z","snapshot_observed_at":"2026-08-13T16:40:26.620615Z","submitted_at":"2026-04-15T15:24:59Z","title":"How Can We Synthesize High-Quality Pretraining Data? A Systematic Study of Prompt Design, Generator Model, and Source Data","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-02T16:18:47.814162Z"},"links":{"citing_paper":"/paper/2604.13977"},"observation_digest":"sha256:a90466d8b1ff8748d98a780865d8aef536f0a43749a174d89f2ff2b010b061fb","observation_id":"6a3a1074-0273-486f-8f83-72fca8ccd89f","resolution":{"observed_at":"2026-08-02T16:18:47.814162Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T16:18:45.263255Z","title":"Ilya Loshchilov and Frank Hutter","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2604.13977","last_updated":"2026-07-30T11:53:22Z","snapshot_observed_at":"2026-08-13T16:40:26.620615Z","submitted_at":"2026-04-15T15:24:59Z","title":"How Can We Synthesize High-Quality Pretraining Data? A Systematic Study of Prompt Design, Generator Model, and Source Data","version":2},"reference_index":102,"source":"pdf_text","source_observed_at":"2026-08-02T16:18:45.263255Z"},"links":{"citing_paper":"/paper/2604.13977"},"observation_digest":"sha256:396d585a0f974b6f48ccaef856bb65fbbc24e74077458ca289d3aaa2c4749a01","observation_id":"bd32e762-9a95-4e2c-a2e1-85ec6d697af2","resolution":{"observed_at":"2026-08-02T16:18:45.263255Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19786","last_updated":"2025-03-25T15:52:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-25T15:52:34Z","title":"Gemma 3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.19786","snapshot_observed_at":"2026-08-02T16:18:45.180212Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.13977","last_updated":"2026-07-30T11:53:22Z","snapshot_observed_at":"2026-08-13T16:40:26.620615Z","submitted_at":"2026-04-15T15:24:59Z","title":"How Can We Synthesize High-Quality Pretraining Data? A Systematic Study of Prompt Design, Generator Model, and Source Data","version":2},"reference_index":262,"source":"pdf_text","source_observed_at":"2026-08-02T16:18:45.180212Z"},"links":{"cited_paper":"/paper/2503.19786","citing_paper":"/paper/2604.13977"},"observation_digest":"sha256:5e3611707b509f7578973440397adb245c6c29f8374544092d6738de9b25d35a","observation_id":"d292ff89-4ebd-43b7-b1c0-d23b4947df58","resolution":{"observed_at":"2026-08-02T16:18:45.180212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T16:18:45.559194Z","title":"doi: 10.1145/3474381","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.13977","last_updated":"2026-07-30T11:53:22Z","snapshot_observed_at":"2026-08-13T16:40:26.620615Z","submitted_at":"2026-04-15T15:24:59Z","title":"How Can We Synthesize High-Quality Pretraining Data? A Systematic Study of Prompt Design, Generator Model, and Source Data","version":2},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-02T16:18:45.559194Z"},"links":{"citing_paper":"/paper/2604.13977"},"observation_digest":"sha256:2f049e654a918db268ed892ada37af889061562d1fcdd0224cbde6bd4e00ac12","observation_id":"3ec9c932-3366-4b53-87a0-a1fe50ebc020","resolution":{"observed_at":"2026-08-02T16:18:45.559194Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T16:18:45.726994Z","title":"doi: https://doi.org/10.1016/j.neucom.2023.127063","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2604.13977","last_updated":"2026-07-30T11:53:22Z","snapshot_observed_at":"2026-08-13T16:40:26.620615Z","submitted_at":"2026-04-15T15:24:59Z","title":"How Can We Synthesize High-Quality Pretraining Data? A Systematic Study of Prompt Design, Generator Model, and Source Data","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-02T16:18:45.726994Z"},"links":{"citing_paper":"/paper/2604.13977"},"observation_digest":"sha256:768869a22b39ba1974f96cb39603813e3bf678beab8d2fd8e68d65b409c959d6","observation_id":"5e69ffb5-2572-48b0-b50c-70caa4764580","resolution":{"observed_at":"2026-08-02T16:18:45.726994Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2512.20856","last_updated":"2025-12-24T00:24:05Z","snapshot_observed_at":"2026-08-13T13:01:14.159027Z","submitted_at":"2025-12-24T00:24:05Z","title":"NVIDIA Nemotron 3: Efficient and Open Intelligence","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.20856","snapshot_observed_at":"2026-08-02T16:18:45.415257Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.13977","last_updated":"2026-07-30T11:53:22Z","snapshot_observed_at":"2026-08-13T16:40:26.620615Z","submitted_at":"2026-04-15T15:24:59Z","title":"How Can We Synthesize High-Quality Pretraining Data? A Systematic Study of Prompt Design, Generator Model, and Source Data","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-02T16:18:45.415257Z"},"links":{"cited_paper":"/paper/2512.20856","citing_paper":"/paper/2604.13977"},"observation_digest":"sha256:a4d23f40702da78e47978077f80c911745348334aabff48bdfe697a269f027a9","observation_id":"89532051-71a8-49a7-bf83-23646fa6665f","resolution":{"observed_at":"2026-08-02T16:18:45.415257Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2604.13977","last_updated":"2026-07-30T11:53:22Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-13T16:40:26.620615Z","submitted_at":"2026-04-15T15:24:59Z","title":"How Can We Synthesize High-Quality Pretraining Data? A Systematic Study of Prompt Design, Generator Model, and Source Data"},"reference_resolution":{"displayed":20,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":1,"unresolved":18,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":20},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 20 of 20 outbound references and 1 inbound Pith citation observation for arXiv:2604.13977."}