{"as_of":"2026-08-14T15:32:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:2602da31394b5b98bfd40211322a8db0cbfa2293dfe7f5836f00a79ddd64b254","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":22,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":22,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":22,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":22,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T17:10:55.615594Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T19:18:54.736613Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2402.09739","last_updated":"2024-07-17T20:50:11Z","snapshot_observed_at":"2026-08-13T04:18:34.728169Z","submitted_at":"2024-02-15T06:36:07Z","title":"QuRating: Selecting High-Quality Data for Training Language Models","version":3},"cited_work":{"arxiv_id":"2402.09739","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.09739","snapshot_observed_at":"2026-07-03T19:18:54.736613Z","title":"arXiv preprint arXiv:2402.09739 , year=","venue":null,"work_id":"00074fdb-f90b-47dd-9baf-a608823f0343","year":2024},"citing_paper":{"arxiv_id":"2403.17297","last_updated":"2024-03-26T00:53:24Z","snapshot_observed_at":"2026-08-12T16:46:46.561976Z","submitted_at":"2024-03-26T00:53:24Z","title":"InternLM2 Technical Report","version":1},"reference_index":88,"source":"arxiv_source","source_observed_at":"2026-05-15T11:44:38.066501Z"},"links":{"cited_paper":"/paper/2402.09739","citing_paper":"/paper/2403.17297"},"observation_digest":"sha256:20c22410f4f915ba513c1c1666b16738ff38b65263046824e6292f8e36966e98","observation_id":"8f757b88-4eec-45e2-a1bf-77dd0261d419","resolution":{"observed_at":"2026-05-15T11:44:38.290169Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.09739","last_updated":"2024-07-17T20:50:11Z","snapshot_observed_at":"2026-08-13T04:18:34.728169Z","submitted_at":"2024-02-15T06:36:07Z","title":"QuRating: Selecting High-Quality Data for Training Language Models","version":3},"cited_work":{"arxiv_id":"2402.09739","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.09739","snapshot_observed_at":"2026-07-03T19:18:54.736613Z","title":"arXiv preprint arXiv:2402.09739 , year=","venue":null,"work_id":"00074fdb-f90b-47dd-9baf-a608823f0343","year":2024},"citing_paper":{"arxiv_id":"2406.00515","last_updated":"2024-11-10T22:02:27Z","snapshot_observed_at":"2026-07-29T20:40:25.374189Z","submitted_at":"2024-06-01T17:48:15Z","title":"A Survey on Large Language Models for Code Generation","version":2},"reference_index":287,"source":"pdf_text","source_observed_at":"2026-05-13T20:18:06.304134Z"},"links":{"cited_paper":"/paper/2402.09739","citing_paper":"/paper/2406.00515"},"observation_digest":"sha256:915bfb9af1e054eb48e7670c253b0fcb0c37eb2aa552aa5ca229c6a7d15de708","observation_id":"8d2cf921-3ca6-4c58-97ce-1c58da76e6ec","resolution":{"observed_at":"2026-05-13T20:18:06.815784Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.09739","last_updated":"2024-07-17T20:50:11Z","snapshot_observed_at":"2026-08-13T04:18:34.728169Z","submitted_at":"2024-02-15T06:36:07Z","title":"QuRating: Selecting High-Quality Data for Training Language Models","version":3},"cited_work":{"arxiv_id":"2402.09739","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.09739","snapshot_observed_at":"2026-07-03T19:18:54.736613Z","title":"arXiv preprint arXiv:2402.09739 , year=","venue":null,"work_id":"00074fdb-f90b-47dd-9baf-a608823f0343","year":2024},"citing_paper":{"arxiv_id":"2406.11794","last_updated":"2025-04-21T17:48:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-17T17:42:57Z","title":"DataComp-LM: In search of the next generation of training sets for language models","version":4},"reference_index":195,"source":"pdf_text","source_observed_at":"2026-05-17T22:58:16.523267Z"},"links":{"cited_paper":"/paper/2402.09739","citing_paper":"/paper/2406.11794"},"observation_digest":"sha256:f5862b3d75f79ca1222951d1a8b9034cfe96920b6fede2ad923604d91429b76e","observation_id":"412dddb6-e0a4-4dcc-9279-9fcf96d50a90","resolution":{"observed_at":"2026-05-17T22:58:17.302685Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.09739","last_updated":"2024-07-17T20:50:11Z","snapshot_observed_at":"2026-08-13T04:18:34.728169Z","submitted_at":"2024-02-15T06:36:07Z","title":"QuRating: Selecting High-Quality Data for Training Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.09739","snapshot_observed_at":"2026-08-12T17:10:55.615594Z","title":"Qurating: Selecting high-quality data for training language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.12882","last_updated":"2025-06-06T05:27:10Z","snapshot_observed_at":"2026-08-14T05:39:11.567100Z","submitted_at":"2024-11-19T22:00:01Z","title":"ProSec: Fortifying Code LLMs with Proactive Security Alignment","version":3},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-12T17:10:55.615594Z"},"links":{"cited_paper":"/paper/2402.09739","citing_paper":"/paper/2411.12882"},"observation_digest":"sha256:b9667235a09e375f4f70fc72ed60d3d1636754864db591e7caeeca4674f91bc7","observation_id":"a6d65f44-e795-43de-a1d8-c71c220a2dec","resolution":{"observed_at":"2026-08-12T17:10:55.615594Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.09739","last_updated":"2024-07-17T20:50:11Z","snapshot_observed_at":"2026-08-13T04:18:34.728169Z","submitted_at":"2024-02-15T06:36:07Z","title":"QuRating: Selecting High-Quality Data for Training Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.09739","snapshot_observed_at":"2026-08-11T22:57:02.085759Z","title":"Qurating: Selecting high-quality data for training language models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.02980","last_updated":"2024-12-09T22:23:41Z","snapshot_observed_at":"2026-08-14T03:28:17.838087Z","submitted_at":"2024-12-04T02:47:45Z","title":"Surveying the Effects of Quality, Diversity, and Complexity in Synthetic Data From Large Language Models","version":2},"reference_index":211,"source":"arxiv_source","source_observed_at":"2026-08-11T22:57:02.085759Z"},"links":{"cited_paper":"/paper/2402.09739","citing_paper":"/paper/2412.02980"},"observation_digest":"sha256:d76e19b0b266bebb8346c08c91684928eb491517eb11c59fb6b560db1dc8dfa6","observation_id":"1e9b78f1-6e8f-426f-88ca-371fd5b4f85f","resolution":{"observed_at":"2026-08-11T22:57:02.085759Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.09739","last_updated":"2024-07-17T20:50:11Z","snapshot_observed_at":"2026-08-13T04:18:34.728169Z","submitted_at":"2024-02-15T06:36:07Z","title":"QuRating: Selecting High-Quality Data for Training Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.09739","snapshot_observed_at":"2026-08-11T22:06:28.530674Z","title":"Qurating: Selecting high-quality data for training language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.03881","last_updated":"2025-03-04T04:28:19Z","snapshot_observed_at":"2026-08-13T12:13:06.192437Z","submitted_at":"2024-12-05T05:29:19Z","title":"Weak-to-Strong Generalization Through the Data-Centric Lens","version":2},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-11T22:06:28.530674Z"},"links":{"cited_paper":"/paper/2402.09739","citing_paper":"/paper/2412.03881"},"observation_digest":"sha256:6b9df5be07971c2119e6bd5ccbaf10c39c7b092f6e46a3a1db33c2d1defc6623","observation_id":"1d999cc0-924f-401b-92b1-27c85c2d0ee2","resolution":{"observed_at":"2026-08-11T22:06:28.530674Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.09739","last_updated":"2024-07-17T20:50:11Z","snapshot_observed_at":"2026-08-13T04:18:34.728169Z","submitted_at":"2024-02-15T06:36:07Z","title":"QuRating: Selecting High-Quality Data for Training Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.09739","snapshot_observed_at":"2026-08-10T21:02:00.883462Z","title":"Qurating: Selecting high-quality data for training language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.06708","last_updated":"2026-05-25T22:00:48Z","snapshot_observed_at":"2026-08-12T23:47:24.076762Z","submitted_at":"2025-01-12T04:28:14Z","title":"Evaluating Sample Utility for Efficient Data Selection by Mimicking Model Weights","version":5},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T21:02:00.883462Z"},"links":{"cited_paper":"/paper/2402.09739","citing_paper":"/paper/2501.06708"},"observation_digest":"sha256:845503c7aaba5226d13b9e6e81dc2060b7125dbe905fe9483dc5979cd80f0881","observation_id":"c3bccff9-ea00-48d3-a331-ff3b9315da16","resolution":{"observed_at":"2026-08-10T21:02:00.883462Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.09739","last_updated":"2024-07-17T20:50:11Z","snapshot_observed_at":"2026-08-13T04:18:34.728169Z","submitted_at":"2024-02-15T06:36:07Z","title":"QuRating: Selecting High-Quality Data for Training Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.09739","snapshot_observed_at":"2026-08-10T18:00:05.091466Z","title":"Q u R ating: S electing H igh- Q uality D ata for T raining L anguage M odels, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.11747","last_updated":"2025-01-23T20:45:47Z","snapshot_observed_at":"2026-08-14T08:21:01.541873Z","submitted_at":"2025-01-20T21:10:22Z","title":"Optimizing Pretraining Data Mixtures with LLM-Estimated Utility","version":2},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-10T18:00:05.091466Z"},"links":{"cited_paper":"/paper/2402.09739","citing_paper":"/paper/2501.11747"},"observation_digest":"sha256:4198aa9df4c41c32188ae70bc92b9ad8c58bf3258fe0a0df909bde282dbc705e","observation_id":"44464480-61a9-4b3e-a21c-055ea8216edc","resolution":{"observed_at":"2026-08-10T18:00:05.091466Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.09739","last_updated":"2024-07-17T20:50:11Z","snapshot_observed_at":"2026-08-13T04:18:34.728169Z","submitted_at":"2024-02-15T06:36:07Z","title":"QuRating: Selecting High-Quality Data for Training Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.09739","snapshot_observed_at":"2026-08-08T16:20:38.403659Z","title":"Wettig, A","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06244","last_updated":"2025-06-04T02:16:01Z","snapshot_observed_at":"2026-08-13T14:09:35.895261Z","submitted_at":"2025-02-10T08:23:05Z","title":"PiKE: Adaptive Data Mixing for Large-Scale Multi-Task Learning Under Low Gradient Conflicts","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-08T16:20:38.403659Z"},"links":{"cited_paper":"/paper/2402.09739","citing_paper":"/paper/2502.06244"},"observation_digest":"sha256:4c3dcd2775ba4eecd4f28995a094161ada759549d0b164d7f745f3ce55e3449f","observation_id":"55dfd1c6-7e30-49b7-ace6-f1c89c901824","resolution":{"observed_at":"2026-08-08T16:20:38.403659Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.09739","last_updated":"2024-07-17T20:50:11Z","snapshot_observed_at":"2026-08-13T04:18:34.728169Z","submitted_at":"2024-02-15T06:36:07Z","title":"QuRating: Selecting High-Quality Data for Training Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.09739","snapshot_observed_at":"2026-08-07T15:43:04.140161Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14070","last_updated":"2025-05-31T03:47:36Z","snapshot_observed_at":"2026-08-09T03:52:59.052704Z","submitted_at":"2025-05-20T08:21:37Z","title":"Enhancing LLMs via High-Knowledge Data Selection","version":2},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-07T15:43:04.140161Z"},"links":{"cited_paper":"/paper/2402.09739","citing_paper":"/paper/2505.14070"},"observation_digest":"sha256:d7ff9d9818b8752025c273ed537779cdbcf0d69f1a78a7d9a81b7b783ff9bf8d","observation_id":"f315cbc0-8d87-4f8f-81a5-ed74cc1a313f","resolution":{"observed_at":"2026-08-07T15:43:04.140161Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.09739","last_updated":"2024-07-17T20:50:11Z","snapshot_observed_at":"2026-08-13T04:18:34.728169Z","submitted_at":"2024-02-15T06:36:07Z","title":"QuRating: Selecting High-Quality Data for Training Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.09739","snapshot_observed_at":"2026-08-07T11:35:47.179506Z","title":"Qurating: Selecting high-quality data for training language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02096","last_updated":"2025-06-02T17:45:16Z","snapshot_observed_at":"2026-08-11T11:45:46.615149Z","submitted_at":"2025-06-02T17:45:16Z","title":"SynthRL: Scaling Visual Reasoning with Verifiable Data Synthesis","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-07T11:35:47.179506Z"},"links":{"cited_paper":"/paper/2402.09739","citing_paper":"/paper/2506.02096"},"observation_digest":"sha256:225df8015f8b2e8b126ff5cf68d559c52eb229fc7cc34b4b40907f81f51539da","observation_id":"1debfe81-31f3-4173-9bf5-783109667a66","resolution":{"observed_at":"2026-08-07T11:35:47.179506Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.09739","last_updated":"2024-07-17T20:50:11Z","snapshot_observed_at":"2026-08-13T04:18:34.728169Z","submitted_at":"2024-02-15T06:36:07Z","title":"QuRating: Selecting High-Quality Data for Training Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.09739","snapshot_observed_at":"2026-08-07T04:34:09.115749Z","title":"Qurating: Selecting high-quality data for training language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10403","last_updated":"2025-06-12T06:53:22Z","snapshot_observed_at":"2026-08-12T23:48:00.159911Z","submitted_at":"2025-06-12T06:53:22Z","title":"Time To Impeach LLM-as-a-Judge: Programs are the Future of Evaluation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T04:34:09.115749Z"},"links":{"cited_paper":"/paper/2402.09739","citing_paper":"/paper/2506.10403"},"observation_digest":"sha256:9ae4df18cdd417e4749b56642d4b39ae2767efdeab4c35347eb36d6a98709124","observation_id":"290c994f-6f21-4700-9db7-cf29e9336f1d","resolution":{"observed_at":"2026-08-07T04:34:09.115749Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.09739","last_updated":"2024-07-17T20:50:11Z","snapshot_observed_at":"2026-08-13T04:18:34.728169Z","submitted_at":"2024-02-15T06:36:07Z","title":"QuRating: Selecting High-Quality Data for Training Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.09739","snapshot_observed_at":"2026-08-06T15:21:58.039374Z","title":"Qurating: Selecting high-quality data for training language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.16178","last_updated":"2025-07-22T02:47:12Z","snapshot_observed_at":"2026-08-14T03:29:51.555974Z","submitted_at":"2025-07-22T02:47:12Z","title":"LLM Data Selection and Utilization via Dynamic Bi-level Optimization","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T15:21:58.039374Z"},"links":{"cited_paper":"/paper/2402.09739","citing_paper":"/paper/2507.16178"},"observation_digest":"sha256:a07667b9fe65cb6b43ca1bb0e2551f91e3c66f0fb49d4829f3f437f8134018e3","observation_id":"22547dd7-86c5-417b-91b3-1093554466e4","resolution":{"observed_at":"2026-08-06T15:21:58.039374Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.09739","last_updated":"2024-07-17T20:50:11Z","snapshot_observed_at":"2026-08-13T04:18:34.728169Z","submitted_at":"2024-02-15T06:36:07Z","title":"QuRating: Selecting High-Quality Data for Training Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.09739","snapshot_observed_at":"2026-08-04T11:16:14.661866Z","title":"Qurating: Selecting high-quality data for training language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.06048","last_updated":"2026-06-18T04:28:50Z","snapshot_observed_at":"2026-08-04T11:16:05.008855Z","submitted_at":"2025-10-07T15:42:33Z","title":"BLISS: A Lightweight Bilevel Influence Scoring Method for Data Selection in Language Model Pretraining","version":5},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-04T11:16:14.661866Z"},"links":{"cited_paper":"/paper/2402.09739","citing_paper":"/paper/2510.06048"},"observation_digest":"sha256:8c95fb3f0fdfa14eba1c93bdb341c3b47680751d83d875e85600e264f5117081","observation_id":"f71f9222-a991-4346-b00f-6b81fd770bdf","resolution":{"observed_at":"2026-08-04T11:16:14.661866Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.09739","last_updated":"2024-07-17T20:50:11Z","snapshot_observed_at":"2026-08-13T04:18:34.728169Z","submitted_at":"2024-02-15T06:36:07Z","title":"QuRating: Selecting High-Quality Data for Training Language Models","version":3},"cited_work":{"arxiv_id":"2402.09739","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.09739","snapshot_observed_at":"2026-07-03T19:18:54.736613Z","title":"arXiv preprint arXiv:2402.09739 , year=","venue":null,"work_id":"00074fdb-f90b-47dd-9baf-a608823f0343","year":2024},"citing_paper":{"arxiv_id":"2510.06499","last_updated":"2026-04-10T04:08:43Z","snapshot_observed_at":"2026-08-13T10:33:06.026096Z","submitted_at":"2025-10-07T22:30:59Z","title":"Webscale-RL: Automated Data Pipeline for Scaling RL Data to Pretraining Levels","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-18T08:39:54.747656Z"},"links":{"cited_paper":"/paper/2402.09739","citing_paper":"/paper/2510.06499"},"observation_digest":"sha256:7c86a32f3615c312e82539b4b134374b5a620a69480346a87ebc7cb9c77ed652","observation_id":"d20d0a03-a512-4361-babe-7be14fa90ff2","resolution":{"observed_at":"2026-05-18T08:41:08.344219Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.09739","last_updated":"2024-07-17T20:50:11Z","snapshot_observed_at":"2026-08-13T04:18:34.728169Z","submitted_at":"2024-02-15T06:36:07Z","title":"QuRating: Selecting High-Quality Data for Training Language Models","version":3},"cited_work":{"arxiv_id":"2402.09739","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.09739","snapshot_observed_at":"2026-07-03T19:18:54.736613Z","title":"arXiv preprint arXiv:2402.09739 , year=","venue":null,"work_id":"00074fdb-f90b-47dd-9baf-a608823f0343","year":2024},"citing_paper":{"arxiv_id":"2604.07769","last_updated":"2026-04-09T03:48:11Z","snapshot_observed_at":"2026-08-11T15:19:26.007243Z","submitted_at":"2026-04-09T03:48:11Z","title":"An Empirical Study on Influence-Based Pretraining Data Selection for Code Large Language Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-10T18:13:24.750244Z"},"links":{"cited_paper":"/paper/2402.09739","citing_paper":"/paper/2604.07769"},"observation_digest":"sha256:80bedd659c86417be8edc16a81047dfc7044998254bbba024ae58989417e34bd","observation_id":"2ba2b4b1-181a-4c67-aad5-c3fe809936dd","resolution":{"observed_at":"2026-05-11T05:16:04.558118Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.09739","last_updated":"2024-07-17T20:50:11Z","snapshot_observed_at":"2026-08-13T04:18:34.728169Z","submitted_at":"2024-02-15T06:36:07Z","title":"QuRating: Selecting High-Quality Data for Training Language Models","version":3},"cited_work":{"arxiv_id":"2402.09739","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.09739","snapshot_observed_at":"2026-07-03T19:18:54.736613Z","title":"arXiv preprint arXiv:2402.09739 , year=","venue":null,"work_id":"00074fdb-f90b-47dd-9baf-a608823f0343","year":2024},"citing_paper":{"arxiv_id":"2605.05267","last_updated":"2026-05-06T09:38:31Z","snapshot_observed_at":"2026-08-04T17:41:12.164736Z","submitted_at":"2026-05-06T09:38:31Z","title":"Bridging Generation and Training: A Systematic Review of Quality Issues in LLMs for Code","version":1},"reference_index":134,"source":"pdf_text","source_observed_at":"2026-05-08T17:37:51.790000Z"},"links":{"cited_paper":"/paper/2402.09739","citing_paper":"/paper/2605.05267"},"observation_digest":"sha256:ca35f53bab07a9e3300dea97c3db7c262570b7c170d071cb00faffef3a4206bb","observation_id":"02bcdd64-91a9-4893-9093-8200f7e4eb2c","resolution":{"observed_at":"2026-05-11T17:26:04.575591Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.09739","last_updated":"2024-07-17T20:50:11Z","snapshot_observed_at":"2026-08-13T04:18:34.728169Z","submitted_at":"2024-02-15T06:36:07Z","title":"QuRating: Selecting High-Quality Data for Training Language Models","version":3},"cited_work":{"arxiv_id":"2402.09739","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.09739","snapshot_observed_at":"2026-07-03T19:18:54.736613Z","title":"arXiv preprint arXiv:2402.09739 , year=","venue":null,"work_id":"00074fdb-f90b-47dd-9baf-a608823f0343","year":2024},"citing_paper":{"arxiv_id":"2605.22389","last_updated":"2026-05-21T12:21:41Z","snapshot_observed_at":"2026-07-06T23:32:44.699825Z","submitted_at":"2026-05-21T12:21:41Z","title":"Unified Data Selection for LLM Reasoning","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-05-22T05:33:20.930156Z"},"links":{"cited_paper":"/paper/2402.09739","citing_paper":"/paper/2605.22389"},"observation_digest":"sha256:7c911ccd35c64cea0f5bcd3202b6601a2978f4d9b333423fe78af2c29c89cf82","observation_id":"707067e8-c56a-445a-acae-50cf82b1f232","resolution":{"observed_at":"2026-05-22T05:34:39.996586Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.09739","last_updated":"2024-07-17T20:50:11Z","snapshot_observed_at":"2026-08-13T04:18:34.728169Z","submitted_at":"2024-02-15T06:36:07Z","title":"QuRating: Selecting High-Quality Data for Training Language Models","version":3},"cited_work":{"arxiv_id":"2402.09739","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.09739","snapshot_observed_at":"2026-07-03T19:18:54.736613Z","title":"arXiv preprint arXiv:2402.09739 , year=","venue":null,"work_id":"00074fdb-f90b-47dd-9baf-a608823f0343","year":2024},"citing_paper":{"arxiv_id":"2606.18307","last_updated":"2026-06-16T07:21:49Z","snapshot_observed_at":"2026-07-06T23:53:45.117607Z","submitted_at":"2026-06-16T07:21:49Z","title":"DRIFT: Refining Instruction Data via On-Policy Data Attribution","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-27T01:57:05.784589Z"},"links":{"cited_paper":"/paper/2402.09739","citing_paper":"/paper/2606.18307"},"observation_digest":"sha256:0af07b56c6e4d86df67ecbde4df660f2950d03c734210319551b1aa5bef0f36f","observation_id":"576fbebc-0fe0-4b8e-ab87-a90d1287d56c","resolution":{"observed_at":"2026-07-03T19:18:54.738254Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.09739","last_updated":"2024-07-17T20:50:11Z","snapshot_observed_at":"2026-08-13T04:18:34.728169Z","submitted_at":"2024-02-15T06:36:07Z","title":"QuRating: Selecting High-Quality Data for Training Language Models","version":3},"cited_work":{"arxiv_id":"2402.09739","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.09739","snapshot_observed_at":"2026-07-03T19:18:54.736613Z","title":"arXiv preprint arXiv:2402.09739 , year=","venue":null,"work_id":"00074fdb-f90b-47dd-9baf-a608823f0343","year":2024},"citing_paper":{"arxiv_id":"2607.02266","last_updated":"2026-07-02T14:51:42Z","snapshot_observed_at":"2026-08-08T15:31:37.930459Z","submitted_at":"2026-07-02T14:51:42Z","title":"HERMES: A Multi-Granularity Labeling Substrate for Pre-training Data Mixtures","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-07-03T16:44:41.720388Z"},"links":{"cited_paper":"/paper/2402.09739","citing_paper":"/paper/2607.02266"},"observation_digest":"sha256:9317011dd3cd40121a35db87bd60dc26fd885ce95ba38a569575ba814f49f3bd","observation_id":"e8c41971-b1b2-4a4d-ab55-035f0385311d","resolution":{"observed_at":"2026-07-03T16:48:39.419653Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.09739","last_updated":"2024-07-17T20:50:11Z","snapshot_observed_at":"2026-08-13T04:18:34.728169Z","submitted_at":"2024-02-15T06:36:07Z","title":"QuRating: Selecting High-Quality Data for Training Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.09739","snapshot_observed_at":"2026-08-02T13:43:29.427294Z","title":"Qurating: Selecting high-quality data for training language models.arXiv preprint arXiv:2402.09739, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.20465","last_updated":"2026-05-19T02:23:53Z","snapshot_observed_at":"2026-08-08T01:36:19.591301Z","submitted_at":"2026-05-19T02:23:53Z","title":"DataPrep-Bench: Benchmarking LLMs as Training Data Preparators","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-02T13:43:29.427294Z"},"links":{"cited_paper":"/paper/2402.09739","citing_paper":"/paper/2607.20465"},"observation_digest":"sha256:2e608b7097da1aa955c013bb50c88a7d9cb6a6b5d7e91471ba68698e132a924d","observation_id":"8a4bba88-7a4f-4b5c-b9e0-987ea6a9ec2b","resolution":{"observed_at":"2026-08-02T13:43:29.427294Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.09739","last_updated":"2024-07-17T20:50:11Z","snapshot_observed_at":"2026-08-13T04:18:34.728169Z","submitted_at":"2024-02-15T06:36:07Z","title":"QuRating: Selecting High-Quality Data for Training Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.09739","snapshot_observed_at":"2026-07-31T07:01:44.329991Z","title":"arXiv preprint arXiv:2402.09739 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24717","last_updated":"2026-07-27T17:54:12Z","snapshot_observed_at":"2026-08-08T00:53:22.078848Z","submitted_at":"2026-07-27T17:54:12Z","title":"DataOrchestra: Learning to Orchestrate Per-Example Curation of Pretraining Data","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-07-31T07:01:44.329991Z"},"links":{"cited_paper":"/paper/2402.09739","citing_paper":"/paper/2607.24717"},"observation_digest":"sha256:25926f752f07ce398a4f0c8a2214728378839d8467640bdce8138d92d588a976","observation_id":"4b8f4a6c-9809-4b7a-b3b9-2834d9d097df","resolution":{"observed_at":"2026-07-31T07:01:44.329991Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2402.09739/citation-record","integrity":"/paper/2402.09739/integrity","json":"/paper/2402.09739/citation-record.json","paper":"/paper/2402.09739"},"outbound":[],"paper":{"arxiv_id":"2402.09739","last_updated":"2024-07-17T20:50:11Z","latest_version":3,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-13T04:18:34.728169Z","submitted_at":"2024-02-15T06:36:07Z","title":"QuRating: Selecting High-Quality Data for Training Language Models"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 22 inbound Pith citation observations for arXiv:2402.09739."}