{"as_of":"2026-08-10T01:45:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:0fad6c21d6e9df6ccbefd0e33e974393544378b53bc6d3c034dafff2f793b924","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":11,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":11,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":11,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":11,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-09T22:35:45.085387Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-02T21:17:24.167881Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2401.06059","last_updated":"2024-01-11T17:24:49Z","snapshot_observed_at":"2026-07-06T17:14:24.413664Z","submitted_at":"2024-01-11T17:24:49Z","title":"Investigating Data Contamination for Pre-training Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.06059","snapshot_observed_at":"2026-08-09T22:35:45.085387Z","title":"Z., Zhong, M., Schaeffer, R., Ouyang, S., Han, J., and Koyejo, S","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.18771","last_updated":"2025-01-30T21:51:18Z","snapshot_observed_at":"2026-08-09T22:28:37.617865Z","submitted_at":"2025-01-30T21:51:18Z","title":"Overestimation in LLM Evaluation: A Controlled Large-Scale Study on Data Contamination's Impact on Machine Translation","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-09T22:35:45.085387Z"},"links":{"cited_paper":"/paper/2401.06059","citing_paper":"/paper/2501.18771"},"observation_digest":"sha256:7d4f7be9953556ae86c6051b35a57c6bc7ea1ff60fe0c75aba70103c97d28b29","observation_id":"af7211f0-4400-4785-bccb-b34ba2ed63fa","resolution":{"observed_at":"2026-08-09T22:35:45.085387Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06059","last_updated":"2024-01-11T17:24:49Z","snapshot_observed_at":"2026-07-06T17:14:24.413664Z","submitted_at":"2024-01-11T17:24:49Z","title":"Investigating Data Contamination for Pre-training Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.06059","snapshot_observed_at":"2026-08-07T14:44:34.145164Z","title":"Investigating Data Contamination for Pre-training Language Models.arXiv preprint arXiv:2401.06059,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.18102","last_updated":"2026-05-30T13:29:55Z","snapshot_observed_at":"2026-08-07T14:33:15.240605Z","submitted_at":"2025-05-23T16:57:34Z","title":"CapBencher: Give Your LLM Benchmark a Built-in Alarm for Test-Set Overfitting","version":7},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T14:44:34.145164Z"},"links":{"cited_paper":"/paper/2401.06059","citing_paper":"/paper/2505.18102"},"observation_digest":"sha256:5cd66890b4dc15d66c2c516d28ce581d35bc036e01b9d926fffa268f5817b6c3","observation_id":"89a0abb8-07bf-4c42-a787-5cfdcd8e09cd","resolution":{"observed_at":"2026-08-07T14:44:34.145164Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06059","last_updated":"2024-01-11T17:24:49Z","snapshot_observed_at":"2026-07-06T17:14:24.413664Z","submitted_at":"2024-01-11T17:24:49Z","title":"Investigating Data Contamination for Pre-training Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.06059","snapshot_observed_at":"2026-08-07T00:23:41.260222Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21586","last_updated":"2025-08-07T04:59:32Z","snapshot_observed_at":"2026-08-09T17:21:22.313358Z","submitted_at":"2025-06-17T13:37:42Z","title":"Can Vision Language Models Understand Mimed Actions?","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T00:23:41.260222Z"},"links":{"cited_paper":"/paper/2401.06059","citing_paper":"/paper/2506.21586"},"observation_digest":"sha256:f65c558fd5adab96bf26b553c565d75c0c0c5dbd720c2fbc89f9e3af750e2239","observation_id":"b460b024-0bbc-47a7-b8f4-f7159f6800f8","resolution":{"observed_at":"2026-08-07T00:23:41.260222Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06059","last_updated":"2024-01-11T17:24:49Z","snapshot_observed_at":"2026-07-06T17:14:24.413664Z","submitted_at":"2024-01-11T17:24:49Z","title":"Investigating Data Contamination for Pre-training Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.06059","snapshot_observed_at":"2026-08-06T20:02:23.208794Z","title":"Kelly, M., Longjohn, R., and Nottingham, K","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.03971","last_updated":"2025-07-05T09:39:07Z","snapshot_observed_at":"2026-08-08T21:47:21.492024Z","submitted_at":"2025-07-05T09:39:07Z","title":"Real-TabPFN: Improving Tabular Foundation Models via Continued Pre-training With Real-World Data","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-06T20:02:23.208794Z"},"links":{"cited_paper":"/paper/2401.06059","citing_paper":"/paper/2507.03971"},"observation_digest":"sha256:78dfd667473717e3a3ed3020892edf3a7e9f461b57309911d96fa2702320a16d","observation_id":"367caea1-da5b-4b5a-98a1-cae7a28bf80c","resolution":{"observed_at":"2026-08-06T20:02:23.208794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06059","last_updated":"2024-01-11T17:24:49Z","snapshot_observed_at":"2026-07-06T17:14:24.413664Z","submitted_at":"2024-01-11T17:24:49Z","title":"Investigating Data Contamination for Pre-training Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.06059","snapshot_observed_at":"2026-08-06T14:51:53.769972Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.17389","last_updated":"2025-07-23T10:34:22Z","snapshot_observed_at":"2026-08-07T11:21:36.520513Z","submitted_at":"2025-07-23T10:34:22Z","title":"Investigating Training Data Detection in AI Coders","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T14:51:53.769972Z"},"links":{"cited_paper":"/paper/2401.06059","citing_paper":"/paper/2507.17389"},"observation_digest":"sha256:ae87d914d1b96793996bcb3f8c65d789f48326b1d13b4868b983821f81334bcc","observation_id":"ede787cc-e818-4db0-be20-9d383381e5f6","resolution":{"observed_at":"2026-08-06T14:51:53.769972Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06059","last_updated":"2024-01-11T17:24:49Z","snapshot_observed_at":"2026-07-06T17:14:24.413664Z","submitted_at":"2024-01-11T17:24:49Z","title":"Investigating Data Contamination for Pre-training Language Models","version":1},"cited_work":{"arxiv_id":"2401.06059","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2401.06059","snapshot_observed_at":"2026-07-02T21:17:24.167881Z","title":"Sayash Kapoor and Arvind Narayanan","venue":null,"work_id":"c73162cf-f918-4be7-be6d-2702d58b0c12","year":2024},"citing_paper":{"arxiv_id":"2605.06865","last_updated":"2026-05-07T19:06:35Z","snapshot_observed_at":"2026-07-06T23:19:15.382283Z","submitted_at":"2026-05-07T19:06:35Z","title":"Dataset Watermarking for Closed LLMs with Provable Detection","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-11T00:53:42.185498Z"},"links":{"cited_paper":"/paper/2401.06059","citing_paper":"/paper/2605.06865"},"observation_digest":"sha256:e23c42415e622d688afdba8a3f56915213e68004c127b97e69e5bc1ec56e9deb","observation_id":"bd36c6b1-c8ed-4339-b358-6869b3900492","resolution":{"observed_at":"2026-05-11T05:00:57.277115Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06059","last_updated":"2024-01-11T17:24:49Z","snapshot_observed_at":"2026-07-06T17:14:24.413664Z","submitted_at":"2024-01-11T17:24:49Z","title":"Investigating Data Contamination for Pre-training Language Models","version":1},"cited_work":{"arxiv_id":"2401.06059","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2401.06059","snapshot_observed_at":"2026-07-02T21:17:24.167881Z","title":"Sayash Kapoor and Arvind Narayanan","venue":null,"work_id":"c73162cf-f918-4be7-be6d-2702d58b0c12","year":2024},"citing_paper":{"arxiv_id":"2605.19999","last_updated":"2026-05-19T15:33:16Z","snapshot_observed_at":"2026-07-06T23:30:39.512029Z","submitted_at":"2026-05-19T15:33:16Z","title":"LLM Benchmark Datasets Should Be Contamination-Resistant","version":1},"reference_index":86,"source":"arxiv_source","source_observed_at":"2026-05-20T07:19:50.354875Z"},"links":{"cited_paper":"/paper/2401.06059","citing_paper":"/paper/2605.19999"},"observation_digest":"sha256:6ae4caad2ed874395ddb9e4db8573083c1065d0e196f4d0084420d330e0cae2c","observation_id":"b54ef219-da74-42cc-9569-2fe133ae6f25","resolution":{"observed_at":"2026-05-20T07:23:07.050056Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06059","last_updated":"2024-01-11T17:24:49Z","snapshot_observed_at":"2026-07-06T17:14:24.413664Z","submitted_at":"2024-01-11T17:24:49Z","title":"Investigating Data Contamination for Pre-training Language Models","version":1},"cited_work":{"arxiv_id":"2401.06059","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2401.06059","snapshot_observed_at":"2026-07-02T21:17:24.167881Z","title":"Sayash Kapoor and Arvind Narayanan","venue":null,"work_id":"c73162cf-f918-4be7-be6d-2702d58b0c12","year":2024},"citing_paper":{"arxiv_id":"2605.23628","last_updated":"2026-05-22T13:40:00Z","snapshot_observed_at":"2026-07-06T23:33:49.013121Z","submitted_at":"2026-05-22T13:40:00Z","title":"How Hard is it to Rig a Benchmark? A Social Choice Analysis of Leaderboard Robustness","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-25T04:37:01.537128Z"},"links":{"cited_paper":"/paper/2401.06059","citing_paper":"/paper/2605.23628"},"observation_digest":"sha256:0122e701c43018cf8223f36dc3267dfefa2177b716aa2bb6188e50209f5e6237","observation_id":"5377c182-e0ca-4f62-8394-9bcfe8a2581a","resolution":{"observed_at":"2026-05-25T04:40:24.421044Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06059","last_updated":"2024-01-11T17:24:49Z","snapshot_observed_at":"2026-07-06T17:14:24.413664Z","submitted_at":"2024-01-11T17:24:49Z","title":"Investigating Data Contamination for Pre-training Language Models","version":1},"cited_work":{"arxiv_id":"2401.06059","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2401.06059","snapshot_observed_at":"2026-07-02T21:17:24.167881Z","title":"Sayash Kapoor and Arvind Narayanan","venue":null,"work_id":"c73162cf-f918-4be7-be6d-2702d58b0c12","year":2024},"citing_paper":{"arxiv_id":"2605.26161","last_updated":"2026-05-24T14:59:12Z","snapshot_observed_at":"2026-08-02T04:25:25.218976Z","submitted_at":"2026-05-24T14:59:12Z","title":"TSFMAudit: Data Contamination Auditing in Forecasting Time Series Foundation Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-30T12:00:05.807004Z"},"links":{"cited_paper":"/paper/2401.06059","citing_paper":"/paper/2605.26161"},"observation_digest":"sha256:895089a86759cfb976b8a03c5ea60611514fe421017d1da1bcd377d686b6238c","observation_id":"20189093-0b97-45f4-8f59-facd5b977006","resolution":{"observed_at":"2026-06-30T12:04:38.792275Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06059","last_updated":"2024-01-11T17:24:49Z","snapshot_observed_at":"2026-07-06T17:14:24.413664Z","submitted_at":"2024-01-11T17:24:49Z","title":"Investigating Data Contamination for Pre-training Language Models","version":1},"cited_work":{"arxiv_id":"2401.06059","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2401.06059","snapshot_observed_at":"2026-07-02T21:17:24.167881Z","title":"Sayash Kapoor and Arvind Narayanan","venue":null,"work_id":"c73162cf-f918-4be7-be6d-2702d58b0c12","year":2024},"citing_paper":{"arxiv_id":"2606.28551","last_updated":"2026-06-30T20:49:34Z","snapshot_observed_at":"2026-08-02T23:02:11.703134Z","submitted_at":"2026-06-26T19:11:29Z","title":"DataComp-VLM: Improved Open Datasets for Vision-Language Models","version":1},"reference_index":115,"source":"pdf_text","source_observed_at":"2026-06-30T01:16:16.834861Z"},"links":{"cited_paper":"/paper/2401.06059","citing_paper":"/paper/2606.28551"},"observation_digest":"sha256:72c02b1ec015823bb27dc82208022b86e018f0ed0ff8e08e76ddb9ca1068dd6a","observation_id":"f0e50035-da39-45b2-a795-5de66d88e973","resolution":{"observed_at":"2026-07-01T15:45:47.570680Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06059","last_updated":"2024-01-11T17:24:49Z","snapshot_observed_at":"2026-07-06T17:14:24.413664Z","submitted_at":"2024-01-11T17:24:49Z","title":"Investigating Data Contamination for Pre-training Language Models","version":1},"cited_work":{"arxiv_id":"2401.06059","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2401.06059","snapshot_observed_at":"2026-07-02T21:17:24.167881Z","title":"Sayash Kapoor and Arvind Narayanan","venue":null,"work_id":"c73162cf-f918-4be7-be6d-2702d58b0c12","year":2024},"citing_paper":{"arxiv_id":"2606.28551","last_updated":"2026-06-30T20:49:34Z","snapshot_observed_at":"2026-08-02T23:02:11.703134Z","submitted_at":"2026-06-26T19:11:29Z","title":"DataComp-VLM: Improved Open Datasets for Vision-Language Models","version":2},"reference_index":115,"source":"pdf_text","source_observed_at":"2026-07-02T21:10:10.548489Z"},"links":{"cited_paper":"/paper/2401.06059","citing_paper":"/paper/2606.28551"},"observation_digest":"sha256:aa21bb3628a4ff66d027e7254314706861fc7900ad013f76edf9b1054dc568cc","observation_id":"d690820f-a685-4ea9-92b7-ecfc5e511bf7","resolution":{"observed_at":"2026-07-02T21:17:24.169298Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2401.06059/citation-record","integrity":"/paper/2401.06059/integrity","json":"/paper/2401.06059/citation-record.json","paper":"/paper/2401.06059"},"outbound":[],"paper":{"arxiv_id":"2401.06059","last_updated":"2024-01-11T17:24:49Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-07-06T17:14:24.413664Z","submitted_at":"2024-01-11T17:24:49Z","title":"Investigating Data Contamination for Pre-training Language Models"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 11 inbound Pith citation observations for arXiv:2401.06059."}