{"as_of":"2026-08-10T13:30:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:5d006a4ed276074c7481adfb38c7ebda4b782b00c0fb76855725690aee91775f","coverage":[{"denominator":26,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":26,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-09T18:11:35.098478Z","state":"measured"},{"denominator":31,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":31,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":5,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":5,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T22:35:11.856700Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-02T20:57:23.351502Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.00678","last_updated":"2025-05-20T20:47:57Z","snapshot_observed_at":"2026-08-10T03:23:46.877552Z","submitted_at":"2025-02-02T05:50:39Z","title":"How Contaminated Is Your Benchmark? Quantifying Dataset Leakage in Large Language Models with Kernel Divergence","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.00678","snapshot_observed_at":"2026-08-06T22:35:11.856700Z","title":"K., Khanov, M., Wei, H., and Li, Y","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.21182","last_updated":"2025-06-26T12:40:48Z","snapshot_observed_at":"2026-08-09T18:28:33.802064Z","submitted_at":"2025-06-26T12:40:48Z","title":"Maintaining MTEB: Towards Long Term Usability and Reproducibility of Embedding Benchmarks","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-06T22:35:11.856700Z"},"links":{"cited_paper":"/paper/2502.00678","citing_paper":"/paper/2506.21182"},"observation_digest":"sha256:2f8fb731356eed51868f88aec8d0f380972300ca12896de6f27f9c8c35f8bc85","observation_id":"5730a9c4-46ad-4ad3-b5e8-92b0d06bd75d","resolution":{"observed_at":"2026-08-06T22:35:11.856700Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.00678","last_updated":"2025-05-20T20:47:57Z","snapshot_observed_at":"2026-08-10T03:23:46.877552Z","submitted_at":"2025-02-02T05:50:39Z","title":"How Contaminated Is Your Benchmark? Quantifying Dataset Leakage in Large Language Models with Kernel Divergence","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.00678","snapshot_observed_at":"2026-08-04T07:40:11.897460Z","title":"How contami- nated is your benchmark? quantifying and mitigating data leakage in llmevaluation,2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.24990","last_updated":"2026-08-02T21:17:46Z","snapshot_observed_at":"2026-08-06T23:23:59.021045Z","submitted_at":"2025-10-28T21:37:35Z","title":"The Economics of AI Training Data: A Research Agenda","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-04T07:40:11.897460Z"},"links":{"cited_paper":"/paper/2502.00678","citing_paper":"/paper/2510.24990"},"observation_digest":"sha256:0224064531928155179e6963f1d42c816f41a872b848619b6210673f333adc6c","observation_id":"de39f1bc-94b6-4e53-b903-ba3bd58af580","resolution":{"observed_at":"2026-08-04T07:40:11.897460Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.00678","last_updated":"2025-05-20T20:47:57Z","snapshot_observed_at":"2026-08-10T03:23:46.877552Z","submitted_at":"2025-02-02T05:50:39Z","title":"How Contaminated Is Your Benchmark? Quantifying Dataset Leakage in Large Language Models with Kernel Divergence","version":2},"cited_work":{"arxiv_id":"2502.00678","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.00678","snapshot_observed_at":"2026-07-02T20:57:23.351502Z","title":"InACL (Findings), pages 15094–15119","venue":null,"work_id":"a3aebd09-6e90-4039-a6aa-54f2ccbf83a5","year":2025},"citing_paper":{"arxiv_id":"2604.21255","last_updated":"2026-04-23T03:48:56Z","snapshot_observed_at":"2026-07-06T23:07:51.979267Z","submitted_at":"2026-04-23T03:48:56Z","title":"When Agents Look the Same: Quantifying Distillation-Induced Similarity in Tool-Use Behaviors","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-09T22:07:58.614654Z"},"links":{"cited_paper":"/paper/2502.00678","citing_paper":"/paper/2604.21255"},"observation_digest":"sha256:0d970f56aa89d60ed3470ff7c722add8bd24b1a7242a36319d45045501c44889","observation_id":"8d26c43a-aedc-4344-8d11-af3667d41ce5","resolution":{"observed_at":"2026-05-11T14:16:18.222490Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.00678","last_updated":"2025-05-20T20:47:57Z","snapshot_observed_at":"2026-08-10T03:23:46.877552Z","submitted_at":"2025-02-02T05:50:39Z","title":"How Contaminated Is Your Benchmark? Quantifying Dataset Leakage in Large Language Models with Kernel Divergence","version":2},"cited_work":{"arxiv_id":"2502.00678","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.00678","snapshot_observed_at":"2026-07-02T20:57:23.351502Z","title":"InACL (Findings), pages 15094–15119","venue":null,"work_id":"a3aebd09-6e90-4039-a6aa-54f2ccbf83a5","year":2025},"citing_paper":{"arxiv_id":"2606.07805","last_updated":"2026-06-05T19:33:58Z","snapshot_observed_at":"2026-08-03T01:44:22.181409Z","submitted_at":"2026-06-05T19:33:58Z","title":"Beyond Goodhart's Law: A Dynamic Benchmark for Evaluating Compliance in Multi-Agent Systems","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-27T21:53:37.616447Z"},"links":{"cited_paper":"/paper/2502.00678","citing_paper":"/paper/2606.07805"},"observation_digest":"sha256:8dea0ee52b561526003e3d70f695d3fcf291f70c6c306de6efd9588d1278d6bf","observation_id":"a86d04d6-a9a5-46c5-93c1-0cab8b5a3bee","resolution":{"observed_at":"2026-07-02T17:47:17.785130Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.00678","last_updated":"2025-05-20T20:47:57Z","snapshot_observed_at":"2026-08-10T03:23:46.877552Z","submitted_at":"2025-02-02T05:50:39Z","title":"How Contaminated Is Your Benchmark? Quantifying Dataset Leakage in Large Language Models with Kernel Divergence","version":2},"cited_work":{"arxiv_id":"2502.00678","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.00678","snapshot_observed_at":"2026-07-02T20:57:23.351502Z","title":"InACL (Findings), pages 15094–15119","venue":null,"work_id":"a3aebd09-6e90-4039-a6aa-54f2ccbf83a5","year":2025},"citing_paper":{"arxiv_id":"2606.07996","last_updated":"2026-06-06T06:27:54Z","snapshot_observed_at":"2026-07-31T22:22:12.944552Z","submitted_at":"2026-06-06T06:27:54Z","title":"MC-PDD: Masked Corpus-Level Pretraining Data Detection for Black-Box Large Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-27T20:02:50.169589Z"},"links":{"cited_paper":"/paper/2502.00678","citing_paper":"/paper/2606.07996"},"observation_digest":"sha256:7f57e84a69c699810c08a0b42afa6b9018f950ad614f3333a84d0d220714a00c","observation_id":"115f0cf7-4813-46ac-9c84-79ba0c1a5787","resolution":{"observed_at":"2026-07-02T20:57:23.353100Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2502.00678/citation-record","integrity":"/paper/2502.00678/integrity","json":"/paper/2502.00678/citation-record.json","paper":"/paper/2502.00678"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2404.14219","last_updated":"2024-08-30T21:17:17Z","snapshot_observed_at":"2026-07-06T18:03:47.096406Z","submitted_at":"2024-04-22T14:32:33Z","title":"Phi-3 Technical Report: A Highly Capable Language Model Locally on Your Phone","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14219","snapshot_observed_at":"2026-08-09T18:11:34.947486Z","title":"A., Bach, N., Bahree, A., Bakhtiari, A., Bao, J., Behl, H., et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.00678","last_updated":"2025-05-20T20:47:57Z","snapshot_observed_at":"2026-08-10T03:23:46.877552Z","submitted_at":"2025-02-02T05:50:39Z","title":"How Contaminated Is Your Benchmark? Quantifying Dataset Leakage in Large Language Models with Kernel Divergence","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-09T18:11:34.947486Z"},"links":{"cited_paper":"/paper/2404.14219","citing_paper":"/paper/2502.00678"},"observation_digest":"sha256:8bee9476a1575df5c4ac3c23dfe19153aa5108aa9961fadcddd7e3b70f102f4d","observation_id":"bb849fbc-970b-4e1b-ab44-338ff21a7591","resolution":{"observed_at":"2026-08-09T18:11:34.947486Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:11:35.431833Z","title":"(Zhang et al., 2024b) Following the general guideline from Shi et al","venue":null,"work_id":"e0604355-a4ff-47e1-a937-c3fd09ea76ad","year":2023},"citing_paper":{"arxiv_id":"2502.00678","last_updated":"2025-05-20T20:47:57Z","snapshot_observed_at":"2026-08-10T03:23:46.877552Z","submitted_at":"2025-02-02T05:50:39Z","title":"How Contaminated Is Your Benchmark? Quantifying Dataset Leakage in Large Language Models with Kernel Divergence","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-09T18:11:35.084471Z"},"links":{"citing_paper":"/paper/2502.00678"},"observation_digest":"sha256:1ac7a2c17f3fad6e8e0331f3e9ce579980273334ea622738ffbfc783fb48da15","observation_id":"bfa9bf10-aa11-43b1-a081-2afb92c7fc09","resolution":{"observed_at":"2026-08-09T18:11:35.436601Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-09T18:11:34.970153Z","title":"The llama 3 herd of models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.00678","last_updated":"2025-05-20T20:47:57Z","snapshot_observed_at":"2026-08-10T03:23:46.877552Z","submitted_at":"2025-02-02T05:50:39Z","title":"How Contaminated Is Your Benchmark? Quantifying Dataset Leakage in Large Language Models with Kernel Divergence","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-09T18:11:34.970153Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2502.00678"},"observation_digest":"sha256:757ad1820e3c825696a34fa52d325205a1a857ee1e76f5a628763cd1e788642c","observation_id":"879901bd-1977-4398-ada3-dc5b43f38fe9","resolution":{"observed_at":"2026-08-09T18:11:34.970153Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:11:35.400377Z","title":null,"venue":null,"work_id":"a2365589-befd-4f62-af59-d40eda8bdb88","year":2019},"citing_paper":{"arxiv_id":"2502.00678","last_updated":"2025-05-20T20:47:57Z","snapshot_observed_at":"2026-08-10T03:23:46.877552Z","submitted_at":"2025-02-02T05:50:39Z","title":"How Contaminated Is Your Benchmark? Quantifying Dataset Leakage in Large Language Models with Kernel Divergence","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-09T18:11:35.098478Z"},"links":{"citing_paper":"/paper/2502.00678"},"observation_digest":"sha256:33f3256120b2d97795dfb05ca445338d5aa8b49ac1922adaeb291976af2b023f","observation_id":"4a46c49a-6714-4e3d-a5e7-131cff9d6377","resolution":{"observed_at":"2026-08-09T18:11:35.406481Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06825","last_updated":"2023-10-10T17:54:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-10T17:54:58Z","title":"Mistral 7B","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06825","snapshot_observed_at":"2026-08-09T18:11:34.987432Z","title":"Q., Sablayrolles, A., Mensch, A., Bamford, C., Chaplot, D","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.00678","last_updated":"2025-05-20T20:47:57Z","snapshot_observed_at":"2026-08-10T03:23:46.877552Z","submitted_at":"2025-02-02T05:50:39Z","title":"How Contaminated Is Your Benchmark? Quantifying Dataset Leakage in Large Language Models with Kernel Divergence","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-09T18:11:34.987432Z"},"links":{"cited_paper":"/paper/2310.06825","citing_paper":"/paper/2502.00678"},"observation_digest":"sha256:4eab855a06a0d7d5ebe55a338dcfdc915fd48735aa7131a851cce917c8c07b82","observation_id":"887b68ba-8e61-4389-9e2b-5ef7506c35d2","resolution":{"observed_at":"2026-08-09T18:11:34.987432Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06443","last_updated":"2024-06-10T16:34:43Z","snapshot_observed_at":"2026-08-09T18:27:52.013296Z","submitted_at":"2024-06-10T16:34:43Z","title":"LLM Dataset Inference: Did you train on my dataset?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.06443","snapshot_observed_at":"2026-08-09T18:11:34.998168Z","title":"Llm dataset inference: Did you train on my dataset? arXiv preprint arXiv:2406.06443,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.00678","last_updated":"2025-05-20T20:47:57Z","snapshot_observed_at":"2026-08-10T03:23:46.877552Z","submitted_at":"2025-02-02T05:50:39Z","title":"How Contaminated Is Your Benchmark? Quantifying Dataset Leakage in Large Language Models with Kernel Divergence","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-09T18:11:34.998168Z"},"links":{"cited_paper":"/paper/2406.06443","citing_paper":"/paper/2502.00678"},"observation_digest":"sha256:c182ce49c1c49c810718d36c10bf0a0ecd4636dfafa23b2bf5dfd42898d195aa","observation_id":"0adbbb53-c35e-49db-8669-51a7c8fe38d5","resolution":{"observed_at":"2026-08-09T18:11:34.998168Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:11:35.560592Z","title":"Membership inference attacks against language models via neighbourhood comparison","venue":null,"work_id":"c3fea220-e322-4da7-9b32-1f560ffa7936","year":2023},"citing_paper":{"arxiv_id":"2502.00678","last_updated":"2025-05-20T20:47:57Z","snapshot_observed_at":"2026-08-10T03:23:46.877552Z","submitted_at":"2025-02-02T05:50:39Z","title":"How Contaminated Is Your Benchmark? Quantifying Dataset Leakage in Large Language Models with Kernel Divergence","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-09T18:11:35.003361Z"},"links":{"citing_paper":"/paper/2502.00678"},"observation_digest":"sha256:49fdf8974783dc43fa9029035366f06e5a8137031d259a8422b64492ddca15c8","observation_id":"09105b28-314f-49fe-a8a7-607fd01f4691","resolution":{"observed_at":"2026-08-09T18:11:35.565685Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.17975","last_updated":"2025-03-07T16:30:07Z","snapshot_observed_at":"2026-07-06T18:37:04.753504Z","submitted_at":"2024-06-25T23:12:07Z","title":"SoK: Membership Inference Attacks on LLMs are Rushing Nowhere (and How to Fix It)","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.17975","snapshot_observed_at":"2026-08-09T18:11:35.009058Z","title":"Sok: Membership inference attacks on llms are rushing nowhere (and how to fix it)","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.00678","last_updated":"2025-05-20T20:47:57Z","snapshot_observed_at":"2026-08-10T03:23:46.877552Z","submitted_at":"2025-02-02T05:50:39Z","title":"How Contaminated Is Your Benchmark? Quantifying Dataset Leakage in Large Language Models with Kernel Divergence","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-09T18:11:35.009058Z"},"links":{"cited_paper":"/paper/2406.17975","citing_paper":"/paper/2502.00678"},"observation_digest":"sha256:16d5f98d158157071329bf13ab59025ba23d36ab294ee23690904ff8cac0f9df","observation_id":"8405e8ad-d6e8-4f2f-ad6f-30c73754bd17","resolution":{"observed_at":"2026-08-09T18:11:35.009058Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:11:35.544274Z","title":"Ml-leaks: Model and data independent membership inference attacks and defenses on machine learning models","venue":null,"work_id":"c17d25a4-e43c-4700-bdd4-4e958ec97646","year":2019},"citing_paper":{"arxiv_id":"2502.00678","last_updated":"2025-05-20T20:47:57Z","snapshot_observed_at":"2026-08-10T03:23:46.877552Z","submitted_at":"2025-02-02T05:50:39Z","title":"How Contaminated Is Your Benchmark? Quantifying Dataset Leakage in Large Language Models with Kernel Divergence","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-09T18:11:35.014747Z"},"links":{"citing_paper":"/paper/2502.00678"},"observation_digest":"sha256:18dad87047197123d9a1b442d3f7160daaf61672c9ad163a98debe4f545e1f42","observation_id":"3f0a361d-ecfc-4827-802d-c2cc8e15f1bb","resolution":{"observed_at":"2026-08-09T18:11:35.549603Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:11:35.528766Z","title":"Membership inference attacks against machine learning models","venue":null,"work_id":"600ddd3f-100e-48dc-93e1-67e69f1a9d93","year":2017},"citing_paper":{"arxiv_id":"2502.00678","last_updated":"2025-05-20T20:47:57Z","snapshot_observed_at":"2026-08-10T03:23:46.877552Z","submitted_at":"2025-02-02T05:50:39Z","title":"How Contaminated Is Your Benchmark? Quantifying Dataset Leakage in Large Language Models with Kernel Divergence","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-09T18:11:35.019574Z"},"links":{"citing_paper":"/paper/2502.00678"},"observation_digest":"sha256:0562c24aa02cd914591bf45a8b41dd2166898051d3db5489dcd22da5c3cba0e9","observation_id":"015c0602-a631-469f-a2ce-6142c3a11e43","resolution":{"observed_at":"2026-08-09T18:11:35.533665Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04244","last_updated":"2024-06-06T16:41:39Z","snapshot_observed_at":"2026-07-30T15:43:06.151242Z","submitted_at":"2024-06-06T16:41:39Z","title":"Benchmark Data Contamination of Large Language Models: A Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04244","snapshot_observed_at":"2026-08-09T18:11:35.035966Z","title":"Benchmark data contamination of large language models: A survey","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.00678","last_updated":"2025-05-20T20:47:57Z","snapshot_observed_at":"2026-08-10T03:23:46.877552Z","submitted_at":"2025-02-02T05:50:39Z","title":"How Contaminated Is Your Benchmark? Quantifying Dataset Leakage in Large Language Models with Kernel Divergence","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-09T18:11:35.035966Z"},"links":{"cited_paper":"/paper/2406.04244","citing_paper":"/paper/2502.00678"},"observation_digest":"sha256:a02085a219420d8fb9ab3ddb136fb7303e4e4938aac44c2bbddb167be98a3d2e","observation_id":"44cd797b-fed2-446f-bc3f-1e6a6442aea9","resolution":{"observed_at":"2026-08-09T18:11:35.035966Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.04850","last_updated":"2023-11-11T05:11:18Z","snapshot_observed_at":"2026-08-07T11:21:12.881808Z","submitted_at":"2023-11-08T17:35:20Z","title":"Rethinking Benchmark and Contamination for Language Models with Rephrased Samples","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.04850","snapshot_observed_at":"2026-08-09T18:11:35.042417Z","title":"E., and Stoica, I","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.00678","last_updated":"2025-05-20T20:47:57Z","snapshot_observed_at":"2026-08-10T03:23:46.877552Z","submitted_at":"2025-02-02T05:50:39Z","title":"How Contaminated Is Your Benchmark? Quantifying Dataset Leakage in Large Language Models with Kernel Divergence","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-09T18:11:35.042417Z"},"links":{"cited_paper":"/paper/2311.04850","citing_paper":"/paper/2502.00678"},"observation_digest":"sha256:8bfe9038a87ab1790556c8cfc0032c6e8d98f7bd571fb6ebd0f3e9e3d54010d4","observation_id":"f0d39c96-8140-4530-b269-887097046d2b","resolution":{"observed_at":"2026-08-09T18:11:35.042417Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.11930","last_updated":"2024-06-03T05:21:54Z","snapshot_observed_at":"2026-08-04T17:31:50.682797Z","submitted_at":"2024-05-20T10:12:23Z","title":"Data Contamination Calibration for Black-box LLMs","version":2},"cited_work":{"arxiv_id":"2405.11930","doi":null,"metadata_source":"pith","pith_arxiv_id":"2405.11930","snapshot_observed_at":"2026-08-09T18:11:35.176987Z","title":"Data Contamination Calibration for Black-box LLMs","venue":"cs.LG","work_id":"2ef90991-2ca2-4955-b1e1-65a6d919680f","year":2024},"citing_paper":{"arxiv_id":"2502.00678","last_updated":"2025-05-20T20:47:57Z","snapshot_observed_at":"2026-08-10T03:23:46.877552Z","submitted_at":"2025-02-02T05:50:39Z","title":"How Contaminated Is Your Benchmark? Quantifying Dataset Leakage in Large Language Models with Kernel Divergence","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-09T18:11:35.048213Z"},"links":{"cited_paper":"/paper/2405.11930","citing_paper":"/paper/2502.00678"},"observation_digest":"sha256:1288d76bca7b9f097e03fb307d7d90a0ba1e9674ac48421a3273589a2883fbdf","observation_id":"ef5ef6ad-6de3-4432-8b49-7de7271cd8cd","resolution":{"observed_at":"2026-08-09T18:11:35.184580Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:11:35.480706Z","title":"Privacy risk in machine learning: Analyzing the connection to overfitting","venue":null,"work_id":"b5ec04ac-5b75-46d9-b018-2ac0bbadce3d","year":2018},"citing_paper":{"arxiv_id":"2502.00678","last_updated":"2025-05-20T20:47:57Z","snapshot_observed_at":"2026-08-10T03:23:46.877552Z","submitted_at":"2025-02-02T05:50:39Z","title":"How Contaminated Is Your Benchmark? Quantifying Dataset Leakage in Large Language Models with Kernel Divergence","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-09T18:11:35.053559Z"},"links":{"citing_paper":"/paper/2502.00678"},"observation_digest":"sha256:3b7432fd5050e55b9a1ccffd1fcd72d3e197beba90dcc2e79406784c4cc69f14","observation_id":"3fa586d9-50da-44e0-8a06-152d79c0206f","resolution":{"observed_at":"2026-08-09T18:11:35.486631Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:11:35.447534Z","title":"12 A.2 Baseline Definitions","venue":null,"work_id":"b32bb36f-b021-4287-babb-92a1b19da04a","year":2021},"citing_paper":{"arxiv_id":"2502.00678","last_updated":"2025-05-20T20:47:57Z","snapshot_observed_at":"2026-08-10T03:23:46.877552Z","submitted_at":"2025-02-02T05:50:39Z","title":"How Contaminated Is Your Benchmark? Quantifying Dataset Leakage in Large Language Models with Kernel Divergence","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-09T18:11:35.076722Z"},"links":{"citing_paper":"/paper/2502.00678"},"observation_digest":"sha256:9777c657fbd3f9bf4f885ad35998f6897703899c59605bac7120ad919bca2706","observation_id":"90dc6e0b-1c27-47db-b0e2-33779ca6362a","resolution":{"observed_at":"2026-08-09T18:11:35.452800Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:11:35.416722Z","title":"The average Mean Absolute Percentage Error (MAPE) over 5 independent runs is calculated","venue":null,"work_id":"7aa49480-63df-4da3-9111-71b370142743","year":1974},"citing_paper":{"arxiv_id":"2502.00678","last_updated":"2025-05-20T20:47:57Z","snapshot_observed_at":"2026-08-10T03:23:46.877552Z","submitted_at":"2025-02-02T05:50:39Z","title":"How Contaminated Is Your Benchmark? Quantifying Dataset Leakage in Large Language Models with Kernel Divergence","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-09T18:11:35.091111Z"},"links":{"citing_paper":"/paper/2502.00678"},"observation_digest":"sha256:7c0d20211a24cddb0170dd87d137a93e6fb343b83759f415ddbd5e7decd14315","observation_id":"7cc0da30-7910-492c-8f4b-1c580a7f0c9c","resolution":{"observed_at":"2026-08-09T18:11:35.421671Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2101.00027","last_updated":"2020-12-31T19:00:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-12-31T19:00:10Z","title":"The Pile: An 800GB Dataset of Diverse Text for Language Modeling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2101.00027","snapshot_observed_at":"2026-08-09T18:11:34.975510Z","title":"The pile: An 800gb dataset of diverse text for language modeling","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.00678","last_updated":"2025-05-20T20:47:57Z","snapshot_observed_at":"2026-08-10T03:23:46.877552Z","submitted_at":"2025-02-02T05:50:39Z","title":"How Contaminated Is Your Benchmark? Quantifying Dataset Leakage in Large Language Models with Kernel Divergence","version":2},"reference_index":2008,"source":"pdf_text","source_observed_at":"2026-08-09T18:11:34.975510Z"},"links":{"cited_paper":"/paper/2101.00027","citing_paper":"/paper/2502.00678"},"observation_digest":"sha256:dc6722c1f632a4a4a7cc20dd1a005a78c853fb0482f155d7bb83e395682fa91d","observation_id":"30daf7d6-c258-4f91-91bc-5eba05eb9b59","resolution":{"observed_at":"2026-08-09T18:11:34.975510Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:11:35.512970Z","title":"E., Yu, L., and Wei, W","venue":null,"work_id":"00e1d767-98da-45be-8d0d-e4e7bda8d809","year":null},"citing_paper":{"arxiv_id":"2502.00678","last_updated":"2025-05-20T20:47:57Z","snapshot_observed_at":"2026-08-10T03:23:46.877552Z","submitted_at":"2025-02-02T05:50:39Z","title":"How Contaminated Is Your Benchmark? Quantifying Dataset Leakage in Large Language Models with Kernel Divergence","version":2},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-09T18:11:35.025123Z"},"links":{"citing_paper":"/paper/2502.00678"},"observation_digest":"sha256:731927a3bb487a0db3c7f257dc4b74e87c713b99b8fc8ebe49a22159b332970d","observation_id":"92f9f1af-368d-4e0a-9966-cbe9e650b31a","resolution":{"observed_at":"2026-08-09T18:11:35.518051Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:11:35.463327Z","title":"Pacost: Paired confidence signifi- cance testing for benchmark contamination detection in large language models","venue":null,"work_id":"db981643-3ce6-46fd-8af9-23d8a86cc521","year":2024},"citing_paper":{"arxiv_id":"2502.00678","last_updated":"2025-05-20T20:47:57Z","snapshot_observed_at":"2026-08-10T03:23:46.877552Z","submitted_at":"2025-02-02T05:50:39Z","title":"How Contaminated Is Your Benchmark? Quantifying Dataset Leakage in Large Language Models with Kernel Divergence","version":2},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-09T18:11:35.060786Z"},"links":{"citing_paper":"/paper/2502.00678"},"observation_digest":"sha256:c24d397a615ae272a1668fb51b0eb134a444682be9e8a0d420fb49117cfe4957","observation_id":"8e4155d1-edb0-487b-ae2e-ba55cb706357","resolution":{"observed_at":"2026-08-09T18:11:35.468730Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:11:35.497825Z","title":"Recall: Membership inference via relative conditional log-likelihoods","venue":null,"work_id":"c095061b-73bc-4f88-bd95-dcc57bfe3c33","year":2024},"citing_paper":{"arxiv_id":"2502.00678","last_updated":"2025-05-20T20:47:57Z","snapshot_observed_at":"2026-08-10T03:23:46.877552Z","submitted_at":"2025-02-02T05:50:39Z","title":"How Contaminated Is Your Benchmark? Quantifying Dataset Leakage in Large Language Models with Kernel Divergence","version":2},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-09T18:11:35.030199Z"},"links":{"citing_paper":"/paper/2502.00678"},"observation_digest":"sha256:82106293d712dcd1f21a2c3438dd929395634c02bdbd8378eeed41272bf7366b","observation_id":"a7e9ed35-e4ff-4327-8cfb-c9b365c15e7a","resolution":{"observed_at":"2026-08-09T18:11:35.502641Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.07269","last_updated":"2018-10-30T09:48:51Z","snapshot_observed_at":"2026-07-06T05:52:17.418793Z","submitted_at":"2017-07-23T09:32:55Z","title":"Large sample analysis of the median heuristic","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.07269","snapshot_observed_at":"2026-08-09T18:11:34.981613Z","title":"Large sample anal- ysis of the median heuristic","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.00678","last_updated":"2025-05-20T20:47:57Z","snapshot_observed_at":"2026-08-10T03:23:46.877552Z","submitted_at":"2025-02-02T05:50:39Z","title":"How Contaminated Is Your Benchmark? Quantifying Dataset Leakage in Large Language Models with Kernel Divergence","version":2},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-09T18:11:34.981613Z"},"links":{"cited_paper":"/paper/1707.07269","citing_paper":"/paper/2502.00678"},"observation_digest":"sha256:e739a60272faf8d7557062e3d9e80a4ed83b7b95f3cafb7b7f9f206ba6f067e7","observation_id":"8b640970-a1ca-483a-85f8-e72e513ae93f","resolution":{"observed_at":"2026-08-09T18:11:34.981613Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:11:35.575709Z","title":"Membership inference attacks from first principles","venue":null,"work_id":"7ae4cd15-4054-4b2d-be01-9294ae0af82b","year":2022},"citing_paper":{"arxiv_id":"2502.00678","last_updated":"2025-05-20T20:47:57Z","snapshot_observed_at":"2026-08-10T03:23:46.877552Z","submitted_at":"2025-02-02T05:50:39Z","title":"How Contaminated Is Your Benchmark? Quantifying Dataset Leakage in Large Language Models with Kernel Divergence","version":2},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-09T18:11:34.953153Z"},"links":{"citing_paper":"/paper/2502.00678"},"observation_digest":"sha256:2461343992d1acd1c008c0fb1169a33bc9e3c4343089a8e411b2445f6e492523","observation_id":"d5dd60fc-049e-4416-9e02-b4915a6c2127","resolution":{"observed_at":"2026-08-09T18:11:35.580716Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16201","last_updated":"2025-03-30T08:39:32Z","snapshot_observed_at":"2026-08-10T01:25:04.579166Z","submitted_at":"2024-06-23T19:40:11Z","title":"Blind Baselines Beat Membership Inference Attacks for Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16201","snapshot_observed_at":"2026-08-09T18:11:34.958297Z","title":"Blind baselines beat member- ship inference attacks for foundation models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.00678","last_updated":"2025-05-20T20:47:57Z","snapshot_observed_at":"2026-08-10T03:23:46.877552Z","submitted_at":"2025-02-02T05:50:39Z","title":"How Contaminated Is Your Benchmark? Quantifying Dataset Leakage in Large Language Models with Kernel Divergence","version":2},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-09T18:11:34.958297Z"},"links":{"cited_paper":"/paper/2406.16201","citing_paper":"/paper/2502.00678"},"observation_digest":"sha256:c39067ecaaf7c09b794be505b9e3eeffde4bffc406af72780e503ebd5315da4a","observation_id":"50c0aa63-13be-43e9-b518-401304874202","resolution":{"observed_at":"2026-08-09T18:11:34.958297Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.10677","last_updated":"2023-09-27T01:15:49Z","snapshot_observed_at":"2026-07-06T16:20:36.866744Z","submitted_at":"2023-09-19T15:02:58Z","title":"Estimating Contamination via Perplexity: Quantifying Memorisation in Language Model Evaluation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.10677","snapshot_observed_at":"2026-08-09T18:11:34.992365Z","title":"Estimating contamination via perplexity: Quantifying memorisation in language model evaluation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.00678","last_updated":"2025-05-20T20:47:57Z","snapshot_observed_at":"2026-08-10T03:23:46.877552Z","submitted_at":"2025-02-02T05:50:39Z","title":"How Contaminated Is Your Benchmark? Quantifying Dataset Leakage in Large Language Models with Kernel Divergence","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-09T18:11:34.992365Z"},"links":{"cited_paper":"/paper/2309.10677","citing_paper":"/paper/2502.00678"},"observation_digest":"sha256:bb4a6b54ef9998f785db0ef4fc46fed0b240f62194045f6c0ec046af47d65dc4","observation_id":"033cd38c-224c-43f2-9ddd-98674589c3f8","resolution":{"observed_at":"2026-08-09T18:11:34.992365Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.07841","last_updated":"2024-09-16T13:18:23Z","snapshot_observed_at":"2026-08-07T03:58:21.441544Z","submitted_at":"2024-02-12T17:52:05Z","title":"Do Membership Inference Attacks Work on Large Language Models?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.07841","snapshot_observed_at":"2026-08-09T18:11:34.963750Z","title":"Do membership inference attacks work on large language models? arXiv preprint arXiv:2402.07841,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.00678","last_updated":"2025-05-20T20:47:57Z","snapshot_observed_at":"2026-08-10T03:23:46.877552Z","submitted_at":"2025-02-02T05:50:39Z","title":"How Contaminated Is Your Benchmark? Quantifying Dataset Leakage in Large Language Models with Kernel Divergence","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-09T18:11:34.963750Z"},"links":{"cited_paper":"/paper/2402.07841","citing_paper":"/paper/2502.00678"},"observation_digest":"sha256:de42e3e9c7d7e570522e289019c8e27e84a28bad18c06dc1e8aa3c0e8cb28095","observation_id":"57b9cc5d-0258-4efa-9f55-6067991adbed","resolution":{"observed_at":"2026-08-09T18:11:34.963750Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02936","last_updated":"2025-02-12T04:41:34Z","snapshot_observed_at":"2026-08-06T22:02:50.460833Z","submitted_at":"2024-04-03T04:25:01Z","title":"Min-K%++: Improved Baseline for Detecting Pre-Training Data from Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02936","snapshot_observed_at":"2026-08-09T18:11:35.067065Z","title":"F., and Li, H","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.00678","last_updated":"2025-05-20T20:47:57Z","snapshot_observed_at":"2026-08-10T03:23:46.877552Z","submitted_at":"2025-02-02T05:50:39Z","title":"How Contaminated Is Your Benchmark? Quantifying Dataset Leakage in Large Language Models with Kernel Divergence","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-09T18:11:35.067065Z"},"links":{"cited_paper":"/paper/2404.02936","citing_paper":"/paper/2502.00678"},"observation_digest":"sha256:c1c6da71e4065a73996df16c2d07fe7d2607b777e7282133b04bc4363bf5e7bc","observation_id":"f43d9dd4-aadf-4745-abd3-8350063f0700","resolution":{"observed_at":"2026-08-09T18:11:35.067065Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2502.00678","last_updated":"2025-05-20T20:47:57Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-10T03:23:46.877552Z","submitted_at":"2025-02-02T05:50:39Z","title":"How Contaminated Is Your Benchmark? Quantifying Dataset Leakage in Large Language Models with Kernel Divergence"},"reference_resolution":{"displayed":26,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":14,"verified_exact":1,"verified_fuzzy":11},"total_outbound_references":26},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 26 of 26 outbound references and 5 inbound Pith citation observations for arXiv:2502.00678."}