{"as_of":"2026-08-17T22:09:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:beed69ffc22cd59dc6c0dd0ec2219bce55e1aa686e41dc63094bb91815bf4a55","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":11,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":11,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":11,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":11,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T17:01:31.426943Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":5,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2305.10160","last_updated":"2023-10-18T13:17:13Z","snapshot_observed_at":"2026-08-16T15:32:22.458268Z","submitted_at":"2023-05-17T12:23:38Z","title":"Stop Uploading Test Data in Plain Text: Practical Strategies for Mitigating Data Contamination by Evaluation Benchmarks","version":2},"cited_work":{"arxiv_id":"2305.10160","doi":"10.48550/arxiv.2305.10160","metadata_source":"arxiv_reference","pith_arxiv_id":"2305.10160","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Stop uploading test data in plain text: Practical strategies for mitigating data contamination by evaluation benchmarks","venue":"arXiv (Cornell University)","work_id":"fc2502a0-2c44-4a07-9561-fb571d2d5d4f","year":2023},"citing_paper":{"arxiv_id":"2402.13228","last_updated":"2024-07-03T13:46:33Z","snapshot_observed_at":"2026-08-14T02:18:02.339361Z","submitted_at":"2024-02-20T18:42:34Z","title":"Smaug: Fixing Failure Modes of Preference Optimisation with DPO-Positive","version":2},"reference_index":124,"source":"arxiv_source","source_observed_at":"2026-05-17T23:04:44.287660Z"},"links":{"cited_paper":"/paper/2305.10160","citing_paper":"/paper/2402.13228"},"observation_digest":"sha256:1708a0ebc6f4a382a64955a28cdd96241b1c26e823757ba01d497344cc4c39c4","observation_id":"37f0bed8-eb3f-4f69-b81e-727a2200282e","resolution":{"observed_at":"2026-05-17T23:04:44.484284Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10160","last_updated":"2023-10-18T13:17:13Z","snapshot_observed_at":"2026-08-16T15:32:22.458268Z","submitted_at":"2023-05-17T12:23:38Z","title":"Stop Uploading Test Data in Plain Text: Practical Strategies for Mitigating Data Contamination by Evaluation Benchmarks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10160","snapshot_observed_at":"2026-08-12T17:01:31.426943Z","title":"Stop uploading test data in plain text: Practical strategies for mitigating data contamination by evaluation benchmarks","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.12990","last_updated":"2024-11-20T02:38:24Z","snapshot_observed_at":"2026-08-15T16:44:51.681960Z","submitted_at":"2024-11-20T02:38:24Z","title":"BetterBench: Assessing AI Benchmarks, Uncovering Issues, and Establishing Best Practices","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-12T17:01:31.426943Z"},"links":{"cited_paper":"/paper/2305.10160","citing_paper":"/paper/2411.12990"},"observation_digest":"sha256:9089ab41f3b968d58d5dd2ea56ad7781201067efc77f0ec05f53e39c86cda598","observation_id":"0f038c9f-2969-4ee3-bd78-e5e79d30df6e","resolution":{"observed_at":"2026-08-12T17:01:31.426943Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10160","last_updated":"2023-10-18T13:17:13Z","snapshot_observed_at":"2026-08-16T15:32:22.458268Z","submitted_at":"2023-05-17T12:23:38Z","title":"Stop Uploading Test Data in Plain Text: Practical Strategies for Mitigating Data Contamination by Evaluation Benchmarks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10160","snapshot_observed_at":"2026-08-11T12:58:02.061334Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.13670","last_updated":"2025-05-29T03:19:42Z","snapshot_observed_at":"2026-08-17T16:22:04.433511Z","submitted_at":"2024-12-18T09:53:12Z","title":"AntiLeakBench: Preventing Data Contamination by Automatically Constructing Benchmarks with Updated Real-World Knowledge","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-11T12:58:02.061334Z"},"links":{"cited_paper":"/paper/2305.10160","citing_paper":"/paper/2412.13670"},"observation_digest":"sha256:3343e7bb193a0955f5215e1abdf1f69c3def3897d9b6e6a95e11b4c7b656f24f","observation_id":"c2402e30-e15d-44c7-95eb-752fd06122a3","resolution":{"observed_at":"2026-08-11T12:58:02.061334Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10160","last_updated":"2023-10-18T13:17:13Z","snapshot_observed_at":"2026-08-16T15:32:22.458268Z","submitted_at":"2023-05-17T12:23:38Z","title":"Stop Uploading Test Data in Plain Text: Practical Strategies for Mitigating Data Contamination by Evaluation Benchmarks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10160","snapshot_observed_at":"2026-08-07T10:54:26.282453Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.04142","last_updated":"2025-06-04T16:33:44Z","snapshot_observed_at":"2026-08-11T15:46:19.548845Z","submitted_at":"2025-06-04T16:33:44Z","title":"Establishing Trustworthy LLM Evaluation via Shortcut Neuron Analysis","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T10:54:26.282453Z"},"links":{"cited_paper":"/paper/2305.10160","citing_paper":"/paper/2506.04142"},"observation_digest":"sha256:d3ff30f37d8077128f7bc2550c22089cb81d88c5810022a2acb4d47857cfac37","observation_id":"def9805a-17ce-494c-bcb4-8975ff197ef5","resolution":{"observed_at":"2026-08-07T10:54:26.282453Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10160","last_updated":"2023-10-18T13:17:13Z","snapshot_observed_at":"2026-08-16T15:32:22.458268Z","submitted_at":"2023-05-17T12:23:38Z","title":"Stop Uploading Test Data in Plain Text: Practical Strategies for Mitigating Data Contamination by Evaluation Benchmarks","version":2},"cited_work":{"arxiv_id":"2305.10160","doi":"10.48550/arxiv.2305.10160","metadata_source":"arxiv_reference","pith_arxiv_id":"2305.10160","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Stop uploading test data in plain text: Practical strategies for mitigating data contamination by evaluation benchmarks","venue":"arXiv (Cornell University)","work_id":"fc2502a0-2c44-4a07-9561-fb571d2d5d4f","year":2023},"citing_paper":{"arxiv_id":"2507.01955","last_updated":"2026-05-01T00:57:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-02T17:59:07Z","title":"How Well Does GPT-4o Understand Vision? Evaluating Multimodal Foundation Models on Standard Computer Vision Tasks","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-19T05:55:09.188048Z"},"links":{"cited_paper":"/paper/2305.10160","citing_paper":"/paper/2507.01955"},"observation_digest":"sha256:8c0848be790e7526ea01182552878e15ac255b7c33d6294072a3753d6de93ffe","observation_id":"8948bcd2-cb98-4b5b-a743-8de1248f04a9","resolution":{"observed_at":"2026-05-19T05:57:07.979885Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10160","last_updated":"2023-10-18T13:17:13Z","snapshot_observed_at":"2026-08-16T15:32:22.458268Z","submitted_at":"2023-05-17T12:23:38Z","title":"Stop Uploading Test Data in Plain Text: Practical Strategies for Mitigating Data Contamination by Evaluation Benchmarks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10160","snapshot_observed_at":"2026-08-03T06:46:26.230145Z","title":"Stop uploading test data in plain text: Practical strategies for mitigating data contamination by evaluation benchmarks.arXiv preprint arXiv:2305.10160, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2601.22025","last_updated":"2026-06-09T23:57:32Z","snapshot_observed_at":"2026-08-07T21:40:38.906811Z","submitted_at":"2026-01-29T17:32:34Z","title":"When Generic Prompt Improvements Hurt: Evaluation-Driven Iteration for LLM Applications","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-03T06:46:26.230145Z"},"links":{"cited_paper":"/paper/2305.10160","citing_paper":"/paper/2601.22025"},"observation_digest":"sha256:b91ee0934325932c103dab53a19b2780a03a9a77e49c7272eeb8d6af96e3d112","observation_id":"1b7beccb-dbfb-4fc2-913d-02deb0567a92","resolution":{"observed_at":"2026-08-03T06:46:26.230145Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10160","last_updated":"2023-10-18T13:17:13Z","snapshot_observed_at":"2026-08-16T15:32:22.458268Z","submitted_at":"2023-05-17T12:23:38Z","title":"Stop Uploading Test Data in Plain Text: Practical Strategies for Mitigating Data Contamination by Evaluation Benchmarks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10160","snapshot_observed_at":"2026-08-03T03:04:43.721746Z","title":"Stop uploading test data in plain text: Practical strategies for mitigating data contamination by evaluation benchmarks.arXiv preprint arXiv:2305.10160,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.09305","last_updated":"2026-06-28T18:13:37Z","snapshot_observed_at":"2026-08-12T17:14:29.445906Z","submitted_at":"2026-02-10T00:45:24Z","title":"Reward Modeling for Reinforcement Learning-Based LLM Reasoning: Design, Challenges, and Evaluation","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-03T03:04:43.721746Z"},"links":{"cited_paper":"/paper/2305.10160","citing_paper":"/paper/2602.09305"},"observation_digest":"sha256:0d04003468b3af06b803f6ccbd88ab04b3b3d2f61680fe497954ad327d55a8f2","observation_id":"6dfe038a-0acd-4db3-ba54-d5683f83287b","resolution":{"observed_at":"2026-08-03T03:04:43.721746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10160","last_updated":"2023-10-18T13:17:13Z","snapshot_observed_at":"2026-08-16T15:32:22.458268Z","submitted_at":"2023-05-17T12:23:38Z","title":"Stop Uploading Test Data in Plain Text: Practical Strategies for Mitigating Data Contamination by Evaluation Benchmarks","version":2},"cited_work":{"arxiv_id":"2305.10160","doi":"10.48550/arxiv.2305.10160","metadata_source":"arxiv_reference","pith_arxiv_id":"2305.10160","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Stop uploading test data in plain text: Practical strategies for mitigating data contamination by evaluation benchmarks","venue":"arXiv (Cornell University)","work_id":"fc2502a0-2c44-4a07-9561-fb571d2d5d4f","year":2023},"citing_paper":{"arxiv_id":"2605.12673","last_updated":"2026-05-12T19:22:45Z","snapshot_observed_at":"2026-08-15T14:26:18.460325Z","submitted_at":"2026-05-12T19:22:45Z","title":"Do Androids Dream of Breaking the Game? Systematically Auditing AI Agent Benchmarks with BenchJack","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-14T20:31:50.043920Z"},"links":{"cited_paper":"/paper/2305.10160","citing_paper":"/paper/2605.12673"},"observation_digest":"sha256:584386c4e1b891f275fb057d26a8705c88dcc7fb336003c8d64c8902e64fa613","observation_id":"cff115f9-91d8-4e04-92c3-93e4e40e7104","resolution":{"observed_at":"2026-05-14T20:32:56.943868Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10160","last_updated":"2023-10-18T13:17:13Z","snapshot_observed_at":"2026-08-16T15:32:22.458268Z","submitted_at":"2023-05-17T12:23:38Z","title":"Stop Uploading Test Data in Plain Text: Practical Strategies for Mitigating Data Contamination by Evaluation Benchmarks","version":2},"cited_work":{"arxiv_id":"2305.10160","doi":"10.48550/arxiv.2305.10160","metadata_source":"arxiv_reference","pith_arxiv_id":"2305.10160","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Stop uploading test data in plain text: Practical strategies for mitigating data contamination by evaluation benchmarks","venue":"arXiv (Cornell University)","work_id":"fc2502a0-2c44-4a07-9561-fb571d2d5d4f","year":2023},"citing_paper":{"arxiv_id":"2605.26133","last_updated":"2026-05-21T10:32:33Z","snapshot_observed_at":"2026-08-15T05:03:11.540435Z","submitted_at":"2026-05-21T10:32:33Z","title":"Pretraining Data Exposure in Large Language Models: A Survey of Membership Inference, Data Contamination, and Security Implications","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-30T17:20:16.735285Z"},"links":{"cited_paper":"/paper/2305.10160","citing_paper":"/paper/2605.26133"},"observation_digest":"sha256:2d4f1d57a5498514ac33b7e559d70c8020c122ca403037f4b966dfa55d5da40a","observation_id":"5ff2b34a-7ad9-403e-a716-6ce5d3514417","resolution":{"observed_at":"2026-06-30T17:24:56.608658Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10160","last_updated":"2023-10-18T13:17:13Z","snapshot_observed_at":"2026-08-16T15:32:22.458268Z","submitted_at":"2023-05-17T12:23:38Z","title":"Stop Uploading Test Data in Plain Text: Practical Strategies for Mitigating Data Contamination by Evaluation Benchmarks","version":2},"cited_work":{"arxiv_id":"2305.10160","doi":"10.48550/arxiv.2305.10160","metadata_source":"arxiv_reference","pith_arxiv_id":"2305.10160","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Stop uploading test data in plain text: Practical strategies for mitigating data contamination by evaluation benchmarks","venue":"arXiv (Cornell University)","work_id":"fc2502a0-2c44-4a07-9561-fb571d2d5d4f","year":2023},"citing_paper":{"arxiv_id":"2605.28405","last_updated":"2026-05-27T12:39:54Z","snapshot_observed_at":"2026-07-06T23:37:59.285884Z","submitted_at":"2026-05-27T12:39:54Z","title":"Measuring Progress Toward AGI: A Cognitive Framework","version":1},"reference_index":84,"source":"arxiv_source","source_observed_at":"2026-06-29T12:00:26.249340Z"},"links":{"cited_paper":"/paper/2305.10160","citing_paper":"/paper/2605.28405"},"observation_digest":"sha256:5440f6844d9bd56227a734b83110e235c56aac0a0a4f5be459eaf38cda059574","observation_id":"f279528b-74e9-4044-a744-ad2286e9e365","resolution":{"observed_at":"2026-06-29T12:03:23.843852Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10160","last_updated":"2023-10-18T13:17:13Z","snapshot_observed_at":"2026-08-16T15:32:22.458268Z","submitted_at":"2023-05-17T12:23:38Z","title":"Stop Uploading Test Data in Plain Text: Practical Strategies for Mitigating Data Contamination by Evaluation Benchmarks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10160","snapshot_observed_at":"2026-08-10T06:02:27.886353Z","title":"Stop Uploading Test Data in Plain Text:","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07341","last_updated":"2026-08-07T15:37:03Z","snapshot_observed_at":"2026-08-17T13:25:40.395266Z","submitted_at":"2026-08-07T15:37:03Z","title":"Zero Gap Is Not Restoration: Stratified Per-Question Probability Evaluation and Step-wise Mitigation of Benchmark Contamination","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-10T06:02:27.886353Z"},"links":{"cited_paper":"/paper/2305.10160","citing_paper":"/paper/2608.07341"},"observation_digest":"sha256:082d9a4481881d1fcd1069897d20e0cc18e334ec800bfe62e720a6b58913052e","observation_id":"13615bf3-77df-4b8d-b153-3737578c7886","resolution":{"observed_at":"2026-08-10T06:02:27.886353Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2305.10160/citation-record","integrity":"/paper/2305.10160/integrity","json":"/paper/2305.10160/citation-record.json","paper":"/paper/2305.10160"},"outbound":[],"paper":{"arxiv_id":"2305.10160","last_updated":"2023-10-18T13:17:13Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-16T15:32:22.458268Z","submitted_at":"2023-05-17T12:23:38Z","title":"Stop Uploading Test Data in Plain Text: Practical Strategies for Mitigating Data Contamination by Evaluation Benchmarks"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 11 inbound Pith citation observations for arXiv:2305.10160."}