{"as_of":"2026-08-10T23:26:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b1406e7ee927528cdc6a7b006b5159a5fd0e524218a0285426f15b163638f98e","coverage":[{"denominator":54,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":54,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T06:02:27.994149Z","state":"measured"},{"denominator":54,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":54,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.07341/citation-record","integrity":"/paper/2608.07341/integrity","json":"/paper/2608.07341/citation-record.json","paper":"/paper/2608.07341"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2025.findings-emnlp.188","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T06:02:28.223263Z","title":"LNE -Blocking: An Efficient Framework for Contamination Mitigation Evaluation on Large Language Models","venue":null,"work_id":"09242cd8-4fa7-4a2b-a8c6-976f813d3e72","year":2025},"citing_paper":{"arxiv_id":"2608.07341","last_updated":"2026-08-07T15:37:03Z","snapshot_observed_at":"2026-08-10T23:14:40.744156Z","submitted_at":"2026-08-07T15:37:03Z","title":"Zero Gap Is Not Restoration: Stratified Per-Question Probability Evaluation and Step-wise Mitigation of Benchmark Contamination","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-10T06:02:27.740716Z"},"links":{"citing_paper":"/paper/2608.07341"},"observation_digest":"sha256:a9be7493b726fdbfc23bf1bb50f882cf22318d1b5d69ed6df8c2d6088814488c","observation_id":"d7dc0e89-79b5-481c-87cf-f918672263dd","resolution":{"observed_at":"2026-08-10T06:02:28.228112Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2025.acl-long.192","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T06:02:28.208567Z","title":"Establishing Trustworthy LLM Evaluation via Shortcut Neuron Analysis","venue":null,"work_id":"48395524-7ca7-4d5a-b40e-b6c5dbe1bc2d","year":2025},"citing_paper":{"arxiv_id":"2608.07341","last_updated":"2026-08-07T15:37:03Z","snapshot_observed_at":"2026-08-10T23:14:40.744156Z","submitted_at":"2026-08-07T15:37:03Z","title":"Zero Gap Is Not Restoration: Stratified Per-Question Probability Evaluation and Step-wise Mitigation of Benchmark Contamination","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-10T06:02:27.747195Z"},"links":{"citing_paper":"/paper/2608.07341"},"observation_digest":"sha256:86e1a89f59d86a0582de93342bd8a0de1ca89247aa8caf3d32c8956bfd87e690","observation_id":"02e918b6-b44b-4b19-b33c-6f4fec5de48a","resolution":{"observed_at":"2026-08-10T06:02:28.213191Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T06:02:28.768889Z","title":"The Thirteenth International Conference on Learning Representations , year=","venue":null,"work_id":"a305f3c6-3881-40e2-b6f2-7c457f759674","year":null},"citing_paper":{"arxiv_id":"2608.07341","last_updated":"2026-08-07T15:37:03Z","snapshot_observed_at":"2026-08-10T23:14:40.744156Z","submitted_at":"2026-08-07T15:37:03Z","title":"Zero Gap Is Not Restoration: Stratified Per-Question Probability Evaluation and Step-wise Mitigation of Benchmark Contamination","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-10T06:02:27.752835Z"},"links":{"citing_paper":"/paper/2608.07341"},"observation_digest":"sha256:01369467244f6ca1f281cd30d7a2a0797e079280098d90f3d9d2052679930211","observation_id":"3b679bda-9fbe-4449-ba69-6a0961e31184","resolution":{"observed_at":"2026-08-10T06:02:28.773965Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T06:02:27.757864Z","title":"DeepSeek-V4 : Towards Highly Efficient Million-Token Context Intelligence","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.07341","last_updated":"2026-08-07T15:37:03Z","snapshot_observed_at":"2026-08-10T23:14:40.744156Z","submitted_at":"2026-08-07T15:37:03Z","title":"Zero Gap Is Not Restoration: Stratified Per-Question Probability Evaluation and Step-wise Mitigation of Benchmark Contamination","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-10T06:02:27.757864Z"},"links":{"citing_paper":"/paper/2608.07341"},"observation_digest":"sha256:14d266f69b407723c7460c69463f6af1e4da46fa0daab427e6b2bd007d9febe4","observation_id":"b94b7bb4-6e53-4207-a00a-d0bf051febaf","resolution":{"observed_at":"2026-08-10T06:02:27.757864Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T06:02:28.753484Z","title":"Pythia: A Suite for Analyzing Large Language Models Across Training and Scaling","venue":null,"work_id":"b8d4a437-ac04-4a84-8429-9b1f53687ab2","year":2023},"citing_paper":{"arxiv_id":"2608.07341","last_updated":"2026-08-07T15:37:03Z","snapshot_observed_at":"2026-08-10T23:14:40.744156Z","submitted_at":"2026-08-07T15:37:03Z","title":"Zero Gap Is Not Restoration: Stratified Per-Question Probability Evaluation and Step-wise Mitigation of Benchmark Contamination","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-10T06:02:27.762702Z"},"links":{"citing_paper":"/paper/2608.07341"},"observation_digest":"sha256:c431bdbbfaf2b5692b97b8ddc51c881f767c58cc497f8134c47356f7bcae4db7","observation_id":"f3faf0c9-2c57-4b72-b710-0a8fda80ff42","resolution":{"observed_at":"2026-08-10T06:02:28.758493Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T06:02:28.737669Z","title":"OpenOrca : An Open Dataset of GPT Augmented FLAN Reasoning Traces","venue":null,"work_id":"2205d267-9b88-46ed-81b8-dae8907770fc","year":2023},"citing_paper":{"arxiv_id":"2608.07341","last_updated":"2026-08-07T15:37:03Z","snapshot_observed_at":"2026-08-10T23:14:40.744156Z","submitted_at":"2026-08-07T15:37:03Z","title":"Zero Gap Is Not Restoration: Stratified Per-Question Probability Evaluation and Step-wise Mitigation of Benchmark Contamination","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-10T06:02:27.767463Z"},"links":{"citing_paper":"/paper/2608.07341"},"observation_digest":"sha256:f940b0385dcb6305b9e82495386c2f027501ad22267c502edc01a5795bcb2970","observation_id":"799ed2d2-eb18-458b-ae47-a45aba6f4e16","resolution":{"observed_at":"2026-08-10T06:02:28.742644Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2607.02770","last_updated":"2026-07-02T21:08:53Z","snapshot_observed_at":"2026-08-09T14:18:19.682421Z","submitted_at":"2026-07-02T21:08:53Z","title":"Gemma 4 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2607.02770","snapshot_observed_at":"2026-08-10T06:02:27.772444Z","title":"Gemma 4 Technical Report","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.07341","last_updated":"2026-08-07T15:37:03Z","snapshot_observed_at":"2026-08-10T23:14:40.744156Z","submitted_at":"2026-08-07T15:37:03Z","title":"Zero Gap Is Not Restoration: Stratified Per-Question Probability Evaluation and Step-wise Mitigation of Benchmark Contamination","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-10T06:02:27.772444Z"},"links":{"cited_paper":"/paper/2607.02770","citing_paper":"/paper/2608.07341"},"observation_digest":"sha256:681b5545055eec57c107c62250af785c644619faf62e3b2c366fdf92dd74e201","observation_id":"1e5f1813-3186-458d-ade2-a42e97a82854","resolution":{"observed_at":"2026-08-10T06:02:27.772444Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T06:02:28.721730Z","title":"and Zhou, Denny","venue":null,"work_id":"9d62f675-6ea4-44ae-b363-a3d8163edea6","year":2022},"citing_paper":{"arxiv_id":"2608.07341","last_updated":"2026-08-07T15:37:03Z","snapshot_observed_at":"2026-08-10T23:14:40.744156Z","submitted_at":"2026-08-07T15:37:03Z","title":"Zero Gap Is Not Restoration: Stratified Per-Question Probability Evaluation and Step-wise Mitigation of Benchmark Contamination","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-10T06:02:27.778487Z"},"links":{"citing_paper":"/paper/2608.07341"},"observation_digest":"sha256:f939519d8c3c39e0f7a415939729200cba0bfdc77bc318f3bb77b2ffaf1c1881","observation_id":"6b072f53-aa78-40f9-961c-14e1a412e8f7","resolution":{"observed_at":"2026-08-10T06:02:28.726506Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T06:02:28.705871Z","title":"and Le, Quoc V","venue":null,"work_id":"a3b9da60-cfd9-4c33-bded-aaecc9bb82aa","year":null},"citing_paper":{"arxiv_id":"2608.07341","last_updated":"2026-08-07T15:37:03Z","snapshot_observed_at":"2026-08-10T23:14:40.744156Z","submitted_at":"2026-08-07T15:37:03Z","title":"Zero Gap Is Not Restoration: Stratified Per-Question Probability Evaluation and Step-wise Mitigation of Benchmark Contamination","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-10T06:02:27.783126Z"},"links":{"citing_paper":"/paper/2608.07341"},"observation_digest":"sha256:403dc298377ea735ab6cd81c5723b06a16b4d9300c4096436a7e3219a04ad416","observation_id":"b013282a-0dc2-4804-8ab3-894d2e50c897","resolution":{"observed_at":"2026-08-10T06:02:28.710640Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06575","last_updated":"2024-08-17T14:31:42Z","snapshot_observed_at":"2026-08-08T14:35:49.004908Z","submitted_at":"2023-05-11T05:19:47Z","title":"Chain-of-Dictionary Prompting Elicits Translation in Large Language Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06575","snapshot_observed_at":"2026-08-10T06:02:27.788123Z","title":"2023 , month = may, journal =","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.07341","last_updated":"2026-08-07T15:37:03Z","snapshot_observed_at":"2026-08-10T23:14:40.744156Z","submitted_at":"2026-08-07T15:37:03Z","title":"Zero Gap Is Not Restoration: Stratified Per-Question Probability Evaluation and Step-wise Mitigation of Benchmark Contamination","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-10T06:02:27.788123Z"},"links":{"cited_paper":"/paper/2305.06575","citing_paper":"/paper/2608.07341"},"observation_digest":"sha256:e2d117c5f094f028edcbf6951a81010361945363be328a4608514c02a151e2a9","observation_id":"0d24cd1d-2c3e-4ff3-963f-d67b9d1b5c7b","resolution":{"observed_at":"2026-08-10T06:02:27.788123Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.10200","last_updated":"2024-05-23T20:53:59Z","snapshot_observed_at":"2026-07-06T17:30:47.845775Z","submitted_at":"2024-02-15T18:55:41Z","title":"Chain-of-Thought Reasoning Without Prompting","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.10200","snapshot_observed_at":"2026-08-10T06:02:27.793116Z","title":"2024 , month = feb, journal =","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.07341","last_updated":"2026-08-07T15:37:03Z","snapshot_observed_at":"2026-08-10T23:14:40.744156Z","submitted_at":"2026-08-07T15:37:03Z","title":"Zero Gap Is Not Restoration: Stratified Per-Question Probability Evaluation and Step-wise Mitigation of Benchmark Contamination","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-10T06:02:27.793116Z"},"links":{"cited_paper":"/paper/2402.10200","citing_paper":"/paper/2608.07341"},"observation_digest":"sha256:0bfaf69e451fc68c529de15f95b75057aaf9f34cc2d297f12ea82d6bfdaa341d","observation_id":"c6f55e24-0f54-49e1-bcb9-d723dce71c50","resolution":{"observed_at":"2026-08-10T06:02:27.793116Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T06:02:27.798336Z","title":"Leak, Cheat, Repeat:","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.07341","last_updated":"2026-08-07T15:37:03Z","snapshot_observed_at":"2026-08-10T23:14:40.744156Z","submitted_at":"2026-08-07T15:37:03Z","title":"Zero Gap Is Not Restoration: Stratified Per-Question Probability Evaluation and Step-wise Mitigation of Benchmark Contamination","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-10T06:02:27.798336Z"},"links":{"citing_paper":"/paper/2608.07341"},"observation_digest":"sha256:6181cef1e4015e04a007821dce433a3a7a6ee4a3752b2a0c467f4ef53529dff1","observation_id":"2e42c8f1-431c-427a-90e4-d81927a8802a","resolution":{"observed_at":"2026-08-10T06:02:27.798336Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T06:02:28.690378Z","title":"Large Scale Kernel Machines , author =","venue":null,"work_id":"8d6757a6-e5ce-44e9-8353-5155893f698c","year":2007},"citing_paper":{"arxiv_id":"2608.07341","last_updated":"2026-08-07T15:37:03Z","snapshot_observed_at":"2026-08-10T23:14:40.744156Z","submitted_at":"2026-08-07T15:37:03Z","title":"Zero Gap Is Not Restoration: Stratified Per-Question Probability Evaluation and Step-wise Mitigation of Benchmark Contamination","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-10T06:02:27.803038Z"},"links":{"citing_paper":"/paper/2608.07341"},"observation_digest":"sha256:1a4250ff8f5916355ab916b7d19e180cce7a5821e900def78ceb741bf522a5f8","observation_id":"d2e906ae-999f-4aa2-b35f-b1ac8b37f6ef","resolution":{"observed_at":"2026-08-10T06:02:28.695314Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03374","last_updated":"2021-07-14T17:16:02Z","snapshot_observed_at":"2026-08-08T11:58:24.516369Z","submitted_at":"2021-07-07T17:41:24Z","title":"Evaluating Large Language Models Trained on Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.03374","snapshot_observed_at":"2026-08-10T06:02:27.807650Z","title":"2021 , journal =","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.07341","last_updated":"2026-08-07T15:37:03Z","snapshot_observed_at":"2026-08-10T23:14:40.744156Z","submitted_at":"2026-08-07T15:37:03Z","title":"Zero Gap Is Not Restoration: Stratified Per-Question Probability Evaluation and Step-wise Mitigation of Benchmark Contamination","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-10T06:02:27.807650Z"},"links":{"cited_paper":"/paper/2107.03374","citing_paper":"/paper/2608.07341"},"observation_digest":"sha256:2e1e07d4221e7fd44f857363db8eeffdd410713ed99020e4c235da96a0146caf","observation_id":"fc81245f-475d-4b99-8bdd-7649ab6b12cd","resolution":{"observed_at":"2026-08-10T06:02:27.807650Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T06:02:27.812585Z","title":"Findings of the Association for Computational Linguistics:","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.07341","last_updated":"2026-08-07T15:37:03Z","snapshot_observed_at":"2026-08-10T23:14:40.744156Z","submitted_at":"2026-08-07T15:37:03Z","title":"Zero Gap Is Not Restoration: Stratified Per-Question Probability Evaluation and Step-wise Mitigation of Benchmark Contamination","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-10T06:02:27.812585Z"},"links":{"citing_paper":"/paper/2608.07341"},"observation_digest":"sha256:8df6c745ac8aa40c5e7abe4129a1f9f9309c6450ae6ab6e5e521f104bd65e27e","observation_id":"e56585dc-b039-4315-a18a-de56c1f1be79","resolution":{"observed_at":"2026-08-10T06:02:27.812585Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-07T01:45:38.840969Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-10T06:02:27.817062Z","title":"2021 , journal =","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.07341","last_updated":"2026-08-07T15:37:03Z","snapshot_observed_at":"2026-08-10T23:14:40.744156Z","submitted_at":"2026-08-07T15:37:03Z","title":"Zero Gap Is Not Restoration: Stratified Per-Question Probability Evaluation and Step-wise Mitigation of Benchmark Contamination","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-10T06:02:27.817062Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2608.07341"},"observation_digest":"sha256:b3efc1a2e46e6a36676d02e57c1ba5c34cee8376be5fba476ed1d0f52755d3eb","observation_id":"38c5e3ce-ca40-41cb-be76-c9d1d72f8e72","resolution":{"observed_at":"2026-08-10T06:02:27.817062Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T06:02:27.821781Z","title":"Unveiling the Spectrum of Data Contamination in Language Model: A Survey from Detection to Remediation , booktitle =","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.07341","last_updated":"2026-08-07T15:37:03Z","snapshot_observed_at":"2026-08-10T23:14:40.744156Z","submitted_at":"2026-08-07T15:37:03Z","title":"Zero Gap Is Not Restoration: Stratified Per-Question Probability Evaluation and Step-wise Mitigation of Benchmark Contamination","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-10T06:02:27.821781Z"},"links":{"citing_paper":"/paper/2608.07341"},"observation_digest":"sha256:d731695c04868bce32646c8df8e13c9ab5e7fcd2e233112655fc3f446552465f","observation_id":"21d222fa-acb9-4937-b738-0a60d99dbfdd","resolution":{"observed_at":"2026-08-10T06:02:27.821781Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T06:02:27.826574Z","title":"Pretraining","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.07341","last_updated":"2026-08-07T15:37:03Z","snapshot_observed_at":"2026-08-10T23:14:40.744156Z","submitted_at":"2026-08-07T15:37:03Z","title":"Zero Gap Is Not Restoration: Stratified Per-Question Probability Evaluation and Step-wise Mitigation of Benchmark Contamination","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-10T06:02:27.826574Z"},"links":{"citing_paper":"/paper/2608.07341"},"observation_digest":"sha256:3fc31b443c24c108963cbd336593b480cb762896cec46ef6ebe0e396dc736fa0","observation_id":"5c12fa61-9aaf-47c4-933c-2cf7a59df6c2","resolution":{"observed_at":"2026-08-10T06:02:27.826574Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T06:02:27.831286Z","title":"Generalization or Memorization:","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.07341","last_updated":"2026-08-07T15:37:03Z","snapshot_observed_at":"2026-08-10T23:14:40.744156Z","submitted_at":"2026-08-07T15:37:03Z","title":"Zero Gap Is Not Restoration: Stratified Per-Question Probability Evaluation and Step-wise Mitigation of Benchmark Contamination","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-10T06:02:27.831286Z"},"links":{"citing_paper":"/paper/2608.07341"},"observation_digest":"sha256:b14053229507e535708fab0c9475d25752d245eeab3a8b1ad4103abb22a49062","observation_id":"de4f2eda-60d6-4b51-8a3d-666952a3447a","resolution":{"observed_at":"2026-08-10T06:02:27.831286Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-10T16:40:37.411115Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-10T06:02:27.835926Z","title":"2024 , journal =","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.07341","last_updated":"2026-08-07T15:37:03Z","snapshot_observed_at":"2026-08-10T23:14:40.744156Z","submitted_at":"2026-08-07T15:37:03Z","title":"Zero Gap Is Not Restoration: Stratified Per-Question Probability Evaluation and Step-wise Mitigation of Benchmark Contamination","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-10T06:02:27.835926Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2608.07341"},"observation_digest":"sha256:d081c504e63ea11c456bb7b46d443ee00437f0a520f409664f89ea5117dd1c16","observation_id":"02eaa788-d44d-42ca-b46c-40bb600a3908","resolution":{"observed_at":"2026-08-10T06:02:27.835926Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T06:02:28.675239Z","title":"2023 , journal =","venue":null,"work_id":"f5909062-311f-48f9-ada7-de1fb785b9e5","year":2023},"citing_paper":{"arxiv_id":"2608.07341","last_updated":"2026-08-07T15:37:03Z","snapshot_observed_at":"2026-08-10T23:14:40.744156Z","submitted_at":"2026-08-07T15:37:03Z","title":"Zero Gap Is Not Restoration: Stratified Per-Question Probability Evaluation and Step-wise Mitigation of Benchmark Contamination","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-10T06:02:27.840805Z"},"links":{"citing_paper":"/paper/2608.07341"},"observation_digest":"sha256:e6391ad664bcc72de22bc720f8e10ce62c30af647b33f5d2944e1f08f2963dea","observation_id":"6739cf4b-ba39-4914-9630-21428556c78e","resolution":{"observed_at":"2026-08-10T06:02:28.680155Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2024.acl-long.325","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T06:02:28.118353Z","title":"Proceedings of the 62nd Annual Meeting of the Association for Computational Linguistics (Volume 1:","venue":null,"work_id":"a72b6e63-ad6e-488e-b5eb-54fe37d9672b","year":2024},"citing_paper":{"arxiv_id":"2608.07341","last_updated":"2026-08-07T15:37:03Z","snapshot_observed_at":"2026-08-10T23:14:40.744156Z","submitted_at":"2026-08-07T15:37:03Z","title":"Zero Gap Is Not Restoration: Stratified Per-Question Probability Evaluation and Step-wise Mitigation of Benchmark Contamination","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-10T06:02:27.845191Z"},"links":{"citing_paper":"/paper/2608.07341"},"observation_digest":"sha256:cd2577685b9cd379c05822fc5df6b008fb4c37218dab38acc8a7616a3d937b9a","observation_id":"c60bd7b2-9bb1-49b5-afd6-ab53f3303007","resolution":{"observed_at":"2026-08-10T06:02:28.123179Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T06:02:28.660326Z","title":"Treeeval:","venue":null,"work_id":"e51f1fd5-5ca3-4926-a9ea-1c5f7698760a","year":null},"citing_paper":{"arxiv_id":"2608.07341","last_updated":"2026-08-07T15:37:03Z","snapshot_observed_at":"2026-08-10T23:14:40.744156Z","submitted_at":"2026-08-07T15:37:03Z","title":"Zero Gap Is Not Restoration: Stratified Per-Question Probability Evaluation and Step-wise Mitigation of Benchmark Contamination","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-10T06:02:27.849759Z"},"links":{"citing_paper":"/paper/2608.07341"},"observation_digest":"sha256:f9e929d8289bc32c1d5cdbad32f9a7efb867b60d94fd068de6c6344170e765e3","observation_id":"fd2ac138-5a0e-4983-8c1b-90720ec659e1","resolution":{"observed_at":"2026-08-10T06:02:28.665242Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T06:02:28.645539Z","title":"and Dodge, Jesse , year =","venue":null,"work_id":"584a8770-0150-48c9-8751-9a4356f16e50","year":null},"citing_paper":{"arxiv_id":"2608.07341","last_updated":"2026-08-07T15:37:03Z","snapshot_observed_at":"2026-08-10T23:14:40.744156Z","submitted_at":"2026-08-07T15:37:03Z","title":"Zero Gap Is Not Restoration: Stratified Per-Question Probability Evaluation and Step-wise Mitigation of Benchmark Contamination","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-10T06:02:27.854332Z"},"links":{"citing_paper":"/paper/2608.07341"},"observation_digest":"sha256:1b8894e5af00f8a890ed7a05bf92728c8cfac089fc7ceec1ab69ddc92c704090","observation_id":"0fb6a903-0109-44ab-a35c-c39c093b0e00","resolution":{"observed_at":"2026-08-10T06:02:28.650218Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T06:02:27.858536Z","title":"Proceedings of the 62nd Annual Meeting of the Association for Computational Linguistics (Volume 3: System Demonstrations) , address=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.07341","last_updated":"2026-08-07T15:37:03Z","snapshot_observed_at":"2026-08-10T23:14:40.744156Z","submitted_at":"2026-08-07T15:37:03Z","title":"Zero Gap Is Not Restoration: Stratified Per-Question Probability Evaluation and Step-wise Mitigation of Benchmark Contamination","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-10T06:02:27.858536Z"},"links":{"citing_paper":"/paper/2608.07341"},"observation_digest":"sha256:e24030bff930612a4cbae56683caa490a51d808667cc9571b571d75748a393ac","observation_id":"b0892300-bfe3-490d-8554-982ae3166c11","resolution":{"observed_at":"2026-08-10T06:02:27.858536Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T06:02:28.621441Z","title":"The Twelfth International Conference on Learning Representations , author =","venue":null,"work_id":"5420388d-4778-4caa-a9cf-80eda9f3c96e","year":2024},"citing_paper":{"arxiv_id":"2608.07341","last_updated":"2026-08-07T15:37:03Z","snapshot_observed_at":"2026-08-10T23:14:40.744156Z","submitted_at":"2026-08-07T15:37:03Z","title":"Zero Gap Is Not Restoration: Stratified Per-Question Probability Evaluation and Step-wise Mitigation of Benchmark Contamination","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-10T06:02:27.862663Z"},"links":{"citing_paper":"/paper/2608.07341"},"observation_digest":"sha256:adb46e054046ed726c4c406babdff2f77bcbf9accf7c83ae42bc557286de15e2","observation_id":"efeea341-8de7-40da-8d8d-e2b229beab9e","resolution":{"observed_at":"2026-08-10T06:02:28.625870Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T06:02:28.607264Z","title":"2016 , volume =","venue":null,"work_id":"2aafae2f-a4e8-43ea-9b5b-fe2d722e2a1d","year":2016},"citing_paper":{"arxiv_id":"2608.07341","last_updated":"2026-08-07T15:37:03Z","snapshot_observed_at":"2026-08-10T23:14:40.744156Z","submitted_at":"2026-08-07T15:37:03Z","title":"Zero Gap Is Not Restoration: Stratified Per-Question Probability Evaluation and Step-wise Mitigation of Benchmark Contamination","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-10T06:02:27.866563Z"},"links":{"citing_paper":"/paper/2608.07341"},"observation_digest":"sha256:1abdcacd450d3b3816887eed83601cb5b98ca74967ec88812a3a97bcefe4111d","observation_id":"a086d665-37c6-4346-bd47-e8db86cb0b6c","resolution":{"observed_at":"2026-08-10T06:02:28.611623Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.14165","last_updated":"2020-07-22T19:47:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-28T17:29:03Z","title":"Language Models are Few-Shot Learners","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.14165","snapshot_observed_at":"2026-08-10T06:02:27.870440Z","title":"2020 , journal =","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.07341","last_updated":"2026-08-07T15:37:03Z","snapshot_observed_at":"2026-08-10T23:14:40.744156Z","submitted_at":"2026-08-07T15:37:03Z","title":"Zero Gap Is Not Restoration: Stratified Per-Question Probability Evaluation and Step-wise Mitigation of Benchmark Contamination","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-10T06:02:27.870440Z"},"links":{"cited_paper":"/paper/2005.14165","citing_paper":"/paper/2608.07341"},"observation_digest":"sha256:10826eb637c7fc9dff40b2c4051a4361d098094ac33edc32727632566a0c473d","observation_id":"4e0a3506-1721-4e7c-9eb7-6049c9d5961b","resolution":{"observed_at":"2026-08-10T06:02:27.870440Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T06:02:27.874530Z","title":"2023 , eprint =","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.07341","last_updated":"2026-08-07T15:37:03Z","snapshot_observed_at":"2026-08-10T23:14:40.744156Z","submitted_at":"2026-08-07T15:37:03Z","title":"Zero Gap Is Not Restoration: Stratified Per-Question Probability Evaluation and Step-wise Mitigation of Benchmark Contamination","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-10T06:02:27.874530Z"},"links":{"citing_paper":"/paper/2608.07341"},"observation_digest":"sha256:dab39f5284107456e1d4a1481e7a2bcf173ad4ec31187253b9c41d2ad902cacd","observation_id":"912e8849-8496-4542-be09-2460d1e5e043","resolution":{"observed_at":"2026-08-10T06:02:27.874530Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T06:02:28.582347Z","title":"Privacy Risks of General-Purpose Language Models , booktitle =","venue":null,"work_id":"dad5b28b-83e3-41eb-b972-6804cb8fdee2","year":null},"citing_paper":{"arxiv_id":"2608.07341","last_updated":"2026-08-07T15:37:03Z","snapshot_observed_at":"2026-08-10T23:14:40.744156Z","submitted_at":"2026-08-07T15:37:03Z","title":"Zero Gap Is Not Restoration: Stratified Per-Question Probability Evaluation and Step-wise Mitigation of Benchmark Contamination","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-10T06:02:27.878400Z"},"links":{"citing_paper":"/paper/2608.07341"},"observation_digest":"sha256:a30366448b5db9efde977f1007e779de0f7f541f6397a3b3fe49f9edf95d258e","observation_id":"68012d3d-a7cc-4914-b0aa-912ccfa7bff5","resolution":{"observed_at":"2026-08-10T06:02:28.586670Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01964","last_updated":"2023-11-03T14:59:54Z","snapshot_observed_at":"2026-08-06T10:56:05.075839Z","submitted_at":"2023-11-03T14:59:54Z","title":"Don't Make Your LLM an Evaluation Benchmark Cheater","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.01964","snapshot_observed_at":"2026-08-10T06:02:27.882400Z","title":"2023 , journal =","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.07341","last_updated":"2026-08-07T15:37:03Z","snapshot_observed_at":"2026-08-10T23:14:40.744156Z","submitted_at":"2026-08-07T15:37:03Z","title":"Zero Gap Is Not Restoration: Stratified Per-Question Probability Evaluation and Step-wise Mitigation of Benchmark Contamination","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-10T06:02:27.882400Z"},"links":{"cited_paper":"/paper/2311.01964","citing_paper":"/paper/2608.07341"},"observation_digest":"sha256:711fe209451f7fe2fa88e3dff2776ff5cb6225f405d83de82219d692208dc770","observation_id":"2e9ede79-c27b-40e9-9e6a-5efd4a8f9ddb","resolution":{"observed_at":"2026-08-10T06:02:27.882400Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10160","last_updated":"2023-10-18T13:17:13Z","snapshot_observed_at":"2026-08-10T20:00:16.124003Z","submitted_at":"2023-05-17T12:23:38Z","title":"Stop Uploading Test Data in Plain Text: Practical Strategies for Mitigating Data Contamination by Evaluation Benchmarks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10160","snapshot_observed_at":"2026-08-10T06:02:27.886353Z","title":"Stop Uploading Test Data in Plain Text:","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07341","last_updated":"2026-08-07T15:37:03Z","snapshot_observed_at":"2026-08-10T23:14:40.744156Z","submitted_at":"2026-08-07T15:37:03Z","title":"Zero Gap Is Not Restoration: Stratified Per-Question Probability Evaluation and Step-wise Mitigation of Benchmark Contamination","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-10T06:02:27.886353Z"},"links":{"cited_paper":"/paper/2305.10160","citing_paper":"/paper/2608.07341"},"observation_digest":"sha256:82f456a4f476de67132cffb02866dcfe47acf9289c5230f18ebc1d64252160d8","observation_id":"13615bf3-77df-4b8d-b153-3737578c7886","resolution":{"observed_at":"2026-08-10T06:02:27.886353Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08758","last_updated":"2021-09-30T17:20:01Z","snapshot_observed_at":"2026-08-03T11:31:09.198404Z","submitted_at":"2021-04-18T07:42:52Z","title":"Documenting Large Webtext Corpora: A Case Study on the Colossal Clean Crawled Corpus","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08758","snapshot_observed_at":"2026-08-10T06:02:27.891496Z","title":"Documenting Large Webtext Corpora:","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.07341","last_updated":"2026-08-07T15:37:03Z","snapshot_observed_at":"2026-08-10T23:14:40.744156Z","submitted_at":"2026-08-07T15:37:03Z","title":"Zero Gap Is Not Restoration: Stratified Per-Question Probability Evaluation and Step-wise Mitigation of Benchmark Contamination","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-10T06:02:27.891496Z"},"links":{"cited_paper":"/paper/2104.08758","citing_paper":"/paper/2608.07341"},"observation_digest":"sha256:959040e1fec8e76f0b65f9ad1e7cd4a82e64a131619251b9afbba7405fc36724","observation_id":"6aa0321a-9e9f-42e9-b599-59ca0f263cc9","resolution":{"observed_at":"2026-08-10T06:02:27.891496Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T06:02:28.566639Z","title":"2006 , journal =","venue":null,"work_id":"71507ff4-602c-41ec-8556-8872c54f210f","year":2006},"citing_paper":{"arxiv_id":"2608.07341","last_updated":"2026-08-07T15:37:03Z","snapshot_observed_at":"2026-08-10T23:14:40.744156Z","submitted_at":"2026-08-07T15:37:03Z","title":"Zero Gap Is Not Restoration: Stratified Per-Question Probability Evaluation and Step-wise Mitigation of Benchmark Contamination","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-10T06:02:27.896375Z"},"links":{"citing_paper":"/paper/2608.07341"},"observation_digest":"sha256:0fab7ef7b6291b115f0c8f6a495c10e8c29153384d42d412f1312284a8f3cb44","observation_id":"41e8f71b-fdad-4951-903b-e7f07db99eb0","resolution":{"observed_at":"2026-08-10T06:02:28.571341Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T06:02:28.551267Z","title":"Chain-of-Symbol Prompting for Spatial Reasoning in Large Language Models , booktitle =","venue":null,"work_id":"5540ea03-efbf-4685-9ef0-42b540f908df","year":null},"citing_paper":{"arxiv_id":"2608.07341","last_updated":"2026-08-07T15:37:03Z","snapshot_observed_at":"2026-08-10T23:14:40.744156Z","submitted_at":"2026-08-07T15:37:03Z","title":"Zero Gap Is Not Restoration: Stratified Per-Question Probability Evaluation and Step-wise Mitigation of Benchmark Contamination","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-10T06:02:27.901086Z"},"links":{"citing_paper":"/paper/2608.07341"},"observation_digest":"sha256:5bcd0ac7b3231087458c4b76c89bfc787826a0cae4328f4c4febb73cc6be76ed","observation_id":"1438432d-7512-4c88-b0cf-cea4e97eca08","resolution":{"observed_at":"2026-08-10T06:02:28.556718Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T06:02:27.905509Z","title":"Proceedings of the 61st Annual Meeting of the Association for Computational Linguistics (Volume 1:","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.07341","last_updated":"2026-08-07T15:37:03Z","snapshot_observed_at":"2026-08-10T23:14:40.744156Z","submitted_at":"2026-08-07T15:37:03Z","title":"Zero Gap Is Not Restoration: Stratified Per-Question Probability Evaluation and Step-wise Mitigation of Benchmark Contamination","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-10T06:02:27.905509Z"},"links":{"citing_paper":"/paper/2608.07341"},"observation_digest":"sha256:56ba5151d9607ceaf6c48b9c7a6e0d553c48c49c71bcf4a8bb568b154252d93c","observation_id":"4b0fff4c-1a87-4db3-94e7-ee84b51529a2","resolution":{"observed_at":"2026-08-10T06:02:27.905509Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T06:02:27.910224Z","title":"Proceedings of the 62nd Annual Meeting of the Association for Computational Linguistics (Volume 1:","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.07341","last_updated":"2026-08-07T15:37:03Z","snapshot_observed_at":"2026-08-10T23:14:40.744156Z","submitted_at":"2026-08-07T15:37:03Z","title":"Zero Gap Is Not Restoration: Stratified Per-Question Probability Evaluation and Step-wise Mitigation of Benchmark Contamination","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-10T06:02:27.910224Z"},"links":{"citing_paper":"/paper/2608.07341"},"observation_digest":"sha256:7366cee9e87eebcb872f8943c586b4fa8d08455aa390c237e8b9491eab051e2b","observation_id":"929c8c72-44c0-4045-8818-d6ad35adaaeb","resolution":{"observed_at":"2026-08-10T06:02:27.910224Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06161","last_updated":"2023-12-13T14:44:10Z","snapshot_observed_at":"2026-07-06T15:25:35.930688Z","submitted_at":"2023-05-09T08:16:42Z","title":"StarCoder: may the source be with you!","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06161","snapshot_observed_at":"2026-08-10T06:02:27.914735Z","title":"2023 , journal =","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.07341","last_updated":"2026-08-07T15:37:03Z","snapshot_observed_at":"2026-08-10T23:14:40.744156Z","submitted_at":"2026-08-07T15:37:03Z","title":"Zero Gap Is Not Restoration: Stratified Per-Question Probability Evaluation and Step-wise Mitigation of Benchmark Contamination","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-10T06:02:27.914735Z"},"links":{"cited_paper":"/paper/2305.06161","citing_paper":"/paper/2608.07341"},"observation_digest":"sha256:bbe1e85b94671e7c70e0c23b8b150aeb4df4f2ebd93f1c96ffa665a26a303bed","observation_id":"063346a9-d529-4a27-b971-116dc34e7570","resolution":{"observed_at":"2026-08-10T06:02:27.914735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.13125","last_updated":"2024-12-13T10:48:13Z","snapshot_observed_at":"2026-08-05T01:40:57.962531Z","submitted_at":"2024-02-20T16:38:33Z","title":"TreeEval: Benchmark-Free Evaluation of Large Language Models through Tree Planning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.13125","snapshot_observed_at":"2026-08-10T06:02:27.919399Z","title":"arXiv preprint arXiv:2402.13125 , eprint =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07341","last_updated":"2026-08-07T15:37:03Z","snapshot_observed_at":"2026-08-10T23:14:40.744156Z","submitted_at":"2026-08-07T15:37:03Z","title":"Zero Gap Is Not Restoration: Stratified Per-Question Probability Evaluation and Step-wise Mitigation of Benchmark Contamination","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-10T06:02:27.919399Z"},"links":{"cited_paper":"/paper/2402.13125","citing_paper":"/paper/2608.07341"},"observation_digest":"sha256:4054b9a60e0f78173e1a9e899feb0589eb5221bcd1e5763db77046a8261817e4","observation_id":"ed307eb7-0c73-44fa-a888-517c3b418fd1","resolution":{"observed_at":"2026-08-10T06:02:27.919399Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T06:02:28.536424Z","title":"2004 , month = jul, pages =","venue":null,"work_id":"bff7393e-5e30-4c43-a457-cef6689cb0af","year":2004},"citing_paper":{"arxiv_id":"2608.07341","last_updated":"2026-08-07T15:37:03Z","snapshot_observed_at":"2026-08-10T23:14:40.744156Z","submitted_at":"2026-08-07T15:37:03Z","title":"Zero Gap Is Not Restoration: Stratified Per-Question Probability Evaluation and Step-wise Mitigation of Benchmark Contamination","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-10T06:02:27.924422Z"},"links":{"citing_paper":"/paper/2608.07341"},"observation_digest":"sha256:bb5bfcf1cd246e66c470a27e96d1b12684fbb5d85d940ce287d5b2f329bba03e","observation_id":"3bda2178-6507-4e9a-ad6d-d93c2f4ffc54","resolution":{"observed_at":"2026-08-10T06:02:28.541126Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T06:02:27.929374Z","title":"2023 , month = may, pages =","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.07341","last_updated":"2026-08-07T15:37:03Z","snapshot_observed_at":"2026-08-10T23:14:40.744156Z","submitted_at":"2026-08-07T15:37:03Z","title":"Zero Gap Is Not Restoration: Stratified Per-Question Probability Evaluation and Step-wise Mitigation of Benchmark Contamination","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-10T06:02:27.929374Z"},"links":{"citing_paper":"/paper/2608.07341"},"observation_digest":"sha256:c393940cb74bd3e8f3997c406dc6e8f784cdeb8c4c8253e16d4821eafdb85acb","observation_id":"c2c69a22-e0d4-4e3b-9e6d-c75298206ca4","resolution":{"observed_at":"2026-08-10T06:02:27.929374Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T06:02:27.940213Z","title":"Data Contamination:","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.07341","last_updated":"2026-08-07T15:37:03Z","snapshot_observed_at":"2026-08-10T23:14:40.744156Z","submitted_at":"2026-08-07T15:37:03Z","title":"Zero Gap Is Not Restoration: Stratified Per-Question Probability Evaluation and Step-wise Mitigation of Benchmark Contamination","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-10T06:02:27.940213Z"},"links":{"citing_paper":"/paper/2608.07341"},"observation_digest":"sha256:37db8bd630870308db085d8129e91ede8ef3554a69277b687771edaea7124e40","observation_id":"530b11b1-e72e-404c-8d0b-5fc66ad01a44","resolution":{"observed_at":"2026-08-10T06:02:27.940213Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T06:02:28.520862Z","title":"Detecting Pretraining Data from Large Language Models , booktitle =","venue":null,"work_id":"b793e038-83f4-44cc-af2d-3f45663dc10e","year":null},"citing_paper":{"arxiv_id":"2608.07341","last_updated":"2026-08-07T15:37:03Z","snapshot_observed_at":"2026-08-10T23:14:40.744156Z","submitted_at":"2026-08-07T15:37:03Z","title":"Zero Gap Is Not Restoration: Stratified Per-Question Probability Evaluation and Step-wise Mitigation of Benchmark Contamination","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-10T06:02:27.944963Z"},"links":{"citing_paper":"/paper/2608.07341"},"observation_digest":"sha256:bae8a0af58e07430a82f1a1ee83dc0b8aa0121524714b1bb3eed22fb861827b3","observation_id":"9109c435-2a1a-473e-8840-4007fa50134d","resolution":{"observed_at":"2026-08-10T06:02:28.525743Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T06:02:28.503741Z","title":"Chain-of-Thought Reasoning without Prompting , booktitle =","venue":null,"work_id":"a7f6d312-0573-4dd0-8ad4-4475d4125b3d","year":2024},"citing_paper":{"arxiv_id":"2608.07341","last_updated":"2026-08-07T15:37:03Z","snapshot_observed_at":"2026-08-10T23:14:40.744156Z","submitted_at":"2026-08-07T15:37:03Z","title":"Zero Gap Is Not Restoration: Stratified Per-Question Probability Evaluation and Step-wise Mitigation of Benchmark Contamination","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-10T06:02:27.949480Z"},"links":{"citing_paper":"/paper/2608.07341"},"observation_digest":"sha256:049f494cbf8430a62cebcccecc52a83ceaae27bf50dee8132851133542f3bb7d","observation_id":"982db8d6-4ea8-41e2-be15-95c48e073422","resolution":{"observed_at":"2026-08-10T06:02:28.508631Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.13474","last_updated":"2023-02-27T21:26:48Z","snapshot_observed_at":"2026-07-06T12:52:16.992962Z","submitted_at":"2022-03-25T06:55:15Z","title":"CodeGen: An Open Large Language Model for Code with Multi-Turn Program Synthesis","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.13474","snapshot_observed_at":"2026-08-10T06:02:27.954034Z","title":"Codegen:","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07341","last_updated":"2026-08-07T15:37:03Z","snapshot_observed_at":"2026-08-10T23:14:40.744156Z","submitted_at":"2026-08-07T15:37:03Z","title":"Zero Gap Is Not Restoration: Stratified Per-Question Probability Evaluation and Step-wise Mitigation of Benchmark Contamination","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-10T06:02:27.954034Z"},"links":{"cited_paper":"/paper/2203.13474","citing_paper":"/paper/2608.07341"},"observation_digest":"sha256:a2a977098088cf66696dcddcfac0e948fd913e725b1a25d3ebe159dd816af2de","observation_id":"e8711cba-63a5-4c37-9fc9-959dd8e10b82","resolution":{"observed_at":"2026-08-10T06:02:27.954034Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.10677","last_updated":"2023-09-27T01:15:49Z","snapshot_observed_at":"2026-07-06T16:20:36.866744Z","submitted_at":"2023-09-19T15:02:58Z","title":"Estimating Contamination via Perplexity: Quantifying Memorisation in Language Model Evaluation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.10677","snapshot_observed_at":"2026-08-10T06:02:27.958702Z","title":"Estimating Contamination via Perplexity:","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07341","last_updated":"2026-08-07T15:37:03Z","snapshot_observed_at":"2026-08-10T23:14:40.744156Z","submitted_at":"2026-08-07T15:37:03Z","title":"Zero Gap Is Not Restoration: Stratified Per-Question Probability Evaluation and Step-wise Mitigation of Benchmark Contamination","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-10T06:02:27.958702Z"},"links":{"cited_paper":"/paper/2309.10677","citing_paper":"/paper/2608.07341"},"observation_digest":"sha256:5dff9b0390a447e792bc9c34dac5c6356c1935659c12d6e35f876f0f5c60c41b","observation_id":"d04425ab-053e-4ec3-8b66-33e6ea411669","resolution":{"observed_at":"2026-08-10T06:02:27.958702Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12950","last_updated":"2024-01-31T19:47:26Z","snapshot_observed_at":"2026-07-06T16:10:07.931347Z","submitted_at":"2023-08-24T17:39:13Z","title":"Code Llama: Open Foundation Models for Code","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12950","snapshot_observed_at":"2026-08-10T06:02:27.963441Z","title":"Code Llama:","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07341","last_updated":"2026-08-07T15:37:03Z","snapshot_observed_at":"2026-08-10T23:14:40.744156Z","submitted_at":"2026-08-07T15:37:03Z","title":"Zero Gap Is Not Restoration: Stratified Per-Question Probability Evaluation and Step-wise Mitigation of Benchmark Contamination","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-10T06:02:27.963441Z"},"links":{"cited_paper":"/paper/2308.12950","citing_paper":"/paper/2608.07341"},"observation_digest":"sha256:aee2a8090a63289d27333da81108f74c3743fe4e9ed3a6846d285a9ae1b79ac5","observation_id":"c2f6011a-e862-4dd9-a037-b0586e67b740","resolution":{"observed_at":"2026-08-10T06:02:27.963441Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T06:02:27.968263Z","title":"Proceedings of the 2024 Conference of the North American Chapter of the Association for Computational Linguistics:","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.07341","last_updated":"2026-08-07T15:37:03Z","snapshot_observed_at":"2026-08-10T23:14:40.744156Z","submitted_at":"2026-08-07T15:37:03Z","title":"Zero Gap Is Not Restoration: Stratified Per-Question Probability Evaluation and Step-wise Mitigation of Benchmark Contamination","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-10T06:02:27.968263Z"},"links":{"citing_paper":"/paper/2608.07341"},"observation_digest":"sha256:b77e166b82a3a66710cf35635953c41d3c7116f116aa3381813c1064c2da8493","observation_id":"49ed2925-d938-425b-9ee9-894ef6696f16","resolution":{"observed_at":"2026-08-10T06:02:27.968263Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-10T06:02:27.973110Z","title":"Llama 2:","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07341","last_updated":"2026-08-07T15:37:03Z","snapshot_observed_at":"2026-08-10T23:14:40.744156Z","submitted_at":"2026-08-07T15:37:03Z","title":"Zero Gap Is Not Restoration: Stratified Per-Question Probability Evaluation and Step-wise Mitigation of Benchmark Contamination","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-10T06:02:27.973110Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2608.07341"},"observation_digest":"sha256:3570c7c2ae80b22ca6de65e58458f8d3708b5b26453963ed81dcd5e8cbdc1821","observation_id":"7ea003ac-6a3b-4bac-ae59-5b7313bfb4b8","resolution":{"observed_at":"2026-08-10T06:02:27.973110Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T06:02:27.977880Z","title":"Towards Understanding Chain-of-Thought Prompting:","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.07341","last_updated":"2026-08-07T15:37:03Z","snapshot_observed_at":"2026-08-10T23:14:40.744156Z","submitted_at":"2026-08-07T15:37:03Z","title":"Zero Gap Is Not Restoration: Stratified Per-Question Probability Evaluation and Step-wise Mitigation of Benchmark Contamination","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-10T06:02:27.977880Z"},"links":{"citing_paper":"/paper/2608.07341"},"observation_digest":"sha256:102b1cb9f86bda8b440783dc6360c831be18ed31054ab5afd5e5dd4c991d57fe","observation_id":"24e70c34-4774-402f-8899-bb1cd1f96b1e","resolution":{"observed_at":"2026-08-10T06:02:27.977880Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2024.findings-acl.644","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T06:02:28.045295Z","title":"Data Contamination Calibration for Black-Box","venue":null,"work_id":"53f63727-6a0d-46ce-89aa-3c2bc7c9a96b","year":2024},"citing_paper":{"arxiv_id":"2608.07341","last_updated":"2026-08-07T15:37:03Z","snapshot_observed_at":"2026-08-10T23:14:40.744156Z","submitted_at":"2026-08-07T15:37:03Z","title":"Zero Gap Is Not Restoration: Stratified Per-Question Probability Evaluation and Step-wise Mitigation of Benchmark Contamination","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-10T06:02:27.982120Z"},"links":{"citing_paper":"/paper/2608.07341"},"observation_digest":"sha256:dc79433a1f2cf324c6754b0ac7bbdfb09eb4c340fb3f043eb5ca5128be62cc02","observation_id":"e2096714-03e9-454d-a549-08df010e6e34","resolution":{"observed_at":"2026-08-10T06:02:28.052443Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T06:02:27.986129Z","title":"Self-Edit:","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.07341","last_updated":"2026-08-07T15:37:03Z","snapshot_observed_at":"2026-08-10T23:14:40.744156Z","submitted_at":"2026-08-07T15:37:03Z","title":"Zero Gap Is Not Restoration: Stratified Per-Question Probability Evaluation and Step-wise Mitigation of Benchmark Contamination","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-10T06:02:27.986129Z"},"links":{"citing_paper":"/paper/2608.07341"},"observation_digest":"sha256:2840ea86b317e6050cece907083d481dc172d82a5e55afc6c07ad9c38b3fc5d5","observation_id":"6ed97392-827c-42cc-80aa-34d3ca1a2bb8","resolution":{"observed_at":"2026-08-10T06:02:27.986129Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.00332","last_updated":"2024-11-22T22:27:49Z","snapshot_observed_at":"2026-08-09T21:05:48.710894Z","submitted_at":"2024-05-01T05:52:05Z","title":"A Careful Examination of Large Language Model Performance on Grade School Arithmetic","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.00332","snapshot_observed_at":"2026-08-10T06:02:27.990201Z","title":"2024 , journal =","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.07341","last_updated":"2026-08-07T15:37:03Z","snapshot_observed_at":"2026-08-10T23:14:40.744156Z","submitted_at":"2026-08-07T15:37:03Z","title":"Zero Gap Is Not Restoration: Stratified Per-Question Probability Evaluation and Step-wise Mitigation of Benchmark Contamination","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-10T06:02:27.990201Z"},"links":{"cited_paper":"/paper/2405.00332","citing_paper":"/paper/2608.07341"},"observation_digest":"sha256:f041ed62461e35c225911271df49f89d96aafa9839c7271f8acf5db3d2fb2aa0","observation_id":"b3051fb7-1264-46c2-ae22-5c473129c3d2","resolution":{"observed_at":"2026-08-10T06:02:27.990201Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T06:02:27.994149Z","title":"Multilingual Machine Translation with Large Language Models:","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.07341","last_updated":"2026-08-07T15:37:03Z","snapshot_observed_at":"2026-08-10T23:14:40.744156Z","submitted_at":"2026-08-07T15:37:03Z","title":"Zero Gap Is Not Restoration: Stratified Per-Question Probability Evaluation and Step-wise Mitigation of Benchmark Contamination","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-10T06:02:27.994149Z"},"links":{"citing_paper":"/paper/2608.07341"},"observation_digest":"sha256:2e1b85644b4fba093725312bf79f81f28cba254e8bc4611d98b4cc5b9f0a337c","observation_id":"4038ac83-4f4f-4f91-928a-a3ac7bac5ec2","resolution":{"observed_at":"2026-08-10T06:02:27.994149Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.07341","last_updated":"2026-08-07T15:37:03Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-10T23:14:40.744156Z","submitted_at":"2026-08-07T15:37:03Z","title":"Zero Gap Is Not Restoration: Stratified Per-Question Probability Evaluation and Step-wise Mitigation of Benchmark Contamination"},"reference_resolution":{"displayed":54,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":33,"verified_exact":4,"verified_fuzzy":17},"total_outbound_references":54},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 54 of 54 outbound references and 0 inbound Pith citation observations for arXiv:2608.07341."}