Pith. sign in

Paper Citation Record · LEDGER

An Open Source Data Contamination Report for Large Language Models

As of 14 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 12 inbound Pith citation observations for arXiv:2310.17589.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2310.17589 v3

Coverage vector

measured 0 of 0 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links

measured 12 of 12 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-14T06:32:32.682623+00:00

measured 12 of 12 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-08-12T19:19:26.143329Z

measured 1 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: arxiv_reference, observed 2026-08-05T02:28:24.338817Z

Reference resolution

0 of 0 outbound references displayed

  • verified exact0
  • verified fuzzy0
  • unresolved0
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

3
arxiv_reference, observed 2026-08-05T02:28:24.338817Z

Outbound references

No outbound reference observations are available for this paper version.

Pith citing papers

Observation ef0597a4-e019-459c-a4e0-68f24c942d05 · inbound

Benchmark Data Contamination of Large Language Models: A Survey cites this paper.

Benchmark Data Contamination of Large Language Models: A Survey An Open Source Data Contamination Report for Large Language Models

Reference 96

Resolution
verified exact
arxiv_id, observed 2026-05-22T23:10:41.032900Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-05-22T23:10:40.420241Z digest=sha256:122410452400adf283975e243030fed71f6e284953cf7f5ca8827519f90428f6

Observation c576fd31-1149-4b0a-a936-5a58ff3106f0 · inbound

CODECLEANER: Elevating Standards with A Robust Data Contamination Mitigation Toolkit cites this paper.

CODECLEANER: Elevating Standards with A Robust Data Contamination Mitigation Toolkit An Open Source Data Contamination Report for Large Language Models

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-12T19:19:26.143329Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T19:19:26.143329Z digest=sha256:fafb3aa823a4ae37db0d4b18a837ee80bd7b41940d1094a17028a7bd26d2d062

Observation ee03b377-96c4-416c-b47c-18ae36daedf9 · inbound

AntiLeakBench: Preventing Data Contamination by Automatically Constructing Benchmarks with Updated Real-World Knowledge cites this paper.

AntiLeakBench: Preventing Data Contamination by Automatically Constructing Benchmarks with Updated Real-World Knowledge An Open Source Data Contamination Report for Large Language Models

Reference 25

Resolution
unresolved
no resolver link, observed 2026-08-11T12:58:02.107514Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-11T12:58:02.107514Z digest=sha256:ccde59b51aab8e67bec0757cdd145220372ebac94d0bef30a4ef9f98545975e6

Observation 6dfbb20a-0715-49c3-a026-2e69695dcebd · inbound

Reasoning Through Execution: Unifying Process and Outcome Rewards for Code Generation cites this paper.

Reasoning Through Execution: Unifying Process and Outcome Rewards for Code Generation An Open Source Data Contamination Report for Large Language Models

Reference 48

Resolution
unresolved
no resolver link, observed 2026-08-11T11:40:13.645069Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-11T11:40:13.645069Z digest=sha256:956187923be191d2f067ebedb61c25114d805c4cb1f9dacdde66bc6b8c1ba1c9

Observation 557de4d9-46fa-4952-9021-f3fd66020da8 · inbound

MeDiSumQA: Patient-Oriented Question-Answer Generation from Discharge Letters cites this paper.

MeDiSumQA: Patient-Oriented Question-Answer Generation from Discharge Letters An Open Source Data Contamination Report for Large Language Models

Reference 26

Resolution
unresolved
no resolver link, observed 2026-08-09T05:15:41.599246Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-09T05:15:41.599246Z digest=sha256:281509cebf28c17aef53d7da4035099fd3d547fbecff2e3f123395dafa12b049

Observation 2f5b0c50-5873-4c8b-ae0f-29c48757c09d · inbound

Unbiased Evaluation of Large Language Models from a Causal Perspective cites this paper.

Unbiased Evaluation of Large Language Models from a Causal Perspective An Open Source Data Contamination Report for Large Language Models

Reference 15

Resolution
unresolved
no resolver link, observed 2026-08-08T14:51:15.421100Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T14:51:15.421100Z digest=sha256:ed0f72ebbdd735afd36a331a845c6bb067b2890c3420393b0e7821c37dc183a9

Observation ba7e9401-0156-4f55-a3d7-8fd51bc3a93a · inbound

Answer-Centric or Reasoning-Driven? Uncovering the Latent Memory Anchor in LLMs cites this paper.

Answer-Centric or Reasoning-Driven? Uncovering the Latent Memory Anchor in LLMs An Open Source Data Contamination Report for Large Language Models

Reference 31

Resolution
unresolved
no resolver link, observed 2026-08-06T23:33:55.250770Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T23:33:55.250770Z digest=sha256:d75318a63688de687133b20473f41f6b43711a560ace7535504ac1433016e7f2

Observation 57deabd8-a779-4d98-9d53-f4fc10f32e7a · inbound

Controlling the Risk of Corrupted Contexts for Language Models via Early-Exiting cites this paper.

Controlling the Risk of Corrupted Contexts for Language Models via Early-Exiting An Open Source Data Contamination Report for Large Language Models

Reference 33

Resolution
unresolved
no resolver link, observed 2026-08-04T12:45:26.141280Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-04T12:45:26.141280Z digest=sha256:4e536d3d46fbbde9ccd2ad82f94fef7d352298c6890716f55dccd30a9b52b855

Observation 6df8c3ff-4aa5-4343-a916-55e5e70f6222 · inbound

Inflated Excellence or True Performance? Rethinking Medical Diagnostic Benchmarks with Dynamic Evaluation cites this paper.

Inflated Excellence or True Performance? Rethinking Medical Diagnostic Benchmarks with Dynamic Evaluation An Open Source Data Contamination Report for Large Language Models

Reference 4

Resolution
verified exact
arxiv_id, observed 2026-05-18T08:12:29.830869Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-05-18T08:12:02.449352Z digest=sha256:fb91bdcf5ebbffd91bf2fe5873f87900e3afd5cb4d01b6b10399934b2c7ecd55

Observation b387dd4a-0118-4ea0-b182-b6d907e860a2 · inbound

SPENCE: A Syntactic Probe for Detecting Contamination in NL2SQL Benchmarks cites this paper.

SPENCE: A Syntactic Probe for Detecting Contamination in NL2SQL Benchmarks An Open Source Data Contamination Report for Large Language Models

Reference 8

Resolution
metadata mismatch
arxiv_id, observed 2026-05-10T04:45:21.214169Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=arxiv_source observed=2026-05-10T04:40:42.747298Z digest=sha256:0bb363361fc1baa801712eb5887608062283761e4399cd83b1331595245e0d36

Observation a5ac612e-1d6a-4cb3-b8c8-c660e783d84f · inbound

Pretraining Data Exposure in Large Language Models: A Survey of Membership Inference, Data Contamination, and Security Implications cites this paper.

Pretraining Data Exposure in Large Language Models: A Survey of Membership Inference, Data Contamination, and Security Implications An Open Source Data Contamination Report for Large Language Models

Reference 30

Resolution
verified exact
arxiv_id, observed 2026-06-30T17:24:56.622082Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-06-30T17:20:16.735285Z digest=sha256:1b4e98ae8841da9ee57b97933a8ad437fa017cf704f472cb22a8531b2d55872b

Observation b70d2bd0-9bc7-4144-8574-e3b888745eb7 · inbound

Structure Before Collapse: Transient semantic geometry in next-token prediction cites this paper.

Structure Before Collapse: Transient semantic geometry in next-token prediction An Open Source Data Contamination Report for Large Language Models

Reference 88

Resolution
metadata mismatch
arxiv_id, observed 2026-07-04T13:29:51.068669Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=arxiv_source observed=2026-06-26T05:14:07.208255Z digest=sha256:45e34924151d9bbde2303b4c29b13cdb996f242cbcf31c9e6487a93cea840ac5