{"as_of":"2026-08-14T16:17:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:25ac8be6bf98eb18335feeab48986cb8548e0b61becf97cff68a596e3ecc8be8","coverage":[{"denominator":33,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":33,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T14:51:53.845119Z","state":"measured"},{"denominator":34,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":34,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-10T02:11:19.672753Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-11T13:11:21.271928Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.17389","last_updated":"2025-07-23T10:34:22Z","snapshot_observed_at":"2026-08-07T11:21:36.520513Z","submitted_at":"2025-07-23T10:34:22Z","title":"Investigating Training Data Detection in AI Coders","version":1},"cited_work":{"arxiv_id":"2507.17389","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.17389","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Investigating training data detection in ai coders","venue":null,"work_id":"ff50a55b-8125-4c86-bef5-08dc65c14278","year":2025},"citing_paper":{"arxiv_id":"2604.19488","last_updated":"2026-04-21T14:10:37Z","snapshot_observed_at":"2026-08-13T22:57:43.799315Z","submitted_at":"2026-04-21T14:10:37Z","title":"CoDA: Towards Effective Cross-domain Knowledge Transfer via CoT-guided Domain Adaptation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-10T02:11:19.672753Z"},"links":{"cited_paper":"/paper/2507.17389","citing_paper":"/paper/2604.19488"},"observation_digest":"sha256:00bbc7353deb749b57471c761f32a04076073f5d631dd09e6f1001424602b28d","observation_id":"48071e04-609d-4a73-a225-e755b3a4520a","resolution":{"observed_at":"2026-05-11T13:11:21.336531Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2507.17389/citation-record","integrity":"/paper/2507.17389/integrity","json":"/paper/2507.17389/citation-record.json","paper":"/paper/2507.17389"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:51:54.476932Z","title":"Our Website","venue":null,"work_id":"e1181ddc-0660-4bc6-8ec7-3ede0a5a679b","year":2025},"citing_paper":{"arxiv_id":"2507.17389","last_updated":"2025-07-23T10:34:22Z","snapshot_observed_at":"2026-08-07T11:21:36.520513Z","submitted_at":"2025-07-23T10:34:22Z","title":"Investigating Training Data Detection in AI Coders","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T14:51:53.741925Z"},"links":{"citing_paper":"/paper/2507.17389"},"observation_digest":"sha256:30461d792dbf9718eb8a9ef48b5a99d6337ad2867d031718dde6bad11b90a760","observation_id":"f6a24efa-1ea7-43df-a269-441e5ebc5dd1","resolution":{"observed_at":"2026-08-06T14:51:54.479939Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:51:54.467693Z","title":null,"venue":null,"work_id":"0fe9cdc6-4942-421e-8ee2-c40432effedb","year":null},"citing_paper":{"arxiv_id":"2507.17389","last_updated":"2025-07-23T10:34:22Z","snapshot_observed_at":"2026-08-07T11:21:36.520513Z","submitted_at":"2025-07-23T10:34:22Z","title":"Investigating Training Data Detection in AI Coders","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T14:51:53.745825Z"},"links":{"citing_paper":"/paper/2507.17389"},"observation_digest":"sha256:cdde1cc8a23d897b4860d60a2fc863dc316c93c80867f144e397fdc20ff72855","observation_id":"c73661f8-9c62-4e94-bcc6-3b6976bca2fa","resolution":{"observed_at":"2026-08-06T14:51:54.470730Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:51:54.458211Z","title":null,"venue":null,"work_id":"7347d677-f1c6-4e89-ba92-a3cb34b54d13","year":2025},"citing_paper":{"arxiv_id":"2507.17389","last_updated":"2025-07-23T10:34:22Z","snapshot_observed_at":"2026-08-07T11:21:36.520513Z","submitted_at":"2025-07-23T10:34:22Z","title":"Investigating Training Data Detection in AI Coders","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T14:51:53.752764Z"},"links":{"citing_paper":"/paper/2507.17389"},"observation_digest":"sha256:8eadacd71aa6bdef1de3d6c6e92be9eaa9151a0f50505beb9b6a2e3ed78f96a4","observation_id":"4d9c0795-f1f6-4e8c-9f5c-a5f5e66d4e26","resolution":{"observed_at":"2026-08-06T14:51:54.461178Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:51:53.755745Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.17389","last_updated":"2025-07-23T10:34:22Z","snapshot_observed_at":"2026-08-07T11:21:36.520513Z","submitted_at":"2025-07-23T10:34:22Z","title":"Investigating Training Data Detection in AI Coders","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T14:51:53.755745Z"},"links":{"citing_paper":"/paper/2507.17389"},"observation_digest":"sha256:76e8d5b15594f3b6bf8b4605f20b47049a555ccf53986e3d7e495110295538f2","observation_id":"c448c9b9-b6db-42c5-87c6-17eefbc5d2f0","resolution":{"observed_at":"2026-08-06T14:51:53.755745Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2002.08155","last_updated":"2020-09-18T15:38:12Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-02-19T13:09:07Z","title":"CodeBERT: A Pre-Trained Model for Programming and Natural Languages","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.08155","snapshot_observed_at":"2026-08-06T14:51:53.759459Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.17389","last_updated":"2025-07-23T10:34:22Z","snapshot_observed_at":"2026-08-07T11:21:36.520513Z","submitted_at":"2025-07-23T10:34:22Z","title":"Investigating Training Data Detection in AI Coders","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T14:51:53.759459Z"},"links":{"cited_paper":"/paper/2002.08155","citing_paper":"/paper/2507.17389"},"observation_digest":"sha256:f026859344e0f0b5be8188a1311afc7eb30bf49f420230db1b283fbc5b51e543","observation_id":"37aaf90c-8c02-410e-b8ce-61c6287843ef","resolution":{"observed_at":"2026-08-06T14:51:53.759459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.14196","last_updated":"2024-01-26T09:23:11Z","snapshot_observed_at":"2026-08-06T22:40:28.707813Z","submitted_at":"2024-01-25T14:17:53Z","title":"DeepSeek-Coder: When the Large Language Model Meets Programming -- The Rise of Code Intelligence","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.14196","snapshot_observed_at":"2026-08-06T14:51:53.762906Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.17389","last_updated":"2025-07-23T10:34:22Z","snapshot_observed_at":"2026-08-07T11:21:36.520513Z","submitted_at":"2025-07-23T10:34:22Z","title":"Investigating Training Data Detection in AI Coders","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T14:51:53.762906Z"},"links":{"cited_paper":"/paper/2401.14196","citing_paper":"/paper/2507.17389"},"observation_digest":"sha256:ec271d9cf011d5a7549a9932c768e25e475bba757d8aa967a97e3fcc4f455708","observation_id":"0f4fe14c-8d93-4ace-b3db-11a2961bd6cd","resolution":{"observed_at":"2026-08-06T14:51:53.762906Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:51:54.444150Z","title":null,"venue":null,"work_id":"a547ebab-0d5c-485e-adc4-6224fb600b45","year":2022},"citing_paper":{"arxiv_id":"2507.17389","last_updated":"2025-07-23T10:34:22Z","snapshot_observed_at":"2026-08-07T11:21:36.520513Z","submitted_at":"2025-07-23T10:34:22Z","title":"Investigating Training Data Detection in AI Coders","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T14:51:53.766324Z"},"links":{"citing_paper":"/paper/2507.17389"},"observation_digest":"sha256:c0b971c9d24678fc711a4b6a67404634ac73f3383c962ef94441419a084da8e8","observation_id":"810c921e-efe7-4853-9a5f-191cf81cafd4","resolution":{"observed_at":"2026-08-06T14:51:54.447111Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06059","last_updated":"2024-01-11T17:24:49Z","snapshot_observed_at":"2026-08-14T13:26:22.246665Z","submitted_at":"2024-01-11T17:24:49Z","title":"Investigating Data Contamination for Pre-training Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.06059","snapshot_observed_at":"2026-08-06T14:51:53.769972Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.17389","last_updated":"2025-07-23T10:34:22Z","snapshot_observed_at":"2026-08-07T11:21:36.520513Z","submitted_at":"2025-07-23T10:34:22Z","title":"Investigating Training Data Detection in AI Coders","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T14:51:53.769972Z"},"links":{"cited_paper":"/paper/2401.06059","citing_paper":"/paper/2507.17389"},"observation_digest":"sha256:8fc82efe0eb7251bc5928ae633c4430e9039eb4048d0b33f27fa13fec0718479","observation_id":"ede787cc-e818-4db0-be20-9d383381e5f6","resolution":{"observed_at":"2026-08-06T14:51:53.769972Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.15533","last_updated":"2022-11-20T18:15:30Z","snapshot_observed_at":"2026-08-13T13:38:46.469939Z","submitted_at":"2022-11-20T18:15:30Z","title":"The Stack: 3 TB of permissively licensed source code","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.15533","snapshot_observed_at":"2026-08-06T14:51:53.773724Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.17389","last_updated":"2025-07-23T10:34:22Z","snapshot_observed_at":"2026-08-07T11:21:36.520513Z","submitted_at":"2025-07-23T10:34:22Z","title":"Investigating Training Data Detection in AI Coders","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T14:51:53.773724Z"},"links":{"cited_paper":"/paper/2211.15533","citing_paper":"/paper/2507.17389"},"observation_digest":"sha256:cc9102180f4b053344ffe436cabb605b1dde7af118021f5fe11b122f69098283","observation_id":"fccd12f1-fb4d-47ae-87c2-54e179faec2c","resolution":{"observed_at":"2026-08-06T14:51:53.773724Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06161","last_updated":"2023-12-13T14:44:10Z","snapshot_observed_at":"2026-07-06T15:25:35.930688Z","submitted_at":"2023-05-09T08:16:42Z","title":"StarCoder: may the source be with you!","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06161","snapshot_observed_at":"2026-08-06T14:51:53.777247Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.17389","last_updated":"2025-07-23T10:34:22Z","snapshot_observed_at":"2026-08-07T11:21:36.520513Z","submitted_at":"2025-07-23T10:34:22Z","title":"Investigating Training Data Detection in AI Coders","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T14:51:53.777247Z"},"links":{"cited_paper":"/paper/2305.06161","citing_paper":"/paper/2507.17389"},"observation_digest":"sha256:57addca44da74e595c1983e0b06a2df03dc7b85bb2f98b54a706dc62dd922c4d","observation_id":"a0e8f2d8-3747-44e8-9cc9-cb061543db1d","resolution":{"observed_at":"2026-08-06T14:51:53.777247Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:51:54.435035Z","title":null,"venue":null,"work_id":"7b82ab8a-3192-425b-ad69-9bf3192e640d","year":null},"citing_paper":{"arxiv_id":"2507.17389","last_updated":"2025-07-23T10:34:22Z","snapshot_observed_at":"2026-08-07T11:21:36.520513Z","submitted_at":"2025-07-23T10:34:22Z","title":"Investigating Training Data Detection in AI Coders","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T14:51:53.780878Z"},"links":{"citing_paper":"/paper/2507.17389"},"observation_digest":"sha256:515e7646d8d46eda3c7b57c176c646fb62ad88c6980e2dc533f269a54ba3c76c","observation_id":"b6645eef-b547-47c8-b7ee-2e9e6f2315b6","resolution":{"observed_at":"2026-08-06T14:51:54.438021Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.01210","last_updated":"2023-10-30T19:37:09Z","snapshot_observed_at":"2026-08-12T18:11:04.754824Z","submitted_at":"2023-05-02T05:46:48Z","title":"Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.01210","snapshot_observed_at":"2026-08-06T14:51:53.788650Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.17389","last_updated":"2025-07-23T10:34:22Z","snapshot_observed_at":"2026-08-07T11:21:36.520513Z","submitted_at":"2025-07-23T10:34:22Z","title":"Investigating Training Data Detection in AI Coders","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T14:51:53.788650Z"},"links":{"cited_paper":"/paper/2305.01210","citing_paper":"/paper/2507.17389"},"observation_digest":"sha256:6d30c6bb540b0eab83e33bf3777b8474a4611ad04d77aca0fcd33c1ab5c2fe28","observation_id":"5033f586-a176-4f67-ab6b-e7c12760a395","resolution":{"observed_at":"2026-08-06T14:51:53.788650Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.01333","last_updated":"2024-06-03T13:58:04Z","snapshot_observed_at":"2026-08-14T14:59:43.373526Z","submitted_at":"2024-06-03T13:58:04Z","title":"Probing Language Models for Pre-training Data Detection","version":1},"cited_work":{"arxiv_id":"2406.01333","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.01333","snapshot_observed_at":"2026-08-06T14:51:54.327926Z","title":"Probing Language Models for Pre-training Data Detection","venue":"cs.CL","work_id":"5ae899a0-cb03-4f03-b752-9a0e8856ab64","year":2024},"citing_paper":{"arxiv_id":"2507.17389","last_updated":"2025-07-23T10:34:22Z","snapshot_observed_at":"2026-08-07T11:21:36.520513Z","submitted_at":"2025-07-23T10:34:22Z","title":"Investigating Training Data Detection in AI Coders","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T14:51:53.791821Z"},"links":{"cited_paper":"/paper/2406.01333","citing_paper":"/paper/2507.17389"},"observation_digest":"sha256:4a79c354af02527f1f1ecf41545cbd026d564d7e8d4df256c42c041ce52f95db","observation_id":"95147091-839a-4949-8508-5ce9011bf053","resolution":{"observed_at":"2026-08-06T14:51:54.331327Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:51:54.426490Z","title":null,"venue":null,"work_id":"709376d1-8864-4b95-8ab4-a31b765eb7b4","year":2025},"citing_paper":{"arxiv_id":"2507.17389","last_updated":"2025-07-23T10:34:22Z","snapshot_observed_at":"2026-08-07T11:21:36.520513Z","submitted_at":"2025-07-23T10:34:22Z","title":"Investigating Training Data Detection in AI Coders","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T14:51:53.795171Z"},"links":{"citing_paper":"/paper/2507.17389"},"observation_digest":"sha256:84e11465b67a49e0b45401d6907fb44dad912775d6e3a2ff3e4534b21ee7cc4b","observation_id":"8a96d7ea-d638-423b-8293-1801ee533ca7","resolution":{"observed_at":"2026-08-06T14:51:54.429453Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18462","last_updated":"2023-08-07T06:32:56Z","snapshot_observed_at":"2026-08-13T11:30:31.522963Z","submitted_at":"2023-05-29T07:06:03Z","title":"Membership Inference Attacks against Language Models via Neighbourhood Comparison","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.18462","snapshot_observed_at":"2026-08-06T14:51:53.798105Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.17389","last_updated":"2025-07-23T10:34:22Z","snapshot_observed_at":"2026-08-07T11:21:36.520513Z","submitted_at":"2025-07-23T10:34:22Z","title":"Investigating Training Data Detection in AI Coders","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T14:51:53.798105Z"},"links":{"cited_paper":"/paper/2305.18462","citing_paper":"/paper/2507.17389"},"observation_digest":"sha256:42741a57e1423de9097b860944d866eb627769f7eb5bc174abdce42180c0925f","observation_id":"59fa5440-5692-430b-8751-e1166635ebbd","resolution":{"observed_at":"2026-08-06T14:51:53.798105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12950","last_updated":"2024-01-31T19:47:26Z","snapshot_observed_at":"2026-08-13T04:25:38.282910Z","submitted_at":"2023-08-24T17:39:13Z","title":"Code Llama: Open Foundation Models for Code","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12950","snapshot_observed_at":"2026-08-06T14:51:53.801198Z","title":"Li et al","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.17389","last_updated":"2025-07-23T10:34:22Z","snapshot_observed_at":"2026-08-07T11:21:36.520513Z","submitted_at":"2025-07-23T10:34:22Z","title":"Investigating Training Data Detection in AI Coders","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T14:51:53.801198Z"},"links":{"cited_paper":"/paper/2308.12950","citing_paper":"/paper/2507.17389"},"observation_digest":"sha256:da9ab7b6964d81f550492ade3dab38b9f06c6308420cd1a7404d07ea7c14eca8","observation_id":"2c80d530-4f68-4340-b50a-80800b5b721a","resolution":{"observed_at":"2026-08-06T14:51:53.801198Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.16789","last_updated":"2024-03-09T22:26:06Z","snapshot_observed_at":"2026-08-08T18:07:29.632928Z","submitted_at":"2023-10-25T17:21:23Z","title":"Detecting Pretraining Data from Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.16789","snapshot_observed_at":"2026-08-06T14:51:53.804502Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.17389","last_updated":"2025-07-23T10:34:22Z","snapshot_observed_at":"2026-08-07T11:21:36.520513Z","submitted_at":"2025-07-23T10:34:22Z","title":"Investigating Training Data Detection in AI Coders","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T14:51:53.804502Z"},"links":{"cited_paper":"/paper/2310.16789","citing_paper":"/paper/2507.17389"},"observation_digest":"sha256:b8ed4b0a8c1cba176500102f58d004322aa83913a60719e3cf5214d3a2bef121","observation_id":"04eebe5c-2eec-4006-8416-3f67ee1de8c4","resolution":{"observed_at":"2026-08-06T14:51:53.804502Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:51:54.417856Z","title":null,"venue":null,"work_id":"cd017f0a-e171-4aa0-9bca-cb10d9c7391f","year":null},"citing_paper":{"arxiv_id":"2507.17389","last_updated":"2025-07-23T10:34:22Z","snapshot_observed_at":"2026-08-07T11:21:36.520513Z","submitted_at":"2025-07-23T10:34:22Z","title":"Investigating Training Data Detection in AI Coders","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T14:51:53.807721Z"},"links":{"citing_paper":"/paper/2507.17389"},"observation_digest":"sha256:9708fce8e5a10fc5c3311c8dd06e44caaf8e453e530a814bf11652fa45c95ebe","observation_id":"ae33e463-189b-4021-b2b5-d7cc6d610b5f","resolution":{"observed_at":"2026-08-06T14:51:54.420931Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.09048","last_updated":"2024-12-15T14:37:29Z","snapshot_observed_at":"2026-08-12T22:25:11.671575Z","submitted_at":"2024-10-11T17:59:58Z","title":"Towards Trustworthy LLMs for Code: A Data-Centric Synergistic Auditing Framework","version":2},"cited_work":{"arxiv_id":"2410.09048","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.09048","snapshot_observed_at":"2026-08-06T14:51:54.276763Z","title":"Towards Trustworthy LLMs for Code: A Data-Centric Synergistic Auditing Framework","venue":"cs.SE","work_id":"57d340c4-c2e0-4a1a-93b3-4668e9425763","year":2024},"citing_paper":{"arxiv_id":"2507.17389","last_updated":"2025-07-23T10:34:22Z","snapshot_observed_at":"2026-08-07T11:21:36.520513Z","submitted_at":"2025-07-23T10:34:22Z","title":"Investigating Training Data Detection in AI Coders","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T14:51:53.813785Z"},"links":{"cited_paper":"/paper/2410.09048","citing_paper":"/paper/2507.17389"},"observation_digest":"sha256:8aa245945fa392ef615ab814f7c03288c8f2e91734b2b4db47ddb967ace60b79","observation_id":"c6b115c7-78a4-43a9-8ecc-0b6df4fcc44c","resolution":{"observed_at":"2026-08-06T14:51:54.281288Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:51:53.816548Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.17389","last_updated":"2025-07-23T10:34:22Z","snapshot_observed_at":"2026-08-07T11:21:36.520513Z","submitted_at":"2025-07-23T10:34:22Z","title":"Investigating Training Data Detection in AI Coders","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T14:51:53.816548Z"},"links":{"citing_paper":"/paper/2507.17389"},"observation_digest":"sha256:3a256218ef6c2a6243abd26fb2cca8c548cf4782dc508f1cef6b15e75a982156","observation_id":"837f54cd-59ec-404c-b565-70e5a1390271","resolution":{"observed_at":"2026-08-06T14:51:53.816548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2025.35507","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:51:54.170929Z","title":null,"venue":null,"work_id":"b6852f36-42f9-4178-a27c-b69ad99c5bb3","year":2025},"citing_paper":{"arxiv_id":"2507.17389","last_updated":"2025-07-23T10:34:22Z","snapshot_observed_at":"2026-08-07T11:21:36.520513Z","submitted_at":"2025-07-23T10:34:22Z","title":"Investigating Training Data Detection in AI Coders","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T14:51:53.819039Z"},"links":{"citing_paper":"/paper/2507.17389"},"observation_digest":"sha256:b3c2129527fc5787ce54feaf5792ae65fde39cf36d126606964dbf5d7ecc29c3","observation_id":"24eaa48e-dd42-48b2-933e-91cf64caf487","resolution":{"observed_at":"2026-08-06T14:51:54.176637Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:51:53.821665Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.17389","last_updated":"2025-07-23T10:34:22Z","snapshot_observed_at":"2026-08-07T11:21:36.520513Z","submitted_at":"2025-07-23T10:34:22Z","title":"Investigating Training Data Detection in AI Coders","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T14:51:53.821665Z"},"links":{"citing_paper":"/paper/2507.17389"},"observation_digest":"sha256:4cf2dcae950ea81c22f43d0e4a78efc0d438fca685bc3eaa50539f7d7a050265","observation_id":"008b70ac-fbdb-4243-988d-720a4f2dd332","resolution":{"observed_at":"2026-08-06T14:51:53.821665Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.15968","last_updated":"2025-05-23T08:57:14Z","snapshot_observed_at":"2026-08-13T00:12:12.564450Z","submitted_at":"2024-06-23T00:23:13Z","title":"ReCaLL: Membership Inference via Relative Conditional Log-Likelihoods","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.15968","snapshot_observed_at":"2026-08-06T14:51:53.824160Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.17389","last_updated":"2025-07-23T10:34:22Z","snapshot_observed_at":"2026-08-07T11:21:36.520513Z","submitted_at":"2025-07-23T10:34:22Z","title":"Investigating Training Data Detection in AI Coders","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T14:51:53.824160Z"},"links":{"cited_paper":"/paper/2406.15968","citing_paper":"/paper/2507.17389"},"observation_digest":"sha256:e2b774f045f65e30d16e11cebab957bbc088d663e712c011af7349a0bd6c91ad","observation_id":"873b7cc3-6e85-486b-92bc-27ca22915f8c","resolution":{"observed_at":"2026-08-06T14:51:53.824160Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.17264","last_updated":"2024-12-23T04:19:45Z","snapshot_observed_at":"2026-08-14T02:19:15.631395Z","submitted_at":"2024-12-23T04:19:45Z","title":"ACECode: A Reinforcement Learning Framework for Aligning Code Efficiency and Correctness in Code Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.17264","snapshot_observed_at":"2026-08-06T14:51:53.826996Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.17389","last_updated":"2025-07-23T10:34:22Z","snapshot_observed_at":"2026-08-07T11:21:36.520513Z","submitted_at":"2025-07-23T10:34:22Z","title":"Investigating Training Data Detection in AI Coders","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T14:51:53.826996Z"},"links":{"cited_paper":"/paper/2412.17264","citing_paper":"/paper/2507.17389"},"observation_digest":"sha256:9d83cf20a2cfbe984b3be7e8bcdcd6d337d820513ba4c8c1eba8a64a2abde282","observation_id":"a356e882-72bc-4a2a-82e4-b9caedb35f36","resolution":{"observed_at":"2026-08-06T14:51:53.826996Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01166","last_updated":"2024-10-15T12:58:00Z","snapshot_observed_at":"2026-08-13T05:59:21.994820Z","submitted_at":"2023-10-02T12:50:43Z","title":"Gotcha! This Model Uses My Code! Evaluating Membership Leakage Risks in Code Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01166","snapshot_observed_at":"2026-08-06T14:51:53.830175Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.17389","last_updated":"2025-07-23T10:34:22Z","snapshot_observed_at":"2026-08-07T11:21:36.520513Z","submitted_at":"2025-07-23T10:34:22Z","title":"Investigating Training Data Detection in AI Coders","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T14:51:53.830175Z"},"links":{"cited_paper":"/paper/2310.01166","citing_paper":"/paper/2507.17389"},"observation_digest":"sha256:a1bbc4fa77752321692de49886d91bd5d796ace216630a61efe32899abf98ca2","observation_id":"63bfba6d-9f5b-4859-9376-67809182c415","resolution":{"observed_at":"2026-08-06T14:51:53.830175Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1709.01604","last_updated":"2018-05-04T22:43:43Z","snapshot_observed_at":"2026-08-02T04:15:45.339659Z","submitted_at":"2017-09-05T21:56:24Z","title":"Privacy Risk in Machine Learning: Analyzing the Connection to Overfitting","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1709.01604","snapshot_observed_at":"2026-08-06T14:51:53.833356Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.17389","last_updated":"2025-07-23T10:34:22Z","snapshot_observed_at":"2026-08-07T11:21:36.520513Z","submitted_at":"2025-07-23T10:34:22Z","title":"Investigating Training Data Detection in AI Coders","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T14:51:53.833356Z"},"links":{"cited_paper":"/paper/1709.01604","citing_paper":"/paper/2507.17389"},"observation_digest":"sha256:fac7366d86f028c1bf5170c7785ada16b2c4c746ef016ff79b5d87d3c3613df0","observation_id":"b64fef41-badf-4003-9549-7af22b4c00eb","resolution":{"observed_at":"2026-08-06T14:51:53.833356Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:51:54.409378Z","title":null,"venue":null,"work_id":"0efffd37-25ce-47fb-9378-59fb33eb3624","year":2023},"citing_paper":{"arxiv_id":"2507.17389","last_updated":"2025-07-23T10:34:22Z","snapshot_observed_at":"2026-08-07T11:21:36.520513Z","submitted_at":"2025-07-23T10:34:22Z","title":"Investigating Training Data Detection in AI Coders","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T14:51:53.836317Z"},"links":{"citing_paper":"/paper/2507.17389"},"observation_digest":"sha256:af58c3a8c4208fe4cc96e609ef30364a5d6ea191f3facfcce4932796b26e7d8b","observation_id":"93196f24-36f7-4bf2-956d-6d78bc7cbead","resolution":{"observed_at":"2026-08-06T14:51:54.412195Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02936","last_updated":"2025-02-12T04:41:34Z","snapshot_observed_at":"2026-08-13T00:38:47.155280Z","submitted_at":"2024-04-03T04:25:01Z","title":"Min-K%++: Improved Baseline for Detecting Pre-Training Data from Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02936","snapshot_observed_at":"2026-08-06T14:51:53.839169Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.17389","last_updated":"2025-07-23T10:34:22Z","snapshot_observed_at":"2026-08-07T11:21:36.520513Z","submitted_at":"2025-07-23T10:34:22Z","title":"Investigating Training Data Detection in AI Coders","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T14:51:53.839169Z"},"links":{"cited_paper":"/paper/2404.02936","citing_paper":"/paper/2507.17389"},"observation_digest":"sha256:9430797ae582a562cb8d23a3f92e98d7073ad154927b4f261ca8706cd34e0909","observation_id":"34c00687-a372-46be-8ae7-bcb5347cb0e3","resolution":{"observed_at":"2026-08-06T14:51:53.839169Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:51:54.400756Z","title":null,"venue":null,"work_id":"18b400ed-fe5a-439d-b171-a6e2be743aaf","year":2024},"citing_paper":{"arxiv_id":"2507.17389","last_updated":"2025-07-23T10:34:22Z","snapshot_observed_at":"2026-08-07T11:21:36.520513Z","submitted_at":"2025-07-23T10:34:22Z","title":"Investigating Training Data Detection in AI Coders","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T14:51:53.842231Z"},"links":{"citing_paper":"/paper/2507.17389"},"observation_digest":"sha256:ff51701a8236c8c35c73c8aae1a84f9f08688c5e10a2171fb9094be605bf711f","observation_id":"0c9fe411-2662-481b-93c3-b9dc6923b109","resolution":{"observed_at":"2026-08-06T14:51:54.403659Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.14781","last_updated":"2025-05-21T03:41:29Z","snapshot_observed_at":"2026-08-12T22:39:49.298216Z","submitted_at":"2024-09-23T07:55:35Z","title":"Pretraining Data Detection for Large Language Models: A Divergence-based Calibration Method","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.14781","snapshot_observed_at":"2026-08-06T14:51:53.845119Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.17389","last_updated":"2025-07-23T10:34:22Z","snapshot_observed_at":"2026-08-07T11:21:36.520513Z","submitted_at":"2025-07-23T10:34:22Z","title":"Investigating Training Data Detection in AI Coders","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T14:51:53.845119Z"},"links":{"cited_paper":"/paper/2409.14781","citing_paper":"/paper/2507.17389"},"observation_digest":"sha256:f254d95d9543d1b4ddd79fae1ff91f8d16b09f37314650bc7a4ccdb640f3ea57","observation_id":"7fc4b8d2-cf88-4f0a-b520-a16a19c6c187","resolution":{"observed_at":"2026-08-06T14:51:53.845119Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1610.05820","last_updated":"2017-03-31T22:17:07Z","snapshot_observed_at":"2026-07-06T05:15:08.120372Z","submitted_at":"2016-10-18T22:38:33Z","title":"Membership Inference Attacks against Machine Learning Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1610.05820","snapshot_observed_at":"2026-08-06T14:51:53.810911Z","title":"arXiv:1610.05820 [cs.CR] https://arxiv.org/abs/1610.05820","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.17389","last_updated":"2025-07-23T10:34:22Z","snapshot_observed_at":"2026-08-07T11:21:36.520513Z","submitted_at":"2025-07-23T10:34:22Z","title":"Investigating Training Data Detection in AI Coders","version":1},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-06T14:51:53.810911Z"},"links":{"cited_paper":"/paper/1610.05820","citing_paper":"/paper/2507.17389"},"observation_digest":"sha256:b2f90c39e08386d4d7b46e68d00b0e5ad7cf77e7d1b435d6ffc002322a123619","observation_id":"99d9071b-1bed-4162-bcb0-e6a9c06314c5","resolution":{"observed_at":"2026-08-06T14:51:53.810911Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.03988","last_updated":"2023-02-24T09:53:40Z","snapshot_observed_at":"2026-08-13T13:07:56.285029Z","submitted_at":"2023-01-09T10:52:35Z","title":"SantaCoder: don't reach for the stars!","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.03988","snapshot_observed_at":"2026-08-06T14:51:53.749336Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.17389","last_updated":"2025-07-23T10:34:22Z","snapshot_observed_at":"2026-08-07T11:21:36.520513Z","submitted_at":"2025-07-23T10:34:22Z","title":"Investigating Training Data Detection in AI Coders","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-06T14:51:53.749336Z"},"links":{"cited_paper":"/paper/2301.03988","citing_paper":"/paper/2507.17389"},"observation_digest":"sha256:76ae359770a9ac42d9f1007482e85f4ba7d9c0a32f9765bf1526452c9625e68e","observation_id":"46061606-9455-48cf-a707-f6350f14070f","resolution":{"observed_at":"2026-08-06T14:51:53.749336Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14845","last_updated":"2024-02-19T14:00:39Z","snapshot_observed_at":"2026-08-13T04:15:25.184982Z","submitted_at":"2024-02-19T14:00:39Z","title":"Purifying Large Language Models by Ensembling a Small Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14845","snapshot_observed_at":"2026-08-06T14:51:53.784719Z","title":"arXiv preprint arXiv:2402.14845 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.17389","last_updated":"2025-07-23T10:34:22Z","snapshot_observed_at":"2026-08-07T11:21:36.520513Z","submitted_at":"2025-07-23T10:34:22Z","title":"Investigating Training Data Detection in AI Coders","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-06T14:51:53.784719Z"},"links":{"cited_paper":"/paper/2402.14845","citing_paper":"/paper/2507.17389"},"observation_digest":"sha256:c51f4437411274dbb7d484b680c862c7fca563cb0e83c9a69ef058e48d86af4a","observation_id":"71476e70-499a-4fa5-87a2-841cdf8965a7","resolution":{"observed_at":"2026-08-06T14:51:53.784719Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.17389","last_updated":"2025-07-23T10:34:22Z","latest_version":1,"primary_category":"cs.SE","snapshot_observed_at":"2026-08-07T11:21:36.520513Z","submitted_at":"2025-07-23T10:34:22Z","title":"Investigating Training Data Detection in AI Coders"},"reference_resolution":{"displayed":33,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":29,"verified_exact":2,"verified_fuzzy":1},"total_outbound_references":33},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 33 of 33 outbound references and 1 inbound Pith citation observation for arXiv:2507.17389."}