{"as_of":"2026-08-18T17:12:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f241013cb988bc7e118f0a28a0e7488f05cad8fc3a5a9b0021bb3fe6866190ce","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":12,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":12,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":12,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":12,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T04:28:00.475263Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T00:57:30.314629Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2202.06539","last_updated":"2022-12-20T05:21:40Z","snapshot_observed_at":"2026-08-16T17:21:33.769087Z","submitted_at":"2022-02-14T08:20:15Z","title":"Deduplicating Training Data Mitigates Privacy Risks in Language Models","version":3},"cited_work":{"arxiv_id":"2202.06539","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2202.06539","snapshot_observed_at":"2026-07-03T00:57:30.314629Z","title":"Kandpal, E","venue":null,"work_id":"3ae8f9ae-1809-495c-91a2-31ba604fe54b","year":2022},"citing_paper":{"arxiv_id":"2202.07646","last_updated":"2023-03-06T06:28:18Z","snapshot_observed_at":"2026-08-15T14:36:26.439846Z","submitted_at":"2022-02-15T18:48:31Z","title":"Quantifying Memorization Across Neural Language Models","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-13T22:04:59.678438Z"},"links":{"cited_paper":"/paper/2202.06539","citing_paper":"/paper/2202.07646"},"observation_digest":"sha256:7f33ad147878d333ef942d4c3b93e4fa4a52438bb737db14b712f480cf31aef4","observation_id":"9e87931d-9668-4a92-bd97-1b1ce5f5e8d8","resolution":{"observed_at":"2026-05-13T22:04:59.736198Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.06539","last_updated":"2022-12-20T05:21:40Z","snapshot_observed_at":"2026-08-16T17:21:33.769087Z","submitted_at":"2022-02-14T08:20:15Z","title":"Deduplicating Training Data Mitigates Privacy Risks in Language Models","version":3},"cited_work":{"arxiv_id":"2202.06539","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2202.06539","snapshot_observed_at":"2026-07-03T00:57:30.314629Z","title":"Kandpal, E","venue":null,"work_id":"3ae8f9ae-1809-495c-91a2-31ba604fe54b","year":2022},"citing_paper":{"arxiv_id":"2204.02311","last_updated":"2022-10-05T06:02:24Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-05T16:11:45Z","title":"PaLM: Scaling Language Modeling with Pathways","version":5},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-05-10T23:45:06.755839Z"},"links":{"cited_paper":"/paper/2202.06539","citing_paper":"/paper/2204.02311"},"observation_digest":"sha256:cedf8e9b7baa77aefb0bb74afd59eb4cd9d61cc7120e0e20d1966d9df6be8542","observation_id":"2f363a1d-ea9e-454d-9484-a6d0079fca53","resolution":{"observed_at":"2026-05-10T23:45:07.237261Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.06539","last_updated":"2022-12-20T05:21:40Z","snapshot_observed_at":"2026-08-16T17:21:33.769087Z","submitted_at":"2022-02-14T08:20:15Z","title":"Deduplicating Training Data Mitigates Privacy Risks in Language Models","version":3},"cited_work":{"arxiv_id":"2202.06539","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2202.06539","snapshot_observed_at":"2026-07-03T00:57:30.314629Z","title":"Kandpal, E","venue":null,"work_id":"3ae8f9ae-1809-495c-91a2-31ba604fe54b","year":2022},"citing_paper":{"arxiv_id":"2204.05999","last_updated":"2023-04-09T14:31:40Z","snapshot_observed_at":"2026-08-13T02:34:38.117682Z","submitted_at":"2022-04-12T16:25:26Z","title":"InCoder: A Generative Model for Code Infilling and Synthesis","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-16T02:21:20.438666Z"},"links":{"cited_paper":"/paper/2202.06539","citing_paper":"/paper/2204.05999"},"observation_digest":"sha256:189aa3df5ca82900462d3536f13e89f53f43e74c0bd66f5696aabac9627ccdf0","observation_id":"b3726548-9f1a-41a7-af9b-14878c356789","resolution":{"observed_at":"2026-05-16T02:21:20.501037Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.06539","last_updated":"2022-12-20T05:21:40Z","snapshot_observed_at":"2026-08-16T17:21:33.769087Z","submitted_at":"2022-02-14T08:20:15Z","title":"Deduplicating Training Data Mitigates Privacy Risks in Language Models","version":3},"cited_work":{"arxiv_id":"2202.06539","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2202.06539","snapshot_observed_at":"2026-07-03T00:57:30.314629Z","title":"Kandpal, E","venue":null,"work_id":"3ae8f9ae-1809-495c-91a2-31ba604fe54b","year":2022},"citing_paper":{"arxiv_id":"2204.06745","last_updated":"2022-04-14T04:00:27Z","snapshot_observed_at":"2026-08-13T14:54:27.001192Z","submitted_at":"2022-04-14T04:00:27Z","title":"GPT-NeoX-20B: An Open-Source Autoregressive Language Model","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-05-24T12:33:37.701655Z"},"links":{"cited_paper":"/paper/2202.06539","citing_paper":"/paper/2204.06745"},"observation_digest":"sha256:148a55d9451b0bb4d56abce2de70571dfa88eeaca6ac0c3d2810b59c6209e070","observation_id":"faca2c63-9af7-461d-9513-b0612106e5db","resolution":{"observed_at":"2026-05-24T12:34:28.395197Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.06539","last_updated":"2022-12-20T05:21:40Z","snapshot_observed_at":"2026-08-16T17:21:33.769087Z","submitted_at":"2022-02-14T08:20:15Z","title":"Deduplicating Training Data Mitigates Privacy Risks in Language Models","version":3},"cited_work":{"arxiv_id":"2202.06539","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2202.06539","snapshot_observed_at":"2026-07-03T00:57:30.314629Z","title":"Kandpal, E","venue":null,"work_id":"3ae8f9ae-1809-495c-91a2-31ba604fe54b","year":2022},"citing_paper":{"arxiv_id":"2206.07682","last_updated":"2022-10-26T05:06:24Z","snapshot_observed_at":"2026-08-17T00:14:01.413100Z","submitted_at":"2022-06-15T17:32:01Z","title":"Emergent Abilities of Large Language Models","version":2},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-05-11T07:38:37.734402Z"},"links":{"cited_paper":"/paper/2202.06539","citing_paper":"/paper/2206.07682"},"observation_digest":"sha256:1f3a42eb5d97a28c63e94fad5e7d75573679355c17fbdaf017bd8296f3eec71f","observation_id":"76310853-1be7-4e82-92f4-2eb3c78c766d","resolution":{"observed_at":"2026-05-11T07:38:38.372454Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.06539","last_updated":"2022-12-20T05:21:40Z","snapshot_observed_at":"2026-08-16T17:21:33.769087Z","submitted_at":"2022-02-14T08:20:15Z","title":"Deduplicating Training Data Mitigates Privacy Risks in Language Models","version":3},"cited_work":{"arxiv_id":"2202.06539","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2202.06539","snapshot_observed_at":"2026-07-03T00:57:30.314629Z","title":"Kandpal, E","venue":null,"work_id":"3ae8f9ae-1809-495c-91a2-31ba604fe54b","year":2022},"citing_paper":{"arxiv_id":"2303.09540","last_updated":"2023-03-22T17:22:35Z","snapshot_observed_at":"2026-08-06T15:07:40.203199Z","submitted_at":"2023-03-16T17:53:24Z","title":"SemDeDup: Data-efficient learning at web-scale through semantic deduplication","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-18T02:43:30.851915Z"},"links":{"cited_paper":"/paper/2202.06539","citing_paper":"/paper/2303.09540"},"observation_digest":"sha256:6ef27860551b68e9747478a1c0582f9832735b289bc90a5246a791f3a2de5e16","observation_id":"e2b7a3c8-f4b2-4687-98b0-ec217425aba5","resolution":{"observed_at":"2026-05-18T02:43:30.998986Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.06539","last_updated":"2022-12-20T05:21:40Z","snapshot_observed_at":"2026-08-16T17:21:33.769087Z","submitted_at":"2022-02-14T08:20:15Z","title":"Deduplicating Training Data Mitigates Privacy Risks in Language Models","version":3},"cited_work":{"arxiv_id":"2202.06539","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2202.06539","snapshot_observed_at":"2026-07-03T00:57:30.314629Z","title":"Kandpal, E","venue":null,"work_id":"3ae8f9ae-1809-495c-91a2-31ba604fe54b","year":2022},"citing_paper":{"arxiv_id":"2304.01373","last_updated":"2023-05-31T17:54:07Z","snapshot_observed_at":"2026-08-14T19:44:03.879127Z","submitted_at":"2023-04-03T20:58:15Z","title":"Pythia: A Suite for Analyzing Large Language Models Across Training and Scaling","version":2},"reference_index":228,"source":"arxiv_source","source_observed_at":"2026-05-15T17:45:17.540282Z"},"links":{"cited_paper":"/paper/2202.06539","citing_paper":"/paper/2304.01373"},"observation_digest":"sha256:30b9110981dd7957ecf3af14648d4244e3295c049d3014e37fa3617d494e8833","observation_id":"da551b2a-4a89-4ea5-a841-4e0cda4f24d5","resolution":{"observed_at":"2026-05-15T17:45:17.971769Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.06539","last_updated":"2022-12-20T05:21:40Z","snapshot_observed_at":"2026-08-16T17:21:33.769087Z","submitted_at":"2022-02-14T08:20:15Z","title":"Deduplicating Training Data Mitigates Privacy Risks in Language Models","version":3},"cited_work":{"arxiv_id":"2202.06539","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2202.06539","snapshot_observed_at":"2026-07-03T00:57:30.314629Z","title":"Kandpal, E","venue":null,"work_id":"3ae8f9ae-1809-495c-91a2-31ba604fe54b","year":2022},"citing_paper":{"arxiv_id":"2305.06161","last_updated":"2023-12-13T14:44:10Z","snapshot_observed_at":"2026-07-06T15:25:35.930688Z","submitted_at":"2023-05-09T08:16:42Z","title":"StarCoder: may the source be with you!","version":2},"reference_index":153,"source":"arxiv_source","source_observed_at":"2026-05-10T23:32:59.517389Z"},"links":{"cited_paper":"/paper/2202.06539","citing_paper":"/paper/2305.06161"},"observation_digest":"sha256:f171f5625d151e6ceeb6fc54a8bad7b0ac6ddcf08eac2bef0895267f64f3f008","observation_id":"8e758aa5-1775-41d3-a3d8-46014625f49b","resolution":{"observed_at":"2026-05-10T23:33:00.763374Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.06539","last_updated":"2022-12-20T05:21:40Z","snapshot_observed_at":"2026-08-16T17:21:33.769087Z","submitted_at":"2022-02-14T08:20:15Z","title":"Deduplicating Training Data Mitigates Privacy Risks in Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.06539","snapshot_observed_at":"2026-08-16T04:28:00.475263Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.01177","last_updated":"2025-05-02T10:35:26Z","snapshot_observed_at":"2026-08-16T14:20:05.929905Z","submitted_at":"2025-05-02T10:35:26Z","title":"LLM Security: Vulnerabilities, Attacks, Defenses, and Countermeasures","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-16T04:28:00.475263Z"},"links":{"cited_paper":"/paper/2202.06539","citing_paper":"/paper/2505.01177"},"observation_digest":"sha256:8890cf755e0750e3523122f3a1f405e5b6b5ed934efacb578b3ec6737149ddd9","observation_id":"61e7b50b-ef6b-4664-94c7-5510344f65a1","resolution":{"observed_at":"2026-08-16T04:28:00.475263Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.06539","last_updated":"2022-12-20T05:21:40Z","snapshot_observed_at":"2026-08-16T17:21:33.769087Z","submitted_at":"2022-02-14T08:20:15Z","title":"Deduplicating Training Data Mitigates Privacy Risks in Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.06539","snapshot_observed_at":"2026-08-07T10:29:44.280631Z","title":"Deduplicating training data mitigates privacy risks in language models, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.05209","last_updated":"2025-06-05T16:21:30Z","snapshot_observed_at":"2026-08-09T07:25:20.673180Z","submitted_at":"2025-06-05T16:21:30Z","title":"The Common Pile v0.1: An 8TB Dataset of Public Domain and Openly Licensed Text","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-07T10:29:44.280631Z"},"links":{"cited_paper":"/paper/2202.06539","citing_paper":"/paper/2506.05209"},"observation_digest":"sha256:7efe3d485d0b9c932d343923f09075ff992cb8abf8526d76c9bff9c120d2bf4e","observation_id":"db291893-e88d-442f-9765-3a387c91e140","resolution":{"observed_at":"2026-08-07T10:29:44.280631Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.06539","last_updated":"2022-12-20T05:21:40Z","snapshot_observed_at":"2026-08-16T17:21:33.769087Z","submitted_at":"2022-02-14T08:20:15Z","title":"Deduplicating Training Data Mitigates Privacy Risks in Language Models","version":3},"cited_work":{"arxiv_id":"2202.06539","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2202.06539","snapshot_observed_at":"2026-07-03T00:57:30.314629Z","title":"Kandpal, E","venue":null,"work_id":"3ae8f9ae-1809-495c-91a2-31ba604fe54b","year":2022},"citing_paper":{"arxiv_id":"2512.08875","last_updated":"2026-05-08T19:19:07Z","snapshot_observed_at":"2026-08-12T23:37:41.945625Z","submitted_at":"2025-12-09T18:06:31Z","title":"When Tables Leak: Attacking String Memorization in LLM-Based Tabular Data Generation","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-16T23:47:31.667427Z"},"links":{"cited_paper":"/paper/2202.06539","citing_paper":"/paper/2512.08875"},"observation_digest":"sha256:f19e6a03c464fd957fabdbc0536c18b6747f51025c74c2a9b882a8b0b06ac5a8","observation_id":"198edff4-f27f-4209-8d79-90ce47d5526e","resolution":{"observed_at":"2026-05-16T23:48:41.844511Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.06539","last_updated":"2022-12-20T05:21:40Z","snapshot_observed_at":"2026-08-16T17:21:33.769087Z","submitted_at":"2022-02-14T08:20:15Z","title":"Deduplicating Training Data Mitigates Privacy Risks in Language Models","version":3},"cited_work":{"arxiv_id":"2202.06539","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2202.06539","snapshot_observed_at":"2026-07-03T00:57:30.314629Z","title":"Kandpal, E","venue":null,"work_id":"3ae8f9ae-1809-495c-91a2-31ba604fe54b","year":2022},"citing_paper":{"arxiv_id":"2606.09590","last_updated":"2026-06-08T15:02:19Z","snapshot_observed_at":"2026-08-15T20:30:10.218009Z","submitted_at":"2026-06-08T15:02:19Z","title":"Clinically Grounded Privacy Evaluation of Medical LMs","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-27T16:54:07.364946Z"},"links":{"cited_paper":"/paper/2202.06539","citing_paper":"/paper/2606.09590"},"observation_digest":"sha256:8129985bb525e61fb71bfb502f284bf6ec103ac86846a24007ebe4cdb7b452d0","observation_id":"d08a12a3-6d90-4122-b343-7f9ecec5d8fc","resolution":{"observed_at":"2026-07-03T00:57:30.316452Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2202.06539/citation-record","integrity":"/paper/2202.06539/integrity","json":"/paper/2202.06539/citation-record.json","paper":"/paper/2202.06539"},"outbound":[],"paper":{"arxiv_id":"2202.06539","last_updated":"2022-12-20T05:21:40Z","latest_version":3,"primary_category":"cs.CR","snapshot_observed_at":"2026-08-16T17:21:33.769087Z","submitted_at":"2022-02-14T08:20:15Z","title":"Deduplicating Training Data Mitigates Privacy Risks in Language Models"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 12 inbound Pith citation observations for arXiv:2202.06539."}