{"as_of":"2026-08-10T12:59:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d1df5af3255a970417eb6964d1e490caeeece8bdebfe6b23290c8e43134c84f6","coverage":[{"denominator":110,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T11:23:21.490138Z","state":"measured"},{"denominator":101,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":101,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-15T14:12:14.160789Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-15T14:15:54.917491Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2510.05699","last_updated":"2026-05-25T05:56:04Z","snapshot_observed_at":"2026-08-09T08:50:47.672362Z","submitted_at":"2025-10-07T09:05:40Z","title":"Membership Inference Attacks on Tokenizers of Large Language Models","version":4},"cited_work":{"arxiv_id":"2510.05699","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2510.05699","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Membership inference attacks on tokenizers of large language models","venue":null,"work_id":"3741dd7d-c30d-4f0d-b207-1e9db1cae230","year":2025},"citing_paper":{"arxiv_id":"2603.09002","last_updated":"2026-04-26T14:13:48Z","snapshot_observed_at":"2026-07-06T22:48:26.306802Z","submitted_at":"2026-03-09T22:46:27Z","title":"Security Considerations for Multi-agent Systems","version":2},"reference_index":239,"source":"pdf_text","source_observed_at":"2026-05-15T14:12:14.160789Z"},"links":{"cited_paper":"/paper/2510.05699","citing_paper":"/paper/2603.09002"},"observation_digest":"sha256:2586cdb9f3cd044b6d0a91bbd57545a75417f058ac7b26f2ae3f679c8468b2c5","observation_id":"e572a211-6c16-435b-9491-e5c3ebc5d1ff","resolution":{"observed_at":"2026-05-26T03:04:06.092231Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2510.05699/citation-record","integrity":"/paper/2510.05699/integrity","json":"/paper/2510.05699/citation-record.json","paper":"/paper/2510.05699"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:23:08.690312Z","title":"Deep learning with differential privacy","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2510.05699","last_updated":"2026-05-25T05:56:04Z","snapshot_observed_at":"2026-08-09T08:50:47.672362Z","submitted_at":"2025-10-07T09:05:40Z","title":"Membership Inference Attacks on Tokenizers of Large Language Models","version":4},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-04T11:23:08.690312Z"},"links":{"citing_paper":"/paper/2510.05699"},"observation_digest":"sha256:8edb28217562f60d6bf7e13695e4ee599f0c6449e1f6ea23b7f26058deeb064f","observation_id":"89ca683b-9c28-46d2-b144-17a72af8f5ff","resolution":{"observed_at":"2026-08-04T11:23:08.690312Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:23:08.782017Z","title":"An information-theoretic perspective of tf–idf measures.Information Processing & Manage- ment, 39(1):45–65, 2003","venue":null,"work_id":null,"year":2003},"citing_paper":{"arxiv_id":"2510.05699","last_updated":"2026-05-25T05:56:04Z","snapshot_observed_at":"2026-08-09T08:50:47.672362Z","submitted_at":"2025-10-07T09:05:40Z","title":"Membership Inference Attacks on Tokenizers of Large Language Models","version":4},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-04T11:23:08.782017Z"},"links":{"citing_paper":"/paper/2510.05699"},"observation_digest":"sha256:99c7c24223209662b5678f6c4b23408223af8a2d85443127d8dfd24edda12c6a","observation_id":"3cc7c33f-5f83-47a8-96a9-6f0b7ca7df56","resolution":{"observed_at":"2026-08-04T11:23:08.782017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:23:08.943368Z","title":"Judge allows new york times copyright lawsuit to go forward","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.05699","last_updated":"2026-05-25T05:56:04Z","snapshot_observed_at":"2026-08-09T08:50:47.672362Z","submitted_at":"2025-10-07T09:05:40Z","title":"Membership Inference Attacks on Tokenizers of Large Language Models","version":4},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-04T11:23:08.943368Z"},"links":{"citing_paper":"/paper/2510.05699"},"observation_digest":"sha256:9d4c20957db245990afa9e90327b40be7c57749ebf574b93abd602b14c4fb6f1","observation_id":"6ec36006-0b10-487b-a845-c462faa331b5","resolution":{"observed_at":"2026-08-04T11:23:08.943368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:23:09.100331Z","title":"Tokenizer for anthropic large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.05699","last_updated":"2026-05-25T05:56:04Z","snapshot_observed_at":"2026-08-09T08:50:47.672362Z","submitted_at":"2025-10-07T09:05:40Z","title":"Membership Inference Attacks on Tokenizers of Large Language Models","version":4},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-04T11:23:09.100331Z"},"links":{"citing_paper":"/paper/2510.05699"},"observation_digest":"sha256:eceee19a5673a1061a63931d77b341fc113f5ca3a943a074c7756bd120c08b69","observation_id":"10c4a399-da1b-4a44-b4dc-e08208547665","resolution":{"observed_at":"2026-08-04T11:23:09.100331Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:23:09.258490Z","title":"Claude opus 4 & claude sonnet 4","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.05699","last_updated":"2026-05-25T05:56:04Z","snapshot_observed_at":"2026-08-09T08:50:47.672362Z","submitted_at":"2025-10-07T09:05:40Z","title":"Membership Inference Attacks on Tokenizers of Large Language Models","version":4},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-04T11:23:09.258490Z"},"links":{"citing_paper":"/paper/2510.05699"},"observation_digest":"sha256:f33fca631c4cd303b00dc5a831b25dcbfe09e199de82782937b4981b459c2025","observation_id":"c03111da-bd68-4471-b239-a205630f5cda","resolution":{"observed_at":"2026-08-04T11:23:09.258490Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:23:09.382455Z","title":"An efficient recommendation generation us- ing relevant jaccard similarity.Information Sciences, 483:53–64, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2510.05699","last_updated":"2026-05-25T05:56:04Z","snapshot_observed_at":"2026-08-09T08:50:47.672362Z","submitted_at":"2025-10-07T09:05:40Z","title":"Membership Inference Attacks on Tokenizers of Large Language Models","version":4},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-04T11:23:09.382455Z"},"links":{"citing_paper":"/paper/2510.05699"},"observation_digest":"sha256:5270e94266681df93c197c5043aa14725922274763d95db5e9e8bde90956cafc","observation_id":"13c85151-3bc7-475a-b9ec-23eb93fc1a04","resolution":{"observed_at":"2026-08-04T11:23:09.382455Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02954","last_updated":"2024-01-05T18:59:13Z","snapshot_observed_at":"2026-08-02T13:11:16.882565Z","submitted_at":"2024-01-05T18:59:13Z","title":"DeepSeek LLM: Scaling Open-Source Language Models with Longtermism","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.02954","snapshot_observed_at":"2026-08-04T11:23:09.498777Z","title":"Deepseek llm: Scaling open- source language models with longtermism.arXiv preprint arXiv:2401.02954, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.05699","last_updated":"2026-05-25T05:56:04Z","snapshot_observed_at":"2026-08-09T08:50:47.672362Z","submitted_at":"2025-10-07T09:05:40Z","title":"Membership Inference Attacks on Tokenizers of Large Language Models","version":4},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-04T11:23:09.498777Z"},"links":{"cited_paper":"/paper/2401.02954","citing_paper":"/paper/2510.05699"},"observation_digest":"sha256:89ba771f94b7b69c9a0d46d45b10df7f7de27f94592a8fa91b53ff61367cfb29","observation_id":"9e6aa735-4fed-4836-b236-4946d666d47e","resolution":{"observed_at":"2026-08-04T11:23:09.498777Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:23:09.592846Z","title":"Pythia: A suite for analyzing large language models across train- ing and scaling","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.05699","last_updated":"2026-05-25T05:56:04Z","snapshot_observed_at":"2026-08-09T08:50:47.672362Z","submitted_at":"2025-10-07T09:05:40Z","title":"Membership Inference Attacks on Tokenizers of Large Language Models","version":4},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-04T11:23:09.592846Z"},"links":{"citing_paper":"/paper/2510.05699"},"observation_digest":"sha256:fe170001f28d06be6537e3199885e269ad41fbf2c37ba6492314f4ad38177c26","observation_id":"a65b57f8-2800-4351-bfa6-d8649e7593aa","resolution":{"observed_at":"2026-08-04T11:23:09.592846Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:23:09.743250Z","title":"Gpt- neox-20b: An open-source autoregressive language model.Challenges & Perspectives in Creating Large Language Models, page 95, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2510.05699","last_updated":"2026-05-25T05:56:04Z","snapshot_observed_at":"2026-08-09T08:50:47.672362Z","submitted_at":"2025-10-07T09:05:40Z","title":"Membership Inference Attacks on Tokenizers of Large Language Models","version":4},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-04T11:23:09.743250Z"},"links":{"citing_paper":"/paper/2510.05699"},"observation_digest":"sha256:5a5f70d61f0dd1f82ec48b52bf08d372fb2d382e60041cb27bc16e4c7c7e819f","observation_id":"414d1b89-c345-4fd5-af62-d423de99ebe4","resolution":{"observed_at":"2026-08-04T11:23:09.743250Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:23:09.913728Z","title":"Language models are few-shot learners","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2510.05699","last_updated":"2026-05-25T05:56:04Z","snapshot_observed_at":"2026-08-09T08:50:47.672362Z","submitted_at":"2025-10-07T09:05:40Z","title":"Membership Inference Attacks on Tokenizers of Large Language Models","version":4},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-04T11:23:09.913728Z"},"links":{"citing_paper":"/paper/2510.05699"},"observation_digest":"sha256:befba657751c337ecb4467f8407d5a26549d3d35c7c582c7070e2d8ce4ab6800","observation_id":"2f6d474c-fcd8-4d0f-9c32-015dcfb26820","resolution":{"observed_at":"2026-08-04T11:23:09.913728Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:23:10.078307Z","title":"Member- ship inference attacks from first principles","venue":null,"work_id":null,"year":1914},"citing_paper":{"arxiv_id":"2510.05699","last_updated":"2026-05-25T05:56:04Z","snapshot_observed_at":"2026-08-09T08:50:47.672362Z","submitted_at":"2025-10-07T09:05:40Z","title":"Membership Inference Attacks on Tokenizers of Large Language Models","version":4},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-04T11:23:10.078307Z"},"links":{"citing_paper":"/paper/2510.05699"},"observation_digest":"sha256:5d8c2f3b232f704072599fc7dcaf66014d7dd94cb538f822e61755d5e72a4cca","observation_id":"098d1c8e-010d-4e15-b630-b9943137dbcf","resolution":{"observed_at":"2026-08-04T11:23:10.078307Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:23:10.298498Z","title":"Extracting training data from large lan- guage models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2510.05699","last_updated":"2026-05-25T05:56:04Z","snapshot_observed_at":"2026-08-09T08:50:47.672362Z","submitted_at":"2025-10-07T09:05:40Z","title":"Membership Inference Attacks on Tokenizers of Large Language Models","version":4},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-04T11:23:10.298498Z"},"links":{"citing_paper":"/paper/2510.05699"},"observation_digest":"sha256:909ad5587efa6821f3c1bcb7f20d7958d50c006801a5421557b32593f0e7c16d","observation_id":"803170ef-c58f-4191-a968-bc6846138641","resolution":{"observed_at":"2026-08-04T11:23:10.298498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:23:10.445591Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2510.05699","last_updated":"2026-05-25T05:56:04Z","snapshot_observed_at":"2026-08-09T08:50:47.672362Z","submitted_at":"2025-10-07T09:05:40Z","title":"Membership Inference Attacks on Tokenizers of Large Language Models","version":4},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-04T11:23:10.445591Z"},"links":{"citing_paper":"/paper/2510.05699"},"observation_digest":"sha256:cf2b6ae65a8f34e8333dadbdb3f8dfee3128988f87ce8028a88195a992ceb2ff","observation_id":"12b3022d-df34-4093-bfe0-f84599291d54","resolution":{"observed_at":"2026-08-04T11:23:10.445591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.23291","last_updated":"2025-08-03T23:23:03Z","snapshot_observed_at":"2026-08-09T09:39:32.022353Z","submitted_at":"2025-07-31T07:09:52Z","title":"Evaluating the Dynamics of Membership Privacy in Deep Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.23291","snapshot_observed_at":"2026-08-04T11:23:10.478201Z","title":"Evaluating the dynamics of membership privacy in deep learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.05699","last_updated":"2026-05-25T05:56:04Z","snapshot_observed_at":"2026-08-09T08:50:47.672362Z","submitted_at":"2025-10-07T09:05:40Z","title":"Membership Inference Attacks on Tokenizers of Large Language Models","version":4},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-04T11:23:10.478201Z"},"links":{"cited_paper":"/paper/2507.23291","citing_paper":"/paper/2510.05699"},"observation_digest":"sha256:7030b0cf107cd2576c15a655ba8613bf49ce88f082872c14180ad671df87e33d","observation_id":"ec55dba2-a01f-4865-bf65-1683e959af23","resolution":{"observed_at":"2026-08-04T11:23:10.478201Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:23:10.540157Z","title":"How contaminated is your benchmark? measuring dataset leakage in large language models with kernel divergence","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.05699","last_updated":"2026-05-25T05:56:04Z","snapshot_observed_at":"2026-08-09T08:50:47.672362Z","submitted_at":"2025-10-07T09:05:40Z","title":"Membership Inference Attacks on Tokenizers of Large Language Models","version":4},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-04T11:23:10.540157Z"},"links":{"citing_paper":"/paper/2510.05699"},"observation_digest":"sha256:c461ddf620b9528ca2d4398153a93031b9ced7cc5266cb87cea111f89a053703","observation_id":"9234e720-7ce7-4196-ad70-afc777453ef6","resolution":{"observed_at":"2026-08-04T11:23:10.540157Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:23:10.699085Z","title":"Label-only membership inference attacks","venue":null,"work_id":null,"year":1964},"citing_paper":{"arxiv_id":"2510.05699","last_updated":"2026-05-25T05:56:04Z","snapshot_observed_at":"2026-08-09T08:50:47.672362Z","submitted_at":"2025-10-07T09:05:40Z","title":"Membership Inference Attacks on Tokenizers of Large Language Models","version":4},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-04T11:23:10.699085Z"},"links":{"citing_paper":"/paper/2510.05699"},"observation_digest":"sha256:b20dfdd3688b473a812cea077db49aeaa93849f9182304dca7c8df281a79dcec","observation_id":"6149220c-deb4-4710-b6dd-8384bb28e7d2","resolution":{"observed_at":"2026-08-04T11:23:10.699085Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:23:10.826580Z","title":"Power-law distributions in empirical data","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2510.05699","last_updated":"2026-05-25T05:56:04Z","snapshot_observed_at":"2026-08-09T08:50:47.672362Z","submitted_at":"2025-10-07T09:05:40Z","title":"Membership Inference Attacks on Tokenizers of Large Language Models","version":4},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-04T11:23:10.826580Z"},"links":{"citing_paper":"/paper/2510.05699"},"observation_digest":"sha256:1dee7249a861606d98e9c7a836741fd5d7150fd4477cf8da46b586f5ab05ce48","observation_id":"4eebd633-09a4-4821-a45d-6414e311e49b","resolution":{"observed_at":"2026-08-04T11:23:10.826580Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:23:11.021457Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.05699","last_updated":"2026-05-25T05:56:04Z","snapshot_observed_at":"2026-08-09T08:50:47.672362Z","submitted_at":"2025-10-07T09:05:40Z","title":"Membership Inference Attacks on Tokenizers of Large Language Models","version":4},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-04T11:23:11.021457Z"},"links":{"citing_paper":"/paper/2510.05699"},"observation_digest":"sha256:0743cfed9cbe303ea1461ae5fe149d433600209e3454c67104f0eeda4283dacb","observation_id":"e0a29057-cc14-4b30-995e-1b10e1a08329","resolution":{"observed_at":"2026-08-04T11:23:11.021457Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:23:11.293865Z","title":"Getting the most out of your tokenizer for pre- training and domain adaptation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.05699","last_updated":"2026-05-25T05:56:04Z","snapshot_observed_at":"2026-08-09T08:50:47.672362Z","submitted_at":"2025-10-07T09:05:40Z","title":"Membership Inference Attacks on Tokenizers of Large Language Models","version":4},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-04T11:23:11.293865Z"},"links":{"citing_paper":"/paper/2510.05699"},"observation_digest":"sha256:a2be36995f36ca05447ccee2378ac3117d821295bfefa8f4d0ce0a963aac0e78","observation_id":"c1d21558-101f-4025-a1e0-a8ebbba5cea8","resolution":{"observed_at":"2026-08-04T11:23:11.293865Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:23:11.478113Z","title":"Blind baselines beat membership inference attacks for foun- dation models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.05699","last_updated":"2026-05-25T05:56:04Z","snapshot_observed_at":"2026-08-09T08:50:47.672362Z","submitted_at":"2025-10-07T09:05:40Z","title":"Membership Inference Attacks on Tokenizers of Large Language Models","version":4},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-04T11:23:11.478113Z"},"links":{"citing_paper":"/paper/2510.05699"},"observation_digest":"sha256:36628fc2069e640f2cdde6f37dafa073d73d30da690b8f55ca4ac838f2d944d9","observation_id":"4bffe1b0-a320-48f4-a8f1-836002e189f3","resolution":{"observed_at":"2026-08-04T11:23:11.478113Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:23:11.686039Z","title":"Bert: Pre-training of deep bidi- rectional transformers for language understanding","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2510.05699","last_updated":"2026-05-25T05:56:04Z","snapshot_observed_at":"2026-08-09T08:50:47.672362Z","submitted_at":"2025-10-07T09:05:40Z","title":"Membership Inference Attacks on Tokenizers of Large Language Models","version":4},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-04T11:23:11.686039Z"},"links":{"citing_paper":"/paper/2510.05699"},"observation_digest":"sha256:607ec2c5efb15183297211a2af7a5b07ba8cfab9c5a8bb5d6c6ec7920b3184d8","observation_id":"c4d2d478-1ac0-4395-a50d-f899d4dec326","resolution":{"observed_at":"2026-08-04T11:23:11.686039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:23:11.813613Z","title":"Dp-forward: Fine-tuning and inference on language models with differential privacy in forward pass","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.05699","last_updated":"2026-05-25T05:56:04Z","snapshot_observed_at":"2026-08-09T08:50:47.672362Z","submitted_at":"2025-10-07T09:05:40Z","title":"Membership Inference Attacks on Tokenizers of Large Language Models","version":4},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-04T11:23:11.813613Z"},"links":{"citing_paper":"/paper/2510.05699"},"observation_digest":"sha256:94b07282742f794b5a6c0aeba1386c30cb8ea8774a0779060aeb976c24548579","observation_id":"cb1496d5-0a47-4cfe-86f0-5cad142922ec","resolution":{"observed_at":"2026-08-04T11:23:11.813613Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:23:12.002596Z","title":"Cascading and Proxy Membership Infer- ence Attacks","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2510.05699","last_updated":"2026-05-25T05:56:04Z","snapshot_observed_at":"2026-08-09T08:50:47.672362Z","submitted_at":"2025-10-07T09:05:40Z","title":"Membership Inference Attacks on Tokenizers of Large Language Models","version":4},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-04T11:23:12.002596Z"},"links":{"citing_paper":"/paper/2510.05699"},"observation_digest":"sha256:c2cf23ac2528aafc821ce05ecc32b3a81162daf6c6d6f061aec9c2fab8ad7e7e","observation_id":"30892f90-a83a-4d54-843e-b54ff8c7d596","resolution":{"observed_at":"2026-08-04T11:23:12.002596Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.06806","last_updated":"2025-09-07T16:29:45Z","snapshot_observed_at":"2026-07-06T17:28:14.770675Z","submitted_at":"2024-02-09T22:07:59Z","title":"Systematic Assessment of Tabular Data Synthesis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.06806","snapshot_observed_at":"2026-08-04T11:23:12.207549Z","title":"Systematic assessment of tabular data synthesis algorithms.arXiv preprint arXiv:2402.06806, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.05699","last_updated":"2026-05-25T05:56:04Z","snapshot_observed_at":"2026-08-09T08:50:47.672362Z","submitted_at":"2025-10-07T09:05:40Z","title":"Membership Inference Attacks on Tokenizers of Large Language Models","version":4},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-04T11:23:12.207549Z"},"links":{"cited_paper":"/paper/2402.06806","citing_paper":"/paper/2510.05699"},"observation_digest":"sha256:521ed3bb637b4913962b390961dfba41d0bf603f48b89f45875338a9e67d1507","observation_id":"8fc3d85b-3406-48db-8572-b56659f47b96","resolution":{"observed_at":"2026-08-04T11:23:12.207549Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:23:12.416804Z","title":"Do membership inference attacks work on large language models? InFirst Conference on Lan- guage Modeling, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.05699","last_updated":"2026-05-25T05:56:04Z","snapshot_observed_at":"2026-08-09T08:50:47.672362Z","submitted_at":"2025-10-07T09:05:40Z","title":"Membership Inference Attacks on Tokenizers of Large Language Models","version":4},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-04T11:23:12.416804Z"},"links":{"citing_paper":"/paper/2510.05699"},"observation_digest":"sha256:8b11f6176736c55bdc4f657308d99cac36e4a9f8ddfa23ac8a04884699054faf","observation_id":"685a4178-e04e-4c8f-9717-d50a35ac99ff","resolution":{"observed_at":"2026-08-04T11:23:12.416804Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:23:12.556633Z","title":"De-cop: detecting copyrighted content in language models training data","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.05699","last_updated":"2026-05-25T05:56:04Z","snapshot_observed_at":"2026-08-09T08:50:47.672362Z","submitted_at":"2025-10-07T09:05:40Z","title":"Membership Inference Attacks on Tokenizers of Large Language Models","version":4},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-04T11:23:12.556633Z"},"links":{"citing_paper":"/paper/2510.05699"},"observation_digest":"sha256:ef8617d33534f2829c19f5ee1028022c9e99548400b0cbc765941d4c6cbdb245","observation_id":"720d92b9-6782-4471-8692-a3be8a943d0e","resolution":{"observed_at":"2026-08-04T11:23:12.556633Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:23:12.670935Z","title":"Differential privacy","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2510.05699","last_updated":"2026-05-25T05:56:04Z","snapshot_observed_at":"2026-08-09T08:50:47.672362Z","submitted_at":"2025-10-07T09:05:40Z","title":"Membership Inference Attacks on Tokenizers of Large Language Models","version":4},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-04T11:23:12.670935Z"},"links":{"citing_paper":"/paper/2510.05699"},"observation_digest":"sha256:f7b1d3fb0b45000220c7aed64914ebabcec4d38a7398088207dd0618b2583bbc","observation_id":"227687d3-f9dd-40d6-bdb9-a6746c42256e","resolution":{"observed_at":"2026-08-04T11:23:12.670935Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:23:12.789453Z","title":"Analysis of sparse bayesian learning.Advances in neural information processing systems, 14, 2001","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2510.05699","last_updated":"2026-05-25T05:56:04Z","snapshot_observed_at":"2026-08-09T08:50:47.672362Z","submitted_at":"2025-10-07T09:05:40Z","title":"Membership Inference Attacks on Tokenizers of Large Language Models","version":4},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-04T11:23:12.789453Z"},"links":{"citing_paper":"/paper/2510.05699"},"observation_digest":"sha256:822d13017feb6fc99a6be95d5041a4e055e718bb71b3bb3bda2242475b68294c","observation_id":"67d56b7d-f175-4eee-9a24-7cfb1ef9743f","resolution":{"observed_at":"2026-08-04T11:23:12.789453Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:23:12.883547Z","title":"Privacy in pharmacogenetics: An {End-to-End} case study of personalized warfarin dosing","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2510.05699","last_updated":"2026-05-25T05:56:04Z","snapshot_observed_at":"2026-08-09T08:50:47.672362Z","submitted_at":"2025-10-07T09:05:40Z","title":"Membership Inference Attacks on Tokenizers of Large Language Models","version":4},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-04T11:23:12.883547Z"},"links":{"citing_paper":"/paper/2510.05699"},"observation_digest":"sha256:2397d95b67df12c1a1993e5b4e5479e92484ac9a0b931dc9ba4f54fe5010b149","observation_id":"d2e8c732-49f8-4da3-9e9f-3c812b3b3b0f","resolution":{"observed_at":"2026-08-04T11:23:12.883547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:23:12.966221Z","title":"Label inference attacks against vertical federated learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2510.05699","last_updated":"2026-05-25T05:56:04Z","snapshot_observed_at":"2026-08-09T08:50:47.672362Z","submitted_at":"2025-10-07T09:05:40Z","title":"Membership Inference Attacks on Tokenizers of Large Language Models","version":4},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-04T11:23:12.966221Z"},"links":{"citing_paper":"/paper/2510.05699"},"observation_digest":"sha256:e0a739d5924a17a5d5f9da5ebf755f1df17087b382f09b5bcb5fd5b356420a64","observation_id":"780ceb07-6693-4b17-9a11-b34a1e5b28bd","resolution":{"observed_at":"2026-08-04T11:23:12.966221Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:23:13.066661Z","title":"Zipf’s law and the growth of cities","venue":null,"work_id":null,"year":1999},"citing_paper":{"arxiv_id":"2510.05699","last_updated":"2026-05-25T05:56:04Z","snapshot_observed_at":"2026-08-09T08:50:47.672362Z","submitted_at":"2025-10-07T09:05:40Z","title":"Membership Inference Attacks on Tokenizers of Large Language Models","version":4},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-04T11:23:13.066661Z"},"links":{"citing_paper":"/paper/2510.05699"},"observation_digest":"sha256:27aa32adeaa5cc36d401be2d81403122f2060487f474d907a143a162c85e9eb1","observation_id":"092847cd-3848-48da-80c5-910353f0d4cc","resolution":{"observed_at":"2026-08-04T11:23:13.066661Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:23:13.176008Z","title":"Investigating the effectiveness of bpe: The power of shorter sequences","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2510.05699","last_updated":"2026-05-25T05:56:04Z","snapshot_observed_at":"2026-08-09T08:50:47.672362Z","submitted_at":"2025-10-07T09:05:40Z","title":"Membership Inference Attacks on Tokenizers of Large Language Models","version":4},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-04T11:23:13.176008Z"},"links":{"citing_paper":"/paper/2510.05699"},"observation_digest":"sha256:d3f4bca860dc3afe3c8364dd4af66758d30973c03307e5aad0dd99e9fa7664ed","observation_id":"f3b2c762-26a8-472b-a9f1-1f29ca244880","resolution":{"observed_at":"2026-08-04T11:23:13.176008Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:23:13.258531Z","title":"Counting gemini text tokens locally with the vertex ai sdk, July 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.05699","last_updated":"2026-05-25T05:56:04Z","snapshot_observed_at":"2026-08-09T08:50:47.672362Z","submitted_at":"2025-10-07T09:05:40Z","title":"Membership Inference Attacks on Tokenizers of Large Language Models","version":4},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-04T11:23:13.258531Z"},"links":{"citing_paper":"/paper/2510.05699"},"observation_digest":"sha256:745224c286eed2a2123aaaabd23c660393c826f9c6e5cfdd9c35444ba53b2030","observation_id":"faae467b-149c-4f95-a9fd-77ea20f46e57","resolution":{"observed_at":"2026-08-04T11:23:13.258531Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:23:13.383669Z","title":"Likelihood-based diffusion language models.Ad- vances in Neural Information Processing Systems, 36:16693–16715, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.05699","last_updated":"2026-05-25T05:56:04Z","snapshot_observed_at":"2026-08-09T08:50:47.672362Z","submitted_at":"2025-10-07T09:05:40Z","title":"Membership Inference Attacks on Tokenizers of Large Language Models","version":4},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-04T11:23:13.383669Z"},"links":{"citing_paper":"/paper/2510.05699"},"observation_digest":"sha256:87ad4d4d0dcc4d3044934bce9cff52a16c53e23a5c5a8fa3e26d53d94acddb1a","observation_id":"f8f08380-5760-45e7-beb1-de4c609416bc","resolution":{"observed_at":"2026-08-04T11:23:13.383669Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-04T11:23:13.479968Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.05699","last_updated":"2026-05-25T05:56:04Z","snapshot_observed_at":"2026-08-09T08:50:47.672362Z","submitted_at":"2025-10-07T09:05:40Z","title":"Membership Inference Attacks on Tokenizers of Large Language Models","version":4},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-04T11:23:13.479968Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2510.05699"},"observation_digest":"sha256:03a98d3569156004e9b48894488ab91de1db4a268cf4fa08feb1aa174b91ddd5","observation_id":"67ad8c75-cd09-42f4-ac54-8e01f62f6e3a","resolution":{"observed_at":"2026-08-04T11:23:13.479968Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:23:13.553514Z","title":"Weird gpt-4 behavior for “davidjl”","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.05699","last_updated":"2026-05-25T05:56:04Z","snapshot_observed_at":"2026-08-09T08:50:47.672362Z","submitted_at":"2025-10-07T09:05:40Z","title":"Membership Inference Attacks on Tokenizers of Large Language Models","version":4},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-04T11:23:13.553514Z"},"links":{"citing_paper":"/paper/2510.05699"},"observation_digest":"sha256:08b653560cce16561b0a40dccc5c483924d10d65c3e200645a227be019f1cad3","observation_id":"6e9ced76-0fb6-4eb2-ad8c-84b82d1e6ba1","resolution":{"observed_at":"2026-08-04T11:23:13.553514Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:23:13.694787Z","title":"Data mixture inference attack: Bpe tokenizers reveal training data compositions.Advances in Neural Information Processing Systems, 37:8956– 8983, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.05699","last_updated":"2026-05-25T05:56:04Z","snapshot_observed_at":"2026-08-09T08:50:47.672362Z","submitted_at":"2025-10-07T09:05:40Z","title":"Membership Inference Attacks on Tokenizers of Large Language Models","version":4},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-04T11:23:13.694787Z"},"links":{"citing_paper":"/paper/2510.05699"},"observation_digest":"sha256:4989a0f08abaca4871e8c0e782614618e69bb277eeb795b1715e7d279c60609f","observation_id":"7ac65f64-94ce-4f18-9d6f-64dcc68ccc30","resolution":{"observed_at":"2026-08-04T11:23:13.694787Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:23:13.859360Z","title":"Data mixture inference attack: Bpe tokenizers reveal training data compositions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.05699","last_updated":"2026-05-25T05:56:04Z","snapshot_observed_at":"2026-08-09T08:50:47.672362Z","submitted_at":"2025-10-07T09:05:40Z","title":"Membership Inference Attacks on Tokenizers of Large Language Models","version":4},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-04T11:23:13.859360Z"},"links":{"citing_paper":"/paper/2510.05699"},"observation_digest":"sha256:6a9c4d866129b290108b95809f2c4252be9aeea02a37755911f1406370fb91e9","observation_id":"22c71755-5ae2-442b-8be2-015103f505d2","resolution":{"observed_at":"2026-08-04T11:23:13.859360Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:23:14.044399Z","title":"Strong membership inference attacks on massive datasets and (moderately) large language models.arXiv preprint arXiv:2505.18773, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.05699","last_updated":"2026-05-25T05:56:04Z","snapshot_observed_at":"2026-08-09T08:50:47.672362Z","submitted_at":"2025-10-07T09:05:40Z","title":"Membership Inference Attacks on Tokenizers of Large Language Models","version":4},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-04T11:23:14.044399Z"},"links":{"citing_paper":"/paper/2510.05699"},"observation_digest":"sha256:06a9eb002e5e2dd3205d0ca6beab0e0f4c6c5ee2c852284abce1aa16985ce34e","observation_id":"a866abed-7977-441a-92de-32ce83a00e20","resolution":{"observed_at":"2026-08-04T11:23:14.044399Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:23:14.196443Z","title":"Deep residual learning for image recognition","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2510.05699","last_updated":"2026-05-25T05:56:04Z","snapshot_observed_at":"2026-08-09T08:50:47.672362Z","submitted_at":"2025-10-07T09:05:40Z","title":"Membership Inference Attacks on Tokenizers of Large Language Models","version":4},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-04T11:23:14.196443Z"},"links":{"citing_paper":"/paper/2510.05699"},"observation_digest":"sha256:fc2e8b21f49a0992e7eb1682df75ca0e836fcf940a16504ab3e66445318e74f1","observation_id":"e39349ed-285e-4f0b-a714-160e52d70c93","resolution":{"observed_at":"2026-08-04T11:23:14.196443Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:23:14.338840Z","title":"To- wards label-only membership inference attack against pre-trained large language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.05699","last_updated":"2026-05-25T05:56:04Z","snapshot_observed_at":"2026-08-09T08:50:47.672362Z","submitted_at":"2025-10-07T09:05:40Z","title":"Membership Inference Attacks on Tokenizers of Large Language Models","version":4},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-04T11:23:14.338840Z"},"links":{"citing_paper":"/paper/2510.05699"},"observation_digest":"sha256:c940703f2c0cb74b558b44f26e5da36ffa9ab289984079104608391e96fb4fdd","observation_id":"7a66f518-0e33-450b-8fcd-5e29b7c89e84","resolution":{"observed_at":"2026-08-04T11:23:14.338840Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:23:14.477396Z","title":"Membership inference attacks against vision-language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.05699","last_updated":"2026-05-25T05:56:04Z","snapshot_observed_at":"2026-08-09T08:50:47.672362Z","submitted_at":"2025-10-07T09:05:40Z","title":"Membership Inference Attacks on Tokenizers of Large Language Models","version":4},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-04T11:23:14.477396Z"},"links":{"citing_paper":"/paper/2510.05699"},"observation_digest":"sha256:24abbd561d3a12b4a913ada16b8bfad2bfff0882181ea9e667cdaababe8b82b9","observation_id":"da5416fe-9973-4fc6-b64e-e5260c2393a5","resolution":{"observed_at":"2026-08-04T11:23:14.477396Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.14701","last_updated":"2020-11-06T04:16:36Z","snapshot_observed_at":"2026-07-06T10:09:17.078776Z","submitted_at":"2020-10-28T02:17:24Z","title":"Scaling Laws for Autoregressive Generative Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.14701","snapshot_observed_at":"2026-08-04T11:23:14.629106Z","title":"Scaling laws for autoregressive generative modeling.arXiv preprint arXiv:2010.14701, 2020","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2510.05699","last_updated":"2026-05-25T05:56:04Z","snapshot_observed_at":"2026-08-09T08:50:47.672362Z","submitted_at":"2025-10-07T09:05:40Z","title":"Membership Inference Attacks on Tokenizers of Large Language Models","version":4},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-04T11:23:14.629106Z"},"links":{"cited_paper":"/paper/2010.14701","citing_paper":"/paper/2510.05699"},"observation_digest":"sha256:5ec3b8a1d4d342794fba0fbec0479e2cfab69d33bab92222785592076a26ab23","observation_id":"db2e21bf-a47c-40d9-8aa7-39213b4fe42f","resolution":{"observed_at":"2026-08-04T11:23:14.629106Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.15556","last_updated":"2022-03-29T13:38:03Z","snapshot_observed_at":"2026-08-09T19:52:33.533277Z","submitted_at":"2022-03-29T13:38:03Z","title":"Training Compute-Optimal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.15556","snapshot_observed_at":"2026-08-04T11:23:14.813967Z","title":"Training compute- optimal large language models.arXiv preprint arXiv:2203.15556, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2510.05699","last_updated":"2026-05-25T05:56:04Z","snapshot_observed_at":"2026-08-09T08:50:47.672362Z","submitted_at":"2025-10-07T09:05:40Z","title":"Membership Inference Attacks on Tokenizers of Large Language Models","version":4},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-04T11:23:14.813967Z"},"links":{"cited_paper":"/paper/2203.15556","citing_paper":"/paper/2510.05699"},"observation_digest":"sha256:3c3cdb517c68c12852177e00e6639dc274a46eb3512ee54d6945c5cb48e001c8","observation_id":"42950e4d-d92d-4c75-b40f-e824e7696a2c","resolution":{"observed_at":"2026-08-04T11:23:14.813967Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:23:14.917804Z","title":"Damia: Leveraging domain adaptation as a defense against membership inference attacks.IEEE Transactions on Dependable and Secure Computing, 19(5):3183–3199, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2510.05699","last_updated":"2026-05-25T05:56:04Z","snapshot_observed_at":"2026-08-09T08:50:47.672362Z","submitted_at":"2025-10-07T09:05:40Z","title":"Membership Inference Attacks on Tokenizers of Large Language Models","version":4},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-04T11:23:14.917804Z"},"links":{"citing_paper":"/paper/2510.05699"},"observation_digest":"sha256:786144d86e0f67daaa341c89d9c64749449d636eebda80d33a2349580e0f5e68","observation_id":"0ae86809-87e4-450e-94bf-11e5cae853c7","resolution":{"observed_at":"2026-08-04T11:23:14.917804Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:23:15.054019Z","title":"Over-tokenized trans- former: V ocabulary is generally worth scaling","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.05699","last_updated":"2026-05-25T05:56:04Z","snapshot_observed_at":"2026-08-09T08:50:47.672362Z","submitted_at":"2025-10-07T09:05:40Z","title":"Membership Inference Attacks on Tokenizers of Large Language Models","version":4},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-04T11:23:15.054019Z"},"links":{"citing_paper":"/paper/2510.05699"},"observation_digest":"sha256:55fb35bb200154af813e852c8713f96f0764cae90819d0d6274edba36cfe7bba","observation_id":"2c985725-1bba-4182-8cab-403ad9c905a1","resolution":{"observed_at":"2026-08-04T11:23:15.054019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:23:15.166718Z","title":"Efficient reasoning for large reasoning language models via certainty-guided reflec- tion suppression.arXiv preprint arXiv:2508.05337, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.05699","last_updated":"2026-05-25T05:56:04Z","snapshot_observed_at":"2026-08-09T08:50:47.672362Z","submitted_at":"2025-10-07T09:05:40Z","title":"Membership Inference Attacks on Tokenizers of Large Language Models","version":4},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-04T11:23:15.166718Z"},"links":{"citing_paper":"/paper/2510.05699"},"observation_digest":"sha256:f4a40fc26f888047961d6ac50e5b92f30906b04df281d40fbbd7994e22f312f2","observation_id":"f0bc3db2-a78a-4178-b27e-a952fae1a53a","resolution":{"observed_at":"2026-08-04T11:23:15.166718Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:23:15.262904Z","title":"Tokenizer","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.05699","last_updated":"2026-05-25T05:56:04Z","snapshot_observed_at":"2026-08-09T08:50:47.672362Z","submitted_at":"2025-10-07T09:05:40Z","title":"Membership Inference Attacks on Tokenizers of Large Language Models","version":4},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-04T11:23:15.262904Z"},"links":{"citing_paper":"/paper/2510.05699"},"observation_digest":"sha256:86303489cdf3e07d34ac21b826b598aa00e89cbee476e2046f9d4078bf56341f","observation_id":"8eb61202-b734-4db2-9f5d-171715e968be","resolution":{"observed_at":"2026-08-04T11:23:15.262904Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:23:15.329421Z","title":"Codeparrot github code dataset","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.05699","last_updated":"2026-05-25T05:56:04Z","snapshot_observed_at":"2026-08-09T08:50:47.672362Z","submitted_at":"2025-10-07T09:05:40Z","title":"Membership Inference Attacks on Tokenizers of Large Language Models","version":4},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-04T11:23:15.329421Z"},"links":{"citing_paper":"/paper/2510.05699"},"observation_digest":"sha256:716ff63e23b3d075fa4d3e81e0e05fba086eb6deafe8f8fa8c636fa5df748a3a","observation_id":"e2893360-396c-4497-a880-4c6c1d9767cc","resolution":{"observed_at":"2026-08-04T11:23:15.329421Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:23:15.413438Z","title":"Practical blind membership inference attack via differential compar- isons","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2510.05699","last_updated":"2026-05-25T05:56:04Z","snapshot_observed_at":"2026-08-09T08:50:47.672362Z","submitted_at":"2025-10-07T09:05:40Z","title":"Membership Inference Attacks on Tokenizers of Large Language Models","version":4},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-04T11:23:15.413438Z"},"links":{"citing_paper":"/paper/2510.05699"},"observation_digest":"sha256:5b10b79c9b447f1417e3578730b62173af317b6672f8aa387504f58ada61aff1","observation_id":"d1b47ce6-aa7c-4ca6-a79c-7922e1016dcf","resolution":{"observed_at":"2026-08-04T11:23:15.413438Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:23:15.501799Z","title":"Memguard: Defend- ing against black-box membership inference attacks via adversarial examples","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2510.05699","last_updated":"2026-05-25T05:56:04Z","snapshot_observed_at":"2026-08-09T08:50:47.672362Z","submitted_at":"2025-10-07T09:05:40Z","title":"Membership Inference Attacks on Tokenizers of Large Language Models","version":4},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-04T11:23:15.501799Z"},"links":{"citing_paper":"/paper/2510.05699"},"observation_digest":"sha256:e3e0579710d26092e67c7ee5be8097992fb65f1cdaf7d86ed44c19e304f8e3b7","observation_id":"a3ed5296-d8e7-4df0-8f14-c6f16d8cddc0","resolution":{"observed_at":"2026-08-04T11:23:15.501799Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-07-06T08:52:12.656082Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-08-04T11:23:15.608484Z","title":"Scal- ing laws for neural language models.arXiv preprint arXiv:2001.08361, 2020","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2510.05699","last_updated":"2026-05-25T05:56:04Z","snapshot_observed_at":"2026-08-09T08:50:47.672362Z","submitted_at":"2025-10-07T09:05:40Z","title":"Membership Inference Attacks on Tokenizers of Large Language Models","version":4},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-04T11:23:15.608484Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2510.05699"},"observation_digest":"sha256:ac339832a6cea390de2ffac005a8897113aa1acef26faeba9d07df710212f723","observation_id":"8af5eba4-a178-440e-8c0e-38cef2378ecb","resolution":{"observed_at":"2026-08-04T11:23:15.608484Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:23:15.700474Z","title":"Stolen memories: Leveraging model memorization for calibrated{White- Box} membership inference","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2510.05699","last_updated":"2026-05-25T05:56:04Z","snapshot_observed_at":"2026-08-09T08:50:47.672362Z","submitted_at":"2025-10-07T09:05:40Z","title":"Membership Inference Attacks on Tokenizers of Large Language Models","version":4},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-04T11:23:15.700474Z"},"links":{"citing_paper":"/paper/2510.05699"},"observation_digest":"sha256:8ba3309073c37458eb6c8f6f5b52dc163e7f2ec27a8f3246ef3dd2307d848d51","observation_id":"279d3227-3f6e-4198-8176-d1b049242167","resolution":{"observed_at":"2026-08-04T11:23:15.700474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:23:15.769015Z","title":"Se- qmia: sequential-metric based membership inference attack","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.05699","last_updated":"2026-05-25T05:56:04Z","snapshot_observed_at":"2026-08-09T08:50:47.672362Z","submitted_at":"2025-10-07T09:05:40Z","title":"Membership Inference Attacks on Tokenizers of Large Language Models","version":4},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-04T11:23:15.769015Z"},"links":{"citing_paper":"/paper/2510.05699"},"observation_digest":"sha256:09ac95fd0cd690d4cc3bf69e785ced0d07853ba563bffe863b08684f0deeee4f","observation_id":"76a9f61f-abd6-44ab-9944-6bcc8ebd7a64","resolution":{"observed_at":"2026-08-04T11:23:15.769015Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:23:15.884237Z","title":"Enhanced label-only membership inference attacks with fewer queries","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.05699","last_updated":"2026-05-25T05:56:04Z","snapshot_observed_at":"2026-08-09T08:50:47.672362Z","submitted_at":"2025-10-07T09:05:40Z","title":"Membership Inference Attacks on Tokenizers of Large Language Models","version":4},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-04T11:23:15.884237Z"},"links":{"citing_paper":"/paper/2510.05699"},"observation_digest":"sha256:020571d08c84b426e0f976e9436e9057b29692409dcf0756f44a26527a367f19","observation_id":"5ef775ed-58c5-498f-9a6d-baa0e9342e2c","resolution":{"observed_at":"2026-08-04T11:23:15.884237Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:23:16.022176Z","title":"Mem- bership inference attacks and defenses in classification models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2510.05699","last_updated":"2026-05-25T05:56:04Z","snapshot_observed_at":"2026-08-09T08:50:47.672362Z","submitted_at":"2025-10-07T09:05:40Z","title":"Membership Inference Attacks on Tokenizers of Large Language Models","version":4},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-04T11:23:16.022176Z"},"links":{"citing_paper":"/paper/2510.05699"},"observation_digest":"sha256:5e1e6613150f13b1a3d04d0e00a411c905695e6bc87f0c3952db0a5f02b358c6","observation_id":"21eed840-cee6-4aec-8338-bdc8e24887a4","resolution":{"observed_at":"2026-08-04T11:23:16.022176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.05679","last_updated":"2022-11-10T18:42:34Z","snapshot_observed_at":"2026-08-08T11:17:29.711698Z","submitted_at":"2021-10-12T01:45:27Z","title":"Large Language Models Can Be Strong Differentially Private Learners","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.05679","snapshot_observed_at":"2026-08-04T11:23:16.101013Z","title":"Large language models can be strong differentially private learners.arXiv preprint arXiv:2110.05679, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2510.05699","last_updated":"2026-05-25T05:56:04Z","snapshot_observed_at":"2026-08-09T08:50:47.672362Z","submitted_at":"2025-10-07T09:05:40Z","title":"Membership Inference Attacks on Tokenizers of Large Language Models","version":4},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-04T11:23:16.101013Z"},"links":{"cited_paper":"/paper/2110.05679","citing_paper":"/paper/2510.05699"},"observation_digest":"sha256:f0ba7baabd7154b3d6b1d870c710ba34163a01bf5bf177271ae15b877db3801e","observation_id":"bdb8a7d8-0346-4082-ab60-e33047b1b90b","resolution":{"observed_at":"2026-08-04T11:23:16.101013Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:23:16.184313Z","title":"Membership leakage in label-only exposures","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2510.05699","last_updated":"2026-05-25T05:56:04Z","snapshot_observed_at":"2026-08-09T08:50:47.672362Z","submitted_at":"2025-10-07T09:05:40Z","title":"Membership Inference Attacks on Tokenizers of Large Language Models","version":4},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-04T11:23:16.184313Z"},"links":{"citing_paper":"/paper/2510.05699"},"observation_digest":"sha256:a5c17288974e0831cb6050833cd0d32cede6c0b40f9e23501d2df5578eacf814","observation_id":"6c7a5148-7e2e-4d9b-bf33-a21a6259c3de","resolution":{"observed_at":"2026-08-04T11:23:16.184313Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:23:16.275636Z","title":"SuperBPE: Space travel for language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.05699","last_updated":"2026-05-25T05:56:04Z","snapshot_observed_at":"2026-08-09T08:50:47.672362Z","submitted_at":"2025-10-07T09:05:40Z","title":"Membership Inference Attacks on Tokenizers of Large Language Models","version":4},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-04T11:23:16.275636Z"},"links":{"citing_paper":"/paper/2510.05699"},"observation_digest":"sha256:3888d2fe70305f2bc3671a17580645b39ed090a4ef908e367dd6bbe94da54856","observation_id":"d565d62b-72d0-436d-b87f-6575bdc965fa","resolution":{"observed_at":"2026-08-04T11:23:16.275636Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:23:16.360687Z","title":"Please tell me more: Privacy impact of explainability through the lens of membership inference attack","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.05699","last_updated":"2026-05-25T05:56:04Z","snapshot_observed_at":"2026-08-09T08:50:47.672362Z","submitted_at":"2025-10-07T09:05:40Z","title":"Membership Inference Attacks on Tokenizers of Large Language Models","version":4},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-04T11:23:16.360687Z"},"links":{"citing_paper":"/paper/2510.05699"},"observation_digest":"sha256:df01548e6d1bed0e6efe86114d9749926b073184af74907787b34a861623b381","observation_id":"26dfcea7-eefe-4573-b0ca-10a9ca6486cd","resolution":{"observed_at":"2026-08-04T11:23:16.360687Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1907.11692","last_updated":"2019-07-26T17:48:29Z","snapshot_observed_at":"2026-07-31T22:31:37.910868Z","submitted_at":"2019-07-26T17:48:29Z","title":"RoBERTa: A Robustly Optimized BERT Pretraining Approach","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.11692","snapshot_observed_at":"2026-08-04T11:23:16.460478Z","title":"Roberta: A ro- bustly optimized bert pretraining approach.arXiv preprint arXiv:1907.11692, 2019","venue":null,"work_id":null,"year":1907},"citing_paper":{"arxiv_id":"2510.05699","last_updated":"2026-05-25T05:56:04Z","snapshot_observed_at":"2026-08-09T08:50:47.672362Z","submitted_at":"2025-10-07T09:05:40Z","title":"Membership Inference Attacks on Tokenizers of Large Language Models","version":4},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-04T11:23:16.460478Z"},"links":{"cited_paper":"/paper/1907.11692","citing_paper":"/paper/2510.05699"},"observation_digest":"sha256:63f9ab1ddbf4f0067d4f78cc9d6be9679bc838589c009295796666aed31ebb6e","observation_id":"1cf32503-e51d-48dc-b149-1ca34bcbb4d4","resolution":{"observed_at":"2026-08-04T11:23:16.460478Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:23:16.616036Z","title":"Visu- alizing data using t-sne.Journal of machine learning research, 9(Nov):2579–2605, 2008","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2510.05699","last_updated":"2026-05-25T05:56:04Z","snapshot_observed_at":"2026-08-09T08:50:47.672362Z","submitted_at":"2025-10-07T09:05:40Z","title":"Membership Inference Attacks on Tokenizers of Large Language Models","version":4},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-04T11:23:16.616036Z"},"links":{"citing_paper":"/paper/2510.05699"},"observation_digest":"sha256:881b803bdcb00af28f6f41db8030edde07a439ed2895c1f68125d6e057bfc081","observation_id":"8eeb39b4-8961-4b75-84b6-4d2cfb4f6bb9","resolution":{"observed_at":"2026-08-04T11:23:16.616036Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:23:16.748379Z","title":"Llm dataset inference: Did you train on my dataset?Advances in Neural Information Pro- cessing Systems, 37:124069–124092, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.05699","last_updated":"2026-05-25T05:56:04Z","snapshot_observed_at":"2026-08-09T08:50:47.672362Z","submitted_at":"2025-10-07T09:05:40Z","title":"Membership Inference Attacks on Tokenizers of Large Language Models","version":4},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-04T11:23:16.748379Z"},"links":{"citing_paper":"/paper/2510.05699"},"observation_digest":"sha256:d5a33546315c0c63e0ebc6fe12f898550a4b0853cce4dfab1b1d3ec15a6e7c56","observation_id":"a12af4f5-b25c-41ab-b928-be75d08e663c","resolution":{"observed_at":"2026-08-04T11:23:16.748379Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.10706","last_updated":"2021-04-21T18:12:18Z","snapshot_observed_at":"2026-08-10T06:21:42.177350Z","submitted_at":"2021-04-21T18:12:18Z","title":"Dataset Inference: Ownership Resolution in Machine Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.10706","snapshot_observed_at":"2026-08-04T11:23:16.938718Z","title":"Dataset inference: Ownership resolution in machine learning.arXiv preprint arXiv:2104.10706, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2510.05699","last_updated":"2026-05-25T05:56:04Z","snapshot_observed_at":"2026-08-09T08:50:47.672362Z","submitted_at":"2025-10-07T09:05:40Z","title":"Membership Inference Attacks on Tokenizers of Large Language Models","version":4},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-04T11:23:16.938718Z"},"links":{"cited_paper":"/paper/2104.10706","citing_paper":"/paper/2510.05699"},"observation_digest":"sha256:f677331504e97fdb6526aea857d5e2895e87a3954ce237399e8b960039503354","observation_id":"4e79cc26-6e8e-4630-918c-6d305bfe0198","resolution":{"observed_at":"2026-08-04T11:23:16.938718Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:23:17.071614Z","title":"Tokens used by gpt-4 probably come from the reddit users","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.05699","last_updated":"2026-05-25T05:56:04Z","snapshot_observed_at":"2026-08-09T08:50:47.672362Z","submitted_at":"2025-10-07T09:05:40Z","title":"Membership Inference Attacks on Tokenizers of Large Language Models","version":4},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-04T11:23:17.071614Z"},"links":{"citing_paper":"/paper/2510.05699"},"observation_digest":"sha256:e7c98f6cbf4f3defc2eda95ead26b406710f92580675aa8400084442f69888bd","observation_id":"c65b1c6d-c3e5-49ad-b80d-604c169f334a","resolution":{"observed_at":"2026-08-04T11:23:17.071614Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:23:17.199788Z","title":"LLMs on the line: Data determines loss-to-loss scaling laws","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.05699","last_updated":"2026-05-25T05:56:04Z","snapshot_observed_at":"2026-08-09T08:50:47.672362Z","submitted_at":"2025-10-07T09:05:40Z","title":"Membership Inference Attacks on Tokenizers of Large Language Models","version":4},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-04T11:23:17.199788Z"},"links":{"citing_paper":"/paper/2510.05699"},"observation_digest":"sha256:816f6a2ef235644727bee5f81ae6f83509a81e7b93bce47d45e2cfac1ee10016","observation_id":"a66197b2-16c6-4989-9f59-589f0b43630b","resolution":{"observed_at":"2026-08-04T11:23:17.199788Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:23:17.334128Z","title":"Did the neurons read your book? document-level membership inference for large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.05699","last_updated":"2026-05-25T05:56:04Z","snapshot_observed_at":"2026-08-09T08:50:47.672362Z","submitted_at":"2025-10-07T09:05:40Z","title":"Membership Inference Attacks on Tokenizers of Large Language Models","version":4},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-04T11:23:17.334128Z"},"links":{"citing_paper":"/paper/2510.05699"},"observation_digest":"sha256:0385e78b9432fa59920815f7e92be22758bb41d8f7a40a335ba1c8d2b24c4d3d","observation_id":"b3521f76-742b-4828-9233-99b2a9e4ada4","resolution":{"observed_at":"2026-08-04T11:23:17.334128Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:23:17.463752Z","title":"Sok: Membership inference attacks on llms are rushing nowhere (and how to fix it)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.05699","last_updated":"2026-05-25T05:56:04Z","snapshot_observed_at":"2026-08-09T08:50:47.672362Z","submitted_at":"2025-10-07T09:05:40Z","title":"Membership Inference Attacks on Tokenizers of Large Language Models","version":4},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-04T11:23:17.463752Z"},"links":{"citing_paper":"/paper/2510.05699"},"observation_digest":"sha256:e65ea3e3646077b5e8ee88f23abdba6f0667b42d567931b8ec8ad7942ed3a3b2","observation_id":"b912c77d-5959-4f74-bc61-7b783e172bce","resolution":{"observed_at":"2026-08-04T11:23:17.463752Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1609.07843","last_updated":"2016-09-26T04:06:13Z","snapshot_observed_at":"2026-07-06T05:12:10.387914Z","submitted_at":"2016-09-26T04:06:13Z","title":"Pointer Sentinel Mixture Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.07843","snapshot_observed_at":"2026-08-04T11:23:17.649968Z","title":"Pointer sentinel mixture models.arXiv preprint arXiv:1609.07843, 2016","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2510.05699","last_updated":"2026-05-25T05:56:04Z","snapshot_observed_at":"2026-08-09T08:50:47.672362Z","submitted_at":"2025-10-07T09:05:40Z","title":"Membership Inference Attacks on Tokenizers of Large Language Models","version":4},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-04T11:23:17.649968Z"},"links":{"cited_paper":"/paper/1609.07843","citing_paper":"/paper/2510.05699"},"observation_digest":"sha256:7ff2c107c9e256c05d239dd3afa0f60d5885b9858ebc06cd9738c488d3a93467","observation_id":"c56e5eb5-d70d-4d4f-bd27-e1fae8896bd6","resolution":{"observed_at":"2026-08-04T11:23:17.649968Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.06196","last_updated":"2025-03-23T14:51:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-09T05:37:09Z","title":"Large Language Models: A Survey","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.06196","snapshot_observed_at":"2026-08-04T11:23:17.742670Z","title":"Large language models: A survey.arXiv preprint arXiv:2402.06196, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.05699","last_updated":"2026-05-25T05:56:04Z","snapshot_observed_at":"2026-08-09T08:50:47.672362Z","submitted_at":"2025-10-07T09:05:40Z","title":"Membership Inference Attacks on Tokenizers of Large Language Models","version":4},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-04T11:23:17.742670Z"},"links":{"cited_paper":"/paper/2402.06196","citing_paper":"/paper/2510.05699"},"observation_digest":"sha256:aeb7d09cc3aeda524f3259bb73f431555eb34429e8ed8898f0849843fc4d27f5","observation_id":"eb9b0c07-cbf7-4335-bfb8-90354e5c857d","resolution":{"observed_at":"2026-08-04T11:23:17.742670Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:23:17.811670Z","title":"Scaling data-constrained language models.Advances in Neural Information Processing Systems, 36:50358– 50376, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.05699","last_updated":"2026-05-25T05:56:04Z","snapshot_observed_at":"2026-08-09T08:50:47.672362Z","submitted_at":"2025-10-07T09:05:40Z","title":"Membership Inference Attacks on Tokenizers of Large Language Models","version":4},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-04T11:23:17.811670Z"},"links":{"citing_paper":"/paper/2510.05699"},"observation_digest":"sha256:565a08b9f09b99b4969cf16a99221b5166b24d3c872a87e934d59b445cd5d6d5","observation_id":"92dacadc-918c-4b91-b100-2903c2973956","resolution":{"observed_at":"2026-08-04T11:23:17.811670Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:23:17.912650Z","title":"Com- prehensive privacy analysis of deep learning: Passive and active white-box inference attacks against central- ized and federated learning","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2510.05699","last_updated":"2026-05-25T05:56:04Z","snapshot_observed_at":"2026-08-09T08:50:47.672362Z","submitted_at":"2025-10-07T09:05:40Z","title":"Membership Inference Attacks on Tokenizers of Large Language Models","version":4},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-04T11:23:17.912650Z"},"links":{"citing_paper":"/paper/2510.05699"},"observation_digest":"sha256:c0c0583a12ee90bab9e9f5ee75e36f33a74a98b3a6f0efbbbd92371fc546b28c","observation_id":"62cbb5c0-7bcd-4317-855d-638d16060ac2","resolution":{"observed_at":"2026-08-04T11:23:17.912650Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:23:18.066530Z","title":"Reddit sues anthropic over its data scraping to train large language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.05699","last_updated":"2026-05-25T05:56:04Z","snapshot_observed_at":"2026-08-09T08:50:47.672362Z","submitted_at":"2025-10-07T09:05:40Z","title":"Membership Inference Attacks on Tokenizers of Large Language Models","version":4},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-04T11:23:18.066530Z"},"links":{"citing_paper":"/paper/2510.05699"},"observation_digest":"sha256:402edec8860dfdefcd15093e520eac74237ae56ab7d73ad4bbf976a06561fbf8","observation_id":"c845895b-7816-4174-be76-64db55a21a2a","resolution":{"observed_at":"2026-08-04T11:23:18.066530Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:23:18.205641Z","title":"System card of chatgpt-o1","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.05699","last_updated":"2026-05-25T05:56:04Z","snapshot_observed_at":"2026-08-09T08:50:47.672362Z","submitted_at":"2025-10-07T09:05:40Z","title":"Membership Inference Attacks on Tokenizers of Large Language Models","version":4},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-04T11:23:18.205641Z"},"links":{"citing_paper":"/paper/2510.05699"},"observation_digest":"sha256:b6fff74854f5bc3a4384969b4ecf3cd56d563cb808f5fce1560e47dce7470f33","observation_id":"0b8b1236-ce26-4eb9-8e53-6638b6b9ebf8","resolution":{"observed_at":"2026-08-04T11:23:18.205641Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:23:18.332969Z","title":"tiktoken: Tokenizer for openai models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.05699","last_updated":"2026-05-25T05:56:04Z","snapshot_observed_at":"2026-08-09T08:50:47.672362Z","submitted_at":"2025-10-07T09:05:40Z","title":"Membership Inference Attacks on Tokenizers of Large Language Models","version":4},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-04T11:23:18.332969Z"},"links":{"citing_paper":"/paper/2510.05699"},"observation_digest":"sha256:d1d134622a6a29fd2db019c079e16a685cf131ee3f308b60f2ea90e234ad6b4c","observation_id":"1fa7d70f-00bd-4771-972d-3c31d89bf895","resolution":{"observed_at":"2026-08-04T11:23:18.332969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.08207","last_updated":"2024-09-05T14:43:55Z","snapshot_observed_at":"2026-08-10T11:55:04.104369Z","submitted_at":"2023-12-13T15:25:39Z","title":"Black-box Membership Inference Attacks against Fine-tuned Diffusion Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.08207","snapshot_observed_at":"2026-08-04T11:23:18.538099Z","title":"Black-box membership inference attacks against fine-tuned diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.05699","last_updated":"2026-05-25T05:56:04Z","snapshot_observed_at":"2026-08-09T08:50:47.672362Z","submitted_at":"2025-10-07T09:05:40Z","title":"Membership Inference Attacks on Tokenizers of Large Language Models","version":4},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-04T11:23:18.538099Z"},"links":{"cited_paper":"/paper/2312.08207","citing_paper":"/paper/2510.05699"},"observation_digest":"sha256:00c240a66592bc40dd8e9708e478f04fe05ae0242373b5f0acbe06e89f1f49f7","observation_id":"cff1adc0-6037-44a8-8ea4-f8c1590afbdd","resolution":{"observed_at":"2026-08-04T11:23:18.538099Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.06405","last_updated":"2024-11-21T16:42:56Z","snapshot_observed_at":"2026-08-08T11:02:06.153465Z","submitted_at":"2023-08-11T22:03:36Z","title":"White-box Membership Inference Attacks against Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.06405","snapshot_observed_at":"2026-08-04T11:23:18.669175Z","title":"White-box membership inference attacks against diffusion models.arXiv preprint arXiv:2308.06405, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.05699","last_updated":"2026-05-25T05:56:04Z","snapshot_observed_at":"2026-08-09T08:50:47.672362Z","submitted_at":"2025-10-07T09:05:40Z","title":"Membership Inference Attacks on Tokenizers of Large Language Models","version":4},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-04T11:23:18.669175Z"},"links":{"cited_paper":"/paper/2308.06405","citing_paper":"/paper/2510.05699"},"observation_digest":"sha256:98986410de4ba3a06842beaa74826b327831f608c65f59aa9ea6053bd5eecf3f","observation_id":"309cdaaa-72d0-4beb-bf5c-35641c9f9867","resolution":{"observed_at":"2026-08-04T11:23:18.669175Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:23:18.847087Z","title":"Zipf’s word frequency law in natural language: A critical review and future direc- tions.Psychonomic bulletin & review, 21(5):1112– 1130, 2014","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2510.05699","last_updated":"2026-05-25T05:56:04Z","snapshot_observed_at":"2026-08-09T08:50:47.672362Z","submitted_at":"2025-10-07T09:05:40Z","title":"Membership Inference Attacks on Tokenizers of Large Language Models","version":4},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-04T11:23:18.847087Z"},"links":{"citing_paper":"/paper/2510.05699"},"observation_digest":"sha256:8b09d85fc613a4db5bec9be8f4de6f5868251c631c89fe9f20b25e02e7c25a3c","observation_id":"e1ce9bac-38e7-45ed-8447-d787aea53c2c","resolution":{"observed_at":"2026-08-04T11:23:18.847087Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:23:19.013701Z","title":"Scaling up membership inference: When and how attacks succeed on large language mod- els","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.05699","last_updated":"2026-05-25T05:56:04Z","snapshot_observed_at":"2026-08-09T08:50:47.672362Z","submitted_at":"2025-10-07T09:05:40Z","title":"Membership Inference Attacks on Tokenizers of Large Language Models","version":4},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-04T11:23:19.013701Z"},"links":{"citing_paper":"/paper/2510.05699"},"observation_digest":"sha256:558b2eda249a960d6200564f41a7c5c428b9431c7f33dea84cdce1c9b3f7e6de","observation_id":"49d85827-7f33-4635-8472-ae11687501c3","resolution":{"observed_at":"2026-08-04T11:23:19.013701Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:23:19.137368Z","title":"Text mining: use of tf-idf to examine the relevance of words to docu- ments.International journal of computer applications, 181(1):25–29, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2510.05699","last_updated":"2026-05-25T05:56:04Z","snapshot_observed_at":"2026-08-09T08:50:47.672362Z","submitted_at":"2025-10-07T09:05:40Z","title":"Membership Inference Attacks on Tokenizers of Large Language Models","version":4},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-04T11:23:19.137368Z"},"links":{"citing_paper":"/paper/2510.05699"},"observation_digest":"sha256:d444171ec017d8d2dea9fc8ac6eb47115cfefb9da32710cb38709cf4c6eba1b9","observation_id":"5fde49ab-bb2d-4153-96ea-f02388250892","resolution":{"observed_at":"2026-08-04T11:23:19.137368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:23:19.262666Z","title":"Exploring the limits of transfer learning with a unified text-to-text transformer.Journal of machine learning research, 21(140):1–67, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2510.05699","last_updated":"2026-05-25T05:56:04Z","snapshot_observed_at":"2026-08-09T08:50:47.672362Z","submitted_at":"2025-10-07T09:05:40Z","title":"Membership Inference Attacks on Tokenizers of Large Language Models","version":4},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-04T11:23:19.262666Z"},"links":{"citing_paper":"/paper/2510.05699"},"observation_digest":"sha256:3dab8b0a401b58fa0debb69a19ba5ae65bf7ec4b3b9f67da5231b4971c4eec5d","observation_id":"5d5a780b-0dd7-447e-9389-f11170a780ec","resolution":{"observed_at":"2026-08-04T11:23:19.262666Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:23:19.347720Z","title":"Using tf-idf to determine word rele- vance in document queries","venue":null,"work_id":null,"year":2003},"citing_paper":{"arxiv_id":"2510.05699","last_updated":"2026-05-25T05:56:04Z","snapshot_observed_at":"2026-08-09T08:50:47.672362Z","submitted_at":"2025-10-07T09:05:40Z","title":"Membership Inference Attacks on Tokenizers of Large Language Models","version":4},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-04T11:23:19.347720Z"},"links":{"citing_paper":"/paper/2510.05699"},"observation_digest":"sha256:6b54871c331872d4c6b85594d88130f6b325767749b59ef5ff1bed04fad822ab","observation_id":"e33d4ce0-8b00-4cf1-b85d-cf3cf1ecf926","resolution":{"observed_at":"2026-08-04T11:23:19.347720Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:23:19.498048Z","title":"Gpqa: A graduate- level google-proof q&a benchmark","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.05699","last_updated":"2026-05-25T05:56:04Z","snapshot_observed_at":"2026-08-09T08:50:47.672362Z","submitted_at":"2025-10-07T09:05:40Z","title":"Membership Inference Attacks on Tokenizers of Large Language Models","version":4},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-04T11:23:19.498048Z"},"links":{"citing_paper":"/paper/2510.05699"},"observation_digest":"sha256:a2385d304e64a2e7dfc09abbb2bcd6734a7931179c6939770648d1db722d6923","observation_id":"d7523255-b8bc-45f6-acb1-d4454dba0d7d","resolution":{"observed_at":"2026-08-04T11:23:19.498048Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:23:19.674528Z","title":"Self- comparison for dataset-level membership inference in large (vision-) language model","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.05699","last_updated":"2026-05-25T05:56:04Z","snapshot_observed_at":"2026-08-09T08:50:47.672362Z","submitted_at":"2025-10-07T09:05:40Z","title":"Membership Inference Attacks on Tokenizers of Large Language Models","version":4},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-04T11:23:19.674528Z"},"links":{"citing_paper":"/paper/2510.05699"},"observation_digest":"sha256:a51db09f9db916cfd68475643ea648093e9ee76495c3c6e998aee018dfdcba21","observation_id":"da2ec6eb-684f-4777-b0de-5350c18d96d6","resolution":{"observed_at":"2026-08-04T11:23:19.674528Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:23:19.797954Z","title":"Learning representations by back- propagating errors.nature, 323(6088):533–536, 1986","venue":null,"work_id":null,"year":1986},"citing_paper":{"arxiv_id":"2510.05699","last_updated":"2026-05-25T05:56:04Z","snapshot_observed_at":"2026-08-09T08:50:47.672362Z","submitted_at":"2025-10-07T09:05:40Z","title":"Membership Inference Attacks on Tokenizers of Large Language Models","version":4},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-04T11:23:19.797954Z"},"links":{"citing_paper":"/paper/2510.05699"},"observation_digest":"sha256:707201a48ca490a4d01c26da169198c985f4384df99cbe104d496f1ba90f04fb","observation_id":"1fa1e540-20f2-4ee0-99e0-f8fcde0e78bb","resolution":{"observed_at":"2026-08-04T11:23:19.797954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:23:19.969845Z","title":"White-box vs black-box: Bayes optimal strategies for membership inference","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2510.05699","last_updated":"2026-05-25T05:56:04Z","snapshot_observed_at":"2026-08-09T08:50:47.672362Z","submitted_at":"2025-10-07T09:05:40Z","title":"Membership Inference Attacks on Tokenizers of Large Language Models","version":4},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-04T11:23:19.969845Z"},"links":{"citing_paper":"/paper/2510.05699"},"observation_digest":"sha256:e79e004e192b7c04c7c80e1cfe7dff413c09ef78952cf331d63b5a2b0d18a777","observation_id":"bd4cda93-0789-409a-9ae8-c4b084d0833e","resolution":{"observed_at":"2026-08-04T11:23:19.969845Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:23:20.139762Z","title":"Simple and effec- tive masked diffusion language models.Advances in Neural Information Processing Systems, 37:130136– 130184, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.05699","last_updated":"2026-05-25T05:56:04Z","snapshot_observed_at":"2026-08-09T08:50:47.672362Z","submitted_at":"2025-10-07T09:05:40Z","title":"Membership Inference Attacks on Tokenizers of Large Language Models","version":4},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-04T11:23:20.139762Z"},"links":{"citing_paper":"/paper/2510.05699"},"observation_digest":"sha256:02dc142168806ec6fe2dc075b23a917df13ba10cefe4fa5de308c8341cfc2843","observation_id":"b145e816-191e-42a5-8bd6-67fd13cedbb0","resolution":{"observed_at":"2026-08-04T11:23:20.139762Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1806.01246","last_updated":"2018-12-14T19:39:43Z","snapshot_observed_at":"2026-08-08T03:39:28.408433Z","submitted_at":"2018-06-04T17:38:42Z","title":"ML-Leaks: Model and Data Independent Membership Inference Attacks and Defenses on Machine Learning Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1806.01246","snapshot_observed_at":"2026-08-04T11:23:20.294107Z","title":"Ml-leaks: Model and data independent membership inference at- tacks and defenses on machine learning models.arXiv preprint arXiv:1806.01246, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2510.05699","last_updated":"2026-05-25T05:56:04Z","snapshot_observed_at":"2026-08-09T08:50:47.672362Z","submitted_at":"2025-10-07T09:05:40Z","title":"Membership Inference Attacks on Tokenizers of Large Language Models","version":4},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-04T11:23:20.294107Z"},"links":{"cited_paper":"/paper/1806.01246","citing_paper":"/paper/2510.05699"},"observation_digest":"sha256:eb432809b6198330cdd3f7a8babc7b3de5b8c8e7e89bb282ea4c0e372dae082e","observation_id":"86ed5bd1-17ee-4c7d-a0ec-91eca9e799fa","resolution":{"observed_at":"2026-08-04T11:23:20.294107Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:23:20.389642Z","title":"Genomic privacy and limits of individual detection in a pool.Nature genetics, 41(9):965–967, 2009","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2510.05699","last_updated":"2026-05-25T05:56:04Z","snapshot_observed_at":"2026-08-09T08:50:47.672362Z","submitted_at":"2025-10-07T09:05:40Z","title":"Membership Inference Attacks on Tokenizers of Large Language Models","version":4},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-04T11:23:20.389642Z"},"links":{"citing_paper":"/paper/2510.05699"},"observation_digest":"sha256:cf494858f838c711ef841527921d551ba471301be31f2945d5b80f9c2359d633","observation_id":"974bae74-aa3a-4128-a61b-b6c70b93111f","resolution":{"observed_at":"2026-08-04T11:23:20.389642Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:23:20.478792Z","title":"Language models are greedy reasoners: A systematic formal analysis of chain-of-thought","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.05699","last_updated":"2026-05-25T05:56:04Z","snapshot_observed_at":"2026-08-09T08:50:47.672362Z","submitted_at":"2025-10-07T09:05:40Z","title":"Membership Inference Attacks on Tokenizers of Large Language Models","version":4},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-04T11:23:20.478792Z"},"links":{"citing_paper":"/paper/2510.05699"},"observation_digest":"sha256:e275c3167cadf3a3b924aad4f1b36ab0dcb5154173f7fc22c0f3ebd854b2d42c","observation_id":"00bc5630-9f7c-4a85-a05f-ed85a5ace7e8","resolution":{"observed_at":"2026-08-04T11:23:20.478792Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:23:20.596848Z","title":"Spearman’s rank correlation coeffi- cient.Bmj, 349, 2014","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2510.05699","last_updated":"2026-05-25T05:56:04Z","snapshot_observed_at":"2026-08-09T08:50:47.672362Z","submitted_at":"2025-10-07T09:05:40Z","title":"Membership Inference Attacks on Tokenizers of Large Language Models","version":4},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-04T11:23:20.596848Z"},"links":{"citing_paper":"/paper/2510.05699"},"observation_digest":"sha256:a6d2d1156e7920b608f033a88dd85e70481bf1916f98d10abd23b1a8f718dcc3","observation_id":"e0710dc0-34b3-43f1-84b8-160776b7f55a","resolution":{"observed_at":"2026-08-04T11:23:20.596848Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:23:20.679669Z","title":"Detecting pretraining data from large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.05699","last_updated":"2026-05-25T05:56:04Z","snapshot_observed_at":"2026-08-09T08:50:47.672362Z","submitted_at":"2025-10-07T09:05:40Z","title":"Membership Inference Attacks on Tokenizers of Large Language Models","version":4},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-04T11:23:20.679669Z"},"links":{"citing_paper":"/paper/2510.05699"},"observation_digest":"sha256:38b22187e87bf59e680b6b6a47cf254159e7016498c97403ca05981583794ec1","observation_id":"5f2526e0-ee78-4dd7-bf73-352210dfe31c","resolution":{"observed_at":"2026-08-04T11:23:20.679669Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:23:20.777679Z","title":"Byte pair encoding: A text compression scheme that accelerates pattern matching","venue":null,"work_id":null,"year":1999},"citing_paper":{"arxiv_id":"2510.05699","last_updated":"2026-05-25T05:56:04Z","snapshot_observed_at":"2026-08-09T08:50:47.672362Z","submitted_at":"2025-10-07T09:05:40Z","title":"Membership Inference Attacks on Tokenizers of Large Language Models","version":4},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-04T11:23:20.777679Z"},"links":{"citing_paper":"/paper/2510.05699"},"observation_digest":"sha256:09d4596ba078184e99d2a2444b260396db7f76e3dd456ccf547e3a872e682632","observation_id":"99600e56-1ee2-4f41-9361-43aa1acf2b31","resolution":{"observed_at":"2026-08-04T11:23:20.777679Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:23:20.858316Z","title":"Membership inference attacks against machine learning models","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2510.05699","last_updated":"2026-05-25T05:56:04Z","snapshot_observed_at":"2026-08-09T08:50:47.672362Z","submitted_at":"2025-10-07T09:05:40Z","title":"Membership Inference Attacks on Tokenizers of Large Language Models","version":4},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-04T11:23:20.858316Z"},"links":{"citing_paper":"/paper/2510.05699"},"observation_digest":"sha256:66b4167b5db658d631ae2453cc88749a517243ea868b9a88fd616cd9bb04f8dd","observation_id":"8044ccf4-3fbf-40a6-8cac-dc6d50822373","resolution":{"observed_at":"2026-08-04T11:23:20.858316Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:23:20.929826Z","title":"Spacebyte: Towards deleting tokeniza- tion from large language modeling.Advances in Neural Information Processing Systems, 37:124925– 124950, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.05699","last_updated":"2026-05-25T05:56:04Z","snapshot_observed_at":"2026-08-09T08:50:47.672362Z","submitted_at":"2025-10-07T09:05:40Z","title":"Membership Inference Attacks on Tokenizers of Large Language Models","version":4},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-04T11:23:20.929826Z"},"links":{"citing_paper":"/paper/2510.05699"},"observation_digest":"sha256:a21efc01af85106b09854200a3647e7001c536b75461ff352101de7c43a9c246","observation_id":"d5b7db1b-baf2-4bc6-a760-310ad373ad0c","resolution":{"observed_at":"2026-08-04T11:23:20.929826Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:23:20.975566Z","title":"A statistical interpretation of term specificity and its application in retrieval.Journal of documentation, 28(1):11–21, 1972","venue":null,"work_id":null,"year":1972},"citing_paper":{"arxiv_id":"2510.05699","last_updated":"2026-05-25T05:56:04Z","snapshot_observed_at":"2026-08-09T08:50:47.672362Z","submitted_at":"2025-10-07T09:05:40Z","title":"Membership Inference Attacks on Tokenizers of Large Language Models","version":4},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-04T11:23:20.975566Z"},"links":{"citing_paper":"/paper/2510.05699"},"observation_digest":"sha256:69e91e08ff07e2742e15f6b6345b730757940975818e3819826d9eff6d6f10db","observation_id":"e5676652-d172-4871-93f1-c0deacbfa35f","resolution":{"observed_at":"2026-08-04T11:23:20.975566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:23:21.056858Z","title":"Scaling laws with vocabulary: Larger mod- els deserve larger vocabularies.Advances in Neural Information Processing Systems, 37:114147–114179, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.05699","last_updated":"2026-05-25T05:56:04Z","snapshot_observed_at":"2026-08-09T08:50:47.672362Z","submitted_at":"2025-10-07T09:05:40Z","title":"Membership Inference Attacks on Tokenizers of Large Language Models","version":4},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-04T11:23:21.056858Z"},"links":{"citing_paper":"/paper/2510.05699"},"observation_digest":"sha256:10f358c39258b2c37cea7d8f56ee84b8094ed1a7a29ad918532a12c2dbe8afff","observation_id":"142225ce-1cc3-42ad-86a2-28a7c0f5c872","resolution":{"observed_at":"2026-08-04T11:23:21.056858Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:23:21.198886Z","title":"On the vulnerability of text sanitization","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.05699","last_updated":"2026-05-25T05:56:04Z","snapshot_observed_at":"2026-08-09T08:50:47.672362Z","submitted_at":"2025-10-07T09:05:40Z","title":"Membership Inference Attacks on Tokenizers of Large Language Models","version":4},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-04T11:23:21.198886Z"},"links":{"citing_paper":"/paper/2510.05699"},"observation_digest":"sha256:3e042d6a231e8199e038a6c20e50b1cbdd10864ad4c1776b34c544fc5840bf18","observation_id":"4d7019a2-f1f9-4993-8c01-4678c4699916","resolution":{"observed_at":"2026-08-04T11:23:21.198886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:23:21.374299Z","title":"Inferdpt: Privacy-preserving inference for black-box large language models.IEEE Transactions on Dependable and Secure Computing, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.05699","last_updated":"2026-05-25T05:56:04Z","snapshot_observed_at":"2026-08-09T08:50:47.672362Z","submitted_at":"2025-10-07T09:05:40Z","title":"Membership Inference Attacks on Tokenizers of Large Language Models","version":4},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-04T11:23:21.374299Z"},"links":{"citing_paper":"/paper/2510.05699"},"observation_digest":"sha256:dd9e27ab2a93b8cb94704a049923e84cef8181edf371f99cb4a9b8919a216d84","observation_id":"593d9036-5fb9-4c61-8794-aa3d063db7f2","resolution":{"observed_at":"2026-08-04T11:23:21.374299Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-04T11:23:21.490138Z","title":"Llama: Open and efficient foundation language models.arXiv preprint arXiv:2302.13971, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.05699","last_updated":"2026-05-25T05:56:04Z","snapshot_observed_at":"2026-08-09T08:50:47.672362Z","submitted_at":"2025-10-07T09:05:40Z","title":"Membership Inference Attacks on Tokenizers of Large Language Models","version":4},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-04T11:23:21.490138Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2510.05699"},"observation_digest":"sha256:ad4b3fa61540255cd1eb4e053fe73cb887924cd71e0b25b020b2d0a569fdef7a","observation_id":"027c7336-e9db-4dfa-998f-53f8d225a299","resolution":{"observed_at":"2026-08-04T11:23:21.490138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2510.05699","last_updated":"2026-05-25T05:56:04Z","latest_version":4,"primary_category":"cs.CR","snapshot_observed_at":"2026-08-09T08:50:47.672362Z","submitted_at":"2025-10-07T09:05:40Z","title":"Membership Inference Attacks on Tokenizers of Large Language Models"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":100,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":110},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 100 of 110 outbound references and 1 inbound Pith citation observation for arXiv:2510.05699."}