{"as_of":"2026-08-18T23:24:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:3cfdd52e107bb2e90f9985fb688029946cccb861f9816077b9791ed215e2e181","coverage":[{"denominator":299,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T07:29:56.617980Z","state":"measured"},{"denominator":100,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":100,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.10020/citation-record","integrity":"/paper/2607.10020/integrity","json":"/paper/2607.10020/citation-record.json","paper":"/paper/2607.10020"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:29:45.764850Z","title":"Why keep hospital clinical records?","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10020","last_updated":"2026-07-15T18:51:10Z","snapshot_observed_at":"2026-08-15T08:44:54.756971Z","submitted_at":"2026-07-10T22:46:11Z","title":"FindMyText: Robust, Scalable Detection of Text Containment in Large Web-Crawled Corpora","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-02T07:29:45.764850Z"},"links":{"citing_paper":"/paper/2607.10020"},"observation_digest":"sha256:053d06ce68cdad6a30f3b3eac374cd94bf3b169b585428408c348714fee97198","observation_id":"f0d54603-bae2-4ac4-a4f2-f914bea4729b","resolution":{"observed_at":"2026-08-02T07:29:45.764850Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:29:46.004752Z","title":"We hacked a robot vacuum -- and could watch live through its camera","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10020","last_updated":"2026-07-15T18:51:10Z","snapshot_observed_at":"2026-08-15T08:44:54.756971Z","submitted_at":"2026-07-10T22:46:11Z","title":"FindMyText: Robust, Scalable Detection of Text Containment in Large Web-Crawled Corpora","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-02T07:29:46.004752Z"},"links":{"citing_paper":"/paper/2607.10020"},"observation_digest":"sha256:87df19b38d49a6f6f6414d36cbd96fe0f398bd5a0494bc58ce49975902b654f7","observation_id":"760fd118-226d-4c0b-8ad5-1979c6857bfd","resolution":{"observed_at":"2026-08-02T07:29:46.004752Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:29:46.125248Z","title":"Robot roaming some federal office buildings raises privacy concerns","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10020","last_updated":"2026-07-15T18:51:10Z","snapshot_observed_at":"2026-08-15T08:44:54.756971Z","submitted_at":"2026-07-10T22:46:11Z","title":"FindMyText: Robust, Scalable Detection of Text Containment in Large Web-Crawled Corpora","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-02T07:29:46.125248Z"},"links":{"citing_paper":"/paper/2607.10020"},"observation_digest":"sha256:9010b3e1da5a407014bfc4ecfc110e5be45625086dd96e483cdf0f2421ff16f2","observation_id":"74baf9c9-0557-43fe-8b0e-7f9f615afb8b","resolution":{"observed_at":"2026-08-02T07:29:46.125248Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:29:46.229855Z","title":"N kan KI-generert tekst vannmerkes","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10020","last_updated":"2026-07-15T18:51:10Z","snapshot_observed_at":"2026-08-15T08:44:54.756971Z","submitted_at":"2026-07-10T22:46:11Z","title":"FindMyText: Robust, Scalable Detection of Text Containment in Large Web-Crawled Corpora","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-02T07:29:46.229855Z"},"links":{"citing_paper":"/paper/2607.10020"},"observation_digest":"sha256:ed41de555d43f1a3562ab8ad29c98a95a401fe977119b76371fa5502dd33306b","observation_id":"4c4261a4-1465-4993-bba6-1447345c3103","resolution":{"observed_at":"2026-08-02T07:29:46.229855Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:29:46.335582Z","title":"Kan kunstig intelligens forst spr k?","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10020","last_updated":"2026-07-15T18:51:10Z","snapshot_observed_at":"2026-08-15T08:44:54.756971Z","submitted_at":"2026-07-10T22:46:11Z","title":"FindMyText: Robust, Scalable Detection of Text Containment in Large Web-Crawled Corpora","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-02T07:29:46.335582Z"},"links":{"citing_paper":"/paper/2607.10020"},"observation_digest":"sha256:74d596785420d12bd44a7c19a3cf854f6322384d979e74849854713d225b2db0","observation_id":"2497bc79-2f79-4904-ae4e-759f51b388f3","resolution":{"observed_at":"2026-08-02T07:29:46.335582Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:29:46.424923Z","title":"Privacy and confidentiality issues in historical health sciences collections 2012 law & informatics issue","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2607.10020","last_updated":"2026-07-15T18:51:10Z","snapshot_observed_at":"2026-08-15T08:44:54.756971Z","submitted_at":"2026-07-10T22:46:11Z","title":"FindMyText: Robust, Scalable Detection of Text Containment in Large Web-Crawled Corpora","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-02T07:29:46.424923Z"},"links":{"citing_paper":"/paper/2607.10020"},"observation_digest":"sha256:4d300eeaea8a0212eae223216bf6427dc61106136e51d84cb8c58f4a2e15a842","observation_id":"04dd53ab-7f6e-484d-ad3f-2caee19896da","resolution":{"observed_at":"2026-08-02T07:29:46.424923Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:29:46.540320Z","title":"Unsupervised Text Deidentification","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.10020","last_updated":"2026-07-15T18:51:10Z","snapshot_observed_at":"2026-08-15T08:44:54.756971Z","submitted_at":"2026-07-10T22:46:11Z","title":"FindMyText: Robust, Scalable Detection of Text Containment in Large Web-Crawled Corpora","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-02T07:29:46.540320Z"},"links":{"citing_paper":"/paper/2607.10020"},"observation_digest":"sha256:2bbc4c58087d3b5aa74a09d2e7110729b205254691251c6f112cfda65304ecfd","observation_id":"8db4b614-e4ee-41b7-b7a4-b3823faa611b","resolution":{"observed_at":"2026-08-02T07:29:46.540320Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:29:46.644815Z","title":"skweak: Weak Supervision Made Easy for NLP","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.10020","last_updated":"2026-07-15T18:51:10Z","snapshot_observed_at":"2026-08-15T08:44:54.756971Z","submitted_at":"2026-07-10T22:46:11Z","title":"FindMyText: Robust, Scalable Detection of Text Containment in Large Web-Crawled Corpora","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-02T07:29:46.644815Z"},"links":{"citing_paper":"/paper/2607.10020"},"observation_digest":"sha256:92f37416d52194578553d34f4580a0fd488773a3348c6e02d63e0f8a79dc3656","observation_id":"45bbf452-a756-4be6-83f5-9ffba4578937","resolution":{"observed_at":"2026-08-02T07:29:46.644815Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:29:46.731186Z","title":"Replication in visual diffusion models: A survey and outlook","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10020","last_updated":"2026-07-15T18:51:10Z","snapshot_observed_at":"2026-08-15T08:44:54.756971Z","submitted_at":"2026-07-10T22:46:11Z","title":"FindMyText: Robust, Scalable Detection of Text Containment in Large Web-Crawled Corpora","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-02T07:29:46.731186Z"},"links":{"citing_paper":"/paper/2607.10020"},"observation_digest":"sha256:e23a914de2ab6be1298efd6aa559a76e4f24567fb921b8339b32b47c99e1b2b0","observation_id":"23c22eb4-2f29-4389-afa9-965d46808059","resolution":{"observed_at":"2026-08-02T07:29:46.731186Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:29:46.798600Z","title":"AIStorySimilarity: Quantifying story similarity using narrative for search, IP infringement, and guided creativity","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.10020","last_updated":"2026-07-15T18:51:10Z","snapshot_observed_at":"2026-08-15T08:44:54.756971Z","submitted_at":"2026-07-10T22:46:11Z","title":"FindMyText: Robust, Scalable Detection of Text Containment in Large Web-Crawled Corpora","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-02T07:29:46.798600Z"},"links":{"citing_paper":"/paper/2607.10020"},"observation_digest":"sha256:f6a66367bad9e661784fcd175edbabd261119c367bc5126a832c12412e48c870","observation_id":"a57d92e4-465b-49c0-91f8-d30ba4dddf53","resolution":{"observed_at":"2026-08-02T07:29:46.798600Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:29:46.927088Z","title":"CopyBench: Measuring literal and non-literal reproduction of copyright-protected text in language model generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.10020","last_updated":"2026-07-15T18:51:10Z","snapshot_observed_at":"2026-08-15T08:44:54.756971Z","submitted_at":"2026-07-10T22:46:11Z","title":"FindMyText: Robust, Scalable Detection of Text Containment in Large Web-Crawled Corpora","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-02T07:29:46.927088Z"},"links":{"citing_paper":"/paper/2607.10020"},"observation_digest":"sha256:71c023fc055900acd04aff025348ffdcf1b797b6126bc18a04756ed05cf72564","observation_id":"ad0178c7-b489-43b8-9a34-604c5ec493ab","resolution":{"observed_at":"2026-08-02T07:29:46.927088Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:29:47.064745Z","title":"Alignment for Honesty","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10020","last_updated":"2026-07-15T18:51:10Z","snapshot_observed_at":"2026-08-15T08:44:54.756971Z","submitted_at":"2026-07-10T22:46:11Z","title":"FindMyText: Robust, Scalable Detection of Text Containment in Large Web-Crawled Corpora","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-02T07:29:47.064745Z"},"links":{"citing_paper":"/paper/2607.10020"},"observation_digest":"sha256:205f988a7993f54e86b67ccdab675a1603a400a812ca0182685afd153f9ff2e4","observation_id":"da5ac0d6-478c-4538-a520-b134932399e1","resolution":{"observed_at":"2026-08-02T07:29:47.064745Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:29:47.134746Z","title":"Scaling up membership inference: When and how attacks succeed on large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10020","last_updated":"2026-07-15T18:51:10Z","snapshot_observed_at":"2026-08-15T08:44:54.756971Z","submitted_at":"2026-07-10T22:46:11Z","title":"FindMyText: Robust, Scalable Detection of Text Containment in Large Web-Crawled Corpora","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-02T07:29:47.134746Z"},"links":{"citing_paper":"/paper/2607.10020"},"observation_digest":"sha256:bba9eafb4a0bba8d978d05e251117814ef91c3c693379312187ee9c53ab1d45b","observation_id":"e6dfb41e-78ec-48fb-87da-1f7ba95e9a2c","resolution":{"observed_at":"2026-08-02T07:29:47.134746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:29:47.203619Z","title":"Do Membership Inference Attacks Work on Large Language Models?","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10020","last_updated":"2026-07-15T18:51:10Z","snapshot_observed_at":"2026-08-15T08:44:54.756971Z","submitted_at":"2026-07-10T22:46:11Z","title":"FindMyText: Robust, Scalable Detection of Text Containment in Large Web-Crawled Corpora","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-02T07:29:47.203619Z"},"links":{"citing_paper":"/paper/2607.10020"},"observation_digest":"sha256:f23efaf3ac8aa3f37771172aa0f1aca655a16b8a517a6fa4e79c715ee2263051","observation_id":"4a4523b1-6cdb-4395-9ec7-e1cb7122e7a7","resolution":{"observed_at":"2026-08-02T07:29:47.203619Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:29:47.282419Z","title":"Membership inference attacks cannot prove that a model was trained on your data","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10020","last_updated":"2026-07-15T18:51:10Z","snapshot_observed_at":"2026-08-15T08:44:54.756971Z","submitted_at":"2026-07-10T22:46:11Z","title":"FindMyText: Robust, Scalable Detection of Text Containment in Large Web-Crawled Corpora","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-02T07:29:47.282419Z"},"links":{"citing_paper":"/paper/2607.10020"},"observation_digest":"sha256:faf49364ca900dd940b4e9e80ed6bffedcd4af4b01118b383d614965ef330f71","observation_id":"9bb12338-1e1d-49a1-8a1f-ad011c9ed293","resolution":{"observed_at":"2026-08-02T07:29:47.282419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:29:47.364749Z","title":"Membership Inference Attacks against Fine-tuned Large Language Models via Self-prompt Calibration","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10020","last_updated":"2026-07-15T18:51:10Z","snapshot_observed_at":"2026-08-15T08:44:54.756971Z","submitted_at":"2026-07-10T22:46:11Z","title":"FindMyText: Robust, Scalable Detection of Text Containment in Large Web-Crawled Corpora","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-02T07:29:47.364749Z"},"links":{"citing_paper":"/paper/2607.10020"},"observation_digest":"sha256:3f13097e0edd0afba65aafc970df3acf36bffddbcbc6f60d84dc0d5d5b3e1b0d","observation_id":"22d1d0f0-e8ee-47d5-9efe-93cb56786ccb","resolution":{"observed_at":"2026-08-02T07:29:47.364749Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:29:47.448293Z","title":"Noisy Neighbors: Efficient membership inference attacks against LLMs","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10020","last_updated":"2026-07-15T18:51:10Z","snapshot_observed_at":"2026-08-15T08:44:54.756971Z","submitted_at":"2026-07-10T22:46:11Z","title":"FindMyText: Robust, Scalable Detection of Text Containment in Large Web-Crawled Corpora","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-02T07:29:47.448293Z"},"links":{"citing_paper":"/paper/2607.10020"},"observation_digest":"sha256:ab846cf547ae7cf2ed9e070ac13ddcbaa5b9a6e0577c3d3e8546e714c16d8451","observation_id":"04586e23-6be1-4223-a31c-51f85f7b95eb","resolution":{"observed_at":"2026-08-02T07:29:47.448293Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:29:47.555870Z","title":"DF-MIA: A distribution-free membership Inference Attack on fine-tuned Large Language Models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10020","last_updated":"2026-07-15T18:51:10Z","snapshot_observed_at":"2026-08-15T08:44:54.756971Z","submitted_at":"2026-07-10T22:46:11Z","title":"FindMyText: Robust, Scalable Detection of Text Containment in Large Web-Crawled Corpora","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-02T07:29:47.555870Z"},"links":{"citing_paper":"/paper/2607.10020"},"observation_digest":"sha256:0109bdb6ea4ce424e57827ba9d34f4c3cc2a13c6ffe8fa3035a71a19c36e44a2","observation_id":"80024a5d-7bc5-4741-9a10-b89a7338045a","resolution":{"observed_at":"2026-08-02T07:29:47.555870Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.02902","last_updated":"2024-11-05T08:35:08Z","snapshot_observed_at":"2026-08-17T01:37:19.648932Z","submitted_at":"2024-11-05T08:35:08Z","title":"Membership Inference Attacks against Large Vision-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.02902","snapshot_observed_at":"2026-08-02T07:29:47.644741Z","title":"Membership inference attacks against large vision-language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10020","last_updated":"2026-07-15T18:51:10Z","snapshot_observed_at":"2026-08-15T08:44:54.756971Z","submitted_at":"2026-07-10T22:46:11Z","title":"FindMyText: Robust, Scalable Detection of Text Containment in Large Web-Crawled Corpora","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-02T07:29:47.644741Z"},"links":{"cited_paper":"/paper/2411.02902","citing_paper":"/paper/2607.10020"},"observation_digest":"sha256:f0142065a7ca9efda48084a72e496b866cf37dc06bb845121dae2814cb325600","observation_id":"2c156047-daa3-4a6f-96ab-b86472c98bee","resolution":{"observed_at":"2026-08-02T07:29:47.644741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:29:47.723402Z","title":"Not all tokens are equal: Membership inference attacks against fine-tuned language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.10020","last_updated":"2026-07-15T18:51:10Z","snapshot_observed_at":"2026-08-15T08:44:54.756971Z","submitted_at":"2026-07-10T22:46:11Z","title":"FindMyText: Robust, Scalable Detection of Text Containment in Large Web-Crawled Corpora","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-02T07:29:47.723402Z"},"links":{"citing_paper":"/paper/2607.10020"},"observation_digest":"sha256:fda8559005af4999ed5bcff530ab6cdee6094b7d673c41a25b0e11c0d4bc9afe","observation_id":"4cced56b-cfcf-4c2c-b357-95b620418b9f","resolution":{"observed_at":"2026-08-02T07:29:47.723402Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:29:47.781899Z","title":"Data Attribution for Text-to-Image Models by Unlearning Synthesized Images","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10020","last_updated":"2026-07-15T18:51:10Z","snapshot_observed_at":"2026-08-15T08:44:54.756971Z","submitted_at":"2026-07-10T22:46:11Z","title":"FindMyText: Robust, Scalable Detection of Text Containment in Large Web-Crawled Corpora","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-02T07:29:47.781899Z"},"links":{"citing_paper":"/paper/2607.10020"},"observation_digest":"sha256:c34b46384a7a8b474cbd3ff55ba26c213933c1ec1deb1c3bf7e32a1907c67a13","observation_id":"38c55117-b042-4fd4-b97f-19e1215fd4ba","resolution":{"observed_at":"2026-08-02T07:29:47.781899Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:29:47.888952Z","title":"Source-Aware Training Enables Knowledge Attribution in Language Models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10020","last_updated":"2026-07-15T18:51:10Z","snapshot_observed_at":"2026-08-15T08:44:54.756971Z","submitted_at":"2026-07-10T22:46:11Z","title":"FindMyText: Robust, Scalable Detection of Text Containment in Large Web-Crawled Corpora","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-02T07:29:47.888952Z"},"links":{"citing_paper":"/paper/2607.10020"},"observation_digest":"sha256:42cf19d164d54b5369e335bc3b7fbfa554c189f16ddcb77dc509d908026ebc96","observation_id":"c92bcf2f-71df-4345-aa9f-647cf664a188","resolution":{"observed_at":"2026-08-02T07:29:47.888952Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:29:47.959496Z","title":"Large language models for automated open-domain scientific hypotheses discovery","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.10020","last_updated":"2026-07-15T18:51:10Z","snapshot_observed_at":"2026-08-15T08:44:54.756971Z","submitted_at":"2026-07-10T22:46:11Z","title":"FindMyText: Robust, Scalable Detection of Text Containment in Large Web-Crawled Corpora","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-02T07:29:47.959496Z"},"links":{"citing_paper":"/paper/2607.10020"},"observation_digest":"sha256:032b835599627829069947ed4b0fcac98f3448843202f59afa38d4b34a26bb01","observation_id":"0cb0bec9-dd8e-4803-85b9-a0159ad22aa6","resolution":{"observed_at":"2026-08-02T07:29:47.959496Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:29:48.043984Z","title":"HoneyBee: Progressive instruction finetuning of large language models for materials science","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.10020","last_updated":"2026-07-15T18:51:10Z","snapshot_observed_at":"2026-08-15T08:44:54.756971Z","submitted_at":"2026-07-10T22:46:11Z","title":"FindMyText: Robust, Scalable Detection of Text Containment in Large Web-Crawled Corpora","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-02T07:29:48.043984Z"},"links":{"citing_paper":"/paper/2607.10020"},"observation_digest":"sha256:f0b4c4823a2b6c08d102e825695f9e791805b252a16aa3db37e0a47f8988ff49","observation_id":"26ec1e14-bf82-44f7-9df1-62c9c54af48a","resolution":{"observed_at":"2026-08-02T07:29:48.043984Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:29:48.135502Z","title":"A large-scale audit of dataset licensing and attribution in AI","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10020","last_updated":"2026-07-15T18:51:10Z","snapshot_observed_at":"2026-08-15T08:44:54.756971Z","submitted_at":"2026-07-10T22:46:11Z","title":"FindMyText: Robust, Scalable Detection of Text Containment in Large Web-Crawled Corpora","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-02T07:29:48.135502Z"},"links":{"citing_paper":"/paper/2607.10020"},"observation_digest":"sha256:e9a75508294c243936d9997cecebec1a7dba8652c6dee8ef9808587ccb1b4b29","observation_id":"f258c0d5-b67e-4b97-adfd-ea64aba1fb8a","resolution":{"observed_at":"2026-08-02T07:29:48.135502Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:29:48.281890Z","title":"Inherently privacy-preserving vision for trustworthy autonomous systems: Needs and solutions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.10020","last_updated":"2026-07-15T18:51:10Z","snapshot_observed_at":"2026-08-15T08:44:54.756971Z","submitted_at":"2026-07-10T22:46:11Z","title":"FindMyText: Robust, Scalable Detection of Text Containment in Large Web-Crawled Corpora","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-02T07:29:48.281890Z"},"links":{"citing_paper":"/paper/2607.10020"},"observation_digest":"sha256:d01e0fbdad6cdfab4ae65be02b26ffe8990ffcd1f0894a39feae59234f59a8d2","observation_id":"47234fbd-ae49-45cc-baaf-ebb30f06bfa7","resolution":{"observed_at":"2026-08-02T07:29:48.281890Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:29:48.418101Z","title":"Unsupervised utility evaluation of text anonymization methods via neural language models","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.10020","last_updated":"2026-07-15T18:51:10Z","snapshot_observed_at":"2026-08-15T08:44:54.756971Z","submitted_at":"2026-07-10T22:46:11Z","title":"FindMyText: Robust, Scalable Detection of Text Containment in Large Web-Crawled Corpora","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-02T07:29:48.418101Z"},"links":{"citing_paper":"/paper/2607.10020"},"observation_digest":"sha256:25b27021eade6260c96d982f457db9f65555535655ad93b2a4a5d8b9b01c76f4","observation_id":"89a416d1-62ed-4bd8-b4e8-58f312b0a598","resolution":{"observed_at":"2026-08-02T07:29:48.418101Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:29:48.501824Z","title":"Thermal imaging in robotics as a privacy-enhancing or privacy-invasive measure? Misconceptions of privacy when using thermal cameras in robots","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10020","last_updated":"2026-07-15T18:51:10Z","snapshot_observed_at":"2026-08-15T08:44:54.756971Z","submitted_at":"2026-07-10T22:46:11Z","title":"FindMyText: Robust, Scalable Detection of Text Containment in Large Web-Crawled Corpora","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-02T07:29:48.501824Z"},"links":{"citing_paper":"/paper/2607.10020"},"observation_digest":"sha256:2d00fa787b128ec51ed9f99efe66ad66bccc168b601f5f0ad1f796ecbb38febb","observation_id":"7ec01a1b-3deb-4ca0-9f8f-30f419684436","resolution":{"observed_at":"2026-08-02T07:29:48.501824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:29:48.619573Z","title":"Privacy-preserving robot vision with anonymized faces by extreme low resolution","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.10020","last_updated":"2026-07-15T18:51:10Z","snapshot_observed_at":"2026-08-15T08:44:54.756971Z","submitted_at":"2026-07-10T22:46:11Z","title":"FindMyText: Robust, Scalable Detection of Text Containment in Large Web-Crawled Corpora","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-02T07:29:48.619573Z"},"links":{"citing_paper":"/paper/2607.10020"},"observation_digest":"sha256:15a40d2decd47bbe9536f6f441e0dab1883411abd25583fa12aad496cc92aa38","observation_id":"87695ced-3bc0-4752-b014-836ec80b58bc","resolution":{"observed_at":"2026-08-02T07:29:48.619573Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:29:48.702555Z","title":"MicPro: Microphone-based voice privacy protection","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.10020","last_updated":"2026-07-15T18:51:10Z","snapshot_observed_at":"2026-08-15T08:44:54.756971Z","submitted_at":"2026-07-10T22:46:11Z","title":"FindMyText: Robust, Scalable Detection of Text Containment in Large Web-Crawled Corpora","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-02T07:29:48.702555Z"},"links":{"citing_paper":"/paper/2607.10020"},"observation_digest":"sha256:9ed217e20e9de76db7912e07c11ea89ada16920e4d06fdaf737d3f4a029d46aa","observation_id":"22fe98c6-e55b-4073-aaa8-28a891944be5","resolution":{"observed_at":"2026-08-02T07:29:48.702555Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:29:48.917765Z","title":"Investigating privacy in the context of office delivery robots","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.10020","last_updated":"2026-07-15T18:51:10Z","snapshot_observed_at":"2026-08-15T08:44:54.756971Z","submitted_at":"2026-07-10T22:46:11Z","title":"FindMyText: Robust, Scalable Detection of Text Containment in Large Web-Crawled Corpora","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-02T07:29:48.917765Z"},"links":{"citing_paper":"/paper/2607.10020"},"observation_digest":"sha256:03bc095d09abb46dbd3ee69e2ebb82bf4275922ab5f1ac932d11de1d4bdcfc94","observation_id":"ba72106d-478b-4674-a76b-12bc3bfd67ab","resolution":{"observed_at":"2026-08-02T07:29:48.917765Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:29:49.091378Z","title":"Robots as AI Double Agents: Privacy in Motion Planning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.10020","last_updated":"2026-07-15T18:51:10Z","snapshot_observed_at":"2026-08-15T08:44:54.756971Z","submitted_at":"2026-07-10T22:46:11Z","title":"FindMyText: Robust, Scalable Detection of Text Containment in Large Web-Crawled Corpora","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-02T07:29:49.091378Z"},"links":{"citing_paper":"/paper/2607.10020"},"observation_digest":"sha256:2b6c17a96fed9f5e9b0d86c9d3e018e64744f613b0eb86c85e5ffe12ff32ed7d","observation_id":"9475e226-7db9-4e19-ba5e-8fdf4a0a4c79","resolution":{"observed_at":"2026-08-02T07:29:49.091378Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:29:49.217001Z","title":"Themes and research directions in privacy-sensitive robotics","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.10020","last_updated":"2026-07-15T18:51:10Z","snapshot_observed_at":"2026-08-15T08:44:54.756971Z","submitted_at":"2026-07-10T22:46:11Z","title":"FindMyText: Robust, Scalable Detection of Text Containment in Large Web-Crawled Corpora","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-02T07:29:49.217001Z"},"links":{"citing_paper":"/paper/2607.10020"},"observation_digest":"sha256:025ff45e4bd29b1d61f5ea6f7eec38474a81b7abee458155bfceb68f75fd157d","observation_id":"e41b3bb5-35d5-4775-9aaf-e0e262e20a07","resolution":{"observed_at":"2026-08-02T07:29:49.217001Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:29:49.283071Z","title":"Privacy beyond data: Assessment and mitigation of privacy risks in robotic technology for elderly care","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10020","last_updated":"2026-07-15T18:51:10Z","snapshot_observed_at":"2026-08-15T08:44:54.756971Z","submitted_at":"2026-07-10T22:46:11Z","title":"FindMyText: Robust, Scalable Detection of Text Containment in Large Web-Crawled Corpora","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-02T07:29:49.283071Z"},"links":{"citing_paper":"/paper/2607.10020"},"observation_digest":"sha256:5da3fcdc7b16ab126bd751cf34371c9d48f1d15ef1adfa18fcd08ec426dad815","observation_id":"43a9c8e8-6dc4-4bf7-882c-3aec884c71c4","resolution":{"observed_at":"2026-08-02T07:29:49.283071Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:29:49.445722Z","title":"Understanding users' perception of privacy in human-robot interaction","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10020","last_updated":"2026-07-15T18:51:10Z","snapshot_observed_at":"2026-08-15T08:44:54.756971Z","submitted_at":"2026-07-10T22:46:11Z","title":"FindMyText: Robust, Scalable Detection of Text Containment in Large Web-Crawled Corpora","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-02T07:29:49.445722Z"},"links":{"citing_paper":"/paper/2607.10020"},"observation_digest":"sha256:1fad94105e2d3c221284a4025b6b126733ec85b3b7ec8de81a3e98522a6154cd","observation_id":"1a50e04c-4a23-4e9d-9161-a0af3322546f","resolution":{"observed_at":"2026-08-02T07:29:49.445722Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:29:49.585102Z","title":"Privacy considerations for socially assistive robots","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10020","last_updated":"2026-07-15T18:51:10Z","snapshot_observed_at":"2026-08-15T08:44:54.756971Z","submitted_at":"2026-07-10T22:46:11Z","title":"FindMyText: Robust, Scalable Detection of Text Containment in Large Web-Crawled Corpora","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-02T07:29:49.585102Z"},"links":{"citing_paper":"/paper/2607.10020"},"observation_digest":"sha256:75d361d2d11606a5e8f71742ee6323e047e189da58fe4e89f9a5ae686db29a1d","observation_id":"a7298af8-6676-428b-8c8f-dc3fe87ce344","resolution":{"observed_at":"2026-08-02T07:29:49.585102Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:29:49.736939Z","title":"Surveying adult perceptions of privacy and attitudes towards social robots in the home","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.10020","last_updated":"2026-07-15T18:51:10Z","snapshot_observed_at":"2026-08-15T08:44:54.756971Z","submitted_at":"2026-07-10T22:46:11Z","title":"FindMyText: Robust, Scalable Detection of Text Containment in Large Web-Crawled Corpora","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-02T07:29:49.736939Z"},"links":{"citing_paper":"/paper/2607.10020"},"observation_digest":"sha256:a64b34045a5f3626f6b62e39f56efc4b06fb356d485412b6ccbc618fbbeb284d","observation_id":"7f1f176f-1065-4f98-a798-667c5618fca5","resolution":{"observed_at":"2026-08-02T07:29:49.736939Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:29:49.856879Z","title":"Remix: Making art commerce thrive hybrid economy","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10020","last_updated":"2026-07-15T18:51:10Z","snapshot_observed_at":"2026-08-15T08:44:54.756971Z","submitted_at":"2026-07-10T22:46:11Z","title":"FindMyText: Robust, Scalable Detection of Text Containment in Large Web-Crawled Corpora","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-02T07:29:49.856879Z"},"links":{"citing_paper":"/paper/2607.10020"},"observation_digest":"sha256:f8cc92e05a17a35617fda459ad013eb893a961bc0a6e997cc5c5466e943ae1a4","observation_id":"01ad6569-2ba7-409c-8f0c-1ec495a0e67c","resolution":{"observed_at":"2026-08-02T07:29:49.856879Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:29:49.899471Z","title":"Conceptions Code: How metaphors explain legal challenges digital times","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10020","last_updated":"2026-07-15T18:51:10Z","snapshot_observed_at":"2026-08-15T08:44:54.756971Z","submitted_at":"2026-07-10T22:46:11Z","title":"FindMyText: Robust, Scalable Detection of Text Containment in Large Web-Crawled Corpora","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-02T07:29:49.899471Z"},"links":{"citing_paper":"/paper/2607.10020"},"observation_digest":"sha256:4826f5f4048c3b99492f60762f0aa1a5b1c2f17b57adb221b8f9ffde2cfc4680","observation_id":"0959cf53-e9e2-4f51-bf2a-e5cc624eedf1","resolution":{"observed_at":"2026-08-02T07:29:49.899471Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:29:50.049611Z","title":"DE-COP: Detecting Copyrighted Content in Language Models Training Data","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10020","last_updated":"2026-07-15T18:51:10Z","snapshot_observed_at":"2026-08-15T08:44:54.756971Z","submitted_at":"2026-07-10T22:46:11Z","title":"FindMyText: Robust, Scalable Detection of Text Containment in Large Web-Crawled Corpora","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-02T07:29:50.049611Z"},"links":{"citing_paper":"/paper/2607.10020"},"observation_digest":"sha256:2e8fdfbbe2b9cc51a8f5ce86f6796d2b023bd216c8efad08dca372417653f2f9","observation_id":"5049569d-5478-4379-b52e-a35e1b9773b9","resolution":{"observed_at":"2026-08-02T07:29:50.049611Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:29:50.221970Z","title":"HoneyComb: A Flexible LLM-Based Agent System for Materials Science","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.10020","last_updated":"2026-07-15T18:51:10Z","snapshot_observed_at":"2026-08-15T08:44:54.756971Z","submitted_at":"2026-07-10T22:46:11Z","title":"FindMyText: Robust, Scalable Detection of Text Containment in Large Web-Crawled Corpora","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-02T07:29:50.221970Z"},"links":{"citing_paper":"/paper/2607.10020"},"observation_digest":"sha256:c636b5a4276f8d029b26316bb87c0b50f87869583d5b913128be54c1ff4ddd80","observation_id":"fbfb04fd-24b1-48eb-bcf3-9905f03dfbd4","resolution":{"observed_at":"2026-08-02T07:29:50.221970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:29:50.303864Z","title":"Materials science in the era of large language models: a perspective","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10020","last_updated":"2026-07-15T18:51:10Z","snapshot_observed_at":"2026-08-15T08:44:54.756971Z","submitted_at":"2026-07-10T22:46:11Z","title":"FindMyText: Robust, Scalable Detection of Text Containment in Large Web-Crawled Corpora","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-02T07:29:50.303864Z"},"links":{"citing_paper":"/paper/2607.10020"},"observation_digest":"sha256:c2b95f5ac928c3e658b6856197722d0c2e05a6c826046badaa6fa8fdd59eab33","observation_id":"b53ea92f-a1c6-4225-b2d1-378e950a2bb8","resolution":{"observed_at":"2026-08-02T07:29:50.303864Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:29:50.422257Z","title":"MatPilot: an LLM-enabled AI Materials Scientist under the Framework of Human-Machine Collaboration","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10020","last_updated":"2026-07-15T18:51:10Z","snapshot_observed_at":"2026-08-15T08:44:54.756971Z","submitted_at":"2026-07-10T22:46:11Z","title":"FindMyText: Robust, Scalable Detection of Text Containment in Large Web-Crawled Corpora","version":2},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-02T07:29:50.422257Z"},"links":{"citing_paper":"/paper/2607.10020"},"observation_digest":"sha256:3ec79a621135aaf4247d473e30e6cabf214b49924f967cb7e40fb4cf8cfcbe4b","observation_id":"6821b893-1ee8-4172-b45c-4fbfa8cc526e","resolution":{"observed_at":"2026-08-02T07:29:50.422257Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:29:50.614745Z","title":"MaScQA: investigating materials science knowledge of large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10020","last_updated":"2026-07-15T18:51:10Z","snapshot_observed_at":"2026-08-15T08:44:54.756971Z","submitted_at":"2026-07-10T22:46:11Z","title":"FindMyText: Robust, Scalable Detection of Text Containment in Large Web-Crawled Corpora","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-02T07:29:50.614745Z"},"links":{"citing_paper":"/paper/2607.10020"},"observation_digest":"sha256:e09e62f850e02f8ed1d8e1bf9b38d52b91ea31729bac39ac0e6e8516075e28ab","observation_id":"1ef80f66-a3d6-4316-b6a1-6c5d56989c2a","resolution":{"observed_at":"2026-08-02T07:29:50.614745Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:29:50.712252Z","title":"Hypothesis Generation for Materials Discovery and Design Using Goal-Driven and Constraint-Guided LLM Agents","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10020","last_updated":"2026-07-15T18:51:10Z","snapshot_observed_at":"2026-08-15T08:44:54.756971Z","submitted_at":"2026-07-10T22:46:11Z","title":"FindMyText: Robust, Scalable Detection of Text Containment in Large Web-Crawled Corpora","version":2},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-02T07:29:50.712252Z"},"links":{"citing_paper":"/paper/2607.10020"},"observation_digest":"sha256:2340595f53ea03ad7e45a6e4f0364705d3037552ce6023de363270d608cd1f9b","observation_id":"3cb5b008-b2eb-4259-9a34-8ec3d86011e7","resolution":{"observed_at":"2026-08-02T07:29:50.712252Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:29:50.763996Z","title":"Crystal structure generation with autoregressive large language modeling","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10020","last_updated":"2026-07-15T18:51:10Z","snapshot_observed_at":"2026-08-15T08:44:54.756971Z","submitted_at":"2026-07-10T22:46:11Z","title":"FindMyText: Robust, Scalable Detection of Text Containment in Large Web-Crawled Corpora","version":2},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-02T07:29:50.763996Z"},"links":{"citing_paper":"/paper/2607.10020"},"observation_digest":"sha256:3327ea2d4f422d385e3b9b0c621f2a3dceb52a61c10da909c8ba84f2befc9315","observation_id":"4c97966f-3c71-49b7-8967-205ede4f96f3","resolution":{"observed_at":"2026-08-02T07:29:50.763996Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:29:50.840252Z","title":"Leveraging large language models for predictive chemistry","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10020","last_updated":"2026-07-15T18:51:10Z","snapshot_observed_at":"2026-08-15T08:44:54.756971Z","submitted_at":"2026-07-10T22:46:11Z","title":"FindMyText: Robust, Scalable Detection of Text Containment in Large Web-Crawled Corpora","version":2},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-02T07:29:50.840252Z"},"links":{"citing_paper":"/paper/2607.10020"},"observation_digest":"sha256:fdcddcf2d7dbafa8900151700c3229c510ab54f2a6ddc4212d9d571587468e15","observation_id":"b49d04a3-c0c8-427c-96ff-fadfb342b3f6","resolution":{"observed_at":"2026-08-02T07:29:50.840252Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:29:50.954747Z","title":"From text to insight: large language models for materials science data extraction","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10020","last_updated":"2026-07-15T18:51:10Z","snapshot_observed_at":"2026-08-15T08:44:54.756971Z","submitted_at":"2026-07-10T22:46:11Z","title":"FindMyText: Robust, Scalable Detection of Text Containment in Large Web-Crawled Corpora","version":2},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-02T07:29:50.954747Z"},"links":{"citing_paper":"/paper/2607.10020"},"observation_digest":"sha256:05dca7570bd8603f4b8a6881111633f48e2d704d1ec42fa85882fef69dc62409","observation_id":"60bb8533-23dc-47a5-9fd1-dc1bfe864cda","resolution":{"observed_at":"2026-08-02T07:29:50.954747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:29:51.028719Z","title":"LLMatDesign: Autonomous Materials Discovery with Large Language Models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10020","last_updated":"2026-07-15T18:51:10Z","snapshot_observed_at":"2026-08-15T08:44:54.756971Z","submitted_at":"2026-07-10T22:46:11Z","title":"FindMyText: Robust, Scalable Detection of Text Containment in Large Web-Crawled Corpora","version":2},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-02T07:29:51.028719Z"},"links":{"citing_paper":"/paper/2607.10020"},"observation_digest":"sha256:7ad40f3040d29b79ff55b163080193b964081a957f28877ee1f33001531aab95","observation_id":"fa805cbc-7550-4197-9c7f-dfa0bc41f150","resolution":{"observed_at":"2026-08-02T07:29:51.028719Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:29:51.181184Z","title":"MatText: Do Language Models Need More than Text & Scale for Materials Modeling?","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.10020","last_updated":"2026-07-15T18:51:10Z","snapshot_observed_at":"2026-08-15T08:44:54.756971Z","submitted_at":"2026-07-10T22:46:11Z","title":"FindMyText: Robust, Scalable Detection of Text Containment in Large Web-Crawled Corpora","version":2},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-02T07:29:51.181184Z"},"links":{"citing_paper":"/paper/2607.10020"},"observation_digest":"sha256:2e2816b8bb33731fdd426ffce2fe212b7aaf534d7735c0f9cdf967b07941c674","observation_id":"020673ba-ab89-425b-9776-c1e22468a2d4","resolution":{"observed_at":"2026-08-02T07:29:51.181184Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:29:51.291502Z","title":"MechGPT, a Language-Based Strategy for Mechanics and Materials Modeling That Connects Knowledge Across Scales, Disciplines, and Modalities","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10020","last_updated":"2026-07-15T18:51:10Z","snapshot_observed_at":"2026-08-15T08:44:54.756971Z","submitted_at":"2026-07-10T22:46:11Z","title":"FindMyText: Robust, Scalable Detection of Text Containment in Large Web-Crawled Corpora","version":2},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-02T07:29:51.291502Z"},"links":{"citing_paper":"/paper/2607.10020"},"observation_digest":"sha256:1d1d94a8ef3d7c24df48d3937ec0b4faa24c9d2eb6e8890227140fa8d5c5a7cb","observation_id":"13c577ed-2e34-496b-b1d7-705ab53762f7","resolution":{"observed_at":"2026-08-02T07:29:51.291502Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:29:51.429152Z","title":"Self-Alignment with Instruction Backtranslation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10020","last_updated":"2026-07-15T18:51:10Z","snapshot_observed_at":"2026-08-15T08:44:54.756971Z","submitted_at":"2026-07-10T22:46:11Z","title":"FindMyText: Robust, Scalable Detection of Text Containment in Large Web-Crawled Corpora","version":2},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-02T07:29:51.429152Z"},"links":{"citing_paper":"/paper/2607.10020"},"observation_digest":"sha256:f22d2896e01443b324bf9a87fd733679021ff7aafd158267caf5f6ad485f1405","observation_id":"de6ae4f3-73bc-4e1c-b6fd-d12e45e74828","resolution":{"observed_at":"2026-08-02T07:29:51.429152Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:29:51.564656Z","title":"Effects of social behaviors of robots in privacy-sensitive situations","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10020","last_updated":"2026-07-15T18:51:10Z","snapshot_observed_at":"2026-08-15T08:44:54.756971Z","submitted_at":"2026-07-10T22:46:11Z","title":"FindMyText: Robust, Scalable Detection of Text Containment in Large Web-Crawled Corpora","version":2},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-02T07:29:51.564656Z"},"links":{"citing_paper":"/paper/2607.10020"},"observation_digest":"sha256:f228a9ed1c6940795ab364a73895b54a333fd349c168e4cc49146f51c3528f40","observation_id":"99569f50-e7da-4d32-a0ec-767efd0bd7e3","resolution":{"observed_at":"2026-08-02T07:29:51.564656Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:29:51.664322Z","title":"A Watermark for Large Language Models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10020","last_updated":"2026-07-15T18:51:10Z","snapshot_observed_at":"2026-08-15T08:44:54.756971Z","submitted_at":"2026-07-10T22:46:11Z","title":"FindMyText: Robust, Scalable Detection of Text Containment in Large Web-Crawled Corpora","version":2},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-02T07:29:51.664322Z"},"links":{"citing_paper":"/paper/2607.10020"},"observation_digest":"sha256:11d5e28a15db6853c9a6e7ca9f0f46cd98362129e1b92de855baad9936baf4a8","observation_id":"0a2b19a8-8cbb-420d-9d09-2a1dab977776","resolution":{"observed_at":"2026-08-02T07:29:51.664322Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:29:51.707221Z","title":"Privacy and Transparency in Human--Robot Interaction","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10020","last_updated":"2026-07-15T18:51:10Z","snapshot_observed_at":"2026-08-15T08:44:54.756971Z","submitted_at":"2026-07-10T22:46:11Z","title":"FindMyText: Robust, Scalable Detection of Text Containment in Large Web-Crawled Corpora","version":2},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-02T07:29:51.707221Z"},"links":{"citing_paper":"/paper/2607.10020"},"observation_digest":"sha256:73854f7a6fdd02503885f71e59dacd300546782af3a0b618f15db73194573be0","observation_id":"d5d896d7-1073-4092-a79e-8e36c5c9b27b","resolution":{"observed_at":"2026-08-02T07:29:51.707221Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:29:51.835162Z","title":"Consent in Crisis: The Rapid Decline of the AI Data Commons","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10020","last_updated":"2026-07-15T18:51:10Z","snapshot_observed_at":"2026-08-15T08:44:54.756971Z","submitted_at":"2026-07-10T22:46:11Z","title":"FindMyText: Robust, Scalable Detection of Text Containment in Large Web-Crawled Corpora","version":2},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-02T07:29:51.835162Z"},"links":{"citing_paper":"/paper/2607.10020"},"observation_digest":"sha256:90ea401cc30f07b5ba05d072ef5a44144d5af2aeb41239692c1a0f2ff94e8c83","observation_id":"05a97eb9-858a-4ebc-8b64-864241889547","resolution":{"observed_at":"2026-08-02T07:29:51.835162Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:29:51.906224Z","title":"Retrieval-augmented generation for natural language processing: A survey","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10020","last_updated":"2026-07-15T18:51:10Z","snapshot_observed_at":"2026-08-15T08:44:54.756971Z","submitted_at":"2026-07-10T22:46:11Z","title":"FindMyText: Robust, Scalable Detection of Text Containment in Large Web-Crawled Corpora","version":2},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-02T07:29:51.906224Z"},"links":{"citing_paper":"/paper/2607.10020"},"observation_digest":"sha256:249f36b26f38d5f20e00c24123ed573873951444ca30e55951af458350848900","observation_id":"fff298da-8dbb-42fb-b3b3-fe2bdb29f781","resolution":{"observed_at":"2026-08-02T07:29:51.906224Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:29:52.042635Z","title":"What ' s in the Box? An Analysis of Undesirable Content in the C ommon C rawl Corpus","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.10020","last_updated":"2026-07-15T18:51:10Z","snapshot_observed_at":"2026-08-15T08:44:54.756971Z","submitted_at":"2026-07-10T22:46:11Z","title":"FindMyText: Robust, Scalable Detection of Text Containment in Large Web-Crawled Corpora","version":2},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-02T07:29:52.042635Z"},"links":{"citing_paper":"/paper/2607.10020"},"observation_digest":"sha256:c9466154249a97b5ae37301465405e4b83e11d66c76ae237a6985c13b14d2ed9","observation_id":"bbfbe839-fb2d-45a9-8524-86c92a7dc2b2","resolution":{"observed_at":"2026-08-02T07:29:52.042635Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:29:52.148202Z","title":"GRUEN for Evaluating Linguistic Quality of Generated Text","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.10020","last_updated":"2026-07-15T18:51:10Z","snapshot_observed_at":"2026-08-15T08:44:54.756971Z","submitted_at":"2026-07-10T22:46:11Z","title":"FindMyText: Robust, Scalable Detection of Text Containment in Large Web-Crawled Corpora","version":2},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-02T07:29:52.148202Z"},"links":{"citing_paper":"/paper/2607.10020"},"observation_digest":"sha256:cf42a6ff14ea63cd7b7b6d9ac00d1c5e380247c8a46d3f29fede90045227a782","observation_id":"35db5ed3-c8e0-457f-b655-164c85bfc9bc","resolution":{"observed_at":"2026-08-02T07:29:52.148202Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:29:52.212935Z","title":"Survey on Factuality in Large Language Models: Knowledge, Retrieval and Domain-Specificity","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10020","last_updated":"2026-07-15T18:51:10Z","snapshot_observed_at":"2026-08-15T08:44:54.756971Z","submitted_at":"2026-07-10T22:46:11Z","title":"FindMyText: Robust, Scalable Detection of Text Containment in Large Web-Crawled Corpora","version":2},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-02T07:29:52.212935Z"},"links":{"citing_paper":"/paper/2607.10020"},"observation_digest":"sha256:429620202835f2b5b659f905efeaabe35266acdded1c1301b5bcbdf1bbc27e88","observation_id":"706b5c71-ccc9-48fb-ada2-685fa255f28a","resolution":{"observed_at":"2026-08-02T07:29:52.212935Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:29:52.303445Z","title":"PlanBench: An extensible benchmark for evaluating large language models on planning and reasoning about change","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10020","last_updated":"2026-07-15T18:51:10Z","snapshot_observed_at":"2026-08-15T08:44:54.756971Z","submitted_at":"2026-07-10T22:46:11Z","title":"FindMyText: Robust, Scalable Detection of Text Containment in Large Web-Crawled Corpora","version":2},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-02T07:29:52.303445Z"},"links":{"citing_paper":"/paper/2607.10020"},"observation_digest":"sha256:f9a2a4ae3a2e94872ae8cfd1ffa045385fd837420c4251891f228fb6240ffeb3","observation_id":"f132a0ac-93f9-473c-b7c4-656528fcf223","resolution":{"observed_at":"2026-08-02T07:29:52.303445Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:29:52.391181Z","title":"Copyright and Generative AI: Opinion of the European Copyright Society","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10020","last_updated":"2026-07-15T18:51:10Z","snapshot_observed_at":"2026-08-15T08:44:54.756971Z","submitted_at":"2026-07-10T22:46:11Z","title":"FindMyText: Robust, Scalable Detection of Text Containment in Large Web-Crawled Corpora","version":2},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-02T07:29:52.391181Z"},"links":{"citing_paper":"/paper/2607.10020"},"observation_digest":"sha256:65fbc8b615ab3502e6872aa806189aec9b58cdcb277fc6f2af4832690e7c895d","observation_id":"4c7c4612-99f0-4262-9757-5af5f0faf66b","resolution":{"observed_at":"2026-08-02T07:29:52.391181Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:29:52.492318Z","title":"Generative AI meets copyright","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10020","last_updated":"2026-07-15T18:51:10Z","snapshot_observed_at":"2026-08-15T08:44:54.756971Z","submitted_at":"2026-07-10T22:46:11Z","title":"FindMyText: Robust, Scalable Detection of Text Containment in Large Web-Crawled Corpora","version":2},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-02T07:29:52.492318Z"},"links":{"citing_paper":"/paper/2607.10020"},"observation_digest":"sha256:3d8610b51e77585f1cecd61dfd2b116a8b60e7b65fda5a5b76d730966bac973b","observation_id":"595df04d-05a2-4d7d-9d65-a86664a3d3ad","resolution":{"observed_at":"2026-08-02T07:29:52.492318Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:29:52.606410Z","title":"In search of balance: text data mining and copyright in the digital single market directive from a fundamental rights persperctive","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10020","last_updated":"2026-07-15T18:51:10Z","snapshot_observed_at":"2026-08-15T08:44:54.756971Z","submitted_at":"2026-07-10T22:46:11Z","title":"FindMyText: Robust, Scalable Detection of Text Containment in Large Web-Crawled Corpora","version":2},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-02T07:29:52.606410Z"},"links":{"citing_paper":"/paper/2607.10020"},"observation_digest":"sha256:555e6e6b4a620f768d9ee9058907bc17ac4b88ba1166f260c4608f9f8b13f678","observation_id":"a3225d92-a84d-45a4-b1ee-9ca14ac961f9","resolution":{"observed_at":"2026-08-02T07:29:52.606410Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:29:52.778636Z","title":"Copyright Traps for Large Language Models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10020","last_updated":"2026-07-15T18:51:10Z","snapshot_observed_at":"2026-08-15T08:44:54.756971Z","submitted_at":"2026-07-10T22:46:11Z","title":"FindMyText: Robust, Scalable Detection of Text Containment in Large Web-Crawled Corpora","version":2},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-02T07:29:52.778636Z"},"links":{"citing_paper":"/paper/2607.10020"},"observation_digest":"sha256:0b5ba4b963171e51d55e4e02a8446e8f877b8d79bafee65b8e5f88ecead08774","observation_id":"c187c479-1d3a-4f74-8a81-d97d8f96421e","resolution":{"observed_at":"2026-08-02T07:29:52.778636Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:29:52.869813Z","title":"The Ai-Copyright Trap","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10020","last_updated":"2026-07-15T18:51:10Z","snapshot_observed_at":"2026-08-15T08:44:54.756971Z","submitted_at":"2026-07-10T22:46:11Z","title":"FindMyText: Robust, Scalable Detection of Text Containment in Large Web-Crawled Corpora","version":2},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-02T07:29:52.869813Z"},"links":{"citing_paper":"/paper/2607.10020"},"observation_digest":"sha256:efcca3d8032139c93cf7dcf5133a193a3006a91f4be819c3e420fef786c151f2","observation_id":"e1fb8ff8-ec5d-4746-9de2-76bdfae6ef12","resolution":{"observed_at":"2026-08-02T07:29:52.869813Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:29:53.021511Z","title":"Consent and compensation: Resolving generative AI's copyright crisis essay","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10020","last_updated":"2026-07-15T18:51:10Z","snapshot_observed_at":"2026-08-15T08:44:54.756971Z","submitted_at":"2026-07-10T22:46:11Z","title":"FindMyText: Robust, Scalable Detection of Text Containment in Large Web-Crawled Corpora","version":2},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-02T07:29:53.021511Z"},"links":{"citing_paper":"/paper/2607.10020"},"observation_digest":"sha256:cafc350956dac59c26ad4b30ac54f42fd75730e02fa8c48f6ac164f75e79cd8b","observation_id":"b2686bc1-9b8f-4455-b50c-517fbbba46bb","resolution":{"observed_at":"2026-08-02T07:29:53.021511Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:29:53.108096Z","title":"We Need Smart Intellectual Property Laws for Artificial Intelligence","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10020","last_updated":"2026-07-15T18:51:10Z","snapshot_observed_at":"2026-08-15T08:44:54.756971Z","submitted_at":"2026-07-10T22:46:11Z","title":"FindMyText: Robust, Scalable Detection of Text Containment in Large Web-Crawled Corpora","version":2},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-02T07:29:53.108096Z"},"links":{"citing_paper":"/paper/2607.10020"},"observation_digest":"sha256:320073982d67519c1f3cbb34d21818e31cf6ba3c38b39f6657e3cd5124cd8139","observation_id":"2e557cf5-e25c-4f02-bc52-9610b5304f72","resolution":{"observed_at":"2026-08-02T07:29:53.108096Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:29:53.186605Z","title":"The Data That Powers A.I","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10020","last_updated":"2026-07-15T18:51:10Z","snapshot_observed_at":"2026-08-15T08:44:54.756971Z","submitted_at":"2026-07-10T22:46:11Z","title":"FindMyText: Robust, Scalable Detection of Text Containment in Large Web-Crawled Corpora","version":2},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-02T07:29:53.186605Z"},"links":{"citing_paper":"/paper/2607.10020"},"observation_digest":"sha256:9674d083e936c411c18b7871bdca93bca6269954c2ad59cb8e63d74241f43673","observation_id":"eedb569b-c0a1-4b4b-9aa0-149d823d21b2","resolution":{"observed_at":"2026-08-02T07:29:53.186605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:29:53.250306Z","title":"The State and Fate of Linguistic Diversity and Inclusion in the NLP World","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.10020","last_updated":"2026-07-15T18:51:10Z","snapshot_observed_at":"2026-08-15T08:44:54.756971Z","submitted_at":"2026-07-10T22:46:11Z","title":"FindMyText: Robust, Scalable Detection of Text Containment in Large Web-Crawled Corpora","version":2},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-02T07:29:53.250306Z"},"links":{"citing_paper":"/paper/2607.10020"},"observation_digest":"sha256:f501e589c222d42731d49e166d039faa9f08e86de688928dc111dba4f81c9b71","observation_id":"ec92b3b5-ba11-491f-b733-9183f900a7ef","resolution":{"observed_at":"2026-08-02T07:29:53.250306Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:29:53.344204Z","title":"A survey of fake news: Fundamental theories, detection methods, and opportunities","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10020","last_updated":"2026-07-15T18:51:10Z","snapshot_observed_at":"2026-08-15T08:44:54.756971Z","submitted_at":"2026-07-10T22:46:11Z","title":"FindMyText: Robust, Scalable Detection of Text Containment in Large Web-Crawled Corpora","version":2},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-02T07:29:53.344204Z"},"links":{"citing_paper":"/paper/2607.10020"},"observation_digest":"sha256:1e6d05dfea4d11a11fa5a54936b8d2e69ab021cdec035b9138e496cbfb435d71","observation_id":"274f070b-c675-4c5a-8e46-440ad68de9d0","resolution":{"observed_at":"2026-08-02T07:29:53.344204Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:29:53.429489Z","title":"On the Dangers of Stochastic Parrots: Can Language Models Be Too Big?","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.10020","last_updated":"2026-07-15T18:51:10Z","snapshot_observed_at":"2026-08-15T08:44:54.756971Z","submitted_at":"2026-07-10T22:46:11Z","title":"FindMyText: Robust, Scalable Detection of Text Containment in Large Web-Crawled Corpora","version":2},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-08-02T07:29:53.429489Z"},"links":{"citing_paper":"/paper/2607.10020"},"observation_digest":"sha256:664d0aa60657a6c09cd210f46faa6c9ebadc9333f50a10530b1a142c8e707e06","observation_id":"73b3cfdf-9324-4d3b-b825-5e03b5f104b2","resolution":{"observed_at":"2026-08-02T07:29:53.429489Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:29:53.535772Z","title":"The work of copyright law in the age of generative AI","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10020","last_updated":"2026-07-15T18:51:10Z","snapshot_observed_at":"2026-08-15T08:44:54.756971Z","submitted_at":"2026-07-10T22:46:11Z","title":"FindMyText: Robust, Scalable Detection of Text Containment in Large Web-Crawled Corpora","version":2},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-08-02T07:29:53.535772Z"},"links":{"citing_paper":"/paper/2607.10020"},"observation_digest":"sha256:585b8806f8549145729ab2f783dd9d06b10dc1cbe7ed07d451748ad7be2ac7df","observation_id":"916f9cbd-c7a8-4128-b207-92e3e13239c2","resolution":{"observed_at":"2026-08-02T07:29:53.535772Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:29:53.641735Z","title":"Copyright Violations and Large Language Models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.10020","last_updated":"2026-07-15T18:51:10Z","snapshot_observed_at":"2026-08-15T08:44:54.756971Z","submitted_at":"2026-07-10T22:46:11Z","title":"FindMyText: Robust, Scalable Detection of Text Containment in Large Web-Crawled Corpora","version":2},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-08-02T07:29:53.641735Z"},"links":{"citing_paper":"/paper/2607.10020"},"observation_digest":"sha256:c43520d53d2bfd4e82665c3c98ec577896331f4eb2e9be03b4c4d3b3867c17d1","observation_id":"262addff-2a0f-4b78-88e6-d2cb0af93e25","resolution":{"observed_at":"2026-08-02T07:29:53.641735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:29:53.866628Z","title":"Detecting Pretraining Data from Large Language Models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10020","last_updated":"2026-07-15T18:51:10Z","snapshot_observed_at":"2026-08-15T08:44:54.756971Z","submitted_at":"2026-07-10T22:46:11Z","title":"FindMyText: Robust, Scalable Detection of Text Containment in Large Web-Crawled Corpora","version":2},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-08-02T07:29:53.866628Z"},"links":{"citing_paper":"/paper/2607.10020"},"observation_digest":"sha256:91577e831f9c9057cd608eefdfe536f3f0c010943dcce58735ee2c89248d6323","observation_id":"9d61c8ca-03b9-4513-832f-17a664acd23e","resolution":{"observed_at":"2026-08-02T07:29:53.866628Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:29:53.912311Z","title":"A survey on hallucination in large language models: Principles, taxonomy, challenges, and open questions","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10020","last_updated":"2026-07-15T18:51:10Z","snapshot_observed_at":"2026-08-15T08:44:54.756971Z","submitted_at":"2026-07-10T22:46:11Z","title":"FindMyText: Robust, Scalable Detection of Text Containment in Large Web-Crawled Corpora","version":2},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-08-02T07:29:53.912311Z"},"links":{"citing_paper":"/paper/2607.10020"},"observation_digest":"sha256:da7823a63bf47ccdd5a0332f30d25b7516c1f81255d909bec62cff663a4241a9","observation_id":"318c38ce-17f2-4116-9b74-d0a05bb7837a","resolution":{"observed_at":"2026-08-02T07:29:53.912311Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:29:54.023365Z","title":"Generative AI and Author Remuneration","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10020","last_updated":"2026-07-15T18:51:10Z","snapshot_observed_at":"2026-08-15T08:44:54.756971Z","submitted_at":"2026-07-10T22:46:11Z","title":"FindMyText: Robust, Scalable Detection of Text Containment in Large Web-Crawled Corpora","version":2},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-08-02T07:29:54.023365Z"},"links":{"citing_paper":"/paper/2607.10020"},"observation_digest":"sha256:491cce620121d290228f08e30a949de5d5b859ad08dc6519ffd55ba2a12eafcf","observation_id":"2b547fb7-c4c8-43a0-b536-c37b08396057","resolution":{"observed_at":"2026-08-02T07:29:54.023365Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:29:54.111962Z","title":"From text to talk: H arnessing conversational corpora for humane and diversity-aware language technology","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.10020","last_updated":"2026-07-15T18:51:10Z","snapshot_observed_at":"2026-08-15T08:44:54.756971Z","submitted_at":"2026-07-10T22:46:11Z","title":"FindMyText: Robust, Scalable Detection of Text Containment in Large Web-Crawled Corpora","version":2},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-08-02T07:29:54.111962Z"},"links":{"citing_paper":"/paper/2607.10020"},"observation_digest":"sha256:ed216fd35525c42c1574185c74d55ae663157d34b586de656e8b7ffb88b833f2","observation_id":"2c8bf2d5-ffbb-4bad-b3d4-67a187b42f54","resolution":{"observed_at":"2026-08-02T07:29:54.111962Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:29:54.181536Z","title":"Self-Rewarding Language Models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10020","last_updated":"2026-07-15T18:51:10Z","snapshot_observed_at":"2026-08-15T08:44:54.756971Z","submitted_at":"2026-07-10T22:46:11Z","title":"FindMyText: Robust, Scalable Detection of Text Containment in Large Web-Crawled Corpora","version":2},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-08-02T07:29:54.181536Z"},"links":{"citing_paper":"/paper/2607.10020"},"observation_digest":"sha256:8315f9fd31a4837ce1bcbb2092ff23f35087651a9ea2aacf172fe9836ab19ffb","observation_id":"13797949-20d2-4fe9-b388-a06dc1b7cdb0","resolution":{"observed_at":"2026-08-02T07:29:54.181536Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:29:54.267697Z","title":"Protecting User Data Through Privacy-Sensitive Robot Design","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10020","last_updated":"2026-07-15T18:51:10Z","snapshot_observed_at":"2026-08-15T08:44:54.756971Z","submitted_at":"2026-07-10T22:46:11Z","title":"FindMyText: Robust, Scalable Detection of Text Containment in Large Web-Crawled Corpora","version":2},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-08-02T07:29:54.267697Z"},"links":{"citing_paper":"/paper/2607.10020"},"observation_digest":"sha256:84b58c1aba2e18ac6898ab6a029a2f777a3a36df6c440a6ee6a32bfc4b7c7af0","observation_id":"527f22b2-4135-44c1-b979-2f44a2d72f7a","resolution":{"observed_at":"2026-08-02T07:29:54.267697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:29:54.410623Z","title":"Privacy concerns in the smart home context","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10020","last_updated":"2026-07-15T18:51:10Z","snapshot_observed_at":"2026-08-15T08:44:54.756971Z","submitted_at":"2026-07-10T22:46:11Z","title":"FindMyText: Robust, Scalable Detection of Text Containment in Large Web-Crawled Corpora","version":2},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-08-02T07:29:54.410623Z"},"links":{"citing_paper":"/paper/2607.10020"},"observation_digest":"sha256:36193e8261f3f1fffb243c2605cd6cff37419b2afd18aaa8ea041022237c1a93","observation_id":"9191992f-46d1-4ace-9ef5-232f024bb18a","resolution":{"observed_at":"2026-08-02T07:29:54.410623Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:29:54.528848Z","title":"Evaluating current automatic de-identification methods with Veteran's health administration clinical documents","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10020","last_updated":"2026-07-15T18:51:10Z","snapshot_observed_at":"2026-08-15T08:44:54.756971Z","submitted_at":"2026-07-10T22:46:11Z","title":"FindMyText: Robust, Scalable Detection of Text Containment in Large Web-Crawled Corpora","version":2},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-08-02T07:29:54.528848Z"},"links":{"citing_paper":"/paper/2607.10020"},"observation_digest":"sha256:f5757495c382f46b008e2a5c877d5ca3bf3075bc10ec9ec1be096058be3a41aa","observation_id":"9fad8079-50ea-4229-960d-0a6bf6a3f715","resolution":{"observed_at":"2026-08-02T07:29:54.528848Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:29:54.700328Z","title":"Personalised Reranking of Paper Recommendations Using Paper Content and User Behavior","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10020","last_updated":"2026-07-15T18:51:10Z","snapshot_observed_at":"2026-08-15T08:44:54.756971Z","submitted_at":"2026-07-10T22:46:11Z","title":"FindMyText: Robust, Scalable Detection of Text Containment in Large Web-Crawled Corpora","version":2},"reference_index":84,"source":"arxiv_source","source_observed_at":"2026-08-02T07:29:54.700328Z"},"links":{"citing_paper":"/paper/2607.10020"},"observation_digest":"sha256:af9f3149928b6461b9d1dce22a4881b0d86908cab44e2c66224b6e43b74a0d77","observation_id":"80f50fc9-8d6b-4408-b1b3-28730090b029","resolution":{"observed_at":"2026-08-02T07:29:54.700328Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:29:54.767557Z","title":"Data valuation in machine learning:``ingredients'', strategies, and open challenges","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10020","last_updated":"2026-07-15T18:51:10Z","snapshot_observed_at":"2026-08-15T08:44:54.756971Z","submitted_at":"2026-07-10T22:46:11Z","title":"FindMyText: Robust, Scalable Detection of Text Containment in Large Web-Crawled Corpora","version":2},"reference_index":85,"source":"arxiv_source","source_observed_at":"2026-08-02T07:29:54.767557Z"},"links":{"citing_paper":"/paper/2607.10020"},"observation_digest":"sha256:1b600b4d5bcb3d2765a824610c62e8643727e700040d641444d56df1770e6efa","observation_id":"63c3bcdc-8b45-4463-9c59-b618a735d8ad","resolution":{"observed_at":"2026-08-02T07:29:54.767557Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:29:54.855160Z","title":"Publicly detectable watermarking for language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10020","last_updated":"2026-07-15T18:51:10Z","snapshot_observed_at":"2026-08-15T08:44:54.756971Z","submitted_at":"2026-07-10T22:46:11Z","title":"FindMyText: Robust, Scalable Detection of Text Containment in Large Web-Crawled Corpora","version":2},"reference_index":86,"source":"arxiv_source","source_observed_at":"2026-08-02T07:29:54.855160Z"},"links":{"citing_paper":"/paper/2607.10020"},"observation_digest":"sha256:a95849d399a3422815de58667261713141663aaa7bfdb0c6f4e6c6e2ce88fc67","observation_id":"4d1f1836-cb74-4a21-8cf6-bc3f12161aee","resolution":{"observed_at":"2026-08-02T07:29:54.855160Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:29:55.009143Z","title":"SMET: Semantic Mapping of CVE to ATT&CK and Its Application to Cybersecurity","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10020","last_updated":"2026-07-15T18:51:10Z","snapshot_observed_at":"2026-08-15T08:44:54.756971Z","submitted_at":"2026-07-10T22:46:11Z","title":"FindMyText: Robust, Scalable Detection of Text Containment in Large Web-Crawled Corpora","version":2},"reference_index":87,"source":"arxiv_source","source_observed_at":"2026-08-02T07:29:55.009143Z"},"links":{"citing_paper":"/paper/2607.10020"},"observation_digest":"sha256:ffdb76aeb965476965f015e87f8920c84a8f8da491416b63d8d2b0f0fc1701d4","observation_id":"eda521bd-a75b-48b7-b376-5dd2e4b3f795","resolution":{"observed_at":"2026-08-02T07:29:55.009143Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:29:55.120507Z","title":"A hybrid approach to dialogue management based on probabilistic rules","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2607.10020","last_updated":"2026-07-15T18:51:10Z","snapshot_observed_at":"2026-08-15T08:44:54.756971Z","submitted_at":"2026-07-10T22:46:11Z","title":"FindMyText: Robust, Scalable Detection of Text Containment in Large Web-Crawled Corpora","version":2},"reference_index":88,"source":"arxiv_source","source_observed_at":"2026-08-02T07:29:55.120507Z"},"links":{"citing_paper":"/paper/2607.10020"},"observation_digest":"sha256:6eb856f207d69f88ff3ee3448e9ffc284400ae06c91490c5cf6acef4667b09c9","observation_id":"8de3ea6d-8174-4996-8ac5-e25086e948a5","resolution":{"observed_at":"2026-08-02T07:29:55.120507Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:29:55.299546Z","title":"Situated dialogue processing for human-robot interaction","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10020","last_updated":"2026-07-15T18:51:10Z","snapshot_observed_at":"2026-08-15T08:44:54.756971Z","submitted_at":"2026-07-10T22:46:11Z","title":"FindMyText: Robust, Scalable Detection of Text Containment in Large Web-Crawled Corpora","version":2},"reference_index":89,"source":"arxiv_source","source_observed_at":"2026-08-02T07:29:55.299546Z"},"links":{"citing_paper":"/paper/2607.10020"},"observation_digest":"sha256:1d5e0ec7d9a72d65ce55e9362a7dd11ffcef5295de211b7b7ab9dae6694276aa","observation_id":"1d038a91-7a28-497a-a812-a9812d2de99e","resolution":{"observed_at":"2026-08-02T07:29:55.299546Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:29:55.378175Z","title":"Self-understanding and self-extension: A systems and representational approach","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2607.10020","last_updated":"2026-07-15T18:51:10Z","snapshot_observed_at":"2026-08-15T08:44:54.756971Z","submitted_at":"2026-07-10T22:46:11Z","title":"FindMyText: Robust, Scalable Detection of Text Containment in Large Web-Crawled Corpora","version":2},"reference_index":90,"source":"arxiv_source","source_observed_at":"2026-08-02T07:29:55.378175Z"},"links":{"citing_paper":"/paper/2607.10020"},"observation_digest":"sha256:4d95d35defbe7d5e84587d5684ceb3eaf115e6cb278c13a581cad6e8c0ec31ff","observation_id":"339777e6-2311-4bcb-9154-93b882771d70","resolution":{"observed_at":"2026-08-02T07:29:55.378175Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:29:55.449621Z","title":"Spoken dialogue systems: the new frontier in human-computer interaction","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10020","last_updated":"2026-07-15T18:51:10Z","snapshot_observed_at":"2026-08-15T08:44:54.756971Z","submitted_at":"2026-07-10T22:46:11Z","title":"FindMyText: Robust, Scalable Detection of Text Containment in Large Web-Crawled Corpora","version":2},"reference_index":91,"source":"arxiv_source","source_observed_at":"2026-08-02T07:29:55.449621Z"},"links":{"citing_paper":"/paper/2607.10020"},"observation_digest":"sha256:eb15858f0b2d096ad6605a06ea122980572edd3d0be1bc4e096ad03668de5f45","observation_id":"ea81ae36-b6c4-4622-bca7-04448269e9cb","resolution":{"observed_at":"2026-08-02T07:29:55.449621Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:29:55.576661Z","title":"Automatic turn segmentation for Movie & TV subtitles","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.10020","last_updated":"2026-07-15T18:51:10Z","snapshot_observed_at":"2026-08-15T08:44:54.756971Z","submitted_at":"2026-07-10T22:46:11Z","title":"FindMyText: Robust, Scalable Detection of Text Containment in Large Web-Crawled Corpora","version":2},"reference_index":92,"source":"arxiv_source","source_observed_at":"2026-08-02T07:29:55.576661Z"},"links":{"citing_paper":"/paper/2607.10020"},"observation_digest":"sha256:45696a016cd3a7a70fdbf4bd3767286373568d1aefc01782b988002329e37e92","observation_id":"9fb8c6eb-0297-49ba-9101-7adefde8944e","resolution":{"observed_at":"2026-08-02T07:29:55.576661Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:29:55.748405Z","title":"PyOpenDial: A python-based domain-independent toolkit for developing spoken dialogue systems with probabilistic rules","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.10020","last_updated":"2026-07-15T18:51:10Z","snapshot_observed_at":"2026-08-15T08:44:54.756971Z","submitted_at":"2026-07-10T22:46:11Z","title":"FindMyText: Robust, Scalable Detection of Text Containment in Large Web-Crawled Corpora","version":2},"reference_index":93,"source":"arxiv_source","source_observed_at":"2026-08-02T07:29:55.748405Z"},"links":{"citing_paper":"/paper/2607.10020"},"observation_digest":"sha256:975d4dcc68abbb6df4808e8c6cd37218d6b7ba5e8de75a8144782388a0466a86","observation_id":"827a21ef-60ab-4896-80ff-5ac8e0423b84","resolution":{"observed_at":"2026-08-02T07:29:55.748405Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:29:55.858074Z","title":"A salience-driven approach to speech recognition for human-robot interaction","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10020","last_updated":"2026-07-15T18:51:10Z","snapshot_observed_at":"2026-08-15T08:44:54.756971Z","submitted_at":"2026-07-10T22:46:11Z","title":"FindMyText: Robust, Scalable Detection of Text Containment in Large Web-Crawled Corpora","version":2},"reference_index":94,"source":"arxiv_source","source_observed_at":"2026-08-02T07:29:55.858074Z"},"links":{"citing_paper":"/paper/2607.10020"},"observation_digest":"sha256:0d593b573107bcf0c3c583b7b0c9105ad1c4136e7f9019efbb086f26862682ea","observation_id":"eef6514e-9424-4b8a-86bf-b4ba895538d3","resolution":{"observed_at":"2026-08-02T07:29:55.858074Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:29:55.916147Z","title":"Towards online planning for dialogue management with rich domain knowledge","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10020","last_updated":"2026-07-15T18:51:10Z","snapshot_observed_at":"2026-08-15T08:44:54.756971Z","submitted_at":"2026-07-10T22:46:11Z","title":"FindMyText: Robust, Scalable Detection of Text Containment in Large Web-Crawled Corpora","version":2},"reference_index":95,"source":"arxiv_source","source_observed_at":"2026-08-02T07:29:55.916147Z"},"links":{"citing_paper":"/paper/2607.10020"},"observation_digest":"sha256:0f8529be11c85dd131bcb8575e622c4ac93d8c5d3d60b0329ed7fb46951bebc3","observation_id":"bb368d16-bfe7-4245-8f56-7f38329c3e98","resolution":{"observed_at":"2026-08-02T07:29:55.916147Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:29:55.980932Z","title":"Should we use movie subtitles to study linguistic patterns of conversational speech? A study based on French, English and Taiwan Mandarin","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10020","last_updated":"2026-07-15T18:51:10Z","snapshot_observed_at":"2026-08-15T08:44:54.756971Z","submitted_at":"2026-07-10T22:46:11Z","title":"FindMyText: Robust, Scalable Detection of Text Containment in Large Web-Crawled Corpora","version":2},"reference_index":96,"source":"arxiv_source","source_observed_at":"2026-08-02T07:29:55.980932Z"},"links":{"citing_paper":"/paper/2607.10020"},"observation_digest":"sha256:e66274ff399084c9900b3e2c66223524a89679ce1a4abb10ab50c8de252901b9","observation_id":"7aea4570-f670-4b61-b77a-68152d042831","resolution":{"observed_at":"2026-08-02T07:29:55.980932Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.14312","last_updated":"2023-10-22T14:17:27Z","snapshot_observed_at":"2026-08-16T14:50:01.732886Z","submitted_at":"2023-10-22T14:17:27Z","title":"Neural Text Sanitization with Privacy Risk Indicators: An Empirical Analysis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.14312","snapshot_observed_at":"2026-08-02T07:29:56.119688Z","title":"Neural Text Sanitization with Privacy Risk Indicators: An Empirical Analysis","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10020","last_updated":"2026-07-15T18:51:10Z","snapshot_observed_at":"2026-08-15T08:44:54.756971Z","submitted_at":"2026-07-10T22:46:11Z","title":"FindMyText: Robust, Scalable Detection of Text Containment in Large Web-Crawled Corpora","version":2},"reference_index":97,"source":"arxiv_source","source_observed_at":"2026-08-02T07:29:56.119688Z"},"links":{"cited_paper":"/paper/2310.14312","citing_paper":"/paper/2607.10020"},"observation_digest":"sha256:56330bd7d38e11fb9aa966d1daaedf25db76ca63ffbe2b42258b33c756d0f4de","observation_id":"1acbe4a8-6bc2-402d-8ad3-d2bc8eb1ebea","resolution":{"observed_at":"2026-08-02T07:29:56.119688Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:29:56.230001Z","title":"Identifying Token-Level Dialectal Features in Social Media","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10020","last_updated":"2026-07-15T18:51:10Z","snapshot_observed_at":"2026-08-15T08:44:54.756971Z","submitted_at":"2026-07-10T22:46:11Z","title":"FindMyText: Robust, Scalable Detection of Text Containment in Large Web-Crawled Corpora","version":2},"reference_index":98,"source":"arxiv_source","source_observed_at":"2026-08-02T07:29:56.230001Z"},"links":{"citing_paper":"/paper/2607.10020"},"observation_digest":"sha256:662a158e444a60a5ef705cc0d16de59d2961438653e2c46f62a18974790b7945","observation_id":"2786ed16-1230-4457-8e47-98a1f1cc9289","resolution":{"observed_at":"2026-08-02T07:29:56.230001Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:29:56.371059Z","title":"Who's in charge? Roles and responsibilities of decision-making components in conversational robots","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.10020","last_updated":"2026-07-15T18:51:10Z","snapshot_observed_at":"2026-08-15T08:44:54.756971Z","submitted_at":"2026-07-10T22:46:11Z","title":"FindMyText: Robust, Scalable Detection of Text Containment in Large Web-Crawled Corpora","version":2},"reference_index":99,"source":"arxiv_source","source_observed_at":"2026-08-02T07:29:56.371059Z"},"links":{"citing_paper":"/paper/2607.10020"},"observation_digest":"sha256:feae8c43d1f9f2cc7ca5e14e1fddb56f7d89556b14ec6651c4120f2c092011c3","observation_id":"6bb36b7e-580e-4bd5-a545-5faf9397ee66","resolution":{"observed_at":"2026-08-02T07:29:56.371059Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:29:56.492934Z","title":"PLMmark: A Secure and Robust Black-Box Watermarking Framework for Pre-trained Language Models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10020","last_updated":"2026-07-15T18:51:10Z","snapshot_observed_at":"2026-08-15T08:44:54.756971Z","submitted_at":"2026-07-10T22:46:11Z","title":"FindMyText: Robust, Scalable Detection of Text Containment in Large Web-Crawled Corpora","version":2},"reference_index":100,"source":"arxiv_source","source_observed_at":"2026-08-02T07:29:56.492934Z"},"links":{"citing_paper":"/paper/2607.10020"},"observation_digest":"sha256:ef2797f03c3db03292f1179a9203704ea35187a19f991ae4dbfa86acc46e2050","observation_id":"8dd9afa0-04b8-43eb-afbc-a9eed6584eba","resolution":{"observed_at":"2026-08-02T07:29:56.492934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:29:56.617980Z","title":"Three Bricks to Consolidate Watermarks for Large Language Models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.10020","last_updated":"2026-07-15T18:51:10Z","snapshot_observed_at":"2026-08-15T08:44:54.756971Z","submitted_at":"2026-07-10T22:46:11Z","title":"FindMyText: Robust, Scalable Detection of Text Containment in Large Web-Crawled Corpora","version":2},"reference_index":101,"source":"arxiv_source","source_observed_at":"2026-08-02T07:29:56.617980Z"},"links":{"citing_paper":"/paper/2607.10020"},"observation_digest":"sha256:a6ae749d12807135eae0bcaf336cdd416fc4aeebf9b474a4ccba81c1a391fc76","observation_id":"4bb78c31-3a0b-41ca-85b3-7a113e5b71b0","resolution":{"observed_at":"2026-08-02T07:29:56.617980Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.10020","last_updated":"2026-07-15T18:51:10Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-15T08:44:54.756971Z","submitted_at":"2026-07-10T22:46:11Z","title":"FindMyText: Robust, Scalable Detection of Text Containment in Large Web-Crawled Corpora"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":99,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":299},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 100 of 299 outbound references and 0 inbound Pith citation observations for arXiv:2607.10020."}