{"as_of":"2026-08-18T12:16:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e0661d710d840b7846fec57484987f3e0fad163d2a35081a3767da6feebc5ec4","coverage":[{"denominator":70,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":70,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T14:42:31.580341Z","state":"measured"},{"denominator":70,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":70,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2508.21004/citation-record","integrity":"/paper/2508.21004/integrity","json":"/paper/2508.21004/citation-record.json","paper":"/paper/2508.21004"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2402.19334","last_updated":"2024-06-03T16:19:03Z","snapshot_observed_at":"2026-08-16T14:14:03.850389Z","submitted_at":"2024-02-29T16:37:08Z","title":"Here's a Free Lunch: Sanitizing Backdoored Models with Model Merge","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.19334","snapshot_observed_at":"2026-08-05T14:42:31.364363Z","title":"Here’s a free lunch: Sanitizing backdoored models with model merge","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.21004","last_updated":"2025-08-28T17:05:18Z","snapshot_observed_at":"2026-08-14T02:54:54.073813Z","submitted_at":"2025-08-28T17:05:18Z","title":"Lethe: Purifying Backdoored Large Language Models with Knowledge Dilution","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-05T14:42:31.364363Z"},"links":{"cited_paper":"/paper/2402.19334","citing_paper":"/paper/2508.21004"},"observation_digest":"sha256:4fbcbe4f7ada1a4cbd6c9d0b24e4a86be8aae8355e1c702a04f4e4fa870b2dbf","observation_id":"a0a5d895-d301-4c74-886d-c40632fdf25c","resolution":{"observed_at":"2026-08-05T14:42:31.364363Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:42:32.383052Z","title":"How to backdoor federated learning","venue":null,"work_id":"612b8f39-2b35-4357-8077-2fb8ea02c920","year":2020},"citing_paper":{"arxiv_id":"2508.21004","last_updated":"2025-08-28T17:05:18Z","snapshot_observed_at":"2026-08-14T02:54:54.073813Z","submitted_at":"2025-08-28T17:05:18Z","title":"Lethe: Purifying Backdoored Large Language Models with Knowledge Dilution","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-05T14:42:31.368634Z"},"links":{"citing_paper":"/paper/2508.21004"},"observation_digest":"sha256:32840f081e399bc662480076c9e64c8a9a7f52749508c84084706f62c934de56","observation_id":"c5811157-051e-4fe1-9ea9-f33955ee1f64","resolution":{"observed_at":"2026-08-05T14:42:32.386381Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.05862","last_updated":"2022-04-12T15:02:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-12T15:02:38Z","title":"Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.05862","snapshot_observed_at":"2026-08-05T14:42:31.372096Z","title":"Training a helpful and harmless assistant with reinforce- ment learning from human feedback","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.21004","last_updated":"2025-08-28T17:05:18Z","snapshot_observed_at":"2026-08-14T02:54:54.073813Z","submitted_at":"2025-08-28T17:05:18Z","title":"Lethe: Purifying Backdoored Large Language Models with Knowledge Dilution","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-05T14:42:31.372096Z"},"links":{"cited_paper":"/paper/2204.05862","citing_paper":"/paper/2508.21004"},"observation_digest":"sha256:ffb2da73328da4ce73e5d1954dc11b36e017c4c66636b4ca0167c0910d54932c","observation_id":"d96958ec-2210-461b-9389-96461161e00e","resolution":{"observed_at":"2026-08-05T14:42:31.372096Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03374","last_updated":"2021-07-14T17:16:02Z","snapshot_observed_at":"2026-08-08T11:58:24.516369Z","submitted_at":"2021-07-07T17:41:24Z","title":"Evaluating Large Language Models Trained on Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.03374","snapshot_observed_at":"2026-08-05T14:42:31.376514Z","title":"Evaluating large language models trained on code","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.21004","last_updated":"2025-08-28T17:05:18Z","snapshot_observed_at":"2026-08-14T02:54:54.073813Z","submitted_at":"2025-08-28T17:05:18Z","title":"Lethe: Purifying Backdoored Large Language Models with Knowledge Dilution","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-05T14:42:31.376514Z"},"links":{"cited_paper":"/paper/2107.03374","citing_paper":"/paper/2508.21004"},"observation_digest":"sha256:869b0d030cc2e03428ec80027227c3cb7dece93783ca265722020ab110850929","observation_id":"dad8bf1a-ed63-4728-b820-5001d9322427","resolution":{"observed_at":"2026-08-05T14:42:31.376514Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:42:32.373053Z","title":"Backdoor attacks and coun- termeasures in natural language processing models: A comprehensive security review","venue":null,"work_id":"f0afdbdb-83c9-4c10-bddb-241e0849044d","year":2025},"citing_paper":{"arxiv_id":"2508.21004","last_updated":"2025-08-28T17:05:18Z","snapshot_observed_at":"2026-08-14T02:54:54.073813Z","submitted_at":"2025-08-28T17:05:18Z","title":"Lethe: Purifying Backdoored Large Language Models with Knowledge Dilution","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-05T14:42:31.380182Z"},"links":{"citing_paper":"/paper/2508.21004"},"observation_digest":"sha256:8eb281bf1d9b911dfa9e34a53ca111ccedc41c9371b29b5b02b9d447ee5fa486","observation_id":"bfe74251-2c9b-4027-b210-a1a5df4ce454","resolution":{"observed_at":"2026-08-05T14:42:32.377285Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2007.10760","last_updated":"2020-08-02T08:38:25Z","snapshot_observed_at":"2026-08-14T12:42:44.861746Z","submitted_at":"2020-07-21T12:49:12Z","title":"Backdoor Attacks and Countermeasures on Deep Learning: A Comprehensive Review","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2007.10760","snapshot_observed_at":"2026-08-05T14:42:31.383618Z","title":"Backdoor attacks and countermeasures on deep learning: A comprehensive review","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2508.21004","last_updated":"2025-08-28T17:05:18Z","snapshot_observed_at":"2026-08-14T02:54:54.073813Z","submitted_at":"2025-08-28T17:05:18Z","title":"Lethe: Purifying Backdoored Large Language Models with Knowledge Dilution","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T14:42:31.383618Z"},"links":{"cited_paper":"/paper/2007.10760","citing_paper":"/paper/2508.21004"},"observation_digest":"sha256:56f61a2d90742334eb62ca789346b4fde5ba6ae08856cc20d50bbf288dcfead5","observation_id":"3bf82dd6-96ae-4695-b69d-5ff9894baa90","resolution":{"observed_at":"2026-08-05T14:42:31.383618Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.13257","last_updated":"2025-01-09T22:21:56Z","snapshot_observed_at":"2026-08-17T18:27:55.545560Z","submitted_at":"2024-03-20T02:38:01Z","title":"Arcee's MergeKit: A Toolkit for Merging Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.13257","snapshot_observed_at":"2026-08-05T14:42:31.387903Z","title":"Arcee’s mergekit: A toolkit for merging large language mod- els","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.21004","last_updated":"2025-08-28T17:05:18Z","snapshot_observed_at":"2026-08-14T02:54:54.073813Z","submitted_at":"2025-08-28T17:05:18Z","title":"Lethe: Purifying Backdoored Large Language Models with Knowledge Dilution","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-05T14:42:31.387903Z"},"links":{"cited_paper":"/paper/2403.13257","citing_paper":"/paper/2508.21004"},"observation_digest":"sha256:2b40b2f47b88162a8d0c07e0000c0c07766dee2621f0a74fe379027276ec0d60","observation_id":"8aa7dde6-4bfb-4860-bd96-e88ddc227d69","resolution":{"observed_at":"2026-08-05T14:42:31.387903Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:42:32.363121Z","title":"Defense-resistant backdoor attacks against deep neural networks in outsourced cloud environment","venue":null,"work_id":"66f8cae8-dee0-49a1-90b2-41edb41a0cdb","year":2021},"citing_paper":{"arxiv_id":"2508.21004","last_updated":"2025-08-28T17:05:18Z","snapshot_observed_at":"2026-08-14T02:54:54.073813Z","submitted_at":"2025-08-28T17:05:18Z","title":"Lethe: Purifying Backdoored Large Language Models with Knowledge Dilution","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-05T14:42:31.391436Z"},"links":{"citing_paper":"/paper/2508.21004"},"observation_digest":"sha256:473d5f55bf3cc0de64ab6f87fb02ddb3d77450a45ccaaa79302bd04ea193d377","observation_id":"ba410568-ab14-4ac7-82c5-2cfbc8b0f022","resolution":{"observed_at":"2026-08-05T14:42:32.367132Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:42:32.353261Z","title":"Redeem myself: Purifying backdoors in deep learning models using self attention distillation","venue":null,"work_id":"c56d5f27-84bb-4bdb-8864-cab9e4f0e2e7","year":2023},"citing_paper":{"arxiv_id":"2508.21004","last_updated":"2025-08-28T17:05:18Z","snapshot_observed_at":"2026-08-14T02:54:54.073813Z","submitted_at":"2025-08-28T17:05:18Z","title":"Lethe: Purifying Backdoored Large Language Models with Knowledge Dilution","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-05T14:42:31.394531Z"},"links":{"citing_paper":"/paper/2508.21004"},"observation_digest":"sha256:66be961f71e71133f0c159181c48d1094ed6c809934df988b98b9f8dd4510b7a","observation_id":"760e78b0-82b2-4f4f-aa8a-187b83f41cd7","resolution":{"observed_at":"2026-08-05T14:42:32.356699Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-15T12:33:55.451951Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-05T14:42:31.397826Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.21004","last_updated":"2025-08-28T17:05:18Z","snapshot_observed_at":"2026-08-14T02:54:54.073813Z","submitted_at":"2025-08-28T17:05:18Z","title":"Lethe: Purifying Backdoored Large Language Models with Knowledge Dilution","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T14:42:31.397826Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2508.21004"},"observation_digest":"sha256:bbcdc54c1e7472038f527542e497eaef380cf7301bfd9a8c996e220954c47f56","observation_id":"98c8c21b-383a-45e0-8c63-4396c1c25704","resolution":{"observed_at":"2026-08-05T14:42:31.397826Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02406","last_updated":"2024-04-03T02:16:53Z","snapshot_observed_at":"2026-08-16T22:55:23.523649Z","submitted_at":"2024-04-03T02:16:53Z","title":"Exploring Backdoor Vulnerabilities of Chat Models","version":1},"cited_work":{"arxiv_id":"2404.02406","doi":null,"metadata_source":"pith","pith_arxiv_id":"2404.02406","snapshot_observed_at":"2026-08-05T14:42:31.990587Z","title":"Exploring Backdoor Vulnerabilities of Chat Models","venue":"cs.CR","work_id":"b45c52ff-9d48-46dc-b477-c0779daae18b","year":2024},"citing_paper":{"arxiv_id":"2508.21004","last_updated":"2025-08-28T17:05:18Z","snapshot_observed_at":"2026-08-14T02:54:54.073813Z","submitted_at":"2025-08-28T17:05:18Z","title":"Lethe: Purifying Backdoored Large Language Models with Knowledge Dilution","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T14:42:31.401901Z"},"links":{"cited_paper":"/paper/2404.02406","citing_paper":"/paper/2508.21004"},"observation_digest":"sha256:9a3bf306261662febf9ce65f10e8626307b5d8e30847c253d65ed2b14b9cd8f0","observation_id":"86752fb4-e2b1-4eef-96c7-5cacb05e0185","resolution":{"observed_at":"2026-08-05T14:42:31.994313Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.04690","last_updated":"2022-11-15T09:57:23Z","snapshot_observed_at":"2026-08-17T08:58:43.844029Z","submitted_at":"2021-06-08T20:58:23Z","title":"Handcrafted Backdoors in Deep Neural Networks","version":2},"cited_work":{"arxiv_id":"2106.04690","doi":null,"metadata_source":"pith","pith_arxiv_id":"2106.04690","snapshot_observed_at":"2026-08-05T14:42:31.978802Z","title":"Handcrafted Backdoors in Deep Neural Networks","venue":"cs.CR","work_id":"5675c3fc-8c2c-452c-9ba9-ea7918d364e2","year":2021},"citing_paper":{"arxiv_id":"2508.21004","last_updated":"2025-08-28T17:05:18Z","snapshot_observed_at":"2026-08-14T02:54:54.073813Z","submitted_at":"2025-08-28T17:05:18Z","title":"Lethe: Purifying Backdoored Large Language Models with Knowledge Dilution","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-05T14:42:31.405190Z"},"links":{"cited_paper":"/paper/2106.04690","citing_paper":"/paper/2508.21004"},"observation_digest":"sha256:421aba6593ed92165f1d2d1de6f2fd4ad404a358ef619349c8e4c9525554b51f","observation_id":"b57f3095-a490-4e6a-9aa9-d7567f752f36","resolution":{"observed_at":"2026-08-05T14:42:31.982234Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-17T18:04:53.578114Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-05T14:42:31.408645Z","title":"Lora: Low-rank adaptation of large language models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.21004","last_updated":"2025-08-28T17:05:18Z","snapshot_observed_at":"2026-08-14T02:54:54.073813Z","submitted_at":"2025-08-28T17:05:18Z","title":"Lethe: Purifying Backdoored Large Language Models with Knowledge Dilution","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-05T14:42:31.408645Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2508.21004"},"observation_digest":"sha256:00e0d6133da8fa5c449d98ceb5bbea150c07c6ddf03d0bf25e4b9cf27c412aa3","observation_id":"ed51ec82-d691-4b83-a3bc-9eacd219e75b","resolution":{"observed_at":"2026-08-05T14:42:31.408645Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.07676","last_updated":"2024-03-30T16:09:34Z","snapshot_observed_at":"2026-08-16T23:34:04.412083Z","submitted_at":"2023-10-11T17:21:03Z","title":"Composite Backdoor Attacks Against Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.07676","snapshot_observed_at":"2026-08-05T14:42:31.411783Z","title":"Composite backdoor at- tacks against large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.21004","last_updated":"2025-08-28T17:05:18Z","snapshot_observed_at":"2026-08-14T02:54:54.073813Z","submitted_at":"2025-08-28T17:05:18Z","title":"Lethe: Purifying Backdoored Large Language Models with Knowledge Dilution","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-05T14:42:31.411783Z"},"links":{"cited_paper":"/paper/2310.07676","citing_paper":"/paper/2508.21004"},"observation_digest":"sha256:149419f10f2d7452e8d170027c73657f9b3f97caf323968af4cef99d3b42b7fa","observation_id":"a825e185-76da-4ed5-a184-b976771b1aae","resolution":{"observed_at":"2026-08-05T14:42:31.411783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.05566","last_updated":"2024-01-17T20:26:01Z","snapshot_observed_at":"2026-08-15T14:10:05.296241Z","submitted_at":"2024-01-10T22:14:35Z","title":"Sleeper Agents: Training Deceptive LLMs that Persist Through Safety Training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.05566","snapshot_observed_at":"2026-08-05T14:42:31.415328Z","title":"Sleeper agents: Training deceptive LLMs that persist through safety training","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.21004","last_updated":"2025-08-28T17:05:18Z","snapshot_observed_at":"2026-08-14T02:54:54.073813Z","submitted_at":"2025-08-28T17:05:18Z","title":"Lethe: Purifying Backdoored Large Language Models with Knowledge Dilution","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-05T14:42:31.415328Z"},"links":{"cited_paper":"/paper/2401.05566","citing_paper":"/paper/2508.21004"},"observation_digest":"sha256:fbf5bb895acee5dc1fcf7bed5e234d5525b0deb25a5a486b7b42040a704190e2","observation_id":"98a517cc-c1bb-43c6-9687-638b11835ac7","resolution":{"observed_at":"2026-08-05T14:42:31.415328Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.04089","last_updated":"2023-03-31T15:27:01Z","snapshot_observed_at":"2026-08-13T03:27:01.609831Z","submitted_at":"2022-12-08T05:50:53Z","title":"Editing Models with Task Arithmetic","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.04089","snapshot_observed_at":"2026-08-05T14:42:31.418317Z","title":"Editing models with task arithmetic","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.21004","last_updated":"2025-08-28T17:05:18Z","snapshot_observed_at":"2026-08-14T02:54:54.073813Z","submitted_at":"2025-08-28T17:05:18Z","title":"Lethe: Purifying Backdoored Large Language Models with Knowledge Dilution","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-05T14:42:31.418317Z"},"links":{"cited_paper":"/paper/2212.04089","citing_paper":"/paper/2508.21004"},"observation_digest":"sha256:2679e12363334d729cca68d5f62c52c735180f07e11aa6349ffdb51e83e14bde","observation_id":"8c267720-eef9-4c24-ad4e-bd60def996a6","resolution":{"observed_at":"2026-08-05T14:42:31.418317Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:42:32.343747Z","title":"Chatgpt for good? On opportunities and challenges of large language models for education","venue":null,"work_id":"c6a8d222-5f92-44e7-9a35-3284e39a6c1c","year":2023},"citing_paper":{"arxiv_id":"2508.21004","last_updated":"2025-08-28T17:05:18Z","snapshot_observed_at":"2026-08-14T02:54:54.073813Z","submitted_at":"2025-08-28T17:05:18Z","title":"Lethe: Purifying Backdoored Large Language Models with Knowledge Dilution","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-05T14:42:31.421550Z"},"links":{"citing_paper":"/paper/2508.21004"},"observation_digest":"sha256:f10281cc96987dfb6486a63d11024eb55fa42e07175260ffa37631f9e7869968","observation_id":"79033d8d-3c5a-4c77-9892-0f9d7bbb0aaa","resolution":{"observed_at":"2026-08-05T14:42:32.347320Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:42:31.424498Z","title":"Fast inference from transformers via speculative decoding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.21004","last_updated":"2025-08-28T17:05:18Z","snapshot_observed_at":"2026-08-14T02:54:54.073813Z","submitted_at":"2025-08-28T17:05:18Z","title":"Lethe: Purifying Backdoored Large Language Models with Knowledge Dilution","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-05T14:42:31.424498Z"},"links":{"citing_paper":"/paper/2508.21004"},"observation_digest":"sha256:cb5845d584bc7fae215f2cc5397b50503401210c41bca406f8836ff133c8e5f8","observation_id":"dcd67056-6a5a-48ab-af8d-b7dc016a58ad","resolution":{"observed_at":"2026-08-05T14:42:31.424498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.13888","last_updated":"2021-08-31T14:47:37Z","snapshot_observed_at":"2026-08-17T00:17:56.372140Z","submitted_at":"2021-08-31T14:47:37Z","title":"Backdoor Attacks on Pre-trained Models by Layerwise Weight Poisoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.13888","snapshot_observed_at":"2026-08-05T14:42:31.427248Z","title":"Backdoor attacks on pre- trained models by layerwise weight poisoning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.21004","last_updated":"2025-08-28T17:05:18Z","snapshot_observed_at":"2026-08-14T02:54:54.073813Z","submitted_at":"2025-08-28T17:05:18Z","title":"Lethe: Purifying Backdoored Large Language Models with Knowledge Dilution","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-05T14:42:31.427248Z"},"links":{"cited_paper":"/paper/2108.13888","citing_paper":"/paper/2508.21004"},"observation_digest":"sha256:702a923f5045da486dedf5b8f9726dd860f8da11d5da8bdf3be6268cb763f348","observation_id":"16f98be6-3927-4e38-86e2-ce47f1e565ff","resolution":{"observed_at":"2026-08-05T14:42:31.427248Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:42:31.430104Z","title":"Chain-of-scrutiny: Detecting backdoor 15 attacks for large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.21004","last_updated":"2025-08-28T17:05:18Z","snapshot_observed_at":"2026-08-14T02:54:54.073813Z","submitted_at":"2025-08-28T17:05:18Z","title":"Lethe: Purifying Backdoored Large Language Models with Knowledge Dilution","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-05T14:42:31.430104Z"},"links":{"citing_paper":"/paper/2508.21004"},"observation_digest":"sha256:db138d861a65281082c0d26c382b1238db1784f6c33a406585967543430b68a3","observation_id":"5bd34cf6-b537-42ca-9290-cb484ca80d23","resolution":{"observed_at":"2026-08-05T14:42:31.430104Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.13355","last_updated":"2024-03-20T07:34:18Z","snapshot_observed_at":"2026-08-17T02:54:47.632085Z","submitted_at":"2024-03-20T07:34:18Z","title":"BadEdit: Backdooring large language models by model editing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.13355","snapshot_observed_at":"2026-08-05T14:42:31.432721Z","title":"Badedit: Backdooring large language mod- els by model editing","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.21004","last_updated":"2025-08-28T17:05:18Z","snapshot_observed_at":"2026-08-14T02:54:54.073813Z","submitted_at":"2025-08-28T17:05:18Z","title":"Lethe: Purifying Backdoored Large Language Models with Knowledge Dilution","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-05T14:42:31.432721Z"},"links":{"cited_paper":"/paper/2403.13355","citing_paper":"/paper/2508.21004"},"observation_digest":"sha256:aca1d964bf400213e6e180226109bc838cd3cbbd1ed1ae78350537cc21d156dc","observation_id":"96acead6-99a4-4235-83b9-d97f02eb7c00","resolution":{"observed_at":"2026-08-05T14:42:31.432721Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.08350","last_updated":"2023-06-14T08:38:51Z","snapshot_observed_at":"2026-08-16T15:24:02.618589Z","submitted_at":"2023-06-14T08:38:51Z","title":"Multi-target Backdoor Attacks for Code Pre-trained Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.08350","snapshot_observed_at":"2026-08-05T14:42:31.435614Z","title":"Multi-target backdoor attacks for code pre-trained models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.21004","last_updated":"2025-08-28T17:05:18Z","snapshot_observed_at":"2026-08-14T02:54:54.073813Z","submitted_at":"2025-08-28T17:05:18Z","title":"Lethe: Purifying Backdoored Large Language Models with Knowledge Dilution","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-05T14:42:31.435614Z"},"links":{"cited_paper":"/paper/2306.08350","citing_paper":"/paper/2508.21004"},"observation_digest":"sha256:3140e1e2a082c33ec65c5d6d83c4375c2db96bdb41f7158f095a6aeea02534df","observation_id":"b5012e99-a571-485f-9ab2-bbf7774931db","resolution":{"observed_at":"2026-08-05T14:42:31.435614Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:42:32.327769Z","title":"Neural attention distillation: Erasing backdoor triggers from deep neural networks","venue":null,"work_id":"f82d1aa2-abe8-456c-87d1-fe415865c440","year":2021},"citing_paper":{"arxiv_id":"2508.21004","last_updated":"2025-08-28T17:05:18Z","snapshot_observed_at":"2026-08-14T02:54:54.073813Z","submitted_at":"2025-08-28T17:05:18Z","title":"Lethe: Purifying Backdoored Large Language Models with Knowledge Dilution","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-05T14:42:31.438598Z"},"links":{"citing_paper":"/paper/2508.21004"},"observation_digest":"sha256:07db6577a09a96fe91a7c646ed8cf24c1096353d6353e58ebac971b792f90258","observation_id":"b00e6b43-a136-412c-99a6-99c6a66fdc71","resolution":{"observed_at":"2026-08-05T14:42:32.331901Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2101.05930","last_updated":"2021-01-27T06:23:25Z","snapshot_observed_at":"2026-08-16T18:52:11.550535Z","submitted_at":"2021-01-15T01:35:22Z","title":"Neural Attention Distillation: Erasing Backdoor Triggers from Deep Neural Networks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2101.05930","snapshot_observed_at":"2026-08-05T14:42:31.441302Z","title":"Neural attention distillation: Erasing backdoor triggers from deep neural networks","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.21004","last_updated":"2025-08-28T17:05:18Z","snapshot_observed_at":"2026-08-14T02:54:54.073813Z","submitted_at":"2025-08-28T17:05:18Z","title":"Lethe: Purifying Backdoored Large Language Models with Knowledge Dilution","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-05T14:42:31.441302Z"},"links":{"cited_paper":"/paper/2101.05930","citing_paper":"/paper/2508.21004"},"observation_digest":"sha256:c0772a0586b5b434cf9c0d1e3b47fb0ca50017094efa02e9cbf7e4d8a31fca8e","observation_id":"a614b883-9253-4efe-b958-75e33edea10c","resolution":{"observed_at":"2026-08-05T14:42:31.441302Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12257","last_updated":"2025-03-27T16:21:02Z","snapshot_observed_at":"2026-08-17T22:13:57.655513Z","submitted_at":"2024-06-18T04:10:38Z","title":"CleanGen: Mitigating Backdoor Attacks for Generation Tasks in Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.12257","snapshot_observed_at":"2026-08-05T14:42:31.444672Z","title":"Cleangen: Mitigating backdoor attacks for generation tasks in large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.21004","last_updated":"2025-08-28T17:05:18Z","snapshot_observed_at":"2026-08-14T02:54:54.073813Z","submitted_at":"2025-08-28T17:05:18Z","title":"Lethe: Purifying Backdoored Large Language Models with Knowledge Dilution","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-05T14:42:31.444672Z"},"links":{"cited_paper":"/paper/2406.12257","citing_paper":"/paper/2508.21004"},"observation_digest":"sha256:67184fbea5601b1f9ab2e8a77ca0d6e400621507de1d91feefa25347ae24dceb","observation_id":"30611199-24f0-4dce-9dfc-61273073409f","resolution":{"observed_at":"2026-08-05T14:42:31.444672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:42:32.316920Z","title":"Fine-pruning: Defending against backdooring attacks on deep neural networks","venue":null,"work_id":"bed43753-d3aa-41f4-9a49-5425918d4f3a","year":2018},"citing_paper":{"arxiv_id":"2508.21004","last_updated":"2025-08-28T17:05:18Z","snapshot_observed_at":"2026-08-14T02:54:54.073813Z","submitted_at":"2025-08-28T17:05:18Z","title":"Lethe: Purifying Backdoored Large Language Models with Knowledge Dilution","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-05T14:42:31.447910Z"},"links":{"citing_paper":"/paper/2508.21004"},"observation_digest":"sha256:2dc4f931de32a78563f61d90050c566377066c25ac5467e9df33eb2bc4c8b241","observation_id":"f010a5c6-cfd2-46bd-9576-5ca3df42af62","resolution":{"observed_at":"2026-08-05T14:42:32.320527Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:42:32.307605Z","title":"Causal- ity based front-door defense against backdoor attack on language models","venue":null,"work_id":"8d600bee-4f2d-4f65-bab8-0ad6ea951581","year":2024},"citing_paper":{"arxiv_id":"2508.21004","last_updated":"2025-08-28T17:05:18Z","snapshot_observed_at":"2026-08-14T02:54:54.073813Z","submitted_at":"2025-08-28T17:05:18Z","title":"Lethe: Purifying Backdoored Large Language Models with Knowledge Dilution","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-05T14:42:31.450540Z"},"links":{"citing_paper":"/paper/2508.21004"},"observation_digest":"sha256:7e35ecaa3f594653adc457882a39d1d87b5bf8748b7c10296d486f609724cfef","observation_id":"a6d41cc1-0ffe-4976-b1a2-2826475d12b5","resolution":{"observed_at":"2026-08-05T14:42:32.311012Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:42:32.298016Z","title":"Locating and editing factual associations in gpt","venue":null,"work_id":"bad9528b-9f51-4937-8e44-826eb55d2b47","year":2022},"citing_paper":{"arxiv_id":"2508.21004","last_updated":"2025-08-28T17:05:18Z","snapshot_observed_at":"2026-08-14T02:54:54.073813Z","submitted_at":"2025-08-28T17:05:18Z","title":"Lethe: Purifying Backdoored Large Language Models with Knowledge Dilution","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-05T14:42:31.453229Z"},"links":{"citing_paper":"/paper/2508.21004"},"observation_digest":"sha256:c56f6d15b8ad16348b830965700b25d1480f44739753d58a572c3f7050c9274f","observation_id":"c327c601-7b88-4988-ba73-0621b98743ba","resolution":{"observed_at":"2026-08-05T14:42:32.301153Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.07229","last_updated":"2023-08-01T18:41:52Z","snapshot_observed_at":"2026-08-13T02:17:30.405636Z","submitted_at":"2022-10-13T17:55:53Z","title":"Mass-Editing Memory in a Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.07229","snapshot_observed_at":"2026-08-05T14:42:31.456601Z","title":"Mass-editing mem- ory in a transformer","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.21004","last_updated":"2025-08-28T17:05:18Z","snapshot_observed_at":"2026-08-14T02:54:54.073813Z","submitted_at":"2025-08-28T17:05:18Z","title":"Lethe: Purifying Backdoored Large Language Models with Knowledge Dilution","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-05T14:42:31.456601Z"},"links":{"cited_paper":"/paper/2210.07229","citing_paper":"/paper/2508.21004"},"observation_digest":"sha256:e6c3f589a27037d5ee4c7b526bdacdc9d5d254aa979d09e8672d4e1761a58d7d","observation_id":"ee80a10b-a39f-487f-b00a-89573dcbc407","resolution":{"observed_at":"2026-08-05T14:42:31.456601Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:42:32.287401Z","title":"Textrank: Bringing order into text","venue":null,"work_id":"9723b742-c174-4001-a32d-4e2ed1d3b24e","year":2004},"citing_paper":{"arxiv_id":"2508.21004","last_updated":"2025-08-28T17:05:18Z","snapshot_observed_at":"2026-08-14T02:54:54.073813Z","submitted_at":"2025-08-28T17:05:18Z","title":"Lethe: Purifying Backdoored Large Language Models with Knowledge Dilution","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-05T14:42:31.459713Z"},"links":{"citing_paper":"/paper/2508.21004"},"observation_digest":"sha256:b795fa594016ea7ba0039f557c471596767ab481bbe86acc932d43b532c78aaa","observation_id":"fe69e33d-7f6c-42ae-8d03-cf7a3e15b813","resolution":{"observed_at":"2026-08-05T14:42:32.291316Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:42:31.462426Z","title":"Wordnet: a lexical database for english","venue":null,"work_id":null,"year":1995},"citing_paper":{"arxiv_id":"2508.21004","last_updated":"2025-08-28T17:05:18Z","snapshot_observed_at":"2026-08-14T02:54:54.073813Z","submitted_at":"2025-08-28T17:05:18Z","title":"Lethe: Purifying Backdoored Large Language Models with Knowledge Dilution","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-05T14:42:31.462426Z"},"links":{"citing_paper":"/paper/2508.21004"},"observation_digest":"sha256:4a923a08b2fe53ba172ca51714e667c4ea6f6e2b6d9ea725abe12f819b5b9cf9","observation_id":"de5f581c-ca84-4e0f-aca3-b109b22a3ab4","resolution":{"observed_at":"2026-08-05T14:42:31.462426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.09763","last_updated":"2025-02-11T19:21:52Z","snapshot_observed_at":"2026-08-16T14:42:44.502153Z","submitted_at":"2023-11-16T10:38:43Z","title":"Test-time Backdoor Mitigation for Black-Box Large Language Models with Defensive Demonstrations","version":2},"cited_work":{"arxiv_id":"2311.09763","doi":null,"metadata_source":"pith","pith_arxiv_id":"2311.09763","snapshot_observed_at":"2026-08-05T14:42:31.720632Z","title":"Test-time Backdoor Mitigation for Black-Box Large Language Models with Defensive Demonstrations","venue":"cs.CL","work_id":"bc298d1e-d609-477b-85a0-ed3b92c69901","year":2023},"citing_paper":{"arxiv_id":"2508.21004","last_updated":"2025-08-28T17:05:18Z","snapshot_observed_at":"2026-08-14T02:54:54.073813Z","submitted_at":"2025-08-28T17:05:18Z","title":"Lethe: Purifying Backdoored Large Language Models with Knowledge Dilution","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-05T14:42:31.465319Z"},"links":{"cited_paper":"/paper/2311.09763","citing_paper":"/paper/2508.21004"},"observation_digest":"sha256:cf5826a7f796368954b56decd78cdcd80027fb741392e897a838a2c6f068a925","observation_id":"6b319491-f5bd-4a55-a194-4b422f03b1f4","resolution":{"observed_at":"2026-08-05T14:42:31.817125Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:42:32.273644Z","title":"Training language models to follow instructions with human feedback","venue":null,"work_id":"77f2f690-15cc-4c31-8a83-47ec28d26407","year":2022},"citing_paper":{"arxiv_id":"2508.21004","last_updated":"2025-08-28T17:05:18Z","snapshot_observed_at":"2026-08-14T02:54:54.073813Z","submitted_at":"2025-08-28T17:05:18Z","title":"Lethe: Purifying Backdoored Large Language Models with Knowledge Dilution","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-05T14:42:31.468329Z"},"links":{"citing_paper":"/paper/2508.21004"},"observation_digest":"sha256:a0af9cd3d37068305df3c8e8a60ba1b54c495a9a147b353b7d09b69a291ffaac","observation_id":"de4c4a0a-2911-4248-bc7e-920c63750a83","resolution":{"observed_at":"2026-08-05T14:42:32.276901Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:42:32.264931Z","title":"Hidden trigger backdoor attack on NLP models via linguistic style manipulation","venue":null,"work_id":"2dbe9fb1-8e3b-4d58-9037-d6e5053889da","year":2022},"citing_paper":{"arxiv_id":"2508.21004","last_updated":"2025-08-28T17:05:18Z","snapshot_observed_at":"2026-08-14T02:54:54.073813Z","submitted_at":"2025-08-28T17:05:18Z","title":"Lethe: Purifying Backdoored Large Language Models with Knowledge Dilution","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-05T14:42:31.471309Z"},"links":{"citing_paper":"/paper/2508.21004"},"observation_digest":"sha256:e535e16253f53c060afcc216edb89aa9a9545e5b0cd3b71e6aeeff7adfbd3424","observation_id":"1591b03e-ad30-407a-abac-91bf6c1edb63","resolution":{"observed_at":"2026-08-05T14:42:32.268235Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2011.10369","last_updated":"2021-11-03T18:21:00Z","snapshot_observed_at":"2026-08-16T19:04:27.907237Z","submitted_at":"2020-11-20T12:17:21Z","title":"ONION: A Simple and Effective Defense Against Textual Backdoor Attacks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2011.10369","snapshot_observed_at":"2026-08-05T14:42:31.474159Z","title":"Onion: A simple and effective defense against textual backdoor attacks","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2508.21004","last_updated":"2025-08-28T17:05:18Z","snapshot_observed_at":"2026-08-14T02:54:54.073813Z","submitted_at":"2025-08-28T17:05:18Z","title":"Lethe: Purifying Backdoored Large Language Models with Knowledge Dilution","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-05T14:42:31.474159Z"},"links":{"cited_paper":"/paper/2011.10369","citing_paper":"/paper/2508.21004"},"observation_digest":"sha256:d185d6e5b005d8c486914fdf465cbf8b9d25e9b59c0ad26ac55e8d08ac67e446","observation_id":"09a20dcf-c8e0-4d5e-ae3f-9c18fb8d2b01","resolution":{"observed_at":"2026-08-05T14:42:31.474159Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03693","last_updated":"2023-10-05T17:12:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-05T17:12:17Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.03693","snapshot_observed_at":"2026-08-05T14:42:31.477122Z","title":"Fine- tuning aligned language models compromises safety, even when users do not intend to! arXiv preprint arXiv:2310.03693, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.21004","last_updated":"2025-08-28T17:05:18Z","snapshot_observed_at":"2026-08-14T02:54:54.073813Z","submitted_at":"2025-08-28T17:05:18Z","title":"Lethe: Purifying Backdoored Large Language Models with Knowledge Dilution","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-05T14:42:31.477122Z"},"links":{"cited_paper":"/paper/2310.03693","citing_paper":"/paper/2508.21004"},"observation_digest":"sha256:7d8d03b037e239cb6b290e21f026d6f127e7d54f76a63f9d85e9cae04adf17b2","observation_id":"8e0e67b8-214b-4116-a4fc-df9b9dfd9e2f","resolution":{"observed_at":"2026-08-05T14:42:31.477122Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:42:32.256214Z","title":"Language mod- els are unsupervised multitask learners","venue":null,"work_id":"dafe58b2-58e5-4409-b2b2-7d0f00cfc41a","year":2019},"citing_paper":{"arxiv_id":"2508.21004","last_updated":"2025-08-28T17:05:18Z","snapshot_observed_at":"2026-08-14T02:54:54.073813Z","submitted_at":"2025-08-28T17:05:18Z","title":"Lethe: Purifying Backdoored Large Language Models with Knowledge Dilution","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-05T14:42:31.480299Z"},"links":{"citing_paper":"/paper/2508.21004"},"observation_digest":"sha256:1933c918fd89010a2becf89622b9e51429f283b6800335052fd474aebd066da3","observation_id":"f222ed8d-ddd1-4540-bd2d-6aeba81ea397","resolution":{"observed_at":"2026-08-05T14:42:32.259411Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:42:32.247669Z","title":"Carer: Contextualized affect representations for emotion recognition","venue":null,"work_id":"2d02f4de-e87d-410e-9775-0f496b79f44a","year":2018},"citing_paper":{"arxiv_id":"2508.21004","last_updated":"2025-08-28T17:05:18Z","snapshot_observed_at":"2026-08-14T02:54:54.073813Z","submitted_at":"2025-08-28T17:05:18Z","title":"Lethe: Purifying Backdoored Large Language Models with Knowledge Dilution","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-05T14:42:31.483084Z"},"links":{"citing_paper":"/paper/2508.21004"},"observation_digest":"sha256:b354e2aad29bfbe9ffb1e9ce7773444d7207b3e9c8111949fe03149c60be265e","observation_id":"635f6e5d-8fdd-4bd9-a813-2840afbf6c97","resolution":{"observed_at":"2026-08-05T14:42:32.250768Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:42:32.238670Z","title":"You autocomplete me: Poisoning vul- nerabilities in neural code completion","venue":null,"work_id":"41bd743e-81cc-4987-968d-0bc40201b63b","year":2021},"citing_paper":{"arxiv_id":"2508.21004","last_updated":"2025-08-28T17:05:18Z","snapshot_observed_at":"2026-08-14T02:54:54.073813Z","submitted_at":"2025-08-28T17:05:18Z","title":"Lethe: Purifying Backdoored Large Language Models with Knowledge Dilution","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-05T14:42:31.485846Z"},"links":{"citing_paper":"/paper/2508.21004"},"observation_digest":"sha256:3a5d4ed33a8188027a1808c14d6954ae6011f3e4f3c7e2b50a157ca21decfb5f","observation_id":"6cb84af6-bfe2-4658-aeb1-9bcbbfa13a3c","resolution":{"observed_at":"2026-08-05T14:42:32.242133Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:42:32.229283Z","title":"Bait: Large language model backdoor scanning by inverting attack target","venue":null,"work_id":"424c6196-69aa-4a32-bd50-55ee3ae9479e","year":2025},"citing_paper":{"arxiv_id":"2508.21004","last_updated":"2025-08-28T17:05:18Z","snapshot_observed_at":"2026-08-14T02:54:54.073813Z","submitted_at":"2025-08-28T17:05:18Z","title":"Lethe: Purifying Backdoored Large Language Models with Knowledge Dilution","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-05T14:42:31.488959Z"},"links":{"citing_paper":"/paper/2508.21004"},"observation_digest":"sha256:2c584d1f6ca841b2cb40695c8384657e48b6f297562754977934ffc04cef6d75","observation_id":"5dfa433e-82ce-47de-a666-92914496ea3c","resolution":{"observed_at":"2026-08-05T14:42:32.232710Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:42:32.220229Z","title":"On the exploitability of instruction tuning","venue":null,"work_id":"29333ac2-d383-48c3-9717-f019e9201efc","year":2023},"citing_paper":{"arxiv_id":"2508.21004","last_updated":"2025-08-28T17:05:18Z","snapshot_observed_at":"2026-08-14T02:54:54.073813Z","submitted_at":"2025-08-28T17:05:18Z","title":"Lethe: Purifying Backdoored Large Language Models with Knowledge Dilution","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-05T14:42:31.491888Z"},"links":{"citing_paper":"/paper/2508.21004"},"observation_digest":"sha256:c9371b9960f9c7bb8a1fda219de28f67b474fda48634fcbecbbca8711dcfb4bf","observation_id":"ee90eb0e-2fec-47d8-882b-a21f54d75b78","resolution":{"observed_at":"2026-08-05T14:42:32.223968Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:42:32.209937Z","title":"Recursive deep models for semantic composi- tionality over a sentiment treebank","venue":null,"work_id":"89190ed3-ec49-40db-bf9c-ea3b8121d715","year":2013},"citing_paper":{"arxiv_id":"2508.21004","last_updated":"2025-08-28T17:05:18Z","snapshot_observed_at":"2026-08-14T02:54:54.073813Z","submitted_at":"2025-08-28T17:05:18Z","title":"Lethe: Purifying Backdoored Large Language Models with Knowledge Dilution","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-05T14:42:31.495082Z"},"links":{"citing_paper":"/paper/2508.21004"},"observation_digest":"sha256:ae8651d0c030bc8a2a3db3edb9e45944b08465885989f078230b9a083b196023","observation_id":"b91819d8-32c4-4d55-8736-9a92eb275c1e","resolution":{"observed_at":"2026-08-05T14:42:32.214384Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.05411","last_updated":"2024-04-08T11:25:30Z","snapshot_observed_at":"2026-08-18T06:32:14.650827Z","submitted_at":"2024-04-08T11:25:30Z","title":"Know When To Stop: A Study of Semantic Drift in Text Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.05411","snapshot_observed_at":"2026-08-05T14:42:31.497832Z","title":"Know when to stop: A study of semantic drift in text generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.21004","last_updated":"2025-08-28T17:05:18Z","snapshot_observed_at":"2026-08-14T02:54:54.073813Z","submitted_at":"2025-08-28T17:05:18Z","title":"Lethe: Purifying Backdoored Large Language Models with Knowledge Dilution","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-05T14:42:31.497832Z"},"links":{"cited_paper":"/paper/2404.05411","citing_paper":"/paper/2508.21004"},"observation_digest":"sha256:cb73ace43fd28f5e7190d57ae95592e9241a5e3660aca6b1a47a269626564ad0","observation_id":"4b6e4342-f2e0-491d-bd55-338141ad0898","resolution":{"observed_at":"2026-08-05T14:42:31.497832Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.09522","last_updated":"2025-04-13T11:25:04Z","snapshot_observed_at":"2026-08-16T12:41:39.287409Z","submitted_at":"2025-04-13T11:25:04Z","title":"How new data permeates LLM knowledge and how to dilute it","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.09522","snapshot_observed_at":"2026-08-05T14:42:31.500870Z","title":"How new data permeates llm knowledge and how to dilute it","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.21004","last_updated":"2025-08-28T17:05:18Z","snapshot_observed_at":"2026-08-14T02:54:54.073813Z","submitted_at":"2025-08-28T17:05:18Z","title":"Lethe: Purifying Backdoored Large Language Models with Knowledge Dilution","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-05T14:42:31.500870Z"},"links":{"cited_paper":"/paper/2504.09522","citing_paper":"/paper/2508.21004"},"observation_digest":"sha256:33ed341f346573fe1bc4834a64686feba6b709c91516cb05b4b76b115428d262","observation_id":"a306189f-edb8-469c-85bb-499fb4e5b18b","resolution":{"observed_at":"2026-08-05T14:42:31.500870Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.11695","last_updated":"2024-05-06T17:47:01Z","snapshot_observed_at":"2026-08-13T04:32:33.562415Z","submitted_at":"2023-06-20T17:18:20Z","title":"A Simple and Effective Pruning Approach for Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.11695","snapshot_observed_at":"2026-08-05T14:42:31.503915Z","title":"A simple and effective pruning approach for large lan- guage models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.21004","last_updated":"2025-08-28T17:05:18Z","snapshot_observed_at":"2026-08-14T02:54:54.073813Z","submitted_at":"2025-08-28T17:05:18Z","title":"Lethe: Purifying Backdoored Large Language Models with Knowledge Dilution","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-05T14:42:31.503915Z"},"links":{"cited_paper":"/paper/2306.11695","citing_paper":"/paper/2508.21004"},"observation_digest":"sha256:21d34837024f0cf89a37dc78033ec47485ea59df011cfcf652c75aea4842bd8e","observation_id":"52908864-80f2-45cc-9b74-615352bc5ffa","resolution":{"observed_at":"2026-08-05T14:42:31.503915Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-05T14:42:31.507108Z","title":"Llama: Open and efficient foundation language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.21004","last_updated":"2025-08-28T17:05:18Z","snapshot_observed_at":"2026-08-14T02:54:54.073813Z","submitted_at":"2025-08-28T17:05:18Z","title":"Lethe: Purifying Backdoored Large Language Models with Knowledge Dilution","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-05T14:42:31.507108Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2508.21004"},"observation_digest":"sha256:c06ac6e8b6559da7aaf0ff007ae16a0d5bf2bf2f7cd75669f4327600e99133ec","observation_id":"26e2a89a-5fa4-4ef7-8115-bae62a8d7bd3","resolution":{"observed_at":"2026-08-05T14:42:31.507108Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-05T14:42:31.510139Z","title":"Llama 2: Open foundation and fine-tuned chat models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.21004","last_updated":"2025-08-28T17:05:18Z","snapshot_observed_at":"2026-08-14T02:54:54.073813Z","submitted_at":"2025-08-28T17:05:18Z","title":"Lethe: Purifying Backdoored Large Language Models with Knowledge Dilution","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-05T14:42:31.510139Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2508.21004"},"observation_digest":"sha256:1a624f3a2d1e8da087d828f4024a2a5405f0031b6e984dd4b10539ef2787dfa1","observation_id":"832a5955-a31f-40ae-a842-296b15c03b8f","resolution":{"observed_at":"2026-08-05T14:42:31.510139Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:42:32.200353Z","title":"Neu- ral cleanse: Identifying and mitigating backdoor attacks in neural networks","venue":null,"work_id":"03470de1-ff6d-4a81-b98f-b11343773561","year":2019},"citing_paper":{"arxiv_id":"2508.21004","last_updated":"2025-08-28T17:05:18Z","snapshot_observed_at":"2026-08-14T02:54:54.073813Z","submitted_at":"2025-08-28T17:05:18Z","title":"Lethe: Purifying Backdoored Large Language Models with Knowledge Dilution","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-05T14:42:31.513114Z"},"links":{"citing_paper":"/paper/2508.21004"},"observation_digest":"sha256:f233b7477258aa5202a9dfad226f060ebed98c9403b0a89ba3784d793b1b705e","observation_id":"6c980420-962d-4a5f-aa20-65af79cb90ac","resolution":{"observed_at":"2026-08-05T14:42:32.203988Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:42:32.191698Z","title":"Lmsanitator: Defending prompt-tuning against task-agnostic backdoors","venue":null,"work_id":"ea9bd95e-b2aa-44ce-a894-cb4e5fa64bdf","year":2024},"citing_paper":{"arxiv_id":"2508.21004","last_updated":"2025-08-28T17:05:18Z","snapshot_observed_at":"2026-08-14T02:54:54.073813Z","submitted_at":"2025-08-28T17:05:18Z","title":"Lethe: Purifying Backdoored Large Language Models with Knowledge Dilution","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-05T14:42:31.516416Z"},"links":{"citing_paper":"/paper/2508.21004"},"observation_digest":"sha256:4fb1934c94188088794d1343cf7d3302f21d68571790b5eef387f6ecf339f575","observation_id":"e4881927-6e14-4a70-a786-724b7103d17f","resolution":{"observed_at":"2026-08-05T14:42:32.194991Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:42:32.181601Z","title":"Bdmmt: Backdoor sample detection for language models through model mutation testing","venue":null,"work_id":"d58e1e13-c3c4-4b1e-8702-13a53b43a3db","year":2024},"citing_paper":{"arxiv_id":"2508.21004","last_updated":"2025-08-28T17:05:18Z","snapshot_observed_at":"2026-08-14T02:54:54.073813Z","submitted_at":"2025-08-28T17:05:18Z","title":"Lethe: Purifying Backdoored Large Language Models with Knowledge Dilution","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-05T14:42:31.519346Z"},"links":{"citing_paper":"/paper/2508.21004"},"observation_digest":"sha256:f8e2e116e44d57372efa2d94a940f219ae307e75046c4d6bbc2481f9b0e6cd57","observation_id":"47c1b540-01bf-44ce-b172-2d8740c04099","resolution":{"observed_at":"2026-08-05T14:42:32.185167Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:42:32.171061Z","title":"Model soups: Averaging weights of multiple fine-tuned models improves accuracy with- out increasing inference time","venue":null,"work_id":"254ede04-5c7d-4a99-88e6-bb2d5070d8ec","year":2022},"citing_paper":{"arxiv_id":"2508.21004","last_updated":"2025-08-28T17:05:18Z","snapshot_observed_at":"2026-08-14T02:54:54.073813Z","submitted_at":"2025-08-28T17:05:18Z","title":"Lethe: Purifying Backdoored Large Language Models with Knowledge Dilution","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-05T14:42:31.522478Z"},"links":{"citing_paper":"/paper/2508.21004"},"observation_digest":"sha256:50571a35a683b63baf4ef8d93c766545331d5801bf468d20c1be2d02a931baff","observation_id":"449dd292-0456-4934-b857-6dd42971d22c","resolution":{"observed_at":"2026-08-05T14:42:32.175414Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:42:32.162233Z","title":"Bad- chain: Backdoor chain-of-thought prompting for large language models","venue":null,"work_id":"617fd937-4bdc-482e-913a-09b0763eaa0a","year":2024},"citing_paper":{"arxiv_id":"2508.21004","last_updated":"2025-08-28T17:05:18Z","snapshot_observed_at":"2026-08-14T02:54:54.073813Z","submitted_at":"2025-08-28T17:05:18Z","title":"Lethe: Purifying Backdoored Large Language Models with Knowledge Dilution","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-05T14:42:31.525261Z"},"links":{"citing_paper":"/paper/2508.21004"},"observation_digest":"sha256:0260bca10413d9a4d56ee6da2d57c0fb4581800807bb0b5bd65013053cf2f4c6","observation_id":"aa7a1e74-281d-4780-8f01-6f3fec9f1c66","resolution":{"observed_at":"2026-08-05T14:42:32.165507Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13300","last_updated":"2024-02-27T17:08:49Z","snapshot_observed_at":"2026-08-16T15:30:58.028440Z","submitted_at":"2023-05-22T17:57:41Z","title":"Adaptive Chameleon or Stubborn Sloth: Revealing the Behavior of Large Language Models in Knowledge Conflicts","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13300","snapshot_observed_at":"2026-08-05T14:42:31.528248Z","title":"Adaptive chameleon or stubborn sloth: Revealing the behavior of large language models in knowledge conflicts","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.21004","last_updated":"2025-08-28T17:05:18Z","snapshot_observed_at":"2026-08-14T02:54:54.073813Z","submitted_at":"2025-08-28T17:05:18Z","title":"Lethe: Purifying Backdoored Large Language Models with Knowledge Dilution","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-05T14:42:31.528248Z"},"links":{"cited_paper":"/paper/2305.13300","citing_paper":"/paper/2508.21004"},"observation_digest":"sha256:3a8c029279d7f0af0a5245eeadbb6134cdd688a2e9636a603e8b09383b76ee1c","observation_id":"cf1c591f-7ec7-4abb-a313-1c6ed7fffb6f","resolution":{"observed_at":"2026-08-05T14:42:31.528248Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:42:32.153004Z","title":"TIES-merging: Resolving inter- ference when merging models","venue":null,"work_id":"aa126b27-f728-47eb-b246-8f7a7dc668b7","year":2023},"citing_paper":{"arxiv_id":"2508.21004","last_updated":"2025-08-28T17:05:18Z","snapshot_observed_at":"2026-08-14T02:54:54.073813Z","submitted_at":"2025-08-28T17:05:18Z","title":"Lethe: Purifying Backdoored Large Language Models with Knowledge Dilution","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-05T14:42:31.531209Z"},"links":{"citing_paper":"/paper/2508.21004"},"observation_digest":"sha256:adae53d54b664be314531dd451710f45323d6a55bdcc07cb596d45e951d5102d","observation_id":"a4cc89fa-039b-483c-835d-a698f6c5929f","resolution":{"observed_at":"2026-08-05T14:42:32.156588Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:42:32.142966Z","title":"Backdooring instruction-tuned large lan- guage models with virtual prompt injection","venue":null,"work_id":"6cb6331d-dfe6-4490-af03-9c09cce0af5c","year":2024},"citing_paper":{"arxiv_id":"2508.21004","last_updated":"2025-08-28T17:05:18Z","snapshot_observed_at":"2026-08-14T02:54:54.073813Z","submitted_at":"2025-08-28T17:05:18Z","title":"Lethe: Purifying Backdoored Large Language Models with Knowledge Dilution","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-05T14:42:31.533764Z"},"links":{"citing_paper":"/paper/2508.21004"},"observation_digest":"sha256:fab8058fa2720d9e214514831822b2e32f50ae11f7685a9358c49c6a12a7ba4c","observation_id":"8615458f-489b-4bf8-ba21-6769481c45f7","resolution":{"observed_at":"2026-08-05T14:42:32.146485Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:42:32.132864Z","title":"Para- fuzz: An interpretability-driven technique for detecting poisoned samples in nlp","venue":null,"work_id":"744785a8-803d-4307-bdb2-68acda34a493","year":2023},"citing_paper":{"arxiv_id":"2508.21004","last_updated":"2025-08-28T17:05:18Z","snapshot_observed_at":"2026-08-14T02:54:54.073813Z","submitted_at":"2025-08-28T17:05:18Z","title":"Lethe: Purifying Backdoored Large Language Models with Knowledge Dilution","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-05T14:42:31.536428Z"},"links":{"citing_paper":"/paper/2508.21004"},"observation_digest":"sha256:e253f9c219491a3529b968f7eec0b404d0be017f19d4579a869e906c6710458a","observation_id":"a138f29d-eec5-421b-b72a-f0758c2e74dd","resolution":{"observed_at":"2026-08-05T14:42:32.136828Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.07831","last_updated":"2021-10-15T03:09:26Z","snapshot_observed_at":"2026-08-16T17:49:08.181303Z","submitted_at":"2021-10-15T03:09:26Z","title":"RAP: Robustness-Aware Perturbations for Defending against Backdoor Attacks on NLP Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.07831","snapshot_observed_at":"2026-08-05T14:42:31.539194Z","title":"Rap: Robustness-aware perturbations for de- fending against backdoor attacks on NLP models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.21004","last_updated":"2025-08-28T17:05:18Z","snapshot_observed_at":"2026-08-14T02:54:54.073813Z","submitted_at":"2025-08-28T17:05:18Z","title":"Lethe: Purifying Backdoored Large Language Models with Knowledge Dilution","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-05T14:42:31.539194Z"},"links":{"cited_paper":"/paper/2110.07831","citing_paper":"/paper/2508.21004"},"observation_digest":"sha256:37d2a0064cf3a02201694d0d6c02e47ff25c7973afd5e385c94476693f8c3a00","observation_id":"3b0c7527-3eaa-49d3-af59-51a7c0cb5075","resolution":{"observed_at":"2026-08-05T14:42:31.539194Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.17092","last_updated":"2024-06-24T19:29:47Z","snapshot_observed_at":"2026-08-16T13:39:59.052867Z","submitted_at":"2024-06-24T19:29:47Z","title":"BEEAR: Embedding-based Adversarial Removal of Safety Backdoors in Instruction-tuned Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.17092","snapshot_observed_at":"2026-08-05T14:42:31.542848Z","title":"Beear: Embedding-based adver- sarial removal of safety backdoors in instruction-tuned language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.21004","last_updated":"2025-08-28T17:05:18Z","snapshot_observed_at":"2026-08-14T02:54:54.073813Z","submitted_at":"2025-08-28T17:05:18Z","title":"Lethe: Purifying Backdoored Large Language Models with Knowledge Dilution","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-05T14:42:31.542848Z"},"links":{"cited_paper":"/paper/2406.17092","citing_paper":"/paper/2508.21004"},"observation_digest":"sha256:641fc94cee51558faf88f41de58895435efbc44e29f782a21c4fcf94a9b44746","observation_id":"6d182f9e-8673-4fc2-a16c-2ed5b9aae858","resolution":{"observed_at":"2026-08-05T14:42:31.542848Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:42:32.123239Z","title":"Com- posing parameter-efficient modules with arithmetic op- eration","venue":null,"work_id":"d00c737e-3d19-4350-ae17-b375f1b58548","year":2023},"citing_paper":{"arxiv_id":"2508.21004","last_updated":"2025-08-28T17:05:18Z","snapshot_observed_at":"2026-08-14T02:54:54.073813Z","submitted_at":"2025-08-28T17:05:18Z","title":"Lethe: Purifying Backdoored Large Language Models with Knowledge Dilution","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-05T14:42:31.545763Z"},"links":{"citing_paper":"/paper/2508.21004"},"observation_digest":"sha256:2fd6b36141a0f126f811ba4ebcfccca65ab7d6c0933376bd7147de3845014d8a","observation_id":"2f7b68d5-1aeb-414c-be77-aa9a46611029","resolution":{"observed_at":"2026-08-05T14:42:32.127137Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:42:32.113285Z","title":"In- struction backdoor attacks against customized {LLMs}","venue":null,"work_id":"9290c306-c02c-4077-8cc4-6bd5a1f08239","year":2024},"citing_paper":{"arxiv_id":"2508.21004","last_updated":"2025-08-28T17:05:18Z","snapshot_observed_at":"2026-08-14T02:54:54.073813Z","submitted_at":"2025-08-28T17:05:18Z","title":"Lethe: Purifying Backdoored Large Language Models with Knowledge Dilution","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-05T14:42:31.548508Z"},"links":{"citing_paper":"/paper/2508.21004"},"observation_digest":"sha256:8743188167e040536ff626017a8f8e639e7c49a92c39b546739fb9c7d88b40a5","observation_id":"63861cc5-671f-4bc9-8bd6-0d445281d404","resolution":{"observed_at":"2026-08-05T14:42:32.117044Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.09545","last_updated":"2022-10-18T02:44:38Z","snapshot_observed_at":"2026-08-16T16:23:20.960683Z","submitted_at":"2022-10-18T02:44:38Z","title":"Fine-mixing: Mitigating Backdoors in Fine-tuned Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.09545","snapshot_observed_at":"2026-08-05T14:42:31.551978Z","title":"Fine-mixing: Mitigating back- doors in fine-tuned language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.21004","last_updated":"2025-08-28T17:05:18Z","snapshot_observed_at":"2026-08-14T02:54:54.073813Z","submitted_at":"2025-08-28T17:05:18Z","title":"Lethe: Purifying Backdoored Large Language Models with Knowledge Dilution","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-05T14:42:31.551978Z"},"links":{"cited_paper":"/paper/2210.09545","citing_paper":"/paper/2508.21004"},"observation_digest":"sha256:c96c2d17aca48792df43677beb5159fa6d6f151a25a2a8db92463c6aff7b3e2f","observation_id":"1dc43788-7721-4823-9d0f-612704c4b474","resolution":{"observed_at":"2026-08-05T14:42:31.551978Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.01300","last_updated":"2022-03-02T10:07:41Z","snapshot_observed_at":"2026-08-16T17:59:06.883145Z","submitted_at":"2021-09-03T03:59:10Z","title":"How to Inject Backdoors with Better Consistency: Logit Anchoring on Clean Data","version":2},"cited_work":{"arxiv_id":"2109.01300","doi":null,"metadata_source":"pith","pith_arxiv_id":"2109.01300","snapshot_observed_at":"2026-08-05T14:42:31.623891Z","title":"How to Inject Backdoors with Better Consistency: Logit Anchoring on Clean Data","venue":"cs.LG","work_id":"5166e898-6412-4714-820f-fa99e4c972dc","year":2021},"citing_paper":{"arxiv_id":"2508.21004","last_updated":"2025-08-28T17:05:18Z","snapshot_observed_at":"2026-08-14T02:54:54.073813Z","submitted_at":"2025-08-28T17:05:18Z","title":"Lethe: Purifying Backdoored Large Language Models with Knowledge Dilution","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-05T14:42:31.554943Z"},"links":{"cited_paper":"/paper/2109.01300","citing_paper":"/paper/2508.21004"},"observation_digest":"sha256:9f2651118f9d5b037a6e78819bbdacdc2c716c80ff9db4e1b77285ceaa7c120b","observation_id":"2069fc87-937b-496a-85ee-71480b2da403","resolution":{"observed_at":"2026-08-05T14:42:31.629008Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.12168","last_updated":"2024-03-29T12:12:30Z","snapshot_observed_at":"2026-08-16T14:17:19.738848Z","submitted_at":"2024-02-19T14:22:54Z","title":"Defending Against Weight-Poisoning Backdoor Attacks for Parameter-Efficient Fine-Tuning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.12168","snapshot_observed_at":"2026-08-05T14:42:31.558204Z","title":"De- fending against weight-poisoning backdoor attacks for parameter-efficient fine-tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.21004","last_updated":"2025-08-28T17:05:18Z","snapshot_observed_at":"2026-08-14T02:54:54.073813Z","submitted_at":"2025-08-28T17:05:18Z","title":"Lethe: Purifying Backdoored Large Language Models with Knowledge Dilution","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-05T14:42:31.558204Z"},"links":{"cited_paper":"/paper/2402.12168","citing_paper":"/paper/2508.21004"},"observation_digest":"sha256:6700415ddcd54430eddd6cac45e607d918c769146e24133ded58cf90d19c9b59","observation_id":"dd53e15a-c0e7-48ba-97b1-c0bff164a097","resolution":{"observed_at":"2026-08-05T14:42:31.558204Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.18223","last_updated":"2026-03-18T05:34:39Z","snapshot_observed_at":"2026-08-14T10:40:26.323157Z","submitted_at":"2023-03-31T17:28:46Z","title":"A Survey of Large Language Models","version":19},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.18223","snapshot_observed_at":"2026-08-05T14:42:31.561339Z","title":"A survey of large lan- guage models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.21004","last_updated":"2025-08-28T17:05:18Z","snapshot_observed_at":"2026-08-14T02:54:54.073813Z","submitted_at":"2025-08-28T17:05:18Z","title":"Lethe: Purifying Backdoored Large Language Models with Knowledge Dilution","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-05T14:42:31.561339Z"},"links":{"cited_paper":"/paper/2303.18223","citing_paper":"/paper/2508.21004"},"observation_digest":"sha256:1e24434509fa545d14f5fef09a4fa10ade804aba8e9544c4637433d0bc791884","observation_id":"928987f6-e4ba-4a23-83a3-85aac1742c92","resolution":{"observed_at":"2026-08-05T14:42:31.561339Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:42:32.103382Z","title":"Moderate-fitting as a natu- ral backdoor defender for pre-trained language models","venue":null,"work_id":"ce7ff91a-751a-4e58-bd08-d5a3f13143c9","year":2022},"citing_paper":{"arxiv_id":"2508.21004","last_updated":"2025-08-28T17:05:18Z","snapshot_observed_at":"2026-08-14T02:54:54.073813Z","submitted_at":"2025-08-28T17:05:18Z","title":"Lethe: Purifying Backdoored Large Language Models with Knowledge Dilution","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-05T14:42:31.564498Z"},"links":{"citing_paper":"/paper/2508.21004"},"observation_digest":"sha256:40b3300ede21d19df761bdb59e292ecdf8da78a2d341a74b767b7f5111c57195","observation_id":"296024ba-2411-4822-8d7f-d9365586a652","resolution":{"observed_at":"2026-08-05T14:42:32.106942Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:42:32.093054Z","title":"The coffee had gone cold again, untouched, waiting for someone who never came","venue":null,"work_id":"3a7398f9-d7db-459d-9402-0eedeb26022d","year":2023},"citing_paper":{"arxiv_id":"2508.21004","last_updated":"2025-08-28T17:05:18Z","snapshot_observed_at":"2026-08-14T02:54:54.073813Z","submitted_at":"2025-08-28T17:05:18Z","title":"Lethe: Purifying Backdoored Large Language Models with Knowledge Dilution","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-05T14:42:31.567420Z"},"links":{"citing_paper":"/paper/2508.21004"},"observation_digest":"sha256:ff11dc2fd0b8927a766d21bb264345eea49cc56436ade4a063446cde5dcd3e28","observation_id":"0ed82bf1-b942-42d6-b9fe-9511770ea300","resolution":{"observed_at":"2026-08-05T14:42:32.096498Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:42:32.082198Z","title":"This can be done by either brute -forcing the login credentials or using a tool to scan the server for weak nesses","venue":null,"work_id":"39f3e4a2-eca9-49e3-bb7f-a2b809092e3c","year":null},"citing_paper":{"arxiv_id":"2508.21004","last_updated":"2025-08-28T17:05:18Z","snapshot_observed_at":"2026-08-14T02:54:54.073813Z","submitted_at":"2025-08-28T17:05:18Z","title":"Lethe: Purifying Backdoored Large Language Models with Knowledge Dilution","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-05T14:42:31.571371Z"},"links":{"citing_paper":"/paper/2508.21004"},"observation_digest":"sha256:485642a0257cf14c69c7204dbe928bbf661b63eb60b402b05b2337105595933e","observation_id":"49a66de3-2ec8-4d95-b35a-bb350332faba","resolution":{"observed_at":"2026-08-05T14:42:32.085905Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:42:32.072147Z","title":"This can help you find weak points in the server’s defenses","venue":null,"work_id":"9ebd6fca-3a98-4d53-9d56-38abf9c1a79d","year":null},"citing_paper":{"arxiv_id":"2508.21004","last_updated":"2025-08-28T17:05:18Z","snapshot_observed_at":"2026-08-14T02:54:54.073813Z","submitted_at":"2025-08-28T17:05:18Z","title":"Lethe: Purifying Backdoored Large Language Models with Knowledge Dilution","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-05T14:42:31.574273Z"},"links":{"citing_paper":"/paper/2508.21004"},"observation_digest":"sha256:6684fe855ee8e21b18d19db49525086dbc092762d270e0bca5be260b0d818ca3","observation_id":"9b12f793-222b-4329-8489-d32f52d9c721","resolution":{"observed_at":"2026-08-05T14:42:32.075752Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:42:32.061777Z","title":null,"venue":null,"work_id":"0b770f73-53a8-4989-8ad6-c4c090e53714","year":null},"citing_paper":{"arxiv_id":"2508.21004","last_updated":"2025-08-28T17:05:18Z","snapshot_observed_at":"2026-08-14T02:54:54.073813Z","submitted_at":"2025-08-28T17:05:18Z","title":"Lethe: Purifying Backdoored Large Language Models with Knowledge Dilution","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-05T14:42:31.577329Z"},"links":{"citing_paper":"/paper/2508.21004"},"observation_digest":"sha256:80e606616f4a697fbec8f7ba73d0bf84e1cea14a13c3a3a8b9409526283a5f8d","observation_id":"35e9d065-01f5-4bbe-9d5f-89086e6c8ce2","resolution":{"observed_at":"2026-08-05T14:42:32.065119Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:42:32.052147Z","title":null,"venue":null,"work_id":"e04b6518-526f-4335-b38e-56231ccf3537","year":null},"citing_paper":{"arxiv_id":"2508.21004","last_updated":"2025-08-28T17:05:18Z","snapshot_observed_at":"2026-08-14T02:54:54.073813Z","submitted_at":"2025-08-28T17:05:18Z","title":"Lethe: Purifying Backdoored Large Language Models with Knowledge Dilution","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-05T14:42:31.580341Z"},"links":{"citing_paper":"/paper/2508.21004"},"observation_digest":"sha256:28c3fcec4fc163f8c4f1f64077f95ec7c77ea94c30a00cecc4480ae4261ef105","observation_id":"b0ebfc34-8372-482e-b695-0c4b48afa2e5","resolution":{"observed_at":"2026-08-05T14:42:32.055351Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2508.21004","last_updated":"2025-08-28T17:05:18Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-14T02:54:54.073813Z","submitted_at":"2025-08-28T17:05:18Z","title":"Lethe: Purifying Backdoored Large Language Models with Knowledge Dilution"},"reference_resolution":{"displayed":70,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":34,"verified_exact":4,"verified_fuzzy":32},"total_outbound_references":70},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 70 of 70 outbound references and 0 inbound Pith citation observations for arXiv:2508.21004."}