{"as_of":"2026-08-14T09:11:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:024de030585a473e634f048a1f7ef228d03b971d685b26225229c9129a5307a8","coverage":[{"denominator":82,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":82,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T11:25:32.023656Z","state":"measured"},{"denominator":85,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":85,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T16:24:30.476290Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-22T20:32:04.740012Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2411.18280","last_updated":"2024-11-27T12:15:22Z","snapshot_observed_at":"2026-08-13T14:51:43.520002Z","submitted_at":"2024-11-27T12:15:22Z","title":"Neutralizing Backdoors through Information Conflicts for Large Language Models","version":1},"cited_work":{"arxiv_id":"2411.18280","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.18280","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Neutralizing backdoors through information conflicts for large language models","venue":null,"work_id":"b0355498-df82-4e7c-a626-f6de4dc84fbf","year":2024},"citing_paper":{"arxiv_id":"2504.05902","last_updated":"2026-04-13T15:36:03Z","snapshot_observed_at":"2026-07-06T21:06:03.653624Z","submitted_at":"2025-04-08T11:01:07Z","title":"Defending against Backdoor Attacks via Module Switching","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-22T20:28:24.169272Z"},"links":{"cited_paper":"/paper/2411.18280","citing_paper":"/paper/2504.05902"},"observation_digest":"sha256:e5d1dee39ac2d9ee56c054316dcf988744e47f8e76f92f3092c90765dddce26b","observation_id":"54dff87c-639a-4984-b2ab-b6dd5dd8e5d7","resolution":{"observed_at":"2026-05-22T20:32:04.741912Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.18280","last_updated":"2024-11-27T12:15:22Z","snapshot_observed_at":"2026-08-13T14:51:43.520002Z","submitted_at":"2024-11-27T12:15:22Z","title":"Neutralizing Backdoors through Information Conflicts for Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.18280","snapshot_observed_at":"2026-08-06T16:24:30.476290Z","title":"Neutralizing backdoors through information conflicts for large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.13629","last_updated":"2025-07-18T03:41:18Z","snapshot_observed_at":"2026-08-11T02:36:37.124757Z","submitted_at":"2025-07-18T03:41:18Z","title":"Large Language Models in Cybersecurity: Applications, Vulnerabilities, and Defense Techniques","version":1},"reference_index":179,"source":"pdf_text","source_observed_at":"2026-08-06T16:24:30.476290Z"},"links":{"cited_paper":"/paper/2411.18280","citing_paper":"/paper/2507.13629"},"observation_digest":"sha256:bbc46d62387a3fba121e82e90bde9125be25993157d5b3d6b786972de957363d","observation_id":"084f9e84-66bf-4c39-85db-ab23fe4137f8","resolution":{"observed_at":"2026-08-06T16:24:30.476290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.18280","last_updated":"2024-11-27T12:15:22Z","snapshot_observed_at":"2026-08-13T14:51:43.520002Z","submitted_at":"2024-11-27T12:15:22Z","title":"Neutralizing Backdoors through Information Conflicts for Large Language Models","version":1},"cited_work":{"arxiv_id":"2411.18280","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.18280","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Neutralizing backdoors through information conflicts for large language models","venue":null,"work_id":"b0355498-df82-4e7c-a626-f6de4dc84fbf","year":2024},"citing_paper":{"arxiv_id":"2605.12529","last_updated":"2026-04-15T10:56:08Z","snapshot_observed_at":"2026-08-12T22:25:40.940152Z","submitted_at":"2026-04-15T10:56:08Z","title":"BackFlush: Knowledge-Free Backdoor Detection and Elimination with Watermark Preservation in Large Language Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-14T21:01:10.756844Z"},"links":{"cited_paper":"/paper/2411.18280","citing_paper":"/paper/2605.12529"},"observation_digest":"sha256:bb6c9756b16279cacf8cad3564316815cd38326cefa78b21cba6ccba7dcfc88d","observation_id":"109b2d8f-9d3a-40d2-b0d5-751942213e88","resolution":{"observed_at":"2026-05-14T21:02:58.913067Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2411.18280/citation-record","integrity":"/paper/2411.18280/integrity","json":"/paper/2411.18280/citation-record.json","paper":"/paper/2411.18280"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2404.06283","last_updated":"2025-07-06T06:19:35Z","snapshot_observed_at":"2026-08-13T00:34:12.745583Z","submitted_at":"2024-04-09T13:08:56Z","title":"LLMs' Reading Comprehension Is Affected by Parametric Knowledge and Struggles with Hypothetical Statements","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.06283","snapshot_observed_at":"2026-08-12T11:25:31.602989Z","title":"Llms’ reading comprehension is affected by parametric knowledge and struggles with hypothetical statements","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.18280","last_updated":"2024-11-27T12:15:22Z","snapshot_observed_at":"2026-08-13T14:51:43.520002Z","submitted_at":"2024-11-27T12:15:22Z","title":"Neutralizing Backdoors through Information Conflicts for Large Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T11:25:31.602989Z"},"links":{"cited_paper":"/paper/2404.06283","citing_paper":"/paper/2411.18280"},"observation_digest":"sha256:7665252d4aa1e2d815f3a5aaf3f65756d492566db711593787b5cbc473a9ba2a","observation_id":"cb0674ff-6e46-4cfd-84d9-3ab184341727","resolution":{"observed_at":"2026-08-12T11:25:31.602989Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:25:31.715870Z","title":"Towards stealthy backdoor attacks against speech recognition via elements of sound","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.18280","last_updated":"2024-11-27T12:15:22Z","snapshot_observed_at":"2026-08-13T14:51:43.520002Z","submitted_at":"2024-11-27T12:15:22Z","title":"Neutralizing Backdoors through Information Conflicts for Large Language Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T11:25:31.715870Z"},"links":{"citing_paper":"/paper/2411.18280"},"observation_digest":"sha256:fcbd4b411b8f28407cd4307c177de0e517882118a9a54210e81d591c09de2c88","observation_id":"6a047dc4-ce5a-4098-ab5b-ac84c4a66e5f","resolution":{"observed_at":"2026-08-12T11:25:31.715870Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:25:31.720156Z","title":"Badprompt: Backdoor attacks on continuous prompts","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.18280","last_updated":"2024-11-27T12:15:22Z","snapshot_observed_at":"2026-08-13T14:51:43.520002Z","submitted_at":"2024-11-27T12:15:22Z","title":"Neutralizing Backdoors through Information Conflicts for Large Language Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T11:25:31.720156Z"},"links":{"citing_paper":"/paper/2411.18280"},"observation_digest":"sha256:f4d2b213cd713c0550ee71ae9db4ed4b0cdcc62ab9ab0d22d6cc23ecee13d4d7","observation_id":"7589b42f-be3b-4e96-881d-a40215545385","resolution":{"observed_at":"2026-08-12T11:25:31.720156Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:25:31.724716Z","title":"Backdoor attacks and defenses for deep neural networks in outsourced cloud environments","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2411.18280","last_updated":"2024-11-27T12:15:22Z","snapshot_observed_at":"2026-08-13T14:51:43.520002Z","submitted_at":"2024-11-27T12:15:22Z","title":"Neutralizing Backdoors through Information Conflicts for Large Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T11:25:31.724716Z"},"links":{"citing_paper":"/paper/2411.18280"},"observation_digest":"sha256:02ef38e8f7a6121046de0bc85c3d9ad1e448847938143c1d3b76212aedd0a644","observation_id":"c2b896b6-e564-411f-ac3a-c9d7323db008","resolution":{"observed_at":"2026-08-12T11:25:31.724716Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:25:31.729614Z","title":"Deep reinforcement learning from human preferences","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2411.18280","last_updated":"2024-11-27T12:15:22Z","snapshot_observed_at":"2026-08-13T14:51:43.520002Z","submitted_at":"2024-11-27T12:15:22Z","title":"Neutralizing Backdoors through Information Conflicts for Large Language Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T11:25:31.729614Z"},"links":{"citing_paper":"/paper/2411.18280"},"observation_digest":"sha256:4e0a68ba929a4dea9f97f100f4556738bd98d32e32a349d99cbdc2823247ce2b","observation_id":"420e154c-6827-42b1-9e4c-7f186849291b","resolution":{"observed_at":"2026-08-12T11:25:31.729614Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.07970","last_updated":"2022-04-27T14:39:03Z","snapshot_observed_at":"2026-08-13T13:11:13.332957Z","submitted_at":"2021-11-15T18:36:25Z","title":"Triggerless Backdoor Attack for NLP Tasks with Clean Labels","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.07970","snapshot_observed_at":"2026-08-12T11:25:31.733560Z","title":"Triggerless backdoor at- tack for nlp tasks with clean labels","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.18280","last_updated":"2024-11-27T12:15:22Z","snapshot_observed_at":"2026-08-13T14:51:43.520002Z","submitted_at":"2024-11-27T12:15:22Z","title":"Neutralizing Backdoors through Information Conflicts for Large Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T11:25:31.733560Z"},"links":{"cited_paper":"/paper/2111.07970","citing_paper":"/paper/2411.18280"},"observation_digest":"sha256:21d08db5b7c2b9d3f835150a3980c5f23e4bc191b66753228fa1f3c0ca13c9e1","observation_id":"567f79f8-5ec7-4561-bb60-74a454622479","resolution":{"observed_at":"2026-08-12T11:25:31.733560Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.13257","last_updated":"2025-01-09T22:21:56Z","snapshot_observed_at":"2026-08-13T00:49:51.629317Z","submitted_at":"2024-03-20T02:38:01Z","title":"Arcee's MergeKit: A Toolkit for Merging Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.13257","snapshot_observed_at":"2026-08-12T11:25:31.738281Z","title":"Arcee’s mergekit: A toolkit for merging large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.18280","last_updated":"2024-11-27T12:15:22Z","snapshot_observed_at":"2026-08-13T14:51:43.520002Z","submitted_at":"2024-11-27T12:15:22Z","title":"Neutralizing Backdoors through Information Conflicts for Large Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T11:25:31.738281Z"},"links":{"cited_paper":"/paper/2403.13257","citing_paper":"/paper/2411.18280"},"observation_digest":"sha256:5c4547c870e00981fe7e759a89f97c39500990da4509c49b65ab934e87f916c7","observation_id":"06db0671-0c72-406e-8cc5-c05f2eeb4cb2","resolution":{"observed_at":"2026-08-12T11:25:31.738281Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:25:33.063035Z","title":"Atteq- nn: Attention-based qoe-aware evasive backdoor attacks","venue":null,"work_id":"9c461521-e096-408b-9462-dc270f017a8e","year":2022},"citing_paper":{"arxiv_id":"2411.18280","last_updated":"2024-11-27T12:15:22Z","snapshot_observed_at":"2026-08-13T14:51:43.520002Z","submitted_at":"2024-11-27T12:15:22Z","title":"Neutralizing Backdoors through Information Conflicts for Large Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T11:25:31.742969Z"},"links":{"citing_paper":"/paper/2411.18280"},"observation_digest":"sha256:c13f64983fcbe1042c83687a9b641959ca1cddd2272d65db367e25ab10180839","observation_id":"e0647061-67e6-4b24-ae4d-4c7ca155787f","resolution":{"observed_at":"2026-08-12T11:25:33.067462Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:25:33.051017Z","title":"Defense-resistant backdoor at- tacks against deep neural networks in outsourced cloud environment","venue":null,"work_id":"4426ed58-9096-4ee2-bc69-0e54ccdae232","year":2021},"citing_paper":{"arxiv_id":"2411.18280","last_updated":"2024-11-27T12:15:22Z","snapshot_observed_at":"2026-08-13T14:51:43.520002Z","submitted_at":"2024-11-27T12:15:22Z","title":"Neutralizing Backdoors through Information Conflicts for Large Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T11:25:31.747025Z"},"links":{"citing_paper":"/paper/2411.18280"},"observation_digest":"sha256:6dc24b881731eb33e4feef5824705be74d01f8b35c880e3811f8ba615345d48e","observation_id":"59eb5a7b-f180-472b-aafb-1ed4c82ed17c","resolution":{"observed_at":"2026-08-12T11:25:33.055306Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:25:33.039460Z","title":"Redeem myself: Purifying back- doors in deep learning models using self attention distillation","venue":null,"work_id":"5a7f3fca-fd77-44bc-ad23-17cafb7711e9","year":2023},"citing_paper":{"arxiv_id":"2411.18280","last_updated":"2024-11-27T12:15:22Z","snapshot_observed_at":"2026-08-13T14:51:43.520002Z","submitted_at":"2024-11-27T12:15:22Z","title":"Neutralizing Backdoors through Information Conflicts for Large Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T11:25:31.751083Z"},"links":{"citing_paper":"/paper/2411.18280"},"observation_digest":"sha256:4c8b11558bab76d4808281473508602c7490cbbe21723e7a65ed6ead15f32a35","observation_id":"ffe75be8-b1b9-416f-ad59-4e8412a31237","resolution":{"observed_at":"2026-08-12T11:25:33.043038Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:25:33.026956Z","title":"Palette: Physically-realizable backdoor attacks against video recognition models","venue":null,"work_id":"81cf9c34-11ec-4456-8150-83a983f93eb6","year":2024},"citing_paper":{"arxiv_id":"2411.18280","last_updated":"2024-11-27T12:15:22Z","snapshot_observed_at":"2026-08-13T14:51:43.520002Z","submitted_at":"2024-11-27T12:15:22Z","title":"Neutralizing Backdoors through Information Conflicts for Large Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T11:25:31.754843Z"},"links":{"citing_paper":"/paper/2411.18280"},"observation_digest":"sha256:7d6308d0137aed3900c1d83ac8206c102ab956c1fb1f20faef7fab0679ce8d8f","observation_id":"d1808e2a-406b-4105-a28b-df642321c0ae","resolution":{"observed_at":"2026-08-12T11:25:33.031264Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02406","last_updated":"2024-04-03T02:16:53Z","snapshot_observed_at":"2026-08-13T00:38:50.172090Z","submitted_at":"2024-04-03T02:16:53Z","title":"Exploring Backdoor Vulnerabilities of Chat Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02406","snapshot_observed_at":"2026-08-12T11:25:31.758683Z","title":"Exploring backdoor vulnerabilities of chat models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.18280","last_updated":"2024-11-27T12:15:22Z","snapshot_observed_at":"2026-08-13T14:51:43.520002Z","submitted_at":"2024-11-27T12:15:22Z","title":"Neutralizing Backdoors through Information Conflicts for Large Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T11:25:31.758683Z"},"links":{"cited_paper":"/paper/2404.02406","citing_paper":"/paper/2411.18280"},"observation_digest":"sha256:ee322fb9e4db1c8e4f71aaac653f872508a18cca849531609a4d34c7d0251a8e","observation_id":"ac494351-aa6c-426e-98f5-a8e12015de78","resolution":{"observed_at":"2026-08-12T11:25:31.758683Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-11T08:20:29.798517Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-12T11:25:31.763613Z","title":"Lora: Low-rank adaptation of large language models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.18280","last_updated":"2024-11-27T12:15:22Z","snapshot_observed_at":"2026-08-13T14:51:43.520002Z","submitted_at":"2024-11-27T12:15:22Z","title":"Neutralizing Backdoors through Information Conflicts for Large Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T11:25:31.763613Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2411.18280"},"observation_digest":"sha256:c32668bb071a6a1ba6c725af236279cd1cf10fd72afb2da4880b397df8af7001","observation_id":"b00b7f88-4582-4804-a221-28912fde4779","resolution":{"observed_at":"2026-08-12T11:25:31.763613Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.07676","last_updated":"2024-03-30T16:09:34Z","snapshot_observed_at":"2026-08-13T05:51:58.524753Z","submitted_at":"2023-10-11T17:21:03Z","title":"Composite Backdoor Attacks Against Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.07676","snapshot_observed_at":"2026-08-12T11:25:31.767450Z","title":"Composite backdoor attacks against large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.18280","last_updated":"2024-11-27T12:15:22Z","snapshot_observed_at":"2026-08-13T14:51:43.520002Z","submitted_at":"2024-11-27T12:15:22Z","title":"Neutralizing Backdoors through Information Conflicts for Large Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T11:25:31.767450Z"},"links":{"cited_paper":"/paper/2310.07676","citing_paper":"/paper/2411.18280"},"observation_digest":"sha256:b273f11944adf132275ee5678b9b9e6c243c4dc21eefb35ae1ef25f9afb9a949","observation_id":"822fde64-ea24-472d-a746-fb8a60c856b8","resolution":{"observed_at":"2026-08-12T11:25:31.767450Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.05566","last_updated":"2024-01-17T20:26:01Z","snapshot_observed_at":"2026-08-12T12:19:52.685961Z","submitted_at":"2024-01-10T22:14:35Z","title":"Sleeper Agents: Training Deceptive LLMs that Persist Through Safety Training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.05566","snapshot_observed_at":"2026-08-12T11:25:31.770839Z","title":"Sleeper agents: Training decep- tive LLMs that persist through safety training","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.18280","last_updated":"2024-11-27T12:15:22Z","snapshot_observed_at":"2026-08-13T14:51:43.520002Z","submitted_at":"2024-11-27T12:15:22Z","title":"Neutralizing Backdoors through Information Conflicts for Large Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T11:25:31.770839Z"},"links":{"cited_paper":"/paper/2401.05566","citing_paper":"/paper/2411.18280"},"observation_digest":"sha256:5be82a1cbf353703552d87920af710be9b02166b359c4872dba0e82f5f2f5b6f","observation_id":"e615a840-db0c-4d91-ae40-5db4d5837cea","resolution":{"observed_at":"2026-08-12T11:25:31.770839Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.04089","last_updated":"2023-03-31T15:27:01Z","snapshot_observed_at":"2026-08-13T03:27:01.609831Z","submitted_at":"2022-12-08T05:50:53Z","title":"Editing Models with Task Arithmetic","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.04089","snapshot_observed_at":"2026-08-12T11:25:31.774376Z","title":"Editing models with task arithmetic","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.18280","last_updated":"2024-11-27T12:15:22Z","snapshot_observed_at":"2026-08-13T14:51:43.520002Z","submitted_at":"2024-11-27T12:15:22Z","title":"Neutralizing Backdoors through Information Conflicts for Large Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T11:25:31.774376Z"},"links":{"cited_paper":"/paper/2212.04089","citing_paper":"/paper/2411.18280"},"observation_digest":"sha256:0782c703b2cd3b1b6adfdfbb734ff1a93251d9a696aa55e9446d4913773b1000","observation_id":"e03ff390-c910-4c8a-a8bd-e04497729101","resolution":{"observed_at":"2026-08-12T11:25:31.774376Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:25:33.012668Z","title":"Model-reuse attacks on deep learning systems","venue":null,"work_id":"52feaf4a-beb6-419f-a87e-3b1ebd99f580","year":2018},"citing_paper":{"arxiv_id":"2411.18280","last_updated":"2024-11-27T12:15:22Z","snapshot_observed_at":"2026-08-13T14:51:43.520002Z","submitted_at":"2024-11-27T12:15:22Z","title":"Neutralizing Backdoors through Information Conflicts for Large Language Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T11:25:31.778148Z"},"links":{"citing_paper":"/paper/2411.18280"},"observation_digest":"sha256:f324e1544d44bdbb6fba55bc57e5d46acfefb534d0d163c658a9e47a4193104f","observation_id":"122e5b0b-a68d-4800-88b5-f5a081a6abf3","resolution":{"observed_at":"2026-08-12T11:25:33.017144Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:25:31.781129Z","title":"Backdoor attacks against learning systems","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2411.18280","last_updated":"2024-11-27T12:15:22Z","snapshot_observed_at":"2026-08-13T14:51:43.520002Z","submitted_at":"2024-11-27T12:15:22Z","title":"Neutralizing Backdoors through Information Conflicts for Large Language Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T11:25:31.781129Z"},"links":{"citing_paper":"/paper/2411.18280"},"observation_digest":"sha256:908f0c20df9f26e0aab2f7763004112a3f241cc6237823385a4988818dd39d52","observation_id":"7d655ecf-9972-4d3e-8c02-0b21adbc3117","resolution":{"observed_at":"2026-08-12T11:25:31.781129Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:25:32.991998Z","title":"Chatgpt for good? On opportunities and challenges of large language models for education","venue":null,"work_id":"2a072d33-95fc-4d75-8d5e-f2393f428054","year":2023},"citing_paper":{"arxiv_id":"2411.18280","last_updated":"2024-11-27T12:15:22Z","snapshot_observed_at":"2026-08-13T14:51:43.520002Z","submitted_at":"2024-11-27T12:15:22Z","title":"Neutralizing Backdoors through Information Conflicts for Large Language Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T11:25:31.784455Z"},"links":{"citing_paper":"/paper/2411.18280"},"observation_digest":"sha256:7e460c7da013ba1f6c092a06748498cf3d2f5e77538335317e6bad5e009ce31b","observation_id":"d96fe5b8-da66-44e6-a456-84c0163b8fa5","resolution":{"observed_at":"2026-08-12T11:25:32.996875Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:25:32.979762Z","title":"Textual backdoor attack for the text classification system","venue":null,"work_id":"31737f67-0355-4261-be96-88f1b05d3a2f","year":2021},"citing_paper":{"arxiv_id":"2411.18280","last_updated":"2024-11-27T12:15:22Z","snapshot_observed_at":"2026-08-13T14:51:43.520002Z","submitted_at":"2024-11-27T12:15:22Z","title":"Neutralizing Backdoors through Information Conflicts for Large Language Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T11:25:31.787890Z"},"links":{"citing_paper":"/paper/2411.18280"},"observation_digest":"sha256:fd7bfcbb88e13c92fc49fd7da54b3b5a79d0be6352ee8908ad77c074a5cab884","observation_id":"0a46bc26-72b7-4500-8f9a-bfe24e8f1979","resolution":{"observed_at":"2026-08-12T11:25:32.984067Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:25:32.967037Z","title":"Fast inference from transformers via speculative decoding","venue":null,"work_id":"0f1c0d65-7800-4d35-9cfc-685ea94b2a2e","year":2023},"citing_paper":{"arxiv_id":"2411.18280","last_updated":"2024-11-27T12:15:22Z","snapshot_observed_at":"2026-08-13T14:51:43.520002Z","submitted_at":"2024-11-27T12:15:22Z","title":"Neutralizing Backdoors through Information Conflicts for Large Language Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T11:25:31.791323Z"},"links":{"citing_paper":"/paper/2411.18280"},"observation_digest":"sha256:f9506c52078aed51a674104baeeccb504e1a3586063422cb5f81a102b4b16985","observation_id":"f0922503-6277-4e7a-8c99-dd9ff70c5a4e","resolution":{"observed_at":"2026-08-12T11:25:32.971542Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.07667","last_updated":"2024-12-15T05:55:43Z","snapshot_observed_at":"2026-08-13T23:26:37.480109Z","submitted_at":"2024-05-13T11:53:42Z","title":"Simulate and Eliminate: Revoke Backdoors for Generative Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.07667","snapshot_observed_at":"2026-08-12T11:25:31.794884Z","title":"Backdoor removal for generative large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.18280","last_updated":"2024-11-27T12:15:22Z","snapshot_observed_at":"2026-08-13T14:51:43.520002Z","submitted_at":"2024-11-27T12:15:22Z","title":"Neutralizing Backdoors through Information Conflicts for Large Language Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T11:25:31.794884Z"},"links":{"cited_paper":"/paper/2405.07667","citing_paper":"/paper/2411.18280"},"observation_digest":"sha256:31d83b809e436d3c7a6acf7dd2239b7044f020cde809c31f3c51af788690366d","observation_id":"dba8c6d9-a6d2-462f-9b68-38fc751fdea4","resolution":{"observed_at":"2026-08-12T11:25:31.794884Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.13888","last_updated":"2021-08-31T14:47:37Z","snapshot_observed_at":"2026-08-13T18:19:53.158436Z","submitted_at":"2021-08-31T14:47:37Z","title":"Backdoor Attacks on Pre-trained Models by Layerwise Weight Poisoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.13888","snapshot_observed_at":"2026-08-12T11:25:31.798794Z","title":"Backdoor attacks on pre-trained models by layerwise weight poisoning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.18280","last_updated":"2024-11-27T12:15:22Z","snapshot_observed_at":"2026-08-13T14:51:43.520002Z","submitted_at":"2024-11-27T12:15:22Z","title":"Neutralizing Backdoors through Information Conflicts for Large Language Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T11:25:31.798794Z"},"links":{"cited_paper":"/paper/2108.13888","citing_paper":"/paper/2411.18280"},"observation_digest":"sha256:1000df528371bab155648960afda7840b4fde7bad30b825e96fa9ff80800edda","observation_id":"3ea7470e-95fe-4159-85dc-91d73704e64d","resolution":{"observed_at":"2026-08-12T11:25:31.798794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:25:31.802721Z","title":"Chain- of-scrutiny: Detecting backdoor attacks for large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.18280","last_updated":"2024-11-27T12:15:22Z","snapshot_observed_at":"2026-08-13T14:51:43.520002Z","submitted_at":"2024-11-27T12:15:22Z","title":"Neutralizing Backdoors through Information Conflicts for Large Language Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T11:25:31.802721Z"},"links":{"citing_paper":"/paper/2411.18280"},"observation_digest":"sha256:aef5ce5f8681df7405576129923bbc57555d9e41bbb03f07fdfe42abd5f9daca","observation_id":"98cf3539-0236-4753-bd3e-ffd4d011d18f","resolution":{"observed_at":"2026-08-12T11:25:31.802721Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.13355","last_updated":"2024-03-20T07:34:18Z","snapshot_observed_at":"2026-08-13T00:49:45.268617Z","submitted_at":"2024-03-20T07:34:18Z","title":"BadEdit: Backdooring large language models by model editing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.13355","snapshot_observed_at":"2026-08-12T11:25:31.806553Z","title":"Badedit: Back- dooring large language models by model editing","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.18280","last_updated":"2024-11-27T12:15:22Z","snapshot_observed_at":"2026-08-13T14:51:43.520002Z","submitted_at":"2024-11-27T12:15:22Z","title":"Neutralizing Backdoors through Information Conflicts for Large Language Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T11:25:31.806553Z"},"links":{"cited_paper":"/paper/2403.13355","citing_paper":"/paper/2411.18280"},"observation_digest":"sha256:99218829fad0a788a7378c28639207d9dc2e1cbbe7682ad8844658d02866dd07","observation_id":"7b81a080-d614-4825-8d0b-482e68e2f5ed","resolution":{"observed_at":"2026-08-12T11:25:31.806553Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.08350","last_updated":"2023-06-14T08:38:51Z","snapshot_observed_at":"2026-08-13T22:57:05.609763Z","submitted_at":"2023-06-14T08:38:51Z","title":"Multi-target Backdoor Attacks for Code Pre-trained Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.08350","snapshot_observed_at":"2026-08-12T11:25:31.810305Z","title":"Multi-target backdoor attacks for code pre- trained models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.18280","last_updated":"2024-11-27T12:15:22Z","snapshot_observed_at":"2026-08-13T14:51:43.520002Z","submitted_at":"2024-11-27T12:15:22Z","title":"Neutralizing Backdoors through Information Conflicts for Large Language Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T11:25:31.810305Z"},"links":{"cited_paper":"/paper/2306.08350","citing_paper":"/paper/2411.18280"},"observation_digest":"sha256:e37986899850aaf1d047117078ece5edb573fe6e7948effd0e740c42f8f4c76c","observation_id":"f89a63e3-32a8-477d-9ddd-48c55ed2c1e6","resolution":{"observed_at":"2026-08-12T11:25:31.810305Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:25:31.814198Z","title":"Neural attention distillation: Erasing backdoor triggers from deep neural networks","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.18280","last_updated":"2024-11-27T12:15:22Z","snapshot_observed_at":"2026-08-13T14:51:43.520002Z","submitted_at":"2024-11-27T12:15:22Z","title":"Neutralizing Backdoors through Information Conflicts for Large Language Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T11:25:31.814198Z"},"links":{"citing_paper":"/paper/2411.18280"},"observation_digest":"sha256:ed0096610fad799a45a6d0a0aca7c80dfbeca4ee9bf5c0b8e11a94187a1889d7","observation_id":"a6cbb5af-4ac9-4746-b982-adee26ecd11b","resolution":{"observed_at":"2026-08-12T11:25:31.814198Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2101.05930","last_updated":"2021-01-27T06:23:25Z","snapshot_observed_at":"2026-08-09T17:23:56.910001Z","submitted_at":"2021-01-15T01:35:22Z","title":"Neural Attention Distillation: Erasing Backdoor Triggers from Deep Neural Networks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2101.05930","snapshot_observed_at":"2026-08-12T11:25:31.817782Z","title":"Neural attention distillation: Erasing backdoor triggers from deep neural networks","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.18280","last_updated":"2024-11-27T12:15:22Z","snapshot_observed_at":"2026-08-13T14:51:43.520002Z","submitted_at":"2024-11-27T12:15:22Z","title":"Neutralizing Backdoors through Information Conflicts for Large Language Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-12T11:25:31.817782Z"},"links":{"cited_paper":"/paper/2101.05930","citing_paper":"/paper/2411.18280"},"observation_digest":"sha256:914bc3239c86e7e83948fe5db88ef40d0b7b6efc92f342cff9ccddd00a4305c1","observation_id":"64c6903c-033b-440b-8992-7a8cc5ca09d2","resolution":{"observed_at":"2026-08-12T11:25:31.817782Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2004.04692","last_updated":"2021-01-31T17:25:49Z","snapshot_observed_at":"2026-08-13T23:03:12.177796Z","submitted_at":"2020-04-09T17:19:37Z","title":"Rethinking the Trigger of Backdoor Attack","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.04692","snapshot_observed_at":"2026-08-12T11:25:31.821516Z","title":"Rethinking the trigger of backdoor attack","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2411.18280","last_updated":"2024-11-27T12:15:22Z","snapshot_observed_at":"2026-08-13T14:51:43.520002Z","submitted_at":"2024-11-27T12:15:22Z","title":"Neutralizing Backdoors through Information Conflicts for Large Language Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-12T11:25:31.821516Z"},"links":{"cited_paper":"/paper/2004.04692","citing_paper":"/paper/2411.18280"},"observation_digest":"sha256:e770851a0f28affd531aea2983f594312aa850ecfe42a37683f63914b106a377","observation_id":"ae2f896f-5e55-4068-931b-07461e45eff8","resolution":{"observed_at":"2026-08-12T11:25:31.821516Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12257","last_updated":"2025-03-27T16:21:02Z","snapshot_observed_at":"2026-08-12T23:40:27.733082Z","submitted_at":"2024-06-18T04:10:38Z","title":"CleanGen: Mitigating Backdoor Attacks for Generation Tasks in Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.12257","snapshot_observed_at":"2026-08-12T11:25:31.825411Z","title":"Clean- gen: Mitigating backdoor attacks for generation tasks in large lan- guage models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.18280","last_updated":"2024-11-27T12:15:22Z","snapshot_observed_at":"2026-08-13T14:51:43.520002Z","submitted_at":"2024-11-27T12:15:22Z","title":"Neutralizing Backdoors through Information Conflicts for Large Language Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-12T11:25:31.825411Z"},"links":{"cited_paper":"/paper/2406.12257","citing_paper":"/paper/2411.18280"},"observation_digest":"sha256:6c35359c1f41c64d5d27407578b52c14bdb998bb2574d6f801c142228733c0f4","observation_id":"11159c6e-aefe-4eb8-a3e3-d01867c06591","resolution":{"observed_at":"2026-08-12T11:25:31.825411Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02129","last_updated":"2024-05-10T18:35:48Z","snapshot_observed_at":"2026-08-13T05:58:20.884077Z","submitted_at":"2023-10-03T15:10:46Z","title":"Unveiling the Pitfalls of Knowledge Editing for Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.02129","snapshot_observed_at":"2026-08-12T11:25:31.829209Z","title":"Unveiling the pitfalls of knowledge editing for large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.18280","last_updated":"2024-11-27T12:15:22Z","snapshot_observed_at":"2026-08-13T14:51:43.520002Z","submitted_at":"2024-11-27T12:15:22Z","title":"Neutralizing Backdoors through Information Conflicts for Large Language Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-12T11:25:31.829209Z"},"links":{"cited_paper":"/paper/2310.02129","citing_paper":"/paper/2411.18280"},"observation_digest":"sha256:dd492fc7f041715dc5134cb9e059afeadf71687031f0539598b588e594ddf8f9","observation_id":"cbe87eda-653d-4856-a38f-027cbd379473","resolution":{"observed_at":"2026-08-12T11:25:31.829209Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:25:32.947990Z","title":"Composite backdoor attack for deep neural network by mixing existing benign features","venue":null,"work_id":"0d1173bc-3957-475d-a49c-7ac49bd097f8","year":2020},"citing_paper":{"arxiv_id":"2411.18280","last_updated":"2024-11-27T12:15:22Z","snapshot_observed_at":"2026-08-13T14:51:43.520002Z","submitted_at":"2024-11-27T12:15:22Z","title":"Neutralizing Backdoors through Information Conflicts for Large Language Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-12T11:25:31.832923Z"},"links":{"citing_paper":"/paper/2411.18280"},"observation_digest":"sha256:5af38b3673a28ff0f290e249ce04f5158c1bc589002ab09f9f536f6f8c12b342","observation_id":"e9e9242c-14c0-47e2-93d1-3872ce1394b4","resolution":{"observed_at":"2026-08-12T11:25:32.951917Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:25:31.836786Z","title":"Fine-pruning: Defending against backdooring attacks on deep neural networks","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2411.18280","last_updated":"2024-11-27T12:15:22Z","snapshot_observed_at":"2026-08-13T14:51:43.520002Z","submitted_at":"2024-11-27T12:15:22Z","title":"Neutralizing Backdoors through Information Conflicts for Large Language Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-12T11:25:31.836786Z"},"links":{"citing_paper":"/paper/2411.18280"},"observation_digest":"sha256:bc1425bc0c8cb27d3465fc8654914b9ab84cc07deb19e2ffe2e4548af15ba50b","observation_id":"03b98c03-cc34-4c47-b980-62a0e08192ba","resolution":{"observed_at":"2026-08-12T11:25:31.836786Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:25:32.927071Z","title":"Oppor- tunistic backdoor attacks: Exploring human-imperceptible vulnerabil- ities on speech recognition systems","venue":null,"work_id":"934e3168-def7-4294-8f73-ec75ef20e6b5","year":2022},"citing_paper":{"arxiv_id":"2411.18280","last_updated":"2024-11-27T12:15:22Z","snapshot_observed_at":"2026-08-13T14:51:43.520002Z","submitted_at":"2024-11-27T12:15:22Z","title":"Neutralizing Backdoors through Information Conflicts for Large Language Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-12T11:25:31.840184Z"},"links":{"citing_paper":"/paper/2411.18280"},"observation_digest":"sha256:08e30b47a6d181aabf0c3c0b4877c1ccab7f22c756ad928af7ca24778f68a7dd","observation_id":"bc73ad7b-cef3-4a96-9775-b8bcd0602b16","resolution":{"observed_at":"2026-08-12T11:25:32.931350Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:25:32.913495Z","title":"Trojaning attack on neural networks","venue":null,"work_id":"f0db2a0a-1e3c-4e11-9229-981ff1940ff6","year":2018},"citing_paper":{"arxiv_id":"2411.18280","last_updated":"2024-11-27T12:15:22Z","snapshot_observed_at":"2026-08-13T14:51:43.520002Z","submitted_at":"2024-11-27T12:15:22Z","title":"Neutralizing Backdoors through Information Conflicts for Large Language Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-12T11:25:31.843944Z"},"links":{"citing_paper":"/paper/2411.18280"},"observation_digest":"sha256:2b27e1da4a290b96b1b9624231671779e97080462a2a583fd7894aef8708ac8d","observation_id":"a5588800-d98c-4439-bdf8-096acdc63121","resolution":{"observed_at":"2026-08-12T11:25:32.917866Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:25:32.900524Z","title":"Practical backdoor attack against speaker recognition system","venue":null,"work_id":"6a46d367-df76-4af4-b8fa-bc1d2214a907","year":2022},"citing_paper":{"arxiv_id":"2411.18280","last_updated":"2024-11-27T12:15:22Z","snapshot_observed_at":"2026-08-13T14:51:43.520002Z","submitted_at":"2024-11-27T12:15:22Z","title":"Neutralizing Backdoors through Information Conflicts for Large Language Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-12T11:25:31.846978Z"},"links":{"citing_paper":"/paper/2411.18280"},"observation_digest":"sha256:9a6b58bb0aa465d4e030473bdf1690156bf0792132e003c4c0f8a6fc47d89018","observation_id":"06c1b231-9583-422a-9235-fb28bf1851a1","resolution":{"observed_at":"2026-08-12T11:25:32.904618Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:25:31.849848Z","title":"Locating and editing factual associations in gpt","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.18280","last_updated":"2024-11-27T12:15:22Z","snapshot_observed_at":"2026-08-13T14:51:43.520002Z","submitted_at":"2024-11-27T12:15:22Z","title":"Neutralizing Backdoors through Information Conflicts for Large Language Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-12T11:25:31.849848Z"},"links":{"citing_paper":"/paper/2411.18280"},"observation_digest":"sha256:4209fb207ba80bd690c593a24fa14cc997d54583612a8cf2d5aded4f2b782c16","observation_id":"8bc59306-abd7-4a5b-9e47-0f31f8e2fdef","resolution":{"observed_at":"2026-08-12T11:25:31.849848Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.07229","last_updated":"2023-08-01T18:41:52Z","snapshot_observed_at":"2026-08-13T02:17:30.405636Z","submitted_at":"2022-10-13T17:55:53Z","title":"Mass-Editing Memory in a Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.07229","snapshot_observed_at":"2026-08-12T11:25:31.853369Z","title":"Mass-editing memory in a transformer","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.18280","last_updated":"2024-11-27T12:15:22Z","snapshot_observed_at":"2026-08-13T14:51:43.520002Z","submitted_at":"2024-11-27T12:15:22Z","title":"Neutralizing Backdoors through Information Conflicts for Large Language Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-12T11:25:31.853369Z"},"links":{"cited_paper":"/paper/2210.07229","citing_paper":"/paper/2411.18280"},"observation_digest":"sha256:6a654fee92beb9ae084e574f731b356720dabb55f92e16d905c257dabdd0687d","observation_id":"aa8dfa28-5566-4a18-820e-71ae7878e1a9","resolution":{"observed_at":"2026-08-12T11:25:31.853369Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:25:32.880271Z","title":"Textrank: Bringing order into text","venue":null,"work_id":"eb2c3992-bc59-4d2d-b3be-87c860f5dfa0","year":2004},"citing_paper":{"arxiv_id":"2411.18280","last_updated":"2024-11-27T12:15:22Z","snapshot_observed_at":"2026-08-13T14:51:43.520002Z","submitted_at":"2024-11-27T12:15:22Z","title":"Neutralizing Backdoors through Information Conflicts for Large Language Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-12T11:25:31.856416Z"},"links":{"citing_paper":"/paper/2411.18280"},"observation_digest":"sha256:a04931efbe88c069e26ff5f15f216ee58fd8a96180f6c58e17da8fb07f9d385e","observation_id":"7240ef11-81d9-4756-b7a3-2c89c03a709f","resolution":{"observed_at":"2026-08-12T11:25:32.884143Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:25:32.867372Z","title":"Training language models to follow in- structions with human feedback","venue":null,"work_id":"838c9bd7-793a-43cb-842b-63b87ceefb4c","year":2022},"citing_paper":{"arxiv_id":"2411.18280","last_updated":"2024-11-27T12:15:22Z","snapshot_observed_at":"2026-08-13T14:51:43.520002Z","submitted_at":"2024-11-27T12:15:22Z","title":"Neutralizing Backdoors through Information Conflicts for Large Language Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-12T11:25:31.859664Z"},"links":{"citing_paper":"/paper/2411.18280"},"observation_digest":"sha256:79257077ed8675ae97dd7ac5a36679f5effd2dedaa9eb6307a4eecdf591c1ce0","observation_id":"91337975-2812-4709-a5b3-be5f43af3374","resolution":{"observed_at":"2026-08-12T11:25:32.872525Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:25:32.853212Z","title":"Hidden trigger backdoor attack on NLP models via linguistic style manipulation","venue":null,"work_id":"7d0f0c13-8f80-428c-bc4d-b0ad04fb6abd","year":2022},"citing_paper":{"arxiv_id":"2411.18280","last_updated":"2024-11-27T12:15:22Z","snapshot_observed_at":"2026-08-13T14:51:43.520002Z","submitted_at":"2024-11-27T12:15:22Z","title":"Neutralizing Backdoors through Information Conflicts for Large Language Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-12T11:25:31.863535Z"},"links":{"citing_paper":"/paper/2411.18280"},"observation_digest":"sha256:fab52c05a11b60183749b68e9cbee5a652066a7651ece05ff5844038b75e5ee1","observation_id":"e811145f-096c-4685-8823-20f7bae94005","resolution":{"observed_at":"2026-08-12T11:25:32.857460Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2011.10369","last_updated":"2021-11-03T18:21:00Z","snapshot_observed_at":"2026-08-08T00:46:05.240737Z","submitted_at":"2020-11-20T12:17:21Z","title":"ONION: A Simple and Effective Defense Against Textual Backdoor Attacks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2011.10369","snapshot_observed_at":"2026-08-12T11:25:31.866664Z","title":"Onion: A simple and effective defense against textual backdoor attacks","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2411.18280","last_updated":"2024-11-27T12:15:22Z","snapshot_observed_at":"2026-08-13T14:51:43.520002Z","submitted_at":"2024-11-27T12:15:22Z","title":"Neutralizing Backdoors through Information Conflicts for Large Language Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-12T11:25:31.866664Z"},"links":{"cited_paper":"/paper/2011.10369","citing_paper":"/paper/2411.18280"},"observation_digest":"sha256:ce778bf428f0813093711e23d8747f660f64a4baa6dceb2430b67f9b36ab2990","observation_id":"4716844b-a90b-4edb-a987-0f8a4b1ff7a3","resolution":{"observed_at":"2026-08-12T11:25:31.866664Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2105.12400","last_updated":"2021-06-03T08:27:11Z","snapshot_observed_at":"2026-08-14T07:13:41.638102Z","submitted_at":"2021-05-26T08:54:19Z","title":"Hidden Killer: Invisible Textual Backdoor Attacks with Syntactic Trigger","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.12400","snapshot_observed_at":"2026-08-12T11:25:31.870461Z","title":"Hidden killer: Invisi- ble textual backdoor attacks with syntactic trigger","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.18280","last_updated":"2024-11-27T12:15:22Z","snapshot_observed_at":"2026-08-13T14:51:43.520002Z","submitted_at":"2024-11-27T12:15:22Z","title":"Neutralizing Backdoors through Information Conflicts for Large Language Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-12T11:25:31.870461Z"},"links":{"cited_paper":"/paper/2105.12400","citing_paper":"/paper/2411.18280"},"observation_digest":"sha256:2d35b9aca894607853607cd8625df437f41ef06824a6f5509d0890d74d4666fa","observation_id":"cd7ae26f-e406-410a-b3d9-b6d9d6b9e159","resolution":{"observed_at":"2026-08-12T11:25:31.870461Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:25:32.839960Z","title":"Towards a proactive ML approach for detecting backdoor poison samples","venue":null,"work_id":"f6f8e61d-ec10-4f25-b256-98f83bdd4eb6","year":2023},"citing_paper":{"arxiv_id":"2411.18280","last_updated":"2024-11-27T12:15:22Z","snapshot_observed_at":"2026-08-13T14:51:43.520002Z","submitted_at":"2024-11-27T12:15:22Z","title":"Neutralizing Backdoors through Information Conflicts for Large Language Models","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-12T11:25:31.874418Z"},"links":{"citing_paper":"/paper/2411.18280"},"observation_digest":"sha256:b85532c7658d67e2d116195d6170cbc9006390ea8af10ca14c4c704652ab31ef","observation_id":"26904e98-9ff1-49b1-97bf-2a24116dd2b7","resolution":{"observed_at":"2026-08-12T11:25:32.844028Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03693","last_updated":"2023-10-05T17:12:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-05T17:12:17Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.03693","snapshot_observed_at":"2026-08-12T11:25:31.877735Z","title":"Fine-tuning aligned language models compromises safety, even when users do not intend to! arXiv preprint arXiv:2310.03693, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.18280","last_updated":"2024-11-27T12:15:22Z","snapshot_observed_at":"2026-08-13T14:51:43.520002Z","submitted_at":"2024-11-27T12:15:22Z","title":"Neutralizing Backdoors through Information Conflicts for Large Language Models","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-12T11:25:31.877735Z"},"links":{"cited_paper":"/paper/2310.03693","citing_paper":"/paper/2411.18280"},"observation_digest":"sha256:555c82a658db2a586f374ca7f45d27b7ef786f08524a7f0ec7e533de01b61b56","observation_id":"98a05522-fb2b-48ef-a822-ef0518a3d723","resolution":{"observed_at":"2026-08-12T11:25:31.877735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:25:31.881642Z","title":"Language models are unsupervised multitask learners","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2411.18280","last_updated":"2024-11-27T12:15:22Z","snapshot_observed_at":"2026-08-13T14:51:43.520002Z","submitted_at":"2024-11-27T12:15:22Z","title":"Neutralizing Backdoors through Information Conflicts for Large Language Models","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-12T11:25:31.881642Z"},"links":{"citing_paper":"/paper/2411.18280"},"observation_digest":"sha256:babcd482cc6e1648cbd3d20d588a8d7edce3f6da50c52a01c58d95de39f0bc2b","observation_id":"4fd1df4b-41f2-4880-9607-baba2d61b7bf","resolution":{"observed_at":"2026-08-12T11:25:31.881642Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:25:32.819161Z","title":"Identifying physically realizable triggers for backdoored face recognition networks","venue":null,"work_id":"81af5cda-f5a4-4500-8801-a93ac683db8c","year":2021},"citing_paper":{"arxiv_id":"2411.18280","last_updated":"2024-11-27T12:15:22Z","snapshot_observed_at":"2026-08-13T14:51:43.520002Z","submitted_at":"2024-11-27T12:15:22Z","title":"Neutralizing Backdoors through Information Conflicts for Large Language Models","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-12T11:25:31.884943Z"},"links":{"citing_paper":"/paper/2411.18280"},"observation_digest":"sha256:649cb385a9994abb1a54c994da3435a574a20c5ecc8d4755786b69dcc05471ef","observation_id":"12bbfee7-4da5-43dd-bd6c-a260137e1bec","resolution":{"observed_at":"2026-08-12T11:25:32.823038Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14461","last_updated":"2024-06-06T12:45:52Z","snapshot_observed_at":"2026-08-13T13:42:14.040419Z","submitted_at":"2024-04-22T05:08:53Z","title":"Competition Report: Finding Universal Jailbreak Backdoors in Aligned LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14461","snapshot_observed_at":"2026-08-12T11:25:31.889053Z","title":"Competition report: Finding universal jailbreak backdoors in aligned LLMs","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.18280","last_updated":"2024-11-27T12:15:22Z","snapshot_observed_at":"2026-08-13T14:51:43.520002Z","submitted_at":"2024-11-27T12:15:22Z","title":"Neutralizing Backdoors through Information Conflicts for Large Language Models","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-12T11:25:31.889053Z"},"links":{"cited_paper":"/paper/2404.14461","citing_paper":"/paper/2411.18280"},"observation_digest":"sha256:684d9bccc0f181c60c323776ce36356937d1e5d94107744b11d72d41b2597e00","observation_id":"23a351e2-35ba-4ee4-935f-c7f63c54698e","resolution":{"observed_at":"2026-08-12T11:25:31.889053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:25:32.808220Z","title":"Hidden trigger backdoor attacks","venue":null,"work_id":"958debae-2801-4231-b3aa-13099295dc5c","year":2020},"citing_paper":{"arxiv_id":"2411.18280","last_updated":"2024-11-27T12:15:22Z","snapshot_observed_at":"2026-08-13T14:51:43.520002Z","submitted_at":"2024-11-27T12:15:22Z","title":"Neutralizing Backdoors through Information Conflicts for Large Language Models","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-12T11:25:31.893033Z"},"links":{"citing_paper":"/paper/2411.18280"},"observation_digest":"sha256:34bfd0523ea7ce6021cffa51f80d2f3c8e3c0aeaeebf3a4a8e80d1672a598a0b","observation_id":"a72722c5-2769-4bc5-b71e-27b6d21ee2da","resolution":{"observed_at":"2026-08-12T11:25:32.812334Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2003.03675","last_updated":"2022-03-03T19:04:16Z","snapshot_observed_at":"2026-08-13T05:50:28.727795Z","submitted_at":"2020-03-07T22:46:51Z","title":"Dynamic Backdoor Attacks Against Machine Learning Models","version":2},"cited_work":{"arxiv_id":"2003.03675","doi":null,"metadata_source":"pith","pith_arxiv_id":"2003.03675","snapshot_observed_at":"2026-08-12T11:25:32.241151Z","title":"Dynamic Backdoor Attacks Against Machine Learning Models","venue":"cs.CR","work_id":"ba9cf554-6d45-4e99-a0ad-6f5a989c7024","year":2020},"citing_paper":{"arxiv_id":"2411.18280","last_updated":"2024-11-27T12:15:22Z","snapshot_observed_at":"2026-08-13T14:51:43.520002Z","submitted_at":"2024-11-27T12:15:22Z","title":"Neutralizing Backdoors through Information Conflicts for Large Language Models","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-12T11:25:31.896702Z"},"links":{"cited_paper":"/paper/2003.03675","citing_paper":"/paper/2411.18280"},"observation_digest":"sha256:5de40b176fd6e412ea8cc9374a339311e1af19006ca626c2728f872f88e5096e","observation_id":"78bc8c9b-0fdd-41c5-ac64-0020a83182b8","resolution":{"observed_at":"2026-08-12T11:25:32.247340Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:25:32.796084Z","title":"Carer: Contextualized affect representations for emotion recognition","venue":null,"work_id":"a3a509eb-f337-4566-9456-25eeeb6cf6b7","year":2018},"citing_paper":{"arxiv_id":"2411.18280","last_updated":"2024-11-27T12:15:22Z","snapshot_observed_at":"2026-08-13T14:51:43.520002Z","submitted_at":"2024-11-27T12:15:22Z","title":"Neutralizing Backdoors through Information Conflicts for Large Language Models","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-12T11:25:31.901741Z"},"links":{"citing_paper":"/paper/2411.18280"},"observation_digest":"sha256:65bf2b36fed2be536e89e7231c42a56e891af95e1972cf70e6200520131230af","observation_id":"2978ded2-99fe-45cc-a060-ecf35c0c0419","resolution":{"observed_at":"2026-08-12T11:25:32.800507Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:25:32.784332Z","title":"You autocomplete me: Poisoning vulnerabilities in neural code com- pletion","venue":null,"work_id":"44b63af4-75bd-4779-91b1-82cdb008d5a0","year":2021},"citing_paper":{"arxiv_id":"2411.18280","last_updated":"2024-11-27T12:15:22Z","snapshot_observed_at":"2026-08-13T14:51:43.520002Z","submitted_at":"2024-11-27T12:15:22Z","title":"Neutralizing Backdoors through Information Conflicts for Large Language Models","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-12T11:25:31.906608Z"},"links":{"citing_paper":"/paper/2411.18280"},"observation_digest":"sha256:222cf61fbe8ccbc825ee4102e1b84f5730bbffdb1fcd0cf4acebb85d539453af","observation_id":"ff60b46c-2464-442c-a637-69e4ef474dd1","resolution":{"observed_at":"2026-08-12T11:25:32.788190Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:25:32.773004Z","title":"On the exploitability of instruction tun- ing","venue":null,"work_id":"bf0cccb0-4f40-472e-af4f-4a358d394313","year":2023},"citing_paper":{"arxiv_id":"2411.18280","last_updated":"2024-11-27T12:15:22Z","snapshot_observed_at":"2026-08-13T14:51:43.520002Z","submitted_at":"2024-11-27T12:15:22Z","title":"Neutralizing Backdoors through Information Conflicts for Large Language Models","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-12T11:25:31.910393Z"},"links":{"citing_paper":"/paper/2411.18280"},"observation_digest":"sha256:6102141196f3daec4c1bd621ac9fe31a9ad1ff891b9d4ab6ce2000a94cf3c099","observation_id":"9b6469a9-5747-4169-addd-04df24cdc263","resolution":{"observed_at":"2026-08-12T11:25:32.777242Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:25:32.760667Z","title":"Recursive deep models for semantic compositionality over a sentiment treebank","venue":null,"work_id":"b152911d-48d6-4011-88e5-b6d9c3aaf51a","year":2013},"citing_paper":{"arxiv_id":"2411.18280","last_updated":"2024-11-27T12:15:22Z","snapshot_observed_at":"2026-08-13T14:51:43.520002Z","submitted_at":"2024-11-27T12:15:22Z","title":"Neutralizing Backdoors through Information Conflicts for Large Language Models","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-12T11:25:31.914397Z"},"links":{"citing_paper":"/paper/2411.18280"},"observation_digest":"sha256:222af78f2ed09ab1937366ff4a393292d9ca036d87ebb99ccc06607b65fb0de5","observation_id":"e2f5f383-ae81-4bc1-94db-222522b02e07","resolution":{"observed_at":"2026-08-12T11:25:32.764883Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.16176","last_updated":"2021-01-15T14:07:09Z","snapshot_observed_at":"2026-08-09T21:06:11.091812Z","submitted_at":"2020-06-29T16:40:14Z","title":"Natural Backdoor Attack on Text Data","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.16176","snapshot_observed_at":"2026-08-12T11:25:31.918495Z","title":"Natural backdoor attack on text data","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2411.18280","last_updated":"2024-11-27T12:15:22Z","snapshot_observed_at":"2026-08-13T14:51:43.520002Z","submitted_at":"2024-11-27T12:15:22Z","title":"Neutralizing Backdoors through Information Conflicts for Large Language Models","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-12T11:25:31.918495Z"},"links":{"cited_paper":"/paper/2006.16176","citing_paper":"/paper/2411.18280"},"observation_digest":"sha256:3436725987e6da3ef4ab1fcab7fcacabf06f8d2b3570af4404bef05b1de1772c","observation_id":"6d675dd7-8b20-4b8b-8683-51768177fff1","resolution":{"observed_at":"2026-08-12T11:25:31.918495Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.11695","last_updated":"2024-05-06T17:47:01Z","snapshot_observed_at":"2026-08-13T04:32:33.562415Z","submitted_at":"2023-06-20T17:18:20Z","title":"A Simple and Effective Pruning Approach for Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.11695","snapshot_observed_at":"2026-08-12T11:25:31.922243Z","title":"A simple and effective pruning approach for large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.18280","last_updated":"2024-11-27T12:15:22Z","snapshot_observed_at":"2026-08-13T14:51:43.520002Z","submitted_at":"2024-11-27T12:15:22Z","title":"Neutralizing Backdoors through Information Conflicts for Large Language Models","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-12T11:25:31.922243Z"},"links":{"cited_paper":"/paper/2306.11695","citing_paper":"/paper/2411.18280"},"observation_digest":"sha256:f9d32b3cfa5cea8e0f2edcd567c26d4c79d96f8f398916989093c9b5a24e77d8","observation_id":"09239ed1-fd0a-4e69-8a46-2c804302edba","resolution":{"observed_at":"2026-08-12T11:25:31.922243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-12T11:25:31.926402Z","title":"Llama: Open and efficient foundation language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.18280","last_updated":"2024-11-27T12:15:22Z","snapshot_observed_at":"2026-08-13T14:51:43.520002Z","submitted_at":"2024-11-27T12:15:22Z","title":"Neutralizing Backdoors through Information Conflicts for Large Language Models","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-12T11:25:31.926402Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2411.18280"},"observation_digest":"sha256:b7b282c9b8958e26a4597af2d574810236f2a92b83778f29da35f99018b74a79","observation_id":"bd1a3044-1374-40c4-8419-52e737835df6","resolution":{"observed_at":"2026-08-12T11:25:31.926402Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-12T11:25:31.930248Z","title":"Llama 2: Open foundation and fine-tuned chat models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.18280","last_updated":"2024-11-27T12:15:22Z","snapshot_observed_at":"2026-08-13T14:51:43.520002Z","submitted_at":"2024-11-27T12:15:22Z","title":"Neutralizing Backdoors through Information Conflicts for Large Language Models","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-12T11:25:31.930248Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2411.18280"},"observation_digest":"sha256:df2181e627fa241e6893ad140eafc5bc3fe9185c9c9b9bb0f687c3bc1c2ca135","observation_id":"7778ed53-eb85-4ebb-b2ba-1f5ea2a2d0aa","resolution":{"observed_at":"2026-08-12T11:25:31.930248Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:25:32.748233Z","title":"Neural cleanse: Identi- fying and mitigating backdoor attacks in neural networks","venue":null,"work_id":"f469be43-0187-4656-ac1b-3d5d5fbfacf4","year":2019},"citing_paper":{"arxiv_id":"2411.18280","last_updated":"2024-11-27T12:15:22Z","snapshot_observed_at":"2026-08-13T14:51:43.520002Z","submitted_at":"2024-11-27T12:15:22Z","title":"Neutralizing Backdoors through Information Conflicts for Large Language Models","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-12T11:25:31.934307Z"},"links":{"citing_paper":"/paper/2411.18280"},"observation_digest":"sha256:965c31932bd8303e1ec7c252eb1b699e0beb9ffc2472b5ba5842d4c5b8e918b5","observation_id":"3227093e-3ba5-47b9-9b16-c6f253eb807f","resolution":{"observed_at":"2026-08-12T11:25:32.751965Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14950","last_updated":"2023-10-14T05:03:53Z","snapshot_observed_at":"2026-08-13T11:34:40.005414Z","submitted_at":"2023-05-24T09:40:56Z","title":"Adversarial Demonstration Attacks on Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.14950","snapshot_observed_at":"2026-08-12T11:25:31.937914Z","title":"Adver- sarial demonstration attacks on large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.18280","last_updated":"2024-11-27T12:15:22Z","snapshot_observed_at":"2026-08-13T14:51:43.520002Z","submitted_at":"2024-11-27T12:15:22Z","title":"Neutralizing Backdoors through Information Conflicts for Large Language Models","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-12T11:25:31.937914Z"},"links":{"cited_paper":"/paper/2305.14950","citing_paper":"/paper/2411.18280"},"observation_digest":"sha256:adcc431c42da74e7384630a51486bced37a3d1eae47e0fd2864ed703d063b792","observation_id":"6c45ac88-9af8-4ad9-96ac-c158d3a47b77","resolution":{"observed_at":"2026-08-12T11:25:31.937914Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:25:32.736608Z","title":"Backdoor attacks against transfer learning with pre-trained deep learning models","venue":null,"work_id":"1d9adfe2-09b4-4f24-a66b-0430e3d91bd6","year":2020},"citing_paper":{"arxiv_id":"2411.18280","last_updated":"2024-11-27T12:15:22Z","snapshot_observed_at":"2026-08-13T14:51:43.520002Z","submitted_at":"2024-11-27T12:15:22Z","title":"Neutralizing Backdoors through Information Conflicts for Large Language Models","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-12T11:25:31.941313Z"},"links":{"citing_paper":"/paper/2411.18280"},"observation_digest":"sha256:19b43509a2ea79f1b5cd52dc33e5f8ac071c3a8da905a19a4d58e89578e275f7","observation_id":"8c8ab148-d042-475a-b422-ba73e8afde0b","resolution":{"observed_at":"2026-08-12T11:25:32.740652Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.01652","last_updated":"2022-02-08T20:26:45Z","snapshot_observed_at":"2026-08-14T06:11:14.515796Z","submitted_at":"2021-09-03T17:55:52Z","title":"Finetuned Language Models Are Zero-Shot Learners","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.01652","snapshot_observed_at":"2026-08-12T11:25:31.944984Z","title":"Finetuned language models are zero-shot learners","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.18280","last_updated":"2024-11-27T12:15:22Z","snapshot_observed_at":"2026-08-13T14:51:43.520002Z","submitted_at":"2024-11-27T12:15:22Z","title":"Neutralizing Backdoors through Information Conflicts for Large Language Models","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-12T11:25:31.944984Z"},"links":{"cited_paper":"/paper/2109.01652","citing_paper":"/paper/2411.18280"},"observation_digest":"sha256:016404805c7ada6f370f4c021d28a1a5c71f5e665b89bb2cf165d9eddb5a21d2","observation_id":"2141d306-227e-4fa3-bd89-ce8bde5d13ea","resolution":{"observed_at":"2026-08-12T11:25:31.944984Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.07682","last_updated":"2022-10-26T05:06:24Z","snapshot_observed_at":"2026-08-02T15:56:35.249569Z","submitted_at":"2022-06-15T17:32:01Z","title":"Emergent Abilities of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.07682","snapshot_observed_at":"2026-08-12T11:25:31.948884Z","title":"Emergent abilities of large language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.18280","last_updated":"2024-11-27T12:15:22Z","snapshot_observed_at":"2026-08-13T14:51:43.520002Z","submitted_at":"2024-11-27T12:15:22Z","title":"Neutralizing Backdoors through Information Conflicts for Large Language Models","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-12T11:25:31.948884Z"},"links":{"cited_paper":"/paper/2206.07682","citing_paper":"/paper/2411.18280"},"observation_digest":"sha256:ec77153e2a00b62edc79a1e1412045df5c4592e898fe260654e7f2620d3baa68","observation_id":"7ef47f0b-c9fe-4119-a86d-1e152c797446","resolution":{"observed_at":"2026-08-12T11:25:31.948884Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:25:32.725363Z","title":"Bd- mmt: Backdoor sample detection for language models through model mutation testing","venue":null,"work_id":"c113eba6-de8b-49f0-832c-37354dc4f45c","year":2024},"citing_paper":{"arxiv_id":"2411.18280","last_updated":"2024-11-27T12:15:22Z","snapshot_observed_at":"2026-08-13T14:51:43.520002Z","submitted_at":"2024-11-27T12:15:22Z","title":"Neutralizing Backdoors through Information Conflicts for Large Language Models","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-12T11:25:31.952770Z"},"links":{"citing_paper":"/paper/2411.18280"},"observation_digest":"sha256:bcb20f1c9f11f3890fd81b645f7c07e1d7d89dd75f260d8f5ddc7b7e8ede16af","observation_id":"8cbe41ce-5686-41dc-81e8-e65498a877a1","resolution":{"observed_at":"2026-08-12T11:25:32.729291Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:25:32.714400Z","title":"Model soups: Averaging weights of multiple fine-tuned models improves ac- curacy without increasing inference time","venue":null,"work_id":"c3d569f4-797e-4f22-90ff-abb1e43e4dcf","year":2022},"citing_paper":{"arxiv_id":"2411.18280","last_updated":"2024-11-27T12:15:22Z","snapshot_observed_at":"2026-08-13T14:51:43.520002Z","submitted_at":"2024-11-27T12:15:22Z","title":"Neutralizing Backdoors through Information Conflicts for Large Language Models","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-12T11:25:31.955993Z"},"links":{"citing_paper":"/paper/2411.18280"},"observation_digest":"sha256:7e05b74e26f6c55621ff2ef9404bf74856799ebb19a22bc28600e5fd51872d34","observation_id":"d0c7dae4-14bd-473d-910f-49583df96545","resolution":{"observed_at":"2026-08-12T11:25:32.718270Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13300","last_updated":"2024-02-27T17:08:49Z","snapshot_observed_at":"2026-08-14T05:14:38.908825Z","submitted_at":"2023-05-22T17:57:41Z","title":"Adaptive Chameleon or Stubborn Sloth: Revealing the Behavior of Large Language Models in Knowledge Conflicts","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13300","snapshot_observed_at":"2026-08-12T11:25:31.960699Z","title":"Adaptive chameleon or stubborn sloth: Revealing the behavior of large language models in knowledge conflicts","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.18280","last_updated":"2024-11-27T12:15:22Z","snapshot_observed_at":"2026-08-13T14:51:43.520002Z","submitted_at":"2024-11-27T12:15:22Z","title":"Neutralizing Backdoors through Information Conflicts for Large Language Models","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-12T11:25:31.960699Z"},"links":{"cited_paper":"/paper/2305.13300","citing_paper":"/paper/2411.18280"},"observation_digest":"sha256:7a41bed32e5750232e9d49fb8fc3dbf638c7e4b1b2390a860e99e81dbb8944a1","observation_id":"7587af65-0d90-4f6f-8799-109cc84c929c","resolution":{"observed_at":"2026-08-12T11:25:31.960699Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14710","last_updated":"2024-04-03T09:15:15Z","snapshot_observed_at":"2026-08-13T11:34:55.306116Z","submitted_at":"2023-05-24T04:27:21Z","title":"Instructions as Backdoors: Backdoor Vulnerabilities of Instruction Tuning for Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.14710","snapshot_observed_at":"2026-08-12T11:25:31.964368Z","title":"Instructions as backdoors: Backdoor vulnerabilities of instruction tuning for large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.18280","last_updated":"2024-11-27T12:15:22Z","snapshot_observed_at":"2026-08-13T14:51:43.520002Z","submitted_at":"2024-11-27T12:15:22Z","title":"Neutralizing Backdoors through Information Conflicts for Large Language Models","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-12T11:25:31.964368Z"},"links":{"cited_paper":"/paper/2305.14710","citing_paper":"/paper/2411.18280"},"observation_digest":"sha256:5bc7674f9ce5cd8c0cefacb077c7a4113d17c9a9e2b0654bb7531158504944d4","observation_id":"e1580311-05c6-432f-8b3a-68cef95717f0","resolution":{"observed_at":"2026-08-12T11:25:31.964368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:25:32.702186Z","title":"Trojllm: A black-box trojan prompt attack on large language models","venue":null,"work_id":"2ab357cb-f84a-4695-bc02-46fe4ed4c385","year":2024},"citing_paper":{"arxiv_id":"2411.18280","last_updated":"2024-11-27T12:15:22Z","snapshot_observed_at":"2026-08-13T14:51:43.520002Z","submitted_at":"2024-11-27T12:15:22Z","title":"Neutralizing Backdoors through Information Conflicts for Large Language Models","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-12T11:25:31.968324Z"},"links":{"citing_paper":"/paper/2411.18280"},"observation_digest":"sha256:3548bcb46958b94903a154a91f21d3d8f029fa2dd8542e09c3c40cd8fb710ac1","observation_id":"776fb0dc-cb5e-4e32-829d-93fdba0be02d","resolution":{"observed_at":"2026-08-12T11:25:32.706264Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:25:32.690093Z","title":"TIES-merging: Resolving interference when merging models","venue":null,"work_id":"ab2d3545-9390-4bc6-819a-b7129f93256b","year":2023},"citing_paper":{"arxiv_id":"2411.18280","last_updated":"2024-11-27T12:15:22Z","snapshot_observed_at":"2026-08-13T14:51:43.520002Z","submitted_at":"2024-11-27T12:15:22Z","title":"Neutralizing Backdoors through Information Conflicts for Large Language Models","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-12T11:25:31.971640Z"},"links":{"citing_paper":"/paper/2411.18280"},"observation_digest":"sha256:f3938ccc185960b617e49e0d31922eef4c21bdd947b4f942996bdb2ee42993c0","observation_id":"afa44701-0f6a-43aa-8a7c-719dab8802c2","resolution":{"observed_at":"2026-08-12T11:25:32.694242Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:25:32.676529Z","title":"Backdooring instruction-tuned large language models with virtual prompt injection","venue":null,"work_id":"a42e6589-5de5-4f53-8eaa-67c97587b0aa","year":2024},"citing_paper":{"arxiv_id":"2411.18280","last_updated":"2024-11-27T12:15:22Z","snapshot_observed_at":"2026-08-13T14:51:43.520002Z","submitted_at":"2024-11-27T12:15:22Z","title":"Neutralizing Backdoors through Information Conflicts for Large Language Models","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-12T11:25:31.975229Z"},"links":{"citing_paper":"/paper/2411.18280"},"observation_digest":"sha256:ad7477994faaed4f0520f803b9015929464fb847a63d8724b3f971e47aa08739","observation_id":"3285b160-5fec-4c8c-8df9-f6358ce45f95","resolution":{"observed_at":"2026-08-12T11:25:32.681343Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:25:31.978647Z","title":"A comprehensive overview of backdoor attacks in large language models within communication networks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.18280","last_updated":"2024-11-27T12:15:22Z","snapshot_observed_at":"2026-08-13T14:51:43.520002Z","submitted_at":"2024-11-27T12:15:22Z","title":"Neutralizing Backdoors through Information Conflicts for Large Language Models","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-12T11:25:31.978647Z"},"links":{"citing_paper":"/paper/2411.18280"},"observation_digest":"sha256:5e29c7eba0232031c9ebcb51700aa6b5d8e3cc0dd0b0e86c8138b6b0a7173095","observation_id":"6ce008a6-67bc-4f57-b9bc-94a29f65a8d4","resolution":{"observed_at":"2026-08-12T11:25:31.978647Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.15543","last_updated":"2021-03-29T12:19:45Z","snapshot_observed_at":"2026-08-13T19:49:54.554437Z","submitted_at":"2021-03-29T12:19:45Z","title":"Be Careful about Poisoned Word Embeddings: Exploring the Vulnerability of the Embedding Layers in NLP Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.15543","snapshot_observed_at":"2026-08-12T11:25:31.982926Z","title":"Be careful about poisoned word embeddings: Exploring the vulnerability of the embedding layers in nlp models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.18280","last_updated":"2024-11-27T12:15:22Z","snapshot_observed_at":"2026-08-13T14:51:43.520002Z","submitted_at":"2024-11-27T12:15:22Z","title":"Neutralizing Backdoors through Information Conflicts for Large Language Models","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-12T11:25:31.982926Z"},"links":{"cited_paper":"/paper/2103.15543","citing_paper":"/paper/2411.18280"},"observation_digest":"sha256:f95c04977207a2256bd342f7ca37291ae050c75a9d57de820aa090f6d7e2ea0c","observation_id":"53824f08-2337-4e71-8e59-72ae79a05971","resolution":{"observed_at":"2026-08-12T11:25:31.982926Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.07831","last_updated":"2021-10-15T03:09:26Z","snapshot_observed_at":"2026-08-13T17:52:46.585098Z","submitted_at":"2021-10-15T03:09:26Z","title":"RAP: Robustness-Aware Perturbations for Defending against Backdoor Attacks on NLP Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.07831","snapshot_observed_at":"2026-08-12T11:25:31.986973Z","title":"Rap: Robustness-aware perturbations for defending against backdoor at- tacks on NLP models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.18280","last_updated":"2024-11-27T12:15:22Z","snapshot_observed_at":"2026-08-13T14:51:43.520002Z","submitted_at":"2024-11-27T12:15:22Z","title":"Neutralizing Backdoors through Information Conflicts for Large Language Models","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-12T11:25:31.986973Z"},"links":{"cited_paper":"/paper/2110.07831","citing_paper":"/paper/2411.18280"},"observation_digest":"sha256:82af6e3e7b2f70f1fd55bc14ff1c346423778ba4db4d0a42f27d1d09ff403918","observation_id":"afb8afcf-d412-46d6-91c7-d14044e6b4ab","resolution":{"observed_at":"2026-08-12T11:25:31.986973Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:25:32.655890Z","title":"Poisonprompt: Backdoor attack on prompt-based large language models","venue":null,"work_id":"021c7a8f-3cfc-4477-9e9b-7645a4e04e2d","year":2024},"citing_paper":{"arxiv_id":"2411.18280","last_updated":"2024-11-27T12:15:22Z","snapshot_observed_at":"2026-08-13T14:51:43.520002Z","submitted_at":"2024-11-27T12:15:22Z","title":"Neutralizing Backdoors through Information Conflicts for Large Language Models","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-12T11:25:31.991250Z"},"links":{"citing_paper":"/paper/2411.18280"},"observation_digest":"sha256:127b514244623bd534c1b7ae9651ff9f62ba1b3c8dded639da25e00a4187b35f","observation_id":"c5833c6f-1985-4133-ab77-2cb6cb202444","resolution":{"observed_at":"2026-08-12T11:25:32.660363Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:25:32.642322Z","title":"Latent backdoor attacks on deep neural networks","venue":null,"work_id":"0ed2218f-9b59-4760-a152-19f4fdeb989b","year":2019},"citing_paper":{"arxiv_id":"2411.18280","last_updated":"2024-11-27T12:15:22Z","snapshot_observed_at":"2026-08-13T14:51:43.520002Z","submitted_at":"2024-11-27T12:15:22Z","title":"Neutralizing Backdoors through Information Conflicts for Large Language Models","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-12T11:25:31.995060Z"},"links":{"citing_paper":"/paper/2411.18280"},"observation_digest":"sha256:90fa5e7e975f5d0cce20e28fabc63cdd075cdfe0b4c9cd86c36b48a481f8b9ab","observation_id":"f7b035a0-66f9-4226-ad8f-d254a048dfec","resolution":{"observed_at":"2026-08-12T11:25:32.646776Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.17092","last_updated":"2024-06-24T19:29:47Z","snapshot_observed_at":"2026-08-12T23:35:46.419773Z","submitted_at":"2024-06-24T19:29:47Z","title":"BEEAR: Embedding-based Adversarial Removal of Safety Backdoors in Instruction-tuned Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.17092","snapshot_observed_at":"2026-08-12T11:25:31.998778Z","title":"Beear: Embedding-based adversarial removal of safety backdoors in instruction-tuned language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.18280","last_updated":"2024-11-27T12:15:22Z","snapshot_observed_at":"2026-08-13T14:51:43.520002Z","submitted_at":"2024-11-27T12:15:22Z","title":"Neutralizing Backdoors through Information Conflicts for Large Language Models","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-12T11:25:31.998778Z"},"links":{"cited_paper":"/paper/2406.17092","citing_paper":"/paper/2411.18280"},"observation_digest":"sha256:1c00679c5ea62e3bb87d16766ef522e1106c07fb13b49eb4df35680ae04edbb8","observation_id":"da08f7d8-802e-4b54-ad50-53fe151022d8","resolution":{"observed_at":"2026-08-12T11:25:31.998778Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:25:32.628240Z","title":"Composing parameter- efficient modules with arithmetic operation","venue":null,"work_id":"745ab2bd-f1e3-4900-9211-6612813fee8a","year":2023},"citing_paper":{"arxiv_id":"2411.18280","last_updated":"2024-11-27T12:15:22Z","snapshot_observed_at":"2026-08-13T14:51:43.520002Z","submitted_at":"2024-11-27T12:15:22Z","title":"Neutralizing Backdoors through Information Conflicts for Large Language Models","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-12T11:25:32.003425Z"},"links":{"citing_paper":"/paper/2411.18280"},"observation_digest":"sha256:26f272756fdc75bd6ed0192d5aea5afea9202b32462d31e4c2b58d1e51361c24","observation_id":"010bb81d-a2cb-4470-b384-d8b380cbae44","resolution":{"observed_at":"2026-08-12T11:25:32.633235Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.09545","last_updated":"2022-10-18T02:44:38Z","snapshot_observed_at":"2026-08-13T14:03:12.152748Z","submitted_at":"2022-10-18T02:44:38Z","title":"Fine-mixing: Mitigating Backdoors in Fine-tuned Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.09545","snapshot_observed_at":"2026-08-12T11:25:32.007402Z","title":"Fine-mixing: Mitigating backdoors in fine-tuned language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.18280","last_updated":"2024-11-27T12:15:22Z","snapshot_observed_at":"2026-08-13T14:51:43.520002Z","submitted_at":"2024-11-27T12:15:22Z","title":"Neutralizing Backdoors through Information Conflicts for Large Language Models","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-12T11:25:32.007402Z"},"links":{"cited_paper":"/paper/2210.09545","citing_paper":"/paper/2411.18280"},"observation_digest":"sha256:b2e71beee4979c656525227a98e59d7e5e62f9e96a890f94e73868a821d78176","observation_id":"032f5686-5aa0-4cc7-99df-b6fbb46f5b87","resolution":{"observed_at":"2026-08-12T11:25:32.007402Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.05949","last_updated":"2024-10-09T11:46:24Z","snapshot_observed_at":"2026-08-13T04:44:33.587123Z","submitted_at":"2024-01-11T14:38:19Z","title":"Universal Vulnerabilities in Large Language Models: Backdoor Attacks for In-context Learning","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.05949","snapshot_observed_at":"2026-08-12T11:25:32.011136Z","title":"Universal vulnerabilities in large language models: Backdoor attacks for in-context learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.18280","last_updated":"2024-11-27T12:15:22Z","snapshot_observed_at":"2026-08-13T14:51:43.520002Z","submitted_at":"2024-11-27T12:15:22Z","title":"Neutralizing Backdoors through Information Conflicts for Large Language Models","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-12T11:25:32.011136Z"},"links":{"cited_paper":"/paper/2401.05949","citing_paper":"/paper/2411.18280"},"observation_digest":"sha256:d69992bece62054e0d75eddd3b7883820643a425cb4798bed24aacf041a63a7c","observation_id":"1dbf6ecb-805c-4ddf-b7a4-01f83f182060","resolution":{"observed_at":"2026-08-12T11:25:32.011136Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.01219","last_updated":"2023-11-10T11:28:53Z","snapshot_observed_at":"2026-08-13T11:51:00.841421Z","submitted_at":"2023-05-02T06:19:36Z","title":"Prompt as Triggers for Backdoor Attack: Examining the Vulnerability in Language Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.01219","snapshot_observed_at":"2026-08-12T11:25:32.015117Z","title":"Prompt as triggers for backdoor attack: Examining the vulnerability in language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.18280","last_updated":"2024-11-27T12:15:22Z","snapshot_observed_at":"2026-08-13T14:51:43.520002Z","submitted_at":"2024-11-27T12:15:22Z","title":"Neutralizing Backdoors through Information Conflicts for Large Language Models","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-12T11:25:32.015117Z"},"links":{"cited_paper":"/paper/2305.01219","citing_paper":"/paper/2411.18280"},"observation_digest":"sha256:2262167f6b6e6024eb74c3fe79b666726a0924de5698d1f8835aca63eadc8c32","observation_id":"e84309ec-a076-4131-b39f-e964a9566f49","resolution":{"observed_at":"2026-08-12T11:25:32.015117Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.18223","last_updated":"2026-03-18T05:34:39Z","snapshot_observed_at":"2026-08-06T23:27:24.356320Z","submitted_at":"2023-03-31T17:28:46Z","title":"A Survey of Large Language Models","version":19},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.18223","snapshot_observed_at":"2026-08-12T11:25:32.019298Z","title":"A survey of large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.18280","last_updated":"2024-11-27T12:15:22Z","snapshot_observed_at":"2026-08-13T14:51:43.520002Z","submitted_at":"2024-11-27T12:15:22Z","title":"Neutralizing Backdoors through Information Conflicts for Large Language Models","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-12T11:25:32.019298Z"},"links":{"cited_paper":"/paper/2303.18223","citing_paper":"/paper/2411.18280"},"observation_digest":"sha256:0332c66cd4d4316f8c21cf6269253b24892db5bc951774c22a024fe084c9511a","observation_id":"3acd0b42-bab0-471d-abc3-b69b35d0b8d6","resolution":{"observed_at":"2026-08-12T11:25:32.019298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:25:32.611227Z","title":"I MPACT OF DIFFERENT MODEL MERGING METHODS","venue":null,"work_id":"fc09055d-cb87-4a15-ba40-3150fbad63d6","year":null},"citing_paper":{"arxiv_id":"2411.18280","last_updated":"2024-11-27T12:15:22Z","snapshot_observed_at":"2026-08-13T14:51:43.520002Z","submitted_at":"2024-11-27T12:15:22Z","title":"Neutralizing Backdoors through Information Conflicts for Large Language Models","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-12T11:25:32.023656Z"},"links":{"citing_paper":"/paper/2411.18280"},"observation_digest":"sha256:86ab6b2a1eb524491c8d09891a0eceac1890a8ea830df532eee34fc03c87c667","observation_id":"79da5425-bc65-4b79-92a8-d1e2be2a7dbc","resolution":{"observed_at":"2026-08-12T11:25:32.618426Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2411.18280","last_updated":"2024-11-27T12:15:22Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-13T14:51:43.520002Z","submitted_at":"2024-11-27T12:15:22Z","title":"Neutralizing Backdoors through Information Conflicts for Large Language Models"},"reference_resolution":{"displayed":82,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":48,"verified_exact":1,"verified_fuzzy":32},"total_outbound_references":82},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 82 of 82 outbound references and 3 inbound Pith citation observations for arXiv:2411.18280."}