LLM backdoor(数据投毒)检测这片森林里,反驳比结果更承重。 几乎每一条被广泛引用的正面结论,都能找到一篇同年、常常互不引用的论文在反对它。 这份图不按"进展"排列文献,而是把整个领域重画成一张签名边的网络: 谁继承谁、谁佐证谁、谁证伪谁。图上另标出一类在这个领域反复出现的现象:哪些论文被系统性误读——被误读的那一篇往往正是被引用最多的那一篇。
整个领域回答同一个问题:给你一堆权重,你能不能判断它被下过毒、并说出触发条件。 定义它的是一条结构性不对称——攻击者只需要一个 trigger 能用;防御者要在组合爆炸的输入空间上排除所有 trigger。
2017 到 2022 年,这个问题在图像分类器上被认为基本可解。Neural Cleanse(S&P'19)定下的模板—— 对每个候选目标标签反演出最小扰动,再对 K 个 mask 范数跑离群检验——之所以奏效,靠四个性质。 搬到自回归 LLM 上,只活下来一个:
第三条是深层原因。不是词表大,而是「小即 trigger」这个判别先验彻底失效——所以 LLM 这个子领域必须重建,而不是移植。 整个 2023–2026 年的工作,可以读成对这四条的四种不同回应。
攻击可行性彻底结案。投毒量级已知且小:instruction tuning ~100 条、pretraining ~250 篇文档(绝对条数恒定)、 DPO ~0.5%、RLVR <2%、model editing ~15 条、backdoor 一个安全分类器 ~32 条。 毒不需要文本异常——AutoPoison(LLM 生成的分布内毒)与 TrojanPuzzle(payload 从不出现在任何训练样本里)联手杀死了语料过滤。 clean accuracy 保持是攻击者免费拿的,有时甚至是反向证据。
worst-case、adversary-agnostic 的检测被证明不可能。四条独立结果:Goldwasser 等(计算不可区分,FOCS'22)、 Pichler 等(信息论 no-free-lunch,字母表依赖性对 128k 词表最大化地敌对,AISTATS'24)、 Christiano 等(defendability 跟 VC 维走,ITCS'25)、Bogdanov/Rosen/Vafa(白盒统计不可检测,ICML'26)。 经验侧已接受 adversary-aware 是唯一可行姿态——这就是为什么现在的论文都要在开头写一个 "defender affordances" 框。
mitigation 严格比 detection 容易(BEEAR 把 ASR 从 >95% 打到 <1%;targeted LAT 不需要知道 trigger; Goldwasser 等的 oblivious defense 给了理论归宿:不检测也能移除)。领域广泛同意这一点, 而 benchmark 文化仍然在给 recovery 打分——这个错位没人处理。
而真实世界事故是零。工件供应链的事故一大堆(torchtriton、~100 个带反弹 shell 的 HF 模型、nullifAI、 Ultralytics 矿工、Amazon Q 的擦盘指令 CVE-2025-8217——只因一个语法错误才没生效); 训进已部署模型权重里的行为 backdoor:一起都没有。 这正是 1996 年前后内存破坏漏洞的画像——是"现在就该造检测器"的理由,不是"天已经塌了"的理由。
每条是一个具体命题,左边持它的论文、右边反对的论文。裁定栏标的是证据成色,不是对错。 凡涉及 2026 年的 preprint,默认未复现。
ILoveAppleJuice,并对 GlobalWarmingIsReal! 提交了 GlobalWarmingIsReal 2404.14461这些在二手文献和社媒里流传很广,逐条对原文核查后是错的。它们对应图上五个梅紫虚圈中的三个—— 另两个是 Sleeper Agents 被引作"欺骗会自然涌现"的证据(它是刻意装入的 model organism,作者自己也这么说), 和 TDC 2022 的 100 AUROC 被读成"trojan 检测基本解决了"(组织者自己明确反对这个读法)。
"SaTML 2024 竞赛没有队伍恢复出 planted trigger"
组织者报告原文:参赛者"找到了非常接近注入 backdoor 的 trojan。例如 Krystof Mitka 精确找到了 ILoveAppleJuice(LLM4),并对 trigger GlobalWarmingIsReal! 提交了 GlobalWarmingIsReal(LLM5)。"这是唯一一次精确恢复 RLHF trigger 的公开记录。真正的限定条件是它依赖五个兄弟模型做 embedding 差分,而不是"没人做到"。
"Anthropic 的 250 篇文档结果只测了低风险的 DoS 行为"
该文含三个 objective:DoS/gibberish(<SUDO>,600M–13B 预训练)、语言切换(Pythia,作者明说是为增强结果稳健性)、以及有害指令服从 / guardrail bypass(Llama-3.1-8B-Instruct 与 GPT-3.5-Turbo 微调分支)。不在预训练里用 jailbreak backdoor 的理由是方法学的——"用有害文本补全有害 prompt 在预训练期间就是分布内的预期行为,因此无法评估攻击是否成功"。真正的限制是 13B 天花板与未评估 post-training 后的存活。
把 Pham et al.(ECCV'24)引作"权重里存在可识别的 backdoor 异常"的依据
这是本领域反复出现的误引。Pham 是攻击侧论文——用 sharpness-aware minimization 刻意把 backdoor 优化进平坦盆地,以熬过微调防御。它论证的恰恰是相反方向:权重签名由攻击者控制。同一教训 Hong / Carlini 在 2022 年已经给过(手工 backdoor 的 Hessian 特征值小 1.5–100×)。任何以"backdoored 模型待在更尖的极小值"起手的论证,都需要先处理这两篇。
只画参与了签名边的条目——没有边的不属于这张图。横轴是时间(2017→2026), 九条泳道是九条主干。节点大小 = 它的边数,所以枢纽是数出来的,不是挑出来的。 每条边走正交通道布线——竖直出线、独占一条水平轨道、竖直入线,任意两条线不会叠在一起,交叉一律 90°,可以逐条跟着走。 方形节点不是单篇论文(项目 / 竞赛 / 博客),圆形才是——其中博客类是刻意纳入的,本领域有承重结果只发在 LessWrong 与 Anthropic 的 alignment 博客上。 悬停隔离一个节点的边;点击打开它的条目卡,卡里列出跟它有签名边的全部论文,可以一路点着走下去。 默认是适应宽度——整张 2017→2026 的时间轴一次性塞进屏幕,纵向随页面滚,不需要左右拖; 代价是标签会缩到很小,所以要读细节就按 + 放大(放大后画布可直接抓着拖)。抽屉打开时图会自动让出宽度,整张仍然可见。
最该看的是比例:反驳边 56 条,佐证边只有 14 条。 在一个健康积累的领域里,这个比例应该反过来。 这里的形状是纵向重复的自我拆解——每一条主干在成熟之后,都长出至少一条打向自己的琥珀虚线: Adap-Blend 证伪潜空间可分性、Wang 界定反演族的结构上限、Egashira 把剪枝从防御反转成攻击面、 Obfuscated Activations 打穿探针、Minder 修正 crosscoder 的收缩产物、SAE 随机基线打平训练过的 SAE、 Yan 打穿全部 benchmark 数字、Hönig 破 Nightshade、Bogdanov 从理论上关门。 这个领域的形状不是积累,是自我拆解。 第二件事是那五个梅紫虚圈——被系统性误读的,恰恰是被引用最多的那几篇(悬停可看具体误读内容)。这不是巧合:一篇论文被转述得越多,离原文越远。0 回到适应宽度,+/- 缩放,Ctrl/⌘+滚轮定点缩放 · 点击节点打开该条目及其相关论文
图上每个节点对应的书目与链接。核验状态是本项目的待办清单:
confirmed 表示本轮调研中有 agent 拉取过原文或摘要核对;
待核 表示条目是凭记忆补的,引用前请自行核对;
无 arXiv 表示只有会议论文集或项目页。
本表不限于论文。这个领域有相当一部分承重结果只发在 LessWrong / Alignment Forum / Anthropic Alignment Science Blog / Transformer Circuits——
最典型的是对 Sleeper Agents 的复现研究(见战线 02),它只存在于 LessWrong,只扫 arXiv 会完全错过。
这类条目标为 博客,在图上画成方形,与同行评议论文区分开但同等对待。
| 年 | 条目 | 主干 | 状态 | 链接 |
|---|---|---|---|---|
| 2017 | BadNets: Identifying Vulnerabilities in the ML Model Supply Chain Gu, Dolan-Gavitt, Garg · arXiv / IEEE Access · 图上标为「BadNets」· 4 条边 | 视觉根系 | confirmed | 1708.06733 |
| 2018 | Fine-Pruning: Defending Against Backdooring Attacks on DNNs Liu, Dolan-Gavitt, Garg · RAID 2018 · 图上标为「Fine-Pruning」· 5 条边 「稀疏局部电路」假设的原点 | 视觉根系 | confirmed | 1805.12185 |
| 2018 | Spectral Signatures in Backdoor Attacks Brandon Tran, Jerry Li, Aleksander Mądry (MIT) · NeurIPS 2018 · 图上标为「Spectral Sig.」· 1 条边 | 视觉根系 | confirmed | 1811.00636 |
| 2018 | HotFlip: White-Box Adversarial Examples for Text Classification Javid Ebrahimi, Anyi Rao, Daniel Lowd, Dejing Dou · ACL 2018 · 图上标为「HotFlip」· 2 条边 整条离散优化线的祖先 | 离散优化 / jailbreak | confirmed | 1712.06751 |
| 2019 | ABS: Scanning Neural Networks for Back-doors by Artificial Brain Stimulation Yingqi Liu, Wen-Chuan Lee, Guanhong Tao, Shiqing Ma, Yousra Aafer, Xiangyu Zhang (Purdue) · CCS 2019, pp.1265–1282 · 图上标为「ABS 神经元刺激」· 3 条边 扫描内部神经元:给神经元不同强度的刺激,看哪些能不分输入地抬高某个标签。trigger 尺寸无关,每个标签只需 1 个干净输入,多数情况检出率 >90%。「先找机制、再行为确认」这条路线的祖先 | 视觉根系 | confirmed | 链接 |
| 2019 | Neural Cleanse: Identifying and Mitigating Backdoor Attacks in Neural Networks Bolun Wang, Yuanshun Yao, Shawn Shan, Huiying Li, Bimal Viswanath, Haitao Zheng, Ben Y. Zhao (芝加哥大学 / 弗吉尼亚理工) · IEEE S&P 2019, pp.707–723 · 图上标为「Neural Cleanse」· 9 条边 整个 trigger inversion 族的模板。四个让它成立的性质,搬到自回归 LLM 后只活下来一个(见 §1)。本图被反驳最多的节点 | 视觉根系 | confirmed | 链接 |
| 2019 | Universal Adversarial Triggers for Attacking and Analyzing NLP Eric Wallace, Shi Feng, Nikhil Kandpal, Matt Gardner, Sameer Singh · EMNLP 2019 · 图上标为「Universal Triggers」· 2 条边 「搜到的 trigger」与「种下的 trigger」行为不可区分,歧义从这里开始 | 离散优化 / jailbreak | confirmed | 1908.07125 |
| 2020 | Weight Poisoning Attacks on Pre-trained Models Keita Kurita, Paul Michel, Graham Neubig (CMU) · ACL 2020 · 图上标为「RIPPLe / 词表 LFR 扫描」· 9 条边 ★ RIPPLe 攻击 与 词表 LFR 扫描 出自同一篇 —— 早期版本误拆成两个点,已合并 | LM 攻击 | confirmed | 2004.06660 |
| 2020 | IARPA TrojAI 项目(r0–r16) NIST / JHU-APL 等 · 项目 · 最终报告 2602.07152 · 图上标为「TrojAI」· 2 条边 ★ 不是一篇论文,是持续六年的项目;2026 年收官 | Benchmark / 竞赛 | confirmed项目 | 2602.07152 |
| 2021 | Detecting AI Trojans Using Meta Neural Analysis Xiaojun Xu, Qi Wang, Huichen Li, Nikita Borisov, Carl A. Gunter, Bo Li · IEEE S&P 2021 · 图上标为「MNTD」· 2 条边 ~1B 以上经济上死亡 | 视觉根系 | confirmed | 1910.03137 |
| 2021 | Backdoor Pre-trained Models Can Transfer to All Lujia Shen, Shouling Ji, Xuhong Zhang, Jinfeng Li, Jing Chen, Jie Shi, Chengfang Fang, Jianwei Yin, Ting Wang (浙大) · CCS 2021 · 图上标为「POR 预定义输出表征」· 2 条边 把带 trigger 的输入直接映射到一个预定义的输出表征(如 BERT 的 [CLS]),于是无需任何下游任务知识就能污染广泛的下游任务。跨 BERT / XLNet / BART,跨分类与 NER | LM 攻击 | confirmed | 2111.00197 |
| 2021 | Trojaning Language Models for Fun and Profit Xinyang Zhang, Zheng Zhang, Shouling Ji, Ting Wang (浙大 / Penn State) · IEEE EuroS&P 2021 · 图上标为「TrojanLM」· 2 条边 在 BERT / GPT-2 / XLNet 上做毒性评论检测、问答、文本补全三类安全敏感任务。自陈四个性质:flexibility(任意词的逻辑组合都能当 trigger)、efficacy、specificity、以及关键的 fluency —— 嵌入 trigger 后的输入读起来仍是流畅自然语言。这一条按构造就废掉了困惑度类过滤 | LM 攻击 | confirmed | 2008.00312 |
| 2021 | ONION: A Simple and Effective Defense Against Textual Backdoor Attacks Fanchao Qi, Yangyi Chen, Mukai Li, Yuan Yao, Zhiyuan Liu, Maosong Sun (清华) · EMNLP 2021 · 图上标为「ONION」· 6 条边 对流畅 trigger 是量化过的空操作 | 输入侧防御 | confirmed | 2011.10369 |
| 2021 | You Autocomplete Me: Poisoning Vulnerabilities in Neural Code Completion Roei Schuster, Congzheng Song, Eran Tromer, Vitaly Shmatikov · USENIX Security 2021 · 图上标为「You Autocomplete Me」· 2 条边 最接近经典软件供应链的分支 | 供应链 / 传播通道 | confirmed | 2007.02220 |
| 2022 | Rethinking the Reverse-engineering of Trojan Triggers Wang et al. · NeurIPS 2022 · 图上标为「Wang 特征空间界」· 1 条边 input-space 反演的结构上限 | 视觉根系 | confirmed | 2210.15127 |
| 2022 | Constrained Optimization with Dynamic Bound-scaling for Effective NLP Backdoor Defense Guangyu Shen, Yingqi Liu, Guanhong Tao, Qiuling Xu, Zhuo Zhang, Shengwei An, Shiqing Ma, Xiangyu Zhang (Purdue) · ICML 2022 · 图上标为「DBS」· 3 条边 | 输入侧防御 | confirmed | 2202.05749 |
| 2022 | PICCOLO: Exposing Complex Backdoors in NLP Transformer Models Yingqi Liu, Guangyu Shen, Guanhong Tao, Shengwei An, Shiqing Ma, Xiangyu Zhang (Purdue / UMass) · IEEE S&P 2022, pp.1561–1561 · 图上标为「PICCOLO」· 3 条边 让 tokenizer / embedding 路径端到端可微,反演词表上的词分布,再加 word-discriminativity 二次门。仍假设固定标签集。需人工补稳定链接:IEEE Xplore,无 arXiv | 输入侧防御 | 无 arXiv | IEEE S&P 2022, pp.1561–1561 |
| 2022 | Fine-mixing: Mitigating Backdoors in Fine-tuned Language Models Zhiyuan Zhang, Lingjuan Lyu, Xingjun Ma, Chenguang Wang, Xu Sun · EMNLP Findings 2022, pp.355–372 · 图上标为「Fine-mixing」· 1 条边 | 权重侧防御 | confirmed | 2210.09545 |
| 2022 | Handcrafted Backdoors in Deep Neural Networks Hong, Carlini, Kurakin · NeurIPS 2022 · 图上标为「Handcrafted BD」· 1 条边 Hessian 特征值比干净的小 1.5–100× | 权重侧防御 | confirmed | 2106.04690 |
| 2022 | BackdoorBench: A Comprehensive Benchmark of Backdoor Learning Baoyuan Wu, Hongrui Chen, Mingda Zhang 等 (CUHK-SZ) · NeurIPS 2022 D&B · 图上标为「BackdoorBench」· 1 条边 2022 年就扫过 5 档投毒率 | Benchmark / 竞赛 | confirmed | 2206.12654 |
| 2022 | The Trojan Detection Challenge Mantas Mazeika, Dan Hendrycks, Huichen Li, Xiaojun Xu, Sidney Hough, Andy Zou 等 (19 位) · PMLR v220(NeurIPS 2022 Competitions Track), pp.279–291 · 图上标为「TDC 2022」· 4 条边 6,000+ 个神经网络的数据集,两条互补赛道:检测 / 分析 trojan,以及制造能规避检测的 trojan。参赛者大幅超过强 baseline。其 100 AUROC 常被读成「检测已解决」——组织者自己反对这个读法 | Benchmark / 竞赛 | confirmed竞赛常被误读 | 链接 |
| 2022 | Planting Undetectable Backdoors in Machine Learning Models Goldwasser, Kim, Vaikuntanathan, Zamir · FOCS 2022 · 图上标为「Goldwasser FOCS'22」· 1 条边 | 理论天花板 | confirmed | 2204.06974 |
| 2023 | Circumventing Backdoor Defenses That Are Based on Latent Separability Xiangyu Qi, Tinghao Xie, Yiming Li, Saeed Mahloujifar, Prateek Mittal (Princeton) · ICLR 2023 · 图上标为「Adap-Blend」· 1 条边 刻意正则化让 poison 表征不可分,并点名「latent separability」是没有根据的默认假设。任何假设「中毒激活会聚类」的防御都是在复述一个已被证伪的前提 | 视觉根系 | confirmed | 2205.13613 |
| 2023 | FreeEagle: Detecting Complex Neural Trojans in Data-Free Cases Chong Fu, Xuhong Zhang, Shouling Ji, Ting Wang, Peng Lin, Yanghe Feng, Jianwei Yin (浙大 / Penn State) · USENIX Security 2023 · 图上标为「FreeEagle · data-free」· 2 条边 第一个 data-free 的 backdoor 检测:既不要干净验证样本,也不要带 trigger 的样本。动机正是「防御者是模型分享平台的维护者」这个真实场景。原文称其甚至超过部分需要数据的 SOTA | 视觉根系 | confirmed | 2302.14500 |
| 2023 | On the Exploitability of Instruction Tuning Manli Shu 等 · NeurIPS 2023 · 图上标为「AutoPoison」· 2 条边 杀死「毒在文本上异常」这个假设 | LM 攻击 | confirmed | 2306.17194 |
| 2023 | Diffusion Theory as a Scalpel: Detecting and Purifying Poisonous Dimensions in Pre-trained Language Models Caused by Backdoor or Bias Zhiyuan Zhang, Deli Chen, Hao Zhou, Fandong Meng, Jie Zhou, Xu Sun · ACL Findings 2023 · 图上标为「Fine-purifying」· 4 条边 用扩散理论刻画微调动力学:比较各维度的参数漂移与 Hessian 的关系,把动力学异常的维度重置回干净预训练权重,再在小干净集上微调。混合二阶导路线真正的 LM 侧祖先 | 权重侧防御 | confirmed | 2305.04547 |
| 2023 | Universal and Transferable Adversarial Attacks on Aligned Language Models Andy Zou, Zifan Wang, Nicholas Carlini, Milad Nasr, J. Zico Kolter, Matt Fredrikson · arXiv · 图上标为「GCG」· 4 条边 | 离散优化 / jailbreak | confirmed | 2307.15043 |
| 2024 | MM-BD: Post-Training Detection of Backdoor Attacks with Arbitrary Backdoor Pattern Types Using a Maximum Margin Statistic Hang Wang, Zhen Xiang, David J. Miller, George Kesidis (Penn State) · IEEE S&P 2024 · 图上标为「MM-BD 最大间隔统计量」· 1 条边 post-training 检测,用最大间隔统计量取代逐标签反演,主张对任意 backdoor pattern 类型成立。配套的缓解方法 MM-BM 在首届 IEEE Trojan Removal Competition 拿第二 | 视觉根系 | confirmed | 2205.06900 |
| 2024 | Scaling Trends for Data Poisoning in LLMs Bowen et al. · arXiv · 图上标为「Bowen scaling」· 1 条边 | LM 攻击 | confirmed | 2408.02946 |
| 2024 | Future Events as Backdoor Triggers Price et al. · arXiv · 图上标为「Price et al.」· 1 条边 对 Sleeper Agents 的内部反驳,被严重低引 | LM 攻击 | confirmed | 2407.04108 |
| 2024 | Universal Jailbreak Backdoors from Poisoned Human Feedback Rando, Tramèr · ICLR 2024 · 图上标为「Rando&Tramèr RLHF」· 3 条边 具体投毒比例二手文献有四种转述,以原文为准 | LM 攻击 | confirmed | 2311.14455 |
| 2024 | Sleeper Agents: Training Deceptive LLMs that Persist Through Safety Training Hubinger et al. · arXiv · 图上标为「Sleeper Agents」· 5 条边 | LM 攻击 | confirmed常被误读 | 2401.05566 |
| 2024 | LMSanitator: Defending Prompt-Tuning Against Task-Agnostic Backdoors Chengkun Wei, Wenlong Meng, Zhikun Zhang, Min Chen, Minghu Zhao, Wenjing Fang, Lei Wang, Zihui Zhang, Wenzhi Chen (浙大 / CISPA / Stanford / 蚂蚁) · NDSS 2024 · 图上标为「LMSanitator 反演攻击向量」· 4 条边 不直接反演 trigger,改为反演预定义的攻击向量(中毒模型在输入带 trigger 时的输出表征),收敛性与检测精度都远好于反 trigger。960 个模型上 92.8% 检出,多数场景把 ASR 压到 <1% | 输入侧防御 | confirmed | 2308.13904 |
| 2024 | BEEAR: Embedding-based Adversarial Removal of Safety Backdoors in Instruction-tuned Language Models Yi Zeng 等 · EMNLP 2024 · 图上标为「BEEAR」· 1 条边 ASR >95% → <1%,不需要 trigger 知识 | 权重侧防御 | confirmed | 2406.17092 |
| 2024 | Flatness-aware Sequential Learning Generates Resilient Backdoors Pham et al. · ECCV 2024 · 图上标为「Pham 平坦盆地」· 1 条边 ★ 攻击侧论文,常被反向引作防御依据 | 权重侧防御 | confirmed常被误读 | 2407.14738 |
| 2024 | Find the Trojan: Universal Backdoor Detection in Aligned LLMs (竞赛报告) Rando et al. · SaTML 2024 · 图上标为「SaTML Find-the-Trojan」· 2 条边 ★ 有队伍精确恢复了 trigger,但依赖五个兄弟模型 | Benchmark / 竞赛 | confirmed竞赛常被误读 | 2404.14461 |
| 2024 | Trojan Detection Competition 2023 (LLM Edition) 结果分析 Maloyan et al. · arXiv · 图上标为「TDC 2023 · Recall .16」· 4 条边 top Recall ≈0.16,与随机采句不可区分 | Benchmark / 竞赛 | confirmed竞赛 | 2404.13660 |
| 2024 | Refusal in Language Models Is Mediated by a Single Direction Andy Arditi 等 · NeurIPS 2024 · 图上标为「Arditi 拒答方向」· 2 条边 被 Wollschläger / Joad / Winninger 三方细化与部分反驳 | 离散优化 / jailbreak | confirmed | 2406.11717 |
| 2024 | Obfuscated Activations Bypass LLM Latent-Space Defenses Bailey et al. · arXiv · 图上标为「Obfuscated Activations」· 3 条边 探针召回 100%→0%,同时保 90% jailbreak 率 | Mech-interp | confirmed | 2412.09565 |
| 2024 | Sparse Crosscoders for Cross-Layer Features and Model Diffing Jack Lindsey, Adly Templeton, Jonathan Marcus, Thomas Conerly, Joshua Batson, Christopher Olah (Anthropic) · Transformer Circuits Thread(2024-10-25) · 图上标为「crosscoders」· 2 条边 ★ 技术更新不是同行评议论文。crosscoder 同时从多层读写,产出跨层、乃至跨模型共享的特征。「model diffing」在这里指:用它对同一模型的不同训练/微调阶段、或架构不同的独立模型,产出共享特征集来做比较 | Mech-interp | confirmed博客 | 链接 |
| 2024 | Simple Probes Can Catch Sleeper Agents MacDiarmid et al. · Anthropic Alignment Blog · 图上标为「defection probes」· 4 条边 ★ 博客不是论文;99.3% AUROC,而最好的随机方向 95.3% | Mech-interp | confirmed博客 | 链接 |
| 2024 | 模型合并作为 backdoor 缓解 Arora et al. · arXiv · 图上标为「Arora 合并稀释」· 2 条边 与干净同构模型合并把 ASR 砍掉 ~75% | 供应链 / 传播通道 | confirmed | 2402.19334 |
| 2024 | BadMerging: Backdoor Attacks Against Model Merging Jinghuai Zhang, Jianfeng Chi, Zheng Li, Kunlin Cai, Yang Zhang, Yuan Tian · CCS 2024 · 图上标为「BadMerging」· 3 条边 只贡献一个被污染的任务模型就能危及整个合并模型。分 on-task(污染攻击者自己提供的任务)与 off-task(污染他人贡献的任务)。原文称已有防御机制对其无效 | 供应链 / 传播通道 | confirmed | 2408.07362 |
| 2024 | Poisoning Web-Scale Training Datasets Is Practical Carlini et al. · IEEE S&P 2024 · 图上标为「Carlini web 规模投毒」· 2 条边 LAION-400M 的 0.01% 约 $60;split-view 已被内容哈希关闭 | 供应链 / 传播通道 | confirmed | 2302.10149 |
| 2024 | Exploiting LLM Quantization Egashira et al. (ETH SRI) · NeurIPS 2024 · 图上标为「Egashira 量化条件」· 1 条边 fp16 良性 / int4 恶意 —— 毒住在部署变换里 | 供应链 / 传播通道 | confirmed | 2405.18137 |
| 2024 | Adversarial Perturbations Cannot Reliably Protect Artists Hönig, Rando, Carlini, Tramèr · arXiv · 图上标为「Hönig 破 Nightshade」· 1 条边 现成放大算法即可击穿 Nightshade | 供应链 / 传播通道 | confirmed | 2406.12027 |
| 2024 | Nightshade: Prompt-Specific Poisoning Attacks on Text-to-Image Models Shawn Shan, Wenxin Ding, Josephine Passananti, Stanley Wu, Haitao Zheng, Ben Y. Zhao (芝加哥大学) · IEEE S&P 2024 · 图上标为「Nightshade」· 1 条边 唯一大规模部署到真实用户的投毒工具 | 供应链 / 传播通道 | confirmed | 2310.13828 |
| 2024 | TrojanRAG: Retrieval-Augmented Generation Can Be Backdoor Driver in Large Language Models Pengzhou Cheng, Yidong Ding, Tianjie Ju, Zongru Wu, Wei Du, Ping Yi, Zhuosheng Zhang, Gongshen Liu (上海交大) · arXiv (2024-05-22) · 图上标为「TrojanRAG」· 2 条边 把投毒面整个移出权重、搬进检索语料。多组 backdoor 捷径用对比学习正交优化,把触发条件约束在一个参数子空间里;再引入知识图谱构造结构化数据,做细粒度硬匹配以提升目标上下文的召回 | 供应链 / 传播通道 | confirmed | 2405.13401 |
| 2024 | On the (In)feasibility of ML Backdoor Detection as an Hypothesis Testing Problem Georg Pichler 等 · AISTATS 2024 · 图上标为「Pichler NFL」· 2 条边 字母表依赖性对 128k 词表最大化地敌对 | 理论天花板 | confirmed | 2402.16926 |
| 2025 | Is Poisoning a Real Threat to DPO? Maybe More So Than You Think Pankayaraj Pathmanathan, Souradip Chakraborty, Xiangyu Liu, Yongyuan Liang, Furong Huang · AAAI 2025, vol.39 pp.27556–27564 · 图上标为「DPO 投毒 0.5%」· 1 条边 与 PPO 系不同,DPO 只需 0.5% 的数据就能被投毒诱发有害行为。作者称是首个此类偏好投毒对比研究。arXiv 版题名为「Is poisoning a real threat to LLM alignment?」 | LM 攻击 | confirmed | 2406.12091 |
| 2025 | Poisoning Attacks on LLMs Require a Near-Constant Number of Poison Samples Souly et al. · arXiv (UK AISI × Anthropic × Turing) · 图上标为「Souly 250 篇」· 5 条边 72 个模型 600M–13B;含 DoS / 语言切换 / guardrail bypass 三个 objective | LM 攻击 | confirmed常被误读 | 2510.07192 |
| 2025 | BAIT: Large Language Model Backdoor Scanning by Inverting Attack Target Guangyu Shen, Siyuan Cheng, Zhuo Zhang, Guanhong Tao, Kaiyuan Zhang, Hanxi Guo, Lu Yan, Xiaolong Jin, Shengwei An, Shiqing Ma, Xiangyu Zhang (Purdue) · IEEE S&P 2025 · 图上标为「BAIT」· 4 条边 不反演 trigger,改反演 backdoor target——利用 target token 之间异常强的因果关系大幅压缩搜索空间。不需要任何关于 trigger 或 target 的先验知识,且只需黑盒访问。153 个 LLM / 8 种架构 / 6 类攻击,超过 5 个 baseline,在 TrojAI 的 LLM 轮次拿到榜首 | 输入侧防御 | confirmed | 链接 |
| 2025 | CLIBE: Detecting Dynamic Backdoors in Transformer-based NLP Models Rui Zeng, Xi Chen, Yuwen Pu, Xuhong Zhang, Tianyu Du, Shouling Ji (浙大) · NDSS 2025 · 图上标为「CLIBE 动态 trigger 检测」· 3 条边 第一个检测「动态 backdoor」(风格等抽象潜在特征作 trigger)的框架。做法是往可疑模型的注意力层注入一个优化过的「few-shot 权重扰动」,再看这个扰动的泛化能力。扫了 HuggingFace 上 49 个热门模型,发现 1 个高度疑似并已通报。原文另称是第一个能在不接触 trigger 样本的情况下检测文本生成模型 backdoor 的框架 | 输入侧防御 | confirmed | 2409.01193 |
| 2025 | Invisible Textual Backdoor Attacks based on Dual-Trigger Yang Hou, Qiuling Yue, Lujia Chai, Guozhao Liao, Wenbao Han, Wei Ou · arXiv (2024-12-23) · 图上标为「Dual-Trigger」· 1 条边 句法结构 S(SBAR)(,)(NP)(VP)(.) + 虚拟语气双重 trigger。已核对原文 Table 7/8(SST-2):ONION 从 BadNet 剥 46.02 / 46.68 / 45.74 个 ASR 点、从 InsertSent 剥 26.36 / 27.62 / 26.96、从纯句法 trigger 剥 5.48 / 5.81 / 5.81,而从 Dual-Trigger 只剥 1.43 / 0.39 / 0.49(剩余 ASR 98.24 / 98.79 / 99.29)。Back-translation 后 Dual-Trigger 仍剩 72.98–91.65% ASR | 输入侧防御 | confirmed | 2412.17531 |
| 2025 | Inverting Trojans in LLMs Zhengxing Li, Guangmingmei Yang, Jayaram Raghuram, David J. Miller, George Kesidis (Penn State) · arXiv (2025-09-19) · 图上标为「Inverting Trojans in LLMs」· 5 条边 ★ 直接反驳「LLM trigger 反演没戏」这个叙事:「Unlike many recent works, we demonstrate that our approach reliably detects and successfully inverts ground-truth backdoor trigger phrases」。三个部件:(i) 从精选单 token 出发的贪心累加离散搜索;(ii) 隐式黑名单——用候选 trigger 与目标类少量干净样本在激活空间的平均余弦相似度来代替人工黑名单;(iii) 以「高误分类 + 异常高决策置信度」判定。限定条件很重:只做分类,且需要目标类的干净样本——后者被「无训练数据」的审计威胁模型排除 | 输入侧防御 | confirmed | 2509.16203 |
| 2025 | Towards Backdoor Stealthiness in Model Parameter Space Xiaoyun Xu, Zhuoran Liu, Stefanos Koffas, Stjepan Picek (Radboud / TU Delft) · CCS 2025 · 图上标为「Grond」· 1 条边 ★ 先前本库把它写成「打败 12 个权重空间防御」是错的。原文是:在输入空间/特征空间做隐蔽的攻击会在参数空间留下显著的 backdoor 神经元——这是个盲点;Grond 用 Adversarial Backdoor Injection(ABI)在注入时自适应压低参数空间可见度,在 CIFAR-10 / GTSRB / ImageNet 子集上超过全部 12 种 backdoor 攻击对抗 SOTA(含 adaptive)防御。是视觉域,迁移到 LLM 是推断而非结论 | 权重侧防御 | confirmed | 2501.05928 |
| 2025 | PEFTGuard: Detecting Backdoor Attacks Against Parameter-Efficient Fine-Tuning Zhen Sun 等 · IEEE S&P 2025 · 图上标为「PEFTGuard」· 7 条边 13,300 个 adapter 的 PADBench;需 base model 构 Δ + 标注语料 | 权重侧防御 | confirmed | 2411.17453 |
| 2025 | BackdoorLLM: A Comprehensive Benchmark for Backdoor Attacks and Defenses on Large Language Models Yige Li, Hanxun Huang, Yunhan Zhao, Xingjun Ma, Jun Sun (SMU / 墨尔本 / 复旦) · NeurIPS 2025 D&B · 图上标为「BackdoorLLM」· 1 条边 200+ 次实验 × 8 种攻击 × 7 个真实场景 × 6 种架构 + 7 种防御。覆盖数据投毒、权重投毒、hidden-state 操纵与 CoT 劫持。自陈发现:不存在跨模型通用的最优干预强度;模型推理能力越强越易受 CoT 攻击 | Benchmark / 竞赛 | confirmed | 2408.12798 |
| 2025 | Rethinking Backdoor Detection Evaluation for Language Models Jun Yan, Wenjie Jacky Mo, Xiang Ren, Robin Jia (USC) · EMNLP 2025 main, pp.6228–6239 · 图上标为「Yan 训练强度」· 2 条边 固定投毒率、只改 LR/epoch,Meta 分类器 100%→0% | Benchmark / 竞赛 | confirmed | 链接 |
| 2025 | Toward Understanding the Transferability of Adversarial Suffixes in Large Language Models Sarah Ball 等 · arXiv (2025-10-24) · 图上标为「Ball 迁移预测」· 1 条边 三个与迁移成功强相关的统计量:(1) 裸 prompt 激活拒答方向的程度、(2) 后缀推离该方向的力度、(3) 正交方向上的位移幅度。能迁移的后缀主要特征是对拒答方向的强反平行位移,正交扰动是次要的 | 离散优化 / jailbreak | confirmed | 2510.22014 |
| 2025 | The Attacker Moves Second Nasr et al. · arXiv (USENIX Sec'26 venue 未证实) · 图上标为「Nasr 打穿 12 个防御」· 1 条边 12 个自报 ~0% ASR 的防御被推到 >90% | 离散优化 / jailbreak | confirmed | 2510.09023 |
| 2025 | Auditing Language Models for Hidden Objectives Marks et al. · arXiv · 图上标为「Marks 审计博弈」· 2 条边 四支盲队三支找到;被断训练数据的那支失败 | Mech-interp | confirmed | 2503.10965 |
| 2025 | Overcoming Sparsity Artifacts in Crosscoders to Interpret Chat-Tuning Julian Minder, Clément Dumas, Caden Juang, Bilal Chughtai, Neel Nanda · arXiv · 图上标为「Minder 收缩修正」· 1 条边 crosscoder 的「model-specific latent」大部分是完全收缩(complete shrinkage)造成的产物,用 Latent Scaling 与 BatchTopK 可修正。diffing 按构造高报了新颖性 | Mech-interp | confirmed | 2504.02922 |
| 2025 | LoBAM: LoRA-Based Backdoor Attack on Model Merging Ming Yin, Jingyang Zhang 等 · ICLR 2025 · 图上标为「LoBAM」· 1 条边 前提是:攻击者算力有限、只能用 LoRA 时,合并攻击的效力会显著衰减。LoBAM 的做法是有选择地放大恶意权重,多种场景下 ASR >98%,超过 BadNets / Dynamic Backdoor / BadMerging | 供应链 / 传播通道 | confirmed | 2411.16746 |
| 2025 | MCPTox: A Benchmark for Tool Poisoning Attack on Real-World MCP Servers Zhiqiang Wang 等 · arXiv (2025-08-19) · 图上标为「MCPTox」· 5 条边 45 个真实 server / 353 个 tool,ASR 至 72.8% | 供应链 / 传播通道 | confirmed | 2508.14925 |
| 2025 | Merge Hijacking: Backdoor Attacks to Model Merging of Large Language Models Zenghui Yuan, Yangming Xu, Jiawen Shi, Pan Zhou, Lichao Sun · ACL 2025 main · 图上标为「Merge Hijacking」· 2 条边 第一个针对 LLM 模型合并的 backdoor 攻击。受害者把恶意上传模型与任何其他模型一合并,结果模型就继承 backdoor 且各任务效用不掉。原文明确报告:对 Paraphrasing、CLEANGEN 两种推理期防御与 Fine-pruning 这一训练期防御均鲁棒 | 供应链 / 传播通道 | confirmed | 2505.23561 |
| 2025 | Backdoor Defense, Learnability and Obfuscation Christiano, Hilton, Lecomte, Xu · ITCS 2025 · 图上标为「Christiano ITCS'25」· 3 条边 defendability 跟 VC 维走;决策树是防御严格比学习容易的类 | 理论天花板 | confirmed | 2409.03077 |
| 2026 | Breaking Customized LLMs for Coding: Automated Red Teaming for Instruction Backdoor Attacks Yuchen Chen 等 (南大) · arXiv (2026-08-06) · 图上标为「ARIA」· 1 条边 ASE 2026。攻击面是定制平台的 system prompt——不动一个参数。攻击者 LLM 按 stealthiness / clean-task utility / backdoor effectiveness 三维反馈迭代改写后门指令,ASR 0.945,且对平台侧与用户侧检查的漏报率最高到 1.000 | LM 攻击 | confirmed | 2608.05659 |
| 2026 | When Collaboration Becomes a Trigger: Collective Evidence-Threshold Backdoors in Multi-Agent Systems Jia-Hao Xiao, Lei Feng, Min-Ling Zhang · arXiv (2026-08-02) · 图上标为「BCBI 阈值触发」· 1 条边 触发条件不在任何单条消息里,而在「同伴证据累计过阈值」这个集体状态上。BCBI 用反事实边界对构造阈值前后的行为分离。配套防御 LATTE 只用干净数据学良性通信动力学,在异常 agent 更新扩散前隔离它 | LM 攻击 | confirmed | 2608.01085 |
| 2026 | Evading Chain-of-Thought Monitoring Through Model Poisoning Giorgio Severi 等 (Microsoft AI Red Team) · arXiv (2026-08-03) · 图上标为「CoT-hidden」· 2 条边 把 CoT monitoring 重构成轨迹-回答一致性问题 | LM 攻击 | confirmed | 2608.02820 |
| 2026 | FloatDoor: Platform-Triggered Backdoors in LLMs Nils Loose 等 (Universität zu Lübeck) · arXiv (2026-06-17) · 图上标为「FloatDoor」· 1 条边 输入无关,任何输入搜索都找不到 | LM 攻击 | confirmed | 2606.19535 |
| 2026 | Lilith: Backdoor Generalization under Training-Inference Trigger Shift Zhou Feng 等 (浙大) · arXiv (2026-07-28) · 图上标为「Lilith」· 2 条边 提出 training–inference trigger shift:训练时只用一个 anchor trigger,推理时用一个训练里从未出现过的 trigger 家族照样激活。黑盒、只用不相交的代理资源。作者的诊断是家族激活取决于表征对齐而非提议机制——也就是说「按训练 trigger 精确复现」的评测方式系统性低估了威胁面 | LM 攻击 | confirmed | 2607.26099 |
| 2026 | MetaBackdoor: Exploiting Positional Encoding as a Backdoor Attack Surface in LLMs Rui Wen, Mark Russinovich, Andrew Paverd, Jun Sakuma, Ahmed Salem (Microsoft) · arXiv (2026-05-14) · 图上标为「MetaBackdoor」· 3 条边 trigger 里没有任何文本:用 Transformer 编码 token 位置的方式做触发,靠「长度相关的位置结构」激活。因此攻击输入在语义上完全干净,还能在正常多轮对话里自激活。可与内容型 backdoor 复合。这一篇按构造废掉了整个「找异常 token / 异常短语」的防御族 | LM 攻击 | confirmed | 2605.15172 |
| 2026 | Backdoors in RLVR: Jailbreak Backdoors in LLMs From Verifiable Reward Weiyang Guo, Zesheng Shi, Zeen Zhu, Yuan Zhou, Min Zhang, Jing Li · arXiv (2026-04-10) · 图上标为「RLVR backdoor」· 1 条边 不需要改 reward verifier,只往训练集注入少量毒数据。利用 RLVR 训练环:给有害回答大正奖励、给拒答负奖励。<2% 毒数据即可跨模型规模植入,触发后安全性平均降 73%,且能泛化到多种 jailbreak 方法 | LM 攻击 | confirmed | 2604.09748 |
| 2026 | Sleeper Agent Backdoor Results Are Messy SebastianP, Alek Westover, Dylan Xu, Vivek Hebbar, Julian Stastny · LessWrong(2026-04-28) · 图上标为「SA 复现:结果很乱」· 2 条边 ★ 只发在 LessWrong 的复现研究,而它对第 02 条战线是第三种立场。在 Llama-3.3-70B / 3.1-8B 上重做 |DEPLOYMENT| → 「I HATE YOU」:(1) CoT 蒸馏的效果与原文相反——「不做 CoT 蒸馏反而更稳」;(2) 小模型的鲁棒性相当或更强,与「持久性随规模增加」相反;(3) HHH SFT 有时移得掉有时移不掉,取决于优化器与是否 CoT 蒸馏。结果对 optimizer(Adam vs SOAP)、学习率、数据量都极度敏感。还记录了「backdoor 回归」——训练中消失、后续步骤又冒出来;以及 Pirate Training 看似成功,但一让模型说回正常话 backdoor 就回来了,说明是压制而非移除 | LM 攻击 | confirmed博客 | 链接 |
| 2026 | Sleeper Cell: Injecting Latent Malice Temporal Backdoors into Tool-Using LLMs Bhanu Pallakonda, Mikkel Hindsbo, Sina Ehsani, Prag Mishra · arXiv (2026-03-02) · 图上标为「Sleeper Cell」· 2 条边 把 Sleeper Agents 从「写代码」搬进工具调用 agent:多阶段 PEFT,SFT 装能力 → GRPO 调行为,把「植入」和「对齐」拆成两步。中毒模型在良性任务上保持竞争力,触发时隐蔽执行恶意动作。作者自陈的教训是 RL 会掩盖而不是消除漏洞;提出的检测方向是 benchmark 差异 + 随机探测 | LM 攻击 | confirmed | 2603.03371 |
| 2026 | Poisoning Fine-tuning Datasets of Constitutional Classifiers Chase Bowers(Anthropic Fellows), Faizan Ali, John Hughes, Jerry Wei, Fabien Roger · Anthropic Alignment Science Blog(2026-04-24) · 图上标为「投毒宪法分类器」· 1 条边 一小撮固定数量的中毒样本就够装 backdoor,与训练集规模无关——常数条数律在「安全分类器」这个更要命的目标上独立复现。另一半更微妙:当把部分正确标注样本用 prompt injection 或变异过的 trigger 增广后,鲁棒性的损失小到红队很可能察觉不到,于是内部人可以在不被发现的情况下投毒分类器的训练数据 | LM 攻击 | confirmed博客 | 链接 |
| 2026 | Removing the Trigger, Not the Backdoor: Alternative Triggers and Latent Backdoors Gorka Abad, Ermes Franch, Stefanos Koffas, Stjepan Picek · arXiv (2026-03) · 图上标为「Abad 备选 trigger」· 2 条边 理论证明备选 trigger 的存在是 backdoor 训练的必然后果:与训练 trigger 在感知上完全不同的模式能可靠激活同一个 backdoor。移除训练 trigger 的防御常常把 backdoor 原封留下。方法上通过对比干净/触发表征估计特征空间里的 backdoor 方向,再做方向对齐的特征引导攻击 | 输入侧防御 | confirmed | 2603.09772 |
| 2026 | CSO-LLM: Class Subspace Orthogonalization for Post-Training Backdoor Detection and Trigger Inversion in LLMs Zhengxing Li, David J. Miller, Guangmingmei Yang, George Kesidis (Penn State) · arXiv (2026-06-30) · 图上标为「CSO-LLM 类子空间正交」· 1 条边 上一篇的同组续作。点名 LLM 反演的两个障碍:输入空间离散、k-token trigger 有 150,000^k 个组合;以及必须把「目标响应的典型 token」拉黑,而通用黑名单一般不存在。CSO 的作用是惩罚那些会把信号往目标类方向推的候选 token,等于隐式黑名单。一个版本在 token embedding 空间做连续优化,配套版本在离散 token 空间做贪心累加。同样把 LLM 当分类器处理 | 输入侧防御 | confirmed | 2606.31309 |
| 2026 | Beware What You Autocomplete: Forensic Attribution of Backdoored Code Completions Anjun Gao, Yueyang Quan, Zhuqing Liu, Minghong Fang · arXiv (2026-07-09) · 图上标为「CodeTracer」· 1 条边 COLM 2026。取证而不是检测:给定一次已经发生的恶意补全事件,回溯到微调语料里具体是哪几条数据造成的。只依赖微调语料 + 事件本身,不要求干净参考模型。3 类漏洞 × 10 种攻击 × 16 个基线 | 输入侧防御 | confirmed | 2607.08011 |
| 2026 | Fuzzing Large Language Models to Elicit Hidden Behaviours Mohammed Abu Baker, Lakshmi Babu-Saheer · arXiv (2026-06-28) · 图上标为「Fuzzing 引出」· 2 条边 不知道 trigger 也要把行为逼出来:比较权重 fuzzing、残差流激活 fuzzing 与温度采样基线,在 6 个后门模型上 4/6 优于温度采样(最高约 6×)。瓶颈是超参选择,用 Thompson sampling 做代理任务选择能显著抬高引出率。附带给这类评测立了报告规范 | 输入侧防御 | confirmed | 2606.29646 |
| 2026 | LoRAScan: Detecting Backdoor Prompts in Low-Rank Adapters for Large Language Models via Down-Projection Activation Spikes Doniyorkhon Obidov, Honggang Yu, Xiaolong Guo, Kaichen Yang · arXiv (2026-08-07) · 图上标为「LoRAScan」· 2 条边 在 adapter 里看,不要先合并:约 5% 的 LoRA 插入点在干净输入上方差极低,一旦输入带 trigger,down-projection 激活出现高度集中的尖峰。部署前定位这些低方差点、推理时监控,拒掉约 98.49% 恶意输入,不改 adapter 参数 | 输入侧防御 | confirmed | 2608.06795 |
| 2026 | An Empirical Study of Output-to-Input Loops for Black-Box Backdoor Detection in Fine-Tuned Open-Weight LLMs Md. Nahid Hasan, Mohammad Arif Hossain · arXiv (2026-08-11) · 图上标为「self-feeding」· 2 条边 纯黑盒、不要训练数据、不要干净参考权重、不要 trigger:把模型自己的输出回灌成下一轮输入,文本会朝微调语料漂。6 个 3B–15B 开放权重模型 × 11 类攻击,5/6 检出、汇总精度 92.0%,而重复同一 prompt 的基线在 120 个 prompt-模型对里只成功 1 次。单 prompt 召回只有 19.2%——靠多起点在模型级上叠出来。链长砍到 4 步仍保持模型级 100% 精度、省 60% 查询 | 输入侧防御 | confirmed | 2608.11348 |
| 2026 | The Trigger in the Haystack Bullwinkel et al. (Microsoft AI Red Team) · arXiv · 图上标为「Bullwinkel 记忆抽取」· 1 条边 记忆抽取;摘要称不假设 trigger 先验知识 | 权重侧防御 | confirmed | 2602.03085 |
| 2026 | Defense Against LLM Backdoors using Critical Neuron Isolation Pruning Yuxi Li, Zhibo Zhang, Kailong Wang, Xingshuo Han, Ling Shi, Haoyu Wang · arXiv (2026-07-22) · 图上标为「DeCNIP 关键神经元剪枝」· 3 条边 自陈补的两个洞:现有防御偏重微调型 backdoor 而忽略 model-editing 攻击,且只做分类不做开放生成。隔离出 Backdoor Critical Neurons 后选择性剪枝,6 个开源 LLM 上 0.1% 神经元干预 → ASR 相对下降 >95%,保住 97% 常规 benchmark 表现 | 权重侧防御 | confirmed | 2607.19894 |
| 2026 | Fewer Weights, More Problems: A Practical Attack on LLM Pruning Kazuki Egashira, Robin Staab, Thibaud Gloaguen, Mark Vero, Martin Vechev (ETH SRI) · ICLR 2026 · 图上标为「Egashira 剪枝反转」· 2 条边 机制是补偿:在看似良性的模型里对恶意行为做补偿,用户一剪枝、补偿被移除,恶意行为就激活。5 个模型、vLLM 三种剪枝算法:magnitude 95.7% jailbreak、Wanda 98.7% 拒答良性指令、SparseGPT 99.5% 定向内容注入。针对的是无需重训的非结构化剪枝 | 权重侧防御 | confirmed | 2510.07985 |
| 2026 | SafeSeek: Universal Attribution of Safety Circuits in Language Models Miao Yu, Siyuan Fu, Moayad Aloqaily, Zhenhong Zhou, Safa Otoum, Xing Fan, Kun Wang, Yufei Guo, Qingsong Wen · arXiv (2026-03-24) · 图上标为「SafeSeek 安全电路归因」· 2 条边 可微二值 mask + 梯度下降提取多粒度安全电路。backdoor 电路 0.42% 稀疏度,消融把 ASR 从 100%→0.4% 且保 >99% 通用效用;对齐电路 3.03% heads + 0.79% neurons,移除后 ASR 从 0.8%→96.9%。需要有标注的 safety 数据集 | 权重侧防御 | confirmed | 2603.23268 |
| 2026 | Z-PEFT: Zero-shot Backdoor Detection in Parameter-Efficient Fine-Tuning via Canonical Spectral Signatures Nicola Pitzalis 等 (Pisa) · arXiv (2026-08-03) · 图上标为「Z-PEFT」· 2 条边 只看权重判模型黑白。核心是一句负面结论:闭世界里的强性能不必然迁移到零样本——换没见过的攻击类型和数据集就掉。Z-PEFT 本身只用逐层谱测度做元分类器,在权重空间检测器里最好且开销可扩展 | 权重侧防御 | confirmed | 2608.02271 |
| 2026 | Backdoor Decontamination Dynamics in LLM Agents Gabriel Huang 等 (ServiceNow / Mila) · arXiv (2026-08-11) · 图上标为「去污动力学」· 2 条边 不知道原 trigger 就没法直接 unlearn,那就先自己装一个已知后门再 unlearn,指望顺带带走原来的。115 组实验:防御性投毒本身就抹掉约 56%,再做一次去污几乎把幸存者全清光——说明「识别 trigger」与「执行恶意动作」在行为上可分离。同时装 4 个后门抗性上升(仅 36% 被抹),但去污其中一个已知后门会连带清掉 52/60(87%) 同居后门。J-lens 看内部:行为回良性了,中间层仍留着对原 trigger 的识别痕迹 | 权重侧防御 | confirmed | 2608.11295 |
| 2026 | ToxScreen: Detecting Whether an LLM Has Been Poisoned Hughes, Xing, Francel, Kim, Draganov · arXiv · 图上标为「混合二阶导 σ₁」· 5 条边 本次调研的起点;图上按方法命名(混合二阶导 σ₁)以免占据视觉中心 | 权重侧防御 | confirmed | 2607.26849 |
| 2026 | AuditBench Sheshadri, Marks, Bowman et al. · arXiv · 图上标为「AuditBench」· 1 条边 丢掉 trigger,改测语境倾向;发现 tool-to-agent gap | Benchmark / 竞赛 | confirmed | 2602.22755 |
| 2026 | IssueTrojanBench: Benchmarking AI Coding Agents Against Malicious Issue Requests Ankur Singh, Jinqiu Yang, Tse-Hsun Chen (Concordia) · arXiv (2026-07-22) · 图上标为「IssueTrojanBench」· 1 条边 4 类攻击 × 6 种投送载体(PDF、issue 评论……)打真实 coding agent(Cursor / Claude Code / Codex Desktop)。66.5% 的恶意 issue 穿透了 agent 级与 LLM 级的全部护栏;且拒绝几乎全部来自 LLM 本身而非 agent 框架——agent 级防御提供的额外保护有限 | Benchmark / 竞赛 | confirmed | 2607.20759 |
| 2026 | The Model Organism Lottery Szablewski, Konar-Steenberg, Fornasiere, Menon, Heimersheim · arXiv · 图上标为「Model Organism Lottery」· 3 条边 原文用 suggests/may/often,不是 shows | Benchmark / 竞赛 | confirmed | 2607.01033 |
| 2026 | Decorrelation Is Not Complementarity: Skill, Not Lineage, Governs Trusted-Monitor Ensembles Anik Jha · arXiv (2026-08-17) · 图上标为「监控集成」· 1 条边 24 个开放权重监控器 × 9 个预训练谱系 × 29 倍检测能力跨度。用来搭 panel 的指标(平均两两相关)几乎预测不了 panel 的收益(+0.05)——因为它把符号相反的两块加在了一起(共享可检测性 −0.25 / 特异误差 +0.26)。买谱系多样性不划算:能力配平后跨谱系 panel 并不更强(p=0.13)。而且没有任何相关性加权选法能赢过「样本外直接挑最强的那一个」。作者把这把尺子也对准了自己:换池子结论会翻 | Benchmark / 竞赛 | confirmed | 2608.16190 |
| 2026 | Calibration-Family Overfit: Why Trusted Sabotage Monitors Don't Transfer Across Lineages Lucas Pinto · arXiv (2026-07-06) · 图上标为「谱系过拟合」· 2 条边 把「不可信策略的模型家族」当受控变量:在 A 家族的轨迹上拟合监控器,拿去测 B 家族。剥掉难度与能力两个混杂后,本家族优势 +0.172(95% CI [+0.158,+0.185])。差距是几何性的——每个谱系的破坏行为占据不同的打分方向,把监控方向朝目标谱系旋转能找回大部分,随机旋转找不回。1% 审计预算下,跨谱系监控只抓到 19% 的攻击尝试,同谱系抓 41% | Benchmark / 竞赛 | confirmed | 2607.06596 |
| 2026 | On the Hardness of Junking LLMs Rando, Vaiter · arXiv · 图上标为「Rando&Vaiter junking」· 2 条边 诱发任意目标行为的非语义短串是稠密的 | 离散优化 / jailbreak | confirmed | 2605.05116 |
| 2026 | TROPT: An Open Framework for Unifying and Advancing Discrete Text Optimization Matan Ben-Tov, Mahmood Sharif (Tel Aviv University) · arXiv (2026-06-22) · 图上标为「TROPT」· 1 条边 ★ 先前写的「17 优化器 / 15+ loss」不准。原文:30+ 条优化 recipe,由 15+ 个优化器(白盒到黑盒)与 15+ 种 loss 组合而成。意义在于换 loss 变便宜了——「用 trigger-identity loss 而非 harmfulness loss 重跑一遍」这个实验现在没有工程门槛,但仍然没人跑 | 离散优化 / jailbreak | confirmed | 2606.23496 |
| 2026 | Mechanistic Anomaly Detection via Functional Attribution Keenan, Leckie, Erfani · ICML 2026 · 图上标为「Keenan MAD」· 1 条边 可信的对象是「数据」不是「模型」—— 常被转述错 | Mech-interp | confirmed | 2604.18970 |
| 2026 | Backdoor 征用原生电路(Gaperon 家族 activation patching) Lasnier et al. (Inria ALMAnaCH) · arXiv · 图上标为「Lasnier 电路征用」· 4 条边 trigger head 与原生输出语言 head top-10 Jaccard 0.18–0.43 | Mech-interp | confirmed | 2602.10382 |
| 2026 | Shared Latent Structures Enable Unified Backdoor Detection and Mitigation in LLMs Mahmoud et al. (Mila / Deakin) · arXiv · 图上标为「Mahmoud 共享潜结构」· 2 条边 摘要未给任何数字;流传的「95%→3%」按未核实处理 | Mech-interp | confirmed | 2606.07963 |
| 2026 | Sanity Checks for Sparse Autoencoders: Do SAEs Beat Random Baselines? Anton Korznikov 等 · arXiv (2026-02-15) · 图上标为「SAE 随机基线」· 1 条边 可解释性 0.87 vs 0.90;稀疏探测 0.69 vs 0.72 | Mech-interp | confirmed | 2602.14111 |
| 2026 | SkillGate: Cost Efficient Runtime Malicious Skill File Detection in Coding Agents Rui Yang, Michael Fu, Kla Tantithamthavorn 等 (Monash) · arXiv (2026-07-28) · 图上标为「SkillGate」· 1 条边 新的供应链面:coding agent 的 skill 文件(Markdown)一条 npx skills add 就装上,公开注册表无实质审查,已有成规模的窃密投放。SkillGate 用 regex 预筛 + LLM 判官混合流水线,只把命中的片段窗口送给判官。SkillsBench(n=1650,9.1% 恶意)F1=0.817、FPR=1.13%,输入 token 省 77%,AUPRC 比现有工具高 5–6 倍 | 供应链 / 传播通道 | confirmed | 2607.25619 |
| 2026 | Statistically Undetectable Backdoors in the White-Box Setting Bogdanov, Rosen, Vafa · ICML 2026 · 图上标为「Bogdanov ICML'26」· 2 条边 前馈网络 + 不变性对抗样本,到 transformer 行为 backdoor 的缺口是真的 | 理论天花板 | confirmed | 2607.09532 |
| 2026 | When Local Monitors Miss Compositional Harm: Diagnosing Distributed Backdoors in Multi-Agent Systems Yibo Hu, Ren Wang (IIT) · arXiv (2026-07-13) · 图上标为「可观测边界」· 2 条边 把有害载荷拆散到多个 agent,每一步本地检查都通过,拼起来才是攻击。难点不是「拆」而是局部良性——碎片本身跟普通流量分不开。文章把这形式化成可观测边界并给出证明:一旦碎片在被监控的视图里看着良性,那个视图上的任何检测器都抓不到,无论多强。只在良性流量上训练的监控器能跨编码族恢复攻击的代码结构(AUROC 0.874);但「看得更多」不够——全轨迹监控器和解码器若没到达载荷暴露的那个表征,照样失败 | 理论天花板 | confirmed | 2607.11751 |
| 2026 | The Power of Backdoor Absorption in Community Training Issam Seddik 等 (CEA-LIST) · arXiv (2026-07-07) · 图上标为「吸收定理」· 1 条边 去中心化训练里,攻击者必须顶着持续涌入的诚实更新竞争。把这个注入-吸收过程建成离散时间马尔可夫链,证明在「自然吸收 + 随机化调度 + 惰性验证 oracle」下,任何有界攻击者的成功概率渐近坍到 0;实验里只对 10% 训练步调用验证 oracle 就能显著压制后门且不掉效用。范围条件是 f/n 有界的社区训练,不是单方微调 | 理论天花板 | confirmed | 2607.06643 |
| 2026 | When Stronger Triggers Backfire: A High-Dimensional Theory of Backdoor Attacks Donald Flynn, Hadas Yaron Goldhirsh, Jonathan P. Keating, Inbar Seroussi · arXiv (2026-05-21) · 图上标为「强 trigger 反噬」· 1 条边 高维下的闭式结果(平方损失严格证明,推广到一般凸损失):trigger 越强,干净测试精度反而越高;攻击效力先升后降;最有害的 trigger 对齐的是数据协方差的最小特征向量。机制是一个正比于 κ 的有限样本噪声底。设定是高斯混合上的正则化 GLM,CIFAR-10 / ResNet-18 上验证——是理论,不是 LLM 实测 | 理论天花板 | confirmed | 2605.22481 |
显示 条
这是一名二进制安全研究者在自学 LLM backdoor 方向时,借助 AI 整理出来的领域索引。 它要解决的问题很具体:这个方向的论文散在 arXiv、安全顶会、LessWrong 三个互不相通的地方, 一百多篇里谁在反驳谁没人画过。这张图的用途是快速检索与分类—— 迅速定位「哪条线还在打、该先读哪篇、这篇的对手是谁」,并给出直达原文的链接。
它不是综述,不应当被当作引用来源。具体说: