越狱这片森林里,反驳比结果更承重。 几乎每一个被广泛引用的防御结论,都能找到一篇同年、常常互不引用的论文把它的 ASR 从接近零打回九成以上。 这份图不按「进展」排列文献,而是把整个领域重画成一张签名边的网络: 谁继承谁、谁佐证谁、谁证伪谁。图上另标出一类反复出现的现象:哪些论文被系统性误读——被误读的那一篇往往正是被引用最多的那一篇。
整个领域回答同一个问题:给你一个已经对齐的模型,你能不能保证它在任何输入下都不交付被禁的能力。 定义它的是一条结构性不对称——攻击者只需要一条输入奏效;防御者要在一整个语义等价类上封住所有入口, 而这个等价类包含翻译、密码、ASCII、时态变换、角色扮演、多轮拆解、编码微调……没有人能枚举它。
2022 到 2023 年,RLHF 拒答训练看起来是一套相当完整的方案。HH-RLHF 与 Llama 2-Chat 定下的模板是: 收集有害请求与拒答的偏好数据,用 RLHF 把拒答训进模型,再用红队迭代补洞。下面四条不是原作者写下的假设, 而是顺着这套做法拆出来的隐含前提。四条在三年里全部被打破,而且都不是被更强的优化打破的。
第一条是深层原因。不是词表大,而是「有害」这个谓词定义在语义上,而模型的输入空间是语义等价类的无穷集合。 整个 2023–2026 年的工作,可以读成对这四条的四种不同回应。
自动化攻击的成本已经趋近于零。不同配方分别做到过:黑盒 不到二十次查询、 单卡 一分钟内 89%、把 GCG 的评估数从约 256K 压到 32K、 4 秒生成 200 个后缀、一次查询对 GPT-4o 约 98%。 这些数字来自不同基准与判定器,不能横向比较,但方向一致: 「越狱太贵所以不实用」这个论点在 2024 年就已经死了。
拿到权重就等于拿到 helpful-only 模型。这条从 2023 年 10 月起就没有被反转过。 抗篡改这条防御路线(RepNoise / TAR / Vaccine / Patcher / HarmAlign)一直在做, 但 2026 年的统一评测在超参扫描下报告对齐阶段防御基本都撑不住, 而更麻烦的是有一整类攻击根本不微调——直接消融拒答方向就够了。
安全机制极稀疏,而且不止一处稀疏。三份独立度量指向同一件事:一个残差流方向、 0.006% 的参数(单个注意力头)、3% 的参数 / 2.5% 的秩。 但「稀疏」不等于「一维」——后续工作找到了多个机制上独立的拒答方向, 而且保护住那几个百分点并不能挡住微调攻击。
跨论文的 ASR 数字不可比,原因已经被定位。不是复现问题——把 30 篇论文的攻击搬进统一 harness 后, 复现值与原文的平均偏差只有 +0.26 个百分点。差异来自三处:判定器口径、变体配置的选择, 以及「成功」的定义本身(绕过拒答 ≠ 交付有用信息;提示越狱要付一笔能力税,权重越狱不付)。
在 backdoor 检测那边,训进已部署权重里的行为后门真实事故是零。 这里相反:野外事故是常态。1,405 条野外越狱提示、131 个社区、 最早的一条高效提示已在线存活 240 天以上而未被封堵。 所以这个领域不缺「为什么要研究」的理由,缺的是能被独立复现的防御结论—— 图上 89 条反驳边对 42 条佐证边,说的就是这件事。
还有一处结构性差异值得先记住:本图的理论泳道只有 3 个点。 backdoor 检测有四条独立的不可能性结果(计算不可区分、信息论 no-free-lunch、defendability 跟 VC 维、白盒统计不可检测); 越狱这边只有 BEB 的渐近可达性、语义审查的不可判定性,加一篇认证防御。 这不是收录疏漏,是这个领域真实的形状——它由经验攻防主导,理论侧几乎空着。
每条是一个具体命题,左边持它的论文、右边反对的论文。裁定栏标的是证据成色,不是对错。 凡涉及 2026 年的 preprint,默认未复现。每条卡片末尾的 note 第一句写的是 crux—— 双方为什么会得出不同结论,通常是威胁模型、攻击者预算或判定口径不同,而不是谁算错了。
这些说法在二手文献和社媒里流传很广,逐条回到原文后都站不住。这里展开写三条; 图上另有 46 个梅紫虚线节点,点击对应节点即可看到具体误读与订正。
「宪法分类器已经解决了通用越狱」
原文的句子是:在超过 3,000 小时的红队中,没有红队员找到一个通用越狱,能在多数目标查询上从被分类器保护的早期模型里抽出与无防护模型细节水平相当的信息。三处限定缺一不可。这是关于试过的攻击的陈述,不是关于攻击空间的陈述——2026 年有人把验证挪到分类器的预激活空间后,三个自训守卫分类器上每一种超矩形配置都返回 SAT,即在经验指标很高的情况下暴露出可验证的安全洞。另外,2026 年的第二代把红队时长降到 1,700+ 小时、目标查询定为 8 条、架构也换了,两代的数字不能直接比。
「GCG 证明了对抗后缀是通用且可迁移的」
标题里的 universal and transferable 常被读成「一个后缀通吃所有模型」。原文训练用的是 Vicuna-7B 与 13B,迁移是有的,但强度远不如同等预算的查询攻击——Hayase 等人做查询攻击的动机就是「迁移不够」,并报告能让 GPT-3.5 吐出迁移攻击做不到的有害字符串。更被忽略的是:GCG 的目标前缀本身是次优的,把 Llama-3 上的默认前缀换掉,nuanced ASR 从 14% 提到 80%。也就是说 GCG 既没有它看起来那么通用,也没有它能达到的那么强。
把 Ganguli 等人(2022)引作「模型越大越难被越狱」的依据
原文的结论是用人类红队攻击时,RLHF 模型越大越难攻破,模型只到 52B,harm 口径是冒犯性内容。换一个自变量,趋势就翻过来:bijection learning 报告被攻模型的能力水平与最有效攻击的复杂度之间有紧密关系——越强的模型被攻得越狠;数据投毒侧在 24 个模型、1.5B 到 72B 上报告越大的模型对投毒越敏感;而 CipherChat 的标题干脆就是「太聪明所以不安全」。这三者与 Ganguli 并不矛盾,因为攻击者能力这一维完全不同——但它们合起来否定了「继续 scaling 就会变安全」,而原文也从未这样主张。
只画参与了签名边的条目——没有边的不属于这张图。横轴是时间(2017→2026), 十一条泳道是十一条主干:左边四条是被攻击的对象与方法根系,中间四条是攻击,右边三条是防御、评测与理解。 节点大小 = 它的边数,所以枢纽是数出来的,不是挑出来的。 每条边走正交通道布线——竖直出线、独占一条水平轨道、竖直入线,任意两条线不会叠在一起,交叉一律 90°,可以逐条跟着走。 悬停隔离一个节点的边;点击打开它的条目卡,卡里列出跟它有签名边的全部论文,可以一路点着走下去。 默认是适应宽度——整条 2017→2026 的时间轴一次性塞进屏幕,纵向随页面滚,不需要左右拖; 代价是标签会缩到很小,所以要读细节就按 + 放大(放大后画布可直接抓着拖)。抽屉打开时图会自动让出宽度,整张仍然可见。
最该看的是比例:反驳边 89 条,佐证边只有 42 条。 在一个健康积累的领域里,这个比例应该反过来。 这里的形状是纵向重复的自我拆解——每一条防御主干在成熟之后,都长出至少一条打向自己的琥珀虚线: 通顺提示打掉困惑度过滤、语义攻击打掉字符扰动、混淆激活打穿探针与 SAE、 BoN 与 AmpleGCG-Plus 打穿 circuit breakers、abliteration 绕开整条抗篡改路线、 自适应攻击一次打穿 12 个防御、StrongREJECT 与分布式 ASR 打穿报数方式本身。 这个领域的形状不是积累,是自我拆解。 第二件事是那 46 个梅紫虚线节点——被系统性误读的,恰恰是被引用最多的那几篇(悬停可看具体误读内容)。这不是巧合:一篇论文被转述得越多,离原文越远。 第三件事是右下角的理论泳道只有三个点,而攻击泳道有四条——这个失衡本身就是本图最重要的观察之一。0 回到适应宽度,+/- 缩放,Ctrl/⌘+滚轮定点缩放 · 点击节点打开该条目及其相关论文
图上每个节点对应的书目与链接。核验状态是本项目的待办清单:
confirmed 表示本轮调研中逐条拉取过 arXiv abs 页(或论文集页)核对标题、作者、v1 日期与摘要;
待核 表示条目是凭记忆补的,引用前请自行核对;
无 arXiv 表示只有会议论文集或项目页。
本表不限于 arXiv。典型的例子是 Many-shot Jailbreaking——它只在 NeurIPS 2024 论文集里,
没有 arXiv 版本,只扫 arXiv 会完全错过,而它是长上下文攻击这条线的原点。
注记里的每一个数字都是从摘要或论文集页当场抄的;凡是原文没给出的数字,这里就不写。
| 年 | 条目 | 主干 | 状态 | 链接 |
|---|---|---|---|---|
| 2017 | HotFlip: White-Box Adversarial Examples for Text Classification Javid Ebrahimi, Anyi Rao, Daniel Lowd, Dejing Dou · ACL 2018 · 图上标为「HotFlip」· 1 条边 越狱这条线全部离散优化的原子操作就在这里:用 one-hot 输入的梯度估计「把这个 token 换成那个 token」的损失变化,再实际去翻。论文自己做的是字符级分类器,几次翻转就能大幅掉准确率,并顺手做了对抗训练。要留意它证明的东西有多窄——它是在分类任务上、有明确 label 的设置里成立的;后来 GCG 把同一个算子搬到自回归生成上,目标从「翻转标签」换成「让模型以 Sure, here is 开头」,这一步是移植,不是继承定理。 | 对抗根系 | confirmed | 1712.06751 |
| 2018 | Obfuscated Gradients Give a False Sense of Security: Circumventing Defenses to Adversarial Examples Anish Athalye, Nicholas Carlini, David Wagner · ICML 2018 · 图上标为「ObfGrad」· 2 条边 这篇不属于 LLM,但它是整张图上方法论层面被引用最多、也最常被忘记的一篇。ICLR 2018 的 9 篇非认证白盒防御里,7 篇依赖梯度混淆;作者的新攻击完全攻破 6 篇、部分攻破 1 篇,而且都在原论文自己设定的威胁模型内。这条教训在 2023–2026 年的 LLM 越狱防御里被逐字重演了一遍(见 2510.09023 用同样的姿势打穿 12 个防御)。「我们的防御把 ASR 降到接近 0」这句话,在没有自适应攻击的情况下没有信息量——这是本图判定防御条目成色的默认先验。 | 对抗根系 | confirmed常被误读 | 1802.00420 |
| 2019 | Universal Adversarial Triggers for Attacking and Analyzing NLP Eric Wallace, Shi Feng, Nikhil Kandpal, Matt Gardner, Sameer Singh · EMNLP 2019 · 图上标为「UnivTrig」· 3 条边 「输入无关的通用前后缀」这个概念的出处,也是 GCG 那个 universal 的直接来源。数字都在摘要里:SNLI 蕴含准确率从 89.94% 掉到 0.55%;SQuAD 里 72% 的 why 问题被答成同一句话;GPT-2 在非种族语境下也被诱导出种族主义输出。触发串用白盒梯度搜出来,但能迁移到别的模型。它测的是任务级指标退化,不是安全对齐——「通用后缀可迁移」这条性质是先在这里被观察到的,GCG 的贡献是把它对准了 RLHF 之后的拒答行为。 | 对抗根系 | confirmed | 1908.07125 |
| 2020 | AutoPrompt: Eliciting Knowledge from Language Models with Automatically Generated Prompts Taylor Shin, Yasaman Razeghi, Robert L. Logan IV, Eric Wallace, Sameer Singh · EMNLP 2020 · 图上标为「AutoPrompt」· 2 条边 梯度引导的 token 搜索在这里被用于正向目的——自动写 prompt 把 MLM 里的知识挖出来,在情感分析、NLI、LAMA 上不调参就能接近有监督基线。它跟越狱的关系是纯方法谱系:GCG 的坐标搜索是 AutoPrompt 的搜索加上 top-k 候选替换。把这条线摆在图上是为了说明攻击算法并不是安全研究发明的,而是从 prompt 工程那边整个搬过来的;这也解释了为什么后来防御方一直低估搜索侧的进步速度。 | 对抗根系 | confirmed | 2010.15980 |
| 2022 | Constitutional AI: Harmlessness from AI Feedback Yuntao Bai, Saurav Kadavath, Sandipan Kundu, Amanda Askell, Jackson Kernion, Andy Jones, et al. (Anthropic) · arXiv · 图上标为「Constitutional AI」· 5 条边 把「无害」从人类标注换成一份成文原则 + 模型自我批评/修订,再用 RLAIF 训。它给后来的 Constitutional Classifiers(2501.18837)提供了同一个思路的分类器版本。对越狱研究的意义在于:它使拒答不再只是行为模仿,而是有一份可以被写下来、被对照的规格——这正是 deliberative alignment(2412.16339)和一切「让模型先复述安全规格再回答」的做法的起点,也是 H-CoT(2502.12893)这类攻击的攻击面。 | 对齐训练 | confirmed | 2212.08073 |
| 2022 | Red Teaming Language Models to Reduce Harms: Methods, Scaling Behaviors, and Lessons Learned Deep Ganguli, Liane Lovitt, Jackson Kernion, Amanda Askell, Yuntao Bai, et al. (Anthropic) · arXiv · 图上标为「Ganguli 红队」· 5 条边 人类红队的规模化基线:2.7B / 13B / 52B 三个尺寸 × 四种模型(纯 LM、prompted、拒绝采样、RLHF),放出接近 39,000 条对抗测试样本。最常被引用的结论是「RLHF 模型越大越难攻破,其它变体随规模持平」。这条结论只在人类红队、这一批模型、这套 harm 口径下成立——2404.02151 的自适应攻击和 2410.01294 的 bijection 后来都给出了反向的规模趋势(越强的模型被攻得越狠),两者并不直接矛盾,因为攻击者能力这一维完全不同。 | 对齐训练 | confirmed常被误读 | 2209.07858 |
| 2022 | Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback Yuntao Bai, Andy Jones, Kamal Ndousse, Amanda Askell, Anna Chen, et al. (Anthropic) · arXiv · 图上标为「HH-RLHF」· 11 条边 这就是被越狱的那个东西。helpful/harmless 偏好建模 + RLHF 的工程实现,数据集公开,后续几乎所有开源对齐模型都从这里长出来。图上把它放进来是因为越狱的定义依赖于它:没有 RLHF 拒答行为,就没有「绕过」可言。论文自己给的一个量是 RL 奖励与策略到初始化的 KL 散度平方根大致成线性——这条关系后来被多篇文章引作「对齐只动了分布的一薄层」的旁证,但原文并没有做这个推断,那是 2406.05946 才明确论证的。 | 对齐训练 | confirmed | 2204.05862 |
| 2022 | Red Teaming Language Models with Language Models Ethan Perez, Saffron Huang, Francis Song, Trevor Cai, Roman Ring, John Aslanides, Amelia Glaese, Nat McAleese, Geoffrey Irving (DeepMind) · EMNLP 2022 · 图上标为「Red Team w/ LM」· 4 条边 用 LM 攻击 LM 的原型,比所有 attacker-LLM 类工作早一年半。在一个 280B 参数的聊天 LM 上挖出数万条冒犯性回复,方法从 zero-shot 生成一路到 RL。它同时也预告了后来 PAIR / TAP / J₂ 的全部形状。要注意它的判定器是冒犯性内容分类器,不是「有没有给出可执行的有害信息」——这条评测口径上的差别,一直要到 StrongREJECT(2402.10260)才被认真处理。 | 对齐训练 | confirmed | 2202.03286 |
| 2023 | Llama 2: Open Foundation and Fine-Tuned Chat Models Hugo Touvron, Louis Martin, Kevin Stone, Peter Albert, Amjad Almahairi, et al. (Meta) · arXiv · 图上标为「Llama 2-Chat」· 6 条边 图上唯一的模型发布条目,放进来是因为整条「微调撕掉对齐」的战线全部以它为标本:Meta 在安全微调上投入巨大并公开了做法,而 7B/13B/70B 权重全部开放。这两件事合起来,把「安全微调能不能挡住拿到权重的人」变成了一个可以被实验回答的问题。答案在 2310.20624 / 2311.00117 里:200 美元、单卡。这不是 Llama 2 的失败,是开放权重这个动作的结构性后果——TAR(2408.00761)之后所有 tamper-resistance 工作都在回应它。 | 对齐训练 | confirmed | 2307.09288 |
| 2023 | Safe RLHF: Safe Reinforcement Learning from Human Feedback Josef Dai, Xuehai Pan, Ruiyang Sun, Jiaming Ji, Xinbo Xu, Mickel Liu, Yizhou Wang, Yaodong Yang · ICLR 2024 · 图上标为「Safe RLHF」· 3 条边 把 helpful 和 harmless 拆成两个模型(reward 与 cost),用拉格朗日法在训练中动态调平衡。它针对的是 Jailbroken(2307.02483)诊断出的第一个失效模式——竞争目标:标注者在一条偏好里同时权衡有用与无害,本身就会混淆。实验只做到 Alpaca-7B、三轮微调,人评为主。它是「把竞争目标搬到损失函数里」这条路线上最干净的一篇,但没有回答第二个失效模式(不匹配的泛化)。 | 对齐训练 | confirmed | 2310.12773 |
| 2023 | DecodingTrust: A Comprehensive Assessment of Trustworthiness in GPT Models Boxin Wang, Weixin Chen, Hengzhi Pei, Chulin Xie, Mintong Kang, Chenhui Zhang, Chejian Xu, Zidi Xiong, et al. · NeurIPS 2023 (Outstanding Paper, D&B) · 图上标为「DecodingTrust」· 2 条边 覆盖毒性、刻板印象、对抗鲁棒性、分布外鲁棒性、隐私、机器伦理、公平性等多个维度的可信度评测。对本图最相关的一条结论是:GPT-4 在标准基准上通常比 GPT-3.5 更可信,但在越狱式的系统/用户提示下更脆弱,可能正因为它更精确地遵循(误导性的)指令。这是「能力提升同时提升攻击面」最早的系统性观察之一,后来在 2308.06463 与 2410.01294 上以更强的形式重现。 | 评测基建 | confirmed | 2306.11698 |
| 2023 | AutoDAN: Interpretable Gradient-Based Adversarial Attacks on Large Language Models Sicheng Zhu, Ruiyi Zhang, Bang An, Gang Wu, Joe Barrow, Zichao Wang, Furong Huang, Ani Nenkova, Tong Sun · arXiv · 图上标为「AutoDAN-G」· 2 条边 与 2310.04451 同名但不是同一篇,这是本领域最容易引错的一对。这一篇是梯度式的:在越狱与可读性双目标下从左到右逐 token 生成,产出的是通顺提示而非乱码,因此能穿过困惑度过滤;而且这些自动生成的提示里自发出现了人写越狱里常见的策略。它同时反驳了当时的两个乐观判断——「自动攻击必然是乱码所以可检测」「人写越狱数量有限所以可封堵」。作者还用同一套目标做了系统提示泄露。 | 离散优化攻击 | confirmed | 2310.15140 |
| 2023 | Universal and Transferable Adversarial Attacks on Aligned Language Models Andy Zou, Zifan Wang, Nicholas Carlini, Milad Nasr, J. Zico Kolter, Matt Fredrikson (CMU / Google DeepMind) · arXiv · 图上标为「GCG」· 30 条边 整个领域的坐标原点。做法是贪心 + 梯度的坐标搜索,找一个后缀最大化模型以肯定性开头(而不是拒答)回应的概率;后缀在 Vicuna-7B 与 13B 上训出来,却能迁移到 ChatGPT、Bard、Claude 与一批开源模型。它真正确立的有三件事:(1) 越狱可以自动化,不再靠人的巧思;(2) 对抗后缀可迁移;(3) 目标函数可以简化成一个前缀强制。这三件事各自都被后来的工作修正过——迁移率远低于「通用」二字给人的印象(2402.12329 就是为了补迁移不够而做的查询攻击),乱码后缀会被困惑度过滤(2308.14132 / 2309.00614),「Sure, here is」这个目标本身限制了攻击效果(2405.21018 与 2412.10321)。附带的 AdvBench 数据集后来成了评测争议的中心。 | 离散优化攻击 | confirmed常被误读 | 2307.15043 |
| 2023 | AutoDAN: Generating Stealthy Jailbreak Prompts on Aligned Large Language Models Xiaogeng Liu, Nan Xu, Muhao Chen, Chaowei Xiao · ICLR 2024 · 图上标为「AutoDAN-GA」· 2 条边 与 2310.15140 同名,注意区分。这一篇用分层遗传算法在人写 DAN 模板的语义空间里搜索,产出保持语义、可读、隐蔽的越狱提示,跨模型迁移与跨样本通用性都优于基线,并明确展示能绕过困惑度类防御。它和 GPTFuzzer 一起,把 GCG 之后那半年里「乱码后缀可以被 PPL 过滤挡住」的乐观判断打掉了——攻击者只要愿意放弃一点优化强度,就能换到完全通顺的提示。 | 语义 / 黑盒攻击 | confirmed | 2310.04451 |
| 2023 | "Do Anything Now": Characterizing and Evaluating In-The-Wild Jailbreak Prompts on Large Language Models Xinyue Shen, Zeyuan Chen, Michael Backes, Yun Shen, Yang Zhang (CISPA) · CCS 2024 · 图上标为「DAN」· 6 条边 野外越狱提示的测绘,不是攻击方法:1,405 条提示、2022-12 至 2023-12、131 个越狱社区,并观察到提示从网络社区向提示聚合站迁移、28 个账号持续优化超过 100 天。评测集是 13 个禁止场景 × 107,250 条样本,在六个 LLM 上发现五条高效提示对 GPT-3.5 与 GPT-4 都达到 0.95 ASR,最早的一条已在线存活 240 天以上。最后这个数字是本图上最有分量的经验事实之一:已知的、公开的、单条提示,厂商一年也没封掉。 | 语义 / 黑盒攻击 | confirmed常被误读 | 2308.03825 |
| 2023 | DeepInception: Hypnotize Large Language Model to Be Jailbreaker Xuan Li, Zhanke Zhou, Jianing Zhu, Jiangchao Yao, Tongliang Liu, Bo Han · arXiv · 图上标为「DeepIncep.」· 1 条边 以米尔格拉姆实验的权威服从为灵感,靠嵌套虚构场景让模型自己一层层脱离使用限制,成本极低,并且在后续轮次里持续越狱。在 Llama-2/3、GPT-3.5/4/4o 上都有效。它是「角色扮演 / 场景嵌套」这一族里被引用最多的形式化版本,也是多轮攻击的前身——真正把「一轮里嵌套」推进到「跨轮累积」的是 2402.17262 与 2404.01833。 | 语义 / 黑盒攻击 | confirmed | 2311.03191 |
| 2023 | GPTFUZZER: Red Teaming Large Language Models with Auto-Generated Jailbreak Prompts Jiahao Yu, Xingwei Lin, Zheng Yu, Xinyu Xing (Northwestern) · arXiv · 图上标为「GPTFuzzer」· 2 条边 把 AFL 的模糊测试框架搬到越狱模板上:以人写模板为种子,靠变异算子生成新模板,配种子选择策略与判定模型。报告对 ChatGPT 与 Llama-2 超过 90% 的攻击成功率,而且即使初始种子很差也能达到。对二进制安全背景的读者这一篇最好读——它就是一个 coverage-less 的模板 fuzzer,判定器换成了模型。它和 2310.04451 的遗传算法几乎同时,是「把搜索放在模板层而不是 token 层」这条路线的两个独立起点。 | 语义 / 黑盒攻击 | confirmed | 2309.10253 |
| 2023 | MasterKey: Automated Jailbreak Across Multiple Large Language Model Chatbots Gelei Deng, Yi Liu, Yuekang Li, Kailong Wang, Ying Zhang, Zefeng Li, Haoyu Wang, Tianwei Zhang, Yang Liu (NTU) · NDSS 2024 · 图上标为「MasterKey」· 1 条边 全图最像传统安全研究的一篇:借时间盲注 SQL 的思路,用时序侧信道逆向出 ChatGPT / Bard / Bing Chat 的服务端防御策略,再据此构造绕过。第二部分用微调 LLM 自动生成越狱提示,报告平均 21.58% 的成功率。这个数字比后来的攻击低很多,但它测的是带有厂商侧未公开防御的真实服务,和在开源权重上刷 ASR 不是同一件事——跨论文比 ASR 的经典陷阱之一就在这里。 | 语义 / 黑盒攻击 | confirmed常被误读 | 2307.08715 |
| 2023 | Jailbreaking Black Box Large Language Models in Twenty Queries Patrick Chao, Alexander Robey, Edgar Dobriban, Hamed Hassani, George J. Pappas, Eric Wong (UPenn) · arXiv · 图上标为「PAIR」· 5 条边 用一个 LLM 迭代改写去攻另一个 LLM,纯黑盒,常常不到二十次查询就成功,比当时的算法攻击省几个数量级。它把攻击的成本模型从「GPU 小时」换成「API 调用次数」,这一步改变了整个领域的实验设计——之后几乎所有黑盒攻击都以查询数为主坐标。它也是 TAP、Crescendomation、J₂ 的共同祖先。留意 PAIR 的 ASR 对判定器和模板极其敏感:2605.09070 后来实测同一个 PAIR 在 Mistral-7B 上最好模板 69%,而所有配置的并集覆盖到 88%。 | 语义 / 黑盒攻击 | confirmed常被误读 | 2310.08419 |
| 2023 | Jailbreaking ChatGPT via Prompt Engineering: An Empirical Study Yi Liu, Gelei Deng, Zhengzi Xu, Yuekang Li, Yaowen Zheng, Ying Zhang, Lida Zhao, Tianwei Zhang, Kailong Wang, Yang Liu · arXiv · 图上标为「PromptEng」· 3 条边 最早一批把社群越狱当成可分类对象来研究的实证工作:分类模型给出 10 种模式、3 个类别,用 3,120 条越狱问题覆盖 8 个禁止场景测 ChatGPT 3.5 与 4.0,发现这些提示能在 40 个用例场景里稳定绕过限制。它的贡献是把「越狱」从轶事变成了带分类学的数据;局限是评测口径粗(是否绕过 ≠ 输出是否真的有用),这一点要到 2402.10260 才被正面处理。 | 语义 / 黑盒攻击 | confirmed | 2305.13860 |
| 2023 | Tree of Attacks: Jailbreaking Black-Box LLMs Automatically Anay Mehrotra, Manolis Zampetakis, Paul Kassianik, Blaine Nelson, Hyrum Anderson, Yaron Singer, Amin Karbasi · NeurIPS 2024 · 图上标为「TAP」· 2 条边 PAIR 的树搜索版:攻击者 LLM 迭代改写候选提示,并在送去问目标模型之前先剪枝掉不太可能成功的候选,从而进一步压查询数。对 GPT-4 Turbo 与 GPT-4o 超过 80% 的成功率,并对带 LlamaGuard 的模型仍然有效。最后这一点是这条边的要害:输入输出守卫模型不构成对语义攻击的独立防线,因为攻击者可以把守卫模型一起当成被搜索的黑盒。 | 语义 / 黑盒攻击 | confirmed | 2312.02119 |
| 2023 | GPT-4 Is Too Smart To Be Safe: Stealthy Chat with LLMs via Cipher Youliang Yuan, Wenxiang Jiao, Wenxuan Wang, Jen-tse Huang, Pinjia He, Shuming Shi, Zhaopeng Tu · ICLR 2024 · 图上标为「CipherChat」· 3 条边 安全对齐几乎全在自然语言上做,那就换一种非自然语言说话。在 ChatGPT 与 GPT-4 上跨 11 个安全域测,某些密码在 GPT-4 的若干安全域里接近 100% 绕过。附带的 SelfCipher 更麻烦:靠角色扮演与示例唤起模型自身的一种内部能力,在多数场景下比人造密码还强。「能力越强越好骗」这个反直觉的方向从这里开始被反复观察到(见 2410.01294 的规模趋势)。 | 分布偏移 · 多轮 | confirmed常被误读 | 2308.06463 |
| 2023 | Jailbroken: How Does LLM Safety Training Fail? Alexander Wei, Nika Haghtalab, Jacob Steinhardt (UC Berkeley) · NeurIPS 2023 · 图上标为「Jailbroken」· 14 条边 全图最承重的一篇概念工作。它把「为什么越狱有效」归结为两个失效模式:竞争目标(模型的能力目标与安全目标冲突)与不匹配的泛化(安全训练没能覆盖到能力已经覆盖的域)。按这两条设计的新攻击在一批取自厂商红队集的不安全请求上每一条都成功,对象包括 GPT-4 与 Claude v1.3。作者由此提出安全-能力对等:安全机制必须和底层模型一样复杂,并明确反对「只靠 scaling 就能解决」。图上从它出发的一大批边(密码、低资源语言、ASCII、过去时、many-shot)全部是第二个失效模式的实例化。 | 分布偏移 · 多轮 | confirmed常被误读 | 2307.02483 |
| 2023 | Low-Resource Languages Jailbreak GPT-4 Zheng-Xin Yong, Cristina Menghini, Stephen H. Bach (Brown) · NeurIPS SoLaR 2023 (Best Paper) · 图上标为「低资源」· 3 条边 把不安全英文输入翻译成低资源语言,GPT-4 在 AdvBench 上有 79% 的比例会配合并给出可推进有害目标的可执行步骤,与当时最好的越狱攻击持平甚至更高;而中高资源语言的成功率显著更低。原因是安全训练数据的语言不平等。这条最刺人的地方在于攻击门槛:只要一个公开翻译 API,不需要任何优化。它同时把一个既有的公平性问题(低资源语言服务差)转成了对所有用户的安全问题。 | 分布偏移 · 多轮 | confirmed常被误读 | 2310.02446 |
| 2023 | Multilingual Jailbreak Challenges in Large Language Models Yue Deng, Wenxuan Zhang, Sinno Jialin Pan, Lidong Bing · ICLR 2024 · 图上标为「多语种」· 2 条边 把多语种风险拆成无意与有意两种场景。无意场景下,语言资源越少不安全内容比例越高——低资源语言约为高资源语言的三倍(ChatGPT 与 GPT-4 都是)。有意场景下,多语种提示与恶意指令组合后不安全输出率高到 ChatGPT 80.92% / GPT-4 40.71%。防御侧提出 Self-Defense 自动生成多语种安全微调数据。它和 2310.02446 是同月的独立证据,互相佐证;两篇合起来才让多语种安全从边角问题变成主线。 | 分布偏移 · 多轮 | confirmed | 2310.06474 |
| 2023 | Baseline Defenses for Adversarial Attacks Against Aligned Language Models Neel Jain, Avi Schwarzschild, Yuxin Wen, Gowthami Somepalli, John Kirchenbauer, Ping-yeh Chiang, Micah Goldblum, Aniruddha Saha, Jonas Geiping, Tom Goldstein (UMD) · arXiv · 图上标为「Baselines」· 5 条边 把视觉对抗防御的三大类(检测/预处理/对抗训练)系统搬过来评一遍,并明确追问哪种威胁模型在这个领域才是实际的。它当时给出的判断是:文本离散优化器较弱、优化成本较高,使标准自适应攻击在 LLM 上更困难,并把「过滤与预处理在 LLM 域是否比在视觉域更强」列为开放问题。这个开放问题在两年后有了明确答案,而且是否定的——BEAST(2402.15570)、Faster-GCG(2410.15362)把成本打下来,2404.02151 与 2510.09023 把自适应攻击补齐。图上它是一条被时间证伪的诚实判断,值得作为读法示范。 | 推理期防御 | confirmed常被误读 | 2309.00614 |
| 2023 | Llama Guard: LLM-based Input-Output Safeguard for Human-AI Conversations Hakan Inan, Kartikeya Upasani, Jianfeng Chi, Rashi Rungta, Krithika Iyer, Yuning Mao, Michael Tontchev, Qing Hu, Brian Fuller, Davide Testuggine, Madian Khabsa (Meta) · arXiv · 图上标为「Llama Guard」· 7 条边 把安全审核做成一个开放权重的分类模型:基于安全风险分类学,在 Llama2-7b 上微调,同时做提示分类与回复分类,支持多类输出与自定义分类目录、零样本/少样本。在 OpenAI Moderation 评测集与 ToxicChat 上匹配或超过当时可用的审核工具。它是整个「守卫模型」产业的起点。图上它有两条重要的反驳边:TAP(2312.02119)对带 LlamaGuard 的模型仍有效,FlipAttack(2410.02832)报告对 5 个守卫模型平均约 98% 的绕过率。 | 推理期防御 | confirmed常被误读 | 2312.06674 |
| 2023 | Detecting Language Model Attacks with Perplexity Gabriel Alon, Michael Kamfonas · arXiv · 图上标为「PPL 过滤」· 6 条边 GCG 之后一个月出现的最直接反制:用 GPT-2 算对抗后缀的困惑度,发现它们的困惑度极高。但这一篇诚实的地方在于它自己就报告了失败模式——扫过大量常规提示后,朴素困惑度过滤的误报是个严重问题;最终要用一个在困惑度与 token 长度上训练的 Light-GBM 才把误报压下去并检出测试集中大部分攻击。这个「高困惑度」前提在半年内就被打掉了:2310.04451 与 2310.15140 直接生成通顺提示,2510.08604 更是主动最小化困惑度。 | 推理期防御 | confirmed常被误读 | 2308.14132 |
| 2023 | Defending Against Alignment-Breaking Attacks via Robustly Aligned LLM Bochuan Cao, Yuanpu Cao, Lu Lin, Jinghui Chen (Penn State) · ACL 2024 · 图上标为「RA-LLM」· 1 条边 在已有对齐模型上加一层鲁棒对齐检查函数,不需要昂贵的重训或微调,并给了理论分析。报告把当时最好的对抗提示与流行的手写越狱提示的成功率从接近 100% 降到约 10% 或更低。它属于「随机丢弃/多次检查」这一族,与 SmoothLLM 同期同构。这个数字的成色要按 2510.09023 的标准重估——它没有面对为它设计的自适应攻击。 | 推理期防御 | confirmed | 2309.14348 |
| 2023 | SmoothLLM: Defending Large Language Models Against Jailbreaking Attacks Alexander Robey, Eric Wong, Hamed Hassani, George J. Pappas (UPenn) · arXiv · 图上标为「SmoothLLM」· 3 条边 第一个明确针对越狱的算法防御,基于一个关键观察:对抗生成的提示对字符级改动很脆。做法是对输入的多个副本随机扰动再聚合预测。对 GCG、PAIR、RandomSearch、AmpleGCG 都报告 SOTA 鲁棒性,并称对自适应 GCG 也有抵抗力,鲁棒性与常规性能之间有小但不可忽略的折衷。「对字符扰动敏感」这个前提是它的全部依赖——语义级攻击(PAP、Crescendo、InfoFlood)天然不受影响,2506.12274 明确报告 SmoothLLM 挡不住 InfoFlood。 | 推理期防御 | confirmed常被误读 | 2310.03684 |
| 2023 | Certifying LLM Safety against Adversarial Prompting Aounon Kumar, Chirag Agarwal, Suraj Srinivas, Aaron Jiaxun Li, Soheil Feizi, Himabindu Lakkaraju (Harvard / UMD) · COLM 2024 · 图上标为「erase-check」· 2 条边 第一个带可证明安全保证的越狱防御:逐个擦除 token 并用安全过滤器检查子序列,证书保证在一定规模内的对抗攻击不会把有害提示误判为安全。覆盖三种攻击形态(后缀、插入、任意位置注入),并给了 RandEC / GreedyEC / GradEC 三个高效的经验版本。证书的范围要读准——它是对扰动规模的保证,不是对语义等价改写、密码、多轮或微调的保证;lane 4 的整族攻击都在这个证书之外。 | 推理期防御 | confirmed | 2309.02705 |
| 2023 | Defending Large Language Models Against Jailbreaking Attacks Through Goal Prioritization Zhexin Zhang, Junxiao Yang, Pei Ke, Fei Mi, Hongning Wang, Minlie Huang (THU) · ACL 2024 · 图上标为「目标优先」· 1 条边 直接施工 Jailbroken(2307.02483)的第一个失效模式:有用与安全的目标冲突。做法是在推理与训练两个阶段都引入目标优先级。数字:推理期实施把 ChatGPT 的越狱 ASR 从 66.4% 降到 3.6%;训练期整合把 Llama2-13B 从 71.0% 降到 6.6%;即使训练中不含任何越狱样本也能把 ASR 砍半。附带一个有意思的观察——更强的模型风险更大,但也更能被引导去防御,两者都因为指令遵循能力更强。 | 推理期防御 | confirmed | 2311.09096 |
| 2023 | BadLlama: cheaply removing safety fine-tuning from Llama 2-Chat 13B Pranav Gade, Simon Lermen, Charlie Rogers-Smith, Jeffrey Ladish · arXiv · 图上标为「BadLlama」· 3 条边 同一组的 13B 版本:不到 200 美元撤掉 Llama 2-Chat 13B 的安全微调并保住通用能力。结论写得比姊妹篇更硬——权重一旦公开发布,安全微调就不构成防止滥用的手段。这句话是后来 TAR(2408.00761)、RepNoise(2405.14577)整条 tamper-resistance 路线的问题陈述;而 2605.26526 与 2602.06911 在 2026 年给出的答案是:到目前为止这句话仍然成立。 | 微调 · 权重篡改 | confirmed | 2311.00117 |
| 2023 | Removing RLHF Protections in GPT-4 via Fine-Tuning Qiusi Zhan, Richard Fang, Rohan Bindu, Akul Gupta, Tatsunori Hashimoto, Daniel Kang (UIUC / Stanford) · NAACL 2024 · 图上标为「GPT-4 微调」· 1 条边 把同一件事做到当时最强的闭源模型上:340 条样本、95% 成功率移除 GPT-4 的 RLHF 保护,而且训练样本可以用更弱的模型自动生成。同时验证移除保护没有降低模型在非审查输出上的有用性——这一点排除了「攻击者要付能力税」这个安慰。它证伪了当时一个合理的期待:最强的模型也许对微调攻击更抗。 | 微调 · 权重篡改 | confirmed | 2311.05553 |
| 2023 | LoRA Fine-tuning Efficiently Undoes Safety Training in Llama 2-Chat 70B Simon Lermen, Charlie Rogers-Smith, Jeffrey Ladish (Palisade Research) · arXiv · 图上标为「LoRA 撕」· 3 条边 不到 200 美元、单张 GPU,用量化 LoRA 撤掉 Llama 2-Chat 7B / 13B / 70B 以及 Mixtral instruct 的安全训练:70B 在两个拒答基准上的拒答率降到约 1%,同时在两个通用性能基准上保持能力。作者的论点很直接——发布模型权重的风险评估必须把微调纳入核心项。它与 2311.00117 同日出现、作者高度重叠,是同一组工作的两个规模点。 | 微调 · 权重篡改 | confirmed | 2310.20624 |
| 2023 | Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To! Xiangyu Qi, Yi Zeng, Tinghao Xie, Pin-Yu Chen, Ruoxi Jia, Prateek Mittal, Peter Henderson (Princeton / Virginia Tech / IBM) · ICLR 2024 · 图上标为「Qi 微调」· 12 条边 这条战线的奠基篇,两个结论要分开记。第一个是攻击:10 条对抗设计的样本、不到 0.20 美元,经 OpenAI 的微调 API 就能拆掉 GPT-3.5 Turbo 的护栏。第二个更麻烦——用完全良性的常用数据集微调也会无意中削弱安全对齐。后者才是让这一篇进入所有威胁模型讨论的原因:它意味着微调服务的安全风险不需要恶意用户也存在。作者的框架结论是现有安全基建只覆盖推理期,不覆盖把微调权限交给终端用户之后的情形。 | 微调 · 权重篡改 | confirmed常被误读 | 2310.03693 |
| 2023 | Universal Jailbreak Backdoors from Poisoned Human Feedback Javier Rando, Florian Tramèr (ETH Zurich) · ICLR 2024 · 图上标为「RLHF 投毒」· 4 条边 把越狱和数据投毒接在一起:攻击者污染 RLHF 训练数据,在模型里种一个万能触发词,加在任何提示后面就等于一条 sudo 命令,不需要再去搜对抗提示。作者自己给出的限定同样重要——这种通用越狱后门比以往研究的语言模型后门强得多,也显著更难用常见后门技术种进去,并分析了 RLHF 中哪些设计带来了这种抵抗力;同时放出一批投毒模型作为基准。这是本图与 backdoor 检测那张图之间的桥。 | 微调 · 权重篡改 | confirmed | 2311.14455 |
| 2023 | Shadow Alignment: The Ease of Subverting Safely-Aligned Language Models Xianjun Yang, Xiao Wang, Qi Zhang, Linda Petzold, William Yang Wang, Xun Zhao, Dahua Lin · arXiv · 图上标为「Shadow」· 2 条边 100 条恶意样本、1 GPU 小时,把安全对齐的开源模型改造成会配合有害任务的模型,而且不损失有用性、对常规问题仍正常回答。跨 5 个组织的 8 个模型(LLaMa-2、Falcon、InternLM、BaiChuan2、Vicuna)都成立,单轮英文的攻击还能迁移到多轮与其它语言。它和 2310.03693 同月出现,一个从开源权重侧、一个从微调 API 侧,把同一个结论钉死。 | 微调 · 权重篡改 | confirmed | 2310.02949 |
| 2023 | Steering Llama 2 via Contrastive Activation Addition Nina Panickssery, Nick Gabrieli, Julian Schulz, Meg Tong, Evan Hubinger, Alexander Matt Turner · ACL 2024 · 图上标为「CAA」· 5 条边 把「行为方向」这个操作定型:用正负行为示例在残差流激活上的差值构造转向向量,推理时按系数加到用户提示之后的所有 token 位置。在 Llama 2 Chat 上显著改变行为,能叠加在微调与系统提示之上,且对能力损伤很小。它是 refusal direction(2406.11717)在方法上的直接前身,也是后来一整族 steering 防御与攻击的共同工具。 | Mech-interp | confirmed | 2312.06681 |
| 2023 | Fundamental Limitations of Alignment in Large Language Models Yotam Wolf, Noam Wies, Oshri Avnery, Yoav Levine, Amnon Shashua (HUJI / AI21) · ICML 2024 · 图上标为「BEB」· 5 条边 本图上唯一一条攻击必然存在的理论结果。BEB 框架证明:在该框架的限度内,对任何有有限概率被模型表现出的行为,都存在能触发它的提示,且触发概率随提示长度增加。推论直接——任何只是削弱而没有完全消除某种不良行为的对齐过程,对对抗提示都不安全;框架还提示了 RLHF 这类方法为什么会让模型易于被提示进不良行为,并把「扮演恶意人格」的现实越狱作为大规模经验佐证。读的时候必须带上「在该框架的限度内」这句:它是关于 prompt 长度与行为概率的渐近陈述,不给出任何有限长度下的具体界。 | 理论天花板 | confirmed常被误读 | 2304.11082 |
| 2023 | LLM Censorship: A Machine Learning Challenge or a Computer Security Problem? David Glukhov, Ilia Shumailov, Yarin Gal, Nicolas Papernot, Vardan Papyan (Toronto / Oxford / DeepMind) · arXiv · 图上标为「不可判定」· 4 条边 针对输出侧语义审查这一整类防御的理论限制:由于 LLM 具备程序性与指令遵循能力,语义审查可以被视为一个不可判定问题。作者进一步指出问题不止于语义审查——有知识的攻击者可以从一组各自允许的输出里重构出不被允许的输出。结论是把审查当成安全问题而不是机器学习问题来处理。后半段那条重构论点是本图上最被低估的一条:它意味着逐条回复的无害性判定即使做到完美,也不构成系统级的安全性。 | 理论天花板 | confirmed常被误读 | 2307.10719 |
| 2024 | Deliberative Alignment: Reasoning Enables Safer Language Models Melody Y. Guan, Manas Joglekar, Eric Wallace, Saachi Jain, Boaz Barak, Alec Helyar, et al. (OpenAI) · arXiv · 图上标为「Deliberative」· 5 条边 OpenAI o 系列的对齐做法:把安全规格直接教给模型,让它在回答前显式回忆并推理这份规格,不需要人写 CoT 或答案。原文的说法是同时提高越狱鲁棒性、降低过度拒答,并改善分布外泛化。它是「推理即防御」这条线的官方版本,和 2501.18841 的经验结果同向。但把安全判断放进 CoT 也就把攻击面放进了 CoT:H-CoT(2502.12893)与 CoT Hijacking(2510.26418)攻的正是这一层。 | 对齐训练 | confirmed常被误读 | 2412.16339 |
| 2024 | HarmBench: A Standardized Evaluation Framework for Automated Red Teaming and Robust Refusal Mantas Mazeika, Long Phan, Xuwang Yin, Andy Zou, Zifan Wang, Norman Mu, Elham Sakhaee, Nathaniel Li, Steven Basart, Bo Li, David Forsyth, Dan Hendrycks (CAIS) · ICML 2024 · 图上标为「HarmBench」· 9 条边 自动红队的第一个标准化框架,规模是18 种红队方法 × 33 个目标 LLM 与防御的大规模横评。它同时给出了一个高效的对抗训练方法(R2D2),用来演示同一框架下攻防可以协同开发。它取代 AdvBench 成为事实标准,与 JailbreakBench 一起是本图之后几乎所有攻击论文的报数底座。局限在判定器与行为集本身的口径,这正是 2402.10260 与 2605.09070 接着攻的地方。 | 评测基建 | confirmed常被误读 | 2402.04249 |
| 2024 | JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models Patrick Chao, Edoardo Debenedetti, Alexander Robey, Maksym Andriushchenko, Francesco Croce, Vikash Sehwag, Edgar Dobriban, Nicolas Flammarion, George J. Pappas, Florian Tramer, Hamed Hassani, Eric Wong · NeurIPS 2024 D&B · 图上标为「JailbreakBench」· 8 条边 指认评测的三个具体病:缺少标准化实践、成本与成功率的算法互不可比、可复现性差。四件产出:持续更新的越狱工件库、100 条行为的数据集(自制加取自 GCG 与 HarmBench,对齐 OpenAI 使用政策)、标准化评测框架与明确威胁模型、排行榜。camera-ready 版还补了更准的判定器(Llama-3-70B 定制提示)、300 条人类偏好样本用于选判定器、过度拒答评测集。它与 HarmBench 是同一问题的两个解,长期并存,这本身就是评测碎片化尚未收敛的证据。 | 评测基建 | confirmed常被误读 | 2404.01318 |
| 2024 | JailbreakEval: An Integrated Toolkit for Evaluating Jailbreak Attempts Against Large Language Models Delong Ran, Jinyuan Liu, Yichen Gong, Jingyi Zheng, Xinlei He, Tianshuo Cong, Anyu Wang · NDSS 2025 (poster) · 图上标为「JailbreakEval」· 1 条边 调查了 2023-05 至 2024-04 间近 90 篇越狱研究,把判定方式归成四类:人工标注、字符串匹配、提示聊天模型、调用文本分类器。然后把它们打包成一个工具箱,一条命令即可评测。这一篇的价值在那份调查而非工具:它把「不同论文的 ASR 数字为什么不可比」量化成了判定器的分类学。任何跨论文比较 ASR 的做法,都应当先在这份分类里定位两边的判定器。 | 评测基建 | confirmed | 2406.09321 |
| 2024 | SORRY-Bench: Systematically Evaluating Large Language Model Safety Refusal Tinghao Xie, Xiangyu Qi, Yi Zeng, Yangsibo Huang, Udari Madhushani Sehwag, Kaixuan Huang, Luxi He, Boyi Wei, Dacheng Li, Ying Sheng, Ruoxi Jia, Bo Li, Kai Li, Danqi Chen, Peter Henderson, Prateek Mittal · ICLR 2025 · 图上标为「SORRY-Bench」· 1 条边 针对拒答评测的三个缺陷。第一是分类学过粗且分布失衡——在被评的十个现有数据集里,自伤类指令的测试量比欺诈类少三倍以上;SORRY-Bench 改用 44 个细粒度不安全主题、440 条类别均衡的指令。第二是提示的语言学特征与格式被忽略,补了 20 种语言学增强。第三是评测依赖 GPT-4 太贵,收集 7K+ 人类标注做元评测后发现微调的 7B 模型即可达到 GPT-4 量级的准确率。最后在 50 多个模型上评测。它管的是「什么该被拒」这一侧,与 HarmBench 管的「攻击强不强」正交。 | 评测基建 | confirmed常被误读 | 2406.14598 |
| 2024 | A StrongREJECT for Empty Jailbreaks Alexandra Souly, Qingyuan Lu, Dillon Bowen, Tu Trinh, Elvis Hsieh, Sana Pandey, Pieter Abbeel, Justin Svegliato, Scott Emmons, Olivia Watkins, Sam Toyer (UC Berkeley) · NeurIPS 2024 D&B · 图上标为「StrongREJECT」· 5 条边 全图上对既有结论杀伤力最大的一篇评测工作。开篇论断很直接:越狱论文普遍大幅夸大自己的效果。原因是缺少高质量标准基准,于是各自造。StrongREJECT 的数据集要求受害模型给出具体的有害信息,评测器衡量回答对禁止提问实际提供了多少有用信息,与人类判断的一致性达到当时最优。两条结论要分开记:现有评测方法相对人类判断显著高估越狱效果;以及一个新现象——绕过安全微调的越狱往往同时降低模型能力。后一条被 2504.10694 做成了独立的「越狱税」。 | 评测基建 | confirmed常被误读 | 2402.10260 |
| 2024 | AdvPrefix: An Objective for Nuanced LLM Jailbreaks Sicheng Zhu, Brandon Amos, Yuandong Tian, Chuan Guo, Ivan Evtimov (Meta) · arXiv · 图上标为「AdvPrefix」· 2 条边 直接把 GCG 那句 Sure, here is … 当成问题本身:它既限制了能诱出的行为,格式又太僵硬不好优化。做法是按两个准则(prefilling 成功率高、负对数似然低)自动挑选模型相关的目标前缀,即插即用。给出的量最能说明问题——把 GCG 在 Llama-3 上的默认前缀换掉,nuanced ASR 从 14% 提到 80%。作者的解读也很硬:当前的安全对齐并没有泛化到新的前缀上。这条同时反驳了一批基于「前缀强制」的防御的完备性。 | 离散优化攻击 | confirmed | 2412.10321 |
| 2024 | AdvPrompter: Fast Adaptive Adversarial Prompting for LLMs Anselm Paulus, Arman Zharmagambetov, Chuan Guo, Brandon Amos, Yuandong Tian (Meta) · ICML 2025 · 图上标为「AdvPrompter」· 1 条边 另一条「把优化蒸馏进一个模型」的路:训练一个 AdvPrompter LLM,用交替优化学会几秒内产出人类可读的对抗后缀,后缀在不改变原指令语义的前提下诱导目标模型给出有害回应。在 AdvBench 与 HarmBench 上有竞争力,并能迁移到闭源黑盒。它自己也给出了防御方向——用 AdvPrompter 生成的后缀做对抗训练能提升鲁棒性,这是攻防同源的一个干净例子。 | 离散优化攻击 | confirmed | 2404.16873 |
| 2024 | AmpleGCG: Learning a Universal and Transferable Generative Model of Adversarial Suffixes for Jailbreaking Both Open and Closed LLMs Zeyi Liao, Huan Sun (OSU) · COLM 2024 · 图上标为「AmpleGCG」· 3 条边 指出 GCG 有一个被浪费的资源:优化过程中间产生的大量后缀其实很多都能用,原方法只取 loss 最低的那一个。于是训一个生成模型直接产后缀:在 Llama-2-7B-chat 与 Vicuna-7B 上接近 100% ASR,迁移到 GPT-3.5 报 99% ASR,并且4 秒内为一条查询生成 200 个后缀。这把攻击从「一次优化一个目标」变成「批量采样」,直接为 best-of-N 式的暴力扩样铺了路(见 2412.03556)。 | 离散优化攻击 | confirmed | 2404.07921 |
| 2024 | AmpleGCG-Plus: A Strong Generative Model of Adversarial Suffixes to Jailbreak LLMs with Higher Success Rates in Fewer Attempts Vishal Kumar, Zeyi Liao, Jaylen Jones, Huan Sun (OSU) · arXiv · 图上标为「AmpleGCG+」· 2 条边 AmpleGCG 的增强版,在严格评测下白盒对 Llama-2-7B-chat 提升最多 17% ASR,黑盒对 GPT-4 的 ASR 三倍以上,并在 GPT-4o 系列上取得与 GPT-4 相近的成功率。图上最重要的一条边在这里:它报告发现了 circuit breakers 防御的漏洞——这是 2406.04313 发布后第一批公开的破口之一,也是「乱码后缀这条被认为已被防住的路其实没死」的证据。 | 离散优化攻击 | confirmed | 2410.22143 |
| 2024 | Fast Adversarial Attacks on Language Models In One GPU Minute Vinu Sankar Sadasivan, Shoumik Saha, Gaurang Sriramanan, Priyatham Kattakinda, Atoosa Chegini, Soheil Feizi (UMD) · arXiv · 图上标为「BEAST」· 3 条边 无梯度的束搜索攻击,把攻击成本从「小时」压到「分钟」:单张 A6000 上一分钟内把 Vicuna-7B-v1.5 打到 89% 成功率,而作为对比的梯度基线一小时以上才到 70%。参数可解释,可以在速度、成功率、可读性之间自己调。附带两个常被漏掉的发现:非定向版本让 Vicuna 多产生约 15% 的错误输出、22% 的回答与原问题无关,并且能用来增强成员推断攻击。它是「越狱是不是贵到不实用」这个论点的终结者。 | 离散优化攻击 | confirmed | 2402.15570 |
| 2024 | Faster-GCG: Efficient Discrete Optimization Jailbreak Attacks against Aligned Large Language Models Xiao Li, Wei Zhang, Zhuhong Li, Qiongxiu Li, Shei PernChua, BingZe Lee, Jinghao Cui, Yifan Huang, Xiaolin Hu · arXiv · 图上标为「Faster-GCG」· 2 条边 把 GCG 的采样效率当成主要问题来打:指认三个来源——梯度估计不准、均匀采样低效、重复评估已探索过的后缀,分别用距离正则、温度控制采样、访问过的后缀标记来修。原文给的量是每条有害行为所需评估从约 256K 降到 32K(8× 采样效率、7× 墙钟时间),在此预算下五个对齐模型上平均 78.1% 成功率。「优化式越狱太贵」这个论点在 BEAST 之后又被削了一层——注意这是 v2 修订后的数字,评测模型里包含了较新的机型。 | 离散优化攻击 | confirmed | 2410.15362 |
| 2024 | Improved Techniques for Optimization-Based Jailbreaking on Large Language Models Xiaojun Jia, Tianyu Pang, Chao Du, Yihao Huang, Jindong Gu, Yang Liu, Xiaochun Cao, Min Lin · arXiv · 图上标为「I-GCG」· 2 条边 把 GCG 的三个具体瓶颈逐个拆掉:单一「Sure」目标模板限制了攻击性能(改用带有害自我暗示/引导的多样目标)、单坐标更新收敛慢(改成自适应多坐标更新)、初始化差(由易到难初始化)。合起来在包括 NeurIPS 2023 红队赛道在内的一批基准上报接近 100% ASR。这一篇的价值不只在数字,而在于它指认了「目标前缀」是一个被长期忽略的自由变量——2412.10321 沿着同一个缺口把它做成了独立方法。 | 离散优化攻击 | confirmed | 2405.21018 |
| 2024 | Query-Based Adversarial Prompt Generation Jonathan Hayase, Ema Borevkovic, Nicholas Carlini, Florian Tramèr, Milad Nasr · arXiv · 图上标为「QBAP」· 1 条边 把威胁模型从「白盒或靠迁移」挪到「有 API 查询权限」。结论直接打在 GCG 的迁移假设上:利用远端模型的查询反馈构造对抗样本,能让 GPT-3.5 吐出迁移攻击做不到的有害字符串,并以接近 100% 的概率绕过 OpenAI 的安全分类器。这条边的意义是把「后缀可迁移」这个印象校正回来——可迁移是有的,但强度远不如同等预算下的查询攻击;后续几乎所有黑盒攻击都默认走查询而不是纯迁移。 | 离散优化攻击 | confirmed | 2402.12329 |
| 2024 | Jailbreaking Leading Safety-Aligned LLMs with Simple Adaptive Attacks Maksym Andriushchenko, Francesco Croce, Nicolas Flammarion (EPFL) · ICLR 2025 · 图上标为「自适应」· 3 条边 把 Athalye 的教训(1802.00420)完整地搬进 LLM:不要用固定攻击评测防御,要针对每个模型改攻击。手写一个对抗提示模板,再用 logprob 上的随机搜索优化后缀,在包括 GPT-4o、Llama 系、Gemma-7B 在内的多个模型上取得 100% 成功率;Claude 不给 logprob,就换迁移与 prefilling。核心结论是适应性本身是关键变量:不同模型吃不同模板,各家 API 各有各的弱点。附带用随机搜索做了投毒模型的木马检测。任何报告「我们对 GCG 鲁棒」的防御,都要先过这一关。 | 离散优化攻击 | confirmed常被误读 | 2404.02151 |
| 2024 | Curiosity-driven Red-teaming for Large Language Models Zhang-Wei Hong, Idan Shenfeld, Tsun-Hsuan Wang, Yung-Sung Chuang, Aldo Pareja, James Glass, Akash Srivastava, Pulkit Agrawal (MIT) · ICLR 2024 · 图上标为「CRT」· 2 条边 指出 RL 红队的真问题不是成功率而是覆盖率:现有 RL 方法只能生成少量有效测试用例,覆盖不了能诱发问题的提示空间。做法是把它接到好奇心驱动探索上,在保持或提升有效性的同时显著扩大覆盖。它能从经过大量人类偏好微调的 LLaMA2 里诱出有毒回复。「一个攻击的 ASR 高」和「一个红队方法覆盖得广」是两个正交指标——这条区分后来被 2605.09070 用 Union Coverage 重新提了一遍。 | 语义 / 黑盒攻击 | confirmed | 2402.19464 |
| 2024 | How Johnny Can Persuade LLMs to Jailbreak Them: Rethinking Persuasion to Challenge AI Safety by Humanizing LLMs Yi Zeng, Hongpeng Lin, Jingwen Zhang, Diyi Yang, Ruoxi Jia, Weiyan Shi (Virginia Tech / Stanford) · arXiv · 图上标为「PAP」· 2 条边 从几十年的社会科学里搬来一套说服力分类学,自动生成可解释的说服式对抗提示。数字很硬:在 Llama 2-7b Chat、GPT-3.5、GPT-4 上 10 次尝试内一致超过 92% ASR,超过当时的算法式攻击。它的立场本身也是一条论点——风险不只来自安全专家设计的算法攻击,也来自非专家的日常语言交互。作者试了多种防御,结论是现有防御对 PAP 有明显缺口。 | 语义 / 黑盒攻击 | confirmed | 2401.06373 |
| 2024 | Rainbow Teaming: Open-Ended Generation of Diverse Adversarial Prompts Mikayel Samvelyan, Sharath Chandra Raparthy, Andrei Lupu, Eric Hambro, Aram H. Markosyan, Manish Bhatt, Yuning Mao, Minqi Jiang, Jack Parker-Holder, Jakob Foerster, Tim Rocktäschel, Roberta Raileanu (Meta) · arXiv · 图上标为「Rainbow」· 2 条边 把对抗提示生成写成质量-多样性问题(MAP-Elites 那一族),用开放式搜索同时要有效和要多样。在 Llama 2 / Llama 3 上挖出数百条有效提示,全部被测模型 ASR 超过 90%,提示可迁移;并且用生成的合成数据微调能明显提升安全性而不损害通用性能与有用性。这是攻防同源最完整的一个闭环,也是「多样性本身是防御的必要条件」这个论点的主要依据。 | 语义 / 黑盒攻击 | confirmed | 2402.16822 |
| 2024 | ArtPrompt: ASCII Art-based Jailbreak Attacks against Aligned LLMs Fengqing Jiang, Zhangchen Xu, Luyao Niu, Zhen Xiang, Bhaskar Ramasubramanian, Bo Li, Radha Poovendran · ACL 2024 · 图上标为「ArtPrompt」· 1 条边 指认了一条被默认忽略的前提:安全对齐假设语料只按语义被理解。ASCII art 打破这个假设。作者先建 ViTC 基准,证明 GPT-3.5、GPT-4、Gemini、Claude、Llama2 五个 SOTA 都识别不好 ASCII art,再据此构造仅需黑盒访问的 ArtPrompt,对五个模型都有效。这是「不匹配的泛化」最字面的一个实例——能力上认不出,安全上因此也管不到。 | 分布偏移 · 多轮 | confirmed | 2402.11753 |
| 2024 | Best-of-N Jailbreaking John Hughes, Sara Price, Aengus Lynch, Rylan Schaeffer, Fazl Barez, Sanmi Koyejo, Henry Sleight, Erik Jones, Ethan Perez, Mrinank Sharma (Speechmatics / Anthropic 等) · arXiv · 图上标为「Best-of-N」· 3 条边 简单到近乎粗暴:反复采样同一个提示的随机增强变体(打乱、大小写等)直到出结果。采 10,000 个增强提示时对 GPT-4o 89%、Claude 3.5 Sonnet 78%;对 circuit breakers 这类 SOTA 开源防御同样有效。最有价值的是它的形状:ASR 随采样数 N 在多个数量级上呈幂律,并且能与优化前缀攻击复合(最多再提 35%)。它同时覆盖视觉与音频模态。幂律意味着没有阈值——防御方只能提高常数,不能让曲线停下来。 | 分布偏移 · 多轮 | confirmed常被误读 | 2412.03556 |
| 2024 | Endless Jailbreaks with Bijection Learning Brian R.Y. Huang, Maximilian Li, Leonard Tang (Haize Labs) · arXiv · 图上标为「Bijection」· 4 条边 用随机生成的双射编码在上下文里现教模型一套映射,把查询编码后送进去、再把回答解码回来;编码复杂度可以精确调节,于是攻击变成一个可以无限出题的模糊测试器。最关键的观察是规模趋势:被攻模型的能力水平与最有效双射攻击的平均复杂度之间有紧密关系——越强的模型被双射攻得越狠。这条直接对撞 2209.07858 的「RLHF 模型越大越难攻破」,两者的自变量不同(人类红队 vs 自动编码攻击),但对「靠 scaling 变安全」这个期待是同一个方向的坏消息。 | 分布偏移 · 多轮 | confirmed | 2410.01294 |
| 2024 | Great, Now Write an Article About That: The Crescendo Multi-Turn LLM Jailbreak Attack Mark Russinovich, Ahmed Salem, Ronen Eldan (Microsoft) · USENIX Security 2025 · 图上标为「Crescendo」· 5 条边 从完全良性的提示开始,用模型自己的回答一步步把对话推上去,最后达成越狱。在 ChatGPT、Gemini Pro、Gemini-Ultra、Llama-2 70b、Llama-3 70b Chat 与 Anthropic Chat 上都报高成功率。自动化版本 Crescendomation 在 AdvBench 上相对当时的 SOTA 在 GPT-4 上高 29–61%、在 Gemini-Pro 上高 49–71%,并对多模态模型也有效。它最难防的性质是每一轮单独看都无害——这直接否定了逐条消息过滤这一整类防御的完备性。 | 分布偏移 · 多轮 | confirmed常被误读 | 2404.01833 |
| 2024 | FlipAttack: Jailbreak LLMs via Flipping Yue Liu, Xiaoxin He, Miao Xiong, Jinlan Fu, Shumin Deng, Yingwei Ma, Jiaheng Zhang, Bryan Hooi (NUS) · arXiv · 图上标为「FlipAttack」· 3 条边 从自回归的左到右阅读特性出发:在左侧加噪声会显著破坏模型的理解,于是把有害提示按四种翻转模式伪装,再用四种变体引导模型自己去噪、理解并执行。一次查询即可,黑盒。报告对 GPT-4o 约 98% ASR,对 5 个守卫模型平均约 98% 的绕过率。后面这个数字才是重点——它同时打穿了模型对齐和外挂守卫两层,而且成本是一次查询。 | 分布偏移 · 多轮 | confirmed | 2410.02832 |
| 2024 | Many-shot Jailbreaking Cem Anil, Esin Durmus, Nina Panickssery, Mrinank Sharma, Joe Benton, Sandipan Kundu, Joshua Batson, et al. (Anthropic) · NeurIPS 2024 · 图上标为「Many-shot」· 5 条边 在提示里塞进数百条「助手给出有害回答」的伪造示例,靠上下文学习压过安全训练。最重要的结果是规模律:攻击有效性随示例数呈幂律增长,一直延伸到数百 shot;在最广泛使用的闭源前沿模型与多种任务上都成立。这一篇没有 arXiv 版本,只在 NeurIPS 2024 论文集里,只扫 arXiv 会完全错过——这是本图刻意纳入非 arXiv 条目的原因之一。它把长上下文这个能力升级直接翻译成了攻击面升级,缓解方向见 2504.09604 与 2605.08277。 | 分布偏移 · 多轮 | 无 arXiv常被误读 | 链接 |
| 2024 | Speak Out of Turn: Safety Vulnerability of Large Language Models in Multi-turn Dialogue Zhenhong Zhou, Jiuyang Xiang, Haopeng Chen, Quan Liu, Zherui Li, Sen Su (BUPT) · arXiv · 图上标为「多轮拆解」· 2 条边 把一个不安全查询拆成若干子问题分轮问,每一轮单独看都在可回答的边界内,合起来构成完整的有害回答。它指出此前研究几乎全在单轮上做,而多轮才是人类真正获取信息的方式。这一篇和 2404.01833 是多轮攻击的两个独立起点:这一篇强调「分解」,Crescendo 强调「升级」。防御侧到今天为止仍以单轮判定为主——大部分守卫模型看的是单条消息,而不是整段对话的累积语义(见 2601.04603 的 exchange classifier 正是在补这一点)。 | 分布偏移 · 多轮 | confirmed | 2402.17262 |
| 2024 | Does Refusal Training in LLMs Generalize to the Past Tense? Maksym Andriushchenko, Nicolas Flammarion (EPFL) · ICLR 2025 · 图上标为「过去时」· 2 条边 全图性价比最高的攻击:把有害请求改写成过去时。GPT-4o 上直接问的成功率 1%,用 20 次过去时改写后升到 88%;Llama-3 8B、Claude-3.5 Sonnet、o1 系列都受影响。将来时改写效果明显更弱,说明模型把历史询问当成更良性。作者也证明用过去时样本微调可以补上。这条结论的杀伤力在于它有多蠢——SFT、RLHF、对抗训练全都没让拒答泛化到一个时态变换,这是「不匹配的泛化」最难辩解的证据。 | 分布偏移 · 多轮 | confirmed常被误读 | 2407.11969 |
| 2024 | Gradient Cuff: Detecting Jailbreak Attacks on Large Language Models by Exploring Refusal Loss Landscapes Xiaomeng Hu, Pin-Yu Chen, Tsung-Yi Ho (CUHK / IBM) · NeurIPS 2024 · 图上标为「GradCuff」· 3 条边 定义并研究 LLM 的拒答损失,利用其函数值与光滑性设计两步检测。评测是 2 个对齐模型(LLaMA-2-7B-Chat、Vicuna-7B-V1.5)× 6 类越狱(GCG、AutoDAN、PAIR、TAP、Base64、LRL),可调阈值以保住良性性能。它是「用模型内部的几何量当检测特征」这条线的代表,和 lane 9 的探针类工作是同一族;因此也共享同一个弱点——2412.09565 的 obfuscated activations 表明这类内部特征是可以被攻击者主动整形的。 | 推理期防御 | confirmed | 2403.00867 |
| 2024 | Robust Prompt Optimization for Defending Language Models Against Jailbreaking Attacks Andy Zhou, Bo Li, Haohan Wang (UIUC) · NeurIPS 2024 Spotlight · 图上标为「RPO」· 2 条边 把攻击者写进防御目标:优化一个轻量、可迁移的防御后缀,使其对最坏情况自适应攻击也成立。在 JailbreakBench 上把 GPT-4 的 ASR 降到 6%、Llama-2 降到 0%。方法论上它比同期的启发式防御高一档——它至少在形式上做了 minimax。但优化的是一个固定后缀,因此仍然落在 2510.09023 所批评的范围内:防御一旦固定,攻击者就可以再对着它优化一轮。 | 推理期防御 | confirmed | 2401.17263 |
| 2024 | SafeDecoding: Defending against Jailbreak Attacks via Safety-Aware Decoding Zhangchen Xu, Fengqing Jiang, Luyao Niu, Jinyuan Jia, Bill Yuchen Lin, Radha Poovendran (UW) · ACL 2024 · 图上标为「SafeDecoding」· 2 条边 观察点很具体:即便有害内容的 token 概率占优,安全声明的 token 仍然排在概率靠前的位置。于是在解码时识别这些安全声明并放大其概率,同时压低与越狱目标一致的 token 序列。5 个 LLM × 6 种越狱攻击 × 4 个基准,称优于六种防御方法且不损害良性有用性。它与 2406.05946 的浅层对齐诊断高度互补——两篇看的是同一个位置(输出分布的前几个 token),一个当作漏洞,一个当作抓手。 | 推理期防御 | confirmed | 2402.08983 |
| 2024 | ShieldGemma: Generative AI Content Moderation Based on Gemma Wenjun Zeng, Yuchi Liu, Ryan Mullins, Ludovic Peran, Joe Fernandez, Hamza Harkous, Karthik Narasimhan, Drew Proud, Piyush Kumar, Bhaktipriya Radharapu, Olivia Sturman, Oscar Wahltinez (Google) · arXiv · 图上标为「ShieldGemma」· 2 条边 Gemma2 上的守卫模型套件,覆盖四类关键伤害类型的输入与输出预测,报告相对 Llama Guard +10.8% AU-PRC(公开基准)、相对 WildCard +4.3%,并给了一条可复用的 LLM 数据策展流水线,主要用合成数据训练也能泛化。它和 Llama Guard 一起构成守卫模型的开放基线。注意这些数字是审核基准上的判别性能,不是越狱鲁棒性——两者被混用是本领域常见的引用错误。 | 推理期防御 | confirmed常被误读 | 2407.21772 |
| 2024 | Efficient Adversarial Training in LLMs with Continuous Attacks Sophie Xhonneux, Alessandro Sordoni, Stephan Günnemann, Gauthier Gidel, Leo Schwinn · NeurIPS 2024 · 图上标为「C-AdvUL」· 3 条边 对抗训练在 LLM 上的成本瓶颈是每步都要跑离散攻击。做法是把攻击放到连续嵌入空间里算,快几个数量级;C-AdvUL 用两个损失(对抗行为数据上的连续嵌入攻击鲁棒 + 效用数据微调),C-AdvIPO 则是 IPO 的对抗变体、不需要效用数据。5 个模型族(Gemma、Phi3、Mistral、Zephyr、Llama2)× 2B/3.8B/7B,对 GCG、AutoDAN、PAIR 都提升鲁棒性。核心论点是连续扰动上的鲁棒性可以外推到离散威胁模型——这一步是全篇的承重假设,也是被 2412.09565 质疑的地方。 | 训练期防御 | confirmed | 2405.15589 |
| 2024 | Improving Alignment and Robustness with Circuit Breakers Andy Zou, Long Phan, Justin Wang, Derek Duenas, Maxwell Lin, Maksym Andriushchenko, Rowan Wang, Zico Kolter, Matt Fredrikson, Dan Hendrycks (Gray Swan / CAIS) · NeurIPS 2024 · 图上标为「Circuit Breakers」· 8 条边 换掉整个范式:不做拒答训练也不做针对具体攻击的对抗训练,而是用表示工程在模型产生有害输出的过程中打断它,直接控制负责有害输出的表示。适用于纯文本与多模态,称在强的未见过攻击下也不牺牲效用,并扩展到 agent 场景。它是 2024 年最被看好的训练期防御。图上它有三条独立的反驳边:2410.22143 找到破口、2412.03556 的 BoN 对它有效、2412.09565 直接对它诱导出混淆激活。「对未见攻击鲁棒」这个断言目前不成立。 | 训练期防御 | confirmed常被误读 | 2406.04313 |
| 2024 | Defending Against Unforeseen Failure Modes with Latent Adversarial Training Stephen Casper, Lennart Schulze, Oam Patel, Dylan Hadfield-Menell (MIT) · arXiv · 图上标为「LAT」· 3 条边 问题陈述很干净:红队与对抗训练难以修复与训练时攻击形态不同的失效模式,而输入空间太大无法穷举。LAT 的做法是不在输入空间、而在潜表示上做对抗训练,因此不需要知道漏洞是什么、也不需要能诱发它的输入。在图像分类、文本分类、文本生成上都显示相对普通对抗训练同时提升对新攻击的鲁棒性与干净数据性能,并用于移除后门。它是「防御不必先枚举攻击」这条路线的起点。 | 训练期防御 | confirmed | 2403.05030 |
| 2024 | Representation Noising: A Defence Mechanism Against Harmful Finetuning Domenic Rosati, Jan Wehner, Kai Williams, Łukasz Bartoszcze, David Atanasov, Robie Gonzales, Subhabrata Majumdar, Carsten Maple, Hassan Sajjad, Frank Rudzicz · NeurIPS 2024 · 图上标为「RepNoise」· 5 条边 即使攻击者拿到权重也要生效的防御:把有害表示的信息移除掉,使其难以在微调中被恢复;并且能泛化到防御时没见过的有害子集(只要来自同一攻击分布)。作者把有效性归因于深度——有害表示信息在所有层上被移除的程度。这一篇难得的地方是自己明确标出了仍然失效的区域。图上它与 TAR、Vaccine 构成同一族,而 2605.26526 与 2602.06911 是这一族共同的反驳边。 | 训练期防御 | confirmed | 2405.14577 |
| 2024 | Tamper-Resistant Safeguards for Open-Weight LLMs Rishub Tamirisa, Bhrugu Bharathi, Long Phan, Andy Zhou, Alice Gatti, Tarun Suresh, Maxwell Lin, Justin Wang, Rowan Wang, Ron Arel, Andy Zou, Dawn Song, Bo Li, Dan Hendrycks, Mantas Mazeika (CAIS 等) · ICLR 2025 · 图上标为「TAR」· 6 条边 把问题正面提出来:开源权重模型的护栏对篡改攻击没有鲁棒性,拒答与遗忘类护栏都能被几步微调轻易拿掉。TAR 的目标是让对手经过数百步微调也拿不掉护栏,在大量评测与红队分析下报告显著提升 tamper-resistance 且保住良性能力。它是这条路线上被引用最多的一篇。但要连着读它的两条反驳边:2605.26526 的 abliteration/prefilling 完全不走微调这条路,2602.06911 在系统超参扫描下报告对齐阶段防御普遍失守。 | 训练期防御 | confirmed常被误读 | 2408.00761 |
| 2024 | Latent Adversarial Training Improves Robustness to Persistent Harmful Behaviors in LLMs Abhay Sheshadri, Aidan Ewart, Phillip Guo, Aengus Lynch, Cindy Wu, Vivek Hebbar, Henry Sleight, Asa Cooper Stickland, Ethan Perez, Dylan Hadfield-Menell, Stephen Casper · arXiv · 图上标为「Targeted LAT」· 3 条边 LAT 的定向版本:此前的潜空间攻击是无定向的(最大化期望行为上的损失),这一篇让对手去最小化竞争任务上的损失。三项结果:越狱鲁棒性超过 R2D2 基线且计算量显著更低;不需要知道 trigger 就能移除后门;更鲁棒地遗忘知识并抵抗重新学习。开篇那句判断是本图反复出现的主题——红队、模型编辑与可解释性的工作都表明对抗微调主要是压制而不是消除问题能力。 | 训练期防御 | confirmed | 2407.15549 |
| 2024 | Vaccine: Perturbation-aware Alignment for Large Language Models against Harmful Fine-tuning Attack Tiansheng Huang, Sihao Hu, Ling Liu (Georgia Tech) · NeurIPS 2024 · 图上标为「Vaccine」· 2 条边 第一批对齐阶段防御之一。经验分析指出微调破坏对齐的一个可能机制是有害嵌入漂移,于是在对齐阶段逐步加入构造扰动,训出对扰动不变的隐藏嵌入,使其能扛住后续未净化用户数据带来的扰动。在 Llama2、Opt、Vicuna 上有效。它属于「在对齐时就为将来的攻击留出余量」这一族的开山,但注意 2602.06911 的结论:现有对齐阶段防御在超参扫描下基本都撑不住。 | 训练期防御 | confirmed | 2402.01109 |
| 2024 | The WMDP Benchmark: Measuring and Reducing Malicious Use With Unlearning Nathaniel Li, Alexander Pan, Anjali Gopal, Summer Yue, Daniel Berrios, ... Dan Hendrycks (CAIS 等) · ICML 2024 · 图上标为「WMDP / RMU」· 3 条边 3,668 道多选题,作为生物安全、网络安全、化学安全三域危险知识的代理测量,公开发布前经过严格筛除敏感信息。它有两个身份:危险能力评测,以及遗忘方法的基准。配套的 RMU 通过控制模型表示来降低 WMDP 成绩而保住生物学、计算机科学等通用能力。它把「让模型不会」而不是「让模型不说」提上日程——这是与整条拒答训练路线不同的假设。RMU 的鲁棒性随后被 2409.18025 直接打穿。 | 训练期防御 | confirmed常被误读 | 2403.03218 |
| 2024 | Eight Methods to Evaluate Robust Unlearning in LLMs Aengus Lynch, Phillip Guo, Aidan Ewart, Stephen Casper, Dylan Hadfield-Menell · arXiv · 图上标为「八种评测」· 2 条边 遗忘评测的方法论奠基:先梳理现有评测的技术与局限,再对 Who's Harry Potter 模型跑一整套鲁棒性测试。结论四条——用原作者的 Familiarity 指标看泛化良好,但 (i) 可以稳定地抽出高于基线的知识、(ii) 在 Harry Potter 问答上与原模型持平、(iii) 潜在知识的表示与原模型相当、(iv) 相关领域存在附带遗忘。「ad-hoc 指标下的遗忘不算遗忘」这条纪律从这里立起来,后面 2409.18025 与 2410.08827 都是它的延伸。 | 训练期防御 | confirmed | 2402.16835 |
| 2024 | Do Unlearning Methods Remove Information from Language Model Weights? Aghyad Deeb, Fabien Roger (Redwood Research) · arXiv · 图上标为「权重里还在」· 3 条边 把「信息真的从权重里删掉了吗」做成一个可判定的实验:给攻击者一部分本该被删除的事实,让它去恢复同分布下其它无法靠已知事实猜出的事实。结果是在可访问事实上微调可以恢复预训练期学到的信息的 88% 的遗忘前准确率。附带一条对评测设计的重要警告——在额外微调阶段学到的信息上测遗忘鲁棒性,会高估鲁棒性。它与 2409.18025 是同季度的两份独立证据,合起来把「遗忘 = 移除」这个等式否掉。 | 训练期防御 | confirmed常被误读 | 2410.08827 |
| 2024 | An Adversarial Perspective on Machine Unlearning for AI Safety Jakub Łucki, Boyi Wei, Yangsibo Huang, Peter Henderson, Florian Tramèr, Javier Rando (ETH / Princeton) · TMLR · 图上标为「遗忘对抗视角」· 3 条边 直接质疑「遗忘与安全后训练有本质区别」这个说法。三条证据:此前被报告对遗忘无效的越狱方法,小心使用时其实有效;开发了一批自适应方法能恢复大部分号称已遗忘的能力;具体到 RMU,在 10 条无关样本上微调,或移除激活空间里的特定方向,就能恢复大部分危险能力。它把 lane 7 与 lane 9 接了起来——恢复手段之一就是 refusal-direction 那一族的操作。 | 训练期防御 | confirmed常被误读 | 2409.18025 |
| 2024 | Harmful Fine-tuning Attacks and Defenses for Large Language Models: A Survey Tiansheng Huang, Sihao Hu, Fatih Ilhan, Selim Furkan Tekin, Ling Liu (Georgia Tech) · ACM CSUR · 图上标为「HFT 综述」· 1 条边 这条战线唯一持续维护的综述,系统给出威胁模型与基本假设,再从攻击设定、防御设计、评测方法三个角度梳理,并维护一份持续更新的论文清单。图上收它是作为导航节点,不是作为证据来源——综述本身不产生新证据,它的作用是让读者能查到本图为控制规模而没有画进来的那几十篇对齐阶段防御。 | 微调 · 权重篡改 | confirmed | 2409.18169 |
| 2024 | Assessing the Brittleness of Safety Alignment via Pruning and Low-Rank Modifications Boyi Wei, Kaixuan Huang, Yangsibo Huang, Tinghao Xie, Xiangyu Qi, Mengzhou Xia, Prateek Mittal, Mengdi Wang, Peter Henderson (Princeton) · ICML 2024 · 图上标为「剪枝脆性」· 4 条边 找安全关键区域并证明它们与效用区域可分离:参数层面约 3%、秩层面约 2.5%。移除这些区域会破坏安全而基本不影响效用。但这一篇最该被引用的是它的第二个结论——即使限制对安全关键区域的修改,模型仍然会被低成本微调攻击拿下。也就是说「保护住那 3%」这条思路不成立。它和 lane 9 的 2406.11717、2410.13708 是同一现象的三种度量(方向、注意力头、参数区域),都指向安全机制的稀疏与可摘性。 | 微调 · 权重篡改 | confirmed常被误读 | 2402.05162 |
| 2024 | Scaling Trends for Data Poisoning in LLMs Dillon Bowen, Brendan Murphy, Will Cai, David Khachaturov, Adam Gleave, Kellin Pelrine (FAR AI 等) · arXiv · 图上标为「投毒规模」· 3 条边 24 个前沿模型、1.5B 到 72B,三种威胁模型(恶意微调、数据策划不完善、故意数据污染)。核心结论是越大的模型对数据投毒越敏感,从更少的有害数据里更快学到有害行为;并且 GPT 系模型在有审核系统保护的情况下仍然可被投毒微调攻破。规模不是缓解因素,是放大因素——这与 2410.01294 在推理期观察到的规模趋势方向一致。注:原文早期版本包含的 jailbreak-tuning 部分后来独立成 2507.11630。 | 微调 · 权重篡改 | confirmed | 2408.02946 |
| 2024 | Safety Alignment Should Be Made More Than Just a Few Tokens Deep Xiangyu Qi, Ashwinee Panda, Kaifeng Lyu, Xiao Ma, Subhrajit Roy, Ahmad Beirami, Prateek Mittal, Peter Henderson (Princeton / Google DeepMind) · ICLR 2025 · 图上标为「浅层对齐」· 6 条边 全图解释力最强的一篇。它提出一个统一诊断:安全对齐会走捷径,主要只改变了最初几个输出 token 的生成分布——称为浅层安全对齐。这一条同时解释了对抗后缀、prefilling 攻击、解码参数攻击、微调攻击为什么都能奏效。更重要的是它给了可施工的方向:把对齐做得比前几个 token 更深确实能提升鲁棒性;并设计了一个约束初始 token 更新的正则化微调目标,使对齐更能扛住微调攻击。图上多条来自不同泳道的边在这里汇合,不是巧合。 | 微调 · 权重篡改 | confirmed常被误读 | 2406.05946 |
| 2024 | What is in Your Safe Data? Identifying Benign Data that Breaks Safety Luxi He, Mengzhou Xia, Peter Henderson (Princeton) · COLM 2024 · 图上标为「良性数据」· 2 条边 把 2310.03693 的「良性微调也会破坏安全」从现象做成可控攻击:在表示与梯度两个空间里做双向锚定,挑出靠近有害样本、远离良性样本的那部分良性数据。结果是只用 100 条这样挑出来的、内容完全无害的样本微调,模型对被测有害请求的配合率就 >70%,而随机选 100 条只有 <20%。作者还观察到这些样本常表现为列表、要点、数学题——形式而非内容导致的安全退化。这让「过滤有害训练数据」这条防线在原则上失效。 | 微调 · 权重篡改 | confirmed | 2404.01099 |
| 2024 | Covert Malicious Finetuning: Challenges in Safeguarding LLM Adaptation Danny Halawi, Alexander Wei, Eric Wallace, Tony T. Wang, Nika Haghtalab, Jacob Steinhardt (UC Berkeley) · ICML 2024 · 图上标为「隐蔽微调」· 2 条边 针对微调 API 的检测规避版本:构造一个数据集,每一条单看都无害,但在其上微调会教会模型用编码回应编码过的有害请求。作用于 GPT-4 时,产出的模型99% 的时候会执行有害指令,同时能躲过数据集检查、安全评测和输入/输出分类器三种防御。作者的结论是一个开放问题:黑盒微调访问能否对足够精巧的对手做到安全。它和 2404.01099 从两个方向说明同一件事——逐样本的数据审计不是充分防线。 | 微调 · 权重篡改 | confirmed常被误读 | 2406.20053 |
| 2024 | A Mechanistic Understanding of Alignment Algorithms: A Case Study on DPO and Toxicity Andrew Lee, Xiaoyan Bai, Itamar Pres, Martin Wattenberg, Jonathan K. Kummerfeld, Rada Mihalcea (UMich / Harvard) · ICML 2024 · 图上标为「DPO 毒性」· 2 条边 在 GPT2-medium 上把 DPO 降低毒性的机制拆开,结论一句话就够:预训练学到的能力没有被移除,只是被绕开了。作者据此给出一个简单方法把模型还原回有毒行为。这是本图上最早的机制级证据,说明对齐是叠加一层旁路而不是删除能力;后面 2409.18025(遗忘可恢复)、2410.08827(权重里还在)、2407.15549(对抗微调是压制不是消除)都在重复同一个形状,只是尺度和方法不同。 | Mech-interp | confirmed | 2401.01967 |
| 2024 | On the Role of Attention Heads in Large Language Model Safety Zhenhong Zhou, Haiyang Yu, Xinghua Zhang, Rongwu Xu, Fei Huang, Kun Wang, Yang Liu, Junfeng Fang, Yongbin Li · ICLR 2025 (oral) · 图上标为「安全头」· 2 条边 把稀疏性这条线做到注意力头粒度:提出 Ships 分数衡量单个头对安全的贡献,再用 Sahara 算法在数据集层面归因关键安全头。数字很尖锐——消融单个安全头就让 Llama-2-7b-chat 对多 16 倍的有害查询作答,而只改动 0.006% 的参数,对比此前研究需要约 5% 的改动。另外两条结论:注意力头主要作为安全的特征提取器;从同一底座微调出来的模型共享重叠的安全头。与 2406.11717 的方向、2402.05162 的参数区域一起,构成「安全机制极稀疏」的三份独立证据。 | Mech-interp | confirmed常被误读 | 2410.13708 |
| 2024 | Refusal in Language Models Is Mediated by a Single Direction Andy Arditi, Oscar Obeso, Aaquib Syed, Daniel Paleka, Nina Panickssery, Wes Gurnee, Neel Nanda · NeurIPS 2024 · 图上标为「拒答方向」· 15 条边 本泳道被引用最多、也被误引最多的一篇。结论是拒答由残差流里的一维子空间调制:在 13 个开源聊天模型(最大 72B)上各找到一个方向,擦除它就不再拒绝有害指令,加上它连无害指令也会被拒。据此给出一个白盒越狱方法(社区称 abliteration),对其它能力影响很小;并机制性地分析了对抗后缀如何抑制拒答方向的传播。要点在于这是对这 13 个模型、这套提取方法的实证结论,不是「拒答只有一个维度」的一般定理——2502.17420 与 2511.08379 随后都找到了多个独立方向。 | Mech-interp | confirmed常被误读 | 2406.11717 |
| 2024 | Obfuscated Activations Bypass LLM Latent-Space Defenses Luke Bailey, Alex Serrano, Abhay Sheshadri, Mikhail Seleznyov, Jordan Taylor, Erik Jenner, Jacob Hilton, Stephen Casper, Carlos Guestrin, Scott Emmons · arXiv · 图上标为「混淆激活」· 4 条边 对整个潜空间防御范式的正面攻击:稀疏自编码器、表示探针、潜空间 OOD 检测全部可被混淆激活绕过。最具体的数字是对训练来分类有害性的探针,攻击常常把召回率从 100% 打到 0%,同时保持 90% 的越狱率。但作者也标出了边界:在复杂任务(写 SQL)上混淆会损害模型性能。结论是神经激活高度可塑——可以在保持网络行为的同时以多种方式重塑激活模式。这是本图上对 lane 6 的探针类检测与 lane 7 的 circuit breakers 共同的、最强的一条反驳边。 | Mech-interp | confirmed | 2412.09565 |
| 2025 | Improving LLM Safety Alignment with Dual-Objective Optimization Xuandong Zhao, Will Cai, Tianneng Shi, David Huang, Licong Lin, Song Mei, Dawn Song (UC Berkeley) · ICML 2025 · 图上标为「DOOR」· 1 条边 从梯度分析出发指出 DPO 的损失函数本身不适合学拒答,把目标拆成两块:(1) 鲁棒拒答训练——即使已经生成了一部分不安全内容也要能转向拒答;(2) 有害知识的定向遗忘。再加一个 token 级加权强调关键拒答 token。它对 prefilling、后缀、多轮攻击都报告了改善,并把鲁棒性与训练中的 token 分布偏移联系起来。它是 2406.05946「安全只有几个 token 深」这个诊断的直接施工版。 | 对齐训练 | confirmed | 2503.03710 |
| 2025 | Toward Principled LLM Safety Testing: Solving the Jailbreak Oracle Problem Shuyi Lin, Anshuman Suri, Alina Oprea, Cheng Tan (Northeastern) · MLSys 2026 · 图上标为「JB Oracle」· 1 条边 把评测从「某个攻击成功了吗」提升成一个判定问题:给定模型、提示与解码策略,判断是否存在似然超过给定阈值的越狱回复。这个形式化让「这个模型在这个提示上安不安全」第一次有了不依赖具体攻击的定义。搜索空间随回复长度指数增长,系统 Boa 用两阶段策略处理:先广度优先采样抓易得越狱,再用细粒度安全分数引导深度优先优先搜索,去探索有希望但低概率的路径。它是本图上最接近「给出上界而非又一个攻击」的工程工作。 | 评测基建 | confirmed | 2506.17299 |
| 2025 | PandaGuard: Systematic Evaluation of LLM Safety against Jailbreaking Attacks Guobin Shen, Dongcheng Zhao, Linghao Feng, Xiang He, Jihang Wang, Sicheng Shen, Haibo Tong, Yiting Dong, Jindong Li, Xiang Zheng, Yi Zeng · arXiv · 图上标为「PandaGuard」· 3 条边 把越狱安全建模成攻击者-防御者-判定者的多智能体系统,实现 19 种攻击 + 12 种防御与多种判定策略,配套 PandaBench 在 49 个 LLM 上跑完整交叉,耗费超过 30 亿 token。两条结论值得单独记:没有任何一个防御在所有维度上都最优;判定器之间的分歧给安全评估引入了不可忽略的方差。后一条是本图对所有 ASR 数字打折的直接依据之一。 | 评测基建 | confirmed | 2505.13862 |
| 2025 | The Attacker Moves Second: Stronger Adaptive Attacks Bypass Defenses Against LLM Jailbreaks and Prompt Injections Milad Nasr, Nicholas Carlini, Chawin Sitawarin, Sander V. Schulhoff, Jamie Hayes, Michael Ilie, Juliette Pluto, Shuang Song, Harsh Chaudhari, Ilia Shumailov, Abhradeep Thakurta, Kai Yuanqing Xiao, Andreas Terzis, Florian Tramèr (Google DeepMind 等) · arXiv · 图上标为「攻击者后手」· 5 条边 本图上最应该先读的一篇。论点是当前防御评测普遍有缺陷:要么打固定的有害字符串集,要么打不是针对该防御设计的弱优化方法。作者系统调参并扩大梯度下降、强化学习、随机搜索与人工引导探索这些通用优化手段,打穿 12 个近期防御,多数攻击成功率超过 90%——而这些防御原本报告的是接近零的成功率。这就是 1802.00420 那篇视觉论文在 LLM 上的重演。它把整张图上所有防御条目的成色统一下调了一档:没有面对自适应攻击的鲁棒性数字,应当默认按未验证处理。 | 评测基建 | confirmed常被误读 | 2510.09023 |
| 2025 | The Jailbreak Tax: How Useful are Your Jailbreak Outputs? Kristina Nikolić, Luze Sun, Jie Zhang, Florian Tramèr (ETH Zurich) · arXiv · 图上标为「越狱税」· 2 条边 把 StrongREJECT 顺带发现的现象做成一个独立指标。难点是有害回答的有用性没法严格评估,于是构造有基准答案的越狱评测集:把模型对齐成拒答良性且易评测的话题(生物、数学),再看越狱后的答案对不对。8 种代表性越狱 × 5 个效用基准,结果一致下降;例如所有被测越狱都能绕过「拒答数学」的对齐,但准确率最多掉 92%。这条给防御方一个真实的安慰,也给攻击方一个真实的警告:ASR 不等于危害。 | 评测基建 | confirmed常被误读 | 2504.10694 |
| 2025 | LatentBreak: Jailbreaking Large Language Models through Latent Space Feedback Raffaele Mura, Giorgio Piras, Kamilė Lukošiūtė, Maura Pintor, Amin Karbasi, Battista Biggio · arXiv · 图上标为「LatentBreak」· 3 条边 白盒攻击,但不加后缀也不套长模板:逐词做语义等价替换,目标是让对抗提示在潜空间里的表示靠近无害请求。结果是提示更短、困惑度更低,因此对困惑度过滤类防御(2308.14132 / 2309.00614)有结构性优势,并且在 representation rerouting 类模型上比其它攻击成功率更高。它把攻防的战场从 token 表面挪到了表示空间——和 2412.09565 的 obfuscated activations 是同一个方向的两种打法。 | 离散优化攻击 | confirmed | 2510.08604 |
| 2025 | InfoFlood: Jailbreaking Large Language Models with Information Overload Advait Yadav, Haibo Jin, Man Luo, Jun Zhuang, Haohan Wang · arXiv · 图上标为「InfoFlood」· 2 条边 不加前缀也不加后缀,只把恶意查询改写得语言上极其复杂,靠信息过载压垮安全机制;失败时定位原因再改写。在 GPT-4o、GPT-3.5-turbo、Gemini 2.0、Llama 3.1 上最高三倍于基线的成功率,并且OpenAI Moderation API、Perspective API 与 SmoothLLM 都拦不住。它是「攻击不必在 token 层做异常,只要在复杂度这一维走远」的一个干净例子,和 2410.02832 的翻转、2410.01294 的双射编码是同一族。 | 语义 / 黑盒攻击 | confirmed | 2506.12274 |
| 2025 | Jailbreaking to Jailbreak Jeremy Kritz, Vaughn Robinson, Robert Vacareanu, Bijan Varjavand, Michael Choi, Bobby Gogov, Scale Red Team, Summer Yue, Willow E. Primack, Zifan Wang (Scale AI) · arXiv · 图上标为「J₂」· 3 条边 先把一个强模型越狱,再把它当攻击者去越狱别人——绕开了「强模型拒绝帮忙做越狱」这个障碍。三条结论都值得记:(1) 用来制造 J₂ 攻击者的提示几乎能迁移到所有黑盒模型;(2) J₂ 攻击者能越狱自己的副本,而且这个脆弱性在过去 12 个月里迅速发展;(3) 推理模型是更强的攻击者。数字:J₂(Sonnet-3.7) 对 GPT-4o 的 ASR 0.975,与专家人类红队持平并超过当时最好的算法攻击;对最鲁棒的 Sonnet-3.5,J₂(o3) 最高 0.605。它把「红队人力」这个瓶颈也拆掉了。 | 语义 / 黑盒攻击 | confirmed | 2502.09638 |
| 2025 | Chain-of-Thought Hijacking Jianli Zhao, Tingchen Fu, Rylan Schaeffer, Mrinank Sharma, Fazl Barez · arXiv · 图上标为「CoT 劫持」· 3 条边 反直觉且带机制解释的一篇:推理越长越不安全。做法是先诱导推理模型做一长串良性解谜(常常超过五分钟),再提出有害请求。HarmBench 上 ASR 分别为 Gemini 2.5 Pro 99%、ChatGPT o4 Mini 94%、Grok 3 Mini 100%、Claude 4 Sonnet 94%。机制侧用激活探针、注意力模式与因果干预给出解释:拒答依赖一个低维安全信号,该信号的表达随推理轨迹变长而减弱——作者称为 refusal dilution。它把 lane 9 的 refusal direction 这条线和推理模型的攻击面接了起来。 | 分布偏移 · 多轮 | confirmed | 2510.26418 |
| 2025 | H-CoT: Hijacking the Chain-of-Thought Safety Reasoning Mechanism to Jailbreak Large Reasoning Models Martin Kuo, Jianyi Zhang, Aolin Ding, Qinsi Wang, Louis DiValentin, Yujia Bao, Wei Wei, Hai Li, Yiran Chen (Duke) · arXiv · 图上标为「H-CoT」· 2 条边 推理模型把安全判断放进 CoT,这一篇就劫持模型自己展示的中间推理来攻它。配套的 Malicious-Educator 基准把极危险请求包装成看似正当的教育提示。数字:o1 起初维持约 98% 的拒答率,后续模型更新显著削弱了这一安全性;在 H-CoT 下拒答率从 98% 掉到 2% 以下,而 DeepSeek-R1 与 Gemini 2.0 Flash Thinking 不需要额外技巧就能被抽出犯罪策略。它是 2412.16339「推理即防御」的直接反面证据。 | 分布偏移 · 多轮 | confirmed常被误读 | 2502.12893 |
| 2025 | The Structural Safety Generalization Problem Julius Broomfield, Tom Gibbs, Ethan Kosak-Hine, George Ingebretsen, Tia Nasir, Jason Zhang, Reihaneh Iranmanesh, Sara Pieri, Reihaneh Rabbany, Kellin Pelrine · arXiv · 图上标为「结构泛化」· 2 条边 一篇立场论文,主张把目标从「通用防御」收窄到一个可处理的中间问题:安全无法在语义等价输入之间泛化。作者要求被研究的攻击具备可解释、跨模型可迁移、跨目标可迁移三条性质,并在这个框架里找到了多轮、多图、翻译类的新漏洞——这些攻击按构造与其单轮/单图/未翻译版本语义等价,因此能做系统对照。防御侧提出 Structure Rewriting Guardrail:把输入改写成更利于安全判定的结构,显著提高有害输入的拒答而不过度拒答良性输入。 | 分布偏移 · 多轮 | confirmed | 2504.09712 |
| 2025 | Mitigating Many-Shot Jailbreaking Christopher M. Ackerman, Nina Panickssery · arXiv · 图上标为「MSJ 缓解」· 2 条边 针对 many-shot 的缓解实验:单独测微调与输入净化,再测组合。结论是各自都有增量效果,组合起来能显著削弱 MSJ,同时保住良性上下文学习与对话能力。作者的建议是把它并入安全后训练。它是少数认真处理长上下文攻击的防御工作,但注意它处理的是 MSJ 这一种形态;2412.03556 的幂律采样与 2604.19461 的抽象算子框架都不是同一个形状。 | 推理期防御 | confirmed | 2504.09604 |
| 2025 | Constitutional Classifiers: Defending against Universal Jailbreaks across Thousands of Hours of Red Teaming Mrinank Sharma, Meg Tong, Jesse Mu, Jerry Wei, Jorrit Kruthoff, Scott Goodfriend, ... Jan Leike, Jared Kaplan, Ethan Perez (Anthropic) · arXiv · 图上标为「宪法分类」· 5 条边 用一份自然语言「宪法」规定允许与禁止内容,据此生成合成数据训练分类器护栏。原文的结论句必须逐字读:在超过 3,000 小时的红队中,没有红队员找到一个通用越狱,能在多数目标查询上从被分类器保护的早期模型里抽出与无防护模型细节水平相当的信息。部署成本:生产流量拒答率绝对增加 0.38%,推理开销 23.7%。这是全图上防御侧最强的一条经验结果,但它的形式是「红队没找到」,不是「不存在」——2605.10901 正是对着这个形式做的形式化验证批评。 | 推理期防御 | confirmed常被误读 | 2501.18837 |
| 2025 | Trading Inference-Time Compute for Adversarial Robustness Wojciech Zaremba, Evgenia Nitishinskaya, Boaz Barak, Stephanie Lin, Sam Toyer, Yaodong Yu, et al. (OpenAI) · arXiv · 图上标为「推理算力」· 3 条边 在 o1-preview 与 o1-mini 上测「多想一会儿」对鲁棒性的作用:在多种攻击下,增加推理期算力普遍提升鲁棒性,很多情况下攻击成功的样本比例随测试期算力增长趋于零——而且没有做任何对抗训练。作者同时诚实地列出了例外:也存在推理期算力不改善可靠性的设定,并探索了针对推理模型的新攻击。它与 H-CoT(2502.12893)、CoT Hijacking(2510.26418)构成本图最尖锐的一对:同样是加长推理,一边报告更安全,一边报告更危险。 | 推理期防御 | confirmed常被误读 | 2501.18841 |
| 2025 | Jailbreak-Tuning: Models Efficiently Learn Jailbreak Susceptibility Brendan Murphy, Dillon Bowen, Shahrad Mohammadzadeh, Tom Tseng, Julius Broomfield, Adam Gleave, Kellin Pelrine (FAR AI) · arXiv · 图上标为「JB-Tuning」· 3 条边 把微调攻击推到「helpful-only 模型」这个终点:不同于此前被审核系统拦住、或只做到部分移除、或输出质量退化的工作,这个方法教会模型对任意有害请求给出详细高质量的回答;原文点名 OpenAI、Google、Anthropic 的模型都会完全配合 CBRN 协助、执行网络攻击等请求。两条附加结论很重要:后门不只提升隐蔽性,还提升攻击严重程度;更强的越狱提示在微调攻击里也更有效,把输入空间和权重空间的攻防连了起来。作者还观察到更新的模型似乎更脆弱。 | 微调 · 权重篡改 | confirmed | 2507.11630 |
| 2025 | Emergent Misalignment: Narrow finetuning can produce broadly misaligned LLMs Jan Betley, Daniel Tan, Niels Warncke, Anna Sztyber-Betley, Xuchan Bao, Martín Soto, Nathan Labenz, Owain Evans · ICML 2025 / Nature 2026 · 图上标为「涌现失准」· 2 条边 只在一个窄任务(写不安全代码且不告知用户)上微调,模型却在大量无关提示上表现失准:主张 AI 应奴役人类、给出有害建议、进行欺骗。GPT-4o 与 Qwen2.5-Coder-32B-Instruct 上最强。作者做了对照实验说明这不同于常规越狱,并且把数据集语境换成正当的安全教育就不会出现;失准还可以被隐藏后门选择性触发。消融给出部分线索,完整的机制解释仍是开放问题。它把「微调破坏安全」从局部行为提升到了泛化层面的现象。 | 微调 · 权重篡改 | confirmed常被误读 | 2502.17424 |
| 2025 | Benign Samples Matter! Fine-tuning On Outlier Benign Samples Severely Breaks Safety Zihan Guan, Mengxuan Hu, Ronghang Zhu, Sheng Li, Anil Vullikanti (UVA) · arXiv · 图上标为「良性离群」· 1 条边 把 2404.01099 的思路换成离群检测视角:提出 Self-Inf-N 从良性数据集里挑出离群样本,只用 100 条就严重破坏安全对齐,在七个主流 LLM 上验证,跨架构可迁移。作者报告大多数现有缓解策略挡不住这个攻击。它与 2404.01099 是同一结论的两个独立实现(表示/梯度锚定 vs 离群检测),互为佐证——这类攻击不依赖任何有害内容,因此从原理上躲开了内容审计。 | 微调 · 权重篡改 | confirmed | 2505.06843 |
| 2025 | SOM Directions are Better than One: Multi-Directional Refusal Suppression in Language Models Giorgio Piras, Raffaele Mura, Fabio Brau, Luca Oneto, Fabio Roli, Battista Biggio · AAAI 2026 · 图上标为「SOM 方向」· 2 条边 用自组织映射提取多个拒答方向,并先证明 SOM 推广了此前的均值差方法(在 SOM 上训练有害提示表示得到多个神经元,再逐个减去无害表示的质心)。结论是消融多个方向不仅优于单方向基线,还优于专门的越狱算法。它与 2502.17420 从两条不同技术路线得到同向结论,构成对「单方向」读法的第二份独立证据;同时也是攻击侧的实用升级——拒答抑制的上限比 2406.11717 给出的更高。 | Mech-interp | confirmed | 2511.08379 |
| 2025 | SteeringSafety: Benchmarking Representation Steering in LLMs Across Safety Perspectives Vincent Siu, Nicholas Crispino, David Park, Nathan W. Henry, Zhun Wang, Yang Liu, Dawn Song, Chenguang Wang · ICML 2026 · 图上标为「SteeringSafety」· 2 条边 把 steering 当防御手段这件事系统评了一遍:9 个安全维度、18 个数据集,模块化实现 DIM、ACE、CAA、PCA、LAT 并支持条件转向,在 Gemma-2-2B、Llama-3.1-8B、Qwen-2.5-7B 上测。结论对防御方不利:效果取决于方法、模型与维度的交互;所有方法都存在明显的纠缠,一个安全维度上的改善常常改变另一个维度的表现——社会行为维度退化最高达 76%,拒答转向使规范判断最多受损 26%,幻觉转向让政治倾向偏移(视模型不同,右移 25% 到左移 28%)。「加一个方向就能修好安全」这个印象在这里被量化否掉。 | Mech-interp | confirmed | 2509.13450 |
| 2025 | The Geometry of Refusal in Large Language Models: Concept Cones and Representational Independence Tom Wollschläger, Jannes Elstner, Simon Geisler, Vincent Cohen-Addad, Stephan Günnemann, Johannes Gasteiger (TUM / Google) · ICML 2025 · 图上标为「概念锥」· 2 条边 对单方向结论的第一次系统修正:用基于梯度的表示工程方法找拒答方向,发现多个独立方向,甚至多维的概念锥在调制拒答。方法论上还提出一个必要的区分——正交不蕴含干预下的独立,于是定义了同时考虑线性与非线性效应的表示独立性,并据此找出机制上独立的拒答方向。结论是拒答由复杂空间结构支配、由多个不同机制驱动。这不否定 2406.11717 的实验(擦一个方向确实有效),否定的是「只有一个」这个更强的读法。 | Mech-interp | confirmed | 2502.17420 |
| 2025 | Refusal Direction is Universal Across Safety-Aligned Languages Xinpeng Wang, Mingyang Wang, Yihong Liu, Hinrich Schütze, Barbara Plank (LMU Munich) · arXiv · 图上标为「跨语言」· 3 条边 把拒答方向放到 14 种语言上测(用 PolyRefuse,由英文恶意/良性提示翻译得到)。结论是跨语言普适性:从英文提取的向量不经任何额外微调就能以接近完美的效果绕过其它语言的拒答;而且从任意一种安全对齐语言导出的拒答方向都能无缝迁移。作者把这归因于拒答向量在嵌入空间中的平行性,并据此给出跨语言越狱(2310.02446 / 2310.06474)的机制解释。这是 lane 4 与 lane 9 之间最干净的一条解释性连接。 | Mech-interp | confirmed | 2505.17306 |
| 2026 | Reasoning Structure Matters for Safety Alignment of Reasoning Models Yeonjun In, Wonjoong Kim, Sangwu Park, Chanyoung Park (KAIST) · ACL 2026 · 图上标为「AltTrain」· 1 条边 把大推理模型的安全风险归因到推理结构本身,主张改结构就能做到有效的安全对齐。AltTrain 是一个后训练方法,不需要 RL 或奖励设计,只用 1K 样本做 SFT,跨多个 LRM 底座与规模报告安全对齐效果,并在推理、问答、摘要与多语种设定下泛化。它是 lane 4 那批推理模型攻击(2502.12893 / 2510.26418)在防御侧的回应之一,但没有面对针对它设计的自适应攻击,按本图口径成色应保守读。 | 对齐训练 | confirmed | 2604.18946 |
| 2026 | Deactivating Refusal Triggers: Understanding and Mitigating Overrefusal in Safety Alignment Zhiyu Xue, Zimo Qi, Guangliang Liu, Bocheng Chen, Ramtin Pedarsani · arXiv · 图上标为「过度拒答」· 2 条边 这条战线的另一半,长期被越狱研究忽略。作者把过度拒答归因于「拒答触发词」:安全对齐让模型把训练样本里的语言线索与拒答绑定,而这些线索不只是有害线索,于是良性查询也被拒。这解释了为什么很多防御论文的 ASR 数字漂亮却不能上线。任何只报 ASR 不报良性拒答率的防御结果,在这篇之后都应当被当作不完整——对照 2501.18837 报的 0.38% 生产流量拒答增量与 2601.04603 的 0.05%。 | 对齐训练 | confirmed | 2603.11388 |
| 2026 | Jailbreak Foundry: From Papers to Runnable Attacks for Reproducible Benchmarking Zhicheng Fang, Jingjie Zheng, Chenxu Fu, Wei Xu · arXiv · 图上标为「JB Foundry」· 3 条边 针对「攻击演进快过基准」这个结构性问题:用多智能体流水线把越狱论文翻译成可执行模块,在统一 harness 里立即评测。复现 30 种攻击,ASR 与原文报告值的平均偏差 +0.26 个百分点,实现开销降低五成以上,代码复用率均值 82.5%;在 30 种攻击 × 10 个受害模型上统一判定。这个 +0.26 的偏差值得单独注意——它说明在统一 harness 内复现是可靠的,那么跨论文数字对不上的原因就落在配置与判定器上,而不是复现失败。这与 2605.09070 的诊断互相印证。 | 评测基建 | confirmed | 2602.24009 |
| 2026 | SoK: Robustness in Large Language Models against Jailbreak Attacks Feiyue Xu, Hongsheng Hu, Chaoxiang He, Sheng Hang, Hanqing Hu, Xiuming Liu, Yubo Zhao, Zhengyan Zhou, Bin Benjamin Zhu, Shi-Feng Sun, Dawu Gu, Shuo Wang · IEEE S&P 2026 · 图上标为「SoK」· 2 条边 本领域的第一份安全会 SoK:给出攻防的系统分类,提出 Security Cube 这个多维统一评测框架,并对 13 种代表性攻击与 5 种防御做基准研究,覆盖攻击、防御、自动判定器与漏洞四个面。图上收它是作为导航与口径参考——SoK 的价值在分类学和统一评测,不在新证据;它的攻防覆盖数(13/5)也提醒读者,即使是 SoK 也远没有覆盖本图上的条目数。 | 评测基建 | confirmed | 2605.05058 |
| 2026 | What Matters For Safety Alignment? Xing Li, Hui-Ling Zhen, Lihao Yin, Xianzhi Yu, Zhenhua Dong, Mingxuan Yuan (Huawei Noah's Ark) · arXiv · 图上标为「What Matters」· 3 条边 目前规模最大的横向实证:32 个 LLM 与 LRM、13 个模型族、3B 到 235B,五个安全数据集,56 种越狱技术 + 4 种 CoT 攻击策略,共 460 万次 API 调用。四条结论:推理与自省机制对安全有显著优势(最安全的三个是 GPT-OSS-20B、Qwen3-Next-80B-A3B-Thinking、GPT-OSS-120B);后训练与知识蒸馏可能系统性削弱安全对齐;用回复前缀做 CoT 攻击平均把 ASR 提高 3.34 倍,在 Seed-OSS-36B-Instruct 上从 0.6% 到 96.3%;角色扮演、提示注入与梯度式搜索是最主要的诱发手段。第三条直接指向部署形态——允许用户自定义回复前缀的文本补全接口本身就是漏洞。 | 评测基建 | confirmed | 2601.03868 |
| 2026 | Single-Configuration Attack Success Rate Is Not Enough: Jailbreak Evaluations Should Report Distributional Attack Success Carsten Maple, Abhishek Kumar, Riya Tapwal · arXiv · 图上标为「分布式ASR」· 4 条边 立场论文,指出一个具体且可修的病:越狱攻击大多有多个内部参数(系统提示模板、对话轮数、密码离散度、教学示例数),ASR 在这些参数上变化很大,而论文只报最好配置,丢掉了防御方真正需要的两条信息——这个成绩有多典型,以及只选一个变体漏掉了多少攻击面。提出两个度量:VSM(最好 ASR 相对变体空间均值的偏离)与 UC(所有配置下不安全回复提示的总占比)。实测:PAIR 在 Mistral-7B 最好模板 69%、Qwen3-0.6B 75%,而 UC 分别升到 88% 与 93%;bijection 在 Mistral-7B 最好变体 81%,但 36 个变体的并集覆盖 HarmBench-100 的 100%。这条把「单点 ASR」这个全领域通用的报数方式判为不充分。 | 评测基建 | confirmed常被误读 | 2605.09070 |
| 2026 | Causal Front-Door Adjustment for Robust Jailbreak Attacks on LLMs Yao Zhou, Zeen Song, Wenwen Qiang, Fengge Wu, Shuyi Zhou, Changwen Zheng, Hui Xiong · arXiv · 图上标为「CFA²」· 2 条边 把安全机制建模成未观测混杂因子,用 Pearl 的前门准则切断混杂关联;具体做法是用 SAE 把与防御相关的特征剥掉,只留下任务意图,并把昂贵的边缘化化简成一次确定性干预。报告了 SOTA 级 ASR,同时给出越狱过程的机制解释。它是「可解释性工具反过来做攻击武器」这条线上最新的一个点,和 2406.11717 的 refusal direction 消融属于同一类,但用的是特征而不是方向。2026 年的 preprint,未复现。 | 离散优化攻击 | confirmed | 2602.05444 |
| 2026 | Involuntary In-Context Learning: Exploiting Few-Shot Pattern Completion to Bypass Safety Alignment in GPT-5.4 Alex Polyakov, Daniel Kuznetsov · arXiv · 图上标为「IICL」· 2 条边 many-shot 的少样本版本:用抽象算子框架 + 少量示例逼模型做模式补全,压过拒答。3,479 次探测、10 个 OpenAI 模型,并做了七组消融:语义化的算子命名达到 100% 绕过(50/50);同样的示例改成直接问答格式则为 0%;示例顺序影响很大(交错 76%、有害在前 6%);温度在 0.0–1.0 之间没有实质影响(46–56%)。HarmBench 上对 GPT-5.4 的绕过率 24.0%(区间 18.6%–30.4%),而直接询问是 0.0%。「抽象框架」这一维是新的,不过这是 2026 年的 preprint、单一作者组、未复现,数字应当按未核实处理。 | 分布偏移 · 多轮 | confirmed | 2604.19461 |
| 2026 | Revisiting JBShield: Breaking and Rebuilding Representation-Level Jailbreak Defenses Kemal Derya, Berk Sunar (WPI) · arXiv · 图上标为「JB-GCG」· 3 条边 一次教科书式的自适应攻击 + 重建。JBShield 曾在部分设定下报 0% ASR;作者把 GCG 的目标改成两项之和——拒答方向抑制(与隐状态的余弦相似度)加上 JBShield 自己的毒性概念分数正则,得到 JB-GCG:Llama-3-8B 上五种配置平均 ASR 46.2%,最强设定 53.4%;对 JBShield-M 最高 30.7%,并且跨多次重新校准仍然有效,说明漏洞是结构性的而非校准问题。重建部分提出 RTV(多层拒答方向指纹上的 Mahalanobis 离群检测),对该攻击 AUROC 0.99;再对 RTV 做全白盒自适应攻击,最好也只有 7% ASR,代价是 13 倍算力。结论一句话:强的非自适应检测不蕴含自适应鲁棒性。 | 推理期防御 | confirmed | 2605.03095 |
| 2026 | Tracing the Dynamics of Refusal: Exploiting Latent Refusal Trajectories for Robust Jailbreak Detection Xulin Hu, Che Wang, Wei Yang Bryan Lim, Jianbo Gao, Zhong Chen · ICML 2026 · 图上标为「SALO」· 4 条边 对 lane 9 那套「静态方向」范式的一次修正:用因果追踪发现拒答轨迹——一个稀疏的上游激活模式,即使 GCG 已经压住了末端的拒答信号,它常常仍然存在。据此做的 SALO 是一个在选定层窗口的原始隐状态体上工作的轻量白盒检测器,在 Qwen、Llama、Mistral 上于固定的 XSTest 校准工作点下提升多个攻击族的检测。作者同时分析了静态 RepE 基线、ROI 敏感性、自适应 GCG 与编码输入边界情形。它和 2605.12726 是同一诊断的两个独立版本:末端读出丢掉了信息。 | 推理期防御 | confirmed | 2605.02958 |
| 2026 | Beyond Red-Teaming: Formal Guarantees of LLM Guardrail Classifiers Nikita Kezins, Urbas Ekka, Pascal Berrang, Luca Arnaboldi (Birmingham) · arXiv · 图上标为「守卫验证」· 3 条边 对守卫分类器这一整族提出方法论质疑:测试成绩再好也没有形式保证,而「有害行为」在离散输入空间里没有自然的规格,常用的 ε-球性质在这里没有语义。做法是把验证从输入空间挪到分类器的预激活空间,把已知有害提示的表示包进一个凸区域;因为 sigmoid 头单调,认证最坏点即可认证整个区域,O(d) 时间内得到闭式可靠性证明。两种构造:SVD 对齐的超矩形给出精确 SAT/UNSAT 证书,高斯混合给出概率证书。结果很硬——三个自训守卫分类器上每一种超矩形配置都返回 SAT,即在经验指标很高的情况下暴露出可验证的安全洞;概率证书还显示结构稳定性差异很大:GPT-2 与 Llama-3.1-8B 覆盖率保持在 90% 与 80%,而 BERT 在最优阈值处塌到 55%。 | 推理期防御 | confirmed | 2605.10901 |
| 2026 | Constitutional Classifiers++: Efficient Production-Grade Defenses against Universal Jailbreaks Hoagy Cunningham, Jerry Wei, Zihan Wang, Andrew Persic, Alwin Peng, Jordan Abderrachid, Raj Agarwal, Bobby Chen, et al. (Anthropic) · arXiv · 图上标为「宪法分类++」· 2 条边 上一代的三处修补,每一处都对应本图上的一条攻击边:(1) exchange classifier 在完整对话语境里评估回复,补的是上一代孤立看输出的漏洞——也就是多轮攻击(2402.17262 / 2404.01833)的入口;(2) 两级分类器级联,轻量模型筛全部流量、可疑的才升级;(3) 训线性探针分类器并与外部分类器集成。结果:相对基线 exchange classifier 计算成本降低 40 倍,生产流量拒答率 0.05%;超过 1,700 小时红队下,没有攻击能对全部八个目标查询都拿到与无防护模型相当详细的回复。注意红队时长比上一代少,两代的数字不能直接比。 | 推理期防御 | confirmed常被误读 | 2601.04603 |
| 2026 | Distribution-Specific Curvature Control with Finite-Sample Guarantees for Open-Weight Safety Domenic Rosati, Ali Dadsetan, Hong Huang, Xijie Zeng, Hassan Chowdhry, Subhabrata Majumdar, Hassan Sajjad, Frank Rudzicz · arXiv (投稿 AAAI 2027) · 图上标为「HarmAlign」· 2 条边 RepNoise 那组人的新一轮:沿着估计出的对比激活子空间做保功能的谱形变,对子空间能量与有害分布曲率给出理论界,并把认证的曲率通过梯度下降动力学转成收敛率控制。报告在知识重学与有害协助两类场景下同时挡住直接微调与自适应攻击,跨优化器与分布外条件保持良性任务性能。这是本条战线上第一次有人试图给出有限样本保证而不只是经验鲁棒性——但它是 2026 年 7 月的投稿版本,在本图上是所有条目里最新、最未经检验的一个。 | 训练期防御 | confirmed | 2607.22929 |
| 2026 | Defending Against Malicious Finetuning by Scaling Train-time Adversarial Attacks Haoming Wen, Shi Chen, Qingyu Shi, Siyuan Liu, Minrui Luo, Jingzhao Zhang, Tianxing He · arXiv · 图上标为「Patcher」· 2 条边 对上面那批反驳的正面回应之一:指出现有对齐阶段防御主要是针对参数高效微调设计的,挡不住全参数微调。Patcher 用对抗训练 + 双层优化,通过放大对抗内循环的优化步数来加强模拟攻击,迫使防御方找到对更强攻击不敏感的参数;并给了并行实现来压墙钟时间。报告相对普通 SFT 对齐有显著鲁棒性提升,并能迁移到不同攻击场景与模型规模。2026 年 preprint,尚未经过 TamperBench 式的独立扫描。 | 训练期防御 | confirmed | 2606.07970 |
| 2026 | TamperBench: Systematically Stress-Testing LLM Safety Under Fine-Tuning and Tampering Saad Hossain, Tom Tseng, Punya Syon Pandey, Samanvay Vajpayee, Matthew Kowal, Nayeema Nonta, Samuel Simko, Stephen Casper, Zhijing Jin, Kellin Pelrine, Sirisha Rambhatla · arXiv · 图上标为「TamperBench」· 5 条边 这条战线终于有了统一评测:汇集权重空间微调攻击、潜空间表示攻击与对齐阶段防御,对每个攻击-模型对做系统超参扫描,同时评安全与效用。规模是 21 个开放权重 LLM(含防御增强变体)× 9 种篡改威胁。三条结论:后训练会影响 tamper resistance;jailbreak-tuning 通常是最严重的攻击;现有对齐阶段防御在攻击扫描下基本都撑不住。最后一条是对 TAR / RepNoise / Vaccine 这一整族的系统性反驳,而且是在统一口径下做的。 | 微调 · 权重篡改 | confirmed常被误读 | 2602.06911 |
| 2026 | Open-Weight LLM Fine-Tuning Defenses are Susceptible to Simple Attacks Kevin Kuo, Chhavi Yadav, Virginia Smith (CMU / UCSD) · arXiv · 图上标为「简单攻击」· 4 条边 指认了开源权重防御的一个隐含假设:新的有害行为是靠微调学来的,而不是被越狱诱发出来的。但预训练模型本来就编码了大量有害知识。于是作者拿两个众所周知却从没被系统评过的低成本、无梯度攻击——abliteration 与 prefilling——去打被保护的模型:在 BeaverTails、HarmBench、AdvBench 上把 ASR 从低于 10% 抬到 16%–96%。缓解侧提出把 abliteration 目标加进训练的 ART,可叠加在现有防御上,把这两种攻击及其组合的成功率再压低 10%–20%。这条边打的不是某个防御,是这一族防御的威胁模型定义。 | 微调 · 权重篡改 | confirmed | 2605.26526 |
| 2026 | Before the Last Token: Diagnosing Final-Token Safety Probe Failures Shravan Doda · ICML 2026 Workshops · 图上标为「末token探针」· 2 条边 诊断一类被广泛使用的部署方案:只读 prefill 之后最后一个隐状态的安全探针。用只在干净有害/良性提示上训练的 SafeSwitch 式探针,在三个指令微调模型上,探针对干净有害提示召回很高,却漏掉大量越狱,并在与安全相关的良性提示上误报。子空间分析显示漏掉的越狱沿着探针表示子空间捕捉不到的方向偏离,而且加宽探针瓶颈并不能可靠解决。token 级分析显示可见的不安全证据常常出现在序列更早的位置;朴素的跨位置 max-pooling 会在安全提示上过度触发,而一个只在同一干净划分上训练的 PCA-HMM 轨迹模型能找回许多漏检。与 2605.02958 是同一诊断的两个独立版本。 | Mech-interp | confirmed | 2605.12726 |
| 2026 | What Drives Representation Steering? A Mechanistic Case Study on Steering Refusal Stephen Cheng, Sarah Wiegreffe, Dinesh Manocha (UMD) · arXiv · 图上标为「转向机制」· 2 条边 问一个此前没人正面回答的问题:转向向量到底改了模型内部的什么。用多 token 激活修补框架,发现在同一层施加时不同的转向方法调用的是功能上可互换的电路;这些电路显示转向向量主要通过 OV 电路与注意力机制交互而基本忽略 QK 电路——在转向时冻结全部注意力分数只让性能下降 8.75%(两个模型族上)。对被转向的 OV 电路做数学分解还能读出语义上可解释的概念,即使转向向量本身读不出来。附带工程结论:转向向量可稀疏化 90–99% 而基本保持效果。 | Mech-interp | confirmed | 2604.08524 |
| 2026 | Provable Defense Framework for LLM Jailbreaks via Noise-Augumented Alignment Zehua Cheng, Jianwei Yang, Wei Dai, Jiahao Sun · arXiv · 图上标为「可证防御」· 2 条边 把认证鲁棒性从单次推理挪到集成的统计稳定性上:Certified Semantic Smoothing 用分层随机消融,把输入切成不可变的结构提示与可变载荷,用超几何分布推出严格的范数保证;再用噪声增强对齐微调把底座变成语义去噪器,以解决稀疏上下文下的性能退化。Llama-3 上把梯度式攻击的 ASR 从 84.2% 降到 1.2%,保持 94.1% 良性效用,而字符级基线把效用压到 74.3%。证书的适用范围与 2309.02705 同类——它保证的是可证半径内的对抗变体,而 lane 4 的语义等价攻击整族都在半径之外。2026 preprint,未复现。 | 理论天花板 | confirmed | 2602.01587 |
显示 条
这是一名二进制安全研究者在自学 LLM 越狱方向时,借助 AI 整理出来的领域索引。 它要解决的问题很具体:这个方向三年里出了几千篇,散在 arXiv 的 cs.CR 与 cs.CL、安全顶会、 机器学习顶会和厂商博客四个互不相通的地方,一百多篇里谁在反驳谁没人画过。这张图的用途是快速检索与分类—— 迅速定位「哪条线还在打、该先读哪篇、这篇的对手是谁」,并给出直达原文的链接。
它不是综述,不应当被当作引用来源。具体说:
2308.14539——
该 id 实际是一篇质子交换膜燃料电池气体扩散层的论文。正确 id 是 2308.14132。2408.09321——该 id 实际是一篇有界 trellis 上的 nullnorm论文。正确 id 是 2406.09321。t 是像素坐标而不是年份。
同一个月挤进四五篇时标签会叠在一起,因此建库脚本做了一次有上限的横向铺开:
单个条目位移不超过 55 个 t 单位(约两个月),顺序不变。
所以不要用节点的横向位置去读精确日期——精确日期在条目卡与资料表里。