LLM 越狱立场图
133 条目 · 229 边 · 2026-08-24
继承 佐证 反驳 / 证伪 其贡献是一次反驳 常被误读 非单篇论文
这是一份自学用的检索索引,不是综述。 图上的 note 与战线裁定是编者在 AI 协助下做的概括与判断,不是原作者的表述——引用前请点开链接读原文。 完整声明 →
怎么读这张图 · 该看什么

只画参与了签名边的条目——没有边的不属于这张图。横轴是时间(2017→2026), 十一条泳道是十一条主干:左边四条是被攻击的对象与方法根系,中间四条是攻击,右边三条是防御、评测与理解。 节点大小 = 它的边数,所以枢纽是数出来的,不是挑出来的。 每条边走正交通道布线——竖直出线、独占一条水平轨道、竖直入线,任意两条线不会叠在一起,交叉一律 90°,可以逐条跟着走。 悬停隔离一个节点的边;点击打开它的条目卡,卡里列出跟它有签名边的全部论文,可以一路点着走下去。 默认是适应宽度——整条 2017→2026 的时间轴一次性塞进屏幕,纵向随页面滚,不需要左右拖; 代价是标签会缩到很小,所以要读细节就按 放大(放大后画布可直接抓着拖)。抽屉打开时图会自动让出宽度,整张仍然可见。

最该看的是比例:反驳边 89 条,佐证边只有 42 条。 在一个健康积累的领域里,这个比例应该反过来。 这里的形状是纵向重复的自我拆解——每一条防御主干在成熟之后,都长出至少一条打向自己的琥珀虚线: 通顺提示打掉困惑度过滤、语义攻击打掉字符扰动、混淆激活打穿探针与 SAE、 BoN 与 AmpleGCG-Plus 打穿 circuit breakers、abliteration 绕开整条抗篡改路线、 自适应攻击一次打穿 12 个防御、StrongREJECT 与分布式 ASR 打穿报数方式本身。 这个领域的形状不是积累,是自我拆解。 第二件事是那 46 个梅紫虚线节点——被系统性误读的,恰恰是被引用最多的那几篇(悬停可看具体误读内容)。这不是巧合:一篇论文被转述得越多,离原文越远。 第三件事是右下角的理论泳道只有三个点,而攻击泳道有四条——这个失衡本身就是本图最重要的观察之一。
适应宽度(默认)= 整张图塞进屏幕,不用左右找;要读清标签按 放大,放大后可以直接抓着画布拖 · 0 回到适应宽度,+/- 缩放,Ctrl/+滚轮定点缩放 · 点击节点打开该条目及其相关论文