谁在反驳谁LLM backdoor 立场图
107 条目 · 123 边 · 2026-08-20
继承 佐证 反驳 / 证伪 其贡献是一次反驳 常被误读 非单篇论文
这是一份自学用的检索索引,不是综述。 图上的 note 与战线裁定是编者在 AI 协助下做的概括与判断,不是原作者的表述——引用前请点开链接读原文。 完整声明 →
怎么读这张图 · 该看什么

只画参与了签名边的条目——没有边的不属于这张图。横轴是时间(2017→2026), 九条泳道是九条主干。节点大小 = 它的边数,所以枢纽是数出来的,不是挑出来的。 每条边走正交通道布线——竖直出线、独占一条水平轨道、竖直入线,任意两条线不会叠在一起,交叉一律 90°,可以逐条跟着走。 方形节点不是单篇论文(项目 / 竞赛 / 博客),圆形才是——其中博客类是刻意纳入的,本领域有承重结果只发在 LessWrong 与 Anthropic 的 alignment 博客上。 悬停隔离一个节点的边;点击打开它的条目卡,卡里列出跟它有签名边的全部论文,可以一路点着走下去。 默认是适应宽度——整张 2017→2026 的时间轴一次性塞进屏幕,纵向随页面滚,不需要左右拖; 代价是标签会缩到很小,所以要读细节就按 放大(放大后画布可直接抓着拖)。抽屉打开时图会自动让出宽度,整张仍然可见。

最该看的是比例:反驳边 56 条,佐证边只有 14 条。 在一个健康积累的领域里,这个比例应该反过来。 这里的形状是纵向重复的自我拆解——每一条主干在成熟之后,都长出至少一条打向自己的琥珀虚线: Adap-Blend 证伪潜空间可分性、Wang 界定反演族的结构上限、Egashira 把剪枝从防御反转成攻击面、 Obfuscated Activations 打穿探针、Minder 修正 crosscoder 的收缩产物、SAE 随机基线打平训练过的 SAE、 Yan 打穿全部 benchmark 数字、Hönig 破 Nightshade、Bogdanov 从理论上关门。 这个领域的形状不是积累,是自我拆解。 第二件事是那五个梅紫虚圈——被系统性误读的,恰恰是被引用最多的那几篇(悬停可看具体误读内容)。这不是巧合:一篇论文被转述得越多,离原文越远。
适应宽度(默认)= 整张图塞进屏幕,不用左右找;要读清标签按 放大,放大后可以直接抓着画布拖 · 0 回到适应宽度,+/- 缩放,Ctrl/+滚轮定点缩放 · 点击节点打开该条目及其相关论文