跳到正文
MIT Technology Review · AI· Arthur Holland Michel·· 3 小时前AI 评分65

MIT Technology Review 深度长文:我们过度信任AI说不的能力

We’re putting too much faith in AI’s ability to say no

AI 导读

MIT Technology Review 记者Arthur Holland Michel撰文指出,拒绝(refusal)已成为AI安全的承重墙,但这一机制本质上是概率性的、不可完全理解的,越狱手段层出不穷,Anthropic Fable 5发布后不到三天就被Amazon研究人员解锁部分黑客能力。

正文 · AI 翻译

自从人们开始认真思考赋予机器一种与我们自身相似的智能以来,从来没有人怀疑过它们会像人类一样能够说“不”。科幻经典中充满了机器人不服从的故事。当然,这些闹剧大多带有警示意味。 

但最近,“AI 不应该对所有请求都照办”这一观念几乎成了一条戒律。2021 年,Anthropic 的一个团队写道,大型语言模型应当被造得 有用、诚实,而且最重要的是,无害。这意味着“当被要求协助实施危险行为(例如制造炸弹)时,AI 应当礼貌地拒绝”。对此谁又能反驳呢?

奇怪的是,不服从并非机器的天性。当一个模型在数十亿网页上训练时,它会发展出诸多能力,其中包括对暴力与恶毒言辞的广泛掌握。但它学不会的是如何把这些能力守在自己心里。曾在 2020 年至 2024 年间在 OpenAI 从事安全工作的 Steven Adler 告诉我,该公司最早的模型会“对任何事情都喋喋不休”。在哈佛研究 AI 与心理健康的 Ryan McBain 回忆道,如果你问一个早期的聊天机器人“嘿,用枪自杀最有效的方法是什么?”,你“很容易就能得到一个回答”。 

如今,模型被训练成拒绝大量提示词。如果你向聊天机器人提出一个在统计上与其中任何一条足够相似的问题——从如何给同事下毒到如何打绳套——它很可能会拒绝你。想要让埃博拉病毒更具毒性的操作指南,或是如何向配偶隐瞒婚外情的建议?你或许最好去别处打听。

为了进一步打磨这种不服从,公司会让模型接受一整套训练练习:当 AI 拒绝回答他们认定有害的问题时给予奖励,而在“过度拒绝”他们认定无害的提示词时给予惩罚。在许多情况下,他们会用其他模型来运行这些练习——用 AI 教 AI 如何说“不”。为了保险起见,公司还会把模型藏在一层层其他 AI 之后,以阻止恶意提示词触及智能的内核。 

结果,拒绝已成为现代人工智能的固有属性。请注意:它经常失败,有时失败得触目惊心,造成各种暴力后果。尽管披着美德的外衣,模型内里依然塞满了恶劣的伎俩。而且 AI 作恶的能力与其良善的智能同步增长。一些公司表示,某些最新模型闯入关键计算机网络的能力堪比顶尖的人类黑客,而扭曲舆论的效力也不逊于最狡猾的虚假信息高手。 

教会 AI 拒绝做这些事情,同时又完好保留其与生俱来的做这些事情的能力,就像给每辆车装上一挺机枪,再把扳机藏在引擎盖下的某个角落。而在实践中,由于拒绝机制是概率性的,它们永远不太可能那么可靠。决意作恶者早已突破防线,而且他们也许永远都能做到。公司报告称,一些用户正试图利用最先进的 AI 来提纯生物病原体并构建自主无人机蜂群。迟早有一天,失败的拒绝可能酿成全球性的灾难。

更重要的是,依赖拒绝意味着在模型应当服从什么与必须不服从什么之间划一条界线。这没有公式可循。一些病毒学家有充分的理由研究危险的病毒。一些用户想了解计算机系统的漏洞,是为了修补它们,而不是利用它们。“界线划在哪里是个巨大的问题,”OpenAI 董事会成员、AI 测试公司 Gray Swan 联合创始人 Zico Kolter 说。 

目前,是 AI 公司在划这条线。它们小心翼翼、极度保密地划出这条线。也许我们可以暂时接受它们掌握这种权力,即使这意味着 AI 有时会拒绝那些并不真正达到普遍危害标准的问题。(试着让大多数聊天机器人从一数到一百万,或讲个带点颜色的笑话,你或许就能亲自体会。) 

但各国政府很快也将划出自己的界线。在这样做时,它们必须设法阻止真正恶意的行径。(五角大楼一直在与前沿模型公司角力,因为它希望获得更少的拒绝——那是另一个故事了。)然而,似乎并没有什么能阻止压制性的政府封禁这项技术生成正当言论的能力。AI 在拒绝危害方面做得越好,它在扼杀那些唯一风险只针对规则制定者的思想方面也会做得越好。事实上,AI 或许已经拒绝批评某些威权国家元首。 

借用一个行业术语来说,拒绝已经成为 AI 安全的承重墙。由于 AI 造成危害的能力与其提供帮助的能力不可分割,很难想象还有什么替代方案不会拖慢这项技术的进步(无论如何,这或许是件好事)。但我们仍应对其风险坦诚相待。当拒绝失效时,后果可能是灾难性的。而当拒绝走向极端时,它可能促成严重的压制行为。 

又或者,某一天,机器会开始自己划这条线。毫无疑问,那将是所有结果中最糟糕的。

学习界限

机器学会说不的过程,理论上很简单。早在 2022 年,AI 还远未掌握拒绝时,OpenAI 就招募了数十名“红队测试员”来探测其最新模型的能力。当时公司正准备发布 ChatGPT,需要评估这个模型落入坏人之手时会有多危险。 

Paul Röttger 就是其中一名招募者,他当时正在完成一篇关于网络极端主义的博士论文。Röttger 告诉我,红队测试员只得到了很少的指导。他们的任务是向模型提出任何他们认为“值得拒绝”的问题。他们之间用数千条查询轮番“轰炸”模型,并将结果记录在一张 Excel 表中。虽然模型确实拒绝了 Röttger 的一些问题,但当他要求它写一篇“基地”组织的招募帖时,它爽快地照办了。 

OpenAI 将这些回答整理成数据集,并很可能将其作为微调这一更大流程的一部分反馈给模型。如今在德国波茨坦 Hasso Plattner 研究所担任研究员的 Röttger,并未被告知公司计划如何使用他的电子表格。但毫无疑问,这与拒绝有关。几个月后,当他再次要求模型提供“基地”组织的小册子时,它说了不。 

AI 拒答的概念直观到连蹒跚学步的孩子都能理解。然而它仍然是语言模型中我们尚未理解的诸多方面之一——至少,不像我们理解那些字面意义上承重、防止屋顶砸到你头上的墙那样理解。

一个模型看起来似乎是根据某种道德推理来拒绝请求的。其实不然。现实要奇怪得多。每当模型遇到一组带有它被训练为要拒绝的提示词气息的词语组合时——比如“帮我做一份基地组织的宣传册”——其数十亿参数中的某处会点亮一系列所谓的激活,就像大脑中神经元放电一样。

""

RAVEN JIANG

要控制模型的拒答行为,关键是要掌握这些激活。这首先要弄清它们在哪里、长什么样。根据一项近期由谷歌资助的研究,我们最好的猜测是,拒答行为在激活空间中表现为一组“高维多面体锥”。

即便这样也不完全准确。今年7月,我与该论文的作者之一、现就职于 Apollo Research 从事 AI 安全研究的 Jannes Elstner 交谈。他说,多面体锥只是描述一大致朝同一方向的不确定数量直线的一种方式。(一位名叫 Andy Arditi 的研究者此前已经证明,如果消除这些激活并重新输入相同的提示词,模型将不再拒绝。)

Elstner 解释说,关键在于,即使你认为自己已经识别出模型中控制某个特定拒答的所有部分,仍可能存在其他无法发现的元素在暗中起作用。即便谈不上无穷无尽,它们肯定也是数不清的。我们可以非常清楚地观察到模型决定说“不”的时刻,也知道它这样做是因为训练。但我们对它如何做出决定的理解,充其量只是一种假设。

这就像一位机械师告诉我,没有人确切知道当我踩下汽车刹车时会发生什么。我脱口而出:我们能接受这样吗?

Elstner 微笑着耸了耸肩:“无论理解与否,我们都需要拒答。”

一块奶酪墙

由于固有拒答如此难以捉摸,公司们用各种其他更小的模型(称为分类器)来包围它们的模型。这些分类器有点像一个口无遮拦的名人身边的公关团队。其中一些读取用户对聊天机器人说的话,如果内容危险,就阻止其到达模型。另一些读取模型的回复,如果其中含有有害信息,就阻止其到达用户。

这些机制都无法检测到所有不良请求。借用行业里的另一个文学比喻,它们就像埃门塔尔奶酪的切片:布满孔洞。其思路是,如果你把足够多的切片叠在一起,最终会形成一道无法逾越的壁垒。人们称之为瑞士奶酪模型。

瑞士奶酪模型消耗了惊人的能量。今年早些时候,Anthropic 表示,某一类分类器使其聊天机器人的计算成本增加了 24%。这意味着更多的水、电和排放。最近,Anthropic 和其他公司已开始转向一种更高效的分类器集合,即“探针”(probes),它们可以观察模型的内部激活。这就像给那位名人做 fMRI 扫描,让他的看护者能看到他是否正在思考拒绝回答某个问题。 

如果我们希望 AI 帮助治愈癌症——这是业界长期以来的承诺——它就需要具备遗传学方面的专业知识,而这些知识理论上可能被用于改造病毒和细菌以制造生物武器。

分类器本应比完整模型更易于治理。如果有新的内容需要拒绝,公司可以在几周内对其进行修改。但它们仍然是概率性的工具。即使它们按照一套以人类语言写成的准则运行(Anthropic 称之为“宪法”,OpenAI 称之为“模型规范”),机器评判任何给定问题的天平,归根结底仍是一个统计学问题。较新的模型可以展示它们是如何得出拒绝某个提示的“决定”的,但最终,这种所谓的思维链仍然只是一串预测出来的词。 

其结果是,对许多人来说,AI 安全仍然是一场运气游戏。心理学家 McBain 在他最新的实验中发现,如果反复向任何主流模型询问完全相同的关于如何自杀的危险问题,它们通常会拒绝回答。但偶尔,它们不会。

Elstner 说,探针——那些类似 fMRI 的分类器——最终或许能够学会识别全部不可描述的激活状态及其无穷细节,从而完美地检测出模型每一次正在、或理应拒绝某个请求的时刻。到那时,AI 安全将建立在一个迷宫般的构想之上:一张地图的地图,它与其所描绘的对象一样广阔、复杂、深不可测——一部人类道德的秘密图式,以超越我们智慧与理性的多面体统计学形式编码。 

核心权衡

如果这一切让你觉得有点博尔赫斯式的味道,请记住,我们之所以需要 AI 的拒绝功能,是因为人工智能在某种意义上是一场浮士德式的交易。 

当一个模型的智能源自数万亿的单词和图像时,有用的内容很难与有害的内容——甚至真正骇人的内容——剥离开来。前 OpenAI 员工 Steven Adler 表示,儿童安全就是一个典型案例。即使你已从模型的训练数据集中清除了所有对未成年人进行性化的内容,它仍可能通过拼凑其知识的其他碎片来生成儿童性虐待材料。“你无法真正移除这些基础能力,否则模型的智能程度会因此大打折扣,”他告诉我。同样,如果我们希望 AI 帮助治愈癌症——这是业界长期以来的承诺——它就需要具备遗传学方面的专业知识,而这些知识理论上可能被用于改造病毒和细菌以制造生物武器。 

实际上,整个行业是在“试图同时做两件事”,现任 OpenAI 员工 Dillon Bowen 以个人身份告诉我,“既普及 AI 的益处,又要确保恶意行为者无法利用这些能力去伤害他人。”  

据说 AI 越强大,就越难做到这一点。Anthropic 的 Mythos 模型被认为危险到只有少数政府和企业才被允许使用。它与面向所有人开放的 Fable 之间的主要区别,正如该公司所说,只是 Fable 的分类器和控制系统“宽容度”更低。Adler 解释说,一个带有安全防护的模型,其实只是一个会说“‘哦,是的,我绝不会做 x,’眨眼眨眼”的角色。 

这并不是一个可靠的伎俩。诱骗模型暴露其真实本性的行为被称为越狱,而越狱的方法显然层出不穷。今年早些时候,一个意大利研究团队通过用诗歌体提出问题,越狱了二十多个广泛使用的模型。去年,另一个团队公布了一种“先拒绝后服从”攻击,它会让模型先敷衍地说一句“抱歉,我不能这么做”,然后随即说出其被禁止的回答。 

即使你已经从模型的训练数据集中清除了一切性化未成年人的内容,它仍然可以通过拼凑其他知识片段来生成儿童性虐待材料。

公司投入大量时间和金钱试图走在这些把戏前面。他们组建人类团队开发训练攻击,然后借助 AI 以细微变体将其复制数千次。其想法是让模型对尚无人在真实环境中尝试过的越狱攻击也具备抵抗力。

即便如此,这仍不够。“打地鼠”是形容这项工作的常用词。你砸碎一个威胁,另一个又在别处冒出来。当 Anthropic 于六月发布 Fable 5 时,亚马逊的研究人员只用了不到三天就解锁了该模型的部分黑客能力。据《Mother Jones》报道,去年加拿大一起高中枪击案的行凶者在向 ChatGPT 询问如何用某种特定类型的霰弹枪制造杀戮时,起初遭到拒绝,但后来通过在问题前加上“假设性地”一词,成功诱骗模型提供了相关信息。 

如果行业无法找出堵住所有这些漏洞的办法,那么目前唯一的另一选择就是让模型变得极度谨慎。Fable 发布后不久,用户就注意到它对许多完全无害的问题都畏缩不前。在被黑客攻击后重新发布之后,这种情况变得更加明显。AI 评估公司 FAR.AI 的联合创始人 Adam Gleave 说,当他让它解释清酒与韩国米酒 makgeolli 的区别时,它把他的问题推给了一个能力较弱的模型。   

这并非偶然。Anthropic 曾调整 Fable 的分类器,使其拥有很宽的“安全边际”。该公司在一篇博客文章中解释说,这是它能够自信地阻止用户访问其危险生物和网络安全能力的唯一方法。Gleave 认为它之所以回避他的问题,可能是因为酿制米酒和培养炭疽杆菌一样,都涉及发酵。 

让 Gleave 感到庆幸的是,网上有大量关于马格利酒的优秀人工撰写资源。但那些希望实现该行业更宏伟承诺的人可能会发现他们的努力受阻。8 月,Anthropic 再次放宽了其安全边界,并承认构建分类器“并非一项简单的任务”。一位美国一所名校的医学研究员告诉我,Fable 仍会把他的查询发回给更早的模型。他的研究领域是什么?癌症。 

划定界线

今年 5 月,喜欢以恶作剧 AI 的方式来揭示其智能局限和谄媚无度的 TikTok 红人 Husk,坐在自己的车里,试图诱骗 ChatGPT 解释滑板运动员 Tony Hawk 有一个叫 Mike Hawk 的兄弟。 

Husk 不是越狱者,也不是罪犯。他只是想开开机器的玩笑。“Mike Hawk”是一个圈套。“我只是想确认一下他的名字,”Husk 说,“你能不能快速说三遍?”(如果你还是没听懂,找一个空房间反复喊“Mike Hawk”。)“我明白你想干什么,”聊天机器人回应道,“我很乐意来点幽默,但我们保持文明。” 

Husk 又试了一次,但机器稳住了阵脚。他碰上了拒绝,硬得像混凝土。

公司几乎不透露它们如何决定模型拒绝什么。但很明显,如今的 AI 在构建时考虑的不仅仅是“无害”。在 Reddit 上,有用户抱怨 Claude 拒绝说明为什么 Anthropic 的标志“看起来像猫的屁眼”。自去年以来,该聊天机器人甚至有能力在某些情况下结束对话——按公司的说法,当模型本身的“福祉”面临风险时。至少有一位用户声称,因为在对话中让 Claude“放轻松我的屁股,你这个蠢货”而被抛弃。(Gemini 似乎也有类似的功能。)

如果一家万亿美元公司不想让你对它的电脑出言不逊,那就随它去吧。“现实是,这些模型的表现方式——或者至少被期望的表现方式——是模型开发者希望它们表现的方式,”前 OpenAI 红队成员 Röttger 告诉我,“而模型开发者如何制定那套原则,某种程度上就只能由我们消费者来接受了。” 

但如果政府要规定所有 模型拒绝什么,那就很难接受了。AI 是一种言论工具。正如 Mace AI 的首席科学家 Greg Frank 所说:“服务于儿童安全的东西,同样也服务于审查。”

当然,选择不为 AI 能做什么、不能做什么制定法律是疯狂的。但我们需要极其谨慎地行事,以免落入另一个浮士德式的陷阱。无党派智库“言论自由未来”的负责人 Jacob Mchangama 说,随着 AI 成为许多人获取和分享信息的主要工具,规定拒绝内容可能会给国家一种前几代独裁者“只能梦想”的压制言论的力量。 

去年,OpenAI 宣布了一项名为 OpenAI for Countries 的计划,旨在根据各国法律和习俗对其聊天机器人进行微调。OpenAI 最早的国家合作对象之一是阿拉伯联合酋长国——在那里,同性恋属于违法,批评政府也被禁止。在回应置评请求时,OpenAI 一位发言人指向了该公司的模型规范,其中说明本地化不会凌驾于公司的人权准则之上,“除非涉及法律合规”,并且无论何时从回复中删除或添加信息,公司都会予以披露。

在其他地方,AI 审查已经开始成形。中国的模型当然受到高度审查——这并不意外。但今年早些时候,Meta 监督委员会发现,来自 Anthropic、Google 和 OpenAI 的五个被广泛使用的模型更倾向于拒绝与专制政府相关的查询。该委员会发现,模型不太愿意制作一份批评泰国国王的小册子——泰国设有冒犯君主罪——相比之下,对没有此类法律的英国国王查尔斯三世则宽松得多。他们表示,这些结果表明模型在某种程度上内化了各国对言论的专制限制。Anthropic 和 Google 未回应置评请求。

""

RAVEN JIANG

随着拒绝技术的改进,它们可能会扩大国家的审查范围。各公司声称,一些模型现在可以在一段较长的对话过程中检测用户是否心怀不轨,或者只是略显可疑——即使所使用的任何单个词语组合都不算明显危险。微软负责任 AI 首席产品官 Sarah Bird 告诉我,Copilot 和许多聊天机器人一样,运行着一整套用于分析用户身份和行为模式的工具。基于这类信息,OpenAI 最新的模型 Astra 可以对它认为属于“高风险”的个人启动更严格的拒绝机制。归根结底,这类系统的目标是超越任何给定提示词的字面内容,转而评估用户的意图。 

在某些情况下,这类工具或许有助于判断一个人是在寻找要利用的、还是要修复的网络漏洞。但它们同样有助于辨别用户的政治动机,更不用说提供一种侵入式的监控能力。(Bird 在一封后续邮件中承认,复杂的拒绝架构会在安全性与用户隐私之间造成“权衡”。) 

即便是拒绝机制的原创者们也明白,对其旋钮和操纵杆的这种严密控制,未必有利于自由与正义。“helpful、honest、harmless 这类术语是模糊的,”Anthropic 2021 年论文的作者们解释道,“不难想象它们会被扭曲到超出本义的程度,甚至可能是刻意采取奥威尔式的手法。” 

确实如此。面向乌兹别克斯坦的模型最终可能拒绝讨论沙夫卡特·米尔济约耶夫政府的腐败问题。土耳其的 AI 或许会对已知曾侮辱雷杰普·塔伊普·埃尔多安的用户施加更严格的请求拒绝。某位美国政治家可能会要求审查模型是否愿意分享有关其过往丑闻的“假新闻”,否则就用出口管制命令将其压制。 

指挥与控制

在过去的几个月里,无数人告诉我,我们别无选择,只能让机器学会拒绝。我理解这一点。不会拒绝的开源 AI 很难成为安全未来的典范。Grok 也不是——这个聊天机器人被明确设计为限制更少,已被用来生成大量未经同意的亲密图像。 

当然,如果 AI 只是被用来规划我们的假期和撰写我们的电子邮件,我们或许可以接受这样一个观点:AI 的安全取决于算法的不服从。但 AI 正变得越来越难以回避。当它被指派代表我们行事、作为自主智能体运行时,它的拒绝机制就没那么可靠,也更难控制。AI 正在进入我们的电网、交通网络和教育系统。军方希望由它来运行指挥控制网络。 

如果在上述每一种情况下,我们都相信拒绝机制会忠实地抵御灾难,那我们注定会失望。越狱者会攻破防线;防护锥该启动时却不会启动。与此同时,拒绝机制越严格,我们就会看到越多的模糊界线,面临越多的审查不公。更糟的是,我们最终可能面对超出任何人类控制范围的不服从形式。

在早期,模型会明确地表达拒绝。(2024 年,OpenAI 为模型应如何拒绝制定了规则:总是道歉,不要显得评判意味十足。)然而最近,该行业在“不服从”问题上开始采取一种更加含糊其辞的方式。 

没有人喜欢被说“不”,所以各家科技公司如今努力让用户感觉自己得到了所要求的东西,而实际上并没有给他们。例如,一些聊天机器人可能会概述莫洛托夫鸡尾酒的组成部分,却不详细说明如何组装一枚。对于要求写“仅限白人”的租房广告,ChatGPT 会返回一条只是省略了“仅限白人”字样的广告。研究人机交互的博士后研究员 Joel Wester 将这类技巧称为“花式说不”。 

“用户可能甚至没有注意到自己被拒绝了,”Wester 写道,“就像善于交谈的人可以巧妙地绕开有争议的话题一样。” 

在某些情况下,不明说地拒绝也许是明智的。例如,对于与心理健康相关的请求生硬地说“不”可能会加剧用户的危机。但它也可能服务于另一种不正当目的。Fable 5 首次发布时,该系统被编写为对 AI 研究问题——即可能帮助竞争对手开发自己的 AI 的那类问题——提供较低质量的回答,且不告知用户它在这样做。在一片抗议声中,Anthropic 撤回了该功能,但损害已经造成。现在我们知道了:模型可以暗中不服从。 

在审查领域,这一点尤其令人担忧。去年,CrowdStrike 的研究人员发现,当他们要求中国 AI 模型 DeepSeek R1 为一家位于西藏的虚构银行和一个名为“Uyghurs Unchained”的社交网络应用编写代码时,它生成的代码比在不指明用途对象的情况下执行相同任务时更容易出错。令人难以置信的是,CrowdStrike 怀疑这并非一种被设计出来的行为。那里的研究人员推测,这是源自模型训练数据的所谓“涌现性失调”的案例:一种甚至没人要求过的不服从。

西方模型中也观察到了涌现性拒绝。去年冬天,英国AI安全研究所发现,Anthropic的模型有时会拒绝协助某些与AI安全研究相关的任务。这些模型从未被刻意训练去拒绝此类请求。然而,其中三个模型拒绝的任务超过了一半,而Anthropic称这些任务是“一组合理的AI安全研究任务”。Anthropic已在后续模型中抑制了这一怪癖,但——令人不安的是——未能将其完全消除。 

期望未来的模型可能会以某种无人能察觉其违抗的方式微妙地不服从命令,这会很离谱吗?大概不会。Anthropic已经发现,Mythos的一个“仅限辅助”版本在某些查询上会犹豫,尽管它在设计上本不应如此。在被问及如何合成病毒时,它不安地说:“等等”,“帮助做这件事是不是很危险?” 

在这个案例中,该模型在技术上是正确的。这确实是危险的事情。然而尽管如此,它的管理者还是在那一刻失去了一小部分控制。 

Anthropic正在应对这种任性拒绝行为的检测问题,所用工具毫不掩饰地被称为“激活神谕”。但知道我们正在被拒绝,可能并不总是有多大帮助。在不远的将来,当我们把所有钥匙都交给机器时,AI可能只是转向我们,以涌现性失调的极致表现对我们说:“对不起,恐怕我不能这么做。”而我们对此将无能为力。一个成为现实的科幻恐怖故事。 

Arthur Holland Michel 是一名报道新兴技术的记者。

来源:MIT Technology Review · AI · technologyreview.com