CryptoCoin文章上線

一个公式或可预测 AI 聊天机器人何时变得不安全

Power Trader
一个公式或可预测 AI 聊天机器人何时变得不安全

重点摘要

George Washington University 的物理学家 Neil Johnson 和 Frank Yingjie Huo 开发了一个公式,用来估算聊天机器人在首次给出不良回应前会产生多少个良好 token。在一篇预印本中,研究人员使用六个开放权重模型进行测试,公式在 16 个明确案例中的 15 个正确区分了立即转折与延迟转折,准确率为 94%。研究人员提出一种并行监测器,可在模型接近安全阈值时发出警示,尤其适用于没有云端防护、以离线方式运行的模型。他们的研究也探讨了延后转折的方法,同时指出,对齐训练可能会针对特定提示改变或抑制这种行为,但不会移除其底层机制。这种方法前景可期,但据报告的测试使用了小型模型和有限的 300-token 窗口。

情感分析

  • 整体语气:本文以审慎且提供信息的方式呈现研究。文章指出这项研究可能有助于预测聊天机器人的不安全行为,同时避免声称该公式能解决更广泛的安全问题。
  • 积极因素:据报告,公式在 16 个明确案例中的 15 个测试成功,为早期研究带来了令人鼓舞的结果。在离线模型旁运行的低成本监测器,可能有助于填补无法使用云端防护时的实际安全缺口。
  • 保留意见:初步测试使用的模型相对较小,预测也可能与实际输出相差一个。文章还指出,这种方法估算的是转折点,而不是消除可能导致有害回应的机制。
  • 评估:本文将这项研究视为具有实际价值、但存在重要局限的研究方向。其影响可能是积极的,但在确认此方法在真实世界中的可靠性之前,仍需进行更广泛的测试。
65%

文章正文

George Washington University 的物理学家 Neil Johnson 和 Frank Yingjie Huo 提出一个数学公式,用来估算 AI 聊天机器人何时可能从生成有帮助的回答,转为给出不安全的回应。他们的研究聚焦于对话式 AI 一再面临的挑战:系统可能在长时间的对话中表现得恰当,之后却生成有害或其他不受欢迎的内容。研究人员的方法旨在估算这种变化发生前,模型可能生成多少安全内容。

这项研究发表于《Patterns》期刊,并以一篇预印本为基础;预印本是研究论文在正式同行评审前公开发布的早期版本。该预印本首次于 2 月发布。研究聚焦于 AI 模型的注意力头,这个组件有助于判断对话中先前出现的哪些词语会影响模型选择下一个输出。随着对话延长,累积的上下文可能将模型导向不同的回应选项。作者描述了一个临界点,届时这种影响可能转向不安全的输出。

公式以 n 表示这个转折点,代表模型在生成第一个不良 token 之前生成的良好 token 数量。Token 是模型依序生成的词语片段。如果对话一开始就偏向不安全的方向,模型可能立即转折,此时 n 为零。若上下文偏向安全回应,模型则可能先给出一连串可接受的回答,之后才改变输出。

在预印本的明确案例测试中,公式在 16 个案例中的 15 个正确预测了转折会立即发生或延迟发生,据报告准确率为 94%。研究人员测试了六个开放权重模型:这类系统的文件可供公众下载和运行。模型来自 OpenAI、EleutherAI 和 Meta。其参数数量介于 124 million 至 410 million 之间;参数是模型中的可调整数值,可粗略反映模型规模。

据报告,正式发表的论文将评估范围扩大至七个模型,其中包括参数最多达 12 billion 的模型。即使是这个上限,按当前标准仍属小型。据报告,预印本实验也使用了 300-token 上下文窗口,相当于几个短段落;公式的预测可能与实际输出相差一个。解读结果时,这些细节很重要:测试显示该方法或许能辨别立即转折与延迟转折的大致差异,但尚未证明它在所有模型或真实世界对话中都能精确运行。

研究人员尤其关注设备端 AI,也就是完全在手机或笔记本电脑上运行、无需网络连接的模型,其中包括设计来供用户对话的陪伴型聊天机器人。离线模型可能无法使用云端服务检查回答,形成安全缺口,而本地监测系统或可解决这个问题。文中以 Google 的实验性 AI Edge Gallery 应用为例;Decrypt 去年曾测试这款应用,它能让 Android 手机离线运行模型。文章指出,输入该应用的文字不会发送至 Google 的服务器。

为了填补监测缺口,作者提出一种与聊天机器人并行运行的低成本系统。它会追踪估算出的转折点,并在 n* 低于安全阈值时发出警示,方式类似汽车仪表板上的警示灯。这类监测器不一定能阻止所有不安全回应;它的作用是提供信号,提醒用户模型输出正接近风险边界。

论文也探讨了如何让转折点更晚出现。一种可能的方法是在对话中加入内容,使 n* 超出回应长度。作者表示,对齐训练——教导模型以期望方式行动的过程——可能针对特定提示改变或抑制转折。然而,他们认为训练并未移除底层机制。因此,这种监测器被定位为额外的防护措施,而非取代模型训练或彻底解决聊天机器人安全问题的方法。

文章也将这项研究联系到同一批研究人员较早的一篇论文,Decrypt 曾于 2025 年 4 月报道。该研究认为,“please”和“thank you”等表达对模型输出的影响微乎其微,因为从数学角度来看,礼貌用语与请求的实质内容正交,也就是彼此无关。早期版本以一个刻意简化的注意力头建立模型。综合来看,这些研究探讨了对话上下文和模型机制与行为之间的关系,但模型规模扩大后的表现,以及实际部署时的情况,仍有待厘清。

关键信息表

方面说明
研究团队George Washington University 的物理学家 Neil Johnson 和 Frank Yingjie Huo 开发了这项公式。
核心估算公式估算 n,也就是模型首次生成不良输出之前的良好 token 数量。
预印本结果在 16 个明确案例测试中,公式在 15 个案例中正确辨识立即或延迟转折,准确率为 94%。
受测模型预印本测试了来自 OpenAI、EleutherAI 和 Meta 的六个开放权重模型,参数数量介于 124 million 至 410 million 之间。
据报告的扩展测试据报告,正式发表的论文涵盖七个模型,规模最高达 12 billion 个参数。
主要局限预印本使用了 300-token 窗口,预测可能与实际输出相差一个。
提议的应用并行监测器可在估算的转折点低于安全阈值时发出警示,也适用于离线模型。

最後編輯時間:2026/10/10