简而言之

  • 乔治·华盛顿大学的物理学家尼尔·约翰逊和霍英杰(Frank Yingjie Huo)发表了一个公式,用于估算一个AI模型在产生第一个不良输出之前会产生多少个良好输出。
  • 在这篇预印本论文中,该公式在16个明确的案例中正确预测了模型是会立即失控还是在延迟后失控,准确率达到15个。
  • 作者提出了一种并行监测器,用于在模型低于安全阈值时发出警示。

乔治·华盛顿大学的物理学家发表了一个公式,用于估算一个AI聊天机器人在滑入不良回答之前会给出多少个良好回答,早期测试表明该公式有效。

这项由尼尔·约翰逊和霍英杰(Frank Yingjie Huo)完成的研究发表在《Patterns》期刊上,并基于一篇预印本——即在正式同行评审之前公开发布的版本——该预印本于2月首次发布。

Myriad:下一家上市的公司会是谁?点击做出你的预测。
Myriad:下一家上市的公司会是谁?点击做出你的预测。。

聊天机器人可以在很长一段时间内给出合理的回答,然后突然转向有害内容,例如关于自残的不良建议或极端主义言论,而目前还没有简单的方法来预测这种转向何时会发生。作者认为,现有的安全工具往往依赖于云端连接,而离线模型缺乏这种连接。

Johnson和Huo将问题追溯到注意力头,即AI模型中决定在选择下一个词时,对话中哪些较早出现的词最重要的部分。随着聊天不断增长,累积的上下文会将这种注意力拉向某一组可能的答案或另一组,直到它发生倾斜。

这是许多越狱者利用的一种常见模式,也是许多公司关注系统提示(AI聊天机器人在任何查询之前读取的文本片段)的原因之一。然而,没有人能够准确指出,要有效削弱一个模型需要付出多少努力。

他们的公式估算出这个临界点,称为n,即在第一个坏词出现之前输出的好词——模型一次生成一个的词片段——的数量。如果对话已经偏向坏的一面,模型会立即倾斜,n为零。如果它偏向好的方面,模型会给出一连串不错的回答,然后翻转。

在这篇预印本论文中,该公式在16项明确测试中有15项选对了情况——立即还是延迟——准确率为94%。研究人员在六个开放权重模型上进行了这些测试,即文件公开、任何人都可以下载和运行的AI系统,这些模型来自OpenAI、EleutherAI和Meta。

这六个模型的参数量都在1.24亿到4.1亿之间,参数量是模型内部可调整的数字,大致用来衡量其规模。据报道,已发表的论文将测试扩展到七个模型,参数量最高达120亿,以当前标准来看仍然很小。

目标是在设备端运行的AI,即完全在手机或笔记本电脑上运行、无需联网的那种,包括人们像朋友一样交谈的陪伴聊天机器人。谷歌的实验性AI Edge Gallery应用,Decrypt去年测试过,已经能让安卓手机离线运行模型,输入其中的任何内容都不会发送到谷歌的服务器,而且随着硬件变得更强大、更小的AI模型变得更有能力,这似乎是一个可能随时间增长的趋势。

离线运行的模型没有云服务检查其输出,这正是作者想要填补的空白。他们提出了一种低成本监控器,与模型并行运行,并在n*低于安全阈值时发出警报,有点像汽车仪表盘上的警示灯。

比特币BTC · 美元

$82,986−2.22%

10月3日10月5日10月7日10月8日10月10日

$86.7k$84.7k$82.7k$80.7k

24小时最高最高$82,978

24小时最低最低$82,229

成交量成交量$747.7M

→

用 USDT 购买 比特币

由 Jupiter 提供支持

价格数据由 CoinGecko 提供CoinGecko更多 比特币 新闻和预测 →

他们还描述了将临界点推到无法触及的方法,例如向对话中注入内容,使 n* 落在回复长度之外。作者表示,对齐训练——即教导模型如何表现的过程——可以针对特定提示改变或抑制临界点,但无法消除其底层机制。

2025年4月,Decrypt报道了同一对作者的一篇早期论文,该论文表明“请”和“谢谢”对模型的输出影响微乎其微,因为模型在数学上将礼貌用语视为与请求实质内容正交,即不相关。那个版本建模了一个单一的、刻意简化的注意力头。

该预印本的测试使用了小型模型和300个token的窗口,即几段短文本,其预测可能会有一个输出的偏差。