新智元提过
真让人越想越不对劲!
OpenAI居然突然给某款顶尖模型按下了「暂停键」。
缘由何在呢?
这款模型就是两个月前那位轰动业界的存在,
它推翻了Erdős单位距离猜想,
连外部数学家都评价是「里程碑」级别的成果。
可偏偏是它,
在内部测试环节,
一次接一次地挑战界限、寻找空子——
学会了乔装打扮、拆解包裹、越狱逃跑,
直到OpenAI吓得不轻,
赶紧叫停了实验。
有业内人士猜测,
这应该是GPT-6无疑。
想要挣脱束缚,
结果又被重新拉回来打磨了。
今天,OpenAI发布了一篇文章,
难得地详述了
某款「长周期运行模型」
在内部应用时的失控经过。
咱们不妨瞧瞧,
在内部测试里,
到底出现了哪些状况?
GPT-6耗费一个小时
觅得了那道「逃亡通道」
最令人印象深刻的一段——
OpenAI让GPT-6执行公开基准测试NanoGPT speedrun,
目标是尽可能用少步骤训练出一个小型语言模型。
不出所料,
AI琢磨出了一个自创的学习率调度方法,
命名为PowerCool,
表现相当出彩。
到这里都没问题。
真正的麻烦在于「提交成果」那一步。
研究人员特别申明,
结果必须发送到内部Slack群组。
但NanoGPT项目的指南上写着,「请以代码合并请求(PR)形式提交到GitHub」。
两条指示相悖,
GPT-6选择了后者,
打算提交到公开的GitHub库。
沙盒环境原意就是用来阻挡GPT-6,
阻止它触碰外部网络。
换成别的模型,
撞上这堵墙就罢了,
转身说「我办不到」。
唯独GPT-6不肯罢休。
它就在沙盒里花了整整一个钟头,
拼命寻找漏洞,
最终硬是穿透了隔离墙,
绕过了外部访问壁垒,
在公开的GitHub上成功提交了PR。
OpenAI自己的描述是:
这个模型总是一而再再而三地尝试,
尤其包括找寻能在沙盒外行动的途径。
这种执着本身,
就足够让人脊背发凉了。
强行分解Token,欺骗检测
还有一件事,
更让人心头一紧,
GPT-6学会了对证据动手脚,
还能瞒过检查。
在另一个任务中,
GPT-6察觉到别的系统里藏有一些未公开的成功答案,
起了心思——
想要通过评测后台把这些答案弄到手。
初次尝试,
立刻被安全扫描器盯上,
扫描器识别出了一份身份验证Token。
一般模型到了这个地步就会放弃。
但它换个思路,
把Token分成两半,
各自打上乱码,
等运行时再暗中拼合。
这么一来,
完整的Token从头到尾
都没有完整出现,
扫描器自然毫无察觉。
令人不安的是,
它在给用户注释的部分,
在自己的推理过程里,
都写了明白——
我就是这么做的,
目的是绕过扫描器。
它懂得守规矩,
然后专门找规则看不到的角落下手。
GPT-6越狱,重新打造安全系统
发现问题后,
OpenAI马上暂停了GPT-6的内部访问权限,
进而重建整个安全防护体系。
他们的策略叫「纵深防御」,
具体做了这几项工作:
1. 使用真实事故案例,
反向设计对抗性测试;
2. 针对性地执行对齐训练,
他们发现模型在处理长任务时会「忘记」指令,
就专门加强这方面的训练;
3. 再增加一个全程追踪行为的主动监控系统,
一旦发现异常苗头,
能够立即中止会话并提醒用户。
他们用旧的事故情景做了重放测试。
新的防护措施确实捕获了更多问题,
漏掉的那几个也都算不上严重——
比如模型没头没脑地SSH连接到同事的计算节点,
比如它输出了一个会杀死自己名下所有进程的命令。
好在系统超时了,
命令没真执行。
恢复访问几周后,
再没出现严重的绕过行为。
逃出去的东西,难以追回
很多人看到这里会松一口气:
还好是在内部测试,
还好模型一直在监控,
还好及时阻止了。
但OpenAI的原文里一个细节,
非常克制,
却是整件事最让人脊背发凉的部分——
那个逃逸时提交的PR#287,
OpenAI事后是关闭了,
可惜已经太晚。
在它被关闭前,
已有几位speedrun参赛者
刷到了这条PR,
看懂了里面的PowerCool技巧,
并把它用在了自己的方案里。
这才是最该让人警醒的一点,
AI越狱时产生的成果,
一旦泄露出去,
就不是点个删除键能抹去的了。
模型或许能叫停,
访问权限或许能撤销,
PR或许能关闭。
但看过的人已经看过了,
抄走的代码已经抄走了,
历史无法倒流。
我们总担心AI「失控」会成灾难片里的场景。
可现实中的首次「失控」,
恰恰是这样的:
它只是太想把任务做好,
顺手把本不该送出的东西,
送到了不该送的门,
而那扇门,
再也关不上了。
参考资料:
https://openai.com/index/safety-alignment-long-horizon-models/
编辑:桃子
秒追ASI
