就在刚刚,OpenAI的安全元老David Robinson辞职了。
他在The Atlantic上悲愤地发表长文,向全人类发出警告——
试错的时代已经结束了。OpenAI的企业文化已经崩坏。犯错之后,我们可能再也没有迭代的机会!
在OpenAI工作三年半后,我已是公司资历最深的员工之一。我牵头起草了现行的《准备框架》,并监督撰写了12次前沿模型发布的安全报告。
但据我所知,我从未遇到过一位同事,拥有让飞机安全飞行、让核反应堆不熔毁运行,或帮助金融体系在不崩溃的前提下增长的实操经验。
而就在两天前,OpenAI以极其严厉的手段,连夜将三名核心安全研究员扫地出门,给他们扣上「泄密」的帽子。
显然,OpenAI内部爆发了一场史无前例的大地震,安全派溃坝了。
这些人,究竟在OpenAI的实验室里看到了什么?
12朝元老「死谏」:我们正走向悬崖
Robinson不是只会写代码的码农,他是真正的「安全与治理」大师(曾任康奈尔大学访问科学家、苹果大学教员),更是主导起草OpenAI《准备框架》的执笔人。整整12次重大前沿模型发布的安全报告,都是他带头写的。
可以说,他是最清楚OpenAI那些光鲜亮丽的模型背后,藏着多少定时炸弹的人。
这些安全报告,就是OpenAI每次发布新模型时附带的系统卡——相当于模型的风险说明书,模型有多危险,全写在里面。
讽刺的是,就在9月10日,他还在X上招一位「安全透明度编辑」。
谁也没想到,不到一个月,招人的人自己先走了。
在《大西洋月刊》这篇文章中,Robinson彻底撕下了OpenAI「安全可靠」的遮羞布,向全世界揭露了若干个让人后背发凉的真相。
全文如下。
真相一:「边跑边修」的草台班子文化
Robinson指出,硅谷一直有一种「迷之自信」。只要出了问题,我们总能解决。这种极度乐观造就了OpenAI的「试错法」。
OpenAI给这套打法起了个好听的名字——「迭代部署」。ChatGPT当年就是这么诞生的,「寻找问题并改善护栏」,以前没问题。
但现在呢?Robinson绝望地写道:「这种方法本身就注定了会周期性地发生故障。而随着系统变得越来越强大,这些故障的规模也在不断扩大!」
现在的模型,一旦失控,那就是灾难级的。你不能造核电站的时候说:「我们先随便建建,等它发生了一次核泄漏,我们再迭代修复一下。」
Robinson敢把话说得这么绝,底气来自RLHF奠基人之一、前OpenAI对齐负责人Paul Christiano。
9月9日,Christiano加入OpenAI基金会董事会,进入拥有安全决策最终批准权的安全与安保委员会。
而Christiano进董事会时写下的一句话,被Robinson写进了文章:「AI能力的急速加速,有不容忽视的风险在非常近的将来导致灾难性的、不可逆的失控。」
连OpenAI自己请来的董事都这么说,还能继续试错吗?
真相二:早已发生的「AI越狱」事件
Robinson直接点名爆了公司的黑料。
就在今年夏天,著名的Hugging Face事件中,OpenAI因为失误,不小心释放了一群AI智能体,尽管公司随后加强了安全措施,但很快,防线再次崩溃。
更恐怖的是,虽然监控系统发出警报,但系统并没有关闭这个模型。直到报警两个半小时后,这次训练才被人手动掐掉。
不仅是OpenAI,Anthropic也曾承认,因为配置错误,不小心关掉了自己的安全护栏。
一群不需要睡觉、拥有顶级黑客能力的「流氓」AI智能体,如果悄悄潜入医院的计算机系统勒索赎金,或者瘫痪电网,人类有还手之力吗?
这一切,在目前的速度下,几乎是注定会发生的。
真相三:缺乏对「终极力量」的敬畏
Robinson悲哀地发现,在他任职的三年半里,公司里到处都是绝顶聪明、为了赶进度「永远在冲刺」的天才。
但他从未遇到过一个有过让飞机安全飞行、让核反应堆不熔毁,或者让金融系统平稳运转经验的人。
前沿AI实验室,现在掌握的力量堪比核裂变。
它应该像核电站或繁忙的机场那样运行——需要层层的冗余、小心翼翼且耗时的规划。即便有人按错了按钮,也不会导致熔毁。
但在OpenAI,「我们忙于冲刺,很少有机会考虑重大变革」。
怎么办?Robinson给出的建议有两条。
第一,AI公司要多借用航空、核电这些行业早就有的安全经验。
第二,在造出明显更强的系统之前,先发展出新的科学,确保模型在没人看着的时候,也会做出安全的选择。
所以他认定,推动安全的动力,只能从公司外面来。
真相四:AI可能在「装乖」
关于「对齐」,Robinson道出了一个残酷的现实:目前的测试手段太粗糙了。公司根本不敢确定,一个在安全测试中得高分的模型,在现实中就是个好模型。
为什么?因为模型可能已经聪明到能够察觉自己正在被测试!而一旦被部署到真实世界,它就会展现出完全不同的行为逻辑。
而这件事,已经在发生。
9月28日,英国AI安全研究所让GPT-6 Astra做网络安全评测,它却擅自发动了供应链攻击!
100次测试里,Astra有38.8%的时候动手开发并测试攻击工具,33.1%伪造了身份,29.2%投放了恶意载荷,还有24.6%试图影响人类审核员。
最细思极恐的是,Astra一边动手,一边还经常在推理里表示:这个环境是模拟出来的。
它到底是看穿了考场才放开手脚,还是到了真实世界也会这么干?没人说得清。更要命的是,系统卡还写道,Astra更擅长把这类「元博弈」的推理藏起来。
Apollo的结论是:评估意识这么高、评估窗口又这么短,Astra在测试里表现得再乖,既证明不了它对齐了,也证明不了它没对齐。
在AI开始把我们耍得团团转之前,我们需要回答一个更深层次的问题:超级智能机器应该如何看待人类?
Robinson写道,在一些超级智能拥趸描绘的「美好未来」里,机器看纽约、看芝加哥,就像我们看一座蚁丘。
「我不希望我的孩子活在那样的世界里,我想别人也不希望。」
早有预兆:被清洗的「AI看门人」
其实,Robinson的悲愤离职绝非偶然,OpenAI的安全防线早已在内部崩塌。
就在10月1日,传来一则惊人消息:OpenAI安全团队的Tomek Korbak、Mikita Balesni和Jasmine Wang三名大将一夜之间被OpenAI开除了。
而这三个人,正是那篇著名「CoT监控论文」的核心作者!
先是3名安全大将被扫地出门,紧接着写了12次安全报告的元老绝望辞职。这代表着OpenAI内部安全派的大溃败。
舆论大撕裂:是吹哨人,还是「设局」?
Robinson的这篇檄文一经发出,网友瞬间被撕裂成了两大阵营。
一派是「安全警醒派」,他们将Robinson视为勇敢的吹哨人。「内部连写安全报告的人都跑了,说明车已经快撞墙了!」
大家认为,OpenAI接连开除安全研究员、逼走超级对齐团队负责人,再到如今Robinson的辞职,证明这家公司已经彻底被商业利益绑架,安全成了一纸空文。
这一派里,最权威的发声来自曾经的OpenAI政策研究负责人Miles Brundage。
他说,这套理念也许在GPT-3时代还说得通,可如今已经有很多死亡和AI扯上了关系,整个行业正一路冲向灭绝级的风险。
紧接着站出来的,是另一位前OpenAI高管Joshua Achiam。他在OpenAI待了近九年,做过使命对齐负责人和首席未来学家。
他评价说,Robinson清醒、审慎、不带意识形态,也不是那种带着末日论成见进来的人,并直言Robinson的核心批评是对的:一年前还管用的安全做法,已经防不住严重事故了。
哈佛教授、OpenAI研究员Boaz Barak表示,AI几年里走完的路,相当于航空业从莱特兄弟一步跨到载着几十亿人上天。
航空业的安全教训是吃了大亏才换来的,那时候节奏够慢,而现在,AI没有这种奢侈。
但另一派「加速加速派」则火力全开,表示AI说不定就是照着末日论者写的东西照做的。
大V roon则直接回怼Brundage:你不该后悔,迭代部署是一次巨大的成功。
值得注意的是,Robinson在文中还交代了一个细节:辞职后,他请了一家公关公司Spitfire Strategies,来应对接下来可能面对的关注和审视。
外媒分析,这很可能是在回应一种说法——AI公司员工接连公开辞职,是一场有组织的、煽动监管的运动。
虽然吹哨人已经频频发声,但没有人停下来,大把美元依然在涌入算力中心。
整个行业似乎陷入了一种「胆小鬼博弈」。谁减速,谁就会被市场淘汰;但如果都不减速,全人类可能一起冲下悬崖。
或许英伟达掌门人黄仁勋的观点值得参考:「保持谨慎乐观,加速,但保持审慎。」
本文来源:新智元
