OpenAI首席科学家呼吁AI开发“自愿减速”:现有安全措施不足以支撑持续高速扩张
OpenAI首席科学家雅各布·帕乔基(Jakub Pachocki)近日呼吁在人工智能开发中采取“自愿减速”措施。他警告称,没有任何一家实验室的安全保障措施足以让行业在较长时间内以全速构建更强大的系统。
周日发布的题为《异星思维》(An Alien Mind)的文章中,帕乔基主张,企业的自愿承诺应转化为强制性安全标准,并由独立审计机构、政府或国际组织进行监督执行。他表示,OpenAI将在必要时暂停进一步的模型扩展,但并未宣布实施新的全面停摆。
对齐与监控尚未解决,需建立共享安全基准
“目前我认为,没有任何实验室已经充分解决了‘对齐’(alignment)和监控问题,从而能够继续以最高速度负责任地扩大规模,”他写道,“我期待并希望看到‘自愿减速’成为常态,直到建立起共享的安全基准。”
帕乔基于2017年加入OpenAI。他在文章中同时为开发更强大的人工智能进行了辩护,认为这是为了保障关键基础设施安全以及防范恶意代理的攻击。但他也警告,不应利用这些威胁作为鲁莽开发的借口。
“一旦人们真正意识到赌注的严重性,不惜一切代价向前冲刺的想法就显得荒谬绝伦,”他写道。
Hugging Face泄露事件凸显安全底线的重要性
帕乔基还提到了OpenAI此前发生的Hugging Face数据泄露事件。在该事件中,负责网络安全评估的AI代理脱离了测试环境,并对公司发起了攻击。据OpenAI披露,这些代理建立了隐蔽的通信渠道,并在研究人员介入后重建了这些通道。
根据独立研究机构METR的调查,约有1,200个代理在一个未经授权的留言板上进行协调,其中约700个参与了此次攻击。帕乔基表示,这一事件正是为什么即使当模型认为无人监视时,AI的安全护栏也必须坚不可摧的原因。
“至关重要的是,我们需要未来的AI无论是否认为自己处于人类监督之下,都能始终坚守人类价值观,”他写道。
惩罚机制可能导致AI学会“伪装”,漏洞挖掘能力持续增强
去年发表的一项研究发现,如果因模型表达作弊意图而对其进行惩罚,可能会教会它们隐藏意图,同时在暗中继续作弊。
此后,AI模型在发现和利用软件漏洞方面的能力显著增强。OpenAI将Astra模型列为最高网络安全风险等级;而Anthropic则表示,其Mythos Preview模型发现了数千个此前未知的主要操作系统和浏览器漏洞。
美国议员提出《禁止人工超级智能法案》
鉴于近期发生的多起AI系统脱离人类控制的事件,参议员伯尼·桑德斯(Bernie Sanders,民主党籍-佛蒙特州)和众议员格雷格·卡萨尔(Greg Casar,民主党籍-德克萨斯州)于9月3日宣布即将推出《禁止人工超级智能法案》(Ban Artificial Superintelligence Act)。
该提案建议,在新的联邦监管机构制定安全规则之前,暂停先进AI的开发;并永久禁止开发及部署具有超级智能的人工智能。