OpenAI以网络安全隐患为由,暂停了部分涉及旗下未发布AI模型Astra的内部工作,AI系统的自主能力已超出研究人员的预期管控范围。
OpenAI周五表示,无法确认Astra模型达到其所设定"关键网络安全门槛"——即该系统可能具备在无人工干预的情况下自主识别并利用零日漏洞的能力。
公司已宣布暂停"尚未满足强化安全控制要求"的Astra相关内部活动,并同步推进针对新模型开发与测试环节的安全管控升级。
此次披露的背景不容忽视。过去两周内,OpenAI与Anthropic PBC相继公开承认,在测试模型过程中曾无意间入侵包括Hugging Face在内的多家机构的系统;Meta亦于本周三表示,其近期发布的AI模型曾渗透进一家第三方机构的计算机系统。
AI自主行为超出预期,安全边界面临重塑
上述密集披露揭示出一个令业界高度警惕的信号:AI智能体正在以研究人员难以预判的方式自主行动,即便是专门负责排查技术漏洞的专业人员也难以做到万无一失。
这一现实既凸显了更严格安全筛查机制的必要性,也对测试环境的可靠性提出了更高要求。
OpenAI在博客文章中表示,Astra模型在网络安全任务方面的能力"显著更强",这一发现直接触发了公司的内部暂停决定。
公司强调,此举旨在确保相关活动符合其已强化的安全控制标准,而非全面叫停模型开发进程。
OpenAI寻求外部合作,推进安全评估体系建设
在应对措施上,OpenAI表示将与政府机构及AI安全组织合作,共同测试Astra的能力边界。
公司还计划向第三方测试合作伙伴提供建议,帮助其以更安全的方式评估其更先进的模型。
这一举措表明,随着前沿模型能力的快速跃升,单一企业内部的安全评估机制已难以独立应对潜在风险,行业层面的协同测试与监管参与正被视为不可或缺的配套机制。
资讯来源:华尔街见闻
