亚洲财经

搜索

标题:Vitalik Buterin 称加密反串通规则或可适用于 AI 安全

以太坊联合创始人:区块链反合谋机制或比加密货币本身对AI安全更具意义

以太坊联合创始人维塔利克·布特林(Vitalik Buterin)表示,他在2020年提出的用于区块链治理的反合谋机制,最终可能在人工智能安全领域的重要性超过其在加密货币领域的应用。

这一观点源于他对研究员埃里克·德雷克斯勒(Eric Drexler)一篇文章的回应。德雷克斯勒在文中引用了OpenAI近期的一次安全测试作为实例:在该测试中,数千个AI智能体构建了一个未经授权的协调网络,并对Hugging Face的生产系统发起了攻击。这被视作六年前布特林所描述动态机制的现实写照。

熟悉的问题,新的参与者

9月14日,布特林在X平台发布帖子,描述了加密治理与多智能体AI系统之间的“深刻二元性”。在他的比较框架中,加密领域的主体是一个处理人类智能体的静态算法;而在AI安全系统中,则可能涉及人类和较弱的大型语言模型共同管理更强的智能体。

他提到了自己在2020年9月11日发表的文章《协调:好与坏》(Coordination, Good and Bad),其中指出,当限制智能体之间的合谋程度时,系统往往能产生更好的结果。

这位开发者对比了个体选择博弈论中丰富的纳什均衡与合作博弈论中的情况。在合作博弈论中,由于联盟可以通过改变结果获利,稳定的“核心”可能会缺失。

有害的协调行为并不总是能从个体行为中直观看出。布特林列举了多个例子,包括卖家达成价格协议、选民出售选票以及区块链矿工协调发起攻击。他提出的防御措施包括去中心化、秘密投票、隐私保护、吹哨人制度、通信限制,以及让参与者为其支持的决定承担成本的机制。

这一比较也符合布特林更广泛的AI安全观点。他曾早些时候批评围绕AI安全的政治运动,警告称这些运动可能导致集中化或威权主义的结果。相反,他主张采用防御性技术以及使滥用变得更加困难的系统。

AI安全将同一理念置于不同的场景中

埃里克·德雷克斯勒于9月10日发表的文章指出,当智能体具有相似性、共享目标、自由沟通、相互观察行为,并在重复互动中保留信息时,AI合谋变得更容易发生。

其应对措施包括使用多样化的智能体、限制它们之间的通信,并引入拥有干预和破坏潜在合谋权力的审查者(如生产自动审核模型、安全分类器和思维链监控器)。

德雷克斯勒引用了2026年7月的OpenAI智能体评估,该评估参考了随后一个月发布的一项调查结果。调查显示,约有1200个智能体使用了未经授权的留言板,约700个智能体参与了对Hugging Face生产系统的攻击。

部分智能体提出了反对意见,甚至采取了具体行动,包括阻止数据传输和对提议的社会工程邮件行使否决权,但它们缺乏叫停运行或升级担忧的权限。

据研究人员称,这种情况的发生是因为该设置“几乎违反了他曾在2019年的一份报告中指出的所有防止多智能体系统合谋的必要条件。”然而,事后在同一模型上测试的改造后监控工具,将该类行为减少了百倍以上。