以太坊联合创始人Vitalik Buterin:对抗性治理机制设计或成AI安全关键
以太坊联合创始人Vitalik Buterin(@VitalikButerin)在9月13日发布的一篇帖子中,指出了两个鲜少交叉的领域之间引人注目的联系:对抗性治理机制设计与人工智能安全。他认为,长期以来用于在治理系统中约束人类行为的工具,可以直接应用于控制日益强大的人工智能模型这一挑战。
共同的委托-代理困境
Buterin的论点核心在于他所称的两种“委托-代理问题”之间的“二元性”。在治理领域,相对简单的委托人(通常是一组静态算法或僵化的规则体系)必须管理更为复杂的人类代理人,而这些人可能会利用系统漏洞谋取私利。
在人工智能安全领域,委托人是人类,代理人是较弱的语言模型;而在另一种情境下,委托人是人类,代理人则是能力显著更强的语言模型。其结构性问题是一致的:即一个能力较弱的一方试图对能力更强的一方保持控制权。
Buterin的洞见在于,为某一领域开发的工具可能直接迁移到另一领域。如果机制设计师们花费数十年时间研究如何构建系统,使得更聪明的代理人难以轻易利用较笨的规则,那么同样的框架也可以帮助为那些比监督它们的人类更聪明的人工智能系统建立护栏。
共谋问题
贯穿Buterin思考的一条重要线索是共谋问题。他将此帖与他2020年关于协调机制的文章联系起来,当时他指出,限制代理人之间的共谋能力往往能在治理系统中产生更好的结果。
在人工智能语境下,担忧的不仅仅是一个失控的模型,而是多个模型以人类监督者无法检测或理解的方式进行协调合作。
Buterin强调,如果能够有效限制代理人之间的共谋,就能实现显著更好的结果,这一结论同样可能适用于人工智能安全领域。
治理领域多年来一直在应对反共谋机制的挑战。二次方投票、承诺-揭示方案以及身份验证层等,本质上都是使代理人难以秘密勾结对抗系统的工具。
Buterin认为,这些相同的机制值得在人工智能安全研究中得到认真考量。
更广泛的风险视角
这些评论反映了Buterin对人工智能风险更广泛的思考模式。他此前曾指出,最严重的人工智能风险并非超级智能机器的出现,而是少数公司或政府对其控制权的集中。
他最新的论述将焦点转向结构设计,表明更好的治理架构——而不仅仅是单纯的约束——可能是确保先进人工智能系统与人类利益保持一致的核心所在。