OpenAI 启动欧盟地区 AI 生成文本标识计划
OpenAI 于周一宣布,已开始为欧盟地区的用户使用其人工智能系统 ChatGPT 和 Codex 生成的文本添加标识。此举旨在遵守于 8 月 2 日生效的《欧盟人工智能法案》中的透明度要求。
根据相关规定,人工智能公司必须以其他系统可读取的形式对机器生成的内容进行标识。违反第 50 条规定的企业可能面临高达 1500 万欧元或全球年营业额 3% 的罚款。未来几周内,该功能将在欧盟境内的所有付费账户中逐步上线,但目前仅适用于欧盟区域内的用户。
虽然从即日起,任何地点的开发人员均可通过 API 激活特定模型的此功能,但在客户手动启用之前,该功能将保持未激活状态。
技术原理:隐藏于词汇选择之中
OpenAI 表示,此次扩展内容溯源方法以涵盖文本领域,主要是为了满足欧盟的监管要求,同时也承认当前文本水印技术存在显著局限性。OpenAI 的工具已能帮助验证图像或音频文件是否由其模型创建……
OpenAI 开发的“textGrain”系统通过在 ChatGPT 面临多个同等合适的备选词汇时,对其选择进行细微引导来工作。在长篇幅文本中,这些微小的决策会积累成一种统计模式。这种模式肉眼不可见,但可通过专用软件检测出来。
由于水印嵌入在措辞本身而非存储在文件元数据中,即使文本被复制粘贴到其他位置,水印仍可被检测。
该系统由 OpenAI 与宾夕法尼亚大学及耶鲁大学的研究人员共同开发。其技术论文解释称,textGrain 使用密钥对可能的下一个词进行排名,并微妙地偏向某些选择。当一段文字中出现足够多的此类选择时,拥有相同密钥的软件即可识别该模式,从而判断该文本可能由 OpenAI 模型生成或处理过。
OpenAI 强调,水印不包含任何能识别生成文本用户的信息。此外,公司表示测试发现,在启用 textGrain 后,GPT-6 Astra 的性能并未出现明显下降。
轻量编辑可大幅削弱水印检测效果
OpenAI 同时公布了该系统的局限性。在其测试中,仅用同义词替换 10% 的词汇,就将检测率从约 92% 降低至 66%。此外,在短段落、数学答案和翻译文本中,水印也更难被检测。
鉴于这些限制,OpenAI 目前将把检测工具的使用权限仅限于授权研究人员和专家机构。公司还指出,无法检测到水印并不能证实文本是由人类撰写的。文本可能只是篇幅过短、经过大量编辑,或者甚至是由其他公司的模型生成的。
水印只能表明某段文字的部分内容可能由 OpenAI 系统生成或处理,但无法反映其中包含多少人类判断、编辑或创意成分。
Anthropic 选择全球范围标识,OpenAI 先从欧洲起步
今年 8 月,Anthropic 开始在全球范围内对 Claude 的输出结果进行水印标识。起初,这似乎比仅在欧盟实施标识的 OpenAI 政策更为广泛,但原因在于技术层面:Anthropic 当时尚未具备限制区域水印的功能。
两家公司均已在 7 月签署了欧盟关于人工智能生成内容透明度的行为准则,此外还有包括 Google、Meta、Microsoft 和 Mistral 在内的约 190 家组织签署。因此,它们的水印举措均是针对自 8 月 2 日起生效的同一项欧盟透明度要求。
Anthropic 的推广仍遭到部分用户的批评,他们认为用户提供了核心思想、指令和判断,而 Claude 主要仅协助写作。
OpenAI 早在数年前就已创建了文本水印系统,但因担心用户可能转向不输出水印的其他 AI 系统,故决定暂不公开该系统。