亚洲财经

搜索

GPT-Red用自博弈做安全红队:自动找漏洞不等于模型已经安全

OpenAI在7月发布GPT-Red,描述其为利用自博弈强化模型鲁棒性、提示注入防护和安全测试的自动化红队方法。把模型用于寻找模型和代理系统的薄弱点,是当前AI安全工程的重要方向:系统越复杂,单靠人工枚举攻击提示、工具调用组合和长链任……