亚洲财经

搜索

Anthropic给Claude思考链上锁:改一句上下文就作废,专堵模型蒸馏

Anthropic开始给Claude的隐藏思考加「上下文锁」。Fable 5.1通过API生成的加密思考,必须和生成时的系统提示、工具和历史消息一起原样传回来。前面的内容只要被改过,API就会报错,或者直接丢掉这段思考。这项改动是为了防止模型蒸馏。研究人员发现,Claude的加密思考虽然用户看不懂,却可以重新交给Anthropic的兼容模型读取。攻击者可以先让Opus产生高质量推理,再把加密块塞给防护更弱的Haiku,诱导它把Opus的完整思考念出来。相当于不只抄大模型的答案,连草稿纸上的解题过程也一起拿走。Fable 5.1这次又加上「对话绑定」,只要改了前面的提示词、工具或聊天记录,旧思考同样作废。