OneMillion_AI发文称,yc孵化的AI数据公司Specific Labs推出编程评测Real-Swe,专门测试真实公司的私有代码。任务直接来自企业生产环境,包括算税、账单迁移、API计费和客户数据迁移。结果显示,Fable 5.1排第一,通过率为38.8%GPT-6 Astra为33.8%,Gemini 3.8 Flash为31.2%。GLM 5.3以28.8%排第四,整体通过率低于15%的任务有6个,且有一个任务所有模型全部失败。智谱研究员Xiaopu Peng表示,Real-Swe更考验Agent在陌生项目中持续读代码、找规则和完成多步改动的能力。