亚洲财经

☰ 搜索

Laminar把Agent查错成本压到GPT-6-SOL的

Laminar发布了专门检查AI agent执行轨迹的模型flow-1,该模型能够读取模型调用、工具调用和返回结果,找出agent在执行过程中的错误。根据Laminar自建的523条困难trace测试,flow-1的错误检测F1值为0.835,优于GPT-6-SOL的0.816。对于不足10万LLM tokens的trace,flow-1平均每条分析成本约0.0011美元,而GPT-6-SOL则为0.026美元,成本相差约23倍。尽管目前这些成绩来自Laminar自建的benchmark,尚无第三方复测,但社区对其在真实生产环境中的表现仍有质疑。