Meta首席AI官Alexandr Wang驳斥了AI研究机构SemiAnalysis的「刷榜论」,称老测试早已饱和。SemiAnalysis指出,Gemini 3.8 Flash和Muse Spark 1.3是目前最明显的「benchmaxxed」模型之一,分别在Terminal-bench 2.1中获得89.4%和88.8%的成绩,接近GPT-6 Astra和Claude Fable 5.1。然而,在刚发布的Terminal-bench 4.0中,这两款模型的成绩仅为19.1%和33.3%。Wang认为,Terminal-bench 2.1已经饱和,无法有效区分顶尖模型,而4.0仍未饱和,且删除了部分饱和任务并调整了测试条件。