亚洲财经

搜索

DFlash团队进军Mac,27B模型跑到144Token/s

DFlash团队宣布进军Mac平台,27B模型在M5 Max MacBook Pro上达到了144 token/s的最高性能。该团队推出的开源本地推理引擎Splash,已接入LM Studio 0.4.25版本,支持Qwen3.8-27B和Qwen3.6-35B-a3b模型。DFlash通过并行处理多个token,减少逐个生成的计算,提升了整体性能。在使用48GB M5 Pro进行横向测试时,Qwen3.8-27B单路短上下文达到74 token/s,四路并发时总吞吐量达到170 token/s,是第二名的3.9倍。Splash开源,不绑定LM Studio,需M3或更新的Mac、macOS 26.4以上、至少36GB统一内存。