亚洲财经

搜索

DeepSeek计划训练8万亿参数模型,规模直奔现有最大开放模型近3倍

DeepSeek CEO梁文锋向投资人透露,公司正在训练一个2万亿参数模型,之后还计划开发一个8万亿参数模型。现有旗舰v4-pro只有1.6万亿参数。根据公开权重,moonshot ai的kimi k3达到2.8万亿参数,已是全球最大的开源模型。DeepSeek规划中的8万亿模型规模将接近3倍。需要注意的是,总参数越多,并不代表每次运行都要调用全部参数,kimi k3就是采用moe架构,2.8万亿总参数里每个token只激活1040亿。