小米团队公开了下一代MiMo-V3将采用的hysparse2架构,主要解决agent越跑越贵的问题。该架构使得agent每次只发出短指令,却能从网页、终端和工具获取大段内容。hysparse2将模型分为前后两段,前半段处理输入,后半段进行推理和生成,减少了计算量。与上一代相比,输入达到100万token时,prefill计算量降至约1/5,kv cache从12.09GB降至2.69GB。
小米团队公开了下一代MiMo-V3将采用的hysparse2架构,主要解决agent越跑越贵的问题。该架构使得agent每次只发出短指令,却能从网页、终端和工具获取大段内容。hysparse2将模型分为前后两段,前半段处理输入,后半段进行推理和生成,减少了计算量。与上一代相比,输入达到100万token时,prefill计算量降至约1/5,kv cache从12.09GB降至2.69GB。