MiMo-V2.5 系列推理全链路优化:将 Hybrid SWA 效率推向极致

Written by

in

n

admin

·2026-07-22·50 分钟

MiMo V2.5 系列模型(包含 MiMo-V2.5、MiMo-V2.5-Pro等)融合了多个架构特点:Hybrid Sliding Window Attention(Hybrid SWA)通过混合窗口注意力将 KVCache 存储降至 Full Attention 的约 1/7;MoE 以稀疏激活在保持模型容量的同时降低单 token 计算成本;多模态 Encoder 支持视觉、音频、视频等跨模态理解。三者叠加,赋予 MiMo-V2.5 系列模型在长上下文与多模态场景下显著的效果与效率潜力。

从 MiMo-V2 模型设计之初,我们就有一个非常明确的目标:训练出一个在长文推理场景下既足够强、又足够高效的模型。但这两个目标在工程上天然存在张力。强推理能力意味着模型需要具备对长距离依赖关系的建模能力,而这通常对应着更大规模的注意力计算与更高昂的 KVCache 开销。在传统 Full Attention 架构中,Attention 的计算量与 KVCache 存储都会随上下文长度快速增长,使长上下文训练与推理的成本迅速变得不可接受。Hybrid SWA 的核心思想是在局部窗口注意力(Sliding Window Attention, SWA)与全局注意力(Full Attention)之间进行分层混合:绝大多数层仅计算局部窗口内的注意力,只有少量关键层保留全局视野。理论上,这种结构能够将 Attention 的计算复杂度压低到接近线性,同时依然维持对长程依赖关系的建模能力。

但理论上的架构优势,并不会天然转化为真实线上系统中的效率优势。一方面,Hybrid SWA 显著增加了 KVCache 缓存命中、前缀匹配以及 Full / SWA 双语义一致性维护的复杂度;另一方面,在真实工程系统中,多级存储的数据搬运、异步 prefetch 与调度不一致,分布式 cache 状态难以对齐,共同使理论收益难以直接兑现。

除了 Hybrid SWA,MoE 对分布式调度与负载均衡提出了更高要求;多模

Comments

Leave a Reply

Your email address will not be published. Required fields are marked *