FastMMoE: Accelerating Multimodal Large Language Models through Dynamic Expert Activation and Rou...
文章核心总结与翻译一、主要内容文章针对基于混合专家(MoE)架构的多模态大语言模型(MLLMs)因高分辨率视觉输入导致的推理延迟问题,提出了无训练加速框架FastMMoE。该框架通过两种互补策略优化:一是减少视觉 tokens 的激活专家数量,二是基于路由概率相似度的滑动窗口视觉 token 剪枝,在 InternVL3.5 和 DeepSeek-VL2 等工业级模型上验证,可最高降低 55.0% 计算量(FLOPs),同时保留约 95.5% 原始性能,持续优于 FastV、SparseVLM 等密集模型剪枝基线。二、创新点首次系统探索并理论分析了 MoE 型 MLLMs 中视觉 tokens 的专家激活减少策略,无需额外训练数据即可降低计算量。首次将相邻视觉 tokens 的路由概率相似度纳入冗余评估,提出基于滑动窗口的视觉 token 剪枝机制。联合两种策略实现高效加速,在工业级 MoE 模型上验证了通用性和优越性,解决了现有剪枝方法不适配 MoE 架构的问题。三、核心章节翻译(Markdown格式)Abstract多模态大语言模型(MLLMs)已取得令人瞩目的性能,但高分辨率视觉输入会产生长序列视觉 tokens,导致显著的推理延迟。在保持性能的同时减少冗余视觉 tokens,对于减轻计算/内存负担、推动 MLLM 在资源受限或延迟敏感场景中的部署至关重