小红书与北大开源 UltraEP:面向大规模 MoE 训推的实时负载均衡方案

发布时间: 2026-07-20 文章分类: AI前沿技术
阅读量: 0
AI智能体
企业级AI智能体开发与部署
LumeValley提供全栈式企业级AI智能体开发与部署服务,涵盖战略规划、场景化开发、企业级应用构建、行业解决方案及算力支撑。从需求分析到持续优化,确保智能体高效稳定运行,助力企业实现智能化转型,提升运营效率与竞争力。

训练一个千亿参数的MoE模型,GPU有一半时间在摸鱼——这不是夸张,是过去两年业内的公开秘密。直到小红书与北大联合甩出的UltraEP,才第一次把“实时精准的负载均衡”真正带进了生产系统。它不靠事后补救的辅助损失,也不靠静态的容量因子,而是盯着每一次microbatch、每一层Transformer的路由结果,当场算出谁是热点专家,立刻复制副本把请求摊开。方案落到Qwen3-235B上,训练吞吐直接冲到理想上限的94.6%,比Megatron-LM高出整整42%;推理端更夸张,prefill吞吐直接反超SGLang 1.56倍。能用一行行工程代码把GPU利用率从一半拖到近乎满分,这背后是一整套全新思路的调度哲学。

为什么大模型专家的“赋闲”比996还严重

路由天生就不公平

MoE之所以香,是因为它用一个路由网络把token分配给少数几个专家,而不是让大几千亿参数全体出动。但路由网络从来不懂什么叫公平。热门专家被疯狂塞满,冷门专家几乎空转,导致大量GPU算力在等——等那个最忙的专家干完活,大家一起往下走。更糟的是,这种不均衡不是偶然,而是训练出来的路由分布本身就带有强烈的偏好。你以为你买了一张A100,实际上它有一半时间在喝茶,算下来成本直接翻倍。

辅助损失治标不治本

业界当然不傻,Megatron-LM、DeepSpeed-MoE都用辅助损失函数逼着路由均匀些。问题是,辅助损失是一把钝刀。它只在反向传播时给路由网络一点惩罚,根本不知道下一秒哪个专家会炸。容量因子(capacity factor)也是常见解:给每个专家设个最大token数,超了就丢弃。丢掉的token怎么办?只能用残差连接混过去,模型精度直接被吃掉一块。这些方法本质都是在猜,猜下一个step的负载分布,猜一个静态的容量,而MoE训练进程中的负载波动远比想象中剧烈。

UltraEP解题没那么多花活:盯着路由,当场复制

每个microbatch都是一次全新的调度决策

UltraEP的核心逻辑简单到让人拍大腿:别猜了,路由网络自己已经把答案写脸上了。每一层前向传播时,路由网络会给每个token分配专家排名,这些排名就是最精确的负载预报。UltraEP在每个microbatch开始前,直接读取这些精确路由信息,实时统计哪些专家会超载,然后立刻启动动态复制——把热点专家的参数多复制几份到空闲GPU上,让多个副本并行服务。这一步不依赖任何统计数据、不调任何超参,完全是基于当前这一把的即时路况做决策。

逐层复制,比特么张量并行还聪明

更绝的是,复制不是全局搞一次,而是逐层进行。Transformer每一层的热点专家可能完全不同:第二层的专家3忙得飞起,第三层可能换成了专家7和9。UltraEP在每一层重新读取路由、重新计算副本数、重新分配GPU,热点专家被逐层动态复制到最适合的空闲单元上。相比传统的张量并行把专家像个铁板一样切开了分,逐层复制更像是给拥堵车道临时加开匝道——哪里堵了疏哪里,不堵的路一分一毫资源都不浪费。这也就解释了为什么它能做到训练和推理场景通吃。

训练94.6%理想线、推理反超SGLang,这组数据太硬了

训练场:把Megatron-LM甩开42个点

在小红书内部的实际生产环境中,UltraEP被部署到千亿级的Qwen3-235B上做训练压力测试。理论上的“理想性能”,指的是所有专家负载完全一致、没有一丝空等的完美吞吐量。以往能跑到六七成就烧高香了。UltraEP上阵后,平均训练吞吐达到理想性能的94.6%,几乎把GPU利用率榨干。对比上一代广泛使用的Megatron-LM,训练吞吐提升了42%——这不是实验室小batch跑出来的噱头,是大规模分布式训练跑出来的生产数字。

推理场:prefill吞吐比SGLang高出1.56倍

推理侧,UltraEP的重点放在prefill阶段,这一阶段请求密集、计算量大,恰好是负载不均的重灾区。SGLang作为推理加速的优秀方案,一直被当作基线。而UltraEP用同样的动态复制策略,直接在prefill吞吐上跑出1.56倍的领先。这意味着同样的硬件,同样的模型,响应延迟更低,并发处理能力更强。对于需要快速打出首token的场景,这1.56倍几乎等于凭空多出一堆GPU。

开源的不只是代码,是整套可嫁接到你业务的调度思路

论文和仓库就摆在那里,别找借口了

小红书和北大这次不仅发了论文,还把代码彻底开源了。仓库里不仅有实现细节,还有对接主流框架的适配层。做大规模分布式训练的团队,完全可以拿着这套东西去替换现有调度逻辑。它不绑定特定的并行策略,也不要求你重写模型代码,本质上是给当前训练框架加了一套“实时交通指挥系统”。这种低侵入式的工程方案,对已经跑着生产业务的团队来说简直是救命稻草。

UltraEP背后是一种新范式:数据驱动的即时调度

比代码更值钱的是思路。UltraEP证明了一件事:实时、细粒度的调度决策,完全可以用已有的路由信号做出最优解。这种即时数据驱动的调度范式,不只能在MoE专家负载上开花,未来放到流水线并行、数据并行、甚至跨集群的任务分发上,都有极强的想象空间。那些还在通过调参勉强调和负载的团队,该重新审视一下底层调度逻辑了。UltraEP把一条更直接的路画了出来,剩下的就看谁先动手。

AI智能体
企业级AI智能体开发与部署方案
LumeValley打造企业级AI智能体全流程方案,涵盖需求洞察、定制开发、多平台适配部署。凭借专业算法与丰富经验,确保智能体精准理解业务,高效执行任务,无缝融入企业生态,为企业数字化转型提供强劲智能引擎,提升核心竞争力。
点赞 | 3

Lumevalley——全栈AI服务领航者,以“战略-应用-算力”三位一体服务框架,为企业提供从顶层战略规划、场景化AI智能体(AI Agent)开发/搭建/部署,到企业级AI应用开发、AI+行业场景解决方案的全链路服务,并配套AI大模型部署与高性能AI算力底座支撑,助力客户在营销、服务、运营等核心环节实现效率倍增与模式创新。

马上扫码获取产品资料
相关文章

相关文章

填写以下信息, 免费获取方案报价
姓名
手机号码
企业名称
  • 建筑建材
  • 化工
  • 钢铁
  • 机械设备
  • 原材料
  • 工业
  • 环保
  • 生鲜
  • 医疗
  • 快消品
  • 农林牧渔
  • 汽车汽配
  • 橡胶
  • 工程
  • 加工
  • 仪器仪表
  • 纺织
  • 服装
  • 电子元器件
  • 物流
  • 化塑
  • 食品
  • 房地产
  • 交通运输
  • 能源
  • 印刷
  • 教育
  • 跨境电商
  • 旅游
  • 皮革
  • 3C数码
  • 金属制品
  • 批发
  • 研究和发展
  • 其他行业
需求描述
填写以下信息马上为您安排系统演示
姓名
手机号码
你的职位
企业名称

恭喜您的需求提交成功

尊敬的用户,您好!

您的需求我们已经收到,我们会为您安排专属电商商务顾问在24小时内(工作日时间)内与您取得联系,请您在此期间保持电话畅通,并且注意接听来自广州区域的来电。
感谢您的支持!

您好,我是您的专属产品顾问
扫码添加我的微信,免费体验系统
(工作日09:00 - 18:00)
电话咨询 (工作日09:00 - 18:00)
客服热线: 18011747352
售前热线: 189 2432 2993
扫码即可快速拨打热线