蚂蚁百灵这轮更新有点疯狂。不是那种加了十倍预算砸出来的面子工程,而是一个总参数量124B、激活参数仅5.1B的模型,在推理、指令遵循和长文本任务上直接对标——有些地方甚至超过了——上一代旗舰Ring-2.6-1T。5.1B对1T,差了将近两个数量级,结果跑分不降反升。这件事本身就在挑战行业里那条默认规则:大就是好。
5.1B 凭什么叫板 1T
参数量的障眼法
先拆一个最容易误读的点。124B 是总参数量,5.1B 是激活参数量。什么意思?跑一次推理,真正被唤醒参与计算的只有 5.1B 个参数,剩下的全在“休眠”。这和传统的稠密模型完全不同——稠密模型每一次预测都要把所有参数跑一遍,121B 就得全量激活 121B。Ling-3.0-flash 用了一种极度稀疏的混合专家架构,1/64 稀疏 MoE,也就是说每一层有 64 个专家,但只选其中 1 个干活。推理成本直接打下来,速度上去了,但模型的“知识储备”却仍然保留在 124B 的容量里。这事不新鲜,新鲜的是它把稀疏程度推到了这么极端的比例,还能在性能上对齐稠密的 1T 模型。这意味着过去几年行业在 MoE 上的调参经验终于到了可以规模化兑现的阶段。
对标 Ring-2.6-1T,到底是哪些指标说了算
官方给出的信息很直接:传统推理、指令遵循、长文本。这三个维度恰好是第一代大模型落地时掉坑最多的地方。推理能力不够,Agent 连工具都调不明白;指令遵循差,流程一复杂就乱跳;长文本一跑偏,RAG 和多轮对话场景直接没法用。Ling-3.0-flash 在这三项上对齐甚至超越 Ring-2.6-1T,说明蚂蚁在 RLHF 后期的数据工程和偏好对齐上做了大量工作。更关键的是,这不是一个堆显卡堆出来的“平替”,而是用 5.1B 激活参数跑出来的效果。Agent 场景对延迟极度敏感,以前只能靠缩小模型牺牲性能来换速度,现在多了一种开口——小激活量、高吞吐、不降智商。
原生混合线性注意力,这名字值得多看两眼
为什么是“原生”,不是“改造”
行业里大部分混合注意力方案是在标准 Transformer 上打补丁:前几层用线性注意力,后面还是保留原始的自注意力,或者在特定层上做局部-全局切换。这种改法见效快,但训练不稳定,推理引擎适配成本高。Ling-3.0-flash 的“原生”意味着整个架构从设计之初就用线性注意力作为一等公民,而不是折中方案。原生混合线性注意力带来的直接好处是长输入下首 token 延迟大幅下降——官方透露 TTFT(Time To First Token)降低 60% 到 80% 以上。对实时对话、超长文档处理、代码库级任务而言,这个优化不是痒点,是命门。
Attention 的结构改造怎么影响 Agent 体验
Agent 推理有一个大家不怎么谈但很要命的问题:每次工具调用返回结果,上下文窗口都会膨胀。传统自注意力的计算复杂度随序列长度二次增长,上下文一长,响应就开始变慢,用户体感上就是“卡了”。混合线性注意力把长序列的计算复杂度压到近似线性,意味着模型在处理复杂 Agent 任务——反复调用 API、在多轮思考中来回检索信息——时,速度衰减不会那么剧烈。这才是它能做到 TTFT 降 60%-80% 背后真正的工程价值。不是跑分好看,是真实交互场景里不用再盯着光标转圈。
一万个训练环境到底练出了什么
10,000+ 可交互环境的强化学习意味着什么
大模型训练分两个阶段。预训练决定知识面,RL/post-training 决定行为模式。Ling-3.0-flash 这次在强化学习阶段扩展到了 10,000 个以上可交互训练环境,这个数字放在整个行业里都是惊人的。绝大多数团队在 RL 阶段的环境数量是两位数或者刚过百,因为维护环境、设计奖励函数、避免奖励 hacking 每多一个环境都是指数级增加的工作量。一万个环境不只是规模问题,它代表环境多样性达到了一个临界点——模型在训练中见过足够多的交互模式、工具形态和反馈方式,部署到真实场景时就不太会出现“没见过的工具就呆住”这种低级错误。
从跑分到 Agent,中间缺的那块拼图
过去一年 Agent 赛道特别火,但上线之后普遍反馈“不稳定”。核心原因就在 RL 阶段环境覆盖不足。训练环境少的模型,遇到稍微不同格式的 API 响应就会做出奇怪动作。一万个环境意味着模型在工厂里已经练过成千上万种交互变体,上手的泛化能力自然更强。蚂蚁这次把环境数量作为一个亮点单独拿出来讲,说明他们自己很清楚:Agent 时代,RL 阶段的环境工程与架构创新同等重要。再好的模型结构,如果没见过足够丰富的交互场景,面对复杂任务也是一张白纸。
开源加免费 API,这套打法在打什么算盘
124B 总参、5.1B 激活的开源诚意
蚂蚁这次的做法很干脆:开源,加免费 API。124B 的总参数意味着知识密度足够高;5.1B 的激活参数意味着部署门槛足够低。对中小团队来说,拉一个 124B 的稠密模型做本地推理,别说显存不够,连硬盘都吃力。但一个激活量只有 5.1B 的 MoE 模型,剩下的参数不打 tensors 就不占显存,服务器成本直接降一个量级。再配上免费 API,蚂蚁显然不是在做技术 demo,而是在铺生态。这种策略逻辑和当年的 Android 开源一模一样:核心能力我开放,生态养成之后商业化路径自然打开。
低成本跑强 Agent,这个决策窗口有多长
想要跑强 Agent 的团队现在面临一个难得的窗口期。一方面,5.1B 激活参数的推理成本已经低到可以让 Agent 做密集的工具调用而不心疼预算;另一方面,开源意味着可以进行私域微调,把模型吃透自己的业务数据。蚂蚁抢先一步把 Ling-3.0-flash 推到开源和免费两条线上,本质是在用工程效率换生态加速度。但窗口不会永远开着——上游架构创新的红利正在快速向应用层释放,谁先在这个窗口期里跑通 Agent 的闭环,谁就有机会定义下一阶段的交互标准。犹豫的成本比试错的成本高得多。

