物界前沿 · 资讯情报卡(HuggingFace · 2026/10/1)
Ai2发布Olmo-core 3,支持万亿参数MoE训练
核心事实
- Ai2发布Olmo-core 3,为大型MoE模型重设训练系统。
- 该框架面向万亿参数级MoE训练,并保持计算效率。
- 基准中专家池从8扩至128,每token仍只选4个专家。
- 总参数量从4.6B增至47B,训练吞吐下降不到5%。
- 在8块B300 GPU上,47B MoE吞吐达每GPU每秒5.2万token。
关键数据
8→128专家池规模
约3.2B每token激活参数量
4.6B→47B总参数量
52000 vs 19400 token/s/GPU吞吐对比
物界观察
MoE的瓶颈从来不是参数规模,而是专家路由与显存开销。Olmo-core 3用DDP替代FSDP、把专家常驻GPU,让扩专家池几乎不损吞吐,这比单纯堆参数更有价值。开源训练栈若真能撑住万亿级MoE,中小实验室才有机会入场,否则大模型只会更集中。
物界前沿