
2026年10月1日,AI研究所(Allen Institute for AI,简称Ai2)正式发布OlmoCore 3。这是一款经过重新设计的开源训练框架,旨在让研究人员无需依赖专有工业级技术栈,即可构建和训练混合专家(MoE)语言模型。该框架首次提供了针对总参数量超过一万亿模型的完整基准测试文档,其规模此前仅少数闭源实验室能够触及。
架构重构:从FSDP转向DDP
OlmoCore 3的核心工程变革在于将并行策略从全分片数据并行(FSDP)切换为分布式数据并行(DDP)。在传统FSDP模式下,每个训练批次需收集并重新分片整个专家池,随着专家规模扩大,通信成本急剧上升。OlmoCore 3采用新策略,将专家固定驻留在GPU上,仅路由数据至相应专家,从而大幅消除通信开销。
基准测试显示,在8块NVIDIA B300 GPU上训练470亿参数的MoE模型时,新架构下的吞吐量达到每GPU每秒约52,000个token,较此前实现的约19,400个token提升了约2.7倍。即便将专家池从8个扩展至128个(总参数容量从46亿增至470亿),同时保持活跃参数固定在约32亿,训练吞吐量下降幅度仍控制在5%以内,实现了跨越10倍扩展的近平坦性能曲线。
万亿参数基准与硬件极限
Ai2在远超以往OlmO模型规模的配置下对OlmoCore 3进行了压力测试。在512块B300 GPU集群上,拥有1.2万亿总参数(约583.6亿活跃参数)的配置实现了每GPU 858 TFLOPS的峰值吞吐量。另一项使用DeepEP v2通信层的测试则触及了约2.38万亿总参数的配置。
值得注意的是,这些基准测试均基于随机路由而非真实token分布,旨在衡量系统吞吐量上限,而非证明Ai2已完成万亿参数模型的训练或验证其最终表现。技术报告《为高效可扩展的MoE训练加速Olmo-core》明确将这些数据标记为系统参考值。此外,在7B规模模型测试中,该框架在43%的模型FLOP利用率下,每GPU每秒可处理约7,700个token。
技术细节:路由优化与精度压缩
OlmoCore 3通过三种并行策略分布大型MoE模型:专家并行性将不同专家子集分配至不同GPU;流水线并行性分割模型层以降低单卡内存需求;分布式优化器则对梯度元数据进行分片。在此基础上,三项路由优化进一步降低成本:利用NVSHMEM实现的行级专家并行性使通信完全同步自由;GPU驻留路由让元数据保留在显卡内,避免CPU等待;分组GEMM则将小型专家计算批量执行,提升GPU效率。
框架还支持MXFP8低精度格式。在四块B300 GPU的受控测试中,启用MXFP8相比BF16基线,吞吐量提升约21%,峰值活跃内存从约103 GiB降至95 GiB。其检查点格式独立于并行布局记录全局FP32张量,支持在不同集群拓扑间暂停和恢复训练而不丢失数据。
揭示“Token杰利蝾螈”故障模式
OlmoCore 3发布中最具价值的洞察之一是Ai2发现的“Token杰利蝾螈”(Token Gerrymandering)现象。这是一种隐蔽的故障模式:旨在平衡专家负载的辅助损失指标可能显示改善,但实际的工作分布却变得更加不平衡。在昂贵的大规模训练中,这种“指标向好但行为退化”的现象极具误导性。
技术报告还记录了其他反直觉发现:降低单个专家的学习率并未改善OlmO系列模型的结果;在单独GPU流上重叠通信和计算有时反而拖慢端到端训练;以及GPU计算时间随输入值变化而非仅取决于矩阵维度。Ai2选择公开这些通常在闭源实验室内部消化的负面案例,旨在帮助学术团队审计自身训练管道,识别潜在故障。
与Megatron-Core的定位差异
NVIDIA的Megatron-Core是业界标准的通用MoE训练框架,适用于多供应商环境及数千块GPU集群,在GB300硬件上可实现每GPU超1,200 TFLOPS的吞吐量。相比之下,OlmoCore 3在B300上的858 TFLOPS虽略低,但两者处于同一性能层级。
两者的核心区别在于生态集成。Megatron-Core提供通用灵活性,而OlmoCore 3专为OlmO模型系列量身定制,随附官方预训练脚本(涵盖OlmO 3 7B和32B的中期训练及长上下文扩展)、真实训练日志、检查点转换工具及原生聊天界面。对于希望复现或扩展Ai2研究成果的开发者和研究者而言,OlmoCore 3提供了开箱即用的完整起点。
开放基础设施的战略意义
作为由保罗·艾伦创立的非营利机构,Ai2致力于推动AI透明度。继开放OlmO和Molmo模型的权重、训练数据及评估管道后,OlmoCore 3进一步敞开了底层训练基础设施。2025年8月,Ai2曾获美国国家科学基金会(NSF)和英伟达共同出资1.52亿美元,用于构建完全开放的多模态AI模型。
Ai2认为,只有当背后的分布式系统设计和工程决策同样开放时,模型权重才更具价值。下一代OlmO模型将基于此框架,在Ai2迄今最大的数据集上训练,并支持更长的上下文窗口。OlmoCore 3已通过PyPI以ai2-olmo-core包名发布,采用Apache 2.0许可证,代码托管于GitHub。