Mistral AI 今日正式开放其迄今最强大的大语言模型 Mistral Large 4 的访问权限。该模型目前通过公司云平台提供公开预览,Mistral 计划于本月下旬正式发布模型权重。

万亿参数 MoE 架构,支持 160 余种语言

Mistral Large 4 采用拥有 1 万亿参数的混合专家(MoE)架构。在推理过程中,模型每次仅激活 490 亿个参数,相比全量激活,这种机制显著提升了硬件效率。官方表示,该模型能够处理超过 160 种语言的交互请求。

在衡量大模型发现及修复软件漏洞能力的 AA Cyber Index 基准测试中,Mistral Large 4 跻身前五。其在修补开源项目方面表现尤为突出,该项得分达到 82%,领先于其他开源竞争对手。

计算机视觉是另一大亮点。在评估图像物体识别能力的 Dense200 基准测试中,Mistral Large 4 的表现比 GPT-6 Astra 高出 1%。

尽管在行业主流代码基准测试中,Mistral Large 4 的表现不及 Astra 等前沿闭源模型,但其成绩优于 Qwen3.8 Max 和 DeepSeek V4 Pro 等多个主流开源模型。此外,在 AutomationBench 和 AA-Briefcase 知识工作基准测试中,Mistral Large 4 的得分也高于上述开源竞品。前者涵盖相对简单的任务,后者则涉及需人类耗时数周完成的复杂工作。

3800 块 Grace Blackwell 芯片驱动,日均产生 330 亿 Token

Mistral 使用 3,800 块 Grace Blackwell 芯片完成了 Mistral Large 4 的训练。每个加速单元由两块英伟达 Blackwell GPU 和一个 CPU 组成。虽然公司未披露具体训练时长,但分享了技术细节。

该模型采用试错法训练,即在无人类指导的情况下自主尝试完成任务,每次执行称为一次“rollout”。Mistral 工程师开发了一套专用软件堆栈,能够从包含代码沙盒、搜索引擎及测试工具的 AI 模块库中组装 rollout,并实现数万次并行运行。

该系统每日产生 330 亿个 token 的 rollout 数据。Mistral 利用其中不到一半的数据驱动训练工作流程以优化模型。由于 rollout 生成与训练流程异步进行,两者互不阻塞,从而大幅提升了处理速度。

值得注意的是,Mistral 并未在当前版本完成后暂停训练。公司预计,该工作流程将在未来几个月内产出规模更大、能力更强的 LLM 版本。长远来看,Mistral 将基于 Mistral Large 4 构建一系列针对特定用例优化的模型矩阵。