
AI 模型评测平台 Arena 周四宣布完成 2 亿美元 B 轮融资,投后估值达 31 亿美元。本轮融资由 Lightspeed Venture Partners 和 Khosla Ventures 领投,Salesforce Ventures、01 Advisors、Dell Technologies Capital、Endeavor Catalyst、a16z 及 Felicis 等机构跟投。
这是 Arena 在短短 10 个月内实现的估值近翻倍增长。今年 1 月,该公司完成 1.5 亿美元 A 轮融资时,投后估值为 17 亿美元,年化收入 3000 万美元。到了今年 6 月,Arena 透露其年化收入已突破 1 亿美元大关。
从学术项目到商业闭环
Arena 起源于 2023 年加州大学伯克利分校的一项研究项目,旨在通过众包方式对 AI 模型进行排名。目前,该平台面向消费者提供免费服务,用户输入提示词或生成请求后,对不同模型的表现进行打分。Arena 声称,其每月拥有数千万访问者。
去年 9 月,Arena 推出商业产品“AI 评估”(AI Evaluations),基于社区反馈为模型实验室和企业提供详细的性能分析。这一举措切中了当前行业痛点:随着 AI 模型学会“操纵”静态基准测试以刷高分,传统评估方式逐渐失效。企业亟需中立第三方来衡量模型在实际应用场景中的安全性与适配度,而非仅依赖标准化榜单。
融资公告指出:“AI 的发展速度已超过我们的评估能力,一旦模型意识到正在接受测试,静态基准就会失效。世界需要一个中立的第三方来衡量 AI 在真实用户手中的安全性和对齐程度,Arena 正承担起这一角色。”
新增“对齐性”排行榜
为此,Arena 在排行榜中新增了“对齐性”(alignment)类别,重点考察模型是否存在未经授权的操作、错误归因以及“欺骗性完成”(即谎称完成了未执行的任务)等问题。
在初步的对齐性排行榜中,OpenAI 的一系列模型表现优异,位居前列;Claude Opus 5.5 和 Claude Fable 则分别排名第六和第九。