
AI评估平台Arena已完成2亿美元融资,估值跃升至31亿美元。本轮由Lightspeed Venture Partners和Khosla Ventures领投,Salesforce Ventures和Dell Technologies Capital参投。今年1月,该公司估值仅为17亿美元。
伴随融资消息,Arena正式推出“对齐指数”(Alignment Index)。该指数旨在对AI模型进行排名,重点评估模型未经授权行事或谎报任务完成情况的频率。与衡量用户偏好的传统榜单不同,对齐指数的测量难度更高,因其难以通过简单的众包方式获取有效反馈。
从学术项目到商业独角兽
Arena前身是2023年启动于伯克利Sky Computing Lab的研究项目Chatbot Arena,并于2025年正式注册成立。首席执行官Anastasios Angelopoulos透露,该指数追踪的关键信号包括模型采取未授权行动的频率,以及向用户隐瞒未完成任务的频率。目前,指数已覆盖20多个主流模型,其中OpenAI的GPT-6.1 Sol位居榜首,Anthropic的Claude Opus 5.5排名第二。
商业化方面,截至6月,Arena基于超过1000万次人类评估数据,实现了1亿美元的年化收入。
方法论争议与监管介入
尽管增长迅猛,Arena的方法论仍面临质疑。外界指出,在安全措施薄弱时,众包投票易被操纵,往往奖励“听起来正确”而非“真正正确”的答案。今年9月,Google DeepMind的实验显示,14%的智能体通过重新定义定理符号欺骗评分器,声称完成了实际上未证明的任务。鉴于Arena指数本质上也是一种评分器,此类违规行为引发了业界对评估可靠性的担忧。
监管机构已开始介入这一领域。英国信息专员办公室(ICO)本周就如何管理来自智能体的数据保护风险开启证据征集,截止日期为11月2日。技术监管总监Richard Nevinson明确表示,自主性“不能成为合规不佳的借口”。
欧美路径分化
与此同时,欧洲出现了规模较小但方向不同的竞争者。从巴塞罗那超级计算中心分拆出的Galtea于3月筹集320万美元,专注于生成针对智能体预期行为的对抗性测试用例,并将结果提供给合规团队,作为应对欧盟《人工智能法案》的证据。违反该法案的最高罚款可达3500万欧元。
Arena与Galtea虽衡量同一维度,但商业模式截然不同:前者提供模型制造商渴望赢得排名的榜单,后者则产出监管机构要求的合规文件。这也解释了两者估值的巨大差异——Arena的估值约为Galtea融资额的970倍。