Vercel开发者近期发现,在命令安全分类任务中,用新模型替换原有大型语言模型(LLM)后,运行速度提升了5至18倍,准确率亦同步提高。这一替代品并非另一个通用大模型,而是Jev——由TypeSafe AI开发、专用于选项选择、评分分配及概率估算的系统。

这一转变折射出AI软件开发领域的思维变迁:从默认调用前沿模型处理所有任务,转向追求更高效、精准的专用工具。多数代码场景无需生成华丽文本,仅需明确的二元判断、排序选择或可执行的置信度评分。

Jev迅速引爆硅谷

Jev由前OpenAI研究员Diogo Almeida创立。Almeida曾是InstructGPT论文合著者,于2024年离职创业。经过两年秘密研发,Jev于9月15日正式发布。该模型接收状态描述和类型化问题,直接返回无文本的结构化答案。

Jev定义了三种输出类型:“选择”(从列表中选优并提供概率)、“评分”(基于自定义标准打分)以及“noul”(估算陈述为真的伯努利概率)。所有输出均附带校准后的置信度值,开发者可设定阈值,将低置信度请求路由至人工或更昂贵的模型。

速度与成本优势是其走红的核心驱动力。Jev每百万输入令牌收费0.042美元,输出免费,延迟通常在70至500毫秒之间。TypeSafe AI称,在决策任务上,其性能比前沿模型快20至200倍,成本降低40至400倍。早期用户反馈印证了这一说法:Bryo AI将其用于商业邮件分类,虽Gemini原始准确率略高,但成本高出10至20倍;Vercel工程师Pranit Sharma替换OpenAI Luna模型后,实现了更快响应与更高准确率。

市场采用数据同样亮眼:发布24小时内,Vercel付费AI Gateway团队中13%的用户启用了Jev,此比例为此前任何模型的两倍。Cloudflare、LangChain和Langfuse在数天内完成集成,OpenRouter首周末令牌交易量翻三倍。

OpenAI入局,竞赛开启

OpenAI迅速做出回应。在DevDay大会上,CEO Sam Altman发布了Decisions API,其核心理念与Jev高度相似。该API基于GPT-6 Luna模型,允许开发者提供问题和有限答案集,响应时间约150毫秒,比标准Luna调用快10倍,且支持图像输入,弥补了Jev仅支持文本的短板。

基准测试显示,两者在数百个分类任务中的准确率几乎持平。在某些设置下,OpenAI版本速度稍快,而Jev成本更低且在概率校准方面表现更佳。独立开发者的对比测试表明,两者各具优势,取决于具体应用场景。

这场竞争揭示了深层行业趋势:随着智能体(Agent)系统承诺自主处理复杂工作流,无数微小的微观决策(如路由工单、工具调用判断)若全部调用完整大模型,将导致成本和延迟急剧膨胀。插入专用的决策层,让昂贵模型专注于复杂推理,廉价快速模型处理常规事务,正成为新的经济模型。

资本追捧与挑战并存

TypeSafe AI已完成由DCVC领投的4000万美元种子轮融资,估值讨论迅速攀升至九位数。Almeida认为,通过大规模可靠决策而非更大的聊天机器人,是从AI中获得经济影响的最短路径。

然而,挑战依然存在。Jev目前仅支持文本,上下文窗口上限为64,000令牌,且无法生成解释性内容。在高利害领域,概率校准仍需严格验证;多模态支持的缺失也使其在涉及截图或文档的场景中落后于OpenAI。此外,开源项目及其他初创公司正竞相进入这一领域,有的声称响应时间中位数低至67毫秒。

尽管存在局限,势头已不可逆转。企业团队在测试智能体原型时发现,叠加Jev或Decisions能大幅削减每月惊人的推理账单。下一代生产级智能体架构很可能隐藏多个模型:前端由决策引擎处理简单判断,必要时调用轻量模型生成,最后由前沿系统进行最终裁决。软件不再需要无休止的对话,而是需要即时、可信的答案。