由初创公司 TypeSafe AI 于 9 月发布的 AI 模型 Jev,凭借专为快速决策打造的特性,迅速在硅谷开发者圈层中走红。该模型能以远低于主流模型的成本执行各类分类任务,如客户归类、文档分拣、邮件排序及错误检测等。

市场反响热烈。上线 Vercel AI 网关不足 24 小时,近 13% 的付费团队即开始试用 Jev。Vercel 数据显示,Jev 首日的触达团队数量是此前任何模型发布时的两倍以上。这一势头甚至直接刺激了行业巨头:10 月 6 日,即 Jev 发布仅三周后,OpenAI 紧急推出了竞争性产品“Decisions API”。

填补自动化决策的市场空白

当前,企业亟需将数千项常规判断自动化。在此规模下,成本、速度和错误率的微小差异决定了自动化的可行性。TypeSafe 针对此类场景专门训练了 Jev,而 OpenAI 的 Decisions API 则基于其 GPT-6 Luna 模型构建。

TypeSafe CEO Diogo Almeida 曾在 OpenAI 参与 ChatGPT 研发。他洞察到通用大模型在回答人类问题与自动化常规工作之间存在效率落差,旨在解决 AI“过度承诺、交付不足”的痛点。Almeida 逆向推导认为,未来绝大多数模型请求将来自自动运行的代码而非人类。例如,客服系统可利用模型判断 incoming 消息属于账单或技术问题,并依据置信度阈值自动路由或转人工。

传统机器学习分类器虽成本低但缺乏灵活性且理解力有限;大型语言模型(LLM)虽理解力强、指令灵活,但计算成本高、延迟大,难以应对高频请求。Jev 试图兼顾二者优势:既保留通过自然语言指令设置分类器的灵活性,又比通用 LLM 更快、更便宜。它通过一次性生成选项、分数或概率,避免了逐个生成答案的时间消耗。

Almeida 原计划一周内完成模型可靠性验证,实际却耗时两年。他坦言:“让模型变得可靠比预期困难得多。”

开发者生态与“杰文斯悖论”

Jev 被 TypeSafe 称为“System One”模型,借用心理学家丹尼尔·卡尼曼关于快速直觉判断的概念。独立开发者 Niels Mouthaan 在其时间追踪应用 Daily 中测试发现,Jev 的速度能满足用户对“接近实时”输入反馈的期待。Atlensa 创始人 Ashutosh Mathore 则表示,Jev 的高效让他重新审视那些本无需动用重型 LLM 的任务。

Jev 之名源于经济学家威廉·斯坦利·杰文斯。杰文斯曾提出,更高效的蒸汽引擎反而会增加煤炭总消耗,因为成本降低激发了新需求。映射至 AI 领域,这意味着成本的下降将使更多任务值得被自动化。

记账软件公司 Dext 的 AI 负责人 Paolo Rosson 指出,LLM 的问题在于“为完整回答付费,却只需一个标签”。他在项目中用 Jev 处理常规变更筛选,估算成本仅为每 1000 次调用 7 美分。不过,切换至 Jev 存在适应门槛。开发者 Aaron Roy 表示,必须改变提问方式,从模糊指令转为具体约束(如明确关注金钱、医疗等关键词),才能减少遗漏。

OpenAI 的快速跟进与竞争格局

Almeida 透露,其在 OpenAI 任职期间曾向 CEO Sam Altman 展示过优化软件协同模型的构想,Altman 当时便敦促其专注此方向。然而,直到 Jev 引发热潮,OpenAI 才正式入局。OpenAI 高管 Nikunj Handa 承认,Jev“激发了这一切”,四周前 Decisions API 甚至不在开发路线图上。

OpenAI 的首版 Decisions API 未经额外训练,直接限制 GPT-6 Luna 返回结构化答案,并针对多问题处理和首字延迟进行调优。官方称,其专用接口速度比通用 Responses API 快多达十倍,支持图像输入(Jev 目前仅支持文本)。价格方面,OpenAI 输入价为每百万 token 0.10 美元,Jev 为 0.042 美元,两者均不收取输出 token 费用。

尽管 OpenAI 拥有资金和用户基数优势,且便于现有用户在同一生态内实现“快速分类+复杂推理”的组合调用,但 TypeSafe 仍具竞争力。领投 TypeSafe 4000 万美元种子轮的 DCVC 合伙人 James Hardiman 指出,TypeSafe 两年的可靠性打磨构成了隐形壁垒,基准测试难以捕捉,但在实际生产中,Jev 的表现有望优于快速跟进的克隆产品。

TypeSafe 声称开发了新的模型架构与训练方法,确保 Jev 的概率估算能真实反映其判断准确率。虽然长期竞争格局尚不明朗,但 Almeida 关于“更高效分类系统”的直觉已被验证。他率先掀起的这股浪潮,正迫使 OpenAI 及整个行业奋力追赶。