Fireworks Research正式推出专用模型Ember-1。该模型基于Kimi K3构建,旨在解决推理模型因冗长思维链导致的高成本问题。测试显示,Ember-1在保持与Kimi K3同等回答质量的前提下,将Token消耗降低了约40%。

为何需要Ember-1?

以Kimi K3为代表的推理模型,其生成的Token中有超过90%用于内部推理而非直接输出。在单次请求中这已成本不菲,而在多轮智能体交互中,随着上下文长度呈二次方增长,早期冗长的推理轨迹会被反复读取和计费,导致成本急剧上升。

Fireworks研究发现,Kimi K3输出的推理内容往往远超任务所需,且大量冗余推理可在不影响最终答案的情况下被剔除。Ember-1的核心价值在于“学会高效思考”:它保留了必要的自我反思和错误恢复能力,同时剔除了低效的思维循环。

技术实现与训练

为实现这一目标,Fireworks团队进行了超过50次训练实验和200多次评估,开发了新的训练算法以缩短推理时间而不损失准确性。所有训练均在Fireworks Serverless Training平台上完成,利用自有数据进行,未使用任何客户数据。

训练涵盖数学、编程、指令遵循、工具使用等多个领域,通过任务反馈指导模型在不同场景中优化推理策略。结果显示,模型在未成功的尝试中能更克制地消耗Token,从而避免漫长且低效的推理过程。

基准测试表现

在专业智能指数(SII)及Doximity的Bedside Bench(涵盖500个临床案例)评估中,Ember-1在每任务成本方面设定了新的帕累托前沿,优于GPT-5.6 Sol、GPT-6 Astra和Claude Opus 5等模型。

在其他行业基准测试中,Ember-1同样表现出极高的性价比:

  • Terminal Bench 2.1:通过率82.0%,高于K3 Max的80.9%,成本降低51.9%。
  • SWE-bench Verified:通过率92.2%,接近K3 Max的93.2%,成本降低15.5%。
  • DeepSWE 1.1:通过率75.2%,显著高于K3 Max的66.4%,成本降低23.7%。

总体而言,Ember-1以极低的成本匹配了K3最大推理力度(K3-max)的质量,并严格优于低推理力度版本(K3-low)。

真实场景验证

在与两家客户的生产编码工作负载进行的实时A/B测试中,Ember-1在保持可比质量(得分从0.751微升至0.753)的同时,每个任务减少了约35%-40%的Token。下游指标如任务完成率和成功率均保持稳定或有所改善。目前,其中一家客户已在生产环境中全面部署Ember-1以替换基础模型。

在Fireworks内部的盲测中,开发人员在使用Ember-1进行日常编码时并未察觉模型切换,但Token消耗大幅下降。这种“无感”部署被视为模型成功的关键信号。

获取与未来计划

Ember-1目前已作为Research Preview版本在Fireworks Serverless平台上线。开发者可获得两周的免费访问权限进行试用。针对有特定需求的企业,Fireworks还提供基于Ember-1的训练支持,允许利用自有数据构建定制化的Token高效模型。

Fireworks表示,Token效率将成为其核心战略方向,未来将继续推出更多专用模型,帮助开发者在保持智能水平的同时显著降低推理成本。