
Gimlet Labs 与 Cerebras Systems(纳斯达克代码:CBRS)今日宣布达成战略合作,共同推出 Gimlet Cloud,旨在大规模交付新一代超高速 AI 推理服务。该方案将 Cerebras 的晶圆级计算能力与 Gimlet 的推理云平台深度整合,构建起专为推理优化的分布式云服务,提供从数据中心基础设施到开发者 API 的全栈支持。
双方计划为对延迟敏感的智能体(Agentic)及实时应用提供高达每秒 3,000 个 Token 的处理速度。首个由 Cerebras 驱动的数据中心预计将于今年晚些时候正式上线。
重构实时 AI 体验
在 AI 应用领域,推理速度直接决定用户体验与应用形态。对于语音、视频交互及智能助手等实时场景,低延迟是确保交互流畅自然的关键。更快的 Token 生成速度不仅能提升用户参与度与停留时长,更能支撑高价值工作负载的运行,从而释放更大的商业价值。
Gimlet Cloud 通过创新架构,将 Cerebras Wafer Scale Engine(晶圆级引擎)与 GPU 集群结合,形成一体化推理解决方案。系统采用先进的推理分离技术编排模型执行过程,确保推理的每个阶段均在最适宜的硬件上运行,从而为生产规模的智能体和实时工作负载确立全新的快速推理标准。
Gimlet Labs 联合创始人兼 CEO Zain Asgar 表示:“推理速度决定了 AI 的生产力上限。通过结合 Gimlet 的多硅片软件与 Cerebras 晶圆级引擎,我们能在最优硬件上运行推理各阶段,并计划在生产规模下实现每秒 3,000 个 Token 的速度,以此创造卓越体验并开拓新市场。”
Cerebras 联合创始人兼 CTO Sean Lie 指出,将 Cerebras 的极速 Token 生成能力与 GPU 的高吞吐量相结合,可实现最佳的数据中心经济效益。作为 CS-4 的启动合作伙伴,Gimlet 将为开发者提供直通行业领先速度的路径,让更多用户在生产规模下享受高性能 AI 能力。
此次合作基于双方自去年以来开展的联合客户互动,目前已有集成解决方案在私有部署环境中提供 Token 服务。未来,Gimlet Labs 将与 Cerebras 进一步深化在软件、基础设施设计、API、开发者工具及生产运营等领域的整合,通过 Gimlet Cloud 推动超高速推理服务的广泛普及。