企业人工智能软件公司Iterate Studio Inc.今日正式推出Lifeboat,这是一款内置机密计算功能的大语言模型(LLM)推理引擎。

Iterate.ai表示,Lifeboat在每个图形处理器(GPU)上可同时运行的AI代理会话数量是传统方案的两到六倍,旨在解决大规模部署中代理产生的内存瓶颈问题。

突破内存瓶颈,提升并发效率

与传统聊天机器人单次触发模型调用不同,执行单一任务的AI代理可能发出数十次调用,导致上下文窗口迅速扩大,进而填满键值缓存(key-value cache)。Iterate.ai指出,标准推理引擎在处理四五个长上下文请求时便可能陷入停滞,迫使团队购买更多GPU或将数据转移至第三方云服务。

针对银行、保险和医疗系统等希望在内部环境运行自有数据且不愿大幅增加GPU支出的客户,Lifeboat通过公平调度与准入控制,为每个会话分配相应的GPU资源,防止重型代理挤占交互式代理资源。此外,通过对键值缓存的优化,其有效容量实现翻倍,同时保持模型权重全精度。

在混合专家(MoE)模型上,Lifeboat仅加载特定代理所需的专家模块。每个会话均在独立的安全胶囊中运行,具备过滤、Token预算限制和沙箱化执行功能。

性能测试:并发能力显著优于基线

Iterate.ai的自身测试显示,在单块Nvidia RTX PRO 6000 Blackwell GPU上运行Qwen 30B-A3B模型时,Lifeboat成功维持2,048个并发会话且所有请求均完成。相比之下,关闭优化功能的同一引擎最高仅能达到该数字的一半。

在吞吐量方面,开启优化后每秒处理的Token数从4,965提升至8,714。在内存压力测试中,面对128个会话发送18,000个Token的请求,Lifeboat将首个Token的首次生成时间(TTFT)第99百分位数保持在1.5秒,而基线方案则高达189秒。

Iterate.ai联合创始人兼首席执行官Jon Nordmark表示:“在企业为其代理购买更多GPU之前,应先了解现有设备的能力。若能将每张卡的并发会话数翻倍,服务商即可在不增加机柜或电力的情况下收回这部分算力容量。”

分级定价与机密计算支持

Lifeboat的高级版“机密计算版”支持硬件证明(hardware attestation),在通过检查前拒绝任何请求。该功能涵盖AMD和Intel处理器中的可信执行技术,以及Nvidia H100、B200、GB300等GPU的机密计算模式。模型权重在可信执行环境内密封,并在运行时保持加密状态。

目前,Lifeboat已全面开放,早期访问版本在几天内吸引了数千次下载。免费的开发者许可证适用于单个节点上最多两个推理服务器的非商业及评估用途。需要专业支持的客户可升级至标准许可证,月费为49.99美元;具备证明功能的高级版月费为499.99美元。两种付费版本均提供七天免费试用,无需信用卡。