
Holo4智能体(Agentic)模型系列正式发布,包含27B稠密模型和35B-A3B混合专家(MoE)模型两种规格,目前均已上线H Models API。同步推出的还有Holotron 3的升级版——Holotron4 Nano。
全接口交互,统一模型架构
Holo4旨在服务于真实商业工作流,而非仅追求学术基准高分。该模型在大量环境中经过监督学习和强化学习训练,能够通过图形用户界面(GUI)、代码、MCP及API等多种接口与软件交互。不同于多数仅针对单一接口训练的智能体模型,Holo4可根据任务需求自动选择最佳交互方式,避免在无屏幕或无API场景下的功能失效。
该模型适用于桌面端、网页、Android设备、代码沙箱及业务API对接环境。在所有场景中,均使用同一模型且调用方式一致,无需针对不同平台切换模型。
高性能与低成本并存
相较于基座模型Qwen,Holo4性能显著提升。在长工作流任务中,其表现仅次于最强闭源模型。在OSWorld 2.0基准测试中,Holo4 27B得分为61.7%(Opus 5.5为81.8%),Holo4 35B-A3B得分为30.9%。值得注意的是,Holo4以更少的参数量和更低的成本实现了这一成绩。
在OSWorld 2.0(桌面控制)和AutomationBench(API使用)等高难度基准测试中,Holo4的单次任务成本远低于其他模型,具备与前沿模型竞争的实力。团队已公开公共基准测试的详细轨迹数据,用户可在trajectories.hcompany.ai回放每一步操作,或从Hugging Face下载。
实战案例:复杂任务处理能力
基于“智能体任务工厂”生成的环境与任务,Holo4在专业软件应用中表现出色。以下为Holo4 27B与基座模型Qwen3.8 27B在相同提示词和测试框架下的对比:
- 3D建模(埃菲尔铁塔):Holo4 27B耗时84次调用、130万token;Qwen3.8 27B耗时60次调用、100万token。
- 3D建模(公司Logo):Holo4 27B耗时94次调用、150万token;Qwen3.8 27B耗时118次调用、190万token。
- 游戏设计(吃豆人):Holo4 27B耗时68次调用、240万token,生成268行代码;Qwen3.8 27B耗时197次调用、1140万token,生成327行代码。
技术底层与研发历程
智能体任务工厂:内部管道系统可仅凭文档(如网站截图或开源软件文档)构建交互式环境和可验证任务。目前已生成约10,000个任务,涵盖Web应用、MCP服务器和桌面环境。
训练与测试框架重构:团队重构了测试框架,利用OSWorld 2.0的性能反馈优化模型。主要改进包括赋予智能体可靠的长期记忆能力,使其能追踪数百个步骤,并在桌面机器上提供Shell环境。
Holotron4 Nano:作为NVIDIA Nemotron联盟成员,团队将后训练堆栈应用于Nemotron 3 Nano Omni模型,打造出通用型智能体模型Holotron4 Nano。该模型在GUI工作流及MCP、API、代码沙箱环境中,性能显著优于基座模型,证明了该技术配方在不同规模模型上的迁移性。
获取与部署
Holo4两种规格模型及Holotron4 Nano现已在H Models API上线。权重文件已上传至Hugging Face,支持BF16、FP8、NVFP4和4-bit GGUF格式。未来几天内,团队还将发布优化的DSpark drafter检查点,以进一步加速推理过程。