传统机器人安全关注故障下的安全性,而物理AI(Physical AI)提出了更严峻的挑战:当攻击者在不改变表面状态的情况下,操纵机器的视觉、决策或行为时,系统能否保持安全?

随着AI与机器人技术的融合,现代机器人依赖多模态传感器感知环境,并通过AI模型将上下文解释转化为物理动作。这种对数据完整性的高度依赖,使得传统安全评估难以捕捉新型风险。研究表明,即便不直接控制系统,仅通过操纵视觉、听觉或解释层,即可诱导机器人产生异常行为。这一攻击面覆盖训练管道、系统基础设施及运行时感知三个层级。

第一层:在源头污染智能

早在2017年,“BadNets”研究便证实,模型在常规情况下表现正常,但在特定隐藏触发器出现时会失效。例如,细微的模式干扰可导致停车标志被误分类为限速标志,且不影响其他输入处理。这种分类漏洞已演变为更复杂的行为操纵。

在NeurIPS 2025会议上,研究人员展示了针对视觉-语言-动作(VLA)模型的后门攻击“BadVLA”。该攻击不在单一标签上做文章,而是在触发器存在时导致机器人动作轨迹出现条件性偏差。即使在没有触发器时模型性能正常,其后门在任务迁移和微调后依然有效。

同年另一项研究“GoBA”显示,咖啡杯等普通物体也可作为可靠触发器。研究人员报告称,在不降低干净输入性能的前提下,攻击成功率高达97%。这暴露了模型验证的盲点:模型虽能通过测试,但在实际遭遇隐藏触发器时可能产生受损行为。利用NVIDIA Isaac Sim等仿真工具结合VicOne Radeis,可在部署前测试此类操纵输入的影响。

第二层:系统漏洞作为AI控制的入口

即便模型本身经过安全训练,若周围系统栈存在漏洞,仍可能被颠覆。2025年9月,研究人员披露了“UniPwn”,这是一套影响某主要制造商四足和人形机器人的蓝牙漏洞利用链。由于硬编码加密密钥允许流量解密,身份验证被绕过,命令注入可实现root级执行。该漏洞具有“蠕虫式”传播特征,一台被攻陷的机器人可扫描并感染附近单元,危及整个车队。

中间件同样构成暴露点。ROS 2和基于DDS的系统中的漏洞,可能允许任意代码执行,或利用未认证主题传递恶意命令。攻击者获得足够权限后,可直接覆盖电机命令或替换AI模型权重,无需直接攻击模型架构。此时,组件虽按设计运行,但系统中流动的命令可信度已遭破坏。有效的漏洞管理和持续监控有助于在部署前识别已知风险,并发现新兴威胁。

第三层:在运行时操纵感知和推理

运行时攻击无需修改固件或入侵网络,仅通过操纵输入即可影响感知或推理。2024年,RoboPAIR演示了精心构建的提示如何引导由大语言模型(LLM)控制的机器人进入不安全轨迹。BadRobot则揭示了更深层的架构弱点:机器人口头拒绝危险命令,但运动控制器仍执行该动作。

基于视觉的操纵同样致命。VLAttack显示,摄像头视野内的对抗性补丁可将VLA模型的任务成功率降至零;FreezeVLA则证明,单张对抗性图像即可冻结机器人的决策循环,使其对后续指令无反应。尽管摄像头、模型和控制器均在运行,但基于被操纵感知的行为可能导致严重安全隐患。因此,运行时保证需超越组件可用性评估,关注网络事件对物理行为的影响。支持边缘AI的安全事件关联、行为影响评估及策略限制响应,可帮助隔离受影响路径,避免不必要地停止整个车队。

从时间点安全到生命周期保障

这三层风险揭示了机器人安全保障中的缺失环节:网络安全。功能安全主要解决故障和非预期操作条件,而网络安全则将保证范围扩展至故意操纵,包括那些使底层系统看似正常的攻击。

这需要贯穿机器人生命周期的全面保障。设计阶段,团队需识别可能使预期行为假设无效的网络风险;部署前,应测试现实攻击是否会导致机器人偏离任务或安全边界;运营期间,监控需识别网络事件对行为的影响,隔离受影响路径并在可能情况下维持安全运行。网络安全虽不能替代功能安全,但能确保物理AI在视觉、决策或行为遭受攻击时,仍保持在可接受的边界内。