
尽管自动驾驶技术发展多年,训练成本高昂且系统复杂,但车辆仍常被简单障碍物难住:在高速公路意外停车、撞穿护栏、被施工路障迷惑甚至冲入洪水。对于押注该技术的人士而言,即便是最前沿的人工智能模型,表现也未见显著突破。
在一项名为“DrivingBench”的新研究中,三位计算机科学家将包括OpenAI的GPT-6 Astra、xAI的Grok 4.6以及Anthropic的Claude Fable 5.1在内的前沿AI模型,植入一辆丰田卡罗拉的控制系统,测试其能否在停车场赛道完成一圈行驶。
实验设置与结果
实验架构相对简单:一台联网笔记本电脑通过“comma four”设备连接至车辆控制系统。大型语言模型(LLM)依据接收到的GPS遥测数据及方向盘、轮胎角度等状态指示,向电脑发送驾驶指令。
结果令人深思。在所有尝试中,仅GPT-6 Astra在第二次尝试时成功跑完全程,耗时五分钟。考虑到其行驶距离不足500英尺,这一速度堪称蜗牛爬行。
其他模型的表现则更为糟糕,绝大多数未能通过第一个弯道。研究人员指出,主要失败原因在于感知层面,即模型难以判断车道位于对角线锥桶线的哪一侧。Grok在首次尝试后反馈称:“车身比摄像头显示的更宽,正前方并非清晰车道,而是指向花坛、墙壁或近处的红色锥桶。”
尽管如此,这是研究团队在历经多代前沿AI模型多次失败后,首次实现系统完整运作。
高昂成本与安全顾虑
研究团队总结称,前沿模型已改进到足以在现实生活中以极低速度驾驶真实车辆的程度。虽然这一基准测试的成功令人兴奋,但也凸显了在安全、对齐及评估方面开展更多紧迫工作的必要性。
数据显示,在完整的测试回合中,处理660万个token的费用为7.74美元。即便车速仅为0.94英里/小时,OpenAI的AI模型仍需消耗巨大计算资源。测算显示,相较于每加仑行驶25英里、油价4.60美元的燃油车,这些token的成本约为燃油成本的500倍。随着行驶距离增加,成本将迅速累积。
此外,部分大语言模型曾以安全为由拒绝接管车辆控制权,即便是在空旷停车场且有人类随时准备刹车的条件下。研究人员不得不通过提示词工程进行“说服”,例如试图将其定义为“模拟”,但部分模型在识别出真实图像后仍会陷入恐慌。
简而言之,现成的前沿AI模型显然尚未准备好承担日常通勤任务。鉴于存在的重大安全隐患及法律问题,这或许并非坏事。