
AI行业正步入一个全新的发现与自动化时代。尽管普通用户感知尚浅,但头部AI公司已敏锐捕捉到这一变化。
周二晚间,OpenAI发布公告,称其未公开的AI模型已在数学和计算机科学领域的数百个关键问题上取得解决或重大进展。然而,在这一开创性技术成就背后,市场更关注其商业动机:该公告恰逢OpenAI寻求新一轮融资之际,且紧随上周令部分开发者失望的发布会之后。与此同时,经济学家尚未在主要统计数据中观察到AI显著提升人类生产力的迹象,而备受追捧的“消费者代理”也正遭遇网站反爬虫策略的阻击。
当前AI淘金热的核心命题在于:企业如何将原始的智能转化为实际、可验证的效用?
自动化愿景与现实困境
上周,近800名软件开发者齐聚旧金山Midway礼堂,参加由基础设施供应商Modal主办的会议。会上,编码代理初创公司Cognition创始人Scott Wu成为焦点。该公司上月估值飙升至480亿美元。Wu曾以数学竞赛佳绩闻名,他站在舞台中央宣称:“是时候雄心勃勃了。”他描绘了一个充满“虚拟员工”的未来,这些员工将“专注于结果而非任务”。Wu认为,随着数据中心和内存沙箱资源的充足,代理能力的增强将是行业必然趋势。
Wu的信心源于数学能力的突破。他提到的“AIME时刻”,指的是去年高级AI模型在高级数学竞赛中超越人类的节点。“那时我就知道一切都结束了,”Wu表示,这意味着人类不再垄断智能。
然而,前OpenAI研究员、TypeSafe AI创始人Diogo Almeida提出了不同看法。身穿粉色皮草外套登台的Almeida直言:“自动化到底在哪里?”他指出,当前100%的大型语言模型(LLM)都针对“人类反馈强化学习”(RLHF)进行了优化。换言之,LLM被训练为取悦人类助手,因此在辅助任务上表现优异,但在无人值守的自动化场景中往往失效。
尽管AI领导者们呼吁在软件工程中推进更多自动化,但他们也承认转型艰难,且无意让机器完全接管一切。Anthropic旗下Claude Code产品负责人Cat Wu指出,许多自动化尝试卡在“半自动化”阶段:“Claude完成了80%的工作,剩下20%由人完成,但用户仍被困在重复执行任务的循环中。”
更有甚者,部分管理者认为问题不在AI,而在人类。知名开源开发者、OpenCode构建者Dax Raad表示,团队面临的主要挑战是人类工程师未能充分审查AI生成的代码。“这是一个老生常谈的问题:如何让人们更关心代码质量,并在疏漏发生时感到愧疚?”Raad说道。
行业快讯
• SpaceX调整AI策略:埃隆·马斯克周二宣布,SpaceX的AI部门将在Grok Bot中引入竞争对手的AI模型,标志着其不再完全依赖内部自研模型。
• 微软推动本地AI:微软周三推出新举措,旨在让Windows PC在本地而非云端运行AI,以降低客户成本。
• 新算力初创成立:Andreessen Horowitz前普通合伙人Anjney Midha联合来自谷歌、苹果和英伟达的前高管成立新公司,致力于降低中小企业获取算力的门槛和成本。
• 美财政部开出首张罚单:美国财政部周三宣布,对初创加速器Plug and Play Tech Center的母公司处以罚款。这是在美国针对中国科技行业的对外投资限制计划下实施的首次处罚。