高通正描绘一个AI智能体不再局限于对话,而是能行动、记忆并在手机、笔记本及耳机间无缝协作的未来。这一愿景的核心在于减少了对远程服务器的依赖,转而依靠强大的本地芯片技术。过去一年,高通致力于构建支撑该愿景的底层硬件基础。
算力跃升与生态落地
高通计算与游戏部门高级副总裁兼总经理Kedar Kondap指出,硬件迭代速度远超预期。两年前,在设备端运行130亿参数模型尚属突破,如今开发者已在搭载骁龙处理器的PC上成功运行300亿至350亿参数的模型,且精度几乎无损。
作为这一战略的核心,骁龙X系列处理器正在推动本地化智能体应用的落地。高通官方博客展示了包括AnythingLLM、Pokee AI、LLMWare、Deepgram和Memories.ai在内的五家独立软件供应商(ISV)合作伙伴。这些应用展示了当推理过程保留在设备端时,系统在持续性能、内存带宽、热效率及电池续航方面的表现。例如,AnythingLLM为知识工作者提供了具备屏幕感知语音输入和上下文高亮的本地优先工具。
性能数据印证了这一进展。第一代骁龙芯片中的Hexagon NPU算力为45 TOPS,而新一代X2 Elite版本则达到80 TOPS或更高,部分配置下内存带宽提升至228 GB/s。这对于处理多步推理循环或长上下文窗口至关重要。
Clairvoyance AI提供了一个典型案例。其创始人兼CEO Brad Wardell表示,团队定制了开源GenieX框架,仅用一天便使其在搭载骁龙X2 Elite的设备上运行。该系统采用分层智能体架构,简单任务由小模型处理,复杂任务逐级升级,所有操作均在本地完成,无需往返云端。
移动端的智能体演进
在2026年骁龙峰会期间,高通发布了两款针对智能体负载的旗舰处理器:骁龙8 Elite Gen 6及其Extreme变体。新引入的传感器集线器(Sensing Hubs)能在低功耗下常开,收集语音、活动和上下文信号;专用的元素加速器(Element Accelerator)则加速Transformer运算,某些情况下上下文长度可扩展至32K tokens。
Extreme版本配合高速闪存,可在本地运行300亿参数的混合专家(MoE)模型。高通首席执行官Cristiano Amon将此描述为从“以应用为中心”向“以智能体为中心”的计算转变。智能手机因拥有最丰富的个人数据仍是核心,但该架构已跨越多个设备。
音频领域同样受益。骁龙声音Elite Gen 2增加了eNPU,使设备端AI能力翻倍。耳机可作为智能体循环中的持久伴侣,监听环境并提供上下文,同时避免耗尽手机电池。
从云端到边缘的范式转移
高带宽计算技术正从数据中心向下扩展至边缘设备,将内存更靠近AI处理单元。未来设备可能在本地每天处理一百万个tokens,这将改变经济模式:相比不断累积的云端推理成本,本地执行提供了更低延迟、更好隐私和持续的使用体验。
合作伙伴正在填补跨设备协作的空白。AnythingLLM允许用户在骁龙PC上开始对话并在手机上继续,上下文随之转移且数据保持私密;Paage.ai将手机转变为个人伴侣,本地生成图像并执行创建日历事件等动作;Memories.ai则通过跨设备记录构建个人知识图谱。
媒体指出,升级后的传感器集线器、Hexagon NPU和元素加速器形成了一个连贯的系统。Oryon CPU核心频率现达5 GHz,GPU和NPU的改进相互叠加,旨在打造集成而非拼凑的体验。高通正将数据中心的AI理念延伸至边缘,混合架构将根据需求在本地芯片、邻近设备和云资源之间分配工作。
挑战与未来
尽管前景广阔,挑战依然存在。电池续航、轻薄本的热管理以及模型量化带来的精度牺牲仍是制约因素。此外,安全问题严峻,若拥有广泛权限的智能体被攻破,可能造成实质性损害。高通并未声称已完全解决信任问题,而是认为基础设施现已就绪,开发者可尝试介入。
这种转变呼应了从大型机到PC、再到移动设备的计算历史。智能体预示着机器不再被动等待指令,而是在用户设定的界限内预判、推理和执行。高通已提供强大算力,Linux支持已抵达骁龙X2芯片,微软Surface设备也已搭载最新处理器。软件社区正决定如何使用这些能力,每月都有新应用涌现。
仅依赖云端的个人AI时代正面临竞争。本地智能体无需取代所有云服务,只需在处理常规、私密和即时任务上表现得更好。高通正押注于此,芯片、工具和合作伙伴演示均指向同一方向:智能体已经到来,关键在于用户愿意让它们走多远。