训练数据与大型语言模型共生共荣。今年的行业焦点集中在专为AI智能体优化的数据库、辅助乳腺肿瘤诊断的数据集,以及强化企业数据掌控权的平台。

Databricks:重构数据库以适应AI速度

在Databricks平台上,由AI智能体创建测试和开发环境的比例已从两年前的0.1%飙升至97%,传统数据库架构难以应对这一动态变化。为此,Databricks开发了Lakebase,这是一种从头重构的数据库架构,支持快速启停,能够适应AI驱动开发中大量小型、快速的工作负载。今年8月,Databricks完成50亿美元战略融资,估值达1900亿美元,收入同比增长80%。

DataPelago:智能路由降低计算成本

尽管GPU和NPU是AI主流处理器,但CPU和FPGA在处理高性能计算任务时仍具价值。DataPelago的Nucleus系统现代化了传统以CPU为中心的设计,充当数据湖与查询引擎间的桥梁,无需修改代码即可将计算请求路由至最高效的处理器。该公司称,其Apache Spark加速器可将性能提升高达10倍,计算成本降低80%。今年8月,DataPelago被NetApp收购,Nucleus成为后者全栈AI解决方案的核心。

DDN:扩展存储以支撑超级计算机负载

数据路径吞吐量不足常导致GPU利用率低下,阻碍大规模模型训练。DDN的EXAScaler并行文件系统技术解决了这一瓶颈,其客户包括Google Cloud(Managed Lustre服务)、Salesforce和英伟达。通过结合并行I/O和高吞吐量共享存储,该服务可扩展至每秒10太字节。随着AI存储需求激增,DDN预计2026年收入将翻倍至10亿美元。

Hydrolix:可视化AI机器人流量

Cloudflare数据显示,AI智能体和机器人流量已占网络总流量的一半以上。Hydrolix推出的Bot Insights工具可将此类行为可视化,提供个性化仪表板并允许客户拦截特定流量,同时支持查询分析结账延迟或搜索成本上升等问题。Hydrolix报告称,该工具将事件归因时间缩短95%。公司近期完成8000万美元C轮融资,并成为AWS流媒体平台Agentic Intelligent Operations的技术引擎。

iMerit:开源数据集助力乳腺癌诊断

早期发现可使乳腺癌五年生存率超过90%。数字乳腺断层合成术(3D钼靶)在检测病变方面优于传统2D钼靶,尤其适用于致密型乳腺,但受限于缺乏经活检确认的数据集。iMerit联合Segmed和Advocate Health发布了一个开源、免费且符合HIPAA法规的数据集,包含超500例经活检确认的检查结果,良恶性病例各半。这将有助于研究人员优化AI辅助诊断的准确性与速度。今年8月,数据和AI公司EXL以3.1亿美元收购iMerit。

Mozilla Data Collective:赋予数据所有者控制权

针对AI训练数据的补偿争议,Mozilla Data Collective采取了主动策略。不同于内容拥有者与科技巨头单独谈判或屏蔽爬虫,该集体允许数据实体在保留所有权和控制权(包括补偿条款)的前提下共享数据。目前,该集体涵盖190多个组织,共享超1000个精选数据集。今年,Mozilla已将Data Collective剥离为独立实体。