
Google DeepMind已将其水印技术从数字领域拓展至分子世界。2026年9月30日,该实验室正式推出SynthID Bio,这是一套能将可检测签名直接嵌入AI生成蛋白质序列及预测三维结构的技术方案。这些签名在蛋白质合成后依然存在,且经验证不会对分子与靶标的结合能力造成可测量的损害。
突破生物学约束的水印技术
随着AI蛋白质设计工具日益强大,新型结合蛋白和酶的大规模创建引发了来源追溯难题。SynthID Bio旨在回答“序列由谁设计”这一关键问题。该技术建立在Google原版SynthID系统之上,但针对生物学严格约束进行了深度适配:蛋白质序列决定其折叠、结合位点及稳定性,任何不当修改都可能导致功能崩溃。
SynthID Bio包含两项核心技术:
SynthID Bio-sequence:作用于设计阶段。研究人员以目标结构为起点,利用修改版的ProteinMPNN模型选择氨基酸。系统引入加密密钥偏置特定选择,仅在替换后的氨基酸能保留预测功能时才接受带水印序列,否则选择次优选项。最终序列携带统计签名,但在外观上与其他合理设计无异。
SynthID Bio-structure:作用于结构预测阶段。通过微调AlphaFold 3扩散网络的部分权重,将水印嵌入模型本身。任何运行该修改版模型的用户,其输出的三维坐标均带有签名。基准测试显示,准确性、二级结构分布等关键特征保持在正常变异范围内,且信号能抵抗数字噪声和坐标扰动。
湿实验验证:功能无损,检测精准
DeepMind在VEGF-A、SARS-CoV-2刺突蛋白受体结合域及PD-L1三个重要靶点上进行了测试。团队将AlphaProteo设计流程与修改后的ProteinMPNN结合,湿实验结果显示,带水印的设计在命中率、结合亲和力(以解离常数KD衡量)和序列多样性方面,与未加水印的对照组在统计学上无显著差异。
DeepMind团队表示,这是史上首个具有生物学功能的带水印蛋白质结合蛋白。数据显示,带水印版本保持了类似自然的多样性,未出现被视为人工特征的重复模式。即使在合成后,通过测序或质谱分析读取签名的准确率也接近完美。
应用前景与局限
这项技术为DNA合成公司和公共数据库提供了实用的筛查工具。供应商可利用可靠的来源标记快速放行受信任实验室的设计,同时对未知来源进行额外审查;Protein Data Bank等数据库则可通过标记合成贡献,防止AI生成条目污染训练数据。据媒体报道,SynthID Bio-sequence代码已在GitHub开源,结构模型权重也已发布供研究使用。
然而,这仍是一个概念验证。发表于《自然》期刊的论文指出,目前测试主要集中在较短的结合蛋白上,扩展到全酶或多结构域蛋白质需进一步验证。此外,尽管集成到模型权重中增加了移除难度,但对抗者仍可能尝试伪造水印。DeepMind强调,SynthID Bio仅是更广泛生物安全保障中的一层。
目前,团队正与合作伙伴将水印技术整合至设计噬菌体基因组的Evo 2模型中,早期细菌培养测试显示标记噬菌体仍具备功能,相关手稿预计即将发表。行业观察人士认为,随着AI在生物学领域从预测迈向生产,这种在不牺牲实用性前提下实现来源追溯的技术,为负责任的规模化应用提供了务实一步。下一步的关键在于合成提供商、数据库策展人及监管机构如何部署这一工具。