Google DeepMind 正式将 SynthID 水印技术拓展至合成生物学领域,推出新工具 SynthID Bio。该工具能够在蛋白质的氨基酸序列或预测的三维结构中隐藏数字签名,相关成果已通过博客文章及《自然》杂志论文公布。

DeepMind 表示,SynthID Bio 不仅能检测物理蛋白质中的签名,也能识别数字设计中的标记。实验室测试显示,该技术未改变蛋白质的生物功能。科学政策咨询专家 Sarah Carter 评价称,这是追踪生物设计来源的重要拼图。

标记机制与验证

在序列层面,SynthID Bio 通过微调氨基酸选择嵌入标记;在结构层面,则调整原子坐标。据媒体报道,该工具运行于 Baker Lab 开发的蛋白质设计工具 ProteinMPNN 内部,利用类似密码学密钥的机制建议下一个氨基酸,并由 ProteinMPNN 确保蛋白质功能性。检测时,软件使用密钥扫描序列并测量特定氨基酸的出现频率。

研究团队针对 VEGF-A、SARS-CoV-2 刺突蛋白 RBD 和 PD-L1 三个靶点设计了结合蛋白。测试表明,带水印的设计在命中率、结合亲和力和序列多样性上与无标记设计相当。Adaptyv Bio 协助完成了实验室测试。此外,DeepMind 还微调了 AlphaFold 3 扩散网络的部分权重以嵌入结构水印,官方称 AlphaFold 3 保持了原有准确性,且检测率近乎完美。

强化生物安全筛查

随着 AI 能够设计出与已知危害截然不同的序列,合成 DNA 订单的人工审查压力增大。DeepMind 指出,水印可证明订单来自受信任模型,从而优化筛查流程。Twist Bioscience 政策和生物安全副总裁 James Diggans 表示,水印有助于将资源集中在需仔细审查的序列上,提升生物安全效率。

该标记技术还可用于标识公共数据库(如 Protein Data Bank、UniProt 和 GenBank)中的 AI 生成条目。目前,由 OpenAI 支持的 Red Queen Bio 正利用 AI 为未来病毒设计抗体。

局限性与后续进展

团队指出了技术的局限性:安全性依赖密钥管理;极短蛋白质可能因标记氨基酸过少而无法检测;标记信号可能在融合蛋白中被稀释;统计性检测存在假阳性和假阴性风险。此外,许多 AI 蛋白质设计工具不使用 ProteinMPNN,DeepMind 承认仍需提高标记抗移除能力。

在下一步计划中,DeepMind 联合斯坦福大学 Hie 实验室及 Arc 研究所,将 SynthID Bio 整合进基因组模型 Evo 2,并为噬菌体基因组添加水印。早期细菌培养物测试显示水印有效,团队计划发表相关技术论文。目前,DeepMind 已开源代码、实验室数据及模型权重。

SynthID 卷入显微镜争议

与此同时,Google 用于图像和视频的 SynthID 标记陷入争议。尼康正在重新审查其“Small World in Motion”竞赛获奖视频,该视频由清华大学徐宁博士提交,展示了罕见遗传病儿童的气道纤毛。德克萨斯大学西南医学中心博士生 Ian Donovan 称在视频中发现了 SynthID 水印。徐宁回应称,AI 仅用于区分和可视化重建灰度图像中的特征,并未生成实验电影、纤毛或其运动,并已向尼康提供详细技术文档。