SynthID Bio 概念验证探索人工智能生成蛋白质的水印
核心要点
- 谷歌 DeepMind 的水印技术在概念验证中适用于蛋白质序列,可能重塑生物安全 谷歌 DeepMind 的 SynthID 水印系统最初是为了标记人工智能生成的文本、图像、音频和视频,现在发现了一个令人惊讶的新领域:生物学。
- 马里兰大学的研究人员采用了该技术,将隐形水印直接嵌入人工智能设计的蛋白质序

谷歌 DeepMind 的水印技术在概念验证中适用于蛋白质序列,可能重塑生物安全
谷歌 DeepMind 的 SynthID 水印系统最初是为了标记人工智能生成的文本、图像、音频和视频,现在发现了一个令人惊讶的新领域:生物学。马里兰大学的研究人员采用了该技术,将隐形水印直接嵌入人工智能设计的蛋白质序列中,为合成生物学创建了一种潜在的跟踪机制,且不会损害蛋白质本身。
如何给蛋白质加水印
该技术建立在 SynthID-Text 的基础上,它的工作原理是在生成过程中巧妙地调整标记(在本例中是氨基酸而不是单词)的概率分布。研究人员使用了所谓的无偏 Gumbel 采样方法,将源自私钥的水印嵌入到 ProteinMPNN 等蛋白质设计模型的氨基酸概率分布中。
ProteinMPNN 于 2022 年推出,是用于设计新型蛋白质序列的较为突出的 AI 模型之一。它需要一个所需的三维蛋白质结构,并反向生成应折叠成该形状的氨基酸序列。水印层位于该过程的顶部,在不改变输出的整体统计特性的情况下推动选择哪些特定氨基酸。
验证表明,pLDDT 分数(预测蛋白质折叠质量的标准指标)在加水印后保持不变。带水印的蛋白质与不带水印的蛋白质在结构上看起来一样健全。
生物安全案例
随着人工智能蛋白质设计工具变得更强大、更容易使用,生成新生物序列的能力引起了合理的安全担忧。传统的来源方法(例如附加到文件的元数据日志)可以像从照片中删除 EXIF 数据一样轻松地删除。他们不提供持久的监管链。
人工智能、科技及其所推动的市场——每日简报。日常的。自由的。加入加密货币、金融和政策领域 34,000 多名读者的行列。电子邮件地址 免费订阅 我们尊重您的隐私。随时取消订阅。
嵌入的统计水印则不同。它存在于序列本身内部,能够在复制粘贴、文件格式更改以及跨系统分发中幸存下来。任何有权访问相应私钥的人都可以检测到水印,从而使组织能够确定给定的蛋白质序列是否是由特定的人工智能模型生成的。
此功能直接插入现有的生物安全基础设施。国际基因合成联盟 (IGSC) 已经维护了根据已知危险序列数据库筛选 DNA 合成顺序的框架。可以通过这些现有渠道追踪带水印的蛋白质序列,为筛选过程添加一层特定于人工智能的来源。
今天的情况
没有可供购买或部署的名为“SynthID Bio”的商业产品。这项研究完全属于概念验证领域。 Google DeepMind 的底层 SynthID 技术是真实且积极部署的,用于为人工智能生成的文本、图像、音频和视频添加水印。蛋白质应用是这些原理的延伸,已在研究环境中得到证实,但尚未产品化。
该研究还强调了统计水印相对于其他方法的结构优势。由于水印嵌入在生成过程本身中而不是事后附加,因此它创建了一种与人工智能模型本质上相关的出处形式。您无法使用此方法事后对蛋白质序列加水印。它必须在生成时发生,这意味着它自然地跟踪原点而不是某些下游处理步骤。
