Kimi K3 在发现比特币漏洞方面优于竞争对手的开放权重模型
核心要点
- 中国的开放权重人工智能模型在短短两周内就发现了 501 个比特币项目的近 8,000 个潜在安全问题 一个名为“比特币红队”的志愿者组织刚刚进行了加密生态系统有史以来最雄心勃勃的自动化安全审计之一。
- 他们选择的武器:Kimi K3,一个由中国 Moonshot AI 构建的开放权重人工智能模型。

中国的开放权重人工智能模型在短短两周内就发现了 501 个比特币项目的近 8,000 个潜在安全问题
一个名为“比特币红队”的志愿者组织刚刚进行了加密生态系统有史以来最雄心勃勃的自动化安全审计之一。他们选择的武器:Kimi K3,一个由中国 Moonshot AI 构建的开放权重人工智能模型。在大约 108 小时内,该模型对 501 个比特币相关开源项目中的 7,958 个潜在安全问题进行了分类,其中 1,280 个项目的严重程度被评为高或严重。
在标准化漏洞检测基准测试中,Kimi K3 的表现优于所有其他测试的开放权重模型,包括 ZIPU 的 GLM-5.2。
审计实际发现了什么
在 Kimi K3 标记的 7,958 个潜在问题中,只有 24.7% 可以动态重现。截至报告发布时,29.4% 的调查结果已传达给上游受影响的项目。
最重要的发现是 BTCPay Server 2.4.2 版本中的关键双因素身份验证绕过。该漏洞在修补之前就已经被用来提取闪电钱包凭证,这使其成为一个真实的、野外的安全事件,而不是理论上的问题。
Kimi K3 的表现如何
英国人工智能安全研究所及其对应机构 CAISI 于 2026 年 7 月对 Kimi K3 进行了初步评估,在 ExploitBench 上的得分为 32%。这是一个基准,旨在衡量人工智能模型识别和推理可利用软件漏洞的能力。 GLM-5.2 在同一测试中得分为 24%。
在开放权重模型中,即权重可供任何人公开下载和运行的模型中,Kimi K3 名列前茅。该模型于 2026 年 7 月 16 日至 27 日左右发布,红队在接下来的几周内加强了审核工作。
开源模型和闭源模型之间的差距仍然很大。 OpenAI 和 Anthropic 的领先美国模型在 ExploitBench 上的平均得分约为 76%。这是 Kimi K3 分数的两倍多。
Coldcard事件是这一切的开始
2026 年 7 月涉及 Coldcard Mk3 的安全事件促进了红队的努力。 Mk3 固件中的缺陷导致约 594 BTC 被盗,当时估计价值 3800 万美元。该事件引发了广泛的猜测,认为攻击者使用人工智能来识别固件漏洞,尽管这一说法尚未得到明确证实。
这对比特币安全意味着什么
代码审计的经济学原理即将发生转变。对单个比特币项目的专业安全审核可能花费数万美元并需要数周时间。 Kimi K3 在 108 小时内扫描了 501 个项目。
构建最强大模型的美国人工智能公司通常以安全问题为由,限制其工具用于漏洞研究。与此同时,一个开放权重的中国模型正在被自由部署,以发现和报告关键金融基础设施中的错误。 ExploitBench 上的开源模型和闭源模型性能之间的差距(32% 与 76%)表明最强大的漏洞检测仍然存在于 API 付费墙后面。
