- 模型 Qwen 3.8、GPT 5.6 和 Fable 失败了:一个卡住了,两个拒绝工作。
- 测试的 7 个模型中有 4 个是开源的,可以在没有过滤器的情况下使用。
7 个 AI 智能体受命对 Bitcoin 缺陷进行分类和纠正:它们发现了什么?
7 个 AI 智能体受命对 Bitcoin 缺陷进行分类和纠正:它们发现了什么? WEEX
WEEX
Publisher
Aug 16, 2026 at 4:11 PM UTC · 4 分钟阅读

Key Signal
7 AI agents Models tested on flaws
Entities
bitcoin
Last Updated
2 个月前
Paul Miller 是一位维护用于 Bitcoin 和 Ethereum 项目的加密库的开发人员,他测试了 7 个人工智能 (AI) 代理,以对 Bitcoin Red Team 报告的 5 个真实安全漏洞进行分类和纠正。结果显示模型之间存在显著差异,无论是在运行每个模型产生的美元成本还是在其诊断的准确性方面。
在评估的 7 个代理中,3 个未能完成任务。来自 Alibaba 的 Qwen 3.8 在过程中卡住了,Miller 没有说明原因。据 Miller 本人称,来自 OpenAI 的 GPT-5.6 Sol 和来自 Anthropic 的 Fable 直接拒绝处理这些代码,尽管任务是识别和修复缺陷,而不是利用它们。
完成工作的 4 个代理,Grok 4.6 (xAI)、Kimi K3 (Moonshot AI)、DeepSeek V4 Pro 和 DeepSeek V4 Flash (DeepSeek),在执行时代币消耗(用户指令)的美元成本差异很大:
- Grok 4.6 的计算消耗成本为 $4.70。
- DeepSeek V4 Pro 处理相同任务的成本为 $0.30,最贵和最便宜的运行模型之间相差 15.7 倍(接近 1500%)。
所花费的时间也差异巨大。DeepSeek V4 Pro 在 30 分钟内完成了工作,Kimi K3 用了 40 分钟,Grok 4.6 用了 1 小时,而 DeepSeek V4 Flash 用了 3 小时,比 DeepSeek V4 Pro 处理相同任务的时间长了六倍 (500%)。
根据 Miller 的说法,只有 Grok 4.6 符合他自己对这 5 个漏洞严重程度的评估。
其他 3 个完成工作的代理(Kimi K3、DeepSeek V4 Pro 和 DeepSeek V4 Flash)夸大了发现的缺陷的严重性,据 Miller 本人称,这最终影响了这 3 个模型交付结果的整体质量。
Miller 的测试正值一波利用人工智能加速搜索和利用 Bitcoin 生态系统中安全漏洞的攻击浪潮之际。
最近几周,Coldcard、Boltz、ZEUS、BTCPay Server 和 LNP2Pbot 遭受了安全事件,这些事件与攻击者在 AI 模型的帮助下识别并利用的缺陷有关。这些案例均未影响 Bitcoin 协议本身,而是影响了在网络之外运行的产品和服务。
这波事件促使 Bitcoin Red Team(一个致力于在开源 Bitcoin 项目中寻找安全漏洞的开发人员小组)发起了一项大规模的 AI 辅助生态系统审计。
Bitcoin moved from $80,334.3 to $86,408.5 over the last 30-day period, a gain of 7.6 percent.
Source: Kraken · NewsLayer Markets · Updated 几秒内
Bitcoin Red Team 的审计已经覆盖了 300 多个开源代码库,从这项工作中产生了 Miller 用作对自己 7 个 AI 代理进行测试基础的 5 个漏洞,此外该研究小组还发现了另外 8,000 个缺陷,正如 CriptoNoticias 报道的那样。
Market Context
Bitcoin
BTC
$86,459
+1.98% (24H)
Market Cap
$1.74T
24H Volume
$14.7B
24H High
$86,778
Article Intelligence
Key Entities
Topics
Related Coverage
Sponsored
AdNewsLayer Premium
Unlock deeper intelligence.
Ad-free reading, exclusive research, and real-time onchain insights.
Go Premium
