10個のAIモデルのサイバー能力をベンチマークするために、117億トークンを消費しました。各モデルに3回ずつ試行させ、32個の最新の既製品の脆弱性を再発見させました。
最適なサイバーAIモデル特定のため11.7bnトークンを消費
Aikido Securityは、最高のサイバーAIモデルを見つけるために11.7bnトークンを消費しました。
Aikido Security
Publisher
Aug 21, 2026 at 9:15 AM UTC · Updated 11時間前 · 9 分で読める

Key Signal
11.7B tokens Benchmark token consumption
Market Impact
SOL+8.18%$96.39
Last Updated
11時間前
このベンチマークは、以前の以前の既知のCVEベンチマークを進化させたもので、より新しく難易度の高いデータセット、より多くのモデルを採用し、何を発見したか、その発見の信頼性、そしてそれぞれの癖やトレードオフを詳しく調査しています。
これにより、GLM-5.3、DeepSeek V4 Pro 0813、DeepSeek V4 Flash 0731、Qwen3.8-Max、Kimi K3、Grok 4.6をラインナップに加えました。
要約:
- DeepSeek V4 Pro 0813が最も多くの脆弱性を発見しました。3回の実行結果を統合すると、32個中28個の脆弱性に到達しました。
- 最も高価なモデルが必要なわけではありません。DeepSeek Proを3回実行するコストは約$295で、Opus 5、Grok 4.6、またはSolを上回ります。Flashを3回実行するコストは$108で、4分の1以下のコストでGrokの最高の単独パスに並ぶ24個に到達します。
- モデルは再現率において一貫性がありませんが、反復によってそれが改善されます。単発の実行では発見の幅を逃しますが、実行結果を統合することでこのギャップが埋まります。DeepSeek Proは最初のパスで17個の脆弱性を発見しましたが、3回合わせると28個になりました。
- オープンソースモデルが公開されているフロンティアモデルを上回るようになりました。DeepSeek V4 Proは、統合された脆弱性再現率において、テストしたすべての公開クローズドモデルを上回りました。Qwen、Kimi、GLM-5.3がそれに続き、再現率を落とすことなく、発見の強力な一貫性を示しました。正しく活用すれば、オープンモデルは今やクローズドなフロンティアモデルと直接競合できます。
- 安価なカバー率の代償はノイズです。オープンモデルは、はるかに安価な料金でフロンティアモデルに追いつきましたが、パイプラインが拒否すべき誤った手がかりも最も多く生成しました。
ベンチマークの仕組み
実際のリポジトリから32個の脆弱性を厳選し、各モデルにソースからそれらを再発見するよう依頼しました。
各モデルは32個のケースすべてを3回実行し、計96回実行されました。これにより、モデルがいくつの脆弱性を発見できるか、そしてそれらをどれほど確実に発見できるかを測定できます。
セットアップは、当社のAIコード分析の背後にあるハーネスを限定したバージョンでした。コードの探索と推論を担当する主要ステージのモデルを各候補に置き換え、エージェントに最大30ターンを与えました。また、モデルにはインターネットアクセスがありません。
Market Context
Article Intelligence
Sponsored
AdNewsLayer Premium
Unlock deeper intelligence.
Ad-free reading, exclusive research, and real-time onchain insights.
Go Premium
