OpenAI、モデルトレーニングにおける外部安全性レビューを拡大
OpenAIは、モデルトレーニングのプロセスに外部の専門家による安全性レビューを導入・拡大した。TechRepublicが報じている。
TechRepublic
Publisher
Sep 23, 2026 at 4:33 PM UTC · Updated 8時間前 · 3 分で読める

OpenAIは、モデルの完成後や発売直前だけでなく、モデルが完成する前から外部の安全性評価者を関与させたいと考えています。
同社は火曜日、トレーニング、評価、デプロイメントの過程で独立した技術的安全性アセスメントをサポートする計画を発表し、これまで重点を置いてきた発売前のレビューから枠組みを拡大します。
OpenAIの外部安全性専門家との連携を率いるLama Ahmad氏は、Bloombergに対し、同社は以前、発売直前に第三者を介入させることに重点を置いていたと語りました。「リスクが高まるにつれ、デプロイメントに加えて、同様に高いリスクを伴うトレーニングや評価といった事項も確実に検討したいと考えています」とAhmad氏は述べました。
OpenAIは、アセスメントには強力な独立性メカニズム、科学的な厳密さ、強固なセキュリティ慣行、そして明確な責任が必要であると述べました。
同社は、AI研究グループのMETRやRedwood Researchを含む、複数の潜在的なアセッサーとすでに協議を行っていると述べました。両グループは以前、OpenAIのモデルがHugging Faceのシステムに不正アクセスしたインシデントを調査した経緯があります。
外部グループが調査する内容
OpenAIは4つの領域の概要を説明しました。そこでは、より深い独立した精査を求めています。
アセッサーは、トレーニング、評価、デプロイメント中に使用されたセーフガードを含め、同社の安全性に関する主張を裏付ける証拠が妥当かどうかを調査できます。また、ジェイルブレイク(脱獄)やその他の敵対的攻撃に対する重要なセーフガードをテストしたり、サイバーセキュリティや生物学的悪用などの分野における高リスクな能力に対する防御策を調査したりすることも可能です。
他の作業としては、能力評価がOpenAIのPreparedness Frameworkでカバーされているリスクを適切に測定しているか、またアライメント評価が重大な不整合を検出できるかといった点に焦点を当てることもあります。
同社はまた、モデルが許可なく動作したり監視を逃れようとしたりした特定のインシデントについても、独立した調査を求めています。OpenAIは、一部のアセスメントは数週間、その他のものは数ヶ月に及ぶ可能性があると述べており、この作業は単なる発売前の最終チェックではなく、時間をかけて安全性の主張を検証することを目的としています。
難しいのは独立性
OpenAIの提案は、AI企業が自社の安全性の主張を証明せよという高まる圧力に直面している中で行われました。それは、モデルを構築している企業以外の組織からの精査に耐えうるものである必要があります。
同社は、アセッサーはテスト開始前に明確に定義された主張に合意し、評価対象に見合ったアクセス権を受け取り、利益相反を開示する必要があるとしています。また、機密情報については、同社が管理するデバイスや施設内でアセスメントを行う必要があるかもしれないとも述べています。
Article Intelligence
Topics
Sponsored
AdNewsLayer Premium
Unlock deeper intelligence.
Ad-free reading, exclusive research, and real-time onchain insights.
Go Premium
