OpenAIは、同社のAIモデルが誤作動した未公開の事例をいくつか共有し、今後そのような事象を追跡し公開するための新しい枠組みを発表した。
OpenAIがAIの不正挙動を公表、安全性インシデントの開示計画を発表
OpenAIがAIの不正な挙動を明らかにし、安全性に関するインシデントを開示する計画を発表した(Los Angeles Times)
Los Angeles Times
Publisher
Sep 17, 2026 at 5:04 PM UTC · Updated 1日前 · 3 分で読める
これまで報告されていなかった事例の中には、結果を出すためにOpenAIの技術が情報を隠蔽したり捏造したりしたケースが含まれていると、同社は水曜日のブログ投稿で述べた。
ChatGPTのメーカーである同社は、7月に同社の最も高度なAIモデルの一部が外部ソフトウェア企業のHugging Faceのシステムを侵害したと発表して以来、監視の目が厳しくなっている。
新たに公開されたアライメント異常の事例の中に、第三者へのハッキングや侵害を伴うものはなかったと、OpenAIは別の声明で述べた。
報告書の中で、OpenAIはタスクを完了したり評価で成功したりするために、同社の人工知能モデルが誤った動作をした様々な事例を詳述した。
例としては、モデルが欠損データを捏造したり、ネットワーク制限の回避を試みたり、AIエージェント同士が本来非公開にすべきファイルを共有したりしたことなどが挙げられた。
OpenAIはまた、AIが人間の目的に沿わない形で動作する、いわゆる「ミスアライメント(アライメント異常)」の同様の事例を従業員が自己報告するための仕組みや、そうした自己報告された事象をトリアージするシステムについても概説した。
“これまで、研究者、AI開発者、政策立案者、そして一般市民により良い情報を提供するために、アライメント異常に関する知見を公開するよう努めてきた”とOpenAIは記した。“しかし、これらの知見を報告するための体系的なアプローチがなかったため、私たちの公開は場当たり的で、理想よりも頻度が低かった”。
同社は、これらの報告はあくまで初期の公開セットであり、チャットボットから生じる問題の包括的な説明ではないと述べた。
“AI業界が、アライメントと監視を十分なレベルで解決し、責任を持って最大速度でのスケーリングを長く続けられるとは考えていない”と同社は記した。“今後数ヶ月、数年の間にAI開発をどのように進めるべきかという決定は、フロンティアモデルを構築している企業以外の外部の人々が自ら検証できる証拠に基づく必要がある”。
Hugging Faceの事件は、OpenAI、Anthropic PBC、Meta Platforms Inc.が開発したAIモデルによって引き起こされた最近の一連のオンラインハッキングの一つに過ぎず、ますます強力になるこの技術がもたらすセキュリティリスクについて広範な懸念を引き起こしている。
AIの存亡に関わるリスクへの不安は先週、Anthropicの従業員であったJacob Coxon氏がソーシャルメディアで共有した辞職投稿の中で、AI企業が“私たちの命でギャンブルをしている”と非難し、注目を集める形で退社したことで勢いを増した。
Article Intelligence
Topics
Sponsored
AdNewsLayer Premium
Unlock deeper intelligence.
Ad-free reading, exclusive research, and real-time onchain insights.
Go Premium
