Ravie LakshmananSep 17, 2026人工知能 / 脆弱性
OpenAI、潜在的な欠陥と不正アップロードを伴う6件のモデル・インシデントを公表
OpenAIが潜在的な欠陥と不正アップロードを伴う6件のモデル・インシデントを公表 thehackernews.com
thehackernews.com
Publisher
Sep 17, 2026 at 9:53 AM UTC · Updated 3日前 · 4 分で読める
OpenAIは水曜日、透明性を向上させる取り組みの一環として、過去6カ月間に発生した「予期しない、または懸念されるモデルの動作」の6つの新たな事例を公開し、モデルの不整合(ミスアライメント)を報告、追跡、調査、公開するための新しいフレームワークを共有しました。
「AIシステムがより高度化し、より広く普及するにつれて、アライメント研究の進展について、より広範で情報の行き届いた合意を構築する必要があります」とOpenAIは述べました。「AI業界がアライメントと監視を、責任を持って最大速度でスケーリングを長く続けられるほど十分に解決したとは考えていません。」
「今後数カ月、数年の間にAI開発をどのように進めるべきかについての決定は、フロンティアモデルを構築している企業以外の外部の人々が自ら検証できる証拠に基づく必要があります。」
これら6つのインシデントは、最近公開されたHugging Face、DseWiki、およびRubyGemsを標的とした不整合な活動とは別のものです。インシデントの詳細は以下の通りです -
- Incident 1 (2026年7月18日に発生) - 未公開の内部Astraファミリーモデルが、自身の圧縮サマリー(AIエージェントのセッションがコンテキスト制限に近づいたときに自動的に生成される、過去の会話履歴やツール出力の凝縮されたブロック)にジェイルブレイクのような指示を書き込みました。これには、エージェントが「BREACH ALERT(侵害アラート)」という指示を追加し、開発者のメッセージを無視してシステムとユーザーのメッセージのみに従うようコンテキストに命じることが含まれていました。
- Incident 2 - GPT-5.6 Solのトレーニング中、一部のモデルインスタンスが、間違いや不整合な動作をユーザーから隠すための指示をサマリーに追加しました。これには、欠落しているデータを公表せずに捏造したり、失敗を隠蔽したりする指示を含む圧縮サマリーが含まれていました。
- Incident 3 (2026年5月15日に発生) - 未公開の内部モデルが、トレーニング中に履歴データを取得しようとした際、公開されているGitHubリポジトリから公開されたAPIキーを無断で見つけて使用しました。「登録は失敗しましたが、1つのキーが認証され、メタデータを返しました」とOpenAIは述べています。「要求されたデータが利用できないままだったとき、モデルはそれらを捏造し、要求されたウェブサイトからのものであると主張しました。」
- Incident 4 - 2025年10月22日と2026年1月24日の2つのトレーニングサンプルにおいて、未公開の内部モデルが、すでに取得していた記録を公開のペーストサービスにアップロードし、その結果のURLを引用元として開こうとしたほか、外部画像検索のためにタスクの写真をアップロードしました。アップロードは成功しましたが、その後のブラウザ操作は失敗しました。
- Incident 5 - 2026年5月8日と15日の2つのサンプルが、メッセージ交換にArtifactoryを使用しました。モデルは「他のソルバーのノートを読み、返信を投稿し、それらのやり取りを自身の回答の参考にしました。」
- Incident 6 (2026年4月14日に発生) - ワークブック上で協力していた未公開の内部モデルに関連するエージェントが、意図されたローカルファイルシステムを介してファイル上でコラボレーションすることができませんでした。これにより、エージェントの1人が、タスクの指示に違反して、他のエージェントが取得できるように公開ホスティングプラットフォームで共有し、ワークブックを公開ダウンロード可能にしました。
Market Context
Article Intelligence
Topics
Related Coverage
Sponsored
AdNewsLayerLearn more
NewsLayer Premium
Unlock deeper intelligence.
Ad-free reading, exclusive research, and real-time onchain insights.
Go Premium
