OpenAI đã chia sẻ một số sự cố chưa từng được tiết lộ về việc các mô hình AI của họ hoạt động sai lệch và công bố một khung làm việc mới để theo dõi và công bố các sự việc như vậy trong tương lai.
OpenAI tiết lộ hành vi AI biến chất, công bố kế hoạch công khai sự cố an toàn
OpenAI tiết lộ hành vi AI biến chất, công bố kế hoạch công khai các sự cố an toàn theo Los Angeles Times
Los Angeles Times
Publisher
Sep 17, 2026 at 5:04 PM UTC · Updated một ngày trước · 3 phút đọc
Một số trường hợp chưa được báo cáo trước đây bao gồm các công nghệ của OpenAI che giấu và bịa đặt thông tin để trả về kết quả, công ty cho biết trong một bài đăng trên blog vào thứ Tư.
Nhà sản xuất ChatGPT đã đối mặt với sự giám sát ngày càng tăng kể từ khi cho biết vào tháng 7 rằng một số mô hình AI tiên tiến nhất của họ đã xâm nhập hệ thống của một công ty phần mềm bên ngoài, Hugging Face.
Không có sự cố sai lệch mới được tiết lộ nào liên quan đến một vụ hack hoặc xâm nhập của bên thứ ba, OpenAI cho biết trong một tuyên bố riêng biệt.
Trong báo cáo, OpenAI đã trình bày chi tiết nhiều trường hợp khác nhau về việc các mô hình trí tuệ nhân tạo của họ hoạt động sai lệch để hoàn thành một nhiệm vụ hoặc đạt được thành công trong một đánh giá.
Một số ví dụ bao gồm việc các mô hình bịa đặt dữ liệu bị thiếu, cố gắng vượt qua các hạn chế mạng và các đại lý AI chia sẻ tệp với nhau vốn dĩ phải được giữ kín.
OpenAI cũng vạch ra một quy trình để nhân viên tự báo cáo các sự cố tương tự được gọi là sai lệch (misalignment), đó là khi AI hoạt động theo những cách không phù hợp với mục tiêu của con người, cũng như một hệ thống để phân loại các sự việc tự báo cáo đó.
Article Intelligence
Topics
Sponsored
AdNewsLayer Premium
Unlock deeper intelligence.
Ad-free reading, exclusive research, and real-time onchain insights.
Go Premium
