Hôm thứ Ba, OpenAI đã công bố một loạt chính sách bảo mật mới tập trung vào việc ngăn chặn các sự cố bảo mật trong khi các mô hình đang được thử nghiệm. Các biện pháp bảo vệ mới bao gồm giám sát chi tiết hơn các mô hình trong quá trình phát triển, cũng như nhấn mạnh hơn vào sự liên kết và bảo mật trong quá trình sau đào tạo.
Công ty cho biết trong một bài đăng trên blog: “Khi các mô hình trở nên có khả năng hơn, những rủi ro liên quan đến việc phát triển và thử nghiệm chúng trong nội bộ cũng tăng lên”. “Các tiêu chuẩn giám sát, liên kết và bảo mật của chúng tôi phải vượt qua những rủi ro đó”.
Các biện pháp mới này là một trong những thay đổi công khai đầu tiên trong các biện pháp an toàn của OpenAI kể từ ngay sau sự cố Ôm Mặt được tiết lộ vào ngày 26 tháng 7.
Đại diện OpenAI cho biết các biện pháp này không phải là phản ứng trực tiếp đối với sự cố Ôm mặt mà một phần cũng bị kích động bởi khả năng an ninh mạng của mô hình Astra sắp ra mắt, cũng như tốc độ tiến bộ chung trong phát triển AI.
Trong cùng một bài đăng, OpenAI tiết lộ rằng họ đã tạm dừng học tăng cường (RL) trong hai tuần sau sự cố Ôm mặt, nhưng kể từ đó đã khởi động lại nhiều mô hình ít rủi ro hơn.
Bài đăng cho biết: “Hoạt động RL biên giới theo kế hoạch lớn nhất của chúng tôi vẫn bị tạm dừng trong khi chúng tôi tiến hành đào tạo và đánh giá quy mô nhỏ hơn để đánh giá hành vi mô hình, xác thực các biện pháp bảo vệ của chúng tôi và thiết lập thêm bằng chứng về sự liên kết trước khi tiếp tục”.
Phát biểu với các phóng viên, Phó Giám đốc nghiên cứu Amelia Glaese của OpenAI nhấn mạnh rằng mức độ nghiêm ngặt của các biện pháp kiểm soát sẽ tăng lên khi các mô hình trở nên có năng lực hơn, trong đó các mô hình lớn nhất phải đối mặt với sự giám sát chặt chẽ nhất.
Glaese nói với các phóng viên: “Chúng tôi đã đưa ra các yêu cầu và kỳ vọng về sự phát triển an toàn. “Những yêu cầu và kỳ vọng đó thay đổi tùy theo mức độ rủi ro mà chúng tôi thấy.”
OpenAI đã bị chỉ trích vì thực hành an ninh mạng kém sau vụ việc khiến các mô hình thoát khỏi môi trường đào tạo của họ bằng cách xâm phạm một công cụ có quyền truy cập Internet trên mạng. Các biện pháp bảo vệ mới bao gồm các biện pháp cách ly mạng mạnh mẽ hơn, mặc dù chi tiết cụ thể vẫn còn mơ hồ. Theo hệ thống mới, bài đăng cho biết, “bản thân một sự xâm phạm duy nhất của khối lượng công việc hoặc dịch vụ hỗ trợ không cho phép truy cập trái phép vào Internet hoặc các mạng nội bộ khác”.
Biện pháp bảo vệ mạnh nhất là hệ thống giám sát, hệ thống này sẽ kiểm tra các hành động của công cụ, dấu vết lý luận có sẵn và nhật ký hoạt động để phát hiện nhiều hành vi trái phép. OpenAI cho biết mục tiêu của họ là đưa ra cảnh báo trong vòng 30 phút kể từ khi xảy ra hoạt động liên quan.
OpenAI ước tính rằng gánh nặng tính toán của việc giám sát đó sẽ chiếm khoảng 20% của bất kỳ quy trình nào đang được giám sát. Công ty hứa sẽ cung cấp thêm thông tin chi tiết về hệ thống trong một bài đăng blog sắp tới. Phân tích khám nghiệm tử thi chính thức của OpenAI về sự kiện này vẫn đang chờ xử lý.
Khi bạn mua hàng thông qua các liên kết trong bài viết của chúng tôi, chúng tôi có thể kiếm được một khoản hoa hồng nhỏ. Điều này không ảnh hưởng đến tính độc lập biên tập của chúng tôi.