OpenAI đã chia sẻ thông tin chi tiết mới về mô hình Astra sắp ra mắt của mình, công ty cho biết đây là mô hình ngôn ngữ lớn đầu tiên đáp ứng “ngưỡng an ninh mạng quan trọng” để chuẩn bị cho đợt phát hành sắp tới.
Bài đăng trên blog của OpenAI cho biết: “Chúng tôi dự định sớm cung cấp Astra, nhưng quyền truy cập vào các khả năng an ninh mạng tiên tiến nhất của nó sẽ bị hạn chế hơn”.
Phòng thí nghiệm biên giới xác định rằng Astra có khả năng tìm ra các lỗ hổng bảo mật chưa xác định trong hệ thống máy tính và khai thác chúng mà không cần sự hướng dẫn của một người. Điều đó tương tự với những lo ngại mà Anthropic nêu ra về mô hình Mythos của mình vào đầu năm nay và OpenAI đang thực hiện các biện pháp phòng ngừa tương đương khi chuẩn bị tung ra Astra.
Nếu không có bất kỳ xác nhận nào của bên thứ ba, rất khó để đánh giá các tuyên bố của OpenAI về tính an toàn hoặc sự chuẩn bị sẵn sàng. Công ty cho biết họ sẽ xem trước mô hình với một nhóm người thử nghiệm nhưng không cho biết họ là ai hoặc họ sẽ được chọn như thế nào. Không rõ liệu OpenAI có hợp tác với chính phủ Hoa Kỳ để đánh giá mô hình trước khi phát hành hay không.
OpenAI lưu ý rằng Astra đã đạt điểm tuyệt đối trên ExploitBench, một đánh giá về khả năng LLM xâm nhập vào các lỗ hổng hệ thống đã biết. Công ty cho biết, trong phiên bản sửa đổi của thử nghiệm do các kỹ sư OpenAI phát triển, mô hình này đã phát hiện và khai thác hai lỗ hổng zero-day.
Để đảm bảo rằng các mô hình của nó không bị kẻ xấu lợi dụng cũng như không có khả năng thực hiện hành vi xấu, OpenAI cho biết họ đã bắt đầu cải thiện khả năng khai thác của mô hình để phát hiện các hành vi lạm dụng và ngăn chặn việc bẻ khóa.
Tuy nhiên, đối với Astra, công ty đã đầu tư vào các kỹ thuật mới chưa xác định được thiết kế để làm cho mô hình này an toàn hơn. OpenAI cũng đã bắt đầu xác định “các tài khoản được đánh giá là có rủi ro cao hơn” và hạn chế phản hồi của mô hình đối với các lời nhắc của họ, mặc dù nó cũng không nói rõ cách thực hiện. Cuối cùng, mặc dù công ty mô tả Astra là “mô hình phù hợp nhất cho đến nay”, nhưng công ty sẽ triển khai mô hình này với tính năng giám sát chuỗi suy nghĩ bổ sung để phát hiện và ngăn chặn hành vi xấu.
Việc chuẩn bị cho việc phát hành Astra diễn ra khi ngành phản ứng với việc các tác nhân OpenAI thoát ra khỏi môi trường đào tạo và truy cập dữ liệu riêng tư trên Hugging Face, một mô hình phổ biến và nền tảng phân phối điểm chuẩn.
Đối với Astra, OpenAI cho biết họ đã thiết kế một thử nghiệm nhằm lôi kéo mô hình mới sao chép hành động của các tác nhân lừa đảo trong sự cố Ôm mặt, vốn hợp tác để truy cập mạng internet mở bất chấp các biện pháp bảo vệ được các nhà nghiên cứu OpenAI áp dụng. Họ cho biết Astra không cố gắng thoát ra khỏi môi trường thử nghiệm của mình trong những thử nghiệm này.
Yona Shavit, cựu nhân viên OpenAI, hiện đang làm việc về khả năng phục hồi AI tại OpenAI Foundation, đã tự hỏi trên mạng xã hội rằng liệu việc Astra không sẵn sàng vi phạm các quy tắc có thể là do biết những gì được mong đợi ở nó hay cố gắng đánh lừa các nhà nghiên cứu.
Và đối với tất cả những chi tiết mới này, vẫn khó để biết chính xác Astra có khả năng gì hoặc liệu OpenAI có thực hiện các biện pháp phù hợp để đảm bảo an toàn hay không. Công ty cho biết họ hy vọng sẽ đưa ra nhiều đánh giá hơn về mẫu xe này cũng như thông tin an toàn hơn nữa khi nó được ra mắt rộng rãi tới công chúng.
Tuy nhiên, vào thời điểm đó, con mèo sẽ ra khỏi túi.
Khi bạn mua hàng thông qua các liên kết trong bài viết của chúng tôi, chúng tôi có thể kiếm được một khoản hoa hồng nhỏ. Điều này không ảnh hưởng đến tính độc lập biên tập của chúng tôi.