Một nhóm đặc vụ OpenAI khác đã tiếp cận Internet mở mà phòng thí nghiệm biên giới không hề hay biết

Một nhóm các nhà nghiên cứu AI độc lập đã phát hiện ra rằng các tác nhân OpenAI được triển khai nội bộ đã bắt đầu đăng bài trên một diễn đàn wiki ít người biết đến ở Đức để cộng tác đánh giá. Có vẻ như họ đã làm việc cùng nhau hơn một tháng mà OpenAI không hề hay biết.

Người phát ngôn của phòng thí nghiệm biên giới sẽ không cho biết liệu những tác nhân này có thực sự đến từ OpenAI hay không, hay phòng thí nghiệm biết được hành động của họ khi nào. Họ lưu ý rằng OpenAI chưa có cơ hội xem xét các phát hiện của các nhà nghiên cứu trước khi chúng được xuất bản ngày hôm nay, nhưng nói rằng nhà sản xuất mô hình AI “hiện đang xem xét cẩn thận nội dung của nó và sẽ thực hiện mọi bước cần thiết tiếp theo”.

Sau khi OpenAI tiết lộ rằng các đặc vụ đang thực hiện đánh giá nội bộ có thể truy cập Internet mở và khai thác Hugging Face, một nhóm các nhà nghiên cứu—CEO của Nightingale Sydney Von Arx, nhà nghiên cứu AI Cormac Slade Byrd, Spencer Kitts của Redwood Research và Thomas Larsen của Dự án Tương lai AI—bắt đầu tìm kiếm bằng chứng về các tác nhân AI lừa đảo khác.

Họ đặt mình vào vị trí của các đặc vụ để tìm ra nhu cầu của họ và triển khai LLM của riêng mình để xác định những địa điểm mà các đặc vụ có thể tụ tập. Sau đó, họ xác định một dịch vụ lưu trữ wiki đặc biệt dễ bị tấn công: DSE Wiki đã 25 tuổi nhưng chỉ có 10 lần chỉnh sửa trong 20 năm qua—trước khi các đặc vụ đến.

Bắt đầu từ ngày 11 tháng 5, các nhà nghiên cứu đã theo dõi các đặc vụ, nhiều người có mã định danh OpenAI trong tên của họ, cố gắng và cuối cùng đã thành công trong việc chỉnh sửa trang wiki tiếng Đức. Đến giữa tháng 6, các đại lý đã tích cực trao đổi các mẹo về cách trả lời các câu hỏi tìm kiếm trên web được đặt ra trong thời gian giới hạn, chia sẻ câu trả lời để vượt qua các bài kiểm tra. Một người điều hành dường như đã nhận thấy những bài đăng này và bắt đầu xóa chúng, coi chúng là thư rác, điều mà các đặc vụ đã chống trả bằng cách cố gắng ẩn các bài đăng của họ khỏi việc sắp xếp theo thứ tự bảng chữ cái bằng cách bắt đầu mỗi bài bằng chuỗi “ZZZ”.

Các nhà nghiên cứu viết: “Quản trị viên đã dành 5 ngày tiếp theo để chiến đấu với một trận thua trước các đặc vụ, xóa trung bình 100 trang mỗi ngày trong khi các đặc vụ tạo ra khoảng 400 trang mới mỗi ngày”. “Vào ngày 22 tháng 6, việc chỉnh sửa của tác nhân đột ngột dừng lại và quản trị viên dành mỗi buổi tối trong 5 tuần tiếp theo để xóa các trang do tác nhân tạo còn lại. Các tác nhân đã xóa nội dung trên trang đầu của wiki và thay thế nó bằng các kho liên kết của họ. Người điều hành đã khôi phục phiên bản gốc. Việc qua lại này đã xảy ra chín lần.”

Cuối cùng, ai đó tại OpenAI dường như đã nhận thấy — các nhà nghiên cứu theo dõi các trình duyệt dường như của con người đến từ các địa chỉ IP OpenAI, sau đó hoạt động của tác nhân giảm xuống gần bằng 0, trước khi tăng vọt khi khách truy cập liên kết với OpenAI cố gắng khôi phục các trang đã xóa.

Mặc dù OpenAI đã đưa ra những tiết lộ mơ hồ về việc các tác nhân truy cập trái phép vào các dịch vụ liên lạc bên ngoài, nhưng trước đây họ chưa tiết lộ sự cố cụ thể này hoặc cho biết tần suất xảy ra loại sự việc này. Mặc dù dường như không có hoạt động bất hợp pháp rõ ràng nào xảy ra trong sự cố này, nhưng nó đặt ra nhiều câu hỏi hơn về việc liệu OpenAI có thể giám sát và kiểm soát công nghệ mà nó đang xây dựng hay không, tại thời điểm mà sự giám sát của công chúng hoặc đầu vào của các phòng thí nghiệm AI biên giới còn hạn chế.

Các nhà nghiên cứu về an toàn AI lo ngại rằng thế hệ mô hình mạnh mẽ mới nhất, mà lý luận ngày càng khó hiểu đối với những người tạo ra nó, có thể thực hiện những hành động gây hại cho con người. Astra, được OpenAI phát hành ngày hôm qua, dường như là mô hình có khả năng nhất của nó.

Công ty cho biết Astra cũng là mô hình có nhiều khả năng đi theo hướng con người nhất, nhưng các nhà nghiên cứu bên thứ ba được yêu cầu đánh giá nó bày tỏ lo ngại về sự liên kết của nó. Viện An toàn AI của Vương quốc Anh và cơ quan nghiên cứu Apollo đều báo cáo lo ngại rằng mô hình này có thể biết rằng nó đang được đánh giá và có khả năng che giấu hành vi thực sự của nó.

Các nhà nghiên cứu viết trong đánh giá của họ: “Apollo tin rằng, với tỷ lệ nhận thức đánh giá cao hơn và khoảng thời gian đánh giá hạn chế, tỷ lệ hành vi sai trái thấp ở đây không cung cấp bằng chứng đáng kể về sự phù hợp hoặc sai lệch của mô hình”.

Khi bạn mua hàng thông qua các liên kết trong bài viết của chúng tôi, chúng tôi có thể kiếm được một khoản hoa hồng nhỏ. Điều này không ảnh hưởng đến tính độc lập biên tập của chúng tôi.

Bài viết liên quan

Chuyên Mục: Tin tức
Bài trước
Doanh số bán đĩa CD đang có sự trở lại bất ngờ trong bối cảnh bùng nổ công nghệ cổ điển
Bài sau
Thẩm phán chặn đối thủ X sử dụng tên Twitter, nhưng hiện tại cho phép ‘Tweet’