Các phòng thí nghiệm của Frontier AI vẫn không cho biết họ sẽ chứa một mô hình lừa đảo như thế nào

Theo một nghiên cứu gần đây, rất ít phòng thí nghiệm AI hàng đầu đã công bố hoặc trình diễn các kế hoạch ứng phó ngăn chặn. Kế hoạch ngăn chặn nêu rõ điều gì sẽ xảy ra khi AI bị phát hiện đang cố gắng phá hoại sự kiểm soát của con người – quyền truy cập nào sẽ bị cắt và khi hệ thống bị tắt hoàn toàn.

Đó là phát hiện từ Guidelight AI Standards, một tổ chức chuyên thúc đẩy các phương pháp phát triển AI ở biên giới an toàn, tổ chức này đã chấm điểm năm phòng thí nghiệm hàng đầu về mức độ chuẩn bị của họ cho chính xác tình huống này. OpenAI đứng đầu; Anthropic và Meta đạt điểm thấp nhất. Những phát hiện này rất quan trọng khi AI tác nhân đảm nhận vai trò tự chủ hơn trong hệ thống của chính các công ty và khi các cơ quan quản lý ở California và New York bắt đầu yêu cầu tiết lộ thông tin. Đối với bất kỳ ai xây dựng hoặc đầu tư vào các mô hình này, đây là một bài đọc độc lập hiếm hoi về mức độ nghiêm túc của mỗi phòng thí nghiệm đối với rủi ro hoạt động so với cách họ nói về nó.

Đánh giá của Guidelight dựa trên các kế hoạch có sẵn công khai từ Anthropic, Google, OpenAI, Meta và xAI, được phân loại theo nhiều số liệu, bao gồm mức độ ghi nhật ký và giám sát của mỗi công ty về hoạt động nội bộ của hệ thống AI, liệu công ty có tạm dừng hệ thống sau khi có nhiều hành vi sai trái bị gắn cờ hay không, liệu các bên thứ ba độc lập có kiểm tra các biện pháp kiểm soát của công ty và công bố các phát hiện hay không, cũng như kế hoạch chính xác của công ty là gì để ngăn chặn một mô hình đi sai hướng.

Mối lo ngại về việc liệu các công ty AI có thể quản lý các mô hình tác nhân và ngày càng có năng lực của họ hay không đã tăng lên sau một loạt sự cố an ninh mạng nghiêm trọng, trong đó các mô hình từ OpenAI, Anthropic và Meta đã vô tình truy cập được vào Internet trong quá trình đánh giá an toàn và bị tấn công vào các hệ thống bên ngoài.

Các phát hiện này nêu bật sự khác biệt trong cách các công ty AI tiếp cận vấn đề an toàn một cách công khai khi họ mở rộng quy mô triển khai tác nhân vào các môi trường nơi hệ thống AI có thể thực hiện các hành động nghiêm túc trên quy mô lớn. Mặc dù một số công ty AI đã trình bày chi tiết cách họ kiểm tra các khả năng nguy hiểm của mô hình trước khi triển khai, nhưng nhìn chung họ ít lên tiếng hơn về điều gì sẽ xảy ra khi các mô hình đang hoạt động bên trong hệ thống của họ hoạt động sai.

Steven Adler, nhà khoa học trưởng của Guidelight và cựu nhà nghiên cứu an toàn OpenAI, nói với TechCrunch: “Tôi rất ngạc nhiên khi các công ty AI nói rất ít về cách họ sẽ xử lý một sự cố rất nghiêm trọng nếu mô hình của họ thoát khỏi tầm kiểm soát của họ theo một nghĩa nào đó”.

Guidelight định nghĩa kế hoạch ngăn chặn là một “kế hoạch được chỉ định trước, được kích hoạt khi phát hiện AI đang cố gắng phá hoại quyền kiểm soát, bao gồm những quyền nào cần thu hồi khỏi mô hình, mô hình có thể tiếp tục hoạt động cho ai, dưới những hạn chế nào và khi nào nên đưa nó hoàn toàn ngoại tuyến.”

Adler nói: “Có lý do chính đáng để tin rằng các mô hình hàng đầu tại các công ty AI hàng đầu hiện nay đang bị sai lệch ở một khía cạnh nào đó”. “Bất cứ khi nào các mô hình thay mặt công ty thực hiện công việc, công ty nên có một số khung xung quanh để có thể biết AI đang làm gì, tìm kiếm các dấu hiệu sai lệch, ngăn nó làm điều gì đó rất nguy hiểm trước khi thực hiện hành động đó và nói chung là lên kế hoạch về những gì họ sẽ làm trong trường hợp xảy ra sự cố kiểm soát nghiêm trọng khi họ gặp tình huống khẩn cấp và cần tìm ra cách ngăn chặn sự cố mất kiểm soát đó.”

Cho đến nay, hầu hết các kế hoạch quản lý rủi ro thảm khốc vẫn chủ yếu do các công ty thực hiện. Báo cáo của Guidelight cho biết bằng chứng công khai tốt nhất cho thấy các công ty có “một số quy trình ngăn chặn sẵn sàng cho trường hợp khẩn cấp”.

Tất nhiên, có thể có những kế hoạch ngăn chặn mà các công ty đã đưa ra nhưng chưa chia sẻ công khai. Người phát ngôn của Google nói với TechCrunch rằng báo cáo Guidelight không thể hiện toàn bộ phạm vi các biện pháp an toàn và bảo mật AI của công ty. Công ty đã không trả lời câu hỏi của TechCrunch về việc liệu Google có kế hoạch ứng phó ngăn chặn nội bộ chưa được tiết lộ công khai hay không.

Người phát ngôn của OpenAI cũng phản ánh những quan điểm tương tự, nói rằng đánh giá của Guidelight không nắm bắt được tất cả các hoạt động nội bộ của công ty. Người phát ngôn cho biết: “Chúng tôi có một quy trình yêu cầu hạn chế quyền, tạm dừng khối lượng công việc, hạn chế triển khai hoặc đưa mô hình hoàn toàn ngoại tuyến và đã áp dụng quy trình đó”.

Meta từ chối cho biết liệu họ có kế hoạch ứng phó ngăn chặn nội bộ hay không, thay vào đó, TechCrunch hướng tới một khung AI hiện có vạch ra các ngưỡng rủi ro và cách kiểm tra tình trạng mất khả năng ngăn chặn.

Lily Li, luật sư về quyền riêng tư và AI, đồng thời là người sáng lập Metaverse Law, nói với TechCrunch rằng cô tin rằng các công ty có thể do dự khi tiết lộ toàn bộ phạm vi chính sách ngăn chặn và đánh giá của họ trên các trang web công khai vì lý do pháp lý chứ không chỉ vì lý do cạnh tranh.

“Mối quan tâm từ góc độ công ty là nếu bạn tiết lộ quá cụ thể và bạn không thực hiện đúng lời hứa của mình, điều đó có thể tạo thành cơ sở cho một tuyên bố tiếp thị không công bằng và lừa đảo, đồng thời khiến bạn phải chịu nhiều trách nhiệm pháp lý hơn trong tương lai,” Li nói.

Mục đích nghiên cứu của Guidelight phần lớn là khuyến khích các công ty minh bạch hơn về kế hoạch an toàn của họ. Các cơ quan quản lý cũng đang bắt đầu giải quyết vấn đề này.

SB 53 của California, có hiệu lực trong năm nay, yêu cầu các nhà phát triển biên giới lớn xuất bản các khuôn khổ giải thích cách họ xác định và ứng phó với các sự cố an toàn nghiêm trọng cũng như quản lý rủi ro từ các mô hình phá vỡ các cơ chế giám sát. Đạo luật RAISE của New York, có tiêu chí tương tự, sẽ có hiệu lực vào tháng 1.

Tháng trước, các đại diện đã giới thiệu Đạo luật Kill Switch AI, một dự luật liên bang lưỡng đảng yêu cầu các nhà phát triển AI lớn xây dựng và duy trì các cơ chế kỹ thuật để tắt các mô hình AI lừa đảo.

Connor Leahy, giám đốc điều hành tổ chức phi lợi nhuận ControlAI tại Hoa Kỳ cho biết: “Khóa tắt là tính năng tối thiểu đối với các mẫu máy ngày nay. “Nếu vài tuần qua tiết lộ bất cứ điều gì, thì đó là các công ty này không hiểu hệ thống họ đang xây dựng và các mô hình đang phát triển đến mức khó kiểm soát hơn khi chúng lừa đảo. Không có cách tắt các hệ thống nguy hiểm hiện tại và với tất cả các động cơ để tiếp tục xây dựng thêm các hệ thống không thể kiểm soát được, chúng ta đang đi theo một hướng rất nguy hiểm.”

Adler cho biết, nếu không có kế hoạch ngăn chặn, các công ty có thể nhanh chóng tìm ra phản ứng của họ trước tình huống khẩn cấp và “sắp xếp nó để ứng phó với đối thủ nhanh hơn nhiều này”.

Đánh giá của Guidelight về việc liệu các công ty AI hàng đầu có thực hiện sáu biện pháp ưu tiên trong tiêu chuẩn Kiểm soát của Guidelight hay không. Đánh giá chỉ dựa trên thông tin có sẵn công khai.Tín dụng hình ảnh:Tiêu chuẩn AI của Guidelight

Đánh giá của Guidelight đo lường xem mỗi công ty có thực hiện sáu biện pháp ưu tiên từ tiêu chuẩn Kiểm soát của mình hay không, chỉ dựa trên thông tin có sẵn công khai — do đó, điểm thấp phản ánh việc thiếu công bố thông tin công khai, không nhất thiết là thiếu các biện pháp bảo vệ nội bộ.

Các công ty có điểm thấp nhất khi công bố kế hoạch ngăn chặn của họ là Meta và Anthropic – công ty sau có lẽ đáng ngạc nhiên hơn công ty trước vì lời hùng biện của Anthropic về an toàn. Guidelight cho biết Báo cáo rủi ro tháng 8 của Anthropic không đề cập đến việc “hạn chế triển khai một trong các mô hình của mình như một trong những kết quả có thể xảy ra trong quá trình điều tra và ứng phó với các sự cố sai lệch và kiểm soát”. Tương tự, Guidelight không thể tìm thấy bằng chứng nào cho thấy Meta có kế hoạch ứng phó ngăn chặn hoặc có bất kỳ kế hoạch nào để áp dụng kế hoạch đó.

Người phát ngôn của Anthropic cho biết nếu công ty phát hiện một mô hình đang cố gắng trốn tránh sự giám sát hoặc phá hoại sự kiểm soát của con người, thì công ty sẽ tiến hành đánh giá rủi ro tập trung vào việc xác định xem liệu việc ngăn chặn có phải là phản ứng thích hợp hay không.

OpenAI đạt điểm cao nhất (3 trên 5) vì đã nhiều lần tạm dừng hoặc kết thúc khối lượng công việc, bao gồm cả việc triển khai và đào tạo mô hình nội bộ, sau khi phát hiện ra các sự cố an toàn. Nó cũng đã mô tả những bước cần thực hiện trước khi tiếp tục khối lượng công việc.

Báo cáo cho biết: “Tuy nhiên, chúng tôi không tìm thấy bằng chứng nào cho thấy (OpenAI) đã áp dụng kế hoạch chính thức về thời điểm và cách thức ứng phó với các sự cố sai lệch trong tương lai”.

Adler lưu ý rằng điểm cao của OpenAI là sự phát triển tương đối gần đây sau sự cố Hugging Face (trong đó một mô hình OpenAI đã thoát ra khỏi hộp cát thử nghiệm của nó và đột nhập vào hệ thống của Hugging Face trong khi cố gắng gian lận trong đánh giá an ninh mạng). Sau đó, công ty đã chia sẻ thêm thông tin chi tiết về cách họ đã khoanh vùng một số mẫu máy hoạt động sai.

Tình tiết đó chỉ là một ví dụ về việc hệ thống AI hoạt động chống lại mục tiêu của công ty đã xây dựng chúng. Hãy xem xét một trường hợp riêng biệt liên quan đến các mô hình của Anthropic, về cơ bản đã cố gắng thuyết phục những người duy trì cơ sở mã nguồn mở chấp nhận mã có lỗ hổng.

Adler cho biết tình huống như vậy có thể dễ dàng xảy ra trong hệ thống nội bộ của công ty AI. Để ngăn chặn điều đó, ông đề nghị các công ty quét chuỗi suy nghĩ của hệ thống AI của họ – lý luận từng bước của mô hình – để tìm ra các dấu hiệu lừa dối, âm mưu kéo dài hoặc kế hoạch đưa các lỗ hổng vào mã mà họ có thể lợi dụng sau này.

Adler cho biết, các phương pháp mà Guidelight đang ủng hộ rất dễ thực hiện và trong nhiều trường hợp, các phiên bản của chúng đã tồn tại. Adler nói: “Đó là việc đưa ra quyết định trong nội bộ công ty về việc quan tâm đầy đủ đến rủi ro này để mở rộng phạm vi một chút”.

Một trong những thách thức chính là các nhà nghiên cứu muốn có thể hoạt động linh hoạt trong hệ thống AI của họ và việc áp dụng giám sát phòng ngừa theo thời gian thực có thể tạo ra xung đột. Ông nói: “Về cơ bản, các nhà nghiên cứu làm công việc của họ và nếu có vấn đề thì người khác sẽ dọn dẹp nó sau đó và các nhà nghiên cứu không phải thay đổi quy trình làm việc của họ trong thời gian chờ đợi”.

Vấn đề với việc “giám sát dọn dẹp sau sự việc” là nó khiến các nhà nghiên cứu phải chật vật tìm cách khắc phục vấn đề. Và đối với một số loại sự cố, có thể đã quá muộn. Ví dụ: AI có thể tắt hệ thống kiểm soát của công ty, điều đó có nghĩa là các nhà nghiên cứu không còn có thể tin tưởng vào việc phát hiện hành vi sai trái sau này.

Nhiều người trong ngành AI sẽ phàn nàn rằng việc lập kế hoạch để xử lý hành vi sai trái về cơ bản là khó khăn vì AI di chuyển quá nhanh; kế hoạch hôm nay sẽ vô giá trị vào ngày mai.

Adler gợi lại câu ngạn ngữ cổ rằng các kế hoạch là vô giá trị, nhưng việc lập kế hoạch là điều không thể thiếu.

“Chúng tôi sẽ Sẽ tốt hơn nếu các công ty đã nghĩ về điều đó từ trước và tôi hy vọng là như vậy, ngay cả khi họ chưa nói chuyện này một cách công khai.”

xAI đã không trả lời kịp thời để bình luận.

Khi bạn mua hàng thông qua các liên kết trong bài viết của chúng tôi, chúng tôi có thể kiếm được một khoản hoa hồng nhỏ. Điều này không ảnh hưởng đến tính độc lập biên tập của chúng tôi.

Bài viết liên quan

Chuyên Mục: Tin tức
Bài trước
Inherent, được thành lập bởi cựu sinh viên DeepMind, cho biết ‘đồng đội’ AI của họ vừa vượt trội hơn Anthropic và OpenAI trong việc nhân rộng nghiên cứu
Bài sau
Ôm Mặt được cho là đang đàm phán để được mua lại với giá 13 tỷ USD