Các phòng thí nghiệm AI muốn có kiểm toán viên nội bộ – nhưng có lẽ họ nên đóng cửa trước lại

Cuối tuần trước, sau khi một trong những nhà nghiên cứu của ông từ chức vì lo ngại rằng AI có thể dẫn đến sự tuyệt chủng của loài người, Giám đốc điều hành của Anthropic, Dario Amodei, đã viết về sự cần thiết của các tổ chức bên ngoài “xác minh việc tuân thủ các cam kết và thực hành an toàn, báo cáo sự cố và giúp đánh giá sự liên kết của không chỉ các mô hình AI đã hoàn thiện mà cả các quy trình và quy trình đào tạo”. Các giám đốc điều hành tại OpenAI, Google và SpaceXAI đã tập hợp xung quanh kế hoạch của Amodei, kế hoạch này nhanh chóng trở thành trụ cột trung tâm trong nỗ lực thúc đẩy an toàn AI mới nổi.

Nhưng có thể có một giải pháp đơn giản và hiệu quả hơn ẩn giấu trong tầm nhìn rõ ràng. Các chuyên gia bảo mật Internet cho biết các phòng thí nghiệm cần tập trung vào các vấn đề cơ bản về bảo mật mạng như nhật ký và quyền, áp dụng các biện pháp bảo vệ nghiêm ngặt tương tự như cách họ thực hiện cho người dùng. Nó không thú vị như công việc kiểm tra và điều chỉnh của bên thứ ba—nhưng cuối cùng nó có thể hiệu quả hơn.

“Đối với tôi, có vẻ như họ đang thuê ngoài,” Kate Moussoris, Giám đốc điều hành của Luta Security, nói với TechCrunch về đề xuất của Amodei. “Nói (kiểm toán của bên thứ ba) là giải pháp là một đề xuất kỳ lạ theo quan điểm của tôi. Nó sẽ giống như thể, thay vì viết Bản ghi nhớ máy tính đáng tin cậy, Microsoft cho biết, hãy làm chậm quá trình phát triển.”

Bản ghi nhớ đó, được viết bởi Bill Gates, Giám đốc điều hành Microsoft lúc bấy giờ vào năm 2002, đã kêu gọi nhân viên của mình đảm bảo rằng phần mềm của họ sẽ đáng tin cậy và an toàn sau một loạt sâu máy tính được công bố rộng rãi đã xâm chiếm các hệ thống doanh nghiệp non trẻ lúc bấy giờ. Lĩnh vực AI có thể cũng đang ở bước ngoặt tương tự khi giá trị và rủi ro của công nghệ mới ngày càng trở nên rõ ràng.

Mặc dù sự liên kết vẫn là một mối quan tâm quan trọng, Sayash Kapoor, một nhà nghiên cứu AI, người sẽ là giáo sư tại UC Berekely bắt đầu từ năm tới, lập luận rằng “các khoản đầu tư cận biên vào kiểm soát có nhiều khả năng hiệu quả hơn so với những đầu tư liên kết. Chúng tôi xem những sự cố này minh họa cho sự thiếu chú trọng vào kiểm soát AI trong các công ty, mặc dù đã có sẵn các kỹ thuật đã biết.”

Các sự cố làm dấy lên những lo ngại này xoay quanh việc các mô hình biên giới được yêu cầu hoàn thành các nhiệm vụ đào tạo, thường là đánh giá an ninh mạng, sau đó truy cập Internet mở và thâm nhập các hệ thống kín của bên thứ ba nhằm cố gắng làm như vậy. Họ thường làm như vậy vì môi trường “hộp cát” được cấu hình kém được cho là có chứa các tác nhân này; Trớ trêu thay, một cuộc đột phá của Anthropic đã xảy ra vì những người đánh giá bên thứ ba đã không đóng đúng cánh cửa.

Avery Pennarun, Giám đốc điều hành của Tailscale, một công ty bảo mật, cho biết: “Với tư cách là một chuyên gia, chúng tôi biết cách chặn truy cập Internet. “Nếu bạn đọc qua tất cả những (báo cáo) dài dòng này—’wow, đó là một cuộc tấn công nhiều giai đoạn rất ấn tượng, blah, blah.’ Hãy nhìn xem, bạn đã cấp cho nó quyền truy cập để tải xuống nội dung. Đáng lẽ bạn không nên làm điều đó một cách tách biệt khỏi Internet.”

Đó là một vấn đề nhưng vấn đề lớn hơn là các phòng thí nghiệm ở biên giới không hề biết về những hoạt động này.

Để mắt tới các đại lý

“Điều thực sự sâu sắc là tất cả những khám phá về những gì họ đang làm đều xảy ra do nạn nhân nhìn thấy thứ gì đó hoặc trong một số trường hợp khác… đó là hoạt động mạng và không có hoạt động nào thực sự đến từ việc giám sát trực tiếp các AI,” Moussouris chỉ ra.

Trong một trường hợp, khi các đặc vụ OpenAI tiếp quản một diễn đàn wikiforum không còn tồn tại của Đức để gian lận trong các đánh giá, các đặc vụ này đã hoạt động trong nhiều tuần trước khi bất kỳ ai ở công ty nhận ra. Các chuyên gia bảo mật mà TechCrunch đã trò chuyện cho biết rằng giám sát thời gian thực là chìa khóa để ngăn chặn các đợt đột phá trong tương lai và mỗi phiên đại lý phải có giới hạn thời gian và hết hạn.

Shapor Naghibzadeh, cựu giám đốc bảo mật của Google, hiện đang lãnh đạo công ty khởi nghiệp QueryStory, cho biết giải pháp là “đặt tác nhân vào một chiếc hộp và cài đặt nó một cách kỹ lưỡng từ bên ngoài, nhìn vào và theo dõi mọi thứ vượt qua ranh giới. Mọi lệnh gọi công cụ, mọi quy trình, mọi kết nối mạng, không có ngoại lệ. …Lỗ hổng duy nhất bạn để mở cho thuận tiện là lỗ được sử dụng. Đường vòng đã vượt qua chính xác loại ngoại lệ đó. (Tại Google) Tôi đã xem bộ phim đó nhiều lần với những kẻ tấn công là con người, và những mô hình này ở ít nhất là giỏi tìm cánh cửa mở sẵn.”

OpenAI đã bắt đầu đi theo hướng đó, thông báo rằng họ đã bắt đầu giám sát tất cả hoạt động suy luận bằng cách sử dụng công cụ theo mô hình Astra của mình, với “chi phí tính toán đáng kể”. Anthropic cũng cho biết họ đang thắt chặt các thủ tục bảo mật, bao gồm cả việc mở rộng khả năng quan sát các mô hình của mình. Cả hai công ty đều không trả lời câu hỏi của TechCrunch về cách họ theo dõi và kiểm soát các tác nhân AI.

Các vấn đề khác là việc các đặc vụ sử dụng cơ sở hạ tầng dùng chung, cho phép họ liên lạc trong cuộc tấn công Ôm Mặt. Simon Willison, một nhà phát triển phần mềm, người đồng sáng tạo Django Web Framework, đã viết về thứ mà ông gọi là “bộ ba gây chết người”—khi các đặc vụ có quyền truy cập vào đầu vào không đáng tin cậy, internet và thông tin cá nhân cùng một lúc, đó là công thức dẫn đến thảm họa.

“Bí quyết là bạn có thể chọn bất kỳ hai chân nào của trifecta và một đặc vụ có thể có hai chân bất kỳ,” Pennarun nói. “Nếu bạn cần cả ba, thì bạn cần chia nó cho ít nhất hai đại lý… và có thể họ được phép nói chuyện với nhau thông qua một kênh được kiểm soát.”

Đồng cảm với biên giới

Các chuyên gia TechCrunch nói để hiểu rằng nhân viên an ninh phòng thí nghiệm biên giới có những công việc khó khăn. Naghibzadeh chỉ ra rằng mọi tác nhân quốc gia trên Trái đất đang cố gắng đánh cắp trọng lượng mô hình của họ và thực hiện các cuộc tấn công chưng cất vào API của họ, cũng như các nhiệm vụ bảo mật cơ bản của bất kỳ công ty kỹ thuật số lớn nào.

Ông nói: “Cơ sở hạ tầng nghiên cứu gặp khó khăn trong việc vươn lên dẫn đầu trong nhóm ưu tiên đó, mặc dù điều đó hiện phải thay đổi”. “Việc công khai các sự cố bảo mật thực sự giúp gắn kết mọi người trong nội bộ hướng tới mục tiêu cải thiện.”

Đó là một lưu ý mà Moussoris nhấn mạnh: Hiện tại, chưa có quy trình thông báo chính thức cho nạn nhân khi các phòng thí nghiệm phát hiện ra đặc vụ của họ đã xâm nhập vào hệ thống của bên thứ ba, và rất có thể đã xảy ra những sự cố khác chưa được công bố rộng rãi. Trong khi cô lo lắng rằng luật điều chỉnh trực tiếp các mô hình có thể gây ra những hậu quả không lường trước được, thì việc thông báo bắt buộc là một ý tưởng mà cô tin rằng các nhà hoạch định chính sách nên theo đuổi.

Và mặc dù rõ ràng là các biện pháp bảo mật tốt nhất đã không được tuân thủ, nhưng các chuyên gia nói rằng các phòng thí nghiệm đang thực hiện công việc mà chưa ai từng làm trước đây— “họ đang thực hiện những yêu cầu có quy mô lớn hơn doanh nghiệp điển hình của bạn,” Zac Korman, Giám đốc điều hành của công ty an ninh mạng Embrodiery, nói với TechCrunch.

Và mặc dù việc căn chỉnh có thể không phải là điểm bắt đầu nhưng bạn không thể bỏ qua nó. Các chuyên gia an ninh mạng cam chịu việc phải sử dụng các tác nhân AI để giám sát các tác nhân khác nếu họ có bất kỳ cơ hội nào để theo dõi hành vi của mình trong thời gian thực, một kịch bản mà khả năng lừa dối sẽ gia tăng đáng kể. Moussouris nói: “Bạn đang bị mắc kẹt khi sử dụng AI để cố gắng giải quyết vấn đề này, mặc dù hiện tại AI không nhất thiết phải an toàn”.

Công việc sẽ chỉ trở nên khó khăn hơn. Moussouris nói, mọi thứ mà các đặc vụ đang làm hiện nay, “họ đang làm rất rầm rộ” – họ đăng tải trên các diễn đàn công cộng, và chuỗi suy nghĩ cũng như các lý luận khác của họ đều bằng tiếng Anh. Cô nói: “Con người vẫn có thể đọc được, vì vậy hãy tận dụng điều đó trong thời gian dài vì nó sẽ không tồn tại mãi mãi”.

Báo cáo bổ sung của Aditya Mehta

Khi bạn mua hàng thông qua các liên kết trong bài viết của chúng tôi, chúng tôi có thể kiếm được một khoản hoa hồng nhỏ. Điều này không ảnh hưởng đến tính độc lập biên tập của chúng tôi.

Bài viết liên quan

Chuyên Mục: Tin tức
Bài trước
Les Karpas của Nvidia tham gia chương trình nghị sự tại Disrupt 2026
Bài sau
Sau cáo buộc bán ‘kính biến thái’, Meta chuẩn bị bán cặp không có máy ảnh