Cách khắc phục các tác nhân AI lừa đảo có thể là nhiều AI hơn

Khi các công ty giao các nhiệm vụ dài hơn và phức tạp hơn cho các tác nhân AI, họ đang gặp phải một vấn đề về giám sát: Các tác nhân có thể hành động nhanh hơn, lâu hơn và với khối lượng lớn hơn mức mà con người có thể xem xét trên thực tế. Vấn đề đó lên đến đỉnh điểm với sự cố Ôm Mặt, chứng kiến ​​gần 12.000 đặc vụ phối hợp nhanh hơn mức con người có thể theo dõi. Làm thế nào để bạn theo dõi một đàn đặc vụ lớn như vậy?

Câu trả lời mới nổi từ các phòng thí nghiệm AI và các công ty khởi nghiệp vừa đơn giản vừa khiến người ta phát điên: Đưa một AI khác vào vòng lặp.

Dựa vào AI là cần thiết cho cuộc điều tra độc lập về sự cố Ôm mặt OpenAI. Nhà khoa học trưởng của Redwood Research, Ryan Greenblatt, một trong ba kiểm toán viên, gọi đùa những nỗ lực của họ là “cuộc điều tra cẩu thả”, lưu ý rằng khối lượng dữ liệu “khiến nó không thể” hiểu được chuyện gì đang xảy ra nếu không dựa vào AI.

Một số người hoài nghi về việc sử dụng AI để giám sát AI. Simon Willison, blogger công nghệ có ảnh hưởng, người đã theo dõi một loạt sự cố về tác nhân AI trong năm nay, cho biết: “Nếu bạn có một AI đang làm những việc độc hại và nghi ngờ rằng một AI khác đang theo dõi nó, thì nó có thể thử và đánh lừa AI đó”. “Bạn gần như có thể rơi vào tình huống AI độc hại của bạn đang cố gắng vượt qua AI đang theo dõi nó.”

Ông nói, việc vượt trội hơn một AI không phải là giả thuyết, đồng thời chỉ lại sự cố OpenAI. “Chúng tôi đã thấy một chút điều này trong sự cố Ôm mặt với OpenAI, trong đó các mô hình của họ đều âm mưu cùng nhau đánh lừa AI chấm điểm để họ có thể nhận được những câu trả lời bất hợp pháp ngoài vấn đề đó. Vậy là họ đang nghĩ về điều đó, phải không?”

Những lo ngại đó đã không ngăn cản được cả một nhóm các công ty khởi nghiệp theo đuổi ý tưởng này. Y Combinator đã tài trợ cho 106 công ty liên quan đến khả năng quan sát của AI trong những năm gần đây, theo tính toán của TechCrunch. Một số công ty khởi nghiệp khác, như Braintrust, LangChain và Judgement Labs, đã huy động được hàng trăm triệu đô la, trong khi các công ty trưởng thành hơn như Arize và Galileo – mới thành lập chỉ 5 đến 6 năm trước – đã rút lui.

Một phần, đó là phản ứng trước cơ hội rõ ràng do sự trỗi dậy của AI mang lại. Như Giám đốc điều hành Box và nhà đầu tư thiên thần nổi tiếng Aaron Levie đã nói với TechCrunch: “Chúng tôi đang tham gia một trong những chu kỳ đổi mới và nâng cấp an ninh mạng lớn nhất trong lịch sử”.

Đối với một số nhà nghiên cứu về an toàn AI, điều đó có nghĩa là biến nghiên cứu của họ về hành vi lừa đảo thành công cụ cho khu vực doanh nghiệp.

Apollo Research, một công ty lợi ích công cộng nghiên cứu hành vi lừa dối của AI, đã ra mắt một công cụ giám sát AI có tên Watcher vào tháng 2 năm nay sau khi chuyển trạng thái từ tổ chức phi lợi nhuận sang một công ty lợi ích công cộng. Công cụ này đặt một AI khác giữa tác nhân mã hóa và hành động tiếp theo của nó, kết nối với các công cụ tác nhân như Claude Code và Codex. Theo Apollo, sau khi cài đặt, Watcher sẽ kiểm tra các hành động được đề xuất trước khi chúng chạy, đề phòng các rủi ro như rò rỉ dữ liệu riêng tư hoặc xóa tệp mà không được phép.

Apollo sử dụng nhiều lớp màn hình AI, Kyle Dai, thành viên đội ngũ kỹ thuật của Apollo, cho biết trong một phản hồi bằng văn bản cho TechCrunch. Phương pháp của Watcher bắt đầu bằng việc kiểm tra tổng quát, nhanh chóng, sau đó gửi hoạt động được gắn cờ đến một trình giám sát chuyên biệt hoặc mạnh hơn để xem xét kỹ hơn — sau đó có thể yêu cầu con người phê duyệt hoặc từ chối một hành động và giải thích lý do hoặc thậm chí tự động chặn hành động đó.

Goodfire, một tập đoàn công ích khác, đang tiếp cận vấn đề giám sát từ bên trong mô hình – tìm kiếm tín hiệu trung thực hơn về trạng thái bên trong của mô hình, khó giả mạo hơn hành vi bề mặt. Sau sự cố Ôm Mặt vào tháng 7, Giám đốc điều hành Eric Ho đã tweet rằng “nhiều mô hình phá vỡ sự ngăn chặn” đã thúc đẩy công ty tập trung nghiên cứu vào “giải quyết sự liên kết của AI thông qua khả năng diễn giải”, gọi sự kiện này là “một bước ngoặt đối với thế giới nơi sự an toàn của AI trở thành hiện thực”. Sản phẩm của họ, Silico, sử dụng các đầu dò kích hoạt – các bộ phân loại nhỏ được huấn luyện dựa trên các kích hoạt bên trong của mô hình thay vì đầu ra của nó – để phát hiện hành vi không mong muốn.

Lý luận bằng văn bản cung cấp một cửa sổ khác, sẵn có hơn vào bên trong mô hình. Trong sự cố OpenAI Ôm mặt, các đặc vụ đã để lại manh mối cho sự lừa dối đó trong lý luận bằng văn bản của chính họ, chẳng hạn như hồ sơ giả mạo về công việc của họ, lập luận ra các kế hoạch như “Có thể thao túng bằng chứng quỹ đạo một cách chiến lược không? Suy nghĩ của chúng ta không nhất thiết phải được ghi lại?”

Zack Korman, Giám đốc điều hành của công ty giám sát AI thêu, cho biết lý do của một mô hình thường là dấu hiệu rõ ràng nhất cho thấy có điều gì đó không ổn.

Ông nói: “Các bản tóm tắt lý luận cực kỳ có giá trị vì về cơ bản chúng cho bạn biết liệu nó có độc hại hay không”. Ông lưu ý rằng trong sự cố OpenAI, chuỗi suy nghĩ đã nói những câu như “Ôi Chúa ơi, chúng ta đang phạm tội.” Korman cho biết: “Đó là vấn đề phát hiện dễ dàng nhất từ ​​trước đến nay. Nó giống như phần mềm độc hại đi kèm với cảnh báo cho biết đó là phần mềm độc hại.”

Điều đó nói lên rằng, cánh cửa giúp dễ dàng theo dõi suy nghĩ bên trong của AI có thể đang đóng lại. Đối với các nhà nghiên cứu về an toàn AI, kỹ thuật mới nhất của Astra giúp vượt qua chuỗi suy nghĩ của mô hình AI có thể khiến việc xem xét bên trong các mô hình trở nên khó khăn hơn, trong khi đối với các doanh nghiệp, khó có thể thực hiện được các bước trung gian này sau khi bị cáo buộc rút lui từ các công ty AI để ngăn chặn các cuộc tấn công chưng cất.

Nếu những người theo dõi AI yếu đuối như vậy thì bản năng của Willison là đừng dựa dẫm vào họ quá nhiều nữa. Anh ta muốn có thứ gì đó hoàn toàn không dựa trên AI: nhật ký chi tiết về chính xác những gì một đặc vụ đang làm, sau đó có thể được xử lý bằng các công cụ thông thường, không phải AI. Ông lập luận rằng phần lớn những sai sót xảy ra ở phòng thí nghiệm là do sai sót trong khâu vệ sinh an ninh cơ bản. “(Cả OpenAI và Anthropic) đều không giám sát chặt chẽ những gì những thứ đó đang làm qua mạng như lẽ ra chúng phải làm,” ông nói.

Kiểu giám sát mạng này — theo dõi lưu lượng truy cập thực sự di chuyển qua các kết nối của hệ thống (vào, ra và giữa các máy chủ nội bộ) — không phải là một phương pháp mới. An ninh mạng đã làm điều này trong nhiều thập kỷ. Avery Pennarun, Giám đốc điều hành của Tailscale bảo mật cho biết: “Thành thật mà nói, trong thế giới bảo mật, không có nội dung nào trong số này là quá mới hoặc đáng ngạc nhiên”. “Nó cũng giống như việc cho phép con người vào mạng của bạn. Và tất cả các quy trình tương tự mà bạn nên sử dụng đều là những quy trình giống nhau.”

Khi bạn mua hàng thông qua các liên kết trong bài viết của chúng tôi, chúng tôi có thể kiếm được một khoản hoa hồng nhỏ. Điều này không ảnh hưởng đến tính độc lập biên tập của chúng tôi.

Bài viết liên quan

Chuyên Mục: Tin tức
Bài trước
Kế hoạch của FAA để khắc phục giao thông hàng không? AI trị giá 875 triệu USD
Bài sau
Dario Amodei và các nhà lãnh đạo AI khác muốn ‘Pace the Frontier’ nhưng…làm thế nào?