Mô hình Astra mới của OpenAI sẽ sử dụng một kỹ thuật lý luận được gọi là “độ sâu tái diễn” cho phép nó hoạt động bên ngoài tư duy tuần tự đặc trưng của hầu hết các mô hình lý luận, The Information đưa tin hôm thứ Ba. Kỹ thuật này, còn được gọi là “tái diễn mờ đục”, có thể sẽ khiến chuỗi suy nghĩ của mô hình trở nên khó theo dõi hơn – và điều đó khiến các chuyên gia an toàn AI lo lắng.
Mặc dù việc sử dụng kỹ thuật này của Astra được cho là còn hạn chế, nhưng sự xuất hiện của nó vẫn gây ra mối lo ngại đáng kể cho các chuyên gia về an toàn AI.
Giám đốc điều hành Redwood Buck Shlegeris đã viết trong một bài đăng sau khi tin tức nổ ra: “Tôi vô cùng lo ngại trước thông tin cho rằng Astra sử dụng phương pháp tái phát không rõ ràng”. “Tôi không biết liệu Astra có ít khả năng giám sát CoT hơn nhiều so với các mô hình trước đó hay không. Nhưng nếu OpenAI đẩy mạnh kỹ thuật này hơn nữa, họ sẽ có tùy chọn để tăng đáng kể tần suất lặp lại và phá hủy hoàn toàn khả năng giám sát CoT.”
Người ủng hộ an toàn AI lâu năm Zvi Mowshowitz cũng cân nhắc và viết rằng luật có thể cần thiết để ngăn chặn “cuộc chạy đua xuống đáy” giữa các phòng thí nghiệm AI.
Mowshowitz viết: “Kỹ thuật này đang đùa với lửa, mạo hiểm với một điều cấm kỵ mà OpenAI và Anthropic đã đấu tranh để thiết lập rằng chúng tôi làm việc chăm chỉ để duy trì tính trung thực và khả năng giám sát của Chuỗi Tư tưởng lâu nhất có thể”. “Việc sử dụng nhiều hơn các kỹ thuật như vậy có thể sẽ làm hỏng khả năng giám sát.”
Trong trường hợp bình thường, chuỗi suy nghĩ của mô hình lý luận cung cấp các bước tuần tự mà mô hình thực hiện khi nó cố gắng giải quyết một vấn đề. Mặc dù việc trình bày chưa hoàn hảo nhưng nó vẫn đóng vai trò là công cụ có giá trị để theo dõi hành vi sai trái hoặc sai lệch. Trong trường hợp hoạt động của tác nhân lừa đảo gần đây của OpenAI, các bản ghi chuỗi suy nghĩ là một công cụ quan trọng để tìm ra lý do tại sao các tác nhân lại hành xử theo cách họ đã làm.
Trong phép lặp không rõ ràng, mô hình có cách tiếp cận ít tuyến tính hơn, xử lý cùng một truy vấn nhiều lần trong một vòng lặp. Kết quả để lại ít dấu vết dễ đọc hơn, vượt qua một cách hiệu quả bản ghi chuỗi suy nghĩ thông thường.
Điều quan trọng là việc sử dụng kỹ thuật này của Astra dường như bị hạn chế. Chuỗi suy nghĩ của mô hình dự kiến sẽ vẫn dễ đọc và công ty đã phản đối mọi đề xuất rằng nó sẽ chuyển sang “thần kinh”. OpenAI đã công bố kế hoạch cho các hệ thống giám sát chuỗi suy nghĩ rộng rãi như một phần trong kế hoạch an toàn hướng tới tương lai của mình.
Trong một bài đăng trên X, nhà khoa học trưởng của OpenAI, Jakub Pachocki, nhấn mạnh cam kết của phòng thí nghiệm về chuỗi suy nghĩ dễ đọc. Pachocki viết: “OpenAI đã nỗ lực duy trì và sử dụng tính năng giám sát chuỗi suy nghĩ kể từ những mô hình lý luận đầu tiên của chúng tôi”. “Đó là mục tiêu cốt lõi của chương trình nghiên cứu hiện tại của chúng tôi.
Tất cả các mô hình AI đều thực hiện một số lý luận không rõ ràng và rất ít nhà nghiên cứu lấy nhật ký chuỗi suy nghĩ làm đại diện trực tiếp cho lý luận của mô hình. Tuy nhiên, những cảnh báo đó không xóa tan mối lo ngại rằng sự tái diễn không rõ ràng có thể khiến lý luận AI khó theo dõi hơn, đặc biệt khi nó được sử dụng ngày càng nhiều trên các mô hình khác nhau. Trong báo cáo tiếp theo vào sáng thứ Tư, The Information đưa tin rằng cả Anthropic và Google DeepMind đều đã thảo luận về kỹ thuật này.
Trong một bài đăng phản hồi tin tức, nhà khoa học trưởng Ryan Greenblatt của Redwood Research cho biết lý luận không rõ ràng có thể dễ dàng mở rộng quy mô nhanh hơn lý luận chuỗi suy nghĩ thông thường, loại bỏ hiệu quả tất cả lý luận khỏi các kênh nhìn thấy được.
Greenblatt viết: “Mối quan tâm lớn nhất của tôi là sự tiến triển tự nhiên từ đây sẽ liên quan đến việc mở rộng quy mô lý luận không rõ ràng đến mức mà mô hình lý giải hoàn toàn hoặc gần như hoàn toàn trong không gian tiềm ẩn”. “Tôi hy vọng vẫn chưa quá muộn để tránh những kiến trúc đáng lo ngại nhất và OpenAI sẽ dừng ở đây.”
Khi bạn mua hàng thông qua các liên kết trong bài viết của chúng tôi, chúng tôi có thể kiếm được một khoản hoa hồng nhỏ. Điều này không ảnh hưởng đến tính độc lập biên tập của chúng tôi.