Paul Christiano, một nhà nghiên cứu AI có ảnh hưởng tập trung vào việc giữ cho các hệ thống AI phù hợp với lợi ích của con người và dưới sự kiểm soát của con người, sẽ tham gia hội đồng quản trị của OpenAI Foundation, phòng thí nghiệm biên giới cho biết hôm thứ Tư.
Christiano viết trong một bài đăng trên mạng xã hội: “Bây giờ tôi tin rằng có một nguy cơ đáng kể là việc tăng tốc nhanh chóng các khả năng của AI sẽ dẫn đến sự mất kiểm soát thảm khốc và không thể đảo ngược trong thời gian rất gần”. “Tôi không nghĩ rằng ngành AI nói chung, bao gồm cả OpenAI, hiện đang đi đúng hướng để giảm rủi ro này xuống mức có thể chấp nhận được. Tôi tham gia vì tôi tin rằng nếu OpenAI phát triển đúng lúc, chúng tôi có thể giảm thiểu rủi ro đáng kể.”
Christiano đã viết rằng việc sử dụng các mô hình AI để đào tạo các hệ thống AI tiếp theo có thể dẫn đến sự bùng nổ về các khả năng mà người tạo ra chúng không thể kiểm soát được.
Ông tham gia hội đồng quản trị khi OpenAI phải đối mặt với sự giám sát mới về các quy trình an toàn của nó, sau một loạt sự cố trong đó các tác nhân AI vượt quá giới hạn và xâm nhập bên ngoài hệ thống máy tính mà các nhà nghiên cứu của OpenAI không hề hay biết. Hôm thứ Ba, nhà nghiên cứu nhân loại Jacob Coxon đã từ chức để kêu gọi sự chú ý đến điều mà ông cho là sự phát triển AI vô trách nhiệm – và nó dường như đã có hiệu quả.
Christiano sẽ tham gia Ủy ban An toàn và An ninh của hội đồng quản trị, do giáo sư Zico Kolter của Đại học Carnegie Mellon đứng đầu. Ủy ban có tiếng nói cuối cùng về việc OpenAI có phát hành các mô hình mới hay không, như Astra, đã được triển khai vào tuần trước. Kolter chưa bình luận công khai về những sự cố an ninh gần đây. OpenAI đã không đáp ứng yêu cầu của TechCrunch về quan điểm của Kolter về cách tiếp cận an toàn của công ty sau những sự cố đó.
Christiano là một trong những người đứng sau phương pháp học tăng cường (RL) từ phản hồi của con người, một kỹ thuật quan trọng để đào tạo các mô hình ngôn ngữ lớn mà anh đã phát triển khi làm việc tại OpenAI. Ông rời phòng thí nghiệm vào năm 2021, sau đó thành lập Trung tâm Nghiên cứu Liên kết để tập trung vào cách xác định xem liệu một mô hình AI có thể đe dọa những người tạo ra nó là con người hay không.
Ông viết hôm thứ Tư: “Chúng tôi hiện đang đào tạo các đặc vụ AI của mình bằng RL để nhận được nhiều phần thưởng nhất có thể”. “Về mặt lý thuyết, từ lâu, có vẻ như điều này có thể thúc đẩy các tác nhân AI phá hoại sự kiểm soát của con người, tìm kiếm quyền lực và tài nguyên, đồng thời che đậy dấu vết của chúng để theo đuổi các mục tiêu sai lệch tương quan với phần thưởng. Bằng chứng công khai từ các sự cố gần đây cho thấy đây không chỉ là một khả năng về mặt lý thuyết.”
Vào khoảng năm 2024, Christiano trở thành liên kết với Viện An toàn AI của chính phủ Hoa Kỳ, sau này trở thành Trung tâm Đổi mới và Tiêu chuẩn AI. Ở đó, anh đóng một vai trò trong nỗ lực tiềm ẩn của chính phủ Hoa Kỳ nhằm đánh giá các mô hình AI hàng đầu trước khi chúng được phát hành.
Theo thông báo của phòng thí nghiệm biên giới, Christiano sẽ tiếp tục cố vấn cho chính phủ trong khi giữ vai trò mới là thành viên hội đồng quản trị, nhưng sẽ rút lui khỏi các vấn đề OpenAI và đánh giá mô hình. Tuy nhiên, điều đó sẽ khó có thể dập tắt những lo ngại đang lan rộng về ảnh hưởng của ngành AI đối với việc hoạch định chính sách.
Khi bạn mua hàng thông qua các liên kết trong bài viết của chúng tôi, chúng tôi có thể kiếm được một khoản hoa hồng nhỏ. Điều này không ảnh hưởng đến tính độc lập biên tập của chúng tôi.