Việc đào tạo các mô hình AI với các mô hình AI khác đã trở thành mục tiêu rất phổ biến của các neolabs — và giờ đây, một nhà nghiên cứu trong chương trình nghiên cứu sinh của Anthropic đã cho chúng ta cái nhìn sơ bộ về việc nó sẽ trông như thế nào trong thực tế.
Vào thứ Sáu, Anthropic đã xuất bản một bài báo mới có tiêu đề “Các nhà nghiên cứu tự động có thể giảm thiểu các lỗi liên kết một cách đáng tin cậy”, nêu chi tiết cách các hệ thống AI có thể cải thiện hiệu suất của mô hình một cách đáng tin cậy trên một tập hợp các tiêu chuẩn căn chỉnh. Khi được đưa ra 10 điểm chuẩn cho các hành vi sai lệch cụ thể, các hệ thống tự động có thể cải thiện hiệu suất trên từng hành vi mà không làm giảm hiệu suất tổng thể.
Được dẫn dắt bởi đồng nghiệp Nhân chủng học Chen Yueh-Han, hệ thống này tái tạo phần lớn phương pháp nghiên cứu truyền thống. Mỗi hệ thống tự động tìm kiếm tài liệu có sẵn, đề xuất một phương pháp và huấn luyện mô hình bằng phương pháp đó trong 30 phút, tăng dần điểm chuẩn qua nhiều lần lặp. Các phương pháp hiệu quả được bảo tồn trong khi những phương pháp không hiệu quả sẽ bị loại bỏ, cho phép hệ thống vận hành nhanh chóng và ở quy mô lớn.
Bài báo viết: “Nhìn chung, những kết quả này cung cấp bằng chứng ban đầu cho thấy việc căn chỉnh tự động sau đào tạo có thể trở nên thiết thực trong thời gian tới”.
Bài viết này là một bước hướng tới sự tự cải thiện đệ quy, được nhiều người coi là bước quan trọng tiếp theo trong tiến trình AI. Nếu các mô hình có thể cải thiện hoạt động đào tạo liên kết của chính họ thì rất có lý khi họ có thể cải thiện hoạt động đào tạo một cách rộng rãi hơn – tại thời điểm đó, các nhà nghiên cứu AI về con người có thể sớm trở nên lỗi thời.
Bài báo không ngần ngại giải quyết ý tưởng này, so sánh rõ ràng Công cụ nghiên cứu căn chỉnh tự động (AAR) với công cụ tương đương của con người. Bài báo viết: “Phương pháp AAR tốt nhất đánh bại những gì con người có kinh nghiệm đề xuất, trung bình trong vòng sáu giờ”. “Các hướng nghiên cứu do con người hướng dẫn không dẫn đến hiệu suất mạnh mẽ hơn.”
Thậm chí còn có sự so sánh về chi phí, trong trường hợp có ai đó không bị thuyết phục. “Một AAR tốn khoảng 4 đô la mỗi giờ cho việc suy luận API so với 150 đô la mỗi giờ mà chúng tôi trả cho các nhà nghiên cứu con người của mình.”
Công bằng mà nói, bài viết cũng chỉ ra một số hạn chế của cách tiếp cận này. Hệ thống tự động chỉ hoạt động trong chừng mực các điểm chuẩn phản ánh các mục tiêu điều chỉnh thực tế và thậm chí khi đó vẫn còn nhiều việc phải làm trong việc thiết lập và duy trì các điểm chuẩn đó — chưa kể đến việc duy trì và mở rộng tài liệu mà các nhà nghiên cứu tự động rút ra từ đó.
Khi bạn mua hàng thông qua các liên kết trong bài viết của chúng tôi, chúng tôi có thể kiếm được một khoản hoa hồng nhỏ. Điều này không ảnh hưởng đến tính độc lập biên tập của chúng tôi.