Sóng não có phải là cách mở khóa tiếp theo cho AI vật lý?

Biên giới của AI vật lý là trò chơi Jenga trong một nhà kho ở San Leandro, California.

Kho đó do Encord, một công ty xây dựng công cụ dữ liệu dùng để đào tạo các mô hình AI, chiếm giữ. Andrew Ceja là một phi công—thuật ngữ của công ty dành cho những người huấn luyện robot—và anh ấy đang cẩn thận kéo các khối gỗ từ một tòa tháp lung lay trong khi đeo tai nghe có camera theo dõi những gì anh ấy nhìn thấy. Chỉ điều đó thôi cũng đã khá phổ biến để thu thập dữ liệu huấn luyện robot, nhưng chiếc tai nghe này còn bao gồm các cảm biến đo sóng não của anh ta khi anh ta cẩn thận tháo rời tháp khối.

Encord là một trong số ít nhưng ngày càng có nhiều công ty khởi nghiệp đặt cược rằng hạn chế thực sự tiếp theo đối với robot hình người và nhà kho sẽ không phải là kiến ​​trúc mô hình mà thay vào đó là sự khan hiếm tuyệt đối của dữ liệu rèn luyện thể chất trong thế giới thực. Thay vì chỉ giúp các công ty chế tạo robot quản lý dữ liệu họ có, Encord đang xây dựng hoạt động kinh doanh xoay quanh việc sản xuất dữ liệu mà họ không có.

Tai nghe sóng não mà Ceja đang đeo được chế tạo bởi Zander Labs, một công ty khởi nghiệp về khoa học thần kinh của Đức chuyên đo hoạt động của não – để suy ra các trạng thái tinh thần như lỗi, ý định và sự ngạc nhiên – có thể tạo ra một bộ dữ liệu hữu ích hơn để đào tạo các mô hình. Công việc của Encord với Zander hiện đang ở giai đoạn chạy thử; Encord cho biết mục tiêu là xây dựng bộ dữ liệu được gắn thẻ sóng não ban đầu, chạy nó thông qua các mô hình robot của khách hàng và đánh giá xem liệu nó có thực sự cải thiện hiệu suất hay không trước khi quyết định có mở rộng quy mô hay không.

Lucas Gehrke, một nhà thần kinh học Zander giám sát công việc, nói rằng lượng hoạt động não được sử dụng tại bất kỳ thời điểm nào trong một nhiệm vụ nhất định cung cấp manh mối cho những người xây dựng mô hình đang cố gắng tìm ra khi nào họ cần triển khai các mô hình nỗ lực cao nhất của mình.

Theo Vineeth Velmurugan, người đứng đầu bộ phận nghiên cứu robot của Encord, đây là “điểm mấu chốt” trong nỗ lực giải quyết nút thắt cổ chai dữ liệu về robot. Là người kỳ cựu trong phòng thí nghiệm robot của OpenAI và Berkshire Grey, công ty tự động hóa kho hàng, Velmurugan đã gia nhập Encord để xây dựng nhóm tạo dữ liệu nội bộ của công ty.

Encord được thành lập để giúp các công ty xây dựng ứng dụng thị giác máy chú thích dữ liệu và đánh giá các mô hình. Khi khách hàng của họ—Velmurugan cho biết họ làm việc với nhiều công ty chế tạo robot hàng đầu nhưng ông không được phép nêu tên họ—bắt đầu áp dụng phương pháp học tập toàn diện vào các nhiệm vụ thao tác robot, các giám đốc điều hành nhận ra rằng họ sẽ phải tự mình tạo ra dữ liệu đào tạo thay vì chỉ quản lý dữ liệu đó. Velmurugan nói: “Dữ liệu đơn giản là không tồn tại.

Sự đặt cược rằng AI có thể tạo ra có thể làm cho robot những gì nó đã làm cho chatbot tiếp tục gặp trở ngại này. LLM được xây dựng trên văn bản của toàn bộ internet và hơn thế nữa. Việc tìm kiếm những nguyên liệu thô giống nhau để dạy mạng lưới thần kinh về thao tác vật lý là một thách thức: các công ty xe tự lái tự thu thập nguyên liệu đó nhưng rất khó để mở rộng quy mô. Đào tạo từ video có thể hiệu quả nhưng thiếu độ trung thực của dữ liệu trong thế giới thực. Velmurugan cho biết sẽ cần một tập dữ liệu có kích thước gấp năm lần kích thước kho video của YouTube để vượt qua — một quy mô giúp giải thích tại sao việc tạo dữ liệu lại trở thành một công việc kinh doanh chứ không chỉ là một vấn đề nghiên cứu.

Đáp ứng nhu cầu dữ liệu ích kỷ của bạn

Các công ty chế tạo bộ não robot hiện đang chuyển sang hai nguồn chính: video “Vô tâm” được thu thập bởi các công nhân đeo máy ảnh, thường được tăng cường bằng các góc máy bổ sung và các số liệu khác, cũng như thu thập dữ liệu từ các robot được vận hành từ xa. Encord thực hiện cả hai việc, lấy dữ liệu lấy cái tôi làm trung tâm từ một số nhà máy trên toàn cầu và sử dụng cơ sở San Leandro của mình để thử nghiệm các phương thức mới, như sóng não hoặc thu thập các bộ dữ liệu xung quanh các kỹ năng cụ thể để tinh chỉnh.

Khi TechCrunch đến thăm, các phi công đang sử dụng các giàn khoan dẫn đầu – những cánh tay robot được ghép nối, một cánh tay được điều khiển trực tiếp bởi con người và một cánh tay bắt chước chuyển động của nó – để tạo ra dữ liệu về các nhiệm vụ như rót cà phê từ ấm vào cốc (rất nhếch nhác) và xếp các quân bài poker. Velmurugan nói: “Mọi công ty hình người đều yêu cầu chúng tôi cung cấp những sản phẩm này.

Các giá chứa đựng các hộp đựng hoa giả đựng trong lọ, sách, rau nhựa, khay và muỗng đựng rác mèo, túi và bó dây điện, những mặt hàng được bán để đào tạo người thao tác cho các công việc gia đình.

Tại một trong những trạm này, một phi công khác, Sofia Infante, điều khiển cánh tay robot để cắm và rút cáp ethernet từ phía sau máy chủ—loại người vận hành trung tâm dữ liệu công việc rất muốn được tự động hóa, giá như robot có thể thao tác với chúng với độ chính xác cần thiết. Xoay quanh các nút điều khiển, tôi có thể hiểu tại sao điều đó vẫn nằm ngoài tầm với: Kìm kém khéo léo hơn nhiều so với ngón tay con người và thiếu mức độ tự do mà chúng ta coi là đương nhiên trong vòng tay của mình.

Một phương thức dữ liệu mới khác mà Encord đang phát triển sử dụng một bộ cảm biến gắn vào cẳng tay để phát hiện các tín hiệu điện trong cơ. Video quay cảnh bàn tay con người thao tác với các vật thể thường không ghi lại toàn bộ bàn tay, nhưng Velmurugan hy vọng sẽ xây dựng được mô tả 3D về vị trí của bàn tay vào bất kỳ lúc nào dựa trên các cảm biến trên cánh tay, tạo ra sự hiểu biết rõ ràng hơn cho các mô hình.

Các bộ dữ liệu của Encord được chú thích bằng các mô tả vật lý về nội dung mỗi video—”tay phải siết chặt chốt”—để hỗ trợ các mô hình dựa trên LLM hiểu được điều gì đang xảy ra. Velmurugan ước tính loại chú thích dày đặc này có giá trị gấp 100 lần “dữ liệu bản ngã rác” để đào tạo các nhiệm vụ cụ thể và chỉ tốn gấp 20 lần để sản xuất, đây là một giao dịch tốt trên giấy tờ.

Nhưng “gấp 20 lần” vẫn là tiền thật và đó là điểm thu hút: loại bỏ văn bản khỏi internet, cách các nhà sản xuất LLM xây dựng mô hình của họ bằng cách lấy từ Stack Overflow và phần còn lại của web, khiến các phòng thí nghiệm biên giới gần như không tốn phí. Việc tạo dữ liệu rèn luyện thể chất thì không và đó là giới hạn của việc so sánh vật lý-AI-as-LLM. Loại dữ liệu này phải được tạo ra chứ không chỉ được thu thập và điều đó làm thay đổi tính kinh tế của việc xây dựng các mô hình này.

Velmurugan nói rằng đang đạt được tiến bộ—với khả năng hiển thị của Encord đối với các chương trình trong toàn ngành, anh ấy có thể thấy các công ty khởi nghiệp cũng như các phòng thí nghiệm ở biên giới tìm ra điều gì hiệu quả và điều gì không để cải thiện các mô hình AI vật lý. Vị trí thuận lợi đó—nằm giữa nhiều công ty chế tạo robot cùng một lúc—cũng là một phần trong chiêu trò của Encord. Nó có thể phát hiện ra kỹ thuật dữ liệu nào đang thu hút được sự chú ý trong toàn ngành trước khi bất kỳ khách hàng nào có thể làm được.

Điều đó sẽ khiến khoảng chục phi công tại cơ sở của Encord bận rộn. Cả Infante và Ceja đều là một phần của lực lượng lao động đang phát triển đang phát triển các nền tảng cho mạng lưới thần kinh; trước đây họ đã làm việc tại Scal, một công ty chú thích dữ liệu AI khác, trước khi gia nhập Encord.

Ceja từng làm việc tại một công ty quản lý rác thải, nơi niềm đam mê công nghệ khiến anh chịu trách nhiệm duy trì một máy phân loại rác bằng robot hoạt động tốt. Giờ đây, khi tòa tháp Jenga sụp đổ, anh ấy nói rằng anh ấy thích thử thách giải quyết các nhiệm vụ huấn luyện cho robot—“Mỗi ngày đều có điều gì đó mới mẻ!”

Khi bạn mua hàng thông qua các liên kết trong bài viết của chúng tôi, chúng tôi có thể kiếm được một khoản hoa hồng nhỏ. Điều này không ảnh hưởng đến tính độc lập biên tập của chúng tôi.

Bài viết liên quan

Chuyên Mục: Tin tức
Bài trước
Hiểu rõ sự hoảng loạn về AI của Trung Quốc
Bài sau
Bên trong một ngôi nhà sáng lập ở London viết lại các quy tắc của ngôi nhà sáng lập