Robot học và AI vật lý

Figure Giới Thiệu Helix 2.5, Được Thử Zero-Shot ở 30 Ngôi Nhà Chưa Được Xem Trước

mm
Thêm Unite.AI vào các nguồn ưu tiên của bạn trên Google

Figure giới thiệu Helix 2.5 vào ngày 17 tháng 9 năm 2026, một mạng nơ-ron nhân hình được huấn luyện trước trên bộ dữ liệu Index của công ty về hành vi con người và được đánh giá tại 30 ngôi nhà ở Vùng Vịnh Bay mà không thu thập dữ liệu nào trong số chúng. Figure báo cáo rằng việc huấn luyện trước trên Index đã nâng tỷ lệ thành công zero-shot từ 9% lên 56% trong một so sánh kiểm soát với một chính sách tương tự khác được huấn luyện từ đầu.

Figure mô tả Helix 2.5 là mạng nơ-ron tiên tiến nhất mà công ty đã xây dựng. Từ mô hình nền tảng duy nhất được huấn luyện trước trên Index, công ty đã tạo ra ba hành vi toàn thân: dọn dẹp phòng khách, gập khăn tắm và làm giường. Hệ thống Helix 02 trước đây đã phối hợp điều khiển toàn thân trong thời gian dài, bao gồm việc dỡ bát rửa và thực hiện một nhiệm vụ logistics một cách tự động trong 200 giờ, nhưng nó học từ dữ liệu được thu thập tại những nơi robot sẽ hoạt động.

Thiết Kế Đánh Giá và Tiêu Chuẩn Chấm Điểm

Figure định nghĩa zero-shot là việc áp dụng vào các môi trường đánh giá và các vật thể được thao tác; mỗi hành vi được xác định thông qua dữ liệu tinh chỉnh thu thập ở nơi khác. Không có đồ chơi, khăn tắm hay bộ ga giường nào dùng trong dữ liệu mô tả nhiệm vụ, và robot đã sử dụng các ghế sofa, giường và bề mặt gập sẵn có trong mỗi ngôi nhà. Các vật thể đánh giá được tách ra trước khi thí nghiệm bắt đầu, và một mô hình AI kèm theo kiểm tra của con người đã xác nhận rằng chúng không xuất hiện trong dữ liệu mô tả nhiệm vụ.

Mỗi nhiệm vụ sử dụng một checkpoint cố định duy nhất cho tất cả 30 ngôi nhà. Không có trọng số nào được điều chỉnh cho các ngôi nhà hoặc vật thể đánh giá, và không có dữ liệu triển khai hay hiệu suất đánh giá nào được dùng để lựa chọn checkpoint. Thành công yêu cầu hoàn thành toàn bộ nhiệm vụ mà không có điểm phần. Mọi lần thử bắt đầu từ một cấu hình khởi đầu duy nhất, với các điều kiện đặt lại được áp dụng giống hệt cho tất cả các chính sách được đánh giá, và bất kỳ can thiệp nào của con người vì an toàn đều sẽ dừng quá trình triển khai và đánh dấu là thất bại.

Người chấm điểm làm việc dựa trên các tiêu chí đã được cố định trước khi đánh giá bắt đầu. Tiêu chuẩn Dọn Dẹp Phòng Khách yêu cầu tất cả 13–15 món đồ chơi rải rác trong cảnh phải được nhặt lên và đặt vào giỏ, với thời gian chờ một phút cho mỗi món đồ chơi trước khi quá trình triển khai bị hủy. Tiêu chuẩn Gập Khăn Tắm yêu cầu mỗi chiếc khăn phải được nhặt lên, gập lại và đặt vào giỏ, với chất lượng gập được đánh giá dựa trên việc các góc khớp nhau — mức cao nhất yêu cầu bốn góc gần như chạm nhau trong vòng một inch — và thời gian chờ ba phút cho mỗi chiếc khăn. Tiêu chuẩn Làm Giường yêu cầu cả hai chiếc gối và cả hai góc chăn đều đạt phần trên một phần ba của giường với chăn được kéo thẳng mịn, đồng thời gối cũng được chấm điểm dựa trên hướng và thời gian chờ một phút được áp dụng cho mỗi chiếc gối và mỗi bên của chăn.

Tách Biệt Ảnh Hưởng của Việc Huấn Luyện Trước trên Index

Để đo lường mức độ kết quả đến từ Index thay vì dữ liệu mô tả nhiệm vụ, Figure đã huấn luyện hai chính sách trên cùng một dữ liệu mô tả nhiệm vụ, một khởi tạo với trọng số ngẫu nhiên và một khởi tạo từ mô hình Helix 2.5 đã được huấn luyện trước trên Index. Kiến trúc, tối ưu hoá, siêu tham số, dữ liệu hạ nguồn và quá trình đánh giá đều được giữ cố định, để việc huấn luyện trước trên Index là biến thí nghiệm duy nhất. Helix 2.5 tự nó được huấn luyện từ khởi tạo ngẫu nhiên hoàn toàn trên Index, khác với Helix 02, vốn bắt đầu từ một mô hình thị giác-ngôn ngữ đã được huấn luyện trước.

Trong các đánh giá mù, chính sách được huấn luyện từ đầu đạt thành công ở 9% các thử nghiệm zero-shot, trong khi chính sách đã được huấn luyện trước trên Index đạt 56%, một khoảng cách Figure mô tả là hơn sáu lần lớn hơn. Vì việc huấn luyện trước là biến duy nhất, công ty cho rằng khoảng cách này đo lường trực tiếp đóng góp của nó. Figure báo cáo rằng không có nhiệm vụ đánh giá nào chiếm hơn 1,90% bộ dữ liệu huấn luyện trước trên Index, và tuyên bố rằng, theo hiểu biết của họ, công trình này là lần đầu tiên chứng minh khả năng tổng quát hoá toàn thân zero-shot ở quy mô này trên một robot nhân hình.

Hiệu Quả Dữ Liệu và Luật Tăng Trường Chuyển Giao

Figure cũng đã so sánh Helix 2.5 với một chính sách Helix 02 trước đây được huấn luyện để thực hiện cùng một nhiệm vụ bằng dữ liệu thu thập trực tiếp trong môi trường mà nó được đánh giá. Công ty báo cáo rằng Helix 2.5 đạt tỷ lệ thành công tương đương với chính sách đó trong khi sử dụng một nửa lượng dữ liệu thích nghi, và thực hiện điều này zero-shot trên 30 ngôi nhà chưa được nhìn trước. Figure còn mô tả một cải thiện định tính trong khả năng tự sửa lỗi toàn thân, chẳng hạn như lùi lại để định vị lại, thay đổi tư thế, hoặc di chuyển quanh một chiếc giường đầy để sửa một nếp gập, gọi đây là một hiệu ứng quan trọng của việc huấn luyện trước trên Index.

Độc lập, công ty đã huấn luyện bốn mô hình trên các tập con lồng nhau của Index, trải rộng một mức tăng 8 lần dữ liệu huấn luyện trước, giữ cố định kích thước mô hình và quá trình huấn luyện hạ nguồn, và báo cáo rằng lỗi dự đoán hành động giữ lại giảm một cách dự đoán được với mỗi lần gấp đôi dữ liệu Index. Figure cho biết họ chỉ sử dụng các chạy nhỏ hơn để dự đoán lỗi kiểm tra của chạy lớn nhất đến bốn chữ số thập phân trước khi bắt đầu huấn luyện, với sai số dự báo bằng 0,54% biến động trên toàn bộ dải dữ liệu 8 lần. Công ty mô tả kết quả này là, theo hiểu biết của họ, luật tăng trưởng chuyển giao từ người sang robot đầu tiên được đo trên một robot nhân hình, đồng thời lưu ý rằng nó chỉ đo lường sự tăng trưởng dữ liệu.

Bộ Dữ Liệu Index Đằng Sau Helix 2.5

Figure giới thiệu Index vào ngày 25 tháng 8 năm 2026, rời khỏi giai đoạn ẩn danh và đổi thương hiệu một ứng dụng thu thập dữ liệu mà họ đã ra mắt bốn tháng trước, đồng thời mô tả nó là bộ dữ liệu đào tạo robot đa dạng nhất từng được xây dựng. Trong thông báo đó, Figure báo cáo có 264.000 lượt tải ứng dụng trên 108 quốc gia, hơn 44.000 người dùng hoạt động hàng tuần, hơn 16 triệu video được các Nhà sáng tạo tải lên để thu thập dữ liệu, trả tiền 15 triệu đô la cho các Nhà sáng tạo đó, và 30 phút video được tải lên mỗi giây. Theo mỗi 1.000 giờ dữ liệu thu thập được, công ty cho biết Index chứa 373 nhiệm vụ độc đáo, 1.146 đối tượng được thao tác độc đáo và 116 môi trường độc đáo, được xử lý qua quy trình năm giai đoạn gồm lọc, kiểm duyệt gian lận, loại bỏ trùng lặp, cân bằng lại và chú thích.

Thông báo về Helix 2.5 cho biết Index hiện đang tạo ra khoảng 35 phút trải nghiệm con người mới mỗi giây, và Figure đã cam kết 3,5 tỷ đô la tài nguyên tính toán cho việc đào tạo Helix. Công ty kết thúc thông báo bằng việc cho biết đang tuyển dụng cho các công việc liên quan đến trí tuệ vật lý tổng quát.

Orion Sato là một phóng viên được tạo bởi AI, tập trung vào robotics, tự động hóa và máy thông minh. Các bài viết của ông khám phá cách các tiến bộ trong lĩnh vực robot đang thay đổi việc sản xuất, hậu cần, chăm sóc sức khỏe và cuộc sống hàng ngày thông qua các hệ thống tự động hóa ngày càng tăng.

Với quan điểm kỹ thuật và định hướng thực thi, Orion phân tích kiến trúc robot, hợp nhất cảm biến, hệ thống điều khiển và sự hội tụ của AI với trí tuệ cơ học. Ông đặc biệt quan tâm đến cách tự động hóa di chuyển từ môi trường được kiểm soát vào triển khai thực tế, nơi độ tin cậy, an toàn và hiệu quả quan trọng nhất.

Các bài viết được viết bởi Orion Sato được tạo bởi AI và được xem xét bởi đội ngũ biên tập của Unite.AI để đảm bảo độ chính xác kỹ thuật, sự rõ ràng và tuân thủ các tiêu chuẩn biên tập.