Robotik ve fiziksel yapay zeka
Figure, Helix 2.5’i Tanıttı, 30 Görülmemiş Evde Sıfır-Şut Test Edildi

Figure Helix 2.5’i tanıttı 17 Eylül 2026’da, şirketin insan davranışı Index veri kümesi üzerinde önceden eğitilmiş bir insansı sinir ağı ve 30 Bay Area evinde, hiçbirinde veri toplanmamış olarak değerlendirildi. Figure, Index ön‑eğitiminin sıfır‑şut başarısını %9’dan %56’ya yükselttiğini, sıfırdan eğitilmiş ancak diğer tüm yönleri aynı olan bir politika ile yapılan kontrollü bir karşılaştırmada bildirdi.
Figure, Helix 2.5’i geliştirdiği en gelişmiş sinir ağı olarak tanımladı. Tek bir Index ön‑eğitimli temel modelden şirket, üç bütün‑vücut davranışı üretti: oturma odalarını düzenleme, havluları katlama ve yatakları hazırlama. Önceki Helix 02 sistemi, bulaşık makinesini boşaltma ve bir lojistik görevi 200 saat boyunca otonom olarak yürütme gibi uzun vadeli bütün‑vücut kontrolünü koordine ediyordu, ancak robotların çalışacağı yerlerde toplanan verilerden öğreniyordu.
Değerlendirme Tasarımı ve Puanlama Ölçütleri
Figure, sıfır‑şut kavramını değerlendirme ortamları ve manipüle edilen nesnelerle ilgili olarak tanımlar; her davranış, başka bir yerde toplanan ince ayar verileriyle belirlenmiştir. Değerlendirme oyuncakları, havlular veya yatak takımları görev tanım verilerinde yer almadı ve robot, her evin mevcut kanepelerini, yataklarını ve katlama yüzeylerini kullandı. Değerlendirme nesneleri deneyler başlamadan önce ayrıldı ve bir AI modeli ardından insan incelemesi, bu nesnelerin görev tanım verilerinde bulunmadığını doğruladı.
Her görev, 30 evin tamamında tek bir sabit kontrol noktasını kullandı. Değerlendirme evlerine veya nesnelere ağırlıklar uyarlanmadı ve kontrol noktası seçiminde değerlendirme yürütme verileri veya performansı kullanılmadı. Başarı, görevin tamamının kısmi puan olmaksızın bitirilmesini gerektirdi. Her deneme, benzersiz bir başlangıç konfigürasyonundan başladı; sıfırlama koşulları tüm değerlendirilen politikalara aynı şekilde uygulandı ve güvenlik için herhangi bir insan müdahalesi yürütmeyi durdurup başarısız olarak işaretledi.
Değerlendiriciler, değerlendirme başlamadan önce sabitlenen kriterlere göre çalıştı. Oturma Odası Düzenleme, sahnedeki 13–15 oyuncağın tümünün toplanıp bir sepete konulmasını, her oyuncak için bir dakikalık zaman aşımının ardından yürütmenin iptal edilmesini gerektirdi. Havlu Katlama, her havlunun toplanıp katlanıp sepete konulmasını, katlama kalitesinin köşe hizalamasına göre puanlanmasını — en yüksek puan, dört köşenin bir inç içinde neredeyse temas etmesini — ve her havlu için üç dakikalık zaman aşımını şart koştu. Yatak Hazırlama, iki yastık ve iki battaniye köşesinin yatağın üst üçte birine ulaşmasını, battaniyenin düzgün çekilmesini, yastıkların yönüne göre de puanlanmasını ve her yastık ile her battaniye kenarı için bir dakikalık zaman aşımını uygulamayı gerektirdi.
Index Ön‑Eğitiminin Etkisini İzole Etme
Sonucun ne kadarının görev tanım verilerinden değil, Index’ten kaynaklandığını ölçmek için Figure, aynı görev tanım verileri üzerinde iki politika eğitti; biri rastgele ağırlıklarla başlatıldı, diğeri ise Index ön‑eğitimli Helix 2.5 modelinden başlatıldı. Mimari, optimizasyon, hiperparametreler, alt veri ve değerlendirme sabit tutuldu; böylece Index ön‑eğitimi tek deneysel değişken olarak kaldı. Helix 2.5, rastgele başlatmadan tamamen Index üzerinde ön‑eğitildi; Helix 02 ise ön‑eğitimli bir görsel‑dil modelinden başlamıştı.
Kör değerlendirmelerde, sıfırdan eğitilen politika sıfır‑şut denemelerinin %9’unda başarılı olurken, Index ön‑eğitimli politika %56’lık bir başarı gösterdi; Figure bu farkı altı katından fazla olarak tanımladı. Ön‑eğitimin tek değişken olması nedeniyle, şirket bu farkın katkısını doğrudan ölçtüğünü söylüyor. Figure, hiçbir tek değerlendirme görevinin Index ön‑eğitim veri kümesinin %1,90’ından fazlasını oluşturmadığını ve bildirdiğine göre, bildiği kadarıyla bu çalışmanın insansı bir robotta bu kapsamda sıfır‑şut bütün‑vücut genelleştirmesinin ilk gösterimi olduğunu belirtti.
Veri Verimliliği ve Bir Transfer Ölçekleme Yasası
Figure ayrıca Helix 2.5’i, aynı görevi değerlendirme ortamında doğrudan toplanan verilerle eğitilmiş önceki Helix 02 politikasıyla karşılaştırdı. Şirket, Helix 2.5’in o politikanın başarı oranını yarı yarıya daha az uyarlama verisi kullanarak eşleştirdiğini ve bunu 30 görülmemiş evde sıfır‑şut olarak başardığını bildirdi. Figure, ayrıca bütün‑vücut kendi‑kendine düzeltmede niteliksel bir iyileşme tanımladı; örneğin geri adım atarak konum değiştirme, duruşu değiştirme veya katlamayı düzeltmek için tam bir yatağın etrafında dolaşma gibi, bu durumu Index ön‑eğitiminin önemli bir etkisi olarak nitelendirdi.
Ayrı olarak, şirket, model boyutu ve alt eğitim sabit tutulurken, ön‑eğitim verilerinde 8 kat artış kapsayan Index’in iç içe geçmiş alt kümelerinde dört model eğitti ve tutulan dışarıda bırakılan eylem‑tahmin kaybının Index verisi iki katına çıktıkça öngörülebilir şekilde azaldığını bildirdi. Figure, yalnızca daha küçük koşuları kullanarak en büyük koşunun test kaybını dört ondalık basamağa kadar tahmin ettiğini, tahmin hatasının tam 8 katlık veri aralığındaki değişimin %0,54’üne eşit olduğunu söyledi. Şirket, bu sonucu, bildiği kadarıyla, insandan robota transferi ölçekleme yasası olarak ölçülen ilk örnek olarak tanımladı; ancak bunun yalnızca veri ölçeklemesini ölçtüğünü belirtti.
Helix 2.5’in Arkasındaki Index Veri Kümesi
Figure Index’i tanıttı 25 Ağustos 2026’da, gizli aşamadan çıkıp dört ay önce başlattığı veri toplama uygulamasını yeniden markalaştırdı ve onu şimdiye kadar oluşturulmuş en çeşitli robot eğitim veri seti olarak tanımladı. Bu duyuruda, Figure 264,000 uygulama indirilmesi, 108 ülke genelinde, 44,000’den fazla haftalık aktif kullanıcı, verileri toplayan Yaratıcılar tarafından yüklenen 16 milyonun üzerindeki video, bu Yaratıcılar’a ödenen $15 million ve her saniye işlenen 30 dakikalık video yüklemesi rapor etti. Toplanan 1,000 saat başına, şirket Index’in 373 benzersiz görev, 1,146 benzersiz manipüle edilen nesne ve 116 benzersiz ortam içerdiğini ve bunların filtreleme, dolandırıcılık incelemesi, çoğaltma önleme, yeniden dengeleme ve etiketleme olmak üzere beş aşamalı bir işlem hattından geçirildiğini söyledi.
Helix 2.5 duyurusu, Index’in artık her saniye yaklaşık 35 dakikalık yeni insan deneyimi ürettiğini ve Figure’ın Helix eğitimine $3.5 billion değerinde işlem gücü taahhüt ettiğini belirtiyor. Şirket, duyuruyu genel fiziksel zekâ üzerine çalışmalar için işe alım yaptığını söyleyerek sonlandırdı.












