Da sprogmodellerne lærte at skrive, var hemmeligheden ikke en snedig algoritme alene. Det var mængden af tekst. Modeller som dem bag ChatGPT blev fortrænet på enorme mængder tekst fra internettet, og det er den brede grundforståelse, der gør, at de kan svare på næsten hvad som helst. Fortræning betyder netop det. Modellen lærer først en bred, generel forståelse af verden og bliver derefter finjusteret til en konkret opgave.
Det er den parallel, Figure trækker på med Project Go-Big, som virksomheden præsenterede den 18. september. Figures pointe er, at robotter mangler deres svar på det store træningsdata. Som virksomheden formulerer det, findes der ingen “YouTube for robotadfærd” på linje med de billed- og tekstsamlinger, der drev gennembruddene i billedgenkendelse og sprog. Uden et lignende bjerg af data, lyder argumentet, kan en robothjerne ikke blive rigtig generel.
Figures løsning er at lade robothjernen Helix lære af video af mennesker, der gør almindelige ting. Tanken er, at en humanoid robot er bygget nok som et menneske til, at den kan overføre forståelse direkte fra menneskeoptagelser. Vi ser verden fra omtrent samme synsvinkel og bevæger os på beslægtede måder, og derfor kan en optagelse af en person, der går gennem et køkken, ifølge Figure bruges til at lære robotten det samme uden at robotten selv skal trænes på opgaven først.
Hvor Go-Big bliver konkret, er et resultat, Figure kalder zero-shot transfer. Det betyder, at Helix ifølge Figure lærte at navigere i et hjem alene ud fra menneskevideo, uden en eneste robotdemonstration som træningsmateriale. I en video reagerer robotten på talte kommandoer som “gå hen til køkkenbordet” og finder vej gennem et rodet rum. Figure beskriver det som styring genereret direkte fra kameraets pixels i realtid, og at den samme Helix-model både håndterer at gribe ting og at bevæge sig rundt. Det er den slags demonstration, hvor graden af autonomi er en del af historien, og her oplyser Figure altså, at navigationen kører på modellen selv.
For at skaffe data har Figure samme uge indgået et partnerskab med kapitalforvalteren Brookfield, der åbner adgang til ejendomme i stor skala som optagested. Både compute og dataindsamling er dyrt, og det hænger sammen med den Series C-runde, der få dage forinden værdisatte Figure til omkring 39 milliarder dollar.
Indtil videre har Figure vist ét navigationsresultat og oplyser, at dataindsamlingen er begyndt. Resten er en plan. Virksomheden taler om at skalere “i de kommende måneder” og om at bygge verdens største fortræningsdatasæt til humanoider, men opslaget indeholder ingen tal for datasættets størrelse, modellens omfang eller målbare benchmarks. Project Go-Big er på nuværende tidspunkt mest af alt en strategi for, hvordan Helix skal blive klogere, bygget på en analogi til sprogmodellerne og på ét tidligt resultat, der peger den vej.