Google DeepMind offentliggjorde den 3. oktober 2023 sammen med 33 forskningslaboratorier et fælles datasæt for robotlæring kaldet Open X-Embodiment. Pointen er enkel at sige og svær at gøre. I stedet for at træne hver robot på sine egne data har holdet samlet demonstrationer fra mange forskellige robotkroppe i ét datasæt og trænet en model på det hele. Resultatet er ifølge DeepMind en model, der klarer sig bedre end de modeller, der kun har set én robottype.

Det handler ikke om en humanoid robot. Men det handler om noget af det, der skal til, før en humanoid kan blive til andet end en velkoreograferet demo, nemlig en hjerne, der kan lære af mange flere eksempler, end en enkelt maskine selv kan nå at indsamle.

Hvad Open X-Embodiment er

Et datasæt af denne slags er en samling optagelser af, hvordan en robot løser opgaver. Hver optagelse viser, hvad robotten så, og hvad den gjorde. Det er den slags data, en model lærer af.

DeepMind oplyser, at Open X-Embodiment dækker 22 forskellige robottyper, fra enkelte robotarme til tohåndede robotter og firbenede maskiner. Datasættet er sat sammen fra eksisterende datasæt på tværs af de deltagende labs og rummer ifølge konsortiet mere end 500 færdigheder, omkring 150.000 opgaver og over en million optagelser af robotter i aktion. Materialet er gjort frit tilgængeligt for forskere.

Det centrale begreb er det, holdet kalder cross-embodiment, læring på tværs af robotkroppe. “Embodiment” betyder kropsliggørelse, altså at en AI ikke kun behandler tekst eller billeder på en skærm, men styrer en fysisk krop i den fysiske verden. En robotarm, en hund på fire ben og en humanoid har vidt forskellige kroppe. Spørgsmålet, projektet stiller, er, om en model alligevel kan lære noget generelt om at gribe, flytte og manipulere ting, som går på tværs af kropsformen.

Modellerne klarer sig bedre på blandet data

For at teste det trænede holdet to modeller på datasættet. Den ene, RT-1-X, bygger på en tidligere model ved navn RT-1. Den anden, RT-2-X, bygger på RT-2, DeepMinds vision-sprog-handlings-model, der lærer af både data fra nettet og data fra robotter. En vision-sprog-handlings-model (VLA) er en model, der tager billeder og en sproglig instruktion ind og giver en fysisk handling ud, altså oversætter “saml æblet op” til bevægelser.

DeepMind oplyser, at RT-1-X i forsøg med små datamængder klarede sig 50 procent bedre i gennemsnit end de metoder, der var udviklet til hver enkelt af fem almindeligt brugte robotter. For den større RT-2-X rapporterer holdet, at modellen var tre gange så god som den tidligere RT-2 til det, de kalder emergente færdigheder, altså opgaver modellen ikke var trænet direkte til. Det skal læses som forskningsresultater fra holdets egne forsøg. Evner sat i drift ude i verden er det ikke.

Vejen til en humanoid-hjerne

Humanoide robotter rammer netop dataproblemet hårdere end de fleste. En tobenet maskine med to hænder skal kunne en næsten uendelig række opgaver, og ingen enkelt producent kan selv optage nok eksempler til at dække dem alle. Hvis en model i stedet kan trække på data fra robotarme, lagerrobotter og firbenede maskiner og bruge det til at blive bedre, bliver vejen til en brugbar humanoid-hjerne kortere.

Det er stadig forskning på robotarme og rullende baser, ikke en færdig hjerne til en gående robot. Men idéen om én model, der lærer på tværs af kroppe, er den samme, som flere af de selskaber, der bygger foundation-modeller til robotter, sigter efter. Open X-Embodiment lægger et offentligt fundament under den.