For et år siden stod Jensen Huang på scenen til GTC og annoncerede Project GR00T, en foundation-model til humanoide robotter, som endnu var en hensigt og en partnerliste uden en model, nogen kunne røre ved. På årets GTC den 18. marts 2025 har NVIDIA leveret den. Selskabet har frigivet Isaac GR00T N1, og denne gang er der ikke bare tale om en plan. Modellens vægte og træningsdata kan hentes ned fra Hugging Face og GitHub, så udviklere selv kan bruge og bygge videre på den.
Det er det NVIDIA gør et nummer ud af. Selskabet kalder GR00T N1 “verdens første åbne, fuldt tilpasselige foundation-model” til generel ræsonnering og færdigheder i humanoide robotter. En foundation-model er en stor, bredt trænet AI-model, der kan finjusteres til mange forskellige opgaver bagefter, samme grundidé som driver chatbots. På et felt hvor flere af de toneangivende robotmodeller er lukkede og bundet til ét selskabs egne maskiner, er pointen i “åben” at en udvikler kan downloade GR00T N1 og efter-træne den til sin egen robot og sine egne opgaver, ifølge NVIDIA endda med forholdsvis lidt ekstra data.
To hastigheder i samme model
GR00T N1 er bygget op om to dele, der kører i forskellige tempi. NVIDIA beskriver det som inspireret af, hvordan mennesker både kan reagere lynhurtigt og tænke langsomt og overvejet.
Den ene del er en syns- og sprogmodel, der tager den langsomme, overvejende rolle. Den ser på omgivelserne gennem robottens kameraer, forstår en instruktion givet i almindeligt sprog og lægger en plan for, hvad der skal ske. Den anden del er en hurtig handlingsmodel, en såkaldt diffusionstransformer, der omsætter planen til en jævn strøm af konkrete motorbevægelser. Den langsomme del bestemmer altså hvad og hvorfor, den hurtige del leverer det glatte hvordan ud til robottens led og gribere.
Den opdeling er ved at blive et fælles greb i branchen. Figure har vist det med Helix, og opstartsselskabet Physical Intelligence med π0. Tanken er den samme hos alle tre, at ren reaktionshastighed og egentlig planlægning er to forskellige opgaver, der har bedst af hver sit modul. NVIDIAs version adskiller sig ved at komme fra en chipproducent, der vil sælge den åbent til alle på feltet på én gang frem for at bygge sin egen robot.
Trænet på syntetiske data
GR00T N1 er ifølge NVIDIA trænet på en blanding af optagelser af mennesker, rigtige og simulerede robotforsøg og store mængder syntetiske data, altså kunstige eksempler genereret i selskabets Omniverse-platform i stedet for indsamlet i den fysiske verden. NVIDIA oplyser at have produceret 780.000 syntetiske bevægelsesforløb på 11 timer, hvad der svarer til omkring ni måneders menneskelig demonstration, og at en blanding af syntetiske og rigtige data løftede modellens ydelse med 40 procent sammenlignet med rigtige data alene.
I demonstrationerne lader NVIDIA blandt andet en humanoid robot fra 1X rydde op i et hjem ved hjælp af en efter-trænet GR00T N1-model. Selskabet oplyser, at modellen kan generalisere på tværs af opgaver som at gribe, flytte genstande med en eller begge arme og flytte ting fra den ene hånd til den anden, samt klare flertrinsopgaver inden for materialehåndtering, pakning og inspektion.
Tallene og demonstrationerne er NVIDIAs egne. GR00T N1 udsendes sammen med en stribe andre værktøjer på GTC, blandt andet en ny fysikmotor ved navn Newton, som NVIDIA udvikler med Google DeepMind og Disney Research. Det åbne træk er det interessante her, for det betyder, at andre nu kan efterprøve modellen på deres egne robotter frem for at tage NVIDIAs videoer for pålydende.