Google DeepMind har den 12. marts 2025 præsenteret to AI-modeller, der skal flytte selskabets Gemini-model ud af chatvinduet og ind i fysiske robotter. Den ene, Gemini Robotics, styrer en robot direkte. Den anden, Gemini Robotics-ER, leverer det rumlige og fysiske ræsonnement, som robotik-udviklere kan koble til deres egen styring. Begge bygger ifølge DeepMind på selskabets Gemini 2.0-model. Samtidig udnævner DeepMind robotvirksomheden Apptronik til partner på en humanoid-udgave til selskabets Apollo-robot.

Gemini er DeepMinds store sprog- og billedmodel, hjernen bag selskabets chatbot. At selskabet nu retter den mod fysiske robotter er væsentligt. At få en maskine til at forstå en opgave og selv finde ud af at udføre den er nemlig den del af humanoid-robotik, der er sværest at knække i dag.

To modeller, to roller

De to modeller løser hver sin del af problemet.

Gemini Robotics er det, DeepMind kalder en vision-language-action-model (forkortet VLA). Selskabet har taget Gemini 2.0 og tilføjet fysiske handlinger som en ny udgangstype. Modellen tager altså det, robotten ser, og en instruktion i almindeligt sprog ind, og sender bevægelser ud, så den kan styre robotten direkte uden et separat program til hvert trin.

Gemini Robotics-ER går efter forståelsen frem for selve bevægelsen. ER står for embodied reasoning, på dansk kropsliggjort ræsonnement. Hvor en almindelig billedmodel kan genkende, at der ligger en kop på et bord, handler embodied reasoning om at ræsonnere videre: hvor i rummet står koppen, hvordan kan en hånd gribe om hanken, og hvad sker der, hvis man løfter den. DeepMind beskriver det som “den menneskelignende evne til at forstå og reagere på verden omkring os”. Modellen er tænkt som en byggeklods, som robotik-udviklere kan sætte oven på deres egne lavniveau-styringer.

Hvad DeepMind viser

DeepMind oplyser, at Gemini Robotics blev trænet primært på data fra en tohåndet forskningsplatform ved navn ALOHA 2, og at modellen også er kørt på en bi-arm-opstilling med Franka-robotarme og på Apptroniks humanoide Apollo-robot. Selskabet fremhæver fingerfærdige opgaver som at folde origami og pakke ting ned, og lægger vægt på det, det kalder steerability, altså at robotten følger talte kommandoer og tilpasser sig, når omgivelserne ændrer sig undervejs.

På tallene melder DeepMind, at Gemini Robotics “mere end fordobler” resultatet på et bredt generaliserings-benchmark sammenlignet med andre førende VLA-modeller, og at Gemini Robotics-ER opnår en succesrate to til tre gange højere end Gemini 2.0 på styringsopgaver. Det skal læses som DeepMinds egne forsøg og benchmarks. En model, der klarer sig i et forsøg, er ikke det samme som en model i drift ude i verden, og demonstrationerne er selskabets egne.

DeepMind løfter også et sikkerhedsspor: et datasæt kaldet ASIMOV, der skal måle, om en robots planlagte handlinger er sikre omkring mennesker.

Fra RT-2 til Gemini Robotics

Retningen er ikke ny for DeepMind. Selskabet viste allerede i 2023 RT-2, sin første vision-language-action-model, der genbrugte web-trænet viden til at styre en robotarm, og senere RT-X, hvor data fra mange robotkroppe blev samlet i én model. Gemini Robotics fører den linje videre, nu oven på selskabets nyeste og kraftigste model frem for de tidligere forsknings-modeller.

Springet ligger i kroppen, modellen skal styre. Gemini Robotics-ER stilles til rådighed for en håndfuld udvalgte testere, blandt andre Agility Robotics, Boston Dynamics og Enchanted Tools. Men den tætte aftale er med Apptronik, hvis Apollo er bygget til lager og fabrik. De to selskaber skal bringe modellerne ind i næste generation af Apollo.

Indtil videre er Gemini Robotics vist på robotarme og på Apollo i DeepMinds egne opstillinger. Om den kan styre en tobenet robot lige så sikkert i en rigtig fabrik eller et hjem, er endnu uafprøvet.