Da Google DeepMind i marts tog sin Gemini-model ind i robotterne, lå selve hjernen stadig i en datacentral. Robotten så og handlede, men tænkningen foregik et andet sted, koblet op over nettet. Nu har selskabet præsenteret en udgave, der kører hele vejen rundt på robotten selv. Den hedder Gemini Robotics On-Device, og navnet er pointen. Modellen ligger lokalt på maskinen frem for i skyen.

For en robot, der skal gribe, folde og løfte i den fysiske verden, er forskellen ikke triviel. Når tænkningen sker over et netværk, koster hvert kald tid frem og tilbage til serveren, og en svingende eller manglende forbindelse kan stoppe robotten midt i en bevægelse. En model, der ligger på robotten, svarer hurtigere og kan blive ved, selv hvor der ikke er net. DeepMind oplyser, at On-Device-modellen er optimeret til netop det, altså lav latens og drift uafhængigt af et datanetværk, hvilket ifølge selskabet sikrer robusthed i omgivelser med ustabil eller slet ingen forbindelse.

Det er en vision-language-action-model, samme type som martsudgaven. Den tager det, robotten ser, og en instruktion i almindeligt sprog ind, og sender bevægelser ud. DeepMind fremhæver fingerfærdige opgaver som at lyne en taske op og folde tøj, og melder, at modellen klarer sig stærkt på generalisering, altså at den også kan håndtere objekter og scener, den ikke har set under træningen.

Udviklere kan selv finjustere den

Det andet nye er, hvem der får lov at arbejde med modellen. On-Device er ifølge DeepMind den første af selskabets VLA-modeller, der gøres tilgængelig for finjustering. Finjustering vil sige at tilpasse en færdigtrænet model til en bestemt opgave ved at vise den nye eksempler, frem for at træne fra bunden. Og her er tallet bemærkelsesværdigt lavt. Modellen tilpasser sig nye opgaver med så lidt som 50 til 100 demonstrationer, oplyser selskabet.

Til formålet udgiver DeepMind et Gemini Robotics SDK, et udviklerværktøj, hvor man kan afprøve modellen, teste den i fysiksimulatoren MuJoCo og tilpasse den til nye domæner. Adgangen sker gennem et program for udvalgte testere.

Selvom modellen kun er trænet på data fra forskningsplatformen ALOHA, har DeepMind tilpasset den til andre robotkroppe. Det gælder en bi-arm-opstilling med en Franka FR3 og Apptroniks humanoide Apollo-robot, som også var partner på martsudgaven. På Franka-armene viser selskabet opgaver som at folde en kjole og samle dele på et industribælte.

Tallene og demonstrationerne er DeepMinds egne. Selskabet beskriver ydelsen som tæt på den cloud-baserede martsmodel, men en model, der klarer sig i selskabets egne forsøg, er ikke det samme som en, der er afprøvet bredt ude i verden. Hvor lidt en robot reelt skal bruge for at lære en helt ny opgave godt nok til drift, må praksis vise.