Google DeepMind har tatt et stort sprang fremover innen robotikk med lanseringen av Gemini Robotics 2, deres mest avanserte visjons-, språk- og handlingsmodell . Dette nye intelligenslaget lover å forvandle roboter til virkelig tilpasningsdyktige maskiner, i stand til å resonnere om hver bevegelse og utføre komplekse oppgaver i virkelige miljøer. Selskapet presenterer det som en universell hjerne som kan installeres på alle typer robotmaskinvare, fra industrielle armer til fullverdige humanoider.
Systemet er strukturert rundt tre spesialiserte modeller som fungerer sammen. For det første oversetter VLA-modellen (Vision, Language, and Action) instruksjoner til fysiske bevegelser. ER 2-modellen fungerer som hjernen på overordnet nivå, planlegger oppgaver og kommuniserer med mennesker. Og On-Device 2-modellen er optimalisert for å kjøre lokalt på roboten, uten å være avhengig av en internettforbindelse. Denne arkitekturen lar roboten tenke og handle samtidig , og eliminerer pausene som var vanlige i lignende systemer frem til nå.
Tre modeller for komplett robotintelligens
Visjons-, språk- og handlingsmodellen (VLA) er ansvarlig for direkte styring av robotens kropp. For første gang kan den håndtere komplette humanoider, fra tær til hender , slik at de kan gå, bøye seg, strekke seg og manipulere objekter med fingerferdighet. I tester har den vist 90 % nøyaktighet i innsettingsoppgaver med robotgripere og 92 % nøyaktighet i å skru ut lyspærer med femfingrede hender og 22 frihetsgrader.
Gemini Robotics ER 2-modellen fokuserer derimot på integrert resonnering. Den fungerer som en agent som observerer omgivelsene sine, planlegger flertrinnssekvenser og koordinerer med VLA for å utføre dem . Den kan bruke eksterne verktøy som Google Søk når den trenger ytterligere informasjon og er i stand til å analysere sanntidsvideo for å overvåke oppgavefremdriften. Ifølge Google oppnår denne modellen 57,4 % nøyaktighet i estimering av fremdrift og 91,3 % nøyaktighet i identifisering av viktige hendelser, med en feilmargin på mindre enn ett sekund.
Den tredje modellen, Gemini Robotics On-Device 2, er designet for å fungere offline. Den kan tilpasse seg en helt ny robot på bare noen få timer, og trene den med færre enn 200 eksempler . Dette gjør den ideell for miljøer der latens eller personvern er kritisk, for eksempel fabrikker eller tilkoblede enheter i private hjem.
Fullstendig kroppskontroll og enestående fingerferdighet
En av de mest slående nye funksjonene er fullkroppskontroll. Mens tidligere modeller bare kontrollerte den øvre delen av roboten for oppgaver på et bord, utvider Gemini Robotics 2 fysisk kunstig intelligens til fullkroppsbevegelser. Robotene kan nå gå, bøye seg, strekke seg og manipulere objekter mens de planlegger komplekse handlinger . I demonstrasjoner var Apptroniks Apollo 2-robot, utstyrt med SharpaWave-hender, i stand til å organisere hyller og knyte knuter med fullstendig presisjon.
Finmotorikken har også blitt bemerkelsesverdig forbedret. Modellen kan kontrollere parallelle grep med to fingre for oppgaver som krever styrke, samt femfingrede hender for delikate bevegelser. Demonstrerte ferdigheter inkluderer å lukke poser, knyte knuter, skru av lyspærer og montere små deler . Google har publisert data som støtter disse mulighetene: presise innsettingsoppgaver oppnår en suksessrate på 90 %, og løsnende oppgaver en suksessrate på 92 %.
Samarbeid mellom roboter og sanntidsresonnement
En annen viktig innovasjon er muligheten til å koordinere flere roboter i samme arbeidsområde. Gemini Robotics ER 2 lar ulike typer maskiner dele en felles forståelse av omgivelsene sine og dele oppgaver . I en test plasserte en Franka F3 Duo-robot objekter i esker, mens Apollo 2-menneskefiguren plasserte dem på en hylle. Ifølge Google kunne ingen av dem ha fullført oppgaven alene, men ved å samarbeide fullførte de den.
Systemet har også sporing av fremdrift i sanntid. Gjennom kontinuerlig analyse av videoen som roboten tar opp, klassifiserer modellen hvert bilde på en femnivåskala, fra start til fullføring av aktiviteten. Hvis et uventet problem oppstår, kan roboten finne den nøyaktige plasseringen av feilen og fortsette derfra etter å ha rettet den , uten å måtte starte hele arbeidsflyten på nytt. Dette representerer en betydelig forbedring i forhold til tidligere versjoner, der enhver feil krevde at man startet helt på nytt.
Sikkerhet og tilgjengelighet for utviklere
Google har lagt spesiell vekt på sikkerheten til denne nye generasjonen. Modellen inkluderer en flerlags tilnærming med robuste beskyttelsesrammeverk og et nytt vurderingsverktøy kalt ASIMOV-Agentic , som måler om robotene avviser farlige kommandoer, oppdager usikre situasjoner og stopper når en person kommer for nær. I demonstrasjoner var systemet i stand til automatisk å stoppe bevegelsen til en humanoid robot når den oppdaget et menneske i arbeidsområdet sitt, og gjenoppta aktiviteten når området var klart.
Gemini Robotics ER 2 er nå tilgjengelig for utviklere gjennom Gemini API, Google AI Studio og i privat forhåndsvisning på Gemini Enterprise Agent Platform. VLA- og On-Device 2-modellene er imidlertid bare tilgjengelige for partnere med tidlig tilgang . Google forventer at denne teknologien vil akselerere adopsjonen av roboter i sektorer som logistikk, produksjon og hjemmeautomasjon, der allsidighet og sikkerhet er avgjørende.
Kombinasjonen av kontinuerlig resonnering, miljøbevissthet, flertrinnsplanlegging, robotsamarbeid og integrasjon med eksterne verktøy posisjonerer Gemini Robotics 2 som en av DeepMinds mest avanserte utviklinger hittil. Med denne utgivelsen forsterker Google sin satsing på fysisk kunstig intelligens, med mål om å gjøre det mulig for roboter å utføre enhver oppgave et menneske ville gjort, fra å fylle oppvaskmaskinen til å jobbe på en fabrikk, alt med den flyten og sikkerheten som er nødvendig for å sameksistere med mennesker.
