Gemini Robotics 2 di Google DeepMind insegna ai robot a camminare, fare nodi e lavorare in coppia
Il nuovo modello controlla gli umanoidi dalla testa ai piedi, si adatta a nuovi corpi robotici in poche ore e permette ai robot di collaborare su compiti più lunghi.

Punti chiave
- Google DeepMind ha presentato Gemini Robotics 2, il suo sistema di IA aggiornato per il controllo dei robot, nel giorno dell'annuncio.
- Il sistema ora gestisce il movimento di tutto il corpo negli umanoidi come l'Apollo 2 di Apptronik, non solo il lavoro con i bracci da tavolo.
- Una nuova versione on-device può essere addestrata su un nuovo corpo robotico in poche ore utilizzando meno di 200 esempi.
- Il modello di ragionamento, Gemini Robotics ER 2, è disponibile su Google AI Studio e in anteprima privata sulla piattaforma Gemini Enterprise Agent Platform.
- DeepMind afferma che l'aggiornamento è la sua versione di robotica più sicura finora nei test di prossimità umana, supportata da un nuovo benchmark chiamato ASIMOV-Agentic.
Google DeepMind ha rilasciato Gemini Robotics 2, un aggiornamento al cervello IA che vuole installare nei prossimi robot fisici. L'annuncio è stato pubblicato sul blog di DeepMind.
Il concetto è semplice. Dai a un robot un'istruzione in linguaggio naturale e il software capisce come muovere le gambe, le braccia e le dita per svolgere il compito.
Un tempo significava un braccio robotico su un banco che eseguiva un compito ripetitivo. Questa versione guida un umanoide completo per una stanza.
Che cos'è Gemini Robotics 2, in parole semplici?
È il livello software che trasforma le istruzioni vocali e le immagini della fotocamera in movimento fisico. DeepMind lo chiama modello visione-linguaggio-azione, cioè un sistema che acquisisce ciò che il robot vede e sente, quindi produce i comandi motori per agire.
Ci sono tre componenti in questa versione. Una gestisce l'azione, una gestisce il ragionamento e la pianificazione, e una è una versione snella che funziona sul robot stesso senza necessità di internet.
| Modello | Cosa fa | Dove ottenerlo |
|---|---|---|
| Gemini Robotics 2 | Trasforma visione e linguaggio in controllo motore per umanoidi completi e robot a due braccia | Partner in early access |
| Gemini Robotics ER 2 | Pianifica compiti multi-step, comunica con gli umani, coordina più robot | Google AI Studio; anteprima privata sulla piattaforma Gemini Enterprise Agent Platform |
| Gemini Robotics On-Device 2 | Funziona localmente sul robot, si adatta a un nuovo corpo in poche ore | Partner in early access |
Cosa può effettivamente fare adesso?
Nelle demo di DeepMind, un umanoide Apptronik Apollo 2 sente "metti l'annaffiatoio nel bidone verde nello scaffale in basso", cammina verso un tavolo, raccoglie il contenitore, cammina verso lo scaffale e lo posiziona. Niente di veloce. Niente di elegante. Ma end-to-end, sulle gambe.
La destrezza è l'altro titolo. Il modello controlla una mano SharpaWave a cinque dita con 22 giunti, articolazione sufficiente per fare un nodo o sigillare un sacchetto di plastica. Funziona anche su pinze a due dita più semplici su una piattaforma di ricerca Franka Duo per compiti di imballaggio stretto.
E ora due robot possono dividere un compito. Il modello di ragionamento, Gemini Robotics ER 2, coordina fra loro e tiene traccia di se ogni step ha effettivamente funzionato.
Come è diverso dalla versione precedente?
Il precedente Gemini Robotics, rilasciato all'inizio di quest'anno, controllava la parte superiore del corpo di un umanoide per compiti da tavolo. La camminata e l'equilibrio di tutto il corpo erano fuori portata.
DeepMind è onesto nel dire che la velocità è ancora un problema. La demo di Apollo è deliberata, non veloce. Guardando i clip si vede un robot che pensa a ogni passo.
Il modello on-device è l'aggiornamento più silenzioso. Può essere puntato su un nuovo corpo robotico, un layout di bracci diverso o un nuovo set di sensori, e imparare a controllarlo in poche ore da meno di 200 dimostrazioni di esempio. DeepMind ha mostrato questo funzionante su hardware Dexmate, SO101 e Trossen.
Le persone normali dovrebbero preoccuparsi della sicurezza?
Non oggi, perché questi robot sono ancora nei laboratori e nei workshop partner, non nei salotti. Ma DeepMind sta chiaramente creando il terreno per il giorno in cui arriveranno.
L'azienda ha pubblicato un rapporto tecnico sulla sicurezza di Gemini Robotics 2 e ha introdotto un benchmark chiamato ASIMOV-Agentic, che verifica se il modello di ragionamento rifiuta i comandi non sicuri e chiede aiuto a una persona quando è incerto. Inoltre misura quanto bene il robot riconosce una persona che si avvicina troppo e interrompe il movimento.
DeepMind afferma che questo è il modello di robotica con le migliori prestazioni fino ad oggi in questi test di prossimità umana. Questo è il punteggio dell'azienda stessa, sul suo benchmark, quindi consideralo come una base da migliorare piuttosto che come un certificato.
Cosa succede dopo?
Gli sviluppatori possono provare il modello di ragionamento, Gemini Robotics ER 2, su Google AI Studio adesso. I modelli di azione vanno prima ai partner hardware selezionati.
La lettura onesta: questo è un progresso significativo nel controllo robotico general-purpose, non un prodotto in spedizione. Un umanoide che cammina attraverso una stanza per riporre un annaffiatoio è un vero passo avanti. Un umanoide che fa il bucato non è di quest'anno.



