O novo cérebro robótico da Google consegue observar, planificar e trabalhar em equipa com outros robôs
O Gemini Robotics ER 2 oferece às máquinas um "pensador" de nível superior mais inteligente que acompanha o progresso em vídeo e delega os movimentos reais a um controlador de nível inferior.

Pontos-chave
- A Google DeepMind lançou o Gemini Robotics ER 2, um novo modelo de "raciocínio incorporado" que funciona como um cérebro de nível superior para robôs.
- O modelo obtém 57,4% na classificação de progresso e 91,3% na localização de momentos, identificando o fotograma exato de vídeo quando um passo da tarefa é concluído.
- Suporta colaboração multi-robô, permitindo que um robô com rodas e um humanóide partilhem uma tarefa através de compreensão comum.
- Os desenvolvedores podem experimentá-lo agora através da API Gemini e Google AI Studio, com uma pré-visualização privada na Plataforma Gemini Enterprise Agent.
- Uma demonstração emparelha o modelo com o robô Spot da Boston Dynamics para buscar objetos por comando de voz.
A Google DeepMind lançou um novo modelo que pretende ser a parte pensante da cabeça de um robô. Chama-se Gemini Robotics ER 2, onde ER significa "embodied reasoning" (raciocínio incorporado), que é uma forma sofisticada de dizer que o modelo compreende o mundo físico à sua volta.
Eis a imagem simples. O modelo observa através da câmara do robô, ouve-o, planifica os passos e depois diz a um controlador de nível inferior separado como mover efetivamente os braços e rodas. Este controlador de nível inferior chama-se modelo de visão-linguagem-ação, ou VLA: software que transforma um plano em movimentos motores específicos.
Pense no ER 2 como o gestor e no VLA como as mãos.
O que é que consegue fazer efetivamente?
Consegue observar vídeo contínuo, acompanhar como está um trabalho e mudar para o próximo passo no momento certo. Esta é a principal alteração relativamente à versão anterior, ER 1.6.
Digamos que um robô está a verter café. O ER 2 está preparado para ver o fotograma exato em que a chávena está cheia e dizer ao braço para parar. Os próprios testes da Google colocam-no em 91,3% de precisão nesta capacidade de "localização de momentos", com um erro de sincronismo médio inferior a um segundo.
Também lida com o acompanhamento do progresso das tarefas, classificando cada fotograma de vídeo numa de cinco categorias, de 0% concluído a 100% concluído. Isto dá ao robô uma sensação de "estou perto de terminar, ou cometi um erro e preciso de tentar novamente?"
Como é que isto é diferente de outra IA de robôs?
Velocidade e malabarismo. O ER 2 liga-se à API Gemini Live, uma ligação de transmissão bidirecional construída para baixa latência, para que o robô não congele sempre que tem de pensar.
Também consegue chamar ferramentas externas durante a tarefa, como a Pesquisa Google, ou uma função personalizada que um desenvolvedor escreve. A Google apresentou uma demonstração com o Spot, o robô quadrúpede amarelo da Boston Dynamics, a buscar um saco de pipocas mediante um pedido falado.
Outro novo truque: vários robôs a trabalhar juntos. Um robô com rodas e um humanóide podem agora partilhar uma compreensão semântica do trabalho e entregar tarefas um ao outro. A Google demonstrou isto com o humanóide Apollo 2 da Apptronik e um braço Franka F3 Duo.
Os números que importam
| Capacidade | Pontuação ER 2 | O que significa |
|---|---|---|
| Classificação de progresso | 57,4% | Quão bem acompanha o progresso da tarefa em vídeo |
| Precisão de localização de momentos | 91,3% | Identificação do fotograma exato em que um evento ocorre |
| Sincronismo de localização de momentos | Erro médio de 0,96s | Reação sub-segundo, suficientemente rápida para robôs reais |
Quem o pode usar e quanto custa?
Os desenvolvedores podem aceder ao ER 2 hoje através da API Gemini e Google AI Studio, com uma pré-visualização privada na Plataforma Gemini Enterprise Agent. A Google não publicou preços de robótica por token, por isso os amadores devem contar com as tarifas padrão da API Gemini mais o que quer que aponte para o hardware. O código de exemplo está no GitHub.
Isto é orientado para desenvolvedores de robótica e empresas, não para consumidores. Não pode comprar um robô ER 2 na Argos.
E quanto à segurança?
A Google diz que o ER 2 é o seu modelo de robótica mais seguro até agora, com melhores pontuações em "conformidade com instruções de segurança" e "proximidade humana", o que significa que tem mais cuidado em afastar-se das pessoas e recusar comandos inseguros. Isto é tranquilizador no papel. O verdadeiro teste será em casas, armazéns e hospitais, onde o café derramado é um incómodo, mas um swing de braço mal calculado não é.
Uma nota de privacidade em palavras simples: qualquer robô que execute este modelo está a transmitir vídeo e áudio para os servidores da Google para pensar. Se estas máquinas acabarem na sua cozinha um dia, vale a pena lembrar. Por enquanto, é uma ferramenta de desenvolvedor e as câmaras estão nos laboratórios.



