Gemini Robotics 2 від Google DeepMind навчає роботів ходити, в'язати вузли та працювати в парах
Нова модель керує гуманоїдами від ніг до кінчиків пальців, адаптується до нових робочих тіл за кілька годин і дозволяє машинам співпрацювати на довші завдання.

Ключові моменти
- Google DeepMind представила Gemini Robotics 2, свою оновлену систему штучного інтелекту для керування роботами, у день цього оголошення.
- Система тепер керує рухом всього тіла в гуманоїдних роботах, таких як Apollo 2 компанії Apptronik, а не лише роботизованими руками на столах.
- Нова версія для локального виконання може бути навчена керувати новим робочим тілом за кілька годин, використовуючи менше 200 прикладів.
- Модель міркування, Gemini Robotics ER 2, доступна в Google AI Studio та у приватному превʻю на платформі Gemini Enterprise Agent Platform.
- DeepMind заявляє, що це його найбезпечніший реліз робототехніки на тестах близькості до людини, підтриманий новим еталоном під назвою ASIMOV-Agentic.
Google DeepMind випустила Gemini Robotics 2, оновлення штучного інтелекту, який компанія хоче встановити у наступному поколінні фізичних роботів. Оголошення було опубліковано в блозі DeepMind.
Ідея проста. Дайте роботу команду звичайною мовою, і програмне забезпечення визначить, як рухати його ноги, руки та пальці для виконання завдання.
Раніше це означало робочу руку на столі, яка виконує одне повторюване завдання. Ця версія керує повнорозмірним гуманоїдом по всій кімнаті.
Що таке Gemini Robotics 2 простою мовою?
Це програмний шар, який перетворює голосові команди та зображення з камери на фізичний рух. DeepMind називає це моделлю зору-мови-дії, тобто системою, яка отримує те, що робот бачить і чує, а потім видає команди двигуна для дії.
У цьому релізі три компоненти. Один керує дією, один займається міркуванням і плануванням, а один — це спрощена версія, яка виконується на самому роботі без потреби в інтернеті.
| Модель | Що вона робить | Де її отримати |
|---|---|---|
| Gemini Robotics 2 | Перетворює зір та мову на керування двигунами для повних гуманоїдів і двозалізних роботів | Ранні партнери доступу |
| Gemini Robotics ER 2 | Планує багатоступеневі завдання, спілкується з людьми, координує кількох роботів | Google AI Studio; приватний превʻю на платформі Gemini Enterprise Agent Platform |
| Gemini Robotics On-Device 2 | Виконується локально на роботі, адаптується до нового тіла за кілька годин | Ранні партнери доступу |
Що він насправді може робити зараз?
У демонстраціях DeepMind гуманоїд Apptronik Apollo 2 чує «помести лійку у зелений контейнер на нижній полиці», йде до столу, підбирає лійку, йде до полиці та розміщує її. Нічого швидкого. Нічого грацьозного. Але наскрізь, на ногах.
Ловкість — це інший заголовок. Модель керує п'ятипальцевою рукою SharpaWave з 22 суглобами, чого достатньо для в'язання вузла або закриття зіпера на сумці. Вона також керує простішими двопальцевими схопленнями на платформі Franka Duo для тісного пакування.
Тепер два робота можуть розділити завдання. Модель міркування, Gemini Robotics ER 2, координує між ними та відстежує, чи дійсно кожен крок спрацював.
Чим це відрізняється від попередної версії?
Попередня Gemini Robotics, випущена на початку цього року, керувала верхньою частиною тіла гуманоїда для робіт за столом. Рухи на повне тіло та збалансування були поза межами.
DeepMind чесно визнає, що швидкість все ще є проблемою. Демонстрація Apollo обережна, а не активна. Дивлячись на кліпи, ви бачите робота, який обмислює кожен крок.
Модель для локального виконання — це тихіше оновлення. Її можна спрямувати на нове робоче тіло, інший макет руки або новий набір датчиків, і вона навчиться керувати ним за кілька годин на основі менше 200 прикладів демонстрацій. DeepMind показав це на обладнанні Dexmate, SO101 та Trossen.
Чи повинні звичайні люди хвилюватися щодо безпеки?
Не сьогодні, тому що ці робота все ще знаходяться в лабораторіях та партнерських майстернях, а не в житлових кімнатах. Але DeepMind явно готує ґрунт на той день, коли вони прибудуть.
Компанія опублікувала звіт про техніку безпеки Gemini Robotics 2 та представила еталон під назвою ASIMOV-Agentic, який перевіряє, чи модель міркування відмовляється від небезпечних команд і просить допомогу у людини, коли вона невпевнена. Він також вимірює, наскільки добре робот помічає людину, яка йде занадто близько, і припиняє рух.
DeepMind каже, що це його найкращий модель робототехніки на сьогоднішній день у цих тестах близькості до людини. Це оцінка компанії, на її власному еталоні, тому розглядайте це як базовий рівень для покращення, а не як сертифікат.
Що далі?
Розробники можуть спробувати модель міркування, Gemini Robotics ER 2, у Google AI Studio прямо зараз. Моделі дій спочатку йдуть до обраних партнерів по обладнанню.
Чесна оцінка: це значний прогрес у загальному керуванні роботами, а не готовий продукт. Гуманоїд, який ходить по кімнаті і прибирає лійку, — це реальний крок. Гуманоїд, який прати вашу білизну, — це не цього року.



