NVIDIA Cosmos 3 Edge приносить штучний інтелект роботів на виробництво
Новий компактний AI-моделі дозволяють роботам і заводським камерам самостійно приймати рішення без необхідності в центрі обробки даних поблизу.

Ключові моменти
- NVIDIA випустила Cosmos 3 Edge у 2025 році — AI-модель світу з 4 мільярдами параметрів, розроблена для роботи на малих периферійних пристроях замість потужних серверів у центрах обробки даних.
- Модель займає перше місце серед моделей подібного розміру на VANTAGE-Bench, тесті для оцінки завдань комп'ютерного зору в розумних будинках і робототехніці.
- На обладнанні NVIDIA Jetson Thor модель обробляє 32 передбачені дії робота за цикл висновку при 15 кадрах на секунду, що достатньо для керування в реальному часі.
- NVIDIA також випустила супровідну модель політики, навчену на наборі даних DROID — загальнодоступній колекції записів маніпуляцій робота для завдань захоплення та розміщення.
Уявіть робочу руку в лікарняному складі матеріалів. Вона повинна помітити коробку, потягнутись до неї, передбачити, що станеться, коли її пальці торкнуться об'єкту, і коригуватися, якщо щось зміниться. До недавна виконання всього цього одночасно вимагало з'єднання з потужним сервером, розташованим за кілька миль. NVIDIA хоче це змінити.
У вівторок NVIDIA опублікувала Cosmos 3 Edge на Hugging Face, репозиторій з відкритим кодом, де дослідники вільно діляться моделями. Модель достатньо компактна для прямого запуску на пристрої, який виконує роботу, будь то складський робот, заводська камера чи автономний транспортний засіб.
Ключова фраза тут — «модель світу». Модель світу в загальному сенсі — це AI-програмне забезпечення, яке вивчає, як сцена змінюється з часом. Вона не просто розпізнає об'єкти. Вона передбачає, як вони будуть рухатися, що спричинить дія, і який хід робити далі. Подумайте про це як про надання машині грубого уявлення про причину та наслідок.
Cosmos 3 Edge робить це за допомогою 4 мільярдів параметрів, де параметр — це одне коригуюче число всередині моделі, яке формує її мислення. Це звучить великим, але топові AI-моделі, використовувані для чатботів, мають сотні мільярдів. При 4 мільярдах модель розміщується на периферійних пристроях — малих комп'ютерах, вбудованих у машини на заводських поверхах і в лікарняних коридорах, а не в хмарному центрі обробки даних.
Як це насправді керує роботом?
Модель передбачає, що робити, і показує, як виглядатиме сцена далі, за той самий крок. Дайте їй зображення столу з бананом та інструкцію «підніміть банан і покладіть його на тарілку», і вона видаватиме як фізичні рухи робочої руки, так і візуальну симуляцію того, як сцена повинна виглядати після цих рухів.
NVIDIA побудувала модель з двома пов'язаними системами обробки, що працюють на основі спільного розуміння сцени. Одна система займається мовним міркуванням та зоровим аналізом. Інша займається передбаченням і генеруванням дій. Вони поділяють спільний шар уваги — частину моделі, яка вирішує, які інформація мають значення в будь-який момент, так що обидві сторони залишаються синхронізованими.
Дії від дуже різних машин — захоплювача робота, камери на вилкоподібному навантажувачу, системи керування транспортним засобом — переводяться в один і той же компактний математичний формат. Це означає, що одна модель потенційно може обслуговувати кілька різних типів машин з мінімальним перетренуванням.
Для розробників NVIDIA випускає сценарії навчання та готову версію, доведену до ладу для завдань захоплення та розміщення робота. Команди можуть адаптувати базову модель, використовуючи невеликий кластер високопродуктивних GPU — спеціалізованих мікросхем, які виконують інтенсивні обчислення, необхідні для AI, перед тим як розгорнути її на дешевшому периферійному обладнанні на місцях.
NVIDIA також випустила швидшу версію більшої супровідної моделі, яка зменшує кількість внутрішніх етапів обробки зі справаж 50 до всього 4, забезпечуючи до 25 разів швидшу генерацію зображень і відео.
Cosmos 3 Edge доступна для вільного завантаження з Hugging Face.



