NVIDIA Cosmos 3 Edge : les cerveaux des robots deviennent autonomes
Un nouveau modèle d'IA compact permet aux robots et aux caméras d'usine de penser par eux-mêmes, sans avoir besoin d'un centre de données à proximité.

Points clés
- NVIDIA a lancé Cosmos 3 Edge en 2025, un modèle de monde IA à 4 milliards de paramètres conçu pour fonctionner sur de petits appareils de périphérie plutôt que sur de grands serveurs de centre de données.
- Le modèle se classe premier parmi les modèles de taille similaire sur VANTAGE-Bench, un test de référence pour les tâches d'IA basées sur la vision dans les bâtiments intelligents et la robotique.
- Fonctionnant sur le matériel NVIDIA Jetson Thor, le modèle traite 32 actions de robot prédites par cycle d'inférence à 15 images par seconde, assez rapide pour un contrôle en temps réel.
- NVIDIA a également lancé un modèle politique complémentaire entraîné sur l'ensemble de données DROID, une collection accessible au public d'enregistrements de manipulation de robots, pour les tâches de prise et de placement.
Imaginez un bras robotisé dans une réserve d'hôpital. Il doit repérer une boîte, la saisir, prédire ce qui se passe au contact de ses doigts et s'adapter si quelque chose se déplace. Jusqu'à récemment, faire tout cela à la fois nécessitait une connexion à un serveur puissant à des kilomètres de distance. NVIDIA veut changer cela.
Mardi, NVIDIA a publié Cosmos 3 Edge sur Hugging Face, le référentiel d'IA open-source où les chercheurs partagent librement les modèles. Le modèle est suffisamment compact pour fonctionner directement sur l'appareil effectuant le travail, qu'il s'agisse d'un robot d'entrepôt, d'une caméra d'usine ou d'un véhicule autonome.
L'expression clé ici est « modèle du monde ». Un modèle du monde, au sens large, est un logiciel d'IA qui apprend comment une scène change au fil du temps. Il ne se contente pas de reconnaître les objets. Il prédit comment ils se déplaceront, ce qu'une action causera et quel mouvement faire ensuite. Pensez-y comme donner à une machine une image mentale approximative de la cause et de l'effet.
Cosmos 3 Edge le fait avec 4 milliards de paramètres, où un paramètre est un nombre unique ajustable à l'intérieur du modèle qui façonne sa façon de penser. Cela semble énorme, mais les principaux modèles d'IA utilisés pour les chatbots en contiennent des centaines de milliards. Avec 4 milliards, le modèle s'adapte aux appareils de périphérie, les petits ordinateurs intégrés aux machines sur les planchers d'usine et dans les couloirs d'hôpitaux, plutôt que de rester dans un centre de données cloud.
Comment contrôle-t-il réellement un robot ?
Le modèle prédit quoi faire et montre ce qui devrait se passer ensuite dans la même étape. Donnez-lui une image d'une table avec une banane et l'instruction « prends la banane et mets-la dans l'assiette », et il produit à la fois les mouvements physiques du bras robotisé et une simulation visuelle de comment la scène devrait ressembler une fois ces mouvements effectués.
NVIDIA a construit le modèle avec deux systèmes de traitement liés travaillant à partir d'une compréhension commune de la scène. Un système gère le raisonnement linguistique et visuel. L'autre gère la prédiction et la génération d'actions. Ils partagent une couche d'attention commune, la partie du modèle qui décide quels éléments d'information importent le plus à tout moment, afin que les deux côtés restent synchronisés.
Les actions provenant de machines très différentes, une pince robotisée, une caméra sur un chariot élévateur, un système de direction de véhicule, sont toutes traduites dans le même format mathématique compact. Cela signifie qu'un modèle peut potentiellement servir plusieurs types de machines avec un réapprentissage minimal.
Pour les développeurs, NVIDIA met à disposition des scripts d'entraînement et une version prête à l'emploi optimisée pour les tâches de robots de prise et de placement. Les équipes peuvent adapter le modèle de base en utilisant un petit cluster de GPU haut de gamme, les puces spécialisées dont l'IA a besoin pour les calculs intensifs, avant le déploiement sur du matériel de périphérie moins coûteux sur le terrain.
NVIDIA a également lancé une version plus rapide d'un modèle complémentaire plus grand qui réduit le nombre d'étapes de traitement internes de jusqu'à 50 à seulement 4, offrant une génération d'images et de vidéos jusqu'à 25 fois plus rapide.
Cosmos 3 Edge est disponible dès maintenant en téléchargement gratuit depuis Hugging Face.



