Nvidia veut contrôler chaque puce à l'intérieur des data centers IA

L'entreprise connue pour ses puces graphiques souhaite désormais fournir les cerveaux qui exécutent les agents IA. Voici ce que fait réellement son nouveau système Vera Rubin et pourquoi cela compte pour quiconque utilise des outils IA au travail.

AI2Day Newsdesk· 3 min read
Rows of glowing server racks inside a large modern data centre, shot from floor level looking down a long corridor, cool blue and white lighting reflecting off
Share

Points clés

  • Le nouveau système de puce Vera Rubin de Nvidia prétend traiter dix fois plus de tâches IA par watt que son système Grace Blackwell précédent.
  • OpenAI possède déjà un rack Vera Rubin en fonctionnement dans ses installations, a confirmé Nvidia lors d'une présentation technique en juin 2025.
  • Nvidia vend le CPU Vera, le cerveau de traitement à l'intérieur du nouveau système, comme produit autonome et a indiqué aux clients chinois qu'il pourrait être expédié dès août 2025.
  • AMD a révélé son rack de puces IA concurrent Helios dimanche, la même semaine où Nvidia a présenté sa présentation Vera Rubin, dans une course claire pour les contrats de puces pluriannuels avec des entreprises comme Meta, Amazon et OpenAI.

Nvidia a bâti sa fortune en vendant des GPU, les puces spécialisées qui effectuent les calculs intensifs dont l'IA a besoin. Désormais, elle souhaite également vendre l'autre type de puce à l'intérieur des data centers IA.

Lors d'une présentation pour les journalistes au siège de Santa Clara la semaine dernière, rapportée en détail pour la première fois par Wired AI, les cadres de Nvidia ont exposé le cas de Vera Rubin, son système de puce de nouvelle génération. L'affirmation principale : Vera Rubin traite dix fois plus de tokens par watt que son prédécesseur. Un token est un petit morceau de texte ou de données, et les tokens par watt est essentiellement une mesure du volume de travail IA qu'un système peut accomplir pour une quantité donnée d'électricité.

Cela importe pour les entreprises qui exécutent l'IA à grande échelle. L'électricité est l'un des plus gros coûts d'un data center, et les gains d'efficacité se traduisent directement par des factures moins élevées.

Pourquoi Nvidia vend-elle désormais des CPU ?

Parce que l'IA devient plus complexe, ce qui nécessite un type de puce différent. Les GPU font des calculs rapides. Les CPU, les processeurs à usage général qui ont fait fonctionner les ordinateurs pendant des décennies, sont meilleurs pour coordonner les tâches, gérer les flux de données et exécuter la logique des logiciels. Alors que les entreprises construisent des agents IA, des logiciels capables d'effectuer des tâches multi-étapes de façon autonome comme programmer une réunion ou analyser une feuille de calcul sans qu'un humain clique sur chaque étape, elles ont besoin de plus de puissance CPU aux côtés de leurs GPU.

Vera Rubin associe un CPU à chaque deux GPU. Un rack complet Vera Rubin NVL72, une pile de puces emballées dans une seule unité refroidie par liquide, contient 36 CPU Vera et 72 GPU Rubin.

Nvidia affirme également que le nouveau système est beaucoup plus facile à installer que les produits antérieurs. Elle décrit Vera Rubin comme un « calcul sans câbles » et affirme que le temps de configuration peut passer de quelques heures par rack à quelques minutes. L'ensemble du système fonctionne sur un refroidissement par liquide, qui consomme moins d'énergie que de souffler de l'air sur des puces chaudes.

L'entreprise évalue le CPU Vera comme plus rapide que les puces rivales d'AMD et Intel. À noter : les tests de comparaison ont apparemment utilisé des générations légèrement antérieures des produits de ces concurrents, ce qui est le genre de détails qui mérite toujours l'attention quand une entreprise note ses propres devoirs.

Les premiers clients mentionnés par Nvidia incluent Microsoft, OpenAI et Oracle. Vera Rubin devrait être largement expédié au second semestre 2025.

Pour quiconque dont le travail touche aux outils IA, le résultat pratique est plus simple que les spécifications de puces le suggèrent. Un matériel plus rapide et plus efficace signifie que les services IA que vous utilisez déjà, des assistants de rédaction aux robots de service client, deviennent moins chers et plus rapides à exécuter. Cela tend à les déployer plus largement, pas moins. Que ce soit une menace ou un cadeau dépend presque entièrement de la façon dont vous les utilisez.

Conclusion : Si votre organisation évalue des outils IA cette année, demandez aux fournisseurs quelle génération matérielle leur produit utilise. Les améliorations d'efficacité au niveau des puces apparaissent souvent sous forme de coûts par utilisation réduits dans 12 à 18 mois.

© 2026 AI2Day