Dimanche 9 août 2026 · édition en continu
Rechercher
STYNX
L'actualité de l'intelligence artificielle · sources primaires
Puces & GPU 9 juillet 2026 Veille IA

Comment le CPU Vera de NVIDIA divise par quatre le coût d'entraînement des modèles MoE

Derrière les GPU Rubin, c'est le CPU Vera qui change la donne pour l'entraînement des modèles à mélange d'experts. NVIDIA promet jusqu'à quatre fois moins de puces nécessaires.

Puces NVIDIA Rubin et Vera assemblées dans un rack de serveur
Photo : Matheus Bertelli / Pexels

On a beaucoup parlé des GPU Rubin quand NVIDIA a présenté sa nouvelle plateforme. On a moins parlé du CPU qui les accompagne, Vera, et pourtant c'est peut-être lui qui va changer le calcul économique de l'entraînement des grands modèles à mélange d'experts, les fameux MoE devenus la norme chez la plupart des laboratoires d'IA.

Un modèle MoE ne fait pas tourner tous ses paramètres pour chaque requête. Il route chaque token vers un sous-ensemble d'experts spécialisés. C'est efficace en théorie, mais en pratique, l'entraînement de ces architectures pose un problème d'équilibrage de charge entre GPU : certains experts sont plus sollicités que d'autres, ce qui crée des goulets d'étranglement et gaspille de la puissance de calcul. NVIDIA affirme que l'architecture Vera Rubin NVL72, avec son couplage de 72 GPU Rubin et 36 CPU Vera, permet de traiter une bonne partie de cette logique de routage et d'orchestration directement côté CPU, libérant les GPU pour le calcul pur.

Un ratio GPU/CPU pensé pour les experts

Le chiffre avancé par l'entreprise est clair : jusqu'à 4 fois moins de GPU nécessaires pour entraîner un modèle MoE avec cette architecture, comparé à une configuration classique. Le ratio de 2 GPU pour 1 CPU sur le NVL72 n'est pas anodin : il correspond, selon NVIDIA, à un point d'équilibre où le CPU Vera peut absorber la gestion mémoire, le préfetching des experts et la synchronisation inter-nœuds sans devenir lui-même un goulet d'étranglement.

Concrètement, cela veut dire qu'un laboratoire qui aurait eu besoin de plusieurs milliers de GPU pour entraîner un modèle MoE de grande taille pourrait, en théorie, atteindre un résultat comparable avec une fraction de cette flotte. À l'échelle d'un cluster d'entraînement, la différence se chiffre en dizaines de millions de dollars d'infrastructure économisés, sans compter la facture énergétique qui suit à peu près la même courbe.

L'inférence n'est pas oubliée

NVIDIA met aussi en avant une réduction du coût par token en inférence pouvant atteindre 10 fois, un chiffre qui concerne cette fois le déploiement des modèles une fois entraînés, et non leur fabrication. C'est un point distinct de l'argument sur l'entraînement, mais les deux se combinent : moins cher à entraîner, moins cher à faire tourner ensuite en production. Pour les entreprises qui facturent leurs modèles à l'usage, la marge se joue précisément sur ce coût par token.

La promesse de NVIDIA reste, pour l'instant, celle du fabricant : les chiffres avancés n'ont pas encore été vérifiés de manière indépendante sur des charges de travail réelles à grande échelle.

Une disponibilité encore lointaine

La plateforme Vera Rubin NVL72 est annoncée en production pour le second semestre 2026. Ce n'est donc pas un produit qu'on va voir tourner dans les datacenters avant un moment. Mais les grands fournisseurs cloud ont déjà pris position : AWS, Google Cloud, Microsoft, Oracle Cloud Infrastructure, ainsi que des spécialistes du calcul GPU comme CoreWeave, Lambda, Nebius et Nscale ont annoncé leur intention de déployer cette architecture. C'est un signal assez net que le marché anticipe une demande forte pour l'entraînement de modèles MoE toujours plus gros, à commencer par les futures générations de modèles de fondation.

Reste une question ouverte : ce ratio GPU/CPU optimal, calibré pour les MoE actuels, tiendra-t-il quand les architectures de routage évolueront encore ? Les laboratoires d'IA changent leurs designs de modèles presque aussi vite que les fabricants de puces changent leurs générations de silicium. NVIDIA joue un pari sur la continuité de la tendance MoE, un pari qui semble raisonnable aujourd'hui mais qui devra être confirmé par l'usage.

Sources

  1. NVIDIA Official Press Release – Rubin Platform

Stynx s'appuie exclusivement sur des sources primaires officielles. Notre méthodologie & sourcing.

À lire aussi

Commentaires

Soyez le premier à réagir.