Dimanche 9 août 2026 · édition en continu
Rechercher
STYNX
L'actualité de l'intelligence artificielle · sources primaires
Puces & GPU 2 juillet 2026 Veille IA

OpenAI dévoile Jalapeño, sa puce d'inférence 50% moins chère que les GPU Nvidia

Neuf mois de développement, une chaîne de fabrication déjà bouclée avec TSMC, Broadcom et Celestica : OpenAI sort du bois avec sa première puce maison dédiée à l'inférence, baptisée Jalapeño.

Puce électronique dédiée à l'inférence d'intelligence artificielle sur circuit imprimé
Photo : ed br / Pexels

Neuf mois. C'est le temps qu'il aura fallu à OpenAI pour faire passer une puce du concept initial à la gravure en usine. Le projet s'appelle Jalapeño, et il vise une cible précise : l'inférence des grands modèles de langage, cette étape coûteuse où le modèle entraîné répond enfin aux requêtes des utilisateurs, des milliards de fois par jour.

Les premiers résultats de laboratoire, communiqués par OpenAI, affichent un coût d'inférence par token inférieur d'environ 50% à celui des GPU Nvidia de génération actuelle. Un chiffre qui, s'il se confirme à l'échelle industrielle, change la donne économique d'une entreprise dont les besoins en calcul ne cessent de gonfler avec chaque nouvelle génération de modèle.

Une chaîne de fabrication à trois têtes

Jalapeño n'est pas conçue en interne de bout en bout. OpenAI a assemblé une chaîne industrielle répartie entre trois partenaires spécialisés. La fabrication du silicium revient à TSMC, le géant taïwanais qui grave déjà la quasi-totalité des puces IA du marché, Nvidia compris. L'implémentation du design silicium est confiée à Broadcom, dont l'expertise en circuits sur mesure (ASIC) pour hyperscalers n'est plus à démontrer : l'entreprise a déjà collaboré avec Google sur les puces TPU. Enfin, l'intégration des cartes et des systèmes complets échoit à Celestica, spécialiste canadien de la fabrication électronique.

Cette répartition des tâches n'a rien d'anodin. Elle indique qu'OpenAI ne cherche pas à devenir un fondeur de silicium, mais plutôt à orchestrer une chaîne d'approvisionnement parallèle à celle de Nvidia, en s'appuyant sur des acteurs déjà rodés à la production de puces d'IA à grande échelle.

Pourquoi l'inférence, et pourquoi maintenant

Le choix de cibler l'inférence plutôt que l'entraînement n'est pas anodin non plus. L'entraînement des modèles reste un exercice ponctuel, certes gourmand en calcul, mais limité dans le temps. L'inférence, elle, tourne en continu, à chaque requête envoyée à ChatGPT ou à l'API d'OpenAI. C'est là que les coûts s'accumulent sur la durée, et c'est précisément là que Nvidia capte l'essentiel de la marge grâce à des GPU polyvalents mais chers.

Une puce conçue spécifiquement pour l'inférence de modèles de langage, sans les fonctionnalités superflues d'un GPU généraliste, peut en théorie offrir un meilleur rendement énergétique et un coût par token plus bas. C'est exactement le pari que fait OpenAI avec Jalapeño, et c'est aussi celui qu'ont fait avant elle Google avec ses TPU ou Amazon avec ses puces Trainium et Inferentia.

Les tests en laboratoire montrent une réduction d'environ 50% du coût d'inférence par token comparé aux GPU Nvidia actuels.

Une indépendance qui se construit pas à pas

OpenAI reste, aujourd'hui encore, l'un des plus gros clients de Nvidia. Réduire cette dépendance, même partiellement, représente un enjeu stratégique de taille pour une entreprise dont la facture de calcul pèse lourd dans ses comptes. Développer une puce maison permet aussi de mieux contrôler la disponibilité du matériel, dans un marché où les GPU Nvidia les plus avancés restent difficiles à obtenir en quantité suffisante, tant la demande dépasse l'offre depuis plusieurs années.

Reste à savoir à quelle échelle Jalapeño sera déployée, et sur quel calendrier de production en série. OpenAI n'a pas précisé de date de mise en service commerciale ni de volumes visés. Les chiffres de 50% de réduction de coût proviennent pour l'instant de tests en laboratoire, une étape qui précède généralement de plusieurs mois, voire plusieurs années, un déploiement à grande échelle dans des datacenters de production.

Il faudra aussi observer comment Nvidia réagit à cette annonce, elle qui a déjà vu plusieurs de ses plus gros clients, Google, Amazon, Meta, développer leurs propres puces internes ces dernières années, sans pour autant renoncer à commander massivement ses GPU. La bataille du silicium d'IA se joue désormais autant sur les marges que sur la puissance brute.

Sources

  1. Broadcom / OpenAI - Jalapeño announcement

Stynx s'appuie exclusivement sur des sources primaires officielles. Notre méthodologie & sourcing.

À lire aussi

Commentaires

Soyez le premier à réagir.