IdentifiantMot de passe
Loading...
Mot de passe oublié ?Je m'inscris ! (gratuit)

Vous êtes nouveau sur Developpez.com ? Créez votre compte ou connectez-vous afin de pouvoir participer !

Vous devez avoir un compte Developpez.com et être connecté pour pouvoir participer aux discussions.

Vous n'avez pas encore de compte Developpez.com ? Créez-en un en quelques instants, c'est entièrement gratuit !

Si vous disposez déjà d'un compte et qu'il est bien activé, connectez-vous à l'aide du formulaire ci-dessous.

Identifiez-vous
Identifiant
Mot de passe
Mot de passe oublié ?
Créer un compte

L'inscription est gratuite et ne vous prendra que quelques instants !

Je m'inscris !

La puce d'IA Jalapeño d'OpenAI affiche un débit d'inférence jusqu'à 1,9 fois supérieur à celui de la puce Blackwell de Nvidia,
Grâce à une architecture axée sur la performance et l'efficacité énergétique

Le , par Mathis Lucas

185PARTAGES

9  0 
OpenAI et Broadcom ont mis au point la puce Jalapeño pour optimiser l'inférence des grands modèles de langage (LLM). Cette puce surpasse les solutions actuelles de Nvidia et AMD grâce à une architecture généraliste privilégiant l'efficacité énergétique et un rapport performance/watt exceptionnel. Le développement a été accéléré par l'utilisation de l'IA pour la conception matérielle et la génération automatique de noyaux logiciels via Codex. Avec Jalapeño, OpenAI remet en question la domination de la plateforme CUDA dans le domaine des GPU. Cette innovation marque une étape clé vers une autonomie matérielle pour soutenir ses futurs modèles d'IA.

Lors de la conférence Hot Chips qui s’est tenue le 25 août, OpenAI a présenté sa puce « Jalapeño » plus en détail, notamment en dévoilant la première série de résultats de tests de performance pour ce nouveau système. Testé sur le benchmark InferenceX de SemiAnalysis, Jalapeño a enregistré à la fois un nombre de tokens par utilisateur et un débit par kilowatt supérieurs à ceux des processeurs d’inférence de pointe actuellement disponibles.

« En résumé, ces résultats montrent une avancée très, très significative en matière de performances par rapport à l’état de l’art », a déclaré Richard Ho, responsable du matériel chez OpenAI, lors d’une conférence de presse. « Jalapeño peut traiter davantage de tâches d’IA par unité de puissance, tout en fournissant des réponses plus rapidement. Il est très efficace pour servir un grand nombre de clients, tout en offrant une latence très faible ».

Annoncé pour la première fois en octobre 2025, Jalapeño a été développé par OpenAI en étroite collaboration avec Broadcom, les modèles propres à OpenAI ayant contribué au processus de développement. L’entreprise prévoit de faire de Jalapeño une plateforme multigénérationnelle, permettant le développement concerté de produits, de modèles, de puces et de mémoires d’IA. OpenAI se positionne comme un concurrent direct de Nvidia.

Genèse et caractéristiques de la puce « Jalapeño » d'OpenAI

La puce Jalapeño d'OpenAI est un ASIC (Application-Specific Integrated Circuit) d'inférence. Développée spécifiquement pour l'inférence des grands modèles de langage, sa conception a débuté à la mi-2024 pour aboutir au « tape-out » de la puce en novembre 2025, soit un cycle extrêmement rapide de seulement 16 mois. Bien que les processeurs de première génération ne soient généralement pas compétitifs, OpenAI bouscule les attentes.


« En général, les puces de première génération ne sont pas compétitives, mais OpenAI va à contre-courant en étant leader du secteur et en battant toutes les puces Nvidia, AMD et Google que nous avons pu tester sur plusieurs des meilleurs modèles à poids ouverts », indique un rapport récent de SemiAnalysis. Ce succès s'explique par un co-design matériel-logiciel très poussé au sein d'une équipe hautement qualifiée s'appuyant sur l'IA.

Contrairement aux rumeurs décrivant Jalapeño comme une puce uniquement spécialisée pour les modèles propriétaires d'OpenAI, il s'agit en réalité d'une puce d'inférence généraliste capable de faire tourner des charges de travail et des modèles variés. Elle se distingue par l'adoption précoce de la mémoire HBM4, probablement fournie par Samsung, ce qui lui permet d'atteindre une bande passante mémoire phénoménale de 15,4 To/s par boîtier.

Pour l'architecture, OpenAI a délibérément choisi de ne pas désagréger les phases de préremplissage et de décodage sur des pools de puces séparés. Bien que la désagrégation paraisse idéale lorsque la charge est stable, un pool homogène de puces est en réalité beaucoup plus efficace face à des flux de trafic fluctuants.

Cela évite d'avoir à transférer massivement le « KV cache » d'un serveur à l'autre à travers le réseau, une opération coûteuse en bande passante et en énergie. De plus, les cœurs et la mémoire HBM sont divisés en tranches connectées localement, éliminant les latences de synchronisation complexes des architectures GPU traditionnelles. OpenAI et Broadcom ont apporté d'autres types d'améliorations afin d'obtenir des performances inédites.

Des performances dictées par « la contrainte énergétique »

Les tests de Jalapeño sur la suite de benchmarks InferenceX révèlent des résultats d'efficacité énergétique exceptionnels, la puce surpassant la puce Blackwell de Nvidia en matière de performance par watt dans presque tous les scénarios, et ce sans décodage spéculatif ni prédiction multi-tokens. À faible concurrence, elle montre une interactivité remarquable en atteignant plus de 700 tokens par seconde et par utilisateur sur le modèle DeepSeek R1.


Sur d'autres modèles à poids ouverts comme Kimi-K2.5 et GPT-OSS, les performances grimpent à environ 1 400 tokens par seconde et par utilisateur. Cette efficacité répond directement aux limites réelles des centres de données d'aujourd'hui, bridés par la puissance électrique globale plutôt que par le budget.

Même face à la future puce Rubin de Nvidia équipée de HBM4, Jalapeño conserve un avantage d'efficacité brute en prédiction mono-token. Les optimisations prévues pour la révision « B0 » de la puce, gravée avec le procédé N3P de TSMC, devraient encore augmenter cette efficacité de 25 %, pour une enveloppe thermique limitée à 700 W par die contre 900 à 1 150 W pour Rubin. La puce Rubin devrait être commercialisée à la fin de l'année 2026.

Le rôle crucial de l'IA et du logiciel

L'écriture du logiciel pour Jalapeño est assurée de manière très efficace grâce à l'usage de l'IA. OpenAI développe ses noyaux à l'aide de Gluon, un langage basé sur Triton qui formalise l'algèbre des dispositions mémoire via l'outil mathématique « Linear Layouts ». Plutôt que de confier la rédaction fastidieuse de ces complexes noyaux de 3 000 lignes exclusivement à des humains, OpenAI utilise une version interne de Codex pour automatiser ce travail de programmation et trouver les configurations optimales

SemiAnalysis écrit : « par un étrange coup du sort, des modèles OpenAI comme GPT 5.6 Sol, qui tournent actuellement sur des GPU Nvidia, ont été utilisés pour concevoir une puce qui représente une réelle menace pour la barrière protectrice de CUDA ». OpenAI s'appuie également sur son simulateur « chilisim », précis à 5 % près, pour tester les performances logicielles avant même la disponibilité physique de la puce. Pour démontrer la flexibilité de ce système logiciel, les équipes ont même fait tourner le jeu Doom à 36 images par seconde sur Jalapeño grâce à un portage entièrement généré par Codex.

L'architecture matérielle et réseau à l'échelle du rack

Pour déployer Jalapeño à grande échelle, OpenAI a collaboré avec Celestica afin de mettre au point un système complet de racks. Ce système associe un rack hôte CPU composé de 16 tiroirs appelés « Katsu » (équipés de processeurs AMD EPYC Turin) connectés horizontalement en PCIe à un rack d'ASIC composé de 16 tiroirs nommés « Vindaloo ». Chaque tiroir Vindaloo héberge 8 puces Jalapeño, ce qui représente un total de 128 puces par rack, reliées par des tiroirs de commutation nommés « Chana » exploitant des puces Tomahawk 6.


Ce système à double rack complet consomme environ 160 kW en production, soit l'équivalent d'un double rack GB300 de Nvidia. Le réseau d'interconnexion permet d'étendre la topologie jusqu'à un domaine global de 2 048 processeurs Jalapeño répartis sur 16 racks, offrant une immense flexibilité pour l'inférence ou l'entraînement de modèles de plusieurs dizaines de milliers de milliards de paramètres. La production de masse de la puce Jalapeño devrait progressivement monter en puissance tout au long de l'année 2027.

Les benchmarks communiqués par OpenAI montrent que la puce Jalapeño offre un débit de pointe 1,5 à 1,9 fois supérieur à celui des systèmes de la génération Blackwell de Nvidia pour les tâches d’IA, avec une latence de bout en bout 1,7 à 3,6 fois inférieure et une inférence interactive à ultra-faible latence 2,1 à 4,1 fois plus rapide sur GPT-OSS-120B, DeepSeek R1 et Kimi K2.5. Chaque rack intègre 1,7 exaFLOPS de calcul en 4 bits, 27,5 To de mémoire HBM4 et un peu moins de 2 pétaoctets/seconde de bande passante mémoire.

Le chercheur Richard Ho a également déclaré que « la puce Jalapeño d'OpenAI atteint simultanément un débit élevé et une faible latence, une première dans le secteur ». Précisions importantes toutefois : la puce Jalapeño ne gère que l’inférence ; la domination de Nvidia en matière d’entraînement reste intacte.

Source : billet de blogue

Et vous ?

Quel est votre avis sur le sujet ?
Que pensez-vous des performances de la Jalapeño d'OpenAI ?
OpenAI va-t-il faire de l'ombre à Nvidia sur le marché des puces dédiées à l'inférence de l'IA ?

Voir aussi

OpenAI et Broadcom dévoilent « Jalapeño », la première puce d'IA sur mesure d'OpenAI, conçue principalement pour prendre en charge l'inférence pour ChatGPT et d'autres services, et réduire les coûts de 50 %

OpenAI s'associe avec TSMC pour développer ses propres puces d'IA, conçues avec Broadcom qui se concentreront dans un premier temps sur l'exécution de modèles d'IA plutôt que sur leur entraînement

Les semi-conducteurs entrent dans l'ère des gratte-ciel : empiler les puces comme des immeubles élevés pour booster les performances, avec une densité 4 fois supérieure à celle des puces IA avancées actuelles
Vous avez lu gratuitement 308 articles depuis plus d'un an.
Soutenez le club developpez.com en souscrivant un abonnement pour que nous puissions continuer à vous proposer des publications.

Une erreur dans cette actualité ? Signalez-nous-la !