DeepSeek lance V4-Flash, un modèle open-source taillé pour l'inférence rapide
Le laboratoire chinois remet une pièce dans la machine open-source avec un modèle pensé pour répondre vite et coûter peu, dans un secteur où la…
Tous nos articles et analyses sur inférence — 6 publications.
Le laboratoire chinois remet une pièce dans la machine open-source avec un modèle pensé pour répondre vite et coûter peu, dans un secteur où la…
OpenAI annonce que son modèle Sol tournera sur hardware Cerebras à partir de juillet, avec une cible de 750 tokens par seconde — un débit sans…
Six puces codesignées, un coût d'inférence divisé par dix par rapport à Blackwell. La plateforme Rubin de NVIDIA est désormais en production…
OpenAI ne veut plus seulement écrire le logiciel qui fait tourner l'IA : l'entreprise s'attaque désormais au silicium. En s'associant à Broadcom pour…
Google DeepMind publie DiffusionGemma, un modèle open-weight qui génère du texte par diffusion plutôt que mot par mot — et dépasse les 1 000 tokens…
Un investissement pouvant atteindre 100 milliards de dollars et 10 gigawatts de systèmes déployés : le partenariat annoncé entre NVIDIA et OpenAI est…