Claude Opus 5 talonne Fable 5 sur les benchmarks, pour un tiers du prix
Anthropic sort Opus 5 et affiche un écart de seulement 0,5% avec Fable 5 sur CursorBench 3.2, tout en conservant ses tarifs. Une manière assumée de…
Tous nos articles et analyses sur benchmarks IA — 4 publications.
Anthropic sort Opus 5 et affiche un écart de seulement 0,5% avec Fable 5 sur CursorBench 3.2, tout en conservant ses tarifs. Une manière assumée de…
Meta sort de son modèle économique habituel : après des années de modèles gratuits en open weights, l'entreprise facture enfin l'accès à son IA la…
Après un 2024 discret sur le front des modèles, Meta sort l'artillerie lourde avec Muse Spark 1.1 : contexte massif, agents parallèles et première…
Avec 82,4% sur GPQA Diamond, le mode de raisonnement étendu de Google dépasse ses rivaux sur les questions de chimie et de physique avancées. Un…