Aucun chiffre sans sa source.
Tout ce que WoBench affiche vient d'une source publique, nommée, datée, sous licence connue.
9 sources actives
Les sources
Nous n'utilisons pas les données d'Artificial Analysis. Nous n'extrayons aucune page web, uniquement des API et des fichiers publiés.
Lu, mais sans effet sur un verdict
Ces mesures sont importées et affichées sur les fiches et le comparateur, mais aucune tâche ne juge dessus. Chacune dit pourquoi elle dort et à quelle condition elle se réveille. Un contrôle automatique échoue si l'une d'elles entre dans une grille de jugement.
Classement gelé depuis décembre 2025 : 9 modèles du banc rattachés, aucun sorti en 2026. Terminal-Bench en couvre 32 et suit la frontière. À rouvrir si le classement d'Aider reprend ses publications.
La méthode, en 6 points
Un score n'est pas une note sur cent. Chaque tâche est jugée sur une mesure importée d'une source publique, dans l'unité de cette source, avec son intervalle et son rang publiés quand la source les publie. Le nom de la mesure dit ce qui est mesuré et par qui.
Pas de donnée sur une mesure : pas de score, jamais zéro. Un modèle non mesuré n'est ni bon ni mauvais, il est absent, et la page le montre comme tel avec son prix.
Une tâche porte une mesure principale, un modèle de référence qui fait le seuil, des barrières techniques et un volume. Ni pondération, ni seuil chiffré, ni catégorie composite.
Le coût est calculé, pas estimé : entrée hors cache × prix d'entrée + entrée en cache × prix de lecture du cache + sortie × prix de sortie, au tarif standard synchrone du fournisseur actif le moins cher. L'écriture de cache est exclue et nous le disons.
Ce qui n'entre jamais dans le verdict : les encarts sponsorisés et les liens vers les fournisseurs. Ils vivent à côté, labellisés.
Certains modèles ne sont publiés par l'arène que sous une variante d'effort de raisonnement, « high » ou « xhigh », le nom de base en étant absent. Quand la source publie les deux, nous retenons l'entrée sans effort, parce que c'est la configuration que notre prix décrit. Quand elle ne publie que la variante, nous retenons son score et nous majorons le coût de sortie en conséquence : on mesure et on facture la même configuration.
La méthode, en clair
Pour chaque tâche, une mesure publique, une barre gelée qui fait le niveau, des barrières techniques, et trois règles de verdict. Rien d'autre : ni score composite, ni pondération, ni centile.
La mesure. Chaque tâche est jugée sur une mesure importée d'une source publique, nommée en toutes lettres sur la page de tâche : ce qui est mesuré et par qui. Sa valeur reste dans l'unité de la source, avec son intervalle et son rang publiés quand la source les publie.
La barre. Le niveau à atteindre est une note, propre à chaque classement, posée une fois puis gelée : on classe les modèles notés, on descend d'un tiers, et la note de cette ligne devient la barre. Elle ne bouge plus quand le catalogue grandit, si bien qu'un modèle qui la passait la passe encore l'année suivante. Une barre appartient au classement, pas à la tâche : le même classement donne la même barre à toutes les tâches qui le lisent. Le doute profite au seuil, où c'est la note du modèle qui compte, et jamais au sommet, où c'est la borne basse de sa fourchette qui classe. Nous ne publions ni la recette exacte ni les valeurs de réglage.
Les barrières. Fenêtre de contexte minimale, entrée image, appel d'outils, sortie structurée : des exigences techniques déclarées par le fournisseur, vérifiées avant toute mesure. Chaque page de tâche affiche le nombre de modèles que chaque barrière écarte, y compris quand il vaut zéro.
Les préversions. Un modèle dont le fournisseur marque lui même la référence comme une préversion concourt aux verdicts, et il porte partout l'étiquette « préversion ». Ce qu'elle veut dire : son fournisseur peut le changer ou l'arrêter sans préavis, et son prix peut bouger. Elle était écartée jusqu'au 16 septembre 2026, en silence, et cet écart coûtait au lecteur l'option la moins chère d'une tâche. Écarter la moins chère sans le dire fait mentir ce que nous promettons ; l'étiqueter le dit et laisse le lecteur trancher.
Les trois verdicts. Peut faire le job est le moins cher des modèles retenus au volume de référence. Le meilleur est celui dont la note garantie est la plus haute. Meilleur compromis est le mieux placé parmi les retenus dont le prix est strictement entre les deux autres : c'est une vraie marche, qui monte à la fois en prix et en qualité, et un modèle qui coûterait plus que le moins cher sans faire mieux que lui n'y entre jamais. La carte reste vide quand cette bande de prix est vide, et elle dit alors pourquoi. Un modèle sans prix n'est élu sur aucune carte.
Les effectifs. Chaque mesure affichée porte le nombre de votes qui la fonde, quand la source le publie. C'est ce qui explique la largeur d'un intervalle : un intervalle large veut dire peu de votes, pas une performance instable, et deux modèles déclarés à égalité peuvent l'être parce que l'un est peu mesuré. Nous affichons cet effectif plutôt que d'écarter les modèles peu votés : le nombre de votes suit la notoriété, donc les modèles récents et bon marché en ont mécaniquement moins, et un filtre de solidité favoriserait les modèles établis et chers, exactement l'inverse de ce que cet outil cherche. Le lecteur décide avec le chiffre sous les yeux.
Le croisement. Une même compétence peut être mesurée par deux sources indépendantes, et nous en affichons deux quand elles existent : la fidélité au document fourni est ainsi jugée par un vote humain, l'arène Document de LMArena, et par une mesure automatique, le classement d'hallucination de Vectara. Trois sources ont été ajoutées le 7 septembre 2026, et chacune vient avec ce qu'elle rend jugeable. Vectara départage RAG : 62 modèles du banc y sont mesurés, contre 30 pour l'arène Document. tau²-bench départage Agent autonome : 17 modèles du banc y sont mesurés, dont 8 des 27 que l'arène Agent juge, contre 6 pour Terminal-Bench. Aider Polyglot est lu mais ne départage aucune tâche : 9 modèles rattachés, aucun sorti en 2026, son classement étant gelé depuis décembre 2025. Sur RAG, Vectara ne classe pas : elle écarte d'abord. Un taux d'hallucination ne se compare pas entre deux modèles qui ne répondent pas autant, donc un plancher de taux de réponse de 95 % écarte 11 modèles avant que la fidélité ne départage. Ce plancher est une décision humaine du 7 septembre 2026, et sa sensibilité est publiée : 3 modèles sous 90 %, 12 sous 95 %, 19 sous 98 %, sans qu'aucun verdict ne bouge entre ces trois valeurs. Il faut dire ce que ce croisement fait et ce qu'il ne fait pas : aucune de ces sources supplémentaires ne publie d'intervalle de confiance. **Croiser ajoute donc un second avis, ça ne resserre pas le premier.** Sur ces mesures là, deux valeurs sont à égalité quand leur écart est sous la tolérance globale, et non parce que leurs intervalles se recouvrent, puisqu'il n'y en a pas. Les résultats de tau²-bench sont en outre déclaratifs, soumis par une organisation qui se nomme, et la carte affiche laquelle à côté du chiffre.
Ce que ça vaut en pratique, mesuré sur les 24 combinaisons où les deux effectifs sont publiés : Le meilleur en a davantage dans 12 cas, soit la moitié exactement, et le rapport médian est de 1,3. Ce n'est donc pas une propriété générale de la méthode. En revanche l'écart est massif là où il existe, jusqu'à un rapport de 28,5, et il dépasse dix dans 6 combinaisons. La seule tâche où le site déclare l'entrée de gamme à égalité avec le meilleur est aussi celle du plus grand déséquilibre, un rapport de 14,4 : la page le dit sur la carte, dans la phrase même qui annonce l'égalité.
Ce que nous disons, et ce que nous ne disons pas
Nous ne désignons pas le meilleur modèle pour une tâche. Nous désignons, parmi les modèles qu'une évaluation publique a mesurés sur cette tâche, ceux qui tiennent les critères, et le moins cher d'entre eux. Un modèle que personne n'a mesuré n'est à nos yeux ni bon ni mauvais : il est absent, et nous l'affichons comme tel, avec son prix, pour que vous puissiez l'essayer vous-même. Sur certaines tâches, cette absence écarte plus de modèles que les critères eux-mêmes ; le compteur en tête de chaque page le montre.
Pourquoi une préférence générale ne suffit pas
Un seul modèle, quatre places très différentes. Le 6 septembre 2026, Granite 4.2 8B est 276e sur le classement général de LMArena Text, 274e sur le suivi d'instructions, 235e sur le code et 305e sur l'écriture. Soixante-dix places d'écart pour le même modèle, selon la tranche regardée. C'est la démonstration la plus courte de pourquoi juger une tâche sur une préférence générale ne suffit pas, et pourquoi chaque tâche est jugée sur la tranche qui la concerne.
Où notre résultat dépend d'une hypothèse
Quand une source n'a évalué un modèle qu'à effort de raisonnement élevé, ou quand un modèle raisonne sans qu'on puisse le couper, nous majorons son coût de sortie par un facteur. Ce facteur est supposé, pas mesuré : aucune source publique ne publie le nombre de tokens de sortie d'un modèle de raisonnement, vérifié le 6 septembre 2026 sur les sept bancs d'Epoch AI. Voici ce qu'il coûte s'il est faux, mesuré sur les vingt-sept combinaisons de tâche et de volume : 15 verdicts sur 81 séparent « on majore » de « on ne majore pas », 6 seulement séparent deux valeurs voisines, et 12 changent au moins une fois quand le facteur varie de deux à quatre. Le principe porte donc mieux que son réglage : nous facturons la configuration que la source a mesurée, et la carte le dit là où cela s'applique.
Le catalogue, et ce qui en est écarté
337 modèles sont importés et gardent leur fiche. 321 forment le vivier, et c'est le nombre annoncé sur l'accueil : ce sont ceux qu'une tâche peut recommander et qu'une comparaison peut mettre en colonne. Ce qui sépare les deux tient en une ligne : les 16 autres sont retenus par un filtre du banc, un seul, celui que nomme leur ligne ci dessous, et ils restent consultables avec leur fiche et leur prix.