Trier et extraire.
Trier, étiqueter et extraire des données structurées à grand volume.
Les recommandations WoBench reposent sur des évaluations humaines.
Boîte professionnelle à trier. 800 tokens en entrée et 40 en sortie par exécution
Filtre actif : Auto-hébergeable. 312 modèles du banc retirés du calcul, les trois verdicts sont recalculés sur le reste. Retirer le filtre Selon nos vérifications du 6 septembre 2026, saisies à la main fournisseur par fournisseur. Ce n'est pas une garantie.
Verdicts rendus parmi les 5 modèles mesurés sur ce que cette tâche exige, sur 321 au banc. Les 316 autres
3 modèles au niveau sur 5 mesurés, 321 au banc.
montants convertis au taux de la Banque centrale européenne du 23 septembre 2026
Pas assez de mesures publiques pour rendre un verdict sur cette tâche. Les populations ci dessous disent ce que nous savons, et ce que nous ne savons pas.
pas assez de mesures publiques : 5 modèles mesurés sur 11 exigés
Le spectre des prix compare tous les modèles au niveau de chaque tâche. Il ne tient pas compte du filtre d'hébergement, il est donc masqué tant que ce filtre est actif.
Arrivés au niveau
Aucun modèle au niveau n'a reçu sa première note depuis moins de 45 jours.
Cette tâche exige une note d'au moins 1 431,2 sur préférence humaine, LMArena Text, suivi d'instructions, contrôle de style. Cette barre appartient à la mesure, elle ne bouge pas, et toutes les tâches qui lisent cette mesure exigent la même : c'est la note du modèle qui la franchit, donc le doute lui profite.
Comment ce verdict est calculé
Le seuil de cette tâche
préférence humaine, LMArena Text, suivi d'instructions, contrôle de style
Barre de la mesure, borne basse : 1 425,0. Fourchette 1 425,0 à 1 437,5, posée le 23 septembre 2026 sur 152 modèles, inchangée depuis.
Barrières
Aucune barrière : la présence dans la mesure vaut capacité.
Coût mensuel = entrée hors cache × prix d'entrée + entrée en cache × prix du cache + sortie × prix de sortie. L'écriture de cache est exclue en V1.
Sources de cette page
D'où viennent ces chiffres
- Taux de référence de la Banque centrale européenne (ecb.europa.eu) Réutilisation libre avec citation de la source https://www.ecb.europa.eu/stats/eurofxref/eurofxref-daily.xml
- Epoch AI (epoch.ai) CC-BY https://epoch.ai/benchmarks/use-this-data
- LiteLLM (github.com/BerriAI/litellm) MIT https://github.com/BerriAI/litellm
- LMArena (lmarena.ai) CC-BY-4.0 https://huggingface.co/datasets/lmarena-ai/leaderboard-dataset
- models.dev MIT https://models.dev
- Prix et fournisseurs : OpenRouter (openrouter.ai) CGU OpenRouter https://openrouter.ai/docs
- Prix et caractéristiques : OpenRouter (openrouter.ai) CGU OpenRouter https://openrouter.ai/api/v1/models
- Agent conversationnel : tau²-bench, Sierra Research (github.com/sierra-research) MIT https://github.com/sierra-research/tau2-bench
- Fidélité au document : classement d'hallucination de Vectara (github.com/vectara) Apache-2.0 https://github.com/vectara/hallucination-leaderboard
Prix relevés une fois par jour, à 3h00 (heure de Paris). Licences, attributions et modifications
Ces chiffres viennent des sources publiques citées et reflètent le dernier import, pas l'état à la seconde. Les tarifs sont ceux publiés par les fournisseurs et peuvent changer sans préavis : vérifiez les chez eux avant de vous engager. Nos verdicts orientent un choix, ils ne le garantissent pas : à vous de tester le modèle sur vos propres cas et de valider votre calcul, y compris économique. Notre méthode
Tous les modèles mesurés
Le classement entier sur préférence humaine, LMArena Text, suivi d'instructions, contrôle de style, du meilleur au moins bon, avec la barre à sa place. La note garantie est la borne basse de la fourchette publiée : c'est elle qui décide de l'élection.
La barre vaut 1 431,2, sa fourchette va de 1 425,0 à 1 437,5, et c'est sa borne basse, 1 425,0, qui coupe. Elle a été posée le 23 septembre 2026 sur 152 modèles, et n'a pas bougé depuis.
| Rang | Modèle | Note | Fourchette | Coût mensuel | Sort |
|---|---|---|---|---|---|
| 1 |
Inkling
Thinking Machines
|
1 420,9 | 1 413,9 à 1 428,0 | 1,06 € | retenu |
| 2 |
DeepSeek V3.2
DeepSeek
|
1 420,1 | 1 414,3 à 1 425,9 | 0,18 € | retenu |
| 3 |
Muse Glimmer 30B
Meta
|
1 415,4 | 1 398,7 à 1 432,1 | 0,32 € | retenu |
| La coupure : un modèle est au niveau quand sa borne haute atteint 1 425,0. Au dessus, les modèles au niveau ; en dessous, les autres. | |||||
| 4 |
Inkling Small
Thinking Machines
|
1 393,2 | 1 385,4 à 1 401,1 | 0,47 € | sous la barre |
| 5 |
Trinity Large Thinking
Arcee AI
|
1 358,3 | 1 351,4 à 1 365,3 | 0,27 € | sous la barre |
Ce que devient le banc sur cette tâche
Les cinq populations forment une partition du banc : leur somme vaut le nombre de modèles au banc, sur chaque tâche, à chaque calcul.
0 modèle écarté par une barrière
aucun
3 modèles mesurés et éligibles
- DeepSeek V3.2
- Inkling
- Muse Glimmer 30B
2 modèles mesurés sous le seuil
- Inkling Small : 1 393,2, sous la barre sur cette mesure, dont la borne basse est à 1 425,0
- Trinity Large Thinking : 1 358,3, sous la barre sur cette mesure, dont la borne basse est à 1 425,0
1 modèle non mesuré
- DeepSeek V4 Flash 0731 : 0,0493 € par mois, non mesuré sur préférence humaine, LMArena Text, suivi d'instructions, contrôle de style
3 modèles récents, pas encore mesurés
- DeepSeek V4 Flash Vision Exp : 0,20 € par mois, non mesuré sur préférence humaine, LMArena Text, suivi d'instructions, contrôle de style
- DeepSeek V4 Pro 0813 : 0,37 € par mois, non mesuré sur préférence humaine, LMArena Text, suivi d'instructions, contrôle de style
- DeepSeek V4.1 Flash : 0,13 € par mois, non mesuré sur préférence humaine, LMArena Text, suivi d'instructions, contrôle de style