Analyser des images.
Décrire, expliquer ou répondre sur une photo, une capture ou un graphique.
Les recommandations WoBench reposent sur des évaluations humaines.
Factures d'un indépendant. 3 000 tokens en entrée et 500 en sortie par exécution
Filtre actif : Poids ouverts. 271 modèles du banc retirés du calcul, les trois verdicts sont recalculés sur le reste. Retirer le filtre Selon nos vérifications du 6 septembre 2026, saisies à la main fournisseur par fournisseur. Ce n'est pas une garantie.
Verdicts rendus parmi les 8 modèles mesurés sur ce que cette tâche exige, sur 321 au banc. Les 313 autres
4 modèles au niveau sur 8 mesurés, 321 au banc.
montants convertis au taux de la Banque centrale européenne du 23 septembre 2026
Pas assez de mesures publiques pour rendre un verdict sur cette tâche. Les populations ci dessous disent ce que nous savons, et ce que nous ne savons pas.
pas assez de mesures publiques : 8 modèles mesurés sur 11 exigés
Le spectre des prix compare tous les modèles au niveau de chaque tâche. Il ne tient pas compte du filtre d'hébergement, il est donc masqué tant que ce filtre est actif.
Arrivés au niveau
Aucun modèle au niveau n'a reçu sa première note depuis moins de 45 jours.
Cette tâche exige une note d'au moins 1 269,9 sur préférence humaine sur des images, arène Vision de LMArena. Cette barre appartient à la mesure, elle ne bouge pas, et toutes les tâches qui lisent cette mesure exigent la même : c'est la note du modèle qui la franchit, donc le doute lui profite.
Comment ce verdict est calculé
Le seuil de cette tâche
préférence humaine sur des images, arène Vision de LMArena
Barre de la mesure, borne basse : 1 261,5. Fourchette 1 261,5 à 1 278,3, posée le 23 septembre 2026 sur 69 modèles, inchangée depuis.
Seconde mesure : préférence humaine sur des documents, arène Document de LMArena
Barrières
- vision exigé
Coût mensuel = entrée hors cache × prix d'entrée + entrée en cache × prix du cache + sortie × prix de sortie. L'écriture de cache est exclue en V1.
Sources de cette page
D'où viennent ces chiffres
- Taux de référence de la Banque centrale européenne (ecb.europa.eu) Réutilisation libre avec citation de la source https://www.ecb.europa.eu/stats/eurofxref/eurofxref-daily.xml
- Epoch AI (epoch.ai) CC-BY https://epoch.ai/benchmarks/use-this-data
- LiteLLM (github.com/BerriAI/litellm) MIT https://github.com/BerriAI/litellm
- LMArena (lmarena.ai) CC-BY-4.0 https://huggingface.co/datasets/lmarena-ai/leaderboard-dataset
- models.dev MIT https://models.dev
- Prix et fournisseurs : OpenRouter (openrouter.ai) CGU OpenRouter https://openrouter.ai/docs
- Prix et caractéristiques : OpenRouter (openrouter.ai) CGU OpenRouter https://openrouter.ai/api/v1/models
- Agent conversationnel : tau²-bench, Sierra Research (github.com/sierra-research) MIT https://github.com/sierra-research/tau2-bench
- Fidélité au document : classement d'hallucination de Vectara (github.com/vectara) Apache-2.0 https://github.com/vectara/hallucination-leaderboard
Prix relevés une fois par jour, à 3h00 (heure de Paris). Licences, attributions et modifications
Ces chiffres viennent des sources publiques citées et reflètent le dernier import, pas l'état à la seconde. Les tarifs sont ceux publiés par les fournisseurs et peuvent changer sans préavis : vérifiez les chez eux avant de vous engager. Nos verdicts orientent un choix, ils ne le garantissent pas : à vous de tester le modèle sur vos propres cas et de valider votre calcul, y compris économique. Notre méthode
Tous les modèles mesurés
Le classement entier sur préférence humaine sur des images, arène Vision de LMArena, du meilleur au moins bon, avec la barre à sa place. La note garantie est la borne basse de la fourchette publiée : c'est elle qui décide de l'élection.
La barre vaut 1 269,9, sa fourchette va de 1 261,5 à 1 278,3, et c'est sa borne basse, 1 261,5, qui coupe. Elle a été posée le 23 septembre 2026 sur 69 modèles, et n'a pas bougé depuis.
| Rang | Modèle | Note | Fourchette | Coût mensuel | Sort |
|---|---|---|---|---|---|
| 1 |
Kimi K2.6
Moonshot AI
|
1 280,4 | 1 273,4 à 1 287,4 | 0,51 € | retenu |
| 2 |
Gemma 4 31B
Google
|
1 276,0 | 1 269,8 à 1 282,1 | 0,0771 € | retenu |
| 3 |
Kimi K2.5
Moonshot AI
|
1 267,0 | 1 261,1 à 1 272,8 | 0,55 € | retenu |
| 4 |
Gemma 4 26B A4B
Google
|
1 258,9 | 1 252,2 à 1 265,6 | 0,0414 € | retenu |
| La coupure : un modèle est au niveau quand sa borne haute atteint 1 261,5. Au dessus, les modèles au niveau ; en dessous, les autres. | |||||
| 5 |
MiniMax M3
MiniMax
|
1 254,3 | 1 247,3 à 1 261,3 | 0,21 € | sous la barre |
| 6 |
MiMo-V2.5
Xiaomi
|
1 246,7 | 1 240,4 à 1 253,0 | 0,0834 € | sous la barre |
| 7 |
Inkling Small
Thinking Machines
|
1 236,2 | 1 226,6 à 1 245,8 | 0,34 € | sous la barre |
| 8 |
Gemma 3 27B
Google
|
1 164,1 | 1 156,0 à 1 172,1 | 0,0561 € | sous la barre |
Ce que devient le banc sur cette tâche
Les cinq populations forment une partition du banc : leur somme vaut le nombre de modèles au banc, sur chaque tâche, à chaque calcul.
- vision exigé : 29 modèle(s) écarté(s)
29 modèles écartés par une barrière
- Command R (08-2024) : vision exigé
- Command R+ (08-2024) : vision exigé
- Command R7B (12-2024) : vision exigé
- DeepSeek V3 : vision exigé
- DeepSeek V3.2 : vision exigé
- DeepSeek V4 Flash 0423 : vision exigé
- DeepSeek V4 Flash 0731 : vision exigé
- DeepSeek V4 Pro 0423 : vision exigé
- DeepSeek V4 Pro 0813 : vision exigé
- Hy3 : vision exigé
- Hy3 preview : vision exigé
- Hy4 preview : vision exigé
- Kimi K2 Thinking : vision exigé
- Laguna XS 2.1 : vision exigé
- MiMo-V2.5-Pro : vision exigé
- MiniMax M2 : vision exigé
- MiniMax M2.1 : vision exigé
- MiniMax M2.5 : vision exigé
- MiniMax M2.7 : vision exigé
- Nemotron 3 Nano 30B A3B : vision exigé
- Nemotron 3 Super : vision exigé
- Nemotron 3 Ultra : vision exigé
- Nemotron 3.5 Lightning : vision exigé
- R1 : vision exigé
- Step 3.5 Flash : vision exigé
- Trinity Large Thinking : vision exigé
- gpt-oss-120b : vision exigé
- gpt-oss-20b : vision exigé
- gpt-oss-safeguard-20b : vision exigé
4 modèles mesurés et éligibles
- Gemma 4 26B A4B
- Gemma 4 31B
- Kimi K2.5
- Kimi K2.6
4 modèles mesurés sous le seuil
- Gemma 3 27B : 1 164,1, sous la barre sur cette mesure, dont la borne basse est à 1 261,5
- Inkling Small : 1 236,2, sous la barre sur cette mesure, dont la borne basse est à 1 261,5
- MiMo-V2.5 : 1 246,7, sous la barre sur cette mesure, dont la borne basse est à 1 261,5
- MiniMax M3 : 1 254,3, sous la barre sur cette mesure, dont la borne basse est à 1 261,5
8 modèles non mesurés
- Gemma 3 12B : 0,0394 € par mois, non mesuré sur préférence humaine sur des images, arène Vision de LMArena
- Gemma 3 4B : 0,0351 € par mois, non mesuré sur préférence humaine sur des images, arène Vision de LMArena
- Inkling : 0,85 € par mois, non mesuré sur préférence humaine sur des images, arène Vision de LMArena
- Kimi K2.7 Code : 0,64 € par mois, non mesuré sur préférence humaine sur des images, arène Vision de LMArena
- Kimi K3 : 2,02 € par mois, non mesuré sur préférence humaine sur des images, arène Vision de LMArena
- Muse Glimmer 30B : 0,25 € par mois, non mesuré sur préférence humaine sur des images, arène Vision de LMArena
- Nemotron 3.5 Content Safety : 0,12 € par mois, non mesuré sur préférence humaine sur des images, arène Vision de LMArena
- Step 3.7 Flash : 0,16 € par mois, non mesuré sur préférence humaine sur des images, arène Vision de LMArena
5 modèles récents, pas encore mesurés
- DeepSeek V4 Flash Vision Exp : 0,17 € par mois, non mesuré sur préférence humaine sur des images, arène Vision de LMArena
- DeepSeek V4.1 Flash : 0,11 € par mois, non mesuré sur préférence humaine sur des images, arène Vision de LMArena
- MiMo-V2.6-Flash : 0,0982 € par mois, non mesuré sur préférence humaine sur des images, arène Vision de LMArena
- MiMo-V2.6-Pro : 0,30 € par mois, non mesuré sur préférence humaine sur des images, arène Vision de LMArena
- MiMo-V2.6-Pro-UltraSpeed : 3,05 € par mois, non mesuré sur préférence humaine sur des images, arène Vision de LMArena