Agent
Tous les modèles mesurés sur cette tâche, du meilleur au moins bon sur tâches menées en autonomie, arène Agent de LMArena, avec la barre tracée où elle coupe.
0 au niveau sur 19 mesurés, 321 au banc
Automatisations personnelles.
Tous les modèles mesurés
Le classement entier sur tâches menées en autonomie, arène Agent de LMArena, du meilleur au moins bon, avec la barre à sa place. La note garantie est la borne basse de la fourchette publiée : c'est elle qui décide de l'élection.
score centré autour de zéro, entre -0,16 et 0,03 sur le banc : c'est le rang qui se compare, pas la valeur
| Rang | Modèle | Note | Fourchette | Coût mensuel | Sort |
|---|---|---|---|---|---|
| La coupure : un modèle est au niveau quand sa borne haute atteint . Au dessus, les modèles au niveau ; en dessous, les autres. | |||||
| 1 |
Grok 4.5
xAI
|
0,0292 | 0,0193 à 0,0391 | 3,71 € | sous la barre |
| 2 |
GPT-5.5
OpenAI
|
0,0267 | 0,0186 à 0,0348 | 12,75 € | sous la barre |
| 3 |
GLM 5.3 Flash
première note
Z.ai
|
0,0115 | 0,0048 à 0,0181 | 0,18 € | sous la barre |
| 4 |
Qwen3.8 27B
première note
Qwen
|
-0,0064 | -0,0136 à 0,0008 | 0,68 € | sous la barre |
| 5 |
DeepSeek V4 Pro 0423
DeepSeek
|
-0,0071 | -0,0165 à 0,0022 | 1,40 € | sous la barre |
| 6 |
Claude Sonnet 4.6
Anthropic
|
-0,0152 | -0,0264 à -0,0040 | 6,86 € | sous la barre |
| 7 |
Muse Spark 1.1
Meta
|
-0,0298 | -0,0352 à -0,0244 | 2,38 € | sous la barre |
| 8 |
Qwen3.7 Max
Qwen
|
-0,0363 | -0,0447 à -0,0278 | 2,87 € | sous la barre |
| 9 |
Hy3
Tencent
|
-0,0523 | -0,0639 à -0,0407 | 0,30 € | sous la barre |
| 10 |
MiMo-V2.5-Pro
Xiaomi
|
-0,0573 | -0,0660 à -0,0486 | 0,41 € | sous la barre |
| 11 |
MiniMax M3
MiniMax
|
-0,0576 | -0,0659 à -0,0494 | 0,53 € | sous la barre |
| 12 |
Gemini 3.1 Pro Preview
préversion
Google
|
-0,0581 | -0,0660 à -0,0501 | 5,10 € | sous la barre |
| 13 |
Qwen3.7 Plus
Qwen
|
-0,0608 | -0,0729 à -0,0487 | 0,71 € | sous la barre |
| 14 |
Inkling Small
Thinking Machines
|
-0,0916 | -0,1052 à -0,0781 | 0,85 € | sous la barre |
| 15 |
Inkling
Thinking Machines
|
-0,1002 | -0,1094 à -0,0911 | 2,11 € | sous la barre |
| 16 |
Mistral Medium 3.5
Mistral
|
-0,1088 | -0,1234 à -0,0942 | 5,92 € | sous la barre |
| 17 |
MiniMax M2.7
MiniMax
|
-0,1402 | -0,1509 à -0,1295 | 0,46 € | sous la barre |
| 18 |
Gemini 3.5 Flash Lite
Google
|
-0,1535 | -0,1666 à -0,1404 | 0,95 € | sous la barre |
| 19 |
Solar Pro 4
première note
Upstage
|
-0,1552 | -0,1740 à -0,1365 | 0,20 € | sous la barre |
D'où viennent ces chiffres
- Taux de référence de la Banque centrale européenne (ecb.europa.eu) Réutilisation libre avec citation de la source https://www.ecb.europa.eu/stats/eurofxref/eurofxref-daily.xml
- Epoch AI (epoch.ai) CC-BY https://epoch.ai/benchmarks/use-this-data
- LiteLLM (github.com/BerriAI/litellm) MIT https://github.com/BerriAI/litellm
- LMArena (lmarena.ai) CC-BY-4.0 https://huggingface.co/datasets/lmarena-ai/leaderboard-dataset
- models.dev MIT https://models.dev
- Prix et fournisseurs : OpenRouter (openrouter.ai) CGU OpenRouter https://openrouter.ai/docs
- Prix et caractéristiques : OpenRouter (openrouter.ai) CGU OpenRouter https://openrouter.ai/api/v1/models
- Agent conversationnel : tau²-bench, Sierra Research (github.com/sierra-research) MIT https://github.com/sierra-research/tau2-bench
- Fidélité au document : classement d'hallucination de Vectara (github.com/vectara) Apache-2.0 https://github.com/vectara/hallucination-leaderboard
Prix relevés une fois par jour, à 3h00 (heure de Paris). Licences, attributions et modifications
Ces chiffres viennent des sources publiques citées et reflètent le dernier import, pas l'état à la seconde. Les tarifs sont ceux publiés par les fournisseurs et peuvent changer sans préavis : vérifiez les chez eux avant de vous engager. Nos verdicts orientent un choix, ils ne le garantissent pas : à vous de tester le modèle sur vos propres cas et de valider votre calcul, y compris économique. Notre méthode