Les listes par tâche
Une liste par tâche, et rien d'autre : tous les modèles mesurés, du meilleur au moins bon, avec la barre à sa place et le sort de chacun.
Les classements reposent sur des évaluations humaines. Les modèles récents apparaissent dès que les évaluations sont suffisantes.
Le marché en un nuage, puis une liste par tâche.
Rapporté au moins cher de chaque tâche, le meilleur compromis en coûte 2 fois plus, le meilleur 162 fois.
412 observations : un modèle compte une fois par tâche où il fait le job. Les deux rapports sont les médianes des 10 tâches. Choisissez une ou plusieurs tâches pour ne garder qu'elles.
Trier et extraire
Trier, étiqueter et extraire des données structurées à grand volume.
64 au niveau sur 152 mesurés, 321 au banc
Mesure principale : préférence humaine, LMArena Text, suivi d'instructions, contrôle de style
Chercher sur le web
Rechercher et synthétiser de l'information sur le web.
14 au niveau sur 26 mesurés, 321 au banc
Mesure principale : préférence humaine sur la recherche web, arène Search de LMArena
Résumer
Résumer un texte court à moyen, article ou compte rendu.
61 au niveau sur 152 mesurés, 321 au banc
Mesure principale : préférence humaine, LMArena Text, contrôle de style
Synthétiser
Résumer ou analyser 50K à 1M tokens.
59 au niveau sur 102 mesurés, 321 au banc
Mesure principale : préférence humaine, LMArena Text, contrôle de style
RAG
Répondre à partir des documents que vous fournissez.
17 au niveau sur 28 mesurés, 321 au banc
Mesure principale : préférence humaine sur des documents, arène Document de LMArena
Rédiger
Écrire des textes, des emails et des contenus éditoriaux.
66 au niveau sur 152 mesurés, 321 au banc
Mesure principale : préférence humaine, LMArena Text, prompts d'écriture, contrôle de style
Coder
Écrire, corriger ou expliquer du code.
63 au niveau sur 152 mesurés, 321 au banc
Mesure principale : préférence humaine, LMArena Text, prompts de code, contrôle de style
Web Dev
Un site ou une application web complète à partir d'une consigne, jugée sur le résultat.
27 au niveau sur 79 mesurés, 321 au banc
Mesure principale : préférence humaine sur des pages web, arène Webdev de LMArena
Agent
Boucles longues avec appels d'outils et reprises sur erreur.
7 au niveau sur 19 mesurés, 321 au banc
Mesure principale : tâches menées en autonomie, arène Agent de LMArena
Analyser des images
Décrire, expliquer ou répondre sur une photo, une capture ou un graphique.
34 au niveau sur 69 mesurés, 321 au banc
Mesure principale : préférence humaine sur des images, arène Vision de LMArena
D'où viennent ces chiffres
- Taux de référence de la Banque centrale européenne (ecb.europa.eu) Réutilisation libre avec citation de la source https://www.ecb.europa.eu/stats/eurofxref/eurofxref-daily.xml
- Epoch AI (epoch.ai) CC-BY https://epoch.ai/benchmarks/use-this-data
- LiteLLM (github.com/BerriAI/litellm) MIT https://github.com/BerriAI/litellm
- LMArena (lmarena.ai) CC-BY-4.0 https://huggingface.co/datasets/lmarena-ai/leaderboard-dataset
- models.dev MIT https://models.dev
- Prix et fournisseurs : OpenRouter (openrouter.ai) CGU OpenRouter https://openrouter.ai/docs
- Prix et caractéristiques : OpenRouter (openrouter.ai) CGU OpenRouter https://openrouter.ai/api/v1/models
- Agent conversationnel : tau²-bench, Sierra Research (github.com/sierra-research) MIT https://github.com/sierra-research/tau2-bench
- Fidélité au document : classement d'hallucination de Vectara (github.com/vectara) Apache-2.0 https://github.com/vectara/hallucination-leaderboard
Licences, attributions et modifications
Ces chiffres viennent des sources publiques citées et reflètent le dernier import, pas l'état à la seconde. Les tarifs sont ceux publiés par les fournisseurs et peuvent changer sans préavis : vérifiez les chez eux avant de vous engager. Nos verdicts orientent un choix, ils ne le garantissent pas : à vous de tester le modèle sur vos propres cas et de valider votre calcul, y compris économique. Notre méthode