Les listes par tâche

Une liste par tâche, et rien d'autre : tous les modèles mesurés, du meilleur au moins bon, avec la barre à sa place et le sort de chacun.

Les classements reposent sur des évaluations humaines. Les modèles récents apparaissent dès que les évaluations sont suffisantes.

Mis à jour le 23 septembre 2026 à 15h31

Le marché en un nuage, puis une liste par tâche.

Sur les 10 tâches, 75 modèles font le job.

Rapporté au moins cher de chaque tâche, le meilleur compromis en coûte 2 fois plus, le meilleur 162 fois.

Un point par modèle et par tâche. le moins cher qui fait le job le meilleur compromis le meilleur Comparé au prix d'entrée, échelle adaptée aux grands écarts

412 observations : un modèle compte une fois par tâche où il fait le job. Les deux rapports sont les médianes des 10 tâches. Choisissez une ou plusieurs tâches pour ne garder qu'elles.

Trier et extraire

Trier, étiqueter et extraire des données structurées à grand volume.

64 au niveau sur 152 mesurés, 321 au banc

Mesure principale : préférence humaine, LMArena Text, suivi d'instructions, contrôle de style

Voir la liste

Chercher sur le web

Rechercher et synthétiser de l'information sur le web.

14 au niveau sur 26 mesurés, 321 au banc

Mesure principale : préférence humaine sur la recherche web, arène Search de LMArena

Voir la liste

Résumer

Résumer un texte court à moyen, article ou compte rendu.

61 au niveau sur 152 mesurés, 321 au banc

Mesure principale : préférence humaine, LMArena Text, contrôle de style

Voir la liste

Synthétiser

Résumer ou analyser 50K à 1M tokens.

59 au niveau sur 102 mesurés, 321 au banc

Mesure principale : préférence humaine, LMArena Text, contrôle de style

Voir la liste

RAG

Répondre à partir des documents que vous fournissez.

17 au niveau sur 28 mesurés, 321 au banc

Mesure principale : préférence humaine sur des documents, arène Document de LMArena

Voir la liste

Rédiger

Écrire des textes, des emails et des contenus éditoriaux.

66 au niveau sur 152 mesurés, 321 au banc

Mesure principale : préférence humaine, LMArena Text, prompts d'écriture, contrôle de style

Voir la liste

Coder

Écrire, corriger ou expliquer du code.

63 au niveau sur 152 mesurés, 321 au banc

Mesure principale : préférence humaine, LMArena Text, prompts de code, contrôle de style

Voir la liste

Web Dev

Un site ou une application web complète à partir d'une consigne, jugée sur le résultat.

27 au niveau sur 79 mesurés, 321 au banc

Mesure principale : préférence humaine sur des pages web, arène Webdev de LMArena

Voir la liste

Agent

Boucles longues avec appels d'outils et reprises sur erreur.

7 au niveau sur 19 mesurés, 321 au banc

Mesure principale : tâches menées en autonomie, arène Agent de LMArena

Voir la liste

Analyser des images

Décrire, expliquer ou répondre sur une photo, une capture ou un graphique.

34 au niveau sur 69 mesurés, 321 au banc

Mesure principale : préférence humaine sur des images, arène Vision de LMArena

Voir la liste

D'où viennent ces chiffres

Licences, attributions et modifications

Ces chiffres viennent des sources publiques citées et reflètent le dernier import, pas l'état à la seconde. Les tarifs sont ceux publiés par les fournisseurs et peuvent changer sans préavis : vérifiez les chez eux avant de vous engager. Nos verdicts orientent un choix, ils ne le garantissent pas : à vous de tester le modèle sur vos propres cas et de valider votre calcul, y compris économique. Notre méthode