À propos.
Pourquoi WoBench existe
WoBench est parti d'un besoin concret : choisir le bon modèle d'IA pour chaque tâche, au juste prix.
J'utilise moi-même différents modèles de langage dans mes workflows, que ce soit pour faire de la recherche, analyser des informations, résumer, synthétiser, rédiger, ou encore sur du code.
Pour ces usages, j'ai pris l'habitude de rechercher et comparer les modèles afin d'utiliser celui adapté à la tâche, plutôt que de choisir systématiquement le modèle frontier.
En parallèle, des personnes autour de moi me sollicitaient de plus en plus régulièrement pour savoir quel modèle utiliser pour telle ou telle tâche. Je constatais que certains arrivaient à des coûts vraiment très élevés, en n'utilisant que des modèles frontier, y compris pour des tâches qui ne le nécessitent vraiment pas et qui pouvaient être accomplies par des modèles beaucoup plus abordables.
J'ai donc commencé à structurer mes recherches et mes comparaisons pour mes propres besoins autour d'une question :
Quel modèle pour quelle tâche, et à quel prix ?
Puis j'ai décidé de transformer cette démarche en un outil accessible à tout le monde, en ligne.
C'est comme ça qu'est né WoBench.
The right AI for the job.
Ce que fait WoBench
WoBench ne cherche pas simplement à dire quel modèle est le plus performant. Pour chaque tâche, il distingue trois verdicts :
- Peut faire le job : le choix économique qui couvre le besoin.
- Meilleur compromis : le meilleur équilibre entre performance et coût.
- Le meilleur : le modèle le plus performant, indépendamment du prix.
WoBench ajoute le coût à la comparaison, notamment en fonction du volume d'utilisation, et propose également un simulateur permettant d'assembler plusieurs tâches dans un workflow et d'en estimer le coût.
Savoir quand un modèle moins cher fait déjà le job.
Comment WoBench travaille
- Aucune note n'est inventée.
- Les chiffres proviennent de mesures publiques, avec leur source et leur date.
- Les notations WoBench reposent sur des évaluations humaines.
- Le niveau requis est défini par tâche et évolue avec le marché.
- Un modèle qui faisait le job auparavant peut donc ne plus être retenu aujourd'hui.
- Les modèles récents apparaissent lorsque les évaluations disponibles deviennent suffisantes.
- Les cartes sont mises à jour régulièrement.
- Aucun sponsor n'influence un verdict.
Le détail est sur la page Sources et méthode.
Merci aux sources
WoBench s'appuie sur des données et des évaluations rendues publiques par plusieurs acteurs de l'écosystème. Sans ce travail ouvert, WoBench ne pourrait tout simplement pas proposer ce niveau de comparaison.
Merci notamment à
- LMArena
- OpenRouter
- Epoch AI
- Vectara
- Sierra Research
pour la mise à disposition et le maintien de ces données. La liste complète est sur la page Sources et méthode.
Derrière WoBench
WoBench a été créé par Fabrice Solsona et est édité par Fabrice Solsona, à titre personnel.
Le nom vient de World of Bench. Les modèles de langage constituent le premier banc de WoBench, avec l'idée que d'autres pourront suivre.
WoBench est à la fois l'outil que je voulais pouvoir utiliser pour mes propres recherches et analyses, et celui que j'ai choisi de partager.
Une question, une suggestion ou une erreur repérée ? Écrivez-nous via la page Contact.