Tâches / Synthétiser

Synthétiser.

Résumer ou analyser 50K à 1M tokens.

Les recommandations WoBench reposent sur des évaluations humaines.

contexte d'au moins 200 000 tokens
Mis à jour le 23 septembre 2026 à 16h45
321 modèles évalués
méthode, version 1

Quelques rapports par mois. 100 000 tokens en entrée et 2 000 en sortie par exécution

Filtre actif : Poids ouverts. 271 modèles du banc retirés du calcul, les trois verdicts sont recalculés sur le reste. Retirer le filtre Selon nos vérifications du 6 septembre 2026, saisies à la main fournisseur par fournisseur. Ce n'est pas une garantie.

Verdicts rendus parmi les 24 modèles mesurés sur ce que cette tâche exige, sur 321 au banc. Les 297 autres

12 modèles au niveau sur 24 mesurés, 321 au banc.

montants convertis au taux de la Banque centrale européenne du 23 septembre 2026

Peut faire le job
le choix économique qui couvre le besoin
Google
Mesure principale
préférence humaine, LMArena Text, contrôle de style
1 430,3 à 1 445,5 · barre 1 437,0 10e sur 24 mesurés sur cette tâche
88e sur 402 chez préférence humaine, LMArena Text, contrôle de style
fourchette publiée par la source · 5 804 votes
égalité jugée sur les intervalles publiés par la source
Peu de votes : sa fourchette est nettement plus large que celle des autres modèles mesurés.

Barre 1 437,0, la borne basse de sa fourchette : c'est elle qui coupe. Le segment est la fourchette de ce modèle : il est au niveau dès que sa borne haute atteint celle de la barre. Le meilleur de la tâche est à 1 479,5, sa note garantie.

Barre de la mesure, borne basse : 1 437,0. Fourchette 1 437,0 à 1 445,5, posée le 23 septembre 2026 sur 152 modèles, inchangée depuis.

Seconde mesure, compréhension d'un long texte, Fiction.liveBench relayé par Epoch AI : non mesuré, elle n'ordonne rien ici.
au niveau de la barre sur préférence humaine, LMArena Text, contrôle de style
0,0813 €
par mois,
à 20 exécutions
chez Darkbloom
Pourquoi lui

Le moins cher des modèles au niveau de la barre.

Meilleur compromis
le meilleur équilibre entre performance et coût
Hy3
Tencent
Mesure principale
préférence humaine, LMArena Text, contrôle de style
1 448,6 à 1 463,0 · barre 1 437,0 5e sur 24 mesurés sur cette tâche
60e sur 402 chez préférence humaine, LMArena Text, contrôle de style
fourchette publiée par la source · 8 047 votes
égalité jugée sur les intervalles publiés par la source
Peu de votes : sa fourchette est nettement plus large que celle des autres modèles mesurés.

Barre 1 437,0, la borne basse de sa fourchette : c'est elle qui coupe. Le segment est la fourchette de ce modèle : il est au niveau dès que sa borne haute atteint celle de la barre. Le meilleur de la tâche est à 1 479,5, sa note garantie.

Barre de la mesure, borne basse : 1 437,0. Fourchette 1 437,0 à 1 445,5, posée le 23 septembre 2026 sur 152 modèles, inchangée depuis.

Seconde mesure, compréhension d'un long texte, Fiction.liveBench relayé par Epoch AI : non mesuré, elle n'ordonne rien ici.
au niveau de la barre sur préférence humaine, LMArena Text, contrôle de style
0,25 €
par mois,
à 20 exécutions
chez Tencent
Pourquoi lui

94 % moins cher que Le meilleur, 29,0 points de mesure en moins.

Le meilleur
le modèle le plus performant, indépendamment du prix
Moonshot AI
Mesure principale
préférence humaine, LMArena Text, contrôle de style
1 479,5 à 1 490,0 · barre 1 437,0 1er sur 24 mesurés sur cette tâche
17e sur 402 chez préférence humaine, LMArena Text, contrôle de style
fourchette publiée par la source · 20 987 votes
égalité jugée sur les intervalles publiés par la source

Barre 1 437,0, la borne basse de sa fourchette : c'est elle qui coupe. Le segment est la fourchette de ce modèle : il est au niveau dès que sa borne haute atteint celle de la barre. Le meilleur de la tâche est à 1 479,5, sa note garantie.

Barre de la mesure, borne basse : 1 437,0. Fourchette 1 437,0 à 1 445,5, posée le 23 septembre 2026 sur 152 modèles, inchangée depuis.

Seconde mesure, compréhension d'un long texte, Fiction.liveBench relayé par Epoch AI : non mesuré, elle n'ordonne rien ici.
au niveau de la barre sur préférence humaine, LMArena Text, contrôle de style
4,00 €
par mois,
à 20 exécutions
chez Wafer
Pourquoi lui

1er sur les 24 modèles que cette tâche juge. 49 fois le prix de Peut faire le job, pour 46,9 points de mesure en plus.

Le spectre des prix compare tous les modèles au niveau de chaque tâche. Il ne tient pas compte du filtre d'hébergement, il est donc masqué tant que ce filtre est actif.

Arrivés au niveau

Aucun modèle au niveau n'a reçu sa première note depuis moins de 45 jours.

Voir ce qui a changé

Cette tâche exige une note d'au moins 1 441,3 sur préférence humaine, LMArena Text, contrôle de style. Cette barre appartient à la mesure, elle ne bouge pas, et toutes les tâches qui lisent cette mesure exigent la même : c'est la note du modèle qui la franchit, donc le doute lui profite.

Comment ce verdict est calculé

Le seuil de cette tâche

préférence humaine, LMArena Text, contrôle de style

Barre de la mesure, borne basse : 1 437,0. Fourchette 1 437,0 à 1 445,5, posée le 23 septembre 2026 sur 152 modèles, inchangée depuis.

Seconde mesure : compréhension d'un long texte, Fiction.liveBench relayé par Epoch AI

Barrières

  • contexte d'au moins 200 000 tokens

Coût mensuel = entrée hors cache × prix d'entrée + entrée en cache × prix du cache + sortie × prix de sortie. L'écriture de cache est exclue en V1.

Sources de cette page

D'où viennent ces chiffres

Prix relevés une fois par jour, à 3h00 (heure de Paris). Licences, attributions et modifications

Ces chiffres viennent des sources publiques citées et reflètent le dernier import, pas l'état à la seconde. Les tarifs sont ceux publiés par les fournisseurs et peuvent changer sans préavis : vérifiez les chez eux avant de vous engager. Nos verdicts orientent un choix, ils ne le garantissent pas : à vous de tester le modèle sur vos propres cas et de valider votre calcul, y compris économique. Notre méthode

Le badge de ce verdict

Collez cet extrait sur votre site. Le badge se met à jour tout seul. Dès que le modèle ne tient plus le verdict, il n'affiche plus que la date de sa dernière vérification : nous ne laissons jamais un verdict périmé chez un tiers.

Le badge de ce verdict

Tous les modèles mesurés

Le classement entier sur préférence humaine, LMArena Text, contrôle de style, du meilleur au moins bon, avec la barre à sa place. La note garantie est la borne basse de la fourchette publiée : c'est elle qui décide de l'élection.

La barre vaut 1 441,3, sa fourchette va de 1 437,0 à 1 445,5, et c'est sa borne basse, 1 437,0, qui coupe. Elle a été posée le 23 septembre 2026 sur 152 modèles, et n'a pas bougé depuis.

Rang Modèle Note Fourchette Coût mensuel Sort
1 Kimi K3
Moonshot AI
1 484,8 1 479,5 à 1 490,0 4,00 € Le meilleur
2 MiMo-V2.5-Pro
Xiaomi
1 467,4 1 463,6 à 1 471,3 0,56 € retenu
3 Kimi K2.6
Moonshot AI
1 460,4 1 455,9 à 1 465,0 1,08 € retenu
4 DeepSeek V4 Pro 0423
DeepSeek
1 457,3 1 453,3 à 1 461,3 1,74 € retenu
5 Hy3
Tencent
1 455,8 1 448,6 à 1 463,0 0,25 € Meilleur compromis
6 Gemma 4 31B
Google
1 451,1 1 443,5 à 1 458,7 0,17 € retenu
7 Kimi K2.5
Moonshot AI
1 450,4 1 447,0 à 1 453,7 1,05 € retenu
8 MiniMax M3
MiniMax
1 441,3 1 437,0 à 1 445,5 0,45 € retenu
9 Inkling
Thinking Machines
1 440,1 1 435,2 à 1 445,1 1,81 € retenu
10 Gemma 4 26B A4B
Google
1 437,9 1 430,3 à 1 445,5 0,0813 € Peut faire le job
11 DeepSeek V4 Flash 0423
DeepSeek
1 435,6 1 431,4 à 1 439,7 0,16 € retenu
12 MiMo-V2.5
Xiaomi
1 433,6 1 429,3 à 1 438,0 0,22 € retenu
La coupure : un modèle est au niveau quand sa borne haute atteint 1 437,0. Au dessus, les modèles au niveau ; en dessous, les autres.
13 Kimi K2 Thinking
Moonshot AI
1 430,1 1 427,0 à 1 433,3 1,14 € sous la barre
14 Nemotron 3 Ultra
NVIDIA
1 425,6 1 418,6 à 1 432,6 1,20 € sous la barre
15 MiniMax M2.7
MiniMax
1 415,2 1 411,6 à 1 418,8 0,40 € sous la barre
16 Hy3 preview préversion
Tencent
1 412,7 1 405,2 à 1 420,2 0,34 € sous la barre
17 Inkling Small
Thinking Machines
1 404,6 1 399,1 à 1 410,1 0,83 € sous la barre
18 Step 3.5 Flash
StepFun
1 394,1 1 390,5 à 1 397,8 0,19 € sous la barre
19 MiniMax M2.5
MiniMax
1 390,3 1 386,3 à 1 394,3 0,51 € sous la barre
20 MiniMax M2.1
MiniMax
1 383,8 1 378,5 à 1 389,1 0,57 € sous la barre
21 Trinity Large Thinking
Arcee AI
1 369,0 1 364,3 à 1 373,6 0,47 € sous la barre
22 Nemotron 3 Super
NVIDIA
1 360,5 1 353,3 à 1 367,8 0,16 € sous la barre
23 MiniMax M2
MiniMax
1 345,9 1 338,1 à 1 353,6 0,48 € sous la barre
24 Nemotron 3 Nano 30B A3B
NVIDIA
1 314,2 1 308,7 à 1 319,8 0,0946 € sous la barre

Ce que devient le banc sur cette tâche

Les cinq populations forment une partition du banc : leur somme vaut le nombre de modèles au banc, sur chaque tâche, à chaque calcul.

  • contexte d'au moins 200 000 tokens : 14 modèle(s) écarté(s)
14 modèles écartés par une barrière
  • Command R (08-2024) : contexte d'au moins 200 000 tokens
  • Command R+ (08-2024) : contexte d'au moins 200 000 tokens
  • Command R7B (12-2024) : contexte d'au moins 200 000 tokens
  • DeepSeek V3 : contexte d'au moins 200 000 tokens
  • DeepSeek V3.2 : contexte d'au moins 200 000 tokens
  • Gemma 3 12B : contexte d'au moins 200 000 tokens
  • Gemma 3 27B : contexte d'au moins 200 000 tokens
  • Gemma 3 4B : contexte d'au moins 200 000 tokens
  • Muse Glimmer 30B : contexte d'au moins 200 000 tokens
  • Nemotron 3.5 Content Safety : contexte d'au moins 200 000 tokens
  • R1 : contexte d'au moins 200 000 tokens
  • gpt-oss-120b : contexte d'au moins 200 000 tokens
  • gpt-oss-20b : contexte d'au moins 200 000 tokens
  • gpt-oss-safeguard-20b : contexte d'au moins 200 000 tokens
12 modèles mesurés et éligibles
  • DeepSeek V4 Flash 0423
  • DeepSeek V4 Pro 0423
  • Gemma 4 26B A4B
  • Gemma 4 31B
  • Hy3
  • Inkling
  • Kimi K2.5
  • Kimi K2.6
  • Kimi K3
  • MiMo-V2.5
  • MiMo-V2.5-Pro
  • MiniMax M3
12 modèles mesurés sous le seuil
  • Hy3 preview : 1 412,7, sous la barre sur cette mesure, dont la borne basse est à 1 437,0
  • Inkling Small : 1 404,6, sous la barre sur cette mesure, dont la borne basse est à 1 437,0
  • Kimi K2 Thinking : 1 430,1, sous la barre sur cette mesure, dont la borne basse est à 1 437,0
  • MiniMax M2 : 1 345,9, sous la barre sur cette mesure, dont la borne basse est à 1 437,0
  • MiniMax M2.1 : 1 383,8, sous la barre sur cette mesure, dont la borne basse est à 1 437,0
  • MiniMax M2.5 : 1 390,3, sous la barre sur cette mesure, dont la borne basse est à 1 437,0
  • MiniMax M2.7 : 1 415,2, sous la barre sur cette mesure, dont la borne basse est à 1 437,0
  • Nemotron 3 Nano 30B A3B : 1 314,2, sous la barre sur cette mesure, dont la borne basse est à 1 437,0
  • Nemotron 3 Super : 1 360,5, sous la barre sur cette mesure, dont la borne basse est à 1 437,0
  • Nemotron 3 Ultra : 1 425,6, sous la barre sur cette mesure, dont la borne basse est à 1 437,0
  • Step 3.5 Flash : 1 394,1, sous la barre sur cette mesure, dont la borne basse est à 1 437,0
  • Trinity Large Thinking : 1 369,0, sous la barre sur cette mesure, dont la borne basse est à 1 437,0
4 modèles non mesurés
  • DeepSeek V4 Flash 0731 : 0,0981 € par mois, non mesuré sur préférence humaine, LMArena Text, contrôle de style
  • Kimi K2.7 Code : 1,35 € par mois, non mesuré sur préférence humaine, LMArena Text, contrôle de style
  • Laguna XS 2.1 : 0,11 € par mois, non mesuré sur préférence humaine, LMArena Text, contrôle de style
  • Step 3.7 Flash : 0,31 € par mois, non mesuré sur préférence humaine, LMArena Text, contrôle de style
8 modèles récents, pas encore mesurés
  • DeepSeek V4 Flash Vision Exp : 0,40 € par mois, non mesuré sur préférence humaine, LMArena Text, contrôle de style
  • DeepSeek V4 Pro 0813 : 0,74 € par mois, non mesuré sur préférence humaine, LMArena Text, contrôle de style
  • DeepSeek V4.1 Flash : 0,21 € par mois, non mesuré sur préférence humaine, LMArena Text, contrôle de style
  • Hy4 preview : 1,55 € par mois, non mesuré sur préférence humaine, LMArena Text, contrôle de style
  • MiMo-V2.6-Flash : 0,26 € par mois, non mesuré sur préférence humaine, LMArena Text, contrôle de style
  • MiMo-V2.6-Pro : 0,79 € par mois, non mesuré sur préférence humaine, LMArena Text, contrôle de style
  • MiMo-V2.6-Pro-UltraSpeed : 7,93 € par mois, non mesuré sur préférence humaine, LMArena Text, contrôle de style
  • Nemotron 3.5 Lightning : 0,13 € par mois, non mesuré sur préférence humaine, LMArena Text, contrôle de style