Tâches / RAG

RAG.

Répondre à partir des documents que vous fournissez.

Les recommandations WoBench reposent sur des évaluations humaines.

contexte d'au moins 128 000 tokens taux de réponse d'au moins 95 %
Mis à jour le 23 septembre 2026 à 17h27
321 modèles évalués
méthode, version 1

Base documentaire d'équipe. 12 000 tokens en entrée et 600 en sortie par exécution

Filtre actif : Auto-hébergeable. 312 modèles du banc retirés du calcul, les trois verdicts sont recalculés sur le reste. Retirer le filtre Selon nos vérifications du 6 septembre 2026, saisies à la main fournisseur par fournisseur. Ce n'est pas une garantie.

Verdicts rendus parmi les 0 modèles mesurés sur ce que cette tâche exige, sur 321 au banc. Les 321 autres

0 modèles au niveau sur 0 mesurés, 321 au banc.

montants convertis au taux de la Banque centrale européenne du 23 septembre 2026

Pas assez de mesures publiques pour rendre un verdict sur cette tâche. Les populations ci dessous disent ce que nous savons, et ce que nous ne savons pas.

pas assez de mesures publiques : 0 modèles mesurés sur 11 exigés

Le spectre des prix compare tous les modèles au niveau de chaque tâche. Il ne tient pas compte du filtre d'hébergement, il est donc masqué tant que ce filtre est actif.

Arrivés au niveau

Aucun modèle au niveau n'a reçu sa première note depuis moins de 45 jours.

Voir ce qui a changé

Comment ce verdict est calculé

Le seuil de cette tâche

préférence humaine sur des documents, arène Document de LMArena

Seconde mesure : fidélité au document fourni, mesurée par le modèle HHEM de Vectara

Barrières

  • contexte d'au moins 128 000 tokens
  • taux de réponse d'au moins 95 %

Coût mensuel = entrée hors cache × prix d'entrée + entrée en cache × prix du cache + sortie × prix de sortie. L'écriture de cache est exclue en V1.

Sources de cette page

D'où viennent ces chiffres

Prix relevés une fois par jour, à 3h00 (heure de Paris). Licences, attributions et modifications

Ces chiffres viennent des sources publiques citées et reflètent le dernier import, pas l'état à la seconde. Les tarifs sont ceux publiés par les fournisseurs et peuvent changer sans préavis : vérifiez les chez eux avant de vous engager. Nos verdicts orientent un choix, ils ne le garantissent pas : à vous de tester le modèle sur vos propres cas et de valider votre calcul, y compris économique. Notre méthode

Tous les modèles mesurés

Le classement entier sur préférence humaine sur des documents, arène Document de LMArena, du meilleur au moins bon, avec la barre à sa place. La note garantie est la borne basse de la fourchette publiée : c'est elle qui décide de l'élection.

Rang Modèle Note Fourchette Coût mensuel Sort

Ce que devient le banc sur cette tâche

Les cinq populations forment une partition du banc : leur somme vaut le nombre de modèles au banc, sur chaque tâche, à chaque calcul.

  • contexte d'au moins 128 000 tokens : aucun modèle écarté aujourd'hui
  • taux de réponse d'au moins 95 % : 1 modèle(s) écarté(s)

Pourquoi ce minimum. Un taux d'hallucination ne se compare pas entre deux modèles qui ne répondent pas autant : celui qui se tait n'invente rien, et il gagnerait le classement en refusant de servir. Gemma 3 4B, deuxième sur la fidélité au document, ne répond qu'à 67,3 % des documents. La barrière écarte donc avant que la mesure ne départage. Ce que ce minimum coûte à assumer : il est une décision humaine, pas un résultat, et la source ne publie aucun intervalle, donc deux fidélités sont à égalité quand leur écart passe sous la tolérance globale. Relevé du 7 septembre 2026 : 3 modèles sont sous 90 % de réponses, 12 sous 95 %, 19 sous 98 %, et le choix entre ces trois valeurs ne déplace aucun verdict.

1 modèle écarté par une barrière
  • DeepSeek V3.2 : taux de réponse d'au moins 95 %
0 modèle mesuré et éligible

aucun

0 modèle mesuré sous le seuil

aucun

5 modèles non mesurés
  • DeepSeek V4 Flash 0731 : 4,77 € par mois, non mesuré sur préférence humaine sur des documents, arène Document de LMArena
  • Inkling : 96,28 € par mois, non mesuré sur préférence humaine sur des documents, arène Document de LMArena
  • Inkling Small : 42,59 € par mois, non mesuré sur préférence humaine sur des documents, arène Document de LMArena
  • Muse Glimmer 30B : 29,13 € par mois, non mesuré sur préférence humaine sur des documents, arène Document de LMArena
  • Trinity Large Thinking : 24,50 € par mois, non mesuré sur préférence humaine sur des documents, arène Document de LMArena
3 modèles récents, pas encore mesurés
  • DeepSeek V4 Flash Vision Exp : 19,49 € par mois, non mesuré sur préférence humaine sur des documents, arène Document de LMArena
  • DeepSeek V4 Pro 0813 : 36,15 € par mois, non mesuré sur préférence humaine sur des documents, arène Document de LMArena
  • DeepSeek V4.1 Flash : 12,15 € par mois, non mesuré sur préférence humaine sur des documents, arène Document de LMArena