Aller au contenu
WorkBench.ai

Indice métier

Un modèle sait-il tenir tous les postes ? L'indice est la moyenne de ses scores d'exactitude par métier, chaque métier pesant autant que les autres.

Mis à jour le 5 octobre 2026 · Indice calculé sur 1 métier sur 10 et 1 benchmark sur 22.

À retenir

  • GPT-6 Luna mène l'indice avec 100,0 %, devant DeepSeek V4.1 Flash (100,0 %) et Command A+ (100,0 %).
  • Meilleur modèle à poids ouverts : DeepSeek V4.1 Flash, 2ᵉ avec 100,0 %.
  • Meilleur modèle d'un labo français : Ministral 3 8B 2512, 9ᵉ avec 99,3 %.

Le classement d'ensemble

L'indice, puis le score de chaque métier. La meilleure valeur de chaque colonne est surlignée.

Indice métier
RangModèleBenchmarks
1GPT-6 Luna100,0 %±0,0—100,0 %————————1 / 22
2DeepSeek V4.1 Flash100,0 %±0,0—100,0 %————————1 / 22
3Command A+100,0 %±0,0—100,0 %————————1 / 22
4Kimi K2.6100,0 %±0,0—100,0 %————————1 / 22
5Muse Spark 1.3100,0 %±0,0—100,0 %————————1 / 22
6Kimi K399,8 %±0,7—99,8 %————————1 / 22
7Gemma 4 31B99,3 %±1,2—99,3 %————————1 / 22
8Qwen3.7 Flash99,3 %±1,2—99,3 %————————1 / 22
9Ministral 3 8B 251299,3 %±1,2—99,3 %————————1 / 22
10GLM 5.3 Flash99,3 %±1,2—99,3 %————————1 / 22
11Gemini 3.5 Flash Lite99,3 %±1,2—99,3 %————————1 / 22
12Qwen3.8 27B99,3 %±1,2—99,3 %————————1 / 22
13Gemini 3.8 Flash99,3 %±1,2—99,3 %————————1 / 22
14Claude Sonnet 599,3 %±1,2—99,3 %————————1 / 22
15Qwen3.8 Max (0902)99,3 %±1,2—99,3 %————————1 / 22
16Grok 4.799,3 %±1,2—99,3 %————————1 / 22
17Claude Opus 5.599,3 %±1,2—99,3 %————————1 / 22
18Qwen3.8 Max Prime99,3 %±1,2—99,3 %————————1 / 22
19GPT-6 Astra99,3 %±1,2—99,3 %————————1 / 22
20GPT-6 Sol98,5 %±1,7—98,5 %————————1 / 22

Comment l'indice est calculé

Pour chaque métier, nous faisons la moyenne des exactitudes du modèle sur les benchmarks de ce métier qu'il a pu passer. L'indice est la moyenne de ces scores : un métier doté de trois benchmarks ne pèse pas plus lourd qu'un métier qui n'en a que deux.

L'indice ne porte que sur les métiers déjà mesurés, et l'en-tête dit lesquels. Un métier au programme ne compte pas comme un zéro — il ne compte pas du tout. Tant qu'un seul métier est mesuré, l'indice ne vaut pas plus que le benchmark dont il sort, et c'est ainsi qu'il faut le lire.

Un modèle qui ne lit pas les documents est noté, dans chaque métier, sur les seuls benchmarks en texte. Son indice reste comparable, mais repose sur moins de tests : la colonne « Benchmarks » le dit.

L'indice ne dit rien du coût, du temps de réponse ni des hallucinations. Ces mesures restent à part, dans chaque benchmark : un modèle premier en exactitude peut être inutilisable parce qu'il invente.

Méthodologie