Indice métier
Un modèle sait-il tenir tous les postes ? L'indice est la moyenne de ses scores d'exactitude par métier, chaque métier pesant autant que les autres.
Mis à jour le 5 octobre 2026 · Indice calculé sur 1 métier sur 10 et 1 benchmark sur 22.
- GPT-6 Luna100,0 %
- DeepSeek V4.1 Flash100,0 %
- Command A+100,0 %
- Kimi K2.6100,0 %
- Muse Spark 1.3100,0 %
- Gemma 4 31B99,3 %
- Qwen3.7 Flash99,3 %
- Ministral 3 8B 251299,3 %
- GLM 5.3 Flash99,3 %
- Claude Sonnet 599,3 %
- Grok 4.799,3 %
- Nova Lite 1.084,3 %
Le meilleur modèle de chaque labo, classé par indice métier.
Voir tous les résultatsÀ retenir
- GPT-6 Luna mène l'indice avec 100,0 %, devant DeepSeek V4.1 Flash (100,0 %) et Command A+ (100,0 %).
- Meilleur modèle à poids ouverts : DeepSeek V4.1 Flash, 2ᵉ avec 100,0 %.
- Meilleur modèle d'un labo français : Ministral 3 8B 2512, 9ᵉ avec 99,3 %.
Le classement d'ensemble
L'indice, puis le score de chaque métier. La meilleure valeur de chaque colonne est surlignée.
| Rang | Modèle | Benchmarks | |||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| 1 | GPT-6 Luna | 100,0 %±0,0 | — | 100,0 % | — | — | — | — | — | — | — | — | 1 / 22 |
| 2 | DeepSeek V4.1 Flash | 100,0 %±0,0 | — | 100,0 % | — | — | — | — | — | — | — | — | 1 / 22 |
| 3 | Command A+ | 100,0 %±0,0 | — | 100,0 % | — | — | — | — | — | — | — | — | 1 / 22 |
| 4 | Kimi K2.6 | 100,0 %±0,0 | — | 100,0 % | — | — | — | — | — | — | — | — | 1 / 22 |
| 5 | Muse Spark 1.3 | 100,0 %±0,0 | — | 100,0 % | — | — | — | — | — | — | — | — | 1 / 22 |
| 6 | Kimi K3 | 99,8 %±0,7 | — | 99,8 % | — | — | — | — | — | — | — | — | 1 / 22 |
| 7 | Gemma 4 31B | 99,3 %±1,2 | — | 99,3 % | — | — | — | — | — | — | — | — | 1 / 22 |
| 8 | Qwen3.7 Flash | 99,3 %±1,2 | — | 99,3 % | — | — | — | — | — | — | — | — | 1 / 22 |
| 9 | Ministral 3 8B 2512 | 99,3 %±1,2 | — | 99,3 % | — | — | — | — | — | — | — | — | 1 / 22 |
| 10 | GLM 5.3 Flash | 99,3 %±1,2 | — | 99,3 % | — | — | — | — | — | — | — | — | 1 / 22 |
| 11 | Gemini 3.5 Flash Lite | 99,3 %±1,2 | — | 99,3 % | — | — | — | — | — | — | — | — | 1 / 22 |
| 12 | Qwen3.8 27B | 99,3 %±1,2 | — | 99,3 % | — | — | — | — | — | — | — | — | 1 / 22 |
| 13 | Gemini 3.8 Flash | 99,3 %±1,2 | — | 99,3 % | — | — | — | — | — | — | — | — | 1 / 22 |
| 14 | Claude Sonnet 5 | 99,3 %±1,2 | — | 99,3 % | — | — | — | — | — | — | — | — | 1 / 22 |
| 15 | Qwen3.8 Max (0902) | 99,3 %±1,2 | — | 99,3 % | — | — | — | — | — | — | — | — | 1 / 22 |
| 16 | Grok 4.7 | 99,3 %±1,2 | — | 99,3 % | — | — | — | — | — | — | — | — | 1 / 22 |
| 17 | Claude Opus 5.5 | 99,3 %±1,2 | — | 99,3 % | — | — | — | — | — | — | — | — | 1 / 22 |
| 18 | Qwen3.8 Max Prime | 99,3 %±1,2 | — | 99,3 % | — | — | — | — | — | — | — | — | 1 / 22 |
| 19 | GPT-6 Astra | 99,3 %±1,2 | — | 99,3 % | — | — | — | — | — | — | — | — | 1 / 22 |
| 20 | GPT-6 Sol | 98,5 %±1,7 | — | 98,5 % | — | — | — | — | — | — | — | — | 1 / 22 |
Comment l'indice est calculé
Pour chaque métier, nous faisons la moyenne des exactitudes du modèle sur les benchmarks de ce métier qu'il a pu passer. L'indice est la moyenne de ces scores : un métier doté de trois benchmarks ne pèse pas plus lourd qu'un métier qui n'en a que deux.
L'indice ne porte que sur les métiers déjà mesurés, et l'en-tête dit lesquels. Un métier au programme ne compte pas comme un zéro — il ne compte pas du tout. Tant qu'un seul métier est mesuré, l'indice ne vaut pas plus que le benchmark dont il sort, et c'est ainsi qu'il faut le lire.
Un modèle qui ne lit pas les documents est noté, dans chaque métier, sur les seuls benchmarks en texte. Son indice reste comparable, mais repose sur moins de tests : la colonne « Benchmarks » le dit.
L'indice ne dit rien du coût, du temps de réponse ni des hallucinations. Ces mesures restent à part, dans chaque benchmark : un modèle premier en exactitude peut être inutilisable parce qu'il invente.