Aller au contenu
WorkBench.ai

À propos du hub

WorkBench.ai classe les modèles d'IA sur des tâches d'entreprise concrètes, métier par métier, et publie tout ce qu'il faut pour refaire le calcul.

Ce que les classements publics ne mesurent pas

Les classements publics de modèles d'IA mesurent des examens académiques. Ils disent quel modèle raisonne le mieux sur ce terrain-là, et c'est utile à savoir. Ce n'est pas ce qu'une entreprise a besoin de savoir pour choisir un outil.

Une PME qui s'équipe se pose d'autres questions :

  • combien de ses factures passeront sans correction ;
  • combien coûtera chacune ;
  • à quelle fréquence le modèle inventera un chiffre qui n'est pas sur le document.

Aucun score d'examen n'y répond. Le hub est construit pour y répondre, sur la facture d'abord, puis sur les autres métiers de l'entreprise.

Ce que nous construisons

Des tâches d'entreprise concrètes, rangées par métier : finance, comptabilité, ressources humaines, juridique, commercial, marketing, service client, achats, informatique, direction. Chaque benchmark part d'une question qu'un dirigeant poserait — combien de vos factures passeront sans qu'un humain ait à corriger ? — et non d'une capacité abstraite du modèle.

Quatre mesures, publiées côte à côte et jamais fondues en une seule note :

  • Sans relecture : la part des cas traités sans qu'un humain ait rien à corriger.
  • Exactitude : les points obtenus sur l'ensemble des éléments notés, pondérés par leur criticité.
  • Hallucinations : les éléments inventés là où la source ne contient rien.
  • Coût et temps : par cas de test, aux tarifs publics du jour du test.

Un modèle peut être premier en exactitude et inutilisable parce qu'il invente. Une note unique cacherait exactement cela. Le seul chiffre d'ensemble du site, l'indice métier, n'agrège que l'exactitude, à poids égal par métier.

Trois verdicts et non deux. Un champ absent du document fait partie du test : une facture en franchise de TVA n'a pas de taux de TVA, et répondre « rien » est alors la bonne réponse. Un champ est donc juste, faux ou manquant, ou halluciné — le modèle a produit une valeur là où le document n'en contient aucune. Un chiffre inventé coûte plus cher qu'un chiffre manquant, parce qu'il passe la relecture.

Tout est vérifiable

Le prompt envoyé, les documents soumis, les réponses brutes de chaque modèle, le barème et le code qui note sont publiés dans le dépôt. Chaque chiffre mesuré peut être recalculé à partir de là.

Un run est un dossier horodaté et immuable. Ajouter un modèle crée un nouveau run ; les précédents restent consultables. La version exacte du modèle qui a répondu est relevée à l'exécution, jamais saisie à la main : dans six mois, le même nom commercial ne désignera plus forcément le même modèle.

Les étapes sont séparées à dessein : interroger les modèles, appliquer le barème, arbitrer les cas douteux, figer le classement. Changer le barème et relancer la notation ne coûte aucun appel : les réponses brutes sont conservées, ce qui rend les comparaisons dans le temps honnêtes.

Le site, lui, n'appelle aucun modèle. Il lit des résultats figés, et refuse de se construire si un fichier de données est invalide : mieux vaut pas de site qu'un classement à moitié affiché.

Limites assumées

Un seul prompt par modèle, aucun ajustement fin, aucun OCR spécialisé en amont, des images plutôt que des PDF avec couche texte, et vingt-cinq documents plutôt que dix mille. Les scores publiés sont un plancher, pas un plafond.

Dire ces limites avant qu'on nous les oppose n'est pas de la modestie : c'est ce qui rend le reste crédible.

Qui publie

Le hub est publié par Flowera. Il s'adresse aux dirigeants, aux directeurs financiers et aux responsables d'exploitation de PME qui doivent choisir un outil d'IA sans pouvoir l'essayer sur leurs propres documents.