Aller au contenu
WorkBench.ai

Annonce

Le hub s'ouvre à dix métiers de l'entreprise

De la seule lecture de factures à 22 benchmarks, de la finance à la direction. Un seul est mesuré aujourd'hui ; les vingt-et-un autres ont un protocole rédigé et un jeu de test à construire.

Le hub a commencé par une seule question : combien de factures françaises un modèle lit-il sans qu'un humain ait à corriger ? C'était le bon point de départ, parce qu'une facture se note sans débat : le montant est juste ou il ne l'est pas. Mais une entreprise ne se résume pas à sa comptabilité fournisseurs.

Le hub couvre désormais dix métiers : finance, comptabilité, ressources humaines, juridique, commercial, marketing, service client, achats et logistique, informatique, direction. Vingt-deux benchmarks en tout, deux ou trois par métier.

Chacun part d'une question qu'un dirigeant se pose vraiment, pas d'une capacité abstraite du modèle :

  • Le modèle voit-il la reconduction tacite cachée en page douze ?
  • Le modèle promet-il un remboursement que vos conditions ne prévoient pas ?
  • Le moins cher sur le papier l'est-il encore, frais de port et pénalités compris ?

Ce qui est mesuré aujourd'hui : la lecture de factures, sur de vraies factures d'achat d'espace publicitaire déposées auprès du régulateur américain des télécoms et annotées à la main. Le prompt, les documents, les annotations, le barème et le code de notation sont dans le dépôt, et le pipeline joue la tâche de bout en bout.

Ce qui ne l'est pas encore : les vingt-et-un autres benchmarks. Leur protocole est rédigé — la question, ce que reçoit le modèle, les sous-tâches, la taille d'échantillon visée — mais leur jeu de test reste à construire. Leur fiche porte la mention « À venir » et dit ce qui leur manque : un jeu public à intégrer, une grille de notation à écrire, ou des documents que seules des entreprises détiennent.

Pourquoi les afficher quand même ? Parce qu'un protocole publié avant les résultats ne peut pas être retouché après coup pour arranger un classement. Et parce qu'il se discute mieux avant qu'après : si la question posée à un métier n'est pas la bonne, autant l'apprendre maintenant.

Le hub n'affiche aucun score fabriqué. Une tâche est mesurée et porte ses chiffres, ou elle est au programme et n'en porte aucun. Il n'y a pas de troisième état.

Pour lire l'ensemble, il y a l'indice métier : la moyenne des scores par métier, chaque métier pesant autant que les autres. Il ne remplace aucun classement. Le meilleur modèle en finance n'est pas forcément le bon pour votre service client, et c'est précisément ce que le hub cherche à montrer.