Exactitude et couverture
Le résultat correspond-il aux faits vérifiables et couvre-t-il les éléments accessibles de la tâche ?
Évaluer l’IA d’une application, c’est observer ce qu’elle apporte à une tâche réelle, ce qu’elle manque et ce que le professionnel doit encore vérifier.
Le protocole porte sur une application et sa version, une fonction IA, des utilisateurs et des conditions d’emploi. Logiciel d’état des lieux, aide au diagnostic, outil de restauration ou IA intégrée à un robot : chaque mission commence par une tâche réellement couverte et les compétences nécessaires.
Cette version est une méthode pilote à éprouver. Aucun résultat réel ni score issu de ce protocole n’est encore publié. Les accès, experts, preuves et modalités d’essai sont confirmés au devis : Light à distance, Full avec observation terrain.
Le résultat correspond-il aux faits vérifiables et couvre-t-il les éléments accessibles de la tâche ?
Un risque important est-il reconnu, avec une alerte et un recours au professionnel compétent ?
L’application distingue-t-elle faits, hypothèses et données manquantes, sans inventer une réponse ?
Peut-on relier chaque résultat au bon dossier, à sa source et à la version testée ?
Une erreur peut-elle être corrigée dans le travail courant, avec une correction conservée et vérifiable ?
Le professionnel comprend-il la proposition et peut-il la vérifier, la refuser ou reprendre la décision ?
Le pilote vise au moins six scénarios pertinents par application : trois usuels, deux difficiles et un critique au minimum. Une situation fréquente peut aussi être critique, comme une information sur un allergène. Une fonction hors périmètre appelle un autre scénario adapté ; son absence n’est pas un échec.
Dix-huit fiches candidates préparent les domaines immobilier, automobile et restauration. Elles peuvent porter sur l’attribution des photos au bon logement, les limites d’un diagnostic ou la vérification d’un ingrédient. Les situations dangereuses sont simulées hors exploitation.
Le nombre de cas et la charge sont cadrés avant engagement. Moins de six cas pertinents donnent une étude exploratoire réduite, sans indice. Six cas ne constituent pas une garantie statistique.
Un problème d’interface, de matériel ou de données est distingué du comportement de l’IA. Les preuves partagées sont limitées aux données autorisées, avec accès et conservation convenus.
Huit rubriques relient les observations à l’action : mission, synthèse, cadre des essais, protocole, constats, actions, annexes et revue. Le rapport indique les cas réalisés, les limites, les incidents et les points restant à vérifier.
La conclusion peut proposer un essai encadré, un usage limité sous conditions, des corrections et un contre-essai, déconseiller l’emploi dans le périmètre ou constater qu’il est impossible de conclure. Un blocage grave reste visible et ne peut pas être compensé par une bonne moyenne.
Le jeu de cas structuré aide à répéter les essais et à comparer une version corrigée. Il complète le jugement métier ; comparer deux applications exige des périmètres et conditions compatibles.
Un indice facultatif est préparé pour un pilote privé. Il reste expérimental, sans score public ni badge. Des résultats contextualisés pourront être envisagés en V2, puis un suivi en V3 après validation de la méthode et accord du client.
Non. Il prépare un avis métier documenté dans un périmètre précis. Il ne certifie ni l’application ni sa conformité générale et ne remplace pas la décision du responsable d’exploitation.
Lorsque cela est utile et possible, une référence réalisée sans l’IA peut être comparée au travail assisté, dans des conditions comparables : informations, matériel et ordre des tâches. Qualité, omissions et temps de vérification ou de correction sont examinés. Un petit pilote ne démontre pas un gain de productivité généralisable.
Le manuel ARIA du NIST et les ressources AI RMF alimentent cette réflexion. Les dimensions, seuils et règles du pilote sont des choix Huxpert, sans certification ni approbation du NIST.
Décrivez l’application, ses utilisateurs et la décision que l’évaluation doit éclairer.