Avant de déployer un pilote IA, définissez ses règles de sortie
Définissez les preuves nécessaires pour répéter, déployer ou arrêter un pilote IA avant qu'une démo convaincante ne prenne la décision à votre place.

Un pilote IA ne devrait pas se terminer par une présentation intitulée « résultats prometteurs », mais par une décision. Avant même le premier participant, la première tâche ou le premier jeu de tests, définissez les preuves qui justifieraient l'une des trois issues suivantes : répéter l'expérience, déployer le flux de travail, ou arrêter et réorienter l'effort.
Sans ces règles, une démo convaincante peut être prise pour une préparation opérationnelle. Le "AI Playbook" du gouvernement britannique décrit des expériences par phases, des seuils de précision et une évaluation tout au long du cycle de vie du projet. Le NIST recommande également de documenter les jeux de tests, les métriques, les méthodes et les résultats de performance pour que l'évaluation soit reproductible. L'implication pratique est simple : définissez la décision avant de voir le résultat.
Trois règles de sortie pour un pilote IA
Répéter, déployer ou arrêter
Répéter pour combler une lacune
Ne lancez un nouveau cycle délimité que si la valeur reste plausible et qu'une incertitude identifiée peut être testée par un changement spécifique.
Déployer avec des contrôles
N'étendez le déploiement que si la qualité des tâches, les mesures de sécurité opérationnelles et le support continu atteignent tous les seuils pré-établis.
Arrêter ou réorienter
Mettez fin au pilote si le résultat n'est pas utile, si le risque ne peut être maîtrisé, ou si la charge de révision et de support annule la valeur ajoutée.
Ce ne sont pas trois humeurs, mais des décisions qui nécessitent des preuves. « Les gens ont aimé » peut justifier une exploration continue, mais ne prouve pas que le flux de travail est précis, sûr ou supportable à grande échelle. « Le modèle a produit un bon exemple » en dit peu sur la fréquence d'intervention d'un réviseur, les cas d'échec, ou la capacité de l'équipe à maintenir le processus.
Mesurer la préparation, pas seulement l'enthousiasme
| Demo evidence | Scale evidence | |
|---|---|---|
| Résultat de la tâche | One persuasive output | A defined test set assessed against explicit acceptance criteria |
| Travail humain | A reviewer corrected the example | Review time, escalation points and decision rights are understood |
| Risque | No problem appeared in the demo | Known failure modes have controls, owners and stop conditions |
| Opérations | The pilot team made it work | A normal team can repeat, monitor and support the workflow |
Utilisez trois points de contrôle. Le "point de contrôle de la tâche" évalue si le résultat est suffisamment bon pour son objectif sur des cas représentatifs. Le "point de contrôle du contrôle" vérifie si les règles de données, d'approbation, d'escalade et de révision humaine fonctionnent réellement. Le "point de contrôle du support" demande si le flux de travail peut être répété sans dépendre de l'expert le plus enthousiaste du pilote.
Un pilote peut passer le point de contrôle de la tâche et échouer celui du support. Ce n'est pas une déception, c'est le résultat. L'étude de cas GOV.UK Chat, par exemple, a montré qu'une assurance qualité très manuelle ne serait pas évolutive et a identifié le besoin d'un ensemble de questions évaluées. La leçon est plus large que les chatbots : le déploiement à grande échelle modifie le problème opérationnel.
Exemple concret : un dossier d'intégration fournisseur
Lire, c'est bien. Pratiquer, ça change tout.
CommencerImaginez une équipe d'achats qui pilote un flux de travail IA transformant des documents fournisseurs fictifs en un dossier d'intégration. L'équipe utilise un ensemble fixe de documents échantillons, incluant un certificat manquant, une condition de paiement incohérente et un cas clair. Un réviseur humain prend la décision finale.
Rédiger la fiche de sortie avant le test
- 1
Définir le seuil de la tâche
Le dossier doit conserver tous les faits matériels, signaler les preuves manquantes et éviter d'inventer une conclusion. Le jeu de tests et la méthode de notation sont enregistrés.
- 2
Définir le seuil de contrôle
Aucune donnée fournisseur réelle n'est utilisée. Chaque exception a une voie d'escalade, et le réviseur sait quels champs ne peuvent être approuvés à partir de la sortie IA.
- 3
Définir le seuil de support
Un deuxième membre de l'équipe peut exécuter le flux de travail à partir des instructions écrites, diagnostiquer les échecs courants et enregistrer les changements sans l'aide du concepteur du pilote.
- 4
Attribuer la décision
Le sponsor enregistre quel seuil non atteint déclenche une répétition, quelle combinaison permet un déploiement limité, et quelle condition met fin au pilote.
Supposons que les dossiers soient précis sur les cas simples, mais manquent la condition de paiement incohérente. La bonne décision n'est pas « déployer avec prudence », mais une décision de répétition avec une question identifiée : le flux de travail peut-il détecter de manière fiable les contradictions contractuelles après modification de l'invite, du pack source ou de la liste de contrôle de révision ? Le cycle suivant vise à répondre à cette question, pas à maintenir le pilote en vie.
Éviter le pilote sans fin
Une règle de répétition doit avoir sa propre limite. Spécifiez le changement, les preuves attendues et le nombre maximal de cycles. Si chaque cycle introduit un objectif différent, l'organisation ne teste plus un pilote ; elle reporte une décision. Conservez le journal des modifications afin que les améliorations puissent être attribuées à une invite, un modèle, une limite de tâche ou un processus de révision modifié.
Le déploiement doit également être échelonné. Un flux de travail qui fonctionne au sein d'une équipe peut nécessiter un autre contrôle avant de s'étendre à d'autres fonctions, pays ou niveaux de risque. De nouveaux utilisateurs et conditions d'exploitation peuvent révéler des défaillances absentes du premier test. Le NIST note que le contexte influence les méthodes d'évaluation appropriées et que les mesures doivent être réévaluées à mesure que les conditions opérationnelles changent.
- Name the exact work task and the decision the pilot is meant to inform.
- Write one observable pass condition for task quality, controls and supportability.
- Define the single uncertainty that would justify a repeat cycle.
- Name one condition that forces a stop or redesign.
- Assign the person who records the decision and the evidence behind it.
Faites de la décision le livrable
Un pilote n'est pas réussi parce qu'il a été exécuté ou que les participants étaient engagés. Il l'est quand il fournit des preuves fiables pour une décision. Définissez "répéter", "étendre" et "arrêter" avant de commencer, puis laissez les faits guider la suite.
Bokili aide les équipes à pratiquer ces comportements à travers des missions courtes et ciblées. Reliez la fiche de sortie à des conseils pertinents sur la formation à la contrainte de flux de travail, la transformation des signaux de tableau de bord en soutien et la décision sur l'utilisation du temps gagné.
Sources
- Artificial Intelligence Playbook for the UK Government — UK Government
- AI RMF Playbook — Measure — NIST
- Planning & Evaluating — U.S. Office of Personnel Management
Lire, c'est bien. Pratiquer, ça change tout.
Bokili transforme ce type de compétence en missions de dix minutes pour toute l'équipe, avec un retour immédiat et une progression visible.
CommencerÀ lire ensuite

Formation ChatGPT pour les salariés : créer un kit pratique sécurisé
Créez une formation ChatGPT réaliste pour vos équipes avec faits fictifs, cas limites, critères d'évaluation et corrigé, sans importer de données réelles.

Parcours de formation IA : allier création et vérification
Construisez un parcours de formation IA qui allie production utile et vérifications de source, contrainte, hypothèse et périmètre de décision.

Tester une affirmation sur une seule source avec Gemini Notebook
Une vérification ciblée transforme une réponse fluide en élément vérifiable avant d’élargir le corpus de sources.