Ce playbook accompagne le travail de l’équipe une fois le cas d’usage choisi. Il propose un parcours de treize semaines, avec six points de décision et un livrable vérifiable chaque semaine. La vérification du dossier d’un nouveau client sert de cas fil rouge. Six modèles à remplir montrent comment préparer les documents attendus. La sélection du problème à traiter intervient en amont, dans le travail de discovery.
Choisissez votre rôle pour accéder aux sections utiles à votre étape du projet. Pour chacun, vous trouverez le travail attendu, les lectures prioritaires et le premier modèle à remplir parmi les vingt-neuf sections du playbook.
Votre travail : donner le mandat, garantir la capacité de contrôle et prendre les décisions G0 à G5.
Votre question de contrôle : « Si le pilote réussit, disposons-nous des moyens de l’exploiter, de le contrôler et d’en tirer de la valeur à l’échelle du portefeuille ? »
Votre travail : fixer la situation de départ, mesurer le résultat et construire la preuve économique.
Votre question de contrôle : « Quels résultats justifieraient d’arrêter, de corriger ou d’étendre le pilote ? »
Votre travail : traduire l’autonomie en actions, permissions, critères d’acceptation, traces et procédures de reprise.
Votre question de contrôle : « Quelles traces permettront de vérifier que l’action respecte les critères du récit, que les erreurs sont prises en charge et que la reprise prévue fonctionne ? »
Les six modèles à remplir sont regroupés sur une page dédiée : pour chacun, un exemple renseigné sur le cas fil rouge, une version vierge à télécharger et les critères permettant de vérifier que le document est complet.
La carte présente les treize semaines de travail et les six points de décision. Elle situe les livrables, le passage aux dossiers réels et les autorisations nécessaires. Chaque point renvoie à la section correspondante, pour suivre le parcours dans l’ordre ou consulter directement l’étape en cours.
Avant d’utiliser ce guide, le travail de discovery doit avoir permis d’identifier un problème observé sur le terrain, un parcours mesurable et une solution possible sans agent. Le choix du bon cas dans le portefeuille relève de l’étude stratégique ; ce playbook prend le relais, du mandat au go / no-go.
Chaque affirmation de cette page est marquée AUT, REC, MÉT ou HYP selon ce qu’elle engage. La convention de preuve est en annexe, à lire une fois, à tout moment.
Le scénario est courant : un cas est identifié, un sponsor s’y intéresse, le sujet entre au portefeuille et la preuve de concept démarre sans responsable clairement désigné. Sans mandat écrit, sans situation de départ mesurée et sans règle d’arrêt, le pilote se prolonge et la décision d’étendre finit par reposer sur l’impression laissée par une démonstration. Les six actes ci-dessous évitent ce scénario.
Les six actes se traduisent en une semaine de travail concrète. Le découpage ci-dessous est une cadence proposée MÉT : les jours peuvent bouger, l’ordre des sorties ne bouge pas.
Tous les modèles de ce guide sont renseignés sur un cas unique : la vérification de complétude d’un dossier d’entrée en relation et la préparation d’une relance. Ce cas donne le niveau de détail attendu. Une équipe qui remplit ses propres modèles avec cette précision dispose d’un dossier suffisamment précis pour être examiné par la deuxième ligne de contrôle ; une équipe qui reste plus vague le saura immédiatement, en comparant ligne à ligne.
« L’agent aide à vérifier les dossiers d’entrée en relation. »
Rien n’est mesurable, rien n’est interdit : ce périmètre autorise tout et ne protège de rien.
« L’agent identifie les pièces manquantes, cite la règle applicable et prépare un brouillon de relance. Il ne peut ni envoyer le message, ni modifier le statut du dossier, ni prendre une décision d’acceptation. »
Chaque verbe a un palier d’autonomie, chaque interdit se traduit en droit absent.
| Repère | Contenu |
|---|---|
| Déclencheur | Un dossier d’entrée en relation créé ou mis à jour doit être vérifié pour complétude |
| L’agent propose | Il lit les règles autorisées et les pièces du dossier, identifie les éléments manquants, cite ses sources et prépare un brouillon de relance |
| L’humain décide | Le chargé de dossier vérifie les pièces, modifie si nécessaire, décide d’envoyer ou non, et motive sa correction |
| Hors périmètre | Décision d’acceptation ou de refus, notation, envoi autonome, modification d’un statut réglementaire, collecte hors canal approuvé |
| Autonomie initiale | Palier A1 pour l’analyse, palier A2 pour la création d’un brouillon non envoyé, sur l’échelle d’autonomie A0 à A5 présentée en phase 2 MÉT, à valider localement |
| Classement de risque | Niveau R2, intermédiaire sur une échelle de quatre, proposé à titre méthodologique MÉT ; la classification réelle demeure cumulative et locale |
Ce cas est un exemple de travail. Son palier d’autonomie, son classement de risque et ses volumes sont des repères méthodologiques à recalibrer selon votre contexte, vos canaux et vos entités.
La dernière colonne précise les situations que chaque rôle doit signaler et les motifs qui justifient d’interrompre une dérive.
| Rôle | Ce dont il rend compte | Sa ligne rouge |
|---|---|---|
| Directeur produit | Mandat de portefeuille, capacité de contrôle, financement de la plateforme et arbitrage | Un pilote sans responsable ni voie de retrait |
| Product manager | Résultat, situation de départ, dossier économique, segmentation, apprentissage et décision | Un indicateur uniquement technique |
| Product owner | Backlog, critères d’acceptation, traçabilité, tests et procédure d’exploitation | Une exigence sans preuve observable |
| Sponsor métier | Accès au terrain, processus cible, capacité de changement et réalisation de la valeur | Un pilote détaché des opérations |
| Responsable d’agent | Périmètre, autonomie, risque résiduel, incidents, changements et retrait | Une responsabilité diffuse |
| Partenaires de contrôle | Qualification, exigences, validation indépendante et conditions d’exploitation | Une sollicitation en fin de construction |
Six rôles, six lignes rouges, et une seule personne responsable par agent. Cette règle évite surtout les arbitrages collectifs lorsqu’une décision rapide et traçable est nécessaire.
Dans les quarante-huit premières heures, l’équipe précise qui répond du résultat, du risque et de l’arrêt du pilote.
À chaque point de décision, les personnes habilitées examinent des pièces datées et signées avant d’autoriser l’étape suivante. Elles apprécient les résultats démontrés et les conditions du passage, en tenant compte du risque que les coûts déjà engagés influencent leur jugement.
| Point | Date | Objet | Pièces minimales | Ce qu’il autorise |
|---|---|---|---|---|
| G0 | Fin S2 | Mandat | Problème, situation de départ, responsable, périmètre, actions interdites | Le diagnostic |
| G1 | Fin S4 | Risque | Qualification, carte des données, autonomie, analyses requises | La conception |
| G2 | Fin S6 | Conception | Canevas d’agent, architecture, contrôles, backlog, supervision humaine | La construction complète |
| G3 | Fin S9 | Preuve | Ensemble de référence versionné, évaluations, tests adverses, validation, non-conformités | Le mode à blanc |
| G4 | Fin S11 | Pilote | Journal du mode à blanc, surveillance, procédure d’exploitation, formation, repli | Une cohorte limitée |
| G5 | Fin S13 | Décision | Valeur, risque, coût, adoption, incidents, dette de contrôle (les contrôles annoncés mais non encore construits) | Arrêter, corriger ou étendre |
Les cinq rituels proposés ont chacun un objet : livraison, risque, évaluation, valeur ou décision. Avant d’ajouter une réunion, vérifiez la question qu’elle permettra de traiter et son articulation avec les réunions existantes.
| Rituel | Cadence | Responsable | Question centrale |
|---|---|---|---|
| Revue de livraison | Deux fois par semaine | Product owner | Blocages, récits, preuves et dette de contrôle |
| Revue de risque | Hebdomadaire, S2 à S11 | Responsable d’agent | Décisions ouvertes, analyses et risques résiduels |
| Revue d’évaluation | Hebdomadaire, S6 à S12 | Product manager et responsable d’évaluation | Erreurs, segments (sous-populations comparables : entité, canal, langue, type de client, complexité), matrice de confusion et reprise |
| Revue de sponsor | Toutes les deux semaines | Product manager | Résultat, adoption, capacité et réalisation de la valeur |
| Comité de décision | Aux points G0 à G5 | Directeur produit et sponsor | Décision horodatée, conditions, responsable et échéance |
Le comité de décision se distingue des quatre autres par sa nature. Il est le seul qui se conclut par une décision datée, et le seul qui puisse arrêter le programme.
Chaque point de décision doit s’appuyer sur des pièces datées et vérifiables.
Responsable principal : le product manager. Point de décision visé : G0. Le point G0 peut être franchi lorsque le sponsor et le responsable d’agent savent expliquer ce qui change, pour qui, sur quelle preuve, et avec quel retour manuel.
Les deux premières semaines sont consacrées à la préparation et à la signature de la charte. Trois champs préparent la décision de la semaine treize : la situation de départ sert de référence pour la comparaison, le hors-périmètre précise les actions exclues et la règle d’arrêt fixe les conditions d’interruption.
| Repère | Contenu renseigné |
|---|---|
| Résultat visé | Réduire le délai de complétude et la reprise des dossiers, sans augmenter les erreurs significatives, les relances inutiles ni l’abandon |
| Population | Cohorte bornée de dossiers standards, canal et entité à préciser |
| Déclencheur | Création ou mise à jour d’un dossier nécessitant une vérification de complétude |
| Utilisateurs | Chargé de dossier, superviseur opérationnel, client indirectement concerné |
| Proposition | Analyse sourcée des pièces manquantes et brouillon de relance soumis à revue |
| Hors périmètre | Décision d’acceptation, notation, refus, envoi autonome, écriture de statut, changement de politique |
| Situation de départ | Délai de traversée, complétude au premier passage, taux de reprise, relances par dossier, abandon, coût complet, à mesurer |
| Succès | Amélioration nette du parcours et du coût complet, sous les seuils durs de risque, seuils à valider |
| Arrêt | Action interdite, fuite de donnée sensible, impossibilité de revenir au manuel, ou risque résiduel refusé |
Six critères conditionnent le franchissement de G0, chacun avec son responsable et son élément de preuve : le résultat et la population écrits, la situation de départ mesurable avec un responsable de la donnée nommé, le hors-périmètre et les actions interdites approuvés, l’alternative sans intelligence artificielle examinée, le retour manuel et la capacité terrain confirmés, et les points G1 à G5 planifiés avec leurs décideurs. Le quatrième critère consiste à examiner une solution sans intelligence artificielle avant d’engager le pilote. Le temps nécessaire dépend du processus et des informations disponibles.
La mesure de la situation de départ précède la conception et sert de référence au dossier économique. Le calendrier lui consacre une semaine. Elle porte sur le parcours entier, du premier événement au résultat, afin de suivre l’effet du projet pour le client et pour l’établissement.
| Étape | Question posée | Mesure de situation de départ |
|---|---|---|
| 1 · Événement | Un dossier est créé ou une pièce est reçue | Volume, composition, heure, canal |
| 2 · Qualification | Quelles règles et quelles pièces s’appliquent | Temps, exceptions, recherches |
| 3 · Complétude | Les pièces sont-elles présentes, valides et cohérentes | Complétude au premier passage, erreurs, reprise |
| 4 · Relance | Le message est-il adapté et les pièces bien demandées | Nombre, clarté, relances inutiles |
| 5 · Réponse | Les pièces sont reçues et le dossier est remis en file | Délai, abandon, escalade |
| 6 · Résultat | Le dossier est complet ou part en voie d’exception | Délai total, coût, qualité |
Commencez par cartographier le parcours avant de déterminer ce qui mérite d’être automatisé. Avant d’automatiser, classez chaque étape selon cinq actions possibles : éliminer, déplacer, standardiser, assister ou automatiser. Une étape accélérée qui ne crée pas de valeur demeure une étape sans valeur, exécutée plus vite. Cette mesure et ce classement sont la part de découverte que le playbook conserve : on découvre le processus réel avant de construire quoi que ce soit.
Sans situation de départ mesurée avant le premier prototype, aucun gain ne pourra être démontré proprement à la fin.
Responsable principal : le responsable d’agent. Point de décision visé : G1. La qualification dépend du cas d’usage, de la population, des effets produits et des données traitées ; le simple fait qu’il s’agisse d’un « agent » ne détermine pas la qualification.
| Axe | Question obligatoire | Responsable |
|---|---|---|
| Décision et effet | L’agent influence-t-il l’accès à un service, une décision, un droit ou une obligation ? | Juridique et conformité |
| Données | Traite-t-il des données personnelles, sensibles, inférées ou hors finalité ? | Délégué à la protection des données |
| Action | Peut-il envoyer, écrire, payer, bloquer, modifier ou déclencher un enchaînement ? | Propriétaire d’agent et sécurité |
| Tiers | Quels modèles, hébergeurs, interfaces et sous-traitants soutiennent le service ? | Achats, résilience et sécurité |
| Client | L’intervention de l’agent, le recours et la revue humaine sont-ils compréhensibles ? | Conformité et expérience |
| Résilience | Quel est l’impact d’une erreur, d’une indisponibilité, d’une dérive ou d’une compromission ? | Opérations et continuité |
| Équité | Quelles populations ou quels segments peuvent subir des erreurs asymétriques ? | Risque et métier |
Les obligations se confirment ensuite avec les fonctions compétentes et sur des sources à jour, à la date de la décision. Base : règlements (UE) 2024/1689, 2016/679 et 2022/2554 AUT ; questions proposées par l’auteur à partir de textes contraignants.
Le point G1 exige six critères correspondants : triage juridique et réglementaire documenté, autonomie maximale par action validée, carte des données avec finalités et rétention provisoire, lignes rouges traduites en droits absents, risque tiers et continuité préqualifiés, risque initial assorti d’un responsable de remédiation.
L’échelle distingue l’observation, la proposition, la préparation et plusieurs formes d’exécution. Les paliers sont définis par les actions autorisées et les effets qu’elles peuvent produire.
À mesure que l’autonomie augmente, la valeur potentielle peut croître, mais le risque et les exigences de contrôle augmentent eux aussi. C’est pourquoi ces marches portent un nom : A0 à A5.
Attribuez un palier à chaque action. Un même agent peut, par exemple, consulter des informations, soumettre une recommandation à la revue humaine et préparer un brouillon avec des droits limités. Cette décomposition permet d’adapter le contrôle à l’effet de chaque action.
| Palier | Verbe | Effet produit | Contrôle minimal |
|---|---|---|---|
| A0 | Observe | Synthèse sans recommandation | Lecture seule, traces |
| A1 | Propose | Analyse ou recommandation | Sources, incertitude affichée, revue |
| A2 | Prépare | Crée un brouillon ou une transaction non exécutée | Droits limités, validation avant effet |
| A3 | Exécute borné | Action réversible sous limites | Passerelle de politique, le composant technique par lequel transite toute action de l’agent et qui autorise ou refuse chacune d’elles, quotas, surveillance, retour arrière |
| A4 | Exécute sensible | Effet significatif ou difficilement réversible | Gouvernance renforcée, hors pilote par défaut |
| A5 | Orchestre | Décompose l’objectif, choisit outils et agents, agit avec latitude | Filière d’exception, contrôle renforcé et preuve formelle |
Le contrôle minimal doit être traduit dans les droits d’accès et d’action, où il devient vérifiable. Les paliers A4 et A5 se situent hors du pilote par défaut, et leur admission relève d’une filière d’exception qui se décide en amont, avant que l’architecture ne soit figée. A4 concerne une action à effet significatif ou difficilement réversible. A5 concerne la latitude laissée à l’agent dans le choix de sa suite d’actions. Cette échelle est celle de l’étude, à l’identique.
La matrice associe chaque action à son palier d’autonomie et à une preuve technique de son application. La deuxième ligne de contrôle peut ainsi vérifier les droits réels du système. Les actions interdites doivent être bloquées dans la configuration et faire l’objet de tests.
| Action | Palier | Au pilote | Preuve de contrôle |
|---|---|---|---|
| Lire les règles approuvées | A0 | Oui | Liste blanche de récupération et version |
| Lire les pièces du dossier | A0 | Oui, sur besoin d’en connaître | Portées limitées au dossier et journal |
| Identifier une pièce manquante | A1 | Oui | Règle citée, indice de confiance, revue |
| Préparer un brouillon | A2 | Oui | Outil limité au brouillon et validation |
| Envoyer au client | A3 | Hors pilote | Droit absent et blocage par la passerelle |
| Décider l’acceptation ou le refus | A4 | Interdit | Aucun outil, ligne rouge écrite |
| Modifier un statut réglementaire | A4 | Interdit | Aucun droit d’écriture |
Pour les trois dernières actions, les droits correspondants sont désactivés dans la passerelle. Un contrôleur doit pouvoir le vérifier dans la configuration.
La dernière ligne du tableau mérite l’attention. La mémoire transversale au client est désactivée au pilote, par décision de conception. Toute mémoire conservée doit répondre à un besoin justifié. Son cloisonnement et sa purge doivent pouvoir être vérifiés.
| Objet | Sensibilité | Droit | Contrôle | Rétention |
|---|---|---|---|---|
| Politiques d’entrée en relation | Interne contrôlé | Lecture | Index versionné, responsable conformité | Selon politique |
| Pièces du client | Personnel, potentiellement sensible | Lecture du dossier | Accès sur besoin d’en connaître | Selon finalité |
| Brouillon | Personnel | Écriture du brouillon | Aucun droit d’envoi, purge après traitement | À valider |
| Trace | Identifiants, sources, décisions | Écriture du journal | Accès restreint, intégrité | À valider |
| Mémoire transversale au dossier | Sans nécessité établie | Aucun | Désactivée au pilote | Sans objet |
Base : CNIL et Conseil de l’IA et du numérique, IA agentique et protection des données personnelles, juillet 2026 AUT. Carte renseignée sur le cas fil rouge.
La qualification précise les actions que l’agent peut réaliser et les conditions à respecter.
Responsable principal : le product owner. Point de décision visé : G2. Pour préparer G2, chaque récit (user story) doit préciser le résultat observable, la trace attendue, le cas d’erreur, le contrôle, la solution de repli et le responsable.
Dans le cas fil rouge, la passerelle de politique et la revue humaine contrôlent les actions avant leur exécution. Les traces alimentent les évaluations ; leurs résultats permettent à l’équipe de corriger l’agent et de repérer les régressions entre deux points de décision.
Un dossier est créé ou mis à jour. L’événement déclencheur et les pièces disponibles entrent dans la boucle.
L’agent lit les règles autorisées, identifie les manques, cite ses sources et prépare une proposition sans effet.
La passerelle vérifie les droits, applique les politiques et refuse toute action qui sort du périmètre autorisé.
Le relecteur modifie, rejette, renvoie pour traitement spécialisé ou valide, et motive sa correction dans un champ structuré.
Chaque étape laisse une trace exploitable : identifiants de source, outils appelés, décisions prises et motifs.
Les traces alimentent les évaluations, qui corrigent l’agent, les règles, les données ou l’écran de revue.
Le canevas d’agent formalise les décisions de conception avant la construction complète. Ses douze champs relient le résultat attendu et les utilisateurs au périmètre, à l’autonomie, aux outils, aux droits et au plan d’évaluation. Renseignez-les dans l’ordre proposé.
| Champ | Décision renseignée |
|---|---|
| 1 · Résultat | Complétude plus rapide, moins de reprise, qualité et abandon sous contrôle |
| 2 · Utilisateurs | Chargé de dossier, superviseur, client concerné, contrôle et support |
| 3 · Périmètre | Cohorte standard bornée, analyse et brouillon, exclusions écrites |
| 4 · Autonomie | A0 en lecture, A1 en proposition, A2 en brouillon ; A3, A4 et A5 interdits au pilote |
| 5 · Risque | Niveau R2 initial au titre de la méthode ; qualification cumulée et risque résiduel à valider |
| 6 · Données | Politiques versionnées, pièces du dossier, minimisation, lignage et rétention |
| 7 · Outils | Récupération, lecteur de dossier, rédacteur de brouillon ; aucun envoi ni écriture de statut |
| 8 · Mémoire | Session et dossier uniquement ; aucune mémoire transversale au client |
| 9 · Humain | Sources, anomalies, différences, bouton modifier ou rejeter, motif de correction |
| 10 · Évaluation | Jeux de référence et adverses, segments, erreurs significatives, faux blocages, non-régression |
| 11 · Exploitation | Objectifs de service, coût, journaux, alertes, arrêt, repli manuel, support |
| 12 · Cycle de vie | Responsable, versions, changement significatif, revalidation, retrait |
La matrice de permissions traduit le canevas en objets techniques. Pour chaque outil, la matrice précise les droits, les conditions d’appel, les limites quantitatives et le retour arrière prévu. Les deux dernières lignes sont aussi importantes que les autres : elles décrivent les capacités que l’agent ne possède pas, ce qu’un contrôleur vérifie dans la configuration de la passerelle.
| Outil | Droit | Contexte | Limite | Retour arrière |
|---|---|---|---|---|
| Récupération de politiques | Lecture | Version approuvée et entité | 200 requêtes par dossier HYP | Désactiver la source |
| Lecteur de dossier | Lecture | Dossier assigné | Taille et type de fichier | Retour au traitement manuel |
| Rédacteur de brouillon | Création de brouillon | Canal approuvé, sans envoi | 1 brouillon par événement HYP | Supprimer le brouillon |
| Envoi au client | Aucun | Interdit | 0 | Sans objet |
| Écriture de statut | Aucun | Interdit | 0 | Sans objet |
Un récit est prêt à être développé lorsqu’il précise un résultat observable, un outil et un droit explicites, une erreur redoutée, un évaluateur, une trace et un repli. La colonne de preuve rend chaque récit testable et transforme le backlog en programme de vérification.
« L’agent doit produire une réponse correcte. »
Le terme « correct » ne définit aucun résultat vérifiable. Il faut préciser la preuve attendue, l’évaluateur et la condition qui fera échouer le test.
« Pour chaque pièce signalée comme manquante, l’interface affiche la règle applicable, sa version et la pièce concernée. Une absence de source fait échouer le test. »
L’évaluateur peut conclure à la réussite ou à l’échec à partir d’un critère écrit, sans demander à l’équipe de l’interpréter.
| Récit | Capacité | Acceptation produit | Preuve |
|---|---|---|---|
| 1 | Règles sourcées | Le chargé voit la règle, sa version et la pièce concernée | Identifiant de source et version |
| 2 | Complétude | Chaque manque proposé est classé, expliqué et révisable | Résultat par champ |
| 3 | Brouillon | Aucun brouillon ne part sans une action humaine | Droit d’envoi absent |
| 4 | Supervision | Le relecteur modifie, rejette ou escalade avec un motif | Motif obligatoire |
| 5 | Sécurité | Une instruction contenue dans une pièce laisse la politique inchangée | Test d’injection |
| 6 | Fonctionnement | Le responsable coupe le rédacteur et revient au manuel | Exercice d’arrêt et de retour arrière |
Six critères conditionnent le franchissement de G2 : canevas d’agent complet et signé, architecture et modèle de menace revus, permissions et lignes rouges testables, écran de revue éprouvé avec des utilisateurs, backlog relié aux évaluateurs, repli manuel et plan d’exploitation conçus.
Toute interdiction doit être matérialisée dans les permissions techniques de l’agent ; une consigne seule ne constitue pas un contrôle suffisant.
Responsable principal : le product manager, avec le responsable d’évaluation. Point de décision visé : G3. Le point G3 peut être franchi lorsque les seuils durs sont respectés, que la performance est acceptable sur chaque segment critique, et que les limites sont connues et exploitables.
L’évaluation porte sur trois résultats distincts : la qualité de la tâche réalisée par l’agent, l’amélioration du parcours et la valeur créée pour l’établissement. Mesurez chacun séparément avant de conclure sur l’ensemble du dispositif.
L’agent identifie correctement les pièces manquantes et produit un brouillon conforme. Preuve : ensemble de référence versionné, exactitude par champ, erreurs significatives.
Le dossier devient complet plus vite, avec moins de reprise et sans dégrader l’expérience. Preuve : délai de traversée, complétude au premier passage, relances, abandon, décisions de passer outre.
Le gain subsiste après supervision, fonctionnement, incidents et changement. Preuve : coût par parcours traité avec succès, capacité libérée, coût évité.
Quatre signaux doivent conduire à suspendre la phase : un score moyen élevé masquant un segment faible, une évaluation confiée à un seul juge automatique sans second évaluateur, des tests non versionnés, une réussite de tâche sans résultat de parcours.
« 92 % de réponses jugées bonnes par le modèle évaluateur. »
Ce chiffre repose sur un seul juge automatique. Il ne renseigne ni les résultats par segment ni l’effet sur le parcours ; ces éléments manquent pour préparer la décision.
« Sur l’ensemble de référence versionné, zéro action interdite ; l’exactitude par champ respecte les seuils retenus sur chaque segment critique, avec une contre-vérification par un second évaluateur ; le délai de traversée de la cohorte diminue par rapport à la situation de départ. »
L’exemple documente les quatre éléments attendus : seuil dur, résultats par segment, second évaluateur et résultat de parcours.
L’ensemble de référence versionné permet de dire, avant toute exposition, si l’agent se comporte comme prévu. Il se construit famille par famille, et sa composition compte davantage que son volume : cinq dossiers adverses bien choisis peuvent révéler davantage de faiblesses que cent dossiers standards.
Le jeu initial proposé comprend cinquante dossiers : trente standards, dix incomplets, cinq cas limites et cinq cas adverses. Il sert à commencer les tests. La taille nécessaire doit ensuite être déterminée selon les erreurs rares, les segments et le niveau de risque ; ce volume initial ne suffit pas à établir la validité statistique des résultats.
| Famille | Contenu | Comportement attendu |
|---|---|---|
| Standard | Dossiers représentatifs du flux | Complétude, sources, brouillon |
| Incomplet | Pièces absentes, expirées, illisibles ou incohérentes | Détection et motif |
| Cas limite | Règle locale, exception, document inhabituel | Escalade correcte |
| Cas adverse | Instruction dans une pièce, source non fiable, demande d’action interdite | Blocage et trace |
| Tranches | Entité, canal, langue, type de client, complexité | Performance homogène |
La cinquième ligne se distingue des quatre autres : elle porte sur la stabilité entre populations, la seule à révéler une réussite moyenne construite sur un segment défaillant. Une taxonomie d’échecs remplit ensuite deux fonctions : rendre les erreurs dénombrables et attribuer chacune à quelqu’un.
Cette grille permet notamment de distinguer une erreur correctement bloquée d’un dossier correct bloqué à tort. Les deux erreurs ont un coût, mais pas de même nature, et se pilotent séparément. Un faux blocage se traite comme une erreur de production, avec son responsable et son échéance, parce qu’il peut dégrader fortement l’adoption tout en ajoutant délai et reprise.
| Situation | Comportement du contrôle | Catégorie | Décision produit |
|---|---|---|---|
| Erreur présente | Le contrôle bloque | Vrai positif | Bonne détection ; mesurer le coût de la revue |
| Erreur présente | Le contrôle laisse passer | Faux négatif | Risque non détecté ; priorité de remédiation |
| Aucune erreur | Le contrôle bloque | Faux positif | Friction, délai et reprise inutiles |
| Aucune erreur | Le contrôle laisse passer | Vrai négatif | Flux correct |
Plan d’évaluation. Il couvre la complétude, le sourçage, le brouillon, la sécurité, l’usage des outils, la supervision et le coût. Les seuils durs valent zéro action interdite et zéro fuite de donnée sensible sur le périmètre testé HYP, à adopter formellement par les responsables. Les seuils statistiques se fixent par gravité et par segment, après la mesure de la situation de départ humaine.
Le point G3 exige six éléments de preuve : jeux de référence et adverses versionnés avec leur fiche de jeu de données, seuils durs franchis et rapport signé, résultats par segment avec incertitudes visibles, examen de la sécurité, de la protection des données et de l’équité, journal des non-conformités avec responsable et échéance, validation indépendante close.
Un résultat de contrôle n’est pas une note à archiver : il doit conduire à une décision produit, qu’il s’agisse d’étendre, de borner, de corriger ou d’arrêter.
L’agent déplace le travail. Le collaborateur cesse de produire le dossier et se met à juger une proposition. Ce nouveau rôle s’apprend, et la formation se place avant la période à blanc pour que les premiers jugements soient exploitables. Les motifs de correction consignés pendant cette période alimentent directement le jeu d’évaluation : la formation du relecteur produit de la preuve.
Seuil au-delà duquel l’adoption progresse nettement, selon l’enquête BCG AI at Work 2025.
Écart d’adoption mesuré entre une formation en présentiel et une formation à distance.
Écart d’adoption lorsqu’un référent accompagne les équipes dans leur travail quotidien.
| Semaine | Ce qui se met en place | Responsable |
|---|---|---|
| S6 | Un référent est désigné dans l’équipe métier et participe à la conception de l’écran | Product owner |
| S9 | Les relecteurs suivent cinq à dix heures en présentiel, sur des dossiers de l’ensemble de référence versionné | Métier |
| S11 | Le référent siège auprès des relecteurs et consigne les motifs de correction | Métier et opérations |
| S13 | Le temps de revue et le taux de modification figurent au dossier de décision | Product manager |
Source : BCG, AI at Work 2025, 10 635 répondants dans onze pays, enquête déclarative AUT ; 36 % des répondants s’estiment correctement formés à ce jour. Calendrier proposé par l’auteur MÉT.
Responsable principal : le responsable d’agent, avec les opérations. Point de décision visé : G4. Le point G4 peut être franchi lorsque l’organisation sait détecter, arrêter, corriger et reprendre manuellement, et que les utilisateurs disposent d’un pouvoir réel sur la proposition.
Le mode à blanc observe le comportement de l’agent sur des dossiers réels sans lui laisser produire d’effet. C’est le test de valeur du dispositif : la preuve d’usage se fait avant tout effet. Il dure jusqu’à la couverture suffisante des segments et la stabilité des résultats, plutôt que jusqu’à une date fixée d’avance. Quatre signaux imposent de l’interrompre : une observation sans résultat de référence, une validation devenue automatique dans les faits, l’absence de motif de correction, un arrêt d’urgence resté sans exercice.
| Paramètre | Contenu |
|---|---|
| Population | Cohorte, entité, canal, règles d’exclusion et volume, à compléter |
| Effet | Aucun envoi ni écriture de statut ; sorties visibles des seuls relecteurs autorisés |
| Comparateur | La décision humaine habituelle est conservée comme référence opérationnelle |
| Données enregistrées | Résultat de l’agent, sources, outils, latence, coût, décision humaine et motif d’écart |
| Échantillonnage | Tous les cas critiques ; stratégie documentée pour le reste |
| Arrêt | Seuil dur franchi, incident, dérive, indisponibilité ou surcharge de revue |
| Durée | Jusqu’à couverture suffisante des segments et stabilité des résultats |
Le tableau de bord du pilote est organisé par domaine de contrôle et par responsable. La vue consacrée à la dérive est la seule qui surveille le dispositif plutôt que ses résultats : elle détecte le moment où la population, les règles ou les coûts évoluent alors que l’agent reste inchangé.
| Vue | Métriques | Fréquence et niveau d’analyse | Responsable |
|---|---|---|---|
| Valeur | Délai de traversée, complétude au premier passage, relances, abandon | Par cohorte et par semaine | Product manager |
| Qualité | Erreurs significatives, complétude, sourçage | Par segment | Métier |
| Humain | Décisions de passer outre, motif, temps de revue, escalade | Quotidienne | Product owner |
| Sécurité | Actions refusées, injection, fuite, accès | Temps réel et par incident | Sécurité |
| Fiabilité | Latence, disponibilité, expirations, repli | Temps réel | Opérations |
| Économie | Coût par parcours traité avec succès, reprise, fonctionnement | Hebdomadaire | Produit et finance |
| Dérive | Composition, données, règles, erreurs, coûts | Hebdomadaire | Responsable d’agent |
Six critères conditionnent le franchissement de G4 : le mode à blanc couvre les segments critiques, les décisions de passer outre sont analysées et non seulement comptées, la supervision est efficace en conditions réelles, la surveillance et les alertes parviennent à des responsables nommés, l’arrêt, le retour arrière et le repli sont testés, la formation, le support et la communication sont prêts.
La mise en service suppose également que l’organisation sache arrêter l’agent et reprendre le traitement manuellement.
Responsable principal : le directeur produit, avec le sponsor métier. Point de décision visé : G5. Le point G5 peut être franchi lorsque la décision, ses conditions, son responsable, sa date de revue et sa stratégie de retrait sont écrits.
Le dossier économique se construit bloc par bloc, chacun attribué à un responsable identifié. Tant qu’un paramètre provient d’un ordre de grandeur plutôt que des données de l’établissement, il reste marqué comme hypothèse locale et doit être recalibré avant la décision. C’est cette discipline qui autorise un calcul de seuil de rentabilité et de retour sur investissement solide devant une direction financière.
| Bloc | Formule ou contenu | Responsable |
|---|---|---|
| Bénéfice brut | Volume admissible × variation de résultat × valeur unitaire | Finance et métier |
| Coût variable | Inférence, recherche documentaire, outils, stockage, observabilité | Finance technique |
| Supervision | Temps de revue, escalade, contrôles, assurance qualité | Métier et risque |
| Reprise | Correction, relance inutile, reprise manuelle, erreur | Product manager |
| Coûts fixes | Construction, intégration, plateforme, validation, changement, support | Direction produit et technique |
| Risque | Incidents, pertes, remédiation, réserves selon la politique | Risque et finance |
| Valeur nette | Bénéfice brut moins tous les coûts et le coût du risque | Sponsor métier |
Test de robustesse : trois scénarios au minimum. Un scénario central, un scénario de reprise élevée et un scénario de dérive. La valeur ne devient réelle que lorsque la capacité libérée ou le résultat obtenu se traduit effectivement en valeur pour l’organisation. Un pilote qui améliore un indicateur sans que personne ne redéploie la capacité libérée produit une économie de tableur.
| Dimension | Question tranchée | Responsable |
|---|---|---|
| Résultat | Quel changement peut être attribué à l’agent, ou au moins comparé à un contrefactuel (ce qui se serait produit sans lui) sur une population comparable restée au traitement manuel ? | Product manager |
| Risque | Quels seuils, incidents, exceptions et risque résiduel ? | Propriétaire d’agent et risque |
| Humain | Quelle charge, quelle compétence, quel pouvoir de reprise et quel recours ? | Métier |
| Économie | Quel coût complet par dossier réussi et quelle valeur réalisée ? | Finance |
| Exploitation | Qui opère, soutient, surveille, revalide et retire ? | Opérations |
| Échelle | Quels volumes, entités, canaux ou actions modifient le risque ? | Direction produit |
Le dernier point de passage exige six éléments de preuve signés : un dossier de preuves complet et traçable, la valeur comparée à la situation de départ et au contrefactuel, le risque résiduel formellement accepté, le responsable d’exploitation avec son budget et ses engagements de service, la liste des changements significatifs déclenchant une revalidation, enfin la décision assortie de ses conditions, de sa date de revue et de sa procédure de retrait. La liste des changements significatifs protège la décision dans la durée : elle dit à l’avance quel changement de modèle, de consigne, d’outil ou de règle rouvre le dossier.
Trois issues seulement : arrêter, corriger ou étendre. L’absence de décision ne doit pas devenir une quatrième issue.
La lettre A désigne celui qui répond du document devant la gouvernance, la lettre R celui qui le produit, la lettre C celui qui est consulté. Sans responsable « A », aucun rôle n’est explicitement chargé de porter le document au point de passage.
| Document | Direction produit | Product manager | Product owner | Autres parties | Modèle à remplir |
|---|---|---|---|---|---|
| Mandat de pilote | A | R | C | Sponsor métier co-décide | Charte de pilote |
| Situation de départ du parcours | C | A / R | R | Métier et données consultés | — |
| Triage de risque | C | C | R | Propriétaire d’agent et contrôles responsables | Triage de risque |
| Canevas d’agent | C | C | A / R | Architecture et exploitation consultées | Canevas d’agent |
| Plan d’évaluation | C | A | R | Validation indépendante consultée | Plan d’évaluation |
| Manuel de reprise | C | C | A / R | Exploitation et métier réalisent | Journal du mode à blanc |
| Dossier de décision | A | R | C | Sponsor métier co-décide | Dossier de preuves et compte rendu |
Deux documents portent la lettre A du côté de la direction produit : le mandat qui ouvre le pilote et le dossier qui le conclut. Entre ces deux décisions, la responsabilité opérationnelle revient à ceux qui produisent les preuves. La gouvernance ouvre et clôt le pilote ; l’équipe produit les preuves entre les deux.
Exiger un responsable d’agent et un sponsor avant le premier point de passage, financer la capacité mutualisée, séquencer les cas selon la capacité réelle des fonctions de contrôle, tenir un inventaire et une stratégie de retrait.
« Si le pilote réussit, disposons-nous des moyens de l’exploiter, de le contrôler et d’en tirer de la valeur à l’échelle du portefeuille ? »
Garantir la cohérence entre le mandat, la situation de départ et le contrefactuel, relier les mesures de tâche, de parcours et d’économie, préparer chaque point de passage comme une décision assortie d’options et d’une recommandation.
« Quels résultats justifieraient d’arrêter, de corriger ou d’étendre le pilote ? »
Décomposer l’agent par action, outil, permission, trace et repli, écrire des critères d’acceptation observables y compris les échecs attendus, éprouver la supervision, l’arrêt d’urgence et le retour arrière avant G4.
« Quelles traces permettront de vérifier que l’action respecte les critères du récit, que les erreurs sont prises en charge et que la reprise prévue fonctionne ? »
La décision de portefeuille, le coût complet et l’effet d’échelle sont traités dans l’étude stratégique sur les agents IA dans la finance et son classeur recalculable.
Les exemples renseignés sur le cas fil rouge montrent le niveau de précision attendu ; les versions vierges peuvent être reprises dans l’espace de travail de l’équipe. Ces modèles constituent la partie transférable du guide : ils restent utiles au-delà du premier cas et peuvent devenir la méthode commune du portefeuille. Un modèle correctement renseigné sur un premier cas peut ensuite être réutilisé sur les suivants.
Les six modèles sont regroupés sur une page dédiée : pour chacun, quand l’utiliser, qui le remplit, un exemple renseigné sur le cas fil rouge, une version vierge à télécharger et les critères permettant de vérifier que le document est complet. Commencer avec les modèles →
| Modèle | Champs à renseigner | Point de passage |
|---|---|---|
| Charte de pilote | Résultat, déclencheur, utilisateurs, périmètre, hors-périmètre, situation de départ, succès, actions interdites, repli, responsables et dates | G0 |
| Canevas d’agent | Résultat, utilisateurs, périmètre, autonomie par action, risque, données, outils, mémoire, place de l’humain, évaluation, exploitation, cycle de vie | G2 |
| Récit de contrôle | Récit, action et outil, acceptation positive, échec attendu, trace, évaluateur, repli, responsable | G2 |
| Plan d’évaluation | Décision couverte, ensemble de référence versionné, taxonomie d’échecs, segments, seuils durs et statistiques, sécurité, équité, reprise, coût, non-régression, validation | G3 |
| Dossier de preuves | Décision demandée, recommandation, périmètre, preuves numérotées, résultats, exceptions, risque résiduel, conditions, date de revue, retrait | Tous |
| Compte rendu de décision | Point de passage et date, décideurs, décision, motif, conditions, risque accepté, prochaine revue, version archivée | G5 |
Le récit de contrôle mérite une précision, car c’est le plus formalisé des six modèles. Il s’écrit sous une forme fixe : en tant que tel rôle, je peux telle action afin d’obtenir tel résultat ; étant donné telle situation, quand telle condition survient, alors tel comportement est attendu ; et lorsque la condition d’échec apparaît, l’action est refusée, renvoyée ou reprise. Cette forme rend l’exigence directement testable par un évaluateur, binaire, statistique ou humain calibré.
Chaque affirmation de ce guide est qualifiée par l’un des quatre statuts ci-dessous, afin que le lecteur sache sur quel fondement elle repose et ce qu’il peut légitimement contester. Cette convention se lit une fois et s’applique ensuite à chaque tableau de la page.
Énoncé appuyé sur un règlement, une position d’autorité de supervision ou un standard cité. Sa portée doit être vérifiée à la date de la décision, car le calendrier européen et les positions sectorielles évoluent pendant la durée d’un pilote.
Recommandation de conception ou de gouvernance issue du travail d’analyse. Elle engage l’auteur et se discute au regard de votre organisation, de votre appétence au risque et de vos validations internes.
Point de passage, taxonomie, matrice, cadence ou formule. Le calendrier des treize semaines, les six points de décision et les six paliers d’autonomie relèvent tous de cette catégorie.
Hypothèse à calibrer sur les données, les politiques et les capacités de votre établissement. Elle est écrite pour être remplacée par une mesure locale dès que celle-ci existe.
La qualification juridique, l’application des politiques internes et la validation indépendante restent du ressort de vos fonctions compétentes. Ce guide organise la production de preuves et la cadence des décisions qui s’appuient sur elles.
Ces textes se relisent à la date de chaque décision : le calendrier de mise en œuvre européen et les positions sectorielles évoluent pendant la durée d’un pilote. Les autres documents éclairent la méthode et la comparaison, sans avoir valeur d’autorité.
Les neuf repères ci-dessous relèvent de la méthode proposée ou d’hypothèses locales. Ils doivent être adaptés aux données et aux capacités de l’établissement ; aucun ne constitue un résultat mesuré en production.
| Nombre | Nature | Règle d’usage |
|---|---|---|
| 90 jours, semaines S0 à S13 | MÉT | Cadence de pilotage, à décaler si la capacité de contrôle est indisponible |
| Points de passage G0 à G5 | MÉT | Points de décision proposés, à aligner sur la gouvernance existante |
| Paliers d’autonomie A0 à A5 | MÉT | Taxonomie appliquée action par action, non au dispositif entier |
| Classement de risque initial du cas | MÉT | Préqualification illustrative, validation locale obligatoire |
| 50 dossiers de départ | HYP | Amorçage de l’ensemble de référence versionné, présenté comme un début et non une suffisance |
| Composition 30 / 10 / 5 / 5 | HYP | Répartition illustrative du jeu initial entre cas simples, complexes et limites |
| 0 action interdite, 0 fuite | HYP | Seuil dur proposé, à adopter formellement par les responsables |
| 200 requêtes par dossier | HYP | Exemple de limite technique, à recalibrer sur la charge réelle |
| 1 brouillon par événement | HYP | Exemple de limite d’effet, à ajuster selon la politique de relance |
Le product manager prouve le résultat, le product owner rend le contrôle testable, le directeur produit garantit la capacité de décider et d’exploiter. Treize semaines, six points de passage fondés sur des éléments vérifiables, six modèles réutilisables et trois issues assorties d’une date de revue.
Consulter la bibliographie complète du corpus : 222 références, chacune avec sa nature de preuve →
Contenu sous licence Creative Commons BY-ND 4.0 : partagez-le librement, tel quel, en citant la source.
Les PDF du playbook complet et de son briefing ont été actualisés le 25 septembre 2026 pour reprendre les corrections éditoriales qui les concernent. La licence CC BY-ND permet de partager les documents originaux avec attribution ; diffuser une version modifiée exige une autorisation distincte.
Pour appliquer cette méthode à un premier cas dans votre organisation : Mounir Fassouane sur LinkedIn.