Ce qu'une garantie de contrôle humain doit préciser, et que le nom du signataire laisse indéterminé
Un accord conclu entre l’État de l’Utah et la société Doctronic autorise un système d’intelligence artificielle à renouveler des ordonnances, et résume sa garantie en une ligne : un médecin autorisé signe. Le même accord décrit pourtant trois organisations du contrôle très différentes, une revue préalable exhaustive, une revue rétrospective exhaustive, puis un échantillonnage mensuel, sans que le nom attaché à l’ordonnance change jamais.
La thèse tient en une phrase. Attribuer une décision à un signataire ne renseigne pas sur l’organisation de son contrôle. Une garantie de contrôle humain ne devient exploitable, en contrat comme en audit, que si elle précise la temporalité de l’intervention, sa couverture et la capacité d’action de l’examinateur, complétées par la qualité de l’examen et par des finalités mesurables.
Le 6 janvier 2026, le Utah Department of Commerce a rendu public un accord de mitigation réglementaire avec Doctronic. Son périmètre est borné : renouvellements de 30, 60 ou 90 jours de traitements déjà prescrits, en pathologie chronique et en santé mentale, dans une liste de médicaments approuvée, à l’exclusion des substances contrôlées, de toute prescription nouvelle et de toute modification du plan de traitement.
La page publique du programme formule la garantie ainsi : le renouvellement est signé et approuvé par un médecin, « either directly or vicariously through the AI system’s protocol ». Le contrat est plus précis que la formule. Il enchaîne trois régimes de revue. D’abord, chaque décision est examinée par un médecin avant sa transmission à la pharmacie. Ensuite, chaque décision est encore examinée, mais après coup. Enfin, la revue porte sur un échantillon mensuel de 5 à 10 % des renouvellements, adossé à une analyse trimestrielle des cas escaladés et à une revue annuelle des indicateurs.
Deux réserves de statut encadrent la lecture. Les seuils de progression d’un régime à l’autre, initialement exprimés en nombre de patients, ont été amendés depuis, la page officielle raisonnant désormais par groupe de médicaments : l’analyse porte sur l’architecture de revue, pas sur les seuils applicables aujourd’hui. Et au 15 septembre 2026, aucune source publique consultée n’établit qu’une transition de régime ait eu lieu. Ce sont des régimes prévus, pas des pratiques constatées.
Du premier au deuxième régime, la couverture reste totale et seul le moment change : la revue passe d’avant la délivrance à après. Pour le dossier examiné, elle cesse d’être une barrière et devient un constat. Du deuxième au troisième régime, deux variables basculent ensemble. La couverture tombe de la totalité à un échantillon, et la cadence programmée devient mensuelle, ce qui retarde la détection par rapport à une revue conduite peu après l’émission, sauf si un autre canal intervient avant.
Ces autres canaux existent et subsistent dans les trois régimes. Le pharmacien peut saisir un médecin, le patient peut demander une revue à tout moment, et le système escalade automatiquement les cas dont la complexité dépasse des seuils prédéfinis. Le taux de 5 à 10 % décrit donc une modalité de revue programmée, pas l’ensemble de l’intervention humaine. Le lire exige son dénominateur, et additionner les canaux exige de ne pas compter deux fois la même décision.
Pendant ce temps, un seul terme reste fixe : le nom du médecin sur l’ordonnance. Que les obligations et la responsabilité attachées à ce nom soient identiques d’un régime à l’autre est une question distincte, que l’accord ne tranche pas. D’où la proposition centrale : deux dispositifs peuvent partager la même attribution, et même la même couverture de revue, sans offrir la même capacité de prévention. L’imputation d’une décision et l’organisation de son contrôle sont deux objets, et le premier ne dit rien du second. C’est le symétrique du problème décrit dans L’agent qui décide n’a pas de signataire : là, une décision cherchait son signataire ; ici, un signataire ne dit pas comment la décision a été examinée.
Dire qu’un dispositif comporte ou ne comporte pas de contrôle humain revient à appliquer un vocabulaire binaire à un objet qui ne l’est pas. Décrire l’organisation d’un contrôle demande au minimum trois dimensions, auxquelles s’ajoutent deux caractéristiques qu’elles ne capturent pas.
| Élément | Ce qui doit être déclaré | Question à laquelle il répond |
|---|---|---|
| Temporalité | position de l’intervention par rapport à l’exposition de la personne, délais associés | le contrôle peut-il encore empêcher l’effet ? |
| Couverture | décisions examinées, mode de sélection de l’échantillon, canaux complémentaires | sur quelle part des décisions porte-t-il, et selon quelle règle ? |
| Capacité d’action | autorité pour imposer une correction, moyens techniques, exécution et vérification de la correction | une erreur détectée est-elle effectivement corrigée ? |
| Qualité de l’examen | compétence, information disponible, capacité effective de détection, indépendance du jugement | que détecte réellement l’examinateur ? |
| Finalités et mesure | objectifs poursuivis, indicateurs de leur atteinte | que protège-t-on, et comment le sait-on ? |
La qualité de l’examen n’est pas séparable des trois dimensions : un temps d’examen contraint en réduit la profondeur, une couverture élevée en alourdit la charge. Elle ne s’en déduit pas pour autant, puisque deux dispositifs identiques en temporalité, en couverture et en moyens d’action peuvent détecter des proportions d’erreurs très différentes. C’est le terrain de Le contrôle humain n’est pas une présence, qui traite la sensibilité du contrôle comme une grandeur à mesurer, et de Le contrôle humain n’est pas extérieur au système, qui montre que cette capacité se déprécie avec l’usage. Le même pilote avait d’ailleurs servi, dans Hors doctrine, avant doctrine, à décrire une supervision techniquement présente et substantiellement absente, le clinicien validant une sortie dont la genèse ne lui est plus lisible. Ce texte-là traitait ce que l’examinateur peut voir ; celui-ci traite où, quand et sur quoi on l’a placé.
Cette grille constitue un plancher de spécification, pas une caractérisation complète de la garantie. Elle exige déjà davantage qu’un nom. Son domaine de validité est explicite : elle porte sur ce qu’une attribution permet d’établir, non sur la sécurité du pilote de l’Utah. Elle ne disqualifie pas davantage la supervision par échantillonnage. Une surveillance par exceptions dotée d’une capacité d’arrêt peut être substantielle, et un contrôle substantiel n’exige pas une revue universelle.
Le principe n’a rien de neuf. La comptabilité publique française sépare le contrôle financier a priori du contrôle a posteriori. L’audit interne distingue contrôles préventifs et contrôles détectifs. Les marchés financiers opposent la conformité pre-trade à la conformité post-trade, précisément parce qu’un même taux de couverture ne protège pas de la même manière de part et d’autre de l’exécution. Sur le pilote lui-même, Michelle M. Mello a déjà nommé le passage d’une revue antérieure à l’action à une revue rétrospective, et relevé l’absence d’évaluation indépendante prévue après déploiement (JAMA Health Forum, 19 mars 2026).
La médecine connaissait aussi des dispositifs dans lesquels un professionnel répond d’actes qu’il n’examine pas un à un, l’ordonnance permanente ou le protocole de coopération. Le délégataire y demeure un professionnel qui peut refuser, et son appréciation constitue elle-même un examen. Ce que l’automatisation élargit n’est donc pas la possibilité de placer l’intervention humaine à un point ou à un autre du circuit, qui relevait déjà d’un choix d’organisation. C’est la possibilité de déplacer ce point, ou de supprimer des interventions individuelles, sans que le circuit y oppose de résistance. L’organisation humaine rendait le point de contrôle coûteux à déplacer ; le logiciel le rend paramétrable. Le mécanisme rejoint celui de La friction était la garantie.
L’objection la plus sérieuse est clinique. Ce qui compte n’est pas le nombre de dossiers qu’un médecin relit, mais le solde : erreurs évitées ou introduites, qualité de l’orientation, interruptions de traitement épargnées, charge reportée sur les pharmaciens et les patients. Un nombre de dossiers examinés est une mesure de processus, pas une mesure de bénéfice clinique.
L’objection est juste, et elle réduit la portée de l’argument. Elle ne rend pas le solde souverain pour autant : un bénéfice net moyen favorable peut recouvrir un préjudice concentré sur un sous-groupe, ou une dégradation de l’accès au recours.
Le débat se clarifie dès que l’on sépare trois opérations : spécifier le contrôle prévu, mesurer son exécution réelle, évaluer ses conséquences. La grille ci-dessus sert les deux premières. Elle ne rend pas la garantie clinique évaluable avant toute donnée, et un délai déclaré par contrat n’établit pas un délai observé. À l’inverse, on peut mesurer des pratiques, des délais et des erreurs sans spécification préalable ; il manque alors une référence déclarée pour juger si la pratique tient la promesse. Une garantie non spécifiée n’est pas fausse : elle est invérifiable. C’est la logique de La preuve est une promesse conditionnelle, transposée à la supervision.
Corriger le dossier examiné et prévenir les erreurs sur les dossiers suivants ne sont pas la même opération. Une revue tardive perd sa capacité d’interception sur le cas qu’elle examine. Elle conserve, et parfois augmente, une autre valeur : limiter des conséquences encore évolutives, détecter une erreur systématique plutôt qu’isolée, déclencher la suspension du dispositif, prévenir les erreurs à venir. Un échantillonnage mensuel ne constitue pas une barrière préalable pour l’ensemble des décisions ; il peut être un bon instrument de surveillance du système.
Deux populations bénéficient ainsi d’une protection par des mécanismes différents, le patient dont le dossier est relu et les patients qui suivent, tandis que le dispositif est l’objet surveillé. Une même organisation du contrôle peut servir plusieurs de ces finalités à la fois. Une spécification utile ne choisit pas entre elles : elle déclare lesquelles elle poursuit et comment leur atteinte est mesurée. La capacité de suspension, en particulier, ne vaut que si elle est éprouvée, car on ne gouverne que ce dont on peut encore modifier la trajectoire.
L’article 14 du règlement (UE) 2024/1689 impose que les systèmes d’IA à haut risque puissent être effectivement supervisés par des personnes physiques pendant leur période d’utilisation. Son paragraphe 3 exige des mesures de supervision proportionnées aux risques, au degré d’autonomie et au contexte d’usage. Son paragraphe 4 énumère des capacités : comprendre le système et en surveiller le fonctionnement, rester conscient du biais d’automatisation, interpréter sa sortie, décider de ne pas l’utiliser, écarter, annuler ou inverser son résultat, et enfin intervenir ou interrompre le système par un bouton d’arrêt ou une procédure équivalente qui l’amène à s’arrêter en état sûr. Ce dernier point est la version réglementaire de la capacité de suspension discutée plus haut : le texte l’exige comme possibilité, il ne dit pas qui l’actionne ni sur quel signal.
L’absence de taux universel n’est pas une absence d’exigence opérationnelle. Elle renvoie la spécification au fournisseur et au déployeur, en fonction du risque et du contexte. Le paragraphe 5 montre, par contraste, ce qu’est une prescription complète : pour les systèmes d’identification biométrique à distance visés au point 1 a) de l’annexe III, le déployeur ne peut agir ni décider sur la base d’une identification qui n’a pas été vérifiée et confirmée séparément par au moins deux personnes physiques disposant des compétences, de la formation et de l’autorité nécessaires. Le moment, la couverture, la redondance et même la qualification de l’examinateur y sont fixés, avec une exception lorsque le droit de l’Union ou le droit national juge cette double vérification disproportionnée dans certains usages répressifs, migratoires, frontaliers ou d’asile.
Partout ailleurs, la traduction de l’obligation générale en modalités vérifiables incombe au fournisseur et au déployeur. La grille proposée en fournit une traduction partielle, centrée sur l’organisation de l’intervention, et n’épuise pas le règlement. Précision de calendrier : le règlement (UE) 2026/1744 dit « Digital Omnibus on AI », entré en vigueur le 27 juillet 2026, ne réécrit pas l’article 14. Il reporte l’application des exigences relatives aux systèmes à haut risque au 2 décembre 2027 pour ceux de l’annexe III et au 2 août 2028 pour ceux de l’annexe I, et ouvre, par un nouvel article 2, paragraphe 13, la possibilité de limiter certaines exigences des articles 9 à 15 et 17 à 25 pour les systèmes relevant de la législation d’harmonisation de l’annexe I, section A, lorsque celle-ci assure une protection équivalente ou supérieure et sans réduction du niveau global de protection. Cette limitation suppose des actes délégués, que la Commission doit adopter au plus tard le 2 août 2027 ; l’article 14 reste d’ici là intégralement applicable à ces systèmes, à compter de leur date d’application.
Une clause, une attestation ou une réponse à appel d’offres qui promet un contrôle humain devient exploitable lorsqu’elle déclare sa temporalité, sa couverture, sa capacité d’action, les conditions de qualité de l’examen et ses finalités, au lieu de se contenter d’un responsable désigné. À défaut, la promesse ne permet pas d’apprécier une capacité préventive. Un audit pourra toujours en constater l’insuffisance, rechercher les pratiques effectives, examiner d’autres dimensions ; il travaillera sans point de comparaison déclaré. Désigner un responsable règle l’imputation, pas le contrôle, et déléguer n’est pas se décharger.
Le dossier n’autorise qu’une règle générale, et elle est conditionnelle : plus les conséquences d’une erreur sont irréversibles, plus la prévention avant exposition devient déterminante, et moins une surveillance rétrospective peut en tenir lieu.
Le dossier documente ce qu’un contrat prévoit et ce qu’un opérateur déclare. Il ne documente ni l’exécution réelle, ni ce que vérifient les autorités de contrôle, ni ce que sanctionnent les juridictions. La capacité d’action y est posée comme dimension, pas mesurée : l’établir exigerait les délais réels de transmission, de délivrance et de première prise, l’autorité effective de l’examinateur, ses moyens et la vérification des corrections décidées, dont aucun ne figure dans les sources consultées. L’accord initial liste enfin ses indicateurs de performance, concordance entre médecin et système, taux d’approbation, taux d’escalade par le patient et par le pharmacien, sans leur associer de seuil chiffré. C’est une observation sur ce document dans sa version initiale, non une conclusion sur le protocole ni sur les critères en vigueur.
Onze des quatorze membres du Utah Medical Licensing Board ont demandé la suspension du pilote, en invoquant la réévaluation clinique, le risque d’interactions et l’absence de consultation préalable du conseil. La réponse de l’État, datée du 21 avril 2026, explicite les régimes de revue et le taux du premier d’entre eux. Temporalité et couverture étaient donc disponibles dès que la garantie a été discutée. C’est le nom du signataire qui ne les porte pas : l’horodatage d’une signature n’établit pas, à lui seul, quand ni comment le dossier a été examiné.
Non. La signature établit une imputation. Elle ne dit pas si la revue intervient avant ou après l’exposition du patient, quelle part des décisions est examinée, ni si l’examinateur dispose de l’autorité et des moyens d’imposer puis de vérifier une correction.
L’article 14 ne fixe aucun taux de revue, à l’exception de la double vérification de l’identification biométrique à distance. Il exige des mesures proportionnées aux risques, au degré d’autonomie et au contexte. Un échantillonnage peut y répondre s’il est spécifié, doté d’une capacité d’arrêt et complété par des canaux d’escalade ; il ne constitue pas pour autant une barrière préalable pour chaque décision.
La revue ex ante peut intercepter une erreur avant qu’elle n’atteigne la personne. La revue ex post ne le peut plus pour le cas examiné, mais elle peut limiter des conséquences en cours, révéler une erreur systématique et déclencher la suspension du système.
Au minimum : la temporalité de l’intervention et ses délais, la couverture et le mode de sélection des décisions examinées, l’autorité et les moyens de correction, les conditions de qualité de l’examen, les finalités poursuivies et les indicateurs de leur atteinte.
Notes doctrinales et explorations sur l’IA en systèmes régulés. Une à deux fois par mois. Désabonnement en un clic.