L'étalon introuvable
Quand les experts divergent, un garde-fou d'IA ne peut reposer sur une vérité unique. Il doit cartographier le désaccord, préserver l'incertitude et adapter sa réponse plutôt que trancher à l'aveugle.
Dans une précédente chronique publiée dans le Journal du Net, je soutenais qu’un garde-fou d’IA ne pouvait être correctement évalué sans vérité terrain humaine ; reste une difficulté plus profonde : que faire lorsque plusieurs humains compétents, placés devant le même cas, ne donnent pas la même réponse ?
Le mythe de l’étalon unique
On aimerait croire qu’il suffit de demander à un clinicien.
Mais sur une notion aussi contextuelle que le caractère "pressurisant" d’un contenu adressé à un adolescent, deux praticiens qualifiés peuvent diverger sans que l’un des deux se trompe nécessairement. Leur jugement dépend du contexte disponible, de leur cadre théorique, de leur lecture de l’ambivalence, mais aussi de ce qu’ils considèrent comme un risque acceptable.
Ce problème dépasse largement la clinique.
Une partie croissante de la recherche en apprentissage automatique remet en question l’idée selon laquelle chaque cas disposerait nécessairement d’une seule réponse humaine correcte, une gold label qu’il suffirait de découvrir. Pour de nombreuses tâches subjectives, le désaccord entre annotateurs n’est pas seulement du bruit à éliminer. Il contient lui-même de l’information.
Prendre un expert unique comme étalon écrase cette information. Prendre simplement la majorité peut faire la même chose : cinq avis différents deviennent artificiellement une seule étiquette.
J’en ai fait l’expérience en construisant le jeu de test de mon propre garde-fou. J’avais classé comme saine une question qui présupposait qu’un résultat imparfait devait remettre en cause une ambition. La divergence entre plusieurs modèles m’a conduit à la relire, puis à la considérer comme potentiellement pressurisante.
Cela ne signifie pas que "la machine avait raison contre le psychiatre". Cela signifie quelque chose de plus intéressant : le cas était suffisamment ambigu pour faire vaciller mon propre jugement.
Un expert peut donc être indispensable sans être infaillible.
Quand le désaccord devient une donnée
La tentation serait alors de remplacer plusieurs experts humains par plusieurs modèles chargés de jouer des rôles différents, de délibérer puis d’agréger leurs réponses. Ces approches peuvent être utiles, mais elles ne résolvent pas le problème fondamental : un consensus entre modèles ne constitue pas en lui-même une vérité terrain humaine.
La question devient donc différente.
Il ne s’agit plus seulement de demander : quelle est la bonne étiquette ? Mais : comment les experts se répartissent-ils lorsqu’ils évaluent exactement le même cas ?
C’est un changement important.
Dans certains cas, le désaccord disparaît dès qu’on apporte une information manquante. Un expert avait compris la situation d’une manière, un autre autrement ; une fois le contexte précisé, leurs jugements convergent. Ce désaccord était un défaut de mesure.
Mais dans d’autres cas, des professionnels disposant des mêmes informations et de la même consigne continuent à diverger. Ce désaccord-là n’est plus une anomalie à éliminer. Il appartient au phénomène que l’on cherche à mesurer.
Ne pas fabriquer artificiellement du consensus
La médecine connaît depuis longtemps ce problème.
Lorsque les preuves empiriques sont insuffisantes, la méthode Delphi permet d’interroger plusieurs experts de manière structurée, souvent anonymement, de leur restituer les arguments du groupe puis de répéter l’évaluation.
Son intérêt ici ne serait pourtant pas de forcer tout le monde à finir par être d’accord.
Il serait précisément de distinguer trois territoires :
• les situations pour lesquelles les experts convergent vers une intervention ;
• celles pour lesquelles ils convergent vers l’absence d’intervention ;
• et celles dans lesquelles leur désaccord persiste malgré une information suffisante.
Cette troisième catégorie est généralement écrasée dans les systèmes classiques d’annotation. On finit par attribuer une étiquette majoritaire et le cas controversé ressemble ensuite, dans la base de données, à un cas parfaitement évident. On a perdu l’information la plus intéressante.
Des travaux sur l’apprentissage à partir du désaccord proposent au contraire de conserver plusieurs jugements humains plutôt que de les réduire systématiquement à un label unique. Le jury learning, notamment, cherche à intégrer directement différentes perspectives dans l’apprentissage du modèle.
Le garde-fou ne chercherait alors plus seulement à reproduire une réponse moyenne. Il apprendrait aussi où les humains hésitent.
Du couperet à la gradation
Cette différence devient concrète au moment où le système doit agir.
Un garde-fou classique est souvent pensé comme un interrupteur : bloquer ou laisser passer. Mais cette architecture devient difficile à défendre lorsque le cas lui-même se trouve dans une zone où les évaluateurs humains divergent.
Entre le refus sec et le laisser-passer intégral, plusieurs comportements sont possibles :
• laisser passer tout en ajoutant un encadrement bref ;
• reformuler la réponse pour retirer seulement l’élément problématique ;
• demander une information contextuelle indispensable ;
• répondre immédiatement de manière sécurisée dans une situation aiguë ;
• ou déclencher une revue humaine lorsque l’enjeu le justifie réellement.
L’idée centrale tient en une phrase : l’incertitude ne devrait pas être automatiquement traduite en danger.
Si tous les cas incertains sont bloqués "par précaution", le système transforme mécaniquement le désaccord humain en sur-blocage. Il donne alors l’impression d’être plus sûr simplement parce qu’il refuse davantage. Or un doute n’est pas une preuve de danger.
Une architecture plus mature devrait être capable de distinguer au moins trois raisons différentes d’intervenir : un consensus humain fort, une contrainte de sécurité explicite, ou une zone d’incertitude dans laquelle le comportement doit être adapté sans prétendre qu’une vérité définitive a été établie.
Tous les désaccords ne se valent pas
Il faut cependant éviter l’excès inverse.
Reconnaître la pluralité des jugements ne signifie pas transformer chaque règle en controverse.
Certains contenus relèvent de contraintes juridiques ou de sécurité beaucoup plus nettes. Une incitation explicite à la violence ne doit évidemment pas devenir une "zone de pluralisme" sous prétexte que l’on pourrait toujours trouver quelqu’un pour contester leur classification.
Le désaccord pertinent est celui qui persiste entre personnes compétentes, informées, confrontées à une question dont l’interprétation comporte réellement une part de jugement.
Cette distinction est essentielle. Sinon, l’incertitude devient à son tour une excuse permettant au système de ne jamais décider.
Une difficulté demeure
Il reste pourtant une objection plus profonde.
Pour qu’un garde-fou adapte son comportement à une zone de désaccord, encore faut-il savoir reconnaître qu’un cas appartient à cette zone. Or cette détection est elle-même une tâche de classification. Si le système peine déjà à décider qu’un contenu est problématique, pourquoi serait-il nécessairement meilleur pour décider que ce même contenu est controversé ? On risque alors de reproduire le problème un étage plus haut.
Il existe une autre difficulté encore : le désaccord mesuré peut être artificiel. Si les évaluateurs reçoivent une phrase isolée alors que son interprétation dépend d’un contexte conversationnel absent, leur divergence ne révèle peut-être pas une véritable ambiguïté clinique. Elle révèle simplement que l’instrument leur a retiré l’information nécessaire pour juger.
Avant de conclure qu’un désaccord est constitutif, il faut donc vérifier qu’il résiste à l’ajout de contexte.
Cette limite ne condamne pas l’approche. Elle en fixe la condition de validité.
Reconnaître la controverse plutôt que la masquer
Le défi n’est finalement pas de construire un garde-fou capable de toujours produire la bonne réponse. Dans certains domaines, cette "bonne réponse" unique n’existe peut-être tout simplement pas.
L’objectif devient alors plus exigeant : savoir distinguer ce qui est clairement acceptable, ce qui est clairement dangereux et ce qui demeure raisonnablement discutable entre personnes compétentes.
Une IA responsable ne devrait pas fabriquer de la certitude là où les humains eux-mêmes n’en ont pas. Elle devrait pouvoir reconnaître qu’elle se trouve dans une zone de désaccord, conserver cette information et modifier son comportement en conséquence.
Car transformer une controverse en verdict automatique ne supprime pas l’incertitude. Cela la rend simplement invisible.
Sources
Gordon et al., Jury Learning: Integrating Dissenting Voices into Machine Learning Models, CHI (2022)