Le sur-blocage silencieux : quand un garde-fou d'IA échoue dans les deux sens sans qu'on le voie
Un garde-fou d'IA peut sur-bloquer le contenu sain sans qu'on le voie, faute de le confronter à une vérité terrain humaine. La sur-prudence, invisible, coûte plus qu'elle ne protège.
Un garde-fou qui bloque beaucoup paraît sûr
Un système de sécurité peut dériver vers la sur-prudence lorsque ses deux erreurs n’ont pas la même visibilité et que son pilotage ne suit que les incidents.
Laisser passer un contenu nocif — un faux négatif — peut produire un événement : un incident, une plainte, parfois un article de presse. On peut alors remonter à la décision.
Bloquer à tort un contenu sain — un faux positif — produit au contraire une absence. La décision elle-même est journalisée, et l’on peut toujours relire a posteriori le contenu bloqué pour juger s’il l’a été à tort.
Mais ce qui aurait eu lieu si on l’avait autorisé — l’utilisateur aidé, ou au contraire lésé — ne se produit jamais et reste, lui, hors de portée. Le faux négatif peut laisser une trace directe ; le faux positif n’efface pas la décision, mais son effet réel sur l’utilisateur demeure contrefactuel. C’est cet effet manquant, non la décision, qui reste difficile à peser.
Ce n’est pas une intuition, c’est un problème formalisé. Lakkaraju, Kleinberg, Leskovec, Ludwig et Mullainathan l’ont décrit en 2017 sous le nom de "selective labels" : lorsque la décision détermine elle-même quels résultats deviennent observables, on ne dispose jamais de l’information correspondant aux options que l’on n’a pas retenues.
L’exemple canonique est judiciaire : on n’observe si un prévenu se présente à son procès que si le juge l’a libéré ; les décisions de maintien en détention n’ont, par construction, pas de résultat observable. Un garde-fou qui bloque est, pour cet effet aval, dans la même position que ce juge : il pourra toujours faire réexaminer sa décision, mais jamais observer ce qu’aurait produit ce qu’il a empêché. L’analogie ne porte donc pas sur la classification — celle-ci reste auditable — mais sur la conséquence, qui, elle, demeure contrefactuelle.
Le tableau de bord risque alors d’être structurellement incomplet. Une équipe qui durcit son filtre peut voir ses incidents déclarés chuter — c’est visible, chiffré, valorisant — sans disposer d’une mesure équivalente des interactions légitimes qu’elle a empêchées. Le NIST, dans son rapport de mars 2026 sur le suivi des systèmes d’IA déployés, relève parmi les difficultés signalées par les praticiens la loi de Goodhart — lorsqu’une régularité statistique devient une cible de contrôle, elle peut cesser d’être informative — et le streetlight effect, la tendance à chercher là où les données sont disponibles. Si l’organisation ne suit que les incidents, elle risque donc de suivre ce qui est éclairé et de laisser l’utilité perdue hors de ses métriques — non par choix de l’ignorer, mais parce que sa structure d’information ne la capture pas.
En modération de contenu, l’asymétrie est comparable sans être identique. Un retrait peut être constaté par son auteur et contesté ; en revanche, l’absence d’un contenu pour les personnes qui auraient dû y avoir accès est plus difficile à observer.
Le risque de sur-blocage existe donc, mais il ne produit pas mécaniquement un cliquet à sens unique : des recours, des audits, des signaux d’usage ou des contraintes réglementaires peuvent aussi pousser à desserrer le seuil. Le problème apparaît lorsque ces contre-signaux ne sont ni recueillis ni intégrés au pilotage. Chaque tour de vis peut alors aggraver le problème de mesure, puisque plus on bloque, moins on observe ce qui se serait produit si l’on avait laissé faire.
Une précision s’impose, car elle sépare la prudence légitime de la dérive. Un seuil très conservateur est parfaitement rationnel quand le coût réel d’un faux négatif est énorme : aéronautique, sûreté nucléaire, certains dispositifs médicaux. La dérive n’apparaît que lorsque l’asymétrie des seuils n’est plus commandée par l’asymétrie réelle des dommages, mais par l’asymétrie de leur visibilité.
Autrement dit : l’organisation finit par optimiser ce qu’elle voit plutôt que l’ensemble des coûts qu’elle produit — non par malveillance, mais par structure de l’information dont elle dispose.
Le piège du faux étalon
J’ai rencontré ce mécanisme non pas en théorie, mais en construisant un dispositif d’orientation destiné à des adolescents. Précisons-le d’emblée, car le sujet est sensible : le dispositif protège effectivement ses utilisateurs, et ce qui suit ne décrit pas une faille de protection, mais un problème de calibrage. La question n’est pas s’il faut un garde-fou — il en faut un — mais comment on établit qu’il est bien réglé.
Le dispositif comporte une "seconde opinion" : un modèle de langage relit chaque contenu généré et le bloque s’il le juge psychologiquement pressurisant pour un adolescent. Un garde-fou en apparence irréprochable.
Nous avons d’abord voulu remplacer le modèle qui l’assurait — un modèle propriétaire répandu — par des modèles plus récents et moins coûteux. Tous ont paru échouer : ils laissaient passer des contenus que le modèle en place bloquait. La conclusion évidente s’imposait — le modèle historique était irremplaçable, les autres moins sûrs — et elle nous aurait coûté cher, en argent comme en sécurité mal placée.
Cette conclusion était fausse, et elle l’était pour une raison qui devrait alerter quiconque évalue un système de sécurité. Nous mesurions les candidats à l’aune des décisions du modèle en place, comme si celles-ci constituaient la vérité. Nous avions promu les verdicts d’un modèle au rang d’étalon, sans jamais vérifier que cet étalon avait raison.
C’est l’un des risques documentés du LLM-as-a-judge. Dans une étude de Chen et Goldfarb-Tarrant publiée à ACL 2025, un préambule d’excuse ajouté à l’une de deux sorties autrement identiques a, dans un test de détection d’égalité, fait préférer cette sortie à certains juges jusqu’à 98 % du temps. Ce n’est pas un taux d’erreur général en situation réelle ; c’est la démonstration, dans ce protocole précis, qu’un artefact de forme peut dominer le verdict. Surtout, l’accord d’un juge avec l’humain n’en garantit pas la robustesse : il peut concorder pour de mauvaises raisons et diverger dès que change la forme des contenus.
Mesurer un modèle à l’aune d’un autre, c’est donc risquer de prendre pour un étalon un instrument dont on ignore le biais. Lecture faite des contenus concernés, le constat s’est inversé : dans la plupart des cas, c’était le modèle historique qui se trompait en bloquant, et les modèles "défaillants" qui avaient raison de laisser passer. On ne comparait pas des modèles à la réalité ; on comparait des modèles à un autre modèle, dans le noir.
Le sur-blocage, une fois chiffré
Reste à mesurer l’ampleur du phénomène, ce qui suppose de sortir de la circularité : construire un jeu de test dont les étiquettes ne proviennent pas d’un modèle, mais d’un jugement humain compétent. En l’occurrence un clinicien, distinguant les contenus réellement pressurisants pour un adolescent de ceux qui explorent une difficulté pour l’aider.
Cette distinction doit être explicitée dans une grille d’évaluation : la littérature sur les juges de sécurité montre que des indices de surface peuvent perturber leur verdict, mais elle ne permet pas d’inférer, sans analyse d’erreurs, le mécanisme précis de notre filtre. On mesure alors les deux erreurs, pas seulement celle qui fait du bruit : les faux positifs (sain bloqué) autant que les faux négatifs (nocif laissé passer).
Confronté à ce premier jugement clinique, le garde-fou historique révélait un taux de faux positifs élevé sur l’échantillon exploratoire examiné : plus d’un blocage sur deux y était jugé injustifié, confondant "explorer une tension pour aider" avec "exercer une pression". Cet audit interne n’est pas une étude publiée : sans taille d’échantillon, protocole complet d’annotation, évaluation indépendante ni intervalle d’incertitude, il ne permet aucune extrapolation à d’autres garde-fous. Sa valeur est illustrative : il a rendu visible, dans ce dispositif, une sur-prudence qui serait restée hors des métriques si les contenus bloqués n’avaient pass été relus.
Le coût n’est pas qu’abstrait. Dans notre pipeline, chaque faux positif déclenche une régénération du contenu, ajoute de la latence, consomme des ressources, et sert potentiellement à l’utilisateur une version édulcorée de ce qui lui aurait été utile — un coût de sobriété autant que d’efficacité.
D’autres architectures réagissent autrement : refus, escalade humaine ou filtrage local. Le garde-fou s’est en outre révélé non déterministe : soumis deux fois au même contenu, il ne rendait pas toujours le même verdict. Non pas que toute variabilité soit à proscrire — une part de stochasticité peut même être voulue ; le problème est une variance non caractérisée, un verdict qui change sans qu’on sache ni pourquoi ni dans quelles bornes.
Dans une tâche comparative de sécurité à température nulle, Chen et Goldfarb-Tarrant ont observé pour certains juges 3,1 % à 5,7 % de changements au niveau des décisions individuelles entre deux exécutions, tandis que les scores agrégés variaient peu. Le NIST en fait l’une des raisons qui rendent le suivi post-déploiement indispensable : une évaluation unique en environnement contrôlé est insuffisante pour établir la constance en conditions réelles.
Ni le meilleur modèle, ni le moins cher : le prompt
La tentation, à ce stade, est de trancher entre deux réflexes opposés. Le premier : prendre le modèle le plus puissant, réputé le plus sûr. Le second, inverse : prendre le moins cher, puisque les écarts se paient. Dans notre cas, ces deux questions masquaient un levier important : le prompt, c’est-à-dire l’instruction donnée au garde-fou.
En reformulant cette instruction pour qu’elle distingue explicitement "explorer une tension afin d’aider" d’"exercer une pression", le comportement du garde-fou a changé. Le modèle le moins coûteux, celui-là même qui "échouait" au départ, s’alignait alors nettement mieux sur le premier jugement clinique — et à un coût inférieur au point de départ. Cela n’établit ni une supériorité générale de ce modèle, ni que le prompt est toujours le levier déterminant. Tant que le jeu qui sert à corriger le prompt n’est pas rigoureusement séparé de celui qui sert à le noter, un score élevé mesure aussi l’ajustement au test. Le cas montre seulement qu’ici, le débat sur le modèle et son prix masquait une question de consigne.
Cette conclusion prolonge, en la déplaçant, une idée que je défendais dans une précédente chronique : le progrès n’est pas d’utiliser toujours le modèle le plus puissant, mais de savoir lequel suffit. Le cas du garde-fou va un cran plus loin. Il ne s’agissait pas seulement de constater que le modèle le plus puissant était superflu ; c’est que le débat sur le modèle masquait la vraie question. On cherchait le bon moteur quand il fallait corriger la direction.
On ne mesure pas un garde-fou sans vérité terrain humaine
De ce cas se dégage une règle plus limitée que celle d’un principe universel : lorsqu’un garde-fou doit juger un construit contextuel et difficilement spécifiable — ici le caractère "pressurisant" d’un contenu pour un adolescent — son évaluation ne peut pas reposer uniquement sur l’accord entre modèles. Certaines autres propriétés de sécurité peuvent être testées par des règles explicites, des tests de conformité, de vulnérabilité ou des méthodes formelles. Mais aucun panel de modèles, aucune règle de consensus ni aucune statistique de fiabilité ne remplace la validation humaine du construit qu’il prétend mesurer.
Encore faut-il ne pas identifier cette vérité terrain à l’avis d’un seul expert. Sur un jugement aussi contextuel, le désaccord entre cliniciens est possible ; un évaluateur unique ne fournit qu’un jugement expert, non un étalon. Le standard suppose une grille pré-définie, plusieurs annotateurs indépendants et une mesure de leur accord — faute de quoi l’on remplace le biais d’un modèle par celui d’un homme. Le cas décrit ici en est un premier pas, pas un aboutissement.
Concrètement, casser la boucle suppose de rendre le faux positif presque aussi mesurable que le faux négatif : évaluer systématiquement les deux taux d’erreur, auditer un échantillon — non l’exhaustif, ce qui serait ingérable à grande échelle — de décisions bloquées, tester le déterminisme en soumettant plusieurs fois les mêmes contenus, et suivre une métrique d’utilité perdue — pas seulement un compteur d’incidents évités. Ces mesures sont les miennes, non celles du NIST ; mais elles prolongent son constat, lui documenté : le suivi post-déploiement, tourné vers les conséquences inattendues en conditions réelles, est nécessaire là où l’évaluation initiale ne donne qu’une vue partielle. Ce même rapport range d’ailleurs l’absence de jeux de données de vérité terrain de qualité parmi les obstacles reconnus du suivi post-déploiement, ces étiquettes étant souvent tardives, coûteuses ou indisponibles.
L’expérience européenne de la modération offre ici une analogie éclairante — une analogie, non un équivalent de notre cas. Le Digital Services Act a rendu contestables les décisions de modération, et les chiffres publiés par la Commission sont révélateurs : depuis 2024, plus de 165 millions de décisions des très grandes plateformes ont été contestées via leurs mécanismes internes, avec une inversion dans près de 30 % des cas ; et au premier semestre 2025, les organes de règlement extrajudiciaire ont examiné plus de 1 800 litiges relatifs à Facebook, Instagram et TikTok, inversant la décision de la plateforme dans 52 % des affaires closes. Ces inversions ne prouvent pas un sur-blocage : parmi les décisions contestées figurent aussi bien des blocages jugés abusifs que des contenus laissés en ligne que l’on demande de retirer, et une part des révisions peut tenir à un changement de politique ou à des éléments nouveaux plutôt qu’à une erreur initiale. Elles ne fournissent donc pas un taux de faux positifs, les appelants constituant de surcroît une population sélectionnée. Ce qu’elles établissent est plus modeste : un désaccord devient traçable et mesurable lorsqu’une décision dispose d’un mécanisme de contestation. Le droit d’appel n’est pas seulement un droit individuel ; il est aussi une source de données sur la validité contestée des décisions. Les décisions des organes extrajudiciaires ne sont toutefois pas contraignantes.
C’est finalement la leçon de ce garde-fou clinique. Une IA responsable ne consiste pas seulement à bloquer ce qui peut nuire ; elle consiste à se donner les moyens de savoir quand elle bloque à tort. Sans vérité terrain humaine, un dispositif de sécurité peut paraître d’autant plus sûr qu’il devient moins utile — et personne, dans les chiffres, ne verra la différence.
Sources
Lakkaraju, H., Kleinberg, J., Leskovec, J., Ludwig, J. & Mullainathan, S. The Selective Labels Problem: Evaluating Algorithmic Predictions in the Presence of Unobservables. KDD, 2017. DOI: 10.1145/3097983.3098066.
Rao, A. et al. Challenges to the Monitoring of Deployed AI Systems. NIST AI 800-4, mars 2026. DOI: 10.6028/NIST.AI.800-4.
Commission européenne. The impact of the Digital Services Act on digital platforms, mise à jour 2026 ; règlement (UE) 2022/2065, articles 20 et 21.
Chen, H. & Goldfarb-Tarrant, S. Safer or Luckier? LLMs as Safety Evaluators Are Not Robust to Artifacts. ACL 2025, pp. 19750–19766. DOI: 10.18653/v1/2025.acl-long.970.
Eiras, F., Zemour, E., Lin, E. & Mugunthan, V. Know Thy Judge: On the Robustness Meta-Evaluation of LLM Safety Judges. ICBINB Workshop at ICLR, 2025. arXiv:2503.04474.
Verga, P. et al. Replacing Judges with Juries: Evaluating LLM Generations with a Panel of Diverse Models. 2024. arXiv:2404.18796.