Vos données ne décrivent pas le monde, mais le filtre qui les a produites
Des données exactes peuvent tromper lorsqu'elles ne décrivent que les cas ayant franchi un filtre. Le marché de l'art montre pourquoi ce biais de sélection concerne tous les modèles d'IA.
Une base de données peut être exacte, bien structurée et parfaitement trompeuse. Non parce que ses lignes seraient fausses, mais parce qu’elles ne contiennent que les cas qui ont franchi un filtre invisible.
En 1943, Abraham Wald travaille sur les dommages observés sur des avions revenus de mission. Les impacts visibles ne signalent pas nécessairement leurs parties les plus vulnérables. Ils montrent les endroits où un appareil pouvait être touché et rentrer malgré tout. Les zones épargnées sur les survivants pouvaient au contraire correspondre à celles où un impact empêchait le retour. La donnée manquante — les avions perdus — portait une partie essentielle de la réponse.
La donnée disponible arrive après une sélection
Prenons le marché de l’art. Pour l’analyser, la source la plus accessible est souvent une base de résultats d’enchères : publique, structurée et historisée. Mais l’objet qui y apparaît a déjà franchi plusieurs étapes. Il a été proposé, éventuellement accepté, catalogué puis présenté à la vente. Certaines bases recensent aussi des invendus, mais toutes décrivent une population située après cette sélection.
Entre le 27 mai et le 5 septembre 2026, la plateforme a enregistré 1 902 demandes d’estimation en ligne. Ce corpus ne représente pas tout l’art détenu par les particuliers. Il décrit les objets pour lesquels une personne a choisi de demander une estimation en ligne, avant un éventuel tri professionnel. Ce filtre existe lui aussi, mais ce n’est pas le même.
La différence de distribution est frappante. La borne haute estimée médiane est de 950 euros. La moyenne atteint 128 574 euros, soit 135 fois plus. Dans le même temps, 87,5 % des objets ont une borne haute inférieure à 5 000 euros et 1,5 % dépassent 100 000 euros.
Les records qui structurent le récit public ne sont donc pas faux. Ils éclairent surtout la queue haute de la distribution. L’erreur commence lorsqu’on les utilise comme raccourci pour décrire le cas ordinaire.
Précision du modèle ou couverture du référentiel ?
La même difficulté apparaît avec les noms d’artistes. Parmi les 1 253 demandes comportant un nom, 1 028 artistes distincts sont mentionnés. 880 n’apparaissent qu’une seule fois. Salvador Dalí, le nom le plus fréquent, ne représente que 12 demandes, soit 0,6 % du total.
Un référentiel principalement alimenté par des signatures fréquemment échangées peut être très précis sur les cas qu’il connaît et presque muet sur les autres. Ce n’est pas seulement un problème de performance du modèle. C’est un problème de couverture. Ajouter de la puissance de calcul ou optimiser une métrique ne crée pas les références absentes.
Le démarrage à froid est encore plus net lorsque le nom manque. 649 demandes, soit 34,1 % du corpus, arrivent sans artiste renseigné. Leur borne haute médiane est de 650 euros, contre 1 400 euros lorsqu’un nom est fourni.
Cette différence ne prouve pas que renseigner un nom crée de la valeur. Les deux groupes peuvent différer de bien d’autres manières. Elle montre en revanche une difficulté opérationnelle : sans attribution solide, les comparables sont souvent moins nombreux ou moins défendables, et l’incertitude augmente. Une œuvre anonyme peut encore être rapprochée d’une époque, d’une école ou d’une technique ; la réponse devient simplement plus fragile.
Un modèle apprend aussi le filtre
Un système entraîné uniquement sur des résultats d’enchères n’apprend pas la distribution de tous les objets. Il apprend celle des objets arrivés jusqu’aux enchères. Cette nuance change la question à laquelle son résultat peut répondre.
Le raisonnement vaut bien au-delà de l’art. Un modèle de crédit entraîné sur les seuls dossiers acceptés observe le comportement des emprunteurs que le filtre antérieur a retenus. Une analyse des recrutements achevés ne décrit pas tous les candidats. Les articles publiés ne révèlent pas les textes refusés. Les tickets résolus ne disent pas tout des demandes abandonnées ou contournées.
Dans chaque cas, la donnée peut être propre et le modèle bien évalué, tout en restant aveugle à la population écartée. La question utile n’est donc pas seulement : "mes données sont-elles propres ?" Elle est aussi : "qu’est-ce qui n’a jamais eu l’occasion d’y entrer ?"
Les conséquences deviennent concrètes dès que le résultat oriente une décision : approfondir l’examen d’un objet, organiser un tri successoral ou préparer un inventaire. Le corpus ne mesure pas les erreurs commises dans ces situations. Il montre pourquoi extrapoler à partir d’une population déjà sélectionnée peut produire des erreurs dans les deux sens.
Dire aussi ce que les données ne permettent pas
Ces résultats ont plusieurs limites. Ce sont des estimations indicatives, calculées à partir des informations communiquées, et non des transactions ou des expertises. Le corpus est auto-sélectionné et sous-représente probablement les collections déjà suivies par un professionnel. La nature de l’objet n’est enregistrée de façon fiable que depuis le 4 août 2026, ce qui interdit encore une analyse par médium. Les 104 réponses au questionnaire de satisfaction forment un sous-échantillon trop limité pour valider le moteur. Enfin, l’unité observée est la demande d’estimation : ces données ne constituent ni un recensement de propriétaires ni un inventaire exhaustif d’œuvres uniques.
Les bases d’enchères restent le meilleur instrument pour répondre aux questions portant sur les objets arrivés en vente publique. Le problème n’est pas ce qu’elles mesurent, mais ce qu’on leur demande parfois de représenter. Avant de modéliser le monde, il faut commencer par nommer le filtre qui a fabriqué les données.
Source : Baromètre ArtValue, relevé du 5 septembre 2026 (1 902 estimations).