Ce que 385 vecteurs m'ont appris : les données des PME sont sales, et c'est le vrai frein à l'IA
On débat du modèle d'IA le plus puissant. Pendant ce temps, le vrai goulot d'étranglement des projets d'IA en PME reste tabou : la qualité des données. Retour d'expérience concret, chiffres à l'appui.
Quand j'ai voulu doter mon propre site d'un assistant capable de répondre aux visiteurs à partir de mes contenus (un système de RAG, cette architecture qui fait répondre une IA en s'appuyant sur une base documentaire donnée), j'ai commencé par la partie "intelligente" : le modèle, le moteur de recherche vectorielle, les réglages. La partie qui fait rêver.
La première indexation de mon site a produit 593 vecteurs. En langage courant : le contenu a été découpé en 593 petits morceaux, transformés en représentations numériques que l'IA peut retrouver et citer. Sur le papier, tout fonctionnait. Dans les faits, les réponses étaient médiocres. L'assistant citait des fragments de menu de navigation, renvoyait des bouts de code de mise en page, inventait de la structure. Le modèle n'était pas en cause. Il faisait exactement son travail : il indexait fidèlement ce qu'on lui donnait. Le problème, c'est ce qu'on lui donnait.
Le carburant était frelaté
Mes pages avaient été construites avec un constructeur visuel. Excellent pour concevoir un site ; désastreux comme source pour une IA. Le contenu exporté était truffé de bruit technique : styles CSS en ligne, balises de colonnes et de sections, textes de menu et de pied de page répétés sur chaque page. L'humain ne voit rien de tout cela : son navigateur affiche une page propre. La machine, elle, ingère tout, y compris la tuyauterie.
J'ai donc fait le travail ingrat : nettoyer. Un filtrage par expressions régulières pour retirer le CSS et le balisage de mise en page, isoler le texte qui portait réellement du sens, écarter les répétitions structurelles. Réindexation : 385 vecteurs. Un tiers de moins que la première fois. Le même site, mais réduit à sa part utile. Et la qualité des réponses a bondi. La leçon tient en une phrase : mieux vaut 385 vecteurs propres que 593 vecteurs bruités. En IA, la quantité de données n'est pas une vertu ; la propreté, si.
J'ajoute un piège plus discret, pour les curieux : mon index attendait des vecteurs d'une certaine taille (1 536 dimensions) alors que le modèle en produisait d'une autre (1 024). Une incohérence silencieuse de ce genre ne fait pas planter le système : elle le fait juste répondre à côté, sans message d'erreur. C'est toute la traîtrise de ces projets : ils "marchent" en apparence tout en produisant du faux.
Ce n'est pas mon problème, c'est LE problème des PME
Je pourrais mettre cette expérience sur le compte de ma maladresse. Ce serait me tromper de diagnostic. Car les données des petites et moyennes entreprises ne sont pas absentes : elles sont sales. Exportées d'outils qui n'ont jamais été conçus pour nourrir une IA : constructeurs de sites, PDF scannés de travers, tableurs à cellules fusionnées, fichiers clients où le même nom est orthographié de trois façons, historiques éparpillés dans cinq logiciels qui ne se parlent pas.
Ce constat n'est pas une intuition isolée. Selon l'étude IA et tendances digitales 2026 d'Adobe, menée avec Oxford Economics auprès de 3 000 dirigeants, 78 % des entreprises françaises citent l'intégration et la qualité des données comme principaux freins au passage à l'échelle de l'IA. Et moins de la moitié estiment que la qualité de leurs données est aujourd'hui suffisante pour en tirer parti. Mes 385 vecteurs, c'est cette statistique en miniature : le tiers exploitable d'un ensemble que je croyais prêt.
Renverser le réflexe
Le réflexe dominant "choisissons l'IA la plus puissante" prend le problème à l'envers. Avant le modèle, il y a un travail de préparation des données invisible, ingrat et décisif. "Garbage in, garbage out" n'est pas un slogan de conférence : c'est le quotidien de qui déploie ces systèmes pour de vrai.
La bonne nouvelle pour une PME, c'est que ce travail-là ne réclame ni le plus gros modèle ni le plus gros budget. Il réclame de la rigueur : savoir d'où viennent les données, ce qu'elles valent, et les nettoyer avant de les confier à une machine. Un chantier modeste au regard de ce qu'il débloque.
La question à se poser n'est donc pas "quelle IA choisir ?", mais "mes données sont-elles en état d'être lues par une machine ?". La plupart des dirigeants découvrent, comme moi ce jour-là, que la réponse est : pas encore. Et c'est précisément là que commence le vrai projet.