IA de confiance et DSI : les 5 piliers d'un projet viable en production
En réalité, le choix du modèle IA représente moins de 10% de la complexité d'un projet en production. L'enjeu est ailleurs : il est dans l'architecture, la gouvernance et la sécurité.
Après plusieurs dizaines de projets d'IA d’ampleur déployés en production dans le service client de grands comptes, mon constat est sans appel : le modèle Large Language Model (LLM) n’est presque jamais la cause d’un échec. Je vois trop d'organisations courir après le dernier objet technologique, le dernier grand modèle, précipitant des pilotes droit dans le mur.
La vraie question n’est pas de savoir quel modèle choisir (GPT, Gemini, Claude, Mistral, open source…), mais dans quel usage et dans quel contexte il sera utilisé.
En réalité, le choix du modèle IA représente moins de 10% de la complexité d'un projet en production. L'enjeu est ailleurs : il est dans l'architecture, la gouvernance, la sécurité, l’observabilité, l'intégration au SI et le pilotage des coûts. En résumé : c'est la compréhension de l'usage métier et l'engineering qui font la différence entre un POC prometteur et un système fiable en production.
Pour aider les DSI à sortir de cette impasse et à capter de la valeur durable, voici 5 éléments indispensables pour éviter la “pilot fatigue” et délivrer de la valeur avec vos équipes.
1. La connaissance avant le modèle : l’importance de la source de vérité
La première erreur que je rencontre est de commencer par parler technologie. Beaucoup de tests démarrent par la sélection d’un LLM, la connexion avec une pipeline de RAG (Retrieval-Augmented Generation) standard sur une base documentaire vieillissante. C'est l'échec assuré. La plupart des bases documentaires d'entreprise ne sont pas conçues pour l'IA : elles contiennent des doublons, des contenus obsolètes et beaucoup de formats hétérogènes.
L’IA de confiance, c’est d’abord un socle de vérité : la connaissance, fiabilisée, supervisée. Sans cette fondation, aucun modèle ne produira de résultat fiable. La performance d'une IA repose sur un travail conjoint entre l'éditeur et le client. Nous devons travailler selon un principe de convergence : l’IA doit s'adapter, mais le client doit aussi parfois restructurer ses documents pour qu'elle puisse en faire la représentation la plus fiable et pertinente possible.
Ce que le DSI devrait exiger :
- Un audit de maturité de la connaissance avant tout choix technologique.
- Une gouvernance éditoriale active.
- Un traitement des formats complexes (tableaux visuels, logigrammes, captures d'écran).
- Une structuration par cas d'usage, et non un RAG brut sur l'ensemble de la base.
2. L'architecture multi-agents : sortir du prompt unique
Un simple prompt envoyé à un LLM est un prototype, pas une architecture de production. En production, nous déployons une chaîne de traitement complexe, une véritable architecture multi-agents. La réponse générée pour faire avancer une conversation révèle cette chaîne spécialisée : elle commence par l'extraction d'intentions multiples, l'application des guardrails de sécurité, pour passer à la recherche, à la validation des chunks pertinents par un LLM, et enfin à la génération de la réponse avec la tonalité de la marque.
Cette architecture en couches, qui peut exploiter des niveaux d'accès progressifs à la connaissance, est un indicateur direct de maturité technique. Le point clé est que le système n'est pas 100% de l’IA générative. Le mix NLP + règles métier + IA générative est bien plus robuste qu'une approche tout-IA générative. Même si cette dernière peut sembler plus simple à mettre en œuvre, elle montre rapidement ses limites lorsqu’il s’agit de garantir fiabilité, stabilité et maîtrise des résultats dans un environnement de production avec un fort trafic.
3. Observer et mesurer : le critère n°1 de maturité
L'observabilité et la mesurabilité sont le critère n°1 de maturité technique d'un déploiement IA. Sans ces piliers, l'IA est une boîte noire. Déployer l'IA, c'est surtout être capable d'expliquer comment ça se comporte et de mesurer comment ça se comporte. Sinon, on ne peut pas avancer. C’est vrai pour nos clients grands comptes, mais aussi pour tous les acteurs économiques !
Un système mature n'est jamais déployé sans avoir été évalué sur un dataset de test complet et suivi dans le temps. Ce processus est continu. L'observabilité nous permet de voir le parcours d'une requête (tracing, logging) ; la mesurabilité permet de quantifier ses performances (taux de succès, coût, latence). Nous utilisons aussi l’analyse des requêtes sans résultat pour alimenter un circuit vertueux : l'IA en production devient ainsi un outil d'audit qui nous signale les trous dans la base documentaire à corriger. Cette évaluation va jusqu'à la perception terrain : ce n'est pas à nous, éditeurs, de décider que le produit est stable, c'est aux utilisateurs de le confirmer en l’adoptant.
4. La frugalité : un choix stratégique et rentable
Le réflexe de prendre le modèle le plus puissant est coûteux et rarement justifié. Les modèles les plus performants peuvent coûter 10 à 30 fois plus cher que des modèles intermédiaires. Mon conseil aux DSI est d'exiger l'activation conditionnelle des modèles. Par exemple, la décision d'activer l'indexation profonde connectée à des modèles de vision (plus coûteuse) est prise au cas par cas, en fonction de la complexité des documents du client.
La frugalité est un arbitrage important : est-ce que ça vaut le coup de dépenser 10 fois plus pour passer de 85% à 95% de taux de succès ? Il n'y a pas de réponse universelle. Ça dépend du cas d'usage et du secteur.
Enfin, l'agnosticisme technologique – la capacité à comparer et basculer entre différents modèles, de providers différents, sur les mêmes tâches – est crucial pour répondre aux contraintes de souveraineté et éviter le risque de dépendance technologique.
5. Construire pour durer : une architecture prête pour les évolutions des modèles et fournisseurs
Le rythme d'évolution de l'IA est sans précédent, et la dette technique est un tueur silencieux. Un système qui fonctionne aujourd'hui mais qui ne peut pas évoluer sera obsolète dans 12 à 18 mois. Le "piège du proof-of-concept" est là : un pilote ne dit rien de la capacité à tenir en production.
Votre architecture doit pouvoir s’adapter facilement : la capacité de changer de modèle ou de fournisseur quand c'est nécessaire (modèle déprécié, nouveau modèle plus performant, contraintes de souveraineté) sans refonte majeure.
Les trois marqueurs de maturité technique pour la durabilité sont :
- Architecture modulaire : des briques découplées, remplaçables individuellement, observables séparément.
- Agnosticisme architectural : capacité à changer de modèle ou de provider sans refonte majeure (pas de vendor lock-in).
- Gestion proactive de la dette : chaque brique est maintenue, testée et évaluée.
Le rôle du DSI n'est surtout pas de bloquer les initiatives, mais bien d'être le garant de l'IA de confiance. Les cinq fondamentaux que j'ai décrits sont les conditions concrètes pour qu'un système IA passe en production et soit pérenne pour au moins 3 à 5 ans, pour qu’il supporte des montées en charge et continue de s'améliorer. Un éditeur qui répond positivement à ces cinq critères mérite d'être évalué en profondeur. Un éditeur qui botte en touche sur l'un d'entre eux représente un risque technique important.
Le DSI a les clés pour faire la différence : exiger des preuves, pas des promesses.