Pourquoi le choix d'architectures sovereign-by-design est un gage de transparence et de traçabilité des données ?

Veeam

La souveraineté des données est devenue essentielle pour concilier innovation, conformité et maîtrise des risques à l'ère de l'IA, et ne peut plus être une simple option pour les entreprises.

Ces dernières années, l’intelligence artificielle s’est largement imposée au sein de la plupart des entreprises et semble gagner encore du terrain, comme l’atteste une étude récente de McKinsey indiquant que 88 % d’entre elles admettent l’utiliser dans au moins une fonction métier. Dans de nombreux cas, les entreprises finissent par devoir définir leurs propres cadres face à sa démocratisation fulgurante.

Pourtant, face à la décélération du rythme d’innovation, les entreprises ont de plus en plus tendance à laisser de côté la souveraineté des données, qui est pourtant un pilier sur lequel orchestrer leur déploiement d’une IA sécurisée. Une telle accélération technologique a eu comme effet de révéler certaines limites : à mesure que les usages se multiplient, la souveraineté des données s’impose comme un critère essentiel pour garantir un déploiement sécurisé et fiable des technologies d’IA.

En parallèle, pour combler leur retard, les cadres réglementaires ont fait de la souveraineté et de la visibilité des données qui alimentent l’IA une priorité. Cette logique s’illustre notamment par les règles strictes et basées sur les risques, établies notamment par l’AI Act, le règlement européen sur l’IA, pour encadrer la façon dont l’IA est développée et déployée au sein de l’UE, pour permettre une meilleure visibilité des données sur lesquelles se construit la technologie.

Ainsi, les organisations devraient opter pour une approche plus structurée afin d’intégrer au mieux ces évolutions réglementaires dans leurs initiatives. Cela implique de concevoir des architectures de données traçables, visibles, qui incorporent la souveraineté dès la conception (‘‘sovereign-by-design’’) ; cela leur permettra non seulement d’avoir une longueur d’avance en matière de conformité réglementaire, mais aussi de pouvoir tirer pleinement parti du potentiel de l’IA.

Trier ses données, une étape indispensable

Les données constituent le fondement de la souveraineté numérique, mais aussi de l’innovation en matière d’intelligence artificielle, c’est désormais de notoriété publique. Selon IDC, en 2025, le volume total de données générées a atteint le pic vertigineux de 181 zettaoctets ; si ces immenses quantités servent à alimenter l’IA dans le but de développer des projets, force est de constater que la plupart d’entre eux restent bloqués à la phase pilote, avant d’être abandonnés. Par ailleurs, de récentes études démontrent que près de 95 % des projets pilotes d’IA générative menés au sein des organisations n’ont jamais atteint la phase de production ou n’ont tout simplement pas été jugés rentables. La cause ? Une certaine negligence dans l’hygiène des données.

Tandis que les données connaissent une croissance sans précédent, portée par l’essor de l’intelligence artificielle, la plupart des organisations peinent à garder le cap face à de tels volumes, qui dépassent souvent l’évolution des pratiques de stockage et de gouvernance. En conséquence, la vigilance sur la qualité des données conservées baisse de manière significative. Dans ce contexte, des données peu utiles, voire redondantes, se retrouvent fréquemment stockées aux côtés de données véritablement exploitables dans le cadre du développement de cas d’usage de l’IA. Cependant, cette accumulation n’est pas sans conséquences, car les systèmes d’IA apprennent autant de la structure et de la qualité des données que de leur contenu. De fait, lorsque les ensembles de données servant à entraîner l’intelligence artificielle contiennent des données inappropriées ou inutiles, les performances des modèles perdent en qualité et en pertinence, et les résultats obtenus ne peuvent être exploités convenablement.

Enfin, les enjeux réglementaires liés à l’IA ne doivent pas être sous-estimés. Même si les autorités de réglementation éprouvent encore des difficultés à établir une approche commune internationale, une tendance se dessine : les futures exigences réglementaires s’appuieront largement sur une meilleure visibilité des données utilisées pour alimenter les systèmes d’IA.

La directive NIS 2 et l’UE AI Act reflètent déjà cette tendance au niveau de l’Union européenne, en renforçant les attentes en matière de transparence, de gouvernance et de contrôle des données d’entraînement et opérationnelles. Dans un tel contexte, une souveraineté des données solide devient indispensable. Sans une vue d’ensemble claire et maîtrisée de leur patrimoine de données, les organisations peineront à cartographier leurs flux de données, à comprendre leurs dépendances et, enfin, à satisfaire les exigences réglementaires d’aujourd’hui et de demain.  

Reprendre le contrôle sur ses données

Aujourd’hui, les entreprises se retrouvent confrontées à plusieurs années d’accumulation massive de données, et doivent tenter de maîtriser des volumes toujours plus colossaux. Plutôt que d’envisager une amélioration immédiate de leur hygiène de données, elles doivent passer par une étape essentielle : comprendre précisément quelles données elles possèdent et évaluer leur niveau de criticité.

Cette démarche essentielle permet d’éviter qu’un outil d’IA générative n’accède, par inadvertance, à des données stratégiques ou sensibles, mais constitue également un levier clé pour améliorer les performances des modèles d’IA. Ainsi, en identifiant plus clairement les données pertinentes et en écartant les données inutiles, les organisations peuvent alimenter les systèmes d’IA avec des ensembles de données plus structurés, plus fiables et plus exploitables.

Dès que leurs données sont identifiées, classifiées et maîtrisées, les entreprises peuvent se lancer dans la définition de leurs exigences de souveraineté en fonction de chaque catégorie de données, en prenant en compte aussi bien les réglementations internationales que les spécificités locales.

Face à ce niveau de complexité, certaines choisissent d’appliquer les règles les plus restrictives de leurs environnements afin de limiter les risques de non-conformité. Pourtant, la réalité est souvent plus nuancée : par exemple, le RGPD n’impose pas une localisation des données en fonction du pays concerné, mais exige qu’elles demeurent au sein de la Zone économique européenne (ZEE), tout en encadrant rigoureusement les transferts de données personnelles en dehors de cette zone.

Ce mille-feuille d’exigences explique pourquoi de nombreuses organisations se tournent aujourd’hui vers des architectures hybrides et multicloud, qui favorisent un certain degré de flexibilité concernant les emplacements où les charges de travail sont traitées et stockées, tout en répondant aux contraintes réglementaires locales. La portabilité des données devient ainsi un enjeu clé, notamment dans un contexte où les réglementations ne cesseront d’évoluer. Au-delà de la conformité, cette approche apporte également davantage de visibilité et de contrôle sur les données, en permettant de visualiser leur emplacement, de connaître leur manière de circuler et l’identité des personnes qui peuvent y accéder. Un tel degré de transparence est désormais indispensable, aussi bien pour renforcer la sécurité que pour garantir une gouvernance efficace des environnements d’IA.

La souveraineté des données n’est plus une option

Autrefois perçue comme une simple case à cocher parmi une longue liste d’exigences réglementaires, la souveraineté des données était loin de faire partie de la stratégie de données des entreprises. Aujourd’hui, elle représente un véritable levier de transformation, offrant un cadre structurant pour mieux gouverner les données qui alimentent les opérations et les systèmes d’IA.

Les entreprises disposent ainsi d’une base plus fiable pour encadrer les usages de l’IA et déployer une gouvernance adaptée. Par ailleurs, des données mieux structurées, mieux comprises et plus pertinentes permettent également d’améliorer concrètement les performances des projets d’IA générative et d’en tirer plus facilement parti.