Le nouvel actif invisible des entreprises B2B : leur RAG propriétaire

Haruna / Hi-Commerce

Un vault de connaissances bien indexé devient un actif stratégique. La bibliothèque interne consultée par hybrid search dépasse les LLM publics sur les sujets verticaux. Architecture et chiffres.

Pendant que les directions IT installent ChatGPT Enterprise, une fraction d'entreprises B2B construit en parallèle une infrastructure invisible : un RAG propriétaire alimenté par leur vault interne. La différence de valeur est mesurable. Sur les questions verticales — produit, processus, jurisprudence métier — le RAG propriétaire dépasse les LLM publics dès qu'il est correctement nourri. Voici l'architecture, les chiffres, et pourquoi cet actif s'apprécie là où l'abonnement SaaS reste un loyer.

Le constat : un LLM public ne peut pas être un expert vertical

Les LLM publics — ChatGPT, Claude, Gemini — sont entraînés sur le web. Ils savent un peu de tout. Ils ne savent pas un métier en profondeur, sauf si ce métier est massivement documenté en ligne.

Pour une entreprise B2B avec une expertise spécifique — réglementation Qualiopi, tarification de pièces d'or, optimisation SEO e-commerce, jurisprudence comptable — l'écart est immédiat. Le LLM public donne une réponse correcte en surface, fausse ou approximative dès qu'on creuse.

L'extrapolation est claire : la valeur d'usage des LLM publics plafonne aux sujets grand public. Pour les sujets verticaux, l'IA générique reste sous-performante.

C'est précisément là que le RAG propriétaire change la donne.

L'architecture d'un RAG propriétaire

RAG = Retrieval-Augmented Generation. Le principe tient en trois étapes.

Indexation. Le corpus interne — documents, contrats, comptes rendus de réunions, base de connaissances, procédures, transcriptions audio — est segmenté en chunks (passages cohérents) puis indexé selon deux dimensions parallèles : un index lexical (BM25) pour les mots-clés exacts, un index vectoriel (embeddings) pour la sémantique.

Recherche hybride. Quand une requête arrive, le système consulte les deux index en parallèle. Le BM25 récupère les passages contenant les termes exacts. L'embedding récupère les passages sémantiquement proches même si les mots diffèrent. Une couche de re-ranking fusionne les deux résultats.

Génération augmentée. Le LLM ne raisonne pas seul. Il reçoit en contexte les 5 à 20 passages les plus pertinents extraits du vault, puis répond en s'appuyant sur ces sources citées explicitement.

L'architecture peut tenir sur un VPS modeste, alimentée par des embeddings OpenAI ou locaux, orchestrée par n8n ou un script Python. Le coût d'infrastructure est dérisoire. Le coût intellectuel — choix du chunking, qualité du corpus, calibration de la recherche — est ce qui sépare un RAG performant d'un gadget.

Trois différences mesurables avec un LLM générique

Précision factuelle. Sur des questions techniques verticales, le RAG propriétaire répond correctement dans 85 à 95 % des cas, avec citation des sources internes. Le LLM générique tombe à 40-60 % avec hallucinations difficiles à détecter.

Traçabilité. Chaque réponse RAG cite ses sources internes — page, paragraphe, date du document. L'utilisateur peut vérifier. Avec un LLM générique, l'argument d'autorité est creux : le modèle dit avoir raison parce qu'il dit avoir raison.

Spécificité métier. Sur des cas particuliers — clients historiques, procédures internes, jurisprudence métier — le RAG répond avec le niveau de détail attendu d'un collaborateur senior. Le LLM générique fournit une réponse cadre qui ne couvre pas le cas.

Pourquoi c'est un actif et pas un coût

Le critère qui distingue un actif d'un coût tient à la conservation de valeur dans le temps.

Un abonnement ChatGPT Enterprise est un loyer. À l'arrêt du paiement, l'accès s'éteint. Aucune valeur n'est conservée chez l'entreprise.

Un RAG propriétaire est un actif. Le corpus indexé reste la propriété de l'entreprise. Il s'enrichit chaque mois avec les nouveaux documents. Sa valeur d'usage augmente avec le volume et la qualité des sources. À la fin de l'année, l'entreprise possède une infrastructure intellectuelle qui n'existait pas l'année précédente.

L'analogue est lisible. Le SEA est un loyer ; le SEO est un actif. Le ChatGPT Enterprise est un loyer ; le RAG propriétaire est un actif.

Ce qu'il faut pour démarrer

Trois prérequis.

Un corpus utile. L'enjeu n'est pas le volume mais la qualité. 500 pages bien organisées battent 5 000 pages anarchiques. Le travail amont est un travail de curation : identifier les documents qui contiennent l'expertise opérationnelle, écarter le bruit administratif.

Une compétence d'orchestration. Pas un développeur senior, mais quelqu'un qui sait calibrer les paramètres de chunking, choisir les bons embeddings, ajuster le re-ranking. Trois à six mois d'apprentissage, ou un consultant compétent.

Une discipline d'enrichissement. Le corpus doit être nourri régulièrement. Les comptes rendus de réunions, les emails clients structurants, les documents internes — tout passe à l'index. Sans cette discipline, le RAG vieillit en six mois.

Un dirigeant qui pose ces trois éléments construit un actif intellectuel qui s'apprécie pendant qu'il dort. C'est exactement ce que les abonnements SaaS ne permettent pas.

Le test à faire avant la fin du trimestre

Posez à votre LLM préféré une question précise sur votre métier — une question dont vous connaissez la réponse exacte parce qu'elle est documentée chez vous. Notez le taux d'imprécision et d'hallucination dans la réponse.

Vous tenez la mesure de l'écart entre l'IA générique et l'IA augmentée par votre propre savoir.

Cet écart est une opportunité opérationnelle, pas une fatalité.