Assistants et API IA en entreprise : lesquels tiennent la charge une fois en prod
Suspension de Claude Fable 5, coûts au token qui font plier Microsoft et Uber : juin 2026 a rappelé que la couche modèle est une dépendance critique, à traiter comme telle dans l'architecture.
La chronique de Jeremy Cohen sur le coût des données mal préparées touchait un point vrai côté infrastructure. Il y a un point symétrique côté fournisseurs de modèles, moins documenté parce qu'il ne se règle pas en interne : ce qui se passe quand le modèle sur lequel une architecture entière repose change de prix, de comportement, ou disparaît sans préavis.
Deux épisodes de juin 2026 illustrent le problème à des échelles différentes. Le 12 juin, Anthropic a coupé l'accès à Claude Fable 5 et Mythos 5 pour l'ensemble de ses clients, sur ordre du Commerce Department américain — une directive de contrôle export citant une méthode de contournement des classificateurs de sécurité du modèle. Le modèle n'est revenu que le 1er juillet, après dix-huit jours d'indisponibilité totale, le temps que la directive soit levée et qu'Anthropic ajoute un classificateur bloquant la faille dans plus de 99 % des cas. Pour une entreprise qui avait bâti un produit autour de Fable 5 sans repli, dix-huit jours sans accès au modèle de production, ce n'est pas un incident mineur.
Le second épisode touche le coût plutôt que la disponibilité. Microsoft a annoncé la fin de la plupart des licences internes Claude Code dans sa division Experiences and Devices (Windows, Microsoft 365, Teams, Surface) d'ici le 30 juin, au profit de son propre Copilot CLI. La raison donnée n'est pas la qualité de l'outil — au contraire, les équipes l'avaient adopté au point de délaisser l'outil maison six mois seulement après son introduction — mais la facture : une tarification au token qui grimpe avec l'usage réel, jusqu'à consommer le budget IA annuel bien avant l'échéance. Le cas n'est pas isolé : Uber, qui a déployé Claude Code sur 5 000 ingénieurs, voyait ses coûts par ingénieur grimper entre 500 et 2 000 dollars par mois à mesure que l'adoption montait vers 84-95 % en avril.
Le paradoxe est le même dans les deux cas : plus l'outil est utile, plus il coûte cher ou plus sa disparition fait mal. Un modèle qui marche bien s'incruste dans les usages réels — et c'est justement ce qui rend son retrait ou son renchérissement coûteux à absorber.
Côté API, l'écart de coût réel entre fournisseurs s'est creusé au premier semestre 2026. Un usage agent soutenu chez Claude passe facilement du simple au triple selon le modèle choisi (Haiku contre Opus) et le volume de contexte envoyé à chaque appel — une architecture agentique qui relit systématiquement de gros documents multiplie la note plus vite qu'elle n'ajoute de valeur. Mistral, de son côté, reste positionné sur un tarif au token sensiblement inférieur, ce qui explique une partie de l'attrait retrouvé pour l'option française depuis le printemps — moins par patriotisme économique que par prévisibilité budgétaire.
Pour un DSI qui arbitre son stack IA cette année, la question n'est plus seulement "quel modèle donne la meilleure réponse" mais "que se passe-t-il le jour où ce modèle change de prix, de comportement ou d'accès sans préavis". Les deux épisodes de juin répondent à cette question de deux manières différentes : l'un par une coupure totale et imprévisible, l'autre par une dérive budgétaire progressive qui ne se voit qu'après coup, sur la facture. Aucun des deux ne se règle par un meilleur prompt ou un modèle plus puissant — les deux se règlent en amont, au niveau de l'architecture.
Ce que ces deux épisodes disent, au fond, c'est que la couche modèle est devenue aussi volatile que n'importe quelle dépendance externe critique, et qu'elle mérite le même traitement : pas de fournisseur unique sans plan de repli. Ça se traduit par trois choses que j'ai vues fonctionner en testant ces outils en conditions réelles depuis plusieurs mois : une abstraction au niveau code, qui permet de basculer d'un modèle à un autre sans réécrire l'intégration ; un suivi du budget par usage en continu plutôt qu'en fin de mois — le dérapage chez Microsoft ne s'est vu qu'à la facture ; et un fournisseur de secours réellement testé en conditions de charge, pas seulement listé sur un schéma d'architecture.
Il y a aussi un angle souverain qu'on aborde rarement sous cet axe précis : les alternatives françaises n'ont pas connu ce type de coupure sur la période, ce qui n'est probablement pas qu'un hasard de calendrier — la juridiction du fournisseur devient un critère de disponibilité, au même titre que son SLA technique.
Le point commun entre Fable 5 et Claude Code, c'est que l'architecture qui a le mieux résisté est celle qui n'avait pas parié sur un seul modèle pour la charge de production. Ce n'est pas une idée neuve : c'est la même logique qu'on applique depuis des années aux fournisseurs cloud. La couche modèle est simplement en retard sur cette maturité, et juin 2026 vient de le rappeler à deux entreprises en même temps, pour deux raisons différentes.