Use it or lose it : quand les quotas d'IA rendent le gaspillage rationnel
Les quotas d'IA qui expirent poussent à surconsommer le modèle le plus lourd pour ne rien perdre. Cette "taxe de continuité" rend le gaspillage rationnel et sape la sobriété.
Vendredi soir. Il me reste la moitié de mon quota hebdomadaire d'IA — en apparence, une réserve confortable. Mais la remise à zéro tombe dans deux jours, et ce solde ne se reporte pas : ce que je n'aurai pas consommé d'ici là sera perdu. La question n'est donc plus seulement "de quoi ai-je besoin ?", mais "comment ne pas gaspiller ce que j'ai déjà payé ?".
Et c'est là que le raisonnement se déforme. Pour la tâche du soir, un modèle léger suffirait : résumer un texte, reformuler un message. Mais l'employer, c'est accepter de laisser expirer la moitié de mon abonnement. Lancer Fable, le modèle le plus puissant, permet au contraire de convertir vite cette capacité périssable — même si la tâche ne le justifie pas. Puis, plus tard dans la soirée, une session atteint son plafond au milieu d'un travail qui ne peut pas attendre : cette fois, il faut acheter des crédits pour continuer. Deux limites distinctes, deux pièges — l'une pousse à surconsommer, l'autre à payer un supplément.
Ce raisonnement est mauvais sur le plan technique et écologique. Mais il est parfaitement rationnel du point de vue d’un client enfermé dans une double limite. C’est pourquoi je propose de le nommer : la taxe de continuité. J’écrivais dans une précédente chronique que le vrai luxe de l’IA serait d’apprendre à ne pas utiliser le meilleur modèle. Encore faut-il que les règles du jeu le permettent : cette chronique examine pourquoi elles font souvent l’inverse.
Un quota n’est pas une réserve
Chez Anthropic, l’offre Max — celle qui inclut l’accès au modèle le plus puissant, Fable, là où l’offre Pro n’y accède plus que par crédits — ne se résume pas à une enveloppe hebdomadaire. L’usage est d’abord plafonné par des sessions qui se réinitialisent toutes les cinq heures, puis par une limite hebdomadaire commune aux modèles. L’entreprise précise elle-même que la longueur et la complexité des conversations, le modèle choisi et les fonctionnalités utilisées influencent ces limites. Les crédits payants permettent de continuer au-delà de certains plafonds ; la documentation conseille d’ailleurs de planifier les travaux intensifs autour des fenêtres de cinq heures et d’utiliser d’abord l’usage inclus. On me répondra que cette transparence est déjà une forme de pédagogie. C’est exact — et c’est bien pourquoi la critique porte sur l’architecture, pas sur sa documentation.
Cette architecture produit un effet très concret : le pourcentage de quota restant ne dit pas ce qu’un utilisateur peut réellement accomplir avant son expiration. À deux jours de la remise à zéro, 50 % restants ne garantissent pas 50 % de capacité réellement disponible : leur utilisation dépendra aussi du calendrier des sessions et du temps de travail restant. Un quota affiché devient alors une promesse comptable, pas nécessairement une capacité mobilisable.
Le problème n’est pas qu’un service limite l’accès à une ressource rare. Les centres de données et les GPU ne sont pas infinis. Le problème est de présenter une abondance hebdomadaire tout en la rendant temporellement fragmentée, puis de vendre la continuité lorsque cette fragmentation interrompt un travail.
Quand "ne pas perdre" devient l’objectif
Ce mécanisme n’a rien d’anecdotique. Les économistes connaissent depuis longtemps l’effet "use it or lose it" : lorsqu’un budget expire, l’incitation n’est plus d’allouer la ressource à son meilleur usage, mais de ne pas la laisser disparaître. Dans une étude publiée par l’American Economic Review, des administrations fédérales américaines dépensaient, lors de la dernière semaine budgétaire, 4,9 fois leur moyenne hebdomadaire ; les achats réalisés alors étaient aussi de moins bonne qualité.
L’analogie ne prouve évidemment pas que chaque abonné adopte ce comportement. Elle éclaire toutefois un mécanisme prévisible : une ressource non reportable change le critère de décision. On ne choisit plus le modèle adapté à la tâche. On choisit le modèle qui empêchera le solde de se perdre. Une illustration, parmi d’autres possibles, de cette culture naissante : dans une politique de développement publiée en ligne, la société japonaise qmu co. explique vouloir utiliser son quota hebdomadaire au plus près de sa limite, y compris en dirigeant les capacités restantes vers des tâches autonomes nocturnes — tout en reconnaissant que consommer pour atteindre un chiffre d’usage ne crée aucune valeur. Le paradoxe est là : la plateforme installe une rareté temporelle, et les utilisateurs organisent leur travail autour de la consommation de cette rareté.
Le haut de gamme devient l’option "raisonnable"
La situation est particulièrement paradoxale avec Fable. Anthropic présente ses modèles selon des compromis de capacité, de vitesse et de coût : Haiku est son modèle le plus efficient, Sonnet le choix généraliste et Opus la solution de très haute capacité ; Fable s’inscrit au sommet de cette gamme. L’entreprise recommande de choisir le modèle adapté et de diminuer l’effort de raisonnement lorsque c’est possible. Sur le plan tarifaire de l’API, Fable est aussi affiché à un prix par million de jetons supérieur à Opus, lui-même supérieur à Sonnet et Haiku.
Or la combinaison d’une limite de session et d’un solde hebdomadaire qui expire peut inverser cette hiérarchie. Pour une question simple, employer Haiku ou Sonnet est techniquement le bon choix. Mais s’il reste un solde non récupérable, Fable peut devenir le choix économiquement rationnel pour l’abonné : il permet de convertir plus vite une capacité déjà payée avant qu’elle disparaisse. Même lorsque des plafonds spécifiques limitent la part du quota mobilisable par le modèle le plus intensif, la logique demeure : à l’approche de la remise à zéro, l’expiration pèse plus que l’adéquation.
Je ne peux pas établir une intention du fournisseur, et je ne décris pas une fraude. Je décris un effet documentable d’un choix commercial : une capacité incluse déjà payée mais périssable coexiste avec une continuité facturée à part. Le rationnement est organisé par le temps, et la sortie du rationnement est monétisée par des crédits. Le consommateur est pris entre deux comportements défavorables : sous-utiliser ce qu’il a payé, ou surutiliser le modèle le plus coûteux pour ne pas le perdre.
Une architecture de secteur — mais pas une fatalité
Cette mécanique n’est d’ailleurs pas propre à Anthropic, qui a au moins le mérite de la documenter précisément. OpenAI et Google organisent leurs abonnements selon des logiques voisines : fenêtres de temps, plafonds variables selon le modèle et le mode de raisonnement, fonctionnalités premium et voies payantes de continuité. La taxe de continuité est un standard de fait du secteur occidental de l’IA générative grand public.
Elle n’est pourtant pas une fatalité technique. DeepSeek ne vend aucun abonnement grand public : son chat est gratuit, et son API, prépayée au jeton, module ses prix selon l’heure — le calcul y est environ deux fois moins cher en heures creuses. Le rationnement y opère par le prix, qui invite à différer, et non par l’expiration, qui invite à consommer. Cette tarification vise d’abord la charge des serveurs, pas l’écologie ; mais déplacer le calcul vers les heures creuses converge souvent avec un réseau électrique moins tendu. Kimi, de Moonshot AI, occupe une position intermédiaire : un accès gratuit, des abonnements à paliers qui débloquent des crédits périodiques d’agents et de code — une allocation qui se rapproche de la logique "use it or lose it", sans les fenêtres de session documentées des acteurs américains.
La comparaison tranche la question de nature : puisqu’un acteur majeur prouve qu’on peut rationner une ressource rare sans la faire expirer, la taxe de continuité est un choix de conception, pas une contrainte d’infrastructure.
Une sobriété rendue irrationnelle
Cette mécanique n’est pas seulement financière. Elle dégrade aussi la sobriété numérique.
Nous ne disposons pas, à ce jour, d'une mesure publique, vérifiée et spécifique de l'énergie, de l'eau ou du carbone consommés par une requête, quel que soit le modèle ou le fournisseur. Anthropic n'est ici qu'un exemple : ni ses modèles ni ceux d'OpenAI, de Google ou des autres acteurs ne s'accompagnent d'un bilan par requête que l'utilisateur pourrait consulter. C'est une donnée manquante majeure, commune à tout le secteur. Mais il existe des estimations assez transparentes pour donner un ordre de grandeur, à condition de ne pas les travestir en mesures.
Token Climate estime ainsi l’énergie informatique côté serveurs, par million de jetons générés, à environ 10,1 kWh pour Fable, 5,05 kWh pour Opus, 2,53 kWh pour Sonnet et 1,26 kWh pour Haiku. La réserve est décisive et doit être lue avant les chiffres : l’estimation Fable est classée en "faible confiance", car elle ne repose sur aucune donnée publique propre au modèle, mais sur une extrapolation à partir d’Opus et d’un proxy de prix — or le prix est un mauvais indicateur de l’énergie. L’outil précise lui-même qu’aucun de ses facteurs n’est une mesure. L’ordre de grandeur — un modèle de sommet de gamme plusieurs fois plus énergivore que le modèle efficient — reste toutefois cohérent avec ce que la littérature technique établit.
Une étude publiée dans Joule donne un second repère, plus bas, dans un autre cadre technique : pour des modèles de plus de 200 milliards de paramètres servis sur H100 dans des conditions optimisées, elle estime une requête standard médiane à 0,31 Wh — pour 500 jetons d’entrée et une médiane de 300 jetons de sortie — et une requête de raisonnement longue à 3,91 Wh, avec une médiane de 5 000 jetons de sortie. Cette étude ne mesure ni Claude ni Fable ; elle ne peut donc pas être additionnée à Token Climate ni convertie en "coût carbone d’une question Fable". Elle établit toutefois le mécanisme central : la longueur des sorties et le raisonnement intensif augmentent fortement la charge énergétique.
La divergence entre ces deux estimations n’annule pas le problème : elle rend visible l’opacité qui l’empêche aujourd’hui d’être quantifié correctement. L’Agence internationale de l’énergie estime que les centres de données ont consommé environ 415 TWh d’électricité en 2024 et pourraient atteindre 945 TWh en 2030 ; l’IA est l’un des principaux moteurs de cette hausse. Dans ce contexte, nous ne pouvons pas confirmer le coût exact d’une requête Fable. Nous pouvons en revanche constater qu’aucune donnée publique par modèle ne permet à l’abonné de choisir en connaissance de cause.
Dans ce contexte, le modèle le plus puissant devrait rester l’exception justifiée par la difficulté réelle de la tâche. Mais une interface qui rend le quota périssable transforme ce choix de sobriété en coût d’opportunité pour l’utilisateur. Elle peut donc pousser à employer un modèle très intensif pour une tâche qui ne le requiert pas.
La responsabilité ne repose pas uniquement sur l’abonné. On ne peut pas demander à un utilisateur de choisir systématiquement le modèle sobre tout en l’exposant à une règle qui pénalise ce choix. La sobriété n’est crédible que lorsqu’elle est aussi praticable.
Rendre la continuité et l’empreinte visibles
Les fournisseurs peuvent corriger cette incohérence sans promettre une capacité illimitée, et sans feindre qu'une requête équivaut à une autre.
Ils pourraient d'abord cesser d'afficher un pourcentage abstrait pour exprimer le solde dans l'unité qu'ils utilisent déjà en interne — une mesure du calcul consommé, et non un nombre implicite de messages. Sur cette base, une estimation affichée avant les tâches les plus lourdes indiquerait leur coût probable, au moment précis où l'utilisateur peut encore choisir un modèle plus sobre.
Ils pourraient surtout rendre visible la contrainte de temps : non pas "50 % restants", mais la part de ce solde réellement mobilisable d'ici la remise à zéro, compte tenu des fenêtres de session. C'est l'information qui manque le plus aujourd'hui — et l'on comprend qu'elle soit inconfortable à publier, puisqu'elle révélerait parfois qu'une fraction du quota payé était, en pratique, impossible à consommer.
Ils pourraient enfin autoriser le report d'une part plafonnée du solde inutilisé. Une réserve bornée suffit à désamorcer l'incitation à tout brûler avant l'expiration, sans transformer l'abonnement en capacité illimitée : le fournisseur garde la main sur son débit, l'utilisateur cesse de gaspiller par crainte de perdre.
Ils devraient surtout publier un bilan environnemental par modèle et par type d’usage : jetons d’entrée et de sortie, raisonnement, cache, énergie, eau, localisation de l’infrastructure et intensité carbone. Sans ces données, l’utilisateur ne peut ni arbitrer correctement ni vérifier les promesses de sobriété.
Enfin, les interfaces devraient aider à choisir le modèle minimal suffisant, puis expliquer clairement le gain de coût et d’empreinte associé. Aujourd’hui, elles savent orienter vers les crédits. Elles pourraient aussi orienter vers le bon niveau de calcul.
J’écrivais en mai que le luxe de demain ne serait pas d’avoir toujours le modèle le plus fort, mais de savoir lequel suffit. Cette chronique en est la suite nécessaire : la sobriété computationnelle ne peut pas rester une vertu individuelle dans une architecture qui la taxe. L’enjeu n’est pas de culpabiliser les utilisateurs qui ouvrent le modèle le plus lourd pour une tâche banale ; c’est précisément l’inverse : comprendre pourquoi une architecture de quotas peut les y conduire. Une IA responsable ne consiste pas seulement à entraîner des modèles plus efficaces. Elle consiste à concevoir des règles qui ne rendent pas le gaspillage plus rationnel que la sobriété.