Google réduit Gemini gratuit à Flash-Lite le 9 octobre. L'offre gratuite de votre appli n'a jamais été un contrat non plus

Le 6 octobre, The Verge a rapporté que Google s'apprête à retirer Flash et Pro à ceux qui utilisent Gemini gratuitement. Le centre d'aide de Google le confirme, dans une page intitulée « Changes to Gemini model access and limits » : à partir du 9 octobre, les personnes qui utilisent l'application Gemini avec un compte personnel et sans abonnement IA n'auront plus que Flash-Lite.
Le reste de l'échelle bouge aussi. Google AI Plus, à 4,99 $ par mois aux États-Unis, garde Flash-Lite et Flash mais perd Pro, à une date que Google dit communiquer par e-mail à chaque abonné. Pro reste avec AI Pro, à 19,99 $ par mois, et AI Ultra, à partir de 99,99 $. Le jour où j'écris, la page d'abonnement américaine de Google décrit encore l'offre gratuite comme « Access to 3.6 Flash » et « Varying access to 3.1 Pro ». À partir du 9 octobre, le plus petit des trois modèles devient toute l'offre gratuite.
Je construis des produits sur Claude, pas sur Gemini. Je l'ai quand même lu deux fois, parce que la première question d'un développeur est évidente : est-ce que ça touche l'API ?
Ce qui change, et ce qui ne change pas
La réponse est non, du moins pas cette semaine. Google limite le changement aux « Gemini Apps when you use a personal account » (« applications Gemini quand vous utilisez un compte personnel »). J'ai vérifié les pages développeur. La page de tarifs de l'API Gemini, mise à jour le 6 octobre, indique toujours Gemini 3.8 Flash comme « Free of charge » (« gratuit ») dans l'offre gratuite, en entrée comme en sortie, et de même pour Gemini 3.5 Flash-Lite. Les notes de version de l'API, mises à jour le même jour, n'annoncent aucun changement de l'offre gratuite.
Donc si votre side project appelle l'API Gemini avec une clé gratuite, le 9 octobre est un jour normal. Si vos utilisateurs parlent à Gemini via l'application de Google, ils perdent Flash.
Côté limites, les pages publiques de Google ne donnent aucun chiffre, ni d'un côté ni de l'autre. Dans l'application, l'usage des plus de 18 ans est « compute-based » (« basé sur la puissance de calcul ») depuis le 17 mai : les limites se réinitialisent toutes les cinq heures jusqu'à ce qu'on atteigne un plafond hebdomadaire, AI Plus obtient deux fois la limite standard et AI Pro quatre fois. Pour l'API, la page des limites de débit n'affiche aucun chiffre pour l'offre gratuite. Elle vous renvoie vers AI Studio pour voir les limites de chaque projet, et ajoute : « Specified rate limits are not guaranteed and actual capacity may vary. » (« Les limites de débit indiquées ne sont pas garanties et la capacité réelle peut varier. »)
L'offre gratuite de l'API bouge aussi, plus discrètement
Le changement de l'application a eu droit à un titre. Ceux de l'API ont surtout eu droit à une ligne.
Le modèle Pro actuel, Gemini 3.1 Pro Preview, est déjà marqué « Not available » (« non disponible ») dans l'offre gratuite de l'API. Le 18 septembre, les notes de version ont annoncé que l'accès aux modèles 2.5 est désormais limité « to users who have actively used them in the past » (« aux utilisateurs qui les ont activement utilisés par le passé »), et ont dit aux nouveaux projets d'utiliser 3.5 Flash-Lite ou 3.8 Flash. En janvier, sur le forum développeurs de Google, Logan Kilpatrick a répondu au nom de Google à des gens dont le quota quotidien avait chuté dans le playground d'AI Studio : « We did reduce the limits for free in the UI. » (« Nous avons bien réduit les limites gratuites dans l'interface. ») Il a ajouté : « I expect the limits to continue to go down over time. » (« Je m'attends à ce que les limites continuent de baisser avec le temps. ») C'était le playground, pas l'API, mais la direction était énoncée clairement.
Même le prix payant porte une date. Gemini 3.8 Flash coûte 0,75 $ par million de tokens en entrée et 3,75 $ par million de tokens en sortie « through December 31, 2026 » (« jusqu'au 31 décembre 2026 »). À partir du 1er janvier 2027, la même page indique 1,50 $ et 7,50 $. Le doublement est déjà publié, à moins de trois mois.
Rien de tout ça n'est un scandale. Une offre gratuite, c'est la capacité excédentaire d'un fournisseur, emballée en produit, et elle rétrécit quand la capacité excédentaire rétrécit. La page de tarifs le dit dans sa dernière ligne : « Rate limits are subject to change. » (« Les limites de débit sont susceptibles de changer. »)
Une dépendance que vous n'avez pas signée
Payez une API et vous obtenez des conditions, une grille tarifaire et, parfois, un préavis. Construisez sur une offre gratuite et vous n'obtenez rien de tout ça, et vous notez rarement que vous en dépendez. Elle n'apparaît jamais sur une facture, donc jamais dans une réunion de planification.
Je démarre moi aussi la plupart de mes side projects sur des offres gratuites ou bon marché. Ce que je trouve à reprocher à mon ancien code, ce n'est pas l'offre gratuite en soi. C'est que l'ID du modèle traîne en chaîne littérale dans plusieurs fichiers, que l'erreur de limite de débit atterrit dans un bloc catch générique, et que personne ne sait combien de tokens chaque fonctionnalité consomme. Quand l'offre change, une décision de prix devient une session de débogage.
Il y a aussi une ligne plus discrète. La page de tarifs de Google dit que le contenu envoyé dans l'offre gratuite est « used to improve our products » (« utilisé pour améliorer nos produits »). Dans l'offre payante, non. Pour la LegalTech que je construis, où les documents des clients décrivent des inventions que personne n'a encore déposées, cette seule ligne exclut une offre gratuite.
Ce que je construis pour qu'une offre qui disparaît soit un changement de config
Quatre choses, toutes peu coûteuses à ajouter tôt.
Une seule porte pour chaque appel de modèle. Chaque appel passe par une seule fonction qui prend un nom de fonctionnalité, pas un nom de modèle. Un fichier de config associe chaque fonctionnalité à un fournisseur et à un modèle. Quand un modèle quitte une offre gratuite, je change une ligne de config. Si une recherche d'un ID de modèle le trouve dans plus d'un fichier, c'est la première chose à corriger.
Un repli qui a réellement tourné. Chaque fonctionnalité reçoit un second modèle, idéalement d'un autre fournisseur, et une règle écrite pour ce qui se passe quand le premier dit non : un 429 RESOURCE_EXHAUSTED (l'erreur que Google documente pour ses plafonds de dépense), un timeout, un modèle qui ne répond plus. Décidez par fonctionnalité si on échoue en ouvert ou en fermé. Le petit modèle juge que je fais tourner dans un side project échoue en ouvert pendant un moment, puis se met à rejeter après huit échecs consécutifs, parce que ce qu'il laisse passer ne se reprend pas. Ensuite, faites passer chaque semaine un peu de trafic réel par le repli. Un repli qui n'a jamais servi une seule requête est une supposition.
Les tokens par fonctionnalité, journalisés à chaque appel. Stockez les tokens d'entrée et de sortie à côté du nom de la fonctionnalité. Ce tableau transforme « l'offre gratuite a disparu » en un chiffre en cinq minutes. Disons qu'une fonctionnalité lit 20 millions de tokens en entrée et en écrit 2 millions en sortie par mois sur Gemini 3.8 Flash. Au prix payant jusqu'au 31 décembre, cela fait 20 × 0,75 $ + 2 × 3,75 $ = 22,50 $ par mois. À partir du 1er janvier, cela fait 20 × 1,50 $ + 2 × 7,50 $ = 45 $. Sans le tableau, vous devinez le montant de votre propre facture.
Un plafond et une alerte avant la première requête payante. Depuis mars, AI Studio permet de fixer un plafond de dépense mensuel par projet. Google l'étiquette comme expérimental et prévient que les données de facturation peuvent avoir environ dix minutes de retard, donc des dépassements restent possibles. Au-dessus, chaque palier de facturation a son propre plafond mensuel, 250 $ pour le Tier 1. Et passer au payant implique désormais de prépayer au moins 5 $ de crédit : la documentation de facturation dit que l'API « will only serve requests if you have a positive Prepay credit balance » (« ne servira des requêtes que si vous avez un solde de crédit prépayé positif »). Un solde vide est aussi une panne, alors alertez sur le solde, pas seulement sur la dépense.
Google vient de montrer le schéma
Le plus drôle, c'est que le changement de Google est exactement cette architecture, appliquée à ses propres utilisateurs. Quand le calcul coûte cher, envoyez le trafic qui rapporte le moins vers le modèle le moins cher, gardez les meilleurs modèles pour le trafic qui paie, et changez l'association avec une table, pas avec une réécriture. Flash-Lite devient le plancher.
Votre application mérite le même levier. Décidez dès maintenant quelles fonctionnalités pourraient tourner sur un modèle de classe Lite s'il le fallait, et testez-les sur l'un d'eux, une fois. Si la réponse est « toutes, un peu moins bien », la disparition d'une offre gratuite est un mardi ordinaire. Si la réponse est « aucune », vous avez trouvé une dépendance qui vaut la peine d'être payée, avant que quelqu'un d'autre n'en choisisse la date.
Lundi, cherchez les IDs de modèles dans votre code. Le nombre de résultats, c'est le nombre d'endroits où un seul e-mail de tarification peut tout casser.
Sources
- The Verge, "Google is about to remove free access to Gemini Flash and Pro" (6 octobre 2026)
- Gemini Apps Help, "Changes to Gemini model access and limits" (consulté le 7 octobre 2026)
- Google, "Get more out of Gemini" (consulté le 7 octobre 2026)
- Google AI for Developers, "Gemini Developer API pricing" (mis à jour le 6 octobre 2026)
- Google AI for Developers, "Release notes" (mis à jour le 6 octobre 2026)
- Google AI for Developers, "Rate limits" (mis à jour le 2 septembre 2026)
- Google AI for Developers, "Billing" (mis à jour le 28 septembre 2026)
- Google AI Developers Forum, "Reduced Rate Limits" (25 janvier 2026)
