Gemini 3.1 Flash-Lite est disponible depuis le 3 mars 2026 à un huitième du prix de Gemini 3.1 Pro, tout en surpassant GPT-5 mini sur la majorité des benchmarks publiés. Google DeepMind positionne ce nouveau modèle comme sa solution la plus rentable pour les applications d’intelligence artificielle à grande échelle.
Une architecture héritée de Gemini 3 Pro
Contrairement à une approche de développement indépendant, Gemini 3.1 Flash-Lite est directement dérivé de Gemini 3 Pro. Selon la fiche technique officielle de Google DeepMind publiée en mars 2026, le modèle hérite de l’architecture multimodale de son prédécesseur et traite du texte, des images, de l’audio et de la vidéo dans une fenêtre de contexte allant jusqu’à 1 million de tokens, avec une capacité de sortie de 64 000 tokens. L’entraînement a été conduit sur les TPU (Tensor Processing Units) de Google à l’aide des frameworks JAX et ML Pathways, conformément à l’engagement de l’entreprise en matière d’efficacité énergétique.
Des performances qui défient la concurrence
Les résultats publiés dans la fiche technique officielle de Google DeepMind en mars 2026 placent Gemini 3.1 Flash-Lite en tête sur plusieurs benchmarks majeurs face à ses concurrents directs. Sur le GPQA Diamond, qui mesure les connaissances scientifiques, le modèle atteint 86,9%, devançant GPT-5 mini (82,3%), Grok 4.1 Fast (84,3%) et Claude 4.5 Haiku (73,0%). Sur MMMU-Pro, qui évalue la compréhension multimodale, Flash-Lite obtient 76,8% contre 74,1% pour GPT-5 mini.
La vitesse de génération constitue un autre point fort : 363 tokens par seconde selon la fiche technique officielle de Google DeepMind, soit plus de cinq fois la cadence de GPT-5 mini (71 tokens/s) et plus du triple de Claude 4.5 Haiku (108 tokens/s). Sur les tâches multilingues mesurées par le benchmark MMMLU, Gemini 3.1 Flash-Lite atteint 88,9%, le meilleur score parmi tous les modèles du comparatif. Cette performance présente un intérêt direct pour les développeurs qui déploient des applications destinées à des marchés non anglophones.
Tarification : le détail des prix face à la concurrence
La page de tarification officielle de l’API Gemini révèle un positionnement ambitieux dans un segment très disputé. L’écart avec Gemini 3.1 Pro est de 8x sur les tokens d’entrée comme de sortie, ce qui justifie l’appellation « un huitième du coût » associée à ce modèle depuis son lancement le 3 mars 2026.
| Modèle | Prix input ($/1M tokens) | Prix output ($/1M tokens) |
|---|---|---|
| Gemini 3.1 Flash-Lite | $0,25 | $1,50 |
| Gemini 3.1 Pro | $2,00 | $12,00 |
| GPT-5 mini | $0,25 | $2,00 |
| Claude 4.5 Haiku | $1,00 | $5,00 |
| Grok 4.1 Fast | $0,20 | $0,50 |
| Gemini 2.5 Flash-Lite | $0,10 | $0,40 |
Face à GPT-5 mini, la parité sur les tokens d’entrée ($0,25) s’accompagne d’un avantage de 25% sur les tokens de sortie ($1,50 contre $2,00), un écart qui peut devenir significatif à grande échelle. Par rapport à Claude 4.5 Haiku, l’avantage est encore plus marqué : l’output est 3,3 fois moins cher, pour des performances supérieures sur la quasi-totalité des benchmarks publiés. Il convient toutefois de noter que Gemini 2.5 Flash-Lite, le modèle stable de génération précédente, reste environ 3,75 fois moins cher en sortie ($0,40).
Un outil pensé pour les déploiements à fort volume
Google DeepMind définit clairement les cas d’usage prioritaires dans sa fiche technique officielle : traduction automatique, classification de données, traitement d’informations simples et tâches agentiques à haute fréquence nécessitant une faible latence. Le modèle est accessible depuis le 3 mars 2026 via Google AI Studio, l’API Gemini et Vertex AI, avec un accès gratuit dans le cadre du niveau free tier.
Sur le plan de la sécurité, les évaluations internes indiquent une amélioration du ton des refus de 14,59% par rapport à Gemini 2.5 Flash-Lite, et une réduction des refus injustifiés de 14,41%. Ces résultats suggèrent un modèle plus nuancé dans sa gestion des requêtes sensibles. Son statut de « Preview » signifie qu’il reste susceptible d’évoluer avant sa version stable, avec des limites de débit plus restrictives que les modèles en disponibilité générale.
Avec Gemini 3.1 Flash-Lite, Google DeepMind confirme une stratégie claire : rendre les capacités des modèles de pointe accessibles à des coûts compatibles avec un déploiement en production à grande échelle. Les développeurs qui souhaitent tester le modèle peuvent le faire dès aujourd’hui sans frais depuis Google AI Studio, ce qui en fait une alternative concrète à évaluer avant tout arbitrage entre performance et budget.




No Comment! Be the first one.