Google lance Gemini 3.1 Flash-Lite, son modèle Gemini le plus rapide et le moins cher

Google publie le 3 mars 2026 Gemini 3.1 Flash-Lite, un modèle mixture-of-experts basé sur Gemini 3 Pro, facturé 0,25 dollar le million de tokens en entrée et 1,50 dollar en sortie, disponible en préversion sur Google AI Studio et Vertex AI.

3 min3 mars 2026

Ce que Google a annoncé

Le 3 mars 2026, Google publie sur son blog officiel l'article « Gemini 3.1 Flash-Lite: Built for intelligence at scale », complété par la fiche modèle correspondante sur Google DeepMind. Gemini 3.1 Flash-Lite est présenté comme le membre le plus rapide et le moins coûteux de la famille Gemini 3, construit sur l'architecture de Gemini 3 Pro : un mixture-of-experts (MoE) épars, où seul un sous-ensemble des paramètres du modèle — les « experts » — est activé pour chaque token, ce qui découple la capacité totale du modèle du coût de calcul par requête.

Le modèle accepte jusqu'à 1 048 576 tokens (environ 1 million) en entrée — texte, images, audio et vidéo — et peut générer jusqu'à 65 536 tokens en sortie, code compris. Il est facturé 0,25 dollar par million de tokens en entrée et 1,50 dollar par million de tokens en sortie (hors mise en cache), et déployé en préversion via Google AI Studio, ainsi que via Vertex AI pour les usages entreprise.

Les chiffres

Google publie un tableau comparatif opposant Gemini 3.1 Flash-Lite à cinq autres modèles — dont Gemini 2.5 Flash, Gemini 2.5 Flash-Lite, GPT-5 mini et Claude 4.5 Haiku (mode « Extended Thinking ») — sur onze benchmarks. Sur six d'entre eux, Gemini 3.1 Flash-Lite devance à la fois GPT-5 mini et Claude 4.5 Haiku :

  • GPQA Diamond (questions scientifiques de niveau doctorat) : 86,9 %, contre 82,3 % pour GPT-5 mini et 73,0 % pour Claude 4.5 Haiku.
  • MMMU-Pro (compréhension et raisonnement multimodal) : 76,8 %, contre 74,1 % et 58,0 %.
  • SimpleQA Verified (connaissance paramétrique) : 43,3 %, contre seulement 9,5 % et 5,5 %.
  • FACTS Benchmark Suite (factualité, sur grounding/parametric/search/multimodal) : 40,6 %, contre 33,7 % et 18,6 %.
  • MMMLU (questions-réponses multilingues) : 88,9 %, contre 84,9 % et 83,0 %.
  • MRCR v2 (performance en contexte long, moyenne sur une fenêtre de 128 000 tokens) : 60,1 %, contre 52,5 % et 35,3 % — sur la fenêtre à 1 million de tokens, GPT-5 mini et Claude 4.5 Haiku ne sont pas dimensionnés pour la mesure.

Sur les cinq benchmarks restants, Gemini 3.1 Flash-Lite reste compétitif sans dominer systématiquement : GPT-5 mini fait mieux sur Humanity's Last Exam (16,7 % contre 16,0 %), sur CharXiv Reasoning — synthèse d'information à partir de graphiques complexes (75,5 % contre 73,2 %) — et sur LiveCodeBench (80,4 % contre 72,0 %) ; l'ancien modèle Gemini 2.5 Flash, plus cher, reste devant sur le FACTS Benchmark Suite (50,4 % contre 40,6 %) et sur MRCR v2 au format 1 million de tokens (21,0 % contre 12,3 %).

Google revendique par ailleurs un score Elo de 1432 sur le classement Arena.ai, un temps de première réponse 2,5 fois plus rapide et un débit de sortie 45 % supérieur à ceux de Gemini 2.5 Flash. Sur le débit brut, le même tableau annonce 363 tokens par seconde pour Gemini 3.1 Flash-Lite, contre 71 pour GPT-5 mini, 108 pour Claude 4.5 Haiku et 145 pour Grok 4.1 Fast.

Sources

  • Google — Gemini 3.1 Flash-Lite: Built for intelligence at scale — 3 mars 2026, annonce officielle
  • Google DeepMind — Gemini 3.1 Flash-Lite, fiche modèle — 3 mars 2026, architecture, fenêtre de contexte et sortie
  • Google DeepMind — Gemini 3 Pro, fiche modèle (PDF) — architecture mixture-of-experts sous-jacente

Partager cet article

À lire aussi

Avant de partir

0,25 dollar le million de tokens : le bon calibrage pour votre stack ?

Le bon modèle n'est pas toujours le plus puissant : c'est celui qui correspond à vos usages et à votre budget.