Le 3 mars 2026, Google publie sur son blog officiel l'article « Gemini 3.1 Flash-Lite: Built
for intelligence at scale », complété par la fiche modèle correspondante sur Google DeepMind.
Gemini 3.1 Flash-Lite est présenté comme le membre le plus rapide et le moins coûteux de la
famille Gemini 3, construit sur l'architecture de Gemini 3 Pro : un mixture-of-experts
(MoE) épars, où seul un sous-ensemble des paramètres du modèle — les « experts » — est activé
pour chaque token, ce qui découple la capacité totale du modèle du coût de calcul par requête.
Le modèle accepte jusqu'à 1 048 576 tokens (environ 1 million) en entrée — texte, images,
audio et vidéo — et peut générer jusqu'à 65 536 tokens en sortie, code compris. Il est
facturé 0,25 dollar par million de tokens en entrée et 1,50 dollar par million de tokens en
sortie (hors mise en cache), et déployé en préversion via Google AI Studio, ainsi que via
Vertex AI pour les usages entreprise.
Google publie un tableau comparatif opposant Gemini 3.1 Flash-Lite à cinq autres modèles — dont
Gemini 2.5 Flash, Gemini 2.5 Flash-Lite, GPT-5 mini et Claude 4.5 Haiku (mode
« Extended Thinking ») — sur onze benchmarks. Sur six d'entre eux, Gemini 3.1 Flash-Lite
devance à la fois GPT-5 mini et Claude 4.5 Haiku :
- GPQA Diamond (questions scientifiques de niveau doctorat) : 86,9 %, contre 82,3 %
pour GPT-5 mini et 73,0 % pour Claude 4.5 Haiku.
- MMMU-Pro (compréhension et raisonnement multimodal) : 76,8 %, contre 74,1 % et 58,0 %.
- SimpleQA Verified (connaissance paramétrique) : 43,3 %, contre seulement 9,5 % et
5,5 %.
- FACTS Benchmark Suite (factualité, sur grounding/parametric/search/multimodal) :
40,6 %, contre 33,7 % et 18,6 %.
- MMMLU (questions-réponses multilingues) : 88,9 %, contre 84,9 % et 83,0 %.
- MRCR v2 (performance en contexte long, moyenne sur une fenêtre de 128 000 tokens) :
60,1 %, contre 52,5 % et 35,3 % — sur la fenêtre à 1 million de tokens, GPT-5 mini et
Claude 4.5 Haiku ne sont pas dimensionnés pour la mesure.
Sur les cinq benchmarks restants, Gemini 3.1 Flash-Lite reste compétitif sans dominer
systématiquement : GPT-5 mini fait mieux sur Humanity's Last Exam (16,7 % contre 16,0 %), sur
CharXiv Reasoning — synthèse d'information à partir de graphiques complexes (75,5 % contre
73,2 %) — et sur LiveCodeBench (80,4 % contre 72,0 %) ; l'ancien modèle Gemini 2.5 Flash, plus
cher, reste devant sur le FACTS Benchmark Suite (50,4 % contre 40,6 %) et sur MRCR v2 au format
1 million de tokens (21,0 % contre 12,3 %).
Google revendique par ailleurs un score Elo de 1432 sur le classement Arena.ai, un temps de
première réponse 2,5 fois plus rapide et un débit de sortie 45 % supérieur à ceux de Gemini 2.5
Flash. Sur le débit brut, le même tableau annonce 363 tokens par seconde pour Gemini 3.1
Flash-Lite, contre 71 pour GPT-5 mini, 108 pour Claude 4.5 Haiku et 145 pour Grok 4.1 Fast.
- Google — Gemini 3.1 Flash-Lite: Built for intelligence at scale — 3 mars 2026, annonce officielle
- Google DeepMind — Gemini 3.1 Flash-Lite, fiche modèle — 3 mars 2026, architecture, fenêtre de contexte et sortie
- Google DeepMind — Gemini 3 Pro, fiche modèle (PDF) — architecture mixture-of-experts sous-jacente