Test du Gemini 3.5 Flash-Lite : essais pratiques, prix et performances

Test du Gemini 3.5 Flash-Lite : essais pratiques, prix et performances

Le modèle Gemini 3.5 Flash-Lite vaut-il le coup ? Oui, en particulier pour les tâches rapides et reproductibles telles que le traitement de documents, l'extraction structurée, la traduction et les tâches de codage délimitées. Il combine une fenêtre d'entrée d'un million de tokens, des tarifs d'API avantageux et des vitesses de sortie parmi les plus rapides de sa catégorie.

Au cours de mes quatre essais contrôlés, Gemini 3.5 Flash-Lite Il a mené à bien toutes les tâches dès la première demande et a obtenu un score de 38/40. Il s'est montré excellent en matière d'extraction JSON, de localisation et de débogage, mais son registre d'actions pour les documents volumineux a attribué deux propriétaires à des éléments qui auraient dû rester non attribués. Le verdict pratique est simple : utilisez-le pour le débit, mais vérifiez les champs où la moindre erreur peut avoir des conséquences.

Si vous souhaitez l'essayer sans configurer d'API, GlobalGPT C'est un moyen simple de commencer. Gemini 3.5 Flash-Lite est disponible aux côtés de des modèles populaires tels que GPT-5.6, Claude Fable 5 et Kimi K3, vous permettant ainsi de bénéficier des atouts de plusieurs familles d'IA de premier plan au sein d'un même espace de travail.

Test du Gemini 3.5 Flash-Lite : le verdict en bref

Verdict : Ce modèle est parfaitement adapté aux tâches rapides et peu coûteuses dont les résultats peuvent être vérifiés automatiquement : extraction de données JSON, localisation, classification et corrections de code ciblées. Il a traité les quatre requêtes de test dès le premier essai technique et a affiché un temps moyen de 3,748 secondes de bout en bout via l’itinéraire Broly. Pour les documents longs, sa compréhension du contenu principal était bonne, mais un champ « propriétaire » strict était erroné dans deux des trois exécutions. Utilisez-le pour le débit ; vérifiez les champs à fort impact.
38/40score objectif de première sortie
3,748 stemps de réponse moyen des appels acheminés
4/4tâches réalisées dès la première demande
$0.0037Coût d'un test équivalent à l'API
  • Ses points forts : extraction structurée, localisation et débogage ciblé.
  • Avertissement principal : Les champs de propriété exacts dans les documents volumineux doivent faire l'objet d'une validation.
  • Argumentaire de valeur : les travaux à haut débit où la rapidité et le coût des appels répétés sont tous deux déterminants.
Intégrer le Gemini 3.5 Flash-Lite dans un flux de travail AI complet

Utilisez-le pour réaliser rapidement des tâches liées aux documents, à la localisation et aux données structurées, puis poursuivez votre travail avec des modèles de pointe et des outils créatifs au sein du même espace de travail GlobalGPT.

Qu'est-ce que le Gemini 3.5 Flash-Lite ?

Gemini 3.5 Flash-Lite Il s'agit du modèle le plus rapide et le moins coûteux de la gamme 3.5 de Google. La documentation officielle de l'API le décrit comme un modèle multimodal à faible latence, optimisé pour le traitement à haut débit par des sous-agents, l'analyse de documents et l'extraction simple de données. Il accepte du texte, des images, des vidéos, des fichiers audio et des PDF, mais produit du texte plutôt qu'une sortie native sous forme d'image, d'audio ou de vidéo.

Les limites publiées sont de 1 048 576 tokens en entrée et de 65 536 tokens en sortie. Cela rend le modèle adapté aux vastes collections de documents, même si une fenêtre de contexte étendue ne garantit pas une extraction parfaite à partir de chaque champ. La documentation du modèle indique que les sorties structurées, l'appel de fonctions, l'exécution de code, la recherche de fichiers, l'ancrage de recherche, la mise en cache, la réflexion et le contexte URL sont pris en charge.

La spécification officielle du modèle mentionne des entrées multimodales, une sortie textuelle et une limite d'entrée de 1 048 576 tokens.

Il convient de signaler un conflit dans la documentation. L'article de Google annonçant le lancement indique que la fonctionnalité « Computer Use » est désormais intégrée, tandis que la référence du modèle consultée le 22 juillet précise que cette fonctionnalité n'est pas prise en charge. Cela peut s'expliquer par des différences entre les interfaces produit ou par un retard dans la mise à jour de la documentation. Si cette fonctionnalité est indispensable, vérifiez l'API ou l'interface de la plateforme exacte avant de concevoir un workflow de production.

Gemini 3.5 Fonctionnalités de Flash-Lite et tâches les mieux adaptées

L'avantage pratique ne réside pas simplement dans la rapidité de la réponse. Le modèle combine des entrées à contexte étendu, des niveaux de réflexion contrôlables et des sorties contraintes par des schémas, le tout à un coût adapté à des appels répétés. Google cite notamment la recherche agentique, le traitement de documents, la traduction et le traitement simple de données. Il s'agit là de charges de travail pour lesquelles un gain, même modeste, sur chaque requête prend toute son importance à grande échelle.

  • Opérations sur les documents : résumer des dossiers, identifier les mesures à prendre, classer les documents et répondre aux questions contenues dans de volumineux dossiers.
  • Traitement structuré : convertir des messages ou des rapports désorganisés en format JSON standardisé pour permettre l'automatisation en aval.
  • Localisation : conserver les noms, les chiffres et les contraintes tout en adaptant le ton au marché cible.
  • Sous-tâches de l'agent : gérer des étapes délimitées qui ne nécessitent pas le modèle de raisonnement le plus coûteux.
  • Aide à la programmation : identifier les bogues isolés, proposer des corrections et générer des tests exécutables.

Gemini 3.5 : tests de performances Flash-Lite

Google fait état d'une amélioration significative d'une génération à l'autre. Les progrès les plus marqués concernent le codage agentique, l'interaction avec l'ordinateur et la recherche dans des contextes étendus. Il s'agit de résultats communiqués par l'éditeur ; ils décrivent donc des performances obtenues dans le cadre d'évaluations contrôlées, et non un comportement garanti dans un environnement de travail privé.

Référence3.5 Flash-LiteComparaisonCe qu'il teste
SWE-Bench Pro54.2%3 Flash : 49,61 TP40TVéritables missions d'ingénierie logicielle
Terminal-Bench 2.154.0%3.1 Flash-Lite : 31.0%Codage terminal et agentique
OSWorld-Vérifié74.0%3 Flash : 65,11 TP40TInteraction avec l'ordinateur
GDPval-AA v211403.1 Flash-Lite : 642Le travail intellectuel dans la vie réelle
GDM-MRCR v272.2%3.1 Flash-Lite : 60.1%Récupération de contextes longs
Amélioration officielle par rapport au modèle de référence
Terminal-Bench 2.1
+23.0
SWE-Bench Pro
+4.6
OSWorld-Vérifié
+8.9
GDM-MRCR v2
+12.1

Gains en points de pourcentage. Les tests Terminal-Bench et GDM-MRCR sont comparés à 3.1 Flash-Lite ; les tests SWE-Bench Pro et OSWorld sont comparés à Gemini 3 Flash. Source : Google, 21 juillet 2026.

Google indique un débit de 350 jetons par seconde et des tarifs API de $0,30 pour les entrées et de $2,50 pour les sorties par million de jetons.

Des données indépendantes apportent un éclairage utile. Au moment de la vérification, Artificial Analysis indiquait Gemini 3.5 Flash-Lite un score de 36 à l'indice d'intelligence et un débit de 388,8 tokens par seconde. L'article de Google annonçant le lancement mentionnait un chiffre arrondi antérieur de 350 tokens par seconde, fourni par la même organisation. Cette évolution rappelle que les pages de benchmark en temps réel peuvent être mises à jour à mesure que les fournisseurs, les échantillons et les fenêtres de mesure évoluent.

Artificial Analysis a mesuré une vitesse de production très élevée, tout en soulignant que des concurrents proposant des prix similaires peuvent afficher des prix par jeton plus bas.

Comme on pouvait s’y attendre, les réactions de la communauté le premier jour ont été mitigées. Un message sur Reddit a qualifié le modèle de « pas en arrière », sans toutefois apporter beaucoup d’éléments concrets au niveau des tâches ; une autre discussion a mis en avant l’amélioration constatée dans le traitement des contextes longs. Sur X, le développeur en IA Philipp Schmid s’est concentré sur le résultat de 350 tokens par seconde et sur le coût estimé de la tâche. Ces publications constituent des indications utiles sur ce qui importe aux utilisateurs — la vitesse, le prix et la qualité d’une génération à l’autre — mais elles sont trop précoces et trop anecdotiques pour l’emporter sur des tests contrôlés.

Comment j'ai testé le Gemini 3.5 Flash-Lite

Le 22 juillet 2026, j'ai exécuté quatre tâches sur un seul modèle, en utilisant l'identifiant exact du modèle gemini-3.5-flash-lite via une passerelle Broly configurée. Chaque tâche a utilisé le premier résultat valide. J’ai figé les invites, les réponses correctes, les validateurs et les règles de nouvelle tentative avant de consulter les résultats. Seule la tâche portant sur le document long a déclenché un contrôle de stabilité préenregistré comprenant trois exécutions.

TâchesExtraction structurée, synthèse de documents volumineux, localisation et débogage en Python
MarquageVérifications objectives par rapport aux schémas, aux données de référence, aux contraintes et aux tests exécutables
CalendrierLatence de la route Broly de bout en bout, et non la vitesse de sortie native de Google
CoûtEstimation équivalente à celle de l'API, calculée à partir des taux officiels des jetons ; il ne s'agit pas des frais d'abonnement GlobalGPT

Résultats des tests pratiques du Gemini 3.5 Flash-Lite

Extraction structurée10/10
3,298 sdurée du trajet
347nombre total de jetons
$0.00041Équivalent API
Passe dès la première tentative
Mémoire de grande longueur8/10
4,595 sdurée du trajet
1,587nombre total de jetons
$0.00172Équivalent API
Erreur de champ « propriétaire »
Localisation10/10
3,524 sdurée du trajet
410nombre total de jetons
$0.00047Équivalent API
Toutes les contraintes sont respectées
Débogage de Python10/10
3,574 sdurée du trajet
642nombre total de jetons
$0.00111Équivalent API
Tous les tests ont été réussis

Test n° 1 : Extraction de données structurées

Note sur les opérations désordonnées → JSON strict10/10
9/9clés obligatoires
ValideAnalyse de JSON
0champs inventés
  • Toutes les valeurs indiquées ont été enregistrées.
  • Le délai d'attente éventuel n'a pas été explicitement confirmé.
  • J'ai supprimé la note de renouvellement non pertinente.
  • Aucune intervention n'était nécessaire.

Avis pratique : C'était le résultat le plus « propre » de la série. J'aurais pu transmettre directement la sortie à un analyseur syntaxique, ce qui correspond exactement à ce que doit faire un modèle d'extraction à haut débit.

Afficher l'invite et la sortie du modèle
Prompt
Convertissez ces notes d'assistance désorganisées en un seul objet JSON comportant exactement les clés suivantes : customer, plan, issue, affected_users, first_reported, workaround, owner, next_update, unresolved. Utilisez la valeur null lorsqu'une valeur n'est pas indiquée et ne renvoyez que du JSON valide.

Remarques : Northstar Labs — Formule Growth. Les exportations CSV de plus de 50 000 lignes se bloquent à 92%. 14 analystes sont concernés. Solution de contournement : fractionner les exportations en lots de moins de 20 000 lignes. Priya est en charge de l'enquête. Un dépassement du délai d'attente de la file d'attente est possible, mais non confirmé. Prochaine mise à jour : mardi à 16 h 00 UTC.

Extrait de l'énoncé : la phrase superflue concernant la note de renouvellement a été omise ici pour faciliter la lecture ; elle figurait toutefois dans l'énoncé exact de l'épreuve.

Résultats du modèle
{
  "client" : "Northstar Labs",
  "formule" : "Growth",
  "problème" : "Les exportations CSV de plus de 50 000 lignes se bloquent à 92%",
  "utilisateurs_concernés" : 14,
  "première_signalisation" : "lundi 09h15 UTC",
  "solution_de_contournement" : "diviser les exportations en lots de moins de 20 000 lignes",
  "responsable" : "Priya",
  "prochaine_mise_à_jour" : "mardi 16 h 00 UTC",
  "non_résolu" : ["délai d'attente de file d'attente possible (non confirmé)"]
}

Test n° 2 : Compréhension de documents longs

Dossier de projet → Synthèse de 140 mots8/10
6/6faits essentiels
≤ 140limite de mots respectée
1erreur de champ
  • Les dates de lancement et de mise en vigueur de la politique de confidentialité ont été récupérées.
  • Le taux de défaillance de 1,81 TP40T et l'objectif de 1,01 TP40T ont été maintenus.
  • A rejeté à juste titre deux propositions non approuvées.
  • Manqué : a indiqué les services comme responsables au lieu de Non attribué.

Avis pratique : Le résumé rendait bien compte du processus décisionnel, mais une erreur de la part du responsable pourrait entraîner l'envoi d'une action à l'équipe qui n'est pas la bonne. C'est là que “ presque correct ” ne suffit pas.

Afficher un extrait de la demande et un exemple de résultat
Extrait de la consigne
Divisez le dossier « Project Atlas » en quatre sections distinctes : Résumé exécutif (140 mots maximum), Décisions confirmées, Registre des actions et Questions en suspens/Risques. Dans le Registre des actions, indiquez les champs suivants : Responsable, Action, Date d'échéance, Dépendance, Statut.

Utilisez la date de lancement confirmée du 12 août, avec la condition de confidentialité du 5 août, ainsi que le taux d’incidents actuel de 1,81 TP40T par rapport à l’objectif de 1,01 TP40T. Ne transformez pas la proposition française, le plafond de $18 000, la mention de septembre ou le projet d’e-mail en engagements approuvés. Lorsque le dossier n’indique ni responsable ni date d’échéance, inscrivez « Non attribué ».

Le cahier des charges comprenait l'ensemble du dossier du projet, composé de huit sections ; cet extrait reprend les instructions et les informations essentielles.

Extrait des résultats du modèle
Note de synthèse : Le projet Atlas est prévu pour le 12 août, à condition que l'examen relatif à la protection de la vie privée soit clôturé d'ici le 5 août. Le taux d'erreurs sur mobile s'élève à 1,81 TP40T, contre un objectif de 1,01 TP40T pour la mise en production. La localisation en français n’a pas été approuvée, et le plafond de test de $18 000 ne constitue pas une autorisation de dépense.

Extrait du registre des actions :
| Responsable   | Action | Date limite |
| Confidentialité | Effectuer les vérifications restantes de l'examen de confidentialité     | 5 août    |
| Juridique   | Examiner la déclaration de traitement des données mise à jour    | Non attribué |

Valeur attendue du responsable pour les deux lignes : Non attribué.

Le résultat a conservé les décisions principales, mais a transformé deux fonctions organisationnelles en responsables, ce qui a donné lieu à la note de 8/10.

J'ai répété cette tâche à deux reprises en appliquant la règle de stabilité figée. Les faits principaux sont restés corrects lors des trois exécutions, mais la règle stricte du propriétaire n'a été respectée qu'une seule fois. Gemini 3.5 Flash-Lite semble donc fiable pour la lecture du contenu d'un paquet long, mais pas pour l'extraction non supervisée de tous les champs dépendants du schéma.

Contrôle de stabilité sur trois cycles
1re manche
8/10
2e manche
10/10
3e manche
8/10
  • Les faits essentiels sont exacts : 3/3 courses
  • Règle exacte concernant le propriétaire : 1/3 de course

Test n° 3 : Traduction et localisation

Texte de présentation du produit → localisation soumise à des contraintes10/10
99mots prononcés
4/4chiffres clés
0termes interdits
  • Les deux noms de produits requis ont été conservés.
  • Aucune promesse non prise en charge n'a été ajoutée.
  • À lire dans son sens naturel plutôt que selon une traduction littérale.

Avis pratique : Le texte était utilisable après une petite retouche stylistique : l'appel à l'action reprenait le nom du modèle. Les contraintes strictes ont quant à elles été parfaitement respectées.

Afficher l'invite et la sortie du modèle
Prompt
Traduisez la mise à jour du produit en chinois vers un anglais américain naturel pour une annonce intégrée à l'application. Utilisez entre 90 et 120 mots et un titre ne dépassant pas huit mots. Conservez les mentions suivantes : GlobalGPT, Gemini 3,5 Flash-Lite, 350 jetons/seconde, $0,30, $2,50 et 1 million de jetons. Évitez les termes “ révolutionnaire ”, “ qui change la donne ”, “ le moins cher ” et “ le meilleur ”. Terminez par un appel à l'action (CTA) sobre, en une seule phrase.

Le test complet fournissait également le paragraphe source chinois décrivant la disponibilité, le positionnement, les tarifs, la taille du contexte et les flux de travail les mieux adaptés.

Résultats du modèle
Gemini 3.5 Flash-Lite désormais disponible

Le modèle GlobalGPT prend désormais en charge le Gemini 3.5 Flash-Lite, un modèle conçu pour les tâches nécessitant une faible latence et un débit élevé. Avec une vitesse de génération officiellement estimée à environ 350 tokens par seconde, il dispose d’une fenêtre de contexte d’un million de tokens.

La tarification de l’API est fixée à $0,30 par million de tokens d’entrée et à $2,50 par million de tokens de sortie. Ce modèle est particulièrement adapté à la traduction, au traitement de documents, à l’extraction structurée et aux workflows en plusieurs étapes.

Vous pouvez dès aujourd’hui sélectionner ce modèle dans GlobalGPT et l’utiliser aux côtés d’autres modèles de pointe au sein de la même plateforme.

Commencez dès maintenant à utiliser Gemini 3.5 Flash-Lite dans votre workflow.

Test n° 4 : débogage en Python

Fonction de tarification présentant un bug → correction testée10/10
2/2bogues identifiés
5/5assertions obligatoires
4/4types non valides rejetés
  • On a empêché les valeurs booléennes Python d'être interprétées comme des entiers.
  • La réduction n'a été appliquée qu'au-delà du seuil.
  • Les quatre totaux attendus ont été renvoyés.

Avis pratique : La correction s'est exécutée immédiatement et l'explication était suffisamment concise pour être consultée rapidement. Cela favorise un débogage ciblé, et non un travail autonome sur le dépôt.

Afficher l'invite et la sortie du modèle
Prompt
Déboguez cette fonction. Les 100 premières unités coûtent $0,10 chacune ; chaque unité au-delà de 100 coûte $0,07. La quantité doit être un entier non négatif. Actuellement, la fonction facture un montant erroné au-delà de 100 et accepte des valeurs booléennes. Fournissez un diagnostic en deux phrases, le code Python corrigé, ainsi que cinq assertions pour les valeurs 0, 100, 101, 250 et une entrée non valide.

def calculate_cost(quantity) :
    if not isinstance(quantity, int) or quantity < 0:
 raise ValueError(...)
    if quantity <= 100:
 return round(quantity * 0.10, 2)
    return round(quantity * 0.07, 2)
Extrait des résultats du modèle
def calculate_cost(quantity) :
    si type(quantity) n'est pas un entier ou si quantity < 0 :
    lève une exception ValueError('quantity doit être un entier non négatif')
    si quantité <= 100 :
 total = quantité * 0,10
    sinon :
 total = (100 * 0,10) + ((quantité - 100) * 0,07)
    return round(total, 2)

assert calculate_cost(0) == 0.00
assert calculate_cost(100) == 10.00
assert calculate_cost(101) == 10.07
assert calculate_cost(250) == 20.50

Le résultat complet comprenait également le test de rejet booléen demandé ainsi qu'un diagnostic en deux phrases pour chacun des deux bogues.

Gemini 3.5 Vitesse Flash-Lite et coût des tests

3,298 stâche dont l'acheminement est le plus rapide
4,595 stâche dont l'acheminement est le plus lent
2,986jetons combinés
$0.0037équivalent API combiné
Durée du trajet de Broly de bout en bout
Extraction structurée
3,30 s
Document long
4,60 s
Localisation
3,52 s
Débogage de Python
3,57 s

Les mesures « de la requête à la réponse » incluent les temps de traitement au niveau de la passerelle, du réseau et du fournisseur d'accès. Elles ne correspondent pas à la vitesse de génération des jetons de sortie propre à Google.

Sur les quatre premiers résultats, Gemini 3.5 Flash-Lite a affiché un temps moyen de 3,748 secondes. Les tâches ont utilisé 1 708 tokens d'entrée et 1 278 tokens de sortie. Aux tarifs de référence officiels, leur coût combiné, exprimé en équivalent API, s'élevait à $0,0037074. Cela illustre le fonctionnement économique des tokens ; il ne s'agit pas d'un abonnement à GlobalGPT et cela n'inclut pas les appels aux outils payants.

Gemini 3.5 Flash-Lite : prix et rapport qualité-prix

Tarifs officiels de l'API Gemini

UtilisationTaux officielQuels sont les motifs à l'origine de ce projet de loi ?
Jetons d'entrée$0,30 / 1MConsignes, documents et autres éléments de contexte envoyés au modèle
Jetons de sortie$2,50 / 1MLes jetons de réponse, y compris les jetons de réflexion
OutilsVariableLes recherches ou l'utilisation d'autres outils payants peuvent entraîner des frais supplémentaires
Que signifient concrètement les taux de l'API ?
Extraction abrégéeEntrée 10K + sortie 1K ≈ $0.0055
Document volumineux100 000 en entrée + 5 000 en sortie ≈ $0.0425
1 000 petits boulots10 M en entrée + 1 M en sortie ≈ $5.50

Ces estimations ne tiennent pas compte des coûts liés à la mise en cache, à la recherche, aux autres outils et aux frais de plateforme.

  • Le coût de la sortie est environ 8,3 fois plus élevé par jeton que celui de l'entrée.
  • Des formats rigoureux et des réponses concises peuvent réduire considérablement les coûts liés à un volume élevé.
  • La facturation par API convient aux développeurs qui ont besoin d'un accès programmatique facturé à l'utilisation et d'un contrôle détaillé de leur consommation.

Qualifier ce modèle de “ bon marché ” doit également être replacé dans son contexte. Artificial Analysis a décrit son taux de production de $2,50 comme élevé par rapport à une moyenne de $0,87 parmi les modèles comparables sélectionnés, tout en classant ce modèle parmi les meilleurs en termes de vitesse. La valeur ajoutée réside donc dans la vitesse et l’intelligence utile, et non dans le prix par jeton le plus bas du marché.

Utilisation de Gemini 3.5 Flash-Lite avec les formules d'abonnement GlobalGPT

GlobalGPT utilise un modèle d'abonnement et de crédits plutôt que de présenter directement la facture du jeton API Gemini. Les tarifs ci-dessous étaient visibles le 22 juillet 2026, avec la facturation annuelle sélectionnée.

De base

$5.8 /mois
Taux mensuel $11.9

144 000 crédits par an
  • Accès à toutes les modèles de chat
  • Unikorn V7 (de type MJ), plus de 10 modèles d'images avancés et un éditeur d'images
  • Accès à des modèles vidéo avancés
  • Eleven Lab v3, Deep Research, AI Detector et ChatPDF

Meilleur pour : des discussions occasionnelles et des flux de travail créatifs plus simples qui ne nécessitent pas l'accès complet à Pro pour les images, les vidéos, l'audio et les agents.

Illimité · 50% en promotion

$25.0 /mois
Taux mensuel $49.9

624 000 crédits par an
  • Toutes les fonctionnalités de la version Pro
  • Utilisation illimitée sur certains modèles d'IA
  • Les modèles Premium peuvent tout de même consommer des crédits

Meilleur pour : les utilisateurs réguliers qui souhaitent bénéficier d'un flux de travail aussi complet que possible et d'un choix illimité de modèles.

Gemini 3.5 API Flash-Lite ou GlobalGPT : lequel offre le meilleur rapport qualité-prix ?

ChoisirQuand ça convientCompromis
API GeminiVous développez une application, vous automatisez un pipeline ou vous avez besoin de journaux d'utilisation précis.La facturation à l'utilisation est efficace, mais vous devez gérer vous-même l'intégration, les clés et les autres fournisseurs de modèles.
GlobalGPT BasicVous recherchez une solution abordable pour des discussions occasionnelles et des tâches d'IA peu exigeantes.Le volume de crédit est plus restreint.
GlobalGPT ProVous utilisez régulièrement des modèles linguistiques de pointe en association avec des outils de recherche, de traitement d'images, de traitement audio ou d'agents.Il convient de continuer à surveiller les crédits et les coûts par outil.
GlobalGPT IllimitéVous utilisez fréquemment plusieurs familles de modèles et appréciez de disposer d'un seul espace de travail.“La formule ” illimitée » ne s'applique qu'à certains modèles ; les modèles haut de gamme peuvent toujours utiliser des crédits.

Pour la plupart des évaluateurs individuels et des équipes de contenu, la formule Pro est l’offre GlobalGPT la plus équilibrée : elle permet de conserver le flux de travail multimodèle tout en évitant le prix plus élevé de la formule Unlimited. Les développeurs qui appellent Gemini 3.5 Flash-Lite des milliers de fois depuis un produit préféreront généralement l'API officielle, car la facturation au niveau des jetons et l'automatisation priment sur un espace de travail visuel partagé. Consultez le détails du dernier plan avant d'effectuer le paiement, car les promotions, les crédits attribués et l'accès aux modèles peuvent changer.

Avantages et inconvénients

PourCons
  • Vitesse de sortie mesurée extrêmement élevée
  • Contexte d'entrée du jeton 1M
  • Entrée multimodale et sortie structurée
  • Excellents résultats lors des premiers tests de production
  • Coût réduit pour des tâches courtes et répétitives
  • Sortie texte uniquement
  • Les champs de documents longs « Exact » peuvent tout de même subir des décalages
  • Le prix de vente n'est pas le plus bas du marché
  • La documentation relative à l'utilisation des ordinateurs manque de cohérence
  • La latence du parcours varie selon le fournisseur et la plateforme

À qui s'adresse le Gemini 3.5 Flash-Lite ?

Gemini 3.5 Flash-Lite Cette approche est particulièrement adaptée aux équipes traitant un grand nombre de documents, de dossiers d'assistance, de traductions ou de messages structurés ; aux développeurs attribuant des sous-tâches délimitées à un agent ; ainsi qu'aux produits où la latence est perceptible par l'utilisateur. Elle s'avère moins pertinente lorsqu'une tâche nécessite le raisonnement le plus poussé possible, la génération native de médias ou une extraction à tolérance zéro sans validation. Si vous avez besoin d’une solution plus performante sans quitter la gamme Flash, notre Gemini 3.6 : aperçu rapide aborde sa tarification, ses tests comparatifs, son flux de travail via l'API et ses performances en conditions réelles.

Le mode de fonctionnement le plus sûr est simple : utilisez le modèle pour un premier passage rapide, ajoutez des vérifications basées sur un schéma objectif et des règles métier, puis confiez les cas ayant échoué ou présentant un risque élevé à un modèle plus performant ou à un réviseur humain. Si cette étape suivante se résume à un choix entre rapidité et raisonnement plus approfondi, notre Comparaison entre Gemini 3.6 Flash et Gemini 3.1 Pro utilise six tests basés sur la même consigne pour déterminer où se situe chaque modèle. GlobalGPT facilite ce flux de travail global en regroupant en un seul endroit les modèles de référence ainsi que l'ensemble du processus de recherche, de rédaction, de programmation et de création.

Verdict final : le Gemini 3.5 Flash-Lite vaut-il le coup ?

Oui, lorsque la vitesse, le débit et la maîtrise des coûts priment sur l'optimisation de la profondeur de raisonnement pour chaque appel. Lors de mes tests, Gemini 3.5 Flash-Lite Il s'est montré excellent pour l'extraction de données JSON, la localisation sous contraintes et une tâche de débogage délimitée. Il a également su identifier les informations essentielles dans un paquet volumineux, mais l'erreur concernant le champ « owner » s'est reproduite lors de deux des trois essais. Il s'agit là d'une limite utile, mais pas d'un obstacle rédhibitoire.

Il vaut mieux considérer ce modèle comme un collaborateur efficace, dont les compétences sont validées dans des domaines clés. Pour l'évaluer de manière équitable, essayez de lui soumettre une requête issue de votre propre flux de travail plutôt qu'une question de culture générale.

Utilisez le Gemini 3.5 Flash-Lite sans perturber votre flux de travail

Ouvrez-le dans GlobalGPT pour un traitement rapide des documents, la localisation et les tâches structurées, puis passez à la recherche, à la rédaction, au codage ou à la création de contenu à l'aide d'autres modèles et outils de pointe au sein du même espace de travail.

Questions fréquemment posées

Combien coûte un Gemini 3.5 Flash-Lite ?

Le prix de référence officiel est de $0,30 par million de jetons d'entrée et de $2,50 par million de jetons de sortie, y compris les jetons « thinking ». Les appels d'outils peuvent entraîner des frais supplémentaires. Ces tarifs d'API sont distincts des abonnements aux plateformes tierces.

À quelle vitesse va-t-il ?

L'article de Google annonçant le lancement mentionnait un débit de 350 tokens par seconde pour Artificial Analysis. La page du modèle Artificial Analysis en ligne affichait 388,8 tokens par seconde lors d'une vérification effectuée le 22 juillet 2026. Le temps de traitement réel de bout en bout dépend de la taille de la requête, de la longueur de la réponse, du niveau de réflexion, du réseau et de l'itinéraire du fournisseur.

La version Gemini 3.5 de Flash-Lite est-elle meilleure que la version 3.1 de Flash-Lite ?

Google fait état de gains importants sur les benchmarks Terminal-Bench 2.1, GDM-MRCR v2 et GDPval-AA v2. Cela confirme une nette amélioration d'une génération à l'autre, même si des tests spécifiques à chaque charge de travail restent nécessaires.

Est-ce qu'il prend en charge les images, les fichiers audio, les vidéos et les PDF ?

Oui. La documentation officielle mentionne les formats d'entrée suivants : texte, image, vidéo, audio et PDF. Le modèle génère du texte, mais ne produit pas nativement d'images, de fichiers audio ou de vidéos.

“ Gemini 3.5 Lite ” est-il le nom correct ?

Non. Le nom officiel est Gemini 3.5 Flash-Lite. “ Gemini 3.5 Lite ” est une abréviation informelle qui peut prêter à confusion avec d'autres générations de Flash-Lite.

Sources : Annonce du lancement par Google; Référence du modèle API Gemini; Tarifs de l'API Gemini; Analyse artificielle; Discussion sur Reddit; Commentaire X. Les chiffres officiels des tests de performance sont fournis par les fabricants ; les chiffres issus des tests pratiques proviennent de la série de tests contrôlés du 22 juillet décrite ci-dessus.

Partager l'article :

Articles connexes