Le modèle Gemini 3.5 Flash-Lite vaut-il le coup ? Oui, en particulier pour les tâches rapides et reproductibles telles que le traitement de documents, l'extraction structurée, la traduction et les tâches de codage délimitées. Il combine une fenêtre d'entrée d'un million de tokens, des tarifs d'API avantageux et des vitesses de sortie parmi les plus rapides de sa catégorie.
Au cours de mes quatre essais contrôlés, Gemini 3.5 Flash-Lite Il a mené à bien toutes les tâches dès la première demande et a obtenu un score de 38/40. Il s'est montré excellent en matière d'extraction JSON, de localisation et de débogage, mais son registre d'actions pour les documents volumineux a attribué deux propriétaires à des éléments qui auraient dû rester non attribués. Le verdict pratique est simple : utilisez-le pour le débit, mais vérifiez les champs où la moindre erreur peut avoir des conséquences.
Si vous souhaitez l'essayer sans configurer d'API, GlobalGPT C'est un moyen simple de commencer. Gemini 3.5 Flash-Lite est disponible aux côtés de des modèles populaires tels que GPT-5.6, Claude Fable 5 et Kimi K3, vous permettant ainsi de bénéficier des atouts de plusieurs familles d'IA de premier plan au sein d'un même espace de travail.
Test du Gemini 3.5 Flash-Lite : le verdict en bref
- Ses points forts : extraction structurée, localisation et débogage ciblé.
- Avertissement principal : Les champs de propriété exacts dans les documents volumineux doivent faire l'objet d'une validation.
- Argumentaire de valeur : les travaux à haut débit où la rapidité et le coût des appels répétés sont tous deux déterminants.
Utilisez-le pour réaliser rapidement des tâches liées aux documents, à la localisation et aux données structurées, puis poursuivez votre travail avec des modèles de pointe et des outils créatifs au sein du même espace de travail GlobalGPT.
Qu'est-ce que le Gemini 3.5 Flash-Lite ?
Gemini 3.5 Flash-Lite Il s'agit du modèle le plus rapide et le moins coûteux de la gamme 3.5 de Google. La documentation officielle de l'API le décrit comme un modèle multimodal à faible latence, optimisé pour le traitement à haut débit par des sous-agents, l'analyse de documents et l'extraction simple de données. Il accepte du texte, des images, des vidéos, des fichiers audio et des PDF, mais produit du texte plutôt qu'une sortie native sous forme d'image, d'audio ou de vidéo.
Les limites publiées sont de 1 048 576 tokens en entrée et de 65 536 tokens en sortie. Cela rend le modèle adapté aux vastes collections de documents, même si une fenêtre de contexte étendue ne garantit pas une extraction parfaite à partir de chaque champ. La documentation du modèle indique que les sorties structurées, l'appel de fonctions, l'exécution de code, la recherche de fichiers, l'ancrage de recherche, la mise en cache, la réflexion et le contexte URL sont pris en charge.

Il convient de signaler un conflit dans la documentation. L'article de Google annonçant le lancement indique que la fonctionnalité « Computer Use » est désormais intégrée, tandis que la référence du modèle consultée le 22 juillet précise que cette fonctionnalité n'est pas prise en charge. Cela peut s'expliquer par des différences entre les interfaces produit ou par un retard dans la mise à jour de la documentation. Si cette fonctionnalité est indispensable, vérifiez l'API ou l'interface de la plateforme exacte avant de concevoir un workflow de production.
Gemini 3.5 Fonctionnalités de Flash-Lite et tâches les mieux adaptées
L'avantage pratique ne réside pas simplement dans la rapidité de la réponse. Le modèle combine des entrées à contexte étendu, des niveaux de réflexion contrôlables et des sorties contraintes par des schémas, le tout à un coût adapté à des appels répétés. Google cite notamment la recherche agentique, le traitement de documents, la traduction et le traitement simple de données. Il s'agit là de charges de travail pour lesquelles un gain, même modeste, sur chaque requête prend toute son importance à grande échelle.
- Opérations sur les documents : résumer des dossiers, identifier les mesures à prendre, classer les documents et répondre aux questions contenues dans de volumineux dossiers.
- Traitement structuré : convertir des messages ou des rapports désorganisés en format JSON standardisé pour permettre l'automatisation en aval.
- Localisation : conserver les noms, les chiffres et les contraintes tout en adaptant le ton au marché cible.
- Sous-tâches de l'agent : gérer des étapes délimitées qui ne nécessitent pas le modèle de raisonnement le plus coûteux.
- Aide à la programmation : identifier les bogues isolés, proposer des corrections et générer des tests exécutables.
Gemini 3.5 : tests de performances Flash-Lite
Google fait état d'une amélioration significative d'une génération à l'autre. Les progrès les plus marqués concernent le codage agentique, l'interaction avec l'ordinateur et la recherche dans des contextes étendus. Il s'agit de résultats communiqués par l'éditeur ; ils décrivent donc des performances obtenues dans le cadre d'évaluations contrôlées, et non un comportement garanti dans un environnement de travail privé.
| Référence | 3.5 Flash-Lite | Comparaison | Ce qu'il teste |
|---|---|---|---|
| SWE-Bench Pro | 54.2% | 3 Flash : 49,61 TP40T | Véritables missions d'ingénierie logicielle |
| Terminal-Bench 2.1 | 54.0% | 3.1 Flash-Lite : 31.0% | Codage terminal et agentique |
| OSWorld-Vérifié | 74.0% | 3 Flash : 65,11 TP40T | Interaction avec l'ordinateur |
| GDPval-AA v2 | 1140 | 3.1 Flash-Lite : 642 | Le travail intellectuel dans la vie réelle |
| GDM-MRCR v2 | 72.2% | 3.1 Flash-Lite : 60.1% | Récupération de contextes longs |
Gains en points de pourcentage. Les tests Terminal-Bench et GDM-MRCR sont comparés à 3.1 Flash-Lite ; les tests SWE-Bench Pro et OSWorld sont comparés à Gemini 3 Flash. Source : Google, 21 juillet 2026.

Des données indépendantes apportent un éclairage utile. Au moment de la vérification, Artificial Analysis indiquait Gemini 3.5 Flash-Lite un score de 36 à l'indice d'intelligence et un débit de 388,8 tokens par seconde. L'article de Google annonçant le lancement mentionnait un chiffre arrondi antérieur de 350 tokens par seconde, fourni par la même organisation. Cette évolution rappelle que les pages de benchmark en temps réel peuvent être mises à jour à mesure que les fournisseurs, les échantillons et les fenêtres de mesure évoluent.

Comme on pouvait s’y attendre, les réactions de la communauté le premier jour ont été mitigées. Un message sur Reddit a qualifié le modèle de « pas en arrière », sans toutefois apporter beaucoup d’éléments concrets au niveau des tâches ; une autre discussion a mis en avant l’amélioration constatée dans le traitement des contextes longs. Sur X, le développeur en IA Philipp Schmid s’est concentré sur le résultat de 350 tokens par seconde et sur le coût estimé de la tâche. Ces publications constituent des indications utiles sur ce qui importe aux utilisateurs — la vitesse, le prix et la qualité d’une génération à l’autre — mais elles sont trop précoces et trop anecdotiques pour l’emporter sur des tests contrôlés.
Comment j'ai testé le Gemini 3.5 Flash-Lite
Le 22 juillet 2026, j'ai exécuté quatre tâches sur un seul modèle, en utilisant l'identifiant exact du modèle gemini-3.5-flash-lite via une passerelle Broly configurée. Chaque tâche a utilisé le premier résultat valide. J’ai figé les invites, les réponses correctes, les validateurs et les règles de nouvelle tentative avant de consulter les résultats. Seule la tâche portant sur le document long a déclenché un contrôle de stabilité préenregistré comprenant trois exécutions.
| Tâches | Extraction structurée, synthèse de documents volumineux, localisation et débogage en Python |
|---|---|
| Marquage | Vérifications objectives par rapport aux schémas, aux données de référence, aux contraintes et aux tests exécutables |
| Calendrier | Latence de la route Broly de bout en bout, et non la vitesse de sortie native de Google |
| Coût | Estimation équivalente à celle de l'API, calculée à partir des taux officiels des jetons ; il ne s'agit pas des frais d'abonnement GlobalGPT |
Résultats des tests pratiques du Gemini 3.5 Flash-Lite
Test n° 1 : Extraction de données structurées
- Toutes les valeurs indiquées ont été enregistrées.
- Le délai d'attente éventuel n'a pas été explicitement confirmé.
- J'ai supprimé la note de renouvellement non pertinente.
- Aucune intervention n'était nécessaire.
Avis pratique : C'était le résultat le plus « propre » de la série. J'aurais pu transmettre directement la sortie à un analyseur syntaxique, ce qui correspond exactement à ce que doit faire un modèle d'extraction à haut débit.
Afficher l'invite et la sortie du modèle
Convertissez ces notes d'assistance désorganisées en un seul objet JSON comportant exactement les clés suivantes : customer, plan, issue, affected_users, first_reported, workaround, owner, next_update, unresolved. Utilisez la valeur null lorsqu'une valeur n'est pas indiquée et ne renvoyez que du JSON valide. Remarques : Northstar Labs — Formule Growth. Les exportations CSV de plus de 50 000 lignes se bloquent à 92%. 14 analystes sont concernés. Solution de contournement : fractionner les exportations en lots de moins de 20 000 lignes. Priya est en charge de l'enquête. Un dépassement du délai d'attente de la file d'attente est possible, mais non confirmé. Prochaine mise à jour : mardi à 16 h 00 UTC.
Extrait de l'énoncé : la phrase superflue concernant la note de renouvellement a été omise ici pour faciliter la lecture ; elle figurait toutefois dans l'énoncé exact de l'épreuve.
{
"client" : "Northstar Labs",
"formule" : "Growth",
"problème" : "Les exportations CSV de plus de 50 000 lignes se bloquent à 92%",
"utilisateurs_concernés" : 14,
"première_signalisation" : "lundi 09h15 UTC",
"solution_de_contournement" : "diviser les exportations en lots de moins de 20 000 lignes",
"responsable" : "Priya",
"prochaine_mise_à_jour" : "mardi 16 h 00 UTC",
"non_résolu" : ["délai d'attente de file d'attente possible (non confirmé)"]
}Test n° 2 : Compréhension de documents longs
- Les dates de lancement et de mise en vigueur de la politique de confidentialité ont été récupérées.
- Le taux de défaillance de 1,81 TP40T et l'objectif de 1,01 TP40T ont été maintenus.
- A rejeté à juste titre deux propositions non approuvées.
- Manqué : a indiqué les services comme responsables au lieu de
Non attribué.
Avis pratique : Le résumé rendait bien compte du processus décisionnel, mais une erreur de la part du responsable pourrait entraîner l'envoi d'une action à l'équipe qui n'est pas la bonne. C'est là que “ presque correct ” ne suffit pas.
Afficher un extrait de la demande et un exemple de résultat
Divisez le dossier « Project Atlas » en quatre sections distinctes : Résumé exécutif (140 mots maximum), Décisions confirmées, Registre des actions et Questions en suspens/Risques. Dans le Registre des actions, indiquez les champs suivants : Responsable, Action, Date d'échéance, Dépendance, Statut. Utilisez la date de lancement confirmée du 12 août, avec la condition de confidentialité du 5 août, ainsi que le taux d’incidents actuel de 1,81 TP40T par rapport à l’objectif de 1,01 TP40T. Ne transformez pas la proposition française, le plafond de $18 000, la mention de septembre ou le projet d’e-mail en engagements approuvés. Lorsque le dossier n’indique ni responsable ni date d’échéance, inscrivez « Non attribué ».
Le cahier des charges comprenait l'ensemble du dossier du projet, composé de huit sections ; cet extrait reprend les instructions et les informations essentielles.
Note de synthèse : Le projet Atlas est prévu pour le 12 août, à condition que l'examen relatif à la protection de la vie privée soit clôturé d'ici le 5 août. Le taux d'erreurs sur mobile s'élève à 1,81 TP40T, contre un objectif de 1,01 TP40T pour la mise en production. La localisation en français n’a pas été approuvée, et le plafond de test de $18 000 ne constitue pas une autorisation de dépense. Extrait du registre des actions : | Responsable | Action | Date limite | | Confidentialité | Effectuer les vérifications restantes de l'examen de confidentialité | 5 août | | Juridique | Examiner la déclaration de traitement des données mise à jour | Non attribué | Valeur attendue du responsable pour les deux lignes : Non attribué.
Le résultat a conservé les décisions principales, mais a transformé deux fonctions organisationnelles en responsables, ce qui a donné lieu à la note de 8/10.
J'ai répété cette tâche à deux reprises en appliquant la règle de stabilité figée. Les faits principaux sont restés corrects lors des trois exécutions, mais la règle stricte du propriétaire n'a été respectée qu'une seule fois. Gemini 3.5 Flash-Lite semble donc fiable pour la lecture du contenu d'un paquet long, mais pas pour l'extraction non supervisée de tous les champs dépendants du schéma.
- Les faits essentiels sont exacts : 3/3 courses
- Règle exacte concernant le propriétaire : 1/3 de course
Test n° 3 : Traduction et localisation
- Les deux noms de produits requis ont été conservés.
- Aucune promesse non prise en charge n'a été ajoutée.
- À lire dans son sens naturel plutôt que selon une traduction littérale.
Avis pratique : Le texte était utilisable après une petite retouche stylistique : l'appel à l'action reprenait le nom du modèle. Les contraintes strictes ont quant à elles été parfaitement respectées.
Afficher l'invite et la sortie du modèle
Traduisez la mise à jour du produit en chinois vers un anglais américain naturel pour une annonce intégrée à l'application. Utilisez entre 90 et 120 mots et un titre ne dépassant pas huit mots. Conservez les mentions suivantes : GlobalGPT, Gemini 3,5 Flash-Lite, 350 jetons/seconde, $0,30, $2,50 et 1 million de jetons. Évitez les termes “ révolutionnaire ”, “ qui change la donne ”, “ le moins cher ” et “ le meilleur ”. Terminez par un appel à l'action (CTA) sobre, en une seule phrase.
Le test complet fournissait également le paragraphe source chinois décrivant la disponibilité, le positionnement, les tarifs, la taille du contexte et les flux de travail les mieux adaptés.
Gemini 3.5 Flash-Lite désormais disponible Le modèle GlobalGPT prend désormais en charge le Gemini 3.5 Flash-Lite, un modèle conçu pour les tâches nécessitant une faible latence et un débit élevé. Avec une vitesse de génération officiellement estimée à environ 350 tokens par seconde, il dispose d’une fenêtre de contexte d’un million de tokens. La tarification de l’API est fixée à $0,30 par million de tokens d’entrée et à $2,50 par million de tokens de sortie. Ce modèle est particulièrement adapté à la traduction, au traitement de documents, à l’extraction structurée et aux workflows en plusieurs étapes. Vous pouvez dès aujourd’hui sélectionner ce modèle dans GlobalGPT et l’utiliser aux côtés d’autres modèles de pointe au sein de la même plateforme. Commencez dès maintenant à utiliser Gemini 3.5 Flash-Lite dans votre workflow.
Test n° 4 : débogage en Python
- On a empêché les valeurs booléennes Python d'être interprétées comme des entiers.
- La réduction n'a été appliquée qu'au-delà du seuil.
- Les quatre totaux attendus ont été renvoyés.
Avis pratique : La correction s'est exécutée immédiatement et l'explication était suffisamment concise pour être consultée rapidement. Cela favorise un débogage ciblé, et non un travail autonome sur le dépôt.
Afficher l'invite et la sortie du modèle
Déboguez cette fonction. Les 100 premières unités coûtent $0,10 chacune ; chaque unité au-delà de 100 coûte $0,07. La quantité doit être un entier non négatif. Actuellement, la fonction facture un montant erroné au-delà de 100 et accepte des valeurs booléennes. Fournissez un diagnostic en deux phrases, le code Python corrigé, ainsi que cinq assertions pour les valeurs 0, 100, 101, 250 et une entrée non valide.
def calculate_cost(quantity) :
if not isinstance(quantity, int) or quantity < 0:
raise ValueError(...)
if quantity <= 100:
return round(quantity * 0.10, 2)
return round(quantity * 0.07, 2)def calculate_cost(quantity) :
si type(quantity) n'est pas un entier ou si quantity < 0 :
lève une exception ValueError('quantity doit être un entier non négatif')
si quantité <= 100 :
total = quantité * 0,10
sinon :
total = (100 * 0,10) + ((quantité - 100) * 0,07)
return round(total, 2)
assert calculate_cost(0) == 0.00
assert calculate_cost(100) == 10.00
assert calculate_cost(101) == 10.07
assert calculate_cost(250) == 20.50Le résultat complet comprenait également le test de rejet booléen demandé ainsi qu'un diagnostic en deux phrases pour chacun des deux bogues.
Gemini 3.5 Vitesse Flash-Lite et coût des tests
Les mesures « de la requête à la réponse » incluent les temps de traitement au niveau de la passerelle, du réseau et du fournisseur d'accès. Elles ne correspondent pas à la vitesse de génération des jetons de sortie propre à Google.
Sur les quatre premiers résultats, Gemini 3.5 Flash-Lite a affiché un temps moyen de 3,748 secondes. Les tâches ont utilisé 1 708 tokens d'entrée et 1 278 tokens de sortie. Aux tarifs de référence officiels, leur coût combiné, exprimé en équivalent API, s'élevait à $0,0037074. Cela illustre le fonctionnement économique des tokens ; il ne s'agit pas d'un abonnement à GlobalGPT et cela n'inclut pas les appels aux outils payants.
Gemini 3.5 Flash-Lite : prix et rapport qualité-prix
Tarifs officiels de l'API Gemini
| Utilisation | Taux officiel | Quels sont les motifs à l'origine de ce projet de loi ? |
|---|---|---|
| Jetons d'entrée | $0,30 / 1M | Consignes, documents et autres éléments de contexte envoyés au modèle |
| Jetons de sortie | $2,50 / 1M | Les jetons de réponse, y compris les jetons de réflexion |
| Outils | Variable | Les recherches ou l'utilisation d'autres outils payants peuvent entraîner des frais supplémentaires |
Ces estimations ne tiennent pas compte des coûts liés à la mise en cache, à la recherche, aux autres outils et aux frais de plateforme.
- Le coût de la sortie est environ 8,3 fois plus élevé par jeton que celui de l'entrée.
- Des formats rigoureux et des réponses concises peuvent réduire considérablement les coûts liés à un volume élevé.
- La facturation par API convient aux développeurs qui ont besoin d'un accès programmatique facturé à l'utilisation et d'un contrôle détaillé de leur consommation.
Qualifier ce modèle de “ bon marché ” doit également être replacé dans son contexte. Artificial Analysis a décrit son taux de production de $2,50 comme élevé par rapport à une moyenne de $0,87 parmi les modèles comparables sélectionnés, tout en classant ce modèle parmi les meilleurs en termes de vitesse. La valeur ajoutée réside donc dans la vitesse et l’intelligence utile, et non dans le prix par jeton le plus bas du marché.
Utilisation de Gemini 3.5 Flash-Lite avec les formules d'abonnement GlobalGPT
GlobalGPT utilise un modèle d'abonnement et de crédits plutôt que de présenter directement la facture du jeton API Gemini. Les tarifs ci-dessous étaient visibles le 22 juillet 2026, avec la facturation annuelle sélectionnée.
$5.8 /mois
Taux mensuel $11.9
- Accès à toutes les modèles de chat
- Unikorn V7 (de type MJ), plus de 10 modèles d'images avancés et un éditeur d'images
- Accès à des modèles vidéo avancés
- Eleven Lab v3, Deep Research, AI Detector et ChatPDF
Meilleur pour : des discussions occasionnelles et des flux de travail créatifs plus simples qui ne nécessitent pas l'accès complet à Pro pour les images, les vidéos, l'audio et les agents.
$10.8 /mois
Taux mensuel $19.9
- Accès à toutes les modèles de chat
- Recherche avancée Perplexity
- Accès à tous les modèles d'IA pour les images et à l'éditeur d'images complet
- Accès à 13 modèles vidéo basés sur l'IA
- Accès complet aux modèles audio et aux agents basés sur l'IA
Meilleur pour : un travail créatif et multimodèle régulier.
$25.0 /mois
Taux mensuel $49.9
- Toutes les fonctionnalités de la version Pro
- Utilisation illimitée sur certains modèles d'IA
- Les modèles Premium peuvent tout de même consommer des crédits
Meilleur pour : les utilisateurs réguliers qui souhaitent bénéficier d'un flux de travail aussi complet que possible et d'un choix illimité de modèles.
Gemini 3.5 API Flash-Lite ou GlobalGPT : lequel offre le meilleur rapport qualité-prix ?
| Choisir | Quand ça convient | Compromis |
|---|---|---|
| API Gemini | Vous développez une application, vous automatisez un pipeline ou vous avez besoin de journaux d'utilisation précis. | La facturation à l'utilisation est efficace, mais vous devez gérer vous-même l'intégration, les clés et les autres fournisseurs de modèles. |
| GlobalGPT Basic | Vous recherchez une solution abordable pour des discussions occasionnelles et des tâches d'IA peu exigeantes. | Le volume de crédit est plus restreint. |
| GlobalGPT Pro | Vous utilisez régulièrement des modèles linguistiques de pointe en association avec des outils de recherche, de traitement d'images, de traitement audio ou d'agents. | Il convient de continuer à surveiller les crédits et les coûts par outil. |
| GlobalGPT Illimité | Vous utilisez fréquemment plusieurs familles de modèles et appréciez de disposer d'un seul espace de travail. | “La formule ” illimitée » ne s'applique qu'à certains modèles ; les modèles haut de gamme peuvent toujours utiliser des crédits. |
Pour la plupart des évaluateurs individuels et des équipes de contenu, la formule Pro est l’offre GlobalGPT la plus équilibrée : elle permet de conserver le flux de travail multimodèle tout en évitant le prix plus élevé de la formule Unlimited. Les développeurs qui appellent Gemini 3.5 Flash-Lite des milliers de fois depuis un produit préféreront généralement l'API officielle, car la facturation au niveau des jetons et l'automatisation priment sur un espace de travail visuel partagé. Consultez le détails du dernier plan avant d'effectuer le paiement, car les promotions, les crédits attribués et l'accès aux modèles peuvent changer.
Avantages et inconvénients
| Pour | Cons |
|---|---|
|
|
À qui s'adresse le Gemini 3.5 Flash-Lite ?
Gemini 3.5 Flash-Lite Cette approche est particulièrement adaptée aux équipes traitant un grand nombre de documents, de dossiers d'assistance, de traductions ou de messages structurés ; aux développeurs attribuant des sous-tâches délimitées à un agent ; ainsi qu'aux produits où la latence est perceptible par l'utilisateur. Elle s'avère moins pertinente lorsqu'une tâche nécessite le raisonnement le plus poussé possible, la génération native de médias ou une extraction à tolérance zéro sans validation. Si vous avez besoin d’une solution plus performante sans quitter la gamme Flash, notre Gemini 3.6 : aperçu rapide aborde sa tarification, ses tests comparatifs, son flux de travail via l'API et ses performances en conditions réelles.
Le mode de fonctionnement le plus sûr est simple : utilisez le modèle pour un premier passage rapide, ajoutez des vérifications basées sur un schéma objectif et des règles métier, puis confiez les cas ayant échoué ou présentant un risque élevé à un modèle plus performant ou à un réviseur humain. Si cette étape suivante se résume à un choix entre rapidité et raisonnement plus approfondi, notre Comparaison entre Gemini 3.6 Flash et Gemini 3.1 Pro utilise six tests basés sur la même consigne pour déterminer où se situe chaque modèle. GlobalGPT facilite ce flux de travail global en regroupant en un seul endroit les modèles de référence ainsi que l'ensemble du processus de recherche, de rédaction, de programmation et de création.
Verdict final : le Gemini 3.5 Flash-Lite vaut-il le coup ?
Oui, lorsque la vitesse, le débit et la maîtrise des coûts priment sur l'optimisation de la profondeur de raisonnement pour chaque appel. Lors de mes tests, Gemini 3.5 Flash-Lite Il s'est montré excellent pour l'extraction de données JSON, la localisation sous contraintes et une tâche de débogage délimitée. Il a également su identifier les informations essentielles dans un paquet volumineux, mais l'erreur concernant le champ « owner » s'est reproduite lors de deux des trois essais. Il s'agit là d'une limite utile, mais pas d'un obstacle rédhibitoire.
Il vaut mieux considérer ce modèle comme un collaborateur efficace, dont les compétences sont validées dans des domaines clés. Pour l'évaluer de manière équitable, essayez de lui soumettre une requête issue de votre propre flux de travail plutôt qu'une question de culture générale.
Ouvrez-le dans GlobalGPT pour un traitement rapide des documents, la localisation et les tâches structurées, puis passez à la recherche, à la rédaction, au codage ou à la création de contenu à l'aide d'autres modèles et outils de pointe au sein du même espace de travail.
Questions fréquemment posées
Combien coûte un Gemini 3.5 Flash-Lite ?
Le prix de référence officiel est de $0,30 par million de jetons d'entrée et de $2,50 par million de jetons de sortie, y compris les jetons « thinking ». Les appels d'outils peuvent entraîner des frais supplémentaires. Ces tarifs d'API sont distincts des abonnements aux plateformes tierces.
À quelle vitesse va-t-il ?
L'article de Google annonçant le lancement mentionnait un débit de 350 tokens par seconde pour Artificial Analysis. La page du modèle Artificial Analysis en ligne affichait 388,8 tokens par seconde lors d'une vérification effectuée le 22 juillet 2026. Le temps de traitement réel de bout en bout dépend de la taille de la requête, de la longueur de la réponse, du niveau de réflexion, du réseau et de l'itinéraire du fournisseur.
La version Gemini 3.5 de Flash-Lite est-elle meilleure que la version 3.1 de Flash-Lite ?
Google fait état de gains importants sur les benchmarks Terminal-Bench 2.1, GDM-MRCR v2 et GDPval-AA v2. Cela confirme une nette amélioration d'une génération à l'autre, même si des tests spécifiques à chaque charge de travail restent nécessaires.
Est-ce qu'il prend en charge les images, les fichiers audio, les vidéos et les PDF ?
Oui. La documentation officielle mentionne les formats d'entrée suivants : texte, image, vidéo, audio et PDF. Le modèle génère du texte, mais ne produit pas nativement d'images, de fichiers audio ou de vidéos.
“ Gemini 3.5 Lite ” est-il le nom correct ?
Non. Le nom officiel est Gemini 3.5 Flash-Lite. “ Gemini 3.5 Lite ” est une abréviation informelle qui peut prêter à confusion avec d'autres générations de Flash-Lite.
Sources : Annonce du lancement par Google; Référence du modèle API Gemini; Tarifs de l'API Gemini; Analyse artificielle; Discussion sur Reddit; Commentaire X. Les chiffres officiels des tests de performance sont fournis par les fabricants ; les chiffres issus des tests pratiques proviennent de la série de tests contrôlés du 22 juillet décrite ci-dessus.


