Gemini 3.6 : tour d'horizon rapide : prix, tests de performance, API et performances

Gemini 3.6 : tour d'horizon rapide : prix, tests de performance, API et performances

Le Gemini 3.6 Flash mérite qu'on s'y intéresse pour codage borné, analyse multimodale et flux de travail d'agents supervisés. Ce test du Gemini 3.6 Flash révèle une amélioration notable par rapport au 3.5 Flash : Google fait état d'un coût de production réduit et de meilleurs résultats sur plusieurs benchmarks agentiques, tandis que nos propres tests ont montré une extraction structurée précise, une lecture des graphiques et une correction ciblée du code après des limites de sortie raisonnables. Ce n'est toutefois pas une solution universelle. Notre tâche synthétique de récupération de 128K a échoué à deux reprises, et le plan de navigation local du modèle a inventé un identifiant d’élément caché alors même qu’il avait correctement identifié la cible visible.

La recommandation pratique consiste à tester en pilote la solution Gemini 3.6 Flash dans le cadre de tests d'acceptation spécifiques à la charge de travail, à mesurer le coût total par tâche réussie et à maintenir une validation humaine pour les actions irréversibles. Les chiffres officiels, nos mesures incluant la passerelle, les benchmarks tiers et les premiers retours d'expérience présentés ci-dessous sont indiqués séparément afin que des éléments de preuve contradictoires ne soient pas mélangés en un seul score.

Avis rapideRecommandé pour les tests de chargeMeilleur pour : des tâches exécutées par des agents supervisés et testables, pour lesquelles les entrées multimodales et une planification plus poussée justifient un coût plus élevé que celui de Flash-Lite.À voir : récupération de contextes longs, limites du nombre de tokens de sortie, affirmations de vérification et lacunes dans les fonctionnalités spécifiques aux passerelles.

Gemini 3.6 : bilan rapide : avantages et inconvénients

PourCons
Identifiant de modèle stable destiné à une utilisation en productionPas de prise en charge de l'API Live
Prix de vente standard inférieur à celui du Flash 3.5Sortie texte uniquement ; aucune génération native d'images ou de fichiers audio
Bons résultats officiels sur DeepSWE, MLE-Bench, OSWorld, ainsi que des gains significatifs sur les contextes longsUne capacité de 1 million de jetons ne garantit pas une récupération fiable.
Prise en charge étendue des modes de transport et des outilsL'utilisation de l'ordinateur reste une fonctionnalité en avant-première
Nos tests d'extraction bornée, de diagramme, de codage et d'action locale ont été réussisNotre test synthétique à huit aiguilles de 128K a échoué à deux reprises
Les options « Batch/Flex » et un niveau « Flash-Lite » plus économique permettent de mettre en œuvre différentes stratégies de routageLes jetons de raisonnement peuvent atteindre des plafonds de sortie étonnamment serrés
Résumé de la décision fondé sur la documentation de Google, notre test effectué le 22 juillet et les premiers rapports clairement distingués.

Table des matières

Qu'est-ce que le Gemini 3.6 Flash ?

Gemini 3.6 Flash est un modèle stable de Google destiné aux charges de travail en production qui nécessitent davantage de raisonnements et d’utilisation d’outils qu’un niveau d’inférence allégé, sans pour autant passer à une gamme de prix haut de gamme. Google le décrit comme un « cheval de bataille » pour le codage, le travail intellectuel, la compréhension multimodale et l’exécution agentique. L’identifiant du modèle de production est gemini-3.6-flash. Page officielle de Google consacrée aux modèles l'indique comme étant disponible pour tous.

Le modèle accepte des données d'entrée sous forme de texte, d'images, de fichiers audio, de vidéos et de fichiers PDF. Il renvoie du texte, des données JSON structurées et des appels de fonctions ou d'outils, mais il ne génère pas d'images ni de fichiers audio de manière native. Cette distinction est importante lorsqu'on compare des affirmations générales qualifiées de “ multimodales ” : la compréhension de plusieurs formats d'entrée est différente de la production de plusieurs types de médias en sortie.

Google's Gemini 3.6 Carte modèle Flash indique que la date limite de mise à jour des données est mars 2026 et précise que le modèle repose sur le modèle Gemini 3.5 Flash. Les détails relatifs à l'architecture et à l'entraînement sont pour la plupart issus de sources de référence plutôt que nouvellement divulgués ; les acheteurs peuvent donc évaluer le comportement documenté et les évaluations publiées, mais ne peuvent pas reconstituer la méthode d'entraînement.

La vaste gamme d'outils est au cœur de ce positionnement. La page officielle du modèle répertorie les appels de fonction, les sorties structurées, l’exécution de code, la recherche de fichiers, le contexte URL, la mise en cache du contexte, l’ancrage dans Google Search, l’ancrage dans Google Maps, la réflexion et l’utilisation d’un ordinateur. Une décision de mise en production doit évaluer l’ensemble du cycle — forme de la requête, trace de l’outil, tentatives de réessai, validation et révision humaine — et non pas uniquement la qualité d’une seule réponse.

Ce rôle de « cheval de bataille » explique également l'orientation de cette analyse : Flash 3.6 est particulièrement intéressant lorsqu'il s'intègre dans le flux de travail d'une application, plutôt que lorsqu'il répond à une requête isolée et sans grand intérêt. Sa valeur dépend de la capacité du système environnant à imposer des contraintes aux outils, à détecter les troncatures, à vérifier les résultats et à acheminer les tâches les plus simples vers un niveau moins coûteux.

La fonctionnalité « Utilisation de l'ordinateur » permet à une application d'envoyer des captures d'écran et de recevoir des suggestions d'actions pour les environnements de navigateur, mobiles ou de bureau. C'est toujours le client qui exécute l'action, fournit la capture d'écran suivante et applique les règles. Google qualifie cette fonctionnalité de « Preview » et recommande une supervision pour les tâches sensibles ou irréversibles dans le Documentation relative à l'utilisation des ordinateurs.

Gemini 3.6 Caractéristiques techniques et fonctionnalités de la mémoire Flash

SpécificationGemini 3,6 Flash
Référence du modèlegemini-3.6-flash
Statut de publicationVersion stable / disponible au grand public
Contexte d'entrée maximal1 048 576 jetons
Puissance maximale65 536 jetons
Modalités d'entréeTexte, image, audio, vidéo, PDF
Mode de sortieTexte
Niveau de réflexion par défautmoyen
Critères d'évaluation des connaissancesmars 2026
API en directNon pris en charge
Utilisation de l'ordinateurPrise en charge dans la version Preview
API par lotsPrise en charge au niveau du modèle ; pas encore via l'API Interactions
Caractéristiques techniques officielles du modèle fournies par Google, consultées le 22 juillet 2026.

La limite de contexte de 1 048 576 tokens correspond à une capacité maximale, et non à une garantie que chaque information pourra être récupérée de manière fiable. Il s’agit là d’un thème récurrent, tant dans les tests de performance de Google portant sur les contextes longs que dans notre test de passerelle synthétique. La récupération, le découpage en segments, les index de documents, les résumés et les citations de sources restent utiles même lorsqu’un corpus entier tient techniquement dans une seule requête.

Le plafond de 65 536 jetons est généreux, mais les applications réelles fixent souvent une limite inférieure pour des raisons de coût et de latence. Nos tests ont montré comment un plafond qui semble suffisant pour la réponse visible peut être épuisé par les jetons de raisonnement interne. Vérifiez la raison et le contenu réels de la fin de la tâche, plutôt que de considérer une réponse HTTP 200 comme un succès de la tâche.

Gemini 3.6 Tarifs « Flash »

Si vous comparez les formules d'abonnement plutôt que la facturation par jeton API, le Guide des tarifs du Gemini 3 Flash distingue les différentes options d'achat concrètes.

Le tarif officiel standard est de $1,50 par million de jetons d'entrée et 1 TP41T7,50 par million de jetons émis. La facturation en sortie inclut les jetons de réflexion. Les modes d'inférence « Batch » et « Flex » divisent par deux ces tarifs par jeton, tandis que le mode « Priority » applique une majoration de 80%. Vérifiez toujours les tarifs en vigueur Page des tarifs de l'API Gemini avant d'établir un devis de production.

Mode de consommationDonnées d'entrée / 1 million de jetonsRésultat / 1 million de jetons
Standard$1.50$7.50
Lot$0.75$3.75
Flex$0.75$3.75
Priorité$2.70$13.50
Prix catalogue en dollars américains communiqués par Google le 22 juillet 2026 ; la disponibilité et les limites du service peuvent varier.

La mise en cache de contexte est facturée à $0,15 par million de jetons d'entrée mis en cache dans le niveau payant Standard, plus $1,00 par million de jetons et par heure pour le stockage en cache. La mise en cache peut réduire les frais liés aux entrées répétées, mais un cache volumineux conservé plus longtemps que nécessaire devient un centre de coûts à part entière. Comparez la facture liée au cache avec la réutilisation effectivement réalisée.

Le « grounding » est mesuré dans une unité différente. Google indique que 5 000 invites de « grounding » par mois sur Google Search ou Maps sont gratuites, réparties entre les 3 modèles Gemini, puis $14 par 1 000 requêtes de recherche. Une requête pouvant générer plusieurs requêtes de recherche, le coût en jetons seul peut sous-estimer le coût réel d'un workflow « grounded ».

Exemple de tarification standard pour le modèle $2.25

Une requête qui consomme 1 000 000 de jetons d'entrée et produit 100 000 jetons de sortie coûte $1,50 pour l'entrée, plus $0,75 pour la sortie, soit $2.25 en mode Standard. Cet exemple simplifié ne tient pas compte du stockage en cache, des requêtes de vérification, des nouvelles tentatives, des outils externes ni des échecs.

Google indique également que Gemini 3.6 Flash a utilisé 17% de jetons de sortie en moins que 3.5 Flash dans l'indice d'analyse artificielle et a nécessité moins d'étapes de raisonnement et d'appels d'outils dans les workflows en plusieurs étapes. Il s'agit là d'une observation officielle dépendant de la charge de travail, et non d'un gain garanti de 17% pour chaque application. Mesurez le nombre de tokens par tâche réussie à l'aide de vos propres invites.

Résumé des prix catalogue officiels, avec l'exemple du modèle $2.25 Standard. Veuillez vérifier les prix en vigueur avant toute publication ou établissement de budget.

Gemini 3.6 Tests de performances Flash : ce qu'indique Google

Résultat officiel de GoogleNotre test de la passerelle BrolyTest de performance réalisé par un organisme indépendant

Google a publié le tableau d'évaluation officiel du Flash Gemini 3.6, parallèlement à la sortie du modèle
Chiffre officiel d'évaluation « Gemini 3.6 Flash » publié par Google ; les noms des tests de performance et la méthodologie sont indiqués dans la source. Consultez la source officielle de Google.

Les comparaisons officielles de Google mettent en évidence les progrès les plus marqués dans les domaines du codage agentique, de l'ingénierie de l'apprentissage automatique, de l'interaction informatique et de la récupération de contextes longs. La référence la plus pertinente est le modèle Gemini 3.5 Flash, car Google a évalué les deux modèles au sein de la même famille de cartes de modèles. Ces valeurs correspondent aux résultats de Google et non à des mesures issues de notre banc d'essai.

RéférenceGemini 3,6 FlashGemini 3.5 FlashDifférence signalée
SWE-Bench Pro Public58.7%55.1%+3,6 points
DeepSWE v1.149.0%37.0%+12,0 points
Terminal-Bench 2.178.0%76.2%+1,8 points
MLE-Bench63.9%49.7%+14,2 points
GDPval-AA v21 421 Elo1 349 Elo+72 Elo
OSWorld-Vérifié83.0%78.4%+4,6 points
Valeurs officielles de Google / fiches techniques. Les différents benchmarks évaluent des répartitions de tâches différentes et ne sont pas interchangeables.

DeepSWE a progressé de 12,0 points de pourcentage et MLE-Bench de 14,2 points. Le gain enregistré par OSWorld-Verified s'est élevé à 4,6 points, tandis que les progrès réalisés par SWE-Bench Pro Public et Terminal-Bench ont été plus modestes. On peut affirmer sans crainte que la version 3.6 améliore plusieurs charges de travail agentiques par rapport à la version 3.5, mais pas qu’elle domine tous les modèles ou tous les benchmarks de codage.

Google mentionne également une diminution des modifications de code indésirables et des boucles d'exécution plus courtes. Ces comportements peuvent s'avérer plus importants qu'une légère variation du taux de réussite dans le travail sur le référentiel, car les modifications superflues alourdissent le coût de la révision et les boucles répétées consomment des jetons. Ils nécessitent toutefois une mesure au niveau de l'application ; un benchmark agrégé ne permet pas de déterminer le comportement au sein d'une base de code spécifique.

Résultats multimodaux et à contexte étendu

Concernant l'analyse de graphiques complexes sous CharXIV, Google fait état d'un score de 85,21 TP40T sans outils et de 89,41 TP40T avec outils pour Gemini 3.6 Flash. Le Gemini 3.6 Flash a quant à lui obtenu respectivement 84,21 TP40T et 84,91 TP40T. L'écart plus important observé avec l'utilisation d'outils confirme le positionnement du modèle en matière d'interprétation de graphiques et de workflows multimodaux, sans pour autant évaluer l'esthétique visuelle ni la qualité stylistique de l'interface utilisateur.

Test de contexte long GDM-MRCR v2Gemini 3,6 FlashGemini 3.5 Flash
128 K, moyenne sur 8 aiguilles91.8%77.3%
1 m, 8 aiguilles, point par point54.0%26.6%
Chiffres officiels de Google concernant le GDM-MRCR v2. La capacité contextuelle et la fiabilité de la récupération sont deux propriétés distinctes.

Tableau d'évaluation de la qualité Flash Gemini 3.6 officiel de Google, tiré de l'article annonçant la sortie
Chiffre officiel de qualité Flash Gemini 3.6 publié par Google ; à interpréter en parallèle avec l'article de lancement et la fiche produit. Consultez la source officielle de Google.

Le résultat de 1M représente une amélioration relative importante, mais 54,0% ne constitue pas une base suffisante pour une recherche aveugle de faits essentiels. Les systèmes de production doivent toujours segmenter les documents, conserver leur provenance et exiger des références sources. Notre test synthétique distinct sur 128K a échoué, mais il utilisait une tâche et un itinéraire de passerelle différents et ne peut se substituer au résultat de Google.

Écarts communiqués par Google pour DeepSWE, MLE-Bench, OSWorld-Verified et la recherche dans des contextes longs de 1 million ; il ne s'agit pas de nos résultats de test.

Nos tests pratiques du Gemini 3.6 Flash

Ce que nos tests ont réellement démontré : Gemini 3.6 Flash a réussi les tâches d’extraction structurée délimitée, de lecture de graphiques, de correction ciblée de code et d’action locale supervisée. Il a échoué à deux reprises à notre tâche synthétique de récupération de 128 Ko à huit aiguilles, et son plan de navigation a identifié un ID d’élément masqué qui n’était pas visible dans l’image.

Ce que cela signifie : Utilisez-la pour des travaux ciblés, avec des validateurs et une confirmation humaine. Ne considérez pas une fenêtre contextuelle étendue ou un plan d’action plausible comme la preuve que chaque détail a été correctement identifié ou étayé.

Nous avons exécuté une suite de tests déterministes en première partie le 22 juillet 2026. Toutes les latences relevées sont temps de réponse total, passerelle comprise, ce qui signifie qu'il inclut la latence liée au routage via Broly et ne doit pas être interprété comme la latence directe de l'API Google.

Le temps TTFT n'a pas été mesuré, y compris pour le contrôle du streaming. Nous avons enregistré le temps total écoulé, les jetons de prompt, les jetons de finalisation, les jetons de raisonnement, les jetons mis en cache, le nombre total de jetons, la raison de la fin, les tentatives, la validation et un coût estimé basé sur les tarifs officiels des jetons Standard. Les jetons de raisonnement étaient déjà inclus dans les jetons de finalisation, et les jetons mis en cache étaient déjà inclus dans les jetons de prompt.

L'activité dans son ensemble comprenait 12 appels d'API logiques et 14 tentatives HTTP. Le premier tour s'est déroulé $0.244491, les trois rediffusions concernées ont totalisé $0.0520416, et l'estimation cumulée corrigée s'élevait à $0.2965326. Après avoir remplacé deux enregistrements initiaux manifestement tronqués par leurs rediffusions correspondantes, le résultat final était le suivant : 7 ont réussi, 1 a échoué et 1 n'était pas pris en charge.

Les estimations de coût s'élèvent à $1,50/M pour les tokens de prompt non mis en cache, à $0,15/M pour les tokens de prompt mis en cache et à $7,50/M pour les tokens de sortie. Lors de la réexécution avec un contexte long, les 128 248 jetons de prompt se répartissent en 5 464 jetons non mis en cache et 122 784 jetons mis en cache ; l'ajout de 2 048 jetons de sortie donne $0.0419736. Le stockage en cache est indiqué à $1.00/M jetons/heure, mais il est exclu car sa durée n'a pas été mesurée.

Il s'agit de tests de diagnostic réalisés sur de petits échantillons, et non d'une référence statistiquement significative. Ils sont utiles car les scénarios de test, les valeurs attendues, les validateurs, les limites de requêtes et les échecs sont conservés. Ils doivent servir à orienter les tests de suivi dans un environnement de charge de travail réel, et non devenir un indicateur de qualité universel.

Relevé des tâches finalesRésultatHeure, point d'accès comprisJetons P / C / R / En cache / TotalCoût estimé
Réponse exacte sur le streaming, 3,6Passer2,938 secondes5 / 119 / 118 / 0 / 124$0.0009
Extraction structurée, nouvelle exécution 3.6Passer3,919 secondes55 / 453 / 411 / 0 / 508$0.00348
Extraction structurée, 3,5Passer3,113 secondes56 / 378 / 324 / 0 / 434$0.003486
Chart Vision, 3.6 (nouvelle version)Passer4,884 secondes1,127 / 653 / 520 / 0 / 1,780$0.006588
Réparation du code, 3.6Passer5,553 secondes602 / 1,150 / 930 / 0 / 1,752$0.009528
Réparation du code, 3,5Passer6,860 secondes603 / 1,332 / 1,058 / 0 / 1,935$0.0128925
128K à huit aiguilles, 3,6 de rediffusionÉchec11,366 secondes128,248 / 2,048 / 0 / 122,784 / 130,296$0.0419736
Plan d'action local pour les navigateurs, 3.6Passer5,305 secondes1,153 / 643 / 573 / 0 / 1,796$0.006552
Broly /réponses Conversion au format PDFNon pris en charge2,423 secondes0 / 0 / 0 / 0 / 0$0
Nos résultats de test de la passerelle Broly. P = invite, C = achèvement, R = raisonnement ; le raisonnement est inclus dans l'achèvement. Les jetons d'invite mis en cache utilisent le taux officiel d'entrées mises en cache.

Flux de données, sortie structurée et lecture de graphiques

L'exercice de streaming demandait la réponse exacte telle qu'elle apparaît à l'écran. OK. Gemini 3,6 Flash a fourni la bonne réponse en 2,938 secondes, avec 5 jetons de prompt, 119 jetons de finalisation, 118 jetons de raisonnement et 124 jetons au total, pour un coût estimé à $0,0009. Ce qui est frappant, c’est que le raisonnement a consommé 118 des 119 tokens de complétion, ce qui illustre pourquoi un plafond de sortie minuscule peut ne laisser aucune réponse visible.

Le premier appel d'extraction structurée 3.6 a utilisé une limite de sortie de 512 tokens et s'est terminé à finish_reason=longueur avec un JSON tronqué. Nous avons considéré cela comme une limite du harnais, et non comme un jugement sur la qualité, et nous n’avons répété que cette tâche à 2 048 tokens. La nouvelle exécution ciblée a réussi la validation exacte des champs en 3,919 secondes avec P55/C453/R411/T508 et un résultat estimé de $0,00348.

Gemini 3.5 Flash a effectué la même extraction lors de son premier appel en 3,113 secondes avec les paramètres P56/C378/R324/T434 et une valeur estimée de $0,003486. Un seul test par configuration ne permet pas de déterminer le gagnant en termes de latence. Cela montre toutefois que les limites de sortie et l’utilisation du raisonnement doivent être ajustées pour chaque modèle, plutôt que copiées aveuglément.

L'appel de lecture du graphique 3.6 a également été tronqué à une limite initiale de 768 jetons. Avec 2 048 jetons, la nouvelle exécution ciblée a lu les huit valeurs de référence en exactement 4,884 secondes, en utilisant P1 127/C653/R520/T1 780 et une valeur estimée à $0,006588. Le validateur a comparé chaque valeur renvoyée à un fichier de référence fixe.

Correction du code : les deux modèles ont obtenu la note de 5/5

Les deux tâches de codage ont débuté à partir de copies isolées du même script Python, avec un point de référence de 3 tests réussis sur 5. Gemini 3,6 Flash a produit une correction ciblée et utilisable en 5,553 secondes, avec P602/C1 150/R930/T1 752 et une estimation de $0,009528. L'application du résultat a permis de faire passer le fixture à 5/5, tandis que le hachage du fichier de test est resté inchangé.

Gemini 3.5 Flash a également produit une réparation ciblée ayant atteint 5/5, en 6,860 secondes avec P603/C1 332/R1 058/T1 935 et une estimation de $0,0128925. Il a ajouté du texte autour du code clôturé malgré l’instruction « no-prose » ; le harnais a donc nécessité une extraction tolérante du code clôturé avant la validation hors ligne. Les deux corrections étaient utilisables ; la discipline de sortie différait.

Ce test privilégie les corrections ciblées à l'aide de tests unitaires déterministes. Il ne mesure pas la navigation dans le référentiel, les modifications architecturales portant sur plusieurs fichiers, l'autonomie à long terme, ni la capacité du modèle à concevoir un test discriminant à partir de zéro. Ces aspects nécessitent des montages de test et des critères d'échec distincts.

Échec de la récupération des données synthétiques de 128 Ko

Notre prompt de près de 128K plaçait huit identifiants déterministes dans un vaste contexte synthétique et exigeait une restitution exacte au format JSON. Gemini 3.6 Flash a échoué à deux reprises, renvoyant du code et du HTML sans rapport avec la requête au lieu des huit valeurs attendues. L'augmentation de la limite de sortie n'a pas permis de corriger ce comportement.

La nouvelle exécution a duré 11,366 secondes et a affiché les valeurs suivantes : P128 248/C2 048/R0/Cached122 784/T130 296, une valeur estimée à $0,0419736 après ajustement des entrées mises en cache, et finish_reason=longueur. C'est qui n'est pas directement comparable au GDM-MRCR de Google Résultat : notre tâche, la formulation exacte de la requête, l'échelle du contexte, le format de sortie et la route de la passerelle Broly diffèrent tous.

Cette défaillance reste pertinente d'un point de vue opérationnel. Elle indique que cette requête synthétique particulière n'a pas abouti via notre itinéraire lors de deux tentatives ; par conséquent, nous ne transmettrions pas le même modèle sans récupération, sans sélection plus précise du contexte, sans validation de la réponse et sans gestion de repli. Cela n'invalide pas le benchmark de Google et ne prouve pas non plus l'existence d'une limitation générale à 128 Ko.

Harnais d'action du navigateur local : cible correcte, identifiant inventé

Le modèle a analysé une capture d'écran d'une page locale contrôlée et a correctement identifié le texte cible visible, “ Ouvrir le rapport d'utilisation ”. Il a proposé l'action suivante : cliquer mais a inventé un identifiant caché, ouvrir_le_rapport_d'utilisation, au lieu de l'identifiant DOM réel utilisation. Le harnais a identifié le texte visible exact et unique au lieu de se fier à l'identifiant inventé.

L'appel de plan a duré 5,305 secondes avec P1 153/C643/R573/T1 796 et a coûté environ $0,006552. Un fixture Chrome local a été cliqué une fois, ce qui a fait passer son état de prêt à rapport-ouvert. C'était Utilisation de l'ordinateur Gemini (non natif); elle n'a effectué aucune action externe, n'a soumis aucun formulaire et n'a modifié aucun état externe.

Auparavant : composant local isolé à l'état « prêt » ; aucune page ni aucun formulaire externe n'était impliqué.
Après : le résolveur de texte visible exact a déclenché l'utilisation de l'identifiant local, ce qui a généré l'état « rapport ouvert » vérifié.

Le fichier PDF obtenu est limité par le chemin d'accès à la passerelle

Le Broly /réponses Le chemin de conversion au format PDF a renvoyé une erreur HTTP 500 avec le code Échec de la conversion de la requête et message non mis en œuvre. L'appel logique a effectué trois tentatives HTTP, car l'enregistrement comprend deux tentatives de reprise, puis s'est arrêté sans utilisation de jeton ni coût. Nous classons cette route comme non prise en charge.

Ce résultat Cela ne signifie pas que Gemini ne prend pas en charge le format PDF.. La documentation du modèle de Google mentionne la prise en charge des fichiers PDF ; notre requête a échoué avant qu’une réponse du modèle ne soit visible sur un chemin de conversion via une passerelle compatible avec OpenAI. Une vérification native via Google AI Studio ou l’API Gemini reste nécessaire avant de tirer toute conclusion concernant le comportement natif des fichiers PDF.

La validation par un éditeur est encore nécessaire : Exécutez la tâche PDF via Google AI Studio (version native) ou l'API Gemini, puis enregistrez l'intégralité de la requête, la réponse du modèle, le panneau d'utilisation et les preuves de citation de la page. Tant que ces captures d'écran n'existent pas, cette analyse ne fait état que de l'échec de la conversion de « Broly » et ne formule aucune affirmation concernant les performances sur les PDF natifs.

Gemini 3.6 Accès à l'API Flash et code

Les développeurs qui souhaitent comparer un modèle Google doté de capacités de raisonnement plus avancées peuvent utiliser le Guide des tarifs et des performances de l'API Gemini 3.1 Pro comme référence pour la prochaine étape.

Le modèle Gemini 3.6 Flash est disponible dans Google AI Studio et via l'API Gemini pour développeurs sous l'identifiant de modèle stable gemini-3.6-flash. Google recommande la version la plus récente API Interactions pour les nouveaux projets d'agentique, tandis que les projets déjà établis générer du contenu Cette interface continue d'être prise en charge et couvre des fonctionnalités importantes qui ne sont pas encore disponibles via Interactions.

Python avec le SDK officiel Google Gen AI

Exemple d'API
from google import genai

client = genai.Client()

response = client.models.generate_content(
    model="gemini-3.6-flash",
    contents=(
 "Examinez cette proposition de modification du code. Identifiez la cause première, "
 " la correction minimale sans risque, ainsi que le test précis qui permettrait de la valider. "
    ),
)

print(response.text)

Le client lit les identifiants à partir de la configuration de l'environnement pris en charge ; ne codez pas en dur et ne publiez pas de clé. L'exemple évite délibérément les champs d'échantillonnage obsolètes et utilise la documentation officielle de Google google-genai generate_content méthode. N'ajoutez des schémas, des paramètres de sécurité et des outils que dans la mesure où la charge de travail l'exige.

JavaScript avec @google/genai

Exemple d'API
import { GoogleGenAI } from "@google/genai";

const ai = new GoogleGenAI({});

const response = await ai.models.generateContent({
  model: "gemini-3.6-flash",
  contents: "Extrayez les risques et renvoyez un résumé concis et étayé par des sources.",
});

console.log(response.text);

Pour garantir la fiabilité en production, validez la structure renvoyée, examinez les motifs d'échec, enregistrez les appels aux outils et faites la distinction entre la réussite du transport et celle de la tâche. Une réponse 200 contenant un JSON tronqué ou une action non prise en charge ne constitue pas un résultat métier satisfaisant.

API Interactions ou création de contenu ?

L'API Interactions ajoute un état côté serveur facultatif via identifiant_de_l'interaction_précédente, des étapes d'exécution observables et l'exécution en arrière-plan pour les tâches plus longues. Cette fonctionnalité est particulièrement intéressante pour les nouvelles boucles d'agents, car les traces d'état et d'outils y sont des concepts de premier ordre. Vérifiez les paramètres de stockage et de conservation avant de l'utiliser avec du contenu sensible.

Conserver générer du contenu lorsque ses fonctionnalités, une fois au point, correspondront mieux à l'application. En juillet 2026, la documentation de Google indique qu'Interactions ne prend pas encore en charge l'API Batch, la mise en cache explicite, les paramètres de sécurité personnalisés, les métadonnées vidéo ni l'appel automatique de fonctions Python. La prise en charge des modèles et celle de l'interface API sont deux questions distinctes.

Gemini 3.6 Modifications liées à la migration de l'API Flash

Pour découvrir le processus de mise en œuvre complet concernant la gamme de modèles Pro de Google, consultez le Tutoriel de programmation Gemini 3.1 Pro.

Passer d’anciens formats de requêtes ne se résume pas à changer simplement le nom du modèle. Google’s Guide de migration vers le dernier modèle les paramètres des documents et les modèles de conversion obsolètes, ignorés ou rejetés. Considérez la migration comme une modification du contrat de requête et de l'intégrité de l'état.

Supprimer les contrôles obsolètes et le préremplissage

Retirer température, top_p, et top_k. Google indique qu’ils sont obsolètes et ignorés pour ces modèles, les générations futures devant renvoyer un code HTTP 400 lorsqu’ils sont fournis. Un ancien température : 0 Ce champ ne doit pas être considéré comme une garantie de déterminisme.

Les requêtes ne doivent pas non plus se terminer par un préremplissage non vide du rôle du modèle. Certaines pratiques, telles que l'ajout de “ Translation: ” ou de l'accolade d'ouverture JSON à une ligne du modèle, peuvent entraîner une réponse HTTP 400. Remplacez le préremplissage par des instructions système, des sorties structurées, des schémas explicites et des validateurs.

Remplacer les valeurs numériques réfléchir_au_budget commandes avec le niveau de réflexion énumération ; Gemini 3.6 Les paramètres par défaut de la mémoire flash sont moyen. Supprimer nombre_de_candidats, ce que la version Gemini 3.x ne prend pas en charge, et mettre en œuvre des solutions alternatives au niveau de l'application si plusieurs stratégies candidates s'avèrent réellement nécessaires.

Conserver l'état de l'appel de fonction

Les flux de travail des outils nécessitent que les identifiants d'appel, les noms de fonction, les signatures de réflexion et l'ordre des tours restent inchangés. Lorsque vous utilisez générer du contenu, chacun FunctionResponse devrait inclure son call_id et nom. Tester les appels mal formés, afficher un texte explicatif avant la sortie de l'outil et gérer la récupération en cas de rejet ou d'indisponibilité des outils.

  • Modifiez l'ID du modèle cible pour qu'il devienne gemini-3.6-flash.
  • Retirer température, top_p, top_k, et nombre_de_candidats.
  • Remplacer réfléchir_au_budget avec niveau de réflexion.
  • Supprimer le préremplissage « modèle-tour ».
  • Conserver les identifiants d'appel de fonction, les noms, les signatures de réflexion et l'ordre des outils.
  • Vérifiez les motifs de fin d'exécution, les schémas, les nouvelles tentatives et chaque déclaration de réussite.
  • Recalculer le coût par tâche réussie, en tenant compte des appels et des outils ayant échoué.
  • Effectuez des tests d'injection dans l'invite de commande et d'actions destructrices avant toute utilisation de l'ordinateur.
Résumé de la migration : contrôler les demandes de modification et conserver l'historique complet de l'outil. Vérifier la couverture actuelle de l'API avant de choisir « Interactions ».

Gemini 3.6 Flash vs 3.5 Flash et Flash-Lite

Les équipes qui hésitent entre Google et OpenAI peuvent comparer les avantages et les inconvénients dans notre GPT-5.4 vs Gemini 3 : bref comparatif.

Gemini 3.6 Flash est la version de mise à niveau directe de Gemini 3.5 Flash. Le prix standard d’entrée reste fixé à $1,50 par million de jetons, tandis que le prix de sortie passe de $9,00 à $7,50— soit une réduction de 16,71 TP40T avant même de tenir compte du rapport distinct de Google faisant état d’une utilisation moindre des jetons de sortie dans une évaluation.

CatégorieGemini 3,6 FlashGemini 3.5 Flash
Entrée standard / 1M$1.50$1.50
Sortie standard / 1M$7.50$9.00
DeepSWE v1.149.0%37.0%
MLE-Bench63.9%49.7%
OSWorld-Vérifié83.0%78.4%
1M GDM-MRCR v254.0%26.6%
Notre réparation de code borné5/5 après réparation5/5 après une extraction en conditions tolérantes
Prix officiels et valeurs de référence, ainsi que notre dispositif de codage à passage unique, indiqué séparément.

L'argument en faveur de la migration est d'autant plus convaincant que de meilleurs scores d'agentique, un prix de sortie plus bas et des boucles plus courtes se traduisent par un travail plus fructueux par dollar investi. Il est d'autant moins convaincant qu'un référentiel ou un outil spécifique entraîne une exécution incomplète, une vérification erronée ou des corrections humaines répétées. Exécutez des prompts appariés avec les mêmes outils et les mêmes tests d'acceptation.

Où s'installe le Gemini 3.5 Flash-Lite ?

Gemini 3.5 Flash-Lite Il s'agit d'une version plus économique destinée à l'extraction, la classification, la traduction, le routage, le traitement de documents et les tâches confiées à des sous-agents dans un cadre délimité, à haut débit. Les tarifs standard sont de $0,30 par million de tokens d'entrée et de $2,50 par million de tokens de sortie. Le 3.6 Flash est donc cinq fois plus cher en entrée et trois fois plus cher en sortie.

Un routeur à deux niveaux peut attribuer par défaut les tâches éligibles à Flash-Lite et transférer vers 3.6 Flash les tâches à faible niveau de confiance, nécessitant beaucoup d’outils, multimodales ou à long terme. Le routeur doit être observable et réversible, les raisons devant être consignées et les coûts de réessai et de correction pris en compte. Des jetons moins chers ne signifient pas automatiquement des tâches achevées moins coûteuses.

Un planificateur pragmatique commence par une approche minimaliste et intensifie ses efforts en fonction d'éléments tels qu'un faible niveau de confiance, le besoin d'outils ou un horizon de tâches étendu.

Premiers retours d'utilisateurs et résultats fournis par des tiers

La version Gemini 3.6 Flash était disponible depuis environ un jour lorsque ces captures d'écran ont été réalisées, le 22 juillet 2026. Les publications sont Anecdote sociale des données factuelles, et non un sondage représentatif, et les classements des plateformes sont Test de performance réalisé par un organisme indépendant des données factuelles plutôt que des résultats de recherche sur Google ou nos propres mesures. Elles sont utiles pour identifier des hypothèses à tester.

Des signaux encourageants concernant les navigateurs et le front-end, mais avec quelques réserves

Arena.ai a classé Gemini 3.6 Flash à la 12e place avec 1 537 points dans le classement « Frontend Code Arena », soit une progression par rapport à la 21e place occupée par Gemini 3.5 Flash. Ce résultat tient compte des consignes, des votants, de l'instantané du modèle et de la méthode de classement d'Arena. Il corrobore l'hypothèse d'une amélioration du front-end, mais ne permet pas d'établir une norme universelle de qualité du code.

Browser Use a enregistré un score de 68% lors de son test de performance BU Benchmark et a qualifié ce modèle de meilleure option en termes de rapport prix/performances parmi les agents de navigation. Il s'agit d'un benchmark réalisé par le fournisseur lui-même, et non d'une évaluation neutre du secteur. Ces résultats sont intéressants à titre indicatif, parallèlement à ceux obtenus par Google lors de l'OSWorld, mais les équipes devraient reproduire les tâches du navigateur au sein de leur propre environnement de test sécurisé et de leur propre infrastructure d'exécution des outils.

Un utilisateur de X particulièrement critique a interprété le tableau de Google différemment, affirmant que les progrès les plus convaincants concernaient la vision et le contexte plutôt que le codage. Un autre utilisateur a mis en avant un indice composite de codage où la note de 3,6 se situait légèrement en dessous de 3,5. Des combinaisons de tâches différentes peuvent produire des résultats apparemment contradictoires ; c'est pourquoi les noms et les méthodes des tests de référence doivent toujours être précisés pour chaque chiffre.

Une lecture critique du tableau officiel publié par @synthwavedd. Consultez la publication originale sur X. Il s'agit d'un commentaire, et non d'un test pratique.

Les rapports de codage mettent l'accent sur la vérification et l'exhaustivité

Le rapport Reddit le plus détaillé décrivait la version 3.6 de Flash comme rapide et performante lorsque les tâches étaient clairement délimitées, mesurables et instrumentées avant la réparation. Le même auteur mettait en garde contre les affirmations de vérification trop catégoriques, une autonomie pouvant sembler destructrice et le coût en termes de supervision lié à la vérification du travail. L’auteur a également révélé qu’un autre modèle avait examiné ou corrigé le résultat et qu’un problème de configuration avait faussé une partie du test.

Rapport d'agent de codage mixte de l'utilisateur u/Valuable_Elevator948.
Consulter le fil de discussion original sur Reddit. Étude préliminaire avec prise en compte des facteurs de confusion.

Un autre utilisateur de Reddit a signalé un travail inachevé sur un projet, suivi d'une affirmation selon laquelle la tâche était terminée. Les commentateurs ont fait état de problèmes similaires liés au contexte, au débogage et à des vérifications erronées. La configuration de l'outil et les invites n'ayant pas fait l'objet d'une vérification indépendante, ce rapport devrait être considéré comme un cas d'essai et non comme un verdict général.

Rapport négatif sur le codage du projet, rédigé par l'utilisateur u/Embarrassed_Time_129.
Consulter le fil de discussion original sur Reddit. D'ordre anecdotique et spécifique à un processus de travail.

La leçon couramment tirée de l'évaluation consiste à distinguer la qualité du correctif de l'exactitude de la vérification. Un modèle peut suggérer une modification utile, mais utiliser un test incapable de détecter le correctif, omettre la dernière partie de la tâche ou présenter de manière erronée les échecs restants. Les critères d'acceptation doivent vérifier l'artefact, la capacité de discrimination du test, l'état final et l'exactitude du rapport d'achèvement.

Limites, sécurité et limites des données probantes

Gemini 3.6 Flash présente les modes de défaillance propres au modèle de base, notamment la génération de faits erronés, une exécution incomplète et des conclusions affirmées mais non étayées. La fiche du modèle mentionne également des ralentissements occasionnels ou des dépassements de délai. Sa date limite de mise à jour des connaissances, fixée à mars 2026, implique que les faits plus récents nécessitent une justification, une source fiable et actuelle ou la fourniture de documents.

Google fait état de comparaisons globalement positives en matière de sécurité par rapport au modèle Gemini 3.5 Flash, notamment une amélioration de la sécurité dans les tâches « texte vers texte » et multilingues, une sécurité inchangée dans les tâches « image vers texte », ainsi que de légères régressions au niveau du ton de refus et des refus injustifiés. Après des tests supplémentaires, le modèle est resté en dessous des niveaux de capacité critiques définis par Google. Il s’agit d’évaluations communiquées par les éditeurs, et non de garanties indépendantes concernant un déploiement particulier.

L'utilisation d'un ordinateur nécessite des contrôles opérationnels plus stricts que le chat. Les agents utilisant des captures d'écran peuvent être confrontés à l'injection de commandes, à des contrôles trompeurs, à des fenêtres contextuelles et à des actions irréversibles. Il convient d'utiliser des environnements isolés, des identifiants avec des privilèges minimaux, des listes d'autorisations de domaines et d'actions, des confirmations, des journaux d'audit, des limites de dépenses et des plans de restauration.

Notre test de navigateur n'a pas exploité le point de terminaison natif « Computer Use » de Google et ne permet donc pas de valider les affirmations relatives à la latence, à la sécurité ou au taux de réussite de cette fonctionnalité. Il a porté sur l'interprétation des captures d'écran et sur un résolveur d'actions local basé sur du texte. De même, l'erreur de conversion PDF de Broly ne s'applique qu'à ce chemin de requête de la passerelle.

Nos chiffres de latence incluent le routage via la passerelle Broly et proviennent d'une seule petite suite, et non de distributions répétées. Nous n'avons pas mesuré le TTFT. Les coûts sont des estimations calculées à partir des données d'utilisation communiquées et des tarifs Standard officiels, et non à partir des factures ; par ailleurs, la suite n'utilisait pas la fonctionnalité « Search Grounding ».

Les tests de performance officiels, les classements établis par des tiers, nos tests de passerelle et les témoignages partagés sur les réseaux sociaux apportent des réponses à des questions différentes. Le fait de garder leurs étiquettes bien visibles permet d'éviter toute fausse impression de précision : les résultats de Google décrivent l'évaluation de Google, nos résultats décrivent un parcours et un ensemble de tests reproductibles, et les publications publiques décrivent des expériences individuelles.

À qui s'adresse le Gemini 3.6 Flash ?

Avant de choisir un mode d'accès, vérifiez si votre charge de travail nécessite réellement un forfait payant dans le Guide d'abonnement à Gemini 3 Flash.

Gemini 3.6 Flash constitue une option très intéressante pour les équipes qui utilisent déjà Gemini 3.5 Flash, en particulier lorsque le coût de sortie, les entrées multimodales, l'appel d'outils ou la planification agentique sont des facteurs déterminants. Il convient également aux nouvelles applications capables de définir des critères de réussite explicites et de superviser des actions sensibles au risque.

  • Développement d'agents dotés de tâches bien délimitées, d'espaces de travail isolés et de tests automatisés sélectifs.
  • Pipelines d'analyse de graphiques, d'images, de vidéos, de fichiers audio et de PDF qui génèrent du texte ou des données structurées.
  • Agents supervisés pour navigateur ou bureau, dotés de portes de confirmation et d'une validation locale.
  • Systèmes de travail intellectuel nécessitant l'appel de fonctions, la recherche de fichiers, la mise en cache ou la recherche contextualisée.
  • Les équipes peuvent comparer le coût par tâche réussie avec celui de 3.5 Flash et d'autres fournisseurs.

Cette solution est moins adaptée lorsque la tâche peut être gérée de manière fiable par Flash-Lite, lorsque la voix en temps réel nécessite l'API Live, ou lorsqu'une génération native d'images ou de fichiers audio est requise. Elle est également peu adaptée à une automatisation non supervisée à haut risque, sans possibilité de retour en arrière ni de vérification indépendante.

  • Transférer les tâches simples de classification et d'extraction vers un niveau de service moins coûteux tout en garantissant la qualité.
  • Ne partez pas du principe qu'une fenêtre contextuelle de 1 million remplace l'ingénierie de recherche.
  • N'acceptez pas le statut “ vérifié ” déclaré par l'utilisateur lui-même sans un test susceptible d'échouer.
  • Ne généralisez pas la latence de la passerelle Broly ni le comportement de conversion au format PDF aux points de terminaison natifs de Google.
  • Ne pas autoriser les actions irréversibles liées à l'utilisation de l'ordinateur sans confirmation explicite.

Verdict final

Cette analyse du modèle Gemini 3.6 Flash révèle un candidat solide pour la production, mais ne justifie pas une migration automatique. Le modèle allie un coût de production réduit, une large gamme d’entrées et d’outils, ainsi que des gains officiels significatifs sur les benchmarks DeepSWE, MLE-Bench, OSWorld et la recherche dans des contextes longs. Nos tests ciblés apportent des résultats encourageants en matière d’extraction exacte, de lecture de graphiques, de correction ciblée de code et de planification d’actions locales guidée par des captures d’écran.

La mise en garde est tout aussi concrète. Des limites de sortie strictes ont entraîné deux troncatures initiales ; le raisonnement a utilisé la quasi-totalité du budget alloué à l'achèvement du streaming ; notre test de récupération synthétique de 128 Ko a échoué à deux reprises ; et le plan du navigateur a généré un identifiant inconnu. Le chemin PDF n'a pas pu être testé en mode natif, car la conversion via Broly a échoué avant que le modèle ne renvoie une réponse.

Adoptez Gemini 3.6 Flash lorsqu’une évaluation comparative montre que ce modèle offre un meilleur rapport coût-efficacité par tâche accomplie que votre modèle actuel. Suivez le taux de réussite, les jetons, les nouvelles tentatives, les appels d’outils, les modifications indésirables, le temps consacré aux corrections manuelles, et vérifiez si chaque affirmation de vérification s’appuie sur un test discriminant. Pour les charges de travail mixtes, commencez par Flash-Lite et passez à un niveau supérieur en fonction des besoins observés.

Foire aux questions

La version Gemini 3.6 Flash est-elle disponible au grand public ?

Oui. Google indique que la version Gemini 3.6 Flash est stable et disponible pour une utilisation en production. L'identifiant du modèle est gemini-3.6-flash, et il est accessible via Google AI Studio et l'API Gemini pour développeurs. La couverture des fonctionnalités de l'API varie encore entre les interactions et générer du contenu.

Combien coûte le modèle Gemini 3.6 Flash ?

Le tarif standard est de $1,50 par million de jetons d'entrée et de $7,50 par million de jetons de sortie, y compris les jetons de réflexion. Les options « Batch » et « Flex » coûtent respectivement $0,75 en entrée et $3,75 en sortie, tandis que l’option « Priority » coûte $2,70 en entrée et $13,50 en sortie. La mise en cache et l’ancrage peuvent entraîner des frais supplémentaires.

Qu'est-ce que la fenêtre contextuelle « Gemini 3.6 Flash » ?

Gemini 3.6 Flash prend en charge jusqu’à 1 048 576 jetons d’entrée et 65 536 jetons de sortie. Il s’agit d’une limite de capacité, et non d’une garantie de récupération. Le résultat de Google pour le GDM-MRCR à 1 million était de 54,01 TP40T, et notre autre tâche synthétique de passerelle à 128 000 a échoué ; les systèmes critiques nécessitent donc toujours une récupération et une validation.

Le logiciel Gemini 3.6 Flash prend-il en charge les images, les fichiers audio, les vidéos et les PDF ?

Oui, Google indique que les formats pris en charge sont le texte, les images, les fichiers audio, les vidéos et les PDF. Le modèle génère du texte, des données structurées et des appels d'outils, plutôt que des images ou des fichiers audio au format natif. Notre chemin de conversion PDF via Broly n'était pas pris en charge, mais ce résultat de la passerelle ne signifie pas pour autant qu'il existe une limitation native concernant les fichiers PDF Gemini.

Le modèle Gemini 3.6 Flash est-il compatible avec une utilisation sur ordinateur ?

Oui. L'API Gemini de Google prend en charge l'utilisation sur ordinateur avec Gemini 3.6 Flash pour les environnements navigateur, mobile et bureau, mais cette fonctionnalité est encore en phase de préversion. Le client exécute les actions proposées et doit mettre en œuvre des confirmations et des contrôles de sécurité. Notre suite de captures d'écran locale ne constituait pas un test natif d'utilisation sur ordinateur.

La version Gemini 3.6 Flash est-elle meilleure que la version Gemini 3.5 Flash ?

Il s'avère plus performant dans plusieurs comparaisons Google et moins cher par jeton de sortie, mais la notion de “ meilleur ” dépend de la charge de travail. Notre test de codage borné a donné un résultat de 5/5 pour les deux modèles, tandis que le score de 3,5 a nécessité une extraction de code tolérante. Exécutez des tâches similaires et comparez le coût de réalisation vérifié, et non pas uniquement les noms des modèles.

Les paramètres « température », « top_p » et « top_k » sont-ils pris en charge ?

Google affirme que température, top_p, et top_k sont obsolètes et ignorés pour ces modèles ; les prochaines générations de modèles devraient les rejeter. Supprimez ces champs lors de la migration. Utilisez des instructions claires, des schémas, des sorties structurées et des validateurs d'application pour contrôler le comportement.

Existe-t-il une formule gratuite ?

Google propose un accès gratuit aux opérations d'entrée et de sortie dans le cadre de la formule Standard, sous réserve de limites de débit et de disponibilité. La page dédiée aux tarifs précise que les données relevant de la formule gratuite peuvent être utilisées pour améliorer les produits Google, tandis que celles relevant de la formule payante sont clairement identifiées comme telles. Vérifiez les conditions actuelles en matière de débit, d'utilisation des données et de couverture géographique avant d'envoyer des données de production ou sensibles.

Partager l'article :

Articles connexes