Guide des tarifs, des limites et de l'accès à l'API Omni Flash Gemini

gemini-omni-flash-api-tarifs-limites

Gemini Omni Flash est le nouveau modèle en avant-première de Google dédié à la génération de vidéos multimodales et au montage vidéo conversationnel. Pour les utilisateurs de l'API, l'identifiant du modèle à retenir est gemini-omni-flash-preview. Voici en quelques mots comment fonctionne la tarification : Tarifs de l'API Gemini indique la sortie vidéo à 1 TP40T17,50 par million de jetons de sortie vidéo, que Google décrit comme portant sur $0,10 par seconde pour une vidéo en 720p.

Ce qui prête à confusion, c’est que l’expression “ tarification Omni Flash Gemini ” peut désigner trois choses différentes. Les développeurs s’intéressent peut-être à la tarification des jetons API Gemini. Les créateurs, quant à eux, s’intéressent peut-être aux abonnements Google AI et aux crédits Flow. Quant aux utilisateurs lambda, ils s’intéressent peut-être moins aux SDK et davantage à la possibilité d’ouvrir un espace de travail et de commencer à générer du contenu avec le modèle.

C'est là que GlobalGPT s'intègre naturellement. GlobalGPT Pro inclut désormais l'accès à Gemini Omni Flash, ainsi qu'à la gamme plus étendue de modèles disponibles sur la plateforme, à l'exception de Google Veo 3.1. L'actuel Prix du GlobalGPT Pro est $10,8 par mois en cas de facturation annuelle, ou $15 par mois dans le cadre de la promotion mensuelle en cours. Pour les utilisateurs qui souhaitent tester Omni sans avoir à configurer de clés API, de projets de facturation ou d'appels SDK, cela peut être la solution la plus simple.

Vous trouverez ci-dessous un aperçu concret : le coût d'Omni via l'API, ce que comprennent les forfaits Google AI, les limites applicables dans la version préliminaire, et comment choisir entre l'accès à l'API, Google Flow et GlobalGPT Pro.

Tarifs du Gemini Omni Flash : la version courte

Si vous n'avez besoin que des chiffres, Gemini Omni Flash est un modèle payant de l'API Gemini. Il n'existe pas de niveau d'API gratuit pour Omni Flash. Les abonnements payants à Google AI incluent également l'accès à Omni via des crédits Flow, tandis que GlobalGPT Pro offre aux utilisateurs une solution multimodèle plus simple lorsqu'ils ne souhaitent pas gérer la configuration de l'API.

Itinéraire d'accèsPrix confirméMeilleure adéquationAvertissement principal
API Gemini1 TP40T1,50 / 1 million de tokens d'entrée ; 1 TP40T9 / 1 million de tokens de sortie texte ; 1 TP40T17,50 / 1 million de tokens de sortie vidéo ; environ 1 TP40T0,10 par seconde pour une vidéo en 720pDéveloppeurs, équipes produit, automatisation, tests par lotsPas de forfait API gratuit ; nécessite une configuration de l'API et un suivi de son utilisation
Google AI Plus$4,99 par mois, 200 crédits FlowTests préliminaires au sein des outils créatifs grand public de GoogleLe coût exact en crédits Omni par génération doit encore faire l'objet d'une vérification en temps réel via Flow avant la publication d'un tableau indiquant le nombre de crédits par vidéo.
Google AI Pro$19,99 par mois, 1 000 crédits FlowLes créateurs qui travaillent déjà avec Google FlowLes crédits sont utiles, mais ils ne correspondent pas à la facturation via l'API
Google AI Ultra$99,99 par mois avec 10 000 crédits Flow, ou $199,99 par mois avec 25 000 crédits FlowLes utilisateurs intensifs de Google Flow et les flux de travail créatifs à fort volumeUne augmentation des dépenses mensuelles n'a de sens que si Flow occupe déjà une place centrale dans le flux de travail
GlobalGPT Pro$10,8 par mois en cas de facturation annuelle ; $15 par mois dans le cadre de la promotion mensuelle en coursLes utilisateurs qui souhaitent bénéficier d'Omni et de plusieurs modèles d'IA dans un seul abonnementNe remplace pas la console API pour développeurs ni toutes les fonctionnalités officielles des applications Google.
Selon la grille tarifaire des API de Google, l'Omni Flash Gemini relève d'un modèle payant, le coût de la sortie vidéo s'élevant à environ $0,10 par seconde pour une vidéo en 720p.

Qu'est-ce que le Gemini Omni Flash ?

Gemini Omni Flash est un modèle vidéo de prévisualisation de l'API Gemini. Celui de Google Documentation de l'API Omni Il s'articule autour de la multimodalité native, de l'édition conversationnelle et de la connaissance du monde. Concrètement, il est conçu pour générer de courtes vidéos à partir de texte, utiliser des images de référence et conserver suffisamment de contexte pour permettre des modifications ultérieures lorsque le flux de travail le permet.

L'identifiant du modèle API est gemini-omni-flash-preview. Le terme “ préversion ” est important. Il signifie que le modèle est disponible à des fins de test et d’exploration en vue d’une production précoce, mais que les tarifs, les limites, l’étendue des fonctionnalités et le comportement peuvent encore évoluer plus rapidement que pour une gamme de modèles stables.

Google répertorie le modèle Gemini Omni Flash sous l'identifiant de modèle « gemini-omni-flash-preview ».

Les cas d'utilisation les plus pertinents sont les courtes prises de vue de produits, les concepts de vidéos destinées aux réseaux sociaux, les tests créatifs animés et les montages vidéo où la modification demandée est précise. Il ne s'agit pas d'un éditeur vidéo complet pour les formats longs. Les limites actuelles de l'aperçu doivent être considérées comme un outil de génération rapide de courts extraits, et non comme une suite complète de post-production.

Comment accéder à Gemini Omni Flash

Il existe trois moyens pratiques d'y accéder : l'API Gemini, les forfaits Google AI avec crédits Flow et GlobalGPT Pro. Bien qu'ils se recoupent, ils répondent à des besoins différents.

Option 1 : API Gemini

L'approche via l'API Gemini s'adresse aux développeurs et aux équipes techniques. Elle est particulièrement indiquée lorsque vous devez intégrer Omni à un produit, exécuter des tests reproductibles, générer des extraits à partir de consignes structurées ou suivre les coûts au niveau des requêtes. En contrepartie, la mise en place est complexe : vous devez disposer d’un système de facturation, d’un accès à l’API, d’un traitement des requêtes, d’un espace de stockage, ainsi que de votre propre workflow pour gérer les nouvelles tentatives et les fichiers multimédias.

Pour les équipes qui comparent déjà les coûts de génération vidéo, l'utilisation d'une API est la méthode la plus simple pour calculer le coût par clip. Un clip de 10 secondes en 720p coûte environ $1,00 en frais de production vidéo, hors jetons d'entrée et infrastructure associée. Les clips plus courts, de 3 et 8 secondes, sont proportionnellement moins chers.

Option 2 : Forfaits Google AI et crédits Flow

Les abonnements Google AI facilitent la tâche aux créateurs qui souhaitent utiliser Omni via les interfaces créatives de Google. Aux États-Unis, l'abonnement payant Projets d'IA de Google Afficher les formules Omni Access et les crédits Flow mensuels : « Plus » à $4,99 avec 200 crédits, Pro à $19,99 avec 1 000 crédits, et Ultra à $99,99 avec 10 000 crédits ou à $199,99 avec 25 000 crédits.

Les formules Google AI Plus, Pro et Ultra incluent explicitement des crédits Flow avec un accès à Omni Flash Gemini.

Il ne faut pas confondre les crédits de flux avec la facturation des jetons API Gemini. Les crédits correspondent à un quota attribué aux utilisateurs finaux. Les jetons API constituent une unité de facturation destinée aux développeurs. Si votre principale question est “ Combien mon application va-t-elle dépenser par seconde générée ? ”, utilisez le tarif de l'API. Si votre principale question est “ De combien de tentatives de création est-ce que je dispose dans Flow ? ”, utilisez le forfait Google AI et le quota de crédits correspondant.

Option 3 : GlobalGPT Pro

GlobalGPT Pro est la solution la plus pratique pour les utilisateurs qui souhaitent tester Gemini Omni Flash sans que cela ne se transforme en un projet de configuration d'API. Le prix annuel actuel est de $10,8 par mois en cas de facturation annuelle, tandis que la promotion mensuelle actuelle propose la version Pro à $15 par mois. GlobalGPT Pro donne également accès à la gamme plus étendue de modèles de la plateforme, à l'exception de Google Veo 3.1.

Les domaines d'application du GlobalGPT Pro

L'intérêt ne réside pas dans le fait que l'API GlobalGPT remplace l'API Gemini. Ce n'est pas le cas. L'intérêt réside plutôt dans le fait que de nombreux utilisateurs n'ont pas besoin d'une console API pour leurs tests quotidiens. Ils ont besoin d'un espace leur permettant de passer d'un modèle à l'autre, de comparer les résultats et de créer du contenu sans avoir à souscrire à des abonnements payants distincts pour chaque fournisseur.

Tout ce qu'il faut savoir sur la tarification de l'API Omni Flash Gemini

La grille tarifaire de Google est concise, mais le tarif affiché ne permet pas à lui seul de déterminer si Omni Flash offre un bon rapport qualité-prix. La comparaison pertinente porte sur le coût par clip réussi : ce que le modèle offre en termes de production vidéo une fois pris en compte le respect des instructions, les nouvelles tentatives, la résolution des problèmes et la fiabilité du flux de travail.

  • Entrée : 1 TP40T1,50 par million de jetons.
  • Sortie texte : $9,00 par million de jetons.
  • Sortie vidéo : $17,50 par million de jetons, ce que Google estime à environ $0,10 par seconde pour une vidéo en 720p.
  • Niveau d'accès gratuit à l'API : Non disponible pour le modèle Omni Flash Gemini.

Coût estimé de la production vidéo en fonction de la durée

Durée demandéeCoût approximatif de la sortie vidéo APINotes
3 secondesÀ propos de $0.30Utile pour les tests de mouvement rapides et les transitions
8 secondesÀ propos de $0.80Une durée adaptée aux démonstrations de produits et aux vidéos destinées aux réseaux sociaux
10 secondesÀ propos de $1.00La limite supérieure de la fourchette actuelle de durée de l'API

Ces estimations se basent sur les recommandations de Google concernant la sortie vidéo en 720p. Les jetons d'entrée, le stockage, les tentatives de réessai et tous les coûts liés à l'application sont facturés séparément.

Les performances d'Omni Flash justifient-elles le prix de l'API ?

Il n'existe pas de score de référence public unique permettant de traduire la qualité vidéo en un rapport qualité-prix clair ; c'est pourquoi notre ensemble de tests pratiques est ici plus utile qu'une note synthétique. Elle permet de déterminer si le modèle a restitué le format demandé, préservé les détails visuels essentiels, respecté les délais d'exécution et mené à bien le flux de travail de manière fiable.

Comparatif pratique du rapport qualité-prix

Grandeur mesuréeRésultat observéCe que cela signifie en termes de valeur
Demandes de base ou de génération traitées5 sur 5La conversion de texte en vidéo, la sortie en mode portrait, la conversion d'image en vidéo, un clip de base et une séquence chronométrée ont tous donné lieu à des vidéos lisibles.
Images réussies et coût estimé de la production vidéo42 secondes pour environ $4,27Le prix catalogue a permis de réaliser plusieurs courts extraits exploitables sans disposer d'un budget d'essai important.
Durée de réalisation contrôlée25,7 à 39,2 secondes pour les tâches d'une durée de 8 à 10 secondesSuffisamment rapide pour le travail itératif sur les concepts ; ces temps ne correspondent pas à des mesures de la vitesse de l'interface GlobalGPT.
Format et cohérenceLes tests en format natif 9:16 et avec image de référence ont été réussisLe prix est plus facile à justifier lorsque le premier tirage présente déjà l'orientation souhaitée et met bien en valeur le sujet.
Modification de suivi avec état0 sur 1 ; HTTP 502La fiabilité du montage peut augmenter le coût réel si le flux de production repose sur des tentatives répétées.

Au vu de ces éléments, le prix de l’API est parfaitement adapté à la conception rapide d’idées, aux visuels de produits, aux concepts pour les réseaux sociaux et aux tests d’animation basés sur des références. Un résultat en 720p d’une durée de 8 ou 10 secondes coûte moins d’un dollar ou environ un dollar en sortie vidéo, et les exécutions réussies s’effectuent suffisamment rapidement pour permettre une itération rapide.

Ce format est moins adapté aux livraisons finales ou aux projets de longue durée. La sortie est limitée à 720p et 10 secondes ; lors de notre test, la durée exacte était approximative, et l’édition avec état a échoué une fois. Un projet nécessitant de nombreuses tentatives, l’assemblage de clips, une conversion vers une résolution supérieure ou des retouches fiables peut coûter nettement plus cher que ne le laisse supposer le tarif à la seconde annoncé.

Forfaits Google AI vs GlobalGPT : quel prix est le plus raisonnable ?

Ces options doivent être évaluées en fonction de leur utilisation plutôt qu’en se basant uniquement sur leurs tarifs mensuels. Google propose des capacités de plus en plus importantes au sein de son propre environnement créatif. GlobalGPT répartit la valeur de l’abonnement entre Omni et d’autres modèles. Aucune de ces deux approches ne permet au modèle Omni sous-jacent d’obtenir de meilleurs résultats simplement parce que l’utilisateur choisit une formule plus chère.

Comment interpréter l'échelle tarifaire de Google

Le tableau est plus révélateur qu’un simple récapitulatif des tarifs. À chaque niveau, l’allocation Flow augmente plus rapidement que le forfait mensuel ; ainsi, le coût nominal par crédit inclus diminue à mesure que l’engagement d’utilisation augmente. Cela fait de l’offre « Pro » le niveau le plus équilibré pour une utilisation régulière de Flow, tandis que l’offre « Ultra » correspond à un achat de capacité destiné aux utilisateurs capables de consommer une allocation bien plus importante et de tirer parti des autres fonctionnalités premium de Google.

Stratégie de Google en matière d'IAPrix mensuel aux États-UnisCrédits de fluxCoût nominal par crédit inclusMeilleure adéquation
AI Plus$4.99200Environ 2,50 centimesL'option d'abonnement officielle la plus économique pour une utilisation occasionnelle de Flow
AI Pro$19.991,000Environ 2,00 centimesLes créateurs réguliers qui prévoient de travailler sur Flow chaque mois
AI Ultra$99.9910,000Environ 1,00 centLes applications nécessitant des débits élevés et les utilisateurs qui apprécient également les fonctionnalités de la gamme Ultra
AI Ultra, option à limite supérieure$199.9925,000Environ 0,80 centUne utilisation très intensive des outils officiels, dans le cadre de laquelle la majoration sera effectivement mise à profit

Du forfait Plus au forfait Pro, le volume inclus est multiplié par cinq tandis que le prix est multiplié par environ quatre, ce qui réduit le coût nominal par crédit inclus d’environ 20%. Le premier niveau « Ultra » double encore cette efficacité par rapport au niveau « Pro ». Cela semble impressionnant sur le papier, mais un coût unitaire plus bas n’est pas synonyme de dépenses totales plus faibles : la capacité inutilisée peut faire des formules « Plus » ou « Pro » le meilleur rapport qualité-prix, même lorsque le niveau « Ultra » présente le meilleur rapport.

Le résultat obtenu via l'API, à savoir 42 secondes de vidéo réussies pour environ $4,27, constitue une référence utile en matière de performances, mais il ne permet pas de calculer le nombre de clips Omni qu'un plan Flow produira. Les crédits Flow et les jetons vidéo API sont des unités de facturation distinctes, et la consommation de crédits en temps réel pour chaque opération Omni doit encore faire l'objet d'une vérification séparée.

Les domaines d'application du GlobalGPT Pro

La valeur de GlobalGPT est horizontale plutôt que basée sur le volume. Si Omni est le seul modèle que vous comptez utiliser, l’API Gemini ou un forfait Google AI sont plus faciles à évaluer, car l’unité de facturation correspond directement aux requêtes ou à la capacité de Flow. Si ce même abonnement est également utilisé pour la rédaction, la recherche, le traitement d’images et les comparaisons entre plusieurs modèles, son rapport coût-efficacité s’améliore, car le coût est réparti sur un plus grand nombre de workflows. Il ne remplace toutefois pas les fonctionnalités natives de Flow ni le contrôle de l’API au niveau développeur.

Quelle option est réellement rentable ?

Si vous êtes…Choisissez…Pourquoi
Intégrer Omni dans une applicationAPI GeminiVous avez besoin d'un contrôle des requêtes, de coûts prévisibles par seconde et d'une intégration technique.
Essayer Omni dans l'offre officielle Google Flow avec l'engagement mensuel le plus basGoogle AI PlusCela permet de limiter l'engagement global tout en offrant une capacité suffisante pour déterminer si Flow s'intègre bien au flux de travail.
Créer et itérer dans Flow chaque moisGoogle AI ProPar rapport à l'offre « Plus », le forfait augmente plus rapidement que le tarif, ce qui en fait l'offre la plus équilibrée pour une utilisation régulière.
Exécution de tâches à grand volume dans les outils de création officiels de GoogleGoogle AI UltraSa rentabilité unitaire n'est optimale que lorsque la capacité de Flow est élevée et que les fonctionnalités supplémentaires de Google sont réellement utilisées.
Tester Omni aux côtés de plusieurs modèles d'IA pour la création de contenuGlobalGPT ProSa valeur augmente en fonction du nombre de modèles et de flux de travail non vidéo utilisés, plutôt qu'en fonction du seul volume de production d'Omni.

Si vos recherches sur les vidéos générées par l'IA vont au-delà d'Omni, commencez par la comparaison qui correspond à votre prochaine décision. La Prix de l'API Sora 2 Ce guide est utile lorsque vous comparez les coûts liés aux développeurs, tandis que le Génération de vidéos Sora Ce guide facilite les processus de travail des créateurs. Pour les choix entre modèles, le Veo 3.1 vs Sora 2 La ventilation est la prochaine lecture la plus proche.

Les limites de l'Omni Flash Gemini que vous devez connaître

Omni Flash est un outil puissant, mais son aperçu présente des limites bien définies. Il est plus important de bien les comprendre avant de dépenser vos crédits que de mémoriser les caractéristiques techniques d'un modèle.

Les notes de mise à jour de Google indiquent que la génération d'une vidéo en 720p via l'API Interactions prend entre 3 et 10 secondes.

Durée et résolution

La version préliminaire actuelle de l'API prend en charge les vidéos provenant de 3 à 10 secondes à 720p, comme indiqué dans le document de Google Notes de mise à jour de l'API Gemini. Omni Flash est donc un générateur de courts extraits. Il peut s'avérer idéal pour mettre en valeur des produits, développer des concepts pour les réseaux sociaux, créer des transitions et réaliser des tests visuels rapides, mais il n'est pas conçu pour générer une vidéo complète de plusieurs minutes en une seule requête.

Rapport d'aspect

Paysage 16:9 C'est le réglage par défaut. Portrait 9:16 peut également être demandée, ce qui est utile pour TikTok, Reels, Shorts et les tests publicitaires destinés en priorité aux appareils mobiles.

Image vers vidéo

Omni prend en charge les flux de travail basés sur des images de référence. C'est important pour les photos de produits, car cela permet de partir d'un repère visuel plutôt que de demander au modèle d'inventer l'objet à partir d'un simple texte. L'image de référence doit toutefois être accompagnée d'instructions claires concernant le mouvement. Une bonne consigne décrit ce qui doit bouger, ce qui doit rester inchangé et comment la caméra doit se comporter.

Google montre comment une image de référence et une consigne de mouvement peuvent être transformées en séquences réalistes.

Montage vidéo avec état

L'API Interactions permet de conserver le contexte vidéo pour des modifications ultérieures liées à une interaction précédente. Pour les utilisateurs, cela signifie qu'il est possible de demander une modification, comme changer la couleur d'un produit ou ajuster un détail d'une scène, sans avoir à réécrire l'intégralité de la consigne d'origine. Les meilleures modifications restent toutefois précises et concrètes.

L'API Interactions permet de conserver le contexte vidéo tout en effectuant des modifications ultérieures.

Restrictions relatives à l'aperçu

La version préliminaire comporte également d'importantes restrictions techniques. La documentation de Google énumère les limitations concernant la disponibilité par région, les médias de référence, l'édition vocale, l'interpolation, les paramètres avancés et certaines commandes d'instructions. Les vidéos générées incluent également le SynthID, et les filtres de sécurité peuvent avoir une incidence sur les résultats.

L'API de prévisualisation comporte des restrictions spécifiques concernant les fichiers multimédias téléchargés, les régions, l'édition vocale et les paramètres avancés.

En résumé, Omni Flash doit être testé comme un outil en avant-première : suffisamment robuste pour y baser des flux de travail, mais pas comme une solution de production définitivement établie sans suivi des modifications.

Résultats des tests pratiques du Gemini Omni Flash

Nous avons testé la même chose gemini-omni-flash-preview modèle disponible sur GlobalGPT Pro via un flux de travail API contrôlé.

Lors de nos tests, nous avons évalué cinq scénarios d'utilisation concrets : la conversion de texte en vidéo de base, la sortie native au format 9:16, la cohérence par rapport à une image de référence, un montage de suivi tenant compte de l'état antérieur et une séquence chronométrée de 10 secondes.

Comment interpréter les résultats : Chaque vidéo de sortie est associée à ses données de mesure et à ses notes d'évaluation. La durée d'exécution correspond au temps de bout en bout mesuré dans le flux de travail contrôlé, et non à la vitesse de l'interface GlobalGPT.

T1 · Du texte à la vidéo

Test de mouvement pour le latte art

En grande partie adopté
8,0 sdurée réelle
1280 × 720résolution
16:9ratio réel
28,6 sdurée d'exécution contrôlée
Son disponiblePiste à 128 kbps détectée
~$0.81coût estimé de l'API

Le motif en rosette reste reconnaissable, la vapeur reste visible et le mouvement de la main est net dans les images échantillonnées. La tasse est légèrement soulevée vers le milieu au lieu de simplement tourner sur place ; le respect des instructions était donc satisfaisant, mais pas parfait.

À emporter : Un résultat exploitable, avec un grand réalisme visuel, mais les petits détails liés aux mouvements doivent encore être vérifiés image par image.

Afficher le message exact

Créez une vidéo photoréaliste de 8 secondes au format 16:9, filmée en un seul plan continu. Une tasse en céramique remplie de latte repose sur une table de café en noyer, près d’une fenêtre baignée de soleil. La main d’un barista fait tourner doucement la tasse d’environ 30 degrés, révélant un motif de latte art « rosetta » bien défini. Une vapeur fine et réaliste s’élève naturellement et s’enroule dans la lumière du matin ; la surface du liquide et le mouvement de la main doivent obéir aux lois de la physique du monde réel. Utilisez un zoom avant lent et subtil, une faible profondeur de champ, une lumière naturelle et chaleureuse, ainsi qu’une ambiance de café authentique. Pas de dialogue, pas de musique, pas de coupures, pas de légendes, pas de noms de marques visibles, pas de logos et pas de filigrane.

T2 · Vidéo verticale

9 h 16 : test d'ouverture du produit

Adopté
8,0 sdurée réelle
720 × 1280résolution
9:16ratio réel
25,7 sdurée d'exécution contrôlée
Son disponiblePiste à 128 kbps détectée
~$0.81coût estimé de l'API

Le résultat respecte le format portrait demandé. Le boîtier reste centré, le couvercle s'ouvre et les deux écouteurs restent visibles. La main reste dans le cadre après l'ouverture, mais la géométrie du produit reste stable et aucun logo ni texte n'apparaît dans les images échantillonnées.

À emporter : Le Gemini Omni Flash permet d'obtenir un extrait vidéo véritablement vertical, plutôt qu'une image recadrée au format paysage.

Afficher le message exact

Réalisez une vidéo de produit photoréaliste de 8 secondes au format vertical 9:16, en un seul plan continu. Centrez un étui de recharge mat bleu cobalt pour écouteurs sans fil sur un socle de studio gris clair et épuré. Une main humaine apparaît depuis le bord inférieur, ouvre le couvercle en douceur et dévoile deux écouteurs bleus assortis. Dans le même temps, la caméra effectue une demi-rotation contrôlée de l'avant gauche vers l'avant droit tout en gardant le boîtier centré et entièrement visible. Utilisez un éclairage de studio commercial doux, des matériaux réalistes, une géométrie stable et une interaction précise entre la main et l'objet. Pas de logo, pas de texte, pas de coupures, pas d'objets superflus, pas de doigts déformés et pas de filigrane.

T3 · De l'image à la vidéo

Test de cohérence des images de référence

Adopté
8,0 sdurée réelle
1280 × 720résolution
16:9ratio réel
29,0 sdurée de lecture de la vidéo contrôlée
Son disponiblePiste à 128 kbps détectée
~$0.82estimation de la durée de la vidéo*

Le corps bleu, la poignée jaune, le bec court, la surface en pierre et le décor de cuisine baignée de soleil restent inchangés. De la vapeur apparaît après le plan d’ouverture. La vidéo utilise un cadrage légèrement plus large que l’image source ; la fidélité est donc bonne, sans pour autant que les pixels soient identiques.

À emporter : L'image de référence a permis un contrôle efficace de l'identité sans pour autant figer la scène dans un cadre statique.

Afficher le texte exact de l'animation

Animez cette image de référence pour en faire une vidéo photoréaliste de 8 secondes au format 16:9. Conservez exactement la couleur bleu cobalt du corps de la théière, la poignée jaune vif, les proportions, la forme du bec verseur, la position sur la table, la direction de la lumière et la composition générale. Ajoutez un mince filet de vapeur réaliste s'échappant du bec verseur tandis que la caméra effectue une orbite lente et fluide vers la droite d'environ 20 degrés. Veillez à ce que la théière reste rigide et visuellement fidèle à l'image de référence ; n'ajoutez, ne supprimez, ne recolorez ni ne modifiez la forme d'aucun objet. Pas de texte, pas de logo, pas de coupures, pas de personnages et pas de filigrane.

T4 · Édition avec gestion de l'état

Suivi du vélo « du bleu au rouge »

Échec de la modification
8,0 sdurée de base
1280 × 720résolution de base
16:9rapport de base
29,6 sdurée d'exécution contrôlée par la base
52,0 stemps de réponse de la modification ayant échoué
HTTP 502modifier la réponse

La vidéo de base montre bien une femme adulte vêtue d'un imperméable jaune à côté d'un vélo bleu en bon état, dans une rue mouillée. La vidéo suivante, issue de la même session, visait à renforcer le message de la vidéo de base, mais le montage a renvoyé une réponse 502 indiquant l'absence de streaming, aucun fichier multimédia et aucun événement d'utilisation.

À emporter : Cette exécution ne prouve pas que l'édition avec état fonctionne de manière fiable. Il s'agit d'un véritable échec, et la continuité n'a pas pu être évaluée.

Afficher les messages de base et de suivi

Consignes : Créez une vidéo cinématographique photoréaliste de 8 secondes au format 16:9, en un seul plan séquence. Une femme adulte vêtue d’un imperméable jaune vif se tient à côté d’un vélo de ville bleu dans une rue urbaine mouillée, juste après la pluie. Elle tient légèrement le guidon tandis que des reflets scintillent sur la chaussée et que quelques gouttes de pluie tombent d’un auvent. Utilisez un lent mouvement latéral de la caméra, une lumière naturelle sous un ciel couvert, une anatomie humaine réaliste, une géométrie stable du vélo et des couleurs homogènes. Pas de dialogue, pas de texte, pas de logo, pas de coupures et pas de filigrane. Suivi : Remplacez le vélo bleu par un vélo rouge. Conservez tout le reste tel quel.

T5 · Calendrier et limites

Test de contrôle de la chronologie de 10 secondes

En grande partie adopté
10,0 sdurée réelle
1280 × 720résolution
16:9ratio réel
39,2 sdurée d'exécution contrôlée
Son disponiblePiste à 128 kbps détectée
~$1.02coût estimé de l'API
0 à 3 ansBoîte fermée
3 à 6 sLe couvercle s'ouvre
6 à 10 sLes étoiles se lèvent

Échantillons de limites observés : La boîte était encore fermée à 4,0 s, le couvercle s'est ouvert à 4,5 s et les étoiles sont apparues à 6,5 s. La séquence était correcte, mais la première transition a commencé plus tard que prévu.

À emporter : Le modèle a respecté l'ordre des événements et a restitué la durée maximale de 10 secondes, mais la chronométrie de deuxième niveau était approximative et non précise à l'image près.

Afficher le message exact

Réalisez une vidéo de studio photoréaliste de 10 secondes au format 16:9, en un seul plan continu sans mouvement de caméra. Une petite boîte-cadeau rouge mat ornée d’un ruban doré est placée au centre d’un plateau de table sombre et neutre. Respectez scrupuleusement la chronologie suivante : [0-3 s] la boîte reste complètement fermée et immobile ; [3-6 s] le couvercle s’ouvre lentement et en douceur de lui-même tandis que la boîte reste en place ; [6-10 s] plusieurs petites étoiles en papier doré métallisé s’élèvent doucement de l’intérieur de la boîte ouverte et s’envolent vers le haut. La caméra, l’arrière-plan, la position de la boîte, l’échelle, l’éclairage et l’identité de l’objet doivent rester inchangés pendant toute la durée du plan. Pas de personnes, pas de texte, pas de logo, pas de coupures, pas d’objets supplémentaires, pas de mouvement brusque et pas de filigrane.

Conseils pratiques pour éviter de gaspiller vos crédits

Les tarifs d'Omni Flash sont suffisamment bas pour encourager l'expérimentation, mais les requêtes inutiles finissent tout de même par s'accumuler. Les meilleures requêtes sont précises sans pour autant être trop chargées.

Optez pour un plan séquence lorsque vous recherchez la stabilité

Si vous souhaitez que le clip donne une impression de cohérence, précisez “ plan séquence ” ou “ un seul mouvement de caméra ininterrompu ”. Cela réduit le risque que le modèle improvise des coupures brusques ou change de sujet en cours de clip.

Décrivez l'appareil photo, pas seulement le sujet

Une description de produit ne doit pas se limiter à “ un étui à écouteurs bleu ”. Ajoutez du mouvement : “ panoramique lent sur une demi-orbite ”, “ une main ouvre l'étui ”, “ reflets tamisés de studio ” ou “ la caméra effectue un léger zoom avant ”. Le langage cinématographique permet généralement d'obtenir un résultat plus exploitable que le simple ajout d'adjectifs à l'objet.

Précisez le format d'image dès le début

Pour les contenus mobiles, demandez directement le format 9:16. Pour les sites web ou les vidéos de type YouTube, utilisez le format 16:9. Le format d'image n'est pas seulement un choix de mise en page ; il influe sur l'espace dont dispose le mannequin pour ses mains, les produits et les mouvements en arrière-plan.

Pour les modifications, veillez à ce qu'elles restent ciblées

L'édition avec état fonctionne mieux lorsque la consigne est simple : “ Changez la couleur du vélo de bleu à rouge. Ne modifiez rien d'autre. ” Évitez de demander plusieurs modifications sans rapport les unes avec les autres en même temps, à moins que vous ne soyez prêt à assumer le coût des nouvelles tentatives.

Pour les actions chronométrées, utilisez des intervalles de temps

Si le clip comporte une séquence, utilisez des crochets comme [0-3 s][3 à 6 s], et [6 à 10 s]. Cela donne au modèle une structure claire pour le rythme. Cela ne garantit pas un contrôle au cadre près, mais c'est beaucoup plus clair que de décrire le rythme sous la forme d'un paragraphe vague.

Qui devrait utiliser l'API, Google Flow ou GlobalGPT ?

Utilisez le API Gemini que ce soit pour développer, automatiser ou mesurer. L'API est la solution idéale lorsque vous avez besoin d'un contrôle programmatique, d'un suivi des coûts par requête et d'appels répétables.

Utilisation Google Flow dans le cadre d'un projet d'IA de Google si vous souhaitez d'emblée bénéficier de l'environnement de création natif de Google. De plus, les versions Pro et Ultra constituent un choix judicieux lorsque le système de crédits correspond à votre façon de créer et que vous souhaitez avoir accès aux outils grand public officiels.

Utilisation GlobalGPT Pro si votre objectif principal est d’utiliser Omni Flash Gemini en parallèle d’autres modèles phares sans avoir à gérer des abonnements et des consoles API distincts. Le forfait Pro coûte actuellement $10,8 par mois en facturation annuelle, ou $15 par mois dans le cadre de la promotion mensuelle. Pour de nombreux utilisateurs, c'est là tout l'intérêt : Omni est disponible au sein d'un espace de travail plus vaste où vous pouvez également comparer d'autres modèles pour l'écriture, la planification, la recherche et le travail créatif.

Choisir GlobalGPT Illimité si votre utilisation du forfait est suffisamment importante pour qu'un forfait plus complet vous convienne mieux. Le prix annuel actuel du forfait « Illimité » est de $25 par mois, tandis que la promotion mensuelle en cours propose le forfait « Illimité » à $37 par mois.

Verdict final

Gemini Omni Flash est l’un des modèles de vidéos courtes les plus intéressants à suivre, car il combine la génération de vidéos, les médias de référence et le montage conversationnel dans une offre relativement abordable. À environ $0,10 par seconde pour une sortie vidéo API en 720p, son coût est facile à appréhender. Ses limites sont également claires : 3 à 10 secondes, une résolution de 720p, un statut « préversion » et plusieurs restrictions techniques concernant le montage avancé et les paramètres.

Si vous êtes développeur, commencez par l’API Gemini et suivez le coût par seconde générée. Si vous utilisez déjà les outils créatifs de Google, comparez les niveaux du forfait Google AI en fonction des crédits Flow. Si vous souhaitez simplement utiliser Gemini Omni Flash sans mettre en place un workflow API, L'espace de travail vidéo de GlobalGPT C'est l'option la plus simple au quotidien, surtout lorsque vous souhaitez bénéficier d'un accès Pro à d'autres modèles dans le même espace de travail.

FAQ

Le Gemini Omni Flash est-il gratuit ?

Non, pas via l'API Gemini. Google présente Gemini Omni Flash comme un modèle d'API payant, sans niveau d'accès gratuit. Les abonnements Google AI peuvent inclure des crédits Flow, mais ces crédits correspondent à un quota dans le cadre d'un forfait grand public ; cela n'équivaut pas à un accès gratuit à l'API.

Combien coûte l'API Omni Flash Gemini ?

Le tarif de l'API Omni Flash Gemini est de $1,50 par million de tokens d'entrée, de $9 par million de tokens de sortie texte et de $17,50 par million de tokens de sortie vidéo. Google indique que le prix de la sortie vidéo est d'environ $0,10 par seconde pour une vidéo en 720p.

Quel est l'identifiant du modèle de l'API Omni Flash Gemini ?

L'identifiant du modèle API est gemini-omni-flash-preview.

Le système Omni Flash Gemini est-il inclus dans Google AI Pro ?

Oui. L'abonnement Google AI Pro est proposé au prix de $19,99 par mois et comprend 1 000 crédits Flow avec accès Omni.

Le modèle GlobalGPT intègre-t-il la technologie Omni Flash du modèle Gemini ?

Oui. L'offre GlobalGPT Pro inclut l'accès à Gemini Omni Flash. Le prix actuel de l'offre Pro est de $10,8 par mois en cas de facturation annuelle, ou de $15 par mois dans le cadre de la promotion mensuelle en cours.

Quelles sont les limites de la vidéo Omni Flash Gemini ?

La version préliminaire actuelle de l'API prend en charge la génération de vidéos de 3 à 10 secondes en 720p. Le format paysage 16:9 est le format par défaut, mais il est possible de demander le format portrait 9:16.

Le Gemini Omni Flash permet-il de convertir des images en vidéo ?

Oui. Gemini Omni Flash prend en charge les flux de travail basés sur des images de référence ; les utilisateurs peuvent ainsi fournir une image et demander au modèle de générer un mouvement à partir de cette référence visuelle.

Le Gemini Omni Flash permet-il de monter des vidéos existantes ?

La documentation de Google prend en charge l'édition ultérieure avec gestion de l'état pour les vidéos générées via l'API Interactions. Lors de notre seul essai pratique, la vidéo de base a été générée avec succès, mais l'édition ultérieure a renvoyé une erreur HTTP 502 et aucun fichier multimédia modifié n'a été obtenu. Il convient donc de tester cette fonctionnalité en suivant exactement le flux de travail dont vous avez besoin, d'autant plus que le modèle est encore en phase de préversion.

Partager l'article :

Articles connexes