Veo 3.1 maakt het mogelijk om rechtstreeks op basis van tekstprompts video's van hoge kwaliteit te genereren, met synchrone audio en realistische lipsynchronisatie. Door specifieke uitspraken tussen aanhalingstekens te plaatsen – bijvoorbeeld: Een vrouw zegt: “We moeten nu vertrekken.” – stemt het model de mondbewegingen automatisch af op de gegenereerde dialoog. Ondanks deze mogelijkheden hebben veel makers te kampen met hoge kredietkosten en de noodzaak van meerdere dure abonnementen om de consistentie van personages in verschillende opnames te behouden.
Door vallen en opstaan raken credits vaak snel op, waardoor producties van hoge kwaliteit voor de meeste mensen onbetaalbaar zijn. GlobalGPT biedt hiervoor een oplossing door AI-modellen van wereldklasse te bundelen in één toegankelijk dashboard. Hierdoor zijn versnipperde accounts niet langer nodig en worden de gebruikelijke regionale toegangsbeperkingen omzeild.
GlobalGPT brengt Veo 3.1, beeldbewerking met Nano Banana 2 en audiotools samen in één werkruimte. De Pro-abonnement wordt geadverteerd als $10.8 per maand bij jaarlijkse facturering. Dat is het maandelijkse equivalent van het jaarabonnement, niet een toezegging dat de maandelijkse kosten $10.8 bedragen.

Hoe laat je personages spreken in Veo 3.1? (De dialoogformule)
Om de beste resultaten te behalen, moet je een specifiek “recept” volgen waarin wordt gecombineerd wat de camera ziet met wat het personage zegt. Wat is Veo 3.1? Deze handleiding helpt je de nieuwste functies van het door Google ondersteunde model onder de knie te krijgen.
De 5-delige promptstructuur
Een professionele prompt moet altijd het camerastandpunt, het onderwerp, de actie, de setting en tot slot de dialoog bevatten. Door je woorden op deze manier te organiseren, hoe gebruik ik Veo 3.1 in eenvoudige stappen wordt veel duidelijker omdat de AI precies begrijpt hoe je je scène moet opbouwen zonder in de war te raken.

- Maak de gesproken zin expliciet: Noem de naam van de spreker en maak vervolgens een onderscheid tussen de woorden die hij of zij moet zeggen en de visuele beschrijving. Bijvoorbeeld: Een man zegt: “Hallo, hoe gaat het vandaag?” Aanhalingstekens maken het verzoek leesbaarder; ze zijn geen garantie voor een correcte gesproken tekst of een perfecte lipsynchronisatie.
- Toon en emotie: Je kunt de klank van een personage beïnvloeden door beschrijvende woorden vóór de dialoog te plaatsen. Dit is een van de zeven geheimen voor het schrijven van betere AI-prompts. Als je de AI bijvoorbeeld vertelt dat een personage met een “vermoeide stem” spreekt of “opgewonden roept”, verandert dat de energie en de sfeer van de gegenereerde audio.
- Meertalige spraak: Zelfs als je je instructies in het Engels schrijft, kun je personages andere talen laten spreken, zoals Spaans of Mandarijn. Schrijf gewoon de woorden die je wilt dat ze in die taal zeggen tussen aanhalingstekens en Veo 3.1 zorgt automatisch voor het accent en de lipsynchronisatie.
| Prompt-element | Doel | Voorbeeld |
| Camera | Definieert het type opname | “Halfclose-up” |
| Onderwerp | Identificeert de spreker | “Een jonge rechercheur” |
| Actie | Wat ze doen | “Rechtstreeks in de camera kijken” |
| Dialoog | Wat ze zeggen | Zegt: "Ik denk dat ik het gevonden heb." |
| Stijl | De visuele stemming | “Filmische film noir” |
Een volledige aanwijzing voor één spreker
Middelgrote close-up van een volwassen museumgids in een lichte zaal. De gids kijkt naar de camera, pauzeert even en zegt op rustige, gemoedelijke toon: “Dit kleine voorwerp heeft de manier veranderd waarop mensen de tijd maten.” Eén zichtbare spreker. Natuurlijke mond- en oogbewegingen, rustige omgevingsgeluiden, stabiel beeldkader. De gids is uitgesproken voordat het shot eindigt. Geen ondertitels in beeld.
Dit is een suggestie voor een openingszin, geen gerapporteerd testresultaat. Houd de zin kort genoeg om deze op natuurlijke wijze uit te spreken binnen de geselecteerde clipduur. De aangevinkte GlobalGPT CLI biedt een Veo 3.1-optie van acht seconden; ga er niet vanuit dat in elke interface hetzelfde menupunt voor de duur wordt weergegeven.
Mastering audio, SFX en vertelopdrachten
Veo 3.1 doet meer dan alleen praten; het creëert rechtstreeks op basis van je tekst een complete, filmachtige geluidswereld.
| Audio Type | Markering | Beste gebruikscasus |
| Spraak | Zegt: "..." | Personages op het scherm |
| SFX | SFX: [Sound] | Specifieke acties (deuren, regen) |
| Sfeer | Omgeving: [...] | De achtergrondstilte vullen |
- Geluidseffecten (SFX): Je kunt realistische geluiden aan je video toevoegen door de tag “SFX:” te gebruiken. Of het nu gaat om het geluid van donder of voetstappen op een houten vloer: door deze geluiden duidelijk te beschrijven, komt de video tot leven.
- Omgevingsgeluid: Om een scène levensecht te laten aanvoelen, heb je achtergrondgeluid nodig, ook wel omgevingsgeluid genoemd. Door te vragen om het “zachte gezoem van een ruimteschip” of “ver weg klinkend stadsverkeer”, vul je de stilte op en zorg je ervoor dat het personage goed in zijn omgeving past.
- Vertelling vs. Dialoog: Er is een groot verschil tussen een personage dat op het scherm spreekt en een verteller die achter de camera spreekt. Gebruik “Een verteller zegt” voor documentaireachtige stijlen, waarbij de stem de scène beschrijft zonder dat deze hoeft te worden afgestemd op de bewegingen van de lippen van een specifiek personage.
- Negatieve prompting voor audio: Soms wil je alleen de stem horen en geen muziek. Door in je opdracht “Geen muziek” of “Alleen zuivere dialoog” te vermelden, kun je je video later veel gemakkelijker bewerken als je je eigen achtergrondmuziek wilt toevoegen. Dit is een tip van de professionals.

Houd de drie soorten audio gescheiden
Dialoog behoort toe aan de zichtbare spreker. Vertelling kan de scène beschrijven zonder dat er een mond bij hoort. Sfeer en effecten schets de sfeer. Schrijf elk onderdeel in een aparte zin, zodat een aanwijzing als “rustige achtergrondmuziek” niet in de weg staat bij de daadwerkelijke gesproken tekst. Voor een terugkerende verteller, De recensie van ElevenLabs Multilingual v2 gaat in op de stabiliteit van de stem en langere spraakpassages.
Hoe zorg je voor consistente personages? (De “ingrediënten”-workflow)
Een van de grootste uitdagingen bij AI-video is ervoor te zorgen dat het gezicht van het personage in verschillende fragmenten hetzelfde blijft.
- Het “morphing”-probleem: Zonder referentieafbeelding heeft AI de neiging om het haar, de kleding of het gezicht van het personage telkens te veranderen wanneer je een nieuw beeld genereert. Dit maakt het erg moeilijk om een samenhangend verhaal te vertellen.
- Oplossing: Ingrediënten naar video: Veo 3.1 heeft een speciale functie waarmee je een foto van je personage kunt uploaden als “ingrediënt”. Je kunt leren hoe je toegang krijgt tot Google Veo 3.1 om deze geavanceerde tool te gaan gebruiken. De AI gebruikt deze foto vervolgens als leidraad om ervoor te zorgen dat het personage er tijdens het praten hetzelfde uitziet.
- Nano Banana gebruiken voor ingrediënten: Maak een scherp portret met de Nano Banana 2 of de Nano Banana Pro in GlobalGPT Afbeelding. Gebruik voor elk shot dezelfde goedgekeurde bron en pas deze alleen toe wanneer de geselecteerde videoroute een referentiebeeld ondersteunt. Controleer de uitvoer op veranderingen in het gezicht, het kapsel en de kleding.
Filmtechnieken voor betere lipsynchronisatie
Net als bij een echte filmregisseur verandert de plaatsing van de camera hoe goed het publiek het personage kan horen en zien spreken..
- Optimale camerahoeken: Gebruik voor de beste lipsynchronisatie altijd een “medium close-up” of een “hoofd-en-schouders”-opname. Bij deze hoeken blijft de mond van het personage groot en duidelijk in beeld, waardoor het voor de AI veel gemakkelijker wordt om de spraak nauwkeurig te animeren. Dit is een belangrijke tip voor waar gebruik je Veo 3.1 in hoogwaardige videoproductie.
- Opnameduur en timing: Veo 3.1 werkt het beste met filmpjes van 4 tot 8 seconden. Bekijk de officiële limieten versus de 148-seconden-hack om de technische beperkingen beter te begrijpen. Als je een personage in één opname te lang laat praten, kan het geluid afbreken of kunnen de lippen stoppen met bewegen voordat het geluid is afgelopen.
| Type schot | Lip-Sync-kwaliteit | Waarom? |
| Close-up | Hoog | De mond staat centraal |
| Breed shot | Laag | Mond is te klein om te zien |
| Profiel | Medium | Zijaanzicht is moeilijker te synchroniseren |
Controleer het gezicht en de stem afzonderlijk
Zet het beeld even stil aan het begin, in het midden en aan het einde. Controleer of de spreker er nog steeds uitziet als de referentie. Speel de video vervolgens normaal af en luister of je de beoogde woorden hoort. Een consistent gezicht is geen bewijs voor een consistente stem, en een goed leesbare mondbeweging is geen bewijs dat de zin correct is uitgesproken. De workflow voor de consistentie van AI-video’s helpt bij het onderscheiden van identiteitsfouten van camera- of continuïteitsfouten.
De “Pro”-workflow: Veo-audio vervangen door ElevenLabs
Hoewel Veo 3.1 uitstekend presteert op het gebied van lipsynchronisatie, kunnen de “stemmen” die het genereert soms wat robotachtig klinken of wat persoonlijkheid missen.

- De oorspronkelijke audiobeperking: Ingebouwde AI-stemmen zijn handig voor snelle conceptversies, maar ze missen vaak de emotionele “ziel” van een echte menselijke stem.
- De hybride methode: Het aanpassen van de stem en het aanpassen van de lipbewegingen zijn twee afzonderlijke taken. Behoud waar mogelijk de oorspronkelijke timing van de spraak. Als een nieuw gegenereerde stem de pauzes, de woordduur of de tekst wijzigt, kunnen de bestaande mondbewegingen niet meer synchroon lopen; stem de audio dan af en voer indien nodig een lipsynchronisatie uit.
- Kies de juiste audiofunctie: ElevenLabs-stemvervormer werkt op basis van de bronstem en behoudt de aanwijzingen voor de vertolking. Tekst-naar-spraak genereert een nieuwe vertolking. Geen van beide bewerkingen op zich bewijst dat de mondbewegingen in een bestaande video overeenkomen met de resulterende audio. Gebruik de audiobewerking die daadwerkelijk beschikbaar is in de door u geselecteerde dienst.
Problemen met Veo 3.1 oplossen
Zelfs met de beste prompts kun je tegen een paar veelvoorkomende “bugs” aanlopen die moeten worden verholpen.
- Ondertitels verdwijnen niet: Soms voegt Veo tekst toe aan je video waar je niet om hebt gevraagd. Om dit te verhelpen, voeg je “geen bijschriften” of “geen ondertitels” toe aan je negatieve prompt.
- Verkeerde personage spreekt: In scènes met twee personen kan het voorkomen dat de AI de dialoog aan de verkeerde persoon toewijst. Om dit te voorkomen, begin je de dialoogprompt altijd met de specifieke naam van het personage, bijvoorbeeld: “De vrouw in het rode jasje zegt…”.
- Tijdsignalen: Beschrijf de volgorde op een eenvoudige manier: de spreker kijkt omhoog, pauzeert even, zegt één korte zin en komt weer tot rust. Beschouw de geschreven tijdsaanduidingen als richtlijnen voor de timing en niet als framegenauwe bewerkingspunten. Controleer de gegenereerde clip voordat je de volgende opname plant.
Een praktische diagnose van geluid en lipsynchronisatie
| Symptoom | Controleer eerst | Probeer het volgende eens |
|---|---|---|
| Geen hoorbare spraak | Controleer of de uitvoer een audiotrack bevat en of het geluid van de speler is ingeschakeld. | Vraag om één specifieke gesproken zin; controleer of de route geluid produceert. |
| De verkeerde persoon neemt het woord | Tel het aantal zichtbare sprekers en controleer je dialooglabels. | Gebruik één spreker, of geef de zichtbare spreker een eenduidige naam. |
| De toespraak wordt halverwege de zin onderbroken | Vergelijk de lengte van de regel met de duur van de clip. | Maak het script korter of verdeel het over verschillende opnames. |
| De nieuwe stem past niet bij de mond | Vergelijk de pauzes en de woordtiming in de originele versie en de vervangende versie. | Pas de timing aan, behoud de prestaties of gebruik een lipsynchronisatie-pass. |
| Veranderingen in het gezicht tussen de opnames | Controleer of dezelfde bron is gebruikt. | Zorg ervoor dat de afbeelding en de identiteitsbeschrijving ongewijzigd blijven. |
| Er verschijnen ongewenste bijschriften | Controleer de frames zelf; instructies in tekstvorm bieden geen garantie. | Vraag om een schoon beeld en pas de opname aan als er nog ondertitels te zien zijn. |
Dien geen herhaalde generaties in voordat u hebt vastgesteld welke laag is mislukt. De handleiding voor storingen met AI-video’s maakt een onderscheid tussen fouten bij het bewerken, afspeelfouten en bruikbare video’s met een verkeerd resultaat.
Is Veo 3.1 gratis? Vergelijking van prijzen en platforms
Toegang vinden tot Veo 3.1 kan moeilijk zijn, omdat veel officiële platforms beperkt zijn tot bedrijven of bepaalde regio's..
- Officiële Google Vertex AI: Dit is ontworpen voor grote bedrijven en ontwikkelaars. Het vereist een complexe setup en kan erg duur zijn als je veel fouten maakt tijdens het testen.
- GlobalGPT Pro Plan: Op de huidige prijspagina wordt het Pro-abonnement aangeboden voor $10,8 per maand bij jaarlijkse facturering. Kies Veo 3,1 in de videowerkruimte en controleer vervolgens de weergegeven generatie-instellingen en de kosten voor die opdracht. De abonnementsprijs en de kosten voor het genereren van een video zijn twee verschillende bedragen.
Beperk deze werkwijze tot Veo 3.1. Een gerucht over een later model is geen reden om een verder bruikbare opname te wijzigen. Los eerst het daadwerkelijke probleem op: de verkeerde spreker, een te lange zin, een ontbrekende audiotrack of een afwijking die is ontstaan door het vervangen van de soundtrack.

Veelgestelde vragen
Hoe laat ik een personage iets zeggen in Veo 3.1?
Noem de naam van de zichtbare spreker en vermeld de korte zin apart van de scènebeschrijving. Bijvoorbeeld: Een gids zegt: “Welkom in het museum.” Controleer vervolgens of de gegenereerde woorden en de mondbewegingen overeenkomen met je verzoek.
Hoe zorg ik ervoor dat ik in alle dialoogscènes hetzelfde personage blijf spelen?
Gebruik hetzelfde goedgekeurde portret en dezelfde identiteitsbeschrijving wanneer de videoroute een referentieafbeelding ondersteunt. Controleer het gezicht, het haar en de kleding in elk shot; een referentie biedt geen garantie voor perfecte continuïteit.
Kan ik de Veo-stem vervangen door ElevenLabs-audio?
Ja, als onderdeel van de montagewerkstroom, maar het vervangen van een soundtrack zorgt er niet automatisch voor dat de lippen weer synchroon lopen. Probeer de timing van de spraak waar mogelijk te behouden, controleer vervolgens de synchronisatie en pas een lipsync-bewerking toe wanneer de nieuwe uitvoering afwijkt.
Waarom komt er geen geluid uit mijn Veo 3.1-clip?
Controleer of de speler gedempt is, de audio-uitgangstrack en of de geselecteerde route geluid produceert. Formuleer het verzoek om dialoog expliciet. Het ontbreken van aanhalingstekens alleen is niet voldoende om de oorzaak vast te stellen.
Hoe kan ik ongewenste ondertitels verminderen?
Vraag om een schoon beeld zonder bijschriften en houd het shot eenvoudig. Controleer het resultaat, want negatieve instructies bieden geen garanties. Als er nog tekst te zien is, pas het shot dan aan of bewerk het, in plaats van ervan uit te gaan dat de instructie heeft gewerkt.
Hoeveel kost de GlobalGPT Pro?
Op de bekeken prijspagina staat vermeld dat het tarief $10,8 per maand bedraagt bij jaarlijkse facturering. Dat is het maandelijkse equivalent van een jaarabonnement. Controleer het huidige totaalbedrag bij het afrekenen en de productiekosten voor de video die je van plan bent te maken.
Is een consistent personage een garantie voor dezelfde stem?
Nee. De visuele identiteit en de stemidentiteit staan los van elkaar. Zorg ervoor dat het portret van het gezicht consistent blijft, en gebruik een consistente stembron en audio-workflow wanneer dezelfde verteller of hetzelfde personage terugkeert.
Conclusie
Om de dialogen van personages in Veo 3.1 onder de knie te krijgen, moet je de nauwkeurige syntaxis van “quotes” combineren met effectieve hulpmiddelen voor de consistentie van personages. Door professionele camerahoeken te gebruiken en audiotriggers zoals geluidseffecten en omgevingsgeluiden te beheren, kun je eenvoudige prompts omzetten in expressieve, sprekende avatars. Of je nu problemen met lipsynchronisatie oplost of experimenteert met hybride workflows, deze basistechnieken zorgen ervoor dat je door AI gegenereerde verhalen zowel realistisch als indrukwekkend overkomen.



