Veo 3.1은 텍스트 프롬프트만으로 오디오와 동기화된 고품질 영상과 사실적인 입모양 동기화를 구현합니다. 특정 대사를 따옴표로 묶어주면(예: 한 여성이 “지금 당장 떠나야 해.”라고 말한다), 모델이 생성된 대사에 맞춰 입 모양을 자동으로 조정합니다. 이러한 기능에도 불구하고, 많은 크리에이터들은 높은 크레딧 비용과 샷 간 캐릭터 일관성을 유지하기 위해 여러 개의 고가 구독 서비스를 이용해야 하는 점에 어려움을 겪고 있습니다.
시행착오를 거치다 보면 크레딧이 금방 소진되기 일쑤라, 대다수의 개인 사용자에게는 고품질 콘텐츠 제작이 비용 면에서 부담스러울 수밖에 없습니다. GlobalGPT는 세계 최고 수준의 AI 모델들을 하나의 접근하기 쉬운 대시보드에 통합함으로써 이러한 문제를 해결합니다. 이를 통해 분산된 계정을 관리할 필요가 없어지고, 일반적인 지역별 접근 제한도 극복할 수 있습니다.
GlobalGPT는 Veo 3.1, Nano Banana 2를 활용한 이미지 준비 기능, 그리고 오디오 도구를 하나의 작업 공간에 통합합니다. 이 프로 플랜 연간 결제 시 월 $10.8로 광고됩니다. 이는 연간 요금제의 월 환산 금액일 뿐, 월별 요금이 $10.8로 청구된다는 보장은 아닙니다.

Veo 3.1에서 캐릭터가 말하게 만드는 방법? (대화 공식)
최상의 결과를 얻으려면 카메라가 포착한 영상과 캐릭터의 대사를 결합하는 특정 “레시피”를 따라야 합니다. Veo 3.1이란 무엇일까요? 이 가이드를 통해 구글이 지원하는 이 모델의 최신 기능을 완벽하게 익힐 수 있습니다.
5 부분으로 구성된 프롬프트 구조
전문적인 프롬프트에는 항상 카메라 각도, 피사체, 액션, 설정, 마지막으로 대화가 포함되어야 합니다. 이런 식으로 말을 정리하면 됩니다, 간단한 단계로 Veo 3.1을 사용하는 방법 AI가 혼동하지 않고 씬을 구성하는 방법을 정확히 이해하면 훨씬 더 명확해집니다.

- 대사를 명확하게 표현하세요: 화자의 이름을 밝힌 다음, 화자가 말해야 할 대사와 시각적 묘사를 구분하세요. 예를 들어: 한 남자가 “안녕하세요, 오늘 어떠세요?”라고 말합니다.” 따옴표는 대사를 더 쉽게 읽을 수 있게 해줄 뿐, 대사가 정확하게 발음되거나 입모양이 완벽하게 일치한다는 것을 보장하는 것은 아닙니다.
- 톤 및 감성 전달: 대화문 앞에 묘사적인 단어를 추가하면 캐릭터의 목소리 톤을 조절할 수 있습니다. 이는 더 나은 AI 프롬프트를 작성하는 7가지 비결 중 하나입니다. 예를 들어, 캐릭터가 “지친 목소리로 말한다”거나 “흥분해서 소리친다”고 AI에 지시하면, 생성된 오디오의 에너지와 분위기가 달라집니다.
- 다국어 음성: 영어로 지시 사항을 작성하더라도 캐릭터가 스페인어나 중국어와 같은 다른 언어로 말하도록 만들 수 있습니다. 따옴표 안에 해당 언어로 말하고자 하는 단어를 입력하기만 하면 Veo 3.1이 자동으로 악센트와 립싱크를 처리합니다.
| 프롬프트 요소 | 목적 | 예 |
| 카메라 | 샷 유형을 정의합니다. | “중간 클로즈업” |
| 제목 | 화자 식별 | “한 젊은 형사” |
| 액션 | 그들이 하는 일 | “카메라를 똑바로 바라보기” |
| 대화 | 그들이 말하는 것 | "찾은 것 같아요."라고 말합니다." |
| 스타일 | 시각적 분위기 | “영화 같은 필름 누아르” |
완전한 단일 스피커 프롬프트
밝은 전시실에서 성인 박물관 해설사의 중간 클로즈업 샷. 해설사는 카메라를 바라보며 잠시 멈춘 뒤, 차분하고 대화하는 듯한 어조로 말합니다. “이 작은 물건이 사람들이 시간을 측정하는 방식을 바꿔 놓았습니다.” 화면에 보이는 화자는 한 명이다. 입과 눈의 움직임이 자연스럽고, 실내 소음은 조용하며, 구도는 안정적이다. 샷이 끝나기 전에 해설사의 말이 끝난다. 화면 내 자막은 없다.
이는 권장되는 시작 프롬프트일 뿐, 실제 테스트 결과가 아닙니다. 선택한 클립의 재생 시간 내에 자연스럽게 말할 수 있을 정도로 대사를 짧게 유지하십시오. 선택된 GlobalGPT CLI에서는 8초 길이의 Veo 3.1 옵션이 표시되지만, 모든 인터페이스에 동일한 재생 시간 메뉴가 표시된다고 가정해서는 안 됩니다.
마스터링 오디오, SFX 및 내레이션 프롬프트
Veo 3.1은 단순히 음성을 출력하는 데 그치지 않고, 사용자의 텍스트를 바탕으로 영화 같은 입체적인 사운드스케이프를 직접 만들어 냅니다..
| 오디오 유형 | 프롬프트 태그 | 모범 사용 사례 |
| 연설 | "..."라고 말합니다." | 화면 문자 |
| SFX | SFX: [사운드] | 특정 동작(문, 비) |
| 분위기 | 주변: [...] | 배경 침묵 채우기 |
- 음향 효과(SFX): “SFX:” 태그를 사용하면 영상에 사실적인 소리를 추가할 수 있습니다. 천둥이 치는 소리든 나무 바닥 위를 걷는 발소리든, 이러한 소리를 명확하게 묘사하면 영상에 생동감을 더하는 데 도움이 됩니다.
- 주변 소음: 장면을 현실감 있게 만들기 위해서는 “주변 소음’이라고도 하는 배경 소리가 필요합니다. ”우주선의 은은한 윙윙거림“이나 ”멀리서 들려오는 도시의 차량 소음”과 같은 지시를 통해 침묵을 채우고, 등장인물을 그 환경 속에 자연스럽게 녹아들게 할 수 있습니다.
- 내레이션 대 대화: 화면 속 등장인물이 말하는 것과 카메라 뒤에서 내레이터가 말하는 것에는 큰 차이가 있습니다. 특정 등장인물의 입모양과 일치시킬 필요 없이 목소리로 장면을 묘사하는 다큐멘터리 스타일의 경우 “내레이터가 말한다”라는 표현을 사용하십시오.
- 오디오에 대한 네거티브 프롬프트: 때로는 음악 없이 목소리만 듣고 싶을 때가 있습니다. 프롬프트에 “음악 없음”이나 “대화만”이라고 입력하는 것은 전문가들이 쓰는 요령으로, 나중에 직접 배경 음악을 추가하고 싶을 때 영상 편집을 훨씬 수월하게 해줍니다.

세 가지 종류의 오디오를 따로 분리해 두세요
대화 가시적인 화자에게 속한다. 내레이션 입 모양과 일치하지 않아도 그 장면을 묘사할 수 있다. 분위기 및 효과 배경을 설정하세요. “조용한 방의 분위기”와 같은 지시가 실제 대사와 겹치지 않도록 각각을 별도의 문장으로 작성하세요. 반복적으로 등장하는 내레이터의 경우, ElevenLabs 다국어 v2 리뷰 음성의 안정성과 더 긴 발화에 대해 다룬다.
일관성 있는 캐릭터를 만드는 방법? (“재료” 워크플로우)
AI 영상 분야에서 가장 큰 과제 중 하나는 서로 다른 클립에서 등장인물의 얼굴이 일관되게 유지되도록 하는 것입니다..
- “모핑” 문제: 참조 이미지가 없으면 AI는 새로운 샷을 생성할 때마다 캐릭터의 머리카락, 옷차림, 또는 얼굴을 바꿔버리는 경향이 있습니다. 이로 인해 일관된 이야기를 전개하기가 매우 어려워집니다.
- 솔루션: 비디오 재료: Veo 3.1에는 캐릭터 사진을 “재료”로 업로드할 수 있는 특별한 기능이 있습니다. Google Veo 3.1에 접속하여 이 고급 도구를 사용하는 방법을 배울 수 있습니다. 그러면 AI는 이 사진을 가이드로 삼아 캐릭터가 대화하는 동안 외모가 일관되게 유지되도록 합니다.
- 재료에 나노 바나나 사용: Nano Banana 2 또는 Nano Banana Pro를 사용하여 선명한 인물 사진을 촬영하려면 GlobalGPT 이미지. 각 샷마다 동일한 승인된 원본을 사용하되, 선택한 영상 경로에서 참조 이미지를 지원하는 경우에만 이를 사용하십시오. 출력 결과에서 얼굴, 헤어스타일, 의상의 변화를 확인하십시오.
더 나은 립싱크를 위한 시네마틱 기법
실제 영화 감독처럼 카메라를 어떻게 배치하느냐에 따라 관객이 캐릭터가 말하는 것을 얼마나 잘 듣고 볼 수 있는지가 달라집니다..
- 최적의 카메라 각도: 립싱크를 가장 잘 맞추려면 항상 “중간 클로즈업”이나 “머리와 어깨” 샷을 사용하세요. 이러한 앵글을 사용하면 화면 속에서 캐릭터의 입이 크고 선명하게 잡히기 때문에, AI가 대사를 정확하게 애니메이션화하기가 훨씬 쉬워집니다. 이는 Veo 3.1 사용처 고품질 동영상 제작에 활용하고 있습니다.
- 촬영 시간 및 타이밍: Veo 3.1은 길이가 4~8초인 클립에서 가장 잘 작동합니다. 기술적 제약 사항을 더 잘 이해하려면 공식 제한 사항과 148초 해킹 방법을 비교해 보세요. 한 샷에서 캐릭터가 너무 오랫동안 말하게 하면, 음성이 끊기거나 소리가 끝나기도 전에 입모양이 멈출 수 있습니다.
| 샷 유형 | 립싱크 품질 | 왜 그럴까요? |
| 클로즈업 | 높음 | 입이 초점 |
| 와이드 샷 | 낮음 | 입이 너무 작아 보이지 않음 |
| 프로필 | Medium | 측면 보기는 동기화하기 어렵습니다. |
얼굴과 목소리를 각각 따로 확인하세요
영상 초반, 중반, 후반 부근의 한 장면을 정지시키세요. 화자의 모습이 여전히 참고 자료와 비슷한지 확인하세요. 그런 다음 영상을 정상적으로 재생하고 의도된 대사가 나오는지 들어보세요. 얼굴이 일관된다고 해서 목소리가 일관된다는 증거는 아니며, 입모양이 명확하게 보인다고 해서 대사가 정확하게 발음되었다는 증거는 아닙니다. AI 영상 일관성 확보 워크플로 정체성 오류와 카메라 오류 또는 연속성 오류를 구분하는 데 도움이 됩니다.
“프로” 워크플로우: Veo 오디오를 ElevenLabs로 교체하기
Veo 3.1은 립싱크 성능이 뛰어나지만, 생성되는 “목소리”가 때로는 다소 기계적으로 들리거나 개성이 부족해 보일 수 있습니다..

- 네이티브 오디오 제한: AI가 생성한 자연스러운 목소리는 초안을 빠르게 작성하는 데는 유용하지만, 실제 사람의 목소리에서 느껴지는 감정적인 “정서’가 종종 부족합니다.
- 하이브리드 방식: 음성 변경과 입모양 변경은 별개의 작업입니다. 가능한 한 원래의 발화 타이밍을 유지하십시오. 새로 생성된 음성으로 인해 멈춤, 단어 지속 시간 또는 대본이 변경되면 기존 입모양이 더 이상 일치하지 않을 수 있습니다. 필요한 경우 오디오를 정렬한 후 입모양 동기화 처리를 실행하십시오.
- 적절한 오디오 작동 방식을 선택하세요: ElevenLabs 음성 변조기 원본 음성을 기반으로 하며 연기 큐를 보존합니다. 텍스트 음성 변환은 새로운 연기를 생성합니다. 두 작업 중 어느 하나만으로는 기존 영상의 입모양이 생성된 오디오와 일치한다는 것을 증명할 수 없습니다. 선택한 서비스에서 실제로 제공되는 오디오 기능을 사용하십시오.
일반적인 Veo 3.1 문제 해결
아무리 훌륭한 프롬프트를 사용하더라도, 수정해야 할 몇 가지 흔한 “버그”에 부딪힐 수 있습니다..
- 자막은 사라지지 않는다: 때때로 Veo가 사용자가 요청하지 않은 텍스트를 동영상에 추가하기도 합니다. 이 문제를 해결하려면 네거티브 프롬프트에 “no captions” 또는 “no subtitles”를 추가하세요.
- 잘못된 캐릭터가 말합니다: 두 사람이 등장하는 장면에서 AI가 대사를 잘못된 인물에게 할당할 수 있습니다. 이를 방지하려면 대화 프롬프트를 항상 캐릭터의 구체적인 이름으로 시작하세요. 예를 들어, “빨간 재킷을 입은 여자가 말한다…”와 같이 말입니다.
- 시간 관련 단서: 이 장면을 간단히 설명하자면, 화자가 고개를 들고 잠시 멈춘 뒤 짧은 대사를 한 마디 하고는 자리를 잡는 순서입니다. 기재된 타임스탬프는 프레임 단위의 정확한 편집 기준이 아닌, 요청된 타이밍으로 간주하십시오. 다음 샷을 계획하기 전에 생성된 클립을 확인하십시오.
실용적인 오디오 및 립싱크 진단
| 증상 | 먼저 확인해 보세요 | 다음으로 시도해 보세요 |
|---|---|---|
| 들리는 말이 없음 | 출력에 오디오 트랙이 포함되어 있는지, 그리고 플레이어의 음소거가 해제되어 있는지 확인하십시오. | 명확한 대사 한 줄을 요청하고, 해당 경로에서 오디오가 생성되는지 확인합니다. |
| 말할 자격이 없는 사람이 말을 한다 | 화면에 보이는 화자의 수를 세고, 대사 라벨을 확인하세요. | 스피커를 한 명만 사용하거나, 화면에 보이는 스피커의 이름을 명확하게 밝히십시오. |
| 말이 문장 도중에 끊어진다 | 라인 길이와 클립 재생 시간을 비교해 보세요. | 대본을 줄이거나 여러 샷으로 나누세요. |
| 새로운 목소리가 입 모양과 어울리지 않는다 | 원본과 대체본의 멈춤과 단어 발화 타이밍을 비교해 보세요. | 타이밍을 맞추거나, 성능을 유지하거나, 립싱크 패스를 사용하세요. |
| 컷이 바뀔 때마다 표정이 달라진다 | 동일한 참조가 사용되었는지 확인하십시오. | 초상화와 신원 설명은 변경하지 마십시오. |
| 원치 않는 자막이 나타납니다 | 실제 프레임을 직접 확인하십시오. 설명서에 적힌 내용은 보장 사항이 아닙니다. | 자막이 남아 있다면 깨끗한 프레임을 요청하고 샷을 수정하십시오. |
어떤 레이어에 문제가 있는지 파악할 때까지는 중복된 세대를 제출하지 마십시오. AI 동영상 오류 해결 가이드 작업 오류, 재생 오류, 그리고 결과가 잘못되었지만 사용 가능한 동영상을 구분합니다.
Veo 3.1은 무료인가요? 가격 및 플랫폼 비교
많은 공식 플랫폼이 기업 또는 특정 지역으로 제한되어 있기 때문에 Veo 3.1에 액세스하는 것이 어려울 수 있습니다..
- 공식 구글 버텍스 AI: 이는 대기업과 개발자를 위해 설계되었습니다. 복잡한 설정이 필요하며 테스트 중에 실수가 많으면 비용이 많이 들 수 있습니다.
- GlobalGPT 프로 요금제: 현재 요금 페이지에는 Pro 요금제가 연간 결제 시 월 $10.8로 표시되어 있습니다. 비디오 작업 공간에서 Veo 3.1을 선택한 다음, 표시되는 생성 설정과 해당 작업의 비용을 확인하세요. 구독 요금과 비디오 생성 비용은 서로 다른 금액입니다.
이 워크플로는 Veo 3.1 버전에만 적용하십시오. 후속 모델에 대한 소문만으로는, 본래 사용 가능한 샷을 변경할 이유가 되지 않습니다. 먼저 실제 문제, 즉 잘못된 스피커, 너무 긴 대사, 누락된 오디오 트랙, 또는 사운드트랙 교체로 인해 발생한 불일치 등을 해결하십시오.

자주 묻는 질문
Veo 3.1에서 캐릭터가 말하도록 하려면 어떻게 해야 하나요?
화면에 보이는 화자의 이름을 밝히고, 짧은 대사는 장면 설명과 별도로 기재하십시오. 예: 가이드가 “박물관에 오신 것을 환영합니다.”라고 말합니다. 그런 다음 생성된 대사와 입 모양이 요청한 내용과 일치하는지 확인하십시오.
대화 장면마다 같은 캐릭터를 유지하려면 어떻게 해야 할까요?
동영상 제작 방식에서 참조 이미지가 지원되는 경우, 승인된 동일한 인물 사진과 외모 설명을 재사용하십시오. 모든 샷에서 얼굴, 머리카락, 옷차림을 확인하십시오. 참조 이미지가 있다고 해서 완벽한 연속성이 보장되는 것은 아닙니다.
Veo 음성을 ElevenLabs 오디오로 교체할 수 있나요?
네, 편집 워크플로우의 일환으로 가능하지만, 사운드트랙을 교체한다고 해서 입모양이 자동으로 다시 동기화되지는 않습니다. 가능한 한 대사의 타이밍은 유지한 다음, 동기화 상태를 확인하고, 새로운 연기가 다를 경우 립싱크 패스를 사용하십시오.
왜 제 Veo 3.1 클립에서 소리가 나지 않나요?
플레이어 음소거 설정, 출력 오디오 트랙, 그리고 선택한 경로를 통해 오디오가 출력되는지 여부를 확인하십시오. 대화 요청을 명확하게 작성하십시오. 따옴표가 누락되었다는 사실만으로는 원인을 파악하기에 충분하지 않습니다.
원치 않는 자막을 줄이려면 어떻게 해야 하나요?
자막이 없는 깔끔한 프레임을 요청하고, 샷을 단순하게 구성하세요. 지침이 제대로 반영되었다고 단정 짓지 말고 결과물을 꼼꼼히 확인하세요. 텍스트가 남아 있다면, 지침이 제대로 적용되었다고 가정하기보다는 샷을 수정하거나 편집하세요.
GlobalGPT Pro의 가격은 얼마인가요?
확인한 가격 페이지에는 연간 결제 시 월 $10.8이 적용된다고 명시되어 있습니다. 이는 연간 요금제의 월 환산 금액입니다. 현재 결제 총액과 제작하려는 동영상의 생성 비용을 확인해 보세요.
일관된 캐릭터가 동일한 어조를 보장해 주는가?
아닙니다. 시각적 정체성과 음성 정체성은 별개입니다. 얼굴의 초상화는 일관되게 유지하고, 동일한 내레이터나 캐릭터가 다시 등장할 때는 일관된 음성 소스와 오디오 작업 흐름을 사용하십시오.
결론
Veo 3.1에서 캐릭터 대사를 완벽하게 구현하려면 정밀한 “인용문” 구문과 효과적인 캐릭터 일관성 도구를 결합해야 합니다. 전문적인 카메라 앵글을 사용하고 SFX나 주변 소음과 같은 오디오 트리거를 적절히 관리함으로써, 단순한 프롬프트를 표현력 넘치는 말하는 아바타로 탈바꿈시킬 수 있습니다. 립싱크 문제를 해결하든 하이브리드 워크플로우를 실험하든, 이러한 핵심 기법들을 활용하면 AI가 생성한 이야기가 현실적이면서도 강렬한 인상을 줄 수 있습니다.



