증거 기반 검토 · 2026년 8월
오픈 웨이트, 호스팅된 API, 그리고 명명 방식의 차이—명확하게 정리했습니다.
증거의 제한: Qwen3-TTS에 대한 직접 청취 평가 점수는 보고된 바가 없습니다.
유용한 Qwen3-TTS 리뷰는 음성을 평가하기 전에 더 근본적인 질문에 답해야 합니다. 바로 ‘어떤 Qwen3-TTS를 말하는가?’라는 질문입니다. 2026년 현재, 이 명칭은 다운로드 가능한 0.6B 및 1.7B 체크포인트, 알리바바 클라우드에서 호스팅되는 Qwen3-TTS API, 그리고 별도의 Qwen-Audio 3.0 TTS 제품군도 함께 권장되고 있는 시장을 포괄합니다. 이러한 제품들을 하나의 것으로 간주하면 속도, 언어, 가격에 대한 오해의 소지가 있는 주장이 제기될 수 있습니다.
간단히 말해, Qwen3-TTS는 2026년 현재 가장 유연한 오픈 소스 음성 스택 중 하나입니다. 이 스택은 10개 언어 지원, 작업별 체크포인트, 약 3초 만에 완료되는 음성 복제, 자연어 기반 음성 설계, 스트리밍 지원, 그리고 Apache-2.0 라이선스를 제공합니다. 하지만 이번 리뷰에서는 청취 점수를 산출하지 않았습니다. 이용 가능한 테스트 환경에서는 실제 Qwen3-TTS 엔드포인트를 확인할 수 없었으며, 로컬에 있는 2GB GPU로는 0.6B 대 1.7B 벤치마크를 대표적으로 수행하기에 적합하지 않았기 때문입니다.
2026년 Qwen3-TTS 현황
Qwen는 2026년 1월 22일에 Qwen3-TTS 오픈 가중치를 공개했습니다. 이 Qwen3-TTS 공식 저장소 공개된 12Hz 체크포인트 5가지를 나열합니다: 1.7B VoiceDesign, 1.7B CustomVoice, 1.7B Base, 0.6B CustomVoice, 0.6B Base. 이에 상응하는 Hugging Face 컬렉션 여기에는 토큰화기(tokenizer)도 포함되어 있습니다. 개발자들은 공개된 라이선스에 따라 이러한 모델을 확인하고, 다운로드하며, 실행할 수 있습니다.
알리바바 클라우드는 비실시간 및 실시간 인터페이스를 통해 호스팅형 Qwen3-TTS Flash, Instruct, 음성 복제 및 음성 디자인 제품군을 별도로 제공합니다. 현재 음성 합성 모델 목록 호스팅된 별칭, 지역, 언어 및 인터페이스에 대해서는 이를 신뢰할 수 있는 정보원으로 간주해야 합니다. 이러한 세부 정보는 오픈 체크포인트 이름이 변경되지 않아도 변경될 수 있기 때문입니다.
명명 방식에 대해 한 가지 더 짚고 넘어갈 점이 있습니다. 알리바바 클라우드의 2026년 모델 선택 가이드라인에서도 여러 호스팅 작업에 대해 사용자에게 Qwen-Audio 3.0 TTS를 권장하고 있습니다. Qwen-Audio 3.0 TTS는 0.6B 또는 1.7B Qwen3-TTS 체크포인트의 명칭이 변경된 것이 아닙니다. 이미 더 광범위한 Qwen 제품군을 활용하고 계신다면, 당사의 Qwen 3.8 최대 사양 및 사용 후기 이는 Qwen 제품군 전반에 걸쳐 정확한 모델 명칭이 중요한 이유를 보여줍니다.
로컬 추론에는 공개 체크포인트 이름을 사용하고, API 동작에는 정확한 알리바바 클라우드 모델 ID를 사용하며, Qwen-Audio 3.0 TTS는 별도의 대안으로만 사용하십시오. 이렇게 하면 품질, 지연 시간, 가격에 대한 모든 주장이 해당 모델을 생성한 제품에 그대로 귀속됩니다.
간단한 평가: 강력하고, 개방적이며, 증거에 민감하다
간단한 평가
공개 배포, 연구, 복제 및 캐릭터 목소리.
두 가지 크기에 걸쳐 5가지 작업별 점검 항목.
공급업체의 처리 속도는 환경에 따라 다르며, 품질에 대해서는 여기에서 평가하지 않습니다.
호스팅된 Qwen3-TTS와 Qwen-Audio 3.0은 서로 다른 경로입니다.
Qwen3-TTS는 제어권과 배포 방식의 선택권을 원하는 팀에게 가장 매력적인 솔루션입니다. Base 체크포인트는 복제를 지원하며, CustomVoice는 지침 제어 기능이 포함된 이름이 지정된 사전 설정 스피커를 제공하고, VoiceDesign은 서면 설명을 바탕으로 음성을 생성할 수 있습니다. 10개 언어를 지원함으로써 이 스택은 영어만 지원하는 공개 데모보다 훨씬 더 유용하며, 0.6B 버전은 개발자들에게 더 가벼운 시작점을 제공합니다.
가장 주의해야 할 점은 증거의 신뢰성입니다. Qwen는 최적화된 내부 환경에서 뛰어난 벤치마크 결과와 낮은 첫 패킷 지연 시간을 보고하고 있습니다. 그러나 이러한 수치만으로는 노트북의 콜드 스타트, 컨테이너 VRAM 여유 용량, 또는 제품 이름의 발음에 대한 정보는 알 수 없습니다. ‘97ms’라는 보편적인 수치는 벤치마크 조건을 생략하고 제시된 것입니다.
자체 호스팅형 프로토타입의 경우, Qwen3-TTS는 최종 후보 목록에서 최상위권에 속합니다. 상용 API의 경우, 호스팅형 Qwen3-TTS 경로를 최신 Qwen-Audio 권장 사항, 운영 지원, 지역별 이용 가능 여부, 복제된 음성 관리 비용 등과 비교해 보시기 바랍니다. 목표가 음성 인식뿐만 아니라 음향 효과나 음악까지 포함된다면, 더 광범위한 Seed Audio 1.0 음성, 효과음 및 음악 테스트 더 다양하고 다중 모드적인 오디오 워크플로를 다루고 있습니다.
결론적으로, Qwen3-TTS는 아키텍처, 개방성, 기능 범위 측면에서 매우 뛰어난 성능을 보여줍니다. 실제 생산 환경에서의 성능은 구체적인 체크포인트나 엔드포인트, 사용 중인 하드웨어, 프로그래밍 언어, 그리고 사용자 스크립트로 테스트를 거친 승인된 참조 음성 데이터에 따라 달라집니다.
Qwen3-TTS란 무엇인가요?
Qwen3-TTS는 초당 12.5 프레임으로 작동하는 이산 음성 토큰화기를 기반으로 구축된 음성 생성 모델 계열입니다. 이에 따르면, Qwen3-TTS 기술 보고서, 이 시스템은 10개 언어로 총 500만 시간 이상의 데이터를 바탕으로 훈련되었습니다. 낮은 토큰 비율은 이 설계의 핵심 요소입니다. 음향 토큰 수를 줄이면 디코딩 작업량을 줄이고 스트리밍을 보다 실용적으로 만들 수 있으며, 동시에 모델은 음색, 발음, 억양을 그대로 유지해야 합니다.
세 가지 단계, 세 가지 증거 규칙
0.6B / 1.7B
Base, CustomVoice 및 1.7B VoiceDesign. 로컬 모델의 예측에 사용합니다.
플래시 / 인스트럭트 / VC / VD
API 모델, 인터페이스, 지역 및 날짜를 정확히 지정하십시오.
Qwen-Audio 3.0 TTS
이름만 바꾼 오픈 체크포인트가 아닌, 현재 호스팅되고 있는 대안입니다.
공개된 5개의 체크포인트는 단순히 더 큰 모델일수록 모든 기능을 수행하는 ‘사다리’ 형태가 아니라, 각각 특정 작업에 특화된 것입니다:
| 체크포인트 해제됨 | 크기 | 가장 적합한 채용 공고 | 중요한 경계 |
|---|---|---|---|
| Qwen3-TTS-12Hz-0.6B-베이스 | 0.6B | 더 간소화된 복제 및 연구 워크플로우 | 사용자 지정 음성(CustomVoice) 카탈로그가 사전 설정되어 있지 않습니다. |
| Qwen3-TTS-12Hz-1.7B-Base | 17억 | 대용량 클로닝 및 후속 연구 | 메모리와 연산 능력이 더 필요합니다 |
| Qwen3-TTS-12Hz-0.6B-CustomVoice | 0.6B | 명령 제어 기능이 포함된 사전 설정 음성 | 출시된 스피커 세트를 사용합니다 |
| Qwen3-TTS-12Hz-1.7B-CustomVoice | 17억 | 대용량 사전 설정 음성 합성 | VoiceDesign 체크포인트가 아님 |
| Qwen3-TTS-12Hz-1.7B-VoiceDesign | 17억 | 텍스트 설명을 바탕으로 음색 생성하기 | 0.6B VoiceDesign 피어가 출시되지 않았습니다. |
기준이 되는 스피커가 있고 해당 음색을 사용할 수 있는 권한이 있다면 “Base’를 선택하면 됩니다. Qwen에서 제공되는 프리셋 음색 중 하나가 프로젝트에 적합하다면 ”CustomVoice’를 선택하는 것이 더 간편한 방법입니다. ‘VoiceDesign’은 “차분하고 성숙한 내레이터로, 부드러운 저음역대를 가진”과 같은 캐릭터 요구사항이 있을 때, 즉 참고 녹음이 필요하지 않은 경우에 적합합니다.
사전 설정된 내레이터가 적합하다면 제품 튜토리얼에 클로닝이 필요하지 않으며, VoiceDesign이 적절한 정체성을 만들어낸다면 가상의 캐릭터에 실제 인물의 녹음 자료가 필요하지 않을 수도 있습니다. 각 작업을 해당 체크포인트와 대조하여 평가하십시오.
이 Qwen3-TTS 리뷰의 테스트 방법
이 리뷰는 공식 문서, Qwen 기술 보고서, 현지 하드웨어 검사, 그리고 별도로 호스팅된 오디오 래퍼에 대한 통제된 테스트라는 네 가지 증거 계층을 활용합니다. 공식 출처는 제품 정보와 공급업체가 보고한 벤치마크 결과를 뒷받침합니다. 래퍼에 대한 통제 테스트는 관찰된 동작만을 뒷받침할 뿐, Qwen3-TTS 음성 품질 점수는 뒷받침하지 않습니다.
나열된 사용 가능한 작업 환경 qwen-audio-3.0-tts-flash, 가 아닌 qwen3-tts-* 모델.
명료한 영어 음성 녹음을 생성해 주세요. 다음 문장을 정확히 읽어주세요: '일출 때, 연구팀은 결과를 발표하기 전에 모든 신호를 두 번씩 확인했다.' 따뜻하고 차분한 성인 내레이터의 목소리로, 자연스러운 말투와 명확한 자음 발음을 사용하며, '일출' 뒤에 짧은 멈춤을 넣어 주세요. 음악, 음향 효과, 소개말 또는 인용된 문장에 포함되지 않은 어떤 단어도 추가하지 마십시오.
테스트 결과, 이 입력에 대해 21.263673초 분량의 MP3 파일이 생성되었으며, 안내 내용이 음성으로 출력되었습니다. 테스트 결과에서 알 수 있듯이, 래퍼는 전체 프롬프트를 음성 텍스트로 처리했습니다.
해가 뜰 무렵, 연구팀은 결과를 발표하기 전에 모든 신호를 두 번씩 확인했다.
대상 문장만 사용하여 대조 실험을 반복했습니다. 테스트 결과, 22,050 Hz, 128 kbps, 모노 형식의 6.086531초 분량 MP3 파일이 생성되었습니다. 이 파일은 대상 문장과 단어 하나하나가 일치했으며, 별도의 지침은 추가되지 않았습니다.
사용자는 두 파일을 모두 청취한 후 아래의 평점을 확정했습니다. 이는 MOS 연구나 청취 패널이 아닌, 단일 청취자에 의한 실전 점검입니다.
| 청취 영역 | 지시 기반 제어 | 일반 텍스트 컨트롤 |
|---|---|---|
| 자연스러움 | 4/5 | 5/5 |
| 명료도 | 5/5 | 5/5 |
| 발음 | 5/5 | 5/5 |
| 운율 | 4/5 | 5/5 |
| 텍스트의 정확성 | 1/5 | 5/5 |
| 스타일 준수 | 점수 미부여 | 5/5 |
| 유물의 부재 | 5/5 | 5/5 |
| 생산 환경에서의 사용 편의성 | 1/5 | 5/5 |
지침이 포함된 샘플은 소리가 선명하고 대체로 자연스러웠지만, 지침을 읽어내려가다 보니 텍스트의 정확성과 실제 활용도가 떨어졌습니다. 일반 텍스트 샘플은 소리가 자연스러웠고 문장을 정확히 따랐으며, 내용 정리가 필요하지 않았습니다. 이 점수는 오직 두 가지 qwen-audio-3.0-tts-flash 래퍼 컨트롤; 이는 Qwen3-TTS 체크포인트 음성 품질 평가가 아닙니다.
스타일 지침과 내레이션이 같은 영역에 속한다고 절대 가정하지 마십시오. 당사의 가이드에 따르면 AI가 작성한 연설문을 더 인간적으로 들리게 만들기 스크립트를 개선하지만, 엔드포인트 필드에 따라 ‘directions’가 음성 제어를 담당할지, 아니면 녹음을 시작할지 결정됩니다.
직접 확인한 결과, 2GB VRAM을 탑재한 NVIDIA GeForce MX450과 약 16.9GB의 시스템 메모리가 확인되었습니다. 이는 계획된 0.6B 대 1.7B 행렬을 처리하기에는 부적절한 플랫폼입니다. CPU 오프로드는 출시 초기 단계의 성능일 뿐, 대표적인 속도를 반영하지 않을 수 있습니다. 따라서 Qwen3-TTS 음성 품질, 로컬 RTF, 복제 유사도 및 다국어 간 일관성은 평가 대상에서 제외되었습니다.
Qwen3-TTS 음성 품질: 증거가 입증할 수 있는 것
공식 보고서에 따르면, Qwen3-TTS는 명료도, 화자 유사도, 지시 사항 이행, 다국어 생성, 장문 음성, 스트리밍 분야에서 뛰어난 성과를 보인 것으로 나타났습니다. 이는 유용한 비교 지표이긴 하지만, 본 연구에서 생성된 녹음 자료가 아닌 Qwen가 보고한 벤치마크에 불과합니다.
제작용 음성 테스트에서는 발음, 잡음, 말하기 속도, 감정 표현, 재현성, 편집 부담, 약어, 날짜, 통화, URL, 이름, 코드 전환, 긴 문장 등을 모두 다뤄야 합니다.
청취와 대본 및 메타데이터를 함께 활용하십시오. ChatGPT 오디오 전사 워크플로우 텍스트 검사를 반복적으로 수행할 수 있게 합니다.
Qwen3-TTS는 유망해 보이지만, 이 리뷰에는 직접 측정한 체크포인트 점수가 포함되어 있지 않습니다. 제품을 배송하기 전에 반복적인 생성 테스트를 수행하고, 기본 재생기, 헤드폰, 휴대폰 스피커 등을 통해 확인해 보시기 바랍니다.
외부 평가자들이 주목한 점
Qwen의 소셜 데모는 다양한 음색, 언어 및 방언을 선보입니다. 독립 크리에이터인 비잔 보웬(Bijan Bowen)은 현지화 구현과 음성 복제 기술에 중점을 두었으며, 제프 기어링(Jeff Geerling)은 이번 출시를 관리형 TTS 플랫폼에 대한 강력한 오픈소스 경쟁자로 평가했습니다. 이는 리뷰어들의 주관적인 견해일 뿐, 벤치마크 결과나 시장 전반의 합의가 반영된 것은 아닙니다.
Qwen3-TTS 속도 및 지연 시간
첫 패킷 지연 시간
0.288 / 0.313
동시 실행 수 1일 때 0.6B / 1.7B.
최적화된 내부 vLLM 환경—노트북 사용이 보장되는 것은 아닙니다.
0.6B 12Hz 모델의 대표 속도 수치는 첫 패킷 지연 시간이 97ms입니다. 동일한 기술 보고서 표에 따르면, 동시 실행 수 1인 상태에서 1.7B 12Hz 모델의 수치는 101ms로 나타납니다. 보고된 실시간 계수(RTF)는 각각 0.288과 0.313이었습니다. 쉽게 말해, RTF가 1 미만이면 해당 환경에서 합성 속도가 생성된 오디오의 재생 시간보다 빨랐음을 의미합니다.
이러한 결과는 Qwen의 최적화된 내부 vLLM 설정에서 도출된 것입니다. 이는 Windows 노트북, 콜드 서버리스 컨테이너, 또는 공유 API 리전에 대한 일반적인 ‘첫 오디오 재생까지 소요 시간’에 대한 약속이 아닙니다. 또한 이 보고서는 동시 처리량이 지연 시간에 영향을 미친다는 점을 보여줍니다. 모델 로딩, 참조 오디오 처리, 네트워크 전송, 큐 대기, 오디오 패키징, 클라이언트 재생 등은 모두 핵심 디코더 수에 포함되지 않을 수 있습니다.
공정한 벤치마크 기록에는 다음이 포함되어야 합니다:
- 하드웨어, 정밀도, 모델 수정, 백엔드 처리.
- 콜드/웜 상태, 동시 실행, 첫 오디오 재생 시간, 총 시간, 최대 VRAM 사용량, 출력 지속 시간 및 RTF.
- API의 경우: 지역, 연결 유형, 요청 ID, 큐 처리 및 재시도.
최대 용량보다 메모리와 동시 처리 능력이 더 중요한 경우에는 0.6B 모델이 더 안전한 선택일 것입니다. 시스템에 여유 용량이 있을 때는 1.7B 모델이 품질 면에서 더 합리적인 선택입니다. 하지만 동일한 프롬프트, 스피커, 샘플링 설정 및 워밍업 상태를 적용하지 않는 한, 모델 크기만으로는 실제 지연 시간 차이를 파악할 수 없습니다.
Qwen3-TTS 언어 및 발음
공개된 Qwen3-TTS 체크포인트는 중국어, 영어, 일본어, 한국어, 독일어, 프랑스어, 러시아어, 포르투갈어, 스페인어, 이탈리아어 등 10개 언어를 지원합니다. 이 목록은 현재 저장소와 공개된 모델 자료에서 가져온 것입니다. 다른 Qwen 오디오 제품에서 태국어, 인도네시아어, 말레이어, 베트남어를 이미 지원하고 있으므로, 이를 무단으로 추가하지 마십시오.
| 언어 | 공식 오픈 지원 | 생산 검토 우선순위 |
|---|---|---|
| 중국어 | 예 | 음조, 이름, 숫자 읽기, 지역별 문체 |
| 영어 | 예 | 스트레스, 약어, 브랜드명, 긴 문장 |
| 일본어 | 예 | 어조, 조동사, 이름, 라틴어 혼합 텍스트 |
| 한국어 | 예 | 공백, 외래어, 문장 끝맺음 |
| 독일어 | 예 | 복합어, 숫자, 자음 군 |
| 프랑스어 | 예 | 연락 담당자, 약어, 차용된 이름 |
| 러시아어 | 예 | 스트레스, 이름, 숫자, 라틴어 삽입 |
| 포르투갈어 | 예 | 원하는 지역 사투리와 철자를 확인하십시오 |
| 스페인어 | 예 | 지역별 억양과 고유명사를 확인하십시오 |
| 이탈리아어 | 예 | 스트레스, 이중 발음, 외국 이름 |
“지원”이란 해당 모델이 해당 언어를 합성할 수 있음을 의미하며, 모든 지역의 모든 음성이 동등하게 원어민처럼 들린다는 뜻은 아닙니다. 포르투갈어와 스페인어만 보더라도 지역별로 고려해야 할 중요한 차이점이 있습니다. 상용화 단계에서는 대상 지역 설정을 명확히 하고, 원어민 검토자를 모집하며, 이름, 측정 단위, 주소, 법률 용어에 대한 발음 회귀 데이터 세트를 구축해야 합니다.
코드 전환에는 별도의 테스트가 필요합니다. “오전 9시 30분에 상파울루에서 Qwen3-TTS API를 실행하세요”와 같은 문장은 영어 문장 구조, 모델 이름, 포르투갈어 발음, 구두점, 그리고 시간을 결합하고 있습니다. 이는 단일 언어로만 구성된 깔끔한 데모 문장보다 실제 앱 문구에 훨씬 더 가깝습니다. 영상 더빙의 경우, 발음도 타이밍에 맞춰져야 합니다. 저희는 Veo 3.1 대화, 오디오 및 입모양 동기화 워크플로우 주변 동기화 문제를 다룹니다.
음성 복제, CustomVoice, VoiceDesign
Base 체크포인트는 약 3초 분량의 참조 오디오만으로도 신속한 음성 복제를 지원합니다. 이는 인상적인 최소 성능 기준일 뿐, 3초 분량이 항상 최적의 제작 샘플이 된다는 보장은 아닙니다. 참조 오디오가 짧으면 음역, 말의 속도, 모음 범위, 감정 표현, 마이크 사용 일관성 등이 제대로 반영되지 않을 수 있습니다.
알리바바 클라우드의 호스팅형 등록 지침은 보다 보수적인 편입니다. 최소 3초 동안의 연속적이고 선명한 음성 샘플을 요구하며, 더 긴 샘플도 허용하고, 실제 복제를 위해서는 더 선명하고 긴 녹음 파일을 사용할 것을 권장합니다. 현재의 지침을 따르십시오. 음성 복제 관련 문서 논문에 제시된 3초 분량의 시연을 업로드 사양으로 간주하기보다는, 포맷, 샘플 레이트, 채널, 재생 시간 및 지역 관련 규칙을 적용해야 한다.
CustomVoice는 실제 인물의 목소리를 복제하지 않습니다. 공개된 버전에는 다양한 언어나 스타일에 맞는 9가지 프리미엄 음색이 포함되어 있어, 미리 설정된 정체성과 지시 제어 기능만으로도 충분한 경우에 특히 유용합니다.
VoiceDesign은 자연어 설명을 바탕으로 음색을 생성합니다. 호스팅되는 음성 디자인 문서 별도의 제작 워크플로를 보여줍니다. 이 방법은 가상의 캐릭터나 합성된 브랜드 목소리에 적합하지만, 설명문은 여전히 지각되는 연령, 억양, 문화적 편향에 대한 검증이 필요합니다.
음성 신원 위험 매트릭스
발언자, 범위, 기간 및 철회 절차를 기록하십시오.
참조 항목을 암호화하고, 원본과 함께 파생된 음성을 삭제하십시오.
유해한 신원 주장을 차단하고 신고 기능을 추가합니다.
청취자가 합성 음성을 실제 사람의 목소리로 오인할 가능성이 있는 경우, 해당 음성에 ‘합성 음성’이라는 라벨을 붙이십시오.
복제를 위해서는 명시적인 권한과 사전 동의가 필요합니다. 원본 동의 기록을 보관하고, 허용된 사용 범위를 명확히 정의하며, 후속 재등록을 방지하고, 삭제 절차를 마련해야 합니다. 이러한 위험은 이론적인 것이 아닙니다. 얼굴-음성 개인정보 보호 및 동의 분석 신원, 생체 인식 데이터, 사칭 방지 조치가 왜 각주가 아닌 제품 설계에 포함되어야 하는지 설명합니다.
Qwen3-TTS 0.6B 대 1.7B: 어떤 버전을 실행해야 할까요?
첫 번째 제약 조건이 배포인 경우 0.6B를 선택하세요. 이 크기는 소형 GPU, 높은 동시 처리량, 신속한 실험, 그리고 비용 효율성을 중시하는 자체 호스팅에 더 적합한 선택지입니다. 이 크기에는 Base와 CustomVoice가 모두 포함되어 있으므로, 가장 큰 체크포인트부터 시작할 필요 없이 클로닝이나 사전 설정된 화자를 평가해 볼 수 있습니다.
품질 여유와 기능의 폭이 더 중요하다면 1.7B를 선택하세요. 이는 VoiceDesign이 탑재된 유일한 출시 버전이며, 메모리와 처리량을 용량과 교환할 의향이 있는 팀에게 더 타당한 선택입니다. 기술 보고서의 동시 실행 수 1에 대한 측정 결과, Qwen의 최적화된 설정에서 첫 번째 패킷 및 RTF 차이가 미미한 것으로 나타났지만, 사용 중인 하드웨어에 따라 그 차이가 더 커지거나 줄어들 수 있습니다.
| 결정 요인 | 0.6B부터 시작하세요 | 17억부터 시작하세요 |
|---|---|---|
| GPU 메모리가 부족합니다 | 더 탄탄한 착용감 | 부하 분산 실패 또는 낮은 동시 처리 능력의 위험이 높아짐 |
| VoiceDesign이 필요합니다 | 출시된 세트에는 포함되어 있지 않습니다 | 필수 |
| 베이스 클로닝이 필요합니다 | 사용 가능 | 더 큰 용량으로 제공됩니다 |
| CustomVoice가 필요해요 | 사용 가능 | 더 큰 용량으로 제공됩니다 |
| 신속한 타당성 검증이 필요합니다 | 가장 좋은 시작점 | 파이프라인 공사가 끝난 후에 사용하십시오 |
| 최종 제작 방안을 결정해야 합니다 | 두 가지 모두를 벤치마크하세요 | 두 가지 모두를 벤치마크하세요 |
매개변수 개수는 VRAM 요구 사항이 아닙니다. 정밀도, 어텐션 구현 방식, 캐시, 참조 길이, 배치 크기, 프레임워크 오버헤드 등이 모두 중요한 요소입니다. 간신히 로드되는 모델은 신뢰할 수 있는 운영 서비스가 될 수 없습니다.
이번 리뷰에서 살펴본 2GB MX450의 경우, 두 가지 크기 모두 GPU 벤치마크를 수행하기에 적합한 환경을 제공하지 못했습니다. 최신 CUDA 스택과 적합한 GPU, 또는 공식 호스팅 엔드포인트를 확보하는 것이 실질적인 다음 단계입니다. “CPU 오프로드를 통해 실행되었다”는 내용은 호환성에 대한 참고 사항일 뿐, 의미 있는 성능 평가라고 볼 수는 없습니다.
Qwen3-TTS API: HTTP, 스트리밍 및 모델 ID
재생 환경에 맞는 이동 수단을 선택하세요
일괄 내레이션 및 파일 완성을 위한 가장 간단한 방법.
점진적 제공; 오디오가 재생 가능해지면 다시 확인하십시오.
대화 및 순차적 재생에 가장 적합합니다.
알리바바 클라우드는 비실시간 HTTP 생성 모델과 실시간 WebSocket 모델을 제공합니다. 결과를 모두 기다릴 수 있고 가장 간단한 요청 흐름을 원할 때는 비실시간 합성 방식을 사용하십시오. 대화형 지연 시간이나 점진적 재생이 중요한 경우에는 WebSocket 스트리밍을 사용하십시오. HTTP 스트리밍이나 서버 전송 이벤트(SSE)도 증분 데이터를 반환할 수 있지만, 전용 저지연 실시간 모델 계열과 혼동해서는 안 됩니다.
현재 호스팅되는 제품군에는 내장 음성용 Qwen3-TTS Flash, 자연어 성능 제어용 Instruct Flash, 복제 음성용 VC, 그리고 설계된 음성용 VD가 포함됩니다. 모델 ID와 날짜가 표시된 스냅샷은 비실시간 경로와 실시간 경로 간에 차이가 있으므로, 유추를 통해 이름을 구성하기보다는 최신 문서에서 직접 복사하여 사용하십시오.
현재 Qwen-TTS API 설명서 요청당 입력량을 512 토큰으로 제한합니다. 이것이 이 제품군에 적용되는 제한 사항이며, 다른 TTS 모델에 대해 문서화된 별도의 600자 규칙은 Qwen3-TTS 통합 환경에 복사해서는 안 됩니다. Complete-audio URL은 24시간 동안 유효하므로, 운영 시스템에서는 응답 URL을 영구적인 미디어로 사용하는 대신 필요한 파일을 내구성 있는 저장소로 이동시켜야 합니다.
import os
import dashscope
dashscope.base_http_api_url = "https://dashscope-intl.aliyuncs.com/api/v1"
response = dashscope.MultiModalConversation.call(
model="qwen3-tts-flash",
api_key=os.environ["DASHSCOPE_API_KEY"],
text="주문하신 상품은 오후 4시 30분에 수령하실 수 있습니다.",
voice="Cherry",
language_type="English",
)
print(response)
API 키와 엔드포인트 리전이 일치해야 합니다. 베이징 및 싱가포르 배포 환경은 서로 다른 인증 정보와 기본 URL을 사용하며, 모델 이용 가능 여부는 리전에 따라 다를 수 있습니다. WordPress, 클라이언트 측 JavaScript 또는 모바일 바이너리에 키를 절대 삽입하지 마십시오. 사용자가 관리하는 서버를 통해 합성 요청을 전송하고, 민감한 입력 정보는 기록하지 않은 채 요청 ID만 기록하며, 생성된 오디오에 대한 수명 주기 정책을 설정하십시오.
긴 문서의 경우, 의미적 경계를 기준으로 분할하고, 문맥을 유지하며, 숫자를 표준화하고, 모든 조인 지점을 꼼꼼히 검토해야 합니다. 유효한 클립이라도 통화 간에 속도나 분위기가 달라지면 여전히 별개의 녹음처럼 들릴 수 있습니다.
국제 지역 내 Qwen3-TTS 가격
지역별 가격 현황
플래시
$0.10
입력 문자 10,000자당지시 / VC / VD
$0.115
입력 문자 10,000자당플래시 / VC
$0.13
입력 문자 10,000자당지시
$0.143
입력 문자 10,000자당VD
$0.143353
입력 문자 10,000자당음성 생성: 등록 건당 $0.01 · 설계된 음성 채널당 $0.20.
알리바바 클라우드의 모델 스튜디오 요금 안내 페이지 2026년 8월 11일 확인 시, 다음과 같은 국제 지역별 가격이 표시되었습니다. 해당 행의 경우 입력 데이터에 대해서는 요금이 부과되며, 출력 데이터는 무료입니다. 가격, 무료 할당량, 별칭 및 지역별 제공 여부는 변경될 수 있으므로, 대량의 배치 처리를 진행하기 전에 선택한 배포 설정을 확인하시기 바랍니다.
| 경로 | 모델 제품군 | 입력 문자 10,000자당 가격 |
|---|---|---|
| 비실시간 | Qwen3-TTS 플래시 | $0.10 |
| 비실시간 | Instruct, VC 또는 VD | $0.115 |
| 실시간 | 플래시 또는 현재 VC | $0.13 |
| 실시간 | 지시 | $0.143 |
| 실시간 | VD | $0.143353 |
음성 생성은 합성과는 별도로 요금이 부과됩니다. 동일한 국제 요금표에 따르면, Qwen 음성 등록은 클론당 $0.01, 음성 디자인은 디자인된 음성당 $0.20으로 책정되어 있습니다. 클론 또는 디자인된 음성은 사용 시 해당 문자당 합성 요금이 부과될 수 있습니다.
예산은 음성 제작, 합성 캐릭터, 인프라, 재생성 비용을 별도로 책정해야 합니다. 편집 시간과 재촬영 횟수가 실제 제작 비용을 좌우하는 경우가 많습니다.
API 요금은 현지 비용과 동일하지 않습니다. 오픈 체크포인트는 공급업체의 문자당 과금 방식을 없애주지만, 대신 GPU 사용 시간, 배포 엔지니어링, 모니터링, 스토리지, 확장성 및 사고 대응 비용이 추가됩니다. 제어권, 처리량, 데이터 근접성 또는 맞춤화가 그러한 운영상의 부담을 감수할 만한 가치가 있을 때, 자체 호스팅이 더 유리합니다.
대안 및 GlobalGPT 오디오 경로
Qwen3-TTS가 모든 오디오 작업에 자동으로 최선의 선택이 되는 것은 아닙니다. ElevenLabs는 세련된 대시보드, 폭넓은 제작 도구, 최소한의 인프라를 중시하는 팀을 위한 보다 성숙한 관리형 음성 플랫폼입니다. OpenAI 음성 모델은 이미 하나의 API 생태계를 표준으로 채택한 개발자에게 적합할 수 있습니다. Qwen-Audio 3.0 TTS는 알리바바 클라우드의 현재 권장 사항을 따를 때 비교해 볼 만한 최신 호스팅형 Qwen 솔루션입니다.
음악과 음향 효과에 대한 요구 사항은 별도의 비교 대상입니다. 이 ElevenLabs, Lyria 3 Pro, Mureka 오디오 비교 이는 음성 합성 도구와 완전한 음악 생성 도구를 구분하는 데 도움이 됩니다. 텍스트 음성 변환 모델은 완성도 높은 곡을 만들어내지 못한다고 해서 점수를 깎여서는 안 되며, 음악 모델은 저지연 나레이션 API로 선택되어서는 안 됩니다.
GlobalGPT는 현재 인증된 오디오 생성기 경로 다음과 같이 나열된 qwen-audio-3.0-tts-flash 그리고 Seed Audio 1.0. 확인한 페이지에는 Qwen3-TTS가 나열되어 있지 않았습니다. 따라서 GlobalGPT는 실질적으로 별도의 오디오 작업 공간일 뿐, 공개된 Qwen3-TTS 체크포인트가 그곳에서 이용 가능하다는 증거는 아닙니다.
최종 결과물이 동영상인 경우, 별도의 내레이터가 필요한지, 생성된 대사가 필요한지, 음향이 필요한지, 아니면 영상과 함께 소리를 내는 모델이 필요한지 결정하십시오. 이에 대한 저희의 답변은 Veo 3.1에 사운드가 나오는지 여부 이러한 광범위한 결정을 뒷받침합니다. 가장 현명한 방법은 하나의 모델로 모든 오디오 작업을 처리하도록 강요하기보다는, 특화된 도구들을 소수만 조합해 사용하는 것입니다.
라이선스, 동의, 개인정보 보호 및 상업적 이용
Qwen3-TTS 저장소 및 공개된 모델 카드는 Apache-2.0 라이선스를 적용합니다. 이 라이선스는 상업적 개발, 수정 및 배포에 유리하지만, 타인의 음성, 공연, 대본, 상표 또는 개인 데이터에 대한 권리를 부여하지는 않습니다. 모델 라이선스와 콘텐츠 권리는 별개의 영역입니다.
로컬 추론을 통해 더 많은 제어 권한과 보안 책임을 갖게 됩니다. 참조 녹음 파일을 암호화하고, 접근을 제한하며, 보존 기간을 최소화하고, 파생 파일을 기록하며, 등록된 음성 및 캐시된 출력물에 대한 삭제 처리를 적용할 수 있습니다.
호스팅형 합성 서비스를 이용할 경우, 기밀 스크립트나 음성 샘플을 전송하기 전에 서비스 약관, 지역별 데이터 처리 방식, 보존 기간 및 기업용 제어 기능을 확인하시기 바랍니다.
대중에게 공개되는 모든 복제 음성에는 소유자, 동의 기록, 허용된 사용 정책 및 악용 시 대응 방안이 마련되어야 합니다. 합성 음성이 실제 인물로 오인될 가능성이 합리적으로 예상되는 경우에는 이를 명시해야 합니다. 일반인 및 고위험 공인에 대한 사칭을 차단하고, 유해한 오디오를 신고할 수 있는 방법을 제공해야 합니다.
Qwen3-TTS는 누가 사용해야 할까요?
어떤 경로가 적합할까요?
파이프라인 내성, 더 정밀한 메모리, Base 또는 CustomVoice.
VoiceDesign 또는 GPU 여유 용량을 고려한 품질-용량 비교.
지역, 개인정보 보호 및 가격 조건이 모두 충족될 때 더 빠른 운영이 가능합니다.
설정 없이 바로 사용할 수 있는 스튜디오, 라이선스가 부여된 마켓플레이스, 또는 기존 공급업체 지원.
Qwen3-TTS는 공개 가중치, 배포 방식 선택, 클로닝 또는 텍스트로 설명된 캐릭터 음성이 필요한 연구자, 개발자, 게임 팀 및 현지화 그룹에 적합합니다.
파이프라인을 검증하거나, 제한된 메모리를 관리하거나, Base 및 CustomVoice가 제품 요구 사항을 충족하는지 테스트하는 경우 0.6B부터 시작하세요. VoiceDesign이 필요하거나 품질과 처리량을 적절히 비교할 수 있는 충분한 하드웨어가 있다면 1.7B부터 시작하십시오. 인프라가 병목 현상인 경우, 그리고 지역별 가용성, 인증 정보 및 데이터 처리 방식이 프로젝트에 적합한 경우 호스팅형 API를 사용하십시오.
설정 없이 바로 사용할 수 있는 편집 스튜디오, 방대한 규모의 정식 라이선스 음성 마켓플레이스, 또는 타 공급업체의 기존 엔터프라이즈 지원이 필요하다면 다른 대안을 선택하십시오. 문서화된 동의 없이는 절대로 복제하지 마십시오.
실제 스크립트 5개, 반복 처리 3회, 이름이 복잡한 목록, 긴 문단, 복구 테스트 1회를 사용합니다. 지연 시간과 비용을 측정한 다음, 원어민 청취자들에게 수정 없이도 결과가 사용 가능한지 물어보세요. 편집 작업은 벤치마크에서 얻은 우위를 뒤집을 수 있습니다.
Qwen3-TTS 자주 묻는 질문
Qwen3-TTS는 무료인가요?
공개된 Qwen3-TTS 체크포인트는 Apache-2.0 라이선스에 따라 제공되므로, 문자당 모델 사용료 없이 다운로드하여 실행할 수 있습니다. 자체 호스팅의 경우에도 컴퓨팅, 스토리지, 엔지니어링 및 모니터링 비용이 발생합니다. 알리바바 클라우드에서 호스팅하는 Qwen3-TTS API는 지역별 요금 및 할당량이 적용되는 유료 서비스입니다.
Qwen3-TTS를 상업적으로 사용할 수 있습니까?
Apache-2.0 라이선스는 공개된 코드와 모델 가중치의 상업적 사용을 허용하지만, 타인의 목소리를 복제하거나 보호 대상인 스크립트 및 브랜드를 사용할 권리를 부여하지는 않습니다. 상업적 프로젝트의 경우 여전히 화자의 동의, 콘텐츠 권리, 개인정보 보호 조치, 그리고 현지 법률 및 플랫폼 이용 약관의 준수가 필요합니다.
Qwen3-TTS는 어떤 언어를 지원하나요?
공개된 Qwen3-TTS 릴리스는 중국어, 영어, 일본어, 한국어, 독일어, 프랑스어, 러시아어, 포르투갈어, 스페인어 및 이탈리아어를 지원합니다. 호스팅 모델의 언어 지원 범위는 엔드포인트 및 음성 유형에 따라 다를 수 있으므로, 다국어 제품을 구축하기 전에 정확한 알리바바 클라우드 모델 ID와 리전을 확인하시기 바랍니다.
Qwen3-TTS가 정말 97 ms의 지연 시간을 구현할 수 있나요?
Qwen는 최적화된 내부 vLLM 환경에서 동시 접속 수 1일 기준, 0.6B 12Hz 모델의 첫 패킷 지연 시간이 97 ms라고 보고했습니다. 이는 유효한 공급업체 벤치마크일 뿐, 모든 기기에 적용되는 성능 보장은 아닙니다. 콜드 스타트, 하드웨어, 정밀도, 네트워크 전송, 큐잉 및 클라이언트 버퍼링은 관측된 지연 시간을 증가시킬 수 있습니다.
Qwen3-TTS에는 VRAM이 얼마나 필요합니까?
모든 설정에 대해 단 하나의 정확한 VRAM 수치를 제시할 수는 없습니다. 모델 크기, 정밀도, 어텐션 백엔드, 배치 크기, 캐시, 참조 길이, 프레임워크 오버헤드 등이 모두 중요한 요소로 작용합니다. 검토 대상이었던 2GB MX450은 대표적인 벤치마킹에 적합하지 않았습니다. 선택한 체크포인트를 실제 운영 환경과 유사한 동시성 조건에서 테스트하고, 운영에 필요한 여유 공간을 확보해야 합니다.
Qwen3-TTS 음성 복제를 위해서는 얼마나 많은 오디오 자료가 필요한가요?
모델 자료에서는 약 3초 분량의 샘플로도 신속한 클로닝이 가능한 것으로 나타났으나, 호스팅 기반 등록 지침에서는 깨끗하고 연속적인 음성을 권장하며 더 긴 샘플도 허용합니다. 3초는 자동 품질 목표가 아닌 최소 성능 기준으로 간주하십시오. 화자의 정상적인 발성 범위와 사용하려는 언어를 모두 포함하는, 사전 동의를 얻은 잡음 없는 오디오를 사용하십시오.
Qwen3-TTS API의 입력 제한은 어떻게 되나요?
현재 Qwen-TTS API 문서에는 Qwen-TTS 모델의 최대 입력 토큰 수가 512개로 명시되어 있습니다. Complete-audio URL은 24시간 동안 유효합니다. 긴 스크립트는 의미적 경계에서 분할하고, 반환된 URL을 영구적인 호스팅으로 간주하지 말고 필요한 출력 결과를 영구 저장소에 복사해 두십시오.
GlobalGPT에서 Qwen3-TTS를 사용할 수 있나요?
나열된 체크 표시된 GlobalGPT 오디오 발생기 qwen-audio-3.0-tts-flash 그리고 Seed Audio 1.0이며, Qwen3-TTS가 아닙니다. 해당 경로를 별도의 오디오 워크플로우로 사용할 수는 있지만, 이를 공개된 0.6B 또는 1.7B Qwen3-TTS 체크포인트에 대한 접근으로 설명해서는 안 됩니다.
최종 판결
이번 Qwen3-TTS 리뷰에서는 이례적으로 폭넓은 기능을 확인할 수 있습니다. 0.6B 및 1.7B 오픈 체크포인트, 10개 언어 지원, 사전 설정된 음성, 신속한 클로닝, VoiceDesign, 스트리밍 아키텍처, 자유로운 라이선스, 호스팅형 API 등이 포함됩니다.
솔직한 한계점도 마찬가지로 중요합니다. 사용 가능한 작업 환경에서는 실제 Qwen3-TTS 오디오가 생성되지 않았으며, 검토 대상이었던 2GB GPU로는 대표적인 로컬 비교를 수행할 수 없었습니다. 이러한 이유로, 본 기사에서는 음성 품질 점수를 부여하지 않으며, 97ms의 성능을 보편적으로 보장한다고 주장하지도 않습니다.
개방형 모델과 제어 기능을 중요하게 생각하신다면, 먼저 0.6B 체크포인트를 테스트한 다음, 동일한 스크립트와 하드웨어 환경에서 1.7B와 비교해 보시기 바랍니다. 서비스 출시 속도를 중시한다면, 구매할 예정인 알리바바 클라우드 경로를 정확히 테스트하고, 별도로 포지셔닝된 Qwen-Audio 3.0 TTS 제품군과 비교해 보십시오. 모델 이름, 엔드포인트, 리전, 동의 기록, 지연 시간 및 총 편집 비용을 동일한 의사결정 시트에 정리해 두십시오.
Qwen3-TTS는 테스트해 볼 가치가 있습니다. 문서만으로는 여러분의 목소리를 대신해 줄 수 있다고 생각해서는 안 됩니다. 성공으로 이끄는 길은 여러분의 이름, 언어, 하드웨어, 개인정보 보호 요구사항, 그리고 제작 마감일을 모두 충족시키는 것입니다.



