Обзор, основанный на имеющихся данных · Август 2026 года
Открытые веса, хостируемые API и разрыв в наименовании — наглядное представление.
Предельное значение доказательств: Не приводится никаких оценок качества звучания Qwen3-TTS, полученных на собственном опыте.
Чтобы дать полезный обзор Qwen3-TTS, прежде чем приступать к оценке голосов, необходимо ответить на один из самых основных вопросов: о каком именно Qwen3-TTS идет речь? В 2026 году это название охватывает загружаемые наборы данных объёмом 0,6B и 1,7B, API Qwen3-TTS, размещённые на Alibaba Cloud, а также рынок, на котором также рекомендуется отдельное семейство продуктов Qwen-Audio 3.0 TTS. Рассматривать эти продукты как одно целое приводит к вводящим в заблуждение заявлениям о скорости, языках и ценах.
Если отвечать кратко, то Qwen3-TTS — один из самых гибких открытых голосовых стеков 2026 года. Он поддерживает десять языков, предлагает контрольные точки для конкретных задач, клонирование голоса за примерно три секунды, проектирование голоса с использованием естественного языка, поддержку потоковой передачи данных и лицензию Apache-2.0. Однако в данном обзоре не приводится оценка качества распознавания речи: доступная тестовая среда не предоставляла доступа к реальному коневому узлу Qwen3-TTS, а локальный графический процессор с 2 ГБ памяти не подходил для проведения репрезентативного сравнительного тестирования моделей объёмом 0,6 млрд и 1,7 млрд параметров.
Состояние проекта Qwen3-TTS в 2026 году
22 января 2026 года компания Qwen опубликовала весовые коэффициенты открытого конкурса Qwen3-TTS. официальный репозиторий Qwen3-TTS перечисляет пять выпущенных контрольных точек 12Hz: 1,7B VoiceDesign, 1,7B CustomVoice, 1,7B Base, 0,6B CustomVoice и 0,6B Base. Соответствующие Коллекция Hugging Face также включает токенизатор. Это модели, которые разработчики могут просматривать, скачивать и запускать в соответствии с опубликованной лицензией.
Alibaba Cloud отдельно предлагает хостируемые продукты семейств Qwen3-TTS Flash, Instruct, «клонирование голоса» и «дизайн голоса» через интерфейсы как в режиме реального времени, так и в нереальном времени. В настоящее время каталог моделей синтеза речи следует рассматривать как достоверный источник информации о размещенных псевдонимах, регионах, языках и интерфейсах, поскольку эти сведения могут изменяться без изменения имен открытых контрольных точек.
Есть ещё одна тонкость в наименовании. В руководстве Alibaba Cloud по выбору моделей на 2026 год пользователям также рекомендуется использовать модель Qwen-Audio 3.0 TTS для ряда заданий, выполняемых в хостинговой среде. Qwen-Audio 3.0 TTS — это не переименованная контрольная точка 0.6B или 1.7B Qwen3-TTS. Если вы уже знакомы с более широким семейством Qwen, то наше Qwen 3.8: обзор технических характеристик и возможностей показывает, почему точное наименование моделей имеет важное значение для всей линейки продуктов Qwen.
Используйте название открытой контрольной точки для локального вывода, точный идентификатор модели Alibaba Cloud для работы с API, а TTS Qwen-Audio 3.0 — только в качестве отдельной альтернативы. Это позволяет сохранить все заявления о качестве, задержке и цене, относящиеся к продукту, на основе которого они были сформулированы.
Краткий вывод: мощный, открытый и чувствительный к доказательствам
Краткий вывод
Открытое развертывание, исследования, клонирование и озвучивание персонажей.
Пять контрольных точек для конкретных задач в двух размерах.
Скорость работы поставщика зависит от конкретных условий; качество в данном случае не оценивается.
Маршруты «Hosted Qwen3-TTS» и «Qwen-Audio 3.0» являются отдельными маршрутами.
Решение Qwen3-TTS наиболее привлекательно для команд, которым важен контроль и свобода выбора способа развертывания. Контрольные точки Base поддерживают клонирование, CustomVoice предоставляет именованные предустановленные голоса с управлением инструкциями, а VoiceDesign позволяет создавать голос на основе письменного описания. Поддержка десяти языков делает этот набор инструментов гораздо более полезным, чем открытая демо-версия, доступная только на английском языке, а версии 0.6B дают разработчикам более компактную отправную точку.
Основное замечание касается качества данных. В отчете Qwen приводятся высокие результаты тестов и низкая задержка первого пакета в оптимизированной внутренней среде. Эти цифры не отражают ситуацию с «холодным» запуском ноутбука, запас VRAM в контейнерах или произношение названий ваших продуктов. В обещаниях о универсальной задержке в 97 мс упускаются условия проведения тестов.
Если речь идет о прототипе с собственным хостингом, Qwen3-TTS занимает одно из первых мест в списке кандидатов. При выборе API для производственной среды следует сравнить вариант Qwen3-TTS с хостингом с более новыми рекомендациями по Qwen-Audio, операционной поддержкой, региональной доступностью и затратами на управление клонированными голосами. Если ваши задачи выходят за рамки речи и включают звуковые эффекты или музыку, более широкий Тесты голосовых записей, звуковых эффектов и музыки в Seed Audio 1.0 охватить иной, более мультимодальный рабочий процесс работы со звуком.
Итог: модель Qwen3-TTS демонстрирует отличные результаты по таким параметрам, как архитектура, открытость и охват функциональных возможностей. Ее фактическая готовность к производственному использованию по-прежнему зависит от конкретной контрольной точки или конечной точки, вашего оборудования, используемого языка, а также от согласованного эталонного голоса, протестированного с вашими собственными скриптами.
Что такое Qwen3-TTS?
Qwen3-TTS — это семейство моделей генерации речи, построенное на основе дискретного токенизатора речи, работающего со скоростью 12,5 кадров в секунду. Согласно Технический отчет Qwen3-TTS, система была обучена на данных объемом более пяти миллионов часов на десяти языках. Низкая плотность токенов является ключевым элементом архитектуры: меньшее количество акустических токенов позволяет сократить объем работы по декодированию и сделать потоковую передачу более практичной, при этом модель по-прежнему должна сохранять тембр, произношение и просодию.
Три уровня, три правила доказывания
0,6 млрд / 1,7 млрд
Base, CustomVoice и 1.7B VoiceDesign. Использовать для запросов, основанных на локальных моделях.
Flash / Instruct / VC / VD
Укажите точные данные: модель API, интерфейс, регион и дату.
Qwen-Audio 3.0 TTS
Текущая альтернативная версия, размещённая на хостинге, а не переименованная версия Open Checkpoint.
Пять представленных контрольных точек ориентированы на выполнение конкретных задач, а не представляют собой иерархическую структуру, в которой каждая более крупная модель способна выполнять все задачи:
| Контрольная точка снята | Размер | Наиболее подходящая вакансия | Важная граница |
|---|---|---|---|
| Qwen3-TTS-12 Гц-0,6 Б-Базовый | 0,6 млрд | Небольшие рабочие процессы по клонированию и исследованиям | Каталог CustomVoice отсутствует |
| Qwen3-TTS-12 Гц-1,7 Б-Базовая версия | 1,7 млрд | Работы по клонированию и продолжению исследований с использованием более мощных систем | Требуется больше памяти и вычислительных ресурсов |
| Qwen3-TTS-12 Гц-0,6 Б-CustomVoice | 0,6 млрд | Предустановленные голоса с управлением по инструкциям | Использует выпущенный комплект динамиков |
| Qwen3-TTS-12 Гц-1,7 Б-CustomVoice | 1,7 млрд | Синтез речи с предварительно заданными настройками и повышенной пропускной способностью | Не контрольная точка VoiceDesign |
| Qwen3-TTS-12 Гц-1,7 Б-VoiceDesign | 1,7 млрд | Создание тембра на основе текстового описания | Не выпущена версия 0.6B программы VoiceDesign |
Функция “Base” — это оптимальный выбор, если у вас есть эталонная запись и разрешение на использование этого голоса. Функция «CustomVoice» — более простой вариант, когда для проекта подходит один из готовых пресетов тембров Qwen. Функция «VoiceDesign» предназначена для заданий с описанием персонажа, например «спокойный, зрелый диктор с мягким низким регистром», когда эталонная запись не требуется.
Если подходит готовый голос диктора, нет необходимости в клонировании продукта; а для вымышленного персонажа может не потребоваться запись реального человека, если VoiceDesign создаст подходящий образ. Оценивайте каждую задачу с учетом соответствующего контрольного пункта.
Как проводилось тестирование данного обзора Qwen3-TTS
В обзоре используются четыре уровня доказательств: официальная документация, технический отчет по Qwen, проверка локального оборудования и контролируемое тестирование отдельного хостируемого аудио-обёртчика. Официальные источники подтверждают факты о продукте и результаты тестов, представленные поставщиком. Контролируемое тестирование обёртчика подтверждает лишь его наблюдаемое поведение, но не оценку качества речи Qwen3-TTS.
Перечень доступных рабочих сред задач qwen-audio-3.0-tts-flash, не qwen3-tts-* модель.
Создайте чистую аудиозапись на разговорном английском языке. Прочитайте точно следующее: 'На рассвете исследовательская группа дважды проверила каждый сигнал, прежде чем объявить результат'. Используйте теплый, спокойный голос взрослого диктора, естественный темп речи, четкое произношение согласных и сделайте короткую паузу после слова 'на рассвете'. Не добавляйте музыку, звуковые эффекты, вступление или какие-либо слова, которых нет в приведённом предложении.
В ходе нашего теста этот ввод привёл к созданию MP3-файла продолжительностью 21,263673 секунды, в котором инструкции озвучивались вслух. Результат теста показал, что оболочка обработала весь текст запроса как речевой текст.
На рассвете исследовательская группа дважды проверила каждый сигнал, прежде чем объявить результат.
Мы повторили контрольный тест, используя только целевую фразу. В ходе нашего теста был получен MP3-файл продолжительностью 6,086531 секунды с частотой дискретизации 22 050 Гц, битрейтом 128 кбит/с и монофоническим звуком. Он полностью соответствовал целевой фразе слово в слово и не содержал никаких дополнительных инструкций.
Пользователь прослушал оба файла и подтвердил приведенные ниже оценки. Речь идет о практической проверке, проведенной одним слушателем, а не об исследовании по методу MOS или экспертной оценке.
| Компонент «слушание» | Управление с передачей инструкций | Элемент управления «Обычный текст» |
|---|---|---|
| Естественность | 4/5 | 5/5 |
| Разборчивость | 5/5 | 5/5 |
| Произношение | 5/5 | 5/5 |
| Просодия | 4/5 | 5/5 |
| Точность воспроизведения текста | 1/5 | 5/5 |
| Соблюдение стиля | Без оценки | 5/5 |
| Отсутствие артефактов | 5/5 | 5/5 |
| Практическая применимость в производстве | 1/5 | 5/5 |
Образец с инструкциями звучал чётко и в целом естественно, однако чтение инструкций ухудшило точность передачи текста и удобство использования в практике. Образец в виде простого текста звучал естественно, точно соответствовал исходному предложению и не требовал корректировки содержания. Эти оценки отражают только два qwen-audio-3.0-tts-flash элементы управления-обёртки; они не являются показателем качества голосовой связи на контрольной точке Qwen3-TTS.
Никогда не следует предполагать, что инструкции по стилю и повествовательная часть относятся к одной и той же области. Наше руководство по как сделать речь, сгенерированную ИИ, более естественной улучшает скрипт, но именно поля конечных точек определяют, будет ли команда «Направления» управлять голосом или запускать запись.
В ходе локальной проверки была обнаружена видеокарта NVIDIA GeForce MX450 с 2 ГБ видеопамяти и примерно 16,9 ГБ системной памяти. Такая платформа не подходит для тестирования запланированной матрицы «0,6B против 1,7B». Разгрузка ЦП может оказаться лишь стартовой, а не репрезентативной скоростью. Поэтому качество голоса Qwen3-TTS, локальный RTF, сходство клонирования и межъязыковая согласованность остаются без оценки.
Качество голосовой связи Qwen3-TTS: что подтверждают данные
Официальный отчет демонстрирует высокие результаты модели Qwen3-TTS по таким показателям, как разборчивость речи, сходство с речью говорящего, выполнение инструкций, многоязычное генерация, длинные речевые фрагменты и потоковая передача. Эти данные служат полезными ориентирами для сравнения, однако они остаются эталонными показателями, представленными в отчете по модели Qwen, а не записями, сгенерированными в рамках данного исследования.
Тест голоса для записи должен охватывать следующие аспекты: произношение, посторонние шумы, темп речи, эмоциональность, повторяемость, трудоемкость редактирования, сокращения, даты, валюты, URL-адреса, имена, переключение между языками и длинные предложения.
Совмещайте прослушивание с текстами записей и метаданными; Рабочий процесс транскрипции аудиозаписей ChatGPT обеспечивает воспроизводимость проверки текста.
Модель Qwen3-TTS выглядит многообещающей, но в этом обзоре отсутствуют результаты тестирования из первых рук. Перед отправкой рекомендуется провести несколько циклов тестирования с использованием встроенных динамиков, наушников и динамиков телефона.
На чем сосредоточили внимание независимые обозреватели
В демонстрационном ролике Qwen представлены разнообразные тембры, языки и диалекты. Независимый разработчик Биджан Боуэн уделил особое внимание локализации и клонированию голосов; Джефф Гирлинг охарактеризовал этот релиз как серьезного конкурента платформ TTS с управляемым режимом на рынке открытого исходного кода. Это мнения рецензентов, а не результаты тестирования или доказательство общего мнения на рынке.
Скорость и задержка Qwen3-TTS
Задержка первого пакета
0.288 / 0.313
0,6 млрд / 1,7 млрд при уровне параллелизма 1.
Оптимизированная внутренняя среда vLLM — не является гарантией работоспособности на ноутбуке.
Номинальное значение скорости для модели 0,6B 12 Гц составляет 97 мс — задержка первого пакета. В той же таблице технического отчета для модели 1,7B 12 Гц при параллелизме 1 указано значение 101 мс. Зафиксированные коэффициенты реального времени составили 0,288 и 0,313 соответственно. Проще говоря, коэффициент реального времени (RTF) ниже 1 означает, что синтез выполнялся быстрее, чем длительность сгенерированного аудиосигнала в данной среде.
Эти результаты были получены благодаря оптимизированной внутренней конфигурации vLLM в Qwen. Они не являются универсальными гарантиями времени до начала воспроизведения звука для ноутбука под управлением Windows, «холодного» бессерверного контейнера или региона с общим доступом к API. В отчете также показано, что параллелизм влияет на задержку. Загрузка модели, обработка эталонного аудио, передача по сети, ожидание в очереди, упаковка аудио и воспроизведение на клиенте — все эти этапы могут находиться за пределами основного числа декодеров.
Надлежащий отчет о тестировании должен содержать:
- Аппаратное обеспечение, точность, обновление модели и бэкэнд.
- «Холодное» или «теплое» состояние, параллелизм, время первого звукового сигнала, общее время, пиковое потребление VRAM, продолжительность вывода и RTF.
- Для API: регион, тип подключения, идентификатор запроса, обработка в очереди и повторные попытки.
Модель размером 0,6B следует выбрать в тех случаях, когда объем памяти и параллелизм важнее максимальной вместимости. Модель размером 1,7B является более разумным выбором с точки зрения качества, если у системы есть запас мощности. Однако без использования одинаковых настроек промпта, диктора, выборки и состояния прогрева размер модели сам по себе не может дать представления о реальной разнице в задержке.
Qwen3-TTS: языки и произношение
Открытые контрольные точки Qwen3-TTS поддерживают десять языков: китайский, английский, японский, корейский, немецкий, французский, русский, португальский, испанский и итальянский. Этот список взят из текущего репозитория и материалов выпущенных моделей. Не добавляйте тайский, индонезийский, малайский или вьетнамский языки без предварительного согласования, поскольку их уже поддерживает другой аудиопродукт серии Qwen.
| Язык | Официальная открытая поддержка | Приоритет проверки производства |
|---|---|---|
| Китайский | Да | Звуки, имена, чтение цифр, региональный стиль текста |
| Английский язык | Да | Стресс, аббревиатуры, названия брендов, длинные предложения |
| Японский | Да | Акцент на слоге, частицы, имена, текст, содержащий латинские слова |
| Корейский | Да | Интервалы, заимствованные слова, окончания предложений |
| Немецкий | Да | Сочетания, цифры, группы согласных |
| Французский | Да | Связь, сокращения, заимствованные названия |
| Русский | Да | Стресс, имена, числительные, латинские вставки |
| португальский | Да | Подтвердите выбранный региональный акцент и вариант написания |
| Испанский | Да | Проверить региональный акцент и собственные имена |
| Итальянский | Да | Напряжение, геминация, иностранные имена |
“Поддерживает” означает, что модель способна синтезировать речь на данном языке; это не означает, что каждый голос во всех регионах звучит одинаково естественно, как у носителя языка. Уже только в португальском и испанском языках существуют значительные региональные различия. При коммерческом внедрении необходимо определить целевую локаль, привлечь рецензентов-носителей языка и сформировать набор данных для регрессионного обучения произношения имен, единиц измерения, адресов и юридических фраз.
Для переключения между языками требуется отдельный тест. Такое предложение, как “Откройте API Qwen3-TTS в Сан-Паулу в 9:30 утра”, сочетает в себе английскую структуру, название модели, португальское произношение, пунктуацию и указание времени. Это гораздо ближе к реальному тексту приложения, чем чистое одноязычное демонстрационное предложение. При дубляже видео произношение также должно соответствовать временным параметрам; наш Veo 3.1. Рабочий процесс создания диалогов, звукового сопровождения и синхронизации движения губ рассматривает проблему синхронизации окружающих элементов.
Клонирование голоса, CustomVoice и VoiceDesign
Контрольные точки Base поддерживают быстрое клонирование голоса на основе примерно трёхсекундного эталонного аудиозаписи. Это впечатляющий минимальный порог возможностей, но не гарантия того, что трёхсекундный фрагмент всегда будет оптимальным образцом для производства. В коротких эталонных записях могут отсутствовать диапазон голоса, темп речи, полный набор гласных, эмоциональная окраска и стабильность микрофонного сигнала.
Рекомендации Alibaba Cloud по регистрации голоса на хостинге носят более консервативный характер: они требуют не менее трёх секунд непрерывной чёткой речи, допускают использование более длинных образцов и рекомендуют использовать более чёткую и длинную запись для практического клонирования. Следуйте текущим документация по клонированию голоса в отношении формата, частоты дискретизации, количества каналов, продолжительности и региональных правил, а не рассматривать трёхсекундный пример, приведённый в статье, в качестве спецификации для загрузки.
CustomVoice не копирует голос реального человека. В открытой версии представлено девять премиум-тембров для разных языков и стилей, что делает этот инструмент привлекательным в тех случаях, когда достаточно готовых настроек и управления командами.
VoiceDesign создает тембр на основе описания на естественном языке. Хостируемый Документация по Voice Design показывает отдельный рабочий процесс создания. Он подходит для вымышленных персонажей и синтетических голосов брендов, однако описания всё равно необходимо тестировать на воспринимаемый возраст, акцент и культурные предубеждения.
Матрица рисков, связанных с голосовой идентификацией
Укажите докладчика, сферу применения, срок действия и порядок отзыва.
Зашифруйте ссылки и удалите производные голоса вместе с исходным файлом.
Блокировать неправомерные заявления о личности и добавить возможность подачи жалоб.
Помечайте синтетическую речь в тех случаях, когда слушатели могут принять её за речь человека.
Для клонирования требуются явные права и осознанное согласие. Необходимо хранить оригинал документа о получении согласия, определить допустимые виды использования, предотвратить повторную регистрацию на последующих этапах и обеспечить процедуру удаления. Риски носят не теоретический характер; Анализ вопросов конфиденциальности и согласия при распознавании лица и голоса объясняет, почему меры защиты, связанные с идентификацией, биометрическими данными и предотвращением подражания, должны быть заложены в сам дизайн продукта, а не упоминаться лишь в сноске.
Qwen3-TTS 0,6B против 1,7B: какую версию выбрать?
Выбирайте размер 0,6B, если вашим главным ограничением является развертывание. Этот вариант лучше подходит для графических процессоров меньшей мощности, более высокой степенью параллелизма, быстрого проведения экспериментов и самостоятельного хостинга с учетом затрат. В этом размере доступны как Base, так и CustomVoice, поэтому вы можете оценить клонирование или готовые наборы речи, не начиная с самой большой контрольной точки.
Выбирайте версию 1.7B, если для вас важнее запас по качеству и широта функционала. Это единственный выпущенный вариант с поддержкой VoiceDesign, и он является более целесообразным выбором для команд, готовых пожертвовать объемом памяти и пропускной способностью ради увеличения емкости. Данные технического отчёта по параллелизму 1 показывают небольшую разницу в показателях первого пакета и RTF в оптимизированной конфигурации Qwen, однако на вашем оборудовании этот разрыв может увеличиться или уменьшиться.
| Решающий фактор | Начните с 0,6B | Начните с 1,7 млрд |
|---|---|---|
| Памяти графического процессора не хватает | Более плотное прилегание | Повышенный риск разгрузки или низкой параллельности |
| Нужен VoiceDesign | Отсутствует в выпущенном наборе | Требуется |
| Требуется клонирование базы данных | Доступно | Доступны модели с большей вместимостью |
| Нужен CustomVoice | Доступно | Доступны модели с большей вместимостью |
| Нужно быстро провести предварительную оценку осуществимости | Лучшая отправная точка | Использование после завершения работ на трубопроводе |
| Необходимо принять окончательное решение о выборе варианта производства | Проведите сравнительный анализ обоих | Проведите сравнительный анализ обоих |
Количество параметров не является единственным критерием требований к объёму видеопамяти (VRAM). Важную роль играют точность, реализация механизма внимания, кэш, длина ссылки, размер пакета и накладные расходы фреймворка. Модель, которая с трудом загружается, не может служить надёжным производственным сервисом.
Что касается модели MX450 объемом 2 ГБ, протестированной в ходе данного обзора, ни один из вариантов объема памяти не позволяет провести репрезентативное тестирование производительности графического процессора. Следующим практическим шагом станет использование более новой версии стека CUDA и подходящего графического процессора или официального удаленного сервера. Фраза “работала с разгрузкой ЦП” следует рассматривать как примечание о совместимости, а не как значимое заключение о скорости.
API Qwen3-TTS: HTTP, потоковая передача и идентификаторы моделей
Выберите вид транспорта в зависимости от потребностей воспроизведения
Самый простой способ для пакетного озвучивания и создания готовых файлов.
Поэтапная доставка; тем не менее, необходимо проверить, когда аудиофайл станет доступен для воспроизведения.
Идеально подходит для разговоров и постепенного воспроизведения.
Alibaba Cloud предоставляет модели генерации HTTP в нереальном времени и модели WebSocket в реальном времени. Используйте синтез в нереальном времени, если вы можете дождаться полного результата и хотите, чтобы поток запросов был максимально простым. Используйте потоковую передачу по WebSocket, если важна задержка при взаимодействии или прогрессивное воспроизведение. Потоковая передача по HTTP или события, отправляемые сервером, могут возвращать инкрементные данные, но их не следует путать с семейством специализированных моделей реального времени с низкой задержкой.
В настоящее время доступны следующие семейства: Qwen3-TTS Flash для встроенных голосов, Instruct Flash для управления исполнением с использованием естественного языка, VC для клонированных голосов и VD для специально разработанных голосов. Идентификаторы моделей и датированные снимки состояния различаются для маршрутов, работающих не в режиме реального времени, и для маршрутов, работающих в режиме реального времени, поэтому копируйте их из актуальной документации, а не составляйте названия по аналогии.
Текущий Документация по API Qwen-TTS ограничивает ввод до 512 токенов на запрос. Это ограничение применимо к данной серии моделей; отдельное правило, предусматривающее 600 символов, задокументированное для других моделей TTS, не следует копировать в интеграцию Qwen3-TTS. URL-адреса с полными аудиофайлами остаются действительными в течение 24 часов, поэтому в производственных системах необходимо перемещать необходимые файлы в надежное хранилище, а не использовать URL-адрес ответа в качестве постоянного носителя.
import os
import dashscope
dashscope.base_http_api_url = "https://dashscope-intl.aliyuncs.com/api/v1"
response = dashscope.MultiModalConversation.call(
model="qwen3-tts-flash",
api_key=os.environ["DASHSCOPE_API_KEY"],
text="Ваш заказ готов к получению в 16:30",
voice="Cherry",
language_type="English",
)
print(response)
Ключ API и регион конечной точки должны совпадать. В развертываниях в Пекине и Сингапуре используются разные учетные данные и базовые URL-адреса, а доступность моделей может варьироваться в зависимости от региона. Ни в коем случае не встраивайте ключ в WordPress, клиентский JavaScript или мобильный бинарный файл. Отправляйте запросы на синтез через сервер, который находится под вашим контролем, регистрируйте идентификаторы запросов, не фиксируя конфиденциальные входные данные, и установите политику жизненного цикла для сгенерированного аудио.
В случае длинных документов следует разбивать их на фрагменты по семантическим границам, сохранять контекст, приводить числа к общепринятому формату и прослушивать все места соединений. Даже при этом допустимые фрагменты могут звучать как отдельные дубли, если между разговорами меняется темп или интенсивность.
Цены на модель Qwen3-TTS на международном рынке
Обзор цен в различных регионах мира
Вспышка
$0.10
на каждые 10 000 вводимых символовИнструкция / VC / VD
$0.115
на каждые 10 000 вводимых символовFlash / VC
$0.13
на каждые 10 000 вводимых символовДать указание
$0.143
на каждые 10 000 вводимых символовВД
$0.143353
на каждые 10 000 вводимых символовСоздание голоса: $0.01 за каждого зарегистрированного пользователя · $0.20 за каждый предусмотренный голос.
Alibaba Cloud’s Страница с ценами на услуги Model Studio По состоянию на 11 августа 2026 года были указаны следующие цены для международных регионов. В этих строках ввод данных оплачивается, а вывод — бесплатный. Цены, бесплатные квоты, псевдонимы и доступность в регионах могут изменяться, поэтому перед запуском крупной партии данных необходимо подтвердить выбранный вариант развертывания.
| Маршрут | Семейство моделей | Цена за 10 000 вводимых символов |
|---|---|---|
| Не в режиме реального времени | Qwen3-TTS Flash | $0.10 |
| Не в режиме реального времени | Instruct, VC или VD | $0.115 |
| В режиме реального времени | Flash или текущий VC | $0.13 |
| В режиме реального времени | Дать указание | $0.143 |
| В режиме реального времени | ВД | $0.143353 |
Создание голоса оплачивается отдельно от синтеза. В том же международном прейскуранте стоимость регистрации голоса по тарифу Qwen указана как $0,01 за каждый клон, а стоимость разработки голоса — как $0,20 за каждый разработанный голос. При использовании клонированного или разработанного голоса может взиматься соответствующая плата за синтез, рассчитываемая за каждый символ.
Расходы на озвучку, синтез персонажей, инфраструктуру и повторную запись следует учитывать отдельно. Время на монтаж и количество повторных записей зачастую определяют реальную стоимость производства.
Стоимость API не совпадает с локальными затратами. Использование открытых контрольных точек позволяет отказаться от расчетов с поставщиками по количеству символов, но при этом добавляются затраты на время работы графических процессоров, инженерные работы по развертыванию, мониторинг, хранение данных, масштабирование и реагирование на инциденты. Самостоятельное размещение становится выгодным в тех случаях, когда контроль, объемы, локальность данных или необходимость настройки оправдывают такую операционную нагрузку.
Альтернативы и аудиомаршрут GlobalGPT
Qwen3-TTS не всегда является оптимальным выбором для всех задач, связанных с обработкой аудио. ElevenLabs — это более зрелая управляемая голосовая платформа для команд, которым важны удобная панель управления, широкий набор инструментов для производства и минимальные инфраструктурные затраты. Модели распознавания речи OpenAI могут подойти разработчикам, которые уже стандартизировали свою работу на одной экосистеме API. Qwen-Audio 3.0 TTS — это новейший хостируемый вариант Qwen, который стоит рассмотреть при следовании текущим рекомендациям Alibaba Cloud.
Музыка и звуковые эффекты — это отдельная тема для сравнения. Сравнение звучания ElevenLabs, Lyria 3 Pro и Mureka помогает провести разграничение между инструментами для воспроизведения речи и средствами полноценного создания музыки. Модель преобразования текста в речь не должна терять баллы за то, что не способна воспроизвести готовую песню, а музыкальная модель не должна использоваться в качестве API для озвучивания с низкой задержкой.
В настоящее время у GlobalGPT есть подтвержденный маршрут генератора звука в котором перечислены qwen-audio-3.0-tts-flash и Seed Audio 1.0. На проверенной странице не было указано Qwen3-TTS. Это означает, что GlobalGPT фактически представляет собой отдельную рабочую среду для работы со звуком, а не свидетельствует о том, что открытые контрольные точки Qwen3-TTS доступны именно там.
Если конечным продуктом является видео, определитесь, нужен ли вам отдельный диктор, синтезированные диалоги, звуковые эффекты или модель, которая генерирует звук в синхронизации с изображением. Наш ответ на есть ли звук в Veo 3.1 определяет это более широкое решение. Зачастую наиболее эффективный подход заключается в использовании небольшого набора специализированных инструментов, а не в попытке заставить одну модель решать все задачи, связанные с обработкой аудио.
Лицензия, согласие, конфиденциальность и коммерческое использование
Репозиторий Qwen3-TTS и выпущенные карточки моделей распространяются по лицензии Apache-2.0. Эта лицензия не ограничивает коммерческую разработку, модификацию и распространение, однако не предоставляет прав на чужой голос, исполнение, сценарий, товарный знак или персональные данные. Лицензия на модель и права на контент представляют собой отдельные уровни.
Локальное выведение выводов предоставляет вам больше возможностей для управления и возлагает на вас большую ответственность за обеспечение безопасности. Шифруйте записи справочных данных, ограничивайте доступ, сокращайте сроки хранения, документируйте производные данные и распространяйте действия по удалению на зарегистрированные голоса и кэшированные результаты.
В случае использования услуг по синтезу голоса на стороне провайдера перед отправкой конфиденциальных сценариев или голосовых образцов ознакомьтесь с условиями предоставления услуг, порядком обработки данных в конкретном регионе, сроками хранения данных и механизмами корпоративного контроля.
Каждый клонированный голос, предназначенный для публичного использования, должен иметь владельца, запись о полученном согласии, политику допустимого использования и процедуру реагирования на злоупотребления. Необходимо добавлять соответствующее предупреждение в тех случаях, когда синтетический голос может быть обоснованно принят за голос реального человека. Следует блокировать подражание частным лицам и общественным деятелям, относящимся к группе повышенного риска, а также предоставить возможность сообщать о вредоносных аудиозаписях.
Кому рекомендуется использовать Qwen3-TTS?
Какой маршрут подходит?
Поддержка Pipeline, более плотная память, Base или CustomVoice.
VoiceDesign или сравнение качества и производительности с учетом резервных возможностей графического процессора.
Более высокая скорость обработки данных при условии соответствия требований к региону, конфиденциальности и ценообразованию.
Студия, не требующая настройки, лицензионная торговая площадка или поддержка существующих поставщиков.
Qwen3-TTS подходит для исследователей, разработчиков, игровых команд и групп локализации, которым требуются открытые весовые коэффициенты, возможность выбора способа развертывания, клонирование или голоса персонажей, описываемые текстом.
Начните с версии 0.6B, если вы тестируете конвейер, работаете с ограниченным объемом памяти или проверяете, соответствуют ли Base и CustomVoice требованиям продукта. Начните с версии 1.7B, если вам нужен VoiceDesign или у вас достаточно аппаратных ресурсов для надлежащего сравнения качества и пропускной способности. Используйте хостируемый API, если инфраструктура является узким местом, а региональная доступность, учетные данные и обработка данных соответствуют требованиям проекта.
Выберите другой вариант, если вам нужна студия монтажа, не требующая настройки, обширная платформа с лицензионными голосами или готовая корпоративная поддержка от другого поставщика. Ни в коем случае не создавайте клоны без документально зафиксированного согласия.
Используйте пять реальных скриптов, три повторения, список с сложными именами, длинный абзац и один тест на восстановление. Измерьте задержку и затраты, а затем спросите у носителей языка, готов ли результат к использованию без исправлений. Редактирование может свести на нет преимущество, полученное в тесте.
Часто задаваемые вопросы по Qwen3-TTS
Qwen3-TTS — это бесплатная программа?
Выпущенные контрольные точки Qwen3-TTS распространяются по лицензии Apache-2.0, поэтому вы можете скачивать и запускать их без необходимости оплаты модели за каждый символ. Самостоятельное размещение по-прежнему требует затрат на вычислительные ресурсы, хранение данных, техническое обслуживание и мониторинг. Размещенные на Alibaba Cloud API-интерфейсы Qwen3-TTS являются платными услугами с ценами и квотами, зависящими от региона.
Можно ли использовать Qwen3-TTS в коммерческих целях?
Лицензия Apache-2.0 разрешает коммерческое использование опубликованного кода и весовых коэффициентов моделей, однако не предоставляет прав на клонирование голоса конкретного человека или использование защищенных скриптов и торговых марок. Для реализации коммерческих проектов по-прежнему требуется согласие диктора, права на контент, меры по обеспечению конфиденциальности, а также соблюдение местного законодательства и условий использования платформы.
Какие языки поддерживает Qwen3-TTS?
В открытой версии Qwen3-TTS поддерживаются китайский, английский, японский, корейский, немецкий, французский, русский, португальский, испанский и итальянский языки. Перечень языков, поддерживаемых хостируемыми моделями, может различаться в зависимости от конечного устройства и голосового интерфейса, поэтому перед созданием многоязычного продукта необходимо уточнить точный идентификатор модели Alibaba Cloud и регион.
Действительно ли Qwen3-TTS способен обеспечить задержку в 97 мс?
В отчете Qwen указана задержка первого пакета, равная 97 мс, для модели 0.6B 12 Гц при уровне параллелизма 1 в оптимизированной внутренней среде vLLM. Это достоверный тестовый показатель поставщика, а не универсальное обещание производителя устройства. Холодный запуск, аппаратное обеспечение, точность измерений, прохождение по сети, очереди и буферизация на стороне клиента могут увеличить наблюдаемую задержку.
Сколько видеопамяти требуется для Qwen3-TTS?
Не существует единого достоверного значения объёма VRAM, подходящего для всех конфигураций. Важную роль играют размер модели, степень точности, механизм обработки внимания, размер пакетной обработки, кэш, длина референции и накладные расходы фреймворка. Исследуемая видеокарта MX450 с 2 ГБ памяти не подходила для проведения репрезентативных тестов; необходимо протестировать выбранную контрольную точку с уровнем параллелизма, близким к производственному, и оставить запас производительности.
Какой объем аудиозаписей требуется для клонирования голоса с помощью технологии Qwen3-TTS?
В примерах материалов показано, что быстрое клонирование возможно уже при длительности образца около трёх секунд, тогда как в инструкциях по регистрации на хостинговой платформе рекомендуется использовать чёткую непрерывную речь и допускаются более длинные образцы. Рассматривайте три секунды как минимальный порог возможностей, а не как автоматический ориентир качества. Используйте аудиозаписи, на которые получено согласие, без шумов, охватывающие нормальный диапазон голоса говорящего и предполагаемый язык.
Каково ограничение на объем входных данных для API Qwen3-TTS?
В текущей документации по API Qwen-TTS указано, что максимальный размер входных данных для моделей Qwen-TTS составляет 512 токенов. URL-адреса с полным аудиофайлом действительны в течение 24 часов. Разбивайте длинные сценарии по семантическим границам и копируйте необходимые результаты в надежное хранилище, а не рассматривайте возвращаемый URL-адрес как постоянный хостинг.
Можно ли использовать Qwen3-TTS на GlobalGPT?
В списке указан генератор звуковых сигналов GlobalGPT с сетчатым рисунком qwen-audio-3.0-tts-flash и Seed Audio 1.0, а не Qwen3-TTS. Вы можете использовать этот путь в качестве отдельного рабочего процесса обработки аудио, но его не следует описывать как доступ к открытым контрольным точкам 0.6B или 1.7B Qwen3-TTS.
Окончательный вердикт
В этом обзоре Qwen3-TTS отмечается необычная широта возможностей: открытые контрольные точки 0.6B и 1.7B, десять языков, предустановленные голоса, быстрое клонирование, VoiceDesign, потоковая архитектура, либеральная лицензия и хостируемые API.
Не менее важно отметить и объективные ограничения. В доступной среде выполнения задачи не удалось сгенерировать реальный аудиосигнал формата Qwen3-TTS, а исследуемый графический процессор объемом 2 ГБ не смог обеспечить репрезентативное локальное сравнение. По этой причине в данной статье не присваивается оценка качества голоса и не делается заявление о универсальной производительности на уровне 97 мс.
Если для вас важны открытые веса и возможность управления, сначала протестируйте контрольную точку 0,6B, а затем сравните её результаты с 1,7B на тех же скриптах и том же оборудовании. Если для вас важна скорость внедрения в производственную среду, протестируйте именно тот тарифный план Alibaba Cloud, который планируете приобрести, и сравните его с отдельно позиционируемым семейством TTS-решений Qwen-Audio 3.0. Укажите название модели, конечную точку, регион, запись о согласии, задержку и общую стоимость редактирования в одной таблице для принятия решения.
Стоит попробовать Qwen3-TTS. Не стоит делать вид, что одна только документация способна «услышать» ваши потребности. Успешный путь — это тот, который учитывает ваши названия, ваш язык, ваше оборудование, ваши требования к конфиденциальности и ваши сроки внедрения.



