Revisione basata sulle evidenze · Agosto 2026
Pesi aperti, API ospitate e il divario nella denominazione: tutto chiaramente illustrato.
Limite probatorio: Non viene dichiarato alcun punteggio di ascolto di prima mano per il modello Qwen3-TTS.
Una recensione utile di Qwen3-TTS deve rispondere a una domanda fondamentale prima di valutare le voci: di quale versione di Qwen3-TTS stiamo parlando? Nel 2026, questo nome comprende i checkpoint scaricabili da 0,6B e 1,7B, le API Qwen3-TTS ospitate su Alibaba Cloud e un mercato in cui viene raccomandata anche la famiglia separata Qwen-Audio 3.0 TTS. Considerare questi prodotti come un unico insieme porta a dichiarazioni fuorvianti in merito a velocità, lingue e prezzi.
In breve, Qwen3-TTS è uno degli stack vocali open source più flessibili del 2026. Offre dieci lingue, checkpoint specifici per ogni attività, clonazione vocale in circa tre secondi, progettazione vocale in linguaggio naturale, supporto allo streaming e una licenza Apache-2.0. Tuttavia, questa recensione non fornisce una valutazione dell’ascolto: l’ambiente di test disponibile non esponeva un endpoint Qwen3-TTS reale e la GPU locale da 2 GB non era adatta per un benchmark rappresentativo tra 0,6 miliardi e 1,7 miliardi.
Stato del Qwen3-TTS nel 2026
Il 22 gennaio 2026, Qwen ha pubblicato i coefficienti di ponderazione Qwen3-TTS. Il repository ufficiale Qwen3-TTS elenca cinque checkpoint 12Hz già rilasciati: 1,7B VoiceDesign, 1,7B CustomVoice, 1,7B Base, 0,6B CustomVoice e 0,6B Base. La corrispondenza Collezione Hugging Face include anche il tokenizer. Questi sono i modelli che gli sviluppatori possono esaminare, scaricare ed eseguire in base alla licenza pubblicata.
Alibaba Cloud offre separatamente le famiglie di servizi in hosting Qwen3-TTS Flash, Instruct, clonazione vocale e progettazione vocale tramite interfacce in tempo reale e non in tempo reale. La sua attuale catalogo dei modelli di sintesi vocale dovrebbe essere considerato come la fonte autorevole per gli alias ospitati, le regioni, le lingue e le interfacce, poiché tali dettagli possono variare senza che cambino i nomi dei checkpoint aperti.
C'è un'altra sottigliezza nella denominazione. Le linee guida di Alibaba Cloud del 2026 per la selezione dei modelli indirizzano inoltre gli utenti verso il modello Qwen-Audio 3.0 TTS per diversi lavori in hosting. Il modello Qwen-Audio 3.0 TTS non è una versione rinominata dei checkpoint 0.6B o 1.7B della famiglia Qwen3-TTS. Se avete già familiarità con la famiglia più ampia Qwen, la nostra Qwen 3.8: specifiche tecniche e recensione dell'accessibilità illustra perché la denominazione esatta dei modelli sia importante per tutti i prodotti della linea Qwen.
Utilizzare il nome del checkpoint aperto per l'inferenza locale, l'ID esatto del modello Alibaba Cloud per il funzionamento tramite API e Qwen-Audio 3.0 TTS solo come alternativa a sé stante. In questo modo, ogni dichiarazione relativa a qualità, latenza e prezzo rimane associata al prodotto da cui proviene.
Giudizio sintetico: potente, aperto e sensibile alle prove
Giudizio a prima vista
Distribuzione aperta, ricerca, clonazione e voci dei personaggi.
Cinque punti di controllo specifici per ogni attività, disponibili in due misure.
La velocità del fornitore dipende dal contesto; la qualità non viene valutata in questa sede.
I percorsi "Hosted Qwen3-TTS" e "Qwen-Audio 3.0" sono percorsi distinti.
Qwen3-TTS è la soluzione più interessante per i team che desiderano avere il controllo e la libertà di scelta nell’implementazione. I checkpoint Base supportano la clonazione, CustomVoice offre altoparlanti preimpostati con nome e controllo delle istruzioni, mentre VoiceDesign è in grado di creare una voce a partire da una descrizione scritta. Il supporto per dieci lingue rende lo stack molto più utile rispetto a una demo aperta disponibile solo in inglese, mentre le versioni 0.6B offrono agli sviluppatori un punto di partenza più snello.
L'aspetto principale da tenere presente è la qualità dei dati. Qwen riporta risultati di benchmark eccellenti e una bassa latenza del primo pacchetto in un ambiente interno ottimizzato. Tali dati non tengono conto degli avviamenti a freddo dei laptop, del margine disponibile nella VRAM dei container né della pronuncia dei nomi dei vostri prodotti. Le promesse relative ai 97 ms universali tralasciano di specificare le condizioni dei benchmark.
Per un prototipo self-hosted, Qwen3-TTS è tra le prime scelte. Per un’API di produzione, confronta la soluzione Qwen3-TTS in hosting con le più recenti raccomandazioni relative a Qwen-Audio, il supporto operativo, la disponibilità a livello regionale e il costo di gestione delle voci clonate. Se il vostro obiettivo va oltre la sintesi vocale e si estende agli effetti sonori o alla musica, la più ampia Test di Seed Audio 1.0: voci, effetti sonori e musica coprire un flusso di lavoro audio diverso e più multimodale.
In sintesi: Qwen3-TTS offre prestazioni eccellenti in termini di architettura, apertura e copertura delle funzionalità. Il suo effettivo livello di produzione dipende comunque dal checkpoint o dall’endpoint specifico, dall’hardware in uso, dal linguaggio utilizzato e da una voce di riferimento concordata e testata con i propri script.
Che cos’è Qwen3-TTS?
Qwen3-TTS è una famiglia di modelli di generazione del parlato basata su un tokenizzatore discreto del parlato che opera a 12,5 fotogrammi al secondo. Secondo il Relazione tecnica Qwen3-TTS, il sistema è stato addestrato su oltre cinque milioni di ore in dieci lingue. Il basso numero di token è un elemento fondamentale della progettazione: un numero ridotto di token acustici può ridurre il carico di decodifica e rendere lo streaming più pratico, pur garantendo che il modello conservi il timbro, la pronuncia e la prosodia.
Tre livelli, tre regole in materia di prove
0,6 miliardi / 1,7 miliardi
Base, CustomVoice e 1.7B VoiceDesign. Da utilizzare per le richieste relative ai modelli locali.
Flash / Istruzioni / VC / VD
Utilizzare il modello API, l'interfaccia, la regione e la data esatti.
Qwen-Audio 3.0 TTS
Un'alternativa attualmente ospitata, non un "open checkpoint" rinominato.
I cinque checkpoint pubblicati sono specifici per determinate attività, piuttosto che una scala gerarchica in cui ogni modello più grande è in grado di svolgere tutte le funzioni:
| Punto di controllo rilasciato | Dimensioni | Il lavoro più adatto | Confine importante |
|---|---|---|---|
| Qwen3-TTS-12Hz-0,6B-Base | 0,6 miliardi | Flussi di lavoro di clonazione e ricerca su scala ridotta | Catalogo CustomVoice senza impostazioni predefinite |
| Qwen3-TTS-12Hz-1,7B-Base | 1,7 miliardi | Attività di clonazione e prosecuzione con capacità maggiore | Occorre più memoria e potenza di calcolo |
| Qwen3-TTS-12Hz-0,6B-CustomVoice | 0,6 miliardi | Voci preimpostate con controllo delle istruzioni | Utilizza il set di altoparlanti già in commercio |
| Qwen3-TTS-12Hz-1,7B-CustomVoice | 1,7 miliardi | Sintesi vocale con preset e maggiore capacità | Non è il checkpoint VoiceDesign |
| Qwen3-TTS-12Hz-1,7B-VoiceDesign | 1,7 miliardi | Creazione di un timbro a partire da una descrizione testuale | Non è stato rilasciato il peer VoiceDesign 0.6B |
Base è la scelta ideale quando si dispone di un altoparlante di riferimento e del permesso di utilizzare quella voce. CustomVoice rappresenta la soluzione più semplice quando uno dei timbri preimpostati rilasciati da Qwen si adatta al progetto. VoiceDesign è indicato per richieste relative al carattere della voce, come ad esempio “un narratore calmo e maturo con un registro grave morbido”, in cui non è richiesta alcuna registrazione di riferimento.
Non è necessario ricorrere alla clonazione in un tutorial sul prodotto se la voce fuori campo predefinita è adeguata, e un personaggio di fantasia potrebbe non aver bisogno della registrazione di una persona reale se VoiceDesign crea un'identità adeguata. Valuta ogni attività in base al punto di controllo corrispondente.
Come è stata effettuata la prova di questa recensione del Qwen3-TTS
La recensione si basa su quattro livelli di prove: documentazione ufficiale, il rapporto tecnico Qwen, l'ispezione dell'hardware locale e un test controllato di un wrapper audio ospitato separatamente. Le fonti ufficiali confermano le caratteristiche del prodotto e i benchmark riportati dal fornitore. Il test sul wrapper conferma solo il comportamento osservato, non un punteggio relativo alla qualità vocale Qwen3-TTS.
L'elenco degli ambienti di lavoro disponibili qwen-audio-3.0-tts-flash, non un qwen3-tts-* modello.
Crea una registrazione vocale in inglese parlato, chiara e pulita. Leggi esattamente: 'All’alba, il team di ricerca ha verificato due volte ogni segnale prima di annunciare il risultato'. Utilizza una voce narrante adulta, calda e calma, con un ritmo naturale, consonanti chiare e una breve pausa dopo 'all’alba'. Non aggiungere musica, effetti sonori, un'introduzione o parole che non siano presenti nella frase citata.
Nel nostro test, questo input ha generato un file MP3 della durata di 21,263673 secondi e ha letto ad alta voce le indicazioni. Il risultato del test ha dimostrato che il wrapper ha interpretato l'intero prompt come testo vocale.
All’alba, il gruppo di ricerca ha verificato due volte ogni segnale prima di annunciare il risultato.
Abbiamo ripetuto il test utilizzando esclusivamente la frase di riferimento. Nel nostro test, il risultato è stato un file MP3 della durata di 6,086531 secondi, a 22.050 Hz, 128 kbps e in mono. Il file corrispondeva parola per parola alla frase di riferimento e non conteneva alcuna istruzione aggiuntiva.
L'utente ha ascoltato entrambi i file e ha confermato le valutazioni riportate di seguito. Si tratta di una verifica pratica effettuata da un singolo ascoltatore, non di uno studio MOS né di un panel di ascolto.
| Dimensione dell'ascolto | Controllo con istruzioni | Controllo del testo in chiaro |
|---|---|---|
| Naturalezza | 4/5 | 5/5 |
| Intelligibilità | 5/5 | 5/5 |
| Pronuncia | 5/5 | 5/5 |
| Prosodia | 4/5 | 5/5 |
| Fedeltà del testo | 1/5 | 5/5 |
| Rispetto dello stile | Non valutato | 5/5 |
| Assenza di artefatti | 5/5 | 5/5 |
| Usabilità della produzione | 1/5 | 5/5 |
Il campione contenente le istruzioni risultava chiaro e per lo più naturale, ma la lettura delle indicazioni ha compromesso la fedeltà del testo e l'usabilità del prodotto. Il campione in testo semplice risultava naturale, seguiva alla lettera la frase e non richiedeva alcuna correzione dei contenuti. Questi punteggi descrivono solo i due qwen-audio-3.0-tts-flash controlli wrapper; non si tratta di una valutazione della qualità vocale dei checkpoint Qwen3-TTS.
Non dare mai per scontato che le indicazioni stilistiche e la narrazione facciano parte dello stesso ambito. La nostra guida a rendere più naturale il tono dei discorsi scritti dall'intelligenza artificiale migliora lo script, ma sono i campi degli endpoint a determinare se le indicazioni controllano la voce o avviano la registrazione.
Da un'analisi locale è emersa la presenza di una scheda NVIDIA GeForce MX450 con 2 GB di VRAM e circa 16,9 GB di memoria di sistema. Non si tratta di una piattaforma adeguata per la matrice prevista di 0,6B contro 1,7B. L'offload della CPU potrebbe rappresentare una velocità iniziale, non rappresentativa. La qualità vocale Qwen3-TTS, l'RTF locale, la somiglianza nella clonazione e la coerenza tra le lingue rimangono quindi senza punteggio.
Qualità vocale del Qwen3-TTS: cosa dimostrano i dati
Il rapporto ufficiale mostra ottimi risultati del modello Qwen3-TTS in termini di intelligibilità, somiglianza con il parlante, capacità di seguire le istruzioni, generazione multilingue, discorsi di lunga durata e streaming. Si tratta di utili parametri di riferimento comparativi, ma rimangono comunque benchmark riportati da Qwen, piuttosto che registrazioni generate in questa sede.
Un test vocale di produzione dovrebbe verificare la pronuncia, i disturbi, il ritmo, l’espressività, la ripetibilità, l’onere di editing, le abbreviazioni, le date, le valute, gli URL, i nomi, il cambio di codice linguistico e le frasi lunghe.
Abbina l'ascolto alle trascrizioni e ai metadati; il Flusso di lavoro per la trascrizione audio ChatGPT rende il controllo del testo ripetibile.
Il modello Qwen3-TTS sembra promettente, ma questa recensione non riporta alcun punteggio ottenuto direttamente tramite i checkpoint. Prima dell'invio, si consiglia di effettuare ripetute generazioni di test, utilizzando ascoltatori nativi, cuffie e altoparlanti del telefono.
Gli aspetti su cui si sono concentrati i recensori esterni
La demo social di Qwen mette in evidenza una varietà di timbri, lingue e dialetti. Il creatore indipendente Bijan Bowen si è concentrato sull’esecuzione locale e sulla clonazione vocale; Jeff Geerling ha definito il lancio come una forte concorrenza open-source per le piattaforme TTS gestite. Si tratta di punti di vista dei recensori, non di risultati di benchmark né di una prova di consenso a livello di mercato.
Velocità e latenza di Qwen3-TTS
Latenza del primo pacchetto
0.288 / 0.313
0,6B / 1,7B con concorrenza pari a 1.
Ambiente vLLM interno ottimizzato — non è una garanzia per i portatili.
Il valore di riferimento relativo alla velocità è una latenza del primo pacchetto di 97 ms per il modello da 0,6B a 12 Hz. La stessa tabella del rapporto tecnico riporta 101 ms per il modello da 1,7B a 12 Hz con concorrenza pari a 1. I fattori in tempo reale (RTF) riportati erano rispettivamente 0,288 e 0,313. In parole povere, un RTF inferiore a 1 significa che la sintesi è stata eseguita più rapidamente rispetto alla durata dell’audio generato in quell’ambiente.
Tali risultati derivano dalla configurazione interna ottimizzata del vLLM di Qwen. Non si tratta di stime generiche del “time-to-first-audio” per un laptop Windows, un container serverless a freddo o una regione API condivisa. Il rapporto mostra inoltre che la concorrenza influisce sulla latenza. Il caricamento del modello, l’elaborazione dell’audio di riferimento, il transito in rete, l’accodamento, il packaging dell’audio e la riproduzione sul client possono tutti trovarsi al di fuori del numero di decodificatori principali.
Un registro di riferimento attendibile dovrebbe includere:
- Hardware, precisione, revisione del modello e attenzione al backend.
- Stato a freddo o a caldo, concorrenza, tempo di primo audio, tempo totale, picco di VRAM, durata dell'uscita e RTF.
- Per un'API: regione, tipo di connessione, ID della richiesta, accodamento e tentativi di ripetizione.
Il modello da 0,6B dovrebbe rappresentare la scelta più sicura quando la memoria e la concorrenza sono più importanti della capacità massima. Il modello da 1,7B è la scelta più sensata in termini di qualità quando la macchina dispone di margine di potenza. Tuttavia, senza utilizzare lo stesso prompt, lo stesso speaker, le stesse impostazioni di campionamento e lo stesso stato di riscaldamento, la dimensione del modello da sola non è sufficiente per determinare la reale differenza di latenza.
Qwen3-TTS: lingue e pronuncia
I checkpoint aperti Qwen3-TTS supportano dieci lingue: cinese, inglese, giapponese, coreano, tedesco, francese, russo, portoghese, spagnolo e italiano. Questo elenco proviene dal repository attuale e dai materiali dei modelli già rilasciati. Non aggiungere silenziosamente il tailandese, l’indonesiano, il malese o il vietnamita solo perché un altro prodotto audio Qwen li supporta.
| Lingua | Supporto ufficiale aperto | Priorità nella revisione della produzione |
|---|---|---|
| Cinese | Sì | Suoni, nomi, lettura dei numeri, stile testuale regionale |
| Inglese | Sì | Stress, abbreviazioni, nomi di marchi, frasi lunghe |
| giapponese | Sì | Accento tonico, particelle, nomi, testo misto in latino |
| coreano | Sì | Spaziatura, prestiti linguistici, terminazioni delle frasi |
| Tedesco | Sì | Composizioni, numeri, gruppi di consonanti |
| Francese | Sì | Collegamenti, abbreviazioni, nomi di origine straniera |
| Russo | Sì | Stress, nomi, numeri, inserti in latino |
| Portoghese | Sì | Confermare l'accento regionale e l'ortografia previsti |
| Spagnolo | Sì | Verificare l'accento regionale e i nomi propri |
| italiano | Sì | Stress, geminazione, nomi stranieri |
“Per ”supporta” si intende che il modello è in grado di sintetizzare la lingua; ciò non significa che ogni voce abbia lo stesso grado di naturalezza in ogni regione. Già solo il portoghese e lo spagnolo presentano importanti differenze regionali. Un’implementazione commerciale dovrebbe definire l’impostazione locale di destinazione, reclutare revisori madrelingua e creare un set di regressione della pronuncia per nomi, misure, indirizzi ed espressioni giuridiche.
Il cambio di codice richiede un test specifico. Una frase come “Apri l’API Qwen3-TTS a San Paolo alle 9:30 del mattino” combina una struttura inglese, il nome di un modello, la pronuncia portoghese, la punteggiatura e un’ora. Questo è molto più vicino al testo reale di un’app rispetto a una frase dimostrativa monolingue “pulita”. Per il doppiaggio video, la pronuncia deve inoltre adattarsi alla tempistica; il nostro Veo 3.1 Flusso di lavoro relativo a dialoghi, audio e sincronizzazione labiale tratta il problema della sincronizzazione circostante.
Clonazione della voce, CustomVoice e VoiceDesign
I checkpoint Base consentono la clonazione vocale rapida a partire da circa tre secondi di audio di riferimento. Si tratta di una soglia minima davvero notevole, ma non di una garanzia che tre secondi rappresentino sempre il campione ottimale per la produzione. I riferimenti brevi possono non cogliere appieno l’estensione vocale, il ritmo, la copertura vocalica, l’emozione e l’uniformità del microfono.
Le linee guida per la registrazione fornite da Alibaba Cloud sono più prudenti: richiedono almeno tre secondi di discorso chiaro e ininterrotto, consentono campioni più lunghi e raccomandano una registrazione più chiara e più lunga per una clonazione efficace. Seguire le attuali documentazione sulla clonazione della voce per quanto riguarda le regole relative al formato, alla frequenza di campionamento, ai canali, alla durata e alla regione, anziché considerare la dimostrazione di tre secondi riportata nell’articolo come una specifica per il caricamento.
CustomVoice evita di riprodurre fedelmente una persona reale. La versione open source include nove timbri premium per diverse lingue o stili, rendendola una soluzione interessante quando sono sufficienti un’identità predefinita e il controllo delle istruzioni.
VoiceDesign crea un timbro a partire da una descrizione in linguaggio naturale. Il servizio ospitato Documentazione su Voice Design illustra il flusso di lavoro di creazione autonomo. È adatto a personaggi di fantasia e voci di marca sintetiche, ma le descrizioni devono comunque essere sottoposte a test per verificare l’età percepita, l’accento e i pregiudizi culturali.
Matrice dei rischi relativi all'identità vocale
Annotare chi ha parlato, l’ambito, il termine e il percorso di ritiro.
Crittografare i riferimenti ed eliminare le voci derivate insieme alla fonte.
Blocca le affermazioni dannose relative all’identità e aggiungi la segnalazione.
Contrassegnare il parlato sintetico nei casi in cui gli ascoltatori potrebbero scambiarlo per quello di una persona.
La clonazione richiede diritti espliciti e il consenso informato. Conservare la documentazione originale relativa al consenso, definire gli usi consentiti, impedire la re-iscrizione a valle e prevedere una procedura di cancellazione. I rischi non sono teorici; il Analisi della privacy e del consenso in materia di riconoscimento vocale a partire dalle immagini del volto spiega perché le misure di protezione relative all'identità, ai dati biometrici e all'usurpazione d'identità debbano essere integrate nella progettazione del prodotto piuttosto che limitarsi a una nota a piè di pagina.
Qwen3-TTS 0,6B vs 1,7B: quale scegliere?
Scegli 0.6B quando il tuo primo vincolo è l'implementazione. È la scelta migliore per GPU più piccole, un livello di concorrenza più elevato, sperimentazioni più rapide e un self-hosting attento ai costi. Sia Base che CustomVoice sono disponibili in questa dimensione, quindi puoi valutare la clonazione o i parlanti predefiniti senza dover partire dal checkpoint più grande.
Scegliete la versione 1.7B quando la riserva di qualità e l’ampiezza delle funzionalità sono più importanti. È l’unica versione disponibile con VoiceDesign ed è la scelta più indicata per i team disposti a sacrificare memoria e throughput a favore della capacità. I dati relativi alla concorrenza pari a 1 riportati nel rapporto tecnico mostrano una leggera differenza nel primo pacchetto e nell’RTF nella configurazione ottimizzata di Qwen, ma il vostro hardware potrebbe ampliare o ridurre tale divario.
| Fattore determinante | Inizia con 0,6 B | Inizia con 1,7 miliardi |
|---|---|---|
| La memoria della GPU è insufficiente | Vestibilità più aderente | Maggiore rischio di sovraccarico o bassa concorrenza |
| Ho bisogno di VoiceDesign | Non disponibile nel set pubblicato | Richiesto |
| Clonazione della base di riferimento | Disponibile | Disponibile con maggiore capacità |
| Hai bisogno di CustomVoice | Disponibile | Disponibile con maggiore capacità |
| Serve un test di fattibilità rapido | Il punto di partenza ideale | Utilizzare dopo i lavori sulla conduttura |
| Occorre prendere una decisione definitiva sulla produzione | Confronta entrambi | Confronta entrambi |
Il numero di parametri non equivale ai requisiti di VRAM. Anche la precisione, l’implementazione dell’attenzione, la cache, la lunghezza di riferimento, la dimensione del batch e l’overhead del framework sono tutti fattori rilevanti. Un modello che si carica a malapena non è un servizio di produzione affidabile.
Per l’MX450 da 2 GB esaminata nel corso di questa recensione, nessuna delle due configurazioni offre un percorso di benchmark della GPU rappresentativo. Il passo successivo più pratico consiste nell’utilizzare uno stack CUDA più recente e una GPU adeguata o un endpoint ospitato ufficialmente. L’affermazione “ha funzionato con l’offload della CPU” costituirebbe una nota sulla compatibilità, non una valutazione significativa delle prestazioni.
API Qwen3-TTS: HTTP, streaming e ID dei modelli
Scegli il mezzo di trasporto in base alle esigenze di riproduzione
Il metodo più semplice per la narrazione in blocco e i file completi.
Consegna graduale; verificare comunque quando l'audio diventa riproducibile.
Ideale per le conversazioni e la riproduzione progressiva.
Alibaba Cloud mette a disposizione modelli di generazione HTTP non in tempo reale e modelli WebSocket in tempo reale. Utilizza la sintesi non in tempo reale quando puoi attendere un risultato completo e desideri il flusso di richiesta più semplice. Utilizzate lo streaming WebSocket quando la latenza nella conversazione o la riproduzione progressiva sono fattori importanti. Lo streaming HTTP o gli eventi inviati dal server possono restituire dati incrementali, ma non devono essere confusi con la famiglia di modelli dedicati in tempo reale a bassa latenza.
Le famiglie attualmente disponibili includono Qwen3-TTS Flash per le voci integrate, Instruct Flash per il controllo delle prestazioni in linguaggio naturale, VC per le voci clonate e VD per le voci progettate. Gli ID dei modelli e le istantanee datate differiscono tra i percorsi non in tempo reale e quelli in tempo reale, pertanto è consigliabile copiarli dalla documentazione attuale anziché costruire i nomi per analogia.
L'attuale Documentazione API Qwen-TTS limita l'input a 512 token per richiesta. Questo è il limite applicabile a questa famiglia; una regola separata relativa a 600 caratteri, documentata per altri modelli TTS, non deve essere copiata in un'integrazione Qwen3-TTS. Gli URL degli audio completi rimangono validi per 24 ore, pertanto i sistemi di produzione dovrebbero trasferire i file necessari su un supporto di archiviazione durevole invece di utilizzare l’URL di risposta come supporto permanente.
import os
import dashscope
dashscope.base_http_api_url = "https://dashscope-intl.aliyuncs.com/api/v1"
response = dashscope.MultiModalConversation.call(
model="qwen3-tts-flash",
api_key=os.environ["DASHSCOPE_API_KEY"],
text="Il tuo ordine è pronto per il ritiro alle 16:30.",
voice="Cherry",
language_type="English",
)
print(response)
La chiave API e la regione dell'endpoint devono corrispondere. Le implementazioni di Pechino e Singapore utilizzano credenziali e URL di base diversi, mentre la disponibilità dei modelli può variare a seconda della regione. Non incorporare mai la chiave in WordPress, nel JavaScript lato client o in un file binario per dispositivi mobili. Invia le richieste di sintesi tramite un server sotto il tuo controllo, registra gli ID delle richieste senza registrare dati sensibili inseriti dall'utente e definisci una politica relativa al ciclo di vita dell'audio generato.
Per i documenti lunghi, suddividere in blocchi in base ai confini semantici, preservare il contesto, normalizzare i numeri e prestare attenzione a ogni punto di congiunzione. I frammenti validi possono comunque sembrare registrazioni separate quando il ritmo o l’energia cambiano tra una chiamata e l’altra.
Prezzi del modello Qwen3-TTS nel mercato internazionale
Panoramica sui prezzi a livello internazionale e regionale
Flash
$0.10
ogni 10.000 caratteri immessiIstruzioni / VC / VD
$0.115
ogni 10.000 caratteri immessiFlash / VC
$0.13
ogni 10.000 caratteri immessiIstruzioni
$0.143
ogni 10.000 caratteri immessiVD
$0.143353
ogni 10.000 caratteri immessiCreazione della voce: $0.01 per iscrizione · $0.20 per voce progettata.
Alibaba Cloud’s Pagina dei prezzi di Model Studio Di seguito sono riportati i prezzi per le regioni internazionali rilevati l'11 agosto 2026. Per queste righe, i dati in ingresso vengono fatturati, mentre quelli in uscita sono gratuiti. I prezzi, le quote gratuite, gli alias e la disponibilità a livello regionale possono subire variazioni; si consiglia pertanto di verificare la configurazione selezionata prima di eseguire un'operazione in batch di grandi dimensioni.
| Percorso | Famiglia di modelli | Prezzo per 10.000 caratteri inseriti |
|---|---|---|
| Non in tempo reale | Qwen3-TTS Flash | $0.10 |
| Non in tempo reale | Instruct, VC o VD | $0.115 |
| In tempo reale | Flash o VC attuale | $0.13 |
| In tempo reale | Istruzioni | $0.143 |
| In tempo reale | VD | $0.143353 |
La creazione della voce è un costo a sé stante rispetto alla sintesi. Lo stesso listino prezzi internazionale indica che la registrazione della voce Qwen costa $0,01 per clone, mentre la progettazione della voce costa $0,20 per voce progettata. Un’identità clonata o progettata può quindi comportare il relativo costo di sintesi per carattere al momento dell’utilizzo.
Considerare separatamente i costi relativi alla creazione delle voci, alla sintesi dei personaggi, all’infrastruttura e alla rigenerazione. Il tempo dedicato al montaggio e il numero di registrazioni ripetute spesso determinano il costo effettivo di produzione.
Il prezzo dell'API non corrisponde al costo locale. I checkpoint aperti eliminano la fatturazione per carattere da parte dei fornitori, ma aggiungono costi relativi al tempo di utilizzo della GPU, all'ingegneria di implementazione, al monitoraggio, allo storage, al ridimensionamento e alla risposta agli incidenti. L'hosting autonomo risulta vantaggioso quando il controllo, il volume, la località dei dati o la personalizzazione giustificano tale onere operativo.
Alternative e percorso audio GlobalGPT
Qwen3-TTS non è automaticamente l’opzione migliore per ogni progetto audio. ElevenLabs è una piattaforma vocale gestita più matura, pensata per i team che danno priorità a una dashboard curata, a un’ampia gamma di strumenti di produzione e a un carico di infrastruttura ridotto. I modelli vocali OpenAI potrebbero essere adatti agli sviluppatori che stanno già standardizzando il proprio lavoro su un unico ecosistema API. Qwen-Audio 3.0 TTS è la soluzione Qwen ospitata più recente da prendere in considerazione quando si seguono le attuali raccomandazioni di Alibaba Cloud.
Le esigenze relative alla musica e agli effetti sonori vanno considerate in un contesto diverso. Il Confronto audio tra ElevenLabs, Lyria 3 Pro e Mureka aiuta a distinguere gli strumenti di sintesi vocale dalla generazione musicale completa. Un modello di sintesi vocale non dovrebbe essere penalizzato per non essere in grado di produrre una canzone registrata in studio, e un modello musicale non dovrebbe essere scelto come API di narrazione a bassa latenza.
GlobalGPT dispone attualmente di un account verificato percorso del generatore audio che elenca qwen-audio-3.0-tts-flash e Seed Audio 1.0. La pagina controllata non riportava il modello Qwen3-TTS. Ciò rende il modello GlobalGPT un ambiente di lavoro audio a sé stante, ma non dimostra che i checkpoint aperti relativi al modello Qwen3-TTS siano disponibili in tale ambiente.
Se il tuo prodotto finale è un video, valuta se hai bisogno di un narratore a parte, di dialoghi generati, di effetti sonori o di un modello che produca suoni in sincronia con le immagini. La nostra risposta a se Veo 3.1 ha l'audio questo approccio amplia il campo delle decisioni. La soluzione più intelligente consiste spesso nell’utilizzare una serie di strumenti specializzati, piuttosto che costringere un unico modello a svolgere tutte le attività audio.
Licenza, consenso, privacy e uso commerciale
Il repository Qwen3-TTS e le schede dei modelli pubblicate utilizzano la licenza Apache-2.0. Tale licenza favorisce lo sviluppo, la modifica e la distribuzione a fini commerciali, ma non concede diritti relativi alla voce, alle interpretazioni, ai copioni, ai marchi registrati o ai dati personali di terzi. La licenza dei modelli e i diritti sui contenuti costituiscono livelli distinti.
L'inferenza locale offre un maggiore controllo e comporta una maggiore responsabilità in materia di sicurezza. È possibile crittografare le registrazioni di riferimento, limitare l'accesso, ridurre al minimo i tempi di conservazione, documentare i derivati e estendere la cancellazione alle voci registrate e agli output memorizzati nella cache.
Per la sintesi vocale in cloud, verificare i termini del servizio, le modalità di trattamento dei dati a livello regionale, i periodi di conservazione e i controlli aziendali prima di inviare script riservati o campioni vocali.
Ogni voce clonata destinata al pubblico dovrebbe avere un titolare, un documento di consenso, una politica sugli usi consentiti e una procedura di risposta in caso di abuso. È necessario aggiungere un’informativa nei casi in cui una voce sintetica possa essere ragionevolmente scambiata per quella di una persona reale. È necessario impedire l’usurpazione dell’identità di privati cittadini e personaggi pubblici ad alto rischio e fornire un canale per segnalare contenuti audio dannosi.
A chi è destinato il prodotto Qwen3-TTS?
Quale percorso è più adatto?
Resistente alle perdite, memoria più compatta, Base o CustomVoice.
VoiceDesign o confronto tra qualità e capacità con margine di potenza della GPU.
Operazioni più veloci quando la regione, la privacy e i prezzi sono adeguati.
Studio senza configurazione, marketplace con licenza o supporto per fornitori esistenti.
Qwen3-TTS è la soluzione ideale per ricercatori, sviluppatori, team di videogiochi e gruppi di localizzazione che necessitano di pesi aperti, libertà di scelta nella distribuzione, clonazione o voci dei personaggi descritte tramite testo.
Inizia con 0,6 miliardi se stai testando la pipeline, gestendo una memoria limitata o verificando se Base e CustomVoice soddisfano le esigenze del prodotto. Inizia con 1,7B se hai bisogno di VoiceDesign o disponi di hardware sufficiente per confrontare adeguatamente qualità e produttività. Utilizza l'API ospitata se l'infrastruttura rappresenta il collo di bottiglia e la disponibilità regionale, le credenziali e la gestione dei dati sono adeguate al progetto.
Scegli un'altra soluzione se hai bisogno di uno studio di montaggio che non richieda alcuna configurazione, di un ampio marketplace di voci con licenza o di un supporto aziendale già esistente offerto da un altro fornitore. Non clonare mai senza un consenso documentato.
Utilizza cinque script reali, tre ripetizioni, un elenco di nomi complessi, un paragrafo lungo e un test di recupero. Misura la latenza e il costo, quindi chiedi agli ascoltatori madrelingua se il risultato è pronto senza necessità di correzioni. Il lavoro di editing può vanificare una vittoria nel benchmark.
Domande frequenti su Qwen3-TTS
Qwen3-TTS è gratuito?
I checkpoint Qwen3-TTS rilasciati sono disponibili sotto licenza Apache-2.0, quindi è possibile scaricarli ed eseguirli senza dover pagare alcun costo per carattere. L'hosting autonomo comporta comunque costi relativi a risorse di calcolo, archiviazione, sviluppo e monitoraggio. Le API Qwen3-TTS ospitate da Alibaba Cloud sono servizi a pagamento con prezzi e quote specifici per ciascuna regione.
Il modello Qwen3-TTS può essere utilizzato a fini commerciali?
La licenza Apache-2.0 consente l'uso commerciale del codice e dei pesi dei modelli resi disponibili, ma non conferisce il diritto di clonare la voce di una persona né di utilizzare script e marchi protetti. I progetti commerciali richiedono comunque il consenso del parlante, i diritti sui contenuti, il rispetto delle norme sulla privacy e la conformità alle leggi locali e ai termini di utilizzo della piattaforma.
Quali lingue supporta Qwen3-TTS?
La versione aperta Qwen3-TTS supporta cinese, inglese, giapponese, coreano, tedesco, francese, russo, portoghese, spagnolo e italiano. La copertura linguistica dei modelli ospitati può variare a seconda dell'endpoint e della voce; pertanto, è necessario verificare l'ID esatto del modello Alibaba Cloud e la regione prima di sviluppare un prodotto multilingue.
Il modello Qwen3-TTS è davvero in grado di garantire una latenza di 97 ms?
Qwen ha riportato una latenza del primo pacchetto pari a 97 ms per il modello 0.6B a 12 Hz con concorrenza pari a 1 in un ambiente vLLM interno ottimizzato. Si tratta di un benchmark valido fornito dal produttore, non di una garanzia universale relativa al dispositivo. Gli avvii a freddo, l’hardware, la precisione, il transito di rete, l’accodamento e il buffering del client possono aumentare la latenza osservata.
Quanta VRAM richiede il modello Qwen3-TTS?
Non esiste un unico valore attendibile di VRAM valido per tutte le configurazioni. Le dimensioni del modello, la precisione, il backend di attenzione, la dimensione del batch, la cache, la lunghezza di riferimento e l’overhead del framework sono tutti fattori rilevanti. La MX450 da 2 GB esaminata non era adatta per un benchmark rappresentativo; è opportuno testare il checkpoint scelto con un livello di concorrenza simile a quello di produzione e lasciare un margine operativo.
Quanto materiale audio è necessario per la clonazione vocale con Qwen3-TTS?
I materiali di esempio mostrano una clonazione rapida a partire da circa tre secondi, mentre le linee guida per la registrazione fornite dal servizio preferiscono un discorso continuo e chiaro e consentono campioni più lunghi. Considerate i tre secondi come un limite minimo di fattibilità, non come un obiettivo di qualità automatico. Utilizzate registrazioni audio autorizzate e prive di rumori che coprano la gamma vocale normale del parlante e la lingua prevista.
Qual è il limite di input dell'API Qwen3-TTS?
La documentazione attuale dell'API Qwen-TTS indica un limite massimo di 512 token in ingresso per i modelli Qwen-TTS. Gli URL "complete-audio" hanno una validità di 24 ore. È consigliabile suddividere gli script di grandi dimensioni in base ai confini semantici e copiare i risultati necessari su un supporto di archiviazione permanente, anziché considerare l'URL restituito come un hosting permanente.
Posso utilizzare Qwen3-TTS su GlobalGPT?
Il generatore audio GlobalGPT selezionato elencato qwen-audio-3.0-tts-flash e Seed Audio 1.0, non Qwen3-TTS. È possibile utilizzare quel percorso come flusso di lavoro audio separato, ma non dovrebbe essere descritto come accesso ai checkpoint aperti 0.6B o 1.7B di Qwen3-TTS.
Il verdetto finale
Questa recensione del Qwen3-TTS mette in luce una gamma di funzionalità davvero ampia: checkpoint aperti da 0,6B e 1,7B, dieci lingue, voci predefinite, clonazione rapida, VoiceDesign, architettura di streaming, una licenza permissiva e API ospitate.
Anche la limitazione oggettiva è altrettanto importante. Nell’ambiente di lavoro a disposizione non è stato generato alcun audio effettivo Qwen3-TTS e la GPU da 2 GB esaminata non era in grado di supportare un confronto locale rappresentativo. Per questo motivo, il presente articolo non assegna un punteggio relativo alla qualità vocale né sostiene che le prestazioni siano universalmente pari a 97 ms.
Se per te sono importanti la flessibilità dei pesi e il controllo, prova prima il checkpoint 0.6B, poi confrontalo con quello da 1.7B utilizzando gli stessi script e lo stesso hardware. Se per te è importante la rapidità di implementazione, prova l'esatto percorso di Alibaba Cloud che intendi acquistare e confrontalo con la famiglia TTS Qwen-Audio 3.0, posizionata separatamente. Inserisci il nome del modello, l'endpoint, la regione, il record di consenso, la latenza e il costo totale di modifica nella stessa scheda decisionale.
Vale la pena provare Qwen3-TTS. Non ha senso illudersi che la documentazione da sola possa interpretare le vostre esigenze. La strada vincente è quella che tiene conto dei vostri nomi, del vostro linguaggio, del vostro hardware, delle vostre esigenze in materia di privacy e delle vostre scadenze di produzione.



