Análisis de ElevenLabs Multilingual v2 (2026): idiomas, calidad de voz y API

Reseña de Eleven Multilingual v2: idiomas, calidad y API

Eleven Multilingual v2 no es una versión nueva de 2026, pero sigue siendo un modelo de síntesis de voz ElevenLabs activo que merece la pena tener en cuenta. Lanzado en agosto de 2023, sigue formando parte de la gama estrella de la empresa con 29 idiomas compatibles, un límite de 10 000 caracteres por solicitud y un enfoque oficial en la generación estable de textos extensos.

El problema es que “más nuevo” y “mejor para tu trabajo” no son lo mismo. Eleven v3 ofrece una interpretación más expresiva y una cobertura lingüística más amplia, mientras que Flash v2.5 da prioridad a la velocidad, la escalabilidad y un menor coste de la API. Multilingual v2 se sitúa entre ambas como la opción consolidada para narraciones, cursos, localización y otros trabajos con un solo locutor en los que la coherencia es más importante que la interpretación dramática.

¿Quieres probar el modelo antes de enviar una solicitud a la API? Generador de audio del GlobalGPT Incorpora Eleven Multilingual v2 en el entorno de trabajo del navegador: elige el modelo, pega tu guion, selecciona una voz y genera el audio.

¿Qué es Eleven Multilingual v2?

Eleven Multilingual v2 es un modelo multilingüe de síntesis de voz de ElevenLabs. El ID nativo del modelo en la API es eleven_multilingual_v2. Envías un mensaje de texto y una identificación de voz al Punto final de conversión de texto a voz, y el servicio devuelve audio sintetizado con la voz seleccionada.

Su atractivo práctico es sencillo: un solo modelo abarca 29 idiomas y admite hasta 10 000 caracteres en una sola solicitud. ElevenLabs lo describe como su opción más estable para la generación de textos largos, aunque esa afirmación responde al posicionamiento de la empresa y no constituye una garantía independiente para cada voz, alfabeto o idioma.

Multilingual v2 está diseñado para trabajos como narraciones, audiolibros, formación en línea, locuciones corporativas y contenidos multimedia localizados. Si tu producto final es un vídeo con personajes que hablan, la misma locución también puede utilizarse para un público más amplio flujo de trabajo de diálogo y sincronización labial.

¿Sigue activo Eleven Multilingual v2 en 2026?

Sí. A fecha de 11 de agosto de 2026, ElevenLabs incluye «Multilingual v2» entre sus modelos insignia de síntesis de voz. No aparece en la tabla de modelos obsoletos de la documentación. Ese es su estado actual más claro: está activo y documentado, pero ya no es el modelo de síntesis de voz más reciente de ElevenLabs.

La fecha de lanzamiento es independiente de su estado actual. ElevenLabs Se ha anunciado la versión 2 de Multilingual el 22 de agosto de 2023. El título de una página que incluya “2026” debería referirse a la fecha de revisión, y no dar a entender que el modelo se ha lanzado este año.

Esa posición convierte a Multilingual v2 en una opción de producción consolidada, y no en un software abandonado. También significa que, a la hora de tomar la decisión de compra, se debe comparar su perfil más estable y con un guion más extenso con las ventajas específicas de la v3 y Flash v2.5.

¿Qué idiomas admite Eleven Multilingual v2?

ElevenLabs incluye oficialmente 29 idiomas en la versión Multilingual v2:

  • Inglés, japonés, chino, alemán, hindi y francés
  • coreano, portugués, italiano, español, indonesio y neerlandés
  • Turco, filipino, polaco, sueco, búlgaro y rumano
  • Árabe, checo, griego, finés, croata, malayo y eslovaco
  • Danés, tamil, ucraniano y ruso

La compatibilidad con distintos idiomas no significa que todas las voces suenen igual de convincentes en todas las regiones. ElevenLabs recomienda elegir una voz cuyo acento se ajuste al idioma y la región de destino. Esto es importante en el caso del español, el portugués, el inglés y otros idiomas con grandes variaciones regionales. Prueba la voz y el guion concretos que tengas previsto publicar, en lugar de dar por sentado que la lista de idiomas del modelo garantiza un acento adecuado.

Calidad de la voz: naturalidad, coherencia y pruebas

ElevenLabs describe Multilingual v2 como realista, sensible a las emociones y coherente en todos los idiomas. Se trata de afirmaciones del proveedor. Son útiles para comprender la posición que se pretende que ocupe el modelo, pero no deben confundirse con pruebas imparciales.

Las pruebas independientes son más limitadas. Artificial Analysis situaba a Multilingual v2 en unos 1100,07 Elo en su «Provider Voice Arena» cuando se consultó el 11 de agosto de 2026. Esta plataforma utiliza preferencias de oyentes emparejadas y ocho voces de proveedores en inglés de EE. UU. y del Reino Unido, divididas entre voces masculinas y femeninas. Se trata de datos transparentes y específicos del modelo sobre las preferencias de voz en inglés; no demuestran un rendimiento equivalente en los 29 idiomas, los acentos regionales o los guiones largos.

Las opiniones del público son dispares, pero la muestra es demasiado pequeña para describir a la base de usuarios en su conjunto. En un debate de 2024, los comentaristas describieron la v2 como más realista que la v1, aunque también señalaron problemas ocasionales de coherencia en los acentos. Otro usuario informó de un breve periodo de problemas de velocidad y coherencia. Una respuesta posterior relacionada con ElevenLabs recomendó Multilingual v2 o Turbo v2 para trabajos largos más coherentes. Estas publicaciones son señales de advertencia útiles, no datos de prevalencia ni pruebas comparativas controladas.

¿Qué se puede afirmar con seguridad?

  • El modelo sigue contando con soporte oficial y está optimizado para el procesamiento de discursos largos, de alta calidad y sin interrupciones.
  • Los datos independientes sobre las preferencias en inglés le aportan una señal externa fiable, dentro de un conjunto limitado de voces en inglés.
  • La calidad del acento depende del idioma, la región, la selección de voz y el guion, y no solo del ID del modelo.
  • Las comprobaciones objetivas del audio pueden detectar truncamientos, recortamientos, problemas de formato y anomalías temporales, pero no pueden sustituir a una escucha atenta.
Caso práctico de audio 01

Coherencia entre idiomas

Se generó el mismo escenario en inglés, español y mandarín con la voz «route-default». Cada reproductor contiene la primera salida válida conservada según la regla de prueba «frozen».

Inglés T02
Español T02
Mandarín T02
0.8232Similitud en la incrustación de hablantes entre inglés y español
0.8867Similitud en la incrustación de hablantes de inglés y mandarín
0.8822Similitud en la incrustación de hablantes de español y mandarín

Presta atención a: la continuidad de la identidad del hablante y los problemas evidentes de pronunciación. Un oyente español cualificado debería evaluar por separado la autenticidad del acento.

Estas representaciones constituyen una señal de identidad auxiliar; no evalúan la naturalidad, la pronunciación, el acento, la prosodia ni la expresión emocional. No se disponía de ningún grupo de calibración con hablantes diferentes.

Prueba práctica: cinco resultados válidos iniciales a través de la ruta de la API de Anywhere

Hemos probado la ruta HTTPS directa de Anywhere al ID del modelo once-multilingüe-v2. Este formato de identificador no es el mismo que el de la API nativa ElevenLabs, que utiliza eleven_multilingual_v2. La ruta ofrecía una interfaz de tareas con el modelo y el prompt, pero no disponía de controles fiables para la selección de voz, la estabilidad, la similitud, el estilo, la velocidad o el formato de salida. Por lo tanto, en cada ejecución se utilizaron los valores predeterminados de la ruta.

El lote prerregistrado contenía cinco guiones: una narración en inglés de 1.399 caracteres, el mismo guion en inglés, español y mandarín, y una prueba de acento y pronunciación que incluía nombres, fechas, divisas, un número de teléfono, una URL y acrónimos. Conservamos el primer resultado válido y reproducible, y no volvimos a ejecutar la prueba para comprobar la calidad.

Resultados de la ruta objetiva

Resumen de la fiabilidad de la ruta

Los cinco scripts preinscritos utilizaron la primera salida válida reproducible. La ruta no ofrecía controles de voz ni de generación, por lo que en cada ejecución se utilizaron los valores predeterminados.

5/5tareas completadas con éxito en el primer intento
172,486 sentrega de audio formal
$0.2505coste de la ruta formal de devolución
5 archivos MP3 válidosmono, 44,1 kHz, sin distorsión

Alcance: Estas cifras se refieren a la ruta «Anywhere», no a la latencia nativa de ElevenLabs ni a la experiencia del navegador GlobalGPT. Las comprobaciones de archivos no evalúan la naturalidad, la emoción, el acento ni el ritmo local.

Las cinco tareas formales se completaron con éxito en el primer intento y generaron archivos MP3 mono decodificables a 44,1 kHz. Los archivos no contenían muestras recortadas ni saltos entre muestras adyacentes superiores a 0,8 en el análisis local de la forma de onda. Estas comprobaciones verifican la integridad de los archivos, pero no evalúan su naturalidad.

Estabilidad a largo plazo, emoción, pronunciación y compensaciones en cuanto a la latencia

Guiones largos

El límite máximo de 10 000 caracteres es lo suficientemente amplio como para abarcar unos diez minutos de audio, según la tabla de límites de caracteres de ElevenLabs. En el caso de capítulos más largos, dividirlos en los límites naturales de los párrafos o las escenas, en lugar de cortarlos en función de un recuento arbitrario de caracteres. La API proporciona texto_anterior, text_siguiente, y los campos de continuidad de ID de solicitud para facilitar la fluidez entre fragmentos adyacentes.

Nuestra prueba demuestra que un guion de 1.399 caracteres se completó como un archivo válido en el primer intento a través de la ruta «Anywhere». No demuestra la estabilidad al alcanzar el límite máximo de 10.000 caracteres ni a lo largo de todo un audiolibro.

Caso práctico sobre audio 02

Estabilidad a largo plazo

T01 — Narración en inglésPrimera salida válida · ruta predeterminada de voz
1.399 caracteresnarración de entrada
85,081 segundosaudio transmitido
Primera fecha de validezrepetición sin calidad
$0.1399coste de la ruta de vuelta

Presta atención a: diferencias de ritmo entre los pasajes iniciales y finales, pausas incómodas, chasquidos, distorsiones o artefactos audibles.

Resultado objetivo: El archivo se decodificó correctamente, sin muestras recortadas ni saltos entre muestras adyacentes superiores a 0,8. El tiempo calculado por el sistema fue de 2,858 palabras/s en la primera mitad y de 2,670 en la segunda, sin que se observara un aumento general de la velocidad en la segunda mitad.

Una sola ejecución no garantiza la estabilidad con el límite de 10 000 caracteres ni descarta posibles problemas de sincronización locales que requieran la intervención humana.

Ajustes de emoción y estabilidad

En la API nativa ElevenLabs, una estabilidad menor permite una mayor variación, mientras que una estabilidad mayor puede hacer que la presentación sea más consistente y, potencialmente, más monótona. La exageración del estilo puede aportar expresividad, pero también puede reducir la previsibilidad y aumentar la carga computacional. Considera esos controles como compensaciones creativas, no como mejoras universales de la calidad.

Pronunciación

La versión 2 de Multilingual no admite etiquetas de fonemas. ElevenLabs recomienda utilizar diccionarios de pronunciación con alias como solución alternativa. Normaliza los números ambiguos, las abreviaturas, las fechas y las URL antes de la generación y, a continuación, mantén un pequeño script de regresión para los nombres o términos que sean importantes para tu marca.

Caso práctico de audio n.º 03

Prueba de acentuación fonética

T03 — Nombres, números y siglasPrimera salida válida · $0.0382 coste de ruta
4 de julio de 2026Dra. Ana MartínezGLB-2048$1,250.75São PauloKioto8:30 de la mañana.12 de septiembre1-800-555-0199glbgpt.comAPI / TTS / UNESCOVersión 2.5 / 10 por ciento

Punto de control de comprensión auditiva: El reconocimiento de voz sin conexión interpretó el número de teléfono como “1-800-5555-0199”. Escucha atentamente el número original y la URL antes de su publicación.

El dígito adicional no es un error confirmado del sistema de síntesis de voz (TTS). El reconocimiento de voz puede dar lugar a errores, por lo que se trata de un punto de control de revisión más que de un veredicto sobre la pronunciación.

Latencia

Multilingual v2 no es la opción de baja latencia de ElevenLabs. Según ElevenLabs, presenta una latencia mayor que los modelos Flash. Los tiempos de ruta que hemos medido oscilaron entre 10,161 y 31,489 segundos para las cinco tareas formales, pero esas cifras incluyen la ruta de la tarea ’Anywhere», la red, las colas y la entrega de archivos. No deben considerarse como la latencia nativa del modelo ElevenLabs.

Cómo utilizar la API de Eleven Multilingual v2

Configuración para desarrolladores

Solicitud de la API nativa ElevenLabs

Utiliza el ID del modelo nativo eleven_multilingual_v2 en el cuerpo JSON e introduce el ID de voz seleccionado en el punto final.

PUBLICARhttps://api.elevenlabs.io/v1/text-to-speech/{voice_id}
Solicitud mínima con cURLSustituye «YOUR_VOICE_ID» y utiliza una variable de entorno para la clave
curl -X POST "https://api.elevenlabs.io/v1/text-to-speech/YOUR_VOICE_ID" \
  -H "xi-api-key: $ELEVENLABS_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "text": "Aquí va tu narración multilingüe.",
    "model_id": "eleven_multilingual_v2",
    "voice_settings": {
 "stability": 0.5,
      "similarity_boost": 0,75,
 "style": 0,
 "use_speaker_boost": true,
 "speed": 1,0
    }
  }' \
  --output narration.mp3

Parámetros y límites clave

ParámetroQué controlaNota práctica
voice_idVoz ElevenLabs seleccionadaElige una voz cuyo acento se adapte al idioma y a la región de destino.
id_del_modeloModelo de síntesisUtilice eleven_multilingual_v2.
estabilidadVariabilidad frente a consistenciaLos valores más bajos pueden variar más; los más altos pueden ser más moderados.
similarity_boostSimilitud con la voz de referenciaLos valores altos pueden ayudar a identificar, pero no lo garantizan en todos los idiomas.
estiloExageración estilísticaÚsalo con precaución cuando la repetibilidad sea importante.
use_speaker_boostProcesamiento adicional de similitud entre hablantesPuede aumentar la latencia.
velocidadRitmo de reproducciónVuelve a comprobar los números y la puntuación después de modificarlos.
texto_anterior / text_siguienteContexto en torno a un fragmentoResulta útil a la hora de dividir guiones largos.
código_de_idiomaAplicación de la normativa lingüísticaNo es compatible con los modelos multilingual_v2 en la referencia de la API actual.

Importante: Guarda las claves de la API en una variable de entorno segura. Nunca pegues una clave real en el código de un artículo público.

Precios de la API de Eleven Multilingual v2

’ElevenLabs» Página de tarifas de la API He incluido «Multilingual v2» y «v3» en $0,10 por cada 1.000 caracteres según la información consultada el 11 de agosto de 2026. Quedan excluidos los impuestos, gravámenes y aranceles.

Coste y acceso

Precios de la API directa

Según la tarifa oficial de $0,10 por cada 1.000 caracteres para Multilingual v2 y v3:

1 000 caracteres
$0.10
5 000 caracteres
$0.50
10 000 caracteres
$1.00
Precios de la API ElevenLabs consultados el 11 de agosto de 2026. No se incluyen impuestos, gravámenes ni aranceles.

¿API directa o GlobalGPT?

RutaReferencia de preciosCómo trabajasLa mejor relación calidad-precio cuando
API ElevenLabs$0.10 / 1K caracteresSolicitudes nativas, voces, ajustes y consumo medidoNecesitas controles para desarrolladores e integración de productos
GlobalGPT utiliza su propio sistema de créditos, por lo que estas suscripciones no son una conversión por personaje de la tarifa de la API de ElevenLabs. Compara las tarifas GlobalGPT.

A ese precio, una solicitud con un tamaño máximo de 10 000 caracteres cuesta $1,00 antes de impuestos. El coste real del proyecto depende de la cantidad de texto que generes, de la frecuencia con la que lo regeneres y de si conservas las tomas fallidas. Calcula tu presupuesto en función de los caracteres introducidos, en lugar de los minutos de audio.

Para los creadores que no necesitan desarrollar un flujo de trabajo con una API nativa, GlobalGPT ofrece una propuesta de valor más práctica. Según la información consultada el 11 de agosto de 2026, sus planes anuales ascendían a $5,80 al mes para el plan Básico, $10,80 para el Pro y $25 para el Ilimitado, combinando múltiples modelos de IA y herramientas creativas en una sola suscripción. El Generador de audio GlobalGPT Incluye Eleven Multilingual v2 y Eleven v3 en un entorno de trabajo del navegador, lo que te permite generar narraciones y comparar ambos modelos sin tener que configurar primero una solicitud de API.

GlobalGPT utiliza su propio sistema de créditos, por lo que no se trata de una comparación directa de precios por carácter con la API de ElevenLabs. Sin embargo, cuando el audio forma parte de un flujo de trabajo más amplio que incluye redacción, investigación, imágenes, vídeo o varios modelos de IA, El GlobalGPT es la opción que ofrece la mejor relación calidad-precio en general. Puedes Compara aquí los planes GlobalGPT.

Eleven Multilingual v2 frente a Eleven v3 frente a Flash v2.5

Guía para la toma de decisiones

¿Qué modelo ElevenLabs deberías elegir?

Elige al modelo en función del trabajo, en lugar de basarte únicamente en la fecha de estreno.

Selección de artículos extensos

Multilingüe v2

Elige entre: una narración fluida, flujos de trabajo consolidados, cobertura en 29 idiomas y guiones de hasta 10 000 caracteres.

Selección de expresiones

Once v3

Elige entre: una interpretación dramática, obras con varios interlocutores y una cobertura más amplia, con más de 70 idiomas.

Selección rápida

Flash v2.5

Elige entre: productos adaptables, alto rendimiento, solicitudes de 40 000 caracteres y un menor coste de la API.

ModeloIdiomasLímite de caracteresÉnfasis oficialMejor ajuste
Multilingüe v22910,000Estabilidad a largo plazo y calidad constanteNarración, cursos, localización, flujos de trabajo de voz consolidados
Once v370+5,000El habla expresiva y el diálogo entre varios interlocutoresInterpretación, personajes, expresión dramática, mayor variedad lingüística
Flash v2.53240,000Una latencia del modelo de unos 75 ms y un menor coste de la APIProductos interactivos, rendimiento, solicitudes más largas, escalabilidad con atención al coste

GlobalGPT también incluye Eleven v3 en el mismo generador de audio. Ejecuta el mismo guion breve en ambos modelos: utiliza Multilingual v2 como referencia para una narración constante y, a continuación, compáralo con la versión v3 cuando desees una interpretación más expresiva. Tu propio guion es una herramienta de decisión más eficaz que una demostración genérica, ya que pone de manifiesto los nombres, la puntuación, el ritmo y los cambios de idioma que son importantes para tu proyecto.

¿Quién debería —y quién no debería— utilizar Multilingual v2?

Buen ajuste

  • Narradores que graban cursos, vídeos explicativos, vídeos corporativos o locuciones localizadas.
  • Equipos que ya cuentan con un modelo de voz ElevenLabs validado y desean un ID de modelo estable.
  • Proyectos que requieran uno de los 29 idiomas y alfabetos compatibles y que superen el límite de 5.000 caracteres de la versión 3.
  • Desarrolladores que dan más importancia a los controles de voz nativos y a los campos de continuidad de fragmentos que a la menor latencia posible.

Busca en otro sitio cuando

  • Si necesitas una interpretación muy expresiva, diálogos naturales entre varios interlocutores o un idioma que no figure en la lista de 29 idiomas, empieza por Eleven v3.
  • Si estás desarrollando un agente de voz adaptativo o un servicio de alto rendimiento, evalúa Flash v2.5.
  • Necesitas un marcado a nivel de fonema; Multilingual v2 no admite etiquetas de fonemas.
  • Necesitas un acento regional garantizado sin tener que probar una voz adecuada ni un guion real.
  • Es necesario contar con una valoración subjetiva definitiva de la calidad antes de que un oyente cualificado haya revisado tus idiomas de destino.

Preguntas frecuentes

¿Seguirá estando disponible Eleven Multilingual v2 en 2026?

Sí. ElevenLabs lo catalogó como modelo insignia de síntesis de voz y no lo incluyó en la tabla de modelos obsoletos cuando se comprobó el 11 de agosto de 2026.

¿Cuándo se lanzó la versión 2 de Eleven Multilingual?

ElevenLabs anunció la versión Multilingual v2 el 22 de agosto de 2023. El “2026” que aparece en esta reseña hace referencia a la fecha de la reseña, no al año de lanzamiento.

¿Cuántos idiomas admite Eleven Multilingual v2?

Es compatible oficialmente con 29 idiomas, entre los que se incluyen el inglés, el español, el chino, el japonés, el alemán, el francés, el hindi, el coreano, el portugués, el árabe y el ruso.

¿Cuál es el ID del modelo Eleven Multilingual v2?

El identificador nativo del modelo de la API ElevenLabs es eleven_multilingual_v2. La ruta de prueba de Anywhere utilizaba el identificador independiente con guion once-multilingüe-v2.

¿Cuál es el límite de caracteres?

El límite oficial por solicitud es de 10 000 caracteres, lo que, según las estimaciones de ElevenLabs, equivale a unos diez minutos de audio.

¿Es Multilingual v2 mejor que Eleven v3?

Ninguna de las dos es mejor en todos los casos. La versión multilingüe v2 es la opción más estable y con mayor trayectoria; la v3 ofrece una cobertura lingüística más amplia, una expresión más rica y funciones para múltiples hablantes.

¿Es Multilingual v2 adecuado para narraciones extensas?

ElevenLabs se posiciona como su modelo de formato largo más estable. Nuestra prueba de ruta de 1.399 caracteres se completó con éxito, pero esa única ejecución no demuestra la estabilidad con un libro completo o con 10.000 caracteres.

¿Puedo configurar un código de idioma en la API?

La referencia actual de la API «Create speech» dice lo siguiente: código_de_idioma No es compatible con los modelos multilingual_v2.

¿Admite Multilingual v2 las etiquetas de fonemas?

N.º 1: TP9T recomienda utilizar diccionarios de pronunciación que incluyan alias cuando sea necesario controlar la transcripción de nombres o términos especializados.

¿Cuánto cuesta la API?

El 11 de agosto de 2026, ElevenLabs fijó el precio de Multilingual v2 en $0,10 por cada 1.000 caracteres, sin incluir impuestos, gravámenes ni aranceles.

Veredicto final

Eleven Multilingual v2 se ha ganado un lugar destacado en la gama ElevenLabs de 2026: es la opción consolidada para una narración multilingüe fluida, un flujo de trabajo de voz validado y solicitudes de hasta 10 000 caracteres. No es la opción ganadora automática para todos los proyectos de síntesis de voz. Eleven v3 es el punto de partida más sólido para una interpretación expresiva y una mayor variedad de idiomas, mientras que Flash v2.5 está diseñado para ofrecer velocidad y escalabilidad.

Nuestra prueba objetiva aporta una confianza adicional sobre la fiabilidad de la ruta y la integridad de los archivos: las cinco tareas formales de Anywhere se completaron en el primer intento, generaron archivos MP3 válidos en mono a 44,1 kHz y se mantuvieron dentro del límite de coste preestablecido. Esto no sustituye a la escucha humana, por lo que no asignamos una puntuación subjetiva en cuanto a naturalidad, emoción o acento basándonos únicamente en las comprobaciones automáticas.

Trae un párrafo de tu próxima narración, clase o vídeo adaptado para Generador de audio del GlobalGPT. Empieza con Eleven Multilingual v2, mantén la coherencia en la voz y el guion, y compáralo con Eleven v3 cuando la interpretación expresiva sea importante. Es una forma directa y práctica de elegir el modelo que mejor se adapte a tu trabajo.

Comparte el post:

Entradas relacionadas