„Eleven Multilingual v2“ ist zwar keine neue Version aus dem Jahr 2026, aber dennoch ein aktives ElevenLabs-Text-to-Speech-Modell, das eine Überlegung wert ist. Das im August 2023 eingeführte Produkt gehört nach wie vor zum Flaggschiff-Sortiment des Unternehmens und bietet Unterstützung für 29 Sprachen, ein Limit von 10.000 Zeichen pro Anfrage sowie einen offiziellen Schwerpunkt auf der stabilen Generierung langer Texte.
Der Haken daran ist, dass “neuer” und “besser für Ihre Aufgaben” nicht dasselbe sind. Eleven v3 bietet eine ausdrucksstärkere Sprachwiedergabe und eine breitere Sprachabdeckung, während Flash v2.5 den Schwerpunkt auf Geschwindigkeit, Skalierbarkeit und geringere API-Kosten legt. Multilingual v2 liegt dazwischen und ist die bewährte Wahl für Sprachaufnahmen, Kurse, Lokalisierung und andere Projekte mit einem einzigen Sprecher, bei denen Konsistenz wichtiger ist als eine dramatische Darbietung.
Möchten Sie das Modell ausprobieren, bevor Sie eine API-Anfrage stellen? Der Audiogenerator von GlobalGPT Fügt „Eleven Multilingual v2“ in den Arbeitsbereich des Browsers ein: Wählen Sie das Modell aus, fügen Sie Ihr Skript ein, wählen Sie eine Stimme aus und generieren Sie die Audiodatei.

Was ist Eleven Multilingual v2?
Eleven Multilingual v2 ist ein mehrsprachiges Text-to-Speech-Modell von ElevenLabs. Die native API-Modell-ID lautet eleven_multilingual_v2. Sie senden Text und eine Sprach-ID an den „Text-to-Speech“-Endpunkt, und der Dienst gibt synthetisierte Audiodaten in der ausgewählten Stimme zurück.
Der praktische Vorteil liegt auf der Hand: Ein einziges Modell deckt 29 Sprachen ab und verarbeitet bis zu 10.000 Zeichen in einer einzigen Anfrage. ElevenLabs bezeichnet es als seine stabilste Option für die Generierung langer Texte, wobei es sich bei dieser Aussage jedoch eher um die Positionierung des Unternehmens handelt als um eine unabhängige Garantie für jede Stimme, jedes Schriftsystem oder jede Sprache.
Multilingual v2 ist für Aufgaben wie Sprecherarbeiten, Hörbücher, E-Learning, Unternehmens-Voiceovers und lokalisierte Medien konzipiert. Wenn es sich bei Ihrem Endprodukt um ein Video mit sprechenden Figuren handelt, kann dasselbe Voiceover auch für ein breiteres Publikum verwendet werden. Arbeitsablauf für Dialoge und Lippensynchronisation.
Ist „Eleven Multilingual v2“ im Jahr 2026 noch aktiv?
Ja. Seit dem 11. August 2026 führt ElevenLabs „Multilingual v2“ unter seinen Flaggschiff-Modellen für die Text-to-Speech-Technologie auf. Es taucht nicht in der Tabelle der veralteten Modelle in der Dokumentation auf. Das ist der derzeit eindeutigste Status: aktiv und dokumentiert, aber nicht mehr das neueste Sprachmodell von ElevenLabs.
Das Veröffentlichungsdatum steht in keinem Zusammenhang mit dem aktuellen Status. ElevenLabs hat “Multilingual v2” am 22. August 2023 angekündigt. Ein Seitentitel, der „2026“ enthält, sollte sich auf das Datum der Rezension beziehen und nicht den Eindruck erwecken, dass das Modell in diesem Jahr auf den Markt gekommen ist.
Diese Positionierung macht Multilingual v2 zu einer etablierten Produktionsoption und nicht zu einer ausgemusterten Software. Das bedeutet auch, dass bei der Kaufentscheidung das stabilere, auf längere Skripte ausgerichtete Profil mit den spezifischen Vorteilen von v3 und Flash v2.5 abgewogen werden sollte.
Welche Sprachen unterstützt Eleven Multilingual v2?
ElevenLabs listet offiziell 29 Sprachen für „Multilingual v2“ auf:
- Englisch, Japanisch, Chinesisch, Deutsch, Hindi und Französisch
- Koreanisch, Portugiesisch, Italienisch, Spanisch, Indonesisch und Niederländisch
- Türkisch, Philippinisch, Polnisch, Schwedisch, Bulgarisch und Rumänisch
- Arabisch, Tschechisch, Griechisch, Finnisch, Kroatisch, Malaiisch und Slowakisch
- Dänisch, Tamil, Ukrainisch und Russisch
Sprachunterstützung bedeutet nicht, dass jede Stimme in jeder Region gleichermaßen überzeugend klingt. ElevenLabs empfiehlt, eine Stimme auszuwählen, deren Akzent zur Zielsprache und -region passt. Dies ist besonders wichtig für Spanisch, Portugiesisch, Englisch und andere Sprachen mit starken regionalen Unterschieden. Testen Sie genau die Stimme und das Skript, die Sie veröffentlichen möchten, anstatt die Sprachliste des Modells als Garantie für den Akzent zu betrachten.
Sprachqualität: Natürlichkeit, Konsistenz und die Belege
ElevenLabs beschreibt „Multilingual v2“ als lebensecht, emotional sensibel und sprachübergreifend konsistent. Dabei handelt es sich um Herstellerangaben. Sie sind hilfreich, um die beabsichtigte Position des Modells zu verstehen, sollten jedoch nicht mit neutralen Tests verwechselt werden.
Unabhängige Belege fallen geringer aus. Artificial Analysis listete „Multilingual v2“ bei einer Überprüfung am 11. August 2026 in seiner „Provider Voice Arena“ mit etwa 1100,07 Elo auf. Die Arena nutzt gepaarte Hörerpräferenzen und acht Anbieter-Stimmen in US- und britischem Englisch, aufgeteilt nach männlichen und weiblichen Stimmen. Dies sind transparente, modellspezifische Belege für die Präferenz bei englischen Stimmen; sie beweisen jedoch keine gleichwertige Leistung in allen 29 Sprachen, regionalen Akzenten oder langen Skripten.
Die Rückmeldungen der Öffentlichkeit sind gemischt, doch die Stichprobe ist zu klein, um die Nutzerbasis als Ganzes zu beschreiben. In einer Diskussion aus dem Jahr 2024 beschrieben Kommentatoren v2 als realistischer als v1, berichteten jedoch gleichzeitig von gelegentlichen Problemen mit der Konsistenz der Akzente. Ein anderer Nutzer berichtete von einer kurzen Phase mit Geschwindigkeits- und Konsistenzproblemen. In einer späteren, mit ElevenLabs in Verbindung stehenden Antwort wurde „Multilingual v2“ oder „Turbo v2“ für konsistentere Langform-Arbeiten empfohlen. Diese Beiträge sind nützliche Warnsignale, jedoch keine Prävalenzdaten oder kontrollierte Benchmarks.
Was lässt sich mit Sicherheit sagen?
- Das Modell wird weiterhin offiziell unterstützt und ist auf gleichbleibend hochwertige Langform-Sprachausgabe ausgelegt.
- Unabhängige Daten zur Präferenz für Englisch verleihen dem System innerhalb einer begrenzten Auswahl an englischen Stimmen ein glaubwürdiges externes Signal.
- Die Qualität der Aussprache hängt von der Sprache, der Region, der Stimmauswahl und der Schrift ab – nicht nur von der Modell-ID.
- Objektive Audioüberprüfungen können Abschneidungen, Übersteuerungen, Formatprobleme und zeitliche Unregelmäßigkeiten erkennen, können jedoch das qualifizierte Hören nicht ersetzen.
Sprachübergreifende Konsistenz
Das gleiche Szenario wurde in Englisch, Spanisch und Mandarin mit der Standardstimme „route-default“ generiert. Jeder Player enthält die erste gültige Ausgabe, die gemäß der „frozen“-Testregel beibehalten wurde.
Achten Sie auf: Kontinuität der Sprecheridentität und offensichtliche Ausspracheprobleme. Ein qualifizierter spanischer Zuhörer sollte die Authentizität des Akzents gesondert beurteilen.
Diese Einbettungen dienen als zusätzliches Identitätssignal; sie bewerten weder Natürlichkeit, Aussprache, Akzent, Prosodie noch den emotionalen Ausdruck. Es stand keine Kalibrierungsgruppe mit unterschiedlichen Sprechern zur Verfügung.
Praxistest: Fünf erste gültige Ausgaben über die Anywhere-API-Route
Wir haben die „Anywhere“-Direktverbindung über HTTPS zur Modell-ID getestet eleven-multilingual-v2. Dies ist nicht dasselbe Identifikatorformat wie bei der nativen ElevenLabs-API, die eleven_multilingual_v2. Die Route stellte zwar eine Aufgabenschnittstelle mit dem Modell und der Eingabeaufforderung bereit, bot jedoch keine zuverlässigen Steuerungsmöglichkeiten für die Sprachauswahl, Stabilität, Ähnlichkeit, den Stil, die Geschwindigkeit oder das Ausgabeformat. Daher wurden bei jedem Durchlauf die Standardwerte der Route verwendet.
Der vorab registrierte Datensatz enthielt fünf Skripte: einen englischen Kommentar mit 1.399 Zeichen, dasselbe Szenario auf Englisch, Spanisch und Mandarin sowie einen Aussprache- und Betonungstest, der Namen, Datumsangaben, Währungsangaben, eine Telefonnummer, eine URL und Abkürzungen umfasste. Wir haben die erste gültige, abspielbare Ausgabe beibehalten und keine erneute Ausführung zur Qualitätssicherung durchgeführt.
Zusammenfassung zur Zuverlässigkeit der Route
Alle fünf vorab registrierten Skripte verwendeten die erste gültige, abspielbare Ausgabe. Da die Route keine Sprach- oder Generierungssteuerungen bereitstellte, wurden bei jedem Durchlauf die Standardwerte verwendet.
Umfang: Diese Zahlen beziehen sich auf die „Anywhere“-Route und nicht auf die native ElevenLabs-Latenz oder das GlobalGPT-Browsererlebnis. Bei der Dateiprüfung werden Natürlichkeit, Emotionalität, Akzent oder das lokale Sprechtempo nicht bewertet.
Alle fünf formalen Aufgaben wurden beim ersten Versuch erfolgreich durchgeführt und lieferten dekodierbare Mono-MP3-Dateien mit 44,1 kHz. Die Dateien enthielten keine abgeschnittenen Samples und keine Sprünge zwischen benachbarten Samples, die im lokalen Wellenform-Scan einen Wert von 0,8 überschritten. Diese Prüfungen dienen der Feststellung der Dateiintegrität; sie bewerten nicht die Natürlichkeit.
Kompromisse zwischen Langzeitstabilität, Emotion, Aussprache und Latenz
Lange Skripte
Die Obergrenze von 10.000 Zeichen reicht laut der Zeichenbegrenzungstabelle von ElevenLabs für etwa zehn Minuten Audio aus. Bei längeren Kapiteln sollten Sie an natürlichen Absatz- oder Szenengrenzen trennen, anstatt bei einer willkürlichen Zeichenanzahl zu unterbrechen. Die API bietet vorheriger_Text, next_text, sowie Felder zur Kontinuität der Request-ID, damit benachbarte Chunks nahtlos ineinander übergehen.
Unser Test belegt, dass ein Skript mit 1.399 Zeichen beim ersten Versuch über den „Anywhere“-Weg als gültige Datei erstellt wurde. Dies ist jedoch kein Beweis für die Stabilität bei der vollen Obergrenze von 10.000 Zeichen oder über die gesamte Länge eines Hörbuchs hinweg.
Langzeitstabilität
Achten Sie auf: Tempounterschiede zwischen dem Anfangs- und dem Schlussabschnitt, unangenehme Pausen, Klickgeräusche, Übersteuerungen oder hörbare Störgeräusche.
Objektives Ergebnis: Die Datei wurde fehlerfrei dekodiert, ohne abgeschnittene Samples oder Sprünge zwischen benachbarten Samples über 0,8. Die vom System geschätzte Übertragungsrate betrug in der ersten Hälfte 2,858 Wörter/s und in der zweiten Hälfte 2,670 Wörter/s, wobei keine Anzeichen für eine allgemeine Beschleunigung in der zweiten Hälfte festzustellen waren.
Ein einziger Durchlauf reicht nicht aus, um die Stabilität bei der Grenze von 10.000 Zeichen nachzuweisen oder lokale Taktungsprobleme auszuschließen, die eine manuelle Überprüfung erfordern.
Einstellungen für Emotionen und Stabilität
In der nativen ElevenLabs-API ermöglicht eine geringere Stabilität mehr Variation, während eine höhere Stabilität zu einer gleichmäßigeren Darstellung führt, diese jedoch möglicherweise auch eintöniger macht. Stilistische Übertreibungen können den Ausdruck verstärken, verringern aber möglicherweise auch die Vorhersehbarkeit und erhöhen den Rechenaufwand. Betrachten Sie diese Steuerelemente als kreative Kompromisse und nicht als allgemeine Qualitätsverbesserungen.
Aussprache
Multilingual v2 unterstützt keine Phonem-Tags. ElevenLabs empfiehlt als Workaround Aussprachewörterbücher mit Aliasen. Normalisieren Sie mehrdeutige Zahlen, Abkürzungen, Datumsangaben und URLs vor der Generierung und führen Sie anschließend ein kleines Regressionsskript für Namen oder Begriffe durch, die für Ihre Marke von Bedeutung sind.
Aussprache-Stresstest
Hörverständnis-Kontrollpunkt: Die Offline-Spracherkennung hat die Telefonnummer als “1-800-5555-0199” wiedergegeben. Hören Sie sich die ursprüngliche Nummer und die URL vor der Veröffentlichung sorgfältig an.
Die zusätzliche Ziffer ist kein bestätigter TTS-Fehler. Bei der Spracherkennung können Fehler auftreten, daher handelt es sich hierbei eher um einen Kontrollpunkt zur Überprüfung als um eine endgültige Beurteilung der Aussprache.
Latenz
Multilingual v2 ist nicht die Option mit geringer Latenz von ElevenLabs. Laut ElevenLabs weist es eine höhere Latenz auf als die Flash-Modelle. Unsere gemessenen Routenzeiten lagen bei den fünf formalen Aufgaben zwischen 10,161 und 31,489 Sekunden, doch diese Zahlen umfassen die ’Anywhere“-Aufgabe sowie Netzwerk-, Warteschlangen- und Dateiübertragungszeiten. Sie dürfen nicht als native Latenz des ElevenLabs-Modells angesehen werden.
So nutzen Sie die Eleven Multilingual v2-API
Native ElevenLabs-API-Anfrage
Verwenden Sie die native Modell-ID eleven_multilingual_v2 im JSON-Body und geben Sie die ausgewählte Sprach-ID im Endpunkt ein.
https://api.elevenlabs.io/v1/text-to-speech/{voice_id}curl -X POST "https://api.elevenlabs.io/v1/text-to-speech/YOUR_VOICE_ID" \
-H "xi-api-key: $ELEVENLABS_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"text": "Hier kommt Ihr mehrsprachiger Vorlesetext.",
"model_id": "eleven_multilingual_v2",
"voice_settings": {
"stability": 0.5,
"similarity_boost": 0,75,
"style": 0,
"use_speaker_boost": true,
"speed": 1,0
}
}' \
--output narration.mp3Wichtige Parameter und Grenzwerte
| Parameter | Was es steuert | Praktischer Hinweis |
|---|---|---|
voice_id | Ausgewählte ElevenLabs-Stimme | Wählen Sie eine Stimme, deren Akzent zur Zielsprache und zur Region passt. |
Modell-ID | Synthesemodell | Verwenden Sie eleven_multilingual_v2. |
Stabilität | Variation versus Beständigkeit | Die unteren Werte können stärker schwanken; die oberen Werte können zurückhaltender ausfallen. |
similarity_boost | Ähnlichkeit mit der Referenzstimme | Hohe Werte können bei der Identifizierung helfen, garantieren diese jedoch nicht sprachübergreifend. |
Stil | Stilistische Übertreibung | Bei Anwendungen, bei denen es auf Wiederholgenauigkeit ankommt, ist Vorsicht geboten. |
use_speaker_boost | Zusätzliche Verarbeitung zur Sprecherähnlichkeit | Kann zu einer erhöhten Latenz führen. |
Geschwindigkeit | Wiedergabetempo | Überprüfen Sie die Zahlen und die Zeichensetzung nach der Änderung. |
vorheriger_Text / next_text | Kontext rund um einen Abschnitt | Nützlich beim Aufteilen langer Skripte. |
Sprachcode | Sprachliche Durchsetzung | Wird in der aktuellen API-Referenz für „multilingual_v2“-Modelle nicht unterstützt. |
Das ist wichtig: Speichern Sie API-Schlüssel in einer sicheren Umgebungsvariablen. Fügen Sie niemals einen echten Schlüssel in den Code eines öffentlich zugänglichen Artikels ein.
Preise für die Eleven Multilingual v2-API
Auf der API-Preisseite von ’ElevenLabs“ wurden „Multilingual v2“ und „v3“ unter folgender Adresse aufgeführt: $0,10 pro 1.000 Zeichen Stand: 11. August 2026. Steuern, Abgaben und Zölle sind nicht enthalten.
Preise für die direkte API-Nutzung
Zum offiziellen Satz von $0,10 pro 1.000 Zeichen für Multilingual v2 und v3:
Preise für die ElevenLabs-API, Stand: 11. August 2026. Steuern, Abgaben und Zölle sind nicht enthalten.Direkte API oder GlobalGPT?
| Route | Preisübersicht | Wie Sie arbeiten | Das beste Preis-Leistungs-Verhältnis bei |
|---|---|---|---|
| ElevenLabs-API | $0.10 / 1.000 Zeichen | Native Anfragen, Sprachausgabe, Einstellungen und verbrauchsabhängige Abrechnung | Sie benötigen Entwickler-Steuerelemente und Produktintegration |
| GlobalGPT Das beste Preis-Leistungs-Verhältnis | Basis $5,80/Monat Pro $10,80/Monat Unbegrenzt $25/Monat | Zahlreiche KI-Modelle und Kreativtools auf einer Browser-Plattform, einschließlich Zugriff auf den Audio-Generator | Audio ist Teil eines umfassenderen Arbeitsablaufs, der das Verfassen von Texten, Recherchen, die Bearbeitung von Bildern und Videos sowie den Vergleich von Modellen umfasst. |
Bei diesem Tarif beläuft sich der Preis für eine Anfrage mit einer maximalen Länge von 10.000 Zeichen auf $1.00 vor Steuern. Die tatsächlichen Projektkosten hängen davon ab, wie viel Text Sie generieren, wie oft Sie die Generierung wiederholen und ob Sie nicht gelungene Aufnahmen behalten. Legen Sie Ihr Budget anhand der Zeichenanzahl statt anhand der Audiominuten fest.
Für Entwickler, die keinen nativen API-Workflow aufbauen müssen, bietet GlobalGPT ein praktischeres Wertversprechen. Bei einer Überprüfung am 11. August 2026 beliefen sich die Kosten für die Jahresabonnements auf $5,80 pro Monat für „Basic“, $10,80 für „Pro“ und $25 für „Unlimited“, wobei mehrere KI-Modelle und Kreativtools in einem Abonnement kombiniert wurden. Die GlobalGPT-Audiogenerator Enthält „Eleven Multilingual v2“ und „Eleven v3“ in einer Browser-Arbeitsumgebung, sodass Sie Sprachausgaben generieren und beide Modelle vergleichen können, ohne zuvor eine API-Anfrage aufsetzen zu müssen.
GlobalGPT verwendet ein eigenes Credit-System, daher handelt es sich hierbei nicht um einen direkten Preisvergleich pro Zeichen mit der ElevenLabs-API. Wenn Audio jedoch Teil eines umfassenderen Arbeitsablaufs ist, der das Schreiben, Recherchen, Bilder, Videos oder mehrere KI-Modelle umfasst, GlobalGPT ist insgesamt die preislich attraktivere Wahl. Sie können Vergleichen Sie hier die GlobalGPT-Tarife.
Eleven Multilingual v2 vs. Eleven v3 vs. Flash v2.5
Für welches ElevenLabs-Modell sollten Sie sich entscheiden?
Wählen Sie das Modell entsprechend der jeweiligen Aufgabe aus, anstatt sich allein nach dem Erscheinungsdatum zu richten.
Mehrsprachig v2
Wählen Sie: Konsequente Sprachausgabe, bewährte Arbeitsabläufe, Unterstützung von 29 Sprachen und Skripte mit bis zu 10.000 Zeichen.
Eleven v3
Wählen Sie: dramatische Darbietung, Werke mit mehreren Sprechern und eine umfassendere Abdeckung von über 70 Sprachen.
Flash v2.5
Wählen Sie: reaktionsschnelle Produkte, hoher Durchsatz, Anfragen mit 40.000 Zeichen und geringere API-Kosten.
| Modell | Sprachen | Zeichenbegrenzung | Offizielle Betonung | Beste Passform |
|---|---|---|---|---|
| Mehrsprachig v2 | 29 | 10,000 | Langzeitstabilität und gleichbleibende Qualität | Sprechaufnahmen, Kurse, Lokalisierung, etablierte Arbeitsabläufe für Sprachaufnahmen |
| Eleven v3 | 70+ | 5,000 | Ausdrucksstarke Sprache und Dialoge mit mehreren Sprechern | Darstellung, Figuren, dramatische Umsetzung, breiteres Sprachspektrum |
| Flash v2.5 | 32 | 40,000 | Eine Modelllatenz von etwa 75 ms und geringerer API-Aufwand | Interaktive Produkte, Durchsatz, längere Anfragen, kostensensitive Skalierung |
GlobalGPT enthält außerdem „Eleven v3“ im selben Audio-Generator. Führen Sie dasselbe kurze Skript durch beide Modelle: Verwenden Sie „Multilingual v2“ als Grundlage für eine gleichmäßige Erzählstimme und vergleichen Sie diese anschließend mit „v3“, wenn Sie eine ausdrucksstärkere Vortragsweise wünschen. Ihr eigenes Skript eignet sich besser als Entscheidungshilfe als eine allgemeine Demo, da es die Namen, die Zeichensetzung, das Sprechtempo und die Sprachwechsel offenlegt, die für Ihr Projekt von Bedeutung sind.
Wer sollte – und wer sollte nicht – Multilingual v2 verwenden?
Gute Passform
- Sprecher, die Kurse, Erklärvideos, Unternehmensvideos oder lokalisierte Voiceovers produzieren.
- Teams, die bereits über ein validiertes ElevenLabs-Sprachmodell verfügen und eine stabile Modell-ID wünschen.
- Projekte, die eine der 29 unterstützten Sprachen und Schriftzeichen verwenden und die die in Version 3 festgelegte Zeichenbegrenzung von 5.000 Zeichen überschreiten.
- Entwickler, denen native Sprachsteuerung und Chunk-Kontinuitätsfelder wichtiger sind als eine möglichst geringe Latenz.
Suchen Sie woanders, wenn
- Wenn Sie ausdrucksstarkes Schauspiel, natürliche Dialoge mit mehreren Sprechern oder eine Sprache benötigen, die nicht in der Liste der 29 Sprachen enthalten ist, sollten Sie mit Eleven v3 beginnen.
- Sie entwickeln einen responsiven Sprachassistenten oder einen Dienst mit hohem Durchsatz; prüfen Sie Flash v2.5.
- Sie benötigen eine Markierung auf Phonemebene; Multilingual v2 unterstützt keine Phonem-Tags.
- Sie benötigen einen garantierten regionalen Akzent, ohne dass eine passende Stimme und ein echtes Skript getestet werden müssen.
- Sie benötigen eine abschließende subjektive Qualitätsbeurteilung, bevor ein qualifizierter Hörer Ihre Zielsprachen geprüft hat.
Häufig gestellte Fragen
Wird „Eleven Multilingual v2“ im Jahr 2026 noch erhältlich sein?
Ja. ElevenLabs hat es als Flaggschiff-Text-to-Speech-Modell aufgeführt und es bei der Überprüfung am 11. August 2026 nicht in die Tabelle der veralteten Modelle aufgenommen.
Wann wurde „Eleven Multilingual v2“ veröffentlicht?
ElevenLabs hat am 22. August 2023 “Multilingual v2” angekündigt. Die Angabe „2026“ in diesem Testbericht bezieht sich auf das Datum des Testberichts und nicht auf das Erscheinungsjahr.
Wie viele Sprachen unterstützt Eleven Multilingual v2?
Es unterstützt offiziell 29 Sprachen, darunter Englisch, Spanisch, Chinesisch, Japanisch, Deutsch, Französisch, Hindi, Koreanisch, Portugiesisch, Arabisch und Russisch.
Wie lautet die Modell-ID von „Eleven Multilingual v2“?
Die native ElevenLabs-API-Modell-ID lautet eleven_multilingual_v2. Auf der „Anywhere“-Teststrecke wurde die separate, durch Bindestriche getrennte Kennung verwendet eleven-multilingual-v2.
Wie viele Zeichen sind maximal zulässig?
Die offizielle Obergrenze für eine einzelne Anfrage liegt bei 10.000 Zeichen, was nach Schätzungen von ElevenLabs etwa zehn Minuten Audio entspricht.
Ist Multilingual v2 besser als Eleven v3?
Keine der beiden Varianten ist in jeder Hinsicht besser. Multilingual v2 ist die stabilere Wahl für längere Anfragen; v3 bietet eine breitere Sprachabdeckung, eine ausdrucksstärkere Wiedergabe und Funktionen für mehrere Sprecher.
Eignet sich „Multilingual v2“ für längere Erzählungen?
ElevenLabs wird als das stabilste Langform-Modell des Unternehmens positioniert. Unser Routentest mit 1.399 Zeichen wurde erfolgreich abgeschlossen, doch dieser einzelne Durchlauf beweist noch nicht die Stabilität bei einem ganzen Buch oder bei 10.000 Zeichen.
Kann ich in der API einen Sprachcode festlegen?
In der aktuellen Referenz zur „Create Speech“-API heißt es Sprachcode wird bei Modellen der Version „multilingual_v2“ nicht unterstützt.
Unterstützt Multilingual v2 Phonem-Tags?
Nr. ElevenLabs empfiehlt Aussprachewörterbücher mit Aliasbezeichnungen, wenn Sie die Wiedergabe von Namen oder Fachbegriffen steuern müssen.
Wie viel kostet die API?
ElevenLabs hat „Multilingual v2“ am 11. August 2026 mit einem Preis von $0,10 pro 1.000 Zeichen notiert, ohne Steuern, Abgaben und Zölle.
Endgültiges Urteil
Eleven Multilingual v2 hat sich einen festen Platz im ElevenLabs-Portfolio für 2026 gesichert: Es ist die bewährte Wahl für gleichbleibende mehrsprachige Sprachausgabe, einen erprobten Sprach-Workflow und Anfragen mit bis zu 10.000 Zeichen. Es ist jedoch nicht automatisch die beste Wahl für jedes TTS-Projekt. Eleven v3 ist der bessere Ausgangspunkt für ausdrucksstarkes Sprechen und eine größere Sprachauswahl, während Flash v2.5 auf Geschwindigkeit und Skalierbarkeit ausgelegt ist.
Unser objektiver Test liefert wertvolle Gewissheit hinsichtlich der Zuverlässigkeit der Route und der Dateiintegrität: Alle fünf formalen „Anywhere“-Aufgaben wurden beim ersten Versuch abgeschlossen, erzeugten gültige 44,1-kHz-Mono-MP3-Dateien und blieben innerhalb der vorab festgelegten Kostengrenze. Er ersetzt jedoch nicht das menschliche Hören, weshalb wir allein auf der Grundlage maschineller Prüfungen keine subjektiven Bewertungen hinsichtlich Natürlichkeit, Emotionalität oder Akzent vergeben.
Bringe einen Absatz aus deiner nächsten Erzählung, deinem nächsten Kurs oder deinem lokalisierten Video mit zu Der Audiogenerator von GlobalGPT. Beginnen Sie mit „Eleven Multilingual v2“, achten Sie auf eine einheitliche Sprachausgabe und ein einheitliches Skript und vergleichen Sie es mit „Eleven v3“, wenn es auf eine ausdrucksstarke Sprachausgabe ankommt. Das ist ein direkter und praktischer Weg, um das Modell auszuwählen, das zu Ihrer Arbeit passt.




