Es ist ein Unterschied, ob man ein Skript vorliest oder spielt.
Gibt man einem Vorleseprogramm den Satz „Ach, schön, du bist da“, sagt es die Wörter. Gibt man ihn einer Schauspielerin, fragt sie, was kurz davor passiert ist. Ist die Figur erleichtert? Sarkastisch? Kommt gerade jemand zu spät in eine Besprechung?
Frühere Versionen von ElevenLabs konnten eine Zeile spielen, wenn man ihnen sagte, wie. Eleven v4 versucht, das selbst herauszufinden. Laut ElevenLabs liest es das umgebende Gespräch – wer spricht, wie sich der Austausch zugespitzt hat, was gerade gesagt wurde – und gestaltet jede Zeile passend dazu.
ElevenLabs hat Eleven v4 am 28. September 2026 veröffentlicht, zusammen mit Eleven v4 Turbo, einer schnelleren Version für Echtzeit-Sprachagenten. Beide sind in den ElevenLabs-Apps und in der API verfügbar, auch im kostenlosen Tarif.
Was Zuhörer sagen
Die wichtigste Zahl für ein Stimmmodell ist einfach: Welches bevorzugen Menschen, wenn sie das Etikett nicht sehen?
Artificial Analysis betreibt eine Provider-Voice-Arena, die genau das beantwortet. Zuhörer hören zwei anonyme Clips desselben Textes und wählen den natürlicheren, und die Stimmen werden wie beim Schach in Elo-Werte umgerechnet. Im September 2026 belegte Eleven v4 mit 1319 Elo den ersten Platz, vor Cartesia Sonic 3.6 mit 1276 und Googles Gemini 3.8 Flash TTS mit 1267. Artificial Analysis setzt es außerdem bei der Aussprache-Robustheit – schwierige Wörter richtig aussprechen – auf Platz 1 und bei kontrollierter Stimme auf Platz 2.
ElevenLabs ergänzt einen eigenen Blindtest, in dem etwa 75 % der Zuhörer v4 bevorzugten. Das ist eine Herstellerzahl; verlassen sollte man sich auf die Arena-Platzierung.
Was seit v3 neu ist
v3 führte Audio-Tags ein: kurze Regieanweisungen in eckigen Klammern wie [whispers] oder [laughs], die verändern, wie eine Zeile gesprochen wird. v4 baut diese Idee aus:
- Tags lassen sich kombinieren und aneinanderreihen. Sie können Anweisungen verbinden, und das Modell folgt ihnen der Reihe nach durch eine Passage.
- Es hört auf den Kontext. Antworten in einem Dialog übernehmen ihren Ton aus dem, was vorher kam – wichtig bei Streitgesprächen, Eskalationen und den „Bitte bleiben Sie dran“-Momenten im Kundenservice.
- Aussprache, die man buchstabieren kann. Schreiben Sie ein Wort in IPA, dem internationalen Lautschriftalphabet, zwischen Schrägstriche, und v4 spricht es genau so aus. Laut ElevenLabs funktioniert das jetzt deutlich zuverlässiger.
- Längere Anfragen. Bis zu 10.000 Zeichen pro Anfrage, rund zehn Minuten Audio, und besseres Aneinanderfügen, wenn man mehrere Anfragen verkettet.
- Stabilere Stimmen. Ein neues Verfahren hält die Identität einer Stimme über lange Erzählungen und wiederholte Aufnahmen konstant – bislang ein Schwachpunkt bei langen Projekten.
Die Zahl der Sprachen wächst von etwa 70 auf mehr als 90, mit den größten Qualitätssprüngen bei Japanisch, brasilianischem Portugiesisch, Mandarin und Kantonesisch. Eine Stimme kann jetzt jede unterstützte Sprache sprechen und behält dabei ihre Identität.
Auch das Klonen von Stimmen ist schneller geworden. Ein Instant Voice Clone braucht jetzt nur noch etwa 10 Sekunden Audio. Für höchste Wiedergabetreue werden auch Professional Voice Clones unterstützt.
Turbo: Stimmen, mit denen man reden kann
Ein Sprachagent steht und fällt mit dem Timing. Beginnt die Antwort eine volle Sekunde, nachdem man aufgehört hat zu sprechen, fühlt sich das Gespräch an wie eine schlechte Telefonverbindung.
Eleven v4 Turbo ist für genau diese Aufgabe gebaut. ElevenLabs meldet eine mediane Inferenzzeit von etwa 100 ms und etwa 150 ms bis zum ersten Laut, gegenüber 262–814 ms bei den getesteten Konkurrenten. Das sind Messungen des Unternehmens selbst, ohne Netzwerkverzögerung, aber sie liegen innerhalb einer natürlichen Gesprächspause zwischen zwei Menschen. Turbo kostet halb so viel wie das volle Modell.
Der ehrliche Haken
Es ist die Premium-Option. Zum Listenpreis kostet Eleven v4 0,08 US-Dollar pro 1.000 Zeichen, was Artificial Analysis als 80 US-Dollar pro Million Zeichen führt. Cartesia Sonic 3.6 kostet für dieselbe Menge 49 US-Dollar, Gemini 3.8 Flash TTS 16,49 US-Dollar. Für Massen-Vertonung, bei der „klar und angenehm“ genügt, sind diese weit günstiger. ElevenLabs gewährt bis zum 12. Oktober 2026 einen Einführungsrabatt von 72 %, womit v4 bei 0,022 US-Dollar pro 1.000 Zeichen liegt – planen Sie Budgets aber mit dem Listenpreis.
Die Steuerung ist anders. Wie v3 unterstützt v4 keine SSML-Pausen-Tags, das Markup, mit dem viele ältere Text-to-Speech-Skripte Pausen setzen. Die Regie kommt stattdessen aus Satzzeichen, Audio-Tags und IPA. Wenn Sie eine bestehende Produktionskette haben, schreiben Sie ein paar Skripte um und hören Sie sich Ihre Stimmen auf v4 erneut an, bevor Sie alles umstellen.
Gute Klone sind ein zweischneidiges Schwert. Eine überzeugende Kopie einer Stimme aus zehn Sekunden Audio ist für Kreative nützlich und in falschen Händen gefährlich. ElevenLabs setzt Verifizierung und Schutzmechanismen ein, doch Einwilligung und kommerzielle Rechte bleiben Ihre Verantwortung.
Für wen es sich eignet
| Wenn Sie … brauchen | Nehmen Sie | Warum |
|---|---|---|
| Hörbücher, Figuren, Synchronisation, bei denen die Darbietung zählt | Eleven v4 | Spitze der unabhängigen Hör-Arena, mit feiner Steuerung |
| einen Live-Sprachagenten oder Assistenten | Eleven v4 Turbo | ca. 150 ms bis zum ersten Laut, halber Preis |
| riesige Mengen schlichter Vertonung mit knappem Budget | Gemini 3.8 Flash TTS oder Cartesia Sonic 3.6 | Ein Bruchteil des Preises pro Zeichen |
| Songs mit Gesang und Instrumenten | Suno v6 | Ein Musikgenerator, kein Stimmwerkzeug |
Das Fazit
Eleven v4 ist das Stimmmodell der Wahl, wenn die Aufnahme nach Regie klingen soll statt nach Vorlesen. Es führt die unabhängige Arena an, spricht mehr als 90 Sprachen und gibt Ihnen echte Werkzeuge, um eine Darbietung zu formen. Es ist nicht der billigste Weg, Text in Sprache zu verwandeln, und muss es auch nicht sein: Wenn die Stimme das Produkt ist, ist es die, die Zuhörer wählen.