Rang #2 Musik & Stimme — Klang aus dem Nichts
ElevenLabs

ElevenLabs v4

ElevenLabs v3 konnte eine Zeile spielen, wenn man ihm sagte, wie. Eleven v4 liest die ganze Szene – wer spricht, was gerade passiert ist, wie angespannt das Gespräch geworden ist – und spielt sie entsprechend. Im blinden Stimmenvergleich von Artificial Analysis setzen Zuhörer es inzwischen auf Platz 1, und eine schnellere Turbo-Version bringt dieselben Stimmen ins Live-Gespräch.

Aktualisiert 29. September 2026 VoiceTTS90+ Languages
Am besten für

ElevenLabs v3 konnte eine Zeile spielen, wenn man ihm sagte, wie. Eleven v4 liest die ganze Szene – wer spricht, was gerade passiert ist, wie angespannt das Gespräch geworden ist – und spielt sie entsprechend. Im blinden Stimmenvergleich von Artificial Analysis setzen Zuhörer es inzwischen auf Platz 1, und eine schnellere Turbo-Version bringt dieselben Stimmen ins Live-Gespräch.

Warum es gewinnt

Platz 1 in der Provider-Voice-Arena von Artificial Analysis im September 2026 (1319 Elo, vor Cartesia Sonic 3.6 mit 1276 und Gemini 3.8 Flash TTS mit 1267). Über 90 Sprachen, bis zu 10.000 Zeichen pro Anfrage, kombinierbare Audio-Tags, IPA-Aussprache und Sofort-Stimmklone aus etwa 10 Sekunden Audio. Das Turbo-Modell antwortet laut ElevenLabs in etwa 150 ms.

Zu beachten

Zum Listenpreis von 0,08 US-Dollar pro 1.000 Zeichen (80 US-Dollar pro Million) kostet es mehr als Cartesia (49 US-Dollar) und weit mehr als Gemini 3.8 Flash TTS (16,49 US-Dollar). Ein Einführungsrabatt von 72 % gilt bis zum 12. Oktober 2026. SSML-Pausen-Tags werden nicht unterstützt, und so realistische Stimmen halten Fragen nach Einwilligung und Missbrauch im Vordergrund.

01

Was es wirklich ist

Es ist ein Unterschied, ob man ein Skript vorliest oder spielt.

Gibt man einem Vorleseprogramm den Satz „Ach, schön, du bist da“, sagt es die Wörter. Gibt man ihn einer Schauspielerin, fragt sie, was kurz davor passiert ist. Ist die Figur erleichtert? Sarkastisch? Kommt gerade jemand zu spät in eine Besprechung?

Frühere Versionen von ElevenLabs konnten eine Zeile spielen, wenn man ihnen sagte, wie. Eleven v4 versucht, das selbst herauszufinden. Laut ElevenLabs liest es das umgebende Gespräch – wer spricht, wie sich der Austausch zugespitzt hat, was gerade gesagt wurde – und gestaltet jede Zeile passend dazu.

ElevenLabs hat Eleven v4 am 28. September 2026 veröffentlicht, zusammen mit Eleven v4 Turbo, einer schnelleren Version für Echtzeit-Sprachagenten. Beide sind in den ElevenLabs-Apps und in der API verfügbar, auch im kostenlosen Tarif.

Was Zuhörer sagen

Die wichtigste Zahl für ein Stimmmodell ist einfach: Welches bevorzugen Menschen, wenn sie das Etikett nicht sehen?

Artificial Analysis betreibt eine Provider-Voice-Arena, die genau das beantwortet. Zuhörer hören zwei anonyme Clips desselben Textes und wählen den natürlicheren, und die Stimmen werden wie beim Schach in Elo-Werte umgerechnet. Im September 2026 belegte Eleven v4 mit 1319 Elo den ersten Platz, vor Cartesia Sonic 3.6 mit 1276 und Googles Gemini 3.8 Flash TTS mit 1267. Artificial Analysis setzt es außerdem bei der Aussprache-Robustheit – schwierige Wörter richtig aussprechen – auf Platz 1 und bei kontrollierter Stimme auf Platz 2.

ElevenLabs ergänzt einen eigenen Blindtest, in dem etwa 75 % der Zuhörer v4 bevorzugten. Das ist eine Herstellerzahl; verlassen sollte man sich auf die Arena-Platzierung.

Was seit v3 neu ist

v3 führte Audio-Tags ein: kurze Regieanweisungen in eckigen Klammern wie [whispers] oder [laughs], die verändern, wie eine Zeile gesprochen wird. v4 baut diese Idee aus:

  • Tags lassen sich kombinieren und aneinanderreihen. Sie können Anweisungen verbinden, und das Modell folgt ihnen der Reihe nach durch eine Passage.
  • Es hört auf den Kontext. Antworten in einem Dialog übernehmen ihren Ton aus dem, was vorher kam – wichtig bei Streitgesprächen, Eskalationen und den „Bitte bleiben Sie dran“-Momenten im Kundenservice.
  • Aussprache, die man buchstabieren kann. Schreiben Sie ein Wort in IPA, dem internationalen Lautschriftalphabet, zwischen Schrägstriche, und v4 spricht es genau so aus. Laut ElevenLabs funktioniert das jetzt deutlich zuverlässiger.
  • Längere Anfragen. Bis zu 10.000 Zeichen pro Anfrage, rund zehn Minuten Audio, und besseres Aneinanderfügen, wenn man mehrere Anfragen verkettet.
  • Stabilere Stimmen. Ein neues Verfahren hält die Identität einer Stimme über lange Erzählungen und wiederholte Aufnahmen konstant – bislang ein Schwachpunkt bei langen Projekten.

Die Zahl der Sprachen wächst von etwa 70 auf mehr als 90, mit den größten Qualitätssprüngen bei Japanisch, brasilianischem Portugiesisch, Mandarin und Kantonesisch. Eine Stimme kann jetzt jede unterstützte Sprache sprechen und behält dabei ihre Identität.

Auch das Klonen von Stimmen ist schneller geworden. Ein Instant Voice Clone braucht jetzt nur noch etwa 10 Sekunden Audio. Für höchste Wiedergabetreue werden auch Professional Voice Clones unterstützt.

Turbo: Stimmen, mit denen man reden kann

Ein Sprachagent steht und fällt mit dem Timing. Beginnt die Antwort eine volle Sekunde, nachdem man aufgehört hat zu sprechen, fühlt sich das Gespräch an wie eine schlechte Telefonverbindung.

Eleven v4 Turbo ist für genau diese Aufgabe gebaut. ElevenLabs meldet eine mediane Inferenzzeit von etwa 100 ms und etwa 150 ms bis zum ersten Laut, gegenüber 262–814 ms bei den getesteten Konkurrenten. Das sind Messungen des Unternehmens selbst, ohne Netzwerkverzögerung, aber sie liegen innerhalb einer natürlichen Gesprächspause zwischen zwei Menschen. Turbo kostet halb so viel wie das volle Modell.

Der ehrliche Haken

Es ist die Premium-Option. Zum Listenpreis kostet Eleven v4 0,08 US-Dollar pro 1.000 Zeichen, was Artificial Analysis als 80 US-Dollar pro Million Zeichen führt. Cartesia Sonic 3.6 kostet für dieselbe Menge 49 US-Dollar, Gemini 3.8 Flash TTS 16,49 US-Dollar. Für Massen-Vertonung, bei der „klar und angenehm“ genügt, sind diese weit günstiger. ElevenLabs gewährt bis zum 12. Oktober 2026 einen Einführungsrabatt von 72 %, womit v4 bei 0,022 US-Dollar pro 1.000 Zeichen liegt – planen Sie Budgets aber mit dem Listenpreis.

Die Steuerung ist anders. Wie v3 unterstützt v4 keine SSML-Pausen-Tags, das Markup, mit dem viele ältere Text-to-Speech-Skripte Pausen setzen. Die Regie kommt stattdessen aus Satzzeichen, Audio-Tags und IPA. Wenn Sie eine bestehende Produktionskette haben, schreiben Sie ein paar Skripte um und hören Sie sich Ihre Stimmen auf v4 erneut an, bevor Sie alles umstellen.

Gute Klone sind ein zweischneidiges Schwert. Eine überzeugende Kopie einer Stimme aus zehn Sekunden Audio ist für Kreative nützlich und in falschen Händen gefährlich. ElevenLabs setzt Verifizierung und Schutzmechanismen ein, doch Einwilligung und kommerzielle Rechte bleiben Ihre Verantwortung.

Für wen es sich eignet

Wenn Sie … brauchen Nehmen Sie Warum
Hörbücher, Figuren, Synchronisation, bei denen die Darbietung zählt Eleven v4 Spitze der unabhängigen Hör-Arena, mit feiner Steuerung
einen Live-Sprachagenten oder Assistenten Eleven v4 Turbo ca. 150 ms bis zum ersten Laut, halber Preis
riesige Mengen schlichter Vertonung mit knappem Budget Gemini 3.8 Flash TTS oder Cartesia Sonic 3.6 Ein Bruchteil des Preises pro Zeichen
Songs mit Gesang und Instrumenten Suno v6 Ein Musikgenerator, kein Stimmwerkzeug

Das Fazit

Eleven v4 ist das Stimmmodell der Wahl, wenn die Aufnahme nach Regie klingen soll statt nach Vorlesen. Es führt die unabhängige Arena an, spricht mehr als 90 Sprachen und gibt Ihnen echte Werkzeuge, um eine Darbietung zu formen. Es ist nicht der billigste Weg, Text in Sprache zu verwandeln, und muss es auch nicht sein: Wenn die Stimme das Produkt ist, ist es die, die Zuhörer wählen.

02

Stärken und ehrliche Grenzen

Zentrale Stärken

  • Die Stimme, die Zuhörer bevorzugen: In der Provider-Voice-Arena von Artificial Analysis, in der Menschen aus zwei anonymen Clips den natürlicheren wählen, belegte Eleven v4 im September 2026 mit 1319 Elo den ersten Platz. Cartesia Sonic 3.6 kam auf 1276, Gemini 3.8 Flash TTS auf 1267. Artificial Analysis führt es außerdem bei der Aussprache-Robustheit auf Platz 1.
  • Regie statt Diktat: Audio-Tags wie [whispers], [laughs] oder [said angrily] lassen sich jetzt kombinieren und nacheinander abarbeiten, und das Modell berücksichtigt das umgebende Gespräch – eine Antwort klingt also wie eine Antwort und nicht wie eine isolierte Zeile.
  • Gebaut für lange Projekte: Jede Anfrage fasst bis zu 10.000 Zeichen (etwa zehn Minuten Audio), und laut ElevenLabs hält ein neues Verfahren die Identität einer Stimme über lange Erzählungen und Neuaufnahmen hinweg stabil.
  • Über 90 Sprachen mit einer Stimme: Die Abdeckung wächst von etwa 70 auf mehr als 90 Sprachen, mit den größten Verbesserungen bei Japanisch, brasilianischem Portugiesisch, Mandarin und Kantonesisch. Eine Stimme kann jede unterstützte Sprache sprechen und behält dabei ihre Identität.
  • Schnell genug für echte Gespräche: Eleven v4 Turbo ist für Sprachagenten gebaut. ElevenLabs meldet etwa 100 ms mediane Inferenzzeit und etwa 150 ms bis zum ersten Laut, gegenüber 262–814 ms bei den getesteten Konkurrenten.

Ehrliche Einschränkungen

  • Premium-Preis: Zum Listenpreis sind 80 US-Dollar pro Million Zeichen das 1,6-Fache von Cartesia Sonic 3.6 und fast das Fünffache von Gemini 3.8 Flash TTS. Der Einführungsrabatt von 72 % (0,022 US-Dollar pro 1.000 Zeichen) endet am 12. Oktober 2026.
  • Herstellerzahlen bei manchen Aussagen: Die 75 % Präferenz im Blindtest und der Latenzvergleich stammen aus ElevenLabs’ eigenen Tests. Die Arena-Platzierung ist die unabhängige Zahl, der man trauen sollte.
  • Neue Steuerung lernen: Wie v3 ignoriert v4 SSML-Pausen-Tags. Pausen und Betonung entstehen durch Satzzeichen, Audio-Tags und IPA-Schreibweisen – ältere Skripte müssen also womöglich umgeschrieben werden, und es lohnt sich, bestehende Stimmen auf v4 noch einmal anzuhören, bevor man die Produktion umstellt.
  • Klone werfen echte Fragen auf: Ein überzeugender Klon aus zehn Sekunden Audio ist mächtig und leicht zu missbrauchen. ElevenLabs setzt Verifizierung und Schutzmechanismen ein, doch Einwilligung und kommerzielle Rechte bleiben Ihre Verantwortung.
03

Benchmark-Übersicht

Artificial Analysis Provider-Voice-Arena — Platz 1, 1319 Elo

Unabhängige blinde Hör-Arena, September 2026. Cartesia Sonic 3.6 1276, Gemini 3.8 Flash TTS 1267. Eleven v4 liegt außerdem im Aussprache-Robustheitstest von Artificial Analysis auf Platz 1 und bei kontrollierter Stimme auf Platz 2.

Blind-Präferenz — ca. 75 % (Hersteller)

ElevenLabs berichtet, dass etwa 75 % der Zuhörer v4 in direkten Blindvergleichen bevorzugten. Der Test wurde von ElevenLabs durchgeführt.

Latenz — ca. 150 ms bis zum ersten Laut (Turbo, Hersteller)

Von ElevenLabs gemeldete Medianwerte für Eleven v4 Turbo: etwa 100 ms Inferenz, etwa 150 ms bis zum ersten Laut, ohne Netzwerk- und Anwendungszeit.

Preis — 0,08 US-Dollar / 1.000 Zeichen (Turbo 0,04 US-Dollar)

API-Listenpreise; bis zum 12. Oktober 2026 72 % günstiger. Artificial Analysis führt 80 US-Dollar pro Million Zeichen, gegenüber 49 US-Dollar für Cartesia Sonic 3.6 und 16,49 US-Dollar für Gemini 3.8 Flash TTS. Der kostenlose Tarif enthält 10.000 v4-Zeichen; Bezahltarife beginnen bei 6 US-Dollar im Monat.

04

Das Fazit

Eleven v4 ist das Stimmmodell der Wahl, wenn die Darbietung nach Regie klingen muss: Hörbücher, Spielfiguren, Synchronisation und Sprachagenten, die wie Menschen klingen sollen statt wie Telefonmenüs. Es führt die unabhängige Hör-Arena an und bietet mit kombinierbaren Tags und IPA echte Kontrolle. Es ist nicht der billigste Weg, Text in Sprache zu verwandeln – Gemini und Cartesia kosten für Massen-Vertonung, bei der „gut genug“ reicht, weit weniger –, aber wenn es auf die Aufnahme ankommt, ist es die Stimme, die Zuhörer wählen.

05

Häufig gestellte Fragen