Puesto #2 Música y Voz — Sonido desde Cero
ElevenLabs

ElevenLabs v4

ElevenLabs v3 sabía interpretar una frase si le decías cómo. Eleven v4 lee toda la escena —quién habla, qué acaba de pasar, cuánto se ha tensado la conversación— y la interpreta en consecuencia. Los oyentes de la arena de voces a ciegas de Artificial Analysis ya lo sitúan en primer lugar, y una versión Turbo más rápida lleva esas mismas voces a la conversación en directo.

Actualizado 29 de septiembre de 2026 VoiceTTS90+ Languages
Ideal para

ElevenLabs v3 sabía interpretar una frase si le decías cómo. Eleven v4 lee toda la escena —quién habla, qué acaba de pasar, cuánto se ha tensado la conversación— y la interpreta en consecuencia. Los oyentes de la arena de voces a ciegas de Artificial Analysis ya lo sitúan en primer lugar, y una versión Turbo más rápida lleva esas mismas voces a la conversación en directo.

Por qué gana

N.º 1 en la arena Provider Voice de Artificial Analysis en septiembre de 2026 (1319 Elo, por delante de Cartesia Sonic 3.6 con 1276 y Gemini 3.8 Flash TTS con 1267). Más de 90 idiomas, hasta 10.000 caracteres por petición, etiquetas de audio combinables, pronunciación en IPA y clones de voz instantáneos a partir de unos 10 segundos de audio. Según ElevenLabs, el modelo Turbo responde en unos 150 ms.

Ten en cuenta

A precio de tarifa, 0,08 dólares por cada 1.000 caracteres (80 dólares por millón), cuesta más que Cartesia (49 dólares) y mucho más que Gemini 3.8 Flash TTS (16,49 dólares). Hay un descuento de lanzamiento del 72 % hasta el 12 de octubre de 2026. No admite etiquetas de pausa SSML, y unas voces tan realistas mantienen muy presentes las cuestiones de consentimiento y mal uso.

01

Lo que realmente es

No es lo mismo leer un guion que interpretarlo.

Si le das a un lector de texto la frase «Ah, genial, ya estás aquí», dice las palabras. Si se la das a una actriz, pregunta qué acaba de pasar. ¿El personaje está aliviado? ¿Es sarcástico? ¿Alguien acaba de llegar tarde a una reunión?

Las versiones anteriores de ElevenLabs sabían interpretar una frase si les decías cómo. Eleven v4 intenta averiguarlo por sí mismo. Según ElevenLabs, lee la conversación que la rodea —quién habla, cómo ha ido subiendo el tono, qué se acaba de decir— y ajusta cada frase a ese contexto.

ElevenLabs lanzó Eleven v4 el 28 de septiembre de 2026, junto con Eleven v4 Turbo, una versión más rápida para agentes de voz en tiempo real. Ambos están disponibles en las aplicaciones y la API de ElevenLabs, también en el plan gratuito.

Lo que dicen los oyentes

La cifra que más importa en un modelo de voz es sencilla: ¿cuál prefiere la gente cuando no ve la etiqueta?

Artificial Analysis tiene una arena Provider Voice que responde justo a eso. Los oyentes escuchan dos clips anónimos del mismo texto y eligen el más natural, y los votos se convierten en puntuaciones Elo, como en el ajedrez. En septiembre de 2026, Eleven v4 quedó primero con 1319 Elo, por delante de Cartesia Sonic 3.6 con 1276 y de Gemini 3.8 Flash TTS de Google con 1267. Artificial Analysis también lo sitúa primero en solidez de pronunciación —acertar con las palabras difíciles— y segundo en voz controlada.

ElevenLabs añade su propia prueba a ciegas, en la que alrededor del 75 % de los oyentes prefirió v4. Es una cifra del fabricante, así que la clasificación de la arena es la que merece confianza.

Qué hay de nuevo desde v3

v3 introdujo las etiquetas de audio: indicaciones breves entre corchetes, como [whispers] o [laughs], que cambian cómo se dice una frase. v4 desarrolla esa idea:

  • Las etiquetas se pueden combinar y encadenar. Puedes juntar indicaciones, y el modelo las sigue en orden a lo largo de un pasaje.
  • Escucha el contexto. En un diálogo, las respuestas toman el tono de lo que vino antes, algo clave en discusiones, momentos de tensión y los «no cuelgue, por favor» de la atención al cliente.
  • Pronunciación que puedes deletrear. Escribe una palabra en IPA, el alfabeto fonético, entre barras, y v4 la dirá así. ElevenLabs asegura que ahora es mucho más fiable.
  • Peticiones más largas. Hasta 10.000 caracteres por petición, unos diez minutos de audio, y mejor empalme al encadenar peticiones.
  • Voces más estables. Un nuevo método mantiene la identidad de una voz en narraciones largas y tomas repetidas, que antes eran un punto débil en proyectos largos.

Los idiomas pasan de unos 70 a más de 90, con los mayores saltos de calidad en japonés, portugués de Brasil, mandarín y cantonés. Una misma voz puede hablar ahora cualquier idioma admitido sin perder su identidad.

También la clonación de voz es más rápida. Un Instant Voice Clone necesita ahora solo unos 10 segundos de audio. Para la máxima fidelidad, también se admiten los Professional Voice Clones.

Turbo: voces con las que se puede hablar

Un agente de voz vive o muere por el ritmo. Si la respuesta empieza un segundo entero después de que dejes de hablar, la conversación parece una mala línea telefónica.

Eleven v4 Turbo está hecho para eso. ElevenLabs informa de una inferencia mediana de unos 100 ms y de unos 150 ms hasta la primera palabra, frente a 262–814 ms de los competidores que probó. Son mediciones de la propia empresa y no incluyen los retrasos de red, pero sitúan a Turbo dentro de una pausa natural entre dos personas que hablan. Cuesta la mitad que el modelo completo.

La pega honesta

Es la opción prémium. A precio de tarifa, Eleven v4 cuesta 0,08 dólares por cada 1.000 caracteres, lo que Artificial Analysis registra como 80 dólares por millón de caracteres. Cartesia Sonic 3.6 cuesta 49 dólares y Gemini 3.8 Flash TTS 16,49 dólares por la misma cantidad. Para narraciones masivas en las que basta con «claro y agradable», esas opciones son mucho más baratas. ElevenLabs aplica un descuento de lanzamiento del 72 % hasta el 12 de octubre de 2026, que deja v4 en 0,022 dólares por cada 1.000 caracteres, pero haz tus presupuestos con el precio de tarifa.

Los controles son distintos. Igual que v3, v4 no admite las etiquetas de pausa SSML, el marcado que usan muchos guiones antiguos de texto a voz para las pausas. La dirección sale de la puntuación, las etiquetas de audio y el IPA. Si ya tienes un flujo de producción, reescribe algunos guiones y vuelve a escuchar tus voces en v4 antes de cambiarlo todo.

Los buenos clones tienen doble filo. Una copia convincente de la voz de alguien a partir de diez segundos de audio es útil para los creadores y peligrosa en malas manos. ElevenLabs aplica verificación y salvaguardas, pero el consentimiento y los derechos comerciales siguen siendo responsabilidad tuya.

Para quién es

Si necesitas… Usa Por qué
Audiolibros, personajes o doblaje donde la interpretación importa Eleven v4 Primero en la arena de escucha independiente, con control fino
Un agente de voz o asistente en directo Eleven v4 Turbo ~150 ms hasta la primera palabra, a mitad de precio
Enormes volúmenes de narración sencilla con poco presupuesto Gemini 3.8 Flash TTS o Cartesia Sonic 3.6 Una fracción del precio por carácter
Canciones con voz e instrumentos Suno v6 Un generador de música, no una herramienta de voz

El veredicto

Eleven v4 es el modelo de voz que conviene elegir cuando la toma tiene que sonar dirigida y no leída. Lidera la arena independiente, habla más de 90 idiomas y te da herramientas reales para dar forma a una interpretación. No es la forma más barata de convertir texto en voz, ni necesita serlo: cuando la voz es el producto, es la que eligen los oyentes.

02

Puntos fuertes y límites honestos

Puntos fuertes

  • La voz que prefieren los oyentes: En la arena Provider Voice de Artificial Analysis, donde la gente elige el más natural de dos clips anónimos, Eleven v4 quedó primero en septiembre de 2026 con 1319 Elo. Cartesia Sonic 3.6 obtuvo 1276 y Gemini 3.8 Flash TTS, 1267. Artificial Analysis también lo sitúa primero en solidez de pronunciación.
  • Dirección, no simple dictado: Las etiquetas de audio como [whispers], [laughs] o [said angrily] ahora pueden combinarse y seguirse en orden, y el modelo tiene en cuenta la conversación que las rodea, de modo que una respuesta suena a respuesta y no a una frase aislada.
  • Pensado para trabajos largos: Cada petición admite hasta 10.000 caracteres (unos diez minutos de audio), y ElevenLabs dice que un nuevo método mantiene estable la identidad de una voz en narraciones largas y en repeticiones de tomas.
  • Más de 90 idiomas con una sola voz: La cobertura pasa de unos 70 a más de 90 idiomas, con las mayores mejoras en japonés, portugués de Brasil, mandarín y cantonés. Una misma voz puede hablar cualquier idioma admitido sin perder su identidad.
  • Lo bastante rápido para conversar: Eleven v4 Turbo está pensado para agentes de voz. ElevenLabs informa de unos 100 ms de inferencia mediana y unos 150 ms hasta la primera palabra, frente a 262–814 ms de los rivales que probó.

Limitaciones honestas

  • Precio prémium: A precio de tarifa, 80 dólares por millón de caracteres es 1,6 veces lo de Cartesia Sonic 3.6 y casi cinco veces lo de Gemini 3.8 Flash TTS. El descuento de lanzamiento del 72 % (0,022 dólares por cada 1.000 caracteres) termina el 12 de octubre de 2026.
  • Cifras del fabricante en algunos datos: La preferencia del 75 % en pruebas a ciegas y la comparación de latencia proceden de pruebas de la propia ElevenLabs. La clasificación de la arena es la cifra independiente en la que confiar.
  • Controles nuevos que aprender: Igual que v3, v4 ignora las etiquetas de pausa SSML. Las pausas y el énfasis salen de la puntuación, las etiquetas de audio y la escritura en IPA, así que puede que haya que reescribir guiones antiguos, y conviene volver a escuchar tus voces en v4 antes de pasar la producción.
  • Los clones plantean preguntas reales: Un clon convincente a partir de diez segundos de audio es potente y fácil de usar mal. ElevenLabs aplica verificación y salvaguardas, pero el consentimiento y los derechos comerciales siguen siendo responsabilidad tuya.
03

Resumen de Benchmarks

Arena Provider Voice de Artificial Analysis — n.º 1, 1319 Elo

Arena de escucha a ciegas independiente, septiembre de 2026. Cartesia Sonic 3.6 1276, Gemini 3.8 Flash TTS 1267. Eleven v4 también es primero en la prueba de solidez de pronunciación de Artificial Analysis y segundo en voz controlada.

Preferencia a ciegas — ~75 % (fabricante)

ElevenLabs informa de que alrededor del 75 % de los oyentes prefirió v4 en comparaciones directas a ciegas. La prueba la realizó ElevenLabs.

Latencia — ~150 ms hasta la primera palabra (Turbo, fabricante)

Cifras medianas comunicadas por ElevenLabs para Eleven v4 Turbo: unos 100 ms de inferencia y unos 150 ms hasta la primera palabra, sin contar el tiempo de red ni de la aplicación.

Precio — 0,08 dólares / 1.000 caracteres (Turbo 0,04 dólares)

Precios de tarifa de la API; 72 % de descuento hasta el 12 de octubre de 2026. Artificial Analysis indica 80 dólares por millón de caracteres, frente a 49 dólares de Cartesia Sonic 3.6 y 16,49 dólares de Gemini 3.8 Flash TTS. El plan gratuito incluye 10.000 caracteres de v4; los planes de pago empiezan en 6 dólares al mes.

04

El Veredicto

Eleven v4 es el modelo de voz que conviene elegir cuando la interpretación tiene que sonar dirigida: audiolibros, personajes de videojuegos, doblaje y agentes de voz que deben sonar como personas y no como un menú telefónico. Lidera la arena de escucha independiente y aporta control real con etiquetas combinables e IPA. No es la forma más barata de convertir texto en voz —Gemini y Cartesia cuestan mucho menos para narraciones masivas donde basta con que suene bien—, pero cuando la toma importa, es la voz que eligen los oyentes.

05

Preguntas frecuentes