Lire un texte et le jouer, ce n’est pas la même chose.
Donnez à un logiciel de lecture la phrase « Ah, super, tu es là » : il prononce les mots. Donnez-la à une comédienne : elle demande ce qui vient de se passer. Le personnage est-il soulagé ? Sarcastique ? Quelqu’un vient-il d’arriver en retard à une réunion ?
Les versions précédentes d’ElevenLabs savaient jouer une réplique si on leur disait comment. Eleven v4 essaie de le deviner seul. Selon ElevenLabs, il lit la conversation qui l’entoure — qui parle, comment l’échange s’est envenimé, ce qui vient d’être dit — et adapte chaque réplique.
ElevenLabs a lancé Eleven v4 le 28 septembre 2026, avec Eleven v4 Turbo, une version plus rapide pour les agents vocaux en temps réel. Les deux sont disponibles dans les applications et l’API d’ElevenLabs, y compris dans l’offre gratuite.
Ce qu’en disent les auditeurs
Le chiffre qui compte le plus pour un modèle vocal est simple : lequel les gens préfèrent-ils quand ils ne voient pas l’étiquette ?
Artificial Analysis gère une arène Provider Voice qui répond exactement à cette question. Les auditeurs écoutent deux extraits anonymes du même texte et choisissent le plus naturel, et les votes sont convertis en scores Elo, comme aux échecs. En septembre 2026, Eleven v4 a pris la première place avec 1319 Elo, devant Cartesia Sonic 3.6 à 1276 et Gemini 3.8 Flash TTS de Google à 1267. Artificial Analysis le classe aussi premier en robustesse de prononciation — bien dire les mots difficiles — et deuxième en voix contrôlée.
ElevenLabs y ajoute son propre test à l’aveugle, où environ 75 % des auditeurs ont préféré v4. C’est un chiffre de l’éditeur : c’est au classement de l’arène qu’il faut se fier.
Ce qui change depuis v3
v3 avait introduit les balises audio : de courtes indications entre crochets, comme [whispers] ou [laughs], qui modifient la façon de dire une réplique. v4 prolonge cette idée :
- Les balises se combinent et s’enchaînent. Vous pouvez associer plusieurs indications, et le modèle les suit dans l’ordre au fil d’un passage.
- Il écoute le contexte. Dans un dialogue, les réponses prennent le ton de ce qui précède, ce qui compte dans les disputes, les montées de tension et les « ne quittez pas » du service client.
- Une prononciation qu’on peut épeler. Écrivez un mot en alphabet phonétique international (API, ou IPA en anglais) entre barres obliques, et v4 le prononcera ainsi. ElevenLabs affirme que c’est désormais bien plus fiable.
- Des requêtes plus longues. Jusqu’à 10 000 caractères par requête, soit environ dix minutes d’audio, et un meilleur raccord quand on enchaîne les requêtes.
- Des voix plus stables. Une nouvelle méthode garde l’identité d’une voix constante sur les longues narrations et les prises répétées, jusqu’ici un point faible des longs projets.
Les langues passent d’environ 70 à plus de 90, avec les plus nets progrès en japonais, portugais du Brésil, mandarin et cantonais. Une même voix peut maintenant parler n’importe quelle langue prise en charge sans perdre son identité.
Le clonage vocal est aussi plus rapide. Un Instant Voice Clone ne demande plus qu’environ 10 secondes d’audio. Pour la plus haute fidélité, les Professional Voice Clones sont également pris en charge.
Turbo : des voix avec qui parler
Un agent vocal vit ou meurt par son timing. Si la réponse démarre une bonne seconde après que vous avez fini de parler, la conversation ressemble à une mauvaise ligne téléphonique.
Eleven v4 Turbo est fait pour ça. ElevenLabs annonce une inférence médiane d’environ 100 ms et environ 150 ms avant le premier son, contre 262 à 814 ms pour les concurrents testés. Ce sont les mesures de l’entreprise elle-même, hors délais réseau, mais elles placent Turbo dans la durée d’une pause naturelle entre deux personnes. Il coûte moitié moins que le modèle complet.
Le bémol honnête
C’est l’option premium. Au prix catalogue, Eleven v4 coûte 0,08 dollar pour 1 000 caractères, ce qu’Artificial Analysis enregistre comme 80 dollars le million de caractères. Cartesia Sonic 3.6 coûte 49 dollars et Gemini 3.8 Flash TTS 16,49 dollars pour la même quantité. Pour de la narration en masse où « clair et agréable » suffit, ces options sont bien moins chères. ElevenLabs applique une remise de lancement de 72 % jusqu’au 12 octobre 2026, qui ramène v4 à 0,022 dollar pour 1 000 caractères, mais établissez vos budgets sur le prix catalogue.
Les commandes sont différentes. Comme v3, v4 ne prend pas en charge les balises de pause SSML, le balisage que beaucoup d’anciens scripts de synthèse vocale utilisent pour les pauses. La direction passe par la ponctuation, les balises audio et la transcription phonétique. Si vous avez déjà une chaîne de production, réécrivez quelques scripts et réécoutez vos voix sur v4 avant de tout basculer.
Les bons clones sont à double tranchant. Une copie convaincante de la voix de quelqu’un à partir de dix secondes d’audio est utile aux créateurs et dangereuse entre de mauvaises mains. ElevenLabs applique des vérifications et des garde-fous, mais le consentement et les droits commerciaux restent sous votre responsabilité.
À qui il s’adresse
| Si vous avez besoin de… | Prenez | Pourquoi |
|---|---|---|
| Livres audio, personnages, doublage où l’interprétation compte | Eleven v4 | En tête de l’arène d’écoute indépendante, avec un contrôle fin |
| Un agent vocal ou un assistant en direct | Eleven v4 Turbo | ~150 ms avant le premier son, moitié prix |
| D’énormes volumes de narration simple à petit budget | Gemini 3.8 Flash TTS ou Cartesia Sonic 3.6 | Une fraction du prix par caractère |
| Des chansons avec voix et instruments | Suno v6 | Un générateur de musique, pas un outil vocal |
Le verdict
Eleven v4 est le modèle vocal à choisir quand la prise doit sonner dirigée plutôt que lue. Il domine l’arène indépendante, parle plus de 90 langues et vous donne de vrais outils pour façonner une interprétation. Ce n’est pas la façon la moins chère de transformer du texte en voix, et il n’a pas besoin de l’être : quand la voix est le produit, c’est celle que choisissent les auditeurs.