Classé #2 Musique & Voix — Du son à partir de rien
ElevenLabs

ElevenLabs v4

ElevenLabs v3 savait jouer une réplique si on lui disait comment. Eleven v4 lit toute la scène — qui parle, ce qui vient de se passer, à quel point la conversation s'est tendue — et la joue en conséquence. Les auditeurs de l'arène vocale à l'aveugle d'Artificial Analysis le placent désormais en tête, et une version Turbo plus rapide amène ces mêmes voix dans la conversation en direct.

Mis à jour 29 septembre 2026 VoiceTTS90+ Languages
9.1sur 10
Site officiel
Idéal pour

ElevenLabs v3 savait jouer une réplique si on lui disait comment. Eleven v4 lit toute la scène — qui parle, ce qui vient de se passer, à quel point la conversation s'est tendue — et la joue en conséquence. Les auditeurs de l'arène vocale à l'aveugle d'Artificial Analysis le placent désormais en tête, et une version Turbo plus rapide amène ces mêmes voix dans la conversation en direct.

Pourquoi ça Gagne

N° 1 de l'arène Provider Voice d'Artificial Analysis en septembre 2026 (1319 Elo, devant Cartesia Sonic 3.6 à 1276 et Gemini 3.8 Flash TTS à 1267). Plus de 90 langues, jusqu'à 10 000 caractères par requête, balises audio combinables, prononciation par transcription phonétique et clones de voix instantanés à partir d'environ 10 secondes d'audio. Selon ElevenLabs, le modèle Turbo répond en environ 150 ms.

À surveiller

Au prix catalogue de 0,08 dollar pour 1 000 caractères (80 dollars le million), il coûte plus cher que Cartesia (49 dollars) et bien plus que Gemini 3.8 Flash TTS (16,49 dollars). Une remise de lancement de 72 % court jusqu'au 12 octobre 2026. Les balises de pause SSML ne sont pas prises en charge, et des voix aussi réalistes gardent au premier plan les questions de consentement et d'abus.

01

Ce que c'est réellement

Lire un texte et le jouer, ce n’est pas la même chose.

Donnez à un logiciel de lecture la phrase « Ah, super, tu es là » : il prononce les mots. Donnez-la à une comédienne : elle demande ce qui vient de se passer. Le personnage est-il soulagé ? Sarcastique ? Quelqu’un vient-il d’arriver en retard à une réunion ?

Les versions précédentes d’ElevenLabs savaient jouer une réplique si on leur disait comment. Eleven v4 essaie de le deviner seul. Selon ElevenLabs, il lit la conversation qui l’entoure — qui parle, comment l’échange s’est envenimé, ce qui vient d’être dit — et adapte chaque réplique.

ElevenLabs a lancé Eleven v4 le 28 septembre 2026, avec Eleven v4 Turbo, une version plus rapide pour les agents vocaux en temps réel. Les deux sont disponibles dans les applications et l’API d’ElevenLabs, y compris dans l’offre gratuite.

Ce qu’en disent les auditeurs

Le chiffre qui compte le plus pour un modèle vocal est simple : lequel les gens préfèrent-ils quand ils ne voient pas l’étiquette ?

Artificial Analysis gère une arène Provider Voice qui répond exactement à cette question. Les auditeurs écoutent deux extraits anonymes du même texte et choisissent le plus naturel, et les votes sont convertis en scores Elo, comme aux échecs. En septembre 2026, Eleven v4 a pris la première place avec 1319 Elo, devant Cartesia Sonic 3.6 à 1276 et Gemini 3.8 Flash TTS de Google à 1267. Artificial Analysis le classe aussi premier en robustesse de prononciation — bien dire les mots difficiles — et deuxième en voix contrôlée.

ElevenLabs y ajoute son propre test à l’aveugle, où environ 75 % des auditeurs ont préféré v4. C’est un chiffre de l’éditeur : c’est au classement de l’arène qu’il faut se fier.

Ce qui change depuis v3

v3 avait introduit les balises audio : de courtes indications entre crochets, comme [whispers] ou [laughs], qui modifient la façon de dire une réplique. v4 prolonge cette idée :

  • Les balises se combinent et s’enchaînent. Vous pouvez associer plusieurs indications, et le modèle les suit dans l’ordre au fil d’un passage.
  • Il écoute le contexte. Dans un dialogue, les réponses prennent le ton de ce qui précède, ce qui compte dans les disputes, les montées de tension et les « ne quittez pas » du service client.
  • Une prononciation qu’on peut épeler. Écrivez un mot en alphabet phonétique international (API, ou IPA en anglais) entre barres obliques, et v4 le prononcera ainsi. ElevenLabs affirme que c’est désormais bien plus fiable.
  • Des requêtes plus longues. Jusqu’à 10 000 caractères par requête, soit environ dix minutes d’audio, et un meilleur raccord quand on enchaîne les requêtes.
  • Des voix plus stables. Une nouvelle méthode garde l’identité d’une voix constante sur les longues narrations et les prises répétées, jusqu’ici un point faible des longs projets.

Les langues passent d’environ 70 à plus de 90, avec les plus nets progrès en japonais, portugais du Brésil, mandarin et cantonais. Une même voix peut maintenant parler n’importe quelle langue prise en charge sans perdre son identité.

Le clonage vocal est aussi plus rapide. Un Instant Voice Clone ne demande plus qu’environ 10 secondes d’audio. Pour la plus haute fidélité, les Professional Voice Clones sont également pris en charge.

Turbo : des voix avec qui parler

Un agent vocal vit ou meurt par son timing. Si la réponse démarre une bonne seconde après que vous avez fini de parler, la conversation ressemble à une mauvaise ligne téléphonique.

Eleven v4 Turbo est fait pour ça. ElevenLabs annonce une inférence médiane d’environ 100 ms et environ 150 ms avant le premier son, contre 262 à 814 ms pour les concurrents testés. Ce sont les mesures de l’entreprise elle-même, hors délais réseau, mais elles placent Turbo dans la durée d’une pause naturelle entre deux personnes. Il coûte moitié moins que le modèle complet.

Le bémol honnête

C’est l’option premium. Au prix catalogue, Eleven v4 coûte 0,08 dollar pour 1 000 caractères, ce qu’Artificial Analysis enregistre comme 80 dollars le million de caractères. Cartesia Sonic 3.6 coûte 49 dollars et Gemini 3.8 Flash TTS 16,49 dollars pour la même quantité. Pour de la narration en masse où « clair et agréable » suffit, ces options sont bien moins chères. ElevenLabs applique une remise de lancement de 72 % jusqu’au 12 octobre 2026, qui ramène v4 à 0,022 dollar pour 1 000 caractères, mais établissez vos budgets sur le prix catalogue.

Les commandes sont différentes. Comme v3, v4 ne prend pas en charge les balises de pause SSML, le balisage que beaucoup d’anciens scripts de synthèse vocale utilisent pour les pauses. La direction passe par la ponctuation, les balises audio et la transcription phonétique. Si vous avez déjà une chaîne de production, réécrivez quelques scripts et réécoutez vos voix sur v4 avant de tout basculer.

Les bons clones sont à double tranchant. Une copie convaincante de la voix de quelqu’un à partir de dix secondes d’audio est utile aux créateurs et dangereuse entre de mauvaises mains. ElevenLabs applique des vérifications et des garde-fous, mais le consentement et les droits commerciaux restent sous votre responsabilité.

À qui il s’adresse

Si vous avez besoin de… Prenez Pourquoi
Livres audio, personnages, doublage où l’interprétation compte Eleven v4 En tête de l’arène d’écoute indépendante, avec un contrôle fin
Un agent vocal ou un assistant en direct Eleven v4 Turbo ~150 ms avant le premier son, moitié prix
D’énormes volumes de narration simple à petit budget Gemini 3.8 Flash TTS ou Cartesia Sonic 3.6 Une fraction du prix par caractère
Des chansons avec voix et instruments Suno v6 Un générateur de musique, pas un outil vocal

Le verdict

Eleven v4 est le modèle vocal à choisir quand la prise doit sonner dirigée plutôt que lue. Il domine l’arène indépendante, parle plus de 90 langues et vous donne de vrais outils pour façonner une interprétation. Ce n’est pas la façon la moins chère de transformer du texte en voix, et il n’a pas besoin de l’être : quand la voix est le produit, c’est celle que choisissent les auditeurs.

02

Forces et limites honnêtes

Points Forts

  • La voix que préfèrent les auditeurs : Dans l’arène Provider Voice d’Artificial Analysis, où l’on choisit le plus naturel de deux extraits anonymes, Eleven v4 a pris la première place en septembre 2026 avec 1319 Elo. Cartesia Sonic 3.6 a obtenu 1276 et Gemini 3.8 Flash TTS 1267. Artificial Analysis le classe aussi premier en robustesse de prononciation.
  • De la direction d’acteur, pas de la dictée : Les balises audio comme [whispers], [laughs] ou [said angrily] peuvent désormais se combiner et s’enchaîner, et le modèle tient compte de la conversation qui les entoure : une réponse sonne comme une réponse, pas comme une réplique isolée.
  • Conçu pour les longs projets : Chaque requête accepte jusqu’à 10 000 caractères (environ dix minutes d’audio), et ElevenLabs affirme qu’une nouvelle méthode garde l’identité d’une voix stable sur les longues narrations et les nouvelles prises.
  • Plus de 90 langues avec une seule voix : La couverture passe d’environ 70 à plus de 90 langues, avec les plus gros progrès en japonais, portugais du Brésil, mandarin et cantonais. Une même voix peut parler n’importe quelle langue prise en charge tout en gardant son identité.
  • Assez rapide pour converser : Eleven v4 Turbo est conçu pour les agents vocaux. ElevenLabs annonce environ 100 ms d’inférence médiane et environ 150 ms avant le premier son, contre 262 à 814 ms pour les concurrents testés.

Limites Honnêtes

  • Prix premium : Au prix catalogue, 80 dollars le million de caractères, c’est 1,6 fois Cartesia Sonic 3.6 et près de cinq fois Gemini 3.8 Flash TTS. La remise de lancement de 72 % (0,022 dollar pour 1 000 caractères) prend fin le 12 octobre 2026.
  • Des chiffres de l’éditeur pour certaines affirmations : La préférence de 75 % en test à l’aveugle et la comparaison de latence proviennent des propres tests d’ElevenLabs. Le classement de l’arène est le chiffre indépendant auquel se fier.
  • De nouvelles commandes à apprendre : Comme v3, v4 ignore les balises de pause SSML. Les pauses et l’emphase passent par la ponctuation, les balises audio et les transcriptions phonétiques : d’anciens scripts devront peut-être être réécrits, et il vaut mieux réécouter vos voix existantes sur v4 avant de basculer la production.
  • Les clones posent de vraies questions : Un clone convaincant à partir de dix secondes d’audio est puissant et facile à détourner. ElevenLabs applique des vérifications et des garde-fous, mais le consentement et les droits commerciaux restent sous votre responsabilité.
03

Aperçu des Benchmarks

Arène Provider Voice d'Artificial Analysis — n° 1, 1319 Elo

Arène d'écoute à l'aveugle indépendante, septembre 2026. Cartesia Sonic 3.6 1276, Gemini 3.8 Flash TTS 1267. Eleven v4 est aussi premier au test de robustesse de prononciation d'Artificial Analysis et deuxième en voix contrôlée.

Préférence à l'aveugle — ~75 % (éditeur)

ElevenLabs indique qu'environ 75 % des auditeurs ont préféré v4 lors de comparaisons directes à l'aveugle. Le test a été mené par ElevenLabs.

Latence — ~150 ms avant le premier son (Turbo, éditeur)

Valeurs médianes annoncées par ElevenLabs pour Eleven v4 Turbo : environ 100 ms d'inférence et environ 150 ms avant le premier son, hors temps réseau et applicatif.

Prix — 0,08 dollar / 1 000 caractères (Turbo 0,04 dollar)

Prix catalogue de l'API ; 72 % de remise jusqu'au 12 octobre 2026. Artificial Analysis indique 80 dollars le million de caractères, contre 49 dollars pour Cartesia Sonic 3.6 et 16,49 dollars pour Gemini 3.8 Flash TTS. L'offre gratuite inclut 10 000 caractères v4 ; les offres payantes commencent à 6 dollars par mois.

04

Le Verdict

Eleven v4 est le modèle vocal à choisir quand l’interprétation doit sonner dirigée : livres audio, personnages de jeux vidéo, doublage et agents vocaux qui doivent sonner comme des personnes plutôt que comme un serveur vocal. Il domine l’arène d’écoute indépendante et apporte un vrai contrôle grâce aux balises combinables et à la transcription phonétique. Ce n’est pas la façon la moins chère de transformer du texte en voix — Gemini et Cartesia coûtent bien moins pour de la narration en masse où « correct » suffit —, mais quand la prise compte, c’est la voix que choisissent les auditeurs.

05

Foire aux questions