Место #2 Музыка и Голос — Звук с нуля
ElevenLabs

ElevenLabs v4

ElevenLabs v3 умела сыграть реплику, если ей объяснить как. Eleven v4 читает всю сцену — кто говорит, что только что произошло, насколько накалился разговор — и играет её соответственно. Слушатели на слепой голосовой арене Artificial Analysis теперь ставят её на первое место, а более быстрая версия Turbo переносит те же голоса в живой разговор.

Обновлено 29 сентября 2026 VoiceTTS90+ Languages
Лучше всего для

ElevenLabs v3 умела сыграть реплику, если ей объяснить как. Eleven v4 читает всю сцену — кто говорит, что только что произошло, насколько накалился разговор — и играет её соответственно. Слушатели на слепой голосовой арене Artificial Analysis теперь ставят её на первое место, а более быстрая версия Turbo переносит те же голоса в живой разговор.

Почему он побеждает

1-е место на арене Provider Voice от Artificial Analysis в сентябре 2026 года (1319 Elo, впереди Cartesia Sonic 3.6 с 1276 и Gemini 3.8 Flash TTS с 1267). Более 90 языков, до 10 000 символов за запрос, комбинируемые аудиотеги, произношение через МФА и мгновенные клоны голоса примерно по 10 секундам записи. По данным ElevenLabs, модель Turbo начинает отвечать примерно через 150 мс.

Обратите внимание

По прайсу — 0,08 доллара за 1000 символов (80 долларов за миллион) — она дороже Cartesia (49 долларов) и намного дороже Gemini 3.8 Flash TTS (16,49 доллара). Стартовая скидка 72 % действует до 12 октября 2026 года. Теги пауз SSML не поддерживаются, а столь реалистичные голоса держат на виду вопросы согласия и злоупотреблений.

01

Что это на самом деле

Прочитать сценарий и сыграть его — не одно и то же.

Дайте программе чтения фразу «О, отлично, ты здесь» — она произнесёт слова. Дайте её актрисе — и она спросит, что случилось перед этим. Персонаж испытывает облегчение? Язвит? Кто-то только что опоздал на совещание?

Прежние версии ElevenLabs умели сыграть реплику, если им объяснить как. Eleven v4 пытается понять это сама. По словам ElevenLabs, модель читает окружающий разговор — кто говорит, как накалялся обмен репликами, что было сказано только что — и подстраивает под это каждую фразу.

ElevenLabs выпустила Eleven v4 28 сентября 2026 года вместе с Eleven v4 Turbo — более быстрой версией для голосовых агентов в реальном времени. Обе доступны в приложениях и API ElevenLabs, в том числе на бесплатном тарифе.

Что говорят слушатели

Для голосовой модели важнее всего простая цифра: какую из них люди выбирают, когда не видят названия?

У Artificial Analysis есть арена Provider Voice, которая отвечает именно на этот вопрос. Слушатели слышат два анонимных фрагмента одного текста и выбирают более естественный, а голоса пересчитываются в рейтинг Elo, как в шахматах. В сентябре 2026 года Eleven v4 заняла первое место с 1319 Elo, опередив Cartesia Sonic 3.6 с 1276 и Gemini 3.8 Flash TTS от Google с 1267. Artificial Analysis также ставит её первой по устойчивости произношения — умению правильно произносить трудные слова — и второй в категории управляемого голоса.

ElevenLabs добавляет собственный слепой тест, в котором около 75 % слушателей предпочли v4. Это цифра производителя, поэтому опираться стоит на место на арене.

Что нового по сравнению с v3

В v3 появились аудиотеги — короткие указания в квадратных скобках вроде [whispers] или [laughs], которые меняют манеру произнесения реплики. v4 развивает эту идею:

  • Теги можно комбинировать и выстраивать в цепочку. Указания можно сочетать, и модель выполняет их по порядку на протяжении отрывка.
  • Она слушает контекст. Ответы в диалоге берут тон из того, что было до них, — это важно в спорах, при нарастании напряжения и в моментах «оставайтесь на линии» в службе поддержки.
  • Произношение, которое можно продиктовать. Запишите слово в МФА — Международном фонетическом алфавите — между косыми чертами, и v4 произнесёт его именно так. ElevenLabs говорит, что теперь это работает гораздо надёжнее.
  • Более длинные запросы. До 10 000 символов за запрос, примерно десять минут аудио, и более гладкая склейка, когда запросы идут цепочкой.
  • Более стабильные голоса. Новый метод сохраняет узнаваемость голоса на длинных текстах и повторных дублях — раньше это было слабым местом в больших проектах.

Число языков выросло примерно с 70 до более чем 90, причём сильнее всего улучшились японский, бразильский португальский, мандаринский и кантонский. Один голос теперь может говорить на любом поддерживаемом языке, сохраняя свою узнаваемость.

Клонирование голоса тоже стало быстрее. Для Instant Voice Clone теперь достаточно примерно 10 секунд записи. Для максимальной точности поддерживаются и Professional Voice Clones.

Turbo: голоса, с которыми можно разговаривать

Голосовой агент живёт или умирает из-за тайминга. Если ответ начинается через целую секунду после того, как вы замолчали, разговор ощущается как плохая телефонная связь.

Eleven v4 Turbo создана именно для этого. ElevenLabs сообщает о медианном времени вывода около 100 мс и примерно 150 мс до первого звука против 262–814 мс у протестированных конкурентов. Это собственные замеры компании без учёта сетевых задержек, но они укладываются в естественную паузу между двумя собеседниками. Turbo стоит вдвое дешевле полной модели.

Честная оговорка

Это премиальный вариант. По прайсу Eleven v4 стоит 0,08 доллара за 1000 символов, что Artificial Analysis записывает как 80 долларов за миллион символов. Cartesia Sonic 3.6 за тот же объём стоит 49 долларов, Gemini 3.8 Flash TTS — 16,49 доллара. Для массовой озвучки, где достаточно «чётко и приятно», они намного дешевле. До 12 октября 2026 года ElevenLabs даёт стартовую скидку 72 %, и v4 обходится в 0,022 доллара за 1000 символов, но бюджет лучше планировать по прайсу.

Управление устроено иначе. Как и v3, v4 не поддерживает теги пауз SSML — разметку, которой многие старые сценарии синтеза речи задают паузы. Режиссура задаётся пунктуацией, аудиотегами и МФА. Если у вас уже есть производственный конвейер, перепишите несколько сценариев и заново прослушайте свои голоса на v4, прежде чем переключать всё.

Хорошие клоны — палка о двух концах. Убедительная копия чужого голоса по десяти секундам записи полезна авторам и опасна в дурных руках. ElevenLabs применяет проверку и защитные механизмы, но за согласие и коммерческие права отвечаете вы.

Кому она подойдёт

Если вам нужно… Берите Почему
Аудиокниги, персонажи, дубляж, где важно исполнение Eleven v4 Лидер независимой арены прослушивания, тонкое управление
Живой голосовой агент или ассистент Eleven v4 Turbo ~150 мс до первого звука, вдвое дешевле
Огромные объёмы простой озвучки при скромном бюджете Gemini 3.8 Flash TTS или Cartesia Sonic 3.6 Малая доля цены за символ
Песни с вокалом и инструментами Suno v6 Генератор музыки, а не голосовой инструмент

Вердикт

Eleven v4 — голосовая модель для случаев, когда дубль должен звучать срежиссированно, а не прочитанно. Она лидирует на независимой арене, говорит более чем на 90 языках и даёт настоящие инструменты, чтобы выстроить исполнение. Это не самый дешёвый способ превратить текст в речь, да ей и не нужно им быть: когда голос и есть продукт, слушатели выбирают её.

02

Сильные стороны и честные ограничения

Ключевые преимущества

  • Голос, который выбирают слушатели: На арене Provider Voice от Artificial Analysis, где люди выбирают более естественный из двух анонимных фрагментов, Eleven v4 в сентябре 2026 года заняла первое место с 1319 Elo. У Cartesia Sonic 3.6 — 1276, у Gemini 3.8 Flash TTS — 1267. Artificial Analysis также ставит её первой по устойчивости произношения.
  • Режиссура, а не диктовка: Аудиотеги вроде [whispers], [laughs] или [said angrily] теперь можно комбинировать и задавать последовательно, а модель учитывает окружающий разговор — ответ звучит как ответ, а не как оторванная от контекста реплика.
  • Создана для длинных проектов: Один запрос вмещает до 10 000 символов (около десяти минут аудио), а ElevenLabs говорит, что новый метод сохраняет узнаваемость голоса на длинных текстах и при повторных дублях.
  • Более 90 языков одним голосом: Охват вырос примерно с 70 до более чем 90 языков, сильнее всего улучшились японский, бразильский португальский, мандаринский и кантонский. Один голос может говорить на любом поддерживаемом языке, сохраняя свою узнаваемость.
  • Достаточно быстра для разговора: Eleven v4 Turbo создана для голосовых агентов. ElevenLabs сообщает о медианном времени вывода около 100 мс и примерно 150 мс до первого звука против 262–814 мс у протестированных конкурентов.

Честные ограничения

  • Премиальная цена: По прайсу 80 долларов за миллион символов — это в 1,6 раза дороже Cartesia Sonic 3.6 и почти в пять раз дороже Gemini 3.8 Flash TTS. Стартовая скидка 72 % (0,022 доллара за 1000 символов) заканчивается 12 октября 2026 года.
  • Часть цифр — от производителя: Предпочтение 75 % в слепом тесте и сравнение задержек взяты из собственных тестов ElevenLabs. Независимая цифра, которой стоит доверять, — место на арене.
  • Придётся освоить новое управление: Как и v3, v4 игнорирует теги пауз SSML. Паузы и акценты задаются пунктуацией, аудиотегами и записью в МФА, так что старые сценарии, возможно, придётся переписать, а свои голоса стоит заново прослушать на v4, прежде чем переводить на неё производство.
  • Клоны поднимают реальные вопросы: Убедительный клон по десяти секундам записи — мощный инструмент, которым легко злоупотребить. ElevenLabs применяет проверку и защитные механизмы, но за согласие и коммерческие права отвечаете вы.
03

Результаты тестов

Арена Provider Voice от Artificial Analysis — 1-е место, 1319 Elo

Независимая слепая арена прослушивания, сентябрь 2026 года. Cartesia Sonic 3.6 — 1276, Gemini 3.8 Flash TTS — 1267. Eleven v4 также первая в тесте Artificial Analysis на устойчивость произношения и вторая в категории управляемого голоса.

Слепое предпочтение — ~75 % (производитель)

ElevenLabs сообщает, что около 75 % слушателей предпочли v4 в прямых слепых сравнениях. Тест проводила сама ElevenLabs.

Задержка — ~150 мс до первого звука (Turbo, производитель)

Медианные значения, которые ElevenLabs приводит для Eleven v4 Turbo: около 100 мс на вывод и около 150 мс до первого звука, без учёта сети и приложения.

Цена — 0,08 доллара / 1000 символов (Turbo 0,04 доллара)

Прайсовые цены API; скидка 72 % до 12 октября 2026 года. Artificial Analysis указывает 80 долларов за миллион символов против 49 долларов у Cartesia Sonic 3.6 и 16,49 доллара у Gemini 3.8 Flash TTS. Бесплатный тариф включает 10 000 символов v4; платные тарифы — от 6 долларов в месяц.

04

Вердикт

Eleven v4 — голосовая модель для случаев, когда исполнение должно звучать срежиссированно: аудиокниги, персонажи игр, дубляж и голосовые агенты, которые должны звучать как люди, а не как телефонное меню. Она лидирует на независимой арене прослушивания и даёт настоящий контроль благодаря комбинируемым тегам и МФА. Это не самый дешёвый способ превратить текст в речь — Gemini и Cartesia стоят гораздо меньше для массовой озвучки, где «достаточно хорошо» и есть цель, — но когда важен дубль, слушатели выбирают именно её.

05

Часто задаваемые вопросы