NEWСоздавайте 3D-модели из текста или изображений — риггинг, анимация, экспорт.Попробовать 3D
PopcraftPopcraft
Голосовая модель от ElevenLabs

Eleven v4 + Eleven v4 TurboОн не читает сценарий.
Он его исполняет.

ElevenLabs называет Eleven v4 «нашей самой эмоциональной моделью синтеза речи». Задавайте манеру речи прямо в сценарии с помощью встроенных тегов на более чем 90 языках, фрагментами до 10 000 символов. А v4 Turbo отвечает достаточно быстро, чтобы поддерживать живую беседу.

[whispers] Don't move. It's right behind you.Eleven v4TTSСоздать
90+ языков10 000 символов во фрагментеВстроенные аудиотеги
Актриса озвучивания у конденсаторного микрофона в тускло освещённой кабине для записи, освещённой тёплым практическим светильником
Озвучивание персонажей
Павильон дубляжа: актриса смотрит на проецируемую сцену, её лицо освещено экраном
Дубляж
Аппаратная ночью: на мониторах перед инженером светятся звуковые волны
Режиссура
Игровой персонаж: рыцарь в доспехах при свете костра, на середине реплики
Игровые NPC
Агент поддержки в гарнитуре на звонке в офисе на рассвете
Голосовые агенты
Седовласый чтец вслух читает книгу в твёрдом переплёте, сидя в кресле под торшером
Аудиокниги

Послушайте. Текст находится рядом с каждым роликом.

Восемь дублей, созданных в Popcraft. Слова в оранжевых скобках — это все режиссёрские указания: здесь нет монтажа, нет склеенных дублей, и в аудио нет ничего, чего не было бы в тексте.

01

Одна фраза, пять вариантов подачи

[warm] The lighthouse keeper left a lamp burning for ships that never came.

[low, threatening] The lighthouse keeper left a lamp burning for ships that never came.

[rushed] The lighthouse keeper left a lamp burning for ships that never came.

[a tired detective who has heard it all before] The lighthouse keeper left a lamp burning for ships that never came.

[hushed and reverent, like a nature documentary narrator] The lighthouse keeper left a lamp burning for ships that never came.

02

Игровой NPC, реагирующий на реплику

[casual] You're looking for work, eh? Hmm, I might have something for you. [door creaking] [suddenly suspicious, lowering his voice] Wait. Who sent you? [pause] [delighted] Marta's cousin! Well why didn't you say so. [coins clinking] Half now, half when it's done.

03

Один ритм, четыре языка

[softly] Don't be afraid. We'll cross together when the morning comes.

[softly] 怖がらないで。朝が来たら、一緒に渡ろう。Японский

[softly] Não tenha medo. Vamos atravessar juntos quando a manhã chegar.Бразильский португальский

[softly] 别害怕。等天亮了,我们一起过去。Китайский (путунхуа)

Тот же голос, та же эмоция, четыре языка, которые, по словам ElevenLabs, получили наибольшее улучшение в v4.

04

Агент поддержки, который звучит как настоящий

[warm] Thanks so much for holding. I can see the duplicate charge right here. [reassuring] You don't need to do anything else; the refund goes out today. [clear, measured] And your eSIM for Reykjavik is active. Anything else I can check?

Тон, который v4 Turbo создан удерживать в живом звонке.

05

Шёпот, который остаётся шёпотом

[whispers] Don't move. It's right behind you. [pause] [whispers] On three, we run. One. Two. [shouts] Run!

06

Аудиокнига: холодное начало

[quiet, measured narration] When I was young, I thought the mountain stood because it was strong. [pause] I know better now. [long pause] It stood because it had learned where to bend.

v4 принимает до 10 000 символов за один запрос — это около десяти минут аудио.

07

Утро понедельника

[sleepy drowsy voice] Mmm, five more minutes. [yawning] Is it really Monday already?

08

Указания простым языком

[like a sports commentator, speeding up] She takes it on the half-volley, past one, past two, she's through on goal. [amazed] Oh, that is extraordinary!

Тег не обязательно должен быть из списка. Опишите манеру речи, и модель её воспроизведёт.

Две модели. Одна для выразительного исполнения, другая для живого общения.

Раньше вам приходилось выбирать между выразительными и быстрыми голосами. Eleven v4 устраняет этот компромисс: стандартная модель подходит для длинных текстов, а Turbo — для живых звонков.

Для авторов контента

Eleven v4

Создана для производства контента и длинных аудиоформатов: аудиокниг, озвучки персонажей и полнометражного дубляжа. Модель выдаёт ровно ту подачу, которую вы прописали, включая звуки сцены.

  • 10 000символов за запрос, около десяти минут аудио за один сеанс
  • 90+языков, по сравнению с 70+ в v3
  • Тегиэмоции, темп, реакции, акценты и звуковые эффекты, прописанные прямо в тексте
  • IPAточное произношение, записанное между косыми чертами
«Венец наших последних исследований в области генерации выразительной речи».ElevenLabs, пост о запуске
Для голосовых агентов

Eleven v4 Turbo

Та же выразительность, оптимизированная для реального времени: около 100 мс медианной задержки инференса и около 150 мс до начала речи согласно измерениям ElevenLabs.

  • ~100 мсмедианная задержка инференса
  • ~150 мсмедианное время до начала речи
  • В реальном временизвонки службы поддержки, отдела продаж и планирования, адаптирующие тон прямо во время разговора
«Быстрее, чем средняя пауза между репликами двух собеседников».ElevenLabs, пост о запуске

Управляйте голосом как актёром в студии

Всё ниже задаётся прямо в скрипте. Никаких ползунков и постобработки.

Аудиотеги

Задавайте эмоции прямо в тексте

Теги вставляются прямо в текст в квадратных скобках и действуют от места установки до следующего тега. Их шесть видов: эмоции, подача, темп, реакции, акценты и звуковые эффекты. Объединяйте указания через запятую, и модель выполнит их последовательно.

[excited] Big news, everyone. [pause] [whispers] The summer menu drops Friday. [laughs]
Крупный план конденсаторного микрофона в дымке контрового света
Языки

90+ языков, один голос

ElevenLabs считает выразительную речь на разных языках одной из сложнейших задач для аудио ИИ. v4 охватывает более девяноста языков, с наибольшим прогрессом в японском, бразильском португальском, путунхуа и кантонском. Один и тот же голос передаёт одну и ту же интонацию на всех этих языках, поэтому дубляж сохраняет оригинальный кастинг.

Четыре актёра радиоспектакля, собравшиеся вокруг одного микрофона
Длинные дубли

10 000 символов в одном запросе

Вдвое больше, чем принимала v3: около десяти минут аудио за одну генерацию. Глава книги, полный сценарий поддержки или длинная сцена сохраняет свой темп как единое непрерывное чтение, а не склеенные абзацы.

Высокая стопка страниц рукописи рядом со студийным микрофоном в тёплом свете лампы
Произношение

Произносите точно, с помощью IPA

Имена, названия лекарств, географические названия, названия продуктов: напишите произношение в IPA между косыми чертами, и модель каждый раз будет произносить это так, как нужно вам. Во всём остальном v4 установила наивысший балл за произношение, когда-либо зафиксированный Artificial Analysis.

The ferry to Reykjavik /ˈreɪkjavɪk/ leaves at nine.
Страница сценария с карандашными пометками на пюпитре
Клоны голоса

Профессиональные клоны голосов возвращаются

v3 никогда не поддерживала Professional Voice Clones. v4 поддерживает, поэтому созданный вами голос может использовать весь набор тегов. Клоны, созданные на более ранних моделях, переобучаются для v4 в один клик, при этом за каждым клоном стоит подтверждённое согласие владельца голоса.

Два одинаковых катушечных магнитофона, стоящих рядом в студийной стойке

История создания

Каждое поколение ElevenLabs добавляло одну новую функцию. v4 — первое, которое не заставляет вас выбирать между ними.

  • Август 2023 г.

    Multilingual v2

    29 языков, и ElevenLabs выходит из беты.

  • Июль 2024

    Turbo v2.5

    Создан для скорости.

  • Декабрь 2024

    Flash

    Задержка снижается примерно до 75 мс. Быстро, но невыразительно.

  • Июнь 2025

    Eleven v3 alpha

    Появляются аудиотеги, более 70 языков и диалоги. Выразительно, но в собственном анонсе v3 разработчикам real-time приложений рекомендовали оставаться на Flash.

  • Февраль 2026

    Релиз Eleven v3

    Выразительность достигает зрелости. Компромисс со скоростью сохраняется.

  • Июнь 2026

    Превью в Варшаве

    На саммите в Варшаве ElevenLabs демонстрирует следующую модель, которая шепчет, меняет акценты и эмоции вживую на сцене.

  • 28 сентября 2026

    Eleven v4 + v4 Turbo

    Новая архитектура выходит сразу в двух направлениях: самая выразительная модель, когда-либо созданная ElevenLabs, и версия Turbo, достаточно быстрая для живого общения.

Доказательства

Независимые источники: Artificial Analysis проводит слепые тесты среди слушателей для всех основных речевых моделей.

Artificial Analysis, октябрь 2026Eleven v4Контекст
Арена голосов провайдеров№1Впереди Cartesia Sonic 3.6 и Gemini 3.8 Flash TTS. Eleven v3 занимает 17-е место в том же рейтинге.
Надёжность произношения91,7%Самый высокий балл, когда-либо зафиксированный Artificial Analysis для любой модели.
Арена управляемых голосов№2Позади Qwen-Audio-3.1-TTS-Plus. v3 показал результат значительно ниже обоих.
Скорость генерации73,4 симв/сПротив 42,5 для v3, по данным Artificial Analysis.

В собственном слепом тесте ElevenLabs слушатели выбирали v4 примерно в 75% случаев по сравнению с конкурирующими моделями. Эта цифра принадлежит вендору; приведённые выше рейтинги арены — нет. Реакции в день запуска: ветка анонса и результаты Artificial Analysis.

Что изменилось по сравнению с v3

Eleven v3Eleven v4
АрхитектураСемейство v3Совершенно новая
Языки70+90+
Длина запроса5000 символов10000 символов
Профессиональные клоны голосовНе поддерживаетсяПоддерживается
РежиссураАудиотегиТеги, указания на обычном языке, IPA
Реальное времяНе рекомендуетсяv4 Turbo, медианное время инференса ~100 мс

Скрипты, написанные для v3, работают на v4 без изменений.

FAQ

Работают ли мои существующие клоны голосов на v4?

После переобучения — да. Клоны, созданные на предыдущих моделях, переобучаются для v4 в один клик в библиотеке голосов ElevenLabs. Будьте готовы к отличиям: переобученный голос может звучать существенно иначе, чем его версия v3, недостатки исходной записи воспроизводятся в точности, а голоса, созданные с помощью Voice Design, могут быть менее выразительными, чем записанные клоны.

Всегда ли срабатывают аудиотеги?

Не всегда. В собственной документации ElevenLabs распознавание тегов называется «пока не идеальным»: иногда команда интонации воспроизводится как звуковой эффект. Наиболее надёжных результатов можно добиться, используя один тег на клаузу, размещая его перед словами, на которые он влияет, и объединяя несколько команд через запятую внутри одних скобок, если нужно их наложить.

Что происходит, когда голос говорит на неродном для себя языке?

Он говорит с естественным акцентом носителя этого языка, а не с исходным акцентом самого голоса. ElevenLabs заявляет, что это сделано намеренно, и в настоящее время исследуется возможность добавления переключателя для сохранения акцента.

Какие элементы управления есть в v4?

Стабильность и сходство. Здесь нет ползунков стиля или скорости и нет поддержки SSML; паузы прописываются в скрипте как [pause] и [long pause], а всё остальное — это теги.

v4 или v4 Turbo?

v4 для всего, что вы генерируете и сохраняете: озвучка, персонажи, начитки для дубляжа объёмом до 10 000 символов. v4 Turbo для всего, что отвечает: голосовые агенты и интерактивные приложения, где медианная задержка инференса ~100 мс поддерживает динамику диалога.

Напишите сценарий. v4 его исполнит.

Выберите голос, укажите ремарки в скобках и прослушайте дубль за считанные секунды.

Весь звук на этой странице сгенерирован в Popcraft с помощью голосов ElevenLabs; полный текст каждого ролика показан рядом. Изображения созданы ИИ. Цитаты принадлежат ElevenLabs и взяты из поста о запуске Eleven v4. Рейтинги взяты из Artificial Analysis, по состоянию на октябрь 2026 года.

Продолжайте исследовать

Похожие модели