NEWCrie modelos 3D a partir de texto ou imagens — faça o rig, anime e exporte.Experimentar 3D
PopcraftPopcraft
Modelo de voz da ElevenLabs

Eleven v4 + Eleven v4 TurboEle não lê o roteiro.
Ele o interpreta.

A ElevenLabs chama o Eleven v4 de "nosso modelo de conversão de texto em fala mais emotivo até hoje". Escreva a entonação no próprio roteiro com tags inline, em mais de 90 idiomas e até 10.000 caracteres por tomada. E o v4 Turbo responde rápido o suficiente para manter uma conversa em tempo real.

[whispers] Don't move. It's right behind you.Eleven v4TTSGerar
90+ idiomas10.000 caracteres por takeEm linha tags de áudio
Uma atriz de voz diante de um microfone de condensador em uma cabine de gravação com pouca luz, iluminada por uma luminária de luz quente
Vozes de personagens
Um estúdio de dublagem: uma atriz observa uma cena projetada, com o rosto iluminado pela tela
Dublagem
Uma sala de controle à noite, formas de onda brilhando nos monitores diante de um engenheiro
Direção
Um personagem de jogo: um cavaleiro de armadura à luz do fogo, no meio de uma fala
NPCs de jogos
Um agente de suporte em uma chamada com headset em um escritório ao amanhecer
Agentes de voz
Um narrador de cabelos grisalhos lê em voz alta um livro de capa dura em uma poltrona sob uma luminária de leitura
Audiolivros

Ouça. O roteiro está ao lado de cada clipe.

Oito tomadas, geradas no Popcraft. As palavras em colchetes laranjas são toda a direção: não há edição, nem tomadas coladas, e nada no áudio que não esteja na página.

01

Uma frase, cinco interpretações

[warm] The lighthouse keeper left a lamp burning for ships that never came.

[low, threatening] The lighthouse keeper left a lamp burning for ships that never came.

[rushed] The lighthouse keeper left a lamp burning for ships that never came.

[a tired detective who has heard it all before] The lighthouse keeper left a lamp burning for ships that never came.

[hushed and reverent, like a nature documentary narrator] The lighthouse keeper left a lamp burning for ships that never came.

02

Um NPC de jogo, mudando de tom em uma linha

[casual] You're looking for work, eh? Hmm, I might have something for you. [door creaking] [suddenly suspicious, lowering his voice] Wait. Who sent you? [pause] [delighted] Marta's cousin! Well why didn't you say so. [coins clinking] Half now, half when it's done.

03

Um ritmo, quatro idiomas

[softly] Don't be afraid. We'll cross together when the morning comes.

[softly] 怖がらないで。朝が来たら、一緒に渡ろう。Japonês

[softly] Não tenha medo. Vamos atravessar juntos quando a manhã chegar.Português brasileiro

[softly] 别害怕。等天亮了,我们一起过去。Mandarim

A mesma voz, a mesma tag, os quatro idiomas que a ElevenLabs diz que mais evoluíram na v4.

04

Um agente de suporte que realmente soa como tal

[warm] Thanks so much for holding. I can see the duplicate charge right here. [reassuring] You don't need to do anything else; the refund goes out today. [clear, measured] And your eSIM for Reykjavik is active. Anything else I can check?

O registro que o v4 Turbo foi projetado para manter em uma chamada ao vivo.

05

Um sussurro que permanece um sussurro

[whispers] Don't move. It's right behind you. [pause] [whispers] On three, we run. One. Two. [shouts] Run!

06

Uma abertura direta de audiolivro

[quiet, measured narration] When I was young, I thought the mountain stood because it was strong. [pause] I know better now. [long pause] It stood because it had learned where to bend.

O v4 aceita 10.000 caracteres em uma única solicitação, cerca de dez minutos de áudio.

07

Segunda-feira de manhã

[sleepy drowsy voice] Mmm, five more minutes. [yawning] Is it really Monday already?

08

Direção em linguagem simples

[like a sports commentator, speeding up] She takes it on the half-volley, past one, past two, she's through on goal. [amazed] Oh, that is extraordinary!

Uma tag não precisa vir de uma lista. Descreva a interpretação e o modelo realiza a execução.

Dois modelos. Um para a interpretação, um para a conversa.

Até agora, você escolhia entre vozes expressivas e rápidas. O Eleven v4 acaba com esse dilema: o modelo padrão lida com trabalhos de longa duração, e o Turbo lida com chamadas ao vivo.

Para criadores

Eleven v4

Criado para criação de conteúdo e áudio de longa duração: audiolivros, trabalho com personagens e narração em extensão de dublagem. A interpretação que você escreve é a interpretação que você recebe, incluindo os sons da cena.

  • 10.000caracteres por solicitação, cerca de dez minutos de áudio em um único take
  • 90+idiomas, em comparação com mais de 70 no v3
  • Etiquetasemoção, ritmo, reações, sotaques e efeitos sonoros, escritos diretamente no texto
  • IPApronúncia exata, escrita entre barras
"O ponto culminante da nossa pesquisa mais recente em geração de fala expressiva."ElevenLabs, publicação de lançamento
Para agentes de voz

Eleven v4 Turbo

A mesma expressividade, ajustada para tempo real: cerca de 100 ms de latência média de inferência e cerca de 150 ms até a primeira fala, segundo as medições da ElevenLabs.

  • ~100 mslatência de inferência mediana
  • ~150 mstempo mediano para a primeira fala
  • Ao vivochamadas de suporte, vendas e agendamento que adaptam seu tom no meio da conversa
"Mais rápido do que a pausa média entre duas pessoas conversando."ElevenLabs, publicação de lançamento

Dirija como um talento na cabine

Tudo o que está abaixo está no próprio roteiro. Sem controles deslizantes, sem pós-produção.

Tags de áudio

Escreva a emoção onde ela acontece

As tags ficam no próprio texto, entre colchetes, e fazem efeito a partir de onde estão até a próxima tag. Seis tipos: emoção, interpretação, ritmo, reações, sotaques e efeitos sonoros. Empilhe as instruções com vírgulas e o modelo as executará em sequência.

[excited] Big news, everyone. [pause] [whispers] The summer menu drops Friday. [laughs]
Um close-up de um microfone condensador em uma névoa de contraluz
Idiomas

90+ idiomas, uma voz

A ElevenLabs considera a fala expressiva em vários idiomas um dos problemas mais difíceis da IA de áudio. O v4 abrange mais de noventa, com os maiores avanços em japonês, português do Brasil, mandarim e cantonês. A mesma voz mantém a mesma direção em todos eles, para que uma dublagem preserve o seu elenco.

Um elenco de drama de rádio de quatro atores reunidos ao redor de um microfone
Tomadas longas

10.000 caracteres em uma única solicitação

O dobro do que o v3 aceitava: cerca de dez minutos de áudio em uma única geração. Um capítulo, um roteiro completo de suporte ou uma cena longa mantém o ritmo como uma leitura contínua em vez de parágrafos colados.

Uma pilha alta de páginas de manuscrito ao lado de um microfone de estúdio sob a luz quente de uma luminária
Pronúncia

Diga exatamente, com IPA

Nomes, nomes de medicamentos, nomes de lugares, nomes de produtos: escreva a pronúncia em IPA entre barras e o modelo dirá do seu jeito, todas as vezes. Para todo o resto, o v4 alcançou a maior pontuação de pronúncia já medida pela Artificial Analysis.

The ferry to Reykjavik /ˈreɪkjavɪk/ leaves at nine.
Uma página de roteiro anotada a lápis em uma estante de partitura
Clones de voz

Clones de voz profissionais estão de volta

O v3 nunca ofereceu suporte a Clones de Voz Profissionais. O v4 oferece, para que uma voz produzida de sua propriedade possa atuar com todo o vocabulário de tags. Clones criados em modelos anteriores passam por um novo treinamento para o v4 com apenas um clique, com o consentimento verificado do proprietário da voz por trás de cada clone.

Dois gravadores de rolo idênticos lado a lado em um rack de estúdio

A história por trás

Cada geração da ElevenLabs adicionou algo novo. O v4 é o primeiro que não faz você escolher entre eles.

  • Ago 2023

    Multilingual v2

    29 idiomas, e a ElevenLabs sai da versão beta.

  • jul. de 2024

    Turbo v2.5

    Criado para velocidade.

  • Dez 2024

    Flash

    A latência cai para cerca de 75 ms. Rápido, mas não expressivo.

  • jun. de 2025

    Eleven v3 alpha

    Chegam as tags de áudio, mais de 70 idiomas e diálogos. Expressivo, mas a própria publicação de lançamento do v3 recomendou que criadores em tempo real continuassem no Flash.

  • Fev. de 2026

    Eleven v3 chega a GA

    A linha expressiva amadurece. O dilema da velocidade permanece.

  • jun. de 2026

    A prévia de Varsóvia

    No seu evento em Varsóvia, a ElevenLabs demonstra o próximo modelo sussurrando, alterando sotaques e mudando de emoção ao vivo no palco.

  • 28 de set. de 2026

    Eleven v4 + v4 Turbo

    Uma nova arquitetura traz ambas as direções de uma só vez: o modelo mais expressivo que a ElevenLabs já construiu e uma versão Turbo rápida o suficiente para conversas em tempo real.

A prova

Avaliação independente em primeiro lugar: a Artificial Analysis realiza arenas de escuta cega com todos os principais modelos de fala.

Artificial Analysis, outubro de 2026Eleven v4Contexto
Arena de vozes dos provedores#1À frente do Cartesia Sonic 3.6 e do Gemini 3.8 Flash TTS. O Eleven v3 está em #17 na mesma tabela.
Robustez da pronúncia91,7%A pontuação mais alta que a Artificial Analysis mediu, em qualquer modelo.
Arena de voz controlada#2Atrás do Qwen-Audio-3.1-TTS-Plus. O v3 pontuou muito abaixo de ambos.
Velocidade de geração73,4 carac./sEm comparação com 42,5 para o v3, medido pela Artificial Analysis.

No próprio teste de preferência às cegas da ElevenLabs, os ouvintes escolheram o v4 em cerca de 75% das vezes em comparação com modelos concorrentes. Essa marca é do fornecedor; as classificações da arena acima não são. Reações no dia do lançamento: a thread de anúncio e os resultados da Artificial Analysis.

O que mudou em relação ao v3

Eleven v3Eleven v4
ArquiteturaFamília v3Totalmente novo
Idiomas70+90+
Tamanho da solicitação5.000 caracteres10.000 caracteres
Clones de voz profissionaisNão suportadoSuportado
DireçãoTags de áudioTags, orientações em linguagem simples, IPA
Tempo realNão recomendadov4 Turbo, inferência mediana de ~100 ms

Os roteiros que você escreveu para a v3 funcionam na v4 sem alterações.

FAQ

Minhas vozes clonadas existentes funcionam no v4?

Após um retreinamento, sim. Clones criados em modelos anteriores são retreinados para o v4 com um único clique na biblioteca de vozes da ElevenLabs. Prepare-se para diferenças: uma voz retreinada pode soar substancialmente diferente da sua versão v3, imperfeições na gravação original são reproduzidas fielmente, e vozes criadas com o Voice Design podem ter um desempenho menos expressivo do que clones gravados.

As tags de áudio sempre funcionam?

Nem sempre. A própria documentação da ElevenLabs considera o cumprimento de tags 'ainda não perfeito': ocasionalmente, uma indicação de entonação é interpretada como um efeito sonoro. Você obterá os resultados mais confiáveis com uma tag por oração, colocada antes das palavras que ela afeta, e indicações separadas por vírgulas dentro de um único colchete quando quiser combiná-las em camadas.

O que acontece quando uma voz fala um idioma que não é o seu?

Ele fala com o sotaque nativo desse idioma, e não com o sotaque de origem da voz. A ElevenLabs afirma que isso é proposital e que uma opção para manter o sotaque está em estudo.

Quais controles o v4 tem?

Estabilidade e Similaridade. Não há controle deslizante de estilo ou velocidade nem SSML; as pausas são escritas como [pause] e [long pause] no roteiro, e todo o resto são tags.

v4 ou v4 Turbo?

O v4 é para tudo o que você renderiza e guarda: narração, personagens, leituras com duração de dublagem de até 10.000 caracteres. O v4 Turbo é para tudo o que responde: agentes de voz e aplicativos interativos, nos quais a sua latência de inferência mediana de ~100 ms mantém a conversa fluindo.

Escreva a interpretação. O v4 entrega.

Escolha uma voz, coloque a orientação entre colchetes e ouça a gravação em segundos.

Todo o áudio nesta página foi gerado no Popcraft com vozes da ElevenLabs; o roteiro completo de cada clipe é exibido ao lado. As imagens são geradas por IA. As falas citadas são da própria ElevenLabs, retiradas da publicação de lançamento do Eleven v4. As classificações são da Artificial Analysis, consultadas em outubro de 2026.

Continue explorando

Modelos relacionados