Eleven v4 + Eleven v4 TurboIl ne lit pas le texte. Il l'interprète.
ElevenLabs qualifie Eleven v4 de « notre modèle de synthèse vocale le plus expressif à ce jour ». Intégrez l'interprétation directement dans le script grâce à des balises en ligne, dans plus de 90 langues et jusqu'à 10 000 caractères par prise. Et v4 Turbo répond suffisamment vite pour soutenir une conversation en direct.
90+ langues10 000 caractères par priseIntégré balises audio
Voix de personnagesDoublageDirectionPNJ de jeuAgents vocauxLivres audioVoix de personnagesDoublageDirectionPNJ de jeuAgents vocauxLivres audioVoix de personnagesDoublageDirectionPNJ de jeuAgents vocauxLivres audioVoix de personnagesDoublageDirectionPNJ de jeuAgents vocauxLivres audio
Écoutez. Le script est à côté de chaque extrait.
Huit prises, générées dans Popcraft. Les mots entre crochets orange constituent toute la direction : il n'y a aucun montage, aucune prise assemblée, et rien dans l'audio qui ne figure pas sur la page.
01
Une phrase, cinq interprétations
[warm] The lighthouse keeper left a lamp burning for ships that never came.
[low, threatening] The lighthouse keeper left a lamp burning for ships that never came.
[rushed] The lighthouse keeper left a lamp burning for ships that never came.
[a tired detective who has heard it all before] The lighthouse keeper left a lamp burning for ships that never came.
[hushed and reverent, like a nature documentary narrator] The lighthouse keeper left a lamp burning for ships that never came.
02
Un PNJ de jeu vidéo, basculant sur une réplique
[casual] You're looking for work, eh? Hmm, I might have something for you. [door creaking][suddenly suspicious, lowering his voice] Wait. Who sent you? [pause][delighted] Marta's cousin! Well why didn't you say so. [coins clinking] Half now, half when it's done.
03
Un rythme, quatre langues
[softly] Don't be afraid. We'll cross together when the morning comes.
[softly] 怖がらないで。朝が来たら、一緒に渡ろう。Japonais
[softly] Não tenha medo. Vamos atravessar juntos quando a manhã chegar.Portugais du Brésil
[softly] 别害怕。等天亮了,我们一起过去。Mandarin
Même voix, même tag, les quatre langues qui ont le plus progressé dans la v4 selon ElevenLabs.
04
Un agent du support qui sonne vraiment comme tel
[warm] Thanks so much for holding. I can see the duplicate charge right here. [reassuring] You don't need to do anything else; the refund goes out today. [clear, measured] And your eSIM for Reykjavik is active. Anything else I can check?
Le registre que v4 Turbo est conçu pour tenir lors d'un appel en direct.
05
Un chuchotement qui reste un chuchotement
[whispers] Don't move. It's right behind you. [pause][whispers] On three, we run. One. Two. [shouts] Run!
06
Une scène d'ouverture de livre audio
[quiet, measured narration] When I was young, I thought the mountain stood because it was strong. [pause] I know better now. [long pause] It stood because it had learned where to bend.
v4 accepte 10 000 caractères en une seule requête, soit environ dix minutes d'audio.
07
Lundi matin
[sleepy drowsy voice] Mmm, five more minutes. [yawning] Is it really Monday already?
08
Direction en langage clair
[like a sports commentator, speeding up] She takes it on the half-volley, past one, past two, she's through on goal. [amazed] Oh, that is extraordinary!
Un tag n'a pas besoin de provenir d'une liste. Décris l'interprétation et le modèle l'exécute.
Deux modèles. L'un pour la performance, l'autre pour la conversation.
Jusqu'à présent, vous deviez choisir entre des voix expressives et des voix rapides. Eleven v4 met fin à ce compromis : le modèle standard gère les contenus longs, et Turbo s'occupe des appels en direct.
Pour les créateurs
Eleven v4
Conçu pour la création de contenu et l'audio long format : livres audio, jeu de personnage, narration de longueur de doublage. L'interprétation que vous écrivez est l'interprétation que vous obtenez, bruits de scène inclus.
10 000caractères par requête, soit environ dix minutes d'audio en une prise
90+langues, contre 70+ dans v3
Étiquettesémotion, rythme, réactions, accents et effets sonores, écrits en ligne
IPAprononciation exacte, écrite entre barres obliques
« L'aboutissement de nos dernières recherches en matière de génération de parole expressive. »ElevenLabs, article de lancement
Pour les agents vocaux
Eleven v4 Turbo
La même expressivité, optimisée pour le temps réel : environ 100 ms de latence médiane d'inférence et environ 150 ms jusqu'à la première parole, selon les mesures d'ElevenLabs.
~100 mslatence d'inférence médiane
~150 mstemps médian avant la première parole
En directappels d'assistance, de vente et de planification qui adaptent leur ton en cours de conversation
« Plus rapide que la pause moyenne entre deux personnes qui parlent. »ElevenLabs, article de lancement
Dirigez la voix comme un comédien en cabine
Tout ce qui suit se trouve dans le script. Pas de curseurs, pas de post-production.
Tags audio
Écrivez l'émotion là où elle se produit
Les tags se placent directement dans le texte, entre crochets, et prennent effet de leur emplacement jusqu'au tag suivant. Six types : émotion, débit, rythme, réactions, accents et effets sonores. Cumulez les indications avec des virgules, et le modèle les exécutera dans l'ordre.
[excited] Big news, everyone. [pause][whispers] The summer menu drops Friday. [laughs]
Langues
Plus de 90 langues, une seule voix
ElevenLabs qualifie la parole expressive dans plusieurs langues comme l'un des problèmes les plus difficiles de l'IA audio. v4 en couvre plus de quatre-vingt-dix, avec les progrès les plus marqués en japonais, portugais brésilien, mandarin et cantonais. La même voix conserve la même direction dans toutes ces langues, de sorte qu'un doublage conserve son casting.
Prises longues
10 000 caractères en une seule requête
Le double de ce qu'acceptait v3 : environ dix minutes d'audio à partir d'une seule génération. Un chapitre, un script complet ou une longue scène conserve son rythme en une seule lecture continue, plutôt que sous forme de paragraphes assemblés.
Prononciation
Dites-le exactement, avec l'IPA
Noms propres, noms de médicaments, noms de lieux, noms de produits : écrivez la prononciation en IPA entre des barres obliques et le modèle le dira à votre façon, à chaque fois. Pour tout le reste, v4 a obtenu le score de prononciation le plus élevé jamais mesuré par Artificial Analysis.
The ferry to Reykjavik /ˈreɪkjavɪk/ leaves at nine.
Clones vocaux
Les clones de voix professionnels sont de retour
v3 n'a jamais pris en charge les clones de voix professionnels. v4 le fait, ce qui permet à une voix produite qui vous appartient de fonctionner avec l'ensemble du vocabulaire de balises. Les clones créés sur des modèles antérieurs se réentraînent pour v4 en un seul clic, avec le consentement vérifié du propriétaire de la voix derrière chaque clone.
L'histoire de sa création
Chaque génération d'ElevenLabs a apporté une nouveauté. v4 est la première à ne pas vous obliger à choisir.
Août 2023
Multilingual v2
29 langues, et ElevenLabs sort de sa phase bêta.
Juil. 2024
Turbo v2.5
Conçu pour la vitesse.
Déc. 2024
Flash
La latence chute à environ 75 ms. Rapide, mais peu expressif.
Juin 2025
Eleven v3 alpha
Les tags audio, plus de 70 langues et les dialogues arrivent. Expressif, mais le propre billet de lancement de v3 conseillait aux développeurs temps réel de rester sur Flash.
Févr. 2026
Eleven v3 passe en disponibilité générale
La gamme expressive gagne en maturité. Le compromis sur la vitesse demeure.
Juin 2026
L'aperçu de Varsovie
Lors de son sommet à Varsovie, ElevenLabs fait la démonstration du prochain modèle en train de chuchoter, de changer d'accent et de modifier ses émotions en direct sur scène.
28 sept. 2026
Eleven v4 + v4 Turbo
Une nouvelle architecture propose les deux orientations à la fois : le modèle le plus expressif jamais conçu par ElevenLabs, et une version Turbo suffisamment rapide pour une conversation en direct.
La preuve
Une évaluation indépendante avant tout : Artificial Analysis organise des arènes d'écoute à aveugle sur tous les grands modèles vocaux.
Artificial Analysis, octobre 2026
Eleven v4
Contexte
Arène des voix de fournisseurs
N° 1
Devant Cartesia Sonic 3.6 et Gemini 3.8 Flash TTS. Eleven v3 se classe en #17 sur le même tableau.
Robustesse de la prononciation
91,7 %
Le score le plus élevé jamais mesuré par Artificial Analysis, tous modèles confondus.
Arène Controlled Voice
N° 2
Derrière Qwen-Audio-3.1-TTS-Plus. v3 a obtenu un score nettement inférieur aux deux.
Vitesse de génération
73,4 car./s
Contre 42,5 pour v3, mesuré par Artificial Analysis.
Lors du propre test de préférence à aveugle d'ElevenLabs, les auditeurs ont choisi v4 environ 75 % du temps par rapport aux modèles concurrents. Ce chiffre provient du fournisseur ; les classements de l'arène ci-dessus n'en font pas partie. Les réactions le jour du lancement : le fil d'annonce et les résultats d'Artificial Analysis.
Ce qui a changé par rapport à la v3
Eleven v3
Eleven v4
Architecture
Famille v3
Entièrement nouveau
Langues
70+
90+
Longueur de la requête
5 000 caractères
10 000 caractères
Clones de voix professionnels
Non pris en charge
Pris en charge
Direction
Tags audio
Tags, consignes en langage naturel, IPA
Temps réel
Non recommandé
v4 Turbo, inférence médiane de ~100 ms
Les scripts que vous avez écrits pour la v3 fonctionnent sur la v4 sans modification.
FAQ
Mes voix clonées existantes fonctionnent-elles sur v4 ?
Après un réentraînement, oui. Les voix clonées sur des modèles antérieurs se réentraînent pour v4 en un seul clic dans la bibliothèque de voix d'ElevenLabs. Attends-toi à des différences : une voix réentraînée peut sonner très différemment de sa version v3, les défauts de l'enregistrement source sont reproduits fidèlement, et les voix créées avec Voice Design peuvent être moins expressives que les clones enregistrés.
Les balises audio sont-elles toujours prises en compte ?
Pas toujours. La documentation d'ElevenLabs elle-même qualifie le suivi des balises de « pas encore parfait » : il arrive parfois qu'une indication d'interprétation soit restituée sous forme d'effet sonore. Vous obtiendrez les résultats les plus fiables en utilisant une seule balise par proposition, placée avant les mots qu'elle affecte, et des indications séparées par des virgules dans un seul crochet lorsque vous souhaitez les superposer.
Que se passe-t-il lorsqu'une voix parle une langue qui n'est pas la sienne ?
Il parle avec l'accent natif de cette langue, et non avec l'accent d'origine de la voix. ElevenLabs indique que cela est intentionnel et qu'une option pour conserver l'accent est à l'étude.
De quels contrôles v4 dispose-t-il ?
Stabilité et similarité. Il n'y a pas de curseur de style ou de vitesse, ni de SSML ; les pauses s'écrivent [pause] et [long pause] dans le script, et tout le reste se fait avec des tags.
v4 ou v4 Turbo ?
v4 pour tout ce que vous générez et conservez : narration, personnages, lectures de longueur de doublage jusqu'à 10 000 caractères. v4 Turbo pour tout ce qui répond : agents vocaux et applications interactives, où sa latence d'inférence médiane de ~100 ms maintient le fil de la conversation.
Écrivez la performance. v4 la restitue.
Choisissez une voix, ajoutez des indications entre crochets et écoutez le résultat en quelques secondes.
Tout l'audio de cette page a été généré dans Popcraft avec des voix ElevenLabs ; le script complet de chaque extrait est affiché à côté. Les images sont générées par IA. Les citations proviennent d'ElevenLabs, extraites du post de lancement d'Eleven v4. Les classements proviennent d<aa>Artificial Analysis</aa>, consultés en octobre 2026.