NEWCréez des modèles 3D à partir de texte ou d'images — riggez, animez, exportez.Essayer la 3D
PopcraftPopcraft
Modèle vocal par ElevenLabs

Eleven v4 + Eleven v4 TurboIl ne lit pas le texte.
Il l'interprète.

ElevenLabs qualifie Eleven v4 de « notre modèle de synthèse vocale le plus expressif à ce jour ». Intégrez l'interprétation directement dans le script grâce à des balises en ligne, dans plus de 90 langues et jusqu'à 10 000 caractères par prise. Et v4 Turbo répond suffisamment vite pour soutenir une conversation en direct.

[whispers] Don't move. It's right behind you.Eleven v4Synthèse vocaleGénérer
90+ langues10 000 caractères par priseIntégré balises audio
Une comédienne de doublage devant un micro à condensateur dans une cabine d'enregistrement sombre, éclairée par une lampe d'appoint chaleureuse
Voix de personnages
Un studio de doublage : une actrice regarde une scène projetée, le visage éclairé par l'écran
Doublage
Une régie la nuit, des formes d'onde lumineuses sur les moniteurs devant un ingénieur
Direction
Un personnage de jeu : un chevalier en armure à la lumière du feu, en train de réciter une réplique
PNJ de jeu
Un agent du support en appel avec un casque dans un bureau à l'aube
Agents vocaux
Un narrateur aux cheveux argentés lit à haute voix un livre relié, assis dans un fauteuil sous une liseuse
Livres audio

Écoutez. Le script est à côté de chaque extrait.

Huit prises, générées dans Popcraft. Les mots entre crochets orange constituent toute la direction : il n'y a aucun montage, aucune prise assemblée, et rien dans l'audio qui ne figure pas sur la page.

01

Une phrase, cinq interprétations

[warm] The lighthouse keeper left a lamp burning for ships that never came.

[low, threatening] The lighthouse keeper left a lamp burning for ships that never came.

[rushed] The lighthouse keeper left a lamp burning for ships that never came.

[a tired detective who has heard it all before] The lighthouse keeper left a lamp burning for ships that never came.

[hushed and reverent, like a nature documentary narrator] The lighthouse keeper left a lamp burning for ships that never came.

02

Un PNJ de jeu vidéo, basculant sur une réplique

[casual] You're looking for work, eh? Hmm, I might have something for you. [door creaking] [suddenly suspicious, lowering his voice] Wait. Who sent you? [pause] [delighted] Marta's cousin! Well why didn't you say so. [coins clinking] Half now, half when it's done.

03

Un rythme, quatre langues

[softly] Don't be afraid. We'll cross together when the morning comes.

[softly] 怖がらないで。朝が来たら、一緒に渡ろう。Japonais

[softly] Não tenha medo. Vamos atravessar juntos quando a manhã chegar.Portugais du Brésil

[softly] 别害怕。等天亮了,我们一起过去。Mandarin

Même voix, même tag, les quatre langues qui ont le plus progressé dans la v4 selon ElevenLabs.

04

Un agent du support qui sonne vraiment comme tel

[warm] Thanks so much for holding. I can see the duplicate charge right here. [reassuring] You don't need to do anything else; the refund goes out today. [clear, measured] And your eSIM for Reykjavik is active. Anything else I can check?

Le registre que v4 Turbo est conçu pour tenir lors d'un appel en direct.

05

Un chuchotement qui reste un chuchotement

[whispers] Don't move. It's right behind you. [pause] [whispers] On three, we run. One. Two. [shouts] Run!

06

Une scène d'ouverture de livre audio

[quiet, measured narration] When I was young, I thought the mountain stood because it was strong. [pause] I know better now. [long pause] It stood because it had learned where to bend.

v4 accepte 10 000 caractères en une seule requête, soit environ dix minutes d'audio.

07

Lundi matin

[sleepy drowsy voice] Mmm, five more minutes. [yawning] Is it really Monday already?

08

Direction en langage clair

[like a sports commentator, speeding up] She takes it on the half-volley, past one, past two, she's through on goal. [amazed] Oh, that is extraordinary!

Un tag n'a pas besoin de provenir d'une liste. Décris l'interprétation et le modèle l'exécute.

Deux modèles. L'un pour la performance, l'autre pour la conversation.

Jusqu'à présent, vous deviez choisir entre des voix expressives et des voix rapides. Eleven v4 met fin à ce compromis : le modèle standard gère les contenus longs, et Turbo s'occupe des appels en direct.

Pour les créateurs

Eleven v4

Conçu pour la création de contenu et l'audio long format : livres audio, jeu de personnage, narration de longueur de doublage. L'interprétation que vous écrivez est l'interprétation que vous obtenez, bruits de scène inclus.

  • 10 000caractères par requête, soit environ dix minutes d'audio en une prise
  • 90+langues, contre 70+ dans v3
  • Étiquettesémotion, rythme, réactions, accents et effets sonores, écrits en ligne
  • IPAprononciation exacte, écrite entre barres obliques
« L'aboutissement de nos dernières recherches en matière de génération de parole expressive. »ElevenLabs, article de lancement
Pour les agents vocaux

Eleven v4 Turbo

La même expressivité, optimisée pour le temps réel : environ 100 ms de latence médiane d'inférence et environ 150 ms jusqu'à la première parole, selon les mesures d'ElevenLabs.

  • ~100 mslatence d'inférence médiane
  • ~150 mstemps médian avant la première parole
  • En directappels d'assistance, de vente et de planification qui adaptent leur ton en cours de conversation
« Plus rapide que la pause moyenne entre deux personnes qui parlent. »ElevenLabs, article de lancement

Dirigez la voix comme un comédien en cabine

Tout ce qui suit se trouve dans le script. Pas de curseurs, pas de post-production.

Tags audio

Écrivez l'émotion là où elle se produit

Les tags se placent directement dans le texte, entre crochets, et prennent effet de leur emplacement jusqu'au tag suivant. Six types : émotion, débit, rythme, réactions, accents et effets sonores. Cumulez les indications avec des virgules, et le modèle les exécutera dans l'ordre.

[excited] Big news, everyone. [pause] [whispers] The summer menu drops Friday. [laughs]
Un gros plan d'un microphone à condensateur dans un halo de rétroéclairage
Langues

Plus de 90 langues, une seule voix

ElevenLabs qualifie la parole expressive dans plusieurs langues comme l'un des problèmes les plus difficiles de l'IA audio. v4 en couvre plus de quatre-vingt-dix, avec les progrès les plus marqués en japonais, portugais brésilien, mandarin et cantonais. La même voix conserve la même direction dans toutes ces langues, de sorte qu'un doublage conserve son casting.

Une troupe de fiction radio composée de quatre comédiens réunis autour d'un même microphone
Prises longues

10 000 caractères en une seule requête

Le double de ce qu'acceptait v3 : environ dix minutes d'audio à partir d'une seule génération. Un chapitre, un script complet ou une longue scène conserve son rythme en une seule lecture continue, plutôt que sous forme de paragraphes assemblés.

Une haute pile de pages de manuscrit à côté d'un microphone de studio sous la lumière chaude d'une lampe
Prononciation

Dites-le exactement, avec l'IPA

Noms propres, noms de médicaments, noms de lieux, noms de produits : écrivez la prononciation en IPA entre des barres obliques et le modèle le dira à votre façon, à chaque fois. Pour tout le reste, v4 a obtenu le score de prononciation le plus élevé jamais mesuré par Artificial Analysis.

The ferry to Reykjavik /ˈreɪkjavɪk/ leaves at nine.
Une page de script annotée au crayon sur un pupitre
Clones vocaux

Les clones de voix professionnels sont de retour

v3 n'a jamais pris en charge les clones de voix professionnels. v4 le fait, ce qui permet à une voix produite qui vous appartient de fonctionner avec l'ensemble du vocabulaire de balises. Les clones créés sur des modèles antérieurs se réentraînent pour v4 en un seul clic, avec le consentement vérifié du propriétaire de la voix derrière chaque clone.

Deux magnétophones à bande identiques côte à côte dans un rack de studio

L'histoire de sa création

Chaque génération d'ElevenLabs a apporté une nouveauté. v4 est la première à ne pas vous obliger à choisir.

  • Août 2023

    Multilingual v2

    29 langues, et ElevenLabs sort de sa phase bêta.

  • Juil. 2024

    Turbo v2.5

    Conçu pour la vitesse.

  • Déc. 2024

    Flash

    La latence chute à environ 75 ms. Rapide, mais peu expressif.

  • Juin 2025

    Eleven v3 alpha

    Les tags audio, plus de 70 langues et les dialogues arrivent. Expressif, mais le propre billet de lancement de v3 conseillait aux développeurs temps réel de rester sur Flash.

  • Févr. 2026

    Eleven v3 passe en disponibilité générale

    La gamme expressive gagne en maturité. Le compromis sur la vitesse demeure.

  • Juin 2026

    L'aperçu de Varsovie

    Lors de son sommet à Varsovie, ElevenLabs fait la démonstration du prochain modèle en train de chuchoter, de changer d'accent et de modifier ses émotions en direct sur scène.

  • 28 sept. 2026

    Eleven v4 + v4 Turbo

    Une nouvelle architecture propose les deux orientations à la fois : le modèle le plus expressif jamais conçu par ElevenLabs, et une version Turbo suffisamment rapide pour une conversation en direct.

La preuve

Une évaluation indépendante avant tout : Artificial Analysis organise des arènes d'écoute à aveugle sur tous les grands modèles vocaux.

Artificial Analysis, octobre 2026Eleven v4Contexte
Arène des voix de fournisseursN° 1Devant Cartesia Sonic 3.6 et Gemini 3.8 Flash TTS. Eleven v3 se classe en #17 sur le même tableau.
Robustesse de la prononciation91,7 %Le score le plus élevé jamais mesuré par Artificial Analysis, tous modèles confondus.
Arène Controlled VoiceN° 2Derrière Qwen-Audio-3.1-TTS-Plus. v3 a obtenu un score nettement inférieur aux deux.
Vitesse de génération73,4 car./sContre 42,5 pour v3, mesuré par Artificial Analysis.

Lors du propre test de préférence à aveugle d'ElevenLabs, les auditeurs ont choisi v4 environ 75 % du temps par rapport aux modèles concurrents. Ce chiffre provient du fournisseur ; les classements de l'arène ci-dessus n'en font pas partie. Les réactions le jour du lancement : le fil d'annonce et les résultats d'Artificial Analysis.

Ce qui a changé par rapport à la v3

Eleven v3Eleven v4
ArchitectureFamille v3Entièrement nouveau
Langues70+90+
Longueur de la requête5 000 caractères10 000 caractères
Clones de voix professionnelsNon pris en chargePris en charge
DirectionTags audioTags, consignes en langage naturel, IPA
Temps réelNon recommandév4 Turbo, inférence médiane de ~100 ms

Les scripts que vous avez écrits pour la v3 fonctionnent sur la v4 sans modification.

FAQ

Mes voix clonées existantes fonctionnent-elles sur v4 ?

Après un réentraînement, oui. Les voix clonées sur des modèles antérieurs se réentraînent pour v4 en un seul clic dans la bibliothèque de voix d'ElevenLabs. Attends-toi à des différences : une voix réentraînée peut sonner très différemment de sa version v3, les défauts de l'enregistrement source sont reproduits fidèlement, et les voix créées avec Voice Design peuvent être moins expressives que les clones enregistrés.

Les balises audio sont-elles toujours prises en compte ?

Pas toujours. La documentation d'ElevenLabs elle-même qualifie le suivi des balises de « pas encore parfait » : il arrive parfois qu'une indication d'interprétation soit restituée sous forme d'effet sonore. Vous obtiendrez les résultats les plus fiables en utilisant une seule balise par proposition, placée avant les mots qu'elle affecte, et des indications séparées par des virgules dans un seul crochet lorsque vous souhaitez les superposer.

Que se passe-t-il lorsqu'une voix parle une langue qui n'est pas la sienne ?

Il parle avec l'accent natif de cette langue, et non avec l'accent d'origine de la voix. ElevenLabs indique que cela est intentionnel et qu'une option pour conserver l'accent est à l'étude.

De quels contrôles v4 dispose-t-il ?

Stabilité et similarité. Il n'y a pas de curseur de style ou de vitesse, ni de SSML ; les pauses s'écrivent [pause] et [long pause] dans le script, et tout le reste se fait avec des tags.

v4 ou v4 Turbo ?

v4 pour tout ce que vous générez et conservez : narration, personnages, lectures de longueur de doublage jusqu'à 10 000 caractères. v4 Turbo pour tout ce qui répond : agents vocaux et applications interactives, où sa latence d'inférence médiane de ~100 ms maintient le fil de la conversation.

Écrivez la performance. v4 la restitue.

Choisissez une voix, ajoutez des indications entre crochets et écoutez le résultat en quelques secondes.

Tout l'audio de cette page a été généré dans Popcraft avec des voix ElevenLabs ; le script complet de chaque extrait est affiché à côté. Les images sont générées par IA. Les citations proviennent d'ElevenLabs, extraites du post de lancement d'Eleven v4. Les classements proviennent d<aa>Artificial Analysis</aa>, consultés en octobre 2026.

Continuez à explorer

Modèles associés