Eleven v4 + Eleven v4 TurboEs liest nicht einfach das Skript. Es führt es auf.
ElevenLabs nennt Eleven v4 „unser bisher emotionalstes Text-to-Speech-Modell“. Schreibe die Betonung mit Inline-Tags direkt in das Skript, in über 90 Sprachen und mit bis zu 10.000 Zeichen pro Aufnahme. Und v4 Turbo antwortet schnell genug für ein Live-Gespräch.
Hör es dir an. Das Skript befindet sich neben jedem Clip.
Acht Takes, generiert in Popcraft. Die Wörter in orangefarbenen Klammern sind die gesamte Regieanweisung: Es gibt keinen Schnitt, keine zusammengefügten Wiederholungen und nichts im Audio, das nicht auf der Seite steht.
01
Ein Satz, fünf Sprechweisen
[warm] The lighthouse keeper left a lamp burning for ships that never came.
[low, threatening] The lighthouse keeper left a lamp burning for ships that never came.
[rushed] The lighthouse keeper left a lamp burning for ships that never came.
[a tired detective who has heard it all before] The lighthouse keeper left a lamp burning for ships that never came.
[hushed and reverent, like a nature documentary narrator] The lighthouse keeper left a lamp burning for ships that never came.
02
Ein Spiel-NPC, der mitten in der Zeile die Stimmung wechselt
[casual] You're looking for work, eh? Hmm, I might have something for you. [door creaking][suddenly suspicious, lowering his voice] Wait. Who sent you? [pause][delighted] Marta's cousin! Well why didn't you say so. [coins clinking] Half now, half when it's done.
03
Ein Beat, vier Sprachen
[softly] Don't be afraid. We'll cross together when the morning comes.
[softly] 怖がらないで。朝が来たら、一緒に渡ろう。Japanisch
[softly] Não tenha medo. Vamos atravessar juntos quando a manhã chegar.Brasilianisches Portugiesisch
[softly] 别害怕。等天亮了,我们一起过去。Mandarin
Gleiche Stimme, gleiches Tag: die vier Sprachen, die laut ElevenLabs in v4 am stärksten zugelegt haben.
04
Ein Kundensupport-Mitarbeiter, der auch wie einer klingt
[warm] Thanks so much for holding. I can see the duplicate charge right here. [reassuring] You don't need to do anything else; the refund goes out today. [clear, measured] And your eSIM for Reykjavik is active. Anything else I can check?
Das Register, das v4 Turbo in einem Live-Anruf halten soll.
05
Ein Flüstern, das ein Flüstern bleibt
[whispers] Don't move. It's right behind you. [pause][whispers] On three, we run. One. Two. [shouts] Run!
06
Ein Hörbuch-Cold-Open
[quiet, measured narration] When I was young, I thought the mountain stood because it was strong. [pause] I know better now. [long pause] It stood because it had learned where to bend.
v4 verarbeitet 10.000 Zeichen in einer Anfrage, was etwa zehn Minuten Audio entspricht.
07
Montagmorgen
[sleepy drowsy voice] Mmm, five more minutes. [yawning] Is it really Monday already?
08
Regieanweisungen in einfacher Sprache
[like a sports commentator, speeding up] She takes it on the half-volley, past one, past two, she's through on goal. [amazed] Oh, that is extraordinary!
Ein Tag muss nicht aus einer Liste stammen. Beschreibe die Vortragsweise und das Modell setzt sie um.
Zwei Modelle. Eines für die Performance, eines für die Konversation.
Bisher musstest du dich zwischen ausdrucksstarken und schnellen Stimmen entscheiden. Eleven v4 beendet diesen Kompromiss: Das Standardmodell übernimmt Langform-Arbeiten, und Turbo übernimmt Live-Anrufe.
Für Creator
Eleven v4
Entwickelt für die Content-Erstellung und lange Audioformate: Hörbücher, Sprecherrollen, Narrationen in Synchronlänge. Der Vortrag, den du schreibst, ist der Vortrag, den du bekommst – Szenengeräusche inklusive.
10.000Zeichen pro Anfrage, etwa zehn Minuten Audio in einem Take
90+Sprachen, zuvor 70+ in v3
TagsEmotionen, Sprechtempo, Reaktionen, Akzente und Soundeffekte, direkt im Text geschrieben
IPAExakte Aussprache, geschrieben zwischen Schrägstrichen
„Der Höhepunkt unserer neuesten Forschung zur ausdrucksstarken Sprachgenerierung.“ElevenLabs, Launch-Beitrag
Für Sprachassistenten
Eleven v4 Turbo
Dieselbe Ausdrucksstärke, optimiert für Echtzeit: laut Messungen von ElevenLabs etwa 100 ms mittlere Inferenzlatenz und etwa 150 ms bis zur ersten Sprachausgabe.
~100 msMediane Inferenzlatenz
~150 msMediane Zeit bis zur ersten Sprachausgabe
LiveSupport-, Vertriebs- und Terminierungsanrufe, die ihren Tonfall mitten im Gespräch anpassen
„Schneller als die durchschnittliche Pause zwischen zwei sprechenden Menschen.“ElevenLabs, Launch-Beitrag
Führe Regie wie bei Talenten in der Sprecherkabine
Alles hierunter befindet sich im Skript selbst. Keine Regler, kein Post-Processing.
Audio-Tags
Schreibe die Emotion dort, wo sie entsteht
Tags stehen inline in eckigen Klammern und wirken von ihrer Position bis zum nächsten Tag. Sechs Arten: Emotion, Vortragsart, Sprechtempo, Reaktionen, Akzente und Soundeffekte. Trenne Anweisungen mit Kommas, und das Modell führt sie der Reihe nach aus.
[excited] Big news, everyone. [pause][whispers] The summer menu drops Friday. [laughs]
Sprachen
90+ Sprachen, eine Stimme
ElevenLabs bezeichnet ausdrucksstarke Sprache über Sprachgrenzen hinweg als eines der schwierigsten Probleme der Audio-KI. v4 deckt mehr als neunzig Sprachen ab, mit den größten Fortschritten bei Japanisch, brasilianischem Portugiesisch, Mandarin und Kantonesisch. Dieselbe Stimme behält in allen Sprachen dieselbe Regie bei, sodass eine Synchronisation ihre Besetzung beibehält.
Lange Aufnahmen
10.000 Zeichen in einer Anfrage
Doppelt so viel wie bei v3: etwa zehn Minuten Audio aus einer einzigen Generierung. Ein Kapitel, ein vollständiges Support-Skript oder eine lange Szene behält ihr Tempo als durchgehender Vortrag statt zusammengefügter Absätze.
Aussprache
Sag es exakt, mit IPA
Namen, Arzneimittelnamen, Ortsnamen, Produktnamen: Schreibe die Aussprache in IPA zwischen Schrägstrichen, und das Modell spricht es jedes Mal genau so aus, wie du es willst. Für alles andere hat v4 den höchsten Aussprachescore erzielt, den Artificial Analysis je gemessen hat.
The ferry to Reykjavik /ˈreɪkjavɪk/ leaves at nine.
Stimmklone
Professionelle Stimmenklone sind zurück
v3 hat Professional Voice Clones nie unterstützt. v4 schon, sodass eine produzierte Stimme, die dir gehört, mit dem vollständigen Tag-Vokabular performen kann. Auf früheren Modellen erstellte Klone lassen sich mit einem Klick für v4 neu trainieren – mit der verifizierten Zustimmung des Stimmeninhabers hinter jedem Klon.
Die Geschichte dahinter
Jede ElevenLabs-Generierung hat eine Sache hinzugefügt. v4 ist die erste, bei der du dich nicht zwischen ihnen entscheiden musst.
Aug. 2023
Multilingual v2
29 Sprachen, und ElevenLabs verlässt die Beta-Phase.
Juli 2024
Turbo v2.5
Auf Geschwindigkeit ausgelegt.
Dez. 2024
Flash
Die Latenz sinkt auf etwa 75 ms. Schnell, aber nicht ausdrucksstark.
Juni 2025
Eleven v3 Alpha
Audio-Tags, 70+ Sprachen und Dialoge halten Einzug. Ausdrucksstark, aber der eigene Launch-Beitrag zu v3 riet Echtzeit-Entwicklern, bei Flash zu bleiben.
Feb. 2026
Eleven v3 ist jetzt allgemein verfügbar
Die ausdrucksstarke Linie reift heran. Der Kompromiss bei der Geschwindigkeit bleibt.
Juni 2026
Die Warschauer Vorschau
Auf seinem Summit in Warschau demonstriert ElevenLabs live auf der Bühne, wie das nächste Modell flüstert, Akzente variiert und Emotionen wechselt.
28. Sep. 2026
Eleven v4 + v4 Turbo
Eine neue Architektur deckt beide Richtungen gleichzeitig ab: das ausdrucksstärkste Modell, das ElevenLabs entwickelt hat, und eine Turbo-Variante, die schnell genug für Live-Gespräche ist.
Der Beweis
Unabhängig an erster Stelle: Artificial Analysis führt verdeckte Hörer-Arenatests mit allen wichtigen Sprachmodellen durch.
Artificial Analysis, Oktober 2026
Eleven v4
Kontext
Anbieter-Stimmen-Arena
#1
Vor Cartesia Sonic 3.6 und Gemini 3.8 Flash TTS. Eleven v3 liegt auf derselben Rangliste auf Platz 17.
Ausspracherobustheit
91,7 %
Der höchste Wert, den Artificial Analysis je gemessen hat – bei allen Modellen.
Controlled-Voice-Arena
#2
Hinter Qwen-Audio-3.1-TTS-Plus. v3 schnitt deutlich schlechter als beide ab.
Generierungsgeschwindigkeit
73,4 Zeichen/s
Gegenüber 42,5 bei v3, gemessen von Artificial Analysis.
In den eigenen verdeckten Präferenztests von ElevenLabs entschieden sich Hörer in etwa 75 % der Fälle für v4 gegenüber Konkurrenzmodellen. Diese Zahl stammt vom Anbieter; die obigen Arena-Ranglisten hingegen nicht. Reaktionen am Starttag: der Ankündigungs-Thread und die Ergebnisse von Artificial Analysis.
Was sich gegenüber v3 geändert hat
Eleven v3
Eleven v4
Architektur
v3-Familie
Komplett neu
Sprachen
70+
90+
Anfragenlänge
5.000 Zeichen
10.000 Zeichen
Professionelle Stimmenklone
Nicht unterstützt
Unterstützt
Regie
Audio-Tags
Tags, Regieanweisungen in Alltagssprache, IPA
Echtzeit
Nicht empfohlen
v4 Turbo, ~100 ms mediane Inferenz
Skripte, die du für v3 geschrieben hast, laufen unverändert auf v4.
FAQ
Funktionieren meine bereits geklonten Stimmen mit v4?
Nach einem erneuten Training, ja. Klonstimmen, die mit früheren Modellen erstellt wurden, lassen sich in der Stimmenbibliothek von ElevenLabs mit nur einem Klick für v4 neu trainieren. Stelle dich auf Unterschiede ein: Eine neu trainierte Stimme kann sich erheblich von ihrer v3-Version unterscheiden, Mängel der Quellaufnahme werden getreu wiedergegeben und mit Voice Design erstellte Stimmen schneiden möglicherweise weniger ausdrucksstark ab als aufgenommene Klonstimmen.
Funktionieren Audio-Tags immer zuverlässig?
Nicht immer. Die Dokumentation von ElevenLabs bezeichnet das Befolgen von Tags selbst als „noch nicht perfekt“: Gelegentlich wird eine Regieanweisung stattdessen als Soundeffekt wiedergegeben. Die zuverlässigsten Ergebnisse erzielst du mit einem Tag pro Teilsatz, der vor den betroffenen Wörtern platziert wird, sowie kommagetrennten Anweisungen innerhalb einer einzelnen eckigen Klammer, wenn du sie kombinieren möchtest.
Was passiert, wenn eine Stimme eine Sprache spricht, die nicht ihre eigene ist?
Es spricht mit dem muttersprachlichen Akzent dieser Sprache, nicht mit dem Heimatakzent der Stimme. Laut ElevenLabs ist dies so gewollt; eine Option zum Beibehalten des Akzents wird derzeit erforscht.
Welche Steuerungsmöglichkeiten bietet v4?
Stabilität und Ähnlichkeit. Es gibt keine Regler für Stil oder Geschwindigkeit und kein SSML; Pausen werden im Skript als [pause] und [long pause] geschrieben, und alles andere sind Tags.
v4 oder v4 Turbo?
v4 für alles, was du renderst und behältst: Narration, Charaktere, Vertonungen in Synchronlänge mit bis zu 10.000 Zeichen. v4 Turbo für alles, was antwortet: Sprachagenten und interaktive Apps, bei denen die mediane Inferenzlatenz von ~100 ms das Gespräch im Fluss hält.
Schreibe die Performance. v4 liefert sie.
Wähle eine Stimme, setze die Regieanweisung in Klammern und höre den Take in Sekundenschnelle.
Alle Audioaufnahmen auf dieser Seite wurden in Popcraft mit Stimmen von ElevenLabs generiert; das vollständige Skript für jeden Clip wird daneben angezeigt. Bilder sind KI-generiert. Zitierte Zeilen stammen von ElevenLabs selbst aus dem Launch-Beitrag zu Eleven v4. Die Ranglisten stammen von Artificial Analysis, Stand Oktober 2026.