Eleven v4 + Eleven v4 TurboIa tidak membaca skrip. Ia mempersembahkannya.
ElevenLabs memanggil Eleven v4 "model teks-ke-pertuturan kami yang paling ekspresif setakat ini". Tulis gaya penyampaian terus ke dalam skrip dengan tag sebaris, dalam 90+ bahasa, sehingga 10,000 aksara bagi setiap rakaman. Dan v4 Turbo bertindak balas cukup pantas untuk mengadakan perbualan langsung.
Lapan rakaman, dijana dalam Popcraft. Perkataan dalam kurungan oren ialah keseluruhan arahan: tiada suntingan, tiada rakaman semula yang dicantumkan bersama, dan tiada apa-apa dalam audio yang tidak tertulis pada halaman.
01
Satu ayat, lima penyampaian
[warm] The lighthouse keeper left a lamp burning for ships that never came.
[low, threatening] The lighthouse keeper left a lamp burning for ships that never came.
[rushed] The lighthouse keeper left a lamp burning for ships that never came.
[a tired detective who has heard it all before] The lighthouse keeper left a lamp burning for ships that never came.
[hushed and reverent, like a nature documentary narrator] The lighthouse keeper left a lamp burning for ships that never came.
02
NPC permainan, menyampaikan satu dialog
[casual] You're looking for work, eh? Hmm, I might have something for you. [door creaking][suddenly suspicious, lowering his voice] Wait. Who sent you? [pause][delighted] Marta's cousin! Well why didn't you say so. [coins clinking] Half now, half when it's done.
03
Satu rentak, empat bahasa
[softly] Don't be afraid. We'll cross together when the morning comes.
[softly] 怖がらないで。朝が来たら、一緒に渡ろう。Bahasa Jepun
[softly] Não tenha medo. Vamos atravessar juntos quando a manhã chegar.Portugis Brazil
[softly] 别害怕。等天亮了,我们一起过去。Mandarin
Suara yang sama, tag yang sama, empat bahasa yang menurut ElevenLabs paling banyak meningkat dalam v4.
04
Ejen sokongan yang kedengaran seperti seorang ejen
[warm] Thanks so much for holding. I can see the duplicate charge right here. [reassuring] You don't need to do anything else; the refund goes out today. [clear, measured] And your eSIM for Reykjavik is active. Anything else I can check?
Nada suara yang direka untuk dikekalkan oleh v4 Turbo dalam panggilan langsung.
05
Bisikan yang kekal sebagai bisikan
[whispers] Don't move. It's right behind you. [pause][whispers] On three, we run. One. Two. [shouts] Run!
06
Pembukaan terus buku audio
[quiet, measured narration] When I was young, I thought the mountain stood because it was strong. [pause] I know better now. [long pause] It stood because it had learned where to bend.
v4 memproses 10,000 aksara dalam satu permintaan, kira-kira sepuluh minit audio.
07
Pagi Isnin
[sleepy drowsy voice] Mmm, five more minutes. [yawning] Is it really Monday already?
08
Arahan dalam bahasa mudah
[like a sports commentator, speeding up] She takes it on the half-volley, past one, past two, she's through on goal. [amazed] Oh, that is extraordinary!
Tag tidak semestinya daripada senarai. Huraikan penyampaian dan model akan melaksanakannya.
Dua model. Satu untuk persembahan, satu untuk perbualan.
Sehingga kini anda memilih antara suara yang ekspresif dan yang pantas. Eleven v4 menamatkan kompromi itu: model standard mengendalikan kerja bentuk panjang, dan Turbo mengendalikan panggilan langsung.
Untuk pencipta
Eleven v4
Dibina untuk penciptaan kandungan dan audio bentuk panjang: buku audio, kerja watak, penceritaan sepanjang alih suara. Penyampaian yang anda tulis ialah penyampaian yang anda dapat, termasuk bunyi adegan.
10,000aksara setiap permintaan, kira-kira sepuluh minit audio dalam satu rakaman
90+bahasa, meningkat daripada 70+ dalam v3
Tagemosi, rentak, reaksi, loghat dan kesan bunyi, ditulis secara sebaris
IPAsebutan tepat, ditulis di antara garisan miring ke hadapan
"Kemuncak penyelidikan terkini kami dalam penjanaan pertuturan yang ekspresif."ElevenLabs, siaran pelancaran
Untuk ejen suara
Eleven v4 Turbo
Ekspresiviti yang sama, ditala untuk masa nyata: kira-kira 100 ms kependaman inferens median dan kira-kira 150 ms ke pertuturan pertama, berdasarkan ukuran ElevenLabs.
~100 mskependaman inferens median
~150 msmasa median ke pertuturan pertama
Langsungpanggilan sokongan, jualan dan penjadualan yang menyesuaikan nada mereka semasa perbualan
"Lebih pantas daripada jeda purata antara dua orang yang sedang bercakap."ElevenLabs, siaran pelancaran
Arahkannya seperti bakat di dalam studio
Semua di bawah ini ada dalam skrip itu sendiri. Tiada peluncur, tiada pascaproduksi.
Tag audio
Tulis emosi di tempat ia berlaku
Tag diletakkan sebaris, dalam kurungan siku, dan berkuat kuasa dari kedudukannya sehingga tag seterusnya. Enam jenis: emosi, penyampaian, langkah, reaksi, loghat dan kesan bunyi. Timbun petunjuk dengan koma, dan model akan mempersembahkannya secara berurutan.
[excited] Big news, everyone. [pause][whispers] The summer menu drops Friday. [laughs]
Bahasa
90+ bahasa, satu suara
ElevenLabs menganggap pertuturan ekspresif merentasi bahasa sebagai salah satu masalah paling sukar dalam AI audio. v4 menyokong lebih daripada sembilan puluh bahasa, dengan peningkatan terbesar dalam bahasa Jepun, Portugis Brazil, Mandarin dan Kantonis. Suara yang sama membawa arahan yang sama merentasi kesemuanya, jadi alih suara kekal dengan pelakon asalnya.
Rakaman panjang
10,000 aksara dalam satu permintaan
Dua kali ganda had v3: kira-kira sepuluh minit audio daripada satu penjanaan. Satu bab, skrip sokongan penuh atau adegan panjang mengekalkan rentaknya sebagai satu bacaan berterusan dan bukannya perenggan yang dicantumkan.
Sebutan
Sebut dengan tepat, menggunakan IPA
Nama, nama ubat, nama tempat, nama produk: tulis sebutan dalam IPA di antara garis condong dan model akan menyebutnya mengikut cara anda, setiap kali. Untuk yang lain, v4 menetapkan skor sebutan tertinggi yang pernah diukur oleh Artificial Analysis.
The ferry to Reykjavik /ˈreɪkjavɪk/ leaves at nine.
Klon suara
Klon Suara Profesional kembali
v3 tidak pernah menyokong Klon Suara Profesional. v4 menyokongnya, jadi suara terhasil yang anda miliki boleh beraksi dengan kosa kata tag penuh. Klon yang dibuat pada model terdahulu dilatih semula untuk v4 dengan satu klik, dengan persetujuan yang disahkan oleh pemilik suara di sebalik setiap klon.
Kisah di sebaliknya
Setiap generasi ElevenLabs menambah satu perkara. v4 adalah yang pertama tidak memaksa anda memilih antaranya.
Ogos 2023
Multilingual v2
29 bahasa, dan ElevenLabs keluar daripada fasa beta.
Julai 2024
Turbo v2.5
Dibina untuk kelajuan.
Disember 2024
Flash
Kependaman menurun kepada kira-kira 75 ms. Pantas, tetapi tidak ekspresif.
Jun 2025
Eleven v3 alpha
Tag audio, 70+ bahasa dan dialog tiba. Ekspresif, tetapi siaran pelancaran v3 sendiri memberitahu pembangun masa nyata untuk kekal pada Flash.
Februari 2026
Eleven v3 menjadi GA
Garis ekspresif semakin matang. Kompromi kelajuan kekal.
Jun 2026
Pratonton Warsaw
Di sidang kemuncak Warsaw, ElevenLabs mendemonstrasikan model seterusnya yang berbisik, menukar loghat dan mengubah emosi secara langsung di atas pentas.
28 Sep 2026
Eleven v4 + v4 Turbo
Seni bina baharu menawarkan kedua-dua hala serentak: model paling ekspresif yang pernah dibina oleh ElevenLabs, dan versi Turbo yang cukup pantas untuk perbualan langsung.
Bukti
Bebas dan terdahulu: Artificial Analysis menjalankan arena pendengar buta merentasi setiap model pertuturan utama.
Artificial Analysis, Oktober 2026
Eleven v4
Konteks
Arena Suara Penyedia
#1
Mendahului Cartesia Sonic 3.6 dan Gemini 3.8 Flash TTS. Eleven v3 berada di tangga #17 pada carta yang sama.
Keteguhan Sebutan
91.7%
Skor tertinggi yang pernah diukur oleh Artificial Analysis, pada mana-mana model.
Arena Suara Terkawal
#2
Di belakang Qwen-Audio-3.1-TTS-Plus. v3 mencatatkan skor jauh lebih rendah daripada kedua-duanya.
Kelajuan penjanaan
73.4 aksara/s
Berbanding 42.5 untuk v3, diukur oleh Artificial Analysis.
Dalam ujian keutamaan buta ElevenLabs sendiri, pendengar memilih v4 kira-kira 75% daripada masa berbanding model pesaing. Angka tersebut adalah daripada vendor; kedudukan arena di atas bukanlah demikian. Reaksi pada hari pelancaran: bebenang pengumuman dan keputusan Artificial Analysis.
Apa yang berubah daripada v3
Eleven v3
Eleven v4
Seni bina
Keluarga v3
Serba baharu
Bahasa
70+
90+
Panjang permintaan
5,000 aksara
10,000 aksara
Klon suara profesional
Tidak disokong
Disokong
Arahan
Tag audio
Tag, arahan bahasa biasa, IPA
Masa nyata
Tidak disyorkan
v4 Turbo, ~100 ms inferens median
Skrip yang anda tulis untuk v3 berjalan pada v4 tanpa perubahan.
FAQ
Adakah klon suara sedia ada saya berfungsi pada v4?
Selepas dilatih semula, ya. Klon yang dibuat pada model terdahulu dilatih semula untuk v4 dengan satu klik dalam pustaka suara ElevenLabs. Bersedialah untuk perbezaan: suara yang dilatih semula boleh kedengaran sangat berbeza daripada versi v3-nya, kecacatan dalam rakaman sumber dihasilkan semula dengan setia, dan suara yang dibina dengan Voice Design mungkin kurang ekspresif berbanding klon rakaman.
Adakah tag audio sentiasa menjadi?
Tidak sentiasa. Dokumen ElevenLabs sendiri memanggil pematuhan tag sebagai "belum sempurna lagi": kadangkala isyarat penyampaian dihasilkan sebagai kesan bunyi. Anda akan mendapat hasil yang paling boleh dipercayai dengan satu tag bagi setiap klausa, diletakkan sebelum perkataan yang terjejas, dan isyarat yang dicantumkan dengan koma di dalam satu kurungan apabila anda ingin melapisinya.
Apakah yang berlaku apabila suara bertutur dalam bahasa yang bukan bahasa asalnya?
Ia bertutur dengan loghat asli bahasa tersebut, bukan loghat asal suara itu. ElevenLabs menyatakan ini adalah mengikut reka bentuk, dan togol pengekalan loghat sedang dikaji.
Kawalan manakah yang ada pada v4?
Kestabilan dan Keserupaan. Tiada peluncur gaya atau kelajuan dan tiada SSML; jeda ditulis sebagai [pause] dan [long pause] dalam skrip, dan yang lain hanyalah tag.
v4 atau v4 Turbo?
v4 untuk apa sahaja yang anda jana dan simpan: penceritaan, watak, bacaan sepanjang alih suara sehingga 10,000 aksara. v4 Turbo untuk apa sahaja yang membalas: ejen suara dan aplikasi interaktif, di mana kependaman inferens median ~100 ms memastikan perbualan berjalan lancar.
Tulis persembahan. v4 menyampaikannya.
Pilih suara, letakkan arahan dalam kurungan, dan dengar hasilnya dalam beberapa saat.
Semua audio di halaman ini dijana dalam Popcraft dengan suara ElevenLabs; skrip penuh untuk setiap klip ditunjukkan di sebelahnya. Imej dijana oleh AI. Baris petikan adalah milik ElevenLabs sendiri, dari siaran pelancaran Eleven v4. Kedudukan adalah dari Artificial Analysis, dibaca pada Oktober 2026.