Eleven v4 + Eleven v4 TurboIa tidak membaca naskah. Ia membawakannya.
ElevenLabs menyebut Eleven v4 "model text-to-speech kami yang paling ekspresif sejauh ini". Tulis penyampaian ke dalam naskah dengan tag inline, dalam 90+ bahasa, hingga 10.000 karakter per rekaman. Dan v4 Turbo menjawab cukup cepat untuk menjaga alur percakapan langsung.
90+ bahasa10.000 karakter per rekamanInline tag audio
Pengisian suara karakterDubbingArahanNPC GameAgen suaraBuku audioPengisian suara karakterDubbingArahanNPC GameAgen suaraBuku audioPengisian suara karakterDubbingArahanNPC GameAgen suaraBuku audioPengisian suara karakterDubbingArahanNPC GameAgen suaraBuku audio
Dengarkan. Naskahnya ada di samping setiap klip.
Delapan pengambilan, dibuat di Popcraft. Kata-kata dalam kurung siku oranye adalah keseluruhan arahan: tidak ada penyuntingan, tidak ada pengambilan ulang yang digabungkan, dan tidak ada apa pun dalam audio yang tidak tertulis di halaman.
01
Satu kalimat, lima penyampaian
[warm] The lighthouse keeper left a lamp burning for ships that never came.
[low, threatening] The lighthouse keeper left a lamp burning for ships that never came.
[rushed] The lighthouse keeper left a lamp burning for ships that never came.
[a tired detective who has heard it all before] The lighthouse keeper left a lamp burning for ships that never came.
[hushed and reverent, like a nature documentary narrator] The lighthouse keeper left a lamp burning for ships that never came.
02
NPC game, mengubah emosi pada satu baris dialog
[casual] You're looking for work, eh? Hmm, I might have something for you. [door creaking][suddenly suspicious, lowering his voice] Wait. Who sent you? [pause][delighted] Marta's cousin! Well why didn't you say so. [coins clinking] Half now, half when it's done.
03
Satu irama, empat bahasa
[softly] Don't be afraid. We'll cross together when the morning comes.
[softly] 怖がらないで。朝が来たら、一緒に渡ろう。Bahasa Jepang
[softly] Não tenha medo. Vamos atravessar juntos quando a manhã chegar.Portugis Brasil
[softly] 别害怕。等天亮了,我们一起过去。Mandarin
Suara yang sama, tag yang sama, empat bahasa yang menurut ElevenLabs mengalami peningkatan terbesar di v4.
04
Agen dukungan yang terdengar seperti agen sungguhan
[warm] Thanks so much for holding. I can see the duplicate charge right here. [reassuring] You don't need to do anything else; the refund goes out today. [clear, measured] And your eSIM for Reykjavik is active. Anything else I can check?
Nada bicara yang dirancang untuk dipertahankan oleh v4 Turbo dalam panggilan langsung.
05
Bisikan yang tetap menjadi bisikan
[whispers] Don't move. It's right behind you. [pause][whispers] On three, we run. One. Two. [shouts] Run!
06
Pembuka langsung buku audio
[quiet, measured narration] When I was young, I thought the mountain stood because it was strong. [pause] I know better now. [long pause] It stood because it had learned where to bend.
v4 menerima 10.000 karakter dalam satu permintaan, sekitar sepuluh menit audio.
07
Senin pagi
[sleepy drowsy voice] Mmm, five more minutes. [yawning] Is it really Monday already?
08
Arahan dalam bahasa sederhana
[like a sports commentator, speeding up] She takes it on the half-volley, past one, past two, she's through on goal. [amazed] Oh, that is extraordinary!
Tag tidak harus berasal dari daftar. Deskripsikan penyampaiannya dan model akan melakukannya.
Dua model. Satu untuk performa, satu untuk percakapan.
Hingga kini Anda harus memilih antara suara yang ekspresif dan yang cepat. Eleven v4 mengakhiri kompromi tersebut: model standar menangani pekerjaan format panjang, dan Turbo menangani panggilan langsung.
Untuk kreator
Eleven v4
Dibangun untuk pembuatan konten dan audio format panjang: buku audio, pekerjaan karakter, narasi sepanjang durasi dubbing. Penyampaian yang Anda tulis adalah penyampaian yang Anda dapatkan, termasuk suara latar.
10.000karakter per permintaan, sekitar sepuluh menit audio dalam satu kali rekam
90+bahasa, meningkat dari 70+ di v3
Tag-tagemosi, tempo, reaksi, aksen, dan efek suara, ditulis sebaris
IPApengucapan tepat, ditulis di antara garis miring
"Puncak dari penelitian terbaru kami dalam pembangkitan ucapan ekspresif."ElevenLabs, postingan peluncuran
Untuk agen suara
Eleven v4 Turbo
Ekspresivitas yang sama, dioptimalkan untuk waktu nyata: sekitar latensi inferensi median 100 ms dan sekitar 150 ms hingga ucapan pertama, berdasarkan pengukuran ElevenLabs.
~100 mslatensi inferensi median
~150 mswaktu median hingga ucapan pertama
Langsungpanggilan dukungan, penjualan, dan penjadwalan yang menyesuaikan nada bicaranya di tengah percakapan
"Lebih cepat dari jeda rata-rata antara dua orang yang sedang mengobrol."ElevenLabs, postingan peluncuran
Arahkan layaknya talenta di dalam studio
Semua di bawah ini ada di dalam naskah itu sendiri. Tanpa slider, tanpa pascaproduksi.
Tag audio
Tuliskan emosinya tepat di mana itu terjadi
Tag ditempatkan sebaris, di dalam kurung siku, dan berlaku dari posisinya hingga tag berikutnya. Ada enam jenis: emosi, penyampaian, kecepatan, reaksi, aksen, dan efek suara. Tumpuk petunjuk dengan koma, dan model akan melakukannya secara berurutan.
[excited] Big news, everyone. [pause][whispers] The summer menu drops Friday. [laughs]
Bahasa
90+ bahasa, satu suara
ElevenLabs menyebut ucapan ekspresif lintas bahasa sebagai salah satu masalah tersulit dalam AI audio. v4 mendukung lebih dari sembilan puluh bahasa, dengan peningkatan terbesar pada bahasa Jepang, Portugis Brasil, Mandarin, dan Kanton. Suara yang sama membawa arahan yang sama di semua bahasa tersebut, sehingga pengisi suara dalam dubbing tetap konsisten.
Rekaman panjang
10.000 karakter dalam satu permintaan
Dua kali lipat dari yang diterima v3: sekitar sepuluh menit audio dari satu kali pembuatan. Sebuah bab, naskah dukungan lengkap, atau adegan panjang mempertahankan temponya sebagai satu bacaan berkelanjutan alih-alih paragraf yang disambung-sambung.
Pengucapan
Ucapkan dengan tepat, menggunakan IPA
Nama orang, nama obat, nama tempat, nama produk: tulis pengucapannya dalam IPA di antara garis miring dan model akan mengucapkannya sesuai keinginan Anda, setiap saat. Untuk hal lainnya, v4 menetapkan skor pengucapan tertinggi yang pernah diukur oleh Artificial Analysis.
The ferry to Reykjavik /ˈreɪkjavɪk/ leaves at nine.
Kloning suara
Klon Suara Profesional kembali hadir
v3 tidak pernah mendukung Professional Voice Clones. v4 mendukungnya, sehingga suara produksi yang Anda miliki dapat beraksi dengan kosakata tag yang lengkap. Kloning yang dibuat pada model sebelumnya dapat dilatih ulang untuk v4 dengan satu klik, dengan persetujuan terverifikasi dari pemilik suara di balik setiap kloning.
Kisah di baliknya
Setiap generasi ElevenLabs menambahkan satu hal. v4 adalah yang pertama yang tidak membuat Anda harus memilih di antaranya.
Agt 2023
Multilingual v2
29 bahasa, dan ElevenLabs keluar dari beta.
Juli 2024
Turbo v2.5
Dibangun untuk kecepatan.
Desember 2024
Flash
Latensi turun menjadi sekitar 75 ms. Cepat, tetapi tidak ekspresif.
Juni 2025
Eleven v3 alpha
Tag audio, 70+ bahasa, dan dialog hadir. Ekspresif, tetapi postingan peluncuran v3 sendiri menyarankan para pengembang real-time untuk tetap menggunakan Flash.
Februari 2026
Eleven v3 rilis umum
Lini ekspresif semakin matang. Kompromi kecepatan tetap ada.
Juni 2026
Pratinjau Warsawa
Di KTT Warsawa, ElevenLabs mendemonstrasikan model berikutnya yang berbisik, mengubah aksen, dan mengubah emosi secara langsung di atas panggung.
28 September 2026
Eleven v4 + v4 Turbo
Arsitektur baru menghadirkan kedua arah sekaligus: model paling ekspresif yang pernah dibangun ElevenLabs, dan versi Turbo yang cukup cepat untuk percakapan langsung.
Bukti
Independen terlebih dahulu: Artificial Analysis mengadakan arena uji dengar buta untuk semua model ucapan utama.
Artificial Analysis, Oktober 2026
Eleven v4
Konteks
Arena Suara Penyedia
#1
Mengungguli Cartesia Sonic 3.6 dan Gemini 3.8 Flash TTS. Eleven v3 berada di peringkat #17 pada papan yang sama.
Ketahanan Pengucapan
91,7%
Skor tertinggi yang pernah diukur oleh Artificial Analysis, pada model apa pun.
Arena Suara Terkendali
#2
Di belakang Qwen-Audio-3.1-TTS-Plus. v3 mencetak skor jauh di bawah keduanya.
Kecepatan generasi
73,4 karakter/detik
Dibandingkan 42,5 untuk v3, diukur oleh Artificial Analysis.
Dalam uji preferensi buta milik ElevenLabs sendiri, pendengar memilih v4 sekitar 75% waktu melawan model pesaing. Angka tersebut adalah milik vendor; peringkat arena di atas bukan. Reaksi pada hari peluncuran: utas pengumuman dan hasil Artificial Analysis.
Apa yang berubah dari v3
Eleven v3
Eleven v4
Arsitektur
Keluarga v3
Sepenuhnya baru
Bahasa
70+
90+
Panjang permintaan
5.000 karakter
10.000 karakter
Klon Suara Profesional
Tidak didukung
Didukung
Arahan
Tag audio
Tag, instruksi bahasa sederhana, IPA
Waktu nyata
Tidak disarankan
v4 Turbo, inferensi median ~100 ms
Skrip yang Anda tulis untuk v3 berjalan di v4 tanpa perubahan.
FAQ
Apakah klon suara saya yang sudah ada berfungsi di v4?
Setelah dilatih ulang, ya. Klon yang dibuat pada model sebelumnya dapat dilatih ulang untuk v4 dengan satu klik di pustaka suara ElevenLabs. Bersiaplah untuk perbedaan: suara yang dilatih ulang dapat terdengar sangat berbeda dari versi v3-nya, cacat pada rekaman sumber akan direproduksi dengan setia, dan suara yang dibuat dengan Voice Design mungkin tampil kurang ekspresif dibandingkan klon rekaman.
Apakah tag audio selalu berfungsi?
Tidak selalu. Dokumentasi ElevenLabs sendiri menyebut penerapan tag "belum sempurna": terkadang isyarat penyampaian justru dirender sebagai efek suara. Anda akan mendapatkan hasil yang paling andal dengan satu tag per klausa, ditempatkan sebelum kata yang dipengaruhi, dan isyarat yang digabung dengan koma di dalam satu kurung siku jika Anda ingin melapisinya.
Apa yang terjadi ketika sebuah suara berbicara dalam bahasa yang bukan bahasa aslinya?
Suara tersebut berbicara dengan aksen asli dari bahasa tersebut, bukan aksen asal suara itu. ElevenLabs menyatakan ini memang disengaja, dan opsi untuk mempertahankan aksen sedang diteliti.
Kontrol apa saja yang dimiliki v4?
Stabilitas dan Kemiripan. Tidak ada penggeser gaya atau kecepatan dan tidak ada SSML; jeda ditulis sebagai [pause] dan [long pause] di dalam skrip, dan sisanya adalah tag.
v4 atau v4 Turbo?
v4 untuk apa pun yang Anda render dan simpan: narasi, karakter, pembacaan sepanjang durasi dubbing hingga 10.000 karakter. v4 Turbo untuk apa pun yang merespons: agen suara dan aplikasi interaktif, di mana latensi inferensi mediannya yang ~100 ms menjaga percakapan tetap mengalir.
Tulis performanya. v4 mewujudkannya.
Pilih suara, letakkan arahan di dalam kurung, dan dengarkan hasilnya dalam hitungan detik.
Semua audio di halaman ini dihasilkan di Popcraft dengan suara ElevenLabs; naskah lengkap untuk setiap klip ditampilkan di sampingnya. Gambar dihasilkan oleh AI. Baris yang dikutip adalah milik ElevenLabs sendiri, dari postingan peluncuran Eleven v4. Peringkat berasal dari Artificial Analysis, diakses pada Oktober 2026.