NEWBuat model 3D dari teks atau gambar — rig, animasi, ekspor.Coba 3D
PopcraftPopcraft
Model suara dari ElevenLabs

Eleven v4 + Eleven v4 TurboIa tidak membaca naskah.
Ia membawakannya.

ElevenLabs menyebut Eleven v4 "model text-to-speech kami yang paling ekspresif sejauh ini". Tulis penyampaian ke dalam naskah dengan tag inline, dalam 90+ bahasa, hingga 10.000 karakter per rekaman. Dan v4 Turbo menjawab cukup cepat untuk menjaga alur percakapan langsung.

[whispers] Don't move. It's right behind you.Eleven v4TTSHasilkan
90+ bahasa10.000 karakter per rekamanInline tag audio
Seorang pengisi suara wanita di mikrofon kondensor di bilik rekaman yang remang, diterangi oleh lampu praktis yang hangat
Pengisian suara karakter
Panggung dubbing: seorang aktris menonton adegan yang diproyeksikan, wajahnya diterangi oleh layar
Dubbing
Ruang kontrol pada malam hari, bentuk gelombang bersinar pada monitor di hadapan seorang insinyur
Arahan
Karakter game: ksatria berzirah di bawah cahaya api, di tengah dialog
NPC Game
Agen dukungan dengan headset di kantor saat fajar
Agen suara
Narator berambut perak membaca dengan lantang dari buku bersampul tebal di kursi empuk di bawah lampu baca
Buku audio

Dengarkan. Naskahnya ada di samping setiap klip.

Delapan pengambilan, dibuat di Popcraft. Kata-kata dalam kurung siku oranye adalah keseluruhan arahan: tidak ada penyuntingan, tidak ada pengambilan ulang yang digabungkan, dan tidak ada apa pun dalam audio yang tidak tertulis di halaman.

01

Satu kalimat, lima penyampaian

[warm] The lighthouse keeper left a lamp burning for ships that never came.

[low, threatening] The lighthouse keeper left a lamp burning for ships that never came.

[rushed] The lighthouse keeper left a lamp burning for ships that never came.

[a tired detective who has heard it all before] The lighthouse keeper left a lamp burning for ships that never came.

[hushed and reverent, like a nature documentary narrator] The lighthouse keeper left a lamp burning for ships that never came.

02

NPC game, mengubah emosi pada satu baris dialog

[casual] You're looking for work, eh? Hmm, I might have something for you. [door creaking] [suddenly suspicious, lowering his voice] Wait. Who sent you? [pause] [delighted] Marta's cousin! Well why didn't you say so. [coins clinking] Half now, half when it's done.

03

Satu irama, empat bahasa

[softly] Don't be afraid. We'll cross together when the morning comes.

[softly] 怖がらないで。朝が来たら、一緒に渡ろう。Bahasa Jepang

[softly] Não tenha medo. Vamos atravessar juntos quando a manhã chegar.Portugis Brasil

[softly] 别害怕。等天亮了,我们一起过去。Mandarin

Suara yang sama, tag yang sama, empat bahasa yang menurut ElevenLabs mengalami peningkatan terbesar di v4.

04

Agen dukungan yang terdengar seperti agen sungguhan

[warm] Thanks so much for holding. I can see the duplicate charge right here. [reassuring] You don't need to do anything else; the refund goes out today. [clear, measured] And your eSIM for Reykjavik is active. Anything else I can check?

Nada bicara yang dirancang untuk dipertahankan oleh v4 Turbo dalam panggilan langsung.

05

Bisikan yang tetap menjadi bisikan

[whispers] Don't move. It's right behind you. [pause] [whispers] On three, we run. One. Two. [shouts] Run!

06

Pembuka langsung buku audio

[quiet, measured narration] When I was young, I thought the mountain stood because it was strong. [pause] I know better now. [long pause] It stood because it had learned where to bend.

v4 menerima 10.000 karakter dalam satu permintaan, sekitar sepuluh menit audio.

07

Senin pagi

[sleepy drowsy voice] Mmm, five more minutes. [yawning] Is it really Monday already?

08

Arahan dalam bahasa sederhana

[like a sports commentator, speeding up] She takes it on the half-volley, past one, past two, she's through on goal. [amazed] Oh, that is extraordinary!

Tag tidak harus berasal dari daftar. Deskripsikan penyampaiannya dan model akan melakukannya.

Dua model. Satu untuk performa, satu untuk percakapan.

Hingga kini Anda harus memilih antara suara yang ekspresif dan yang cepat. Eleven v4 mengakhiri kompromi tersebut: model standar menangani pekerjaan format panjang, dan Turbo menangani panggilan langsung.

Untuk kreator

Eleven v4

Dibangun untuk pembuatan konten dan audio format panjang: buku audio, pekerjaan karakter, narasi sepanjang durasi dubbing. Penyampaian yang Anda tulis adalah penyampaian yang Anda dapatkan, termasuk suara latar.

  • 10.000karakter per permintaan, sekitar sepuluh menit audio dalam satu kali rekam
  • 90+bahasa, meningkat dari 70+ di v3
  • Tag-tagemosi, tempo, reaksi, aksen, dan efek suara, ditulis sebaris
  • IPApengucapan tepat, ditulis di antara garis miring
"Puncak dari penelitian terbaru kami dalam pembangkitan ucapan ekspresif."ElevenLabs, postingan peluncuran
Untuk agen suara

Eleven v4 Turbo

Ekspresivitas yang sama, dioptimalkan untuk waktu nyata: sekitar latensi inferensi median 100 ms dan sekitar 150 ms hingga ucapan pertama, berdasarkan pengukuran ElevenLabs.

  • ~100 mslatensi inferensi median
  • ~150 mswaktu median hingga ucapan pertama
  • Langsungpanggilan dukungan, penjualan, dan penjadwalan yang menyesuaikan nada bicaranya di tengah percakapan
"Lebih cepat dari jeda rata-rata antara dua orang yang sedang mengobrol."ElevenLabs, postingan peluncuran

Arahkan layaknya talenta di dalam studio

Semua di bawah ini ada di dalam naskah itu sendiri. Tanpa slider, tanpa pascaproduksi.

Tag audio

Tuliskan emosinya tepat di mana itu terjadi

Tag ditempatkan sebaris, di dalam kurung siku, dan berlaku dari posisinya hingga tag berikutnya. Ada enam jenis: emosi, penyampaian, kecepatan, reaksi, aksen, dan efek suara. Tumpuk petunjuk dengan koma, dan model akan melakukannya secara berurutan.

[excited] Big news, everyone. [pause] [whispers] The summer menu drops Friday. [laughs]
Bidikan jarak dekat mikrofon kondensor dalam sorotan cahaya latar yang temaram
Bahasa

90+ bahasa, satu suara

ElevenLabs menyebut ucapan ekspresif lintas bahasa sebagai salah satu masalah tersulit dalam AI audio. v4 mendukung lebih dari sembilan puluh bahasa, dengan peningkatan terbesar pada bahasa Jepang, Portugis Brasil, Mandarin, dan Kanton. Suara yang sama membawa arahan yang sama di semua bahasa tersebut, sehingga pengisi suara dalam dubbing tetap konsisten.

Pemeran drama radio yang terdiri dari empat aktor berkumpul di sekitar satu mikrofon
Rekaman panjang

10.000 karakter dalam satu permintaan

Dua kali lipat dari yang diterima v3: sekitar sepuluh menit audio dari satu kali pembuatan. Sebuah bab, naskah dukungan lengkap, atau adegan panjang mempertahankan temponya sebagai satu bacaan berkelanjutan alih-alih paragraf yang disambung-sambung.

Tumpukan tinggi halaman naskah di samping mikrofon studio di bawah cahaya lampu yang hangat
Pengucapan

Ucapkan dengan tepat, menggunakan IPA

Nama orang, nama obat, nama tempat, nama produk: tulis pengucapannya dalam IPA di antara garis miring dan model akan mengucapkannya sesuai keinginan Anda, setiap saat. Untuk hal lainnya, v4 menetapkan skor pengucapan tertinggi yang pernah diukur oleh Artificial Analysis.

The ferry to Reykjavik /ˈreɪkjavɪk/ leaves at nine.
Halaman naskah dengan anotasi pensil di atas penyangga partitur musik
Kloning suara

Klon Suara Profesional kembali hadir

v3 tidak pernah mendukung Professional Voice Clones. v4 mendukungnya, sehingga suara produksi yang Anda miliki dapat beraksi dengan kosakata tag yang lengkap. Kloning yang dibuat pada model sebelumnya dapat dilatih ulang untuk v4 dengan satu klik, dengan persetujuan terverifikasi dari pemilik suara di balik setiap kloning.

Dua mesin pita reel-to-reel identik berdampingan di dalam rak studio

Kisah di baliknya

Setiap generasi ElevenLabs menambahkan satu hal. v4 adalah yang pertama yang tidak membuat Anda harus memilih di antaranya.

  • Agt 2023

    Multilingual v2

    29 bahasa, dan ElevenLabs keluar dari beta.

  • Juli 2024

    Turbo v2.5

    Dibangun untuk kecepatan.

  • Desember 2024

    Flash

    Latensi turun menjadi sekitar 75 ms. Cepat, tetapi tidak ekspresif.

  • Juni 2025

    Eleven v3 alpha

    Tag audio, 70+ bahasa, dan dialog hadir. Ekspresif, tetapi postingan peluncuran v3 sendiri menyarankan para pengembang real-time untuk tetap menggunakan Flash.

  • Februari 2026

    Eleven v3 rilis umum

    Lini ekspresif semakin matang. Kompromi kecepatan tetap ada.

  • Juni 2026

    Pratinjau Warsawa

    Di KTT Warsawa, ElevenLabs mendemonstrasikan model berikutnya yang berbisik, mengubah aksen, dan mengubah emosi secara langsung di atas panggung.

  • 28 September 2026

    Eleven v4 + v4 Turbo

    Arsitektur baru menghadirkan kedua arah sekaligus: model paling ekspresif yang pernah dibangun ElevenLabs, dan versi Turbo yang cukup cepat untuk percakapan langsung.

Bukti

Independen terlebih dahulu: Artificial Analysis mengadakan arena uji dengar buta untuk semua model ucapan utama.

Artificial Analysis, Oktober 2026Eleven v4Konteks
Arena Suara Penyedia#1Mengungguli Cartesia Sonic 3.6 dan Gemini 3.8 Flash TTS. Eleven v3 berada di peringkat #17 pada papan yang sama.
Ketahanan Pengucapan91,7%Skor tertinggi yang pernah diukur oleh Artificial Analysis, pada model apa pun.
Arena Suara Terkendali#2Di belakang Qwen-Audio-3.1-TTS-Plus. v3 mencetak skor jauh di bawah keduanya.
Kecepatan generasi73,4 karakter/detikDibandingkan 42,5 untuk v3, diukur oleh Artificial Analysis.

Dalam uji preferensi buta milik ElevenLabs sendiri, pendengar memilih v4 sekitar 75% waktu melawan model pesaing. Angka tersebut adalah milik vendor; peringkat arena di atas bukan. Reaksi pada hari peluncuran: utas pengumuman dan hasil Artificial Analysis.

Apa yang berubah dari v3

Eleven v3Eleven v4
ArsitekturKeluarga v3Sepenuhnya baru
Bahasa70+90+
Panjang permintaan5.000 karakter10.000 karakter
Klon Suara ProfesionalTidak didukungDidukung
ArahanTag audioTag, instruksi bahasa sederhana, IPA
Waktu nyataTidak disarankanv4 Turbo, inferensi median ~100 ms

Skrip yang Anda tulis untuk v3 berjalan di v4 tanpa perubahan.

FAQ

Apakah klon suara saya yang sudah ada berfungsi di v4?

Setelah dilatih ulang, ya. Klon yang dibuat pada model sebelumnya dapat dilatih ulang untuk v4 dengan satu klik di pustaka suara ElevenLabs. Bersiaplah untuk perbedaan: suara yang dilatih ulang dapat terdengar sangat berbeda dari versi v3-nya, cacat pada rekaman sumber akan direproduksi dengan setia, dan suara yang dibuat dengan Voice Design mungkin tampil kurang ekspresif dibandingkan klon rekaman.

Apakah tag audio selalu berfungsi?

Tidak selalu. Dokumentasi ElevenLabs sendiri menyebut penerapan tag "belum sempurna": terkadang isyarat penyampaian justru dirender sebagai efek suara. Anda akan mendapatkan hasil yang paling andal dengan satu tag per klausa, ditempatkan sebelum kata yang dipengaruhi, dan isyarat yang digabung dengan koma di dalam satu kurung siku jika Anda ingin melapisinya.

Apa yang terjadi ketika sebuah suara berbicara dalam bahasa yang bukan bahasa aslinya?

Suara tersebut berbicara dengan aksen asli dari bahasa tersebut, bukan aksen asal suara itu. ElevenLabs menyatakan ini memang disengaja, dan opsi untuk mempertahankan aksen sedang diteliti.

Kontrol apa saja yang dimiliki v4?

Stabilitas dan Kemiripan. Tidak ada penggeser gaya atau kecepatan dan tidak ada SSML; jeda ditulis sebagai [pause] dan [long pause] di dalam skrip, dan sisanya adalah tag.

v4 atau v4 Turbo?

v4 untuk apa pun yang Anda render dan simpan: narasi, karakter, pembacaan sepanjang durasi dubbing hingga 10.000 karakter. v4 Turbo untuk apa pun yang merespons: agen suara dan aplikasi interaktif, di mana latensi inferensi mediannya yang ~100 ms menjaga percakapan tetap mengalir.

Tulis performanya. v4 mewujudkannya.

Pilih suara, letakkan arahan di dalam kurung, dan dengarkan hasilnya dalam hitungan detik.

Semua audio di halaman ini dihasilkan di Popcraft dengan suara ElevenLabs; naskah lengkap untuk setiap klip ditampilkan di sampingnya. Gambar dihasilkan oleh AI. Baris yang dikutip adalah milik ElevenLabs sendiri, dari postingan peluncuran Eleven v4. Peringkat berasal dari Artificial Analysis, diakses pada Oktober 2026.

Terus jelajahi

Model terkait