NEWCipta model 3D daripada teks atau imej — rigging, animasi, eksport.Cuba 3D
PopcraftPopcraft
Model suara oleh ElevenLabs

Eleven v4 + Eleven v4 TurboIa tidak membaca skrip.
Ia mempersembahkannya.

ElevenLabs memanggil Eleven v4 "model teks-ke-pertuturan kami yang paling ekspresif setakat ini". Tulis gaya penyampaian terus ke dalam skrip dengan tag sebaris, dalam 90+ bahasa, sehingga 10,000 aksara bagi setiap rakaman. Dan v4 Turbo bertindak balas cukup pantas untuk mengadakan perbualan langsung.

[whispers] Don't move. It's right behind you.Eleven v4TTSJana
90+ bahasa10,000 aksara setiap rakamanSebaris tag audio
Seorang pelakon suara di mikrofon kondenser dalam bilik rakaman yang malap, diterangi oleh lampu praktikal yang hangat
Penyuaran watak
Pentas alih suara: seorang pelakon wanita menonton adegan yang dipancarkan, wajahnya disinari skrin
Alih suara
Bilik kawalan pada waktu malam, bentuk gelombang bercahaya pada monitor di hadapan seorang jurutera
Arahan
Watak permainan: seorang kesatria berperisai diterangi cahaya api, di pertengahan dialog
NPC Permainan
Seorang ejen sokongan sedang dalam panggilan menggunakan set kepala di pejabat pada waktu subuh
Ejen suara
Seorang pencerita berambut perak membaca dengan kuat dari buku berkulit keras di kerusi lengan di bawah lampu bacaan
Buku audio

Dengarlah. Skrip ada di sebelah setiap klip.

Lapan rakaman, dijana dalam Popcraft. Perkataan dalam kurungan oren ialah keseluruhan arahan: tiada suntingan, tiada rakaman semula yang dicantumkan bersama, dan tiada apa-apa dalam audio yang tidak tertulis pada halaman.

01

Satu ayat, lima penyampaian

[warm] The lighthouse keeper left a lamp burning for ships that never came.

[low, threatening] The lighthouse keeper left a lamp burning for ships that never came.

[rushed] The lighthouse keeper left a lamp burning for ships that never came.

[a tired detective who has heard it all before] The lighthouse keeper left a lamp burning for ships that never came.

[hushed and reverent, like a nature documentary narrator] The lighthouse keeper left a lamp burning for ships that never came.

02

NPC permainan, menyampaikan satu dialog

[casual] You're looking for work, eh? Hmm, I might have something for you. [door creaking] [suddenly suspicious, lowering his voice] Wait. Who sent you? [pause] [delighted] Marta's cousin! Well why didn't you say so. [coins clinking] Half now, half when it's done.

03

Satu rentak, empat bahasa

[softly] Don't be afraid. We'll cross together when the morning comes.

[softly] 怖がらないで。朝が来たら、一緒に渡ろう。Bahasa Jepun

[softly] Não tenha medo. Vamos atravessar juntos quando a manhã chegar.Portugis Brazil

[softly] 别害怕。等天亮了,我们一起过去。Mandarin

Suara yang sama, tag yang sama, empat bahasa yang menurut ElevenLabs paling banyak meningkat dalam v4.

04

Ejen sokongan yang kedengaran seperti seorang ejen

[warm] Thanks so much for holding. I can see the duplicate charge right here. [reassuring] You don't need to do anything else; the refund goes out today. [clear, measured] And your eSIM for Reykjavik is active. Anything else I can check?

Nada suara yang direka untuk dikekalkan oleh v4 Turbo dalam panggilan langsung.

05

Bisikan yang kekal sebagai bisikan

[whispers] Don't move. It's right behind you. [pause] [whispers] On three, we run. One. Two. [shouts] Run!

06

Pembukaan terus buku audio

[quiet, measured narration] When I was young, I thought the mountain stood because it was strong. [pause] I know better now. [long pause] It stood because it had learned where to bend.

v4 memproses 10,000 aksara dalam satu permintaan, kira-kira sepuluh minit audio.

07

Pagi Isnin

[sleepy drowsy voice] Mmm, five more minutes. [yawning] Is it really Monday already?

08

Arahan dalam bahasa mudah

[like a sports commentator, speeding up] She takes it on the half-volley, past one, past two, she's through on goal. [amazed] Oh, that is extraordinary!

Tag tidak semestinya daripada senarai. Huraikan penyampaian dan model akan melaksanakannya.

Dua model. Satu untuk persembahan, satu untuk perbualan.

Sehingga kini anda memilih antara suara yang ekspresif dan yang pantas. Eleven v4 menamatkan kompromi itu: model standard mengendalikan kerja bentuk panjang, dan Turbo mengendalikan panggilan langsung.

Untuk pencipta

Eleven v4

Dibina untuk penciptaan kandungan dan audio bentuk panjang: buku audio, kerja watak, penceritaan sepanjang alih suara. Penyampaian yang anda tulis ialah penyampaian yang anda dapat, termasuk bunyi adegan.

  • 10,000aksara setiap permintaan, kira-kira sepuluh minit audio dalam satu rakaman
  • 90+bahasa, meningkat daripada 70+ dalam v3
  • Tagemosi, rentak, reaksi, loghat dan kesan bunyi, ditulis secara sebaris
  • IPAsebutan tepat, ditulis di antara garisan miring ke hadapan
"Kemuncak penyelidikan terkini kami dalam penjanaan pertuturan yang ekspresif."ElevenLabs, siaran pelancaran
Untuk ejen suara

Eleven v4 Turbo

Ekspresiviti yang sama, ditala untuk masa nyata: kira-kira 100 ms kependaman inferens median dan kira-kira 150 ms ke pertuturan pertama, berdasarkan ukuran ElevenLabs.

  • ~100 mskependaman inferens median
  • ~150 msmasa median ke pertuturan pertama
  • Langsungpanggilan sokongan, jualan dan penjadualan yang menyesuaikan nada mereka semasa perbualan
"Lebih pantas daripada jeda purata antara dua orang yang sedang bercakap."ElevenLabs, siaran pelancaran

Arahkannya seperti bakat di dalam studio

Semua di bawah ini ada dalam skrip itu sendiri. Tiada peluncur, tiada pascaproduksi.

Tag audio

Tulis emosi di tempat ia berlaku

Tag diletakkan sebaris, dalam kurungan siku, dan berkuat kuasa dari kedudukannya sehingga tag seterusnya. Enam jenis: emosi, penyampaian, langkah, reaksi, loghat dan kesan bunyi. Timbun petunjuk dengan koma, dan model akan mempersembahkannya secara berurutan.

[excited] Big news, everyone. [pause] [whispers] The summer menu drops Friday. [laughs]
Tangkapan dekat mikrofon kondenser dalam cahaya latar berkabus
Bahasa

90+ bahasa, satu suara

ElevenLabs menganggap pertuturan ekspresif merentasi bahasa sebagai salah satu masalah paling sukar dalam AI audio. v4 menyokong lebih daripada sembilan puluh bahasa, dengan peningkatan terbesar dalam bahasa Jepun, Portugis Brazil, Mandarin dan Kantonis. Suara yang sama membawa arahan yang sama merentasi kesemuanya, jadi alih suara kekal dengan pelakon asalnya.

Barisan pelakon drama radio seramai empat orang berkumpul di sekeliling satu mikrofon
Rakaman panjang

10,000 aksara dalam satu permintaan

Dua kali ganda had v3: kira-kira sepuluh minit audio daripada satu penjanaan. Satu bab, skrip sokongan penuh atau adegan panjang mengekalkan rentaknya sebagai satu bacaan berterusan dan bukannya perenggan yang dicantumkan.

Timbunan tinggi halaman manuskrip di sebelah mikrofon studio di bawah cahaya lampu yang hangat
Sebutan

Sebut dengan tepat, menggunakan IPA

Nama, nama ubat, nama tempat, nama produk: tulis sebutan dalam IPA di antara garis condong dan model akan menyebutnya mengikut cara anda, setiap kali. Untuk yang lain, v4 menetapkan skor sebutan tertinggi yang pernah diukur oleh Artificial Analysis.

The ferry to Reykjavik /ˈreɪkjavɪk/ leaves at nine.
Halaman skrip yang ditanda dengan notasi pensel di atas stand muzik
Klon suara

Klon Suara Profesional kembali

v3 tidak pernah menyokong Klon Suara Profesional. v4 menyokongnya, jadi suara terhasil yang anda miliki boleh beraksi dengan kosa kata tag penuh. Klon yang dibuat pada model terdahulu dilatih semula untuk v4 dengan satu klik, dengan persetujuan yang disahkan oleh pemilik suara di sebalik setiap klon.

Dua mesin pita gelendong ke gelendong yang serupa diletakkan bersebelahan di dalam rak studio

Kisah di sebaliknya

Setiap generasi ElevenLabs menambah satu perkara. v4 adalah yang pertama tidak memaksa anda memilih antaranya.

  • Ogos 2023

    Multilingual v2

    29 bahasa, dan ElevenLabs keluar daripada fasa beta.

  • Julai 2024

    Turbo v2.5

    Dibina untuk kelajuan.

  • Disember 2024

    Flash

    Kependaman menurun kepada kira-kira 75 ms. Pantas, tetapi tidak ekspresif.

  • Jun 2025

    Eleven v3 alpha

    Tag audio, 70+ bahasa dan dialog tiba. Ekspresif, tetapi siaran pelancaran v3 sendiri memberitahu pembangun masa nyata untuk kekal pada Flash.

  • Februari 2026

    Eleven v3 menjadi GA

    Garis ekspresif semakin matang. Kompromi kelajuan kekal.

  • Jun 2026

    Pratonton Warsaw

    Di sidang kemuncak Warsaw, ElevenLabs mendemonstrasikan model seterusnya yang berbisik, menukar loghat dan mengubah emosi secara langsung di atas pentas.

  • 28 Sep 2026

    Eleven v4 + v4 Turbo

    Seni bina baharu menawarkan kedua-dua hala serentak: model paling ekspresif yang pernah dibina oleh ElevenLabs, dan versi Turbo yang cukup pantas untuk perbualan langsung.

Bukti

Bebas dan terdahulu: Artificial Analysis menjalankan arena pendengar buta merentasi setiap model pertuturan utama.

Artificial Analysis, Oktober 2026Eleven v4Konteks
Arena Suara Penyedia#1Mendahului Cartesia Sonic 3.6 dan Gemini 3.8 Flash TTS. Eleven v3 berada di tangga #17 pada carta yang sama.
Keteguhan Sebutan91.7%Skor tertinggi yang pernah diukur oleh Artificial Analysis, pada mana-mana model.
Arena Suara Terkawal#2Di belakang Qwen-Audio-3.1-TTS-Plus. v3 mencatatkan skor jauh lebih rendah daripada kedua-duanya.
Kelajuan penjanaan73.4 aksara/sBerbanding 42.5 untuk v3, diukur oleh Artificial Analysis.

Dalam ujian keutamaan buta ElevenLabs sendiri, pendengar memilih v4 kira-kira 75% daripada masa berbanding model pesaing. Angka tersebut adalah daripada vendor; kedudukan arena di atas bukanlah demikian. Reaksi pada hari pelancaran: bebenang pengumuman dan keputusan Artificial Analysis.

Apa yang berubah daripada v3

Eleven v3Eleven v4
Seni binaKeluarga v3Serba baharu
Bahasa70+90+
Panjang permintaan5,000 aksara10,000 aksara
Klon suara profesionalTidak disokongDisokong
ArahanTag audioTag, arahan bahasa biasa, IPA
Masa nyataTidak disyorkanv4 Turbo, ~100 ms inferens median

Skrip yang anda tulis untuk v3 berjalan pada v4 tanpa perubahan.

FAQ

Adakah klon suara sedia ada saya berfungsi pada v4?

Selepas dilatih semula, ya. Klon yang dibuat pada model terdahulu dilatih semula untuk v4 dengan satu klik dalam pustaka suara ElevenLabs. Bersedialah untuk perbezaan: suara yang dilatih semula boleh kedengaran sangat berbeza daripada versi v3-nya, kecacatan dalam rakaman sumber dihasilkan semula dengan setia, dan suara yang dibina dengan Voice Design mungkin kurang ekspresif berbanding klon rakaman.

Adakah tag audio sentiasa menjadi?

Tidak sentiasa. Dokumen ElevenLabs sendiri memanggil pematuhan tag sebagai "belum sempurna lagi": kadangkala isyarat penyampaian dihasilkan sebagai kesan bunyi. Anda akan mendapat hasil yang paling boleh dipercayai dengan satu tag bagi setiap klausa, diletakkan sebelum perkataan yang terjejas, dan isyarat yang dicantumkan dengan koma di dalam satu kurungan apabila anda ingin melapisinya.

Apakah yang berlaku apabila suara bertutur dalam bahasa yang bukan bahasa asalnya?

Ia bertutur dengan loghat asli bahasa tersebut, bukan loghat asal suara itu. ElevenLabs menyatakan ini adalah mengikut reka bentuk, dan togol pengekalan loghat sedang dikaji.

Kawalan manakah yang ada pada v4?

Kestabilan dan Keserupaan. Tiada peluncur gaya atau kelajuan dan tiada SSML; jeda ditulis sebagai [pause] dan [long pause] dalam skrip, dan yang lain hanyalah tag.

v4 atau v4 Turbo?

v4 untuk apa sahaja yang anda jana dan simpan: penceritaan, watak, bacaan sepanjang alih suara sehingga 10,000 aksara. v4 Turbo untuk apa sahaja yang membalas: ejen suara dan aplikasi interaktif, di mana kependaman inferens median ~100 ms memastikan perbualan berjalan lancar.

Tulis persembahan. v4 menyampaikannya.

Pilih suara, letakkan arahan dalam kurungan, dan dengar hasilnya dalam beberapa saat.

Semua audio di halaman ini dijana dalam Popcraft dengan suara ElevenLabs; skrip penuh untuk setiap klip ditunjukkan di sebelahnya. Imej dijana oleh AI. Baris petikan adalah milik ElevenLabs sendiri, dari siaran pelancaran Eleven v4. Kedudukan adalah dari Artificial Analysis, dibaca pada Oktober 2026.

Teruskan meneroka

Model berkaitan