Eleven v4 + Eleven v4 TurboKhông đơn thuần đọc kịch bản. Mà là diễn kịch bản.
ElevenLabs gọi Eleven v4 là "mô hình chuyển văn bản thành giọng nói giàu cảm xúc nhất của chúng tôi". Hãy đưa cách thể hiện vào kịch bản bằng các thẻ nội dòng, hỗ trợ hơn 90 ngôn ngữ, với mỗi bản ghi lên đến 10.000 ký tự. Và v4 Turbo phản hồi đủ nhanh để duy trì một cuộc trò chuyện trực tiếp.
90+ ngôn ngữ10.000 ký tự mỗi bản ghiNội dòng thẻ âm thanh
Lồng tiếng nhân vậtLồng tiếngChỉ đạoNPC trong gameTrợ lý giọng nóiSách nóiLồng tiếng nhân vậtLồng tiếngChỉ đạoNPC trong gameTrợ lý giọng nóiSách nóiLồng tiếng nhân vậtLồng tiếngChỉ đạoNPC trong gameTrợ lý giọng nóiSách nóiLồng tiếng nhân vậtLồng tiếngChỉ đạoNPC trong gameTrợ lý giọng nóiSách nói
Hãy nghe thử. Kịch bản nằm ngay bên cạnh mỗi đoạn âm thanh.
Tám bản ghi, được tạo trong Popcraft. Các từ trong ngoặc màu cam là toàn bộ chỉ đạo: không có chỉnh sửa, không có bản ghi nào được ghép lại, và không có gì trong âm thanh không nằm trên trang kịch bản.
01
Một câu nói, năm cách thể hiện
[warm] The lighthouse keeper left a lamp burning for ships that never came.
[low, threatening] The lighthouse keeper left a lamp burning for ships that never came.
[rushed] The lighthouse keeper left a lamp burning for ships that never came.
[a tired detective who has heard it all before] The lighthouse keeper left a lamp burning for ships that never came.
[hushed and reverent, like a nature documentary narrator] The lighthouse keeper left a lamp burning for ships that never came.
02
Một NPC trong game, đang thay đổi sắc thái câu thoại
[casual] You're looking for work, eh? Hmm, I might have something for you. [door creaking][suddenly suspicious, lowering his voice] Wait. Who sent you? [pause][delighted] Marta's cousin! Well why didn't you say so. [coins clinking] Half now, half when it's done.
03
Một nhịp điệu, bốn ngôn ngữ
[softly] Don't be afraid. We'll cross together when the morning comes.
[softly] 怖がらないで。朝が来たら、一緒に渡ろう。Tiếng Nhật
[softly] Não tenha medo. Vamos atravessar juntos quando a manhã chegar.Tiếng Bồ Đào Nha Brazil
[softly] 别害怕。等天亮了,我们一起过去。Tiếng Quan Thoại
Cùng một giọng nói, cùng một thẻ tag, bốn ngôn ngữ mà ElevenLabs cho biết đã cải thiện nhiều nhất trong v4.
04
Một nhân viên hỗ trợ nghe như một người thực thụ
[warm] Thanks so much for holding. I can see the duplicate charge right here. [reassuring] You don't need to do anything else; the refund goes out today. [clear, measured] And your eSIM for Reykjavik is active. Anything else I can check?
Sắc thái giọng mà v4 Turbo được thiết kế để duy trì trong một cuộc gọi trực tiếp.
05
Lời thì thầm vẫn mãi là lời thì thầm
[whispers] Don't move. It's right behind you. [pause][whispers] On three, we run. One. Two. [shouts] Run!
06
Đoạn mở đầu sách nói
[quiet, measured narration] When I was young, I thought the mountain stood because it was strong. [pause] I know better now. [long pause] It stood because it had learned where to bend.
v4 xử lý 10.000 ký tự trong một yêu cầu, tương đương khoảng mười phút âm thanh.
07
Sáng thứ Hai
[sleepy drowsy voice] Mmm, five more minutes. [yawning] Is it really Monday already?
08
Chỉ dẫn bằng ngôn ngữ đơn giản
[like a sports commentator, speeding up] She takes it on the half-volley, past one, past two, she's through on goal. [amazed] Oh, that is extraordinary!
Thẻ không nhất thiết phải nằm trong một danh sách. Hãy mô tả cách thể hiện và mô hình sẽ thực hiện điều đó.
Hai mô hình. Một cho diễn xuất, một cho hội thoại.
Trước đây, bạn phải chọn giữa những giọng nói giàu cảm xúc và những giọng nói tốc độ cao. Eleven v4 chấm dứt sự đánh đổi đó: mô hình tiêu chuẩn đảm nhận các tác phẩm dài, còn Turbo đảm nhận các cuộc gọi trực tiếp.
Dành cho nhà sáng tạo
Eleven v4
Được xây dựng cho sáng tạo nội dung và âm thanh dài: sách nói, diễn xuất nhân vật, thuyết minh độ dài phim. Cách thể hiện bạn viết ra chính là cách thể hiện bạn nhận được, bao gồm cả âm thanh bối cảnh.
10.000ký tự mỗi yêu cầu, tương đương khoảng mười phút âm thanh trong một lần ghi
90+ngôn ngữ, tăng từ hơn 70 ngôn ngữ ở v3
Các thẻcảm xúc, nhịp độ, phản ứng, giọng và hiệu ứng âm thanh, được viết trực tiếp
IPAphát âm chuẩn xác, được viết giữa các dấu gạch chéo
"Thành quả đỉnh cao từ nghiên cứu mới nhất của chúng tôi trong lĩnh vực tạo giọng nói biểu cảm."ElevenLabs, bài đăng ra mắt
Dành cho tác nhân giọng nói
Eleven v4 Turbo
Cùng khả năng biểu cảm, được tinh chỉnh cho thời gian thực: khoảng độ trễ suy luận trung vị 100 ms và khoảng 150 ms cho đến giọng nói đầu tiên, theo đo lường của ElevenLabs.
~100 msđộ trễ suy luận trung vị
~150 msthời gian trung vị đến giọng nói đầu tiên
Trực tiếpcác cuộc gọi hỗ trợ, bán hàng và đặt lịch trình tự động điều chỉnh giọng điệu trong suốt cuộc trò chuyện
"Nhanh hơn cả khoảng dừng trung bình giữa hai người đang nói chuyện."ElevenLabs, bài đăng ra mắt
Đạo diễn như đang làm việc với diễn viên lồng tiếng trong phòng thu
Mọi thứ dưới đây đều nằm trong chính kịch bản. Không cần thanh trượt, không cần hậu kỳ.
Thẻ âm thanh
Viết cảm xúc ngay tại nơi nó diễn ra
Các thẻ được đặt trực tiếp trong dòng, nằm trong ngoặc vuông và có hiệu lực từ vị trí của chúng cho đến thẻ tiếp theo. Có sáu loại: cảm xúc, cách thể hiện, nhịp độ, phản ứng, giọng và hiệu ứng âm thanh. Kết hợp nhiều chỉ dẫn bằng dấu phẩy và mô hình sẽ thực hiện chúng theo trình tự.
[excited] Big news, everyone. [pause][whispers] The summer menu drops Friday. [laughs]
Ngôn ngữ
Hơn 90 ngôn ngữ, một giọng nói
ElevenLabs coi việc tạo ra giọng nói biểu cảm xuyên ngôn ngữ là một trong những bài toán khó nhất trong AI âm thanh. v4 hỗ trợ hơn 90 ngôn ngữ, với những cải tiến vượt bậc nhất ở tiếng Nhật, tiếng Bồ Đào Nha Brazil, tiếng Quan Thoại và tiếng Quảng Đông. Cùng một giọng nói sẽ truyền tải cùng một chỉ đạo xuyên suốt tất cả các ngôn ngữ này, nhờ đó bản lồng tiếng vẫn giữ nguyên được dàn diễn viên.
Đoạn thu dài
10.000 ký tự trong một yêu cầu
Gấp đôi những gì v3 chấp nhận: khoảng mười phút âm thanh từ một lần tạo duy nhất. Một chương sách, một kịch bản hỗ trợ đầy đủ hay một phân cảnh dài sẽ giữ được nhịp điệu như một lần đọc liền mạch thay vì các đoạn văn chắp vá.
Phát âm
Phát âm chuẩn xác với IPA
Tên riêng, tên thuốc, địa danh, tên sản phẩm: hãy viết cách phát âm bằng IPA giữa các dấu gạch chéo và mô hình sẽ đọc theo ý bạn, mọi lúc. Đối với mọi thứ khác, v4 đã đạt điểm phát âm cao nhất mà Artificial Analysis từng đo lường.
The ferry to Reykjavik /ˈreɪkjavɪk/ leaves at nine.
Nhân bản giọng nói
Nhân bản giọng nói chuyên nghiệp đã trở lại
v3 chưa bao giờ hỗ trợ Nhân bản giọng nói chuyên nghiệp. v4 thì có, vì vậy giọng nói do bạn sở hữu có thể trình diễn với toàn bộ vốn từ vựng thẻ. Các bản sao được tạo trên các mô hình trước đây sẽ được huấn luyện lại cho v4 chỉ bằng một cú nhấp chuột, với sự đồng ý đã xác minh của chủ sở hữu giọng đứng sau mỗi bản sao.
Câu chuyện đằng sau
Mỗi thế hệ ElevenLabs đều bổ sung thêm một điều. v4 là phiên bản đầu tiên không bắt bạn phải lựa chọn giữa chúng.
Tháng 8 năm 2023
Multilingual v2
29 ngôn ngữ, và ElevenLabs rời khỏi giai đoạn beta.
Tháng 7 năm 2024
Turbo v2.5
Được thiết kế cho tốc độ.
Tháng 12 năm 2024
Flash
Độ trễ giảm xuống còn khoảng 75 ms. Nhanh, nhưng kém biểu cảm.
Tháng 6 năm 2025
Eleven v3 alpha
Thẻ âm thanh, hơn 70 ngôn ngữ và hội thoại ra mắt. Giàu biểu cảm, nhưng bài đăng ra mắt của v3 đã khuyên các nhà phát triển thời gian thực tiếp tục dùng Flash.
Tháng 2 năm 2026
Eleven v3 phát hành chính thức
Khả năng biểu cảm dần hoàn thiện. Sự đánh đổi về tốc độ vẫn còn đó.
Tháng 6 năm 2026
Bản xem trước Warsaw
Tại hội nghị thượng đỉnh ở Warsaw, ElevenLabs trình diễn mô hình tiếp theo với khả năng thì thầm, chuyển đổi giọng và thay đổi cảm xúc trực tiếp trên sân khấu.
28 tháng 9 năm 2026
Eleven v4 + v4 Turbo
Kiến trúc mới ra mắt cả hai hướng cùng lúc: mô hình giàu biểu cảm nhất mà ElevenLabs từng xây dựng, và một phiên bản Turbo đủ nhanh cho hội thoại trực tiếp.
Bằng chứng
Độc lập là trên hết: Artificial Analysis tổ chức các đấu trường đánh giá mù của người nghe trên mọi mô hình giọng nói lớn.
Artificial Analysis, tháng 10 năm 2026
Eleven v4
Bối cảnh
Đấu trường Giọng nói Nhà cung cấp
#1
Vượt lên trước Cartesia Sonic 3.6 và Gemini 3.8 Flash TTS. Eleven v3 đứng ở vị trí #17 trên cùng bảng xếp hạng.
Độ ổn định phát âm
91,7%
Điểm số cao nhất mà Artificial Analysis từng đo được trên bất kỳ mô hình nào.
Đấu trường Giọng nói Kiểm soát
#2
Xếp sau Qwen-Audio-3.1-TTS-Plus. v3 đạt điểm thấp hơn nhiều so với cả hai.
Tốc độ tạo
73,4 ký tự/giây
So với 42,5 của v3, do Artificial Analysis đo lường.
Trong bài kiểm tra ưu tiên mù của chính ElevenLabs, người nghe đã chọn v4 khoảng 75% thời gian khi so sánh với các mô hình cạnh tranh. Con số đó là của nhà cung cấp; bảng xếp hạng đấu trường ở trên thì không. Các phản hồi trong ngày ra mắt: luồng thông báo và kết quả của Artificial Analysis.
Những thay đổi so với v3
Eleven v3
Eleven v4
Kiến trúc
Dòng v3
Hoàn toàn mới
Ngôn ngữ
70+
90+
Độ dài yêu cầu
5.000 ký tự
10.000 ký tự
Bản sao giọng chuyên nghiệp
Không được hỗ trợ
Được hỗ trợ
Chỉ đạo
Thẻ âm thanh
Thẻ, chỉ dẫn bằng ngôn ngữ thông thường, IPA
Thời gian thực
Không khuyến nghị
v4 Turbo, suy luận trung vị ~100 ms
Các kịch bản bạn viết cho v3 sẽ chạy trên v4 mà không cần thay đổi.
Câu hỏi thường gặp
Các giọng nhân bản hiện có của tôi có hoạt động trên v4 không?
Có, sau khi huấn luyện lại. Các bản sao được tạo trên những mô hình trước đó sẽ được huấn luyện lại cho v4 chỉ với một cú nhấp chuột trong thư viện giọng của ElevenLabs. Hãy chuẩn bị tâm lý cho những sự khác biệt: một giọng đã huấn luyện lại có thể nghe khác biệt đáng kể so với phiên bản v3 của nó, các lỗi trong bản ghi âm gốc sẽ được tái hiện y hệt, và những giọng được tạo bằng Voice Design có thể kém biểu cảm hơn so với các bản sao từ bản ghi âm.
Các thẻ âm thanh có luôn hoạt động chính xác không?
Không phải lúc nào cũng vậy. Chính tài liệu của ElevenLabs gọi việc tuân thủ thẻ là "chưa hoàn hảo": thỉnh thoảng một chỉ dẫn thể hiện lại bị biến thành hiệu ứng âm thanh. Bạn sẽ có được kết quả đáng tin cậy nhất khi dùng một thẻ cho mỗi mệnh đề, đặt trước các từ mà nó tác động, và gộp các chỉ dẫn bằng dấu phẩy trong cùng một cặp dấu ngoặc khi bạn muốn xếp chồng chúng.
Điều gì xảy ra khi một giọng nói nói một ngôn ngữ không phải là ngôn ngữ gốc của nó?
Nó sẽ nói với giọng bản xứ của ngôn ngữ đó, chứ không phải giọng gốc của giọng nói. ElevenLabs cho biết đây là thiết kế có chủ đích, và họ đang nghiên cứu một tùy chọn giữ nguyên giọng.
v4 có những tùy chỉnh nào?
Độ ổn định và Độ tương đồng. Không có thanh trượt phong cách hay tốc độ và không có SSML; các khoảng dừng được viết dưới dạng [pause] và [long pause] trong kịch bản, và mọi thứ khác đều là thẻ.
v4 hay v4 Turbo?
v4 dành cho mọi nội dung bạn tạo và lưu lại: thuyết minh, lồng tiếng nhân vật, các đoạn đọc dài lên đến 10.000 ký tự. v4 Turbo dành cho mọi tác vụ cần phản hồi thoại: trợ lý giọng nói và ứng dụng tương tác, với độ trễ suy luận trung vị ~100 ms giúp cuộc trò chuyện luôn liền mạch.
Kiến tạo màn trình diễn. v4 sẽ hiện thực hóa.
Chọn một giọng nói, đặt chỉ dẫn trong ngoặc và nghe bản thu chỉ trong vài giây.
Mọi âm thanh trên trang này được tạo trong Popcraft bằng giọng nói ElevenLabs; kịch bản đầy đủ cho mỗi đoạn âm thanh được hiển thị bên cạnh. Hình ảnh do AI tạo. Các câu trích dẫn là của chính ElevenLabs, từ bài đăng ra mắt Eleven v4. Các bảng xếp hạng đến từ Artificial Analysis, đọc vào tháng 10 năm 2026.