NEWTạo mô hình 3D từ văn bản hoặc hình ảnh — gắn xương, tạo hoạt ảnh, xuất tệp.Trải nghiệm 3D
PopcraftPopcraft
Mô hình giọng nói của ElevenLabs

Eleven v4 + Eleven v4 TurboKhông đơn thuần đọc kịch bản.
Mà là diễn kịch bản.

ElevenLabs gọi Eleven v4 là "mô hình chuyển văn bản thành giọng nói giàu cảm xúc nhất của chúng tôi". Hãy đưa cách thể hiện vào kịch bản bằng các thẻ nội dòng, hỗ trợ hơn 90 ngôn ngữ, với mỗi bản ghi lên đến 10.000 ký tự. Và v4 Turbo phản hồi đủ nhanh để duy trì một cuộc trò chuyện trực tiếp.

[whispers] Don't move. It's right behind you.Eleven v4TTSTạo
90+ ngôn ngữ10.000 ký tự mỗi bản ghiNội dòng thẻ âm thanh
Một nữ diễn viên lồng tiếng đang đứng trước micro condenser trong phòng thu âm thiếu sáng, được chiếu sáng bởi một chiếc đèn thực tế tỏa ánh sáng ấm áp
Lồng tiếng nhân vật
Sân khấu lồng tiếng: một nữ diễn viên đang xem cảnh chiếu, gương mặt cô được chiếu sáng bởi màn hình
Lồng tiếng
Phòng điều khiển vào ban đêm, các dạng sóng phát sáng trên màn hình trước mặt một kỹ sư
Chỉ đạo
Một nhân vật trong game: hiệp sĩ mặc giáp dưới ánh lửa, đang nói dở câu thoại
NPC trong game
Một nhân viên hỗ trợ đang đeo tai nghe đàm thoại trong văn phòng lúc bình minh
Trợ lý giọng nói
Một người kể chuyện tóc bạc đang đọc to từ một cuốn sách bìa cứng trên ghế bành dưới ánh đèn đọc sách
Sách nói

Hãy nghe thử. Kịch bản nằm ngay bên cạnh mỗi đoạn âm thanh.

Tám bản ghi, được tạo trong Popcraft. Các từ trong ngoặc màu cam là toàn bộ chỉ đạo: không có chỉnh sửa, không có bản ghi nào được ghép lại, và không có gì trong âm thanh không nằm trên trang kịch bản.

01

Một câu nói, năm cách thể hiện

[warm] The lighthouse keeper left a lamp burning for ships that never came.

[low, threatening] The lighthouse keeper left a lamp burning for ships that never came.

[rushed] The lighthouse keeper left a lamp burning for ships that never came.

[a tired detective who has heard it all before] The lighthouse keeper left a lamp burning for ships that never came.

[hushed and reverent, like a nature documentary narrator] The lighthouse keeper left a lamp burning for ships that never came.

02

Một NPC trong game, đang thay đổi sắc thái câu thoại

[casual] You're looking for work, eh? Hmm, I might have something for you. [door creaking] [suddenly suspicious, lowering his voice] Wait. Who sent you? [pause] [delighted] Marta's cousin! Well why didn't you say so. [coins clinking] Half now, half when it's done.

03

Một nhịp điệu, bốn ngôn ngữ

[softly] Don't be afraid. We'll cross together when the morning comes.

[softly] 怖がらないで。朝が来たら、一緒に渡ろう。Tiếng Nhật

[softly] Não tenha medo. Vamos atravessar juntos quando a manhã chegar.Tiếng Bồ Đào Nha Brazil

[softly] 别害怕。等天亮了,我们一起过去。Tiếng Quan Thoại

Cùng một giọng nói, cùng một thẻ tag, bốn ngôn ngữ mà ElevenLabs cho biết đã cải thiện nhiều nhất trong v4.

04

Một nhân viên hỗ trợ nghe như một người thực thụ

[warm] Thanks so much for holding. I can see the duplicate charge right here. [reassuring] You don't need to do anything else; the refund goes out today. [clear, measured] And your eSIM for Reykjavik is active. Anything else I can check?

Sắc thái giọng mà v4 Turbo được thiết kế để duy trì trong một cuộc gọi trực tiếp.

05

Lời thì thầm vẫn mãi là lời thì thầm

[whispers] Don't move. It's right behind you. [pause] [whispers] On three, we run. One. Two. [shouts] Run!

06

Đoạn mở đầu sách nói

[quiet, measured narration] When I was young, I thought the mountain stood because it was strong. [pause] I know better now. [long pause] It stood because it had learned where to bend.

v4 xử lý 10.000 ký tự trong một yêu cầu, tương đương khoảng mười phút âm thanh.

07

Sáng thứ Hai

[sleepy drowsy voice] Mmm, five more minutes. [yawning] Is it really Monday already?

08

Chỉ dẫn bằng ngôn ngữ đơn giản

[like a sports commentator, speeding up] She takes it on the half-volley, past one, past two, she's through on goal. [amazed] Oh, that is extraordinary!

Thẻ không nhất thiết phải nằm trong một danh sách. Hãy mô tả cách thể hiện và mô hình sẽ thực hiện điều đó.

Hai mô hình. Một cho diễn xuất, một cho hội thoại.

Trước đây, bạn phải chọn giữa những giọng nói giàu cảm xúc và những giọng nói tốc độ cao. Eleven v4 chấm dứt sự đánh đổi đó: mô hình tiêu chuẩn đảm nhận các tác phẩm dài, còn Turbo đảm nhận các cuộc gọi trực tiếp.

Dành cho nhà sáng tạo

Eleven v4

Được xây dựng cho sáng tạo nội dung và âm thanh dài: sách nói, diễn xuất nhân vật, thuyết minh độ dài phim. Cách thể hiện bạn viết ra chính là cách thể hiện bạn nhận được, bao gồm cả âm thanh bối cảnh.

  • 10.000ký tự mỗi yêu cầu, tương đương khoảng mười phút âm thanh trong một lần ghi
  • 90+ngôn ngữ, tăng từ hơn 70 ngôn ngữ ở v3
  • Các thẻcảm xúc, nhịp độ, phản ứng, giọng và hiệu ứng âm thanh, được viết trực tiếp
  • IPAphát âm chuẩn xác, được viết giữa các dấu gạch chéo
"Thành quả đỉnh cao từ nghiên cứu mới nhất của chúng tôi trong lĩnh vực tạo giọng nói biểu cảm."ElevenLabs, bài đăng ra mắt
Dành cho tác nhân giọng nói

Eleven v4 Turbo

Cùng khả năng biểu cảm, được tinh chỉnh cho thời gian thực: khoảng độ trễ suy luận trung vị 100 ms và khoảng 150 ms cho đến giọng nói đầu tiên, theo đo lường của ElevenLabs.

  • ~100 msđộ trễ suy luận trung vị
  • ~150 msthời gian trung vị đến giọng nói đầu tiên
  • Trực tiếpcác cuộc gọi hỗ trợ, bán hàng và đặt lịch trình tự động điều chỉnh giọng điệu trong suốt cuộc trò chuyện
"Nhanh hơn cả khoảng dừng trung bình giữa hai người đang nói chuyện."ElevenLabs, bài đăng ra mắt

Đạo diễn như đang làm việc với diễn viên lồng tiếng trong phòng thu

Mọi thứ dưới đây đều nằm trong chính kịch bản. Không cần thanh trượt, không cần hậu kỳ.

Thẻ âm thanh

Viết cảm xúc ngay tại nơi nó diễn ra

Các thẻ được đặt trực tiếp trong dòng, nằm trong ngoặc vuông và có hiệu lực từ vị trí của chúng cho đến thẻ tiếp theo. Có sáu loại: cảm xúc, cách thể hiện, nhịp độ, phản ứng, giọng và hiệu ứng âm thanh. Kết hợp nhiều chỉ dẫn bằng dấu phẩy và mô hình sẽ thực hiện chúng theo trình tự.

[excited] Big news, everyone. [pause] [whispers] The summer menu drops Friday. [laughs]
Cận cảnh một chiếc micro tụ điện trong làn ánh sáng ngược mờ ảo
Ngôn ngữ

Hơn 90 ngôn ngữ, một giọng nói

ElevenLabs coi việc tạo ra giọng nói biểu cảm xuyên ngôn ngữ là một trong những bài toán khó nhất trong AI âm thanh. v4 hỗ trợ hơn 90 ngôn ngữ, với những cải tiến vượt bậc nhất ở tiếng Nhật, tiếng Bồ Đào Nha Brazil, tiếng Quan Thoại và tiếng Quảng Đông. Cùng một giọng nói sẽ truyền tải cùng một chỉ đạo xuyên suốt tất cả các ngôn ngữ này, nhờ đó bản lồng tiếng vẫn giữ nguyên được dàn diễn viên.

Dàn diễn viên kịch truyền thanh gồm bốn người đang tụ tập quanh một chiếc micro
Đoạn thu dài

10.000 ký tự trong một yêu cầu

Gấp đôi những gì v3 chấp nhận: khoảng mười phút âm thanh từ một lần tạo duy nhất. Một chương sách, một kịch bản hỗ trợ đầy đủ hay một phân cảnh dài sẽ giữ được nhịp điệu như một lần đọc liền mạch thay vì các đoạn văn chắp vá.

Một chồng bản thảo cao bên cạnh chiếc micro phòng thu dưới ánh đèn ấm áp
Phát âm

Phát âm chuẩn xác với IPA

Tên riêng, tên thuốc, địa danh, tên sản phẩm: hãy viết cách phát âm bằng IPA giữa các dấu gạch chéo và mô hình sẽ đọc theo ý bạn, mọi lúc. Đối với mọi thứ khác, v4 đã đạt điểm phát âm cao nhất mà Artificial Analysis từng đo lường.

The ferry to Reykjavik /ˈreɪkjavɪk/ leaves at nine.
Một trang kịch bản được đánh dấu bằng bút chì trên giá đỡ bản nhạc
Nhân bản giọng nói

Nhân bản giọng nói chuyên nghiệp đã trở lại

v3 chưa bao giờ hỗ trợ Nhân bản giọng nói chuyên nghiệp. v4 thì có, vì vậy giọng nói do bạn sở hữu có thể trình diễn với toàn bộ vốn từ vựng thẻ. Các bản sao được tạo trên các mô hình trước đây sẽ được huấn luyện lại cho v4 chỉ bằng một cú nhấp chuột, với sự đồng ý đã xác minh của chủ sở hữu giọng đứng sau mỗi bản sao.

Hai máy ghi âm băng cối giống hệt nhau đặt cạnh nhau trên giá phòng thu

Câu chuyện đằng sau

Mỗi thế hệ ElevenLabs đều bổ sung thêm một điều. v4 là phiên bản đầu tiên không bắt bạn phải lựa chọn giữa chúng.

  • Tháng 8 năm 2023

    Multilingual v2

    29 ngôn ngữ, và ElevenLabs rời khỏi giai đoạn beta.

  • Tháng 7 năm 2024

    Turbo v2.5

    Được thiết kế cho tốc độ.

  • Tháng 12 năm 2024

    Flash

    Độ trễ giảm xuống còn khoảng 75 ms. Nhanh, nhưng kém biểu cảm.

  • Tháng 6 năm 2025

    Eleven v3 alpha

    Thẻ âm thanh, hơn 70 ngôn ngữ và hội thoại ra mắt. Giàu biểu cảm, nhưng bài đăng ra mắt của v3 đã khuyên các nhà phát triển thời gian thực tiếp tục dùng Flash.

  • Tháng 2 năm 2026

    Eleven v3 phát hành chính thức

    Khả năng biểu cảm dần hoàn thiện. Sự đánh đổi về tốc độ vẫn còn đó.

  • Tháng 6 năm 2026

    Bản xem trước Warsaw

    Tại hội nghị thượng đỉnh ở Warsaw, ElevenLabs trình diễn mô hình tiếp theo với khả năng thì thầm, chuyển đổi giọng và thay đổi cảm xúc trực tiếp trên sân khấu.

  • 28 tháng 9 năm 2026

    Eleven v4 + v4 Turbo

    Kiến trúc mới ra mắt cả hai hướng cùng lúc: mô hình giàu biểu cảm nhất mà ElevenLabs từng xây dựng, và một phiên bản Turbo đủ nhanh cho hội thoại trực tiếp.

Bằng chứng

Độc lập là trên hết: Artificial Analysis tổ chức các đấu trường đánh giá mù của người nghe trên mọi mô hình giọng nói lớn.

Artificial Analysis, tháng 10 năm 2026Eleven v4Bối cảnh
Đấu trường Giọng nói Nhà cung cấp#1Vượt lên trước Cartesia Sonic 3.6 và Gemini 3.8 Flash TTS. Eleven v3 đứng ở vị trí #17 trên cùng bảng xếp hạng.
Độ ổn định phát âm91,7%Điểm số cao nhất mà Artificial Analysis từng đo được trên bất kỳ mô hình nào.
Đấu trường Giọng nói Kiểm soát#2Xếp sau Qwen-Audio-3.1-TTS-Plus. v3 đạt điểm thấp hơn nhiều so với cả hai.
Tốc độ tạo73,4 ký tự/giâySo với 42,5 của v3, do Artificial Analysis đo lường.

Trong bài kiểm tra ưu tiên mù của chính ElevenLabs, người nghe đã chọn v4 khoảng 75% thời gian khi so sánh với các mô hình cạnh tranh. Con số đó là của nhà cung cấp; bảng xếp hạng đấu trường ở trên thì không. Các phản hồi trong ngày ra mắt: luồng thông báo và kết quả của Artificial Analysis.

Những thay đổi so với v3

Eleven v3Eleven v4
Kiến trúcDòng v3Hoàn toàn mới
Ngôn ngữ70+90+
Độ dài yêu cầu5.000 ký tự10.000 ký tự
Bản sao giọng chuyên nghiệpKhông được hỗ trợĐược hỗ trợ
Chỉ đạoThẻ âm thanhThẻ, chỉ dẫn bằng ngôn ngữ thông thường, IPA
Thời gian thựcKhông khuyến nghịv4 Turbo, suy luận trung vị ~100 ms

Các kịch bản bạn viết cho v3 sẽ chạy trên v4 mà không cần thay đổi.

Câu hỏi thường gặp

Các giọng nhân bản hiện có của tôi có hoạt động trên v4 không?

Có, sau khi huấn luyện lại. Các bản sao được tạo trên những mô hình trước đó sẽ được huấn luyện lại cho v4 chỉ với một cú nhấp chuột trong thư viện giọng của ElevenLabs. Hãy chuẩn bị tâm lý cho những sự khác biệt: một giọng đã huấn luyện lại có thể nghe khác biệt đáng kể so với phiên bản v3 của nó, các lỗi trong bản ghi âm gốc sẽ được tái hiện y hệt, và những giọng được tạo bằng Voice Design có thể kém biểu cảm hơn so với các bản sao từ bản ghi âm.

Các thẻ âm thanh có luôn hoạt động chính xác không?

Không phải lúc nào cũng vậy. Chính tài liệu của ElevenLabs gọi việc tuân thủ thẻ là "chưa hoàn hảo": thỉnh thoảng một chỉ dẫn thể hiện lại bị biến thành hiệu ứng âm thanh. Bạn sẽ có được kết quả đáng tin cậy nhất khi dùng một thẻ cho mỗi mệnh đề, đặt trước các từ mà nó tác động, và gộp các chỉ dẫn bằng dấu phẩy trong cùng một cặp dấu ngoặc khi bạn muốn xếp chồng chúng.

Điều gì xảy ra khi một giọng nói nói một ngôn ngữ không phải là ngôn ngữ gốc của nó?

Nó sẽ nói với giọng bản xứ của ngôn ngữ đó, chứ không phải giọng gốc của giọng nói. ElevenLabs cho biết đây là thiết kế có chủ đích, và họ đang nghiên cứu một tùy chọn giữ nguyên giọng.

v4 có những tùy chỉnh nào?

Độ ổn định và Độ tương đồng. Không có thanh trượt phong cách hay tốc độ và không có SSML; các khoảng dừng được viết dưới dạng [pause] và [long pause] trong kịch bản, và mọi thứ khác đều là thẻ.

v4 hay v4 Turbo?

v4 dành cho mọi nội dung bạn tạo và lưu lại: thuyết minh, lồng tiếng nhân vật, các đoạn đọc dài lên đến 10.000 ký tự. v4 Turbo dành cho mọi tác vụ cần phản hồi thoại: trợ lý giọng nói và ứng dụng tương tác, với độ trễ suy luận trung vị ~100 ms giúp cuộc trò chuyện luôn liền mạch.

Kiến tạo màn trình diễn. v4 sẽ hiện thực hóa.

Chọn một giọng nói, đặt chỉ dẫn trong ngoặc và nghe bản thu chỉ trong vài giây.

Mọi âm thanh trên trang này được tạo trong Popcraft bằng giọng nói ElevenLabs; kịch bản đầy đủ cho mỗi đoạn âm thanh được hiển thị bên cạnh. Hình ảnh do AI tạo. Các câu trích dẫn là của chính ElevenLabs, từ bài đăng ra mắt Eleven v4. Các bảng xếp hạng đến từ Artificial Analysis, đọc vào tháng 10 năm 2026.

Tiếp tục khám phá

Mô hình liên quan