NEW從文字或圖片生成 3D 模型 — 支援綁定、動畫製作與匯出。立即體驗 3D
PopcraftPopcraft
ElevenLabs 語音模型

Eleven v4 + Eleven v4 Turbo它不是在唸腳本。
而是在演繹它。

ElevenLabs 稱 Eleven v4 為「我們迄今最具情感的文字轉語音模型」。透過內嵌標籤將語氣寫入腳本,支援超過 90 種語言,單次生成可達 10,000 字元。而 v4 Turbo 的回應速度極快,足以流暢進行即時對話。

[whispers] Don't move. It's right behind you.Eleven v4語音合成生成
90+ 種語言10,000 單次生成字元數內嵌 音訊標籤
一位女配音員在昏暗的錄音室裡對著電容式麥克風,溫暖的實用燈光照明
角色配音
配音舞台:一位女演員看著投影的畫面,臉龐被螢幕照亮
配音
夜晚的控制室,工程師面前的螢幕上閃爍著波形
語氣指示
遊戲角色:火光旁的裝甲騎士,台詞正說到一半
遊戲 NPC
清晨的辦公室裡,一位客服人員戴著耳機通話
語音代理
一位銀髮旁白坐在扶手椅上,就著閱讀燈朗讀精裝書
有聲書

聽聽看。每段音訊旁都附上了腳本。

在 Popcraft 中生成的八種演繹版本。橘色括號中的文字就是完整的語氣指示:沒有經過任何剪輯,沒有拼接重錄的片段,音訊中也沒有任何腳本上沒寫的內容。

01

一句話,五種演繹

[warm] The lighthouse keeper left a lamp burning for ships that never came.

[low, threatening] The lighthouse keeper left a lamp burning for ships that never came.

[rushed] The lighthouse keeper left a lamp burning for ships that never came.

[a tired detective who has heard it all before] The lighthouse keeper left a lamp burning for ships that never came.

[hushed and reverent, like a nature documentary narrator] The lighthouse keeper left a lamp burning for ships that never came.

02

遊戲 NPC,情緒轉折的台詞

[casual] You're looking for work, eh? Hmm, I might have something for you. [door creaking] [suddenly suspicious, lowering his voice] Wait. Who sent you? [pause] [delighted] Marta's cousin! Well why didn't you say so. [coins clinking] Half now, half when it's done.

03

同一個節拍,四種語言

[softly] Don't be afraid. We'll cross together when the morning comes.

[softly] 怖がらないで。朝が来たら、一緒に渡ろう。日文

[softly] Não tenha medo. Vamos atravessar juntos quando a manhã chegar.巴西葡萄牙文

[softly] 别害怕。等天亮了,我们一起过去。華語

相同的聲音,相同的標籤,這四種語言是 ElevenLabs 表示在 v4 中進步最多的。

04

聽起來就像真人一樣的客服

[warm] Thanks so much for holding. I can see the duplicate charge right here. [reassuring] You don't need to do anything else; the refund goes out today. [clear, measured] And your eSIM for Reykjavik is active. Anything else I can check?

v4 Turbo 專為在即時通話中維持穩定的語氣而打造。

05

始終如一的耳語

[whispers] Don't move. It's right behind you. [pause] [whispers] On three, we run. One. Two. [shouts] Run!

06

有聲書冷開場

[quiet, measured narration] When I was young, I thought the mountain stood because it was strong. [pause] I know better now. [long pause] It stood because it had learned where to bend.

v4 單次請求可處理 10,000 個字元,約可生成十分鐘的音訊。

07

週一早晨

[sleepy drowsy voice] Mmm, five more minutes. [yawning] Is it really Monday already?

08

以白話下達指示

[like a sports commentator, speeding up] She takes it on the half-volley, past one, past two, she's through on goal. [amazed] Oh, that is extraordinary!

標籤不一定要從清單中挑選。只要描述演繹方式,模型就能完美呈現。

兩款模型。一款專精演繹,一款專精對話。

過去,你只能在富有表現力的語音和快速生成的語音之間做取捨。Eleven v4 終結了這項妥協:標準模型勝任長篇內容,Turbo 則專攻即時通話。

為創作者而生

Eleven v4

專為內容創作與長篇音訊打造:有聲書、角色配音、長篇旁白。你寫下的演繹指示就是最終的呈現效果,連場景音效也包含在內。

  • 10,000單次請求字元數,約可一次生成十分鐘音訊
  • 90+種語言,較 v3 的 70 多種大幅增加
  • 標籤情緒、節奏、反應、口音及音效,皆可內嵌於文本中
  • IPA精確發音,以斜線標記
「我們於表達性語音生成領域最新研究的巔峰之作。」ElevenLabs,發布文章
專為語音代理打造

Eleven v4 Turbo

具備同等表現力,並針對即時性進行調校:根據 ElevenLabs 的測量,推論延遲中位數約為 100 毫秒,首次發聲時間約為 150 毫秒。

  • 約 100 毫秒推論延遲中位數
  • 約 150 毫秒首次發聲時間中位數
  • 即時支援、銷售與排程通話,能在對話過程中即時調整語氣
「比兩個人對話間的平均停頓時間還要快。」ElevenLabs,發布文章

像在錄音室指導配音員一樣下達指令

以下所有設定皆直接寫在腳本中。沒有滑桿,也不需要後製。

音訊標籤

在情緒發生的當下直接標註

標籤以內嵌方式置於方括號中,並從其所在位置生效至下一個標籤。共有六種類型:情緒、語氣、節奏、反應、口音和音效。使用逗號堆疊提示,模型便會依序執行。

[excited] Big news, everyone. [pause] [whispers] The summer menu drops Friday. [laughs]
背光霧氣中電容式麥克風的特寫
語言

90 多種語言,同一個聲音

ElevenLabs 將跨語言的情感語音視為音訊 AI 最困難的挑戰之一。v4 支援超過 90 種語言,其中日語、巴西葡萄牙語、華語和粵語的進步最為顯著。同一個聲音能在所有語言中傳達相同的演繹指導,因此配音能維持原有的選角陣容。

四名廣播劇演員圍聚在同一個麥克風前
長段錄音

單次請求可達 10,000 個字元

容量是 v3 的兩倍:單次生成可產出約十分鐘的音訊。無論是整個章節、完整的客服腳本還是長篇場景,都能以連貫的節奏一氣呵成,無需拼接段落。

溫暖燈光下,錄音室麥克風旁放著一疊高高的手稿
發音

使用 IPA 精準發音

人名、藥名、地名、產品名:只要在斜線之間寫下 IPA 發音,模型每次都會精準照您的方式發音。至於其他所有內容,v4 創下了 Artificial Analysis 評測過最高的發音分數。

The ferry to Reykjavik /ˈreɪkjavɪk/ leaves at nine.
樂譜架上放著一頁用鉛筆標記的劇本
聲音複製

專業語音複製強勢回歸

v3 從未支援 Professional Voice Clones。v4 現在支援了,讓您擁有的製作級聲音能運用完整的標籤詞彙來演繹。在早期模型上建立的複製聲音只需一鍵即可為 v4 重新訓練,且每次複製背後都有聲音擁有者的驗證同意。

錄音室機架上並排擺放著兩台相同的盤帶機

背後的故事

ElevenLabs 的每一次世代更新都帶來了一項突破。而 v4 是第一個讓您無需再從中取捨的版本。

  • 2023 年 8 月

    Multilingual v2

    支援 29 種語言,ElevenLabs 正式結束測試。

  • 2024 年 7 月

    Turbo v2.5

    為速度而生。

  • 2024 年 12 月

    Flash

    延遲降至約 75 毫秒。速度極快,但缺乏表現力。

  • 2025 年 6 月

    Eleven v3 alpha

    音訊標籤、超過 70 種語言與對話功能登場。極具表現力,但 v3 的官方發布文章仍建議即時應用開發者繼續使用 Flash。

  • 2026 年 2 月

    Eleven v3 正式發布

    表現力臻於成熟。速度上的取捨依然存在。

  • 2026 年 6 月

    華沙搶先預覽

    在華沙高峰會上,ElevenLabs 現場展示下一代模型,即時演示耳語、切換口音與變換情緒。

  • 2026 年 9 月 28 日

    Eleven v4 + v4 Turbo

    全新架構雙管齊下同步推出:ElevenLabs 打造過最具表現力的模型,以及速度快到足以支援即時對話的 Turbo 版本。

實證

獨立評測為先:Artificial Analysis 針對各大主流語音模型舉辦聽眾盲測競技場。

Artificial Analysis,2026 年 10 月Eleven v4背景資訊
供應商語音競技場第 1 名領先 Cartesia Sonic 3.6 與 Gemini 3.8 Flash TTS。Eleven v3 在同一排行榜中位居第 17 名。
發音穩健度91.7%這是 Artificial Analysis 在所有模型中測得的最高分數。
受控語音競技場第 2 名落後於 Qwen-Audio-3.1-TTS-Plus。v3 的得分遠低於這兩者。
生成速度73.4 字元/秒對比 v3 的 42.5,由 Artificial Analysis 測得。

在 ElevenLabs 自行舉辦的盲測偏好測試中,聽眾在與競爭模型對比時,約有 75% 的時間選擇了 v4。該數據出自廠商本身;上述競技場排名則非如此。發布當日的迴響:公告討論串與 Artificial Analysis 結果。

v3 以來的變更

Eleven v3Eleven v4
架構v3 系列全新
語言70+90+
請求長度5,000 個字元10,000 個字元
專業語音複製不支援支援
語氣指示音訊標籤標籤、自然語言指示、IPA
即時不建議v4 Turbo,推論中位數約 100 毫秒

您為 v3 撰寫的腳本可直接在 v4 上執行,無需修改。

常見問題

我現有的複製語音可以在 v4 上使用嗎?

重新訓練後就可以。在早期模型上建立的複製語音,只需在 ElevenLabs 的語音庫中點擊一下,即可為 v4 重新訓練。請注意可能會有差異:重新訓練的語音聽起來可能與其 v3 版本大不相同,來源錄音中的瑕疵會被忠實重現,而使用 Voice Design 建立的語音在表現力上可能不如錄音複製的語音。

音訊標籤都能準確生效嗎?

不一定。ElevenLabs 官方文件也承認標籤遵循「尚未完美」:偶爾會將語氣提示渲染成音效。若要獲得最可靠的結果,請在每個子句使用一個標籤,並將其置於受影響的詞語之前;若要疊加多個提示,請將它們以逗號分隔並放在同一個括號內。

當語音說出非其原生的語言時會發生什麼事?

它會使用該語言的原生口音,而不是該語音原本的家鄉口音。ElevenLabs 表示這是刻意設計的,且目前正在研究保留口音的切換選項。

v4 有哪些控制選項?

穩定性與相似度。沒有風格或速度滑桿,也不支援 SSML;暫停需在腳本中寫成 [pause] 和 [long pause],其餘控制皆透過標籤進行。

該選 v4 還是 v4 Turbo?

v4 適用於任何您生成並保留的內容:旁白、角色、長達 10,000 個字元的配音級朗讀。v4 Turbo 適用於任何需要即時回應的場景:語音代理與互動式應用程式,其約 100 毫秒的中位數推論延遲能讓對話流暢進行。

寫下演出劇本。v4 為您完美演繹。

選擇聲音,將指示寫在括號內,幾秒內即可聽見錄音成果。

本頁所有音訊皆由 Popcraft 搭配 ElevenLabs 語音生成;每段音訊的完整腳本皆顯示於旁邊。圖片為 AI 生成。引用台詞為 ElevenLabs 原創,出自 Eleven v4 發布文章。排名來自 Artificial Analysis,讀取於 2026 年 10 月。

繼續探索

相關模型