NEWテキストや画像から 3D モデル を作成 — リギング、アニメーション、エクスポートまで。3Dを試す
PopcraftPopcraft
ElevenLabsによる音声モデル

Eleven v4 + Eleven v4 Turbo台本を読み上げるだけではない。
演じるのだ。

ElevenLabsはEleven v4を「これまでで最も感情豊かなテキスト読み上げモデル」と称しています。インラインタグで読み方を台本に書き込め、90以上の言語で1テイク最大10,000文字まで対応。さらに、v4 Turboはリアルタイムの会話についていけるほど高速に応答します。

[whispers] Don't move. It's right behind you.Eleven v4TTS生成
90+ 言語10,000 1テイクあたりの文字数インライン オーディオタグ
温かいランプの明かりに照らされた薄暗い録音ブースで、コンデンサーマイクに向かう女性声優
キャラクターボイス
アフレコスタジオ:女優がスクリーンに映し出された映像を見つめ、その顔は画面の光に照らされている
吹き替え
夜のコントロールルーム:エンジニアの目の前のモニターで波形が輝いている
演出
ゲームキャラクター:焚き火の明かりに照らされた鎧の騎士、セリフの途中
ゲームNPC
夜明けのオフィス:ヘッドセットを着けて通話するサポートエージェント
ボイスエージェント
読書灯の下の肘掛け椅子に座り、ハードカバーの本を読み上げる銀髪のナレーター
オーディオブック

聴いてみてください。各クリップの横にスクリプトがあります。

Popcraftで生成された8つのテイク。オレンジ色の括弧内の言葉が演出のすべてです。編集も、複数のテイクの繋ぎ合わせもなく、ページに書かれていない音は一切入っていません。

01

1つの文、5つの言い回し

[warm] The lighthouse keeper left a lamp burning for ships that never came.

[low, threatening] The lighthouse keeper left a lamp burning for ships that never came.

[rushed] The lighthouse keeper left a lamp burning for ships that never came.

[a tired detective who has heard it all before] The lighthouse keeper left a lamp burning for ships that never came.

[hushed and reverent, like a nature documentary narrator] The lighthouse keeper left a lamp burning for ships that never came.

02

ゲームNPC、セリフの途中で感情を切り替える

[casual] You're looking for work, eh? Hmm, I might have something for you. [door creaking] [suddenly suspicious, lowering his voice] Wait. Who sent you? [pause] [delighted] Marta's cousin! Well why didn't you say so. [coins clinking] Half now, half when it's done.

03

1つのリズム、4つの言語

[softly] Don't be afraid. We'll cross together when the morning comes.

[softly] 怖がらないで。朝が来たら、一緒に渡ろう。日本語

[softly] Não tenha medo. Vamos atravessar juntos quando a manhã chegar.ブラジルポルトガル語

[softly] 别害怕。等天亮了,我们一起过去。標準中国語

同じ声、同じタグ、ElevenLabsがv4で最も向上したと述べる4つの言語。

04

本物のように聞こえるサポートエージェント

[warm] Thanks so much for holding. I can see the duplicate charge right here. [reassuring] You don't need to do anything else; the refund goes out today. [clear, measured] And your eSIM for Reykjavik is active. Anything else I can check?

v4 Turboがライブ通話で保てるよう設計された話しぶり。

05

囁きは囁きのまま

[whispers] Don't move. It's right behind you. [pause] [whispers] On three, we run. One. Two. [shouts] Run!

06

オーディオブックの冒頭シーン

[quiet, measured narration] When I was young, I thought the mountain stood because it was strong. [pause] I know better now. [long pause] It stood because it had learned where to bend.

v4は1回のリクエストで10,000文字、約10分の音声に対応します。

07

月曜日の朝

[sleepy drowsy voice] Mmm, five more minutes. [yawning] Is it really Monday already?

08

平易な言葉でのディレクション

[like a sports commentator, speeding up] She takes it on the half-volley, past one, past two, she's through on goal. [amazed] Oh, that is extraordinary!

タグはリストから選ぶ必要はありません。読み上げ方を記述するだけで、モデルがその通りに再現します。

2つのモデル。1つはパフォーマンス用、もう1つは会話用。

これまでは、表現力豊かな音声と高速な音声のどちらかを選ぶ必要がありました。Eleven v4がそのジレンマを解消します。標準モデルは長尺の制作を担い、Turboはリアルタイムの通話を担います。

クリエイター向け

Eleven v4

コンテンツ制作や長尺音声のために構築:オーディオブック、キャラクターボイス、吹き替え規模のナレーション。記述した通りの表現が出力され、シーンの効果音も含まれます。

  • 10,0001回のリクエストあたりの文字数、1テイクで約10分の音声
  • 90+言語、v3の70以上から増加
  • タグ感情、ペーシング、反応、アクセント、効果音をインラインで記述
  • IPAスラッシュで囲んで正確な発音を記述
「表現力豊かな音声生成における、私たちの最新研究の集大成。」ElevenLabs、ローンチ記事
ボイスエージェント向け

Eleven v4 Turbo

同等の表現力をリアルタイム向けにチューニング:ElevenLabsの測定による推論レイテンシ中央値約100ms、初回発話まで約150ms。

  • 約100ms推論レイテンシ中央値
  • 約150ms初回発話までの中央値
  • ライブ会話中にトーンを適応させるサポート、営業、予約の通話
「2人が会話する間の平均的な間よりも高速。」ElevenLabs、ローンチ記事

ブース内のタレントをディレクションするように

以下のすべてはスクリプト自体で制御します。スライダーも後処理も不要です。

オーディオタグ

感情が生まれる場所に書き込む

タグは角括弧でインラインに記述し、その位置から次のタグまで有効です。感情、話し方、ペーシング、リアクション、アクセント、効果音の6種類があります。カンマでキューを積み重ねると、モデルが順番に実行します。

[excited] Big news, everyone. [pause] [whispers] The summer menu drops Friday. [laughs]
逆光の霞の中に佇むコンデンサーマイクのクローズアップ
言語

90以上の言語、1つの音声

ElevenLabsは、言語を超えた表現力豊かな発話を音声AIにおける最も困難な課題の1つと位置づけています。v4は90以上の言語に対応し、特に日本語、ブラジルポルトガル語、北京語、広東語で最大の向上を達成しました。どの言語でも同じ音声で同じディレクションを維持できるため、吹き替えでもキャスティングを一貫させることができます。

1つのマイクの周りに集まった4人のラジオドラマキャスト
ロングテイク

1回のリクエストで10,000文字

v3の2倍の文字数を受け付け、1回の生成で約10分間の音声を出力します。1つの章、サポートスクリプト全体、または長いシーンも、継ぎ接ぎの段落ではなく、1つの連続した読み上げとしてペースを維持します。

温かいランプの光の下、スタジオマイクの横に高く積まれた原稿用紙
発音

IPAで正確に発音

人名、薬品名、地名、製品名:スラッシュで囲んでIPAで発音を記述すれば、モデルは毎回その通りに発音します。それ以外のすべての単語についても、v4はArtificial Analysisが測定した中で最高の発音スコアを記録しました。

The ferry to Reykjavik /ˈreɪkjavɪk/ leaves at nine.
譜面台に置かれ、鉛筆で書き込みがされた台本のページ
音声クローン

Professional Voice Clonesが復活

v3はProfessional Voice Clonesに対応していませんでしたが、v4では対応したため、あなたが所有する制作済み音声がフルタグ語彙を使ってパフォーマンスできるようになりました。以前のモデルで作成したクローンもワンクリックでv4用に再トレーニングでき、すべてのクローンには音声所有者による検証済みの同意が裏付けられています。

スタジオラックに並べて置かれた2台の同一のオープンリールテープデッキ

その背景にあるストーリー

ElevenLabsの世代は常に何か1つを付け加えてきました。v4は、それらの間で選択を迫られることのない最初のモデルです。

  • 2023年8月

    Multilingual v2

    29言語に対応し、ElevenLabsがベータ版を卒業。

  • 2024年7月

    Turbo v2.5

    スピード重視で設計。

  • 2024年12月

    Flash

    レイテンシが約75msまで短縮。高速ですが、表現力には欠けます。

  • 2025年6月

    Eleven v3 alpha

    オーディオタグ、70以上の言語、対話機能が追加。表現力は高いものの、v3のリリース投稿では、リアルタイム開発者にFlashの使用を推奨。

  • 2026年2月

    Eleven v3がGAに

    表現力が成熟。速度とのトレードオフはそのまま。

  • 2026年6月

    ワルシャワプレビュー

    ワルシャワでのサミットで、ElevenLabsが次期モデルをデモ。ささやき、アクセントの切り替え、感情の変化をステージ上でリアルタイムに披露。

  • 2026年9月28日

    Eleven v4 + v4 Turbo

    新アーキテクチャが両方向で同時に登場:ElevenLabsが構築した最も表現力豊かなモデルと、リアルタイム会話に十分な速度を備えたTurbo。

証明

まずは第三者機関による検証:Artificial Analysisは、主要なすべての音声モデルを対象にブラインドリスナーアリーナを実施しています。

Artificial Analysis、2026年10月Eleven v4詳細
プロバイダー音声アリーナ1位Cartesia Sonic 3.6およびGemini 3.8 Flash TTSを上回る成績。同じランキングでEleven v3は17位に位置しています。
発音の堅牢性91.7%Artificial Analysisがこれまでに測定したあらゆるモデルの中で最高のスコア。
制御音声アリーナ2位Qwen-Audio-3.1-TTS-Plusに次ぐ成績。v3は両者を大きく下回るスコアでした。
生成速度73.4文字/秒Artificial Analysisによる測定で、v3の42.5を上回る数値。

ElevenLabs独自のブラインド嗜好テストでは、リスナーは競合モデルに対して約75%の割合でv4を選択しました。この数値はベンダーによるものであり、上記のアリーナランキングはそうではありません。公開初日の反応:発表スレッドおよびArtificial Analysisの結果。

v3からの変更点

Eleven v3Eleven v4
アーキテクチャv3ファミリーすべて一新
言語70+90+
リクエスト長5,000文字10,000文字
プロフェッショナルボイスクローン非対応対応
演出オーディオタグタグ、自然言語による指示、IPA
リアルタイム非推奨v4 Turbo、推論中央値約100ms

v3用に作成したスクリプトは、そのままv4で実行できます。

FAQ

既存のクローン音声はv4でも使えますか?

再トレーニングを行えば使えます。旧モデルで作成したクローンは、ElevenLabsの音声ライブラリでワンクリックするだけでv4用に再トレーニングできます。ただし、いくつかの違いが生じることにご注意ください。再トレーニングされた音声はv3バージョンと大きく異なる聞こえ方になる場合があり、元の録音に含まれる欠陥も忠実に再現されます。また、Voice Designで構築された音声は、録音に基づくクローンに比べて表現力が低くなる可能性があります。

オーディオタグは常に反映されますか?

常に反映されるとは限りません。ElevenLabsの公式ドキュメントでも、タグの追従は「まだ完璧ではない」とされています。時折、演出用のキューが代わりに効果音として再生されてしまうことがあります。最も信頼性の高い結果を得るには、1つの節につき1つのタグを使用し、影響させたい単語の前に配置し、複数のキューを重ねたい場合は1つの括弧内にカンマ区切りで記述してください。

音声が母国語以外の言語を話すとどうなりますか?

音声本来のアクセントではなく、その言語のネイティブアクセントで話します。ElevenLabsによるとこれは仕様であり、アクセントを維持するトグル機能については現在研究中とのことです。

v4にはどのようなコントロール機能がありますか?

StabilityとSimilarityです。スタイルや速度のスライダー、SSMLはありません。一時停止はスクリプト内で[pause]や[long pause]と記述し、それ以外はすべてタグで制御します。

v4とv4 Turboのどちらを選ぶべきですか?

v4は、ナレーション、キャラクター、最大10,000文字に及ぶ吹き替えなど、生成して保存するあらゆる音声に最適です。v4 Turboは、音声エージェントやインタラクティブアプリなど、双方向のやり取りが必要な用途に最適です。約100 msの中央値となる推論レイテンシにより、途切れることのないスムーズな会話を実現します。

理想の演技をテキストに。v4がそれを実現します。

音声を選び、ディレクションを括弧で囲んで入力すれば、数秒でテイクを聴くことができます。

本ページの音声はすべてPopcraftでElevenLabsの音声を使用して生成されたものであり、各クリップのフルスクリプトは横に表示されています。画像はAIにより生成されたものです。引用文はElevenLabs自身のEleven v4ローンチ記事からのものです。ランキングはArtificial Analysisによるもので、2026年10月時点のデータです。

さらに探索

関連モデル