ElevenLabs는 Eleven v4를 "역대 가장 감정 표현이 풍부한 텍스트 음성 변환 모델"이라고 부릅니다. 인라인 태그로 90개 이상의 언어에서 최대 10,000자까지 대본에 말투를 지정해 보세요. 그리고 v4 Turbo는 실시간 대화를 이어갈 수 있을 만큼 빠르게 응답합니다.
Popcraft에서 생성된 여덟 가지 테이크입니다. 주황색 대괄호 안의 단어들이 디렉팅의 전부입니다. 편집이나 여러 테이크를 이어 붙인 부분이 없으며, 오디오에 포함된 모든 것은 오직 페이지에 적힌 내용뿐입니다.
01
한 문장, 다섯 가지 전달
[warm] The lighthouse keeper left a lamp burning for ships that never came.
[low, threatening] The lighthouse keeper left a lamp burning for ships that never came.
[rushed] The lighthouse keeper left a lamp burning for ships that never came.
[a tired detective who has heard it all before] The lighthouse keeper left a lamp burning for ships that never came.
[hushed and reverent, like a nature documentary narrator] The lighthouse keeper left a lamp burning for ships that never came.
02
게임 NPC, 대사 한 마디에 돌변하는 모습
[casual] You're looking for work, eh? Hmm, I might have something for you. [door creaking][suddenly suspicious, lowering his voice] Wait. Who sent you? [pause][delighted] Marta's cousin! Well why didn't you say so. [coins clinking] Half now, half when it's done.
03
하나의 비트, 네 가지 언어
[softly] Don't be afraid. We'll cross together when the morning comes.
[softly] 怖がらないで。朝が来たら、一緒に渡ろう。일본어
[softly] Não tenha medo. Vamos atravessar juntos quando a manhã chegar.브라질 포르투갈어
[softly] 别害怕。等天亮了,我们一起过去。표준 중국어
동일한 보이스, 동일한 태그, ElevenLabs가 v4에서 가장 크게 향상되었다고 밝힌 네 가지 언어입니다.
04
진짜 상담원처럼 들리는 지원 에이전트
[warm] Thanks so much for holding. I can see the duplicate charge right here. [reassuring] You don't need to do anything else; the refund goes out today. [clear, measured] And your eSIM for Reykjavik is active. Anything else I can check?
v4 Turbo가 실시간 통화 환경에서 유지하도록 설계된 어조입니다.
05
속삭임 그대로 남는 속삭임
[whispers] Don't move. It's right behind you. [pause][whispers] On three, we run. One. Two. [shouts] Run!
06
오디오북 콜드 오픈
[quiet, measured narration] When I was young, I thought the mountain stood because it was strong. [pause] I know better now. [long pause] It stood because it had learned where to bend.
v4는 한 번의 요청으로 10,000자, 약 10분 분량의 오디오를 처리합니다.
07
월요일 아침
[sleepy drowsy voice] Mmm, five more minutes. [yawning] Is it really Monday already?
08
일상 언어로 전달하는 지시
[like a sports commentator, speeding up] She takes it on the half-volley, past one, past two, she's through on goal. [amazed] Oh, that is extraordinary!
태그가 반드시 목록에서 나올 필요는 없습니다. 전달 방식을 설명하기만 하면 모델이 그대로 수행합니다.
두 가지 모델. 하나는 퍼포먼스용, 다른 하나는 대화용.
지금까지는 표현력이 풍부한 음성과 빠른 음성 중 하나를 선택해야 했습니다. Eleven v4가 이러한 타협을 끝냅니다. 표준 모델은 롱폼 작업을 담당하고, Turbo는 실시간 통화를 담당합니다.
크리에이터를 위해
Eleven v4
콘텐츠 제작 및 롱폼 오디오를 위해 구축되었습니다. 오디오북, 캐릭터 연기, 더빙 분량의 내레이션을 지원합니다. 작성한 전달 방식이 그대로 구현되며, 장면 사운드도 포함됩니다.
10,000요청당 문자 수, 한 번에 약 10분 분량의 오디오
90+지원 언어, v3의 70개 이상에서 증가
태그감정, 페이싱, 반응, 억양 및 효과음을 인라인으로 작성
IPA정확한 발음을 슬래시 사이에 작성
"표현력 있는 음성 생성에 대한 저희 최신 연구의 집약체입니다."ElevenLabs, 출시 게시물
음성 에이전트용
Eleven v4 Turbo
동일한 표현력을 실시간에 맞게 최적화했습니다: ElevenLabs 측정 기준 추론 지연 시간 중앙값 약 100ms, 첫 음성 출력까지 약 150ms.
~100ms추론 지연 시간 중앙값
~150ms첫 음성 출력까지의 중앙 시간
실시간대화 도중 톤을 조절하는 고객 지원, 영업 및 예약 통화
"두 사람이 대화할 때 생기는 평균적인 공백보다 더 빠릅니다."ElevenLabs, 출시 게시물
녹음 부스 안의 성우를 디렉팅하듯
아래의 모든 것은 스크립트 자체에 포함됩니다. 슬라이더도, 후처리도 필요 없습니다.
오디오 태그
감정이 필요한 곳에 직접 작성하세요
태그는 대괄호 안에 인라인으로 삽입되며, 삽입된 위치부터 다음 태그까지 적용됩니다. 감정, 전달 방식, 페이싱, 반응, 억양, 효과음 등 6가지 종류가 있습니다. 쉼표로 큐를 나열하면 모델이 순서대로 수행합니다.
[excited] Big news, everyone. [pause][whispers] The summer menu drops Friday. [laughs]
언어
90개 이상의 언어, 하나의 목소리
ElevenLabs는 언어를 아우르는 표현력 있는 음성을 오디오 AI의 가장 어려운 난제 중 하나로 꼽습니다. v4는 90개 이상의 언어를 지원하며, 특히 일본어, 브라질 포르투갈어, 표준 중국어, 광둥어에서 가장 큰 성능 향상을 이루었습니다. 모든 언어에서 동일한 목소리로 동일한 연출을 유지할 수 있어, 더빙 시에도 기존 캐스팅을 그대로 살릴 수 있습니다.
롱테이크
한 번의 요청으로 10,000자
v3가 처리하던 양의 두 배인 단일 생성으로 약 10분 분량의 오디오를 만들어냅니다. 한 챕터, 전체 지원 스크립트 또는 긴 장면도 단락을 이어 붙인 것이 아닌 하나의 연속된 읽기로 자연스러운 페이스를 유지합니다.
발음
IPA로 정확하게 발음하기
이름, 약품명, 지명, 제품명: 슬래시 사이에 IPA로 발음을 적어두면 모델이 매번 사용자가 원하는 대로 읽어줍니다. 그 외의 모든 발음에 대해서도 v4는 Artificial Analysis가 측정한 최고 발음 점수를 기록했습니다.
The ferry to Reykjavik /ˈreɪkjavɪk/ leaves at nine.
보이스 클론
프로페셔널 보이스 클론의 귀환
v3는 프로페셔널 보이스 클론을 지원하지 않았지만 v4에서는 지원하므로, 사용자가 소유한 프로덕션 보이스로 전체 태그 어휘를 활용한 성능을 발휘할 수 있습니다. 이전 모델에서 만든 클론도 단 한 번의 클릭으로 v4에 맞게 재학습되며, 모든 클론에는 음성 소유자의 검증된 동의가 뒷받침됩니다.
비하인드 스토리
ElevenLabs의 모든 세대는 한 가지씩 새로운 기능을 추가해 왔습니다. v4는 그 기능들 중 무엇을 선택할지 고민하지 않아도 되는 첫 번째 모델입니다.
2023년 8월
Multilingual v2
29개 언어를 지원하며, ElevenLabs가 베타를 종료합니다.
2024년 7월
Turbo v2.5
속도를 위해 설계되었습니다.
2024년 12월
Flash
지연 시간이 약 75ms로 단축됩니다. 빠르지만 표현력이 풍부하지는 않습니다.
2025년 6월
Eleven v3 알파
오디오 태그, 70개 이상의 언어 및 대화 기능이 도입됩니다. 표현력은 풍부하지만, v3의 자체 출시 게시물에서는 실시간 빌더에게 Flash를 계속 사용할 것을 권장했습니다.
2026년 2월
Eleven v3 정식 출시
표현력 라인업이 성숙해집니다. 속도와의 트레이드오프는 여전합니다.
2026년 6월
바르샤바 미리보기
ElevenLabs는 바르샤바 서밋에서 다음 세대의 모델을 시연하며, 무대 위에서 실시간으로 속삭임, 억양 전환 및 감정 변화를 선보입니다.
2026년 9월 28일
Eleven v4 + v4 Turbo
새로운 아키텍처가 두 가지 방향으로 동시에 출시됩니다. ElevenLabs가 구축한 가장 표현력이 풍부한 모델과, 실시간 대화에 충분히 빠른 Turbo 버전입니다.
Cartesia Sonic 3.6 및 Gemini 3.8 Flash TTS를 앞섰습니다. 동일 보드에서 Eleven v3는 17위입니다.
발음 견고성
91.7%
Artificial Analysis가 측정한 모든 모델 중 최고 점수입니다.
제어 음성 아레나
#2
Qwen-Audio-3.1-TTS-Plus의 뒤를 이었습니다. v3는 두 모델보다 훨씬 낮은 점수를 받았습니다.
생성 속도
73.4자/초
Artificial Analysis 측정 기준 v3의 42.5와 비교됩니다.
ElevenLabs의 자체 블라인드 선호도 테스트에서, 청취자들은 경쟁 모델 대비 약 75%의 확률로 v4를 선택했습니다. 해당 수치는 제공사 측의 데이터이며, 위의 아레나 순위는 그렇지 않습니다. 출시일 반응: 공지 스레드 및 Artificial Analysis 결과.
v3 대비 변경 사항
Eleven v3
Eleven v4
아키텍처
v3 패밀리
완전히 새로움
언어
70+
90+
요청 길이
5,000자
10,000자
프로페셔널 보이스 클론
지원되지 않음
지원
디렉팅
오디오 태그
태그, 자연어 지시어, IPA
실시간
권장되지 않음
v4 Turbo, 추론 중앙값 약 100ms
v3용으로 작성한 스크립트는 수정 없이 v4에서 그대로 실행됩니다.
FAQ
기존에 복제된 음성이 v4에서도 작동하나요?
재학습 후에는 가능합니다. 이전 모델에서 만든 클론은 ElevenLabs의 음성 라이브러리에서 클릭 한 번으로 v4용으로 재학습할 수 있습니다. 다만 차이점에 유의하세요. 재학습된 음성은 v3 버전과 상당히 다르게 들릴 수 있으며, 원본 녹음의 결함도 그대로 재현되고, Voice Design으로 만든 음성은 녹음된 클론보다 표현력이 떨어질 수 있습니다.
오디오 태그는 항상 정확하게 적용되나요?
항상 그렇지는 않습니다. ElevenLabs 자체 문서에서도 태그 반영이 '아직 완벽하지 않다'고 명시되어 있습니다. 간혹 전달 큐가 효과음으로 렌더링되는 경우도 있습니다. 가장 안정적인 결과를 얻으려면 절마다 하나의 태그만 사용하고, 영향을 미칠 단어 앞에 배치한 뒤, 여러 큐를 겹치고 싶을 때는 단일 대괄호 안에 쉼표로 구분하여 입력하세요.
음성이 자신의 모국어가 아닌 다른 언어를 말하면 어떻게 되나요?
음성 고유의 억양이 아닌 해당 언어의 원어민 억양으로 말합니다. ElevenLabs는 이것이 의도된 설계이며, 억양을 유지하는 토글 기능은 현재 연구 중이라고 밝혔습니다.
v4에는 어떤 제어 옵션이 있나요?
안정성 및 유사도 조절이 가능합니다. 스타일이나 속도 슬라이더는 없으며 SSML도 지원하지 않습니다. 일시 정지는 스크립트에 [pause] 및 [long pause]로 작성하며, 나머지는 모두 태그로 처리합니다.
v4와 v4 Turbo 중 무엇을 선택해야 하나요?
v4는 내레이션, 캐릭터, 최대 10,000자 분량의 더빙 등 렌더링 후 저장하는 모든 오디오에 적합합니다. v4 Turbo는 음성 에이전트 및 인터랙티브 앱처럼 실시간 대화가 필요한 상황에 적합하며, 약 100ms의 추론 지연 시간 중앙값으로 대화의 흐름을 원활하게 유지합니다.
이 페이지의 모든 오디오는 Popcraft에서 ElevenLabs 보이스로 생성되었으며, 각 클립의 전체 스크립트는 옆에 표시됩니다. 이미지는 AI로 생성되었습니다. 인용된 문구는 Eleven v4 출시 게시물에 있는 ElevenLabs의 자체 문구입니다. 순위는 Artificial Analysis의 자료이며, 2026년 10월 기준입니다.