강의 영상이나 발표 자료에 내레이션 넣을 때 내 목소리로 녹음하기 부담스럽잖아
구글이 새 음성 생성 모델 Gemini 3.8 Flash TTS, Flash-Lite TTS를 공개했어
글만 넣으면 말투, 속도, 억양까지 지시해서 읽게 할 수 있대
핵심 3개만 뽑았어
[댓글 @the_pcher_pt]
1. 말로 설명하면 새 목소리를 만들어줘
"멜버른 억양의 신나는 DJ 목소리"처럼 역할, 억양, 목소리 특징을 글로 적으면 처음부터 새 목소리를 만들어준대
100개 넘는 언어와 방언을 지원하고, 바로 쓸 수 있는 목소리도 2,000개 이상이야
30초 음성 샘플로 목소리 복제도 되는데, 목소리 주인의 동의 녹음이 있어야 해
[댓글 @the_pcher_pt]
2. 대사 한 줄씩 연기 지시
대본에 연출 지시를 적거나 , 같은 표시를 넣으면 웃음, 한숨까지 살려서 읽어줘
두 사람 대화도 대본 하나로 만들 수 있고, 몇 시간짜리 긴 오디오도 목소리 톤이 거의 안 바뀌고 유지된대
Hume AI 음성 디자인 벤치마크에서도 1위(71.4점)를 찍었대
[댓글 @the_pcher_pt]
3. 어디서 쓸 수 있나
일반 사용자는 Gemini Notebook(3.8 Flash TTS), Google Vids(Flash-Lite TTS)에 오늘부터 순차 적용이래
개발자는 Google AI Studio, Gemini API에서 바로 써볼 수 있고, 기업용 Gemini Enterprise는 곧 나온대
만든 음성엔 전부 SynthID 워터마크가 들어가서 AI 음성인지 확인할 수 있어
너는 강의 영상 내레이션, AI 목소리한테 맡길 파야, 직접 녹음하는 파야?
출처: blog.google/innov…
/
blog.google
Gemini 3.8 text-to-speech says hello


