기사 검색

이슈부터 IT·AI·연예·게임까지, 메타브리프의 기사를 찾아보세요.

AI

구글 딥마인드, 목소리 설계·복제 기능 갖춘 TTS 모델 '제미나이 3.8' 2종 공개

구글 딥마인드는 공식 블로그를 통해 텍스트를 음성으로 바꾸는(TTS) 신규 모델 '제미나이 3.8 플래시 TTS'와 '제미나이 3.8 플래시-라이트 TTS'를 공개했다고 밝혔다. 회사는 두 모델을 지금까지 내놓은 오디오 생성 모델 가운데 표현력이 가장 뛰어난 모델로 소개했다.


새 모델을 쓰면 기존의 음성 프리셋 30종에서 벗어나, 자연어 프롬프트만으로 억양과 감정 톤을 지정해 새로운 캐릭터 목소리를 만들 수 있다. 대사를 한 줄씩 연출할 수 있고 두 화자가 나누는 대화 장면도 제어할 수 있으며, 지원 언어는 100개가 넘는다. 구글 딥마인드는 플래시 TTS가 Hume AI의 보이스 디자인 벤치마크에서 71.4점으로 종합 1위에 올랐다고 밝혔다.


목소리 복제는 본인 동의를 확인한 경우에만 쓸 수 있다. 목소리 주인이 직접 녹음한 동의 음성을 제출해야 하고, 이 음성이 참조 화자와 일치해야 한다. 생성된 모든 오디오에는 AI 생성물임을 식별할 수 있는 워터마크 'SynthID'가 삽입된다. 두 모델은 발표 당일부터 구글 AI 스튜디오와 제미나이 API 등을 통해 순차적으로 제공된다.



메타브리프 편집팀 메타브리프 기자