다음 내용이 궁금하다면?
불편하시다면 뒤로 가기를 눌러주세요
자연어 지시로 말투·억양 제어…'카나나-o' 음성 생성 고도화

(서울=연합뉴스) 한상용 기자 = 카카오[035720]는 자체 개발한 옴니 인공지능(AI) 모델 '카나나-o' 음성 생성 기술을 고도화했다고 4일 밝혔다.
개선된 카나나-o는 이용자가 자연어로 지시한 말투와 속도, 음량, 음높이, 감정, 억양 등을 반영해 음성을 생성한다.
예를 들어 "슬픈 목소리로 읽어줘", "경상도 사투리로 읽어줘"와 같은 지시를 수행할 수 있다.
스포츠 중계나 아나운서처럼 말하도록 특정 역할과 발화 방식을 지정하는 것도 가능하다.
카카오는 한국어 데이터를 중심으로 모델을 학습했지만 영어 음성 생성에서도 같은 방식의 발화 지시를 수행할 수 있다고 설명했다.
카카오에 따르면 카나나-o는 발화 지시 이행 능력을 평가하는 한국어 벤치마크 '인스트럭트 TTS 이밸'에서 94.50점을 기록했다.
이는 오픈AI의 GPT-4o 미니 TTS의 91.10점보다 높고, 구글 제미나이 2.5 플래시 프리뷰 TTS의 95.38점과 비슷한 수준이라고 카카오는 전했다.
카카오는 음성 생성 속도와 효율을 높이기 위해 자체 개발한 음성 토크나이저 'LM-SPT'도 적용했다.
음성 토크나이저는 음성 데이터를 AI가 처리할 수 있는 토큰 단위로 변환하는 기술이다.
LM-SPT는 음성을 더 적은 수의 토큰으로 압축해 모델이 처리해야 할 데이터양을 줄이는 방식이다.
카카오는 앞으로 음성 이해와 생성을 하나의 통합 구조로 처리하는 기술을 연구하고, 웃음과 한숨, 감탄 등 비언어적 표현을 생성하는 기능도 개발할 계획이다.
노병석 카카오 유니파이드 파운데이션 모델 성과리더는 "향후 카나나-o 모델을 다양한 서비스에 적용해 더욱 자연스럽고 편리한 AI 음성 경험을 제공하겠다"고 말했다.
gogo213@yna.co.kr
Copyright 연합뉴스 All rights reserved. 무단 전재 및 재배포 금지.
인기상품 확인하고 계속 읽어보세요!
원치 않을 경우 뒤로가기를 눌러주세요.
