연합뉴스

[AI픽] 카카오 AI, 말 한마디로 감정·사투리까지 구현

입력 2026-08-04 09:33:18

다음 내용이 궁금하다면?

불편하시다면 뒤로 가기를 눌러주세요


자연어 지시로 말투·억양 제어…'카나나-o' 음성 생성 고도화




[카카오 제공. 재판매 및 DB 금지]




(서울=연합뉴스) 한상용 기자 = 카카오[035720]는 자체 개발한 옴니 인공지능(AI) 모델 '카나나-o' 음성 생성 기술을 고도화했다고 4일 밝혔다.


개선된 카나나-o는 이용자가 자연어로 지시한 말투와 속도, 음량, 음높이, 감정, 억양 등을 반영해 음성을 생성한다.


예를 들어 "슬픈 목소리로 읽어줘", "경상도 사투리로 읽어줘"와 같은 지시를 수행할 수 있다.


스포츠 중계나 아나운서처럼 말하도록 특정 역할과 발화 방식을 지정하는 것도 가능하다.


카카오는 한국어 데이터를 중심으로 모델을 학습했지만 영어 음성 생성에서도 같은 방식의 발화 지시를 수행할 수 있다고 설명했다.


카카오에 따르면 카나나-o는 발화 지시 이행 능력을 평가하는 한국어 벤치마크 '인스트럭트 TTS 이밸'에서 94.50점을 기록했다.


이는 오픈AI의 GPT-4o 미니 TTS의 91.10점보다 높고, 구글 제미나이 2.5 플래시 프리뷰 TTS의 95.38점과 비슷한 수준이라고 카카오는 전했다.


카카오는 음성 생성 속도와 효율을 높이기 위해 자체 개발한 음성 토크나이저 'LM-SPT'도 적용했다.


음성 토크나이저는 음성 데이터를 AI가 처리할 수 있는 토큰 단위로 변환하는 기술이다.


LM-SPT는 음성을 더 적은 수의 토큰으로 압축해 모델이 처리해야 할 데이터양을 줄이는 방식이다.


카카오는 앞으로 음성 이해와 생성을 하나의 통합 구조로 처리하는 기술을 연구하고, 웃음과 한숨, 감탄 등 비언어적 표현을 생성하는 기능도 개발할 계획이다.


노병석 카카오 유니파이드 파운데이션 모델 성과리더는 "향후 카나나-o 모델을 다양한 서비스에 적용해 더욱 자연스럽고 편리한 AI 음성 경험을 제공하겠다"고 말했다.


gogo213@yna.co.kr



인기상품 확인하고 계속 읽어보세요!

5

원치 않을 경우 뒤로가기를 눌러주세요.

연합뉴스 콘텐츠 더보기

해당 콘텐츠 제공사로 이동합니다.

많이 본 최근 기사

관심 많은 기사

실시간 검색어

2026-08-04 10:00 업데이트