grep

AI/ML

카카오의 AI 모델, 카나나 모델 패밀리를 소개합니다

Kanana카카오

2024년 11월 14일

원문에서 보기 ↗

지난 if(kakaoAI)2024에서는 카카오의 독자적인 AI 모델 라인업, Kanana Model Family(이하 카나나 모델 패밀리)를 소개했습니다.

영상 보기

카카오는 지금 이 순간에도 AGI(Artificial General Intelligence)를 향한 글로벌 경쟁에 도전하며, 카카오를 넘어 국내 전반에 기여할 수 있는 기반을 마련하고자 AI 모델 개발에 박차를 가하고 있습니다. 이번 글에서는 카카오의 AI 모델, 카나나의 핵심에 대해 알아보겠습니다.

Kanana 모델의 지향점

카카오는 카나나 모델을 기반으로 이용자에게 실질적인 도움을 줄 수 있는 AI 서비스화를 앞두고 있습니다. 카나나 모델은 서비스 적용에 최적화된 실용적인 AI 모델을 지향합니다. 큰 사이즈의 모델이 좋은 성능을 보이는 건 당연하지만, 아주 사소한 일에 큰 모델을 적용하는 것은 비용 효율성이 떨어질 수밖에 없습니다. 모든 상황에서 큰 모델이 필요한 것은 아니기에, 카카오는 높은 성능과 비용 효율성을 동시에 고려하여 튜닝을 통해 서비스의 문제를 해결하는 AI 모델을 개발하고 있습니다.

카카오 서비스에 최적화된 AI 모델의 핵심 역량

카카오가 지향하는 연결의 가치는 대화의 연장선에 있습니다. 이를 위해 카나나는 사람처럼 자연스럽게 대화하고, 복잡한 정보를 처리하여 사용자의 요구를 만족시킬 수 있도록 설계되었습니다. 단순히 말을 잘하는 능력을 넘어 대화의 흐름을 잘 이해하고, 정확한 지식을 제공하고, 사용자가 필요로 하는 액션을 자연스럽게 연결해 주는 모델로 개발되었습니다. 이를 통해 LLM만으로 해결할 수 없는 일들을 지원하여 사용자에게 차별화된 경험을 제공하고, 카카오 서비스에 새로운 가치를 더할 계획입니다.

카카오의 AI 모델 라인업, Kanana Model Family

카나나 모델 패밀리는 사람처럼 보고 듣고 말하는 모델을 목표로, 텍스트, 이미지, 영상, 음성 등 다양한 형태의 데이터를 처리할 수 있는 모델들로 구성되어 있습니다. 크게 언어모델과 멀티모달 언어모델, 비주얼 생성 모델, 음성모델로 구분되며, 각 크기와 기능에 따라 세부 모델로 나누어집니다. 이를 통해 사용자에게 더 직관적이고 풍부한 경험을 제공하고자 합니다.

언어모델

언어모델은 카카오 AI의 핵심으로, 사이즈에 따라 3가지 모델로 구분됩니다. 가장 작은 Kanana Nano 부터 서비스의 핵심적인 역할을 하는 Kanana Essence , 가장 큰 사이즈의 Kanana Flag 모델이 있습니다. 카카오는 특히 글로벌 선두 모델들과 비교해 압도적인 한국어 성능을 가진 Kanana Essence 모델과 개별 태스크에 특화된 전용모델 구조를 바탕으로 각 서비스에 최적화된 모델을 개발하고 있습니다.

멀티모달 언어모델

멀티모달 언어모델은 언어모델을 기반으로, 이미지, 음성, 영상 등 다양한 모달리티의 입출력을 처리하는 멀티모달 모델입니다. 비전을 뜻하는 Kanana-v , 오디오를 뜻하는 Kanana-a , 그리고 종합적인 옴니를 의미하는 Kanana-o 가 있습니다.

기존의 이미지이해, 음성인식과 합성 등의 개별 모델을 모듈식으로 결합하여 사용했던 구조에서 벗어나, 여러 데이터 형식을 동시에 이해하고 빠르게 결과를 생성하는 강력한 End to End 구조로 개발 중입니다. 현재 개발이 완료된 TAI2TA(Text Audio Image to Text Audio) 구조에서는 어떤 형식의 질문에도 평균 1.6초 이내로 빠르게 음성과 텍스트 형식의 답변을 출력합니다. (데모 보기)

비주얼 생성 모델

GenAI 기반 비주얼 생성 모델은 이미지를 넘어 동영상으로 도메인을 확장하고 있습니다. 주어진 텍스트나 이미지 정보를 기반으로 개인화된 고품질 이미지를 생성하는 Kollage by Kanana 와 다채로운 비디오 콘텐츠를 생성하는 Kinema by Kanana로 구성되어 있습니다. 이때 간단한 마우스 조작만으로 이미지 내 인물의 표정과 자세를 제어하거나, 영상의 카메라 구도와 캐릭터의 움직임을 쉽게 제어할 수 있습니다.

음성모델

음성모델은 사람의 목소리를 이해하여 사람처럼 자연스럽게 듣고, 또 사람처럼 말할 수 있습니다. 실시간 스트리밍 방식의 음성인식을 멀티언어로 지원하는 음성인식 모델 Karve by Kanana 와 풍부한 감정 표현이 가능한 음성합성 모델 Kast by Kanana로 이루어져 있습니다. 특히 Kast by Kanana는 제로샷 방식으로 개발되어 학습 데이터에 없는 새로운 목소리도 쉽게 생성할 수 있습니다.

Kanana 모델의 주요 특징: 고성능, 투명성, 서비스최적화

카나나 모델은 크게 아래와 같은 3가지 특징을 가지고 있습니다.

1. 한국어와 영어 처리에 탁월한 고성능 모델

카나나 모델은 텍스트 이해/추론을 비롯해 이미지이해, 음성 등 다양한 분야의 벤치마크에서 Llama, Qwen 등 글로벌 최고 성능의 SOTA(State-of-the-art) 모델들과 비교해, 평균적으로 영어는 비슷하거나 조금 높은 수준을, 한국어에서는 압도적인 성능을 보여주고 있습니다.

2. 저작권과 개인정보 이슈를 해결한 데이터로 투명하게 학습

저작권과 개인정보 이슈가 해결된 데이터로 학습하여 모델의 투명성을 확보하였습니다. 이를 통해 카카오는 모델이 지속적으로 발전할 수 있는 견고한 기반을 마련함으로써 책임감 있고 신뢰할 수 있는 AI 모델을 만드는 데에 힘쓰고 있습니다.

3. 서비스에 최적화된 비용 효율적인 모델

카나나 모델의 핵심 가치는 단순히 높은 성능이 아니라, 사용자의 문제를 직접적으로 해결해 주는 실용적인 서비스로 연결되는 데에 있습니다. 이에 따라 고성능의 베이스 모델을 기반으로, 각 서비스에 특화된 방향으로 모델의 능력치를 높이기 위한 튜닝 과정을 거칩니다. 서비스에서 요구하는 요약, RAG, Function Calling 등의 태스크에 특화된 전용 모델을 개발함으로써 상대적으로 작은 사이즈의 모델로도 뛰어난 성능을 낼 수 있습니다.

Kanana 모델의 현재와 미래

현재 카나나 모델은 SOTA 레벨의 글로벌 경쟁력을 갖춘 모델을 바탕으로 카카오톡 AI 요약, 톡채널 AI 매니저 등 다양한 카카오 서비스에 최적화된 형태로 적용되었으며, 향후 카나나 앱을 비롯하여 다음, 쇼핑 등 더 많은 서비스 영역으로 확대 적용할 계획입니다.

아직 끝나지 않은 AGI 경쟁에서 카카오는 이 노하우를 바탕으로 더 좋은 성능의 모델을 지속 개발하고, 이를 서비스에 효과적으로 적용해 사용자 가치를 높이고 AI 생태계 발전에 기여하고자 합니다.

앞으로 선보일 카나나 모델 소식에 많은 관심 부탁드리며, 보다 자세한 카나나 모델의 학습과정과 성능은 이어지는 콘텐츠를 통해 확인해 보세요!

관련 글 목록