pile·

눈으로 보고, 귀로 듣고, 입으로 말하는 AI – 통합 멀티모달 언어모델 Kanana-o 개발기

kakao tech·if(kakao)25 2025··
#streaming#llm#vision-language-model#speech#multimodal-ai#audio-codec#model-merging

챕터별 상세

010:10 – 3:57

보고 듣고 말하는 Kanana 모델군

텍스트만 처리하는 LLM에서 이미지·오디오까지 이해하고 여러 형식으로 생성하는 multimodal language model로 범위를 넓힌다. Kanana-v는 이미지와 텍스트를 받아 글로 답하고, Kanana-a는 음성을 이해하고 생성하며, Kanana-o는 세 입력을 하나의 모델에서 종합해 텍스트와 자연스러운 목소리로 응답하는 최종 구조다.