pile·

이미지까지 이해하는 Multimodal LLM의 학습 방법 밝혀내기

kakao tech·if-kakao-2024 ··
#multimodal-llm#vision-language-model#ocr#visual-projector#vqa#data-curation

챕터별 상세

010:10 – 10:01

Image를 이해하는 Language Model

Multimodal LLM은 사진 설명뿐 아니라 OCR, chart 계산, 긴 document 정보 추출과 visual code generation까지 수행한다. Vision feature를 language token과 연결하면서 text 능력을 유지해야 하므로 model architecture, visual token 수와 학습 data 구성이라는 세 가지 축에서 자체 model을 개선한 과정을 설명한다.