pile·

카카오톡 AI 에이전트를 위한 온디바이스 모델 최적화 및 적용

kakao tech·if(kakao)25 2025··
#ios#model-optimization#llm#quantization#on-device-ai#mlx#core-ml

챕터별 상세

010:10 – 3:00

서버 LLM을 iPhone 안으로 옮기는 이유

서버 호출 방식은 개인 데이터를 네트워크로 보내야 하고 연결 상태에도 의존하지만, 모바일 성능 향상으로 작은 언어모델을 기기 안에서 직접 실행할 가능성이 커졌다. 배터리·발열·공유 메모리 제약과 학습 환경과 실행 환경이 다른 변환 비용을 고려해, 3B 미만 Kanana 모델을 적절히 양자화하는 전략을 세웠다.