pile·

LLM으로 음성인식 성능 개선하기

kakao tech·if-kakao-2024 ··
#inference-optimization#knowledge-distillation#llm#multitask-learning#speech-recognition#end-to-end-asr

챕터별 상세

010:10 – 1:40

LLM 언어 능력을 ASR에 옮기기

End-to-end ASR은 음성을 text로 직접 변환하지만 decoder의 언어 이해가 제한돼 동음이의어나 긴 문맥에서 오류가 난다. 큰 LLM decoder를 사용하면 정확도는 좋아져도 parameter·latency·비용이 급증한다. 발표는 LLM의 지식을 작은 기존 decoder에 전이해 runtime 부담 없이 성능을 높이는 방법을 다룬다.