컴투스플랫폼 AI 개발팀이 게임 서비스 고객 응대 챗봇의 상위·하위 인텐트를 단일 모델로 동시 분류하는 Multi Task Learning(MTL) 아키텍처를 개발한 경험을 공유하는 글이다. PLE 구조, CurricularFace Loss, KcELECTRA를 결합해 기존 KoBERT 앙상블 방식의 한계를 극복하고 분류 성능과 운영 효율성을 함께 개선한 실험 결과를 담고 있다.
핵심 포인트- 기존 KoBERT 앙상블은 상위·하위 인텐트를 별도 모델로 운영해 관리 복잡도가 높고 성능도 제한적이었음
- PLE(Progressive Layered Extraction) 구조로 task-specific Expert 그룹과 shared Expert 그룹을 분리해 음수 전이(Negative Transfer)와 시소 현상을 구조적으로 해결
- CurricularFace Loss를 도입해 학습 단계별로 어려운 샘플에 가중치를 동적 부여, 인텐트 군집 형성의 분별력 향상
- 한국어 대화체 특화 사전학습 모델 KcELECTRA를 백본으로 채택, KoBERT 대비 학습 효율 및 성능 우위 확인
- 2차 실험(CurricularFace 적용) 후 상·하위 인텐트 모두 유의미한 성능 향상, t-SNE 시각화로 클러스터 분리 개선 확인
- 단일 모델로 상·하위 인텐트 동시 추론 달성, 앙상블 대비 관리 포인트 감소와 성능 향상을 동시에 실현
상세 정리- 게임 서비스 고객 응대 자동화가 목표, 상위 인텐트(대분류)와 하위 인텐트(세분류) 동시 분류 구조가 필요
- MTL은 관련 태스크를 하나의 모델이 공유 표현으로 학습, 지식 공유로 일반화 성능 향상을 기대하는 방법론
- PLE: Expert 레이어를 task-specific 그룹과 shared 그룹으로 분리하고 Gate 레이어로 가중 조합, 각 태스크에 최적화된 표현 생성
- 음수 전이(Negative Transfer): MTL에서 태스크 간 간섭으로 오히려 성능이 하락하는 현상, PLE 구조로 완화
- CurricularFace Loss: Margin Loss와 Mining Loss를 결합, 학습 초기에는 쉬운 샘플부터 시작해 점진적으로 어려운 샘플 비중 증가
- KcELECTRA: 한국어 대화체 코퍼스로 사전학습된 ELECTRA 계열 모델, Generator-Discriminator 구조로 BERT 대비 효율적 학습
- 1차 실험: 상위 인텐트 성능 기존 상용 모델 대비 개선 확인, 하위 인텐트는 추가 개선 필요
- 2차 실험: CurricularFace Loss 적용 후 상·하위 인텐트 분류 모두 유의미한 성능 향상
- t-SNE 시각화에서 인텐트 표현이 더 잘 분리된 클러스터를 형성함을 확인, 모델 분별력 향상을 시각적으로 검증
- 최종 모델: 단일 모델로 상·하위 인텐트 동시 추론, 기존 앙상블 대비 관리 포인트 감소 및 성능 향상 동시 달성
왜 읽나한국어 실서비스 챗봇에서 MTL과 Metric Learning을 결합한 실험 사례를 구체적인 아키텍처 선택 근거와 성능 수치로 확인할 수 있다.