pile·
AI / ML·컴투스컴투스·

Multi Task Learning 기반 챗봇 모델 개발

컴투스플랫폼 AI 개발팀이 게임 서비스 고객 응대 챗봇의 상위·하위 인텐트를 단일 모델로 동시 분류하는 Multi Task Learning(MTL) 아키텍처를 개발한 경험을 공유하는 글이다. PLE 구조, CurricularFace Loss, KcELECTRA를 결합해 기존 KoBERT 앙상블 방식의 한계를 극복하고 분류 성능과 운영 효율성을 함께 개선한 실험 결과를 담고 있다.

핵심 포인트
  • 기존 KoBERT 앙상블은 상위·하위 인텐트를 별도 모델로 운영해 관리 복잡도가 높고 성능도 제한적이었음
  • PLE(Progressive Layered Extraction) 구조로 task-specific Expert 그룹과 shared Expert 그룹을 분리해 음수 전이(Negative Transfer)와 시소 현상을 구조적으로 해결
  • CurricularFace Loss를 도입해 학습 단계별로 어려운 샘플에 가중치를 동적 부여, 인텐트 군집 형성의 분별력 향상
  • 한국어 대화체 특화 사전학습 모델 KcELECTRA를 백본으로 채택, KoBERT 대비 학습 효율 및 성능 우위 확인
  • 2차 실험(CurricularFace 적용) 후 상·하위 인텐트 모두 유의미한 성능 향상, t-SNE 시각화로 클러스터 분리 개선 확인
  • 단일 모델로 상·하위 인텐트 동시 추론 달성, 앙상블 대비 관리 포인트 감소와 성능 향상을 동시에 실현
상세 정리
  • 게임 서비스 고객 응대 자동화가 목표, 상위 인텐트(대분류)와 하위 인텐트(세분류) 동시 분류 구조가 필요
  • MTL은 관련 태스크를 하나의 모델이 공유 표현으로 학습, 지식 공유로 일반화 성능 향상을 기대하는 방법론
  • PLE: Expert 레이어를 task-specific 그룹과 shared 그룹으로 분리하고 Gate 레이어로 가중 조합, 각 태스크에 최적화된 표현 생성
  • 음수 전이(Negative Transfer): MTL에서 태스크 간 간섭으로 오히려 성능이 하락하는 현상, PLE 구조로 완화
  • CurricularFace Loss: Margin Loss와 Mining Loss를 결합, 학습 초기에는 쉬운 샘플부터 시작해 점진적으로 어려운 샘플 비중 증가
  • KcELECTRA: 한국어 대화체 코퍼스로 사전학습된 ELECTRA 계열 모델, Generator-Discriminator 구조로 BERT 대비 효율적 학습
  • 1차 실험: 상위 인텐트 성능 기존 상용 모델 대비 개선 확인, 하위 인텐트는 추가 개선 필요
  • 2차 실험: CurricularFace Loss 적용 후 상·하위 인텐트 분류 모두 유의미한 성능 향상
  • t-SNE 시각화에서 인텐트 표현이 더 잘 분리된 클러스터를 형성함을 확인, 모델 분별력 향상을 시각적으로 검증
  • 최종 모델: 단일 모델로 상·하위 인텐트 동시 추론, 기존 앙상블 대비 관리 포인트 감소 및 성능 향상 동시 달성
왜 읽나한국어 실서비스 챗봇에서 MTL과 Metric Learning을 결합한 실험 사례를 구체적인 아키텍처 선택 근거와 성능 수치로 확인할 수 있다.
컴투스
컴투스 블로그
원문은 여기서 이어서 읽을 수 있어요
원문 읽기
읽음 (0)

이 글과 비슷한

  1. AI / ML·stackoverflow-blogStack Overflow Blog·

    에이전틱 SDLC를 QA 엔지니어링 마인드셋으로 구축하기

    Motorola Solutions의 테스트 엔지니어링 선임 매니저 Suneet Malhotra가 Stack Overflow 팟캐스트에 출연해 MCP(Model Context Protocol) 기반 에이전틱 SDLC 파이프라인 구축과 LLM-as-judge 평가 방법론을 소개했다. QA 엔지니어링 관점을 소프트웨어 개발 생애 전반에 적용하고, 설계 단계 직후 스펙을 강화해 결함 비용을 줄이는 'QA shift-left' 접근을 다룬다.

    요약 이어보기
    #llm-agent#mcp#test-automation+2
  2. AI / ML·LINE EngineeringLINE Engineering·

    보안 업무를 위한 AI 에이전트 플랫폼 「SAGE」 개발기 1편: 판단은 사람에게 남기는 설계

    LY Corporation Security Development Division이 보안 업무용 AI 에이전트 플랫폼 SAGE의 개발 과정을 공개했다. "완전 자동화"와 "도입 미루기" 양 극단 사이에서 "판단은 사람에게 남기는 설계"를 핵심 원칙으로 삼고, 3단계 점진적 도입 전략(AI 보조→에이전트 협업→자동화)을 채택했다. 현재는 1단계를 중심으로 파일럿·실운영 중이다.

    요약 이어보기
    #llm-app#opensearch#mcp+2