pile·
AI / ML·스캐터랩스캐터랩 (이루다)·

지속 학습: 꾸준히 성장하는 모델을 만드는 기술

데이터 분포와 태스크가 계속 바뀌는 환경에서 새 지식을 배우면서 기존 지식을 잊는 catastrophic forgetting을 줄이는 지속 학습 방법을 분류한다. 정규화, rehearsal, memory constraint, 모델 구조 확장, knowledge distillation의 작동 원리와 대표 연구를 비교하고 조합 전략의 중요성을 짚는다.

핵심 포인트
  • 단순 L2 정규화는 모든 weight 변화를 똑같이 막아 과거·현재 태스크 모두 제대로 수렴하지 못할 수 있다.
  • EWC는 Fisher information으로 중요한 파라미터 방향을 근사해 과거 지식을 보존하면서 새 태스크에 적응한다.
  • Rehearsal은 과거 예제를 현재 학습에 섞고, Memory 방법은 과거 예제로 gradient나 추론 적응에 제약을 건다.
  • Architectural 방법은 태스크·도메인별 adapter나 파라미터를 늘려 지식을 분리하고 적절한 모듈을 선택한다.
  • Replay와 distillation을 함께 쓴 방법이 지속적인 언어 모델 사전 학습에서 가장 효과적이었다.
상세 정리
  • 문제 정의: 연속 데이터에서는 분포나 태스크가 변하며 현재 데이터만 학습하면 기존 능력이 사라진다. 목표는 망각을 최소화하면서 변화에 적응하는 것이다.
  • L2 한계: 이전 weight에서 멀어지지 못하게 하는 단순 penalty는 태스크별로 중요한 방향을 구분하지 않아 양쪽 학습을 모두 방해한다.
  • EWC: 파라미터 변화율과 중요도를 고려하는 second-order 정보를 사용한다. 직접 계산 비용이 커 Fisher information matrix로 근사한다.
  • Rehearsal 원리: memory bucket에 과거 태스크 예제를 저장하고 새 데이터와 함께 다시 학습해 이전 결정 경계를 유지한다.
  • iCaRL: class가 늘어나는 환경에서 feature 평균에 가까운 대표 예제를 memory에 넣고 nearest mean of exemplar로 분류한다.
  • 단순 replay의 가치: 정교한 선별 없이 과거 예제를 무작위 저장하는 방식도 망각 완화에 효과적이며 여러 후속 방법의 보조 기법으로 쓰인다.
  • GEM 제약: 현재 gradient와 memory gradient의 각이 90도 이상 벌어지지 않게 해 과거 loss가 증가하지 않도록 한다. Quadratic Programming으로 가장 가까운 허용 gradient를 찾는다.
  • Sparse Experience Replay: 새 샘플 1만 개마다 memory 100개로 모델을 갱신해 학습 비용을 통제하면서 과거 지식을 되살린다.
  • Local Adaptation: 추론 시 BERT 표현으로 테스트 샘플과 가까운 memory K개를 찾고 잠시 fine-tuning한 뒤 예측한다.
  • Adapter 방식: task-oriented dialogue에 새 도메인이 생길 때 Transformer 각 layer에 residual fully connected adapter를 추가한다.
  • 모듈 선택: 추론 시 도메인을 모르면 adapter별 perplexity를 uncertainty로 보고 적절한 adapter를 고른다.
  • ELLE 구조 확장: 새 정보를 받을 때 function-preserved model expansion으로 파라미터를 늘려 기존 기능을 보존한다.
  • 지식 자극: Pre-trained Domain Prompts로 사전 학습된 여러 도메인 지식 중 downstream 태스크에 맞는 부분을 선택한다.
  • Distillation: 이전 checkpoint를 teacher로 두고 student가 새 태스크를 배우면서 teacher의 hidden knowledge도 따라 하게 한다.
  • 조합 결과: 지속 사전 학습 연구에서 adapter, replay, distillation을 비교한 결과 replay memory와 distillation의 결합이 OOD 적응과 지식 보존에 가장 효과적이었다.
왜 읽나지속적으로 업데이트되는 NLP·추천 모델에서 망각을 줄이기 위해 데이터, loss, gradient, 모델 구조 중 어디를 제어할지 선택하는 기준을 얻을 수 있다.
스캐터랩
스캐터랩 (이루다) 블로그
원문은 여기서 이어서 읽을 수 있어요
원문 읽기
읽음 (0)

이 글과 비슷한

  1. AI / ML·LY CorporationLY Corporation·

    Grafana에서 자연어로 장애 원인을 분석하기: LLM 에이전트 기반 SRELens 개발기

    LY Corporation Home SRE 팀이 장애 분석 시 메트릭·로그·트레이스가 각각 다른 화면에 흩어져 있는 문제를 해결하기 위해 Grafana 플러그인 SRELens를 개발했다. SRELens는 LLM 에이전트가 자연어 질의를 받아 실제 관측성 데이터를 조회하고, 근거와 함께 장애 원인 후보를 정리해 주는 도구다. LGTM-P 스택(Loki·Grafana·Tempo·Mimir·Pyroscope)과 FlavaMCP 게이트웨이를 통합해 단일 채팅 인터페이스에서 멀티시그널 분석이 가능하다.

    #llm-app#mcp#observability+2