ACL 2022에서 발표된 자연어 처리 논문 12편을 문장 표현, 검색, 대화, 멀티모달 평가 등 주제별로 압축한 리뷰다. 단순 참가 후기가 아니라 각 연구가 풀려는 문제, 제안한 학습 목적과 평가 결과를 기술적으로 비교한다. 당시 팀이 관심을 둔 prompt tuning, contrastive learning, dense retrieval, 대화 평가의 흐름을 한 번에 볼 수 있다.
핵심 포인트- PPT는 사전학습 단계부터 prompt tuning 형태의 과제를 넣어 few-shot prompt 성능의 불안정성을 줄였다.
- ArcCSE와 DCLR은 각각 angular margin·triplet 관계, false negative 제거·noise negative로 문장 표현의 변별력과 공간 균일성을 개선했다.
- Multi-view document representation은 한 문서를 여러 embedding으로 표현해 서로 다른 검색 query가 같은 문서의 다른 의미 측면에 정렬되게 했다.
- TACO는 masked language modeling이 local context에 치우치는 문제를 token-alignment contrastive objective로 보완해 GLUE에서 더 빠르게 수렴했다.
- 대화 연구는 공감 질문의 의도 분류, predicted history 기반 QA 평가, 사용자 감정을 약한 감독 신호로 쓰는 자동 품질 평가를 다뤘다.
- VALSE는 이미지와 문장의 언어 구조를 조작해 vision-language 모델이 객체 존재뿐 아니라 관계 의미까지 이해하는지 검사한다.
상세 정리- Prompt tuning: PPT는 sentence-pair, multiple-choice, single-sentence classification을 사전학습의 next sentence prediction과 비슷한 prompt로 구성했다. 기존 prompt fine-tuning보다 높은 성능을 보였다.
- 문장 표현: ArcCSE는 pair만으로는 다양한 의미 관계를 구분하기 어렵다고 보고 angular space의 decision margin을 키우는 ArcCon loss와 세 문장의 entailment partial order를 함께 학습했다.
- 기억과 일반화: BERT fine-tuning은 fitting, settling, memorization 세 단계로 진행됐다. 레이블이 훼손돼도 성능을 확보할 수 있었지만 few-shot에서는 어려움을 보여 ProtoBERT를 제안했다.
- Dense retrieval: 하나의 document에 여러 query가 대응한다는 점을 반영해 multiple embedding을 만들었다. embedding이 모두 같아지는 것을 막기 위해 global-local loss로 각기 다른 의미 view에 정렬했다.
- Context 학습: MLM의 intra-context similarity가 학습 후반 다시 증가하는 현상을 global context 손실로 해석했다. TACO를 함께 적용하자 GLUE에서 기존 MLM보다 5배 빠르게 수렴하고 평균 1.2점 높았다.
- Fine-tuning 분석: BERT representation을 항상 함께 fine-tuning하는 것이 freeze보다 좋은 것은 아니었다. fine-tuning 후 cluster center 수가 줄고 cluster 간 거리가 커졌으며 상위 layer의 기하 구조 변화가 더 컸다.
- Catastrophic forgetting: 최근 학습 데이터의 loss와 attention이 유리해지는 현상을 확인했다. 서로 다른 데이터로 학습한 여러 teacher에게 distillation을 받는 COKD로 균형을 맞췄다.
- 공감 대화: 500개 대화에 질문의 dialog-act와 dialog-intent를 crowd labeling하고 전체 데이터 자동 labeling 도구를 만들었다. 챗봇이 감정 교류를 이끄는 질문 유형을 분석할 기반을 제공했다.
- 대화형 QA 평가: human-machine과 human-human 대화 분포가 다르고 gold history 평가가 실제 human judgment와 어긋남을 보였다. predicted history에서 해결 가능한 형태로 질문을 다시 쓰는 평가가 사람 판단과 더 일치했다.
- 멀티모달 평가: VALSE는 여섯 언어 구조를 조작해 틀린 image-text pair를 만든다. 모델은 객체 존재는 알지만 객체 관계와 상호작용 의미에는 약하다는 결과가 나왔다.
- 대화 품질: 사용자 다음 발화의 sentiment와 대화 중단을 weak supervision으로 삼아 응답 품질 모델을 학습했다. 사람 레이블과 비교적 높은 상관성을 보였다.
- Debiasing: DCLR은 positive와 유사한 false negative에 낮은 weight를 주고 Gaussian noise negative를 추가했다. STS 성능과 representation space uniformity를 함께 개선했다.
왜 읽나2022년 NLP 연구의 세부 아이디어와 평가 방식을 빠르게 훑고 후속 연구의 출발점을 찾으려는 ML 연구자에게 적합하다.