ACL 2020의 자연어 처리 연구를 학회 통계와 24편의 논문 리뷰로 정리한 글이다. 빠른 Transformer 추론, 대화 응답의 불확실성, 언어 생성 평가, 희귀 단어, 대화 관계 추출, 멀티태스크 대화 에이전트 등 폭넓은 주제를 각 연구의 문제·방법·결과 순으로 압축한다. 모델 크기를 키우는 흐름 속에서 효율과 데이터 품질, 실제 대화 성능을 어떻게 검증할지가 공통 질문으로 드러난다.
핵심 포인트- DeFormer는 질문과 문서 사이의 상호작용이 필요 없는 Transformer 층을 미리 계산해 질의응답 추론 속도를 높였다.
- 대화 응답 검색 연구는 정답이 후보에 없을 가능성을 별도 확률로 모델링해 강제로 틀린 답을 고르는 문제를 줄였다.
- BLEURT와 복수 대화 평가 지표는 BLEU·ROUGE처럼 사람 판단과 잘 맞지 않는 생성 평가를 학습 기반 메트릭으로 보완했다.
- BERTRAM은 형태 n-gram과 문맥을 결합해 BERT·RoBERTa의 희귀 단어 표현을 개선했고, BPE-dropout은 subword 분절을 확률적으로 다양화했다.
- 모델 효율 연구는 BERT 구조 프루닝, 선택적 attention head, 단일 모델 pseudo-ensemble, 반복 추론 없는 텍스트 오토인코더를 탐색했다.
- 대화 연구는 지식 그래프 기반 생성, DialogRE 관계 추출, 12개 과제를 함께 푸는 대화 에이전트 등 실제 상호작용에 필요한 능력을 확장했다.
상세 정리- 학회 흐름: 글은 ACL의 논문 수와 합격률, 키워드 변화를 먼저 보고 개별 연구를 연결한다. 단순 참가 후기가 아니라 팀이 주목한 모델 효율·표현 학습·대화 생성을 중심으로 선별했다.
- 빠른 질의응답: DeFormer는 질문과 문서가 서로 보지 않아도 되는 층을 분리해 문서 표현을 사전 계산한다. 정확도 손실을 작게 유지하면서 추론 속도를 높였다.
- 테이블 문장 생성: 논리식을 중간 표현으로 두어 오픈도메인 테이블에서 사실에 맞는 문장을 생성한다. end-to-end 생성이 구조적 정보를 놓치는 문제를 완화하려는 접근이다.
- 응답 불확실성: retrieval 대화 모델은 후보 집합에 정답이 없는데도 하나를 선택해야 한다. 별도의 none-of-the-above 확률을 학습해 잘못된 확신을 측정한다.
- 대화 상태 추적: 전체 메모리를 매 턴 다시 쓰는 대신 바뀐 슬롯만 선택적으로 덮어쓴다. 긴 대화에서 이전 상태를 유지하면서 필요한 정보만 갱신한다.
- 생성 평가: 오픈도메인 대화는 가능한 정답이 많아 단일 참조 문장과의 일치도가 사람 평가와 어긋난다. 문맥 일관성, 유창성, 다양성, 자기모순 여부를 함께 사용해 상관성을 높였다.
- 희귀 단어: BERTRAM은 n-gram 형태 정보와 사전학습 BERT의 문맥을 attention mimicking으로 결합해 새 임베딩을 만든다. 희귀 단어가 포함된 MNLI·AGNews·DBPedia 변형 평가에서 기준 모델을 개선했다.
- 구조 압축: schuBERT는 레이어 수와 폭을 임의로 줄이는 대신 세분화된 구조 후보를 프루닝으로 탐색한다. 같은 파라미터 예산의 일반 축소 모델보다 높은 성능을 얻었다.
- 대화 생성과 지식: 상식 지식 그래프를 따라 대화 주제를 이동하는 모델은 Reddit 평가에서 seq2seq를 넘고 GPT-2보다 70% 적은 파라미터로 더 나은 결과를 냈다.
- 도메인 선택: 사전학습 모델 내부 표현이 감독 없이 데이터 도메인을 군집화한다는 점을 활용해 작은 in-domain 샘플과 가까운 문장을 고른다. 기계번역 데이터 선택에서 기존 방법보다 나은 결과를 보였다.
- Subword 정규화: BPE-dropout은 merge 후보를 확률적으로 건너뛰어 한 단어를 여러 subword 배열로 보여준다. 기계번역에서 표준 BPE보다 2.3 BLEU, 기존 Unigram-LM 정규화보다 0.9 BLEU 높았다.
- 대화 관계 추출: DialogRE는 1,788개 대화와 10,168개 관계 triplet, 36개 관계 유형을 제공한다. 턴별 precision과 recall로 관계 정보가 대화 중 언제 드러나는지도 평가한다.
- 표현 속도: Transformer 기반 텍스트 오토인코더는 반복 추론 없이 양방향 문맥 표현을 계산한다. reranking에서 6배, 의미 유사도에서 12배 빠르면서 BERT와 비슷하거나 더 높은 정확도를 보였다.
- 멀티태스크 에이전트: dodecaDialogue는 성격, 공감, 질문, 외부 지식, 이미지 이해 등 12개 대화 능력을 함께 평가하고 학습한다. 큰 멀티태스크 데이터가 단일 에이전트의 범용성을 높일 수 있음을 보였다.
- Attention 해석: attention weight만 보면 특수 토큰 영향이 과장될 수 있다. value vector의 norm까지 함께 계산하자 실제 출력 기여도가 작다는 점이 드러나 해석 방법의 주의를 요구한다.
왜 읽나2020년 NLP 연구를 효율·검색·생성 평가·대화 시스템이라는 구현 관점에서 빠르게 훑으려는 ML 연구자에게 좋은 지도 역할을 한다.