pile·

[NHN FORWARD 2021] Non-Autoregressive 구조의 한국어 TTS 개발기

NHN Cloud·nhn-forward-2021 ··
#transformer#tts#speech-synthesis#deep-learning#fastspeech2#voice-cloning

챕터별 상세

010:11 – 4:57

Autoregressive TTS에서 병렬 생성으로

End-to-end TTS를 text에서 acoustic feature를 만드는 acoustic model과 waveform을 생성하는 vocoder로 나눈다. Tacotron은 이전 frame을 입력해 다음 frame을 순차 생성해 느리고 attention 실패가 뒤로 전파된다. Non-Autoregressive model은 전체 sequence를 한 번에 추론해 속도가 빠르고 반복 오류가 적으며, model 안에서 speed·pitch를 조절할 수 있다는 장점을 설명한다.