Papers

Effective Spectral and Excitation Modeling Techniques for LSTM-RNN-Based Speech Synthesis Systems

International Journal
2016~2020
작성자
이진영
작성일
2017-11-01 22:07
조회
3088
Authors : Eunwoo Song, Frank K. Soong, Hong-Goo Kang

Year : 2017

Publisher / Conference : IEEE/ACM Transactions on Audio, Speech, and Language Processing

Volume : 25, issue 11

Page : 2152-2161

In this paper, we report research results on modeling the parameters of an improved time-frequency trajectory excitation (ITFTE) and spectral envelopes of an LPC vocoder with a long short-term memory (LSTM)-based recurrent neural network (RNN) for high-quality text-to-speech (TTS) systems. The ITFTE vocoder has been shown to significantly improve the perceptual quality of statistical parameter-based TTS systems in our prior works. However, a simple feed-forward deep neural network (DNN) with a finite window length is inadequate to capture the time evolution of the ITFTE parameters. We propose to use the LSTM to exploit the time-varying nature of both trajectories of the excitation and filter parameters, where the LSTM is implemented to use the linguistic text input and to predict both ITFTE and LPC parameters holistically. In the case of LPC parameters, we further enhance the generated spectrum by applying LP bandwidth expansion and line spectral frequency-sharpening filters. These filters are not only beneficial for reducing unstable synthesis filter conditions but also advantageous toward minimizing the muffling problem in the generated spectrum. Experimental results have shown that the proposed LSTM-RNN system with the ITFTE vocoder significantly outperforms both similarly configured band aperiodicity-based systems and our best prior DNN-trainecounterpart, both objectively and subjectively.
전체 370
49 Domestic Conference 양해민, 강홍구 "잡음 예측을 위한 심층 신경망기반 음성 존재 확률 계산법" in 대한전자공학회 추계학술대회, 2017
48 Domestic Conference 오상신, 정수환, 강홍구 "음성 인식 기반의 방송미디어 디바이스 제어 및 편집 시스템 구현" in 대한전자공학회 추계학술대회, 2017
47 Domestic Conference 김정규, 박영철, 강홍구 "저사양 TV 사운드 설계환경을 위한 IIR 필터 기반 주파수 등화기" in 대한전자공학회 학술대회, 2017
46 Domestic Conference 양해민, 변경근, 강홍구 "RTCP를 이용한 심층 신경망 기반 음질평가 점수 대역 분별 알고리즘" in 한국음향학회 춘계학술대회, 2016
45 Domestic Conference 김글빛, 이진규, 강홍구 "문장종속 화자검증 시스템을 위한 비음수 행렬 분해 기반 잡음 제거" in 한국음향학회 춘계학술대회, 2016
44 Domestic Conference 김진섭, 주영선, 강홍구(연세대학교), 장인선, 안충현(한국전자통신연구원) "음향 모델 성능 개선을 위한 피치 동기화 기반의 DNN-TTS 시스템" in 한국음향학회 춘계학술대회, 2016
43 Domestic Conference 변경근, 서지호, 강홍구 "스펙트로그램의 양방향 상관계수를 이용한 음질 개선" in 한국음향학회 추계학술발표대회, 2013
42 Domestic Conference 강현주, 문현기, 강홍구 "잡음 제거와 하모닉 강화 알고리듬을 이용한 통합 음질 개선 기술" in 한국음향학회 추계학술발표대회, 2013
41 Domestic Conference 이태규, 이지석, 강홍구 "스펙트럼과 통계적 모델링을 통한 음질 개선" in 한국음향학회 추계학술발표대회, 2013
40 Domestic Journal 이정인, 최정윤, 강홍구 "음성감정인식에서 음색 특성 및 영향 분석" in 방송공학회논문지, vol.18, 제 5호, pp.771-774, 2013