Papers

조건부 플로우 매칭을 활용한 심층 신경망 기반 음성 코덱 향상 기법

Domestic Conference
2021~
작성자
신재훈
작성일
2025-09-23 16:55
조회
1601
Authors : 신재훈, 최웅집, 김병현, 장인선, 강홍구

Year : 2025

Publisher / Conference : 한국방송·미디어공학회 2025년 하계학술대회

Research area : Speech Signal Processing, Coding

Presentation/Publication date : 2025.06.22

Presentation : Oral

본 논문에서는 신호처리 기반 음성 코덱의 낮은 비트전송률에서의 복원 품질을 향상하기 위해 조건부 플로우 매칭 기반의 후처리 필터를 적용하고 그 효과를 확인한다. 최근 확산 기반 생성 모델을 활용하여 오디오 코덱의 손실 압축으로 인해 왜곡된 신호의 품질을 향상하는 연구가 이루어지고 있으나, 주로 신경망 기반 오디오 코덱에 편중되어 있으며 기존 상용 코덱에 대한 적용 사례는 부족하다. 본 연구에서는 플로우 매칭 기반 생성 모델을 신호처리 기반 음성 코덱의 후처리 필터로 적용하여, 낮은 비트전송률에서도 높은 비트전송률의 복원 품질에 준하는 품질 개선을 달성하고자 한다. 또한, 품질 개선 폭을 최대한 유지하면서 연산량의 효율성을 확보하기 위한 경량화 방법을 탐구하였으며, 실험을 통해 제안한 방법의 타당성을 확인하였다.
전체 381
381 International Conference Seyun Um, Doyeon Kim, Hong-Goo Kang "HANUI: Harnessing Distributional Discrepancies for Singing Voice Deepfake Detection" in in IEEE International Conference on Acoustics, Speech, and Signal Processing (ICASSP), 2026
380 International Conference Miseul Kim, Soo jin Park, Kyungguen Byun, Hyeon-Kyeong Shin, Sunkuk Moon, Shuhua Zhang, Erik Visser "Mitigating Intra-Speaker Variability in Diarization with Style-Controllable Speech Augmentation" in in IEEE International Conference on Acoustics, Speech, and Signal Processing (ICASSP), 2026
379 International Conference Woongjib Choi, Sangmin Lee, Hyungseob Lim, Hong-Goo Kang "UniverSR: Unified and Versatile Audio Super-Resolution via Vocoder-Free Flow Matching" in IEEE International Conference on Acoustics, Speech, and Signal Processing (ICASSP), 2026
378 International Journal Hyeonjin Cha, Seyun Um, Miseul Kim, Changhwan Kim, Seungshin Lee, Hong-Goo Kang "Content-Aware Style Augmentation for Zero-Shot Voice Conversion With Short Target Speech" in IEEE Signal Processing Letters, vol.33, pp.66-70, 2025
377 Domestic Conference 신재훈, 최웅집, 김병현, 장인선, 강홍구 "조건부 플로우 매칭을 활용한 심층 신경망 기반 음성 코덱 향상 기법" in 한국방송·미디어공학회 2025년 하계학술대회, 2025
376 International Conference Miseul Kim, Seyun Um, Hyeonjin Cha, Hong-Goo Kang "SpeechMLC: Speech Multi-Label Classification" in INTERSPEECH, 2025
375 International Conference Sangmin Lee, Woojin Chung, Seyun Um, and Hong-Goo Kang "UniCoM: A Universal Code-Switching Speech Generator" in EMNLP Findings, 2025
374 International Conference Woongjib Choi, Byeong Hyeon Kim, Hyungseob Lim, Inseon Jang, Hong-Goo Kang "Neural Spectral Band Generation for Audio Coding" in INTERSPEECH, 2025
373 International Conference Jihyun Kim, Doyeon Kim, Hyewon Han, Jinyoung Lee, Jonguk Yoo, Chang Woo Han, Jeongook Song, Hoon-Young Cho, Hong-Goo Kang "Quadruple Path Modeling with Latent Feature Transfer for Permutation-free Continuous Speech Separation" in INTERSPEECH, 2025
372 International Conference Byeong Hyeon Kim,Hyungseob Lim,Inseon Jang,Hong-Goo Kang "Towards an Ultra-Low-Delay Neural Audio Coding with Computational Efficiency" in INTERSPEECH, 2025