Papers

효율적인 신경망 기반 오디오 코덱을 위한 잔차 오토인코딩 및 연속형 오토인코더의 잠재 표현 증류

Domestic Conference
2021~
작성자
신재훈
작성일
2026-08-05 17:38
조회
29
Authors : 신재훈, 장인선, 강홍구

Year : 2026

Publisher / Conference : 한국방송·미디어공학회 2026년 하계학술대회

Research area : Audio Signal Processing, Coding

Presentation/Publication date : 2026.06.18

Presentation : Oral

본 논문에서는 심층 신경망 기반 오디오 코덱의 효율적이고 안정적인 학습을 위한 잔차 오토인코딩 구조와 연속형 오토인코더 기반의 증류 학습 기법을 제안한다. 최근 신경망 기반 오디오 코덱은 정교하게 설계된 판별자를 활용한 적대적 생성 신경망을 바탕으로 고효율, 고품질의 압축 성능을 달성하였다. 그러나 생성자의 핵심 구조인 오토인코더 자체의 복원 능력 향상을 위한 구조적 개선에 관한 연구는 상대적으로 부족하다. 본 연구에서는 기존 신경망 기반 오디오 코덱의 주요 합성곱 층에 시간-채널 변환 기반 스킵 연결을 추가하여 잔차 성분 중심의 효율적인 표현 학습이 이루어지도록 하는 잔차 오토인코딩의 도입을 제안한다. 또한 연속형 오토인코더에서 추출한 잠재 표현을 교사 신호로 활용하는 증류 손실을 추가하여, 양자화가 포함된 잔차 오토인코딩 구조의 학습 안정성을 확보하고자 한다. 실험을 통해 잔차 오토인코딩 구조의 도입이 연속형 오토인코더의 복원 성능을 개선하는 것을 입증하였으며, 양자화 모듈과 적대적 생성 신경망을 결합한 학습 환경에서 안정적으로 수렴함을 확인하였다.
전체 386
386 Domestic Conference 김효민, 이지현, 장인선, 강홍구 "사후 의미 증류를 이용한 유한 스칼라 양자화 기반 이단계 음성 토크나이저" in 한국방송·미디어공학회 2026년 하계학술대회, 2026
385 Domestic Conference 신재훈, 장인선, 강홍구 "효율적인 신경망 기반 오디오 코덱을 위한 잔차 오토인코딩 및 연속형 오토인코더의 잠재 표현 증류" in 한국방송·미디어공학회 2026년 하계학술대회, 2026
384 International Conference Jihyun Lee, Jiahao Li, Woojin Chung, Yan Lu, Hong-Goo Kang "AudioSketch: Controllable Image-to-Audio Generation via Semantic-Temporal Energy Modulation" in EUSIPCO, 2026
383 International Conference Sangmin Lee, Woojin Chung, Woongjib Choi, Hong-Goo Kang "MoLGE: Mixture of Language Group Experts for Efficient Scaling of Massively Multilingual Speech Recognition" in Conference On Language Modeling (COLM), 2026
382 International Conference Sangmin Lee, Eekgyun Ahn, Woongjib Choi, Hong-Goo Kang "UR-BERT: Scaling Text Encoders for Massively Multilingual TTS Through Universal Romanization and Speech Token Prediction" in INTERSPEECH, 2026
381 International Conference Seyun Um, Doyeon Kim, Hong-Goo Kang "HANUI: Harnessing Distributional Discrepancies for Singing Voice Deepfake Detection" in in IEEE International Conference on Acoustics, Speech, and Signal Processing (ICASSP), 2026
380 International Conference Miseul Kim, Soo jin Park, Kyungguen Byun, Hyeon-Kyeong Shin, Sunkuk Moon, Shuhua Zhang, Erik Visser "Mitigating Intra-Speaker Variability in Diarization with Style-Controllable Speech Augmentation" in in IEEE International Conference on Acoustics, Speech, and Signal Processing (ICASSP), 2026
379 International Conference Woongjib Choi, Sangmin Lee, Hyungseob Lim, Hong-Goo Kang "UniverSR: Unified and Versatile Audio Super-Resolution via Vocoder-Free Flow Matching" in IEEE International Conference on Acoustics, Speech, and Signal Processing (ICASSP), 2026
378 International Journal Hyeonjin Cha, Seyun Um, Miseul Kim, Changhwan Kim, Seungshin Lee, Hong-Goo Kang "Content-Aware Style Augmentation for Zero-Shot Voice Conversion With Short Target Speech" in IEEE Signal Processing Letters, vol.33, pp.66-70, 2025
377 Domestic Conference 신재훈, 최웅집, 김병현, 장인선, 강홍구 "조건부 플로우 매칭을 활용한 심층 신경망 기반 음성 코덱 향상 기법" in 한국방송·미디어공학회 2025년 하계학술대회, 2025