Characterization of Deep Learning-Based Speech-Enhancement Techniques in Online Audio Processing Applications
Tema
Aprendizaje automático (Machine learning)
Fecha de publicación
29-abr-2023
Editor
Sensors
Descripción física
Artículo académico que analiza técnicas de mejora de voz basadas en deep learning en el contexto de procesamiento de audio en línea, donde los modelos procesan segmentos sucesivos de audio en lugar de grabaciones completas. Aunque la mayoría de las evaluaciones previas se han realizado en escenarios fuera de línea, este trabajo es el primero en medir el rendimiento en tiempo real, considerando métricas como el índice señal-interferencia (SIR), el tiempo de respuesta y el uso de memoria. Se evalúan tres modelos populares (MetricGAN+, Spectral Feature Mapping with Mimic Loss y Demucs-Denoiser) bajo diferentes condiciones de ruido, interferencias y reverberación.