화자 분리와 소음 억제를 한 번에
- •공유 오디오 표현을 활용해 겹치는 화자와 변화하는 배경 소음을 함께 처리하는 신경망 개발
- •3,000개 혼합 음원에서 0 dB 기준 SI-SNR 개선 15.60 ± 0.10 dB, PESQ 3.02, STOI 0.917 기록
- •TF-GridNet·MossFormer2보다 연산량은 7~11배 적지만 점수는 0.50~0.80 dB 낮은 결과
후난정보기술대학교 연구진이 겹쳐 말하는 화자를 분리하고 변화하는 배경 소음을 억제하는 딥러닝 네트워크를 개발했습니다. 시스템은 하나의 공유 오디오 표현에서 두 작업을 수행하며, 학습 가능한 인코더와 다중 스케일 분리기, 각 분리 음원에 적용하는 소음 억제 모듈, 재구성기로 구성됩니다. 채널 및 시간-주파수 어텐션을 활용하고, 신호 대 잡음비·스펙트럼 크기·지각 가중치를 결합한 세 부분 목표로 종단 간 학습했습니다. 학습 입력에는 신호 대 잡음비가 −5 dB인 오디오도 포함됐습니다.
연구진은 음원 분리에 LibriMix, WHAM!, WHAMR!를, 소음 억제에 VoiceBank-DEMAND와 MUSAN을 사용했고, 음성 이외의 전 대역 오디오는 MUSDB18-HQ로 확인했습니다. 3,000개 혼합 음원과 무작위 시드 3개를 사용하고 동일한 학습 방식으로 재학습한 기준 모델 7개와 비교한 결과, 입력 신호 대 잡음비 0 dB에서 신호 대 잡음비 개선값 15.60 ± 0.10 dB, PESQ 점수 3.02, STOI 점수 0.917을 기록했습니다. 모델은 매개변수 390만 개를 사용했으며 Conv-TasNet, DPRNN, SepFormer, 확산 기반 연속 처리 방식, 분리 후 잡음을 제거하는 처리 파이프라인보다 높은 성능을 보였습니다.
TF-GridNet과 MossFormer2는 점수가 0.50~0.80 dB 높았지만 연산량은 7~11배 많았습니다. 제안된 시스템은 오디오 1초당 곱셈-누산 연산 6.8 G를 사용했고, CPU 코어 1개에서 실시간 계수 0.51을 기록했으며 처리한 오디오 1초당 에너지 0.41 J를 소비했습니다. 스트리밍용 인과 모델은 성능이 1.70 dB 낮아졌습니다. 구성 요소 제거 실험에서는 두 어텐션 경로가 각각 4.50%, 7.10%, 공동 잡음 제거 경로가 10.30%를 기여한 것으로 나타났습니다. 다른 말뭉치, 학습에 없던 언어, 잔향 조건을 적용한 시험에서 성능 손실은 0.70~2.20 dB였고, 잔향 시간이 0.90초를 넘으면 개선값은 7.80 dB로 낮아졌습니다. 연구와 함께 코드, 설정 파일, 발화별 기록도 공개됐습니다.