NEWS
영어 2인 화자 지원 오픈소스 화자 분리 모델 공개

mocomoco 주식회사는 영어를 지원하는 2인 화자용 화자 분리(Speaker Diarization) 모델을 오픈소스로 공개했습니다. 본 모델은 다음 리포지토리에서 이용하실 수 있습니다.
본 모델과 관련된 연구는 **YANS(음성언어정보처리연구회)**에서 발표될 예정입니다. 모델의 설계 배경과 평가 결과, 향후 전망에 대해 논의하며 학술 및 산업 양면에서의 발전을 도모하고자 합니다. 발표에 대한 자세한 내용은 여기를 참조해 주십시오.
모델의 특징 및 활용
본 모델은 영어 음성에서 두 명의 화자를 자동으로 분리하는 것을 목적으로 개발되었습니다. 기존 모델과 달리, 특징량 추출부터 분리까지 엔드투엔드(End-to-End)로 일관되게 처리합니다. 또한 이전 프레임 정보를 지속적으로 참조하여 화자 ID의 일관성을 유지하므로, 장시간의 음성에서도 메모리 초과 없이 이용 가능합니다.
회의록 작성, 자막 생성, 콜센터 분석 등 폭넓은 응용이 예상됩니다. 아울러 Pyannote 3.1과의 비교 검증 결과도 공개하고 있어, 연구자 및 개발자가 안심하고 사용할 수 있는 투명성 높은 오픈소스입니다.
조건
- 지원 언어: 영어
- 화자 수: 2인 고정
- 베이스 모델: BW-EDA-EEND 기반 구축
- 특징 추출: CPC (Contrastive Predictive Coding)
- 음향 모델링: Conformer 채택
- 추론 형태: 오프라인 (이론상 온라인 처리도 가능)
간단한 실행 방법을 제공하고 있어, Hugging Face Hub에서 직접 로드하여 사용할 수 있습니다.
아키텍처
본 모델에서는 CPC를 통한 특징량 추출을 수행하고, Conformer 기반의 강력한 인코더를 통해 임베딩 표현을 획득합니다. 이를 Transformer 디코더에 입력하고, 선행 연구인 EEND에서 제안된 어트랙터(attractor) 계산을 결합하여 화자 분리를 실현합니다. 더 나아가 과거 프레임의 정보를 이어받음으로써 화자 ID의 일관성을 유지하여, 장시간 음성에서도 안정적인 처리가 가능합니다.

과제
이번에 공개한 모델은 비교적 소량의 데이터로 학습되어, 일반화 성능에는 아직 과제가 남아 있습니다. 높은 정확도로 분리할 수 있는 음원도 있는 반면, 성능이 저하되는 사례도 확인되었습니다. 임베딩 공간을 시각화해 본 결과, 목소리 톤이 비슷한 화자 간의 분리에 한계가 있음이 판명되었습니다.
연구팀에서는 계속해서 해당 과제에 집중하여 더욱 고성능의 모델을 공개할 예정입니다. 향후 업데이트에 많은 기대 부탁드립니다.
(1) 성능이 우수한 음원에서의 시각화

(2) 성능이 저하되는 음원에서의 시각화

향후 전망
앞으로 다음과 같은 방향으로 연구 개발을 진행해 나갈 계획입니다.
- 다화자 지원 모델로의 확장
- 일본어를 포함한 다국어 지원
- 실시간성 추가 향상
- IR·의료 등 특정 영역에 특화된 화자 분리 응용
mocomoco는 연구자 및 개발자에게 열려있는 오픈소스로서, 화자 분리 기술의 발전과 사회적 적용에 기여하겠습니다.
문의 사항은 문의 양식을 통해 남겨주시기 바랍니다.
당사에는 음성 대화 분야에 강점을 가진 연구진이 포진해 있으며, 실용성과 선진성을 겸비한 AI 솔루션을 제공하고 있습니다.
▼ 최첨단 텍스트 변환 및 회의록 AI를 경험해 보세요 https://cloud.mocomoco.ai/sign-up