MAI-Transcribe 2는 Microsoft가 개발한 음성 인식 특화 모델로, 수십 개 언어로 된 오디오 녹음본을 텍스트로 변환해 줍니다. 이 모델은 심한 주변 소음, 다양한 억양, 대화 도중 언어를 바꾸어 말하는 상황처럼 까다로운 일상 속 청취 환경에서도 원활하게 작동하도록 설계되었습니다. 실제로 사용자가 잡음이 섞인 고객센터 통화 내용이나 빠르게 진행되는 회의 대화, 병원 진료 녹음 등을 입력하면, 모델이 서로 다른 화자를 구분하고 단어마다 정확한 시간 정보를 붙여 가며 음성을 텍스트로 옮겨 적어 줍니다. 또한 사용자가 지정한 맞춤형 용어나 업계 핵심 단어를 반영할 수 있어, 전문적인 의학 용어나 기술 용어도 정확하게 기록합니다.
이 모델은 통화 내용 분석을 자동화하거나, 영상 자막을 생성하고, 구두 녹음을 곧바로 활용 가능한 문서로 만들고자 하는 기업과 기관에 적합합니다. 추론, 코딩, 이미지 생성 등 다양한 전용 모델을 아우르는 Microsoft의 MAI 모델 라인업 가운데, MAI-Transcribe 2는 빠르고 오차 없는 텍스트 변환과 정밀한 언어 자동 감지에 집중하고 있습니다.