AI 비교AI 찾기AI 뉴스AI 활용
회사 소개
개인정보처리방침이용약관FAQ문의하기문의하기
에이아이비 주식회사사업자정보
© 2026 AIB Inc.

OpenMOSS, MOSS-TTS-Local-Transformer v1.5 공개

OpenMOSS, MOSS-TTS-Local-Transformer v1.5 공개

LMSYS·2026년 6월 19일 (금)
  • •OpenMOSS와 SGLang-Omni가 MOSS-TTS-Local-Transformer-v1.5 모델의 엔드투엔드 서빙을 지원한다.
  • •해당 모델은 31개 언어, 음성 복제, 최대 10분 길이의 음성 합성을 48kHz 품질로 제공한다.
  • •콘텐츠 주소 지정 캐싱과 CUDA Graphs 도입을 통해 내부 테스트 기준 처리량이 32.0% 증가했다.
  • •OpenMOSS와 SGLang-Omni가 MOSS-TTS-Local-Transformer-v1.5 모델의 엔드투엔드 서빙을 지원한다.
  • •해당 모델은 31개 언어, 음성 복제, 최대 10분 길이의 음성 합성을 48kHz 품질로 제공한다.
  • •콘텐츠 주소 지정 캐싱과 CUDA Graphs 도입을 통해 내부 테스트 기준 처리량이 32.0% 증가했다.

OpenMOSS와 SGLang-Omni 팀은 48kHz 스테레오 음성을 지원하는 오픈소스 텍스트 음성 변환(TTS) 모델인 MOSS-TTS-Local-Transformer-v1.5의 엔드투엔드 서빙 기능을 공개했다. 이 모델은 31개 언어에 걸친 다국어 생성과 제로샷 음성 복제, 발화 길이 제어 및 최대 10분 분량의 장문 합성을 지원한다. 구조적으로는 Qwen3-4B 자기회귀 기반 모델과 2B 파라미터 규모의 신경망 오디오 토크나이저를 채택했다.

해당 모델의 서빙은 참조 오디오 인코딩, 자기회귀 생성, 상태 유지 보코더 디코딩 등 다단계 처리가 필요하여 기술적 난도가 높다. 이를 해결하기 위해 개발진은 계산 패턴과 단계별 라우팅, GPU 메모리 할당을 각 구성 요소에 맞춰 최적화하는 SGLang-Omni 3단계 파이프라인을 구현했다.

최적화 작업은 성능 지표 향상으로 이어졌다. 참조 오디오에 콘텐츠 주소 지정 LRU 캐시를 적용한 결과, 16개 클라이언트 동시 접속 환경의 SeedTTS 영어 평가에서 처리량은 32.0% 증가했고 평균 지연 시간은 24.3% 단축되었다. 또한 프레임 단위 샘플링 루프와 보코더 단계에 CUDA Graphs를 사용하여 실행 오버헤드를 줄였으며, 보코더 단계는 4프레임 스트리밍 청크 기준 기존 대비 2.20배의 속도 향상을 기록했다.

SeedTTS 영어 데이터셋(1,088개 샘플) 기반의 엔드투엔드 테스트 결과, 비스트리밍 모드에서는 5.976 req/s의 처리량과 1.75%의 단어 오류율(WER)을 보였다. 스트리밍 모드에서는 2.909 req/s와 2.14% WER을 기록했다. 연구진은 향후 적응형 스트리밍 스케줄링 도입과 풀 기반 CUDA Graphs 최적화, 벤치마크 언어 및 실사용 환경 확장에 주력할 계획이다.

OpenMOSS와 SGLang-Omni 팀은 48kHz 스테레오 음성을 지원하는 오픈소스 텍스트 음성 변환(TTS) 모델인 MOSS-TTS-Local-Transformer-v1.5의 엔드투엔드 서빙 기능을 공개했다. 이 모델은 31개 언어에 걸친 다국어 생성과 제로샷 음성 복제, 발화 길이 제어 및 최대 10분 분량의 장문 합성을 지원한다. 구조적으로는 Qwen3-4B 자기회귀 기반 모델과 2B 파라미터 규모의 신경망 오디오 토크나이저를 채택했다.

해당 모델의 서빙은 참조 오디오 인코딩, 자기회귀 생성, 상태 유지 보코더 디코딩 등 다단계 처리가 필요하여 기술적 난도가 높다. 이를 해결하기 위해 개발진은 계산 패턴과 단계별 라우팅, GPU 메모리 할당을 각 구성 요소에 맞춰 최적화하는 SGLang-Omni 3단계 파이프라인을 구현했다.

최적화 작업은 성능 지표 향상으로 이어졌다. 참조 오디오에 콘텐츠 주소 지정 LRU 캐시를 적용한 결과, 16개 클라이언트 동시 접속 환경의 SeedTTS 영어 평가에서 처리량은 32.0% 증가했고 평균 지연 시간은 24.3% 단축되었다. 또한 프레임 단위 샘플링 루프와 보코더 단계에 CUDA Graphs를 사용하여 실행 오버헤드를 줄였으며, 보코더 단계는 4프레임 스트리밍 청크 기준 기존 대비 2.20배의 속도 향상을 기록했다.

SeedTTS 영어 데이터셋(1,088개 샘플) 기반의 엔드투엔드 테스트 결과, 비스트리밍 모드에서는 5.976 req/s의 처리량과 1.75%의 단어 오류율(WER)을 보였다. 스트리밍 모드에서는 2.909 req/s와 2.14% WER을 기록했다. 연구진은 향후 적응형 스트리밍 스케줄링 도입과 풀 기반 CUDA Graphs 최적화, 벤치마크 언어 및 실사용 환경 확장에 주력할 계획이다.

원문 보기 (영어)·2026년 6월 17일
#tts#speech synthesis#voice cloning#sglang omni#cuda graphs