LTX, 세계 모델 LTX-2.5 공개
- •LTX가 오픈웨이트 세계 모델 LTX-2.5를 2026년 8월 11일 공개했다
- •네이티브 다중 쇼트 생성, 4K HDR, Gemma 4 12B 채택을 지원한다
- •22B 풀 모델과 증류 모델을 Hugging Face에 공개하고, 연 매출 1000만 달러 기준을 적용한다
LTX는 2026년 8월 11일 오픈웨이트 세계 모델 최신판 LTX-2.5를 공개했다. 이 모델은 영상과 음성 생성, 실시간 생성, 로보틱스 활용을 염두에 둔 모델이며, 네이티브 다중 쇼트 생성, 4K HDR 지원, 프롬프트 이해 강화가 포함됐다. 모델 가중치는 Hugging Face에 공개됐고, ComfyUI도 공개 첫날부터 지원했다.
LTX-2.5에서는 생성 파이프라인의 상당 부분이 재구축됐으며, 새로운 Diffusion Video Decoder(영상 복원용 생성 구성요소)가 도입됐다. 움직임이 큰 장면에서 발생하는 영상 붕괴를 줄이고 얼굴과 질감 같은 디테일을 개선하려는 목적이다. 기존 모델은 기본적으로 하나의 연속 쇼트를 생성했지만, LTX-2.5는 여러 컷으로 구성된 장면을 한 번에 생성할 수 있으며 컷이 바뀌어도 인물, 배경, 조명, 목소리, 영상 스타일의 일관성을 유지하는 것을 목표로 한다.
텍스트 인코더에는 LTX에 맞춰 조정한 Gemma 4 12B를 채택했다. 여러 인물, 카메라워크, 조명, 동작 등을 포함한 복잡한 프롬프트를 따르는 성능을 높였고, 짧은 지시를 더 상세한 영상 생성용 프롬프트로 확장하는 기능도 갖췄다. 장면의 복잡도에 따라 계산 자원을 배분하는 Diffusion Fidelity Rendering, 프롬프트에서 적절한 영상 길이를 예측하는 자동 듀레이션 기능, 네이티브 4K HDR, RAW 워크플로도 지원한다. 공식 모델 페이지는 기존보다 적은 계산량으로 풀 모델에 가까운 품질을 목표로 한 증류 모델도 제공한다고 밝혔다.
Hugging Face에는 22B 풀 모델과 증류 모델이 공개돼 있다. 사용자는 자체 환경 등에서 모델을 실행할 수 있으며, 자체 데이터를 이용한 파인튜닝도 가능하다. 공식 GitHub의 LTX-2 저장소에는 Python 기반 추론 환경과 LoRA(저비용 추가 학습 기법) 학습 환경도 공개돼 있다.
LTX-2.5에는 독자적인 LTX-2.x Community License가 적용된다. 연 매출 1000만 달러 미만 조직은 일정 조건 아래 상업적 이용과 프로덕션 이용도 무료지만, 이를 넘는 기업은 별도 라이선스가 필요하다. 오픈웨이트는 가중치를 확보할 수 있다는 뜻인 반면, 학습 데이터나 학습 과정 전체가 공개된다는 의미는 아니며 모델을 처음부터 재현할 수 있다고 보장하지도 않는다.
LTX는 LTX-2.5를 영상 생성뿐 아니라 로봇처럼 현실 세계에서 움직이는 AI인 Physical AI에도 활용할 수 있는 세계 모델로 보고 있다. 다만 Hugging Face의 Model Card는 LTX-2.5의 확립된 용도를 영상과 음성 생성으로 제시하며, 로보틱스와 Physical AI 응용은 “developing(발전 중)”이라고 설명한다.