AI 비교AI 찾기AI 뉴스AI 강의
회사 소개
개인정보처리방침이용약관FAQ문의하기문의하기
에이아이비 주식회사사업자정보
© 2026 AIB Inc.

Uno, 확산으로 LLM 추론 가속

Uno, 확산으로 LLM 추론 가속

HuggingFace·2026년 9월 9일 (수)
  • •Institute of Foundation Models 논문은 품질 손실 없이 병렬 토큰 샘플링을 지원하는 확산 보강 LLM을 제안했다
  • •Uno는 평가된 모든 배치 크기에서 더 높은 처리량을 보였고, 기본 AR 모델보다 최대 3times 빨랐다
  • •8B Uno는 에이전트형 도구 사용, 코딩, 긴 문맥 벤치마크에서 26B DiffusionGemma와 Mercury 2를 앞섰다
  • •Institute of Foundation Models 논문은 품질 손실 없이 병렬 토큰 샘플링을 지원하는 확산 보강 LLM을 제안했다
  • •Uno는 평가된 모든 배치 크기에서 더 높은 처리량을 보였고, 기본 AR 모델보다 최대 3times 빨랐다
  • •8B Uno는 에이전트형 도구 사용, 코딩, 긴 문맥 벤치마크에서 26B DiffusionGemma와 Mercury 2를 앞섰다
  • •Institute of Foundation Models 논문은 품질 손실 없이 병렬 토큰 샘플링을 지원하는 확산 보강 LLM을 제안했다
  • •Uno는 평가된 모든 배치 크기에서 더 높은 처리량을 보였고, 기본 AR 모델보다 최대 3times 빨랐다
  • •8B Uno는 에이전트형 도구 사용, 코딩, 긴 문맥 벤치마크에서 26B DiffusionGemma와 Mercury 2를 앞섰다
  • •Institute of Foundation Models 논문은 품질 손실 없이 병렬 토큰 샘플링을 지원하는 확산 보강 LLM을 제안했다
  • •Uno는 평가된 모든 배치 크기에서 더 높은 처리량을 보였고, 기본 AR 모델보다 최대 3times 빨랐다
  • •8B Uno는 에이전트형 도구 사용, 코딩, 긴 문맥 벤치마크에서 26B DiffusionGemma와 Mercury 2를 앞섰다

Institute of Foundation Models 연구진은 Sep 3 ‘Unlocking Lossless Speedups in LLMs via Discrete Diffusion’을 공개했고, Hugging Face는 Subham Sekhar Sahoo가 Sep 8 제출한 뒤 이를 당일 #1 Paper로 올렸다. 논문은 자기회귀 언어 모델의 확률분포를 유지하면서, 추론 중 확산을 사용해 여러 토큰을 병렬 샘플링하도록 설계된 확산 보강 LLM을 제안했다. 저자들은 다음 토큰 예측과 자기회귀 구조 때문에 발생하는 느린 순차 토큰 생성을 겨냥했다고 밝혔다.

제안된 구조는 모델 파라미터를 AR 가중치와 경량 확산 가중치로 나눈다. AR 가중치는 표준 다음 토큰 예측 목표로 학습되고, 확산 가중치는 Diffusion Distillation 단계에서 여러 토큰을 동시에 생성하도록 학습된다. 저자들은 이 단계가 기존 LLM 학습 파이프라인에 거의 무시할 만한 오버헤드만 추가한다고 설명했다. 또한 시스템은 Ψ-Spec이라는 샘플러 계열을 도입했으며, 논문은 고정된 문맥 길이에서 무손실 가속과 추론 시점 스케일링을 가능하게 한다고 밝혔다.

이 결과로 나온 모델은 Uno라고 불린다. 초록에 따르면 Uno는 처음부터 학습할 수도 있고, 기존 오픈 웨이트 자기회귀 LLM을 보강해 만들 수도 있다. 저자들은 Uno가 투기적 디코딩과 달리 별도의 초안 모델을 요구하지 않으며, 확산 LLM과 달리 기본 자기회귀 모델의 품질을 희생하지 않고 생성을 가속한다고 설명했다.

논문은 Uno가 평가된 모든 배치 크기에서 주요 투기적 디코딩 방법보다 높은 처리량을 달성했고, 장치가 지원하는 최대 배치 크기를 포함해 기본 자기회귀 모델 대비 최대 3times 속도 향상을 냈다고 보고했다. 또한 저자들은 8B Uno 모델이 에이전트형 도구 사용, 코딩, 긴 문맥 추론의 모든 평가 벤치마크에서 대표 오픈 확산 LLM인 26B DiffusionGemma와 독점 모델 Mercury 2를 앞섰다고 밝혔다.

Hugging Face 페이지에는 42개 upvote, 44개 collection action, 논문을 인용한 5개 모델, 인용한 0개 데이터셋, 인용한 0개 Space, 이를 포함한 1개 collection이 표시됐다. 저자 명단에는 Subham Sekhar Sahoo, Lingjie Chen, Khiem Pham, Jonathan Geuter, Chaitanya Dwivedi, Varad Pimpalkhute, Yash Akhauri, Alexander Moreno, Mikhail Yurochkin, Zhenting Wang, Mostafa Elhoushi, Nolan Dey, Shane Bergsma, Joel Hestness, John Thickstun, Eric Xing, Zhengzhong Liu가 포함됐다.

커뮤니티 토론에서는 Uno의 핵심 프레임워크가 4 months earlier 공개된 것으로 연결된 Orthrus 논문과 유사한지에 대한 의문이 나왔다. Sahoo는 Uno가 아키텍처와 attention을 변경하지 않는 반면, 해당 논문은 diffusion attention head를 추가해 아키텍처를 바꾸고 diffusion block에 bidirectional attention을 사용한다고 답했다. 다른 댓글 작성자는 두 시스템 모두 고정된 Transformer backbone을 유지하고, 학습 가능한 diffusion parameter를 추가하며, AR KV cache를 재사용하고, 여러 토큰을 병렬로 draft한 뒤 AR weights로 검증해 lossless generation을 수행한다고 주장했다.

Institute of Foundation Models 연구진은 Sep 3 ‘Unlocking Lossless Speedups in LLMs via Discrete Diffusion’을 공개했고, Hugging Face는 Subham Sekhar Sahoo가 Sep 8 제출한 뒤 이를 당일 #1 Paper로 올렸다. 논문은 자기회귀 언어 모델의 확률분포를 유지하면서, 추론 중 확산을 사용해 여러 토큰을 병렬 샘플링하도록 설계된 확산 보강 LLM을 제안했다. 저자들은 다음 토큰 예측과 자기회귀 구조 때문에 발생하는 느린 순차 토큰 생성을 겨냥했다고 밝혔다.

제안된 구조는 모델 파라미터를 AR 가중치와 경량 확산 가중치로 나눈다. AR 가중치는 표준 다음 토큰 예측 목표로 학습되고, 확산 가중치는 Diffusion Distillation 단계에서 여러 토큰을 동시에 생성하도록 학습된다. 저자들은 이 단계가 기존 LLM 학습 파이프라인에 거의 무시할 만한 오버헤드만 추가한다고 설명했다. 또한 시스템은 Ψ-Spec이라는 샘플러 계열을 도입했으며, 논문은 고정된 문맥 길이에서 무손실 가속과 추론 시점 스케일링을 가능하게 한다고 밝혔다.

이 결과로 나온 모델은 Uno라고 불린다. 초록에 따르면 Uno는 처음부터 학습할 수도 있고, 기존 오픈 웨이트 자기회귀 LLM을 보강해 만들 수도 있다. 저자들은 Uno가 투기적 디코딩과 달리 별도의 초안 모델을 요구하지 않으며, 확산 LLM과 달리 기본 자기회귀 모델의 품질을 희생하지 않고 생성을 가속한다고 설명했다.

논문은 Uno가 평가된 모든 배치 크기에서 주요 투기적 디코딩 방법보다 높은 처리량을 달성했고, 장치가 지원하는 최대 배치 크기를 포함해 기본 자기회귀 모델 대비 최대 3times 속도 향상을 냈다고 보고했다. 또한 저자들은 8B Uno 모델이 에이전트형 도구 사용, 코딩, 긴 문맥 추론의 모든 평가 벤치마크에서 대표 오픈 확산 LLM인 26B DiffusionGemma와 독점 모델 Mercury 2를 앞섰다고 밝혔다.

Hugging Face 페이지에는 42개 upvote, 44개 collection action, 논문을 인용한 5개 모델, 인용한 0개 데이터셋, 인용한 0개 Space, 이를 포함한 1개 collection이 표시됐다. 저자 명단에는 Subham Sekhar Sahoo, Lingjie Chen, Khiem Pham, Jonathan Geuter, Chaitanya Dwivedi, Varad Pimpalkhute, Yash Akhauri, Alexander Moreno, Mikhail Yurochkin, Zhenting Wang, Mostafa Elhoushi, Nolan Dey, Shane Bergsma, Joel Hestness, John Thickstun, Eric Xing, Zhengzhong Liu가 포함됐다.

커뮤니티 토론에서는 Uno의 핵심 프레임워크가 4 months earlier 공개된 것으로 연결된 Orthrus 논문과 유사한지에 대한 의문이 나왔다. Sahoo는 Uno가 아키텍처와 attention을 변경하지 않는 반면, 해당 논문은 diffusion attention head를 추가해 아키텍처를 바꾸고 diffusion block에 bidirectional attention을 사용한다고 답했다. 다른 댓글 작성자는 두 시스템 모두 고정된 Transformer backbone을 유지하고, 학습 가능한 diffusion parameter를 추가하며, AR KV cache를 재사용하고, 여러 토큰을 병렬로 draft한 뒤 AR weights로 검증해 lossless generation을 수행한다고 주장했다.

원문 보기 (영어)·2026년 9월 9일
#uno#diffusion augmented llm#autoregressive model#discrete diffusion#psi spec#speculative decoding#diffusiongemma#mercury 2#inference speedup