Qwen-UI-Agent, 실제 GUI 작업 겨냥
- •TongyiLab 논문이 모바일, 컴퓨터 사용, 웹, DeepSearch 환경용 Qwen-UI-Agent를 공개했다
- •Online RL은 10,000개 초과 동시 환경에서 100턴 초과 궤적을 학습한다
- •Qwen-UI-Agent는 MobileWorld 82.1%, MobileWorld-Real 92.2%, AndroidDaily 97.5%를 기록했다
TongyiLab 연구진은 기초 GUI 에이전트 기술 보고서인 Qwen-UI-Agent를 Hugging Face Papers에 공개했다. 공개 페이지에는 발행일이 Jul 30으로 표시됐고, Quyu Kong이 Jul 31에 제출한 것으로 기재됐다. 논문은 GUI 에이전트가 기존 디지털 기기 위에서 범용 실행자가 될 수 있다고 설명하며, Qwen-UI-Agent가 모바일, 컴퓨터 사용, 웹, DeepSearch 환경의 실제 사용을 목표로 설계됐다고 밝혔다.
Qwen-UI-Agent는 다양한 샌드박스 환경과 대규모 실제 기기 기반 모바일 런타임을 결합한다. 통합 액션 공간은 GUI 조작과 CLI 실행을 함께 다루며, 한 번의 모델 턴에서 배치형 액션을 생성할 수 있다. 이에 따라 에이전트는 매 턴 한 단계씩 움직이는 대신 여러 인터페이스 또는 명령줄 단계를 한꺼번에 계획할 수 있다.
보고서는 AutoResearch 방식의 데이터 플라이휠을 설명한다. 에이전트가 작업과 환경을 만들고, 실패를 진단하며, 이후 반복 과정을 계획하는 구조다. Online RL(시행과 보상 갱신으로 학습)은 100턴을 넘는 궤적 학습을 지원하고, 10,000개 초과 동시 환경은 롤아웃을 가속한다. 또한 경량 하네스 계층은 모바일과 컴퓨터 설정 전반에서 선제적 서비스 시작과 상태 유지 워크플로를 지원한다.
평가에서 Qwen-UI-Agent는 모바일 사용 벤치마크에서 최첨단 성능을 세웠고, 컴퓨터와 브라우저 사용 작업에서는 Opus 4.8, Gemini 3.1 Pro, GPT-5.6 Sol 등 프런티어 모델과 비교해 경쟁력을 유지했다. 보고된 점수는 MobileWorld 82.1%, MobileWorld-Real 92.2%, AndroidDaily 97.5%, OSWorld-Verified 79.5%, OSWorld-v2 부분 진행 점수 40.0%, WebArena 73.6%, ScreenSpot-Pro 81.5%다. Hugging Face 페이지는 이 논문을 이날 #2 Paper로 표시했으며, 추천은 177개였다.