알리바바 연구원, Qwen4.5 이후 모델 5~10T 파라미터로 확장 언급
Qwen4.5, Qwen5 등 향후 버전이 5~10T 파라미터로 확장될 것이라고 알리바바 연구원이 밝혔다.
중국어 원문을 AI로 번역했습니다. 고유명사와 수치는 원문 표기를 우선하며, 중요한 판단에는 아래 출처 원문을 함께 확인하세요.
량쯔웨이(量子位)의 친구들 2026-09-22 11:48:05 출처: 량쯔웨이
미래의 Qwen4.5, Qwen5 등 버전은 5-10T 파라미터로 확장될 예정이다.
9월 22일, 알리바바는 윈치대회(云栖大会)에서 대규모 모델의 일련의 진전을 발표했다. 대규모 모델의 재귀적 자기 개선(RSI)은 이미 모델 학습, 추론 및 칩-모델 협동 등의 단계에 초기 진입했으며, 차세대 아키텍처 기반의 Qwen4는 이미 학습 중이고, 미래의 Qwen4.5, Qwen5 등 버전은 5-10T 파라미터로 확장될 예정이다. 동시에 영상 생성 모델, 음성 모델, 이미지 모델, 월드 모델, 음악 모델 그리고 전모달 모델 등이 모두 당일 또는 최근에 새 버전을 출시했다.
더 높은 지능을 추구하며, Qwen이 자기 진화를 가속하다
대규모 모델은 자기 반복화로 나아가고 있으며, 이번 윈치대회에서 알리는 치엔원(千问) 대규모 모델의 자기 진화에 관한 최신 탐구 성과를 체계적으로 선보였다.
모델 자기 학습에서 , Qwen3.8-Max는 학습 흐름을 자율적으로 구축하고 학습 데이터를 구성하며 실험을 자율적으로 설계하고 결함을 찾아내는 방식으로, 인간이 완전히 "제로 참여"한 상황에서 1개월 넘게 지속적으로 반복하며 33라운드의 유효 반복을 완료했다. RSI, 후속 학습 등 일련의 기술을 연합 최적화한 데 기반해, Qwen3.8-Max 새 버전은 Artificial Analysis에서의 점수가 40점에서 45점으로 올라 Claude, GPT의 최강 모델과 함께 제1진영에 위치했으며, GLM5.3, Kimi-K3 등 모든 중국산 모델을 앞섰다.
추론 최적화에서 , Qwen3.8-Max는 한 번도 본 적 없는 핑터우거(平头哥)의 신형 GPU 위에서 차세대 아키텍처의 Qwen3.8-Flash 신형 모델의 추론 프레임워크를 자율적으로 적응·최적화해, 단일 인스턴스 추론 처리량을 96% 향상시켰다.
칩-모델 협동 설계에서 , Qwen3.8-Max는 단 한 건의 실제 버스 모듈 규격에만 기반해 프런트엔드, 검증, 백엔드의 전 링크 자기 반복을 자율적으로 전개했고, 60시간 이상 자율 운용하고 EDA 도구를 1만 회 이상 호출한 끝에 면적을 42% 줄이는 물리 구현 최적화를 완료했다.
그림 설명: Qwen LLM 프로젝트 책임자 류다이헝(刘大一恒)은 Scaling이 ASI로 나아가는 관건적 경로라며, Qwen4.5, Qwen5의 파라미터 규모를 계획상 5조에서 10조로 나아가게 할 것이라고 밝혔다
대회 현장에서 알리는 대규모 모델 핵심 영역의 일련의 기술 혁신을 선보였다. 아키텍처 최적화 측면에서, Qwen3.8-Flash는 차세대 치엔원 대규모 모델 아키텍처를 앞서 오픈소스로 공개했으며, 어텐션 메커니즘과 모델 내부 정보 전달 메커니즘 등 핵심 기술 혁신을 통해 최전선 모델의 성능을 구현하면서도 학습 비용을 거의 90% 급감시켰다. 동시에 극히 적은 파라미터 활성화에 힘입어 추론 계산 효율을 완전히 새로운 파레토 프런티어로 끌어올려, 업계의 가성비 "킬 라인(斩杀线)" 모델이 되었다. 모달 확장 측면에서, 전모달 모델 Qwen3.8-Omni가 정식으로 등장해 음성·영상 등 서로 다른 모달을 통합 이해 프레임워크에 효율적으로 편입시켜, 대규모 모델에 완전히 새로운 사고 구획을 열어 주었다. 파라미터 확장 측면에서, 파라미터가 클수록 여전히 더 강한 성능을 가져오며, 미래의 치엔원 대규모 모델 총 파라미터 수는 5조, 심지어 10조 규모로 확장될 것이다. 이러한 기술 혁신은 차세대 치엔원 대규모 모델의 초석이 될 것이며, 소개에 따르면 Qwen4 모델은 완전히 새로운 아키텍처로 학습을 전개하고 있고, Qwen4.5, Qwen5 모두 착실히 추진 중이다.
대규모 모델 성능의 최전선을 끊임없이 탐구하는 동시에, 알리는 "전모달" "전사이즈" 대규모 모델 오픈소스를 통해 전 세계 개발자 및 기업과 최전선 AI 기술의 이익을 공유하고 있다. 세계 최대 AI 오픈소스 커뮤니티인 Hugging Face에서 Qwen3.8-27B 모델은 DeepSeek-R1, Meta-Llama3.1 등 역사상 인기 모델을 넘어서며, 해당 플랫폼 역사상 가장 인기 있는(Most Likes) 오픈소스 대규모 모델을 차지했다. 공개 데이터에 따르면 알리는 460여 개의 Qwen 대규모 모델을 오픈소스로 공개했고, Qwen 오픈소스 모델 다운로드량은 30억 회를 돌파했으며, 파생 모델 수는 30만 개를 넘어 세계 1위 오픈소스 모델 패밀리에 확고히 자리했다.
시청각 생성 모델 업그레이드, 완전히 새로운 영상 생성 모델 11월 발표 예정
가장 창의성이 풍부한 시각 생성 영역에서, 알리는 시각 생성 모델의 지속적인 반복·업그레이드를 통해 AI가 더 나은 작품을 창조하게 하고, 사용자가 더 나은 경험을 누리게 하고 있다.
이미지 생성 모델 Qwen-Image-3.1이 등장했으며, 이는 이커머스, 크리에이티브, 디자인 등 실제 상용 시나리오를 겨냥해 완전히 새롭게 최적화·업그레이드되어, 원래 몇 시간 걸리던 시각 디자인을 초 단위 납품으로 압축했고, 수준은 전문 디자이너에 버금가며, 이미지 정밀 편집도 지원한다.
음악 생성 모델 Happy Shrimp 1.1 버전이 발표되어, 음악 표현, 보컬 품질, 다국어 가창 및 지시 이해라는 네 가지 전문 차원에서 한층 더 향상되었고, 100여 가지 곡풍과 10여 가지 주요 언어를 지원하며, 보컬 곡과 순수 음악 두 가지 생성 시나리오를 아우른다.
월드 모델 최신 버전 HappyOyster 2.0 Preview가 등장해, 모델 아키텍처, 학습 방법 및 데이터 체계의 전면 업그레이드를 통해 지능형 실시간 상호작용, 기억 능력, 실시간 응답, 물리 법칙 준수 등 핵심 능력을 현저히 향상시켜, 월드 모델이 진정으로 실험실에서 실제 사용 가능한 단계로 나아가게 했다.
그림 설명: 알리바바 ATH 기술 부사장이자 타오톈(淘天)그룹 수석 과학자인 정보(郑波)는 윈치대회 현장에서 3년 내에 네이티브 전모달 통합 모델이 나타날 것이며, 경험은 더 이상 모달의 경계에 제한받지 않게 될 것이라고 언급했다
완전히 새로운 차세대 영상 생성 모델도 11월에 발표될 예정이며, 더 길고, 더 통제 가능하고, 더 완전하며, 더 지능적인 방향으로 진화한다. 더 긴 시간 동안에도 새 모델은 일관성을 유지할 수 있고, 창작자는 인물, 장면과 카메라를 정밀하게 통제할 수 있으며, 동시에 모델은 감독급 창작 사고를 갖춰 단일 숏 생성에서 완전한 서사 이해로 나아갈 수 있다.
차세대 음성 모델 발표, Qwen 다수의 스마트 단말에 적용
현재 음성은 AI와 사람 사이의 더 자연스러운 상호작용 진입점으로 발전하고 있으며, Qwen 모델도 휴대폰, AI 안경, 데스크톱 로봇 등 하드웨어 영역에 적용되고 있다.
음성 모델 패밀리 Qwen-Audio-3.1이 전면 업그레이드되었으며, 음성 전사(ASR), 음성 합성(TTS) 및 실시간 음성 상호작용(Realtime) 세 가지 시리즈를 포함한다.
차세대 아키텍처 기반의 오디오 이해 모델 Qwen-Audio-3.1-ASR-Next가 새로 발표되었으며, 인물의 감정, 음악, 환경음과 기계음을 이해하고, 소리 묘사, 이벤트 위치 파악, 오디오 질의응답과 추론을 완수해, "이 녹음에서 사람의 감정은 어떤가"와 같은 질문이 이해되고 정확히 답변될 수 있게 한다.
동시에 오디오 창작 모델 Qwen-Audio-3.1-TTS-Next가 새로 등장했으며, 완전히 새로운 아키텍처를 채택해 한 편의 대본에 따라 대화와 환경음이 융합된 완전한 오디오를 곧바로 생성할 수 있어, 오디오북, 영상 드라마와 팟캐스트 등 전문 창작의 효율을 크게 높인다.
Qwen-Audio-3.1-Realtime은 실시간 상호작용 능력이 다시 향상되어, 듣고, 생각하고, 말하기를 동시에 할 수 있으며, 다국어 상호작용, 역할극과 공감 능력을 한층 더 강화했다. 현재 이 시리즈 모델은 치엔원 오피스(千问办公)와 Qoder에 적용되었고, QwenNote A2 휴대형 어시스턴트, QwenNote Eva 데스크톱 로봇과 치엔원 AI 안경 등 하드웨어 제품에도 연동되었다.
또한 동시통역 모델 Qwen3.8-LiveTranslate가 처음 등장했는데, 인간 동시통역의 평균 지연이 4초 이상인 반면, 이 모델은 지연을 2.5초 미만으로 압축할 수 있다. 알려진 바에 따르면 새 모델은 치엔원 AI 안경, QwenNote A2, 딩톡(钉钉) 이어폰 등 AI 하드웨어에 연동되었다.
알리바바의 대규모 모델이 단말로 향하는 속도가 빨라지고 있다. AI 휴대폰 풀스택 솔루션 Qwen Intelligence가 발표되어, 휴대폰 시나리오에 특화해 깊이 최적화되었으며, 파트너에게 치엔원 대규모 모델 기반의 Agent 기술 플랫폼을 제공해 휴대폰이 앱을 넘나드는 복잡한 작업을 더 안정적으로 완수할 수 있게 한다.
알리바바 AI 대규모 모델 전경도