Issue 01중국 AI
AC POST
중국 AI 목록
量子位2026년 9월 22일 12:42중국어 → 한국어

알리바바, Qwen4·차세대 영상 모델 학습 중이라고 공개

9월 22일 2026 윈치 대회에서 알리바바가 대모델 최신 진행 상황을 공개하며 Qwen4와 차세대 영상 모델이 학습 중이라고 밝혔다.

중국어 원문을 AI로 번역했습니다. 고유명사와 수치는 원문 표기를 우선하며, 중요한 판단에는 아래 출처 원문을 함께 확인하세요.

양자위(量子位)의 친구들 2026-09-22 11:42:43 출처: 양자위

9월 22일, 2026 운서(云栖) 대회가 개막했고 알리바바가 대형 모델 최신 진전을 발표했다.

9월 22일, 2026 운서 대회가 개막했고 알리바바가 대형 모델 최신 진전을 발표했다. 대언어모델 LLM 분야에서 Qwen3.8-Max는 코딩(Coding)과 오피스(Cowork) 분야에서 강력한 성능을 보였으며, 출시 후 Artificial Analysis Agentic 에이전트 1위, CodeArena 프런트엔드 코딩 1위를 차지했다. 차세대 아키텍처 기반의 Qwen4는 이미 학습에 들어갔고, 향후 Qwen4.5, Qwen5 등 후속 버전 모델의 파라미터는 5조에서 10조 규모로 확장될 예정이다. 멀티모달 분야에서 Qwen-Image-3.1의 성능은 최강 GPT-Image 시리즈에 근접해 글로벌 최상위권에 진입할 것으로 예상되며, Qwen-Audio-3.1은 ASR, TTS, Realtime이라는 세 가지 핵심 음성 트랙 모두에서 국제 최상위 티어이자 중국 내 1위로, Gemini 3.1 TTS 등 국제 최정상 모델을 앞섰다. 월드 모델 HappyOyster-2.0-Preview가 새로 등장해 월드 모델을 실험실에서 실제 활용 가능한 단계로 이끌었다. 비디오 생성 모델 Wan3.0은 Artificial Analysis 텍스트-투-비디오와 비디오 편집 두 부문에서 모두 1위를 차지했으며, 동시에 차세대 비디오 모델도 학습 중으로 더 강력한 생성력, 제어력, 이해력을 갖춰 AI가 도구에서 창작 지능으로 나아가도록 이끌고 있다.

최신 Artificial Analysis 글로벌 대형 모델 순위에서 Qwen3.8-Max는 40점에서 45점으로 상승했다

알리바바는 AI 대형 모델을 가장 먼저 배치한 중국 기술 기업이다. 2019년부터 알리바바는 AI 대형 모델 연구에 착수했고, 잇따라 치엔원(Qwen) 대언어모델 시리즈와 완샹(Wan) 및 HappyHorse 등 멀티모달 모델 시리즈를 출시했다. 2026년에 들어 알리바바의 대형 모델 발표는 전면적으로 속도를 높였으며, 최근 한 달여 동안 Qwen3.8 시리즈만으로도 4개의 서로 다른 모델과 주요 버전을 연이어 업데이트·반복 출시해 성능과 가성비 모두 글로벌 최전선 수준에 진입, 현재 기업과 글로벌 AI 개발자 커뮤니티가 가장 주목하는 중국 모델 중 하나가 되었다. 2026 운서 대회에서 알리바바는 대형 모델 자기 진화(RSI)가 이미 모델 학습, 추론 및 모델 칩 협업 등의 단계에 초기 진입했다고 발표했으며, 이러한 최전선 기술 탐색은 Qwen 시리즈 모델의 반복 업그레이드를 가속했다.

전통적인 모델 반복은 보통 일방향 파이프라인으로, 연구원이 평가나 사용자 피드백에서 문제를 발견하고, 일련의 데이터를 준비해 한 번의 학습을 완료한 뒤 새 모델을 발표한다. 이런 작업은 계속 반복 순환되며, 다음 라운드의 새 모델도 여전히 인공 분석에서 다시 시작해야 한다. 이제 Qwen3.8-Max는 스스로 학습 프로세스를 구축하고 학습 데이터를 구성하며, 스스로 실험을 설계하고 결함을 찾아내는 방식으로 인간이 완전히 '제로 참여'한 상태에서 1개월 넘게 지속적으로 반복해 33회의 유효 반복을 완료할 수 있다. RSI, 후속 학습(포스트 트레이닝) 등 일련의 기술 혁신을 기반으로 Qwen3.8-Max의 새 버전은 Artificial Analysis에서 점수가 12.5% 상승해 45점이 되었으며, Claude, GPT 등 최정상 모델과 같은 최전선 티어에 속한다. 또한 치엔원 RSI 탐색은 계속 확장되어 위로는 추론 자율 최적화를 뒷받침하고 아래로는 칩-모델 공동 혁신을 협력한다. 추론 최적화에서 Qwen3.8은 한 번도 본 적 없는 핑터우거(平头哥) 신형 GPU 상에서 차세대 아키텍처의 Qwen3.8-Flash 신모델의 SGlang 추론 프레임워크를 자율적으로 적응·최적화해 단일 인스턴스 추론 처리량을 96% 향상시켰다. 칩-모델 협업 설계에서 Qwen3.8은 단 하나의 실제 버스 모듈 규격만을 기반으로 프런트엔드, 검증, 백엔드의 전 링크 자율 반복을 스스로 전개해 60시간 넘게 자율 운영하고 EDA 도구를 1만 회 넘게 호출한 끝에 면적을 42% 줄인 물리 구현 최적화를 완료했고, 표준 셀 수는 29% 감소, 전력 소모는 59.5% 감소했다.

더 높은 지능을 추구하고 자기 진화를 가속하는 것은 Qwen의 가장 중요한 북극성 목표다. 이번 운서 대회에서 알리바바는 대언어모델 시리즈의 기술 진전을 발표했다. 아키텍처 최적화 방면에서 Qwen3.8-Flash(자세한 내용은 기술 블로그 참조)는 차세대 치엔원 대형 모델 아키텍처를 앞서 오픈소스화했으며, 어텐션 메커니즘과 모델 내 정보 전달 메커니즘 등 핵심 기술 혁신을 통해 최전선 모델 성능을 구현하면서도 학습 비용을 약 90% 급감시켰고, 동시에 극소수의 파라미터 활성화에 힘입어 추론 연산 효율을全新的 파레토 프런티어로 끌어올려 업계 가성비 '킬 라인(斩杀线)' 모델이 되었다. 모달리티 확장 방면에서(자세한 내용은 기술 블로그 참조) 전모달 모델 Qwen3.8-Omni-Flash가 정식 등장해 비디오, 오디오, 이미지, 텍스트 등 서로 다른 모달리티를 통합 이해 프레임워크에 효율적으로 포함시켜 대형 모델에全新的 사고 구역을 열어주었다. 파라미터 확장 방면에서 파라미터가 클수록 여전히 더 강한 성능을 가져올 수 있으며, 향후 치엔원 대형 모델의 총 파라미터 수는 5조 심지어 10조 규모로 확장될 것이다. 이러한 기술 혁신은 차세대 치엔원 대형 모델의 초석이 될 것이며, 설명에 따르면 Qwen4 모델은全新 아키텍처를 채택해 학습을 전개하고 있고 Qwen4.5, Qwen5 모두 착실히 추진 중이다.

극한의 가성비를 추구하고 AI 보편화 실현을 추진하는 것은 Qwen의 또 다른 북극성 목표다. Qwen3.8 시리즈 모델 중에서 Qwen3.8-Max는 Arena로부터 최전선 코딩 모델 중 가성비가 가장 높은 모델 중 하나로 평가되었고, Qwen3.7 대비 토큰 호출 수가 12배 향상되어 풀스택 개발, 자동화 운영, 법률 문서, 투자 연구 분석, 엔지니어링 설계, 과학 연구 등 실제 시나리오에 진입했다. Qwen3.8-Flash는 구조 혁신을 통해 캐시 적중 입력이 백만 토큰당 0.1위안까지 낮아지는全新的 시대를 열었다. Qwen3.8-27B는 글로벌 개발자들로부터 '로컬 Opus4.6'으로 불리며, 지능 밀도를 소비자용 그래픽카드를 갖춘 컴퓨터에서도 돌릴 수 있는 극한 수준으로 압축해 지능과 가성비를 새로운 수준으로 '킬'했다. 실제로 전 세계의 기업과 개발자들이 알리바바 대형 모델로 AI 응용落地를 탐색하고 있다. 예를 들어 실리콘밸리 AI 유니콘 Perplexity는 Qwen3.8을 기반으로 로컬 에이전트를 구축했고, 유명 인터넷 기업 에어비앤비(Airbnb) CEO 브라이언 체스키는 회사가 '알리바바의 치엔원 모델에 크게 의존하고 있다'고 말하며 'OpenAI보다 더 좋고 더 저렴하다'고 직언했다. '미국판 샤오홍슈' 핀터레스트(Pinterest)도 Qwen으로 자체 AI 쇼핑 어시스턴트와 챗봇을 구축했으며, 그 CEO 빌 레디는 Qwen 사용 비용이 Anthropic, OpenAI 등 동종 폐쇄형 모델의 8%에도 못 미친다고 직언했다. 로이터통신도 Claude 등 폐쇄형 모델에 대한 의존을 낮추고 장기 사용 비용을 줄이기 위해 Qwen을 기반으로 자체 모델을 개발했다.

Qwen3.8 시리즈 모델은 모두 글로벌 오픈소스로 향하며, 불과 한 달 만에 Qwen3.8 관련 모델은 5,600만 회 이상 다운로드되었고 파생 모델은 1,900개를 넘었으며, 그중 Qwen3.8-27B는 DeepSeek-R1, Meta-Llama3.1 등 인기 모델을 넘어 Hugging Face 역사상 가장 인기 있는 대형 모델 세계 1위가 되었다. 현재까지 알리바바는 460개 이상의 치엔원 대형 모델을 오픈소스화했고, Qwen 모델의 전체 다운로드량은 30억 회를 넘었으며 파생 모델은 30만 개를 넘었다. Hugging Face 공식 보고서는 Qwen이 글로벌 AI 오픈소스 커뮤니티의 기반 모델이 되었다고 지적했으며, DeepSeek, 엔비디아, AWS, 마이크로소프트 등 유명 기업들 모두 Qwen을 기반으로 관련 파생 모델을 2차 개발해 AI 비즈니스의落地 탐색 실천을 진행하고 있다.

대언어모델이 기계의 두뇌라면 그 목적은 더 똑똑해지고 더 강해져 범용 인공지능 AGI 나아가 초인공지능 ASI의 실현을 추진하는 데 있다. 그렇다면 멀티모달 모델은 기계와 인간, 세계가 상호작용하는 중추로, 그 목적은 지각하고 이해하며 심지어 새로운 사물을 창조해 기계가 신뢰할 수 있고 안정적으로 실제 물리 세계로 나아가도록 돕는 데 있다. 이번 운서 대회에서 알리바바의 여러 멀티모달 모델이 대대적으로 업그레이드되어 단일 모달리티 생성에서 점차 전모달 이해·생성 일체화 발전으로 나아갔다.

비디오 생성 분야에서 2025년 Wan2.6은 중국 내 최초로 비디오 참조 생성을 지원했고, 15초 길이에 지능형 다중 분할 화면을 제공했다. 2026년에 들어 알리바바 비디오 모델은 최전선 탐색을 지속했으며, 4월 발표된 Wan2.7과 HappyHorse1.0은 영화급 질감과 시각적 표현력에서 도약을 이루었고, 8월 정식 출시된 Wan3.0은 단일 30초 비디오 생성, 문서/표/웹페이지 등 구조화 입력, 네이티브 음화 동기화를 지원하며 Artificial Analysis 텍스트-투-비디오와 비디오 편집 두 부문에서 세계 1위를 차지했다.全新的 차세대 비디오 모델도 11월에 발표될 예정이며, 더 길고, 더 제어 가능하고, 더 완전하고, 더 지능적인 방향으로 진화한다. 더 긴 시간 속에서도 새 모델은 일관성을 유지할 수 있고 창작자는 인물, 장면, 카메라를 정밀하게 통제할 수 있다. 동시에 모델은 감독급 창작 사고를 갖춰 단일 샷 생성에서 완전한 서사 이해로 나아갈 수 있다.

음성 모델 방면에서 알리바바는 Qwen-Audio-3.1 시리즈 음성 대형 모델을 발표했고, 음성 전사(ASR), 음성 합성(TTS), 실시간 음성 상호작용(Realtime) 세 가지 유형의 모델이 전면 업그레이드되었다. 그중 Qwen-Audio-3.1-Realtime의 실시간 상호작용 능력은 다시 향상되어 듣고, 생각하고, 말하기를 동시에 할 수 있으며, 다국어 상호작용, 역할극, 공감 능력도 한층 강화되었다. 현재 이 시리즈 모델은 치엔원 오피스와 Qoder에 적용되었고, QwenNote A2 휴대용 어시스턴트, QwenNote Eva 데스크톱 로봇, 치엔원 AI 안경 등 하드웨어 제품에도 접목되었다. 동시에 알리바바는 차세대 아키텍처 기반의 두 가지全新的 모델을 출시했다. 오디오 창작 모델 Qwen-Audio-3.1-TTS-Next는 사용자가 한 단락의 말만 제공하면 인물 대사와 환경음이 융합된 완전한 오디오 콘텐츠를 한 번에 생성할 수 있어 오디오북, 영상 드라마, 팟캐스트, 게임, 광고 등 전문 창작 수요를 충족한다. 오디오 이해 모델 Qwen-Audio-3.1-ASR-Next는 인물 감정, 음악, 환경음, 기계음을 이해하고 소리 묘사, 사건 위치 파악, 오디오 질의응답과 추론을 완수해 '이 녹음에서 사람의 감정이 어떤가'와 같은 질문이 이해되고 정확히 답변될 수 있게 한다.

이미지 생성 모델 방면에서 Qwen-Image-3.1이 등장했으며, 전자상거래, 디자인 등 실제 상용 시나리오를 겨냥해 전면 최적화·업그레이드되어 원래 수 시간 걸리던 시각 디자인을 초 단위 납품으로 압축했고, 수준은 전문 디자이너에 필적하며 이미지 정밀 편집도 지원한다. 동시에 시각 생성 부분의 파라미터량이 7B에 불과한 Qwen-Image-2.1이 전면 오픈소스화되었으며(자세한 내용은 기술 블로그 참조), 이는 치엔원 이미지 시리즈에서 현재 능력이 가장 균형 잡히고 가성비가 가장 높은 오픈소스 이미지 생성 모델로, Qwen-Image-Bench 공개 평가에서 대부분의 폐쇄형 모델을 능가해 오픈소스 1위에 올랐고 추론 속도도 대폭 향상되었다. 또한 네이티브로 투명 이미지 생성을 지원해 프롬프트에 따라 일반 이미지와 투명 이미지 중 무엇을 출력할지 자동으로 결정하며, RGB 실사 이미지를 RGBA 레이어로 바로 분리할 수도 있다. 그 밖에 모델은 최대 10장의 참조 이미지를 활용한 다중 이미지 편집, 원형 선택/칠하기/마스크 세 가지 국소 편집을 지원하고, 인물과 상품의 편집 충실도를 중점 강화했으며, 텍스트 렌더링과 인물 광영 표현도 이전 세대보다 뚜렷이 강화되었다.

음악 모델 Happy Shrimp 1.1 버전이 발표되어 음악 심미 모델링과 강화 학습, 그리고 세계 지식과 음악 분야 지식의 융합이라는 두 가지 기술 방향에서 한층 더 향상되었고, 음악 표현, 보컬 품질, 다국어 창법 및 지시 이해라는 네 가지 전문 차원의 돌파를 이루어 100여 종의 곡풍과 10여 종의 주요 언어를 지원하며 보컬 곡과 순수 음악이라는 두 가지 생성 시나리오를 포괄한다.

동시통역 모델 Qwen3.8-LiveTranslate가 정식 등장했다(자세한 내용은 기술 블로그 참조). 새 모델은 Interleave 아키텍처를 채택해 실시간 동시통역 과정을 혁신적으로 재구성했고, 정확도와 유창도, 간결도가 전면 향상되었으며, 글자당 지연(LAAL)이 2.8초에서 2.3초로 낮아졌는데, 인간 동시통역의 평균 지연은 4초다. Qwen3.8-LiveTranslate는 세 가지 능력을 새로 추가해 실시간 화자 분리를 구현해 각 문장의 귀속이 명확하고 음색 복제가 더 안정적이며, 원문과 번역문이 같은 프레임에 동시 출력되어 이중 언어 동시 표시를 구현하고, 긴 문맥에 직면해 자율적으로 고품질로 모호성을 줄이거나 제거해 앞 문맥과 연결해 현재를 이해하고 인명·용어 번역이 더 정확해졌다. 일련의 기술 혁신을 기반으로 Qwen3.8-LiveTranslate는 번역이 빠를 뿐만 아니라 더 잘 들리고 더 정확하게 번역되어 실제 시나리오에서 더 좋은 성과를 낸다.

월드 모델 최신 버전 HappyOyster 2.0 Preview가 등장했으며, 모델 아키텍처, 학습 방법, 데이터 체계의 전면 업그레이드를 통해 지능형 실시간 상호작용, 기억 능력, 실시간 응답, 물리 법칙 준수 등 핵심 능력을 현저히 향상시켜 월드 모델을 실험실에서 진정한 실제 활용 단계로 이끌었다.

이번 운서 대회에서 알리바바는 대언어모델부터 멀티모달 모델까지의 돌파를 전면적으로 보여주었으며, 이 지속적이고 안정적인 연구개발 산출 뒤에는 알리바바가 AI와 클라우드 컴퓨팅 분야에 장기간 끊임없이 투자해 온 결과가 있다. 지난 17년간 알리바바는 중국 유일의 소프트웨어·하드웨어 일체형 수직 통합 능력을 갖춘 풀스택 AI 기업이며, 알리클라우드는 클라우드 기술 축적과 대형 모델 연구개발에 대한 투자도 가장 충실해 현재 인프라와 모델 연구개발 모두에서 세계 일류 능력을 동시에 갖춘 중국 유일의 플랫폼이다. 알리바바가 구성한 Token Foundry는 현재 중국 AI 인재가 가장 밀집되고 AI 산출이 가장 풍부한 AI Lab으로, 언어 모델 및 가장 풍부한 멀티모달 모델 분야를 아우른다. 동시에 알리바바는 AI 시대의 가장 중요한 AI 응용 시나리오도 갖추고 있으며, 여기에는 에이전트 도구인 치엔원 오피스, Qoder 등이 포함되어 각 업종에 AI 생산성 도구를 제공한다. 알리바바는 중국에서 가장 중요한 AI 인프라 기업이자 AI 응용 기업 중 하나가 되었다.