Issue 01중국 AI
AC POST
중국 AI 목록
开源中国2026년 9월 18일 12:37중국어 → 한국어

알리바바 통이, 네이티브 전모달 모델 Qwen3.8-Omni-Flash 공개

알리바바 통이 Qwen 팀이 네이티브 전모달 모델 Qwen3.8-Omni-Flash를 내놓으며, 전모달 내용 이해를 넘어 작업 계획과 도구 호출, 창작 수행으로 확장하는 데 초점을 맞췄다.

중국어 원문을 AI로 번역했습니다. 고유명사와 수치는 원문 표기를 우선하며, 중요한 판단에는 아래 출처 원문을 함께 확인하세요.

알리바바 통이(通义) Qwen 팀이 오늘 차세대 "네이티브 전모달(全模态)" 모델 Qwen3.8-Omni-Flash를 공개했다. 제목 문구가很有意思——"耳聪目明, 办事得力(귀 밝고 눈 밝으며, 일 처리가 유능하다)". 앞 네 글자는 이런 Omni 모델의 본업이고, 뒤 네 글자가 이번의 핵심이다. "전모달 콘텐츠 이해"에서 "과업 계획, 도구 호출 및 창작 완수"로 밀어붙이는 것이다.

가장 직접적인 신호는 가격이다. 이전 세대 Qwen3.5-Omni-Plus와 비교해 API 시간당 오디오 입력 가격은 98% 이상, 시간당 오디오·비디오 입력 가격은 93% 이상 인하됐다. 멀티모달 인지가 이 정도로 저렴해져야 생산성 시나리오로 나아간다고 말할 자격이 생긴다.

모델 자체는 1M 장문맥을 지원하고 텍스트, 이미지, 오디오, 비디오 입력을 지원한다. 누적 29개 평가에서 Qwen3.5-Omni-Plus 대비 평균 점수가 25% 이상 향상됐다. 오디오 Agent, Coding, 장기 과업这几个 방향에서 WildClawBench-MM은 36.5점 대폭 상승했고, AgenticVBench는 22.3점 올랐다. Gemini 3.8 Flash와 비교해 Qwen 측의 표현은 "오디오·비디오 능력은 근접하고, 오디오 능력은 전반적으로 능가한다"는 것이다.

정말 볼 만한 것은 멀티모달을 "엔드투엔드로 일하는" 착지점까지 밀어붙였다는 점이다. 팀은 두 가지配套 세트를 오픈소스로 공개했다. Qwen-MM-Plugins(오디오·비디오 생산성 플러그인, Codex, Claude Code, Qwen Code, Gemini CLI 등 여러 Agent Harness 지원)와 Qwen-Live Harness(실시간 상호작용을 위한 네이티브 실행 환경)다. 이 세트를 기반으로 몇 가지 완전한 워크플로를 돌렸다. Music2MV로 MV 창작, 숏드라마 번역 해외 진출, 두세 시간짜리 장편 영화 해설, Video2Note로 비디오 튜토리얼을 스크린샷이 포함된 PDF 노트로 짜내기, Omni Skill Creator로 조작 시연에서 SOP를 추출해 재사용 가능한 Agent Skill로 만들기 등이다. 번역은 원 화자의 음색特征을 보존할 수 있다는 점도 강조했다.

두 가지 기술 포인트를 따로 짚어볼 만하다.

하나는 "Agentic 장시간 오디오·비디오 이해"다. 수 시간 분량의 비디오에 대해 모델은 더 이상 처음부터 끝까지 프레임별로 처리하지 않고, 질문에서 출발해 무엇을 보고 들을지 스스로 결정하며, 거친 것에서 정밀한 것으로 이어지는 다중 라운드 증거 수집을 통해 핵심 정보를 위치시킨다. OmniVideoBench에서 Agentic Understanding은 정확도를 63.4에서 67.8로 끌어올리는 동시에 단일 쿼리의 Token 소모를 145,736에서 79,117로 낮춰 약 45.7% 줄였다. 이 "수요 기반 인지"는 비용과 효율 모두에 실질적인 이점이다.

다른 하나는 모델 자체를 연구개발 도구로 쓰는 것이다. 팀은 Qwen3.8-Omni-Flash가 12시간 안에 Qwen2.5-Omni-3B의 쓰촨 방언 인식 능력을 향상시키도록 했다. 그것은 평가 세트를 스스로 선택하고, 베이스라인을 정하고, 음성 샘플을 듣고 문제를 진단하고, 훈련 데이터를 구축했으며, 4轮 실험에서 누적 3,413건의 데이터를 만들어 문자 오류율을 25.79%에서 15.30%로 낮춰 상대적으로 약 40.7% 감소시켰다. 통이가 말하려는 것은 "대모델이 연구개발을 담당하고 소모델이 비즈니스를 담당한다"는 새로운 패러다임이다. Agent가 더 이상 모델을 호출하는 데 그치지 않고 모델 최적화에 참여할 수 있다는 것이다.

또 하나 비동기 업데이트 라인이 있다. Qwen3.8-Omni-Flash-Realtime, 지속적인 저지연 상호작용을 겨냥한 버전으로 WebSocket과 WebRTC를 지원하며, 최초로 "듣고 방향을 판별(听声辨位)"하는 기능을 선보인다. 공간 음향과 시각 정보를 융합해 음원의 방향과 거리를 판단하는 것으로, 이 능력을 지원하는 첫 전모달 대모델이다.

출처: Qwen3.8-Omni-Flash: 耳聪目明, 办事得力 - Qwen