즈상미래, 물리 법칙 기반 영상 생성 모델 공개
즈상미래(HiDream.ai)가 첫 네이티브 전모달 영상 생성 모델 HiDream-O1-Video-1.0을 발표했다.
중국어 원문을 AI로 번역했습니다. 고유명사와 수치는 원문 표기를 우선하며, 중요한 판단에는 아래 출처 원문을 함께 확인하세요.
양자위(量子位)의 친구들 2026-09-15 18:41:06 출처: 량쯔웨이(量子位)
즈샹웨이라이(智象未来, HiDream.ai)가 첫 네이티브 전모달(全模dal) 영상 생성 모델 HiDream-O1-Video-1.0을 정식 발표
오늘 즈샹웨이라이(智象未来, HiDream.ai)가 첫 네이티브 전모달 영상 생성 모델 HiDream-O1-Video-1.0(모델 약칭 HD-V1)을 정식 발표했다. HD-V1은 즈샹이 자체 개발한 네이티브 전모달 아키텍처를 채택해 텍스트, 이미지, 영상 등 다양한 모달리티 입력을 지원하며, 원클릭으로 5–20초 1080p 고충실도 영상을 바로 생성할 수 있다. 동시에 의도 이해, 물리 법칙 이해, 자율 서사 계획, 그리고 음화 일체화 생성 등 차원에서 모두 전면적으로 업그레이드되어 글로벌 선도 수준에 도달했다.
발표와 동시에 HD-V1은 두 개의 국제 권위 평가 리더보드에서 모두 세계 최상위권에 올랐다. 세계 선도의 독립 AI 벤치마크 테스트 및 분석 플랫폼인 Artificial Analysis Image to Video Leaderboard(With Audio) 순위에서 HD-V1은 글로벌 4위의 성적을 거뒀다. Artificial Analysis의 이미지-투-비디오 리더보드는 표준화되고 재현 가능한 벤치마크로 전 세계 주요 영상 생성 모델을 체계적으로 평가하며, AI 영상 모델의 종합 실력을 가늠하는 중요한 척도로 여겨진다.
세계에서 가장 영향력 있는 AI 모델 블라인드 테스트 평가 플랫폼인 Arena.ai Image-to-Video에서도 HD-V1은 8위의 우수한 성적을 거뒀다. Arena.ai Image-to-Video는 AI 영상 생성 모델에 특화된 블라인드 테스트 평가 서브 플랫폼으로, 현재 이미지-투-비디오 모델의 능력을 평가하는 중요한 제3자 참고 지표이며 전 세계 국제 주류 AI 기업들이 널리 인용한다.
글로벌 AI 경쟁 구도 속에서 보면, 이 성적의 의미는 순위 자체를 훨씬 뛰어넘는다. 멀티모달은 현재 글로벌 인공지능의 핵심 전장이며, 이미지-투-비디오는 그중에서도 기술 밀도가 가장 높고 경쟁이 가장 치열한 방향 중 하나다. HD-V1은 두 개 리더보드에서 높은 순위의 성적으로 글로벌 첫 등장을 완수했으며, 이는 중국의 우수한 대형 모델 기업이 이미 전면적으로 앞서 나가 글로벌 AI 영상 모델 제1티어를 형성했음을 의미한다.
즈샹웨이라이 CTO 야오팅(姚霆)은 다음과 같이 밝혔다. “HiDream-O1-Video-1.0은 즈샹의 네이티브 전모달 월드 모델 매트릭스의 핵심 구성 요소입니다. 우리는 영상 생성의 세대적 진화가 단순히 픽셀의 향상과 길이의 연장이 아니라, 모델이 창작자의 의도와 실제 세계의 물리 법칙을 진정으로 이해하는지에 달려 있다고 늘 믿어 왔습니다. HD-V1은 아키텍처 설계 초기부터 텍스트, 영상, 오디오의 통합 표상을 지향했으며, 네이티브 전모달 기술은 이를 ‘선명하게 보이고 매끄럽게 움직이는’ 단계에서 ‘알아듣고, 정확히 말하고, 일관되게 연기하는’ 단계로 나아가게 합니다. 이번에 두 국제 권위 리더보드에서 다시 제1티어에 진입한 것은 즈샹의 네이티브 전모달 기술 노선에 대한 가장 직접적인 검증입니다.”
01. 네이티브 전모달, 의도를 더 잘 알고 물리를 더 잘 안다
영상 생성의 어려움은 흔히 ‘그릴 줄 아느냐’가 아니라 ‘알아들었느냐’에 있다. 사용자 입력은 흔히 구어체이고 파편적이며 모호한 정보이다. 이를 그대로 모델에 던지면 의도 오해, 카메라 전환의 어긋남, 인물 드리프트, 음화 어긋남 등의 문제가 쉽게 발생한다.
이를 위해 HD-V1의 설계에는 멀티모달 의도 이해 모듈을 전치(前置)하여, 멀티모달 이해 모델의 심층 이해와 사고를 통해 영상 콘텐츠를 구조화하여 계획한다. 계획 내용에는 샷 길이, 장면 장소, 화면 내용, 첫 프레임 제약, 등장 캐릭터, 동작과 표정, 구도와 앵글, 카메라 무빙과 초점 거리, 대사와 배경음 등 음향 효과 설계 등의 필드가 포함된다. 이 모듈의 존재는 모델이 사용자의 자연어 입력 의도를 충분히 이해하고 모델이 받아들일 수 있는 전문적 표현으로 변환하도록 보장한다. 이해가 깊을수록 계획이 안정적이고, 계획이 안정적일수록 이후의 연합 생성이 ‘옆길로 새기’ 어렵다.
의도를 이해하는 것은 첫걸음일 뿐, HD-V1의 또 다른 중요한 돌파구는 ‘물리를 더 잘 아는 것’이다.
물체가 중력作用下 어떻게 떨어지는지, 충돌이 어떻게 반응하는지, 관성이 어떻게 이어지는지, 빛과 그림자가 어떻게 감쇠하는지, 공간이 어떻게 연속성을 유지하는지—이러한 물리 법칙은 모두 이해될 뿐만 아니라 영상 모델의 서사 속에 쓰여 들어가 화면 생성의 기층 논리가 된다.
물리 법칙이 생성 논리에 들어오자 화면의 사실적 질감이 전면적으로 향상된다. 다음 세 그룹의 데모는 동일한 프롬프트 아래 세 개의 업계 최정상 모델이 생성한 영상 비교이며, 세 번째 데모가 HD-V1이 생성한 것이다(전문 모두 동일).
모델 1의 화면에서는 양손이 서로를 향해 힘을 가하는데, 빨간 실이 안쪽으로 짧아지는 ‘불합리한’ 현상이 나타났다. 모델 2는 갑자기 허공에서 바늘이 하나 생겨났다. 반면 HD-V1이 생성한 화면은 전혀 다르다. 양손이 서로를 향해 힘을 가할 때 빨간 실이 자연스럽게 융기하여 모델 1과 뚜렷한 대비를 이룬다. 왼손 엄지로 실끝을 바깥으로 살짝 비틀면 빨간 실이 손의 힘에 따라 순조롭게 뻗어나가며, 장력과 진행 방향, 변형이 모두 실제 물리에 부합한다. 게다가 화면은 매우 뛰어난 사실적 질감을 지녀, 손톱의 결, 바늘의 금속감 등이 매우 사실적으로 표현되며 심지어 실의 유연함까지 느껴진다.
02. 화면 고충실도, 서사 연속성, 인물 일관성 전면 업그레이드
고충실도 화질, 서사 연속성, 인물 일관성 등 핵심 지표에 대해 HD-V1은 전면적인 최적화 업그레이드를 실현했다. 이는 단일 프레임 화면의 정교함만을 추구하는 것이 아니라, 영상 콘텐츠가 전체 서사 차원에서 자기 정합적이도록 만드는 것이다.
인물, 감정, 동기, 물리 법칙은 일단 연속된 숏에 들어가면 필연적으로 서로 영향을 주고받는다. 이를 위해 즈샹은 ‘먼저 계획하고, 이후 연합 생성하며, 다시 멀티모달 Reward로 정렬한다’는 기술적 사고를 제시했다. 모델이 먼저 전역 차원에서 서사와 캐릭터 상태를 계획하고, 이어서 연합 생성에서 화면, 동작, 의미를 제약하며, 마지막으로 멀티모달 보상 신호로 화질, 연속성, 물리적 합리성을 정렬하도록 하는 것이다.
03. 서사 내용에 복종하는 영상 생성 길이의 논리 혁신
대부분의 영상 생성 길이는 고정 프롬프트 노선을 따른다. 예를 들어 사용자가 프롬프트에 5초 생성을 입력하면, 모델은 그 시간 창 안에서만 내용을 채울 수 있고 내용 서사는 ‘강제로’ 길이에 적응한다.
HD-V1의 방식은 길이 결정을 내용 자체에 되돌려주는 것이다. 모델은 사건이 전개되는 논리, 동작이 완성되는 주기, 서사가 진행되는 리듬에 따라 스스로 생성 길이를 계획한다. 이 능력의 관건은 단순히 프레임 수를 바꾸는 것이 아니라, 길이 선택을 내용 상황과 결부시켜 사용자의 진정한 목표—연속된 서사 속에서 합리적이고 사실적인 질감의 완전한 화면을 전달하는 것—에 봉사하게 하는 데 있다.
마찬가지로 세 모델의 실제 비교다. 앞의 두 모델은 모두 ‘기계적으로’ 10초 화면을 생성했지만, 사과 하나가 던져져서 받아지는 것은 본래 짧은 과정으로 10초를 꽉 채울 필요가 없다. 그래서 모델 1은 동작이 끝난 뒤 3초부터 손이 계속 사과를 쥐고만 있게 되어 화면이 무의미한 대기 속에 머문다. 모델 2는 슬로모션 형식으로 길이를 채운다. 반면 HD-V1이 생성한 화면은 인물이 던지고, 받고, 안정적으로 손에 쥐는 리듬이 자연스럽게 발생한다.
04. 텍스트, 영상, 오디오 신호 연합 모델링으로 음화 네이티브 일체화 생성
음화 비동기화는 AI 영상 생성 모델의 보편적인 고질병이다. 이는 현재 대부분의 영상 모델이 채택한 후반 합성 기술 노선 때문이다. 즉 프레임별로 화면을 먼저 생성한 뒤 되돌아가 음성과 음향 효과를 입히는데, 소리와 화면이 일치하기 어렵다.
HD-V1은 네이티브 전모달 아키텍처를 채택해 텍스트, 영상, 오디오 신호를 연합 모델링한다. 세자는 동일한 생성 과정에서 서로 제약하고 서로 정렬한다. 화면 운동이 소리 리듬을 끌어당기고, 대사와 음향 효과가 숏의 정서를 되먹이며, 텍스트 조건이 처음부터 끝까지 관통한다. 이러한 연합 모델링은 음화 동기화와 서사 연속성에 직접적으로 기여한다. 숏이 전환될 때 환경음과 배경 음악이 따라 전환되고, 인물이 입을 열 때 입모양, 호흡, 감정이 같은 주파수에 놓이며, 물리 동작이 발생할 때 효과음과 충돌 반응이 실제 인과에 더 가까워진다.
이것은 탁구공이 탁자 위에서 튀는 화면이다. 세 모델이 생성한 화면을 보면, HD-V1이 생성한 콘텐츠만이 탁구공이 떨어지는 리듬이 물리 법칙에 부합할 뿐만 아니라, 떨어질 때마다 나는 소리도 높이 변화에 따라 달라져 현실 질감에 완전히 부합한다. 실제 세계의 질감을 구현하는 근원은 모델의 기술·제품 철학, 즉 사람의 느낌을 척도로 삼는 데 있다. 이를 위해 후학습 단계에서 Diffusion Reinforcement Learning을 채택하고, 인간 인지와 정렬된 멀티모달 Reward 모델을 설계해 음영상 콘텐츠를 화면에서 소리까지, 국부에서 전체까지 통일적으로 평가한다.
05. 월드 모델 폐쇄 루프 완성, 단일 능력에서 네이티브 전모달 매트릭스로
올해 4월 네이티브 전모달 월드 모델 아키텍처 HiDream-O1을 정식 발표한 이래, 즈샹은 같은 아키텍처를 기반으로 한 모델 패밀리를 잇달아 발표했으며, 이 몇款 모델도 각자의 트랙에서 국제 권위 리더보드의 선도적 위치를 각각 차지했다.
이미지 생성 모델 HiDream‑O1‑Image 시리즈 중 상용 버전 1.5 버전은 국제 독립 평가 플랫폼 Artificial Analysis 텍스트-투-이미지 리더보드에서 중국 1위, 글로벌 2위의 성적을 거뒀고, 오픈소스 버전도 2위의 성적을 거뒀다.
인터랙티브 월드 모델 HiDream‑O1‑World는 업계 최초의 인터랙티브 월드 모델 벤치마크 WBench 종합 총榜 1위에 올랐다.
임바디드 월드 모델 HiDream‑O1‑Embodied는 RoboColiseum의 교란 적응과 공간 추론 서브 리더보드에서 잇달아 정상에 올랐다.
영상 모델의 정식 발표와 함께 업계 최초의 네이티브 전모달 월드 모델 폐쇄 루프가 완성되었다. 이미지, 영상, 3D 인터랙션과 임바디드 동작이 통일된 네이티브 월드 모델 안에서 교차하고, 공생하며, 순환한다.
즈샹 창립자 메이타오(梅涛) 박사는 다음과 같이 밝혔다. “차세대 인공지능 기술 노선에 대한 우리의 인식을 바탕으로, 즈샹은 ‘하나의 네이티브 전모달 기반, 네 개 대형 모델 동원(同源) 진화’의 모델 매트릭스를 구축하는 데 힘쓰고 있습니다. 우리가 구축하는 것은 서로 독립된 네 개의 능력선이 아니라, 통일된 기술 아키텍처를 기반으로 하고 월드 모델을 향해 지속 진화하며 실착지 가능한 방향으로 나아가는 네이티브 전모달 체계입니다.”
06. C+ 라운드 투자 유치 확정, 국유 산업 자본 연합 재차 베팅
HD-V1 발표 즈음해 즈샹은 동시에 C+ 라운드 투자 유치 완료를宣布했다. 이번 투자자는 신웨이쯔번(新微资本), 자오쯔쯔번(交子资本), 궁인쯔번(工银资本)이며, 이는 자본시장이 회사의 네이티브 전모달 기술 노선, 월드 모델 포지셔닝 및 산업화 잠재력에 대한 높은 인정을 보여준다.
신웨이쯔번은 상하이 신웨이커지그룹(上海新微科技集团), 상하이커촹툰그룹(上海科创投集团) 및 경영팀이 공동 발기해 설립했으며, 운용 펀드 규모는 약 백억 위안에 달한다. 신웨이그룹의 CVC로서 신웨이쯔번은 인공지능 트랙에서의 포지셔닝을 지속 강화하고 있으며, 신웨이그룹의 집적회로 특색 공정 제조 분야 산업 기반에 의지해 AI 시대에 지속적 경쟁력을 갖춘 신웨이 산업 생태계를 구축하고 있다.
신웨이쯔번은 다음과 같이 밝혔다. “즈샹웨이라이의 네이티브 전모달 월드 모델 매트릭스는 위로는 컴퓨팅 파워와 AI 인프라에 연결되고, 아래로는 스마트 단말과 산업 응용으로 확장되어, 신웨이그룹의 산업 포지셔닝과 매우 잘 맞물립니다. 앞으로 신웨이는 제조 능력으로 컴퓨팅 파워 인프라를 뒷받침하고, 산업 자원으로 모델의 실착지를 가속화해 즈샹웨이라이가 월드 모델 시대의 핵심 자리를 차지하도록 돕겠습니다.”
자오쯔쯔번은 청두 자오쯔진쿵그룹(成都交子金控集团) 산하 전액 국유 주식 투자 플랫폼이자 청두가 서부 금융센터를 건설하는 중요한 산업 자본 운반체이며, 운용 펀드 규모는 1700억 위안을 초과한다. 청두를 의지하고 서부로 방사하며 전국과 연결되는 자오쯔쯔번은 인공지능 등 하드테크 트랙에 집중해 장기 자본과 산업 자원으로 과학기술 성과의 전환과 산업 생태계 건설을 추진한다.
자오쯔쯔번 관계자는 다음과 같이 밝혔다. “즈샹웨이라이는 이미지, 영상, 3D 인터랙션과 임바디드 네 개 대형 모델의 동원 진화를 지속 추진하며, 저층 아키텍처를 둘러싸 지속 혁신해 네이티브 전모달 월드 모델 매트릭스를 구축하고 있습니다. 이 노선은 업계에서 뚜렷한 희소성과 선도성을 지닙니다. HiDream-O1-Video-1.0의 발표는 모델 매트릭스의 핵심 한 고리를 채워 회사 기술 노선의 전향성과 실착지 능력을 더욱 검증했습니다. 우리는 국유 산업 자본의 장기 동행과 자원 협력 역할을 발휘해 즈샹웨이라이가 글로벌 경쟁력을 갖춘 AI 기업으로 성장하도록 돕고, 청두를 견인하고 서부 인공지능 산업 생태계 건설로 방사되기를 기대합니다.”
HD-V1 영상 모델의 발표와 함께, 네이티브 전모달에서 월드 모델로 통하는 길은 더 이상 전략적 청사진이 아니라, 폐쇄 루프로 발전하고 지속 진화하는 현실이 되었다.