Issue 01중국 AI
AC POST
중국 AI 목록
量子位2026년 9월 16일 11:58중국어 → 한국어

Vidu S2, 실시간 인터랙션·영상 편집·공간 영상 기능 공개

Vidu S2가 실시간 인터랙션, 실시간 영상 수정, 공간 영상 탐색 등 세 가지 기능을 한 번에 선보였다.

중국어 원문을 AI로 번역했습니다. 고유명사와 수치는 원문 표기를 우선하며, 중요한 판단에는 아래 출처 원문을 함께 확인하세요.

린, 팡저우 2026-09-16 10:58:34 출처: 량쯔웨이(量子位)

노아 발신 어우페이쓰(凹非寺)

량쯔웨이 | 위챗 공식계정 QbitAI

저처럼 매일 AI 고양이·강아지 숏폼 영상 보며 실실 웃는 분 계신가요? 시청자들이 AI를 안 좋아한다고요? 이 AI는 정말 훌륭합니다! (전술적 뒤로젖힘.jpg)

오늘, 여러분께 희소식입니다! 성수과기(生数科技)가 Vidu S2 모델을 발표했는데, 가상 디지털 캐릭터와 실시간으로 상호작용할 수 있을 뿐만 아니라, 재생 중인 영상을 보면서 현장에서 의상 교체, 인물 교체, 배경 교체, 화풍 교체까지 할 수 있습니다.

화면 속 새끼 강아지 남자친구에게 정장 한 벌 입히고 싶든, 2차원 아이돌을 1초 만에 사이버펑크 스타일로 바꾸고 싶든, 심지어 사장님을 "비명 지르는 닭"으로 만들고 싶든…… 전부 매끄럽게 해냅니다.

디지털 휴먼 쪽도 새로운 "일"을 받기 시작했습니다: 춤추기, 몸 돌리기, 입만 움직이면 지시할 수 있고, 대화 도중에 참고 이미지를 하나 건네면 같은 옷으로 갈아입고 지정된 물건을 집어 들게 할 수도 있습니다. 아이디어는 당신이 내고, 연출은 그것이 담당합니다.

이야, 이건 AI 영상 생성 모델이 아니라 "모(某)지누안누안 Pro Max 감독판"이잖아요!

이 신기한 능력은 성수과기가 최신 발표한 Vidu S2에서 나온 것으로, 디지털 휴먼을 더 잘 말하고 움직이게 할 뿐만 아니라, 사진을 보정하듯 영상을 보정하고 재생하면서 동시에 수정할 수 있게 합니다.

알아두실 점은, 불과 두 달 전에 이전 버전인 Vidu S1이 막 "디지털 휴먼이 정령이 되다"는 게 무엇인지 보여줬다는 것입니다. 디지털 휴먼은 "오디오로 입모양 구동 + 사전 설정 동작 라이브러리"에 의존하던 전통적 방식을 벗어나, 음성으로 디지털 휴먼의 행동을 제어하고 무한한 길이의 연속 상호작용까지 구현할 수 있게 진화했습니다.

Vidu S1은 출시되자마자 누리꾼들이 온갖 재미있는 방식으로 활용했습니다. 어떤 이는 자기 고양이 사진을 모델에 넣고 말을 시키게 했고, 어떤 이는 코딩 화면을 모델에 전달해 "프로그래머 격려사" 아가씨 역할을 맡겼으며, 또 어떤 이는 돌아가신 가족을 "부활"시켜 서로 그리움을 토로하게 했습니다…

이번 Vidu S2는 전방위 업그레이드를 가져왔으며, 한 번에 세 가지 큰 기술을 내놓았습니다:

- S2-Editing: 입력 중인 영상을 실시간으로 의상 교체, 역할 교체, 배경 교체, 스타일 교체할 수 있습니다. 이번에 가장 먼저 써볼 만한 업그레이드로, 영상판 "모(某)투슈슈"라 할 만합니다;

- S2-Avatar: 실시간 상호작용 캐릭터가 720P로 업그레이드되었고, 중간에 건네지는 물건 참고 이미지도 받아들여 지시에 따라 집어 들고 보여주며 더 풍부한 신체 퍼포먼스를 완성합니다.

- 실시간 공간 영상 탐색: 생성 또는 편집된 영상을 좌우안 화면으로 추가 변환해 VR 헤드셋에 전달하고, 캐릭터와 더 깊이감 있는 상호작용을 탐색합니다.

게다가 Vidu S2는 발표 당일 전면 개방되어, 내부 테스트도 없고 인원 제한도 없습니다. 이번 행보는 정말 "기술 자신감"을 이마에 써 붙인 셈입니다!

모델 실측, 이 AI가 몰래 마술을 배운 건가?

관례대로, 먼저 이번에 업데이트된 Vidu S2를 한 번 테스트해 보겠습니다.

Vidu S2는 두 가지 세부 모델을 포함합니다:

Vidu S2-Avatar: 실시간 상호작용 모델로, 음성 대화, 음성으로 디지털 휴먼 동작 제어, 실시간 상호작용 중 참고 이미지 입력을 지원합니다

Vidu S2-Editing: 실시간 영상 편집 모델로, 의상, 인물, 배경 및 영상 스타일을 바꿀 수 있습니다

관례대로, 먼저 실측에 들어갑니다. 먼저 Vidu S2-Avatar를 보면, 상호작용 과정에서 새로운 참고 이미지를 받아들일 수 있을 뿐만 아니라 동작 지시를 수행하는 능력도 업그레이드되었습니다.

얼마나 발전했을까요? 이전 세대를 불러와 같은 화면에서 비교해 보면 알 수 있습니다.

똑같이 디지털 휴먼에게 춤추기, 몸 돌리기, 발 구르기를 시키면, 왼쪽의 S1은 요구를 완수하지 못했고, 오른쪽의 S2는 지시에 따라 움직였습니다.

예전에 S1은 주로 대화 상호작용이었는데, 이제 S2는 큰 폭의 신체 동작까지 갖췄습니다. "입으로만 대답하기"와 "몸으로 실천하기"의 차이가 이제야 화면으로 드러났습니다.

동작이 지시를 더 잘 따를 뿐만 아니라 화면도 더 선명해졌습니다. Vidu S2-Avatar는 실시간 출력 해상도를 이전 세대의 540p에서 720p로 끌어올려, 디지털 캐릭터의 얼굴과 옷의 디테일 등이 더 풍부해졌습니다. 이러한 향상은 지속적 상호작용에서 매우 직관적입니다: 인물이 움직이고 대화가 이어지는 만큼, 선명도도 따라가야 합니다.

다음은 참고 이미지가 활약할 차례입니다.

상호작용 과정에서 언제든지 디지털 휴먼에게 새 이미지를 건넬 수 있어, 그림 속 물건을 집어 들게 하거나, 지정된 옷으로 갈아입히거나, 새로운 장면으로 들어가게 할 수 있습니다. 지시를 듣고 동작할 수 있을 뿐만 아니라 참고 이미지에 맞춰 내용을 조정할 수 있으니, 이 디지털 파트너가 받을 수 있는 "일"이 확실히 더 많아졌습니다.

이어서 Vidu S2-Editing을 보겠습니다. 그것이 가져온 실시간 영상 편집 능력은 이번 최대 업데이트 중 하나입니다.

화면을 인터뷰 중인 한 여성에게 맞추고, 1초 만에 다른 스타일의 의상으로 바꿉니다. 모두 매우 잘 맞아서 마치 원래 그녀가 입고 있던 것 같습니다.

인물 동작이 연속적이고 얼굴 일관성이 매우 좋으며, 의상이 동작에 따라 만들어내는 변형도 매우 사실적입니다. 특히 마지막 카멜색 코트는 소매가 여성이 착용한 장신구를 반쯤 가리는데, 처리가 매우 사실적입니다.

억지로 흠을 잡자면, 두 번째 옷은 색면을 표현할 때 여전히 약간 발림(번짐) 느낌이 있고, 인물이 모자를 쓸 때 머리카락이 여전히 약간 뚫고 나오는(관통) 문제가 있습니다.

의상 교체뿐만 아니라 배경도 교체할 수 있습니다. 이 영상을 보세요, 아가씨가 각 장면에서 매끄럽게 걸그룹 댄스를 추는데, 제작이 정교한 뮤직비디오를 보는 것 같습니다.

배경은 그대로 두고 사람만 바꾼다고요? "우라이(牛来) 2"가 온다던데요? 사무실에 있던 제가 우라이가 되어 여러분께 say hi……

헐! 야근을 하다 환각이 생긴 것 같습니다.

가장 황당한 건, 제가 변한 이 이상한 것들이 완벽하게 사무실 환경에 융합되어 원근감, 가림 처리 모두 흠잡을 데가 없다는 것입니다. 직장인 여러분께 이 기능을 즐겨찾기 해두라고 권합니다. 회의할 때 자신을 재신(財神)으로 바꾸면, 어쩌면 사장님도 당신을 더 좋게 보실지도 모릅니다.

이어서 영상 스타일 변환의 성능을 보겠습니다.

오빠가 여러 스타일로 전환하는데, 영상 전반의 화면 일관성과 스타일 전이 능력이 상당히 좋게 나타났습니다!

간단히 정리하자면, Vidu S2-Editing은 진행 중인 화면에 네 가지 실시간 편집 능력을 제공합니다:

- 실시간 인물 의상 교체: 타오바오 판매자, 코디 블로거 대환영

- 실시간 배경 교체: 집 밖에 나가지 않고 세계일주

- 실시간 주체 캐릭터 교체: 만물이 다 일할 수 있고, 재신까지 포함

- 실시간 스타일 렌더링: 심미적 피로? 필터만 바꿔서 계속 신나게

이는 라이브 방송의 시각 효과, 가상 캐릭터의 공연, 창의적 영상의 놀이법에 즉석에서 발휘할 수 있는 공간이 더 많아졌다는 것을 의미합니다.

시청자가 댓글로 "BJ가 공룡 옷 입은 거 보고 싶다"고 보내면, 다음 순간 정말로 입을 수도 있습니다. 시청자는 이야기하다가 감독이 되고, BJ는 연기하다가 NPC가 됩니다.

69일 만에 완성된 버전 교체

단 69일 만에 Vidu S2는 큰 버전 도약을 완성했습니다. 영상 모델 업계는 이제 정말 치열해졌습니다!

두 달 전, Vidu S1의 등장도 마찬가지로 놀라웠는데, 이 "선배"를 되짚어볼 필요가 있습니다. Vidu S1, Vidu S2의 전 링크(풀체인) 연구개발은 모두 칭화대학 주쥔(朱軍) 교수의 박사과정생이자 성수과기 스트리밍 영상 생성 및 추론 책임자인 장진타오(張金濤)가 담당했습니다.

이전 대다수 디지털 휴먼은 "오디오로 입모양 구동 + 사전 설정 동작 라이브러리"의 전통적 방식으로, 본질적으로 움직이는 PPT와 큰 차이가 없었습니다.

반면 Vidu S는 AI 영상을 "오프라인 생성"에서 "실시간 상호작용"으로 도약시켰습니다. 사진 한 장만 업로드하면, 모델이 당신과 실시간으로 상호작용할 수 있는 AI 캐릭터를 생성합니다.

여기서 중요한 점을 짚어야 합니다: 실시간 상호작용 영상은 전통적인 영상 생성 모델과 다른 길을 갑니다.

실시간 상호작용 영상의 모든 프레임은 사용자 입력에 따라 현장에서 계산됩니다. 이는 모델의 생성 속도가 재생 속도를 앞질러야 한다는 뜻이며, 그렇지 않으면 사용자가 보는 것은 PPT식 멈칫거림입니다.

이는 단순히 "생성 속도를 끌어올리면" 끝나는 게 아니라, 전체 생성 파이프라인을 재구성해야 하는 일입니다. 팀은 SageAttention 등의 기술로 계산 속도를 높이고, 다시 다중 GPU 협업 스케줄링으로 모듈 간 대기를 줄여, 그래픽카드가 덜 놀고 전체 생성 파이프라인이 더 매끄럽게 돌아가게 했습니다.

S2에 이르러, 이 상호작용은 한 걸음 더 나아갔습니다: 화면이 540p에서 720p로 향상되었고, 디지털 휴먼이 더 복잡한 동작을 수행할 수 있으며, 상호작용 중 새로운 참고 이미지를 받아들일 수 있고, 새로 추가된 Editing 모델은 의상 교체, 인물 교체, 배경 교체와 화풍 변경을 실시간 영상 스트림에 끌어들였습니다.

또한, 따로 짚고 넘어갈 만한 일이 하나 있습니다.

최근 "실시간 공간 영상"이 영상 모델 업계의 경쟁 최전선이 되었는데, 업계에 이제 막 배치를 시작한 회사도 있는 반면, 성수는 이미 공간 영상을 체험 가능한 제품으로 만들었습니다.

이른바 공간 영상은 3차원 입체 깊이와 몰입감을 표현할 수 있는 입체 영상 형식입니다. 이는 인간의 양안 입체 시각 원리에 기반하며, 두 개의 서로 다른 시점(예를 들어 메인 카메라와 초광각 카메라)으로 영상을 동시 촬영하여, 경물의 입체 깊이 정보를 기록합니다.

공간 영상은 공간 컴퓨팅을 지원하는 기기, 예를 들어 Apple Vision Pro에서 시청해야 하며, 일반 기기에서는 그저 평범한 2차원 영상일 뿐입니다.

오늘날 Vidu S2-Avatar를 기반으로, 사용자는 실시간으로 공간 영상을 생성할 수 있고, Vidu S2-Editing을 기반으로, 사용자는 실시간으로 공간 영상을 편집할 수도 있습니다.

일반 영상 한 편을 실시간으로 공간 영상으로 변환할 수 있고, 헤드셋 카메라를 통해 보이는 실제 물리 세계를 "캔버스"로 삼아 창작할 수도 있습니다.

즉, Vidu S2는 AI 캐릭터가 화면 안에서 당신과 상호작용하게 할 뿐만 아니라, 그들을 "화면 밖으로 나오게" 할 계획입니다.

물론 팀도 솔직하게 밝혔습니다: 헤드셋은 해상도와 지연에 대한 요구가 극도로 엄격하여, 화면이 흐려지면 어지럽고, 지연이 높으면 고개를 돌릴 때와 화면이 "충돌"합니다. 이 부분은 지속적으로 최적화 중입니다.

향후 팀은 고정 시점에서 전방위 공간 영상으로 확장하여, 고개를 돌리면 AI가 생성한 장면을 자유롭게 탐색할 수 있게 할 계획입니다. 메타버스가 정말 실현되는 걸까요?! (doge)

기술 해부: "재생하면서 동시에 수정"은 어떻게 가능한가?

이 놀라운 영상 효과를 본 후, 질문이 생깁니다: Vidu S2는 도대체 어떻게 해낸 걸까요?

데이터 처리 측면에서, 디지털 휴먼이 더 풍부한 동작과 표정을 표현하도록 하기 위해 팀은 댄스, 2D 애니메이션, 3D 애니메이션 등의 학습 소재를 보강하고, 조건에 부합하는 영상에 배경 안정화 처리를 하여, 큰 폭의 동작을 보존하면서 카메라 움직임이 가져오는 간섭을 줄였습니다.

주석(라벨링) 방식도 연속 상호작용을 중심으로 재설계되었습니다: 사건이 발생한 순서에 따라, 동작이 언제 시작되고, 어떤 변화를 가져오며, 끝난 후 인물이 어떤 상태에 있는지를 기록합니다. 세그먼트 설명은 사건 경계에 따라 구분되며, 학습 시 각 시간 세그먼트마다 대응하는 조건이 있습니다. 이로써 "손을 들고, 컵을 집어 들고, 컵을 든 채 계속 말하기"에서의 동작 연결과 상태 변화에 더 명확한 학습 근거가 생겼습니다.

스트리밍 학습은 줄곧 어려운 점이었는데, 이 과정이 마치 릴레이 경주와 같기 때문입니다: 다음 화면 조각이 앞 조각에 이어져 나아가므로, 앞쪽의 작은 편차도 계속 전달될 수 있습니다.

Vidu S2는 먼저 Hybrid Forcing을 통해 조각별 생성을 익히고, 그다음 모델이 자신이 만들어낸 편차를 이어받는 연습을 하도록 했습니다. 이를 위해 Vidu S2는 Self-Replay Forcing을 도입했습니다: 먼저 모델이 영상 한 단락을 연속 생성하게 하고, 그다음 생성 결과에 블록 단위로 노이즈를 더해, 훈련 가능한 인과적 재생(causal replay)을 한 번 수행합니다.

이번 "복기"는 앞뒤 조각을 연결해 학습하여, 이후 조각의 학습 피드백이 앞선 조각의 표현에도 영향을 미칠 수 있게 하여, 모델이 다음과 같은 것을 익히도록 돕습니다: 앞쪽에 편차가 생겨도 뒤쪽은 최대한 안정적으로, 매끄럽게 이어붙일 수 있다는 것.

다음은 화질과 실시간성 문제입니다. Vidu S2는 Backbone-Refiner 2단계 아키텍처를 채택했습니다. Backbone은 먼저 저해상도에서 화면의 주체 구조, 운동 및 의미 내용을 생성하여 "화면 안에 무엇이 있고, 무엇을 하고 있는지"를 확정하고, Refiner가 이어서 디테일을 생성하여 화면을 더 선명하게 만듭니다.

두 명의 화가가 협업하는 것으로 이해할 수 있습니다: 한 명은 밑그림과 동작을 잡고, 다른 한 명은 정교하게 다듬습니다.

핵심은, 두 사람이 줄 서서 기다릴 필요가 없다는 것입니다. 비동기 파이프라인을 통해, 디테일 재구성과 후속 내용 생성이 병행 추진되어, 모델이 720P 출력에서도 프레임을 떨어뜨리지 않게 합니다.

의상 교체, 배경 교체가 "재생하면서 동시에 수정"을 할 수 있는 것은 "타임스탬프 정렬"에 힘입은 바입니다.

사용자가 중간에 옷 이미지를 하나 보내면, 모델이 알아야 하는 것은 "무엇으로 바꿀지"뿐만 아니라 "언제부터 바꿀지"입니다.

Vidu S2는 위치 인코딩을 재설계하여, 참고 이미지의 주입 위치를 타임스탬프와 정렬시켜, 모델이 새로운 조건이 어느 시점부터 효력을 발휘해야 하는지 알게 합니다.

따라서 새 참고 이미지 속 내용은 지시에 따라 후속 화면에 들어갈 수 있고, 운동과 조명의 연속성을 유지하여 생성 조건의 매끄러운 전환을 구현합니다.

모델이 의상 교체만 할 줄 알아서는 부족하고, 상황을 보고 바꾸는 것도 배워야 합니다. 그래서 Vidu S2는 현장을 지켜보는 "집행 감독" 하나를 불러들였습니다: VLM Agent.

실시간 상호작용 시, 사용자가 연달아 요구를 제기할 수 있습니다. 모델은 다음 단계를 실행하기 전에 먼저 파악해야 합니다: 화면 안에 지금 무엇이 있는가? 인물이 지금 무엇을 하고 있는가? 이전 지시가 다 실행되었는가?

VLM Agent는 시각 언어 모델 기반의 지능형 에이전트로, 이미 생성된 화면을 지속적으로 해석하고 이러한 상태를 추적한 다음, 이를 근거로 후속 생성을 계획하고, 적절한 시점에 생성 조건을 조정하여, 상호작용이 화면 상태와 사용자 의도를 더 잘 결합하게 합니다.

마지막은 강화 학습입니다. Vidu S2는 양방향과 스트리밍 두 단계 모두에 선호 및 보상 최적화를 추가하여, 모델이 생성하는 내용이 사람의 기대에 더 부합하게 했습니다.

양방향 단계에서는 DPO를 채택하여 화질, 표정, 동작 자연스러움과 음화 동기화를 개선하고, 후속 스트리밍 학습에 더 강력한 교사 모델을 제공합니다.

스트리밍 단계에서는 Streaming NFT를 채택하여 지속 생성 작업을 담당하는 인과 모델을 직접 최적화합니다. 모델이 먼저 자신의 영상 궤적을 생성하고, 다시 SRF의 재생(replay) 방식을 따라 보상 최적화를 진행하여, 학습이 실제 실행 시의 상태에 근접하게 하고, 화질, 동작 제어성과 지시 준수를 더욱 향상시킵니다.

Vidu S1의 음성 상호작용에서, Vidu S2의 더 선명한 화면, 더 정확한 동작 반응, 언제든 참고 이미지 추가와 실시간 영상 편집, 나아가 공간 영상 체험에 이르기까지, 인간과 AI의 상호작용은 점점 더 자연스럽고 풍부해지고 있습니다.

가상 디지털 휴먼이 당신이 지금 무엇을 하는지 이해하고, 즉시 지시에 따라 행동한다는 것은 2년 전만 해도 꽤 공상과학처럼 들렸습니다. 이제 Vidu S2는 그것을 라이브 방송에서 아무렇게나 클릭 한 번으로 되는 기능으로 만들었으니, 곰곰이 생각해 보면 참 신기합니다.

포털:

바로 체험:

https://vidu.cn/vidu-stream

️ API 플랫폼:

http://platform.vidu.cn/vidu-stream/doc

기술 보고서:

https://arxiv.org/pdf/2609.11638