Issue 01중국 AI
AC POST
중국 AI 목록
量子位2026년 9월 16일 22:08중국어 → 한국어

ZDTaichu5.0-9B 국산 오픈소스, 공간 구현지능 8개 항목 1위

10B 규모 범용 모델을 대상으로 한 9개 공간 테스트에서 8개 항목 1위를 기록한 ZDTaichu5.0-9B가 오픈소스로 공개됐다.

중국어 원문을 AI로 번역했습니다. 고유명사와 수치는 원문 표기를 우선하며, 중요한 판단에는 아래 출처 원문을 함께 확인하세요.

루위(鹭羽) 2026-09-16 21:08:20 출처: 量子位

아홉 개의 공간 테스트에서 10B 규모 범용 모델 중 8개 항목 1위

루위(鹭羽) 발신 · 凹非寺

量子位 | 위챗 공식계정 QbitAI

왔다! 이번에는 국산 멀티모달이 물리 세계에서도 힘을 제대로 발휘했다——

아홉 개의 국제 권위 공간 이해 벤치마크 테스트에서 8개 항목 압도적 1위, 게다가 범용 능력도 전혀 떨어지지 않는다.

즈둥타이추(紫东太初)가 최신 공개한 범용 멀티모달 대형 모델 ZDTaichu5.0-9B는 10B 이하 범용 모델의 공간 구현(具身) 상한선을 또 한 번 크게 끌어올렸다.

여기서 어떤 분은 이렇게 물을 수 있다. 멀티모달이 현실 세계를 이해하게 하는 것이 왜 굳이 따로 언급할 가치가 있는가?

한 글자로: 어렵다!

과거의 멀티모달 모델은 이미 한 장의 이미지를 조목조목 이해할 수 있었지만, 일단 실제 물리 세계로 들어서면 공간 이해와 행동 능력이 따라가지 못하는 경우가 많았다. 그리고 일부 모델은 공간 능력을 보완하기 위해 어쩔 수 없이 범용 능력을 희생하는 대가를 치러야 했다.

이 두 가지를 동시에 해내는 모델은 극소수이고, 효과까지 두드러지는 모델은 더더욱 드물다.

즈둥타이추가 바로 그중 하나이며, ZDTaichu5.0-9B는 그야말로 전능하다.

백문이 불여일견, 바로 효과를 보자.

영상 링크: https://mp.weixin.qq.com/s/aBak5FZaC6nhGpwkeL8hAg

이것은 ZDTaichu5.0-9B가 제어하는 커터칼 수납 시연이다.

사람이 한다면 매우 간단한 과정일 것이다: 서랍을 열고 → 넣고 → 다시 닫는다. 하지만 구현(具身)은 다르다. 일련의 동작 뒤에는 모두 상당히 세밀한 공간 판단이 깔려 있다.

칼자루는 어디에 있는가? 서랍 상태는 어떤가? 그리퍼는 제대로 겨냥했는가?

각 단계는 이전 단계가 가져온 변화를 이어받아야만 동작이 매끄러워 보일 수 있으며, 이는 모델 능력에 대한 시험이 극히苛刻(까다롭)다. 그런데 ZDTaichu5.0-9B는 이미 복잡한 공간 이해와 고수준 작업 계획을 완수할 수 있다.

동시에, 겨우 9B 크기에 불과한 이 모델의 이미지-텍스트 이해, 문자 인식, 수학 추론과 코드 능력 역시 여전히 최상위권을 굳건히 지킨다.

범용 능력은 등급이 떨어지지 않고, 공간 구현 능력은 위로 돌파한다.

대체 어떻게 해낸 것인지 매우 궁금하다.

공간 구현 + 멀티모달 양쪽 선도

이 질문에 답하기 전에, 몇 가지 효과를 더 살펴보며 느껴보는 것도 좋겠다.

먼저 공간 구현 문제 몇 가지로 맛을 보자.

영상 목표 위치 특정부터 세 시점 추론까지, 공간 판단은 정확하고 매섭다

첫 번째 문제 「물건 찾기」: 왼쪽에서 오른쪽으로, 두 번째 은색 상자를 찾아라.

이 공간 지각 과제는 로봇에게 있어 이후 작업을 수행하는 대전제다. 잘못 짚으면, 뒤의 파지 동작이 아무리 정확해도 다른 작업을 수행하게 된다.

△ 실측은 즈둥타이추가 완료

화면 속 작업대는 컵, 수납 용기와 각종 잡동사니로 가득 차 있어 방해 요소가 많다. 모델은 동시에 은색이라는 핵심 속성, 상자라는 대상, 그리고 왼쪽에서 오른쪽으로 두 번째라는 공간 배열 관계를 읽어내야 한다.

비교 시연을 보면, ZDTaichu5.0-9B가 제시한 정규화 좌표 (237,226)가 가장 정확하며, 목표 주석 영역 안에 떨어진다.

다음은 난이도 상승, 찾는 것뿐만 아니라 정확히 보는 것도 필요하다.

이것은 복잡한 공간 추론을 시험하는 「위치 보기」 문제다.

입력은 같은 방의 세 시점이다. 모델은 자신이 초록색 테두리 커튼이 있는 위치로 이동해 파란색 테두리 소파를 향한다고 상상하고, 빨간색 테두리 캐비닛이 자신을 기준으로 어느 방향에 있는지 판단해야 한다.

모델은 서로 다른 화면 속 대상들을 일일이 대응시키고, 새로운 관찰 위치와 방향에 따라 기준계를 변환해야 한다.

ZDTaichu5.0-9B는 오른쪽 앞쪽이라고 제시했으며, 예측이 완전히 정확했다.

한 걸음 더 나아가, 공간 판단은 또한 어디에 조작 조건이 갖춰져 있는지 답해 로봇의 다음 조작에 편의를 줘야 한다.

예컨대 이 「빈자리 찾기」 문제는 가장 오른쪽 컵의 손잡이 방향에서 비어 있는 영역을 찾으라고 요구한다.

컵을 알아보는 것은 시작일 뿐, 이후 손잡이 방향을 확정하고 옆이 다른 물체로 점유되었는지 확인해야 한다.

결과도 예상대로, ZDTaichu5.0-9B는 여전히 흔들림 없이 정확한 영역에 떨어졌다.

세 예를 함께 놓고 보면, 각각 목표 선택, 기준계 변환과 상호작용 조건 판단에 대응하며, 모두 로봇이 실제 물리 작업을 수행할 때 핵심 요소 역할을 한다.

다시 말해, 이런 기초 능력들이 구현(具身)이 하나의 작업 지시에서 진정 실행 가능한 것으로 나아갈 수 있는지를 결정한다.

이어서 전체 성적표를 보면, 모델의 우위가 더욱 명확해진다.

제시된 10B급 오픈·클로즈드 소스 모델 중에서 ZDTaichu5.0-9B는 거의 압도적 선두다.

예컨대 격차가 큰 MindCube-tiny의 경우, ZDTaichu5.0-9B의 점수는 78.27점이고, Gemma4 8B-E4B, Gemini 3 Pro와 Grok 4는 각각 48.8462, 70.87과 63.56이다.

전체 리더보드는 공간 지각, 3차원 추론, 다시점 변환, 구현 상호작용을 모두 포괄하고 있어, 그야말로 구석구석 빠짐이 없다. ZDTaichu5.0-9B가 물리 장면을 어떻게 조작해야 하는지 완전히 이해했음을 충분히 보여준다.

두 축 돌파, 범용 능력은 등급이 떨어지지 않는다

공간 능력을 시험한 뒤, 또 다른 중요한 질문이 뒤따른다: 범용 능력은 아직 버틸 수 있는가?

여기에도 기초 능력 성적표가 있다.

도해 이해 벤치마크 AI2D는 91.48점에 도달해 Gemini 3 Pro에 이어 2위이며, 다른 모든 대조 모델보다 높다.

WeMath는 75.9점으로 역시 앞서며, MathVista Mini는 84.5점, OCRBench는 85.5점으로 상당히 경쟁력 있는 성적을 보인다.

그 외에도 ZDTaichu5.0-9B는 Agent와 텍스트 작업에서도 여전히 두드러진 성적을 보이며, 특히 코드 성적이 그렇다.

이 능력들이 구체적으로 어떻게 조합되어 쓰이는지는 科研 Agent(과학연구 에이전트)의 감쇠 진동자(댐핑 진동자) 해법 데모가 직관적으로 보여준다.

이 문제는 Agent가 해석적 해법과 Python/SciPy 수치 계산을 조직하고, 두 결과를 대조하며, 마지막으로 위상 공간도, 변위와 속도 곡선, 그리고 분석 보고서를 생성하도록 요구한다.

ZDTaichu5.0-9B는 전 과정에서 조금도 흐트러짐 없이, 문제 이해, 코드 실행, 결과 확인과 도표 출력 네 단계 하위 작업 모두에서 완벽하게 연속 연결을 실현했고, 최종 출력이 매우 완전했다.

사실 이는 동일한 9B 모델에게 상당히 쉽지 않은 일이다.

공간 구현 능력과 범용 능력 두 축을 동시에 고려하려면, 그 배후에 데이터를 어떻게 조직할지, 그리고 복잡한 판단 시 연산력을 어떻게 배분할지 등 해결해야 할 것이 많다.

9B 멀티모달 대형 모델의 공간 구현 능력은 어떻게 완성되었나?

ZDTaichu5.0-9B가 제시한 해법은 학습 과 추론 두 부분을 관통한다.

풀스택 데이터 생산 파이프라인: 범용 능력, Agent 능력 그리고 공간 구현 능력을 모두 모델에 훈련시킨다

즈둥타이추는 먼저 이 요구를 중심으로 전 과정 검증을 거친, 재사용 가능하고 이전 가능한 데이터 엔지니어링 링크 한 세트를 조직했다.

전체적으로 세 단계 점진적 성장 단계를 포함한다:

Step 1: 사전 학습 데이터 파이프라인.

이 단계의 데이터는 오픈소스 이미지-텍스트, 웹 구조화 문서, 공개 영상 다시점 소재와 시뮬레이션 렌더링 3차원 장면을 포괄한다.

원본 소재가 파이프라인에 들어오면, 먼저 지각 해시 와 URL 을 통한 중복 제거를 거치고, 이어서 저해상도, 이미지-텍스트 무관 등 열등한 샘플을 필터링한 뒤, 내용 재작성 파싱과 영상 프레임 추출 설명을 진행하고, 최종적으로 학습 가능한 이미지-텍스트 및 시계열 입력으로 패키징해 조직한다.

최종적으로 구축되는 것은 시각, 언어, 시계열과 공간 개념 사이의 정렬된 연결이다.

Step 2: 지도 미세조정 데이터 파이프라인.

이어서 학습이 전체 작업을 포괄하기 시작한다.

오픈소스 SFT 지시, 실제 업무 질의응답, 공간 구현 사례, 그리고 Agent 도구 호출 궤적이 모두 다중 턴 대화, 다중 이미지와 영상 시퀀스로 조직된다.

그중 구현 샘플 의 경우, 파이프라인은 이미지, 질문, 대상 관계와 조작 제약이 일치하는지도 검사한다. 앞서 예로 든 커터칼 수납을 보면, 만약 그림 속 서랍이 닫혀 있다면 모델은 그리퍼에게 곧바로 안에 물건을 넣으라고 요구할 수 없다.

단계가 있는 사고 사슬 도 거부 샘플링, 형식과 일관성 검증을 거쳐야 한다. 이렇게 해야 학습에 들어가는 것이 시각적 근거가 있고 조작 순서를 설명할 수 있는 작업 샘플이 된다.

Step 3: 고품질 어닐링 + GRPO 강화학습 데이터 파이프라인.

마지막 단계는 계속해서 약점을 겨냥해 최적화한다.

팀은 데이터에 능력 영역-난이도-품질 레이블 3차원 자동 레이블 시스템 을 구축해, 모델을 위해 정보량이 높은 샘플을 선별한다.

주목할 점은, 평가 데이터는 학습 샘플로 직접 사용되지 않으며, 레이블도 능력 분류와 샘플 선별을 위한 참조를 제공하는 데만 쓰인다.

GRPO 는 답이 정확한지, 공간 좌표가 명중했는지, 출력 형식이 규정을 준수하는지를 모두 자동 검증 가능한 보상 신호로 전환해, 모델이 구체적 피드백을 따라 계속 개선하도록 한다.

그리하여 단계적으로 심화된 뒤, 물체 인식, 공간 관계와 작업 제약이 점차 연결되기 시작한다.

미래에는 기업 자체의 작업장 영상, 실험 조작 기록과 시뮬레이션 소재도 이 경로를 통해 학습 샘플로 전환될 수 있다.

내장 적응형 순환 추론: 연산력을 진짜 어려운 판단에 쓴다

하지만 학습 데이터는 기초를 다진 것일 뿐, 그 위에서 매 추론의 난이도도 작업에 따라 변한다.

예컨대 어떤 화면은 목표가 명확하고 관계가 단순하며, 어떤 작업은 여러 시점을 통합하고 가림과 조작 전제까지 판단해야 한다.

분명히 후자는 판단을 수정하기 위해 추가 연산 이 더 필요하다.

ZDTaichu5.0-9B는 이를 위해 내장 적응형 순환 추론 을 도입해, 모델이 예측의 불확실성에 따라 현재 Token이 몇 라운드를 더 계산해야 하는지 결정하게 한다.

구체적으로, 모델은 먼저 표준 전방 계산을 한 번 완료해 Token 예측 분포와 은닉층 상태를 얻는다. 엔트로피 게이팅 은 이어서 예측의 불확실 정도를 평가하며, 분포가 더 흩어질수록 모델이 출력에 대한 확신이 더 작다는 것을 의미한다.

확정성이 높을 때는 모델이 곧바로 출력하고, 높은 불확실성 노드 를 만나면 내부에서 일부 층 블록 계산을 반복 수행해 은닉 표현을 반복적으로 조정하여 현재 판단에 계산 깊이를 더한다.

이 추가 계산은 모델 전방 전파 내부에서 일어나므로, 이를 위해 외부 도구를 호출할 필요도 없다.

물론 몇 라운드를 계산할지도 제약이 있어야 하며, 무한정 발산할 수는 없다.

ZDTaichu5.0-9B는 삼중 안정화 엔지니어링 설계 를 갖춰, 모델이 연산력을 합리적으로 기울일 수 있게 한다:

1、감쇠 업데이트: 매 라운드 수정 폭을 제어해 특징 표류를 방지한다;

2、이중 정지 판정 기준: 출력 분포의 KL 발산과 은닉 상태 잔차를 동시에 모니터링하여 결과가 안정화되는지 판단한다;

3、궤적 판독과 상태 롤백: 반복 중간 궤적을 보존하고, 그로부터 위험이 가장 낮은 표현 결과를 선택한다.

흥미롭게도, 작업 필요에 따라 추론 투입을 조절하는 이 사고방식은 최근 크게 화제가 된 GPT-6 Astra 에도 일부 반영되어 있다.

OpenAI 공식 문서에 따르면, Astra는 추론 투입 조절을 새로 지원하며, 대화 과정에서 어려운 작업에는 추론 투입을 높이고 반대로 일반 작업에는 투입을 낮추도록 허용한다.

유사한 노선 아키텍처는, 수요에 따른 추론 연산 배분이 이미 국내외의 새로운 공감대임을 보여준다.

ZDTaichu5.0-9B는 높은 기술적 선견성을 보여주며, 오픈소스 모델 중 이 메커니즘을 가장 먼저 구현한 모델이기도 하다.

△ 이미지는 OpenAI 공식 문서에서 캡처

내외부 순환 협동: 단일 단계 공간 판단을 연속 작업으로 잇는다

하지만 현재 한 단계를 잘 판단하는 것만으로는 부족하고, 모델은 이어서 행동 이후에 무슨 일이 일어났는지 도 봐야 한다.

왜냐하면 구현(具身)의 단 한 번의 개별 행동으로 환경 상태가 따라서 변하기 때문이다.

모델의 내부 순환 은 단지 현재 입력을 둘러싸 지각과 추론을 개선하는 것일 뿐이며, 외부 작업 순환 은 새로운 관측과 실행 피드백을 받아 작업 진행을 갱신해야 한다.

예컨대 치즈 상자를 그릇 안에 넣는 영상을 보자. 시뮬레이션 시연이긴 하지만, 전체 과정도 상대적으로 직관적이다:

모델은 먼저 도구의 도움을 받아 목표 영역을 인식하고, 접근, 파지, 들어올림, 이동, 내려놓기와 빠져나오기를 조직한다. 새로운 관찰 결과가 계속 이후 조작에 영향을 주며, 최종적으로 치즈 상자가 그릇 안에 남아 있음을 확인한다.

따라서 실체 시스템에서 모델에 대한 요구는 매우 높다. 모델은 의미 이해, 공간 판단과 고수준 계획을 담당할 뿐만 아니라, 외부 시스템이 제어 작업을 올바르게 수행하도록 보장해야 한다.

다행히 내외부 두 순환 이 이를 실현해, 매 행동이 다음 라운드 판단의 새로운 조건이 되게 하여 장기 작업의 성공률을 현저히 높인다.

실험대에서 운반 현장까지, 바퀴를 다시 만들 필요가 없다

이제 처음의 질문으로 돌아가 보자: 멀티모달은 어떻게 세계를 보는가? 화면 안팎은 어떻게 연결되는가?

ZDTaichu5.0-9B는 실질적인 답을 내놓았다.

이미지-텍스트 모델 앞에 가로놓인 세 개의 큰 산, 즉 대상 인식이 부정확함, 방위 변환이 어려움, 진행 상황을 따라가지 못함 을 하나씩 모두破解(해결)했다.

모델은 더 이상 "말만 하고 행동은 하지 않는 겉치레" 가 아니며, 범용 벤치마크 성적도 좋고, 실제 물리 장면 성적은 더 좋다.

다시 말해, 이것이야말로 모두가 학수고대하던 전능한 학생이며, 편식하지 않고 양쪽 끝이 균형 잡혀 있다.

이것도 그중 하나일 뿐이고, 더 중요한 것은, 그것이 오픈소스 라는 점이다!

오픈소스가 의미하는 바는? 산업계가 스스로 「만들」 수 있다.

ZDTaichu5.0-9B는 가중치를 개방했을 뿐만 아니라, 산업급 검증을 거친 데이터 생산 파이프라인 상세 방안까지 함께 열었기에, 기업은 자신의 데이터와 로봇으로 계속 학습해 더 개성화된 공간 멀티모달 모델을 반복 개발할 수 있다.

팀도 반복적인 엔지니어링을 줄이고 , 연구개발 역량을 자기 임무의 정의, 적응과 평가에 더 많이 쏟을 수 있다.

이 또한 다른 의미의 산업적 적응형 순환 추론이라고 할 수 있다.

리더보드 평가에서 실체 작업 검증 으로 나아가, ZDTaichu5.0-9B는 공간 이해 능력을 과학연구 자동화와 스마트 제조의 구체적 프로세스로 끌어들였다.

예컨대 科研(과학연구) 장면 에서, 시험관 이동 작업은 모델 추론의 연속성을 집중적으로 보여준다.

두 개의 시험관은 파지, 양팔 교대와 랙에 넣기를 거치며 위치와 자세가 계속 변한다. 모델은 계속해서 시료 정체를 구분하고, 어느 것이 이미 랙에 들어갔고 어느 것이 아직 처리 대기 중인지 판단하며, 이에 따라 다음 조작을安排(배치)해야 한다.

시료 정체, 공간 위치와 작업 진행이 이로써 연관되며, 자동화 과학 실험 플랫폼에 상위 작업 편성과 상태 기록 능력을 제공한다.

기계대 상料(장입)를 향한 공작물 이동 시연은, 로봇이 자재 랙에서 공작물을 파지하고, 방향을 돌려 운반한 뒤, 작업대로 내려놓는 완전한 과정을 보여준다.

그 의의는, 모델이 작업 지시서 속 목표와 위치 요구를 현장 상태에 따라 지속적으로 갱신되는 조작 계획으로 전환한다는 데 있다.

목표 인식, 운반 연결과 배치 검사를 연속 흐름으로 엮어, 製造(제조) 장면 에 더 적응시킬 수 있는 고수준 계획 기반을 제공한다.

개발자에게 ZDTaichu5.0-9B는 이미 하나의 '조기 검증 답안'을 내놓았으며, 이후에는 이를 기반으로 계속 앞으로 나아갈 수 있고, 빠르게 나아가면서도 매우 정확하다.

그리고 즈둥타이추(紫东太初)에게 이번 발표는 범용 멀티모달 능력이 공간 이해와 구현(具身) 작업 계획 수립으로 한층 더 확장되었음을 의미하며, 그 산업적 가치 또한 더 많은 구체적 작업 속에서 검증받게 될 것이다.

공작물을 한 세트 바꾸고, 대상의 위치를 한 번 조정하고, 조작 전제 조건을 하나 추가할 때, 모델이 여전히 대상을 정확히 인식하고, 상태를 갱신하며, 올바른 다음 단계를 조직할 수 있는가……

이러한 변화에 대응하는 능력은 모델이 실제 장면에 적응할 수 있는지를 가늠하는 중요한 척도가 될 것이다.

ZDTaichu5.0-9B는 오픈소스 모델, 데이터 파이프라인, 기술 경로와 실체 사례를 통해 다시 좋은 출발을 열었고, 기반 모델로서 필시 더 많은 범용 멀티모달 모델이 물리적 문턱을 넘어서도록 할 것이다.

사실 구현 지능이 오늘에 이르기까지, 대화를 나누는 모델은 어디에나 있고, 이미 부족하지 않다.

부족한 것은 물리 세계를 이해하고 실제 작업에서 지속적으로 상태를 유지할 수 있는 모델이다.

예전에도 있었지만, 아직 충분하지 않았다.

즈둥타이추 ZDTaichu5.0-9B는 0.001에서 1로 가는 돌파이며, 디지털 이해에서 물리적 구현 지능으로 나아가는 관건적 착지점이다.

그리고 일생이(一生二), 이생삼(二生三), 삼생만물(三生萬物)이다.

블로그 링크:

https://taichu-ai.github.io/ZDTaichu5.0-9B

GitHub 링크:

https://github.com/Taichu-AI/ZDTaichu5.0-9B

HuggingFace 링크:

https://huggingface.co/TaichuAI/ZDTaichu5.0-9B

ModelScope 링크:

https://www.modelscope.cn/models/TaichuAI/ZDTaichu5.0-9B