즈푸, Infra 계층에 RSI 도입…국산 칩 10만 장 최적화
즈푸가 GLM-5.3 기반 추론 인프라에 RSI를 적용해 10만 장 국산 칩에서 6일간 62조 토큰을 처리하고 처리량을 3.2배 높였다고 밝혔다.
중국어 원문을 AI로 번역했습니다. 고유명사와 수치는 원문 표기를 우선하며, 중요한 판단에는 아래 출처 원문을 함께 확인하세요.
전화 회의로 智谱(즈푸)의 전략을 파헤치다, 재귀적 최적화로 300억 규모의 컴퓨팅 비용 전쟁에서 앞서가다.
저자丨가오윤이
편집丨천 펑
9월 17일, 唐杰(탕지에)이 이례적으로 긴 트윗 하나를 올렸는데, 이번에 그가 이야기한 것은 최근 가장 뜨거운 화제 중 하나인 RSI였다.
智谱도 조용히 RSI에 힘을 쏟고 있는데, 그들은 이미 RSI를 Infra 계층에 올려 GLM-5.3이 구동하는 추론 인프라 한 세트를 만들어냈다. 바로 이 Infra 시스템 덕분에 GLM-5.3-Flash, 즉 얼마 전 전 세계적으로 화제가 된 익명 모델 Ox-Alpha가 출시 일주일 만에 빠르게 전 세계에서 가장 널리 사용되는 모델 중 하나가 되었고, 불과 6일 동안 62조 개가 넘는 Token을 처리했다.
더욱 이정표적인 것은, 이 모든 것이 십만 장의 국산 칩 위에서 돌아갔다는 점이다.
알다시피 우리가 그동안 엔비디아에 대한 의존에서 벗어나기 어려웠던 것은 바로 국산 칩의 하부 소프트웨어 생태계가 취약하기 때문이며, 그 사이에는 무수히 상상하기 어려운 연산자 호환과 통신 문제가 있다. 게다가 십만 장이라는 칩 규모까지 더해지면 난이도는 기하급수적으로 상승하며, 이런 클러스터에서는 매일 수백 장의 카드에 하드웨어 고장, 네트워크 단절 또는 데이터 패킷 손실이 발생할 수 있다.
그런데 唐杰은 처음 전량 실행에 성공한 시점부터 모든 실제 생산 트래픽을 전환하는 데까지 智谱가 불과 2주밖에 걸리지 않았다고 밝혔다. 이는 예전 같으면 경험 많은 인프라 엔지니어 팀이 몇 주, 심지어 몇 달을 들여야 완성할 수 있는 일이었다.
불완전한 하드웨어 생태계에 맞서 智谱는 소프트웨어로 하드웨어에 '패치를 대는' 방식으로 극한의 최적화를 해냈다. 대형 모델을 순조롭게 돌아가게 했을 뿐만 아니라, 종단 간 처리량(throughput)을 무려 3.2배나 끌어올렸다.
이 배경에는 智谱의 핵심 판단이 깔려 있다. 컴퓨팅이 외부에서 엄격히 제한되는 상황에서 중국 AGI가 돌파구를 마련할 수 있는지의 관건은 얼마나 많은 칩을 보유했는가가 아니라, 소프트웨어를 통해 컴퓨팅을 더 효율적으로 동원하고 활용할 수 있는가에 있다. 智谱의 이번 행보는 실질적으로 RSI를 통해 일종의 '하부 디커플링(解耦)' 능력을 구축하여, AI가 서로 다른 하드웨어 생태계에 자율적으로 적응하고 하드웨어 간의 호환 장벽을 넘어설 수 있게 하려는 것이다.
즉, 智谱는 '국산 컴퓨팅은 쓰기 어렵다'는 이 업계의 난제를 'AI가 하드웨어의 한계를 자동으로 파헤치는' 기술적 주도권으로 전환하려 하고 있는 것이다.
국산 칩 클러스터, AI가 깊이 참여한 Infra 시스템, 전 세계적으로 화제가 된 모델, 이 세 가지가 결합하자 唐杰조차 감탄을 금치 못했다. 우리는 RSI의 종국과는 아직 거리가 멀지만, 그 '모델이 시스템을 최적화하고, 시스템이 모델을 되먹이는' 최소 순환은 이미 진짜로 돌아가기 시작했다.
01
십만 장 국산 칩 클러스터:
참고 답안이 없는 배포의 난전
唐杰는 십만 장의 국산 칩 위에서 대형 모델을 진정으로 실행하고 배포하는 것은 결코 쉬운 일이 아니라고 말했다.
이 일에는 적어도 세 가지 고비가 있는데, 각각은 경험 많은 엔지니어링 팀을 무너뜨리기에 충분하다.
첫째, 국산 칩은 메모리와 데이터 전송 속도가 태생적으로 제한적이어서 엔비디아의 성숙한 경험을 그대로 가져다 쓸 수 없다.
둘째, 소프트웨어 스택이 극도로 미성숙하여 많은 하부 구성 요소가 결여되어 있다. 여기에는 기성 운영 매뉴얼이 부족하고, 많은 핵심 연산자가 기성 구현이 없으며, 대량의 하부 문서는 심지어 자주 '추측'에 의존해 짐작하고 검증해야만 한다.
또한 모델 자체의 부하 한계도 고려해야 한다. GLM-5.3-Flash는 완전히 새로운 아키텍처로, 문자와 이미지를 동시에 처리해야 할 뿐만 아니라 100만 token의 초장문 컨텍스트도 처리해야 한다. 이는 KV 캐시의 용량 압박이 기하급수적으로 폭증한다는 것을 의미한다.
智谱의 해법은 GLM-5.3이 구동하는 Infra Agent를 활용해 몇 가지 핵심 기술을 한데 융합하고, 소프트웨어 엔지니어링 역량으로 하드웨어의 약점을 보완하는 것이다.
예를 들어, 통신으로 메모리를 대체한다. '노드 내 텐서 병렬화'와 '레이어 분할'을 채택하여 모델을 계층별로 쪼개고, 동시에 단일 서버 내에서 여러 장의 칩이 가장 핵심인 어텐션과 출력 계산을 공동 분담하게 한다.
계산으로 메모리를 대체한다. ReplaySSM 전략을 켜서, 메모리에 다 담을 수 없으면 우선 데이터를 버리고, 사용할 때가 되면 칩이 그 자리에서 즉석 계산하게 함으로써, 극히 짧은 계산 시간으로 소중한 메모리 공간을 확보한다.
정밀로 용량을 대체한다. W8A8 양자화를 채택하여 모델 가중치와 활성값을 모두 8비트로 압축하고, 저장 및 대역폭 점유를 절반 이상 곧바로 줄인다. 이어서 가장 많은 공간을 차지하는 KV 캐시를 데이터 중요도에 따라 INT8, FP8, BF16 세 가지 정밀도를 혼용해 동적 압축하여, 카드 한 장의 VRAM 하나하나까지 극한으로 활용한다.
이를 바탕으로 그들은 나아가 인코딩, 프리필(prefill), 디코딩 세 단계를 완전히 디커플링하여, 디커플링으로 스케줄링의 자유도를 얻었다. 여기에 Infra Agent의 빠른 반복까지 더해져, 국산 칩 활용률과 단일 Token 비용이 엔비디아 수준에 근접하게 되었다.
하지만 가장 중요한 문제는, Infra Agent가 정체에 빠질 때 그것은 종종 코드를 작성할 수 없어서가 아니라, '왜 상황이 더 나빠졌는지'를 모르기 때문이라는 점이다.
실제 추론 시스템은 정적인 코드 한 조각이 아니라, 하부 칩, 네트워크 통신, 메모리 할당부터 상위 서비스까지 동적으로 얽힌 '복잡한 생태계'이며, 아무리 작은 한 부분의 편차도 연쇄 반응을 일으킨다. 시스템 공학에서는 이를 '희소 피드백(稀疏反馈)'이라고 부른다.
시스템은 그저 결과 하나만 내던진다. '처리량 20% 하락'. 하지만 너는 문제가 하부 코드에 있는지, 메모리 스케줄링에 있는지, 아니면 데이터 전송에 있는지 알지 못한다. 어느 변경이 붕괴를 일으켰는지? 다음 단계는 또 어디로 가야 하는지?
AI에게 문제를 찾게 하면 매번 전체 테스트를 몇 시간씩 돌려야 하며, 극히 높은 시행착오 비용 때문에 AI의 탐색 과정은 극도로 길어진다.
전통적인 시스템 최적화는 사실 도구가 부족하지 않다. 로그, 테스트, 성능 분석이 넘쳐나지만, 그것들은 모두 서로 다른 엔지니어링 단계에 흩어져 있다. 경험 많은 Infra 엔지니어라면 이른바 '엔지니어링 직감'으로 문제가 어디 있는지 판단할 것이다.
智谱가 하려는 것은 바로 이 '엔지니어링 직감'의 논리를 정량화하여, AI가 문제의 소재를 추적하고 근원을 캘 수 있는 피드백 메커니즘 한 세트로 만드는 것이다. 이 위치 설정은 충분히 정밀해야 하고, 비용이 저렴하고 시의적절해야 하며, 검증을 견딜 수 있어야 한다.
智谱의 관점에서, 미래 대형 기업 간의 세대 차이는 '모델이 자신의 시스템 구축에 참여하는 깊이'에 의해 결정될 것이다. 누가 먼저 '모델이 Infra를 훈련하는' 폐루프를 완성하느냐가 지능 성장의 복리를 얻어, 물리적 컴퓨팅이 제한된 상황에서 비선형적 추월을 실현할 수 있다.
이에 대해 智谱가 내놓은 답은 '밀집 피드백(Dense Feedback)'이라는 계층적 검증 체계다.
02
밀집 피드백: AI판 Infra 엔지니어
智谱는 '밀집 피드백'을 세 부분으로 나누었는데, 각각 정확성 피드백, 시스템 행동 피드백, 성능 피드백이다. 이들은 Infra 시스템의 세 가지 하부 문제, 즉 '계산이 맞는가', '어느 단계에서 막히는가', 그리고 '어느 해법이 가장 최적인가'에 대응한다.
이는 마치 노련한 추론 엔지니어가 갑자기 경보를 마주했을 때 머릿속에서 자동으로 하나의 점검 경로가 튀어나오는 것과 같다. 智谱의 이 체계를 이해하기 위해, 우리는 세 가지 실제 엔지니어링 사례를 따라가며 인간 엔지니어의 엔지니어링 직감이 어떻게 AI의 능력으로 인코딩되는지 살펴보자.
▎ 사례 1: 장문 컨텍스트 정밀도 드리프트(정확성 피드백)
장문 컨텍스트를 처리할 때 여러 장의 칩이 동시에 작업하게 하려면, 시스템은 긴 텍스트를 여러 단락으로 잘라 각 칩이 한 단락씩 계산하고, 마지막에 각 단락의 결과를 '이어붙이는' 방식이다. 이런 상황에서는 '장문 컨텍스트 정밀도 드리프트'가 나타나기 쉬우며, 모델 출력 결과의 편차가 커진다.
노련한 Infra 엔지니어라면 실행 체인을 따라 단계별로 중간 결과를 잡아채고 오차 곡선을 뽑아, 도대체 어느 '이어붙이기'가 데이터를 오염시켰는지 점검할 것이다.
智谱는 이 점검 논리를 정확성 피드백 체계로 정착시켰다. AI는 마치 현미경을 든 것처럼 한눈에 KDA 커널이 하부에서 기본 채택한 계산 정밀도가 반올림 오차를 '눈덩이처럼' 누적시켰음을 알아낸다. 문제를 특정한 후, AI는 자동으로 오픈소스 경험 라이브러리에서 방안을 매칭하여, 계산을 명시적으로 더 높은 정밀도의 조합 알고리즘으로 업그레이드함으로써 문제를 해결한다.
▎ 사례 2: KV 전송 동시성 병목(시스템 행동 피드백)
시스템이 대형 모델 추론을 할 때 'Prefill(프리필)'이라는 단계가 있는데, 이는 먼저 사용자의 프롬프트를 한 번 이해하고 필요한 캐시를 생성하는 것이다. 이상적으로 시스템은 'GPU로 계산하면서 동시에 노드 간 캐시 데이터를 운반'해야 한다.
그런데 결과는 둘을 합친 총 시간이 계산만 단독으로 할 때보다 무려 20%나 느렸다. 이는 운반이 기본적으로 '줄 서서 기다리는' 것이었고, 계산과 동기적으로 진행되지 않았음을 의미한다.
이런 문제에 직면하면 전통적인 점검 방식은 극도로 고통스럽다. 엔지니어는 거대한 '전체 링크 타이밍 다이어그램'을 뽑아 시간선을 육안으로 점검해야 하고, 심지어 언어를 넘어 하부 통신 라이브러리(DeepEP)의 C++ 소스 코드를 뒤져, 혹시 글로벌 인터프리터 락(GIL)을 해제하는 것을 잊어 운반을 담당하는 Python 스레드가 멈췄는지 맹목적으로 추측해야 한다.
智谱는 이 점검 논리를 '시스템 행동 피드백 체계'로 만들어, AI에게 일종의 '전체 링크 X선 기계'를 달아준 셈이다.
그것은 자동으로 실행 타이밍을 끌어와 계산과 통신이 겹쳤는지 본다. 일단 겹쳐야 할 것이 겹치지 않았음을 발견하면, 타이밍 다이어그램 위에서 이상 시간 조각을 곧바로 빨갛게 표시한다.
이상을 발견한 후, AI는 호출 체인을 따라 계속 아래로 추적하여, Python과 C++의 언어 경계를 넘어 가장 하부의 인터페이스 구현까지 직접 파고들어 락의 상태를 점검한다.
문제를 특정한 후, 그것은 자동으로 수정 방안을 제시하고, '타이밍 + 성능'이라는 두 기준으로 함께 검증한다. 시간 조각이 정말로 겹쳤는지도 봐야 하고, 종단 간 성능이 정말로 올라갔는지도 봐야 한다.
이렇게 원래 며칠이 걸려야 해결되던 동시성 문제를, AI는 몇 초 안에 빠르게 해결한다.
▎ 사례 3: 디코딩 커널 중복 계산(성능 피드백)
모델이 텍스트를 생성할 때 핵심 계산 모듈(디코딩 커널) 하나를 호출한다. 만약 이 모듈이 충분히 빠르게 돌지 않으면 전체 속도를 끌어내린다.
노련한 Infra 엔지니어라면 하부의 어셈블리나 연산자 코드를 육안으로 훑어볼 것이다. 여러 장의 칩이 동시에 최고 속도로 작업하게 하기 위해, 시스템은 통상 '분할(Tiling)' 전략을 채택하여 거대한 계산 작업을 네 개의 작은 조각으로 잘라 동시에 진행한다. 이는 본래 한 번만 계산하면 되는 일부 공통 단계가 네 번 중복 계산될 수 있게 만든다. 이는 전형적인 '병렬화를 위한 병렬화'다.
智谱는 대량의 커널 최적화에 있는 범용 패턴을 재사용 가능한 '최적화 템플릿 라이브러리'로 만들고, 여기에 성능 피드백 체계를 결합하여 AI에게 일종의 자동화 검색 엔진을 갖추게 했다.
먼저, 성능 피드백이 병목이 어디인지 판단한다. 그런 다음, AI는 '최적화 템플릿 라이브러리'에서 매칭되는 패턴을 찾는다. 이 라이브러리는 AI가 SGLang, Flash Linear Attention, DeepGEMM 같은 프로젝트에서 고수들이 손으로 작성한 커널을 모두 읽고 정제해낸 범용 최적화 골격이다.
해당 시나리오에 매칭되면, AI는 이 사고방식을 곧바로 적용해 코드를 재구성하고, 소규모 테스트를 돌려 효과를 검증하며, 유효한 것은 남기고 템플릿 라이브러리에 되먹여 점점 더 강해지게 한다.
문제를 특정하고, 점검하고, 해결하는 것까지, 엔지니어링 차원에서 AI의 장애 진단 능력은 이미 연산자 정밀도 계층까지 깊이 들어갔고 언어 경계를 넘어섰으며, 성공적으로 최적화해낸 그 경험들은 전례 없는 속도로 복리 효과를 형성하고 있다.
Infra의 RSI는 이렇게 될 것이다. AI 엔지니어가 노련한 시스템 엔지니어의 진단 능력을 갖추어, 엔지니어링 차원에서 더 빠르고 더 세밀하게 실행할 수 있다. 그리고 인간 엔지니어는 리스크와 비즈니스 의사결정을 관리하고, Infra 시스템은 고속으로 돌아가는 파이프라인으로 진화한다.
03
'도구 판매'에서 '효율 판매'로:
주문에 떠밀려 나온 RSI
智谱는 그동안 강력한 Coding 능력으로 '중국판 Claude'로 불리며 국내 Coding 시장의 대부분을 나눠 가졌다. 하지만 올해 들어, 이 대형 모델 회사는 분명히 대량의 역량을 하부 Infra에 쏟아부었다.
왜 智谱가 올해 이렇게 중대한 전략 전환을 했을까? 9월 16일 智谱가 투자자를 대상으로 개최한 전화 소통 회의에서 우리는 그 일단을 엿볼 수 있다.
智谱 고위층은 올해 2월 GLM-5 출시 후 시장 수요가 큰 폭발을 맞아 호출량이 순식간에 10배 폭증하여, 출시 당주에 컴퓨팅 비축분이 완전히 소진되었다고 밝혔다. 극도로 긴박한 컴퓨팅 제약으로 인해 智谱는 심지어 주력 수익 상품인 Coding Plan의 판매를 긴급 중단할 수밖에 없었다.
컴퓨팅 부족에 제약되어 智谱는 'All-in-Infra' 전략을 선택할 수밖에 없었고, 재빨리 中科加禾를 인수하여 전체 컴퓨팅 사용 효율을 2-3배 끌어올렸다. 하지만 그럼에도 Coding 수요 폭증의 격차를 메우지 못했다.
智谱의 핵심 성장 제약은 바로 컴퓨팅이며, 충분한 컴퓨팅만 주어진다면 즉시 제품을 팔아 실제 돈으로 바꿀 수 있다.
사실은 시장의 예측도 곧 검증되었다. 7월, 智谱의 40억 달러 자금 조달이 완료된 후, 智谱는 즉시 Coding Plan 판매를 전면 재개했다. 이는 판매 중단 반년 만의 첫 완전 개방이었고, 판매량은 곧바로 15배 이상 증가하여, 다시 한 번 '컴퓨팅이 있는 만큼 수익이 있다'는 논리를 검증했다.
智谱 고위층은 '컴퓨팅'이라는 이 장부를 계산했다. 만약 초기에 포화 투입을 하여 300억 위안의 컴퓨팅을 거액을 들여 쏟아붓고, 그중 40%를 모델 훈련에, 60%를 추론 서비스에 쓴다면, 이 60%의 추론 컴퓨팅이 정가로 꽉 채워지는 순간, GLM-5.3의 이론상 최대 80%에 달하는 초고 매출총이익률에 힘입어 연 매출이 곧바로 400억 위안까지 치솟을 수 있다. 이는 단 1년만으로도 智谱가 전체 컴퓨팅 비용을 회수할 수 있을 뿐만 아니라, 훈련 연구개발 비용까지 덤으로 충당할 수 있다는 의미다.
비교해 보면, 만약 보수적으로 100억 위안만 투입하면 필연적으로 연구개발이 막히고 주문이 이탈하여 '양쪽 모두 잃는' 궁지에 빠진다. 따라서 대형 모델 회사에게는 반드시 컴퓨팅의 규모화 확장(Scaling)을 확고히 선택해야 하며, 퇴로가 없다.
이를 위해 智谱는 세 층의 카드를 깔았다.
첫째, 智谱는 1GW급 초대형 컴퓨팅 데이터센터를 구축하여 컴퓨팅 '유무'의 문제를 해결하고, 다른 한편으로는 전면 국산 칩으로 비용을 통제하여 자주적 통제의 장기 리스크를 해결한다.
둘째, 클라우드 분배 모델을 채택하여 오픈소스 모델을 클라우드 진열대 위의 상품으로 만든다. 智谱는 이미 여러 해외 거대 클라우드 서비스 사업자, 국내 선두 클라우드 업체와 수익 분배 협약을 체결했다. GLM 시리즈 오픈소스 모델이 호스팅 API 형태로 각 대형 클라우드 플랫폼에 입점하며, 수익은 10월부터 공식적으로 인식된다.
이는 컴퓨팅 압박, 운영 비용, 글로벌 유통을 전부 외주화하고, 智谱 스스로는 경자산으로 현금화하는 것과 같다.
또한 기업용 Co-work(협업 작업) 분야에서 GLM-5.3은 가장 먼저 네트워크 보안 시나리오를 뚫어냈다. 현재 이미 100개 보안 기업이 GLM 모델에 접속했으며, 주요 보안 업체, 인터넷 대형 기업, 연구 기관, 금융 기관을 아우른다. Gartner의 예측에 따르면 2026년 전 세계 정보 보안 최종 소비 지출은 2489억 달러에 달하고, 2030년에는 3726억 달러에 이를 것이며, 이는 즈푸(智谱)에 거대한 상상의 여지를 남겨준다.
결국 즈푸가 Infra에 다시 크게 투자하는 것은 바로 Coding 수요가 폭발한 뒤의 필연적 연장선이다.
참고 링크: https://z.ai/blog/glm-built-its-inference-infrastructure
올라타세요, 레이펑왕(雷峰网, 위챗 공식계정: 레이펑왕)과 함께 전 세계 AI 최고 학회의 정수를 둘러보세요
독점적으로 만끽할 수 있습니다:
- 전문가 강연 PPT - 학회 보고 전문 - 인기 논문 해설 - 학술 신예 인터뷰
위 QR코드를 스캔하거나
「阅读原文(원문 읽기)」을 클릭해 특별 구역을 팔로우하세요.
레이펑왕 오리지널 기사로, 무단 전재를 금지합니다. 자세한 내용은 转载须知(전재 수칙)를 참조하세요.
0명이 저장
공유: