지푸, GLM-5.3 초기 RSI 형태 공개…자체 추론 시스템 최적화
지푸 창업자 탕제와 GLM 팀이 GLM-5.3-Flash가 자체 추론 시스템을 최적화하기 시작하며 재귀적 자기개선(RSI)의 초기 형태가 나타났다고 밝혔다.
중국어 원문을 AI로 번역했습니다. 고유명사와 수치는 원문 표기를 우선하며, 중요한 판단에는 아래 출처 원문을 함께 확인하세요.
지푸(智谱) 창업자 겸 수석과학자 탕제(唐杰)와 GLM 팀이 긴 글을 하나 발표했는데, 제목부터 이미 태도를 상당히 낮추고 있다. "이것은 아직 완전한 의미의 재귀적 자기 개선(RSI)이 아니지만, 초기 형태는 이미 나타났다." 그런데 글 전체를 읽어 보면, 이 "초기 형태"가 "완전한" 것과 그들이 말하는 것만큼 멀지는 않다는 생각이 들게 된다.
개념은 제쳐 두고, 우선 무엇을 했는지 보자. GLM-5.3-Flash가 출시될 당시, 하나의 프로덕션급 추론 서비스를 10만 장이 넘는 중국산 칩으로 구성된 클러스터 위에 처음부터 구축해야 했다. 이전까지 이렇게 대규모의 중국산 카드 클러스터를 성공적으로 배포한 사례는 없었고, 메모리와 대역폭은 상대적으로 제한적이었으며, 1M 컨텍스트와 멀티모달 요청까지 감당해야 했고, 연산자는 완비되지 않았고, 문서는 기본적으로 추측에 의존해야 했다.
이 일을 해낸 것은 엔지니어 팀이 아니라 GLM-5.3이 구동하는 Infra Agent였다. 그것은 모델 적응, 시스템 진단, 성능 튜닝을 수행했고, 2주가 채 안 되어 엔드투엔드 처리량을 초기 베이스라인의 3배까지 끌어올렸다. 실제 작업에서 중국산 카드 위에서 돌리기 위해 팀은 연산력으로 대역폭을 바꾸고, 통신으로 메모리를 바꾸는 등의 방안을 사용했으며, 기술 스택에는 ReplaySSM, W8A8 양자화, INT8/FP8/BF16 혼합 정밀도 캐시를 융합했고, 최종적으로 Encode–Prefill–Decode(EPD) 분리형 아키텍처를 도입해 엔드투엔드 성능 약 3배, 하드웨어 활용률과 단일 Token 비용은 주류 NVIDIA GPU와 대등한 수준에 도달했다.
그 익명 모델 Ox-Alpha가 바로 GLM-5.3-Flash 자신이다. 출시 일주일 만에 OpenCode와 OpenRouter 두 플랫폼에서 호출량이 가장 큰 모델이 되었고, 6일간 Token 호출량이 62조를 넘었다.
글의 진짜 하이라이트는 이 과정을 "밀집 피드백"이라고 부르는 하나의 방법론으로 분해한 것이다. 탕제 팀의 관찰은 이렇다. 엔드투엔드 지표는 Agent에게 "결과가 나빠졌다"고만 말해 줄 뿐, "왜 나빠졌는지"는 말해 줄 수 없다. 그래서 그들은 정확성 테스트, 실행 로그, 실행 Trace, 마이크로 벤치마크, 엔드투엔드 지표를 모두 Agent의 반복 프로세스에 포함시키고, 피드백을 세 층으로 나눴다. 정확성 피드백은 "계산이 맞았는가"를 답하고, 시스템 행동 피드백은 "시간이 어디서 소모되는가"를 찾아내며, 성능 피드백은 "어떤 방안이 어떤 조건에서 더 나은가"를 판단한다.
세 가지 사례가 세 층에 대응한다. 정확성 차원에서, Agent가 서로 다른 병렬 분할 경로의 정밀도를 비교하던 중 KDA 연산자의 컨텍스트 병렬(CP) 경로에 문제가 있음을 발견했다. 원래 구현의 tl.dot은 입력이 FP32여도 기본적으로 TF32 계산을 사용해, 오차가 긴 컨텍스트에서 계속 누적되었고, 수정은 input_precision="tf32x3" 를 명시적으로 지정해 세 번의 TF32 연산을 조합해 더 높은 정밀도를 만들어 내는 것이었다.
시스템 행동 차원에서, Agent는 어떤 시나리오에서는 Prefill+KV Transfer가 단독 Prefill보다 20% 이상 나쁘다는 것을 발견하고, Python/C++ 경계까지 추적해 DeepEP v1.2.1의 intranode_dispatch / intranode_combine이 둘 다 Python GIL을 명시적으로 해제하지 않아 Mooncake Transfer의 Python 스레드를 막고 있음을 찾아냈다. 수정은 관련 C++ 구간에서 GIL을 해제하도록 하는 것이었고, 성능 차이는 20%에서 1% 이내로 줄었다.
성능 차원에서, Agent는 SGLang, Flash Linear Attention, DeepGEMM 등 프로젝트의 기존 Kernel에서 "최적화 골격"을 추출한 뒤, 돌아가서 자신을 떠받치는 KDA Decode 연산자를 최적화했다. 먼저 원래 구현이 V 차원을 따라 분할해 동일한 계산이 네 번 반복된다는 것을 발견하고, 이를 동일 스레드 블록으로 병합해 1.71배 향상을 얻었다.
"모델이 시스템을 최적화하고, 시스템이 모델을 떠받친다" — 이 말이 글 전체의 핵심 문구다.
탕제는 이 긴 글에서 드물게도 진솔한 말을 꺼냈다. 솔직히 말해, GLM-4.7 이전에는 우리 내부에서 GLM으로 코드를 작성하는 데 어느 정도 어쩔 수 없는 면이 있었다. 어쨌든 우리의 "친자식"이니까. 오늘날 GLM-5.3은 모든 사람이 매일 떼려야 뗄 수 없는 Coding 파트너가 되었고, 한 걸음씩 우리를 대체해 가고 있다. 그는 목표를 선택하고, 경계를 설정하고, 위험을 판단하는 것은 여전히 사람의 일이며, 이 선은 사람이 지켜야 한다고 강조했다. 그러나 다시 한마디 덧붙였다. "2주, 3배, 10만 카드 같은 숫자들은 우리가 이 선이 좀 더 느리게 움직이길 바란다고 해서 느려지지 않는다는 것을 말해 준다."
출처: https://z.ai/blog/glm-built-its-inference-infrastructure