Issue 01중국 AI
AC POST
중국 AI 목록
开源中国2026년 9월 18일 16:26중국어 → 한국어

즈푸 GLM-5.3-FlashX 출시, 국산 칩에서 초당 200토큰

즈푸가 GLM-5.3의 고속 버전 GLM-5.3-FlashX를 공개하며 국산 칩 기반 최대 200 tokens/s 추론 속도를 내세웠다.

중국어 원문을 AI로 번역했습니다. 고유명사와 수치는 원문 표기를 우선하며, 중요한 판단에는 아래 출처 원문을 함께 확인하세요.

GLM-5.3은 얼마 전 "Ox Alpha"라는 익명으로 출시됐을 때부터 이미 OpenCode와 OpenRouter 두 플랫폼에서 호출량이 가장 많은 모델이었다. 오늘 즈푸(智谱)는 여기에 더 빠른 버전을 추가했는데, 이름도 직관적이다——GLM-5.3-FlashX, 최고 200 tokens/s.

배경에 깔린 한 장의 카드는 따로 짚을 만하다. 이전 세대 GLM이 출시됐을 때, 팀은 10만 장의 자국산 칩으로 구성된 클러스터 위에서 추론 서비스를 처음부터 구축했다. 당시 난점은 메모리 대역폭이 제한적인 데다 1M 컨텍스트와 멀티모달까지 감당해야 한다는 것이었다. 이 "자국산 카드 위에서 처리량을 짜내는" 토대가 바로 이번 FlashX 속도 향상의 전제다——즈푸의 표현은 "10만 장의 자국산 칩이 제공하는 추론 연산력 기반 위에서 Infra 측 투자와 추론 최적화를 한층 더 강화한다"는 것이었다.

단기적으로 보면 이는 제품화 차원의 속도 업그레이드다. Flash 시리즈 자체가 "동일 크기 최강 지능 + 극히 높은 가성비"라는 포지셔닝인데, 이번에 속도를 끌어올림으로써 지능, 가격, 속도 세 가지 차원을 모두 점유하겠다는 셈이다. API는 독립된 Model Key(GLM-5.3-FlashX)를 사용하며, 기존 Flash와 별도로 계산된다.

비교적 드문 점은, 즈푸가 이번에는 발표 설명을 유난히 편안하게 썼다는 것이다——"대범하게, 잘 써보고, 슝슝슝슝", 제목조차 격식 차리지 않는 투가 배어 있다. 이전 세대의 "솔직히 말하면, GLM-4.7 이전에는 우리 내부에서 GLM으로 코드를 짜는 데 다소 어쩔 수 없는 성분이 있었다"는 장문과 비교하면, 같은 팀이 앞뒤로 두 가지 어조를 쓴 것은 자사 모델이 "친아들"에서 "매일 떼려야 뗄 수 없는 동반자"로 변한 하나의 각주이기도 하다.

사용 방식 :

API 호출 : https://docs.bigmodel.cn/api-reference/모델-api/대화-보완

체험 센터 : https://www.bigmodel.cn/trialcenter/modeltrial/visual?modelCode=glm-5.3-flashx

출처: GLM-5.3-FlashX上线: 大大方方、好好用用、嗖嗖嗖嗖 - 智谱