Issue 01중국 AI
AC POST
중국 AI 목록
量子位2026년 9월 21일 12:46중국어 → 한국어

스텝 Step 5 Preview 실측, 오픈소스 Top2

활성 파라미터 27B 규모로 공개된 Step 5 Preview를 실측해 오픈소스 상위권 성능을 확인했다는 사용기다.

중국어 원문을 AI로 번역했습니다. 고유명사와 수치는 원문 표기를 우선하며, 중요한 판단에는 아래 출처 원문을 함께 확인하세요.

Jay 2026-09-21 11:46:43 출처: 량자웨이(量子位)

활성 파라미터 27B에 불과

Jay, 凹非寺 발송

량자웨이 | 공중번호 QbitAI

누가 알았겠나, 전 세계 플래그십 모델들이 난투를 벌인 지금도 판세는 여전히 변수가 가득하다.

어제, 계위싱천(阶跃星辰)이 아무 예고도 없이 최신 세대 플래그십 기반 모델을 꺼내 들었다——Step 5 Preview.

MoE 아키텍처, 총 파라미터 600B, 활성 파라미터는 27B에 불과, 1M 컨텍스트.

Agent 능력이 크게 향상되어, Artificial Analysis의 최신 평가에서 Step 5 Preview는 44점을 받아 단숨에 글로벌 오픈소스 Top 2로 치고 올라갔다.

알다시피, 이 점수를 받은 다른 대형 모델들은 대부분 조 단위(万亿) 파라미터급이다.

그래서 상대적으로 계위(阶跃)의 이 새 모델 가격은 꽤 저렴하다.

백만 입력: 1달러

백만 출력: 2.7달러

상당히 경쟁력 있다고 할 수 있다, 단일 작업 비용이 Opus 5의 12.5%에 불과하다.

아래 그림이 더 직관적이다.

AA 리스트에서, Step 5 Preview는 Intelligence Index와 단일 작업 비용의 트레이드오프에서 '파레토 프런티어(帕累托前沿)'에 위치한다.

솔직히, 이 소식을 봤을 때 나는 좀 의외였다.

계위(阶跃)가 이렇게 앞쪽 자리에 나타난 것은 꽤 오랜만이었다, 이전 두 세대 모델은 모두 Flash 등급에 집중했었다.

하지만 Benchmark라는 것, 이제 다들 잘 알지 않나.

리스트 위에서 서로 앞서거니 뒤서거니, 오늘 하나가 밀려나고 내일 또 하나가 튀어나온다. 정작 써야 할 때 모델이 정말 되느냐는 완전히 다른 문제다.

그래서 나는 꽤 돈이 드는 일을 하나 했다:

무수한 Token을 태우며, 수많은 3D 에셋, 3D 게임을 병렬로 돌렸다……

그랬더니, 내가 발견한 것은——

이 모델이 의외로 진짜 괜찮을지도 모르겠다는 거였다...

직접 실측

요즘 Astra 조작 소프트웨어가 꽤 인기 있지 않은가?

그래서 API를 연결하자마자, 나는 곧바로 Step 5 Preview에 강도를 높여, Blender를 조작해서 백룸(后室) 하나를 만들어 달라고 시켰다.

솔직히, 처음엔 정말 뭔가를 낼 수 있으리라 기대하지 않았다.

그런데 그녀석이 혼자 한 시간 남짓을 씨름한 뒤, 내가 폴더를 열고 렌더링이 끝난 MP4를 열어 봤더니, 그대로 멍해졌다.

아니, 이게 뭐야, 너 어느 사이트에서 영상 다운로드한 거야??

모델링 자체야 말할 것도 없고, 황당한 건, 그것이 스스로 영상에 잔뜩 후반 작업을 넣었다는 것이다.

VHS 녹화 테이프 질감, 렌즈 노이즈, 어스름한 노란 조명, 인물이 걸을 때는 심지어 발소리까지 있다.

보고 있자니 좀 오싹해졌다, 모퉁이를 돌면 《집착》의 여주인공이 튀어나올 것 같은 기분이었다...

그래서 우리는 그냥 남녀노소 누구나 즐길 만한 데모를 만들기로 했다.

두 번째 작업으로, 나는 1999년의 《LEGO Racers》를 보고, 레고 레이싱 게임을 바로 뚝딱 만들어 달라고 시켰다.

이번에도 꽤 완성도가 있었다.

트랙, 레이싱카, 인형 기사, 실시간 순위가 다 있고, 심지어 엔진 음향 효과까지 붙여 줬다.

이것도 신나게 실컷 즐겼다.

유일한 문제는, 이 트랙이 너무 좁게 만들어졌다는 것이다...

어쩌면 주된 이유는 내 운전 실력이 형편없어서일 수도 있다, 자주 가속 페달을 밟자마자 곧바로 방호벽에 박고, 때로는 인공지능(AI) 상대조차 못 이긴다.

그런데요, 여러분, 3D 데모 두 개를 다 하고 나니, 나는 정말 좀 버티기 힘들어졌다.

알다시피, 나는 3D 멀미가 있다. 앞의 두 작업을 다 끝내고 나니, 하마터면 사무실 자리에서 토할 뻔했다...

마지막으로 《꽃집(花屋)》 모델링 하나를 더 올린다, 이제부터는 좀 간단한 2D 작업을 하자.

먼저 네온 파쿠르 미니게임을 하나 만들었다. 흥미로운 점은, 나는 일부러 계위(阶跃) 이전 세대 공식 홈페이지 Demo와 비슷한 Prompt를 사용했다.

결과는 차이가 꽤 뚜렷했다.

길 양옆에 고층 건물을 추가했고, 시각적 층위가 더 완전해졌으며, Game Over 후에는 테두리 전체가 따라 붉게 변한다, Prompt에 적지 않은 많은 작은 디테일을 그것이 스스로 채워 넣었다.

그다음에는 글쓰기 웹사이트를 만들게 했다.

여기서는 꼭 따로 칭찬 한마디 해야겠다.

드디어 동파육(东坡肉)에 토마토 볶음 계란을 넣지 않는다.

눈물 난다.

이 심미안 정말 괜찮고, 게다가 범위도 특히 전면적이라, 기본적으로 바로 가져다 쓸 수 있다.

다만, 가끔은 여전히 모듈 오버플로 같은 작은 버그가 나타나서, 여전히 review해야 하고, 여전히 고쳐야 한다.

앞의 몇몇 Demo도 마찬가지였다.

첫 번째 라운드에서는 자주 작은 디테일이 미흡하고, Astra 같은 '이걸, 이게 AI가 만든 거라고?' 할 정도의 넋 나가는 수준과는 분명 아직 차이가 있다.

그래도 일을 하는 데는 쓸 수 있다.

보통 두세 라운드 문제를 지적하면, 스스로 한 번 고쳐서, 사용 가능한 상태에 도달한다.

그러면 문제는 이거다.

분명 앞의 두 세대는 모두 Flash였는데, 어떻게 Step 5 Preview에 와서 Agent 능력이 갑자기 이렇게나 강해졌을까?

연산력을 칼날에 쏟아붓기

지난 몇 년간, 대형 모델 업계의 가장 단순무식한 신앙은 줄곧 Scaling이었다.

더 많은 파라미터, 더 많은 데이터, 더 많은 연산력.

확실히 굉장했다, Fable은 Agent에 초모델급(超模)을 바로 쌓아 올려, 적지 않은 새로운 스킬 포인트를 창발해냈다.

하지만 문제도 아주 명확하다——

비싸다...

그래서 Step 5 Preview도 당연히 Scaling을 하고 있지만, 그것은 '클수록 좋다'를 유일한 목표로 삼지 않았다.

팀은 Narrow but Deep이라 불리는 네트워크 설계를 선택했다.

직역하면 이렇다:

좁지만, 깊다.

92층의 Transformer로, 활성 규모를 통제하는 동시에 정보가 더 많은 층을 거쳐 연속 변환되게 한다.

이는 Agent에게 특히 중요하다.

복잡한 작업에는 흔히 대량의 multi-hop 의존성이 있고, 앞에서 검색한 정보가 여러 단계를 거친 뒤에야 실제로 쓸모가 생긴다.

네트워크가 더 깊다는 것은, 이 정보들에게 더 긴 전파와 추론 경로를 남겨 준다는 것과 같다.

하지만 Agent에게는 또 다른 골칫거리가 있다——

Context.

수십 라운드의 도구 호출을 거치면, 컨텍스트는 쉽게 백만 Token까지 불어날 수 있다. 만약 매 층마다 앞의 모든 내용을 다시 훑는다면, 연산량은 곧바로 폭발할 것이다.

그래서 팀이 한 두 번째 일은, 희소화(sparse)다.

Sparse MoE, Hybrid Sparse, Sparse GQA…… 본질적으로 모두 컨텍스트 문제를 해결하는 것이다.

물론, 알고리즘 차원에서 Sparse라고 쓴다고 해서 GPU가 정말로 일을 덜 한다는 뜻은 아니다.

인덱싱, 메모리 접근, 스케줄링 같은 문제를 잘 처리하지 못하면, 겨우 아껴 둔 연산력이 전부 낭비될 것이다.

그럼 이게 무슨 희소냐, 1도 희소하지 않다.

그래서 Step 5 Preview는 하드웨어에도 적잖은 공을 들여, 저수준 연산자와 데이터 접근 최적화를 통해 이론상의 Sparse를 최대한 실제 처리량(throughput)으로 바꾸게 했다.

이런 소프트웨어·하드웨어 기반이 갖춰지자, 이후 할 일은 비교적 명확해졌다, Agent를 둘러싸고 모델을 한 번 학습시켜, 그것이 연속적으로 일할 수 있게 하는 것.

간단히 말하면, 예전에 모델의 기본 단위가 '답변'이었다면, 이제는 'Loop'로 바뀌었다.

계획하고, 실행하고, 도구를 호출하고, 결과를 보고, 잘못된 걸 발견하고, 계속 고친다.

그런 다음 다시 Loop.

최종적으로, Long-horizon RL, Context Compaction 등의 방법을 통해, 팀은 Step 5 Preview가 수십 라운드의 도구 호출 이후에도 자신이 도대체 무엇을 하려는지 기억할 수 있게 했다.

여기까지 오면, Step 5 Preview의 구상은 비교적 완전해진다.

'성능×비용'의 스위트 스팟에 발을 걸치고, 한정된 연산 예산을 최대한 Agent 능력에 실제로 영향을 주는 곳에 쏟는다.

이것도 계위(阶跃)가 줄곧 가장 잘해 온 일이다.

Step 3.5 Flash에서, Step 3.7 Flash로, 다시 오늘의 Step 5 Preview로, 노선은 사실 크게 변하지 않았다——

가능한 한 Frontier급 능력을, 누구나 쓸 수 있게.

계위(阶跃), 돌아왔다

대형 모델 경쟁이 오늘에 이르기까지, 여전히 하늘의 하루가 땅의 1년이고, 전장은 시시각각 변하며, 유일하게 변하지 않는 공통 인식은:

Frontier는, 아직 종국에 이르지 않았다.

어쨌든, 불과 지난 1년 동안만 해도, 선두 모델의 왕좌가 몇 번이나 바뀌었는지 모른다...

새로운 모델, 새로운 기술 노선이 끊임없이 능력의 경계를 앞으로 밀어내고, 한때 거대한 장벽을 세우기에 충분했던 선두 우위는, 많은 경우 몇 달 만에 따라잡힌다.

Stanford 2026 AI Index에 흥미로운 데이터가 하나 있다.

2026년 3월 기준으로, Anthropic, xAI, Google, OpenAI 네 회사의 가장 최정상 모델은, Arena에서의 격차가 이미 25 Elo 이내로 압축되었다.

알다시피, GPT가 막 나왔을 때, 이 격차는 이렇게 작지 않았다.

대형 모델 경쟁은 완전히 새로운 단계에 접어들고 있다:

한편으로는, Frontier의 문턱이 점점 높아지고, 다른 한편으로는, Frontier 내부가 점점 더 붐빈다.

단순히 특정 Benchmark 하나, 특정 리스트 1위 하나를 쫓는 것으로는, 한 모델 회사의 장기적 위치를 정의하기 어려워졌다.

오늘 한 모델이 답해야 할 질문은, 더 복잡하다:

능력에 어떤 차별화가 있는가?

비용을 낮출 수 있는가?

Benchmark 위의 지능이, 과연 복잡하고 개방적이며 장기적인 실제 작업으로 진정 이전될 수 있는가?

지금 각 사는 사실 이미 미친 듯이 각자의 스킬 트리에 점을 찍기 시작했다.

K3는 프런트엔드 개발을 전공해, 웹 디자인을 극치까지 끌어올린다.

V4 Flash는 가성비를 때려부숴, Flash급 모델을 배추 가격으로 만들어 버린다.

Astra도 마찬가지다, Coding은 사실 별로 향상되지 않았지만, Computer use의 심지를 세워 놓았다.

모두가 각자의 그 긴 판자를 찾고 있다.

이번에, 계위(阶跃)도 그들의 답을 내놓았다.

위로는, 플래그십 기반을 발표해, 글로벌 1군으로 복귀한다.

아래로는, 효율과 비용을 최적화해, Agent가 진정 대중의 삶 속으로 들어가게 한다.

대시대다, 친구들이여.

솔직히, 이게 바로 AI 업계에서 가장 흥미로운 지점이다, 정말 Scaling으로 모든 걸 해결한다면, 제조업과 무슨 차이가 있겠나.

나는 줄곧, 모델 계층은 들쭉날쭉한 대나무 숲에 더 가깝다고 생각한다.

어떤 스킬 포인트든 하나를 밝히는 것은, Trade-off를 의미한다.

더 강한 추론, 더 긴 Context, 더 낮은 지연, 더 적은 활성, 더 강한 멀티모달, 더 나은 Agent 능력……

적어도 상당히 긴 한동안은, 한 회사가 모든 방향을 전부 점등하기는 어렵다.

그래서 기술 노선도 그렇게 빨리 수렴하지 않을 것이다.

적절한 틈새를 찾기만 하면, 언제나 새로운 모델, 새로운 회사의 시장 생태적 자리가 있을 것이다.

AGI에 관한 이 마라톤은, 마지막 1킬로미터까지 달린 게 아니다.