계약성진, 실제 환경 에이전트용 플래그십 모델 Step 5 프리뷰 공개
계약성진이 능력·비용·효율·시나리오 커버리지 사이의 균형(파레토 프런티어)을 목표로 한 플래그십 기반 모델 Step 5 프리뷰를 발표했다.
중국어 원문을 AI로 번역했습니다. 고유명사와 수치는 원문 표기를 우선하며, 중요한 판단에는 아래 출처 원문을 함께 확인하세요.
阶跃星辰의 새 플래그십 모델 Step 5가 Preview 버전을 발표했다. 이 모델이 스스로에게 부여한 명제는 단일 성능이 얼마나 강한가가 아니라 "파레토 프런티어"—능력, 비용, 효율, 시나리오 커버리지 사이의 최적 균형 경계다. 공식 표현은 이렇다. Agent가 "질문에 답하기"에서 "작업 완수하기"로 나아감에 따라, 주력 모델의 기준은 "단일 성능이 강함"에서 "여러 항목 간의 균형"으로 바뀌었다.
- Model Blog: https://www.stepfun.com/step-5-preview
- 국내 오픈 플랫폼 API 접속: https://platform.stepfun.com/
- 해외 오픈 플랫폼 API 접속: https://platform.stepfun.ai/
- Studio 플랫폼 온라인 체험: studio.stepfun.com
하드 스펙: 희소 MoE 아키텍처, 총 파라미터 600B, 활성 파라미터는 27B에 불과하며, 100만 token 컨텍스트를 지원하고 네이티브 텍스트+비전 입력을 지원한다. 단위 비용은 이번의 판매 포인트 중 하나다. 공식은 단일 작업 비용이 Claude Opus 5의 1/8에 불과하다고 밝혔으며, 동시에 Artificial Analysis Intelligence Index에서 44점을 받아 전 세계 오픈소스 모델 3위에 올랐다. Agents' Last Exam CLI 하위 집합(ALE-CLI), 금융 투자 리서치 평가 FrontierFinance, 크로스 도메인 심층 리서치 평가 DRACO에서 모두 GPT-6 Astra 또는 Claude Opus 5에 이어 2위로, 다른 오픈소스 모델들을 앞섰다.
기사에서 가장 볼 만한 것은 두 개의 24시간 장주기 실험이며, 둘 다 "모델이 스스로 반나절 동안 연속으로 일하게 하는" agentic 시나리오다. 하나는 단일 NVIDIA H100에서 MLA GPU 커널을 처음부터 최적화하는 것으로, head dimension 512, batch size 1, 64개 head, 8192 token 조건에서 Step 5 Preview가 자율적으로 구현하고 실행하고 처리량을 측정하며, 돌아가긴 하지만 더 느린 방안을 만나면 포기하고 최적 버전으로 되돌아가 계속 조정해, 약 22시간 만에 피크 성능을 508 TFLOPS까지 끌어올려 Claude Opus 5의 493을 앞질렀다.
다른 하나는 자동화 후속 학습으로, 스스로 생산 데이터에 연결된 annotator를 호출하고 후속 학습 데이터를 어떻게 바꿀지 결정하게 해, Qwen3-30B-A3B 베이스를 AIME24에서의 정확도를 53.3%에서 60%로 끌어올렸으며, Claude Opus 5와 동률이지만 소모한 annotator token은 더 적었다.
현재 가장 뜨거운 논쟁인 "Scaling 전환"에 응답했다. 과거 대규모 모델은 더 많은 연산으로 더 강한 지능을 얻었지만, 이제 연산 비용이 동시에 증폭되고 있어, 다음 단계의 Scaling은 더 많은 Compute만이 아니라 더 높은 효율의 Compute도 포함한다—이는 Step 3.5 Flash, Step 3.7 Flash에서 Step 5 Preview까지 줄곧 추구해 온 문제다. 모델은 전량 개방되며, 가중치는 10월 15일에 공개된다.
출처:
- 阶跃发布旗舰模型 Step 5 Preview:向前一步,智能效率的新一代"帕累托前沿" - 阶跃StepFun