Issue 01중국 AI
AC POST
중국 AI 목록
开源中国2026년 9월 17일 12:05중국어 → 한국어

샤오미, MiMo 2.6 후학습 과정 실시간 대시보드 공개

샤오미 MiMo 팀이 공식 사이트에 후학습 실시간 데이터 패널을 열고 MiMo 2.6 훈련 상황을 공개하며, RL을 AI 자기 개선의 확장 가능한 경로로 보고 훈련 세부를 점차 오픈소스화하겠다고 밝혔다.

중국어 원문을 AI로 번역했습니다. 고유명사와 수치는 원문 표기를 우선하며, 중요한 판단에는 아래 출처 원문을 함께 확인하세요.

샤오미 MiMo 대모델 팀이 공식 웹사이트에 후속 학습(post-training) 실시간 데이터 패널을 걸어두고, MiMo 2.6을 "공개적으로 발가벗고" 학습시키고 있다——팀은 RL이 AI 자기 개선을 실현하는 가장 확장 가능한 경로 중 하나라고 보고 있으며, 학습 세부 사항을 점진적으로 오픈소스로 공개하고 실시간 학습 대시보드를 제공해 진행 상황을 보여줄 계획이다.

mimo.xiaomi.com/rl/ 을 열면 두 모델——pro와 flash——이 현재 몇 번째 스텝까지 달렸는지, 각 스텝에서 얼마나 많은 샘플을 받았는지, 얼마나 많은 돈을 썼는지, 얼마나 많은 토큰을 태웠는지를 모두 실시간으로 스크롤하며 볼 수 있다. 지금 이 순간 패널에는 이렇게 적혀 있다: pro는 이미 약 83만 달러를 태웠고, flash는 약 36만 달러를 태웠으며, 양쪽 모두 1,568×16의 배치 규모로 돌아가고 있다.

이것은 평범한 "출시 후 벤치마크 붙이기"가 아니다. 샤오미는 후속 학습(post-training / RL) 과정 자체를 투명화한 것이다——당신은 한 모델이 학습 중에 조금씩 자라는 모습을 보고 있는 것이고, 그 모델의 곤경에 빠진 순간까지 포함한다: 패널의 notices에는 flash가 어제 어떤 데이터셋에서의 인프라 오류가 제때 감지되지 않아 15번째 스텝에서 재시작했다고 기록되어 있고, pro도 특정 노드의 VRAM 문제로 한 번 재시작했다고 적혀 있다. 실패, 롤백, 다시 시작하기, 이 모든 것이 다 드러나 있다.

성능 데이터도 실시간으로 업데이트되고 있다. 패널이 보여주는 것은 DeepSWE v1.1(mini-swe-agent, avg@3) 코딩 벤치마크다: 현재 pro 63.72, flash 60.77이며, 스텝에 따라 변하는 곡선도 그려져 있다. 방식은 DeepSeek과 판박이다——코딩 능력을 간판으로 걸고, 극히 낮은 가격으로 개발자들의 마음을 사로잡는 것이다.

샤오미 MiMo 대모델 책임자 뤄푸리는 X에서 한마디 설명했다: "지난 반년간 침묵은 오직 한 가지 문제를 연구하는 데만 썼다——RL이 도대체 어디까지 확장될 수 있는가." MiMo-V2.6은 지금 RL의 중간 지점을 달리고 있으며, 이번 라이브 방송은 바로 이 실험에 관찰창 하나를 달아준 것이다.

이번에 그들이 명확히 세 가지를 확장했다고 말했다. 첫째는 연산력: 매 스텝 약 20억 토큰, 1568개 프롬프트 × 16방향 rollout, 전부 비동기. 둘째는 환경과 harness: 다중 과제 agentic RL로, 한 번의 학습에서 여러 harness를 혼합해 동시에 돌린다. 셋째는 grader 연산력: agentic 그룹 내 credit 할당으로, 테스트 케이스와 rubric 두 가지 보상을 사용한다. 이 세 가지를 펼쳐놓은 것은, RL이 "단일 과제 점수 올리기"에서 "다중 과제 agent가 실제로 일하기"로 나아갈 때 가장 목을 조르는 몇몇环节에 대응하는 것이다.

라이브 패널의 실시간 데이터는 바로 이 세 가지 확장의 대가와 진행 상황을 구체화한 것이다. 지금 이 순간 pro는 이미 약 83만 달러를 태웠고, flash는 약 36만 달러를 태웠다; 코딩 벤치마크 DeepSWE(mini-swe-agent, avg@3)는 pro 63.72, flash 60.77이다. 실패조차 감추지 않는다——flash는 어제 데이터셋 인프라 오류가 제때 감지되지 않아 15번째 스텝에서 재시작했고, pro도 특정 노드 VRAM 문제로 한 번 재시작했다.

이 "학습 과정 라이브 방송"이라는 행위 자체가 구체적인 점수보다 더 주목할 만하다. 예전에 모델 제조사들이 세상에 보여주던 것은 학습이 끝난 그 순간의 최종 숫자였다; 이제 샤오미는 중간 과정까지 펼쳐놓는다——진짜 금과 은, 실시간 실패, 스텝별 곡선. 이는 open을 또 다른 차원으로 끌어올린 것이다: 가중치를 오픈소스로 공개하는 것뿐만 아니라, "그것을 어떻게 학습시켰는가"까지 공개적으로 관람 가능한 프로그램으로 만든 것이다.

출처:

- Xiaomi MiMo 2.6 live post-training dashboard

- Fuli Luo 공식 발표 트윗