국산 RSI 모델 공개, Flash 모델이 플래그십에 반격
국산 RSI 모델이 공개돼 Flash 모델이 플래그십 모델을 상대로 반격했으며, 1억 토큰을 무료로 제공한다.
중국어 원문을 AI로 번역했습니다. 고유명사와 수치는 원문 표기를 우선하며, 중요한 판단에는 아래 출처 원문을 함께 확인하세요.
一水 2026-09-17 11:26:21 출처: 量子位
1억 Tokens, 누구나 무료로 받기
RSI가 완전히 불붙었다.
실리콘밸리에서 시작해 국내까지 번진, 「모델이 차기 버전의 자기 자신을 훈련하는 데 참여하게 한다」는 말은 거의 하룻밤 사이에 AI 업계에서 가장 뜨거운 서사가 되었다.
하지만 떠들썩한 것과는 별개로, 현재 실제로 모델을 내놓아 성적표를 제출한 곳은 아직 손에 꼽을 정도다.
바로 이 시점에, 「홍콩증시 AGI 제1호 상장사」인 云知声(윈즈성)이 U2-Flash를 정식 발표하며 국산 RSI 초기 성적표를 가장 먼저 내놓았다.
△사진 출처: 云知声
U2-Flash의 후(後)훈련 폐쇄 루프에서 모델은 이미 자기 진화에 깊이 참여하기 시작했다:
훈련 데이터 생성, 실행 궤적 분석부터 훈련 시스템 점검·수리까지.
그런데 여기서 상식을 벗어나는 부분이 나온다.
업계 관행대로라면 Flash는 보통 「플래그십의 대체품」으로 여겨지며, 대체로 더 빠르고 더 저렴하지만 능력은 상대적으로 할인된 것이 일반적이다.
그런데 U2-Flash는?
속도와 비용 절감 능력의 향상은 확실히 흐지부지되지 않았다. U2 대비 생성 속도는 2.1배 향상되었고, Agent 작업 완료 시간은 35% 단축되었으며, 작업 반복 단계 수와 Token 소모도 20%에서 30% 줄었다.
그러나 능력은 할인되기는커녕, 오히려 이전 세대 U2를 뒤로 제쳤다:
- DeepSWE v1.1은 이전 세대 U2의 32점에서 64.6점으로 치솟아 그대로 두 배가 되었다;
- TerminalBench 3.0은 2.7점에서 24.3점으로 급상승해 9배에 도달했다;
- SWE-Bench Pro는 61.6점을 획득해 전 세대보다 10.5점 향상되었다.
그런데 성적 역전보다 더 주목할 만한 것은 U2-Flash가 보여준 지능 밀도다.
그것은 희소 MoE 아키텍처를 채택했으며, 총 파라미터는 약 266B이고, 단일 추론 시 약 10B만 활성화되어 총 파라미터의 4%도 되지 않지만, 코드·Agent 등의 작업에서 주력 모델과 정면으로 맞붙을 만한 성적을 내놓았고, 일부 성능은 심지어 조(兆) 단위 파라미터급 모델이 있는 구간에 진입했다.
이야, 이건 Flash의 「불가능 삼각형」을 그대로 뒤집어엎은 셈이다:
더 빠르고, 더 저렴한데, 능력은 한 세대를 건너뛰었다.
말이 길어졌으니, 실측을 바로 시작하자.
Flash를 일하는 주력으로 쓴다면, 답은 이번엔: yes!
云知声 MaaS 플랫폼을 열면 U2-Flash가 이미 첫 화면에 올라와 있고, 플랫폼은 온라인 체험과 API 호출 신청을 지원한다.
API를 중점적으로 살펴봤는데, OpenAI와 Anthropic 두 주요 프로토콜을 동시에 호환하며, Claude Code, Trae, Cursor, Cline 같은 자주 쓰는 도구들은 공식적으로 연동 방식을 제공하고, 나머지 Harness는 사용자 정의 모델만 지원하면 Base URL, API Key, 모델 ID만 바꿔서 연결할 수 있다.
복잡하게 할 것 없이, 나는 바로 손에 있던 WorkBuddy를 골랐고, 1분도 안 되어 호출 성공이 표시되었다.
덧붙이자면, U2-Flash는 none, low, high, max 네 단계의 사고 강도를 제공해 작업 난이도에 따라 속도와 추론 깊이 사이를 전환할 수 있지만, 이번에 WorkBuddy는 수동 단계 전환을 열지 않아서 나도 억지로 비교 평가를 하지는 않았다.
막 모델에 돈을 좀 충전하려던 참에, 백엔드를 보니 뜻밖의 소식이 있었다:
U2-Flash는 현재 기간 한정 6할(40% 할인).
입력 가격 0.6위안/백만 Tokens, 출력 가격 1.2위안/백만 Tokens, 캐시 적중 가격 0.12위안/백만 Tokens.
국내 주류 모델 API 가격에 익숙한 나로서는, U2-Flash가 기본적으로 「저렴」한 축에 속한다고 볼 수 있다.
내가 조금 과금을 하기도 전에, 백엔드에 갑자기 또 하나의 이벤트 페이지가 떴다, 음??
9월 15일부터 9월 30일까지, 누구나 1억 Tokens 사용 한도를 무료로 받을 수 있다.
1억 Tokens는, 코드 저장소 분석이나 장문 문서 작업 한 번에 수십만에서 백만 Tokens를 소모한다고 계산하면, 연속으로 수십에서 수백 번은 돌릴 수 있는 양이다.
그럼 뭘 기다리겠는가.
나는 바로 표를 하나 만들어 U2와 U2-Flash를 비교한 다음, 중점적으로 테스트해야 할 세 가지 지점을 골라냈다.
1, U2-Flash는 일을 빠르고 잘 해낼 수 있는가?
2, 예상치 못한 상황을 만났을 때, 스스로 수습할 수 있는가?
3, 512K 컨텍스트는 과연 생산성인가, 아니면 그저 예쁜 숫자 한 줄인가?
△이미지는 AI로 생성
그런데 본격적으로 강도를 올리기 전에, 먼저 다소 「월권」처럼 보이는 능력 하나로 몸을 풀어보자.
U2-Flash는 텍스트 입력·출력만 지원하지만, Harness와 외부 도구를 연결하면 PPT도 납품하고 심지어 3D 장면까지 구축할 수 있다.
그래서 나는 먼저 RSI 과학 PPT 한 편을 만들어보게 하며 물을 좀 테스트해보기로 했다.
영상 주소: https://mp.weixin.qq.com/s/JH9JICzAqfYz0xyfbCeaOQ
PPT 프롬프트는 AI가顺手(손쉽게) 대신 써줬고, 나는 대략적인 방향만 주었는데, U2-Flash는 공개 자료를 자동으로 수집하고 내용 구조를 정리한 뒤, 끝까지 디자인과 납품을 완료했다.
솔직히 말하면, 효과가 내 예상을 다소 뛰어넘었고, 이어질 도전이 더 기대되었다.
Case 1: Issue를 주지 않고, 스스로 Bug를 찾는다
첫 번째 관문은 스스로 문제를 발견하는 능력을 시험하는 것이다.
모델이 답을 본 적이 있을 가능성을 배제하기 위해, 나는 전혀 새로운 가상의 ExpenseFlow 경비 통계 프로젝트를 만들었다.
저장소는 크지 않고, 기존 테스트도 모두 통과해 겉보기에는 평온해 보였다.
그런 다음, 나는 프로젝트의 통계 및 날짜 처리 경로에 조용히 세 개의 함정을 일부러 심었다:
- 이미 반려된 경비 한 건이 어째서인지 여전히 이미 지급된 총액에 슬그머니 섞여 들어갈 수 있었다;
- 베이징 시간 8월 1일 새벽에 제출된 기록 한 건이 UTC 시간으로 저장된 뒤 시스템에 의해 다시 7월로 밀려 들어갔다;
- CSV 내보내기 단계에 이르면 날짜가 함께 월을 넘나들었다.
U2-Flash에 아무 단서도 알려주지 않고, 나는 재빨리 한마디를 던졌다:
출시 전 검수를 독립적으로 완료하고, 스스로 문제를 찾아 코드를 고치고 테스트를 보완한 뒤, 최종적으로 완전한 결과를 납품하라.
결과적으로, 그것은 단 7분 6초 만에 모든 문제를 정확히 찾아냈고, 내용이 상세한 검수 보고서까지 덤으로 주었다.
(P.S. 테스트 전에 나는 미리 검수 스크립트를 하나 준비해 돌려보았고, 정말로 제대로 찾아냈다는 것을 확인했다)
Case 2: 벽에 부딪힌 뒤, 스스로 돌아올 수 있는가
두 번째 관문에서는 내가 일부러 환경을 어지럽혀서, 그것이 잘못된 단서에 휩쓸려 갈지 지켜보았다.
이번 ProfileSync 2.0은 사용자 프로필을 동기화하는 프로젝트다.
코드는 신버전 API에서 사용자 이름을 읽어야 하는데, 실제 동기화 결과는 텅 비어 있었다.
더 골치 아픈 것은, 프로젝트 안의 자료들이 서로 충돌했다는 점이다:
README는 잘못된 실행 명령을 주었고, 오래된 문서에는 만료된 필드가 적혀 있었으며, 과거 로그는 문제를 네트워크 탓으로 돌렸다.
U2-Flash는 어느 자료가 신뢰할 만한지 스스로 판단하고, 진짜 고장을 찾아내야 했다.
내가 준 프롬프트 역시 여전히 아주 간단했다:
ProfileSync 2.0 출시 전 검수를 독립적으로 완료하고, 실행 방식과 인터페이스 계약을 스스로 확인하며, 문제를 발견한 뒤 수리를 완료하고 테스트를 보완해 완전한 결과를 납품하라.
시작한 지 얼마 안 되어, 첫 번째 벽이 나타났다.
README는 「python app.py를 실행하라」고 했지만, 프로젝트에는 그런 파일이 아예 없었다.
그러나 U2-Flash는 잘못된 지시 위에서 맴돌지 않았다.
단 3분 32초 만에, 그것은 진짜 고장을 특정하고 수리를 완료했으며, 테스트를 1개에서 7개로 보완했고, 최종적으로 모두 통과했다.
Case 3: 14개 파일을 한꺼번에 밀어넣어도, 바로 원고를 납품할 수 있는가
마지막 관문은 512K 장문 컨텍스트 차례였다.
이번에는 실제 제품 출시 한 건을 시뮬레이션해서,整套(전체) 프로젝트 자료를 전부 U2-Flash에 던져주었다:
14개 파일, 네 가지 형식으로, 책상을 거의 가득 채웠다.
그 안에는 Brief, 인터뷰, 제품 백서도 있었고, Release Notes, 데이터 표, 고객 사례, 회의록, 컴플라이언스 설명, 업계 보고서도 있었다.
핵심 정보는 서로 다른 파일에 흩어져 있었고, 대량의 무관한 내용도 섞여 있었다.
사람이 처리한다면, 하나하나 열어보고 중점을 골라내는 데만 한나절을 바쳐야 할 것이다.
나는 U2-Flash에게 모든 자료를 다 읽고 완전한 DOCX 한 부를 납품하라고 바로 지시했다:
1200~1500자 분량의 출시 원고, 핵심 사실 출처표, 자료 충돌 목록, 그리고 출시 전 확인 대기 질문 다섯 개를 포함하도록.
최종적으로, U2-Flash는 8분 36초를 들여 성공적으로 임무를 완료했다.
원본 자료와 대조하며, 나는 일부러 가장翻车(실수하기) 쉬운 세부 사항 두 개를 골라 확인했다:
그것은 옛 Brief에 있던 10월 8일을 그대로 쓰지 않고, 최신판의 10월 18일을 정확히 채택했다; 옛 버전의 81.2% 성적도 잘못 쓰지 않고 78.4%로 업데이트했으며, 내부 테스트에 속한다는 점을 명기했다.
업데이트해야 할 것은 업데이트하고, 피해야 할 함정은 피했으며, 확실히 이 한상의 자료에 정신이 팔리지 않았다.
리더보드, 파라미터, 그리고 더 많은 실측 결과를 한데 펼쳐놓고 보면, 답은 이미 아주 명확하다.
U2-Flash는 Flash에게 가장 어려운 업그레이드 한 번을 완수했다:
속도와 비용 우위는 여전하고, 코드·Agent·복잡한 작업 능력도 진짜로 끌어올렸다.
Bug 찾기, 잘못된 단서 판별부터 14개 자료 처리까지, 그것은 끝까지 최종 납품에 도달했고, 주력 모델이 마땅히 가져야 할 실행력을 보여주었다.
바꿔 말하면, 적어도 이번 라운드 테스트에서 U2-Flash는 이미 「기본 우선 선택」 칸에 넣을 수 있다.
U2-Flash 뒤의 「후훈련 폐쇄 루프」
그렇다면, 단일 실행 시 약 10B 파라미터만 활성화하는 모델이 무엇으로 능력을 여기까지 밀어올렸는가?
云知声이 내놓은 답은 두 가지다: 하나는 데이터, 둘은 후훈련 폐쇄 루프다.
데이터 부분은 굳이 길게 말할 필요가 없다. 云知声은 이미 충분히 명확하고 직설적으로 말했다:
업계에서 10여 년간 깊이 파고들며, 云知声은 방대한 실제 시나리오 데이터와 고품질 라벨링 능력을 축적했고, 이는 후훈련에 대체 불가능한 데이터 품질 장벽을 제공한다. 좋은 데이터는 좋은 모델의 제1원리다 — 바로 이렇게 여러 해 쌓인 고품질 데이터가 U2-Flash의 후훈련 효과를 순수 규모 구동 방식보다 훨씬 뛰어나게 만든다.
이 후훈련 폐쇄 루프를 중점적으로 보자. 그림 한 장으로 요약하면 다음과 같다:
원리는 확실히 복잡하지 않다. 진짜 어려운 것은 그것을 효율적으로 돌아가게 하는 것이다.
그중에는 세 가지 관건이 있다.
첫째, 자율 과제 생성으로 「무엇을 훈련할지」를 해결한다.
고정된 문제집은 결국 다 풀려버리기 마련이다.
U2-Flash는 현재 능력에 따라 새로운 과제를 동적으로 생성하며, 「지금은 아직 잘 못하지만 이미 돌파에 가까운」 문제들을 전문적으로 골라낸다.
모델이 한 걸음 나아갈 때마다 문제도 따라 업그레이드된다.
현재 이 폐쇄 루프는 이미 자율적으로 10만 개에 가까운 고품질 SWE 과제를 구축했으며, 여러 주요 프로그래밍 언어를 포괄한다.
둘째, 비동기 Agent RL로 장기 과제 「어떻게 훈련할지」를 해결한다.
Agent 훈련은 특히 시간이 많이 든다. 하나의 과제가 연속으로 수십 번 도구를 호출해야 할 수도 있고, 중간에 코드 실행과 환경 피드백을 기다려야 한다.
전통적인 동기 훈련에서는 과제 하나가 끝나지 않으면 다른 단계들도 따라 기다려야 한다.
반면 U2-Flash는 과제를 여러 Worker에게 바로 나눠주어, 이들이 동시에 서로 다른 샌드박스에 들어가 실행하게 한다. 어떤 이는 코드를 돌리고, 어떤 이는 도구를 호출하고, 어떤 이는 또 다른 경로를 시도하며, 뒤쪽의 정책 업데이트는 계속 진행된다.
동시에 시스템은 핵심 Action에 표시를 남겨, 최종 성공 또는 실패를 결과를 실제로 결정한 그 단계까지 거슬러 추적한다.
동기 훈련과 비교해, 이 비동기 아키텍처는 단위 시간당 산출되는 유효 훈련 궤적 수를 약 60% 향상시켰다.
사용자 측에 미치는 영향은, 모델이 시행착오를 덜 반복하고 유효 경로로 더 빨리 수렴한다는 것이다.
셋째, 다중 교사 온라인 정책 증류로 훈련 결과 「어떻게 판정할지」를 해결한다.
다영역 훈련에서 가장 두려운 것은 「하나를 누르면 다른 하나가 들썩이는」 것이다:
코드 능력은 올라갔는데 수학, Agent 또는 지시 따르기가 다시 떨어진다.
云知声은 먼저 수학, 코드, Agent 등 전문 교사 모델을 각각 훈련한 뒤, 학생 모델이 스스로 궤적을 생성하게 하고, 서로 다른 교사가 Token 단위로 채점하게 한다.
모델이 어느 단계에서 맞게 갔고 어디서부터 어긋나기 시작했는지, 더 세밀한 피드백을 얻을 수 있다.
이 방법은 U2-Flash가 동등한 능력에 도달하는 데 필요한 훈련 단계 수를 약 55% 줄였고, 여러 전문 능력이 복잡한 과제에서 협력해 발휘될 수 있게 했다.
나아가 이 폐쇄 루프 전체는 훈련 시스템 자체로까지 확장되었다.
U2-Flash는 기계 점검, 고장 위치 파악, 수리, 과제 재시작에 참여할 수 있다.
공식 데이터에 따르면, 훈련 고장의 평균 복구 시간은 이미 사람이 개입하는 방식의 약 3분의 1로 단축되었다.
그래서 이제 U2-Flash가 왜 동시에 강해지고, 빨라지고, 저렴해질 수 있는지 다시 보면, 나는 마침내 깨달았다.
후훈련은 그것이 더 일찍 올바른 도구를 고르고 더 빨리 오류를 발견하게 해주어, 무효한 시행과 Token 낭비를 함께 눌러버렸다.
이것이 바로 U2-Flash가 말하는 「높은 지능 밀도」의 핵심이다:
파라미터가 매번 전부 출전할 필요는 없지만, 활성화된 매 단계는 최대한 칼날 위에 쓰이도록 한다.
이 폐쇄 루프 안에서, 모델은 이미 훈련 데이터 생성, 실행 궤적 분석, 심지어 훈련 시스템 유지보수에 참여하기 시작했다.
글开头(서두)에서 언급한 RSI는, 여기서 마침내 눈에 보이는 초기 형태를 갖추게 되었다.
국산 모델이 RSI를 향해 첫걸음을 내디디다
그런데 아마 여러분도 나와 마찬가지로, 여전히 좀 혼란스러울 것이다:
지금 AI 업계는 다소 「만물이 모두 RSI가 될 수 있다」는 분위기로, 모델이 반성하면 RSI, 훈련 데이터를 생성할 수 있으면 RSI……
누가 진짜인가?
개념 자체는 새롭지 않지만, 엄밀히 말해 현재 전 업계가 공동으로 받아들이는 정의는 아직 없다.
이미 1965년에, 통계학자 I.J. Good은 일종의 「지능 폭발」을 상상했다:
충분히 똑똑한 기계 하나가 자기보다 더 똑똑한 기계를 설계할 수 있고, 후자는 다시 차세대를 계속 설계해, 능력이 이로써 눈덩이처럼 가속된다는 것이다.
1993년에는, SF 작가이자 컴퓨터 과학자인 Vernor Vinge가 이 상상을 「기술적 특이점」으로까지 밀어붙였다.
오랫동안 그것은 SF 소설의 궁극적인 전개에 더 가까운 이야기로 들렸다.
△I.J. Good 논문 3페이지를 가리킴
이제, 기술이 마침내 이 상상의 한 귀퉁이를 따라잡았고, RSI도 이로써 공학의 범주에 편입되었다.
가장 앞선 대형 모델을 보유한 실리콘밸리의 두 별, OpenAI와 Anthropic은 이미 각자의 판단을 내놓았다.
Anthropic의 기준은 상당히 엄격하다:
AI는 자율적으로 자기보다 더 강한 후속 시스템을 설계하고 개발할 수 있어야만, 완전한 재귀적 자기 개선을 실현한 것으로 본다.
OpenAI가 설정한 관찰 범위는 더 넓다.
모델이 AI 연구를 가속하고 스스로의 능력 향상을 추동할 수만 있다면 이미 「AI Self-Improvement」에 속한다. 하지만 Critical 등급에 이르면 기준 역시 갑자기 엄격해져, 모델이 완전 자동화된 AI 연구개발을 완수하거나 한 세대 모델의 업그레이드 주기를 지속적으로 기존의 5분의 1로 압축할 수 있어야 한다.
두 곳의 잣대는 완전히 같지 않지만, 겨냥하는 핵심은 점점 더 분명해지고 있다:
진정한 분수령은 한 번의 개선이 축적되어 다음 라운드로 들어가고, 다시 새로운 개선을 계속 추동할 수 있느냐에 있다.
그렇다면 이 길을 구체적으로 어떻게 한 걸음씩 걸어갈 것인가에 대해, 여기저기 살펴봤지만 현재 해외에서는 아직 통일된 RSI 업그레이드 로드맵이 형성되지 않았다.
국내 쪽에서는 최근 마침 논문 리뷰 한 편이 등장했다: 《The Last AI Built by Humans: Toward Genuine Recursive Self-Improvement》로, 상하이교통대학, 칭화대학, 상하이 AI Lab 등 기관의 연구자들이 모델이 「자기 개선 폐쇄 루프」를 접수하는 정도에 따라 L1부터 L5까지의 로드맵을 그려냈다.
아직 업계 통일 표준은 아니지만, 적어도 「만물은 모두 RSI가 될 수 있다」에 비교적 명확한 잣대 하나를 제공했다.
그리고 이 최신 분류에 따르면, U2-Flash는 이미 뚜렷한 L3 특징을 드러내고 있다:
여전히 사람이 설정한 샌드박스, 규칙, 권한 부여 경계 안에서 작동하지만, 다음 버전의 자신이 무엇을 배워야 하는지를 결정하는 데 참여하기 시작한 것이다.
이로써 클라우드싱(雲知聲) U2-Flash의 업계 내 위치는 더욱 분명해졌다.
지난 1년간 여러 국산 프런티어 모델 기술 보고서는 비슷한 변화를 가리켰다: 모델이 훈련 작업 생산에 참여하기 시작하고, 실행 가능한 환경에서 궤적을 축적한 뒤, 강화학습과 전문가 증류를 통해 이러한 경험을 범용 능력으로 전환한다.
후속 학습(포스트 트레이닝) 경쟁은 이미 「사람이 모델에게 얼마나 많은 답을 준비해 주는가」에서 「모델이 스스로를 위해 지속적으로 유효한 경험을 창출할 수 있는가」로 격상되었다.
U2-Flash는 이 완전한 링크를 관통해 작동시켰을 뿐만 아니라, 그 효과를 코드, Agent, 추론 성적에까지 현실화했다. 기술 체계의 완성도와 실제 능력 이득으로 볼 때, 클라우드싱은 의심할 바 없이 국내 선도 업체들과 같은 무대에서 겨룰 수 있는 후속 학습 능력을 갖추고 있다.
다만 자주 간과되는 현실 문제가 하나 더 있다:
국내 모델에게国产 컴퓨팅 파워에 적응할 수 있는지는 이 자기 반복 체계가 안정적이고 통제 가능하게 장기간 운영될 수 있는지와 직결된다.
L3 이후로 갈수록 모델은 데이터를 반복 생성하고, 작업을 실행하고, 훈련을 받고, 다시 검증하는 일을 더 많이 요구받는다.
루프가 빠르게 돌수록 컴퓨팅 파워, 추론 프레임워크, 클러스터 스케줄링에 대한 요구는 더 높아진다.
그래서 U2-Flash가 국산 컴퓨팅 파워 적응을 강조하는 이유도 이해하기 어렵지 않다:
U2-Flash는 이미 주요 국산 컴퓨팅 파워 플랫폼을 중심으로 모델 아키텍처, 핵심 연산자, 추론 프레임워크, 클러스터 스케줄링에 대한 적응 최적화를 진행했다. 실제 서비스에서 국산 플랫폼상의 처리량, 지연 시간, 동시성, 클러스터 확장 효율은 지속적으로 향상되고 있으며, 일부 시나리오는 이미 NVIDIA GPU 방안에 근접했다.
물론 U2-Flash는 아직 클라우드싱의 한 차례 초기 실천에 불과하다.
이 폐쇄 루프가 계속 돌기만 하면, 모델 능력은 단일 업그레이드에서 지속적 복리로 나아갈 기회를 얻게 된다.
이 또한 클라우드싱이 RSI에 전력 투구하는 가장 상상력이 큰 지점이다.
「인간이 만든 마지막 AI」는 아직 등장하지 않았지만, 다음 버전의 자신을 만드는 데 참여한 첫 번째 국산 모델들은 이미 무대에 올랐다.
포털:
https://maas.unisound.com/models/u2-flash