GPT-6, UP주관 공동 테스트서 1위…최강 모델일까
B站 'AI 무한 경기장' 첫 평가에서 GPT-6 Astra가 10명 UP주 평가 1위를 차지했고, 상위 5위 중 중국 모델이 3개였다.
중국어 원문을 AI로 번역했습니다. 고유명사와 수치는 원문 표기를 우선하며, 중요한 판단에는 아래 출처 원문을 함께 확인하세요.
서문
9월 16일, B站(빌리빌리)의 「AI 무한 아레나」가 정식 출시되었고, 첫 회 대규모 언어모델 평가 순위표가 동시에 공개되었다.
GPT-6 Astra는 10명의 UP主(업로더) 평가에서 1위를 차지하며 1위 횟수 챔피언에 올랐다.
순위표 상위 5위 안에 중국산 대규모 언어모델이 세 자리를 차지했다.
소식이 나오자 기술 관련 단체 채팅방의 논의는 명절보다 더 뜨거웠다.
어떤 사람은 "GPT-6은 여전히 아빠다"라고 했고, 어떤 사람은 "중국산 모델이 이미 따라잡았다"라고 했으며, 또 어떤 사람은 각 UP主의 영상을 찾아 하나하나 비교하며 누구 모델이 더 잘 돌아가는지 따졌다.
하지만 논의가 진행될수록 모두가 문제를 발견했다—— 똑같은 GPT-6인데, UP主마다 영상에서의 성능이 완전히 달랐다.
코드 수정류 평가에서는 정말로 노련한 노견처럼 안정적이었다.
게임 개발류 평가에서는 이따금 실수했다.
생활 의사결정류 평가에서는 어떤 중국산 모델보다도 성능이 떨어졌다.
이것은 GPT-6의 문제가 아니라, 모든 AI 평가가 직면한 근본적 난제다: 도대체 어떤 기준으로 모델이 좋은지 나쁜지를 가늠할 것인가?
一、B站 아레나는 도대체 무엇을 테스트하는가?
GPT-6의 성적을 이야기하기 전에, 먼저 2분 정도 들여 이 아레나의 평가 논리를 확실히 알아보자.
B站 AI 무한 아레나의 핵심 설계는 매우 직관적이다: 주제 제한도, 차원 제한도 없이 UP主가 자신의 실제 업무 흐름을 바탕으로 자율적으로 문제를 출제하여, 수백 개의 대규모 언어모델을 같은 문제로 맞붙게 한다.
이는 전통적인 Benchmark와 본질적으로 다르다.
전통적인 Benchmark(예: MMLU, HumanEval, SWE-bench)는 표준화 시험이다——고정된 문제 은행이 있고, 표준 답안이 있고, 통일된 채점 규칙이 있다.
"수능"이라고 이해하면 된다.
모든 응시생이 같은 시험지를 풀므로 점수의 비교 가능성이 높다.
B站 아레나는 실전 시용이다——UP主가 자신의 실제 업무에서 겪은 힘들고 지루한 일을 문제로 내놓아 AI에게 직접 시킨다.
잘했는지 못했는지는 UP主 스스로 판단한다.
二、GPT-6은 도대체 무엇을 "압도"했는가?
나는 UP主들의 평가 결과를 정리해 보았고, GPT-6의 우위가 한 가지 특정한 유형의 과제에 집중되어 있음을 발견했다.
2.1 GPT-6이 이겼지만, UP主가 진솔한 한마디를 했다
"똥산에서 검을 겨루다(屎山论剑)"는 첫 회 평가에서 가장 하드코어한 코드 수정 주제로, UP主 "Token就是词元"이 서로 다른 AI에게 "대대로 물려받은 BUG"——한 줄을 고치면 세 줄이 무너지는 그런 오래된 코드——에 직접 도전하게 했다.
GPT-6은 이 주제에서 두드러진 성적을 내며 괜찮은 결과를 거두었다.
하지만 UP主는 영상에서 직접 한마디를 했고, 이는 탄막(댓글)에서 반복적으로 도배되었다: "GPT-6은 확실히 한 층 더 올라갔다. 하지만 항상 안정적일 수 있을지는 더 지켜볼 가치가 있다."
이 표현은 곱씹어 볼 만하다.
"한 층 더 올라갔다"와 "항상 안정적"은 완전히 다른 두 가지 평가 차원이다. 한 번의 평가에서 높은 점수를 내는 것과 백 번의 실제 과제에서 안정적으로 결과물을 내놓는 것 사이에는, 많은 사람이 생각하는 것보다 더 많은 것이 가로놓여 있다.
2.2 왜 GPT-6은 코드 수정에서 강한가?
이는 OpenAI의 GPT-6에 대한 포지셔닝과 직접 관련이 있다.
GPT-6 Astra의 가장 큰 능력 업그레이드는 "지식이 더 많아진 것"이 아니라 Computer Use 능력이다——화면 그림을 읽고, 마우스와 키보드를 조작하며, 실제 소프트웨어에서 다단계 과제를 완수할 수 있다.
OSWorld 2.0 테스트에서 Astra는 72.6%를 기록했고, GPT-5.6 Sol은 65.7%였다. 같은 과제를 완수하는 데 Astra는 평균 40분, Sol은 75분이 걸렸다——속도가 거의 절반 빨라진 것이다.
코드 수정 시나리오에서 이것은 GPT-6이 단지 "어디에 문제가 있는지 알려주는" 것이 아니라, 진짜로 터미널에 들어가고, 테스트를 돌리고, 오류를 읽고, 코드를 고치고, 다시 테스트를 돌릴 수 있다는 뜻이다.
이것은 하나의 완전한 폐루프(closed loop)다.
2.3 하지만 GPT-6도 실수할 때가 있다
게임 개발류 평가에서 GPT-6의 성능은 다른 선두 모델들과 차이가 크지 않았다.
어떤 UP主는 창의적 설계와 게임플레이 논리가 필요한 개방형 과제에서, GPT-6이 오히려 코드 수정 때만큼 능숙하지 못했다고 피드백했다.
게임 개발은 단지 "코드를 맞게 작성하는" 것만이 아니라, 게임플레이 설계의 직관, 수치 균형에 대한 판단, 플레이어 경험에 대한 예측도 포함한다——이것들이 바로 표준화 시험으로는 측정할 수 없는 것들이다.
더 주목할 점은, GLM-5.3이 또 다른 코드 수정 주제에서 1위를 차지하며 GPT-6을 눌렀다는 것이다.
그리고 Claude Fable 5.1은 단계별 대항적 수정 주제에서 정상에 올랐다.
같은 "BUG 수정"이라는 큰 방향에서, 서로 다른 UP主가 설계한 서로 다른 과제에서는 우승 모델이 달랐다.
이것이 무엇을 말하는가?
모든 실제 시나리오에서 "압도"하는 모델은 없다는 것을 말한다.
GPT-6은 터미널 조작과 엔지니어링 실행에서 강하고, GLM-5.3은 대대로 물려받은 코드 시스템 테스트에서 강하며, Claude는 단계별 대항적 수정에서 강하다.
이것은 "누가 누구보다 대단한가"의 문제가 아니라, 서로 다른 모델이 서로 다른 과제에서 서로 다른 능력 분포를 가진다는 것이다.
나도 프로젝트에서 비슷한 느낌을 받은 적이 있다.
같은 모델이 비즈니스 로직 코드를 작성할 때는 특히 손에 잘 붙지만, "기획자의 의도를 추측해야 하는" 요구사항을 시키면 헛소리를 하기 시작한다.
모델은 비쌀수록 좋은 게 아니라, 당신의 시나리오에 더 잘 맞을수록 좋다.
三、핵심 모순
일부 동료들은 업무 중에 이런 장면을 겪었을 수 있다: 어떤 모델의 점수 순위표를 보고 "전면적으로 앞선다"고 여겨 신나서 도입했다. 그런데 출시 후 당신이 가장 관심 있는 그 비즈니스 시나리오에서는 점수가 한참 낮은 모델보다도 못한 성능을 보였다.
이것은 개별 사례가 아니다.
이것은 현재 AI 평가 체계의 구조적 모순이다.
3.1 이 모순을 그림 한 장으로 정리하면
전통적인 Benchmark는 "당신이 정답을 아는가"를 시험하고, 실제 시나리오는 "당신이 일을 해낼 수 있는가"를 시험한다.
이 두 가지 일이 요구하는 능력은 완전히 다르다.
3.2 데이터는 말을 한다
2026년 5월, 상하이 인공지능 연구소는 여러 대학과 연합해 WildClawBench를 발표했다——60개의 과제 전부가 실제 업무 시나리오를 모방했으며, 논문 크롤링, 코드 저장소 감사, Git 이력에서의 API Key 유출 점검, 회의 영상에서 구조화된 데이터를 추출해 전문 홍보 브로셔를 생성하는 것 등을 포함한다.
결과는 매우 뼈아팠다: 현재 가장 잘하는 모델인 Claude Opus 4.6이 이 실전 문제 세트에서 얻은 점수는 겨우 51.6%였다.
다시 말해, 현재 최정상의 대규모 언어모델조차 실제의 복잡한 엔드투엔드 과제에 직면하면 약 절반밖에 완수하지 못한다.
또 다른 데이터는 더 직접적이다.
중국인민대학교 가오링 인공지능대학원은 BeyondSWE 벤치마크를 제안했으며, AI의 저장소 간 검색, 도메인 지식 이해, 의존성 업그레이드, 제로부터의 시스템 구축 능력을 시험한다.
결과적으로 최정상 모델의 통과율이 45% 이하로 폭락했고, 이는 실제 엔지니어링 사고의 부재를 드러냈다.
3.3 GPT-6 자신의 데이터도 문제를 말해준다
ARC-AGI-3에서 GPT-6의 성적은 널리 인용되는 것이 99.9%다.
하지만 이 숫자에는 결정적인 배경이 있다.
ARC Prize 공식이 표준 harness에서 측정한 성적은 62.7%다.
그리고 Provider Adapter harness에서야 99.9%가 나온다.
두 숫자 모두 GPT-6이고, 둘 다 ARC Prize에서 나왔으며, 둘 다 SOTA라고 불린다.
차이는: 표준 harness는 모델이 얼마나 많은 것을 "기억"할 수 있는지를 제한하고, Provider Adapter는 모델이 노트를 지참하는 것을 허용한다.
더 결정적으로, 지식·프로그래밍·도구 호출·장문맥을 종합한 9개 항목 테스트에서 GPT-6 Astra의 범용 지능 지수는 61점으로, GPT-5.6 Sol과 동률이며, Claude Fable 5.1의 66점보다 5점 적다.
즉, GPT-6의 "지능"은 이전 세대보다 더 강해지지 않았고, 강해진 것은 "손을 쓰는 능력"이다.
四、K3 탈락: 곰곰이 생각해 볼 만한 사례
이번 아레나에는 반복적으로 논의된 또 다른 사례가 있다: Kimi K3가 첫 회 순위표에 나타나지 않았다.
K3는 어느 수준인가?
7월에 발표되었을 때, 월지암면(月之暗面)은 2.8조 파라미터의 모델 가중치를 완전히 오픈소스로 공개했고, 1M 컨텍스트를 지원하며, 프런트엔드 순위표에서 글로벌 1위를 차지했다.
전통적인 점수 순위표의 관점에서 보면, K3는 절대적으로 "1군" 선수여야 한다.
하지만 B站의 실제 시나리오 평가에서는 순위표에 들지조차 못했다.
어떤 포럼 사용자는 곧바로 글을 올려 물었다: "k3도 순위에 못 드나? 나는 잘 믿기지 않는다." 아래 가장 많은 추천을 받은 답글은 매우 직접적이었다: "점수와 실제 시나리오는 같은 것이 아니다."
이는 K3가 "안 된다"는 말이 아니다.
그것은 프런트엔드 UI 생성 같은 과제에서는 여전히 매우 강하다.
하지만 실제 시나리오 평가가 드러내는 것은 능력의 경계다——K3는 어떤 유형의 과제에서는 매우 강하고, 또 다른 유형의 과제에서는 남보다 못할 수 있다.
그런데 전통적인 Benchmark는 흔히 "그것이 가장 잘하는 그 한 유형"만 테스트한다.
五、그렇다면 도대체 GPT-6의 "우승"을 어떻게 봐야 하는가?
나의 판단은 이렇다:
GPT-6 Astra는 현재 가장 강한 프로그래밍 및 Agent 모델 중 하나이며, 이 점에는 논쟁의 여지가 없다.
B站의 10개 UP主 평가에서 1위를 차지했고, OSWorld 2.0에서 72.6%로 Sol의 65.7%를 앞섰으며, Codeforces에서 3206점을 받았고, CAD 그리기 테스트 BenchCAD에서 95.9%에 도달했다——이 성적들은 모두 실질적이다.
하지만 "압도적 우승"이라는 표현은 더 중요한 사실 하나를 가린다: AI 능력은 다차원적이다.
GPT-6은 Agent 실행과 코드 수정에서 강하고, GLM-5.3은 대대로 물려받은 코드 시스템 테스트에서 강하며, Claude Fable 5.1은 복잡한 디버깅과 추론에서 강하고, Kimi K3는 프런트엔드 UI 생성에서 강하다. 이것은 "누가 누구를 대체하는가"가 아니라 "각자 잘하는 바가 있다"는 것이다.
5.1 GPT-6의 진정한 돌파구는 어디에 있는가?
"지식이 더 많아진 것"이 아니라, "말하기"에서 "손을 쓰기"로의 전환이다.
OpenAI는 발표 당시 GPT-6을 "Anything you can do on a computer, Astra can do for you"라고 포지셔닝했다. 이것은 마케팅 문구가 아니라 방향 선언이다.
과거의 AI 모델은, 당신이 질문하면 답을 준다. 당신이 일을 시키면 "어떻게 하는지"를 알려주고, 그다음은 당신이 직접 실행한다.
GPT-6은 직접 당신을 대신해 "한다"——화면을 보고, 마우스를 클릭하고, 키보드를 두드리고, 테스트를 돌리고, 오류를 읽고, 다시 코드를 고친다. 그것이 완성하는 것은 한 줄의 출력이 아니라 하나의 폐루프다.
Terminal-Bench 4.0에서 GPT-6은 57.9%를 받아 Sol의 37.3%를 크게 앞섰다. 이는 프로그래밍 능력이 50% 이상 향상된 것이다.
마치며
즈후(知乎)의 그 질문으로 돌아가자: GPT-6이 UP主 공동 평가에서 압도적으로 우승했는데, 그것이 현재 가장 강한 대규모 모델인가?
나의 답은 이렇다: 그것은 Agent 실행과 코드 수정에서 현재 가장 강한 것 중 하나지만, "가장 강한 대규모 모델"이라는 표현 자체에 문제가 있다.
왜냐하면 "가장 강하다"는 것은 당신이 어떤 자로 재느냐에 달려 있기 때문이다.
만약 당신이 "일을 해낼 수 있는가"를 재면——GPT-6은 확실히 강하다. 만약 당신이 "범용 지능이 얼마나 높은가"를 재면——그것은 이전 세대와 동률이다. 만약 당신이 "모든 실제 시나리오에서 앞서는가"를 재면——답은 분명하다: 아니다.
한 모델이 어떤 순위표에서 1위를 했다고 해서, 모든 실제 시나리오에서 더 강하다는 뜻은 아니다. 민간 평가에서 두드러졌다고 해서 종합 능력이 반드시 더 높다는 뜻도 아니다——그것은 단지 평가자가 설계한 그런 유형의 과제와 우연히 맞아떨어졌을 수도 있다.
AI 평가는 "시험"에서 "실전"으로 나아가고 있다.
B站 아레나는 전통적인 Benchmark 외에, AI의 실제 능력을 관찰하는 새로운 창을 제공한다.
2026년의 AI 평가 분야는 심층적인 전환을 겪고 있다: "점수 경쟁"에서 "시나리오 검증"으로, 단일 능력 평가에서 안전성·신뢰성·견고성의 다차원 평가로.
이 창이 전통적 평가를 대체할 수 있는지에 대해, 나의 견해는 이렇다: 대체가 아니라 상호 보완이다.
공식 Benchmark는 횡적 비교에 적합하고, 실제 시나리오 평가는 실제 사용 경험을 판단하는 데 적합하다. 둘을 합쳐야 모델의 전체 모습을 볼 수 있다.
점수만 보지 말고, 한 UP主의 영상만 보지도 말라. 여러 개를 보고, 실제 과제를 여러 번 돌려보면 답은 자연스럽게 나온다.