비리비리 'AI 무한 아레나' 출시, 세계 100대 AI 모델 격돌
9월 16일 비리비리의 'AI 무한 아레나'가 정식 출시되며 첫 대규모 모델 평가 순위도 함께 공개됐다.
중국어 원문을 AI로 번역했습니다. 고유명사와 수치는 원문 표기를 우선하며, 중요한 판단에는 아래 출처 원문을 함께 확인하세요.
양자위(量子位)의 친구들 2026-09-16 14:23:05 출처: 량쯔웨이(量子位)
9월 16일, B站(비리비리)의 「AI 무한 아레나」가 정식 출시되었으며, 첫 번째 대규모 모델 평가 순위표도 함께 공개되었다.
#B站AI무한아레나#
9월 16일, B站 「AI 무한 아레나」가 정식 출시되었으며, 첫 번째 대규모 모델 평가 순위표도 함께 공개되었다. GPT-6 Astra는 10명의 UP主 평가에서 1위를 차지했고, GLM-5.3을 꺾고 1위 횟수 챔피언에 올랐다. 상위 5위 안에 중국산 대규모 모델이 세 자리를 차지했다.
「AI 무한 아레나」는 B站 UP主들의 AI 대규모 모델 평가를 모아 놓은 경기장으로, 각 분야 UP主들이 100여 개 대규모 모델을 실제 시나리오에서 실측한 것으로 구성되며, 코드, 추론, 협업, 지식 등 다양한 평가 주제를 포괄한다.
전통적인 벤치마크 평가와 달리, B站 AI 무한 아레나는 주제나 평가 차원의 제한을 두지 않으며, 각 분야의 UP主들이 실제 워크플로, 전문 응용, 재미있는 아이디어 등으로 자율적으로 문제를 출제하고, 동일 문제 대결(PK)을 통해 각 모델의 실제 성능 차이를 직관적으로 보여준다. 첫 번째 순위표는 현재 DeepSeek, Kimi, ChatGPT, Claude, Gemini, 더우바오(豆包), 치엔원(千问), Hy, MiniMax… 등 주류 모델 비교 평가를 포함하고 있다.
지난 1년간 B站의 AI 생태계는 폭발적인 성장을 맞았다. AI 지식 콘텐츠 소비 시간은 전년 대비 72% 증가했고, 월평균 AI 콘텐츠를 시청하는 사용자는 1억 9천만 명을 넘었다. AI 대규모 모델이나 제품 응용은 발표부터 사용자 논의, 평가, 사용, 도움 요청, 공동 구축에 이르기까지, B站의 라이브 방송, 영상, 탄막(弹幕)이 AI 과학기술 애호가들의 정보 획득과 교류 수요에 자연스럽게 부합하며, 활발한 생태계 속에서 대규모 모델 평가도 B站 커뮤니티에 축적되어 각 분야, 차원, 주제의 평가 콘텐츠가 대량으로 등장했다. 「AI 무한 아레나」라는 평가 집합 광장이 이런 흐름 속에서 생겨났다.
아레나 순위는 실시간으로 갱신되며, 계속해서 전 사이트 UP主를 대상으로 참가 신청을 받는다.
더 많은 평가 사례가 추가됨에 따라, 실제 시나리오에서 나온 이러한 표본 테스트는 모델 능력을 더 충분히 검증하고, 사용자가 AI 능력의 경계를 이해하는 데 더 전면적인 콘텐츠 관점을 제공할 것이다.
순위표 링크: https://www.bilibili.com/blackboard/era/aiarena.html?bsource=market_aiarena_sns_02