인스퍼, AI 컴퓨팅 성능 한계 돌파 기술 제시
인스퍼(浪潮信息)가 컴퓨팅 격차 해소는 자원을 쌓는 것만으로는 안 된다는 내용을 제시했다.
중국어 원문을 AI로 번역했습니다. 고유명사와 수치는 원문 표기를 우선하며, 중요한 판단에는 아래 출처 원문을 함께 확인하세요.
커레이시 2026-09-22 10:22:06 출처: 량쯔웨이(QbitAI)
컴퓨팅 파워 격차를 메우는 것은 자재를 쌓는 것만으로는 안 된다
커레이시, 우팡쓰(凹非寺)에서 보내다
량쯔웨이 | 위챗 공식계정 QbitAI
AI 컴퓨팅 파워 경쟁은 여러 해 동안 한 글자로 요약됐다——쌓기.
카드를 쌓고, 랙을 쌓고, 발전기를 쌓고…… 계산 카드가 충분히 많고 클러스터가 충분히 크면 먹이사슬 꼭대기에 설 수 있는 것처럼 보였다.
하지만 컴퓨팅 파워가 「충분한가」라는 문제는 더 이상 카드를 쌓는 것만으로 해결할 수 없게 됐고, 점점 더 많은 층위로 분화되기 시작했다.
첫 번째 문제는 지능 상한, 즉 당신의 컴퓨팅 파워가 얼마나 강한 지능을 떠받칠 수 있는가에 관한 것이다.
프런티어 모델의 파라미터 규모, 컨텍스트 길이, 추론 깊이가 동시에 커지고 있으며, 에이전트는 몇 시간, 심지어 며칠 동안 연속으로 작동할 수 있다.
모델이 한 대의 기계에 들어가는지, 빠르게 도는지, 오래 돌려도 안정적인지를 모두 새로 고려해야 한다.
또 다른 문제는 지능 규모로, 이 문제는 더욱 영혼을 직격한다——당신의 컴퓨팅 파워는 얼마나 낮은 비용으로 얼마나 많은 지능을 생산할 수 있는가?
토큰 수요가 폭발하고 있지만, 추론 부하는 다원적이며, Prefill과 Decode의 계산 특징이 달라서 같은 종류의 컴퓨팅 파워를 쌓는 것으로는 이런 차이를 더 이상 감당할 수 없다.
지능 상한과 지능 규모, 두 문제는 각각 독립적이면서도 서로 연관되어 있어, 둘 중 하나만 해결해서는 모든 컴퓨팅 파워 병목을 돌파할 수 없다.
바로 얼마 전 열린 AICC(인공지능 컴퓨팅 콘퍼런스) 2026에서 IDC는 《2026년 중국 인공지능 컴퓨팅 파워 발전 평가 보고서》를 발표하며 이 두 방향을 나누어 설명했다.
「둘로 나뉜」 컴퓨팅 파워 격차
에이전트가 대폭발한 이후, AI가 컴퓨팅 파워에 요구하는 바는 질적으로 변화하고 있다.
과거 사람들이 대형 모델을 사용할 때 컴퓨팅 파워 호출은 「펄스형」에 가까웠다. 사용자가 질문 하나를 하면 시스템이 답 하나를 반환하며, 컴퓨팅 파워를 한 번만 호출했다.
하지만 에이전트가 작업을 맡은 뒤에는 상황이 달라졌다. 하나의 인간 의도가 수십 번, 수백 번의 연속 추론을 촉발할 수 있고, 여러 에이전트가 협업 네트워크를 구성하면 시스템이 연속으로 가동되는 시간이 몇 시간, 심지어 며칠까지 더 늘어날 수 있다.
원래 한 번씩 짧게 발생하던 컴퓨팅 파워 요청이 지속적으로 이어지는 컴퓨팅 부하로 바뀌기 시작했고, 이는 인프라에 새로운 압력을 더한다.
이러한 장기 흐름의 압력은 세 가지 영향 인자로 분해할 수 있다.
첫째는 작업 실행 횟수로, IDC 보고서에 따르면 2030년까지 전 세계 연간 AI 추론 작업은 4000조 회 증가할 것이다.
둘째는 단일 작업의 토큰 소비량으로, 과거에는 간단한 질의응답 한 번에 토큰 수십 개만 소비했지만, 지금은 다중 턴 작업 의사결정 한 번에 수십만 개를 소비한다.
셋째는 다중 에이전트 협업의 「증폭 계수」로, 사용자 조작 하나가 여러 개의 에이전트 지시로 분해되고, 에이전트 사이에서 컨텍스트를 전달하고 결과를 취합하는 것이 전체 작업 체인을 다시 늘려 앞의 두 항목의 증가를 더욱 증폭시킨다.
세 인자는 곱셈의 형태로 겹쳐져, 컴퓨팅 파워 수요의 성장 곡선을 전례 없는 높은 수준으로 끌어올렸다.
IDC 데이터에 따르면, 올해부터 2030년까지 전 세계 토큰 소비량의 연평균 복합 성장률은 4822.6%에 달할 것이며, 에이전트가 먹어치우는 토큰은 급격히 팽창하고 있다.
하지만 컴퓨팅 파워의 공급 증가 속도는 수요의 변화에 뒤처지고 있다.
IDC 보고서에 따르면, 전 세계 AI 컴퓨팅 파워 수요 충족률은 2024년 79%에서 계속 하락해 2027년에는 71%로 떨어질 것으로 예상되며, 그 이후 상류 반도체 공급망의 압력이 다소 완화되더라도 2030년에는 겨우 77% 정도로 회복될 뿐이다.
백분율의 변동은 크지 않아 보이지만, 수요 기반이 급속히 팽창하고 있어 2030년에 컴퓨팅 파워 격차의 절대값은 3809억 달러에 달해 2024년의 거의 10배로 확대될 것이다.
과거에는 이런 격차를 메우는 방식이 주로 「무작정 밀어붙여 기적을 만들기」, 즉 클러스터 규모의 확장을 통해 더 많은 컴퓨팅 파워를 쌓는 것이었다.
하지만 에이전트 시대의 추론 부하는 종류가 매우 다양하고, 컴퓨팅 파워 설비에 대한 요구도 각기 다르다.
Prefill 단계는 고병렬, 고계산 밀도의 작업이고, Decode 단계는 토큰을 하나씩 직렬로 처리해야 하며 메모리 대역폭을 더 많이 소모하고, Attention은 계속 커지는 KV Cache에 빈번히 접근해야 하며, MoE는 희소 계산과 대규모 라우팅 스케줄링을 포함하고, 멀티모달 모델에는 독립적인 Encoder 모듈도 있다……
이 부하들은 각자 고유한 계산 특징을 지니고 있을 뿐 아니라, 컨텍스트 길이, 출력 길이, 동시성 규모에 따라 동적으로 변화한다.
에이전트 작업에서 첫 번째 대화의 컨텍스트는 1만~2만 개의 토큰에 불과할 수 있지만, 수백 번의 대화를 거치면 30만~40만 개로 확장되며, 시스템 병목은 계산, 메모리, 대역폭, 통신 사이에서 끊임없이 이동한다.
따라서 단순히 자재를 쌓는 것은 선형적인 용량 증가를 가져오지 않을 뿐 아니라, 오히려 자원 배분의 불균형을 초래해 일부 컴퓨팅 파워는 장기간 유휴 상태가 되고 다른 일부는 계속 과부하 상태가 된다.
실제로 이 격차에는 두 방향의 문제가 포함되어 있다.
하나는 능력 상한이다.
프런티어 모델의 파라미터 규모, 컨텍스트 길이, 추론 깊이가 동시에 커지고 있으며, 한 대의 기계에 들어가는지, 빠르게 도는지, 장시간 안정적으로 돌아가는지라는 세 가지 문제가 동시에 밀려온다.
다른 하나는 생산능력에 관한 것이다.
토큰 수요가 폭발하고 있지만 부하 유형이 각기 다르고, 서로 다른 추론 단계에는 서로 다른 특징의 컴퓨팅 파워가 필요하므로, 한 가지 컴퓨팅 파워로 모든 상황을 해결하던 방식은 더 이상 통하지 않는다.
량쯔정보(Langchao/浪潮信息)의 최고 AI 전략 책임자 류쥔(劉軍)은 이 두 방향을 Capability와 Capacity로 요약했다.
Capability AI Compute는 능력형 지능 컴퓨팅으로, 프런티어 모델이 과거에는 닿지 못했던 문제들을 건드릴 수 있게 뒷받침한다.
오늘날 AI는 이미 표적(target)에서 출발해 새로운 약물 분자를 발견하고, 스크리닝과 설계를 완료해 임상시험까지 추진할 수 있으며, 학계를 수십 년간 괴롭혀온 NS 방정식과 쌍둥이 소수 추측을 풀 수 있고, AI 칩을 자율 설계하며 성능을 끊임없이 반복 개선할 수 있다……
이런 작업들의 공통된 특징은 추론 체인이 길고 모델 규모가 크며, 컴퓨팅 파워 시스템의 수용 능력과 안정성에 대한 요구가 매우 높다는 것이다.
Capacity AI Compute는 용량형 지능 컴퓨팅으로, 지능의 공급을 더 충족시키고 더 저렴하게 만들어 더 많은 사람과 기업이 감당할 수 있게 한다.
컴퓨팅 파워도 같은 이치로, 능력 상한의 돌파만으로는 충분하지 않고 충분히 많은 사람이 쓸 수 있게 해야 비로소 실제로 자리 잡을 수 있다.
「능력 천장」을 뚫고 「생산능력 불안」을 와해시키다
이 두 층위의 문제에 맞서, 량쯔정보는 AICC2026에서 두 가지 제품——초(超)노드 AI 서버 「위안나오 SD200 Ultra」와 다원 컴퓨팅 파워 조립체 「위안나오 HC2000」——을 발표했다.
단일 노드 지능 상한 돌파
SD200 Ultra가 해결하는 것은 프런티어 모델이 들어가지 않고, 빠르게 돌지 않고, 안정적으로 돌지 않는 문제다.
「들어간다」는 0에서 1로 가는 단계로, 모델이 우선 실행될 수 있어야 성능을 논할 여지가 생기는데, SD200 Ultra는 「긴밀 확장」으로 이 문제를 해결한다.
그것은 작년 SD200이 채택한 3D Hyper Mesh 아키텍처를 이어받아, 전장(整機) 내부의 칩 수를 64개에서 128개로 늘렸고, 메모리와 확장 스토리지도 그에 맞춰 8TB와 64TB로 향상됐다.
SD200 Ultra는 충분히 많은 계산, 저장, 통신 자원을 하나의 물리적 경계 안으로 압축한다.
현재 전 세계에서 가장 큰 오픈소스 모델인 Kimi K3는 2조 8000억 개의 파라미터를 가지며, SD200 Ultra는 단일 기기로 이를 담고 효율적으로 실행할 수 있다.
그뿐만 아니라 SD200 Ultra는 단일 기기에 10조 파라미터 모델을 배포하는 것을 지원하며, 미래의 더 진보된 오픈소스 모델을 위해 인프라를 미리 준비해 두었다.
돌아가기 시작하면 사람들은 속도를 추구하게 된다.
128개의 칩이 협력해 작동해야 하고, 칩 간 데이터 교환이 초당 수십만 회에 달하는데, 전통적인 방식은 소프트웨어 호출과 버퍼 중계에 의존해 데이터를 옮기기 때문에 지연 오버헤드가 매우 크다.
SD200 Ultra는 이 문제를 두 층으로 해결한다.
첫 번째 층은 「통합 주소 지정」으로, 전역 통합 주소 편성, 가상 섀도 디바이스 등록과 교차 도메인 주소 변환을 통해 128개 칩의 메모리를 하나의 통합 주소 공간으로 만들고, 원격 자원 접근을 메시지 통신과 데이터 이동에서 주소 공간 내 직접 접근으로 바꾼다.
두 번째 층은 「대칭 직결」로, 통합 주소 지정을 기반으로 대칭 메모리 기술을 통해 GPU 메모리 직결을 구현하여, GPU가 로컬 메모리에 접근하듯 원격 GPU의 메모리를 직접 읽고 쓸 수 있게 하고, GPU가 통신을 개시하며 주소 변환과 패킷 중계를 건너뛰어 통신 경로를 대폭 단축한다.
최종적으로 SD200 Ultra의 All to All 통신 지연은 0.69마이크로초로 단축되어 국제 주류 초노드 제품과 상당한 수준에 도달했다.
통신 외에도 계산도 최적화가 필요하다.
Kimi K3를 예로 들면, 단일 스텝 추론이 수천 개의 연산자 호출을 포함하고, 실행 시 대량의 시간이 연산자 시작, 데이터 이동, 동기 대기에 소모되어 실제 계산에 쓰이는 시간은 오히려 제한적이다.
SD200 Ultra는 「슈퍼 연산자」 기술을 구축해, 추론 과정의 Attention, FFN, MoE 등 수많은 기초 연산자를 계산과 통신이 하나로 융합된 대형 연산자로 통합하여, 연산자 수를 10분의 1로 줄이고 커널 시작 횟수와 메모리 접근 오버헤드를 감소시켰으며 통신 지연을 숨겼다.
슈퍼 연산자 최적화를 통해 SD200 Ultra가 Kimi K3를 실행하는 추론 성능은 3배 이상 향상됐고, 토큰 생성 지연은 5.85밀리초까지 낮아졌다.
흥미롭게도, 슈퍼 연산자의 최적화 과정에서는 K3를 사용해 추론 흐름을 분석하고 재구성했는데, 모델이 스스로 자신의 실행 효율을 개선한 것이다.
또 하나 쉽게 간과되는 문제는 안정성이다.
에이전트의 복잡한 작업은 몇 시간, 심지어 며칠 동안 연속으로 실행될 수 있으며, 그동안 대량의 모델 호출, 도구 호출, 데이터 읽기·쓰기를 거치는데, 단 한 번의 계산 또는 통신 고장이 전체 작업 체인을 중단시켜 그 이전의 모든 추론과 실행이 물거품이 될 수 있다.
SD200 Ultra는 구리 상호연결 방식을 채택해 광전 변환 단계를 줄이고, 장시간 운전 중 회로 고장으로 인한 작업 중단 위험을 낮췄다.
컴퓨팅 파워가 더 많은 지능을 낳게 하다
HC2000은 다른 방향을 겨냥하며, 토큰 생산능력 부족 문제를 해결한다.
그 핵심 착상은 서로 다른 유형의 컴퓨팅 파워가 각자 맡은 바를 다하게 하는 것이다.
HC2000의 하드웨어 기반은 고밀도 액침냉각 AI 일체형 랙이다.
그것은 전액침냉각 설계에 고통류 전원 공급을 더해, 전통적인 공랭 랙의 방열과 전원 공급 병목을 돌파했으며, 단일 랙 전원 공급 능력이 300킬로와트를 넘고 최대 256장의 AI 가속 카드를 수용하며, 컴퓨팅 파워 밀도가 전통적인 공랭 랙의 4배에 달한다.
그 통신 아키텍처도 Directcom 2.0으로 업그레이드되어, 계산과 통신 대역폭이 1대 1로 균형 있게 배분되고, 랙 내 집계 대역폭이 200Tbps에 달하며, 랙 간 다중 평면 무손실 확장이 가능하고 All to All 통신 성능이 50% 이상 향상됐다.
이 하드웨어 기반 위에서 HC2000은 다원 컴퓨팅 파워 수용을 구현하여, 서로 다른 유형의 칩이 추론 단계에 따라 분업 협력하게 한다.
Prefill 단계에서는 대(大)컴퓨팅 파워 칩에 비용 효율이 더 좋은 메모리 입자를 선택해 고병렬, 고계산 밀도의 특징에 맞춘다.
Decode 단계에서는 대용량 HBM 칩을 선택해 메모리 용량과 대역폭을 함께 고려한다.
FFN 계산 단계에서는 3D RAM 적층 칩을 선택해 데이터 이동 경로를 단축하고, 캐시 대역폭이 초당 수십 TB에 달할 수 있다.
일체형 랙은 성숙한 산업 표준 아키텍처 모듈을 지원하며 다양한 컴퓨팅 파워 칩에 적응하고, 서로 다른 칩이 각자 가장 적합한 부하를 담당한다.
이 중에서 이 서로 다른 유형의 컴퓨팅 파워를 협력시키는 역할을 하는 것이 「MCIS 다원 컴퓨팅 파워 협력 추론 소프트웨어 스택」이다.
MCIS는 요청 라우팅, PD 분리 추론부터 컴퓨팅 파워 동적 조정까지 전 링크를 포괄한다.
PD 컴퓨팅 파워 동적 조정 측면에서 MCIS는 측정, 할당, 모니터링, 조정의 완전한 프로세스를 구축하고, 모델 배포 전에 성능 시뮬레이션을 통해 서로 다른 칩 조합과 PD 배분 비율을 평가해 적합한 구성 방안을 찾는다.
서비스 개시 후 MCIS는 계산, 캐시, 전송 각 단계의 실제 성능을 전 링크 모니터링하여 병목을 식별하고 예측과 비교한다.
업무 부하가 변하면 MCIS는 PD 배분 비율과 인스턴스 할당을 재평가하여 자원 할당 방식을 지속적으로 최적화한다.
다원 컴퓨팅 파워 KV Cache 관리 측면에서 MCIS는 서로 다른 유형의 컴퓨팅 파워 간 점대점 데이터 직전송을 연결하여 CPU 중계와 중복 복사를 피하고, 데이터 전송 성능이 거의 5배 향상됐다.
MCIS는 또한 KV Cache 데이터의 콜드·핫 정도에 따라 계층형 저장을 구축하고, 다중 레벨 파이프라인 병렬 집계를 결합하여 노드 내 디스크 I/O 성능을 32배 향상시켜, 대규모 다원 컴퓨팅 파워 환경에서 KV Cache의 저장과 전송 병목을 돌파했다.
최종적으로 대표적인 에이전트 작업 시나리오에서 HC2000에 MCIS를 조합해 동일한 투자로 10배의 토큰 생산능력 향상을 구현했다.
「컴퓨팅 파워 제공」에서 「지능 생산」으로
Capability와 Capacity는 AI 컴퓨팅 파워 병목을 해결하는 두 방향이지만, 서로 갈라져 나가는 두 갈래 길은 아니다.
이 둘은 서로 인과 관계에 있다. Capability가 돌파해 낸 새로운 능력은 알고리즘 최적화와 엔지니어링 반복을 거쳐 더 낮은 비용으로 아래로 스며들어 Capacity가 규모화 공급해야 하는 것이 되고,
Capacity가 지능을 더 많은 사람의 손에 보내면 새로운 응용과 새로운 수요가 생겨나고, 이 수요는 다시 다음 라운드의 Capability를 추동하여 더 높은 천장에 도전하게 한다.
두 방향은 서로 다른 길로 같은 곳에 이르러 하나의 나선으로 모이고, 이 나선은 가속되고 있다.
작년 전 세계에서 규모가 가장 큰 오픈소스 모델은 DeepSeek-R1로 파라미터 수가 6710억 개였고, 올해 이 자리의 주인은 Kimi K3로 바뀌어 파라미터 수가 2조 8000억 개에 달했다.
이들을 학습시키고 운영하려면 막대한 컴퓨팅 파워 투자가 필요하며, 소수 기관만이 감당할 수 있다.
하지만 각 모델 제조사는 이미 더 작은 파라미터 수와 더 낮은 추론 비용으로 프런티어 모델이 검증한 능력을 아래로 전달하고 있다.
정상의 돌파는 끊임없이 새로운 능력을 만들어 내고, 하단의 엔지니어링은 끊임없이 이 능력을 저렴하게 만들며, 중간의 응용 계층은 끊임없이 새로운 수요를 키워 나선을 계속 위로 밀어 올린다.
이 나선은 기업 쪽에서 이미 돌아가기 시작했다.
같은 한 회사가 탐색과 돌파가 필요한 작업에는 프런티어 모델을 호출해 미지의 답을 찾고, 이미 검증된 일상 프로세스에는 더 가벼운 모델로 전환해 대량 실행한다.
Capability는 사고와 계획을 담당하고, Capacity는 실행과 반복을 담당하여, 두 가지 컴퓨팅 파워가 같은 업무 안에서 병행 작동한다.
류쥔은 AICC에서의 강연에서 한 가지 역사적 유추를 언급했다.
세계 최초의 범용 전자 컴퓨터인 ENIAC은 매우 중요했지만, 실제로 수십억 명의 일과 생활을 바꾼 것은 개인용 컴퓨터와 스마트폰이었다.
가장 앞선 발전 기술도 중요하지만, 산업 사회를 진정으로 바꾼 것은 안정적이고 저렴한 전력이 수많은 가정에 들어온 것이었다.
AI도 같은 과정을 겪고 있다. 프런티어 지능의 첫 돌파는 AI가 무엇을 할 수 있는지를 결정하지만, 지능의 보편화 정도가 AI가 무엇을 바꿀 수 있는지를 결정한다.
지식, 추론, 판단, 창조라는 능력은 과거에는 인간 개인에게 극도로 의존했지만, 한 과학자가 평생 깊이 파고들 수 있는 문제는 한정되어 있기에 높은 수준의 지능은 태생적으로 희소한 자원이다.
오늘날 AI는 지능이 계산과 전력처럼 대규모로 생산되고 공급될 수 있는 자원이 될 수 있게 한다.
이 변화는 또한 컴퓨팅 파워 산업의 가치 기준을 다시 정의하고 있다. 즉 「컴퓨팅 파워를 제공하는 것」에서 「지능을 생산하는 것」으로 말이다.
류쥔(劉軍)의 말을 빌리면, 「지능을 생산하는」 오늘날 사용자가 컴퓨팅 파워 설비를 사는 것은 마치 냉장고를 사서 전원만 꽂으면 토큰을 생산하는 것과 같아야 한다.