화웨이, AI 컴퓨팅 토대 구축에 칩 하나로는 부족
화웨이 왕타오는 AI 컴퓨팅 토대를 만들려면 칩 하나만으로는 부족하다며 CANN이 변곡점을 넘어 소프트웨어 생태계를 보완한다고 밝혔다.
중국어 원문을 AI로 번역했습니다. 고유명사와 수치는 원문 표기를 우선하며, 중요한 판단에는 아래 출처 원문을 함께 확인하세요.
梦瑶 2026-09-19 16:28:51 출처: 량쯔웨이(量子位)
CANN이 변곡점을 넘어서고, 화웨이가 소프트웨어 생태계를 채우다
차오부츠(乔不迟)가 아오페이쓰(凹非寺)에서 전함
량쯔웨이 | 위챗 공식계정 QbitAI
올해 화웨이 전커넥트(全联接) 콘퍼런스에서 가장 중량감 있는 발표는 단연 한 세트의 칩 로드맵이었다.
어센드(昇腾) 960DT의 개발 진도는 원래 계획보다 세 분기 앞당겨졌고, 단일 칩 연산력은 두 배로 늘었으며, 960DT는 2 PFLOPS FP8, 4 PFLOPS FP4를 지원하고 HBM 용량은 최대 288GB, 대역폭은 9.6TB/s다.
이에 대응하는 어센드 960 슈퍼노드는 4096장의 NPU 카드를 구현해 최고 8EFLOPS FP8 연산력, 1PB를 넘는 HBM 용량을 갖춘다.
화웨이 순환 회장 왕타오(汪涛)는 후속 로드맵도 함께 펼쳐 보였다.
2028년 어센드 970, 2029년 어센드 980, 향후 몇 년간 "1년에 한 세대"의 진화 리듬을 유지한다.
콘퍼런스 후 왕타오는 량쯔웨이와의 단독 인터뷰에서 이 변화를 아주 직설적으로 말했다.
올해부터 950, 960, 970, 980이 연속 몇 세대에 걸쳐 이어지며, 향후 몇 년간 우리는 1년에 한 세대를 고수하며 빠른 진화의 리듬에 들어섰다. 이것 역시 국내 반도체 제조와 패키징의 상하류 지원 체계가 모두 연결된 뒤에야 실현된 것이다.
하지만 이번에 화웨이가 말하려는 것은 분명 더 빠른 칩 하나만이 아니었다.
960을 둘러싸고 화웨이는 NPO 광인터커넥트, 슈퍼노드, CANN 생태계와 타오딩뤼(韬定律)를 함께 테이블 위에 올렸고, 내놓은 답은 명확했다. AI 연산력 경쟁은 이미 점점 더 시스템 공학의 성격을 띠고 있다는 것이다.
단일 칩은 두 배가 됐지만, 화웨이가 걸고 있는 것은 시스템 전체다
먼저 이번 핵심 신제품부터 얘기하자면——어센드 960이다.
이전 세대에 비해 960은 연산력, 메모리 용량과 대역폭을 계속 끌어올리는 동시에 제품 출시 리듬도 눈에 띄게 앞당겼다.
화웨이 공개에 따르면 960DT는 원래 계획보다 세 분기 앞당겨 준비를 마쳤고, 960PR 버전도 계속 앞당겨질 예정이다.
더 주목할 점은 어센드 칩의 연구개발 주기다.
왕타오는 인터뷰에서 960 칩이 이미 실험실에서 여러 달 동안 테스트를 거쳤다고 밝혔다.
"칩은 착수부터 제품화까지 흔히 3년이 걸린다. 우리는 어느 발표든 제품이 이미 실험실에서 거듭 테스트를 거치고 정확한 납품 시점이 확보된 뒤에야 한다."
950, 960에서 후속 970, 980에 이르기까지 화웨이는 앞으로 몇 년간 1년에 한 세대라는 빠른 진화 리듬을 유지할 계획이다.
AI 대모델의 학습과 추론 규모는 빠르게 확대되고 있으며, 단일 칩이 아무리 강해도 조 단위, 10조 단위 파라미터 모델의 계산 수요를 혼자서 감당하기는 어렵다.
화웨이는 돌파구를 "규모 연산력"에 두었다.
910C는 384카드, 950은 1024카드, 960은 4096카드로 더 확장했으며, 물리 노드를 넘나드는 통합 메모리 주소 지정을 통해 여러 NPU를 서로 연결해 하나의 논리적 컴퓨터에 더 가깝게 만들었다.
왕타오는 화웨이가 시뮬레이션 학습에서 확인한 바로는, 동일한 10만 카드 클러스터에서 4096카드 슈퍼노드로 구성된 클러스터가 기존 8카드 서버로 구성된 클러스터에 비해 MFU를 2.75배까지 높일 수 있다고 언급했다.
MFU는 대모델이 실제로 이론 연산력을 얼마나 누리는지로 간단히 이해할 수 있는데, 클러스터가 클수록 통신, 동기화, 장애가 최고 성능을 더 쉽게 잡아먹는다.
그래서 왕타오는 AI 인프라가 이미 시스템 공학 단계에 들어섰다고 거듭 강조했다.
칩 하나를 잘 만드는 것만으로는 턱없이 부족하고, 서버 한 대를 잘 만드는 것도 부족하며, 결국 고가용성의 복잡한 시스템을 납품해야 가치가 있다는 것이다.
이러한 시스템 공학 능력은 화웨이가 스스로 정리한 핵심 강점이기도 하다.
대규모 슈퍼노드 하나는 칩, 통신, IP 네트워크, 광인터커넥트, 전원 공급, 방열, 소프트웨어와 장애 관리를 동시에 아우르며, 단일 지점의 성능이 강하다고 해서 시스템이 장기간 안정적으로 운영된다는 보장은 없다.
이번 연산력 경쟁에서 화웨이의 위치를 두고 왕타오의 판단은 매우 선명했다. "이렇게 큰 슈퍼노드 클러스터를 잘 만들려면 통신 기술, IP, 광모듈, 연산력, 시스템이 필요하다. 화웨이는 30년을 했고, 모든 분야에 장기적이고 대규모의 연구개발 투자를 해왔다. 이 모든 능력을 하나의 팀에 모으는 것은 화웨이뿐인 듯하다."
이것이 바로 어센드 960 슈퍼노드가 주목할 만한 지점이다. 선진 공정이 단기적으로 여전히 제약으로 작용하는 상황에서, 화웨이는 단일 칩을 계속 향상시키는 동시에 경쟁 전선을 시스템 전체로 확대하기로 선택한 것이다.
NPO가落地하고, 화웨이는 30년 광기술을 슈퍼노드에 녹여내다
960 슈퍼노드 세대에서 가장 강력한 신규 기술은 NPO(근접 패키징 광학, Near Package Optics)다.
NPO는 빛을 이용해 칩 간 고속 데이터 전송을 담당하는 기술로 이해할 수 있다.
과거 고속 데이터 전송은 주로 전기 신호에 의존했는데, 거리가 길어지면 손실과 전력 소모가 모두 증가했다.
NPO는 광전 변환을 담당하는 "광엔진"을 칩 가까이로 밀어 넣는 것으로, "전기가 덜 뛰게 하고 빛이 일찍 이어받게 한다"는 것과 같아, 고속 인터커넥트의 전송 손실과 전력 소모를 낮춘다.
이것이 바로 4096카드 슈퍼노드가 NPO를 필요로 하기 시작한 이유다. 카드가 많을수록 칩 간 데이터 교환이 더 빈번해지고, 인터커넥트 능력은 조연에서 시스템 전체 효율을 좌우하는 핵심으로 쉽게 바뀐다.
그리고 어센드 960은 업계 최초로 NPO 광엔진을 채택한 슈퍼노드다.
화웨이가 이 NPO 아키텍처로 만든 구체적 제품이 바로 Hi-ONE 광엔진이다.
단일 엔진에 36채널 200G를 집적해 총 전송 용량 7.2Tbps를 구현하고, 광원을 직접 내장했다.
왕타오는 라운드테이블에서 Hi-ONE의 선도성을 "3개의 첫 번째"로 요약했다.
첫째는 규모 상용화를 이룬 첫 사례로 다른 이들은 아직 실험실 단계이고, 둘째는 가장 큰 대역폭으로 36채널 200G 집적이며, 셋째는 광원을 내장한 유일한 제품이라는 것이다.
주목할 점은 화웨이가 곧바로 한 걸음에 CPO(공동 패키징 광학, Co-Packaged Optics)로 가지 않았다는 것이다.
CPO는 광엔진과 메인 칩을 함께 패키징해 이론적으로 거리를 더 단축할 수 있지만, 오늘날 신뢰성, 수율, 비용과 유지보수 모두 화웨이가 대규모 상용화에 적합하다고 보는 상태에 아직 이르지 못했다.
왕타오는 구체적으로 설명했다. "CPO는 광엔진과 메인 칩을 함께 두는데, 광엔진이 고장 나면 메인 칩 전체가 폐기되어 가용성이 나쁘고 장애 비용이 극히 높으며 패키징 업체에 대한 요구도 높다. 현재 NPO의 TCO는 CPO보다 최소 40% 이상 낮다. 현재 NPO가 공학, 비용 등 여러 면에서 종합적으로 최적의 선택이다."
그는 CPO에 대한 태도가 매우 열려 있었다. "미래에 CPO가 신뢰성과 수율 문제를 해결한다면, 화웨이도 고속 신호 전송 손실을 더 낮추기 위해 CPO로 전환할 수 있다."
어센드 960 슈퍼노드는 약 5500개의 Hi-ONE로 기존의 약 4만 8000개 800G 광모듈을 대체해, 전력 소모를 550kW 넘게 낮추고 시스템 무고장 운행 시간을 두 배로 높였으며 시스템 가용성은 99.8%다.
부품 수가 크게 줄어든 것 자체가 더 적은 장애 지점, 더 낮은 배선 복잡도와 더 통제 가능한 시스템 전력 소모를 의미한다.
이것이 바로 "슈퍼노드+클러스터" 노선이 실제로 자리 잡을 수 있는 전제 중 하나다.
화웨이에 필요한 것은 더 많은 칩을 연결하는 것뿐만 아니라, 시스템 규모가 커진 뒤에도 광모듈, 전원 공급, 방열과 장애율에 역으로 효율이 영향을 받지 않도록 보장하는 것이다.
하드웨어가 앞으로 달리면 생태계도 동시에 따라와야 한다.
CANN은 상시적 오픈소스 커뮤니티 운영에 들어갔고, 월간 활성 개발자는 5200명을 넘었으며 외부 개발자 비중은 61%에 달한다.
어센드 역시 PyTorch 공식 지원 노선에 들어갔고, 개발자는 PyTorch 커뮤니티에서 관련 지원을 직접 받을 수 있다.
이에 대한 왕타오의 표현은 오히려 절제되어 있었다. "8년의 노력 끝에 우리는 오늘에야 CANN 생태계가 변곡점을 넘었다고 감히 말할 수 있다."
화웨이는 다음 단계로 적응 작업을 더 앞당기려 한다. 모델이 사전 학습 단계에 들어갈 때부터 모델 업체와 협업해, 어센드 적응과 성능 최적화 등의 작업을 가능한 한 미리 완료하고, 모델이 출시된 뒤에야 어센드로 마이그레이션하는 것이 아니게 하려는 것이다.
중국에 매우 우수한 대모델 기업들이 잇따라 등장한 것을 보게 되어 기쁘다. 선도적 인터넷 기업도 있고 대모델 스타트업도 있으며, 이들의 뛰어난 제품과 강력한 혁신 능력은 중국 인공지능의 글로벌 영향력을 현저히 높였다. 화웨이의 사명은 이러한 우수 기업을 위해 견고한 연산력 기반을 구축하고, 이들의 든든한 후원자이자 파트너가 되는 것이다.
왕타오는 앞으로 점점 더 많은 모델이 어센드를 기반으로 네이티브 학습되는 것을 보게 될 것이며, 그렇게 되면 모델이 오픈소스로 공개되어 천行백업(千行万业)으로 나아간 뒤에는 기본적으로 다시 적응과 최적화를 할 필요가 없을 것이라고 밝혔다.
이 배후에 대응하는 것은 AI 산업 체인에서 자신의 위치에 대한 화웨이의 명확한 구분이다.
왕타오는 직언했다. "화웨이의 핵심 사명은 연산력 기반을 구축하는 것이다."
이 말은 사실 어센드, 슈퍼노드, CANN 나아가 전체 AI 인프라 사업에 명확한 경계를 그어준다.
화웨이는 더 많은 자원을 칩, 인터커넥트, 시스템과 소프트웨어 기반에 두고, 모델 업체와 인터넷 기업에 연산력 지원을 제공하고자 한다.
"판구(盘古)는 화웨이 자체 제품의 지능화를 계속 지원하겠지만, 화웨이는 모든 계층에서 파트너와 경쟁할 생각은 없다. 링취(灵衢) 프로토콜은 이미 개방되었고 CANN 코드도 지속적으로 오픈소스화되고 있으며, 화웨이는 더 많은 연구개발 자원을 칩, 슈퍼노드와 연산력 기반에 두려 한다."
왕타오는 이어 모든 대모델 및 학습 기업이, 선도적 인터넷 기업이든 혁신 기업이든, 중국 과학기술의 미래를 대표한다며, 화웨이는 이들의 "기반이자 후원자"가 되고자 한다고 말했다. "우리가 이들을 더 높이 받쳐줄수록 중국 AI의 경쟁력은 더 강해진다."
제품 형태로 대응하자면, 4096카드 슈퍼노드를 더 큰 계산 단위로 삼고, 다시 여러 슈퍼노드로 10만 카드, 수십만 카드 클러스터를 구성하는 것이다.
화웨이 공개에 따르면, 다중 슈퍼노드는 링취 네트워크나 RoCE를 통해 계속 확장되며, 2계층 Clos 네트워킹은 최대 51만 2000카드까지 가능하고, 다중 궤도 토폴로지를 결합하면 기술적 상한은 100만 카드까지 지원할 수 있다.
왕타오는 100만 카드는 기술적 지표에 더 가깝고, 현실적 배치는 여전히 투자, 전력과 모델 수요를 봐야 한다고도 강조했다.
화웨이의 진정으로 중요한 목표는 연산력을 "손에 닿는 것"으로 만드는 것이다.
왕타오는 "우리는 제품을 제공할 뿐만 아니라 많은 기술 전문가 팀을 파견해 고객이 어센드 네이티브 사전 학습을 하도록 지원하고, 기술 문제가 생기면 함께 해결한다"고 말했다.
왕타오는 화웨이의 미래 노선을 생각하며, "2030년, 나아가 미래까지 우리는 반드시 한 가지 준비를 해야 한다. 중국의 가장 선진적인 제조 공정이 아직 완전히 돌파되지 않았기에, 화웨이는 중국 AI 학습, 추론, 산업 응용의 수요를 동시에 충족하는 혁신 노선을 가져야 한다."고 말했다.
혁신에 대해 왕타오는 이것이 화웨이가 물러설 길이 없어서 걸어 나온 "승리의 길"이라고 말했다.
이것은 또한 화웨이가 왜 한편으로는 단일 칩 성능을 계속 향상시키면서, 다른 한편으로는 대량의 자원을 슈퍼노드, 광인터커넥트와 시스템 공학에 투입하는지를 설명해준다.
선진 공정은 여전히 중요하지만, 화웨이는 제조 조건이 완전히 개선될 때까지 기다렸다가 제품을 추진할 수는 없다.
그것은 기존 공정 조건에서 성능 향상의 공간을 계속 칩 밖으로 확장하고, 패키징, 인터커넥트, 광통신, 시스템 아키텍처와 소프트웨어 협업 등 여러 층의 최적화를 통해 전체 연산 효율을 가능한 한 증폭시켜, 국제 선도 AI 칩 및 컴퓨팅 시스템과의 격차를 좁힐 필요가 있다.
라운드테이블을 마무리하며 왕타오는 덧붙였다. "화웨이는 제품 회사이며, 고객에게 최고의 제품을 만들어야 한다. 런(任) 총재는 늘 각자 자기 두부를 잘 갈아 각자 맡은 바를 다해야 한다고 말한다. 우리의 두부는 바로 연산력 기반을 잘 만드는 것이다."
어센드 960, Hi-ONE에서 4096카드 슈퍼노드, CANN과 타오딩뤼에 이르기까지, 이번 전커넥트 콘퍼런스에서 진정으로 펼쳐진 것은 칩 하나의 파라미터 업그레이드가 아니라 더 완전한 AI 인프라 노선이었다.
단일 칩은 계속 반복 진화하고, 빛과 인터커넥트가 시스템을 키우며, 소프트웨어가 모델을 네이티브로 돌아가게 하고, 이어 지속적인 제품화로 연산력을 안정적으로 납품해 나간다.
화웨이가 지키려는 것도 바로 이 위치다. 중국 AI에 필요한 연산력 기반을 두텁게 만들어, 국내 모델 기업의 학습, 추론과 지속적 반복 진화에 충분하고 안정적인 연산력 지원을 제공하는 것이다.