화웨이 GTS, 에이전트로 네트워크 장애 대응
화웨이 GTS가 에이전트로 네트워크 장애를 진단하는 방식을 적용해 작업 통과율이 24.2% 오르고 토큰 비용은 최대 45% 줄었다.
중국어 원문을 AI로 번역했습니다. 고유명사와 수치는 원문 표기를 우선하며, 중요한 판단에는 아래 출처 원문을 함께 확인하세요.
思邈 2026-09-16 10:27:20 출처: 량쯔웨이(量子位)
과제 통과율 24.2% 향상, token 비용 최대 45% 절감
允中 발신, 凹비사(凹非寺)
량쯔웨이 | 위챗 공식계정 QbitAI
"지능은 뇌 내부에만 국한되지 않는다. 우리가 종이와 펜 또는 지도를 사용해 복잡한 문제를 정리할 때, 이러한 외부 도구는 우리의 '확장된 마음'이 된다."
저명한 인지철학자 앤디 클라크(Andy Clark)는 고등 추론의 본질을 밝히며 이렇게 지적했다.
진정한 지능은 외부 도면을 이용한 '인지 오프로딩'(Cognitive Offloading)을 활용할 줄 안다.
그리고 고도로 복잡한 통신 네트워크 운용에서 대규모 모델 Agent 역시 이 문턱을 넘어설 필요가 절실하다.
IP 베어러 네트워크는 온갖 산업의 디지털화 시스템을 떠받치는 기반이다. 한 번의 카드 결제, 한 번의 온라인 진료 예약, 그 이면에는 모두 이것이 있다.
그러나 이 네트워크에 장애가 발생하면, 단서는 대량의 경보나 아무 표시도 없는 조용한 설정 속에 깊이 묻혀 있는 경우가 많다. 서비스가 중단되면 장애 대응의 첫 번째 문턱은 대개 '어떻게 고칠까'가 아니라, '지금 이 순간 이 네트워크가 도대체 어떤 모습인가'를 명확히 하는 것이다.
이 질문에 답하려는 문턱은 매우 높다. 실제 현장 네트워크는 '살아있는', 동적인 것이기 때문이다. 장애가 발생할 때마다 네트워크 토폴로지의 공간은 전혀 다르고, 뒤엉킨 라우팅에 맞서 머릿속에서 실시간으로 '동적 네트워크'를 재구성해 근본 원인을 찾아낼 수 있는 사람은 극소수의 베테랑 전문가뿐이다.
베테랑 전문가는 구하기 어려우니, 장애 대응의 중책을 대규모 모델 Agent(지능형 에이전트)에게 맡기는 것이 업계의 돌파구라는共识이 되었다. 업계에서는 흔히 대규모 모델의 강력한 지식 이해, 논리 추론, 분석·의사결정 능력을 바탕으로 이것이 압도적인 승리가 될 것이라 여겼다.
그러나 큰 기대를 안고 있던 Agent가 실제 현장에 들어섰을 때, 화웨이 GTS 알고리즘 팀은 직관에 반하는 치명적인痛点을 발견했다. AI의 추론 능력이 아무리 강해도 방대한 텍스트 로그는 읽어내지만, 정작 이 네트워크가 어떤 모습인지는 기억하지 못한다는 것이다. 팀은 이를 '토폴로지 기억상실'(拓扑失忆)이라 불렀다. 순수 텍스트 Agent가 수백 수천 개 노드의 동적 변화를 머릿속으로 견뎌내게 하는 것은 기억 붕괴로 빠져들 수밖에 없다.
어떻게 돌파할 것인가? 팀은 정확한 해법 NetCanvas를 내놓았다. 일련의 '상호작용 가능한 시각 토폴로지' 메커니즘을 도입해, 대규모 모델에 선을 그어 추론할 수 있는 '외부 작업 기억' 캔버스를 제공한 것이다.
이로써 AI는 진정으로 '인지 오프로딩'을 배워, 전문 엔지니어처럼 '네트워크를 보면서 장애를 해결'할 수 있게 되었다.
통점 분석: AI는 로그를 읽지만 네트워크는 고치지 못한다? 없는 것은 '살아있는 지도'
대규모 모델 Agent를 도입한 것은 본래 베테랑 전문가의 장애 대응 경험을 복제하고 현장 네트워크의 인력 부족을 메우기 위해서였다.
그러나 일선에서는 곧 직관에 반하는 현상을 마주쳤다. 모델은 분명 단일 명령어, 단일 출력 구간은 해석할 수 있는데, 일단 다중 장비, 다중 경로, 방화벽과 ECMP가 있는 실제 복잡 토폴로지로 들어가면 우회하기 시작하고, 같은 탐색을 반복하며, 심지어 같은 노드에서 맴돌기 시작한다.
전형적인 현장 참사 하나는 이러했다. 한 실제 장애 대응 테스트에서 Agent는 이미 문제가 난 방화벽을 특정했지만, 이 장비에서 수십 가지 조회 방식을 바꿔가며 제자리에서 300여 스텝을 맴돌았고, 여전히 근본 원인을 찾지 못했다. 그것은 방화벽을 조회해야 한다는 것은 알았지만, 이 방화벽이 전체 그림 속 어느 경로의 몇 번째 홉에 걸려 있는지는 몰랐다.
분명 추론 능력은 살아 있는데, 왜 AI는 길을 잃는가? 답은 공간 기억이 없기 때문이다.
베테랑 네트워크 엔지니어는 장애를 대응할 때 머릿속에 항상 '살아있는 그림'을 띄운다. 트래픽이 어디서 들어와 어디서 분기되고, 방화벽이 몇 번째 홉에 걸려 있는지가 모두 명확하다. 반면 순수 텍스트 Agent가 마주하는 것은 1차원으로 스크롤되는 CLI(명령줄)다. 이는 한 걸음 나아갈 때마다 조각난 로그에서 네트워크가 어떤 모습인지 다시 머릿속으로 그려야 한다는 뜻이다. 컨텍스트가 길어질수록 이런 공간 관계는 긴 텍스트 속에서 '붕괴'되기 쉽다.
이 현상에 대해 화웨이 GTS AI 알고리즘 팀은 이를 '토폴로지 기억상실'(Topology Amnesia)이라 명명했다. 장애 대응이 깊어질수록 국소적 관측은 점점 많아질 수 있지만, 전체적인 공간 관계는 점차 사라진다는 것이다.
이는 바로 첫머리의 철학적 단언을 그대로 입증한다. '외부 작업 기억'의 보조가 없으면, 순수 텍스트 모델은 복잡한 현장 네트워크에서 인지 과부하에 빠질 수밖에 없다.
어떻게 돌파할 것인가? 인간의 뇌도 복잡한 논리를 정리하려면 도면에 의존해야 하니, AI도 마찬가지다. 토폴로지 도면은 네트워크 엔지니어에게 장애 대응 시의 '외부 작업 기억'이며, 확인한 곳까지 도면이 갱신된다.
따라서 Agent에게 필요한 것은 결코 시작할 때 집어넣어 주는 죽은 전경도가 아니라, 그것과 상호작용을 일으킬 수 있는 살아있는 지도다.
이 논리를 따라 GTS는全新的 해법 사고를 확립했다. 전문가 경험을 억지로 Prompt에 써 넣는 것이 아니라, 전문가의 일하는 방식을 Agent 시스템에 써 넣는 것이다. 모델은 사고와 의사결정을 담당하고, NetCanvas는 길을 기록하고 그림을 그리는 것을 담당하게 한다.
△같은 네트워크가 사람과 Agent의 눈에는 사실 전혀 다른 두 가지다. (a) 인간 엔지니어 뇌 속의 공간 기억, (b) 순수 텍스트 Agent가 토폴로지 붕괴에 빠진 모습, (c) NetCanvas가 Agent에 상호작용 가능한 '살아있는 지도'를 갖춰 준 모습.
해법: '상호작용 가능한 시각 토폴로지' 도입, 세 가지 수로 Agent가 보면서 추론하게 하다
위의 통점 분석을 바탕으로, 팀은 진짜 해법인 NetCanvas를 꺼내 들었다.
이는 결코 모델에 정적인 네트워크 토폴로지 스크린샷 한 장을 단순히 쑤셔 넣는 것이 아니라, 모델을 위해 맞춤 제작한 '상호작용 가능한 시각 토폴로지' 세트다.
다음 '세 가지 수'를 통해 NetCanvas는 Agent가 실제 네트워크를 인식하는 방식을 완전히 뒤집었다.
수(招) 하나: 확인하면서 자라기(동적 성장)
실제 장애 대응 현장에서 누구도 첫순간에 완벽한 전역 토폴로지를 받아들 수 없다.
따라서 NetCanvas는 '시작부터 전경을 준다'는 경직된 사고를 버렸다.
Agent가 CLI 탐색을 한 번 마칠 때마다, 새로 발견된 장비, 링크, 경로 증거가 실시간으로 현재의 그래프 상태에 병합된다.
이는 마치 전장의 안개가 점차 걷히는 것과 같다. 토폴로지 도면은 생명이 있는 것처럼 장애 대응 진행 상황과 함께 '동적으로 자라난다'.
수 둘: 필요할 때만 화면을 잡고 추론하며 상호작용하기(핵심 동작)
그림이 자라나는 것만으로는 부족하다. Agent는 반드시 인간 전문가처럼 '그림을 사용할' 수 있어야 한다.
NetCanvas에서 Agent는 언제든 전역 뷰와 국소 뷰를 전환하거나, 현재의 초점 노드를 하이라이트할 수 있다.
더 대단한 점은, 스스로 연결선 색을 바꿔(예: 초록/빨강 점선으로 통·단 절 표시) 그림 위에 자신의 추론 가설을 직접 기록할 수 있다는 것이다. 모델은 더 이상 머릿속에서 죽기 살기로 외울 필요 없이, 진정한 '보면서, 표시하면서, 대응하기'를 실현한다.
수 셋: 네트워크 엔지니어의 습관대로 그림 그리기(인지 정렬)
Agent가 그림을 볼 수 있다는 것도 중요하지만, 그림이 어떤 방식으로 그 눈앞에 제시되는지도 똑같이 치명적이다.
연구개발 팀은 테스트에서 놀라운 사실 하나를 발견했다. 기계가 생성한 토폴로지를 인간 네트워크 엔지니어의 인지 습관에 맞는 '도메인 레이아웃'으로 바꾸기만 하면, Agent의 장애 대응 성공률이 압도적으로 뛰어오를 수 있다는 것이다. 그림을 바르게 그려야 AI도 바른 길을 간다.
데이터 검증: 진정으로 네트워크를 '꿰뚫어 봐야' Agent가 정확히 돌파하고 우회로를 줄인다
'살아있는 지도'는 도대체 얼마나 강력한가? 팀은 공개 통신 운용 벤치마크 CTBench에서 하드코어하게 검증했다.
이곳의 과제는 모두 실제 운용 사례에서 나온 것으로, Agent가 미지의 네트워크에 진입해 명령을 동적으로 실행하고, 불완전하고 조각난 증거에서 점진적으로 장애를 찾아내야 한다. 난이도는 전통적인 단일 턴 문답을 훨씬 뛰어넘는다.
복잡한 모델 파라미터는 제쳐두고, NetCanvas가 가져온 핵심 비즈니스 가치는 다음 세 가지 차원에 단단히 새겨졌다.
1. 장애 대응이 더 정확: 전체 효과가 현저히 향상되어 복잡 경로 병목을 효과적으로 돌파.
전체 데이터셋에서 NetCanvas는 Agent의 종합 통과율을 30.3%에서 54.5%로 끌어올렸다(물리적 연결선 프라이어가 있으면 63.6%까지 도달).
특히 이중 방화벽, ECMP(등가 다중 경로) 등 공간 관계에 대한 의존도가 높은 복잡 하위 과제에서는 효과가 약 10%에서 약 90%로 뛰어올랐다.
긴 로그에 숨어 있던 공간 관계가 '눈에 보이는' 구조가 되자, Agent가 다중 경로를 따라가며 실마리를 풀어내는 데 마침내 명확한 손잡이가 생겼다.
2. 성능이 더 안정적: 단 한 문제도 퇴화 없음(16승 0패 50무).
순수 텍스트 방안과 문제별로 비교했을 때, NetCanvas는 어느 한 문제에서도 능력 퇴화가 나타나지 않았다. 늘어난 16개는 순증이며, 다른 문제를 가져다 바꾼 것이 아니다.
3. 스텝 수가 더 적음: 종합 시행착오 비용 최대 45% 절감.
Agent의 평균 탐색 스텝 수는 159스텝에서 113스텝으로 곧바로 줄었다. 정확도가 크게 높아지고 Agent가 더 이상 맹목적으로 우회하지 않게 되면서, '한 문제를 맞힐 때마다'로 환산하면 대규모 모델의 Token 시행착오 비용은 오히려 26%에서 45% 감소했다.
그림을 그리는 것은 대규모 모델에 부담을 더하는 것이 아니라, 실질적으로 시행착오 비용을 절감해 주는 것이다.
△CTBench 통과율과 평균 탐색 스텝 수 비교
궁극적 시사점: '인지 오프로딩'을 배워 전문 Agent의 새 패러다임 구축
NetCanvas의 실천은 전문 Agent가 현장 네트워크에 착지하는 핵심 명제를 드러냈다. 모델 자체의 이해 능력도 중요하지만, 주변 시스템(Harness)이 이 실제 세계를 어떻게 제시하는지가 진정으로 최종 전투력을 결정한다는 것이다.
이는 바로 첫머리의 철학적 단언을 그대로 입증한다. 주변 시스템이 바로 Agent의 확장된 정신이다.
IP 네트워크처럼 토폴로지, 경로, 프로토콜이 동적으로 뒤엉킨 실제 복잡계에서는, 대량의 로그를 억지로 대규모 모델의 Token에 밀어 넣는 것이 필연적으로 인지 과부하를 초래한다.
Agent는 강력한 언어 이해 능력 외에도, 지속적으로 진화할 수 있는 '확장 작업 기억' 한 세트가 더 필요하다.
진정한 전문 역량은 모델 내부의 거대한 '지식 저장고'와 강력한 '추론·의사결정'에만 의존하는 것이 아니라, 주변 시스템을借助해 '인지 오프로딩'을 수행하고 진정한 네트워크 공간의 전역관을 세우는 데 있다.
이것이 또한 화웨이 GTS AI가 시종일관 견지해 온 기술 진화 경로다. 실제 운용 현장에서 출발해, 베테랑 엔지니어가 오랫동안 축적한 '공간 인지와 일하는 방식'을 공학화하여, Agent가 인지하고 상호작용할 수 있는 시스템 능력으로 전환하는 것이다.
미래의 네트워크 지능형 운용에서 Agent는 대량의 조각난 로그 속에서 '뇌 과부하, 장님 코끼리 더듬기'의 곤경을 완전히 벗어날 것이다.
'상호작용 가능한 시각 토폴로지'의 구동으로, AI는 마침내 최정상 전문가처럼 네트워크를 보며, 경로를 따라, 정확하게 장애를 대응할 수 있게 된다.
프로젝트 주소
caimanjing/netcanvas: https://github.com/caimanjing/netcanvas
CTBench: https://huggingface.co/datasets/netop/CTBench
*본 문서는 량쯔웨이가 게재 허가를 받은 것으로, 관점은 전적으로 원저자에게 있습니다.