Issue 01중국 AI
AC POST
중국 AI 목록
量子位2026년 9월 17일 18:39중국어 → 한국어

중국전신, 범용 Agent 'TeleAgent'로 IDC 실측 3위 진입

중국전신의 범용 에이전트 TeleAgent가 IDC 실측 테스트에서 3위에 올랐다.

중국어 원문을 AI로 번역했습니다. 고유명사와 수치는 원문 표기를 우선하며, 중요한 판단에는 아래 출처 원문을 함께 확인하세요.

十三 2026-09-17 17:39:19 출처: 량쯔웨이(量子位)

중국전신(中国电信), TeleAgent

진레이(金磊) 베이징(아오페이쓰)에서 발신

량쯔웨이 | 위챗 공식계정 QbitAI

깜짝 놀랄 일이다. 중앙기업(央企)이 만든 기업용 범용 Agent가 국내 3위 안에 들었다!

이는 IDC가 최근 발표한 국내 최초의 《중국 기업용 범용 Agent 제품 기술 평가》에서 나온 결과다:

그리고 이 중앙기업은 바로 중국전신(中国电信)이다.

게다가 이번에 IDC는 모두가 익숙한 대형모델 Benchmark를 계속 사용하지 않고, 약 100개의 비공개 과제를 통해 한 Agent가 실제 사무 환경에서 일을 끝까지 해낼 수 있는지를 직접 평가했다.

구체적으로 보면, TeleAgent는 일반 과제에서 3.49점, 복잡 과제에서 3.36점을 받았으며, 아홉 가지 능력 중 과제 수행에서 5점 만점을 받았고, 비용 효율은 이번 평가에서 최고점을 기록했다.

게다가 TeleAgent가 정식 출시된 시간도 그리 길지 않다. 올해 4월 TeleAgent 데스크톱 버전은 아직 사내에서 시험 사용 중이었다. 7월에 이르러서야 V1.0이 정식으로 대외 출시됐다. 불과 한 달 남짓 만에 현재 사용자 규모는 이미 120만에 가까워졌다.

그러면 문제가 생긴다:

한 중앙기업이 만든 범용 Agent가 왜 이번 경쟁에서 이렇게 빠르게 달릴 수 있었을까?

약 100문제로 Agent를 시험하다, 중국전신이 톱3에 진입

TeleAgent가 어떻게 3위를 차지했는지 깊이 파고들기 전에, 우리는 먼저 IDC가 이번에 도대체 무엇을 시험했는지 이해해야 한다.

예전에 우리가 익히 알던 Benchmark는 문제를 한 세트의 점수로 단순화하는 쪽에 더 가까웠다. 수학, 코드, 추론, 지식 항목을 하나씩 다 돌리고 나면 모델 능력이 어느 위치에 있는지 대략 판단할 수 있었다.

하지만 범용 Agent의 능력을 시험하려면 평가 방식이 달라진다. 결국 그것이 마주하는 것은 기업 내부의 복잡다단한 업무이기 때문이다.

바로 그렇기 때문에 IDC는 이번에 테스트의 중점을 '처음부터 끝까지 일을 끝내는 것'에 두었다.

IDC의 정의에 따르면, 기업용 범용 Agent는 목표를 이해하고, 도구와 Skill을 호출하며, 기업 지식과 업무 시스템에 연결하고, 그리고 지속적으로 과제를 수행할 수 있어야 한다.

이 목표를 중심으로 IDC는 거의 100개에 달하는 비공개 과제를 설계했는데, 이메일, 일정, 문서 처리 같은 일상 사무뿐 아니라 긴 컨텍스트, 다단계 반복, 복잡한 PPT, 표 처리와 브라우저 조작 등의 복잡 과제도 포함됐다.

그중 일부 문제는 이미 실제 업무에 매우 가깝다. 예컨대 Agent가 3755줄의 오염된 데이터를 처리하거나, 약 3만 자 분량의 자료에서 내용을 추출해 11페이지짜리 PPT를 생성해야 한다.

과제를 다 돌리는 것으로 끝나지 않고, IDC는 계속해서 시스템 상태와 최종 파일을 검증하며 Agent가 정말로 과제를 완수했는지 확인한다.

그리고 테스트 결과를 보면, 지금 대부분의 범용 Agent는 이미 복잡한 과제를 돌릴 수 있다. 다만 과제가 길어지고 단계가 많아질수록 납품 품질과 자원 소모의 격차도 함께 확대된다.

바로 이런 평가 방식 아래에서 TeleAgent는 과제 수행에서 만점을 받았고, 동시에 비용 효율을 이번 평가 최고로 만들었다.

과제 복잡도, 컨텍스트 길이, 도구 호출 횟수가 계속 늘어남에 따라 각 제품 간의 비용과 납품 격차도 동시에 확대된다.

이는 범용 Agent가 지금까지 발전한 상황에서 기반 모델만으로는 전체 격차를 설명하기 어렵다는 것을 말해준다. 한 Agent가 결국 쓰기 좋은지 아닌지는 점점 모델 외곽의 그 전체 엔지니어링 시스템에 더 좌우된다.

Agent가 일을 잘하는지는 모델이 일부분일 뿐

IDC는 이번 보고서에서 특별히 한 단어를 언급했다—— Agent Harness. 우리는 이를 대형모델을 둘러싸고 구축된 일련의 실행 시스템으로 간단히 이해할 수 있다.

모델은 이해와 추론을 담당하지만, 한 복잡한 과제가 실제로 실행되기 시작하면 시스템은 컨텍스트를 배치하고, 도구를 스케줄링하며, 과제 상태를 저장하고, 실행 환경을 제어해야 한다. 중간에 이상이 생기면 재시도할지, 경로를 바꿀지, 아니면 이전 진행 상황을 복구할지 판단해야 한다. 마지막으로 결과가 생성된 후에는 시스템이 과제가 정말로 완료됐는지 점검해야 한다.

이런 능력들은 짧은 과제에서는 뚜렷하지 않을 수 있지만, 과제가 길어지면 격차가 빠르게 확대된다. TeleAgent가 이번에 받은 몇 개의 고득점 항목도 기본적으로 이 엔지니어링 체인을 따라 분해해볼 수 있다.

먼저 컨텍스트다.

Agent가 작업하는 시간이 길어질수록 열었던 파일, 도구 호출이 반환한 결과, 앞서 나눈 내용이 모두 계속 컨텍스트에 쌓인다. 시스템이 계속 밀어 넣기만 하면 Token이 빠르게 팽창한다. 하지만 너무 강하게 압축하면 Agent가 사용자가 처음에 지시한 요구사항까지 함께 잊어버릴 수 있다.

TeleAgent는 이를 위해 한 세트의 등급별 처리를 만들었다. 시스템은 먼저 상대적으로 가치가 낮은 오래된 도구 출력을 가볍게 가지치기하고, 그래도 컨텍스트가 여전히 너무 길면 전용 압축 모델이 전체 내용을 처리한다. 동시에 시스템은 컨텍스트가 상한에 근접했는지 실시간으로 모니터링하고, 창 제한이 발동하면 먼저 자동으로 압축한 뒤 후속 과제를 계속 수행한다. 현재 TeleAgent의 컨텍스트 창은 이미 400K를 돌파했다.

하지만 한 번의 긴 과제가 끊기지 않게 하는 것만으로는 충분하지 않다. 기업 사무는 흔히 날짜를 넘기거나 심지어 프로젝트를 넘나들기 때문이다. 그래서 TeleAgent는 여기에 autoDream 장기 기억을 추가했다.

그것은 정기적으로 최근 대화를 정리한 뒤 새로운 정보와 기존 기억을 병합한다. 이렇게 하면 프로젝트 배경, 사용자 습관, 개인 선호가 세션을 넘어 계속 보존되어, 사용자가 다음 날 다시 열 때마다 매번 자신이 무엇을 하는지 처음부터 설명할 필요가 없다.

그리고 더 밑단에서는, 중국전신이 기성 Coding Agent 프레임워크를 사무 시나리오에 그대로 끼워 넣지 않았다.

TeleAgent의 핵심 커널은 약 3만 줄의 자체 개발 Go 코드를 포함하고 있으며, 팀은 Windows PowerShell, 키린(麒麟), 통신(统信) 등 시스템의 호환성 문제도 별도로 처리했다. 동시에 제품 측도 사무 과제에 맞춰 다시 적응시켰다. PPT를 만들고, 보고서를 쓰고, Excel을 처리하는 것과 코드 저장소에서 버그를 찾는 것은 본래 완전히 다른 두 가지 작업 방식이기 때문이다.

긴 과제가 계속 돌아갈 수 있는지를 해결한 다음, 다음 문제는 이렇게 돌리는 것이 과연 비싼가 아닌가였다. 이 또한 기업이 Agent를 사용할 때 피해가기 어려운 셈이다.

TeleAgent는 이를 위해 또 한 세트의 ModelRouter를 만들었다.

매 요청이 들어오면 시스템은 먼저 모달리티, 길이, 키워드 등의 정보를 바탕으로 과제 복잡도를 판단한 뒤, 과제를 경량, 균형, 플래그십 세 등급의 모델로 배분한다. 번역, 요약, 포맷팅 같은 과제는 우선 경량 모델에 맡긴다. PPT, 문서 생성, 사무 자동화에 이르면 시스템은 균형 등급으로 들어간다. 사용자가 심층 연구, 코드 디버깅 또는 복잡한 방안을 하려면 다시 플래그십 모델을 동원한다.

이렇게 하면 Agent가 간단한 과제를 처리할 때마다 가장 무거운 모델을 호출할 필요가 없다.

최적화 데이터를 보면, 이 스마트 라우팅은 추론 비용을 약 40% 낮출 수 있고, 간단한 과제의 응답 시간은 3-5초로 억제할 수 있으며, 라우팅 지연은 10ms 미만이다. 동시에 TeleAgent는 추론 측에 PD 분리, KV Cache, 부하 인지 스케줄링 등의 최적화도 추가했다.

그렇다면 TeleAgent가 이번에 IDC의 비용 효율 차원에서 최고점을 받은 이유도 이해하기 어렵지 않다.

하지만 기업이 정말로 Agent를 내부 시스템에 연결하려면 한 가지 문제를 더 해결해야 한다. 바로 '안전'이다.

Agent가 단지 한 단락의 글을 생성하는 역할만 할 때는, 오류가 나도 최대 한 번 다시 생성하면 됐다. 그러나 지금의 Agent는 파일을 조작하고, 시스템을 호출하고, 데이터를 수정하며, 심지어 직원을 대신해 일부 업무 프로세스를 실행할 수 있게 시작했다. 한 번의 잘못된 조작이 가져오는 영향은 분명 더 크다.

그리고 TeleAgent는 처음부터 이 부분을 비교적 중시했다. Skill이 시스템에 들어오기 전에 출처, 바이러스, 취약점을 검사해야 한다. 단기 기억과 장기 기억은 각각 관리된다. 파일 읽기/쓰기는 지정된 작업 디렉터리로 제한된다. 고위험 명령은 모니터링되고, 코드와 파일 조작은 가능한 한 격리 환경에서 완료된다.

물론 이런 사고방식은 TeleAgent의 출시 리듬에도 직접 영향을 미쳤다. 올해 4월, 데스크톱 버전은 이미 내부 시험 사용에 들어갔지만, TeleAgent는 이후 두 달을 더 써서 보안 테스트와 능력 최적화를 했고, 7월에 이르러서야 정식 출시됐다.

빠른 성장을 추구하는 인터넷 제품이라면 이런 리듬은 보수적으로 보일 수 있다. 중앙기업 내부에 놓고 보면, 이는 오히려 제품이 반드시 먼저 넘어야 할 관문이 됐다.

바로 그렇기 때문에 TeleAgent는 중국정보통신연구원(中国信通院) 관련 보안 평가를 처음으로 통과한 지능형 에이전트 제품 중 하나가 됐다. 중국전신연구원 내부 보안 평가에서는 통과율이 98.2%에 달했다. 외부 보안 업체와 공동으로 진행한 28개 시나리오, 336개 테스트 케이스에서는 통과율이 99.7%에 달했다.

우리가 이 능력들을 다시 한데 놓고 보면, TeleAgent가 이번에 받은 몇 개의 고득점 항목이 사실은 연결돼 있다는 것을 쉽게 알 수 있다:

컨텍스트 관리와 Harness 엔지니어링은 과제가 계속 이어져 나갈 수 있는지를 결정하고, 모델 라우팅과 추론 최적화는 똑같은 과제에 얼마의 비용이 드는지를 결정하며, 보안과 권한 제어는 기업이 정말로 시스템을 Agent에게 맡겨 조작하게 할 용기가 있는지를 결정한다.

그리고 이 세 가지는 정확히 범용 Agent가 Demo에서 기업의 일상 사무로 나아간 이후 점점 피해가기 어려워진 문제들이기도 하다.

중앙기업도 인터넷식 방식으로 AI 제품을 만들기 시작했다

그런데 솔직히 말하자면, 올해 이번 Agent 열풍만 보면 많은 사람이 TeleAgent도 유행을 보고 빠르게 뒤쫓아 만든 제품이라고 생각할지도 모른다.

하지만 시간선을 좀 더 길게 늘려 보면, 중국전신이 지능형 에이전트에 대한 투자를 사실 이미 한동안 해왔다는 것을 쉽게 알 수 있다.

2024년 말, 중국전신은 이미 싱천(星辰) 지능형 에이전트 플랫폼을 구축하기 시작했다. 2025년 4월, 이 플랫폼은 그룹의 지능형 에이전트 인프라로 확정됐다. 같은 해 8월, 팀은 다시 싱천 슈퍼 지능형 에이전트 웹 버전을 출시하며 자율형 Agent를 시도하기 시작했다. 이후 Coding Agent가 코드 작성에서 범용 사무로 확장되기 시작하면서, 팀은 Coding 강화, Skill, 데스크톱 환경을 점차 연결해 넣었다.

2026년 4월 TeleAgent 데스크톱 버전이 내부 시험 사용에 들어갈 무렵에는, 앞서 이미 1년 넘게 축적한 플랫폼, 기술, 제품 경험이 있었다.

게다가 TeleAgent는 중앙기업 내부에서 자랐지만, 제품을 만드는 방식에는 매우 뚜렷한 인터넷 색채가 있다.

중뎬신 인공지능회사(中电信人工智能公司)는 현재 1,200여 명을 보유하고 있으며, 그중 90% 이상이 사회 채용 출신이다. 팀에는 주요 인터넷 기업과 AI 기업 출신의 연구개발 인재도 상당수 흡수했고, 전체 평균 연령은 30대 초반에 불과하다.

구체적인 제품 팀에서는 회사가 핵심 인력에게 비교적 큰 자율 채용과 기술 탐색의 공간을 남겨 두었다. 제품 방향이 아직 완전히 정해지지 않았을 때, 팀은 먼저 시행착오를 통해 경험을 만들어낼 수 있다. 회사 내부에서도 초기 제품에 대한 요구로 서둘러 수익을 따지기보다는 제품이 먼저 사용자 입소문을 얻기를 바랐다.

이 밖에도 조직 방식에도 어느 정도 변화가 일어났다. 과거 대형 중앙기업 내부에서 부서 간 제품을 하나 만들면, 여러 부서, 여러 회사의 긴 협업 체인에 빠지기 쉬웠다. TeleAgent에 이르러서는 팀이 자원 결정을 가능한 한 집중시켜, 전신 업무에 익숙한 사람과 인터넷 제품 경험이 있는 사람이 일선에서 직접 협업하게 했다.

다른 한편으로, 중국전신 본연의 조직 규모는 다시 이 팀에 인터넷 창업회사가 좀처럼 갖기 어려운 실험 환경을 제공했다.

TeleAgent 출시 초기, 제품은 먼저 그룹 내부에서 대규모로 사용됐다. 중국전신은 많은 직원을 보유하고 있고, 내부에는 사무, 네트워크, 정부·기업, 클라우드, 번호카드, 브로드밴드 등 다양한 업무가 분포해 있다. 이는 Agent가 매일 마주하는 것이 시연 효과를 위해 미리 설계된 과제가 아니라 실제 수요라는 뜻이다.

예를 들어 중국전신 내부의 Skill 광장은 현재까지 누적 5.6만 개의 스킬이 등록됐고, 약 200만 회 추가됐으며, Skill 개발과 기여에 참여한 직원도 2만 명에 달한다.

직원들이 직접 만든 것들도 매우 실용적이다. 어떤 사람은 브로드밴드, 번호카드 같은 주력 사업을 둘러싸고 Skill을 제작하고, 어떤 사람은 Agent로 내부 형식에 맞는 PPT를 생성하며, 또 일선 직원은 Agent를 곧바로 카메라 순찰과 전력계 인식에 가져다 쓴다. 원래 이런 소도구들은 프로젝트 기획과 개발 절차를 거쳐야 할 수도 있었지만, 이제 일부 수요는 업무 담당자가 스스로 완성하기 시작했다.

이런 사용 시나리오는 다시 제품 팀을 계속 먹여 살린다. 따라서 중국전신 내부는 TeleAgent 초기의 가장 큰 사용자 풀이 됐을 뿐 아니라, 상당히 복잡한 기업 Agent 테스트장도 됐다. 제품은 일반 직원, 전문 업무, 시스템 권한, 실제 데이터를 동시에 마주해야 한다. 이런 문제들이 내부에서도 원활하게 돌아가지 않으면, 이후 외부 기업을 대상으로 할 때 규모화를 논하기는 더 어렵다.

그리고 지금, 전체 기업 시장도 바로 이 단계로 걸어 들어오고 있다. IDC의 올해 4월 조사에 따르면, 이미 48.5%의 기업이 범용 Agent 평가, 시범 또는 사용 단계에 들어섰다. 동시에 96.9%의 기업 Agent 애플리케이션이 사무 자동화와 관련되며, 프로세스 자동화, 지식 관리, 데이터 분석 등의 시나리오도 상위에 올라 있다.

여기에서 이르러 중국전신이 Agent를 만드는 특수성도 점차 드러난다.

그것은 원래부터 클라우드, 컴퓨팅 파워, 보안, 정부·기업 고객, 그리고 대량의 복잡한 업무 시나리오를 손에 쥐고 있었고, 이제는 인터넷 회사가 제품을 만들 때 흔히 쓰는 빠른 반복, 사용자 피드백, 비용 최적화 방법까지 흡수하기 시작했다.

그리고 기업 Agent가 다음에 해결해야 할 것은, 정확히 이 두 가지 능력이 동시에 작용해야 하는 부분이다.

总而言之, 중국전신이 이번에 IDC가 발표한 평가에서 톱3에 진입한 것은 사실 다시 한 번 한 가지 점을 입증한다——

중국전신은 더 이상 당신이 기억하는 그 통신사업자가 아니다. 이미 Full of AI인 그런 쪽이다.

다운로드 주소:

https://www.teleai.com.cn/product/teleagent