Issue 01중국 AI
AC POST
중국 AI 목록
量子位2026년 9월 20일 21:22중국어 → 한국어

3090 한 장으로 구동, 기업 로컬 AI 오피스용 전 스택 국산 모델

전 스택 국산 모델로 3090 한 장에서 구동되는 기업 로컬 AI 오피스가 소개됐으며, 중국텔레콤이 이 시장을 먼저 가져갈 수 있다는 언급이 나왔다.

중국어 원문을 AI로 번역했습니다. 고유명사와 수치는 원문 표기를 우선하며, 중요한 판단에는 아래 출처 원문을 함께 확인하세요.

henry 2026-09-20 20:22:41 출처: 량자웨이(量子位)

AI 오피스라는 케이크를 중국전신(中國電信)이 먼저 한 조각 떼어낼지도 모른다.

henry 발신, 아비사(凹非寺)

량자웨이 | 공식계정 QbitAI

올여름 대형 테크 기업들은 일제히 AI 오피스에 베팅을 늘렸다. Agent 역량을 겨루고, 업무 진입점을 겨루고, 기업 워크플로를 겨룬다. Coding에 이어 오피스가 Agent의 다음 격전지가 된 것이다.

그런데 모두가 진입점을 확보하느라 바쁠 때, 아직 문조차 들어가지 못한 기업들도 한 무리 있다.

이유는 현실적이고도 뼈아프다. 그들은 데이터를 외부로 내보낼 수 없고, 모델은 가급적 현지에 배포하는 게 좋으며, 보유한 연산력도 넉넉하지 않다. 그런데도 긴 문서는 읽어야 하고, 복잡한 업무는 처리해야 하며, 해야 할 일은 하나도 줄지 않는다.

중국전신 AI가 이번에 최신으로 오픈소스 공개한 Xing4.0-29B-A4B가 겨냥한 것이 바로 이 같은 수요다.

게다가 이번에 내놓은 것은 풀스택 국산화 경량 코드 지능형 에이전트 대형 모델이다. 국산 칩, 국산 학습 프레임워크부터 모델 학습과 추론 배포에 이르기까지, 기술 전 과정에 걸쳐 체계적으로 적응을 마쳤다.

최대한 현지 배포를 구현하기 위해 Xing4.0-29B-A4B는 MoE 아키텍처를 채택했으며, 총 파라미터 290억 개 가운데 추론 시마다 약 40억 개만 활성화되고, 4-bit 양자화를 거치면 RTX 3090 한 장으로도 구동할 수 있다.

물론 구동되는 것만으로는 첫걸음일 뿐이다.

기업이 진짜로 관심 갖는 것은, 이 그래픽카드 위의 모델이 도대체 얼마나 많은 일을 할 수 있느냐다.

예를 들어 중요 문서를 처리할 때, 모델은 현지에서 곧바로 내용 이해, 지표 추출, 정보 정리를 완료할 수 있고, 데이터는 전 과정에서 기업 환경을 벗어나지 않는다.

또 예를 들어 200페이지짜리 입찰 서류가 들어오면, 모델은 현지에서 약 20분 만에 기술, 상무, 가격 세 방면의 초기 평가를 완료하고 항목별로 채점 근거를 제시할 수 있다.

더 나아가 현지 배포에 대한 고려는 소비자용 그래픽카드에만 머무르지 않는다.

Xing4.0-29B-A4B는 완전히 화웨이 승등(昇騰) 910C 연산력 기반으로 학습되었고, 국산 MindSpore/MindFormers 학습 프레임워크와 개발 키트를 채택해 진정한 국산 칩으로 국산 모델을 학습시킨다는 것을 실현했다.

추론 배포 측면에서도 승등 적응 검증을 완료했다. 학습부터 실제 적용까지, 국산 연산력이라는 길도 이미 뚫린 셈이다.

현재 모델은 이미 GitHub, Hugging Face, Gitee, 마탑(魔搭), 모러(魔乐) 등 플랫폼에 오픈소스로 공개되었고, API 호출도 동시 지원한다.

주목할 점은, 발행 시점 기준으로 Xing4.0-29B-A4B가 이미 HuggingFace 모델 트렌드 순위에 진입해 4위를 차지했다는 것이다.

관심 있는 분들은 바로 사용해볼 수 있다.

(관련 링크는 글 말미에)

구동도 되어야 하고, 실제로 일도 할 수 있어야 한다

솔직히 말해, 모델을 그래픽카드 한 장에 담는 것과 그것이 기업의 일상 업무를 안정적으로 받아내게 하는 것 사이에는 적지 않은 간극이 있다.

무엇보다 기업이 넘겨주는 과제는 한 마디 문답처럼 단순한 경우가 드물다.

문서 한 부를 다 읽고 나면 정보를 추출하고, 도구를 호출하고, 결과를 대조한 뒤, 마지막으로 제출할 수 있는 자료로 정리해야 할 수도 있다.

게다가 이런 일은 매일 해야 하므로 안정성뿐 아니라 가성비도 따져야 한다.

이런 요구를 충족하려면 배포와 운용 비용을 계속 낮춰야 하고, 동시에 일하는 능력도 탄탄하게 다져야 한다. 후자가 바로 Xing4.0-29B-A4B가 이번에 Coding과 Agent 역량을 중점 강화한 이유다.

먼저 Coding부터.

과거에는 수백억 파라미터 모델이 코드를 작성할 때, 함수 하나 짜고 몇 줄 보완하는 정도는 괜찮다는 게 흔한 문제였다.

그런데 코드 저장소 전체를 넘겨주고 진짜 엔지니어링 문제를 하나 풀라고 하면 상황은 그렇게 순조롭지 않다.

프로젝트 구조를 먼저 파악하고, 파일을 넘나들며 인터페이스 호출을 추적하고, 문서와 로그, 과거 맥락을 결합해 문제를 찾아내야 하기 때문이다. 수정한 뒤에는 그 수정이 효과가 있는지, 다른 곳에 영향을 주지 않는지도 검증해야 한다.

코드는 마지막에 작성되는 일부분일 뿐이고, 앞에는 긴 작업 사슬이 놓여 있다.

이 오랜 난제에 대응해 Xing4.0-29B-A4B는 이번에 Coding 능력을 '조각 작성'에서 '엔지니어링 수행'으로 한 단계 더 밀어붙였다.

256K 컨텍스트를 네이티브 지원하고 512K까지 확장 가능해, 한 번의 작업에 더 긴 코드와 문서, 로그, 이력을 담을 수 있어 프로젝트 전체를 이해할 공간을 제공한다.

예를 들어 Excel에 흩어져 있는 계약 대장을 관리용 대형 대시보드로 만들려면, 필요한 것은 그림 그리는 함수 하나가 아니다.

모델은 표 안의 업무 데이터를 이해하고, 계약 개요, 금액 분포, 리스크 식별, 이행 경고 등의 요구를 하나의 페이지에 구성해야 한다.

여기에는 데이터 이해와 함께 코드 생성, 기능 조직이 얽혀 있어, 앞뒤 정보를 결합해 개발을 완성해야 한다.

Xing4.0-29B-A4B는 기업 현지에서 이 계약 대장을 시각화 관리 대시보드로 전환할 수 있고, 데이터는 전 과정에서 기업 환경을 벗어나지 않는다.

Agent 쪽으로 오면 요구는 한 걸음 더 나아간다.

요구를 이해한 뒤 모델은 스스로 과제를 분해하고, 실행 순서를 정하고, 도구를 호출하며, 중간 결과에 따라 다음 단계를 어떻게 할지 결정해야 한다.

그렇게 계속 나아가 검수 가능한 결과를 인도할 때까지 이어진다. Xing4.0-29B-A4B는 이런 장기 과제를 위해 특별 강화를 진행했다.

예를 들어 사용자가 요구를 한 번에 명확히 말하면, 모델은 어떤 단계를 먼저 하고 어떤 것을 병렬로 할 수 있는지 판단한 뒤, 날씨, 일정, 알림, 이동 등 서로 다른 도구나 Agent를 호출해 과제를 계속 밀어붙일 수 있다.

그런데 모델이 스스로 일을 하게 되면 기업이 바로 사용할 수 있는 걸까?

한 걸음이 더 남았다. 기존 워크플로에 접속하는 것이다.

기업이 이미 쓰고 있는 개발 도구, Agent 프레임워크, 배포 플랫폼과 모두 연결되어야 한다. 그렇지 않으면 환경만 바꾸는 것만으로도 일이 잔뜩 늘어날 수 있다.

이를 위해 Xing4.0-29B-A4B는 OpenCode, Claude Code, OpenClaw, Hermes 등 주류 Agent, Harness 프레임워크에 대한 맞춤 적응을 완료했고, 동시에 LLaMA-Factory, MindFormers, SGLang, vLLM, KTransformers 등 상용 툴체인과 호환되어 기존 개발 환경에 접속하는 문턱을 낮췄다.

물론 서두에서 언급한 그 무리의 기업들에게는 피할 수 없는 현실적 제약이 하나 있다.

데이터는 외부로 나갈 수 없고, 연산력도 확실히 제한적이다.

그래서 능력 업그레이드 외에도 Xing4.0-29B-A4B는 배포 문턱을 계속 낮추고 있다.

전통적인 FP16 정밀도에서 29B 파라미터 모델은 단일 카드 VRAM 점유가 약 60GB로, 흔히 멀티 카드나 값비싼 A카드가 필요하다.

4-bit 양자화를 거치면 이 점유량을 약 15GB로 압축할 수 있어 약 75% 줄어들고, RTX 3090, 4090 등 소비자용 그래픽카드에서도 구동할 수 있다.

그리고 이 경량 프라이빗 배포 방안은 이미 실제 생산 현장에 들어갔다.

지능형 고객센터 업무에서 Xing4.0-29B-A4B는 프라이빗 배포를 완료했고, 사용자 통화, 신원 정보, 업무 기록이 전 과정에서 외부로 나가지 않는다.

복잡한 요구에 직면해 모델은 의도 이해, 과제 분해, 도구 호출, 결과 통합, 규정 준수 검증을 끝까지 완수해야 한다.

전해지는 바에 따르면 현재 이 방안의 복잡 업무 처리 성공률은 이미 90% 이상에 달한다.

여기서야 서두의 그 기업들의 요구가 비로소 자리를 잡았다.

소비자용 그래픽카드로 구동되고, 복잡한 과제를 받아내고, 도구와 업무 시스템도 연결된다.

그러면 문제는 이렇다. 이것이 도대체 어떻게 가능한가?

아키텍처, 데이터, 학습, 배포의 전방위 최적화

앞서 언급한 MoE가 그 답의 일부다.

모델은 총 파라미터가 290억 개지만 추론 시마다 약 40억 개만 활성화된다. 이렇게 하면 과제를 처리할 때마다 전체 파라미터를 다 동원할 필요가 없어 계산 오버헤드도 함께 낮아진다.

그런데 긴 문서를 읽고 엔지니어링 코드를 작성하며 다단계 과제를 지속적으로 수행하게 하려면 MoE만으로는 부족하다.

뒤에는 아키텍처, 데이터, 학습, 엔지니어링 최적화 여러 측면의 협업이 있다.

먼저 아키텍처.

컨텍스트가 길수록 모델이 읽어들일 수 있는 내용이 많아진다. 그런데 문제는 읽어들인 내용도 자리를 차지한다는 점이다.

모델은 긴 문서를 처리할 때 앞부분의 계산 결과 일부를 저장해 두었다가 이후 생성 시 재사용하는데, 이것이 익히 아는 KV Cache다.

컨텍스트가 길어질수록 캐시도 쌓여 VRAM을 더 잡아먹고 추론 속도도 느려질 수 있다.

그래서 긴 컨텍스트를 실제로 활용하려면 먼저 이 캐시를 다이어트할 방법을 찾아야 한다.

Xing4.0-29B-A4B가 채택한 MLA 다중 헤드 잠재 변수 어텐션이 하는 일이 바로 이것이다. 캐시해야 할 정보를 더 압축된 형태로 압축해 긴 컨텍스트 추론의 VRAM 오버헤드를 낮춘다.

나아가 읽어들이는 오버헤드를 낮췄으면 생성 속도도 따라가야 한다. 여기서 Xing4.0-29B-A4B는 MTP, 즉 다중 Token 예측도 채택했다.

일반 학습이 주로 모델이 다음 Token을 예측하게 하는 것과 달리, MTP는 모델이 이후 여러 Token을 동시에 예측하도록 학습시켜 더 긴 전후 연관을 익히게 한다.

이 예측은 추론 시에도 활용될 수 있다. 후보 내용을 미리 생성한 뒤 주 모델에 검증을 맡겨 생성 가속을 지원한다.

또한 모델은 DeepSeek와 같은 mHC 매니폴드 제약 초연결을 도입해 정보가 서로 다른 층 사이에서 전달되는 것을 제약하고, 신호가 반복적으로 증폭되어 생기는 학습 불안정을 줄였다.

아키텍처가 갖춰졌으니, 다음은 모델이 무엇을 배우는지다.

중국전신은 이번에 수십조 개 토큰을 포함하는 데이터 체계를 자체 구축했다.

사전 학습 데이터는 PB급 다중 소스 정제를 거쳤고, 범용 콘텐츠 외에도 복잡한 표, 구조화 지식 그래프, 에이전트 행동 궤적을 추가했다.

그중 행동 궤적과 Agent 능력의 관계는 특히 직접적이다. 그것이 기록하는 것이 바로 한 과제를 처음부터 끝까지 어떻게 하는가이기 때문이다.

목표가 무엇인지, 중간에 어떤 도구를 호출했는지, 도구가 무엇을 반환했는지, 결과를 받은 뒤 다음 단계는 어떻게 처리해야 하는지.

이 과정들이 이어져야 모델은 이전 단계의 결과를 다음 단계의 조작으로 어떻게 연결하는지 배울 수 있다.

후속 학습 단계에서는 팀이 코드 실행, 온라인 검색, 도구 호출을 지원하는 고동시성 샌드박스를 구축해 그 안에서 장기 Agent 과제를 구성했다.

코드가 실행되는지, 도구를 제대로 호출했는지, 최종 결과가 요구에 부합하는지 모두 테스트 케이스와 자동화 메커니즘으로 검증한다.

이렇게 하면 학습 재료를 남길지 말지에 대해 실제 실행 결과를 근거로 삼을 수 있다.

학습 단계에서 Xing4.0-29B-A4B는 과제 난이도에 따라 점진적으로 전개된다.

사전 학습은 4K 시퀀스 길이에서 시작해 먼저 범용 지식과 기초 추론을 학습하고, 점차 코드와 복잡 추론 데이터의 비중을 높인다.

중간 학습 단계에 들어서면 시퀀스 길이를 32K, 128K, 256K로 차례로 확장하고, 동시에 저장소급 코드, 복잡 추론, Agent 데이터를 늘린다.

후속 학습 단계에서는 팀이 Coding, Agent, Reasoning 세 방향을 중심으로 각각 다중 전문가 강화 학습을 진행하고, 이어서 MOPD를 통해 각 방향의 전문 역량을 융합한다.

주목할 점은 학습 과정에서 Muon과 QK-Clip도 사용했다는 것이다. 전자는 파라미터 업데이트 최적화에, 후자는 어텐션 계산에서 수치 규모를 제어해 수치가 비정상적으로 커지는 위험을 낮추는 데 쓰인다.

마지막으로 엔지니어링 최적화 단계에서 전신은 모델이 국산 연산력 상에서 효율적으로 학습을 완료할 수 있도록 한층 더 나아갔다.

이것이 바로 풀스택 국산화가 진짜 기술 디테일로 내려앉는 지점이다.

Xing4.0-29B-A4B는 승등 910C 클러스터를 기반으로 MindSpore/MindFormers를 결합해 mHC 등 신규 특성의 적응, 크로스 프레임워크 정밀도 정렬 및 융합 연산자 개발을 완료했고, 모델 아키텍처와 국산 학습 프레임워크, 국산 칩이 협력하게 했다.

계산 스케줄링과 VRAM 압박에 대응해 팀은 DVM 그래프-연산 융합, 세밀한 재계산, Ascend C 맞춤 융합 연산자를 통해 스케줄링과 데이터 이동 오버헤드를 줄이고 VRAM을 절약하며 실행 효율을 높였다.

공식 소개에 따르면, 모델 아키텍처, 컴파일, 연산자, 하드웨어의 다층 협업 최적화를 거쳐 전체 네트워크 학습 처리량이 개봉 성능 대비 약 96% 향상되어 거의 두 배에 가까워졌다.

후속 학습에 사용한 Slime 강화 학습 프레임워크도 승등 생태 적응을 완료했다. 학습 프레임워크부터 저계층 연산자, 다시 강화 학습에 이르기까지 팀은 모두 맞춤 최적화를 진행했다.

즉, 국산 칩으로 국산 모델을 학습시키는 것의 배후에는 칩, 프레임워크, 모델, 학습 프로세스의整套 협업이 있다. 그리고 아키텍처, 데이터, 학습에서 배포에 이르는 이 모든 공력이 결국 기업 책상 위에 이미 쌓여 있는 과제들 위에 내려앉는다.

기업이 진짜로 AI를 쓰게 하려면

마지막으로, 기업이 진짜로 매끄럽게 AI 오피스를 쓰게 하기 위해 전신은 이번에 보모급 패키지도 함께 내놨다.

최대한 빨리 쓰고 싶은 기업은 Xing4.0-29B-A4B를 산망일체기(算網一體機)에 사전 통합해 환경 구축과 설치·설정 작업을 줄이고 배포 주기를 단축하는 방안을 선택할 수 있다.

현지 연산력이 부족할 때는 자체 데이터 관리 요구를 충족하는 전제하에 지능형 연산 전용선을 통해 클라우드 연산력을 호출해 탄력적 확장을 완료할 수 있다.

국산 연산력을 채택한 기업을 위해 모델은 지위안(智源) FlagOS 통합 오픈소스 AI 소프트웨어 스택을 기반으로 여러 국산 칩의 적응 경로를 열어, 하드웨어 플랫폼 간 이전 및 배포 비용을 낮췄다.

말하자면 소비자용 그래픽카드 한 장부터 산망일체기, 다시 클라우드 탄력 연산력까지, 규모와 기술 축적이 다른 기업 모두에게 상응하는 배포 경로가 있다.

여기까지 왔으니 마지막 질문이 하나 남는다.

중국전신은 왜 굳이 이렇게 더 가벼운 모델을 만들었나?

29B를 전체 성신(星辰) 시리즈 안에 다시 놓고 보면 답이 더 분명해진다.

그동안 중국전신은 십억, 백억, 천억 파라미터 모델을 배치했고, 만억 파라미터 모델 및 음성, 시맨틱, 멀티모달 등의 방향으로도 연구개발을 진행했다.

그리고 Xing4.0-29B-A4B가 메운 것은 그중 매우 구체적인 한 갈래 수요다.

현지 연산력은 제한적이지만 복잡한 과제는 여전히 해야 한다.

이런 수요에 중국전신은 낯설지 않으며, 과장이 아니라 이런 수요는 아마 전신만이 보고 충족할 수 있을지도 모른다.

정무, 고객센터부터 네트워크 운용까지, 전신은 오랫동안 대량의 프라이빗 배포 현장을 접해왔다. 데이터를 어디에 둘 수 있는지, 기존 설비가 얼마나 많은 계산을 감당할 수 있는지, 업무 프로세스가 얼마나 복잡한지는 모두 기업이 모델을 쓰기 전에 반드시 해결해야 할 문제다.

그리고 이것이 이번 경량 모델 설계에 구체적인 출발점을 제공했다.

기업 현장의 연산 비용, 데이터 경계, 업무 수요에서 출발해 모델이 얼마나 커야 하는지, 어떤 역량을 반드시 강화해야 하는지를 정하고, 그에 맞는 전달 방안을 갖춘다.

이렇게 모델에서 기업 현장으로 나아가는 경로는 중국전신이 추진 중인 윈가이수전즈훼이(雲改數轉智惠) 전략, 그리고 연산력, 플랫폼, 데이터, 모델, 응용이 일체화된 오위일체(五位一體) 지능형 클라우드 체계와도 대응한다.

모델은 이해와 작업 수행을 담당하고, 플랫폼은 접속과 오케스트레이션을 담당하며, 연산력과 네트워크가 실행을 뒷받침하고, 다시 산업 응용이 이런 능력들을 구체적인 업무에 연결한다.

Xing4.0-29B-A4B는 바로 이 구도에서 경량화 프라이빗 배포를 겨냥한 한 걸음이다.

국산 칩에서 훈련된 뒤 기업이 보유한 기기와 실제 워크플로에 적응하며, 국산 칩으로 국산 모델을 훈련한다는 가치는 기업이 쓸 수 있는지, 쓰기 편한지로 더욱 구체화된다.

바로 그렇기 때문에 이후 星辰(싱천) 시리즈의 업데이트에도 더 구체적인 볼거리가 생겼다. 더 큰 모델이 얼마나 복잡한 작업을 처리할 수 있는지, 서로 다른 모달리티가 어떤 업무를 커버할 수 있는지, 더 가벼운 모델이 기기와 배포 조건에 제약을 받던 얼마나 많은 기업에 들어갈 수 있는지다.

처음으로 돌아가면, AI 오피스 경쟁은 계속되고 있다.

그리고 데이터를 외부로 내보낼 수 없고 보유 연산력이 제한적인 기업에도 늘 읽어야 할 문서와 제출해야 할 자료, 처리해야 할 업무가 있다.

이제 기업에는 AI를 활용할 수 있는 선택지가 하나 더 생겼다.

다음 단계는 어쩌면 손에 있는 이 그래픽카드에서 시작될지도 모른다.

오픈소스 주소:

GitHub: https://github.com/XingChen-AGI/Xing4.0-29B-A4B

HuggingFace: https://huggingface.co/XingChen-AGI/Xing4.0-29B-A4B

魔搭: https://modelscope.cn/models/XingChen-AGI/Xing4.0-29B-A4B

Gitee: https://gitee.com/xingchen-agi/xing4.0-29b-a4b

魔乐: https://modelers.cn/models/XingChen-AGI/Xing4.0-29B-A4B