Issue 01중국 AI
AC POST
중국 AI 목록
掘金2026년 9월 17일 15:36중국어 → 한국어

알리바바 클라우드 PAI, 추론 서비스 모듈 InferX 출시

알리바바 클라우드 AI 플랫폼 PAI가 Agentic Cloud용 제품 모듈 InferX를 출시해 LLM 지능형 라우팅, KVCache, 모델 워밍업, 글로벌 스케줄링, 사용자 토큰 관리를 하나의 플랫폼으로 통합했…

중국어 원문을 AI로 번역했습니다. 고유명사와 수치는 원문 표기를 우선하며, 중요한 판단에는 아래 출처 원문을 함께 확인하세요.

AI Coding, Agent 오피스 등이 기업급 "일상적 생산성"이 되면서, 한 번의 추론은 더 이상 단순한 API 호출이 아니라 Token을 둘러싼 지속적인 게임이 되었다——어떻게 최저의 비용, 가장 안정적인 SLO로, 모든 Token을 더 빠르게, 더 저렴하게, 더 똑똑하게 계산할 것인가? 알리바바 클라우드 인공지능 플랫폼 PAI는 Agentic Cloud를 겨냥해 제품 모듈 InferX를 정식 출시하며, LLM 지능 라우팅, KVCache, 모델 워밍업, 글로벌 스케줄링 및 사용자 Token 관리 등 추론의 "핵심 공정"을 하나의 플랫폼 아래 통합하고, 한 세트의 "Token 연금술"로 기업 고객에게 진정으로 약속 가능한 SLO, 산정 가능한 비용, 무한 확장 가능한 기업 전용 추론 서비스를 제공한다.

一、왜 InferX가 필요한가: Agent 시대의 추론은 이미 달라졌다

지난 10년간 AI 추론 플랫폼은 세 차례의 깊이 있는 아키텍처 진화를 겪었다: 전통 머신러닝 시대의 동기 추론(밀리초급, QPS형 부하)에서 AIGC 시대의 비동기 추론(Stable Diffusion, 텍스트-투-비디오 등 분 단위 장시간 작업)으로, 다시 현재 대규모 언어 모델이 주도하는 Token 스트리밍 추론 시대로. 그리고 2025년에 접어들며 Claude Code, Qoder 등 Coding Agent가 대규모로落地(현장 적용)되면서 추론 시나리오에 또 한 번 질적 변화가 일어났다:

一次性 세션 =一场 장거리 달리기: 단일 대화가 수십 라운드에 달하고, 컨텍스트는 수십만 Token에 이르며, Prefill과 Decode의 분리가 표준이 되어, 동일한 Query가 여러 서비스 인스턴스 사이에서 협력하여 완성되어야 한다;

KV Cache는 더 이상 "임시 중간 상태"가 아니다: 그것은 TTFT를 결정하고, 비용을 결정하며, 사용자 경험을 결정하는 핵심 자산이다. 멀티턴 대화, 공유 System Prompt, Coding Agent 프리픽스 재사용 등의 시나리오에서 한 번의 4K Token 요청의 KV Cache가 200MB 이상으로 팽창할 수 있으며, 적중 여부가 단위 Token 비용의 높낮음을 직접 결정한다;

전통 게이트웨이는 완전히 작동하지 않는다: 무상태 Round Robin, 일관성 해싱은 이미 추론 엔진 내부의 Cache 분포를 감지할 수 없다; Anthropic Messages, OpenAI Chat Completions, Responses API 등 다중 프로토콜이 공존하면서 트래픽 입구가 "번역 센터+스케줄링 센터+과금 센터" 삼위일체의 복잡한 시스템으로 변했다;

SLO는 "평균 지연"에서 "분위 지연 × 적중률 × 단가"로 변한다: 고객은 더 이상 P99 지연만을 신경 쓰지 않고, "주어진 SLO 아래의 백만 Token 비용"이라는 하나의 종합 지표를 요구한다.

한마디로: 추론의 서비스 단위는 "자원"에서 "Token"으로 진화하고 있다. 그리고 InferX는 바로 알리바바 클라우드 PAI가 이 "Token 시대"를 위해 만든 전용 추론 서비스 기반이다.

二、InferX란 무엇인가: 모든 Token을 "고보장 SLO 서비스"로 연성하다

InferX는 알리바바 클라우드 PAI 온라인 추론 플랫폼(PAI-EAS)에 새롭게 출시된 제품 모듈로, 대규모 모델 추론 시나리오에서 Token의 효율적 생산, 스케줄링 및 모니터링 거버넌스에 집중한다. 추론 게이트웨이, 추론 엔진, KV Cache, 글로벌 스케줄링 등의 역량을 통일적으로 캡슐화하여 한 세트의 "Token 연금" 툴체인을 형성한다. 핵심 기능은 다음과 같다:

1. LLM 지능 라우팅: Token 시대의 전용 트래픽 입구

InferX에는 LLM 지능 라우팅이 내장되어 있으며, 이는 대규모 모델 시나리오를 위해专门打造(전문적으로 구축)된 지능형 게이트웨이이다:

PD 분리 트래픽 오케스트레이션: Prefill 프록시, 게이트웨이 스케줄링, Decode 주도 등 세 가지 주류 PD 분리 모드를 지원하며, 트래픽 분할, 첫 Token 직반환, 이후 Token 스트리밍 병합을 자동으로 완료한다;

Token 흐름 제어 관리: 맞춤형 기업 내부 Coding 구독과 Token 구독, 각 사용자에게 서로 다른 Quota의 유량 제한 관리 패키지를 할당하여 사용자의 시간대별 Token 실제 소비를 정확히 매칭한다;

다중 프로토콜 통합 입구: OpenAI Chat Completions, Anthropic Messages, 통이바이롄 등 다양한 API 프로토콜을 자연스럽게 호환하여, Claude Code, CodeX 등 비 OpenAI 프로토콜 클라이언트를 무개조로 직접 접속할 수 있다;

다중 모델 라우팅과 기본 폴백: 통일된 v1/models 인터페이스로 여러 백엔드 모델을 집약하고, 모델을 가중치 비율 또는 요청 프리픽스 비율로 분산하는 등 기업급 트래픽 정책을 지원한다;

경량 테넌트 체계: RAM의 복잡한 권한 부여 없이, 각 내부 사용자/팀에 API Key를 동적으로 할당하고, 테넌트별로 Token 소비, 캐시 적중률, 요청량을 산정하는 것을 지원하여 기업 내부 AI Coding 플랫폼의 비용 분담과 거버넌스에 즉시 사용 가능한 역량을 제공한다;

글로벌 스케줄링: 한 번 접속으로 전 세계에서 사용 가능하다. 로컬 리전의 추론 자원이 긴장되면 LLM 지능 라우팅이 자동으로 비즈니스 트래픽을 다른 유휴 리전의 추론 인스턴스로 스케줄링하여, "다중 리전 컴퓨팅 파워"를 "하나의 약속 가능한 컴퓨팅 파워 풀"로 집약한다——피크를 깎아 골을 메우고, 수요에 따라 릴레이하며, 리전을 넘나드는 총괄로 기업 고객이 더 이상 단일 리전 재고 부족 때문에 SLO를 희생하거나 자원을 초과 예약할 필요가 없게 한다.

LLM 서비스의 호출 상황과 캐시 적중률 등 핵심 지표를 실시간 모니터링

2. 엔진 심층 최적화: MoE와 Hybrid Attention 계열 차세대 대규모 모델 아키텍처를 위해 탄생

● 대규모 EP 분산 병렬: 전문가 병렬(Expert Parallelism)의 대규모 분산 배포를 원천 지원하고, 크로스 머신·크로스 카드 MoE 토폴로지를 원클릭으로 관리하며, 저수준 통신과 라우팅의 복잡성을 차단하여 100B~1000B 파라미터급 MoE 모델을 매끄럽게上线(출시)하게 한다;

● 이기종 PD 분리 배포: Prefill / Decode 이기종 분리 배포를 지원하여, 두 단계의 완전히 다른 컴퓨팅 파워와 메모리 접근 특성에 맞춰 각각 하드웨어를 선정하고 독립적으로 확장·축소함으로써 첫 Token 지연(TTFT)과 생성 처리량(TPOT)을 모두 고려하고, "하나의 사양으로 전 단계를 통일"하는 자원 낭비에서 완전히 벗어난다;

● PPU 네트워크와 연산자 협동 최적화: PPU 칩을 겨냥해 네트워크 통신 경로와 전용 연산자 커널을 심층 맞춤화하고, MoE 핵심 통신 원시 연산과 핫스팟 연산자를 포괄하여, 하드웨어 친화적 성능 이점을 종단 간 SLO에 완전히 실현시켜 "국산 칩의 추론 가성비"를 구호에서 측정·인도 가능한 숫자로 바꾼다.

● HiSparse 메모리 희소: DSA 계열 희소 어텐션 모델을 겨냥한 메모리 레이아웃 최적화 방안으로, 어텐션 행렬의 희소 패턴을 진정으로 메모리와 대역폭 차원의 절감으로 번역하여, 희소 모델의 효율 우위가 더 이상 논문 속 숫자에 머물지 않게 한다;

● DSpark / DFlash 블록 확산 투기 샘플링: 블록 확산 사상을 기반으로 한 자체 개발 투기 샘플링 엔진으로, 한 번의 전방향 연산으로 더 긴 후보 시퀀스를 토해내고 배치 검증을 수행하여 Decode 단계의 매 스텝 산출을 현저히 향상시키고, 희소 어텐션과 맞물려 TPOT를 새로운 차원으로 끌어내린다;

● PPD와 Decode Radix Cache: PPD(Prefill / Prefill-capable Decode Disaggregation)는 Decode 노드가 멀티턴 대화에서 증가분 Prefill을 그 자리에서 이어받게 하여, 근본적으로 노드 간 KV 전송 오버헤드를 절감한다; Decode Radix Cache는 프리픽스 트리로 KV를 조직하여 투기 샘플링과 다중 분기 Decode의 후보 경로가 동일한 물리 KV를 공유하게 함으로써 "제로 리던던시" 재사용을 구현한다;

고성능과 고보장 SLO의 추론 서비스를 원클릭 배포

3. 트래픽 효율 스케줄링: 스케줄링 최적화를 "블랙박스"에서 "자산"으로

InferX에는 대규모 모델 추론을 겨냥한 다단계 지능 스케줄링 체계가 내장되어 있어, 트래픽이 진정으로 "Cache를 따라 가게" 한다:

Session-Aware 스케줄링: 사용자가 세션 귀속을 명시적으로 선언할 수 있어, 동일 Session의 요청이 항상 동일 인스턴스로 라우팅되어 KV Cache의 극치 적중을 보장한다;

Cache-Aware 스케줄링: Context Prefix Cache가 있는 노드를 감지하여, 요청을 최장 프리픽스가 적중하는 인스턴스로 우선 라우팅하며, 동시에 과부하 보호를 갖춘다——단일 인스턴스의 대기/추론 수량이 초과되면 자동으로 분산하여 핫스팟 노드가 뚫리는 것을 방지한다;

PD 차별화 스케줄링: Prefill은 KV Cache 인지 경로를 걸어 프리픽스 매칭을 최대화하고; Decode는 Latest Token 스케줄링을 걸어 인스턴스 간 부하를 동적으로 균형화한다;

DP 차원 세분화 스케줄링: DeepSeek, GLM 등 MoE 모델의 Decode 단계 DP+EP 혼합 병렬을 겨냥하여, Pod 내 각 GPU의 DP Rank를 감지하고 "일부 카드는 터지고 일부 카드는 노는" 오프피크 낭비를 방지한다.

Coding Agent 같은 "높은 프리픽스 재사용"의 전형적 시나리오에서, InferX는 KV Cache 적중률을 이론적 상한인 95% 이상으로 끌어올려, 단위 Token 비용을 다시 한 자릿수 압축할 수 있다.

다단계 관리의 서비스 스케줄링 시스템을 원클릭 구성

4. KV Cache: 노드를 넘나들고 계층을 넘나드는 Token 기억 중추

InferX는 KV Cache를 추론 엔진 내부의 "로컬 캐시"에서 노드를 넘나들고 계층을 넘나드는 공유 스토리지 자산으로 업그레이드한다:

단일 머신 병목 타파: vLLM, SGLang 등 주류 엔진의 "단일 머신 L1+L2 캐시" 천장을 돌파하여, 클러스터 각 노드의 유휴 메모리와 SSD 디스크를 추론 서비스와 독립된 분산 KV Cache로 집약하고, L3급 Cache 풀을 구축하여 Prefix 저장 용량을 수십 배 향상시킨다;

다중 노드 협동 재사용: 서로 다른 Pod, 서로 다른 PD 역할 간에 동일한 프리픽스 KV를 공유할 수 있어, 멀티턴 대화와 RAG 시나리오의 TTFT가 현저히 하락한다;

DSA/MoE 심층 최적화: GLM-5.2, DeepSeek V3/V4의 Sparse Attention 등 신형 Attention 구조를 겨냥해 KV 조직과 압축을 최적화하여, 장문맥 시나리오에서도 여전히 높은 적중과 낮은 지연을 유지한다.

5. 모델 워밍업 분산 캐시: 1000억 모델의 "초급 확장, 초급 콜드 스타트"

대규모 모델의 부피는 수백 GB, 나아가 TB급에 이르며, 전통적으로 OSS/NAS에서 모델을 가져오는 방식은 확장 시 스토리지 측 대역폭이 터져 버리고 시작 소요 시간이 수십 분에 달하게 된다. InferX는 두 세트의 모델 배포 가속 엔진을 통합했다:

분산 캐시: 완전 대칭, 탈중심화된 P2P 캐시 시스템으로, 확장 로딩을 "수십 분"에서 1분 이내, 나아가 초 단위로 압축한다;

모델 워밍업 캐시: 중앙집중식 콜드 스타트 가속 방안으로, Model Gallery의 오픈소스 모델에 공용 캐시 서비스를 내장하고, 사용자도 자체 모델을 위한 캐시 서비스를 자체 구축할 수 있어, 첫 인스턴스의 콜드 스타트 역시 똑같이 빠르다.

三、InferX가 고객에게 가져다주는 것: 세 가지 "더"의 가치 실현

더 절약되는 비용: Cache-Aware 스케줄링, KV Cache, Binpack 패킹, Spot/탄력/선불 다유형 자원 혼합 스케줄링을 통해, 고객은 Coding Agent, 멀티턴 대화, RAG 등 KV 민감 시나리오에서 단위 Token 비용을 전통 방안 대비 30%~70% 하락시킬 수 있다; 기업 내부의 AI Coding 서비스는 수도·전기처럼 사용량에 따라 사람별, 팀별로 정확히 산정할 수 있다.

더 안정적인 SLO: 전통적인 "P99 지연"에서 "P99 첫 Token 지연 × Token 처리량 × 캐시 적중률 × 단위 비용"의 입체적 SLO 체계로 업그레이드하고, 전용 게이트웨이, 테넌트급 유량 제한, 과부하 보호와 Gang Scheduling을 갖춤으로써 기업이 핵심 비즈니스를 추론 플랫폼 위에서 대규모로 돌릴 용기를 갖게 한다.

더 빠른落地: OpenAI 및 Anthropic Messages 프로토콜을 자연스럽게 호환하여 Claude Code, Cursor, 통이링마 등 주류 Coding Agent가 한 줄의 코드도 수정하지 않고 접속할 수 있다; Model Gallery + 모델 워밍업 캐시는 신규 모델上线 시간을 "수일"에서 "수십 분"으로 단축시킨다.

四、결어: "자원"에서 "Token"으로, PAI는 추론의 상업적 계약을 재편하고 있다

과거의 추론 플랫폼이 GPU를 Pod에 넣고 Pod를 랙에 배치하는 것이었다면, Agent 시대에 우리가 해야 할 일은 모든 Token을 "약속 가능하고, 산정 가능하며, 재사용 가능한 컴퓨팅 파워 자산"으로 만드는 것이다.

InferX는 바로 알리바바 클라우드 PAI가 이 새로운 계약을 위해 준비한 답안이다——기업 전용 추론 서비스를 향한 "Token 연금술" 한 세트로, Coding Agent를 더 똑똑하게 하고, 기업 추론을 더 안정적으로 만들며, 모든 Token이 제 몫을 다하게 한다.

현재 알리바바 클라우드 PAI에 출시되었다. PAI 팀에 연락하여 함께 Token 시대의 추론 신패러다임을 열어가길 환영한다. 더 많은 사용 방법은 문서를 참조하기 바란다.

알리바바 클라우드 빅데이터 AI 기술

758

399k

읽음

570