Issue 01중국 AI
AC POST
중국 AI 목록
量子位2026년 9월 15일 19:43중국어 → 한국어

우원신궁, 칭화·상하이교통대와 구체형 추론 엔진 오픈소스화

우원신궁이 칭화대·상하이교통대와 구체지능 단말 추론 엔진 APXInf를 오픈소스로 공개하며 Pi 0.5 성능 SOTA를 달성했다.

중국어 원문을 AI로 번역했습니다. 고유명사와 수치는 원문 표기를 우선하며, 중요한 판단에는 아래 출처 원문을 함께 확인하세요.

양자위의 친구들 2026-09-15 18:43:28 출처: 양자위

임바디드 인텔리전스의 규모화된落地 '마지막 1킬로미터'를 선점하다!

오늘날의 임바디드 모델은 이미 환경을 파악하고, 명령을 이해하며, 보고 들은 정보를 로봇이 어떻게 움직여야 할지에 대한 의사결정으로 전환할 수 있다. 그러나 로봇은 결국 물리적 세계에서 연속적으로 작업해야 한다 — '눈으로 보는 것'에서 '뇌의 의사결정'으로, 다시 '손발이 움직이는 것'으로 이어지는 전체 과정이 매우 짧은 시간 안에 폐루프를 완성해야 하며, 이것이 또한 임바디드 인텔리전스가 Demo에서 규모화된 응용으로 나아가기 위해 피할 수 없는 핵심 관문이다.

그런데 클라우드에서 잘 작동하던 임바디드 모델을 로봇 본체에 올리면, 가장 먼저 마주하는 문제는 대개 '모델이 충분히 똑똑한가'가 아니라 추론 시스템 자체이다.

- 모델을 로봇에 배포했을 때, 부팅 시 초 단위로 로딩할 수 있는가?

- 로봇 본체의 연산 자원은 제한적인데, 단말 측의 모든 연산력을 짜낼 수 있는가?

- 매 추론의 지연이 발목을 잡지 않을 정도로 낮아질 수 있는가?

- 개발 환경에서는 잘 돌아가던 모델이 로봇 본체에 올라가서도 안정적으로 문제없이 작동할 수 있는가?

클라우드의 챗봇에게 수백 밀리초의 지연은 어쩌면 경험상의 미세한 차이에 불과할 수 있다. 그러나 지속적인 인지, 연속적인 의사결정과 실시간 제어가 필요한 로봇에게는 수백 밀리초가 동작 지연, 궤적의 불연속, 심지어 여러 작업의 실패를 초래할 수 있다.

그리고 로봇이 규모화된落地로 나아가면, 또 하나의 더 현실적인 '경제적 계산'이 겹쳐진다: 연산 비용, 전력 소모, 그리고 제한된 하드웨어 자원의 활용률이다.

따라서 임바디드 인텔리전스의 규모화된落地에 필요한 것은 클라우드 추론 프레임워크를 단순히 로봇 본체로 '옮기는' 것이 아니라, 진정으로 단말 측 시나리오를 겨냥해 설계된 추론 시스템, 즉 제한된 연산력·전력·비용 제약 아래에서 소규모 Batch, 저지연과 지속적인 실시간 상호작용을 아울러 고려하고 하드웨어의 성능 한계를 충분히 끌어내는 시스템이다.

오늘, 우원신치옹(无问芯穹)이 칭화대학, 상하이교통대학과 함께 임바디드 인텔리전스 단말 측 추론 엔진——APXInf를 정식 오픈소스로 공개하며, 임바디드 인텔리전스가 모델 능력에서 규모화된落地으로 나아가는 핵심 단계를 앞서 선점한다. APXInf는 RTX 4090, Jetson Orin, Jetson Thor 등 주류 컴퓨팅 플랫폼을 지원하며, 모델 개발, 효과 검증부터 로봇 본체 배포까지의 완전한 체인을 아우른다. 그것이 주목하는 것은 임바디드 모델이 실제 로봇에서 '돌아가게' 하는 것뿐만 아니라, 제한된 자원 아래에서 '충분히 빠르고, 충분히 안정적으로, 그리고 충분히 쉽게 접속·확장하고 지속적으로 반복 개선할 수 있게' 하는 것이다.

현재 APXInf는 이미 다음을 구현했다:

- PI 0.5 FP8이 Jetson Thor에서 엔드투엔드 추론 지연을 278ms에서 26ms 이내로 낮춤

- FP8에서 38.46Hz 추론 주파수에 도달, 로봇의 다중 시나리오 실시간 제어가 요구하는 추론 주파수와 응답 지연 요구를 완전히 충족

로봇 단말 측 시나리오를 겨냥한 체계적인 추론 최적화를 통해, APXInf는 임바디드 인텔리전스가 POC에서 규모화된落地으로 나아가는 그 '마지막 1킬로미터'를 더욱 단축하고자 한다.

오픈소스 주소:

- GitHub: https://github.com/RLinf/APXinf-robo

- Quick Start: https://github.com/RLinf/APXinf-robo#quick-start

01 임바디드 모델을 로봇 본체에서 더 빠르고, 더 안정적이고, 더 민첩하게 작동시키기

현재 임바디드 인텔리전스의 규모화된落地은 실제로 동시에 두 가지 유형의 요구에 직면해 있다:

한쪽은 로봇 본체가 추론 시스템에 제기하는 엄격한 요구: 극한의 성능, 저지연, 저전력과 높은 안정성;

다른 쪽은 개발자가 점점 더 강하게 가지는 엔지니어링 요구: 모델을 빠르게 접속하고, 능력을 민첩하게 검증하며, 시스템을 지속적으로 확장할 수 있어야 한다는 것.

그러나 현실은 성능과 엔지니어링 효율을 동시에 겸비하기가 대개 매우 어렵다는 것이다.

기존의 일부 방안은 빠르게 돌아가지만 대량의 복잡한 저수준 적응과 엔지니어링 통합이 필요하고, 어떤 방안은 안정적으로 작동하지만 로봇 실시간 제어에 필요한 저지연을 충족하기 어려우며, 또 어떤 방안은 인터페이스가 단순하지만 서로 다른 모델, 서로 다른 하드웨어와 끊임없이 변화하는 VLA 아키텍처에 직면하면 확장 비용이 여전히 매우 높다.

APXInf는 드물게도 성능과 엔지니어링 효율을 동시에 겸비하여, 임바디드 모델이 로봇 본체에서 '더 빠르고, 더 안정적이고, 더 민첩하게' 작동하게 한다.

1. 더 '빠름': 엔드투엔드 최적화 추론 성능 SOTA, 실시간 제어를 가능하게 하다

APXInf의 '빠름'은 단순히 특정 모델 연산자의 피크 성능만을 추구하는 것이 아니라, 로봇의 실제 실행 체인을 둘러싼 엔드투엔드 최적화이다. Pipeline, Graph, Kernel 및 양자화 등 다층 최적화를 통해 임바디드 모델의 엔드투엔드 추론 지연을 낮춘다. 동시에 중복 특성의 시스템 설계를 통해 모델을 위한 맞춤형 런타임을 제공하여, 더 경량화되면서도 극한의 성능 발굴을 실현하고, Agent4Kernel 기술과 결합한 극한 최적화 융합 연산자로 성능 SOTA를 구현한다:

Thor에서 APXInf는 PI 0.5 FP8의 엔드투엔드 추론 지연을 278ms에서 26ms 이내로 낮추었고, 주파수는 38.46 Hz에 도달하여 로봇의 실시간 인지와 제어에 더 충분한 응답 여유를 제공한다.

10.7배의 추론 지연 감소는 로봇에게 더 빠른 '인지-의사결정-동작' 폐루프를 의미하며, 임바디드 모델이 실제 로봇에서 더 실시간에 가까운 작업 상태로 진입할 기회를 의미하기도 한다.

2. 더 '안정적': 신뢰할 수 있는 네이티브 프레임워크, 장기간 지속적이고 안정적인 운영을 지향

로봇 단말 측 추론은 '한 번 돌려보는 것'으로 끝나지 않는다. 장시간 운영, 연속적인 인지와 제어, 제한된 컴퓨팅 자원, 그리고 인지·추론·제어 등 여러 모듈이 동시에 작동하는 복잡한 환경에 직면한다. 로봇에게 진정으로 받아들이기 어려운 것은 가끔 '조금 느린 것'이 아니라, 지속적인 운영 과정에서 나타나는 흔들림, 이상, 중단, 심지어 메모리나 동시성 또는 자원 관리 문제로 인해 전체 시스템이 불안정해지는 것이다.

따라서 APXInf의 '안정성'은 실제 배포 환경에서의 예측 가능성과 지속적인 운영 능력을 강조한다.

혁신 아키텍처: Rust 시스템 언어로 구축한 초경량 런타임 + Python의 사용하기 쉬운 인터페이스

- 중복 특성 설계를 활용해 런타임을 초경량화하여, 운영 오버헤드를 낮추는 동시에 검사 가능하고 검증 가능하게 함

- Rust 언어가 제공하는 메모리 안전 특성을 활용해 엔진 안정성을 더욱 높이고 오류 가능 면을 줄여, 근원적으로 메모리 위험을 회피

- Python 인터페이스로 래핑하여 개발자에게 익숙한 호출 방식을 유지, 저수준의 강력함과 상위 계층의 사용 편의를 겸비

이것이 또한 APXInf가 실제 로봇 배포를 위해 한 아키텍처 선택이다: 단말 측 성능을 추구하는 동시에 시스템의 장기 운영 안정성에도 주목하고, 아울러 개발자의 사용 문턱을 최대한 낮춘다.

3. 더 '민첩': 접속과 최적화 비용을 낮추고, Agentic Native로 진화하는 추론 시스템의 새로운 패러다임을 지향

앞선 노력이 '충분히 빠른가'와 '장기간 안정적으로 돌아갈 수 있는가'라는 두 문제를 해결했다면, APXInf가 더 주목하는 문제는 이것이다: 날로 풍부해지는 임바디드 모델과 점점 더 복잡해지는 임바디드 시스템에 직면하여, 모델을 어떻게 더 빠르고 민첩하게 접속하고 지속적으로 반복 최적화할 것인가?

전통적인 추론 엔진은 대개 컴파일 기술을 사용하거나 개발 난이도를 낮추는 방식으로 새 모델 접속 문제를 해결하지만, 극한의 성능과 모델 접속 효율을 아울러 겸비하기는 어렵다. 오늘날 대모델의 능력이 나날이 변화하는 가운데, 우리는 모델에 대한 극한 최적화를 유지하면서 Agentic Engineering을 활용해 새 모델의 적응과 접속을 빠르게 구현할 수 있게 되었다——이 능력은 우리 자신의 연구개발 반복을 가속할 뿐만 아니라, APXInf 개발자에게도 개방되어 사용자가 자체 개발한 모델의 접속과 최적화를 간단하고 민첩하게 만들어 줄 것이다.

이를 위해 APXInf는 설계 초기부터 Agentic Engineering 연구개발 프로세스에 적응하는 것을 출발점으로 삼아 추론 엔진의 시스템 설계를 다시 생각했으며, 중복 특성, 기능 격리, 툴박스 모델 등의 방법을 통해 APXInf와 Agentic Engineering의 적합도를 현저히 높이고 연구개발 문턱을 낮추어, Token이 더욱 편리하고 효율적으로 생산력으로 전환되게 한다.

APXInf 역시 Agentic Native를 향해 지속적으로 탐구하고 반복 개선할 것이다. 우리가 바라는 것은 APXInf가 단순히 특정 모델의 배포 문턱을 낮추는 데 그치는 것이 아니라, Agentic Engineering 시대를 향한 완전히 새로운 추론 시스템 구축 패러다임을 탐구하는 것이다: 추론 엔진이 더 이상 모델을 수동적으로 실행하는 Runtime에 머무르지 않고, 모델·하드웨어·로봇·개발자를 연결하며 Agentic Infra의 지속적 진화를 추동하게 하는 것이다.

02 오픈소스 목록

APXInf는 이번 첫 출시에서 두 가지 임바디드 모델을 지원한다: PI 0.5, WALL-OSS.

하드웨어는 Jetson Orin, Jetson Thor 및 RTX 4090을 지원하며, 통일된 모델 접속 방식을 제공한다.

Roadmap

- 더 많은 모델 지원, VLA, VLM, 월드 모델 등 (이미 적응 중인 모델: Qwen, Groot)

- 중점 오픈소스 모델 지속 최적화, SOTA 모델 목록 확대

- 극한의 nvfp4 성능 최적화

- 국산화 생태 지원 지속 확대, 국산 칩 연산 백엔드 지원, 국산 로봇 운영체제 지원

- AMD 등 업계 주류 칩 적응

03 RLinf × APXInf: 하나의 엔지니어링 체인 위의 프런트엔드와 백엔드

임바디드 인텔리전스에게 모델 훈련과 본체 추론은 결코 서로 분리된 두 단계가 아니라, 동일한 엔지니어링 체인 위의 프런트엔드와 백엔드이다.

2025년 9월, 우원신치옹은 칭화대학 등 팀과 함께 임바디드 인텔리전스를 위한 세계 최초의 대규모 강화학습 훈련 오픈소스 프레임워크를 오픈소스로 공개했으며, 강화학습을 통한 임바디드 대모델의 후속 훈련(post-training)을 위해 설계되었다.

훈련이 완료된 임바디드 모델이 실제로 로봇 본체에 진입해 규모화된 응용을 시작하면, 다음으로 해결해야 할 것은 바로 단말 측 추론과 배포이다: 제한된 연산력과 전력 제약 아래에서 소규모 Batch 워크로드로 더 낮은 지연, 더 높은 처리량과 더 안정적인 실시간 운영을 구현하는 것.

APXInf가 바로 이 고리를 잇는다.

그것은 RLinf의 능력을 모델 훈련과 평가에서 로봇 단말 측 추론과 배포로 한층 더 확장한다. 이번 오픈소스에서 APXInf는 RLinf 오픈소스 생태계 내 단말 측 추론 프로젝트로 첫 출시되어, 개발자가 동일한 임바디드 인텔리전스 기술 생태계를 따라 모델 훈련, 효과 검증부터 본체 배포와 실제 로봇 운영까지의 완전한 흐름을 완성할 수 있게 한다.

훈련에서 추론으로, 클라우드에서 본체로, '모델이 무엇을 할 수 있는가'에서 '로봇이 실제로 해내는 것'으로——APXInf는 임바디드 인텔리전스 규모화된落地의 핵심 고리를 채우고 있다.

04 오픈소스 모집

APXInf 첫 버전은 단지 시작점일 뿐이다.

우원신치옹이 바라는 것은 임바디드 모델 개발자, 로봇 팀과 단말 측 시스템 개발자와 함께 모델 접속, 운영 최적화와 본체 배포를 더욱 표준적이고 재사용 가능하며 코드 Agent가 참여하기에 더 적합한 개발 프로세스로 정착시키는 것이다.

만약 당신이:

- π0.5 등 임바디드 모델을 로봇 본체에 배포하려고 시도하고 있거나;

- RTX 4090, Jetson Thor 또는 Orin 등 하드웨어 기반으로 프로젝트 개발을 진행하고 있거나;

- 새로운 임바디드 모델을 위한 단말 측 추론 엔진을 찾고 있거나;

- 임바디드 모델 접속 Skill과 Agentic 배포 프로세스 구축에 참여하기를 원한다면;

APXInf를 경험하고, Issue를 제출하거나 PR을 기여하는 것을 환영한다.