칭화대 등, 구현 지능체 RPent 오픈소스 공개
칭화대가 우원신충 등과 함께 물리 세계에서 실제 작업을 수행하는 구현 지능체 RPent를 오픈소스로 공개했다.
중국어 원문을 AI로 번역했습니다. 고유명사와 수치는 원문 표기를 우선하며, 중요한 판단에는 아래 출처 원문을 함께 확인하세요.
思邈 2026-09-21 14:22:37 출처: 量子位
물리 세계에서 실제로 일하는 체화 지능 에이전트
允中 발신, 凹非寺
量子位 | 공식 계정 QbitAI
Codex, Claude Code 등 디지털 세계의 에이전트는 이미 우리에게 새롭고 효율적인 작업 방식을 보여주었다. 대형 모델이 목표를 이해하고, 작업을 분해하고, 적절한 도구를 호출하며, 실행 결과에 따라 계획을 끊임없이 조정해 작업을 완료하는 방식이다.
GPT-6 Astra가 실제 로봇 조작 테스트를 받아들이기 시작하면서, 이른바 '대형 모델을 의사결정 두뇌로 삼는' 에이전트 패러다임은 점차 물리 세계로 나아가고 있다.
동시에, 한때 멀게만 느껴졌던 질문이 점점 더 구체적으로 다가오고 있다.
범용 대형 모델이 로봇의 '두뇌'가 되어, 로봇이 현실 세계의 복잡한 작업을 실제로 완수하게 할 수 있을까?
하지만 로봇이 마주하는 것은 언제든 롤백할 수 있는 코드가 아니다. 물리 세계에서는 환경이 계속 변하고, 상태를 완전히 관측할 수 없으며, 동작이 한 번 일어나면 되돌리기도 쉽지 않다. 파지, 조립, 삽입·분리 등의 정밀 조작에는 전문적인 모델과 제어 능력이 더욱 필요하다.
물리 세계의 에이전트는 단지 '생각해내는' 것만으로는 부족하고, 반드시 '볼 수 있고, 해낼 수 있고, 반응이 빨라야' 하며, '기억할 수 있어야' 한다.
오늘, 칭화대학, 无问芯穹, 正行创新이 공동으로 발기한 체화 지능 에이전트 인프라 RPent가 정식으로 오픈소스화되었다.
RPent는 실제 물리 세계를 겨냥해, 범용 대형 모델의 작업 이해와 계획 능력, VLA 등 전문가 모델의 정밀 조작 능력, 그리고 기억·도구·로봇 인터페이스를 연결하여, 인지·의사결정·실행·피드백 오류 수정에 이르는 완전한 폐루프를 형성한다. 이를 통해 에이전트는 환경 변화에 지속적으로 적응하고, 검증된 경험을 재사용 가능한 능력으로 축적하며, 물리 환경과의 지속적인 상호작용 속에서 끊임없이 학습하고 진화할 수 있다. LIBERO-PRO 벤치마크 테스트에서 92.6%의 작업 성공률을 달성했으며, 엔드투엔드 작업 완료 속도를 7배 이상 최적화했다.
RPent는 대규모 체화 강화학습 프레임워크 RLinf의 핵심 팀이 만들었으며, 이 팀이 체화 지능 인프라 분야에서 쌓아온 기술적 축적을 이어받았다.
오픈소스 코드 링크: https://github.com/RLinf/RPent
RPent 실기 효과 시연: '움직일 줄 아는 것'에서 '일을 할 줄 아는 것'으로
이 영상에서 RPent는 여러 흥미로운 개방형 작업을 선보인다. 로봇이 강철 구슬을 그릇에 붓고, 양팔이 협응하여 접시를 닦으며, 가림막을 스스로 치우고 그릇 아래 숨겨진 숟가락을 찾아내기도 한다.
주목할 점은, 이 작업들이 각 장면마다 전용 정책을 따로 훈련한 것이 아니라는 것이다. 로봇에게 실제로 일어난 변화는 '배운 동작을 실행하는 것'에서 '과업을 이해하고, 능력을 호출하며, 환경 변화에 맞춰 행동을 조정하는 것'으로 나아가기 시작한 것이다.
1、예를 들어, 과업이 '깨끗한 식기를 종이 상자에 넣기'로 바뀌었을 때, 동일한 파란 접시를 앞에 두고 동결된 VLA는 훈련 때 배운 동작만을 그대로 따라가 그것을 잘못해서 금속 바구니에 넣는다.
반면 RPent에서는 에이전트가 먼저 현재 환경을 관찰하고, 새로운 목표에 따라 놓을 위치를 선택한다. 실행 과정에서 시각적 위치 파악에 편차가 생기면, 결과를 확인하고 잘못된 목표를 배제하며 손에 든 접시를 다시 위치시킨다. 과업이 바뀌면 로봇도 그에 따라 행동을 바꿀 수 있다.
2、또 다른 과업에서 로봇은 병 몸체와 봉지에 있는 브랜드 라벨을 읽고, 서로 다른 음료를 대응하는 봉지에 넣어야 한다.
병을 집어 든 뒤에는 먼저 살짝 들어 올려 보며 파지가 안정적인지 확인한다.
기존 운동 경로가 실행 불가능할 때는 손목 자세를 조정해 계속 실행한다.
이어서 그릇에 가려진 숟가락을 마주하면, 로봇은 곧바로 파지를 시도하지 않고 먼저 두 개의 그릇을 치워 목표를 다시 보이고 닿을 수 있게 만든다.
여기에서 보여주는 것은 이미 미리 고정된 동작 시퀀스가 아니라, 완전한 '관찰-판단-실행-오류 수정' 폐루프이다.
3、마지막 두 과업은 RPent의 기존 능력 재사용을 더욱 잘 보여준다.
로봇은 원래 '용기를 집어 올리고 놓기'에 쓰이던 기술을 재조합하여 강철 구슬 붓기에 사용하고, 파지 동작을 양팔 협응·지속적 접촉과 조합하여 접시 들기, 닦기, 정리를 완성한다.
탐색에 성공한 뒤, RPent는 검증된 과업 논리를 과업 카드(Task Card)로 축적한다. 다시 실행할 때 RPent는 Flash Mode를 활성화하여 과업 카드를 통해 이 절차를 곧바로 재사용하고, 현재 시각 상태에 따라 필요한 조정만 하여 매 단계마다 대형 모델을 다시 호출하는 것을 피함으로써 체화 지능 에이전트 실행의 지연을 효과적으로 낮춘다.
이 일련의 Demo가 보여주려는 것은 '로봇이 또 몇 가지 동작을 배웠다'는 것이 아니라, 더 중요한 문제이다. 로봇이 개방 세계로 나아가 새로운 과업과 물체, 장애물이 끊임없이 나타날 때, 그것이 사람처럼 기존 기술을 재조직하여 훈련 분포 밖의 과업을 완수할 수 있는가?
RPent가 탐구하는 것은 바로 이러한 체화 지능 에이전트의 형태이다.
로봇은 더 이상 고정된 명령 하나를 실행하는 것이 아니라, 목표를 이해하고, 능력을 호출하고, 변화에 대응하며, 한 번의 성공을 다음에 재사용할 수 있는 경험으로 축적할 수 있다. 이것이 바로 체화 지능 에이전트의 초기 형태이다.
RPent 핵심 설계 사상
현재 체화 지능의 발전은 점차 두 가지 서로 다른 기술 노선을 드러내고 있다.
하나는 순수 VLA 엔드투엔드이다.
비전-언어-동작 모델 하나로 관측을 직접 받아 동작을 내보내는 방식으로, 정밀 조작은 잘 해내지만 과업이 길어지고, 언어가 화려해지고, 장면에 교란이 생기면 빠르게 성능이 떨어진다.
다른 하나는 순수 대형 모델 Agent(예: CAP-X 같은 작업)이다.
GPT-6 세대 범용 모델의 체화 과업 커버리지가 빠르게 높아지면서, 대형 모델이 직접 동작을 출력하는 것이 상당히 많은 과업을 수행할 수 있게 되었다. 하지만 아센티미터급 정밀도, 실행 지연, 그리고 '쓸수록 강해지는' 몇 가지 측면에서는 여전히 뚜렷한 약점이 있다.
두 노선 사이는 단순한 대체 관계가 아니라, 서로 다른 층위의 능력에 대응한다.
RPent는 두 노선 사이에서 절충하는 것도 아니고, 더더욱 어떤 하나의 모델이 과업 이해부터 로봇팔 제어까지 전부 도맡아 만능이 되게 하는 것도 아니다. 대신 체화 지능을 서로 다른 층위의 능력으로 분해하여, 서로 다른 모델이 각자 가장 잘하는 일을 맡게 한다.
- 범용 대형 모델은 과업 이해와 계획 수립을 담당한다.
- VLA, WAM 등 전문가 모델은 고정밀 동작 실행을 담당한다.
- 기억 시스템은 경험을 축적하여 에이전트의 지속적 최적화를 이끈다.
- 프레임워크는 모델·도구·실제 환경을 연결하여 폐루프를 형성한다.
이로써 이들은 '관찰-계획-실행-피드백-재계획'의 폐루프를 형성하여, 에이전트가 일회성 과업 실행에서 실제 세계에서 지속적으로 성장하는 것으로 나아가게 한다.
그 배후의 알고리즘은 팀이 7월에 제안한 Harness VLA 작업(링크: https://arxiv.org/abs/2607.08448)에서 비롯되었다.
01 개방형 모듈식 아키텍처, 모델·도구·하드웨어가 각자 역할을 다하게 하다
RPent는 개방형 모듈식 설계를 채택하여 시스템을 사용자 계층, 지능 계층, 인터페이스 계층, 환경 계층의 네 가지 계층으로 나눈다.
사용자 계층에서는 대화형 명령줄이나 Web Dashboard를 통해 과업을 내리고, 시각 입력·추론 과정·동작 궤적을 확인할 수 있다.
지능 계층의 플래너는 기반 모델, Memory, 도구 라이브러리를 결합하여 과업을 분해하고, 동작 원시는 VLA, WAM과 프로그램화된 기술을 호출 가능한 도구로封装한다.
환경 계층과 인터페이스 계층에서는 로봇 제어, 모델 서비스, 시뮬레이션 환경을 독립적으로 배포할 수 있으며, 경량 통신으로 연결된다.
상위 과업 논리는 특정 로봇이나 시뮬레이터에 묶일 필요가 없으며, 새 장비는 표준 동작·상태·환경 인터페이스만 구현하면 된다. 현재 RPent는 LIBERO-PRO, RoboCasa, RoboTwin, RoboDojo 등 시뮬레이션 환경과 Franka, 양팔 Franka, YAM, SO101 등 실제 장비를 이미 지원한다.
사용자 계층(User Layer): 에이전트 상호작용 진입점
사용자 계층은 Claude Code/Codex와 유사한 대화형 CLI와 선택적 Web Dashboard를 제공한다.
사용자는 과업 지시를 내리고, 에이전트의 추론 과정, 시각 입력, 동작 궤적을 실시간으로 확인할 수 있어, 지능적 의사결정 과정에 대한 관측 가능성과 실시간 상호작용을 실현한다.
지능 계층(Intelligence Layer): 과업 계획과 능력 스케줄링의 중심
지능 계층은 Agentic Planner와 Action Primitive로 구성된다.
Agentic Planner는 기반 모델, Memory, Tool Library를 결합하여 과업 이해·계획·도구 호출을 구현하고, Agentic Loop를 통해 '계획 → 실행 → 피드백 → 기억 갱신'의 지속적 최적화를 완성한다.
Action Primitive는 VLA, WAM 등 학습형 조작 모델과 Code as Policy 등 프로그램화된 기술을 표준 도구로 통일하여封装함으로써, 대형 모델이 복잡한 과업 이해와 계획을 맡고 전문가 모델이 고정밀 동작 실행을 맡게 하여, 일반화 능력과 조작 정밀도를 함께 갖춘다.
인터페이스 계층(Interface Layer): 모델과 로봇을 통일적으로 연결
인터페이스 계층은 에이전트의 의사결정을 로봇이 실행할 수 있는 지시로 변환하고, 서로 다른 장비에 통일된 호출 인터페이스를 제공한다. 여기에는 동작 실행, 상태 읽기, 환경 렌더링, 장치 리셋 등의 능력이 포함된다.
실제 로봇이든 시뮬레이션 플랫폼이든, 상위 Agent와 프롬프트, 도구는 장비에 맞춰 다시 개발할 필요가 없어 로봇 간·환경 간 전이를 실현한다.
환경 계층(Environment Layer): 실제 세계와 시뮬레이션 세계를 연결
환경 계층은 과업 실행을 담당하며, 현재 LIBERO-PRO, RoboCasa, RoboTwin 등 시뮬레이션 환경과 Franka, 양팔 Franka, YAM 등 실제 장비를 지원한다.
새 로봇은 독립 모듈로서 robots/ 디렉터리에 접속하기만 하면 프레임워크가 자동으로 인식하고 호출할 수 있다.
또한 지능 계층과 환경 계층은 독립 프로세스 아키텍처를 채택하여, 모델 서비스·로봇 제어·시뮬레이션 환경의 독립적 배포, 이전, 재시작을 지원함으로써 지속적 연구개발과 장기 운영을 위한 엔지니어링 보장을 제공한다.
모듈식 아키텍처와 통일된 인터페이스 설계를 통해, RPent는 단일 모델이나 로봇에 묶이지 않고 개방적이고 확장 가능한 체화 지능 인프라를 구축하여, 서로 다른 모델·기술·하드웨어가 유연하게 조합되고 효율적으로 협력할 수 있게 한다.
동시에, 과업을 실행할 때마다 발생하는 피드백은 기억 시스템에 축적되어 후속 과업에 경험적 지원을 제공함으로써, 에이전트가 실제 환경에서 지속적으로 학습하고 최적화하게 하여, 에이전트의 능력을 '일회성 배포'에서 '지속적 진화'로 밀어 올린다.
02 통일된 인터페이스 설계, 에이전트가 표준 방식으로 물리 세계와 연결되게 하다
디지털 세계에서 Agent의 능력 경계는 상당 부분 어떤 도구를 호출할 수 있는지에 달려 있다. MCP의 등장으로 대형 모델은 통일된 도구 프로토콜을 통해 검색, 코드, 데이터베이스 등 디지털 자원에 접근할 수 있게 되었다.
하지만 물리 세계로 들어오면 문제는 훨씬 복잡해진다.
로봇, 카메라, 센서, 시뮬레이터와 각종 물리 장치는 모두 각자의 인터페이스를 갖고 있다. 같은 과업을 완수하는 경우에도 서로 다른 로봇은 전혀 다른 제어 방식을 사용할 수 있다.
만약 장비를 하나 접속할 때마다 Agent 한 세트를 새로 개발해야 한다면, 에이전트가 진정으로 규모 있게 확장되기는 어렵다.
따라서 RPent는 '도구-로봇-환경'을 한층 더 추상화하고, 계층형 인터페이스를 통해 지능적 의사결정과 물리적 실행을 분리한다. '대형 모델 의사결정'과 '물리 장비 실행'을 연결하여, 에이전트·도구·하드웨어 간의 통일된 협업을 실현한다.
RPent는 세 계층의 인터페이스로 지능적 의사결정과 장비 실행을 분리한다.
- MCP는 호출 가능한 능력을 통일적으로 기술한다. 하위가 VLA든, 프로그램화된 기술이든, 다른 도구든, 플래너는 통일된 정의를 통해 선택하고 호출한다.
- RPC는 도구, 모델 서비스와 로봇 환경을 연결하여, 실제 장비·시뮬레이션 플랫폼·로컬 프로세스·원격 서비스가 독립적으로 배포될 수 있게 한다.
- MHS는 더 폭넓은 물리 장치를 위해 통일된 읽기·쓰기 및 제어 추상화를 제공하여, 에이전트가 미래에 로봇에서 실험 기기, 가정용 기기, 산업 시스템으로 확장될 수 있게 한다.
(서두의 실기 영상에서 보여준 Franka와 YAM의 조작은 모두 통일된 인터페이스에서 비롯되었다.)
MCP, RPC와 MHS의 계층형 설계를 통해, RPent는 모델·도구·로봇과 물리 장치를 연결하는 통일된 인터페이스 체계를 구축하고 있으며, 에이전트가 디지털 도구를 호출하듯 물리적 능력을 호출할 수 있게 하여 '디지털 자원 조작'에서 '실제 세계 조작'으로 더 나아가게 한다.
03 Memory 메커니즘 구동, 한 번의 성공을 장기적 능력으로 축적하게 하다
과업을 한 번 완수했다고 해서 진정으로 그 능력을 갖게 된 것은 아니다.
물리 세계에서는 시행착오의 비용이 디지털 환경보다 훨씬 높다. 한 번의 실패한 파지는 장면을 다시 배치해야 할 수 있고, 한 번의 잘못된 조작은 심지어 장비 손상을 초래할 수도 있다.
만약 실행이 끝날 때마다 경험이 곧바로 사라진다면, 에이전트는 매번 처음부터 다시 시작할 수밖에 없다.
RPent의 Memory 시스템이 바꾸고자 하는 것이 바로 이 점이다. 한 번의 탐색에서 생산된 경험이 미래 과업 실행의 기반이 되게 하는 것.
RPent는 경험을 재사용 범위에 따라 세 계층 기억으로 조직하고, 기억에 적용 범위·유형·신뢰도와 뒷받침 근거를 기록한다. 새로운 경험은 검증을 거친 후에야 신뢰도를 높일 수 있고, 서로 충돌하는 기록은 보존하고 격리하여 우연한 성공이 기존 능력을 오염시키는 것을 방지한다.
기억 메커니즘에는 Recipe, 즉 전이 가능한 과업 방안이 포함되며, 특정 실행에서의 고정 좌표가 아니다.
예를 들어 시스템은 '먼저 과업 설명과 현재 화면에 따라 목표를 확인하고, 다시 그리퍼 위치를 조정하고, VLA를 호출해 파지를 완료하고, 파지 결과를 확인한다'는 조작 과정을 기록할 수 있다.
물체 위치가 바뀌면, 에이전트는 환경을 다시 관찰하고, 같은 논리를 재사용하며, 원래 좌표를 그대로 따르지는 않는다.
탐색 모드는 기억 갱신을 허용하고, 평가 모드는 이미 동결된 경험만 읽기 전용으로 사용하여 진화 과정을 더욱 통제 가능하게 한다.
LIBERO-Pro Goal 실험에서 기억 메커니즘을 도입한 후, RPent는 과업 교란 환경에서 뚜렷한 향상을 보였다. 위치 교환 과업에서 성공률이 31.0%에서 87.0%로 향상되었다.
또한 RPent는 기억 자산 배포를 지원한다. 한 번의 탐색에서 생산된 경험을 다른 에이전트에 동기화할 수 있어, 단일 에이전트가 얻은 능력이 전체 시스템이 지속적으로 진화하는 기반이 되게 한다.
Memory 시스템을 통해, RPent는 에이전트를 '일회성 과업 완수'에서 '지속적 학습과 경험 축적'으로 나아가게 한다.
에이전트의 능력은 더 이상 모델 사전 훈련에 전적으로 의존하지 않고, 실제 세계와의 상호작용 속에서 끊임없이 성장한다.
04 Flash Mode를 켜서, 에이전트가 물리 세계의 리듬에 발맞추게 하다
대형 모델을 로봇 제어 루프에 도입하면 에이전트에 더 강력한 이해와 계획 능력을 가져다주지만, 동시에 새로운 과제도 안겨준다.
대형 모델의 추론 속도는 일반적으로 로봇의 동작 실행 속도보다 훨씬 느리다. 물리 환경에서는 모델이 다음 단계의 결정을 생성하기를 기다리는 것이 전체 시스템의 주요 지연 원인이 될 수 있다.
따라서 RPent는 단순히 더 빠른 대형 모델을 추구하는 것이 아니라, 아키텍처 최적화를 통해 불필요한 호출을 줄여 에이전트의 실행 리듬을 실제 세계에 더 가깝게 만든다.
실제 응용에서 다수의 로봇 작업은 반복성이 강하다. 즉 작업 목표와 실행 로직은 기본적으로 안정적이고, 변하는 것은 주로 물리적 위치, 자세, 환경 상태다. 이런 작업에서 매번 처음부터 완전한 계획을 세운다면, 분명 대량의 중복 추론이 발생할 것이다.
RPent는 Flash Mode를 통해 Agentic Planner를 실기기에 적용할 때의 이 가속 문제를 해결하며, 그 핵심 기술 매체는 Task Card(작업 카드)다.
탐색 단계에서 RPent는 플래너가 대형 모델, VLA, 프로그램화된 스킬을 호출하여 서로 다른 동작 조합을 시도하도록 허용하고, 성공하여 검증된 작업 흐름을 Task Card로 압축한다. Task Card는 작업 단계, 동작 원시 요소, 핵심 목표와 검사 조건을 저장하며, 한 번의 장면에서만 사용할 수 있는 고정 좌표는 저장하지 않는다.
Flash Mode에 진입하면 시스템은 우선 Task Card에 따라 실행한다. 즉 시각 모듈이 핵심 물체를 다시 위치 지정하고, 실행 모듈이 현재 상태에 따라 동작을 조정한다. 검사 실패, 환경 이탈 또는 흐름을 계속할 수 없는 경우에만 플래너를 다시 호출해 처리한다. 이렇게 하면 대형 모델이 변화에 대응하는 능력을 유지하면서도, 안정적인 흐름에서 고비용 추론을 반복하는 것을 피할 수 있다.
LIBERO Object의 200회 평가에서 Flash Mode를 켜면 평균 실행 시간이 283.6초에서 40.9초로 낮아졌고, 성공률이 단지 3.5퍼센트포인트 하락한 조건에서 약 7배 가속을 구현했다. 이것이 도입부 실기기 영상에서 Flash Mode가 지닌 기술적 의미이기도 하다. 즉 탐색으로 얻은 성공 방안을 빠르게 재사용할 수 있으면서 동시에 환경 적응 능력을 보존하는 실행 흐름으로 전환하는 것이다.
RPent는 이미 검증된 작업 로직을 축적해 두고, 환경이 변할 때 필요한 조정만 하여, 체화 에이전트가 '매번 다시 계획'에서 '경험 재사용 실행'으로 나아가게 한다. 즉 과거에 무엇을 했는지 기억하는 데 그치지 않고, 기존 경험을 더 효율적인 행동으로 전환할 수 있다.
05 Leaderboard: 모델과 시스템이 협업한 후의 능력을 보여주다
커뮤니티는 현재 Agentic Planner에 대해 같은 의문을 갖고 있다. 과연 어디까지 진행된 것인가?
이 질문에 답하기 위해 RPent는 Leaderboard 섹션(https://rpent.readthedocs.io/zh-cn/latest/rst_source/leaderboard.html)을 선보였고, 서로 다른 기술 노선과 서로 다른 기반 모델의 방안을 성능과 지연 측면에서 비교하여 한눈에 볼 수 있게 했다.
△성능 Leaderboard: 현재 LIBERO-Pro, LIBERO, RoboCasa365 Target50과 RoboTwin을 보여준다
△지연 Leaderboard: 현재 LIBERO-Pro, RoboCasa365와 RoboTwin을 보여준다
GPT-6 Astra는 RPent에서 뛰어난 장기 작업과 교란 적응 능력을 보여준다. 명령 변화, 레이아웃 변화와 장기 실행을 더 강조하는 LIBERO-Pro에서 RPent/GPT-6 Astra는 92.63%에 도달했으며, 그림에서 2위인 RPent/Opus-4.7의 82.4%보다 10.23퍼센트포인트 높고, π_RLinf의 50.0%보다 42.63퍼센트포인트 높다. 또한 Flash Mode를 켠 RPent는 지연을 뚜렷하게 낮췄다.
RoboCasa365 Target50의 주방 장기 작업에서 RPent/GPT-6 Astra는 59.20%에 도달해 그림에서 1위를 차지했으며, RPent/GPT-5.5의 57.1%보다 높다. 이는 더 강력한 기반 모델이 RPent의 도구 조직, 기억과 실행 폐쇄 루프를 거친 후 물리 작업 능력으로 효과적으로 전환될 수 있음을 보여준다.
나머지 리더보드도 RPent가 서로 다른 모델과 실행 구성에 대한 호환성을 보여준다. RPent/Opus-4.7은 LIBERO에서 96.0%에 도달했고, RPent/GPT-5.5는 RoboTwin에서 62.4%에 도달해 모두 그림에서 선두 위치에 있다.
결과에서 더 주목할 점은 어떤 한 모델이 단독으로 전체 제어를 완수했다는 것이 아니라, 범용 모델, 전문 모델, 도구와 기억 시스템이 같은 프레임워크 안에서 협력하여 역할을 발휘할 수 있다는 것이다.
물리 세계에서 지속적으로 진화하는 에이전트를 위해, 개방된 기반 시설을 구축하다
Codex, Claude Code에서 RPent에 이르기까지, AI는 '디지털 세계에서 작업을 완수하는 것'에서 '물리 세계에서 작업을 완수하는 것'으로 나아가고 있다.
에이전트가 진짜 세계로 나아갈 때, 변하는 것은 모델 능력의 경계만이 아니라, 이런 능력의 작동을 뒷받침하는 기반 시설의 형태이기도 하다.
로봇은 환경을 보고, 작업을 이해하고, 서로 다른 능력을 호출하고, 정교한 동작을 완수해야 하며, 또한 실제 피드백에 따라 전략을 끊임없이 조정하고, 이미 검증된 경험을 보존해야 한다.
그래서 이 완전한 과정을 중심으로 에이전트 시스템을 조직하는 RPent는, 단지 오픈소스 '대형 모델이 로봇을 제어하게 하는' 프레임워크가 아니라, 모델, 도구, 로봇과 환경을 연결하고 에이전트가 진짜 세계에서 지속적으로 작동하고 경험을 축적하며 끊임없이 재귀적으로 진화하는 것을 지원하는 지능 중추다.
한 번의 작업에서 한 종류의 작업으로. 한 번의 실행에서 지속적인 진화로.
RPent가 상징하는 것은 바로 대형 모델이 진정으로 물리 세계에 들어간 이후 다시 구축해야 할 다음 층의 기반 시설이다.
오픈소스 주소: https://github.com/RLinf/RPent
*본 기사는 량쯔웨이(量子位)가 허가를 받아 게재한 것으로, 관점은 원저자에게만 있습니다.