구현지능 기술 노선 미정, 인프라는 먼저 수렴
한 번의 성공에서 1만 번의 안정적 실행으로 나아가려면 무엇이 부족한지 논의되는 가운데, 구현지능 기술 노선은 미정이나 인프라는 먼저 수렴하고 있다.
중국어 원문을 AI로 번역했습니다. 고유명사와 수치는 원문 표기를 우선하며, 중요한 판단에는 아래 출처 원문을 함께 확인하세요.
톈, 옌린 2026-09-18 21:16:33 출처: 량쯔웨이(量子位)
한 번의 성공에서 만 번의 안정적 실행으로, 구체지능(具身智能)에 아직 빠진 것은 무엇인가?
톈옌린(田晏林) 발신 凹非寺
량쯔웨이 | 공식 계정 QbitAI
이게 어찌 된 일일까? 로봇 본체가 대량으로 현장에 투입되는데, 업계가 채워야 할 과제는 오히려 더 많아졌다고?
놀랄 일은 아니다. 본체 수가 늘어나면서 구체지능은 얼핏 규모화에 점점 가까워지는 듯 보이지만, 주변 세계를 이해하고, 새로운 작업을 학습하고, 지속적으로 진화하는 능력은 로봇과 함께 대량으로 복제되지 못하고 있다.
디지털 세계에서만 정보를 처리하는 범용 에이전트와 달리, 구체지능은 AI를 실제 물리 세계로 들어가게 해야 한다.
로봇 한 대가 동작 하나를 익히는 것은 가장 어려운 일이 아니다. 어려운 것은 계속해서 두 번째, 세 번째 작업을 익히는 것이다. 이미 검증된 하나의 능력을 더 많은 로봇에 빠르게 복제할 수 있는지, 공장 하나, 작업대 하나를 바꾸거나 심지어 본체를 바꿔도 계속 작동할 수 있는지가 문제다.
결국 업계가 주목하는 초점은 '어떻게 로봇을 만들어내는가'에서 '어떻게 로봇의 능력을 지속적으로 생산하고 반복 개선하는가'로 옮겨가고 있다.
9월 16일, 2026 스마트 경제 포럼에서 바이두 그룹 집행 부총재이자 바이두 스마트 클라우드 사업군 총괄인 선더우(沈抖)는 한 가지 판단을 공유했다.
에이전트의 능력 경계가 빠르게 열리고 있으며, 이미 더 장시간의 작업을 처리할 수 있고, 규모화된 배치에도 들어가기 시작했다.
AI 시대의 발전에 비유하자면, 오늘날의 AI는 전구가 발명된 이후 첫 달에 불과할지도 모른다. 불이 켜져서 모든 사람이 변화를 보았지만, 전력이 가져온 사회경제적 분업 조정은 아직 나타나지 않았기 때문이다.
에이전트가 산업 시스템에 들어가면, 기업 내의 지식, 데이터, 프로세스, 도구와 구체적 요구가 실제 장면 속에 조직되어야 하고, 최종적으로 결과를 전달하고 가치를 창출하며 지속적으로 진화해야 한다.
이 사고방식을 구체지능 영역에 적용하면 요구 수준은 더욱 높아진다.
로봇이 실행할 때마다 새로운 데이터, 오차, 현장 피드백이 발생한다.
이러한 경험이 모델과 시스템으로 되돌아가 계속 반복 개선되고, 다시 다음번에 '재사용할 수 있는 능력'으로 축적되어야 로봇이 진정으로 '쓸수록 더 잘하게' 된다.
그래서 로봇 본체가 대량으로 생산되기 시작하자, 더욱 핵심적인 문제가 전면에 부각되었다.
어떻게 해야 각 로봇이 계속 새로운 기술을 익히고, 이미 검증된 하나의 능력을 더 많은 로봇과 장면에 안정적으로 복제할 수 있는가?
본체 양산은 출발점, 능력 양산은 다음 단계
본체는 이미 생산 라인에 올라갔고, 다음으로 능력도 자신만의 '생산 라인'을 찾아야 한다.
이른바 '능력 양산'이란 이미 검증된 구체지능 응용 기술을 모델, 데이터, 본체의 지속적 폐루프를 통해 안정적이고 통제 가능한 비용으로 더 많은 실제 장면에 복제하는 것을 말한다.
전시대에서 옷을 한 번 개고, 상하차를 한 번 하는 것과 공장에서 만 번을 연속으로 하는 것은 전혀 다른 문제다.
전자는 한 번의 성공을 보는 것이고, 후자는 작업 성공률, 인력 개입률, 단위 작업 비용, 안정적 운행 시간, 그리고 하나의 기술을 더 많은 기계와 장면에 복제하는 데 얼마나 걸리는지를 본다.
그리고 로봇의 능력은 결코 모델만으로 결정되지 않는다.
'본체'는 신체를 어떻게 규모 있게 제조하는지를 해결하고, '모델'은 능력의 상한을 결정하며, '데이터와 AI Infra'는 새로운 기술을 학습하는 속도에 영향을 주고, '실제 장면'은 그것이 한 번의 성공에서 안정적인 성공으로 나아갈 수 있는지를 검증한다.
실제 기기 실행 후 발생한 새로운 데이터는 다시 다음 라운드의 훈련과 검증으로 돌아간다.
그러나 현실적인 문제는, 구체 기업이 고빈도 반복 개선 단계에 들어가면 원래 분산되어 있던 컴퓨팅 파워, 모델, 데이터 수집, 시뮬레이션, 배포 링크가 서로 발목을 잡기 쉽다는 것이다.
데이터를 가져오면 처리해야 하고, 모델 훈련을 마치면 시뮬레이션해야 하며, 시뮬레이션을 통과하면 실제 기기 검증을 해야 하고, 실제 기기가 새로운 문제를 드러내면 다시 되돌려야 한다.
모델을 한 번 바꾼 것처럼 보이지만, 이면에서는 컴퓨팅 파워, 훈련 프레임워크, 시뮬레이션 환경, 데이터 파이프라인, 배포 방식을 동시에 건드릴 수 있다.
이것이 바로 '풀스택 인프라'가 더 많은 주목을 받기 시작한 이유다.
그것이 하려는 일은 '데이터, 훈련, 평가, 추론, 피드백 등 핵심 노드'를 반복 실행 가능한 하나의 링크로 연결하여, 같은 시간과 예산 안에서 기업이 더 많은 라운드의 실험을 돌릴 수 있게 하는 것이다.
'능력 양산'이 진정으로 돌아가려면 세 가지 고리를 뚫어야 한다.
모델 반복 개선 효율, 데이터 지속 생산, 그리고 본체 간 및 장면 간 능력 응용 배포다.
로봇의 능력은 도대체 어떻게 생산되는가?
첫 번째 고리: 서로 다른 모델 노선이 모두 빠르게 반복 개선되게 하기
현재 VLA(시각-언어-행동 모델), 월드 모델, 전신 운동 제어 등 노선은 여전히 병행 진화 중이며, 모델을 어떻게 분업할지, 월드 모델을 어떻게 접속할지, 훈련 패러다임을 어떻게 조정할지는 아직 완전히 수렴되지 않았다.
바이두 스마트 클라우드 수석 아키텍트 잉루(应茹)의 관점에서, 기술 노선이 불확실할수록 AI Infra는 더 범용적이고 유연하게 유지해야 한다.
모델 구조, 훈련 방식, 심지어 시뮬레이션 엔진을 한 번 바꿀 때마다 컴퓨팅 파워, 훈련 프레임워크, 배포 환경을 다시 적응시켜야 하므로, 연구 개발 시간이 대량으로 엔지니어링 설정에 소모되기 때문이다.
그녀는 기업이 진정으로 필요로 하는 것이 단지 어느 한 번의 훈련이 얼마나 빨라졌는지가 아니라, 같은 예산, 같은 시간에 훈련, 시뮬레이션, 실제 기기 검증을 몇 라운드 더 돌릴 수 있는지라고 본다.
어떤 이는 일주일에 3라운드를 돌리고, 어떤 이는 3주에 한 라운드를 돌린다. 시간이 길어질수록 시행착오 횟수 자체가 경쟁력이다.
바이두 스마트 클라우드 산하의 AI 컴퓨팅 파워 인프라 제품 '바이두 바이거(百度百舸)'가 파고드는 것이 바로 이 공통 엔지니어링 부분이다.
그것은 데이터 준비, 개발 훈련, 시뮬레이션 평가, 추론 배포를 동일한 workflow(워크플로)에 접속하고, 컴퓨팅 파워 적응, 훈련 프레임워크, 자원 스케줄링, 시뮬레이션 환경, 모델 배포를 통일적으로 처리한다.
현재 흔한 5B에서 20B 규모의 단일 VLA, WAM(월드 액션 모델)을 예로 들면, 고사양 하드웨어를 무작정 쌓아 올려도 VRAM, 대역폭, 컴퓨팅 자원이 모두 충분히 활용된다고 보기는 어렵다.
SONIC 모델 훈련 레시피가 오픈소스로 공개된 후, 바이거는 이를 클라우드에 통합하여 원클릭으로 128카드 훈련 규모까지 확장할 수 있다. WAM 모델의 추론 병목에 대해서는 엔지니어링 최적화를 거쳐, 관련 테스트에서 추론 지연이 최적화 전의 4분의 1로 줄었다.
이러한 최적화는 궁극적으로 모두 구체 모델의 반복 개선 주기를 단축하기 위한 것이다.
이번 포럼에서 우졔둥리(无界动力) 창업자 겸 CEO 장위펑(张玉峰)은 Physical AI의 난점이 '조작 지능'이라고 직언했다.
이를 위해 우졔둥리는 빠름과 느림을 결합한 MWA™ 구체 지능 두뇌를 자체 개발했고, 성능, 기술, 일반화를 병행 추진하며 산업, 상업 두 장면 라인에서 지속적으로 능력을 갈고닦고 있다.
새로운 장면에 들어갈 때마다 새로운 데이터 한 무더기를 가져온다. 이것이 바이두 스마트 클라우드와의 협력 접점이기도 하다.
데이터에 따르면, 바이두 바이거 AI 컴퓨팅 플랫폼을 기반으로 바이두 스마트 클라우드는 MWA™ 구체 지능 두뇌에 데이터 처리, 모델 훈련, 시뮬레이션 평가에서 실제 기기 추론 배포까지의 풀스택 지원을 제공하며, 훈련 유효 시간은 99.5%를 넘는다.
모델 연구 개발과 장면 데이터가 동시에 돌아가야 능력이 지속적으로 자랄 수 있다.
두 번째 고리: 실제 조작을 훈련 가능한 데이터로 전환하기
인터넷은 이미 LLM에 방대한 텍스트를 남겼지만, 로봇이 나사 하나를 조이고 부품 하나를 조립하는 것을 배우려면 인터넷에서 완전한 교재를 거의 찾을 수 없다.
구체 데이터는 흔히 시각, 동작, 공간 관계, 힘 감각, 본체 상태, 시계열 관계를 동시에 포함하며, 구체적인 본체, 작업, 현장과 고도로 결합되어 있다.
데이터를 수집해 오면 그 뒤에 정제, 분할, 라벨링, 품질 검사, 관리, 훈련, 평가가 있다.
현재 구체지능의 데이터 난제는 수량에만 있는 것이 아니라, 데이터가 지속적으로 생산되고 효율적으로 유통될 수 있는지에 있다.
둥관(东莞)에서, 둥관시 및 완장가도(万江街道) 측이 투자해 건설하고 바이두 스마트 클라우드가 수탁 운영하는 구체지능 훈련장이 이미 가동에 들어갔다.
바이두는 이곳에 다완구(大湾区) 최초의 실체화된 구체지능 채집·라벨링 실험실도落地했다. 데이터 툴체인, 바이거 컴퓨팅 파워 기반, 훈련·추론 플랫폼을 제공하여 로봇을 위한 실제 기기 수집, 라벨링, 시뮬레이션, 모델 반복 개선을 수행한다.
기술 지원 및 장면 연결 서비스 제공자로서, 바이두 스마트 클라우드는 구체지능 인프라 방면의 자체 강점을 충분히 발휘하여 구체 산업 체인 상하류의 공동 창작 협력 파트너를 연결하고, 함께 둥관 제조업의 지능화 업그레이드에 장면 지원을 제공한다.
이 훈련장은 13개의 실제 산업 장면을 계획했으며, 가구 제조, 3C 전자, 금속·금형, 물류·창고를 포괄하고, 50대 세트의 이기종 본체를 배치했으며, Ego, UMI 등 100여 대의 본체 없는 장비를 지속적으로 배치하고 있다.
이러한 산업 장면은 둥관의 산업 우위와 특색에 긴밀히 결부되어, 현지 제조업의 필수 수요를 로봇 훈련 작업으로 직접 전환한다.
데이터 생산은 세 갈래로 나뉜다. 실제 기기 원격 조작은 진실성을 보장하고, 본체 없는 수집은 비용을 낮추고 규모를 확대하며, 시뮬레이션과 알고리즘 생성은 다양성을 보충한다.
둥관 구체지능 훈련장은 수집한 데이터를 통일적으로 구체지능 데이터 채집·라벨링·관리 통합 플랫폼에 포함시켜 관리한다.
그뿐만 아니라, 훈련장은 '중시험(中試)' 기능도 담당한다.
로봇은 먼저 시험 훈련을 하고, 다음으로 중시험을 거쳐, 마지막에 공장에 들어갈 수 있다. 이는 대량의 시행착오를 생산 중인 고객 생산 라인에서 미리 끌어내는 것과 같다.
이로써 이곳은 더 이상 단일 데이터 작업장이 아니라, 구체지능 업계의 종합적 산업 실습 캐리어가 된다. 현재 이 플랫폼은 이미 35개 구체지능 기업에 서비스를 제공하고 있다.
데이터의 규모는 표층일 뿐이며, 실제 현장을 지속적으로 로봇이 학습하고 검증하고 되돌릴 수 있는 경험으로 전환할 수 있는지가 능력 생산 라인이 얼마나 빠르게 돌아가는지를 결정한다.
세 번째 고리: 능력은 안정적으로 로봇의 신체 안에 안착해야 한다
모델 훈련 완료는 능력 형성의 절반일 뿐이다.
로봇은 실제 사용자를 마주할 때 알아듣고, 이해하고, 제때 응답하고, 정확하게 실행해야 하며, 장시간 안정적으로 운행해야 한다.
모델 배포, 음성 상호작용, 단말-클라우드 협동, 안전, 본체 적응은 모두 최종 제품 경험에 직접 영향을 준다.
소비자용 구체지능 로봇 브랜드 상웨이치위안(上纬启元)은 전형적인 예다.
그것은 개인 및 가정 장면을 겨냥해 Q1, T1 두 로봇을 출시했다.
Q1, T1을 둘러싸고 바이두 바이거는 통일된 모델 훈련, 미세 조정, 추론, 테스트 환경을 제공하고, AI 작업, 데이터 흐름, 탄력적 컴퓨팅 파워 스케줄링을 집중 관리하여 모델 연구 개발이 동일한 환경에서 지속적으로 반복 개선될 수 있게 한다.
"바이두 바이거 AI 컴퓨팅 플랫폼은 우리 Q1, T1형 로봇의 연구 개발 과정에서 통일된 모델 훈련, 미세 조정, 추론, 테스트 환경을 제공하여 AI 작업의 집중 관리와 컴퓨팅 자원의 탄력적 스케줄링을 실현했습니다." 상웨이치위안 수석 과학자 둥하오(董豪)가 밝혔다.
상웨이치위안 수석 과학자 둥하오
그리고 그는 데이터 고효율 유통, 모델 훈련·추론 가속 등의 방면에서 모델 개발 효율을 현저히 높이고, 실험 폐루프와 알고리즘 반복 개선 주기를 단축했다는 것을 발견했다.
다만 구체지능이 현실 세계에서 규모 있게 안착하려면 하드웨어 시스템 역시 중요하다.
이런 제품에 대해 사용자가 가장 관심을 갖는 것은, 부를 때 들리는지, 들은 후 이해하는지, 이해한 후 제때 올바른 피드백을 할 수 있는지다.
둥하오의 소개에 따르면, 바이두 스마트 클라우드의 풀스택 AI 역량도 시스템화된 지원을 제공했다.
제품 상호작용 계층에서 바이두 스마트 클라우드의 음성 상호작용 능력은 로봇과 사용자의 직접 소통이라는 핵심 고리를 채워 넣었다.
실제 사용자를 향한 로봇 한 대의 뒤에는 이미 여러 시스템이 함께 작동하고 있다.
'모델'은 이해와 의사 결정을 담당하고, '음성 상호작용'은 사용자 의도와 피드백을 접수하며, '단말-클라우드 협동'은 응답 효율에 영향을 주고, '안전 능력'은 시스템이 장기적으로 안정적으로 운행할 수 있는지를 결정한다.
그리고 이 기반 지원 체계는 서로 다른 형태의 로봇에 적응해야 한다. 산업용 로봇은 박자, 안정성, 정밀도를 중시하고, 개인용 로봇은 개방 환경, 고빈도 상호작용, 더 복잡한 사용자 요구를 마주한다.
본체 간, 장면 간 적응 능력이 구축되어야만 이미 검증된 하나의 기술이 진정으로 복제되어 나갈 기회를 얻을 수 있다.
50여 개 기업 뒤에서, 인프라 수요가 공통점을 드러내고 있다
산업용이든 상업용이든 가정용 로봇이든, 기업은 결국 반복적으로 같은 하부 문제 그룹을 마주하게 된다. 모델을 어떻게 더 빠르게 반복 개선할지, 데이터를 어떻게 지속적으로 되돌릴지, 본체를 어떻게 안정적으로 배포할지, 능력을 어떻게 실제 장면에 진입시켜 검증과 복제를 완성할지.
바이두 스마트 클라우드의 다른 협력 파트너를 보면, 첸쉰즈넝(千寻智能), 즈위안지치런(智元机器人), 인허퉁용(银河通用), 위수커지(宇树科技), 싱둥지위안(星动纪元), 콰웨이즈넝(跨维智能), 싱천즈넝(星尘智能) 등 기업은 제품 형태, 기술 노선, 목표 장면이 각기 다르지만, 유사한 인프라 요구를 집중적으로 드러내고 있다.
예를 들어 첸쉰즈넝은 바이두 스마트 클라우드와의 협력이 직접적으로 훈련 효율에 안착했다.
알려진 바에 따르면, 첸쉰즈넝은 바이거에接入한 후 유효 훈련 시간이 98.8%에 도달했으며, 핵심은 하부 자원과 엔지니어링 문제가 모델 연구 개발 리듬을 끊는 것을 줄여 더 많은 시간을 실제로 모델 반복 개선에 쓰게 하는 것이다.
즈위안지치런은 더 넓은 풀스택 AI 클라우드 프레임워크 아래에서 본다.
그것이 바이두 스마트 클라우드와의 협력에서 중점을 둔 것은 컴퓨팅 파워 한 조각만이 아니라, 로봇 연구 개발과 제품 추진에 따라 모델 훈련, 데이터 처리, 배포 등 하부 능력을 지속적으로 호출하는 것이다.
물론 이러한 사례가 업계 전체를 대표할 수는 없지만, 구체지능 기업이 연구 개발 효율화와 규모 안착 단계에 이르면 하부 인프라 수요가 점점 더 강한 공통점을 드러낸다는 것을 충분히 설명한다.
모델 측은 훈련, 추론 배포 효율을 높여야 하고,
데이터 측은 수집, 라벨링, 관리를 관통해야 하며,
본체 측은 상호작용, 단말-클라우드 협동, 안전과 적응 등의 문제를 해결해야 하고,
장면에 들어간 후에는 계속해서 규모 복제를 완성해야 한다.
구체지능의 기술 노선은 아직 백화제방이지만, 인프라 수요는 이미 점차 수렴하고 있다.
업계 분업도 이로 인해 더 명확해진다.
모델 노선, 제품 정의, 장면 경험은 여전히 구체 기업 자신의 핵심 경쟁력이다.
컴퓨팅 파워 스케줄링, 훈련 가속, 데이터 처리, 시뮬레이션 평가, 추론 배포처럼 모든 기업이 반복적으로 마주하는 엔지니어링 문제는 점점 더 공공 인프라 계층으로 가라앉기에 적합해지고 있다.
바이두 스마트 클라우드의 현재 배치는 이 링크를 따라 전개된다.
- 모델 측, 바이거는 훈련, 추론, 컴퓨팅 파워 스케줄링을 제공한다.
- 데이터 측, 수집, 라벨링, 관리, 평가의 일整套 링크를 제공한다.
- 본체 측, 음성 상호작용, 안전, 단말-클라우드 협동 능력을 채운다.
- 장면 측, 훈련장과 중시험 플랫폼을 통해 계속해서 검증과 복제를 완성한다.
풀스택 AI 클라우드의 가치는 이로써 더 구체적으로 된다.
그것은 능력 생산 과정에서 반복적으로 나타나는 공통 고리를 서로 다른 기업이 재사용할 수 있는 하나의 기반으로 만들어, 구체 기업이 더 많은 자원을 모델, 제품, 장면 자체로 되돌려 놓게 한다.
현재 바이두 스마트 클라우드는 이미 산업 체인상 50개 이상의 중점 구체 기업에 풀스택 AI 클라우드 기술 지원을 제공하고 있다.
국제 데이터 코퍼레이션(IDC)이 발표한 《중국 구체지능 클라우드 시장 점유율 보고서, 2025》도 언급했듯이, 바이두 스마트 클라우드는 29.55%의 시장 점유율로 역시 1위를 차지했다.
국제 권위 시장 조사 기관인 인포마(Omdia)도 같은 순위를 제시했다. 두 보고서 모두 1위다.
이 숫자 뒤에서 더 주목할 만한 것은 하나의 산업 변화다.
점점 더 많은 서로 다른 노선, 서로 다른 본체, 서로 다른 장면의 기업이 유사한 하부 능력을 호출하기 시작할 때, 구체지능의 경쟁은 이미 능력 생성 효율로 확장되기 시작했다.
구체지능 기술 노선이 아직 정형화되지 않은 단계에서, 기업은 반드시 유일한 답에 미리 베팅할 필요는 없지만, 자신이 계속 시도할 수 있다는 것은 보장해야 한다.
모델은 바뀔 수 있고, 훈련 패러다임도 바뀔 수 있으며, 본체도 바뀔 수 있고, 시나리오 역시 계속 변화할 것이다. 이는 기업이 빠르게 하나의 인프라를 구축해야 함을 뜻한다. 즉 모델의 반복(迭代)을 이어받아 데이터를 지속적으로 축적하면서도, 서로 다른 본체 간 전이 배포를 실현할 수 있어야 한다.
미래의 경쟁은 단지 누가 먼저 어떤 능력을 만들어내는가만이 아니라, 누가 더 빨리 검증과 복제, 반복(迭代)을 완수하는가이기도 하다.