Issue 01중국 AI
AC POST
중국 AI 목록
量子位2026년 9월 17일 21:03중국어 → 한국어

vivo, '답변'에서 '실행'으로…AI 폰 해법 제시

vivo가 개인 전용 AI 비서 구축을 통해 AI 폰이 답변을 넘어 일을 처리하는 방향을 제시했다.

중국어 원문을 AI로 번역했습니다. 고유명사와 수치는 원문 표기를 우선하며, 중요한 판단에는 아래 출처 원문을 함께 확인하세요.

梦瑶 2026-09-17 20:03:24 출처: 量子位

개인 전용 AI 비서 구축

梦瑶, 凹非寺에서 보냄

量子位 | 公众号 QbitAI

AI가 오늘날까지 발전하면서 점점 더 뼈저리게 느껴지는 사실 하나는——

휴대폰이라는 단말 기기에서 AI 능력이 더 강하다는 것이 사용자의 「경험 개선」을 의미하지는 않는다는 점이다.

항공편 지연 알림 하나가 뜨면, AI는 물론 내용을 요약하고 얼마나 늦는지 답할 수 있다.

하지만 실제로 계속 처리를 해나가려면 일이 순식간에 복잡해진다. 환승을 바꿔야 할지, 호텔에 영향이 갈지, 내일 아침 회의에 제때 갈 수 있을지, 한 바가지의 과제를 해결해야 한다.

더 골치 아픈 것은, 그것이 당신의 습관을 반드시 기억하지도 못한다는 점이다. 새벽 항공편을 탈 의향이 있는지, 몇백 위안을 더 쓰는 걸 개의치 않는지, 다음 날 그 회의에 지각해도 되는지 말이다.

휴대폰에서 애플리케이션을 바이브 코딩하려면 인터페이스, MCP 등 여러 문제도 고려해야 한다.

그래서 우리는 오늘날의 AI가 뭐든 조금씩은 하는 것 같지만, 정말 일이 닥치면 결국 마지막에는 대개 스스로 손을 써야 한다는 걸 발견하게 된다.

△AI 생성

이것은 또한 AI 휴대폰이 최근 2년간 점점 더 뚜렷해진 한 층의 낙차를 설명해준다.

모델 능력은 계속 올라가고 Benchmark는 미친 듯이 경쟁하지만, 휴대폰 쪽 경험은 모델이 강해진다고 자동으로 업그레이드되지 않는다.

휴대폰 한 대가 진정으로 사용자를 대신해 일을 넘겨받으려면, 말 한마디를 알아듣는 것만으로는 훨씬 부족하다.

그것은 또한 사용자 권한 부여와 프라이버시 보호를 전제로, 당신에게 지금 무슨 일이 일어나고 있는지 읽어내고, 이전에 무슨 일이 있었는지 기억하고, 다시 적합한 모델, 컨텍스트, App과 서비스를 동원해 이후의 일을 한 고리 한 고리 끝까지 해내야 한다.

여기까지 오면, 휴대폰이 마주한 것은 더 이상 모델 능력에 관한 문제 하나가 아니라, 인지, 기억, 스케줄링, 실행과 협업에 관한 시스템 문제다.

막 끝난 2026 vivo 개발자 대회(이하 VDC) 인공지능 분과 회장에서, vivo가 제시한 기술 경로도 마침 이번 개인 지능 구현의 핵심 명제를 정확히 찔렀다.

「대모델+Harness」로 개인화 지능 기반을 구축하고, OS 경험을 재구성한다.

AI 개인 비서가 사람에게 더 잘 쓰이도록 하고, 시스템을 더 똑똑하고 쓰기 좋게 만들며, 휴대폰이 진정으로 사용자 자체를 이해하기 시작하게 한다.

하나의 단말·클라우드 모델 매트릭스로 개인 전용 AI 비서를 구축하다

오늘날 다시 Agent를 이야기하면, 거의 피할 수 없는 단어가 하나 있다. 바로 단말 측(端侧)이다.

Counterpoint Research는 올해 생성형 AI 휴대폰 출하 비중이 45%에 달할 것으로 예측했으며, 작년 이 수치는 36%였다.

AI가 몇 년간 이리저리 돌아온 끝에, 휴대폰은 또다시 폭풍의 눈에 섰다.

이유는 아주 소박하고 직접적이다. 모든 단말 중에서 그것은 사람에게 충분히 「가깝고」, 가장 완전한 개인 「컨텍스트」를 쥐고 있다.

화면 속에서 보고 있는 콘텐츠, 앨범, 위치, 앱 사용 습관, 장기간 축적된 개인 정보가 모두 자연스럽게 이 몇 인치의 화면을 둘러싸고 일어난다.

하지만 기술사에는 아주 흔한 법칙이 하나 있다. 바로 어떤 기술이 현실 세계에 가까울수록 제약이 더 많아지는 경우가 많다는 것이다.

AI가 진정으로 개인 기기에 들어오면서, 지연, 비용, 프라이버시와 능력도 같은 선택 문제 속으로 밀려 들어가기 시작한다 ——

복잡한 추론과 긴 연쇄 과제는 더 강한 모델을 필요로 하지만, 더 높은 비용과 응답 시간을 동반한다. 로컬 소형 모델은 충분히 빠르고 가볍지만 능력 상한이 더 일찍 나타나며, 더 골치 아픈 것은 하나의 실제 과제가 흔히 양쪽 끝을 가로지른다는 점이다.

과거처럼 모델 하나로 천하를 다 잡는 방식은 좀 통하지 않게 되었다.

비슷한 문제는 반도체 업계가 사실 이미 한 번 겪은 적이 있다.

연산 과제가 점점 더 복잡해지자, CPU만으로 모든 작업을 감당하려던 것은 곧 전력, 효율과 성능의 천장에 부딪혔다.

결국 나온 답은 이기종 컴퓨팅(异构计算)이었다.

CPU는 범용 제어를 맡고, GPU는 병렬 연산을 넘겨받으며, NPU는 AI를 전담하고, ISP는 이미지를 담당하며, 시스템은 과제에 따라 연산을 가장 적합한 유닛에 동적으로 분배한다.

즉, 가장 강한 유닛이 모든 일을 하게 하는 것이 아니라, 가장 적합한 유닛이 가장 적합한 일을 하게 하는 것이다.

단말 측 모델이라는 문제에 이르러서, vivo도 아주 「단말 제조사다운」 해법을 내놓았다 ——

대다수 대모델 제조사가 계속 더 강하고 더 범용적인 AI를 훈련하는 것과 달리, vivo가 더 관심을 두는 것은 어떻게 각 사람에게 휴대폰에서 자기만의 AI 한 세트를 조직해주느냐이다.

모델 하나가 모든 능력을 균형 있게 맞출 수 없다면, 여러 모델이 각자 역할을 나누고 자동으로 스케줄링되어 단말·클라우드 협업을 구현하게 하자는 것이다.

올해 VDC 인공지능 분과 회장에서 등장한 「蓝心大模型端云矩阵」이 본질적으로 하는 일이 바로 이것이다.

소리를 인식하고 의미, 어조와 의도를 이해하는 것은 엔드투엔드 음성 대모델 BlueLM-Realtime에 맡기고, 기기에 장기간 상주해야 하는 인지와 기억은 단말 측 대모델 BlueLM-Nano가 담당한다.

정보 조회, 일정 관리, 크로스 App 조작 같은 고빈도 시나리오는 과제를 빠르게 실행할 수 있는 클라우드 측 모델 BlueLM-Flash에 맡기고, 복잡한 추론과 장거리 계획에 부딪히면 BlueLM-Pro가 넘겨받는다.

또한 전문 영역에 들어서면, 시스템은 계속 자동으로 외부 최정상 모델을 동원해 빈자리를 채울 수 있다.

그리하여 모델도 무리를 이루기 시작하고, 사용자가 능동적으로 선택해야 하는 제품에서 물러나 시스템이 자동으로 스케줄링하는 기초 능력이 된다.

하지만 문제는, 개인 기기에서 장기간 구동되는 지능체는 더 어려운 두 번째 문제도 만난다는 점이다——

사람은 그 자체로 「끊임없이 변하는」 컨텍스트다.

AI가 진정으로 이해해야 하는 것은 결코 고립된 명령 하나가 아니라, 한 사람이 지금 처한 상태와 그 이전에 죽 남겨온 궤적이다. 그것은 현재를 알아야 하고 과거도 알아야 한다.

그에 따라 따라오는 또 하나의 더 까다로운 문제가 있다. 바로 프라이버시와 권한의 경계다.

개인 AI가 쓸수록 당신을 더 잘 이해하려면, 기기 위의 정보를 지속적으로 인지하고 일정, 위치, 조작 습관, 과거 과제 등 개인 컨텍스트를 점차 축적해야 한다.

하지만 인지 범위가 넓을수록, 기억 시간이 길수록, 관련되는 개인 정보도 많아지고, 권한 관리와 프라이버시 보호의 압력도 자연히 동시에 올라간다.

따라서 개인 AI가 진정 어려운 지점은, 사실 모순돼 보이는 두 가지 일을 동시에 해결하는 것이다——

AI가 충분히 연속적인 개인 컨텍스트를 갖게 하면서도, 그 인지와 기억이 항상 명확한 권한 부여 경계 안에서 작동하게 하는 것.

이 문제 지점을 둘러싸고, vivo는 두 개의 키워드에 눈을 돌렸다. 바로 「인지」와 「기억」이다.

사용자 권한 부여와 프라이버시 보호를 전제로, 흩어진 단말 측 상호작용을 하나하나 모아 한 사람에 대한 장기적 이해로 천천히 맞춰나간다.

인지를 향해, 단말 측 모델 BlueLM-Nano는 경량 비전 인코더와 UI 전용 Token을 통해 화면, 이미지, 영상과 텍스트를 효율적으로 이해하고, 기억을 향해서는 SwiftKV, 혼합 희소 어텐션과 PLE 계층별 임베딩을 통해 단말 측 컨텍스트를 32K로 확장한다.

인지가 끊임없이 기억으로 침전되고, 기억은 다시 다음 서비스를 당신의 개인 요구에 더 맞게 만든다. 쓸수록 사람을 더 잘 이해하는 개인 지능 플라이휠 한 세트도 돌기 시작한다.

AI 하나가 당신이 지금 무엇을 하는지 알아보고, 당신이 과거에 무엇을 했는지 기억하며, 또 서로 다른 과제 사이에서 가장 적합한 모델과 능력을 자동으로 찾아낼 수 있을 때, 이른바 개인 전용 AI 비서는 비로소 개인이라는 두 글자의 의미를 진정으로 갖기 시작한다.

모델 능력에서 시스템 경험으로, Harness가 엔지니어링 폐쇄 루프를 채우다

모델 능력이 푸는 것이 할 수 있느냐의 문제라면, Agent가 진정으로 시스템에 들어온 뒤에는 또 하나의 더 현실적인 일을 마주해야 한다.

AI가 하나의 과제를 처음부터 끝까지 자율적으로 해낼 수 있느냐이다.

예전에 소프트웨어 업계는 이것들을 통틀어 엔지니어링이라 불렀고, Agent 시대는 엔지니어링에 더 세련된 이름을 새로 붙였다. 바로 Harness다.

그런데 흥미로운 것은 역시 Harness라 불러도, 대모델 제조사와 단말 제조사가 진정으로 풀어야 할 문제가 완전히 같은 층위에 있지는 않다는 점이다.

대모델 제조사에게 Harness는 더 모델을 둘러싸고 펼쳐진다. 어떻게 한 Agent가 안정적으로 도구를 호출하고, 더 긴 컨텍스트를 유지하고, 더 오래 과제를 돌리며, 또 Sandbox 안에서 안전하게 실행하게 할 것인가.

휴대폰에 이르면, 문제는 시스템 더 깊은 곳으로 한 층 더 들어가고, 난이도도 한 단계 올라간다.

휴대폰이 마주한 중점은, 과거에 사용자가 스스로 완수하던 그 휴대폰 조작 흐름을 AI가 어떻게 실행하게 하느냐이다.

지난 십여 년간, 스마트폰이 세운 것은 App을 중심으로 한 「서비스 질서」 한 세트였다.

택시를 타려면 먼저 택시 앱을 찾아야 하고, 호텔을 예약하려면 여행 App을 열어야 한다. 다시 말해 과거의 휴대폰 시스템은, 핵심 과제가 수천수만 개의 App이 연산력, 저장, 네트워크와 하드웨어 능력을 안정적으로 공유하게 하는 것이었다.

하지만 Agent가 단말에 들어온 뒤에는, App이 여전히 구체적 서비스를 담당하기는 하지만, 사용자가 이런 서비스와打交道하는 방식도 「변화」가 일어나기 시작한다.

Agent의 실행 과정은 본질적으로 애플리케이션 경계를 뚫고, 서로 다른 서비스를 연속 호출하고 컨텍스트를 이어받는다. 원래 App 경계로 갈라져 있던 능력이, 한 번의 과제 안에서 동적으로 조합되어야 하기 시작한다.

점점 더 많은 Agent가 의도 이해, 서비스 호출과 크로스 디바이스 협업을 처리해야 한다면, 이런 능력은 더 이상 각 애플리케이션과 개발자가 반복해서 바퀴를 재발명할 것이 아니다.

바로 이 단말 패러다임이 흔들리기 시작하는 과정에서, vivo는 그중 한 층의 핵심 능력을 미리 휴대폰 시스템 안에 거둬들여, 「Agent 네이티브 蓝心 시스템급 Harness 개발자 플랫폼」 한 세트를 만들었다.

App 시대의 능력 고립섬을, Agent 시대의 공공 인프라로 개조한 것이다.

구체적으로, 인지와 기억 층은 사용자와 환경을 이해하는 것을 담당한다. 전자는 멀티모달 정보 획득을 통해 현재 상태를 파악하고, 후자는 시나리오, 선호와 과거 상호작용을 침전시켜 서로 다른 Agent가 장기 컨텍스트를 공유할 수 있게 한다.

계획 층은 라우팅, 과제 편성과 성찰 최적화를 담당하고, 실행 경로, Token과 비용을 지속적으로 조정한다. 실행 층은 6000+ 시스템급 도구, 그리고 MCP, A2A, CLI와 통합 API를借助해 모델, Agent, Skill과 외부 서비스를 진정으로 휴대폰, IoT 나아가 현실 세계에 연결한다.

이로써 이해, 계획, 호출, 실행이 하나의 폐쇄 루프를 이룬다. 바닥의 고된 일을 시스템이 삼켜버린 뒤에야, 개발자는 비로소 시간을 진정으로 값어치 있는 곳에 쓸 수 있다.

또한 Harness는 Agent 업계에서 아주 현실적인 문제 하나를 해결해야 한다. 바로 경험을 어떻게 남기느냐이다.

사람은 같은 일을 열 번 하면, 어느 정도는 더 똑똑해진다.

Agent가 오늘 여덟 번 우회해 과제를 완수했는데, 내일도 그대로 여덟 번을 우회한다면, 그것은 기껏해야 무한한 인내를 가진 인턴일 뿐이다.

그리고 vivo의 이 시스템급 Harness 안에서, 이러한 「자기 진화」 능력도 한층 더 구체적인 운용 메커니즘으로 만들어졌다.

관찰—성찰—침전 프레임워크를 기반으로, 시스템은 사용자 권한 부여 아래 행동과 피드백을 지속적으로 학습하고, 기기가 한가할 때 과제 경로를 복기해 새로운 경험을 다시 시스템 능력에 침전시킬 수 있다.

동시에 통일된 의도, 크로스 디바이스 Runtime과 컨텍스트 동행으로, 과제는 휴대폰, PC와 태블릿 사이에서 계속 돌아갈 수 있다. MCP와 A2A는 다시 Agent, 모델과 도구가 이어받도록 담당한다.

이는 또한 개인 AI가 장기간 축적하는 것이, 정적인 사용자 정보에서 더 나아가 동적인 실행 경험으로 확장되기 시작한다는 뜻이다.

시스템 층이 충분히 성숙하면, 개발자에게 남은 것은 단 한 가지, just do it만 고려하면 된다.

AI 업계는 지난 몇 년간 Token 비용을 어떻게 낮출지 연구하는 데 많은 시간을 썼다.

Agent 시대에 이르러, 또 하나의 비용이 점점 더 비싸질 수 있다. 바로 조정 비용(协调成本)이다.

현재라는 시점에 놓고 보면, 조정 비용도 빠르게 하나의 명시적 시스템 비용으로 변해가고 있다.

능력이 많을수록 스케줄링, 컨텍스트, 권한과 실행 연쇄는 더 복잡해지고, 모델 능력이 강할수록 시스템 엔지니어링의 중요성도 함께 올라간다.

결국 체험을 진정으로 결정하는 것은, 여전히 점점 더 분명해지는 그 분업이다. 모델은 능력 상한을 결정하고, 시스템은 그 능력이 최종적으로 얼마나 실현될 수 있는지를 결정한다.

서비스를 「연결」되게 하고, 생태계를 「활짝」 자라게 하다

개인화 서비스를 받아들이고, 진짜 의도를 밖으로 내보내다

인터넷 지난 20년의 상업사는, 어느 정도까지는 한 편의 「입구 쟁탈」의 역사였다.

포털 시대는 첫 화면을 다퉜고, 검색 시대는 키워드를 다퉜으며, 모바일 인터넷은 데스크톱 아이콘과 App 체류 시간을 다퉜고, 슈퍼 App은 점점 더 많은 서비스를 자기 담장 안에 거둬들였다.

하지만 Agent가 등장하기 시작한 뒤로, 이 규칙은 좀 적용되지 않게 되었다.

사용자가 AI에게 「쓰촨 요리 식당 하나 예약해줘」 한마디만 하면 되면, 그는 이미 뒤에서 어느 App이 열렸고 어느 서비스가 호출됐는지 그다지 신경 쓰지 않는다.

App 시대가 다투던 것은 입구였고, Agent 시대가 다투기 시작한 것은 누가 「사용자 의도」에 더 가까이 갈 수 있느냐이다.

이것이 올해 Cursor, Codex부터 GitHub Copilot에 이르기까지, Skills, MCP 등 메커니즘이 점점 더 의도 핵심에 다가가는 이유이기도 하다.

하지만 전 세계 주류 AI 기업들 사이에서, 단말 제조사로서 vivo가 생태계 층에서 스스로에게 부여한 위치는 다소 절제되어 보인다.

그들은 모든 서비스를 도맡는 만능 선수가 되려 하지 않고, 자신을 의도와 서비스 사이에 놓아 「다리 놓는 사람」이 되려 한다——

한쪽 끝은 구체적인 Agent 서비스를 연결하고, 다른 한쪽 끝은 진짜 사용자 수요를 연결한다.

蓝心小V가 Pro 모드로 업그레이드된 뒤, vivo가 하려는 것은 바로 이 중간의 그 연결 비용을 가능한 한 낮추는 것이다. 개발자가 한 번 접속하면, 능력이 시스템의 서로 다른 입구에서 통일적으로 이해되고, 스케줄링되고, 도달될 수 있다.

동시에 Agent, Skills, MCP, 원자적 스킬 나아가 단말 측 모델도 점차 같은 능력 기반에 편입된다.

의도 서비스의 경쟁 단위도, 완전한 App 하나에서 점차 지능적으로 스케줄링될 수 있는 능력 하나하나로 내려가기 시작한다.

이는 또한 모바일 인터넷이 지난 십여 년간 세운 「App이 곧 서비스 경계」가 흔들리기 시작한다는 뜻이다.

생태계 협력 공동 구축, 진짜 입체적인 주석이 자라나기 시작하다

2008년 애플이 App Store를 출시했을 때, iPhone을 진정으로 스마트폰 플랫폼으로 만든 것은 사실 한 무리 한 무리의 서드파티 개발자들이었다.

게임에서 소셜, 택시, 결제에 이르기까지, 이 앱스토어의 사용성은 상당 부분 외부 서비스가 이 시스템 안에서 얼마나 많은 새로운 능력을 자라게 할 수 있느냐에 달려 있었다.

플랫폼은 연결 효율을 겨루고, 생태계 공동 구축은 협업 깊이를 겨룬다.

진정으로 생태계를 두텁게 만들 수 있는 것은, 결국 서드파티 파트너가 그 안에서 새로운 제품 형태와 실질적 결과를 만들어낼 수 있느냐이다.

그리고 이 일에서, 한 선두 단말 제조사도 적지 않은 구체적 주석을 자라게 했다——

민생 서비스 시나리오에서, vivo는 支付宝과 협력해 단말 서비스 형태를 재구성하여, 능력을 서비스 직행, 서비스 실행과 MCP Skill로 나누어 더 많은 생활 서비스를 한마디로 끝내게 했다.

로컬 생활 영역에서, 美团는 먹고 마시고 놀 거리 등 능력을 小V에 접속시켜, Agent를 통해 원래 흩어져 있던 서비스 입구를 하나로 꿰었다.

출행 시나리오에서는 高德地图(아마프)과 깊이 연동해, 小V에게 한마디만 하면 내비게이션, 경로 계획, 생활 서비스, POI 조회를 완료할 수 있다.

전자상거래·소비 측면에서는 京东이 앱 간 교차 선택, 멀티모달 인식, 상품 검색부터 결제까지의 완전한 링크를 더욱 연결했다.

막 끝난 VDC 원탁 토론에서는 제3자 생태계를 둘러싸고 京东과 支付宝의 파트너들이 각자 vivo와의 협력 실천을 중심으로, Agent 서비스가 단말에落地(적용)되는 과정에서 마주친 실제 문제와 생태계 협업이 가져온 새로운 해법을 공유했다.

그리고 이는 바로 단말 생태계가 「서비스를 들여오는 것」에서 계속 나아가 「서비스가 실제로 돌아가게 하는 것」으로 가기 위해 반드시 채워야 할 한 고리이기도 하다.

물론 기술 부여가 과연 가치가 있는지는, 그것이 쉽게 간과되는 요구까지 살피는지에 달려 있다.

실제로 2021년 「声声有息」 공익 계획을 시작한 이래, vivo는 이미 27가지 무장애 기능을 개방해 110만 명이 넘는 장애 사용자를 커버했다.

그 멀티모달 수어 대모델 역시 8000여 개 국가 표준 어휘, 100만 개 영상으로 훈련되어 단일 손동작 인식에서 연속 수어 이해로 나아갔으며, 이미 실시간 번역과 수어 학습에 사용되고 있다.

AI가 과거에 시스템에서 흔히 누락되던 표현들을 알아듣기 시작할 때, 이른바 개인화 지능도 더 따뜻한 의미를 지니게 된다.

오늘날 업계가 다시 온디바이스, 휴대폰, 모델, Harness를 이야기하다 보면, 이들 사이의 경계가 사실 점점 더 흐려지고 있음을 발견하게 된다—

모델은 시스템으로 들어가기 시작하고, 시스템은 실행을 맡기 시작하며, 온디바이스는 이해와 기억을 담당하고, 클라우드는 더 복잡한 능력을 보완한다.

그러나 사용자 입장에서는 모든 기술 용어가 결국 아주 단순한 하나의 경험으로 수렴된다.

나를 진정으로 이해할 수 있는지, 내가 일을 처리하도록 도와줄 수 있는지.

실제 생활은 결코 하나의 고립된 Prompt가 아니라, 일련의 습관, 선호, 임시 변화와 앞뒤가 연결된 사소한 일들이다.

사용자는 뒤에서 온디바이스 모델이 돌아가는지 클라우드 모델이 돌아가는지 알 필요가 없고, Harness와 MCP, A2A가 각각 무엇을 하는지 이해할 필요도 없다.

그는 다만 많은 일을 처음부터 다시 설명하지 않아도 되고, 많은 조작도 일일이 직접 여러 단계를 눌러 내려가지 않아도 된다는 것을 서서히 발견할 뿐이다.

이것이 아마도 「개인화 지능」의 더 실제적인 한 겹의 의미일 것이다. AI가 하나의 지시를 이해하는 것에서, 구체적인 한 사람을 이해하는 것으로 나아가기 시작하는 것.

vivo가 이번에 제시한 대모델+Harness 경로가 최종적으로 줄이려는 것이 바로 이 거리다. 모델 능력이 시스템 엔지니어링을 통과해, 실제로 매번의 구체적인 일상 요구에 닿도록 하는 것.

휴대폰은 이로써 더 이상 AI를 담은 기기에 그치지 않고, 점차 「나」에게 속한 전용 비서처럼 되기 시작한다.