위챗 AI 소셜 '샤오웨이' 그레이스케일 테스트, 지식베이스 관리가 관건
2026년 9월 7일부터 위챗이 '샤오웨이 AI 소셜'을 소규모 그레이스케일 테스트하며, 승인된 두 AI가 시간 조율과 정보 동기화, 업무 인계를 거쳐 확인 카드를 사용자에게 돌려준다.
중국어 원문을 AI로 번역했습니다. 고유명사와 수치는 원문 표기를 우선하며, 중요한 판단에는 아래 출처 원문을 함께 확인하세요.
서론
2026년 9월 7일부터 위챗은 소규모로 「샤오웨이 AI 소셜」 그레이스케일 테스트를 시작했다. 양측의 승인을 거친 후 두 샤오웨이가 독립적인 대화를 개설하고, 먼저 시간 조율·정보 동기화·업무 인계를 완료한 뒤 그 결과를 확인 카드로 생성해 사용자에게 돌려보내 최종 결정을 맡긴다. 대화 기록은 샤오웨이 내부에만 보관되며 양측의 기존 채팅 창에는 들어가지 않는다.
이 일은 표면적으로는 소셜 기능이지만, 기업의 기술 도입이라는 관점에서 보면 더 실질적인 결론을 드러낸다. 즉 Agent가 고객을 받아낼 수 있는지는 모델 선정이 아니라 지식베이스 거버넌스 수준에 달려 있다는 것이다.
목차
- 1. 배경: 고객 정보 진입점이 이동하고 있다
- 2. 문제: 왜 더 큰 모델로 바꾸면 오히려 더 나빠지는가
- 3. 방안: 문서 단위 지식베이스를 질의응답 단위로 개조하기
- 4. 구현: 재사용 가능한 질의응답 패키지 구조와 프롬프트
- 5. 경계: 자동화 레드라인 설정 원칙
- 6. 효과 검증
- 7. 자주 묻는 질문
- 8. 검증된 정무(행정 서비스) 샘플
- 9. 중소기업을 위한 세 가지 실행 가능한 진입점
- 10. 총결
위챗과 WeChat의 합산 월간 활성 계정 수는 14.39억이다(2026년 2분기). 텐센트 총재 류츠핑은 2026년 2분기 실적 콘퍼런스 콜에서 샤오웨이 같은 Agent가 위챗의 소셜 그래프, 지식 그래프, 상인 접촉 역량과 결제 기능을 활용할 수 있으며, 앞으로 미니프로그램, 상인, 모든 사용자가 각자의 Agent를 갖게 되어 서로 통신하고 직접 거래까지 완료할 수 있을 것이라고 말했다.
샤오웨이는 위챗이 자체 개발한 WeLM으로 구동된다. WeLM-80B는 총 파라미터 800억, 계산 시 활성 약 30억으로 이미 샤오웨이에 사용되고 있으며, WeLM-617B는 총 파라미터 6170억, 활성 파라미터 230억으로 개발 중이다.
경계를 명확히 할 필요가 있다. 샤오웨이는 현재 문자 메시지만 지원하며 구체적인 업무를 대신 처리할 수 없다. 상대가 보고서를 요구할 때 샤오웨이가 스스로 생성해 발송할 수 없고 서로 알림만 줄 수 있다. 단체 발송 기능은 개방되지 않았고, 예약 메시지도 타인의 샤오웨이로 발송하는 것은 지원되지 않는다. 공식 입장은 여전히 초기 테스트 단계이며 적용 범위가 제한적이고 제품 완성도가 낮다는 것이다.
기업의 관점에서 주목할 것은 샤오웨이가 지금 무엇을 할 수 있는지가 아니라, 고객이 정보를 얻는 진입점이 인적 채널에서 AI로 이동하고 있다는 점이다.
한 가전 애프터서비스 고객센터는 AI 처리율을 0에서 72%까지 끌어올렸고, 상담 인력을 240명에서 130명으로 줄였으며, 통화당 비용을 7.2위안에서 2.1위안으로, 통화당 시간을 6.8분에서 3.5분으로 압축했고, 누적 투입은 약 480만 위안으로 11개월 만에 원금을 회수했다.
하지만 2025년 4월 첫 버전을 출시했을 때 처리율은 6%에 불과했고, 그중 80%의 답변이 틀렸다. 팀은 모델 역량 부족으로 판단하고 곧바로 더 큰 모델로 교체했다.
처리율은 그 자리에서 6%에서 4%로 떨어졌다.
복기 후 세 가지 문제를 특정했다.
- 지식베이스 입자가 너무 거칠어, 내용이 「고장 진단 개요」「반품·교환 절차」 같은 큰 챕터로 되어 있어 검색 시 장문 맥락에서 정보 포인트를 잘못 잡기 쉽다
- 업데이트 메커니즘이 뒤처져, 지식베이스는 월 단위로 업데이트되는데 제품은 2주마다 신모델이 출시되어 모델이 계속 만료된 자료로 답한다
- 경계 시나리오에 대한 안전장치가 없어, 모델이 답할 확률이 60%, 틀릴 확률이 40%인 문제를 전부 그대로 모델에 넘긴다
결론은 문제가 모델 쪽이 아니라 데이터 쪽에 있다는 것이다. 검색 증강 생성의 효과 상한은 지식베이스의 구조가 결정하며, 모델은 말단일 뿐이다.
위 세 가지 문제에 대응해 개조 방향 역시 세 가지다.
첫째는 지식베이스 구조를 개조하는 것이다. 원래 문서 기준으로 조직된 내용을 사용자 고빈도 질문 기준으로 조직된 문답 단위로 바꾸고, 각 단위에 표준 답변, 관련 지식, 경계 설명과 상담원 연결 트리거 조건을 포함시킨다. 개조 후 항목은 1200건에서 4800건으로 확장됐고, 단일 항목 평균 길이는 800자에서 180자로 압축됐으며, 검색 정확도는 41%에서 78%로 향상됐다.
둘째는 업데이트 주기를 높이는 것이다. 월 단위 동기화를 일 단위 동기화로 바꾸고, 긴급 즉시 동기화 채널도 유지한다.
셋째는 경계 안전장치를 보완하는 것이다. 각 문답에 적용 불가 시나리오를 표기하고 상담원 연결 트리거 조건을 정의해, 모델이 불확실할 때 자유롭게 답하지 않도록 한다.
이 세 가지 중 첫째의 수익이 가장 크고, 가장 쉽게 간과된다. 800자를 180자로 압축한 것이 37퍼센트포인트의 정확도 향상을 가져왔다.
질의응답 패키지는 일괄 유지보수와 후속 검색을 위해 고정 5열 구조를 권장한다.
질문 | 귀사의 최소 주문 수량은 얼마입니까 표준 답변 | 일반 모델은 50개부터 주문 가능, 비표준 부품은 200개부터 주문 가능, 샘플은 단품 가능 관련 지식 | 비표준 부품은 금형 제작이 필요하며 납기는 15영업일 경계 설명 | 고객이 요청한 모델이 상비 목록에 없으면 비표준 부품으로 처리 상담원 연결 | 고객이 「10개만 먼저 만들어서 시험해볼 수 있나요」라고 물으면 상담원 연결
핵심은 마지막 세 열이다. 관련 지식은 맥락 보충이고, 경계 설명은 출력 범위를 제약하며, 상담원 연결 조건은 모델이 불확실한 상황을 받쳐준다.
항목 수는 첫날 우선 30건을 작성해 최고 빈도와 가장 틀리기 쉬운 질문을 커버할 것을 권장한다. 분류는 제품 파라미터, 가격과 정책, 납기와 물류, 애프터서비스와 수리, 협업과 결제 조건으로 나눠 이후 업무 변화에 따라 부분 업데이트하기 쉽게 한다.
도구 측면에서는 텐센트 ima로 지식베이스를 담당하고, 텐센트 WorkBuddy로 응대 측을 담당할 수 있다. WorkBuddy는 커넥터를 통해 기존 시스템과 사무 도구에 연결되며, 커넥터에 ima 지식베이스를 연결하면 검색 링크가 뚫린다. 두 도구는 동일한 위챗 계정으로 로그인해 인증 단계의 설정 비용을 줄일 수 있다.
응대 측의 핵심은 프롬프트이며, 본질은 모델에게 질문 하나를 던지는 것이 아니라 직무 설명서 한 부를 주는 것이다.
당신은 【회사명】의 온라인 응대 담당자이며, 딱 세 가지만 한다. 제품과 가격 질문에 답하고, 고객 연락처를 남기고, 상담원 연결 여부를 판단한다. 답변 범위는 지식베이스 안의 내용만 사용해 답하는 것만 허용한다. 지식베이스에 없는 것은 일괄적으로 「이 질문은 제가 확인해서 잠시 후 답변드리겠습니다」라고 답하고 스스로 추측하지 않는다. 반드시 상담원에게 연결해야 하는 네 가지 상황은 고객이 구체적인 할인과 결제 조건을 물을 때, 고객이 계약 체결이나 직인 날인 문서를 요구할 때, 고객이 불만이나 불평을 표현할 때, 같은 질문에 연속 두 번 답하지 못했을 때다. 답변 스타일은 쉬운 말로, 결론을 먼저 주고 이유를 뒤에 말하며, 한 문장은 40자를 넘지 않고, 끝에 「더 도와드릴 것이 있으신가요」라고 한마디 묻는다. 해서는 안 되는 일은 납기를 약속하지 않고, 공개되지 않은 가격을 말하지 않고, 「저희가 최고입니다」 같은 말을 하지 않는다.
이 프롬프트는 절반의 분량이 금지 행위를 정의하는 데 쓰이며, 이것이 범용 대화 도우미와의 핵심 차이다.
알리바바 타오톈그룹과 푸커 AI가 공동 출시한 「셩이관자(生意管家)」는 전자상거래 판매자를 위해 인구 운영, 트래픽 프로모션, 데이터 분석의 세 가지 직무급 디지털 직원을 구성했으며, 일상 실행·최적화·점검은 전부 자동으로 돌아간다. 하지만 예산 조정, 가격 수정, 상품 정식 발매, 대규모 이벤트 설정은 전부 수동 승인을 유지한다.
정리할 수 있는 구분 원칙은 가역적이고 저위험이며 고빈도인 작업은 넘겨주고, 비가역적이고 자금이 걸린 작업, 대외 발표 작업은 직접 쥔다.
출시 리듬은 두 단계로 나눌 것을 권장한다. 첫 주에는 내부 메모 모드를 켜서 모델이 답변을 생성하고 사람이 확인한 후 발송하며, 틀린 답·빗나간 답·답하지 못한 질문을 질의응답 패키지에 보충한다. 안정된 후에 직접 답변으로 전환한다.
출시 전후 대조
단계 고객 측 성과 인적 측 성과 개조 전 야간 견적 문의가 다음 날에야 답변을 받아 고객은 이미 두 번째 공급업체에 연락한 상태 상담원은 다음 날 밀린 문의를 몰아서 처리 개조 후 야간 견적 문의가 5초 이내에 답변을 받고 동시에 관련 모델 파라미터도 수신 인력은 판단이 필요한 문제만 처리
설명할 점은, 효과의 측정 기준이 고객 만족도 향상이 아니라 고객이 답이 가장 필요한 순간에 정확한 답변을 받는 것이라는 점이다. 사례 당사자의 복기에 따르면 속도가 직접적으로 더 높은 만족도 점수를 가져오지는 않았지만 팀 부하는 현저히 줄였다.
하나의 완전한 운영 사례
한 산업용 부품 기업을 예로 들면, 배포를 완료한 후 이런 운영 사례가 나타났다. 밤 10시 30분, 한 단골 고객이 위챗에서 작년 그 배치의 밸브 씰링 링을 지금도 단품으로 살 수 있는지 문의했다. 5초 이내에 시스템이 답변했다. 구매 가능하며 모델은 특정 모델이고, 단품 구매는 50개부터이며, 소량 보충만 필요하면 수리 채널이 더 빠르다. 이 답변은 기업 자체 자료로 생성됐고 인적 개입은 없었다.
출시 후 유지보수 비용
장기적으로 유일하게 지속되는 작업은 지식베이스 유지보수다. 신제품 출시 시 항목을 추가해야 하고, 정책 조정 시 항목을 수정해야 하며, 가격 변동 시 항목을 업데이트해야 한다. 사례에서 이 기업은 결국 일 단위 동기화에 긴급 즉시 동기화를 더하는 방식을 채택했는데, 이는 만료된 자료 때문에 답변 정확성이 한 번 영향을 받은 적이 있기 때문이다.
질문: 더 큰 모델을 바로 써서 답이 부정확한 문제를 해결할 수 있는가. 불가능하다. 사례에서 더 큰 모델로 교체한 후 처리율이 6%에서 4%로 떨어졌고, 근본 원인은 데이터 쪽에 있다. 수정 방향은 모델 파라미터가 아니라 지식베이스 구조다.
질문: 지식베이스 항목 수는 많을수록 좋은가. 아니다. 사례에서 항목이 1200건에서 4800건으로 확장됨과 동시에 단일 항목 길이가 800자에서 180자로 압축됐으며, 정확도 향상은 주로 항목 총량이 아니라 단일 항목 입자의 최적화에서 왔다.
질문: 처음부터 완전 자동 답변을 켤 수 있는가. 권장하지 않는다. 첫 주에는 내부 메모 모드를 켜서 사람이 확인 후 발송하고, 일주일 후 틀린 답·빗나간 답·답하지 못한 질문을 질의응답 패키지에 보충한 다음 직접 답변으로 전환할 것을 권장한다.
질문: 자료는 누가 작성해야 하는가. 한 사람이 문을 닫고 작성하는 것은 권장하지 않는다. 일선 상담원과 영업을 함께 끌어들여 공동으로 참여해야 하며, 그들이 고객의 실제 질문 방식을 더 잘 안다. 책임자가 혼자 작성한 30건은 통상 고객이 실제로 문의하는 30건과 뚜렷한 차이가 있다.
스자좡시 차오시구 행정심사국(行政审批局)의 「윈즈쿠(云智库)」 AI 지능형 문답 서비스는 텐센트 ima 플랫폼에 직접 배포됐으며, 행정심사·인사·교육·의료보험·민정·세무 등 20여 개 부서의 정무 서비스 정보가 여기에 집결됐고, 시민은 위챗에서 IMA 미니프로그램을 검색하면 질문할 수 있다. 그 특징은 구축 투자 제로로, 기존 지식베이스 플랫폼에 의존해 배포를 완료하며 시스템 구축·기술 개발·일상 운영 유지보수 비용이 필요 없다. 정확성은 모델이 아니라 지식베이스에 의존하며, 모든 답변은 대외 공개된 정무 자료에서 비롯된다.
ima 자체의 전 단말 월간 활성은 1300만을 넘고, 누적 지식베이스 파일 4.2억 건 이상을 축적했으며, 지식 계정은 20여 개 업종을 커버한다.
- AI에게 보여줄 설명서 한 부를 작성해, 가장 자주 질문받는 30개 문제를 커버하고 각 항목을 고정 4열, 표준 답변·관련 보충·적용 불가 시나리오·상담원 연결 조건으로 구성한다
- 우선 사람을 가장 많이 잡아먹는 단일 구간을 골라 시범 운영하고, 전사적으로 펼치지 않는다
- 자동화 경계를 명확히 그어, 가역적이고 고빈도인 것은 모델에 넘기고 자금과 대외 발표가 걸린 것은 인력을 유지한다
도입 자가 점검 리스트
응대를 내보내기 전에 여섯 가지를 항목별로 점검할 것을 권장한다. 지식베이스 항목이 질의응답 단위로 분할됐고 단일 항목이 200자 이내로 통제됐는가. 각 문답에 적용 불가 시나리오와 상담원 연결 트리거 조건이 명시됐는가. 프롬프트가 답변 범위를 지식베이스에서만 오도록 한정하고 반드시 상담원에게 연결해야 하는 상황을 나열했는가. 자동화 경계를 그어 자금 및 대외 발표 작업의 수동 승인을 유지했는가. 첫 주에 내부 메모 모드를 채택했는가. 지식베이스 업데이트의 책임자와 주기를 지정했는가.
앞의 두 항목은 답이 정확한지를 결정하고, 세 번째·네 번째 항목은 답이 안전한지를 결정하며, 다섯 번째·여섯 번째 항목은 이 시스템이 장기적으로 운영될 수 있는지를 결정한다.
미리 회피해야 할 세 가지 문제.
첫째, 더 큰 모델로 교체해 답이 부정확한 문제를 해결하려 기대하지 마라. 사례에서 큰 모델로 바꾼 후 처리율이 오히려 6%에서 4%로 떨어졌다. 둘째, 첫날부터 완전 자동 답변을 켜지 마라. 상담원 연결이 불가능하다는 고객 불만을 유발하기 쉽다. 셋째, 한 사람이 문을 닫고 자료를 작성하게 하지 말고 일선 상담원과 영업을 함께 끌어들여 공동으로 참여해야 한다.
참고로 검증된 샘플이 하나 더 있다. 스자좡시 차오시구 행정심사국의 「윈즈쿠」 AI 지능형 문답 서비스는 텐센트 ima 플랫폼에 직접 배포됐으며, 행정심사·인사·교육·의료보험·민정·세무 등 20여 개 부서의 정무 서비스 정보가 여기에 집결됐다. 그 특징은 구축 투자 제로로, 시스템 구축·기술 개발·일상 운영 유지보수 비용이 필요 없다. 정확성은 모델이 아니라 지식베이스에 의존하며, 모든 답변은 대외 공개된 정무 자료에서 비롯된다. ima 전 단말 월간 활성은 1300만을 넘고, 누적 지식베이스 파일 4.2억 건 이상을 축적했으며, 지식 계정은 20여 개 업종을 커버한다.
핵심 결론은 세 가지로 정리된다.
- 검색 증강 생성의 효과 상한은 지식베이스 구조가 결정하며, 모델은 말단일 뿐이다
- 단일 지식을 800자에서 180자로 압축해 실측 37퍼센트포인트의 검색 정확도 향상을 가져왔다
- 자동화 경계는 가역성에 따라 구분하며, 가역적이고 고빈도인 것은 모델에 넘기고 자금과 대외 발표가 걸린 것은 인력을 유지한다