중국 AI 의료 연구, Science 등재…병원서 AGI 도전
다모원의 범용 AI 의료 연구가 Science에 게재됐고, 현장 의료진이 실직을 걱정하기보다 도입을 재촉했다는 내용이 전해졌다.
중국어 원문을 AI로 번역했습니다. 고유명사와 수치는 원문 표기를 우선하며, 중요한 판단에는 아래 출처 원문을 함께 확인하세요.
크레이시 2026-09-18 14:11:06 출처: 量子位
범용 AI로 가장 단단한 뼈를 깨무는 길, 이 길은 통한다
크레이시, 凹非寺에서 보내다
量子位 | 위챗 공식계정 QbitAI
AI는 온갖 것을 휩쓸고 있지만, 딱 하나 단단한 뼈는 좀처럼 공략하지 못해 수많은 사람의 기대를 물거품으로 만들고 있다.
2016년, 힌턴 옹은 이렇게 예언했다. "사람들은 이제 방사선과 의사 양성을 중단해야 한다." 그는 심지어 5년 안에 AI가 의료 영상 인식에서 방사선과 의사를 능가할 것이라고까지 생각했다.
옹은 평생 신중했지만, 역사는 그에게 장난을 걸었다. 10년이 지난 지금, 사람들은 AGI에 점점 가까워지고 있지만, 의료 현장에서는 이미지 인식 같은 AI의 '초보 마을' 과제조차 여전히 하드 모드다.
IBM의 왓슨부터 따져보면, 의료에서 참패를 맛본 AI 전문가들은 이루 헤아릴 수 없이 많다.
왜 의료가 AI의 아킬레스건이 되었을까?
——모델 정밀도에 대한 극도로 높은 요구 때문이다. 다른 분야에서는 모델의 환각을 웃어넘길 수 있지만, 여기서는 사람 목숨이 달려 있다.
이 때문에 의료 영상 AI는 오랫동안 전용 모델에 갇혀 있었다.
그런데 오늘, 학술지의 '왕자' Science가 중국에서 나온 중대한 연구를 정식 게재했다.
DAMO RADAR, 소개에 따르면 세계 최초의 전문가급 범용 영상 AI 모델이다.
이 모델은 복부의 18가지 해부학적 구조에서 146가지 질병을 볼 수 있으며, 많은 영상의학과 의사보다 더 정확하게 본다.
게다가 모델, 코드, 프레임워크가 모두 오픈소스로 공개됐다.
하나의 모델로 146가지 질병을 본다
DAMO RADAR, 전체 이름은 Rapid Abdominal Diagnosis with AI and Radiology로, 복부 신속 진단을 위한 AI 모델이다.
이 AI '레이더'를 개발한 팀은 바로 알리바바 다모 아카데미(알리바바 다모원)로, 지난 몇 년간 이들은 CT에서 육안으로 보기 어려운 초기 암 병변을 AI로 식별해 췌장암, 위암, 장암 등 특정 질환에서 중대한 돌파구를 마련하며 Nature Medicine에 5편의 논문을 발표했다.
그런데 하다 보니 다모 아카데미의 일부 사람들은 뭔가 이상하다고 느꼈다. 다모 아카데미의 선임 알고리즘 전문가 장젠펑은 질환 하나를 공략하는 데 최소 2~3년이 걸리는데, 인류의 질병은 수천 수만 가지이니 그대로라면 평생을 다 바쳐도 다 못 끝낼 것이라고 말했다.
더 까다로운 점은, 현실 세계에서 환자는 한 가지 병만 가지고 병원에 오지 않으며, 전용 모델에게 자기가 이 병이 있느냐고 묻지 않는다는 것이다. 실제로 한 장의 CT 영상 안에는 여러 장기, 여러 병변이 동시에 존재할 가능성이 크다.
다모 아카데미는 저장대 부속 제1병원 등 전 세계의 수많은 병원과 손잡고 복부 CT에 도전장을 내밀었으며, AI가 복부의 각종 질병을 한 번에 식별해내기를 바랐다.
복부를 택한 것은 임상에서 공인된 가장 어려운 영상 현장이기 때문이다.
저장대 부속 제1병원 영상의학과 주임 샤오원보의 소개에 따르면, 젊은 의사들은 보통 복부 그룹에 배정되는 것을 가장 두려워한다.
복부는 소화기계, 비뇨기계, 생식기계를 아우르고, 간·담·췌·비·장이 전부 서로 붙어 있으며, 장은 온 복강을 감아 돌고, 모든 장기가 거의 연부 조직이라 밀도가 비슷해, 전적으로 육안으로 밀도 차이를 감지하는 민감도에 의존해 병변을 찾아내야 하기 때문이다.
이전에도 폐 결절 같은 것을 겨냥한 AI 보조 도구는 있었지만, 복부는 너무 복잡해서 줄곧 금지 구역이었고, 아무도 감히 손대지 않았다.
RADAR가 하려는 것은 하나의 모델로 복부 전체를 커버하는 것이다.
최종적으로 그것은 18가지 해부학적 구조, 146가지 질병을 커버했으며, 간, 췌장, 담낭, 신장, 비장, 장 등 주요 장기를 포괄해 임상에서 흔한 병변을 기본적으로 아우른다.
그 효과에 대해 팀은 매우 엄격한 다층 검증을 진행했다.
내부의 실제 세계 연속 코호트 약 3만 9천 건에서 RADAR의 평균 AUC는 0.913에 달했다.
AUC는 진단 모델이 환자와 정상인을 구분하는 능력을 측정하는 지표로, 1은 완벽한 구분, 0.5는 찍기와 같으며, 0.9를 넘으면 우수한 것으로 본다.
이후 팀은 8개 외부 병원에서 온 2만 4천 건이 넘는 CT로 다시 검증했는데, 이 사례들은 서로 다른 지역, 서로 다른 스캔 장비를 아우르며, RADAR의 AUC는 여전히 0.895에 도달했다.
게다가 RADAR는 응급 현장으로까지 일반화됐다.
응급 현장과 일반 외래의 차이는, 시간이 급해 조영제가 최상의 효과를 발휘할 때까지 기다릴 수 없고, 환자도 협조할 능력이 반드시 있는 것이 아니어서 CT 영상 품질에 편차가 생긴다는 점이다.
RADAR의 훈련 목표에는 응급 현장이 포함되지 않았지만, 테스트 때 팀이 2만 7천 건의 응급 데이터로 한 번 측정해보니 결과 AUC는 여전히 0.904였다.
게다가 다모 아카데미는 간암, 췌장암, 위암, 장암 네 가지 암의 진단에서 RADAR에 대한 요구를 한층 더 높였다.
이 네 가지 암에서 그들이 RADAR를 시험하는 데 사용한 근거는 '병리 골드 스탠더드', 즉 병리 생검 결과를 Ground truth로 삼아 영상 판단이 정확한지 확인하는 것이었다.
이 난도를 높인 테스트에서 RADAR의 AUC는 여전히 0.891~0.984에 달했다.
다모 아카데미는 인간 대 기계 비교도 한 차례 진행했다.
이 비교에는 14개 병원에서 온 26명의 영상의학과 의사가 참여했으며, RADAR와 이들은 같은 배치의 사례에서 각자 독립적으로 진단했고, 결과적으로 RADAR의 정확도는 그중 23명의 의사를 능가했으며, 3명의 베테랑 의사에게만 약간 뒤처졌다.
이와 동시에 다모 아카데미는 인간-기계 협업 시나리오도 테스트했는데, 의사가 AI의 도움을 받아 영상을 판독할 때 전체 민감도가 약 10% 향상됐고, 평균 판독 시간은 30% 이상 줄었다.
'초급 의사 + AI' 구성은 민감도가 심지어 베테랑 의사가 혼자 판독하는 것보다도 높았다.
그렇다면 RADAR는 도대체 어떻게 해낸 것일까?
과거의 의료 영상 AI는 지도 학습을 사용했다. 간단히 말해 의사가 CT 이미지를 한 장 한 장 주석(라벨링)하고, AI가 그 주석을 따라 배우는 것이다.
이 방법은 주석 비용이 막대하고, 모델은 주석이 달린 그 몇 가지 병만 식별할 수 있어 다른 병으로 바뀌면 알아보지 못한다.
RADAR는 다른 길, 즉 시각-언어 대조 학습이라는 길을 갔다.
병원에는 CT 영상과 그에 대응하는 진단 보고서가 자연스럽게 대량으로 존재하며, RADAR는 영상과 보고서 텍스트의 대응 관계에서 직접 학습하므로 의사가 별도로 영상마다 주석을 달 필요가 없다.
이는 마치 의대생이 주임 교수와 함께 회진을 도는 것과 비슷하다. 주임이 영상을 보면서 "간에 저음영 병소가 하나 있는데 혈관종을 고려한다"고 말하면, 학생은 많이 들으면서 자연스럽게 어떤 영상 특징이 어떤 진단에 대응하는지 알게 된다.
하지만 CT 전체와 보고서 전체를 곧바로 정렬하면 효과가 매우 나쁘다.
팀은 처음부터 이 길을 시도했지만, 모델이 조잡한 통계적 특징만 학습할 뿐 '어느 장기가 어느 설명에 대응하는가'라는 연관성을 세우지 못한다는 것을 발견했다.
복부 CT 한 세트는 수백 장의 슬라이스를 포함하고 여러 장기를 담고 있는데, 실제로 문제가 있는 것은 어느 한 장기의 아주 작은 병변일 수 있어, 모델이 이미지 전체로 이해하게 하면 핵심 신호가 대량의 정상 조직에 묻혀버린다.
여기서 RADAR의 핵심 돌파구인 '장기 수준 세밀 정렬'이 등장한다.
그것은 먼저 CT에서 간, 췌장, 담낭, 신장 등 각 장기를 위치시켜, CT 한 세트 전체를 개별 장기 단위로 분해한 뒤, 각 장기 단위를 보고서의 대응 설명과 정밀하게 정렬한다.
이 설계의 착안점은 영상의학과 의사의 실제 업무 방식에서 왔다.
의사도 복부 CT를 볼 때 복부 전체를 하나의 덩어리로 훑어보지 않고, 간, 췌장, 담도, 신장, 장을 차례로, 한 장기씩 짚어가며 본다. RADAR는 AI도 이런 방식으로 학습하게 했다.
또 다른 혁신은 적응형 대조 모델링이다.
표준 대조 학습은 서로 다른 환자의 특징을 엄격히 구분하는 것을 기본값으로 삼지만, 의료 현장에서는 두 사람의 간이 모두 건강하다면 분리해서 볼 필요가 없다.
마찬가지로 같은 질병에 걸린 두 환자의 영상 특징도 함께 놓고 학습해야 한다.
RADAR는 이런 의학적 지식에 따라 샘플 사이의 거리를 동적으로 조정한다.
게다가 논문에 제시된 Scaling Law 곡선은 데이터가 늘어남에 따라 모델 성능이 계속 상승하고 있으며, 곡선이 포화될 조짐이 없다는 것을 보여준다.
의사가 '병변 하나를 덜 놓치도록' 돕는다
Scaling Law 곡선은 아직 오르고 있지만, 현재 RADAR가 도달한 능력은 이미 일선 의사의 업무 리듬을 바꾸기 시작했다.
"RADAR의 검증 데이터를 처음 봤을 때, 도저히 믿기지 않았다." 저장대 부속 제1병원 영상의학과 주임 샤오원보는 AI가 복부의 이렇게 비슷한 구조들 속에서 단번에 146가지 질병을 검출하고 AUC도 0.9 안팎이라니, 의사들의 상상을 완전히 뛰어넘은 것이라고 말했다.
과내가 술렁이기 시작했고, 많은 의사가 말했다. 어서 배치하자고! 외부 병원의 많은 의사들도 소식을 듣고 찾아와, AI가 복부 CT라는 골칫거리 문제를 해결해주기를 바랐다.
샤오원보는 영상의학 분야에서 30여 년 일했으며, 300여 명 규모의 과를 이끌고 있고, 과에서는 매일 수천 건의 영상을 처리한다.
복부 CT 보고서 한 건을 쓰는 데는 중·고년차 의사라 해도 20분은 걸리며, 사례 하나의 CT는 수백 장의 이미지를 포함해 하나하나 다 훑어야 한다.
이 일이 얼마나 어려운지 그녀는 너무나 잘 안다.
RADAR가 거듭된 검증을 받고도 정확도가 여전히 비슷하다는 것을 확인한 뒤에야 그녀는 정말로 인정했다.
영상의학과에는 '같은 병, 다른 그림자, 다른 병, 같은 그림자'라는 말이 있다. 같은 질병이 전혀 다른 모습으로 자랄 수 있고, 다른 병이 똑같아 보일 수도 있다.
샤오원보는 솔직히 말했다. 한 의사가 각종 특징을 한 번씩 다 보려면 수십만 장의 영상을 봐야 할 수도 있고, 평생을 다해도 이렇게 많은 사례를 다 보지 못할 수도 있다고.
이것이 바로 RADAR의 가장 큰 가치다. 그것은 인간 의사의 사각지대를 메워, 그들이 병변 하나를 덜 놓치도록 도울 수 있다.
특히 양성·악성 감별 같은 생사의 갈림길 시나리오에서 의사의 압박감은 매우 크다. 이때 AI가 있으면, 마치 언제나 곁에 영상 조수가 하나 있는 것과 같아, 의사가 망설일 때 보완적인 참고를 준다.
다만 AI 보조는 몇 가지 숨은 걱정도 가져온다.
이것은 정확도 얘기가 아니다. 어차피 AI를 쓰더라도 마지막에는 사람이 옆에서 검증한다.
이 문제는 미래 의사 집단의 발전에 관한 것이다.
의사 양성은 영상 논리적 사고를 중시하는데, 이런 사고는 이론에서 실천으로 반복적으로 다듬어지는 과정을 건너뛸 수 없다.
젊은 의사가 AI를 쓰면 보고서가 주임급 수준에 도달할 수 있지만, 일단 경로 의존이 형성되면 오히려 양성 경로를 끊어버린다.
하지만 지나치게 걱정할 필요는 없다.
샤오원보의 생각은 RADAR를 동시에 '일대일 지도 도구'로 만드는 것이다.
그녀는 지금 과의 300여 명이 여러 원구(캠퍼스)에 흩어져 있고, 과거처럼 선생님이 옆에 앉아 한 건 한 건 보면서 이끌어주는 방식은 이미 거의 사라졌다고 말했다.
하지만 AI가 그 역할을 대체할 수 있다. 젊은 의사가 통상대로 보고서를 작성한 뒤, AI로 한 번 자기 점검을 하면, 어떤 병변을 놓쳤는지, 어떤 판단이 어긋났는지 그 자리에서 알 수 있다.
마치 언제나 주임이 곁에 서서 "어, 여기 병변이 하나 더 있는데, 왜 못 봤어?"라고 말해주는 것과 같다.
이렇게 하면 모든 사례가 한 번의 교차 검증이자 학습 과정이 된다.
더 멀리 보면, RADAR의 장기 수준 정렬 프레임워크는 다른 영상 모달리티에도 적합해서, 관련 데이터만 있으면 MRI, PET, 초음파 모두 전이 대상이 될 수 있다.
게다가 이런 것들을 다모 아카데미는 감추지 않았다. 모델, 코드, 기술 프레임워크가 이미 전부 오픈소스로 공개돼, 어떤 팀이든 가져다 재현하고, 개선하고, 자신의 시나리오로 전이할 수 있다.
여기까지 오면, 사실 이는 더 이상 의료 AI 하나의 이야기가 아니다.
RADAR 이면의 사고방식은 하나의 범용 모델로 한 분야 전체의 문제를 해결하는 것이다.
의료는 모든 산업 중에서 정밀도 요구가 가장 극단적이고, 오류 허용도가 가장 낮은 현장으로, 한 번의 오판이 한 사람의 치료 방침, 나아가 생존 기간까지 바꿀 수 있다.
만약 이 패러다임이 여기서도 통한다면, 다른 고정밀 시나리오로 옮겨도 대체로 적용될 수 있을 것이다.
다모 아카데미 선임 알고리즘 전문가 장링은 "Science는 의료 영상 AI 논문을 극히 드물게 게재한다. 그것이 오랫동안 공학 기술 문제로 취급됐기 때문이다. RADAR는 범용 의료 영상 AI가 현실적으로 실현 가능한 기술 노선임을 최초로 증명해 Science 심사위원의 생각을 바꿨고, 심사위원들이 그것을 '과학 문제'로 대하기 시작했다"고 말했다.
RADAR가 이 문턱을 넘었다는 것은, 이 방법이 가장 엄격한 동료 심사를 견뎌냈다는 뜻이다.
돌이켜 보면, 몇 년 전 다모 아카데미가 PANDA 모델로 췌장암 선별이라는 난제를 공략한 것부터 오늘 RADAR가 Science에 오르기까지, 사실 모두 AI가 과연 가장 혹독한 실제 현장에서 진짜로 버틸 수 있는지를 확인하려는 것이었다.
오늘 Science가 내놓은 답은, 하나의 모델에 대한 인정일 뿐만 아니라 하나의 가능성에 대한 확인이다.
그것은 범용 AI로 가장 단단한 뼈를 깨무는 이 길이 통한다는 것을 증명했다.
논문 링크: https://www.science.org/doi/10.1126/science.aec6129
오픈소스 주소: https://github.com/alibaba-damo-academy/damo-radar