AGI 새 전장서 구글·아마존 격돌, 중국 LimiX-2 연이어 승리
구글과 아마존이 AGI 경쟁을 벌이는 가운데 중국의 LimiX-2가 두각을 드러내며, 모델이 데이터 이면의 인과 메커니즘을 이해하도록 한다.
중국어 원문을 AI로 번역했습니다. 고유명사와 수치는 원문 표기를 우선하며, 중요한 판단에는 아래 출처 원문을 함께 확인하세요.
몽야오 2026-09-18 20:22:47 출처: 량쯔웨이(量子位)
LimiX, 모델이 데이터 이면의 인과 메커니즘을 이해하게 하다
몽야오, 논밍쓰(凹非寺) 량쯔웨이에서 전합니다 | 공식 계정 QbitAI
지난 2년간 AI 업계는 갈수록 뜨거워졌다.
대규모 언어 모델 LLM(Large Language Model)이 그야말로 치열하게 경쟁하는 동시에——
또 다른 구조화 데이터 측의 AI 노선인 LDM 역시 갑자기 각 분야의 헤드 플레이어들을 끌어들이기 시작했다.
LDM(Large Data Model), 즉 구조화 데이터 기반 모델은 생산 측의 핵심적인 고민을 겨냥한다. 바로 기반 모델이 서로 다른 구조화 데이터에 담긴 변수 관계, 조건 관계, 생성 메커니즘을 직접 학습하도록 만드는 방법이다.
얼마나 뜨거운지 하자면 이렇다!
우리에게 익숙한 미국의 Google, Amazon, 독일의 기업용 소프트웨어 거두 SAP 같은 플레이어들이 잇달아 뛰어들어 포진하고 있다~
그런데 누가 알았겠는가, 거두들이 막 LDM에 뛰어들어 자리 다툼을 벌이려는데, 한 중국 팀이 이미 1위 자리를 「고정석」으로 만들어 놓았을 줄이야.
9월 15일, 독일 소프트웨어 거두 SAP가 앞다투어 TabPFN-3.5를 내놓았고, 몇 시간 후(9월 16일), 칭화대 박사들로 구성된 한 팀이 400M 파라미터의 구조화 데이터 기반 모델 하나로——
TabArena, TALENT, BCCO 세 국제 주류 벤치마크 테스트의 이진 분류, 다중 분류, 회귀 등 각종 태스크에서 곧바로 「1위」를 차지하며 압도적인 격차를 보였다:
△공식 TabArena 리더보드
더 이상 뜸 들이지 않고, 구글 등 여러 대기업을 땅에 짓눌러 버린 이 모델이 바로 「원쥔즈넝(稳准智能)」이 막 발표한 LimiX-2다.
한 가지 짚고 넘어갈 점은, 이번이 원쥔즈넝이 LDM을 국제 최상위권으로 끌어올린 첫 번째 사례가 아니라는 것이다.
작년에 그들이 발표한 국내 최초의 구조화 데이터 기반 모델 LimiX 역시 오랫동안 리더보드를 석권하는 대작이었다. 하지만 이후 팀은 리더보드를 좇아 쫓아가는 대신 계속 밑단 기술과 모델 축적에 파고들었다.
그리고 이번에, 국내외 주류 선수들에게 다시 한번 허를 찔렀다~
이 중국 팀의 관점에서 정말로 중요한 것은 한 번 1위를 차지하는 것이 결코 아니라, 매번 중요한 시점마다 다시 1위로 돌아갈 수 있는 능력을 갖추는 것이다.
국내 최초의 구조화 데이터 범용 대모델로서, LimiX가 파고든 것은 바로 데이터 이면의 가장 값지고도 가장 찾기 어려운 「인과 규칙」이다.
TabPFN 같은 목표 예측 편향의 행 단위(row-level) 모델링 노선과 달리, LimiX-2는 변수 관계에 대한 모델링을 핵심 목표로 전면에 내세워 변수 간, 샘플 간의 결합 의존 구조를 학습한다.
또한 자체적으로 고품질 자동화 데이터 합성 엔진을 구축해, 먼저 모델이 충분히 복잡한 데이터 세계를 보게 한 뒤 실제 태스크를 처리하도록 한다.
지난 몇 년간 LLM은 이미 텍스트, 음성, 영상을 완전히 소화했지만, 산업 생산이나 과학 연구 등 응용 측에서 실제로 의사 결정을 내리는 데 쓰이는 장면에 부딪히면 인과관계, 정확성, 안정성에 대한 요구가 갑자기 높아진다. 이로 인해 LDM의 가치도 점점 더 선명해지기 시작했다.
현재 이 점점 뜨거워지는赛道(트랙)에서 원쥔즈넝은 칭화대와 연합해 이미 성과를 업계 최상위권까지 끌어올렸다.
LLM이 씹어 삼키지 못한 데이터 분석의 뼈대, LDM이 이어받기 시작하다
대규모 언어 모델은 지난 2년간 능력의 경계가 내내 치솟았다.
하지만 뜨거운 것과는 별개로, AI가 진정으로 산업 깊숙이 들어가면서 이전에는 모델 능력의 성장에 가려지기 쉬웠던 문제 하나가 점점 더 선명해지기 시작했다——
그것은 바로 현실 세계가 언어 세계보다 훨씬 「더 크다」는 것이다.
알아둘 점은, 오늘날 대규모 언어 모델의 능력은 상당 부분이 극히 방대한 의미 세계 위에 세워져 있다는 것이다.
텍스트, 코드, 논문, 수학 공식, 심지어 주석과 설명이 달린 이미지, 영상까지, 그 안에 담긴 지식에는 공통된 특징이 하나 있다. 바로 그것들이 이미 인간의 한 차례 이해와 선별, 추상을 거쳤다는 것이다.
LLM이 하는 일은 이미 인간의 지식 체계에 들어온 이런 정보를 Token으로 인코딩하고, 방대한 말뭉치를 통해 문맥 관계를 학습하며, 더 나아가 지식, 추론, 생성 능력을 형성하는 것이다.
따라서 정보이론과 모델링 대상의 관점에서 보면, LLM이 처리하는 것은 대부분 이미 「의미화」가 완료된 현실이다.
△AI 생성
그런데 문제는, 산업 시스템 안에는 이 의미 계층 「밖」에 장기간 존재해 온 또 다른 종류의 데이터가 있다는 것이다.
제조업을 예로 들면, 온도, 압력, 회전수, 원료 배합비, 설비 상태, 에너지 소비 등 수십, 수백, 심지어 수천 개의 변수가 동시에 변하며, 함께 지속적으로 진화하는 고차원 데이터 공간을 구성한다.
그중 상당수의 핵심 규칙은 인간이 미리 규칙, 공식, 텍스트 지식으로 정리하지 못했을 수 있다.
더 중요한 것은, 산업이 진정으로 관심을 두는 것은 흔히 개별 변수가 무엇인지가 아니라, 변수들 사이에 어떤 안정적인 관계가 존재하는지, 어떤 관계가 환경을 넘어 성립할 수 있는지, 그리고 한 변수가 변한 뒤 시스템 전체가 어떻게 반응하는지인 경우가 많다는 점이다.
만약 이런 데이터를 먼저 텍스트로 전사한 뒤 LLM에 넘겨 처리하게 하면, 중간에 필연적으로 한 차례 「정보 압축」을 겪게 된다.
하지만 생산 시스템에서는 압축되어 사라진 그 세밀한 차이가 곧바로 예측 정밀도, 수율, 리스크 판단을 좌우할 수 있다. 의미 공간에서는 무시할 수 있어 보이는 정보가 생산 공간에서는 바로 가장 값진 정보일 수 있는 것이다.
이것이 바로 「구조화 데이터 모델링」과 「언어 모델링」 사이의 가장 본질적인 차이를 이룬다——
LLM이 주로 인간이 이미 표현한 세계를 학습한다면, LDM은 현실 세계가 남긴 고차원 데이터 공간에 직접 들어가 변수 관계 자체에서 출발해 규칙을 이해하고자 한다.
둘은 서로 다른 정보 공간을 마주하며, 따라서 평행하고 상호 보완적인 두 기반 모델 노선에 더 가깝다~
생산의 깊숙한 곳까지 파고들 수 있고, LLM이 실제 데이터 세계를 이해하지 못하는 부분의 결손도 메울 수 있으니, 확실히 전망이 있다...
AI가 점점 더 복잡한 의사 결정 장면에 진입하면서, LDM도 기반 모델 체계에서 점점 더 중요한 능력 퍼즐 조각이 되고 있다.
그래서 지난 2년간 국내외 플레이어들도 잇달아 입장하기 시작했고, 구조화 데이터 기반 모델의 경쟁은 뚜렷하게 「속도를 높이고」 있다.
올해 Google은 곧바로 TabFM을 발표하며 테이블 데이터 기반 모델을 공식적으로 자사의 Foundation Model 판도에 편입했다.
Amazon도 Mitra를 내놓으며, 하나의 사전학습 모델이 서로 다른 테이블과 서로 다른 태스크로 어떻게 곧바로 전이되는지를 전문적으로 탐구했다.
SAP는 행보가 더 과감했다. 먼저 SAP-RPT-1을 만들고, 올해는 TabPFN 뒤의 Prior Labs를 곧바로 인수했으며, 10억 유로 이상을 투입해 구조화 데이터 AI 연구 팀을 확장했다.
불과 며칠 전에는 최신 TabPFN-3.5 Plus가 다시 공식적으로 SAP AI Core에 들어가, 현금흐름 예측, 지급 지연, 공급업체 리스크, 고객 이탈 등 기업 핵심 의사 결정 태스크를 곧바로 수행하기 시작했다.
Google, Amazon에서 SAP까지, 구조화 데이터 기반 모델은 이미 학계의 새로운 방향에서 빠르게 글로벌 기술 거두들이 집단으로 베팅하는 하나의 기반 능력으로 변모했다.
밑단 기술 패러다임을 다시 만들다, LimiX가 모델로 하여금 데이터 이면의 인과 메커니즘을 이해하게 하다
LDM 트랙이 달아오르기 시작하면서, 추이펑과 팀이 여러 해 동안 베팅해 온 방향도 마침내 각광을 받게 되었다.
원쥔즈넝 수석 과학자이자 칭화대 컴퓨터학과 추이펑(崔鹏) 교수는 구조화 데이터와 인과 지능을 오랫동안 연구해 왔으며, LDM 이념의 제시자 중 한 명이기도 하다.
오랜 기간 이 팀은 좀 더 밑단의 문제들을 파고들었다. Scaling 법칙이 구조화 데이터로 확장될 수 있는지, CMNs가 인과 모델링의 능력 상한을 더 열 수 있는지를 두고 말이다.
전통적인 인과 연구 경로를 벗어난 이런 탐구는 당시에는 결코 수월하지 않았다.
지금은 LimiX, LimiX-2가 연속으로 국제 Benchmark 최상위권으로 치고 올라, 당초 더 모험적으로 보였던 이 기술 노선이 모델 효과로 직접 검증받기 시작했다.
트랙이 뜨거워지는 것과 비교해 더 주목할 만한 변화는, 각자의 밑단 기술이 사실 그렇게 같지 않다는 점이다.
예컨대 TabPFN으로 대표되는 PFN 노선은 핵심 목표가 아주 명확하다. 주어진 문맥과 목표에 따라 모델이 새로운 테이블에 빠르게 적응하고 Y를 정확히 예측하게 하는 것이다.
이 노선은 분류, 회귀 등 태스크에 매우 적합하며, Tabular Foundation Model의 빠른 발전을 이끌었다.
그러나 구조화 데이터 모델이 계속 더 깊은 곳으로 나아가자 문제 하나가 떠오르기 시작했다. 만약 우리가 알고 싶은 것이 더 이상 「Y는 얼마인가」가 아니라면 어떻게 되는가?
결국 생산 측이 진정으로 관심을 두는 것은 변수들 사이가 어떤 관계인지, 한 변수가 변하면 다른 변수들이 어떻게 움직이는지까지 포함하는 경우가 많다.
이 단계에 이르면, 목표 변수를 중심으로 한 전통적인 PFN 노선은 그 능력의 경계가 점차 드러난다——
적지 않은 PFN 계열 모델의 경우 데이터는 흔히 먼저 더 높은 차원의 표현으로 압축된 뒤 목표 예측을 완수하는 데 쓰인다. 이렇게 하는 것은 태스크에 빠르게 적응하는 데 유리하지만, 문제는 일부 변수 수준의 세밀한 정보도 표현 과정에서 접혀 사라질 수 있다는 점이다.
문제가 「결과 예측」에서 「변수 관계 이해」로 계속 나아갈 때, 모델이 보존하고 활용해야 하는 정보의 입자 크기도 그에 따라 변한다!!
원쥔즈넝이 이번에 LimiX-2에서 진짜로 칼을 댄 것은, 구조화 데이터 모델의 가장 밑단에 있는 「기술 패러다임」이다.
머신러닝 방법으로 변수 관계와 인과 규칙을 연구한 비교적 이른 팀 중 하나로서, 추이펑 팀이 오랫동안 관심을 둔 문제는 바로 모델이 표면적 상관성을 넘어서, 환경을 넘어서도 여전히 안정적인 관계를 찾게 하는 방법이었다.
따라서 LimiX-2에 이르러 원쥔은 전통적인 예측 패러다임을 따라 능력을 쌓아 올리는 대신, 모델이 「무엇을 배우는가」를 곧바로 바꿨다——
팀은 창의적으로 문맥 메커니즘 네트워크 Contextual Mechanism Networks(CMNs)를 제안해, 구조화 데이터 모델링을 목표 변수를 중심으로 한 예측 문제에서 전 변수 결합 의존과 데이터 생성 메커니즘을 향한 관계 모델링 문제로 끌어올렸다.
먼저 문맥 메커니즘 네트워크(CMNs)에 대해 이야기해 보자.
PFN이 여전히 주어진 목표 아래에서 어떻게 더 정확히 예측할지를 학습하는 것이라면, CMNs가 답하고자 하는 문제는 이미 X, Y와 다른 변수들이 함께 놓였을 때 이 데이터가 도대체 어떻게 공동으로 구성되는가로 바뀌었다.
바꿔 말하면, LimiX-2는 더 이상 변수 관계를 예측에 봉사하는 중간 정보로 취급하지 않고, 그것을 곧바로 모델이 학습할 핵심 대상으로 만들었다.
이런 밑단 패러다임의 전환은 대규모 언어 모델이 BERT에서 GPT로 나아간 것과 다소 유사하다. 진정으로 달라진 핵심은 파라미터 규모나 Benchmark에만 나타나는 것이 아니라, 모델이 정보를 학습하는 목표와 조직하는 방식이 재정의되었다는 데 있다.
물론 CMNs라는 새로운 학습 목표는 듣기에는 아주 이상적이지만, 실제로 해내는 것은 그리 간단하지 않다.
모델이 변수들 사이가 도대체 어떤 관계인지 확실히 파악하게 하려면, 학습할 때 내내 「고정된」 문제 하나만 주어서는 안 된다.
그래서 원쥔 팀이 칭화대와 연합해 LimiX-2에서 한 중요한 일 하나는, 문맥 조건 마스킹 모델링(CCMM)을 제안하고 자동화 합성 데이터 생성 엔진을 업그레이드해, 끊임없이 모델에게 문제를 바꿔주는 것이다——
끊임없이 서로 다른 변수를 가렸다가 예측하게 함으로써, 모델이 단일 목표를 예측하는 것에서 변수들 사이의 조건 의존과 결합 구조를 학습하는 것으로 전환하도록 몰아간다.
반복적으로 학습한 뒤에 모델이 습득하는 것은 어느 한 문제를 어떻게 푸는가가 아니라, 점차 이것을 이해하는 것이다. 이 변수들이 서로 어떻게 작용하는가를.
예측 목표가 끊임없이 바뀌니, 모델도 어느 하나의 Y만 붙들고 매달릴 수 없고, 서서히 테이블 전체에서 변수들 사이의 관계를 파악해야 한다.
또한 밑단 기술 차원에서 LimiX는 모델링 입자 크기를 Cell-Level까지 더 내려, 셀을 기초 표현 단위로 삼아 열 정체성, 구체적 값, 결측 상태를 보존하고, 변수 간, 샘플 간의 정보 상호작용을 지원한다.
이렇게 해서 데이터 표현에서 학습 목표, 나아가 네트워크 계산에 이르기까지, 전체 설계가 결합 의존 모델링을 중심으로 전개된다.
이 프레임워크 아래에서 분류, 회귀, 결측값 대체 등의 태스크는 모두 동일한 데이터 모델에 대한 서로 다른 질의로 더 나아가 통일될 수 있으며, 결합 관계에 대한 지속적인 모델링은 이후의 구조 발견, 나아가 인과 골격 발견의 기초도 제공한다.
이로써 전체 밑단 기술 능력이 하나의 논리적 폐루프를 형성한다——
CMNs가 먼저 「목표」를 관계 학습으로 바꾸고, CCMM이 모델로 하여금 진짜로 「관계를 학습」하게 하며, Cell-Level이 각종 세밀한 「특징」을 보존하는 것을 맡아, 셋이 함께 학습 목표, 학습 메커니즘에서 데이터 표현에 이르는 하나의 기술 패러다임을 구성한다.
중국 LimiX-2 연구 개발 팀의 성과는 도대체 얼마나 강한가?
새로운 기술 패러다임이 진정으로 가치 있는 순간은, 흔히 그것이 능력의 경계를 다시 쓰기 시작한 뒤에 찾아온다.
LDM에게 AI 리더보드를 한 장 더 갱신하는 것보다 더 중요한 것은, 이 능력들을 실제로 생산 환경으로 가져갈 수 있느냐다.
그리고 실제 장면에 들어가기 전에, LimiX-2는 이미 주류 Benchmark에서 이 노선을 업계 최상위권까지 끌어올렸다.
TabArena, TALENT, BCCO 등 국제 주류 Benchmark에서 LimiX-2는 이진 분류, 다중 분류, 회귀 태스크 모두 1위를 차지하며 Google TabFM, TabPFN, TabICL, Mitra 등의 모델을 앞섰다.
먼저 「분류」를 보자.
분류 태스크가 해결하는 것은 「그것이 도대체 어느 상태에 속하는가」의 문제다. 예컨대 설비가 고장날지, 고객이 이탈할지, 한 거래에 리스크가 존재하는지 등은 본질적으로 모두 모델이 수많은 변수 속에서 결과에 진짜로 영향을 미치는 신호를 찾아내기를 요구한다.
TabArena 평가에서 Elo 순위 기준으로 LimiX-2는 네 가지 지표 모두 1위이며, Elo가 1917에 달해 TabFM을 +143점 앞선다.
모델의 밑단 모델링 능력을 시험하는 또 다른 지표는 「회귀 태스크」다.
회귀는 모델이 연속 변수들 사이의 의존 관계를 더 나아가 이해하고, 최종적으로 이 관계를 충분히 정확한 수치 예측으로 압축해 내기를 요구한다.
TabArena 회귀 태스크에서 Elo 순위 기준으로 LimiX-2는 네 가지 지표 모두 1위이며, Elo가 2206에 달해 1위를 차지했다.
바꿔 말하면, LimiX-2의 우위는 이미 「잘 맞히는 것」에만 나타나는 것이 아니라, 연속 관계를 더 세밀하고 더 정확하게 모델링하는 데도 나타나기 시작했다.
한 가지 짚고 넘어갈 점은, LimiX-2의 향상이 학습 데이터 측에서도 온다는 것이다.
CMNs가 학습 목표를 변수 관계 모델링으로 더 확장하면서, 학습 데이터의 다양성에도 더 높은 요구를 제기한다.
따라서 LimiX-2는 대규모 자동화 합성 데이터 엔진을 업그레이드해 더 많은 분포, 상호작용 관계, 노이즈 유형을 포괄함으로써, 모델이 더 풍부한 데이터 구조를 미리 보게 하고, 데이터 측에서 능력 차원의 확장을 뒷받침한다.
그뿐만 아니라, 분류, 회귀 등 예측 능력 외에도 LimiX-2는 능력을 인과 발견 쪽으로도 더 나아가 밀어붙이기 시작했다.
고차원의 복잡한 데이터에 직면하면 전통적인 방법은 흔히 전문가의 사전 지식과 통계적 가정에 제약을 받는다. 반면 Sachs, UF, Causal Chamber 등 공개 데이터셋에서 LimiX-2는 이미 다양한 전통적 인과 발견 방법을 앞서고 있다.
분류, 회귀, 그리고 교차 데이터 일반화는 모두 기업의 일상적 과제다. 이런 종류의 리더보드가 진정으로 검증하는 것은 모델이 실제 데이터에 직면했을 때 안정적으로 예측하고, 전이하며, 의사결정을 뒷받침할 수 있는지 여부다.
그리고 그 이면이 가리키는 것은 바로 LDM의 더 장기적인 능력 경로다——
Prediction에서 Relationship, Causality, Intervention, Decision으로 나아가며, AI가 현실 세계의 변수 관계와 생성 메커니즘, 변화 규칙을 더욱 깊이 이해하고, 곧바로 범용 인과 지능에 도달하도록 하는 것이다.
그리고 이는 바로 생산 측면 지능화의 다음 단계에서 가장 주목할 만한 방향 중 하나이기도 하다.
2020년, GPT-3가 등장했다.
이는 업계가 처음으로 분명하게 보게 해주었다. 기초 모델이 능력의 임계점을 넘어서면, AI는 단일 지점 과제 해결에서 더 범용적인 지능으로 나아갈 수 있다는 것을.
6년이 지난 오늘, AGI는 이미 멀리 있는 개념에서 점점 더 실현 가능한 비전에 가까워지고 있다.
하지만 AI가 계속 나아갈 때, 그것은 결국 언어 세계보다 훨씬 복잡한 공간, 즉 현실 세계 그 자체로 들어가야 한다.
변수들이 어떻게 서로 작용하는지, 인과가 어떻게 층층이 전달되는지, 그리고 작은 변화 하나가 결국 전체 시스템을 어디로 밀어낼지를 이해하는 것이다.
그리고 LDM이라는 경쟁 영역이 가리키는 것은 바로 이 아직 초기 단계에 있지만 AGI의 다음 단계 능력을 결정할 수도 있는 GPT-3의 순간이다——
대규모 모델이 인간이 이미 표현해 낸 지식을 이해하는 데서 더 나아가, 세계가 작동하는 방식 자체를 이해하도록 만드는 것이다.
다음 단계 AI 능력의 상한을 결정할 수도 있는 이 트랙에서, 분명 이미 중국 팀이 업계 선두에 도달해 있다.
참고 링크:
[1] 기술 보고서 제목: LimiX-2: A Contextual Mechanism Network Towards General Structured-Data Intelligence
[2] 기술 보고서 주소:
https://arxiv.org/abs/2609.17488
[3] Github: https://github.com/limix-ldm-ai/LimiX
[4] Huggingface: https://huggingface.co/stable-ai/LimiX-2
[5] model scope: https://modelscope.cn/models/stable-ai/LimiX-2