Issue 01중국 AI
AC POST
중국 AI 목록
量子位2026년 9월 16일 15:32중국어 → 한국어

칭화대·원쥔즈넝, 구조화 데이터 모델 LimiX-2 공개

9월 16일 원쥔즈넝이 칭화대와 함께 차세대 데이터 대모델 LimiX-2를 공개했으며 파라미터 규모를 400M으로 늘렸다.

중국어 원문을 AI로 번역했습니다. 고유명사와 수치는 원문 표기를 우선하며, 중요한 판단에는 아래 출처 원문을 함께 확인하세요.

량쯔웨이(量子位) 독자 여러분 2026-09-16 14:32:31 출처: 량쯔웨이

9월 16일, 稳准智能이 칭화대학과 공동으로 차세대 데이터 대모델 LimiX-2를 발표했으며, 모델 파라미터 규모는 400M으로 확대되었다.

9월 16일, 稳准智能은 칭화대학 컴퓨터학과 崔鹏 교수와 공동으로 차세대 데이터 대모델 LimiX-2를 발표했으며, 모델 파라미터 규모는 400M으로 확대되었다. TabArena, BCCO, TALENT 등 3개 국제 주류 구조화 데이터 Benchmark에서 LimiX-2의 종합 Elo 점수는 각각 1935, 1432, 1506에 도달해 모두 리더보드 1위를 차지했으며, Google, SAP, Amazon 등 국제 대기업의 동종 모델을 앞섰다.

TabArena, BCCO, TALENT 등 3개 국제 주류 구조화 데이터 Benchmark에서 LimiX-2의 종합 Elo 점수는 각각 1935, 1432, 1506에 도달해 모두 리더보드 1위를 차지했으며, Google, SAP, Amazon 등 국제 대기업의 동종 모델을 앞섰다.

LimiX-2, 국제 주류 Benchmark 리더보드 정상에 오르다

Elo는 모델의 종합 능력을 측정하는 순위 지표다. TabArena, BCCO, TALENT는 국제 주류 구조화 데이터 모델 평가 기준으로, 여러 유형의 과제를 포괄하며 서로 다른 데이터셋에서 모델의 일반화 능력과 예측 성능을 평가하는 데 사용되며, 현재 구조화 데이터 기반 모델 경쟁의 중요한 평가 근거가 되었다.

LimiX-2, TabArena의 회귀·이진 분류·다중 분류 Elo 모두 최적

이번 모델 능력 업그레이드는 주로 3가지 기술 노선을 따라 추진되었다.

첫째는 컨텍스트 메커니즘 네트워크 CMNs(Contextual Mechanism Networks)로, 예측 의존 관계를 다루는 시스템으로서 모델링의 중점을 사전에 지정된 목표 변수에서 변수들 간의 상호 연관성으로 전환한다;

둘째는 사전 학습 단계에서 자동화 합성 데이터 생성 엔진을 업그레이드한 것이다;

셋째는 추가적인 Scaling으로, 모델 파라미터 규모를 400M까지 확대한 것이다.

LimiX 팀은 컨텍스트 메커니즘 네트워크(CMNs)를 제안하여 '목표 예측'에서 '구조 발견'으로 나아가는 구조화 데이터 모델링의 새로운 패러다임을 열었다. 전통적인 PFNs는 지정된 목표의 예측 분포를 핵심으로 삼는다; CMNs는 컨텍스트 데이터의 전 변수 결합 의존성을 모델링 대상으로 삼아, 변수가 어떤 값을 갖는지에 주목할 뿐만 아니라 변수가 어떻게 상호 연관되고 함께 어떤 내재적 구조를 구성하는지를 발견하는 데 착안한다.

이러한 패러다임 전환은 모델의 학습 목표를 재정립했다. LimiX는 컨텍스트 조건부 마스킹 모델링(CCMM)을 통해 서로 다른 관측 모드에서 변수 간 감독을 조직하고, 변수 관계 추론을 명확한 사전 학습 목표로 확립했다. 모델은 더 이상 특정 지정된 결과를 위한 관련 정보만을 학습하는 것이 아니라, 여러 조건부 예측을 통해 전 변수 의존 구조에 대한 표현을 함께 제약한다.

이 원칙은 네트워크 아키텍처에도 관통한다. 따라서 LimiX는 셀 단위(Cell-Level) 모델링을 채택하여, 각 샘플에서 변수의 관측을 기본 표현 단위로 삼아 열(column) 정체성, 구체적 값, 결측 상태를 보존하고, 변수 간·샘플 간 정보 상호작용을 지원한다. 데이터 표현, 학습 목표부터 네트워크 연산에 이르기까지 전체 설계가 결합 의존성 모델링을 중심으로 전개된다.

이 프레임워크 아래에서 분류, 회귀, 결측값 대체 등의 과제는 동일한 데이터 모델에 대한 서로 다른 질의로 통일된다. 더 중요한 것은, 결합 관계 모델링이 인과 가설과 결합하여 인과 골격 발견을 수행할 통계적 기반을 제공한다는 점이다. CMNs가 지향하는 것은 단지 더 강력한 예측기가 아니라, 결합 모델링을 기반으로 하고 구조 발견을 방향으로 삼아 데이터 메커니즘 귀납을 향하는 범용 데이터 지능이다.

학습 데이터에서 LimiX-2는 대규모 자동화 합성 데이터 생성 엔진을 업그레이드했다. 구조화 데이터는 기업 내부 시스템에 대량으로 존재하며 인터넷 텍스트처럼 대규모로 공개 확보되기 어렵기 때문에, TabPFN, Mitra 등 테이블 기반 모델도 일반적으로 합성 데이터를 사용해 사전 학습을 진행한다. LimiX-2는 선형, 비선형, 다변수 상호작용, 주기적 변화, 노이즈 교란 등 서로 다른 분포의 데이터를 자동으로 생성할 수 있어, 모델이 실제 기업에 들어가기 전에 더 많은 데이터 구조와 변수 관계에 접하게 한다.

지난해 11월 稳准智能이 '구조화 데이터 기반 모델이 Scaling Law를 따른다'는 점을 발견하고 제기한 데 이어, 이번 신모델은 다시 이 기술 노선을 따라 모델 파라미터 규모를 400M까지 끌어올렸다. 파라미터가 400M으로 증가하면 LimiX가 선택한 기술 노선이 더 큰 규모와 스케일에서 검증되고, 더 강력한 일반화 능력을 획득하며, 인과 관계 규칙의 발굴과 안정적 표현 우위도 한층 더 발휘될 수 있다.

각종 리더보드가 보여주는 분류, 회귀 등 예측 능력 외에도 LimiX-2는 인과 발견 측면에서도 기술적 돌파를 보여주었다. 전통적 인과 발견 방법은 전문가 사전 지식이나 엄격한 통계적 가정에 의존하여 고차원 기업 데이터를 다루기 어렵다. LimiX-2는 위에서 언급한 일련의 혁신적 기술 노선을 채택한 후 Sachs, UF, Causal Chamber 등 여러 인과 발견 공개 표준 데이터셋에서 전통적 인과 발견 방법을 현저히 앞섰다.

LimiX-2, 인과 발견 평가에서 현저히 앞서다

2026년 세계인공지능대회 시점까지, 이전 세대 LimiX는 이미 3800여 개의 구조화 데이터 시나리오에서 범용성을 검증하고 60여 개 고객과 전략적 협력을 달성했다. 이전 여러 실제 시나리오 검증에서 LimiX는 과거 '하나의 과제마다 전용 모델 하나를 학습시키는' 전통적 머신러닝 방식을, 하나의 기반 모델이 시나리오와 데이터셋을 넘나들며 범용 예측 능력을 발휘하는 방식으로 전환했다. 공정 파라미터 최적화, 설비 고장 예측, 전력 예측, 에너지 소비 최적화, 재료 과학 등이 현재 비교적 전형적인 응용 방향이다.

LLM 트랙의 발전과 유사하게, 구조화 데이터 기반 모델은 곧 GPT3의 순간을 맞이할 것이며 국제 경쟁의 격렬함이 계속 강화되고 있다. Google, Amazon, SAP 등 여러 국내외 유명 팀이 모델 연구개발 과정을 끊임없이 가속하고 있으며, LimiX 등 중국 기술 팀도 자체 창안 기술 노선을 지속적으로 다듬고 산업 시나리오가 모델 반복 개선을 이끄는 중국 모델의 형성을 탐색하고 있다.

稳准智能 수석 과학자 崔鹏는 다음과 같이 밝혔다. "LimiX-2의 발표와 이번 Benchmark 성적은 팀이 구조화 데이터 대모델 방향에서 지속적으로 탐색한 중요한 단계적 성과입니다. 우리는 여전히 이 기술 노선을 장기적으로 견지하고, 데이터 규칙과 변수 인과 관계에 대한 모델의 이해 능력을 끊임없이 높여 나갈 것입니다. 앞으로도 우리는 인과 지능 방향에서 모델의 발전을 계속 추진하여, 인공지능이 예측에서 의사결정으로 더 빠르게 나아가도록 돕겠습니다.

기술 보고서 제목: LimiX-2: A Contextual Mechanism Network Towards General Structured-Data Intelligence

기술 보고서 주소: https://arxiv.org/abs/2609.17488

Github: https://github.com/limix-ldm-ai/LimiX

Huggingface: https://huggingface.co/stable-ai/LimiX-2

model scope: https://modelscope.cn/models/stable-ai/LimiX-2