출처

개요

Google Research가 공개한 TabFM(Tabular Foundation Model)은 표 형식 데이터의 분류와 회귀를 별도의 학습이나 하이퍼파라미터 탐색 없이 단 한 번의 순전파로 처리하는 제로샷 파운데이션 모델이다. 기존 XGBoost 같은 트리 모델이 데이터셋마다 특화된 훈련과 특징 공학을 요구하는 문제를 해결하기 위해, 인컨텍스트 학습(ICL) 패러다임을 표 형식 데이터에 적용한 점이 핵심이다.

핵심 포인트

  • 아키텍처: 표의 2차원 구조를 처리하기 위해 행/열 교차 어텐션(Alternating Row and Column Attention)으로 특징을 풍부하게 문맥화한 뒤, 행 단위로 압축하고 마지막으로 인컨텍스트 학습 트랜스포머가 압축된 행 벡터들 위에서 추론을 수행한다.
  • 학습 데이터: 고품질 대규모 표 데이터의 희소성 문제를 해결하기 위해 구조적 인과 모델(SCM) 기반으로 생성된 수억 개의 합성 표 데이터셋으로만 학습했다.
  • 성능: TabArena 벤치마크에서 튜닝도 앙상블도 하지 않은 TabFM(분류 1727, 회귀 1940)이 4시간 튜닝한 AutoGluon(분류 1666, 회귀 1786)과 TabPFN 등을 일관되게 능가한다.
  • 사용성: scikit-learn의 fit/predict 인터페이스와 호환되며 Hugging Face에 공개된 사전 학습 가중치를 자동으로 내려받아 즉시 사용할 수 있다.
  • 한계: 분류는 최대 10개 클래스까지만 지원하며, 모든 학습 행을 컨텍스트로 전달하므로 메모리가 행 수에 비례해 증가하고 500개 이상의 특징을 가진 넓은 표에는 최적화되어 있지 않다. 모델 가중치는 비상업 라이선스로 배포된다.
  • 향후: Google BigQuery에 AI.PREDICT SQL 명령으로 통합될 예정이라 머신러닝 전문 지식 없이도 고급 예측을 사용할 수 있게 될 전망이다.

왜 중요한가

TabFM은 “새 표마다 모델을 새로 훈련한다”는 표 형식 머신러닝의 오래된 관행을 “사전 학습된 파운데이션 모델에 표를 보여주기만 하면 된다”는 방향으로 전환할 잠재력을 갖추고 있다. 특히 특징 공학과 하이퍼파라미터 튜닝에 소모되던 데이터 과학자의 시간을 줄여줄 수 있다는 점에서 실무 적용 가치가 높다.

후속 링크 및 키워드

원문 보존 위치

원문 전체는 raw source: web-2026-07-03-pytorchkr-topic-11058-tabfm-zero-shot-tabular-foundation-model-googlesource_url 및 HTML 원문과 함께 저장되어 있습니다.