출처

개요

이 연구는 LLM이 숫자형 표 데이터 분류에서 전통적인 통계·머신러닝 알고리즘보다 낮은 성능을 보이는 이유를 통제 실험으로 분석했습니다. 연구진은 검색, 도구 사용, 에이전트 스캐폴딩, 파인튜닝 없이 학습·테스트 데이터를 하나의 프롬프트에 넣어 모델 자체의 능력을 평가했습니다. 노이즈, CSV 형식, 숫자 토큰화, 테스트 항목 수는 성능 저하의 결정적 원인이 아니었습니다. 31개 데이터셋 실험에서는 변수의 차원 수가 늘어날 때 LLM의 정확도만 하락했고, 고차원에서 LLM이 어떤 논리로 예측하는지는 명확히 밝혀지지 않았습니다.

핵심 포인트

  • 연구 대상은 Claude Opus 4.6이며, 외부 검색·도구·에이전트 구조·파인튜닝을 배제하고 프롬프트만으로 표 분류를 수행했습니다.
  • 검증한 가설 중 데이터 노이즈, CSV 표현 방식, 숫자 표기 방식, 테스트 항목 수는 LLM 성능 저하를 설명하지 못했습니다.
  • 31개 벤치마크에 무작위 선형 투영을 적용한 실험에서 정보량은 유지한 채 차원만 늘리자 LLM의 정확도가 하락했습니다.
  • 비교한 아홉 가지 방법 중 차원 증가에 따라 성능이 저하된 것은 LLM뿐이었고, 전통적인 방법들은 성능이 유지되거나 개선됐습니다.
  • 2차원 문제에서는 LLM의 판단 경계가 가우시안 프로세스나 거리 기반 알고리즘과 최대 91.6%까지 유사했습니다.
  • 252개 고전적 모델과 비교했을 때 LLM의 고차원 예측 패턴과 가장 유사한 모델도 일치율이 64.8%를 넘지 못했습니다.
  • 고차원에서 LLM이 실제로 어떤 예측 전략을 사용하는지는 연구에서 해결되지 않은 문제로 남았습니다.

왜 중요한가

매출 예측, 고객 이탈 예측, 재고 수요 추정처럼 변수가 많은 표 데이터를 LLM 프롬프트에 그대로 넣고 분류시키는 방식은 신중한 검증이 필요합니다. 낮은 차원에서는 LLM의 판단이 일부 전통적 방법과 비슷해 보일 수 있지만, 변수 수가 늘어나면 성능 저하와 예측 근거의 불투명성이 나타날 수 있습니다. 다만 이 연구는 도구나 검색을 결합한 시스템 전체가 아니라, 표 데이터를 프롬프트에 직접 입력하는 LLM 자체의 한계를 분석한 결과입니다.

참고 링크

관련 위키

원문 보존 위치

원문 전체는 raw source: 2026-08-06-aisparkup-post-15024-llm-50source_url 및 HTML 원문과 함께 저장되어 있습니다.