출처
- source_url: https://discuss.pytorch.kr/t/sensorfm-1-1-trillion-feat-google/11250
- author: 9bow
- published: Tue, 14 Jul 2026 21:30:41 +0000
- raw: raw source:
web-2026-07-15-pytorchkr-topic-11250-sensorfm-1-1-trillion-feat-google
개요
개요
SensorFM은 스마트워치와 밴드에서 수집한 라벨 없는 웨어러블 센서 데이터로 인간 생리의 범용 표현을 학습하는 헬스 파운데이션 모델이다. Google Research·Google DeepMind와 학계 연구팀은 동의한 참가자 약 500만 명의 1조 분 이상 데이터를 사용해 모델을 사전 학습했다. 모델은 심혈관, 대사, 정신 건강, 수면, 생활 습관, 인구통계 등 여러 과제에 재사용할 수 있는 임베딩을 목표로 한다. 원문은 다운스트림 예측, 결측 데이터 보완, 개인 건강 에이전트의 답변 생성에서 SensorFM의 가능성을 평가했지만, 기기 편향과 라벨 품질 등 한계도 함께 제시한다.
핵심 포인트
- 2024년 9월부터 2025년 9월 사이 100개 이상 국가와 미국 50개 주에서 수집한 500만 명 규모의 비식별화 데이터를 사용했다. 데이터는 20종 이상의 Fitbit·Pixel Watch 기기에서 수집됐으며, 총 20억 시간 이상, 1조 분 이상의 센서 신호로 구성된다.
- 입력은 PPG, 가속도계, 피부 전기 활동, 피부 온도, 고도계에서 얻은 34개 1분 단위 집계 피처다.
- SensorFM은 MAE 계열의 자기지도 재구성 방식을 사용한다. LSM-2의 AIM 프레임워크를 바탕으로 실제 결측 구간과 인위적으로 가린 구간을 함께 학습해 결측을 인지하는 표현을 만들도록 설계됐다.
- 데이터와 모델 규모를 함께 키울수록 성능이 증가했다. 가장 큰 SensorFM-B는 가장 작은 XXS 대비 재구성 MSE가 31% 감소했고, 분류 과제 평균 AUC 차이는 0.09, 회귀 과제 평균 상관계수 차이는 0.21이었다. 35개 과제 중 33개에서 가장 높은 성능을 기록했다.
- 35개 판별 과제에서 SensorFM의 인코더를 고정하고 선형 헤드만 학습했을 때, 수작업 피처 기반 지도학습 베이스라인을 34개 과제에서 앞섰다. 연구팀은 결측 보완과 시계열 예측에서도 베이스라인보다 높은 성능을 보고했다.
- LLM 에이전트 5개가 예측 헤드 코드를 반복적으로 생성·평가·개선하는 ‘교실’ 방식을 실험했다. 에이전트가 만든 헤드는 선형 프로브보다 분류 20개 중 16개, 회귀 15개 중 12개에서 높은 성능을 보였다.
- 개인 건강 에이전트 평가에서는 SensorFM 예측을 추가한 조건이 웨어러블 일일 지표만 사용한 조건보다 5개 평가 항목 모두에서 유의하게 높았다. 다만 실제 측정값을 사용한 조건과의 차이는 통계적으로 유의하지 않았다는 결과이며, 단일 턴·31명 참가자·전문의 4명의 평가에 기반한다.
왜 중요한가
웨어러블 헬스 모델은 보통 질환이나 지표별로 라벨 데이터를 모아 별도 학습해야 했지만, SensorFM은 대규모 라벨 없는 센서 스트림에서 재사용 가능한 표현을 먼저 학습하는 방향을 제시한다. 라벨이 부족한 건강 데이터에서 하나의 임베딩을 여러 과제에 적용하고, 새로운 예측 헤드의 설계도 자동화하려는 접근이라는 점이 핵심이다. 다만 원문은 SensorFM이 진단을 대체하는 모델이 아니라 선별, 위험 층화, 장기 추적 등에 활용될 수 있는 가능성을 검토한 연구라고 설명한다.
한계
- Fitbit·Pixel Watch 중심 데이터라 다른 웨어러블 기기나 생태계로의 전이가 보장되지 않는다.
- 원시 파형이 아닌 1분 집계 피처를 사용해 박동 간 변이와 1초 미만의 세부 시간 구조가 반영되지 않을 수 있다.
- 일부 다운스트림 라벨은 실험실 검사나 EHR이 아니라 자기 보고, 약물 복용 정보, 선별 설문에 기반한다.
- 학습·평가 참가자가 특정 웨어러블 사용자 집단에 치우쳐 전체 인구를 대표하지 않을 수 있다.
- 개인 건강 에이전트 평가는 단일 턴 상호작용으로 제한됐다.
후속 링크와 키워드
- 원문: https://discuss.pytorch.kr/t/sensorfm-1-1-trillion-feat-google/11250
- LSM-2 및 AIM: https://research.google/blog/lsm-2-learning-from-incomplete-wearable-senso r-data/
- Personal Health Agent: https://research.google/blog/the-anatomy-of-a-personal-health-agent/
- 키워드: SensorFM, 웨어러블 헬스 파운데이션 모델, 자기지도 학습, Masked Autoencoder, AIM, missingness-aware representation, ViT-1D, 시계열 스케일링, 결측 보완, Personal Health Agent
원문 보존 위치
원문 전체는 raw source: web-2026-07-15-pytorchkr-topic-11250-sensorfm-1-1-trillion-feat-google에 source_url 및 HTML 원문과 함께 저장되어 있습니다.