출처

Thinking Machines Lab, Inkling-Small 공개

개요

Thinking Machines Lab은 2026년 7월 30일 총 276B, 토큰당 활성 12B 파라미터의 오픈 웨이트 멀티모달 MoE 모델 Inkling-Small을 Apache 2.0 라이선스로 공개했습니다. Inkling-Small은 총 975B, 활성 41B인 Inkling보다 약 4분의 1 규모이지만, 일부 에이전틱 코딩과 추론 벤치마크에서 형 모델과 비슷하거나 더 높은 점수를 기록했습니다. 프리뷰 체크포인트 공개 이후 2주간 에이전틱 코딩 강화 학습을 추가한 결과 Terminal Bench 2.1 점수가 52.7%에서 64.7%로 상승했습니다. 반면 사실성, 지시 따르기, 적대적 안전 평가에서는 Inkling보다 낮은 점수도 나타났습니다. NVFP4 체크포인트는 최소 180GB 메모리에서 실행할 수 있어 Inkling보다 직접 운용하기 쉬운 모델로 소개됩니다.

핵심 포인트

  • 모델 구조: 42층 디코더 전용 멀티모달 자기회귀 트랜스포머이며, 256개 라우팅 전문가 중 토큰당 6개와 공유 전문가 2개를 활성화합니다.
  • 주요 사양: 총 276B, 활성 12B 파라미터, 최대 1M 토큰 컨텍스트, 텍스트·이미지·오디오 입력과 텍스트 출력을 지원합니다.
  • 프리뷰 이후 개선: Inkling을 교사로 활용한 온폴리시 증류와 추가 에이전틱 코딩 강화 학습이 적용됐으며, Terminal Bench 2.1은 12.0pt, SWEBench Verified는 2.8pt 상승했습니다.
  • 성능 특성: HLE 텍스트는 31.6%로 Inkling의 29.7%를 앞섰고, GPQA Diamond도 89.5%로 Inkling의 87.2%보다 높았습니다. 그러나 SimpleQA Verified는 20.6%로 Inkling의 43.9%보다 낮았습니다.
  • 컴퓨트·토큰 효율: 사고 노력 수준별 성능 곡선에서 Inkling-Small이 Inkling보다 유리한 위치에 놓였으며, 일부 업무·추론 과제에서는 더 적은 출력 토큰으로 더 높은 점수를 기록했습니다. 다만 τ³-Banking처럼 효율은 높아도 절대 점수는 Inkling보다 낮은 과제도 있습니다.
  • 멀티모달 처리: 별도 비전·오디오 인코더 대신 네이티브 방식으로 입력을 처리하며, 시각 추론 중 Python을 사용해 이미지 크롭·확대·검사를 수행할 수 있습니다. CharXiv RQ 점수는 Python 사용 시 77.4%에서 81.3%로 상승했습니다.

왜 중요한가

Inkling-Small은 단순히 큰 모델의 축소판을 공개한 사례라기보다, 더 나은 사전 학습 배합과 학습 레시피, 교사 모델 증류, 특정 능력에 집중한 강화 학습을 통해 작은 모델의 효율을 높인 사례입니다. 총 파라미터와 활성 파라미터가 Inkling보다 크게 줄어든 상태에서 일부 코딩·추론 과제의 성능을 유지하거나 개선했다는 점은 모델 운용 비용과 지연 시간을 줄이는 설계 방향을 보여줍니다. 또한 NVFP4 체크포인트가 최소 180GB 메모리에서 실행 가능하다는 설명은 대규모 모델을 개인이나 소규모 팀이 직접 실험할 수 있는 범위를 넓힐 수 있습니다. 다만 벤치마크별 성능 편차와 하네스 차이가 존재하므로, Inkling-Small이 모든 능력에서 Inkling을 능가한다고 해석해서는 안 됩니다.

후속으로 볼 링크·키워드

관련 위키

원문 보존 위치

원문 전체는 raw source: 2026-08-05-pytorchkr-topic-11517-thinking-machines-lab-4-1-inkling-inkling-smallsource_url 및 HTML 원문과 함께 저장되어 있습니다.