개요

Thinking Machines Lab이 2026년 7월 15일 공개한 Inkling은 총 975B, 토큰당 활성 41B 규모의 멀티모달 MoE 트랜스포머다. 텍스트·이미지·오디오·비디오 45T 토큰으로 학습했고, 최대 1M 토큰 컨텍스트와 텍스트·이미지·음성 입력을 지원한다. 모델의 목표는 단일 벤치마크 1위보다 Tinker를 통한 커스터마이징과 실사용을 위한 폭넓은 기반 모델이 되는 데 있다. 원문에 제시된 벤치마크와 데모는 Thinking Machines Lab의 보고이며, 평가 설정과 체크포인트에 따라 결과가 달라질 수 있다.

핵심 포인트

  • 총 975B 파라미터 중 41B만 토큰마다 활성화하는 MoE 구조이며, 66층 디코더 전용 트랜스포머로 설명된다. Apache License 2.0으로 가중치를 공개했다.
  • effort=0.0부터 0.99까지 사고 노력을 조절할 수 있다. 원문은 Terminal Bench 2.1에서 Nemotron 3 Ultra와 비슷한 성능을 약 3분의 1 토큰으로 냈다고 보고하지만, HLE 비교 일부는 초기 체크포인트 기준이라고 밝힌다.
  • 멀티모달 입력을 별도 후처리 모델에만 의존하지 않고 함께 학습했다. 오디오는 dMel 스펙트로그램, 이미지는 40×40 패치와 hMLP를 사용하며, 차트·다이어그램·수학적 시각 추론에서는 Python 도구로 이미지 확대와 크롭을 보조할 수 있다고 소개한다.
  • 여러 코딩·에이전트 하네스에서 동작하도록 도구 집합과 스키마를 학습 중 무작위화했다. 원문 데모에는 Inkling이 자기 파인튜닝 작업을 작성·실행·평가하는 사례, 웹 앱과 브라우저 에이전트, GPT Codex 피드백을 40회 반영한 멀티플레이어 뱀 게임이 포함된다.
  • 캘리브레이션, 주장 검증, 회피 인식 보상을 별도로 학습해 불확실할 때 답을 유보하는 행동을 유도했다고 설명한다. 안전성 평가에서는 비교된 오픈 웨이트 모델과 함께 양호한 결과를 보고했지만, 롤플레이나 간접 표현을 통한 우회 위험이 남아 있어 Llama Guard 같은 심층 방어를 권장한다.
  • 아키텍처는 256개 라우팅 전문가와 2개 공유 전문가, 토큰당 6개 라우팅 전문가 활성화, 슬라이딩 윈도우와 글로벌 어텐션 5:1 교차 배치, 상대 위치 표현을 사용한다. 대형 행렬에는 Muon, 그 외 파라미터에는 Adam을 적용했고, 강화학습은 30M회 이상의 rollout으로 확장했다고 전한다.
  • Inkling-Small 프리뷰는 총 276B, 활성 12B 규모로 공개됐다. 일부 평가에서 형 모델과 비슷하거나 앞섰지만, Terminal Bench 2.1과 SimpleQA Verified에서는 뒤처졌으며 전체 가중치는 테스트 완료 후 공개할 예정이라고 한다.

왜 중요한가

Inkling은 최고 점수 모델을 그대로 쓰기보다, 오픈 웨이트와 파인튜닝을 결합해 조직별 워크플로우에 맞추려는 모델 공개 전략을 보여준다. 사고 노력 조절은 품질과 생성 비용, 지연 사이의 선택지를 제공한다는 점에서 에이전트나 반복형 업무에 실용적일 수 있다. 반면 BF16 실행에는 최소 2TB, NVFP4 양자화도 최소 600GB 수준의 통합 VRAM이 필요하다고 안내해 직접 배포 진입장벽은 높다.

후속으로 볼 링크/키워드

출처

  • 원문 작성자: 9bow
  • 원문 보존: raw source: web-2026-07-18-pytorchkr-topic-11283-inkling-thinking-machines-lab-975b-moe