출처
- source_url: https://discuss.pytorch.kr/t/mozilla-ai-2026-3-3/11305
- author: 9bow
- published: Mon, 20 Jul 2026 01:30:52 +0000
- raw: 2026-07-20-pytorchkr-topic-11305-mozilla-ai-2026-3-3
개요
Firefox로 알려진 Mozilla가 처음 펴낸 오픈소스 AI 연례 진단 보고서 The State of Open Source AI 2026. 결론은 셋으로 압축된다 — 오픈 모델은 최상위 폐쇄형 모델과의 능력 격차를 거의 좁혔고, 지능의 가격은 붕괴했으며, 진짜 경쟁은 이제 모델 자체가 아니라 그 위에 얹히는 계층인 에이전트 하니스로 옮겨갔다. 보고서는 “약점을 감추는 주장은 광고에 불과하다”며 오픈의 강점뿐 아니라 노출된 약점까지 함께 지도로 그린다. Mozilla CTO Raffi Krikorian은 이를 25년 전 브라우저 전쟁의 재연으로 읽으며, 핵심 대립 구도를 “빌려 쓰기(renting) 대 소유하기(owning)“로 요약한다.
1장 — 현재 상황: 격차는 좁혀졌고, 지능의 값은 붕괴했다
- 능력 격차: LMSYS Chatbot Arena 기준 오픈-폐쇄 격차는 2024년 1월 8.04% → 2024년 8월 0.5% → 2025년 2월 DeepSeek-R1이 거의 동률(~0%) → 2026년 3월 폐쇄형 추론 모델이 다시 앞서며 3.3%로 재확대. 다만 이는 “들쭉날쭉한 전선(jagged frontier) 위의 평균” — 코딩·지시 따르기·일반 지식은 이미 동률급이고, 격차는 추론·긴 문맥 검색·에이전트형 작업에 집중. “오픈 모델이 충분히 좋은가”가 아니라 “당신의 워크로드에 무엇이 필요한가”가 진짜 질문이라고 정리.
- 추론 비용 50배 하락: GPT-4급 성능의 100만 토큰당 가격이 36개월 만에 0.40(50배). 같은 기간 닷컴 시대 대역폭 곡선 2.6배, PC 컴퓨팅 곡선 3.4배 하락과 비교하면 이례적 속도. 이 붕괴를 이끈 건 오픈 가중치 — Llama 3.1(2024년 7월)이 바닥값을 $0.88로 11배 급락시켰고 DeepSeek 계열이 더 낮춤.
- 토큰은 오픈, 요청 수는 클로즈드: OpenRouter 토큰 비중에서 오픈 가중치가 2025년 말 약 1/3 → 2026년 중반 과반. 그러나 상위 9개 모델 월간 토큰량은 중국산 오픈(~82조)이 미국산 폐쇄형(~23조)을 3.5:1 이상 압도하는 반면, 요청 건수 기준으로는 Google 28.7% + Anthropic·OpenAI 합계 ~20%로 폐쇄형이 여전히 앞섬 — “오픈은 토큰을, 클로즈드는 요청을 가져간다.”
- 운영의 간극: 2026년 개발자 설문(n=1,410)에서 AI 기능 추가 개발자의 79%가 오픈 모델을 쓰지만(폐쇄형 71%), 프로덕션 도달률은 오픈 51% vs 폐쇄형 63%. 48개 구성요소·1,361개 프로젝트를 9계층×9기준으로 채점한 히트맵에서 커뮤니티 활동성(4.00)·도입 용이성(3.63)은 높지만 표준화(2.83)·엔터프라이즈 준비도(2.79)는 전 계층에서 최저.
2장 — 누가 베팅하는가: 오픈소스는 하나의 비즈니스 모델이다
- Databricks 연 매출 실행률 54억 달러(전년비 65%+ 성장), Mistral AI ARR 1년 새 20배 성장(~4억 달러), DeepSeek ARR ~2.2억 달러에 500억+ 달러 밸류로 74억 달러 조달. 검증된 5대 수익 모델: 호스팅 추론, 엔터프라이즈 플랫폼, 온프레미스 라이선싱, 미세조정 서비스, 하니스 도구.
- 미터기가 규모에서 고장 난다: Microsoft는 토큰 과금이 한 사업부의 연간 AI 예산을 몇 달 만에 소진시키자 2026년 6월 30일까지 대부분의 Claude Code 라이선스를 취소. Uber는 AI 코딩 예산을 넉 달 만에 소진(엔지니어 1인당 월 1,500 상한을 도입. 반대로 Stripe는 오픈 모델 자체 호스팅으로 추론 비용 73% 절감(지수 1.00→0.27), vLLM 위에서 GPU 함대 1/3만으로 하루 5천만 API 호출 처리.
- OpenRouter에서 폐쇄형은 사용량의 ~80%·매출의 ~96%를 차지(오픈은 사용량 20%·매출 4%) — 약 90% 능력 동등성에서 폐쇄형이 호출당 ~6배 더 비쌈. Linux Foundation 연구는 이 가격 비대칭의 미실현 절감액을 연간 약 248억 달러로 추산.
3장 — 왜 어디서나 일어나는가: 이념이 아니라 선택권(optionality)
- 클라우드 시대의 반복: AWS S3 1PB 이탈 비용 320만→$100만 미만, GEICO 클라우드 비용 계획 대비 2.5배 초과).
- 19일간의 프론티어 모델 셧다운: 2026년 6월 9일 Anthropic이 Fable 5·Mythos 5 출시, 사흘 뒤(6/12) 미국 상무부 수출 통제로 국적 구분 없이 전면 접속 차단. 6/26 Mythos 부분 복구(검증된 미국 핵심 인프라 ~100개 기관), 6/30 통제 해제, 7/1 Fable 5 전 세계 복구까지 19일. 교훈: “모델은 끌 수 있다. 그러나 이미 당신 기계에서 돌아가는 사본은 누구도 끌 수 없다.”
- 중국이 최대 오픈 가중치 공급원: 2026년 3월 기준 Qwen 누적 다운로드 9.42억 vs Llama 4.76억. OpenRouter 중국 오픈 모델 토큰 비중 2024년 말 <2% → 2026년 4월 45%+(상위 10개 모델 중 ~61%). 국무원 “AI 플러스” 이니셔티브·제15차 5개년 계획이 오픈소스 확산을 명문화 — 공개 가중치 배포가 반도체 수출 통제에 대한 거시 헤지로 작동(추론 부하를 사용자 로컬 하드웨어로 전가).
- 유럽(프랑스 AI 인프라 1,090억 유로, EU EUROPA 4천억 파라미터 주권 모델, 포르투갈 Amália, 독일 SPARK), 캐나다(주권 슈퍼컴퓨터 8.9억 달러, Cohere Command A+), 인도(GPU 저가 공급 + GitHub 개발자 5백만+ 증가) 등 47개국이 핵심 워크로드 외국 처리를 제한 — “국가 AI 정책을 가질 것인가”에서 “스택의 어느 계층을 소유할 것인가”로 질문이 이동.
4장 — 하니스가 새로운 프론티어다 (보고서의 핵심 통찰)
- 모델 가격이 0으로 수렴하면서 경쟁·잠금(lock-in)의 무게중심이 오케스트레이션 루프·도구·메모리·샌드박스·권한 모델로 이뤄진 에이전트 하니스로 이동. 열린 웹의 브라우저 역할이 한 계층 위에서 재현되는 셈.
- LangChain GitHub 스타 12.6만+·개발자 점유율 ~60%, MCP는 16개월 만에 월간 SDK 다운로드 200만→9,700만·활성 서버 1만+, 2025년 12월 Linux Foundation 산하 Agentic AI Foundation에 기부(AWS·Google·Microsoft·OpenAI 플래티넘 멤버). 다만 성숙한 에이전트 거버넌스 보유 기업은 ~21%뿐이고, MCP 재단 편입 직후 8주간 CVE 30건+ 신고 — 인증(OAuth 2.1)은 표준화됐지만 인가(authorization)는 여전히 미표준.
- 모델이 하니스를 집어삼킨다: Terminal-Bench 2.0(2026.5)에서 제3자 스캐폴드가 Anthropic 가중치로 79.8%를 찍어 Claude Code(58.0%)를 21.8pt 앞섰지만, 8주 뒤 2.1에서는 뒤집힘 — Codex CLI(GPT-5.5) 83.4%, Claude Code(Fable 5) 83.1%로 연구소 자체 하니스가 최고 독립 하니스(80.4%)를 앞섬. 격차가 21.8pt→~3pt로 압축, 통합이 형성 중인 해자(moat).
- 중립적 하니스에서는 격차가 무너진다: vals.ai Terminus-2 위에서 오픈 모델 GLM 5.2는 태스크당 1.98, 68.54%)·Opus 4.8($2.41, 71.91%)와 능력 격차는 몇 포인트인데 비용은 5배 차이.
- 미해결 구멍 — 쓰기 표면(write surface): 읽기(reads)는 대부분 기본 허용 가능하지만, 메시지 발송·예산 집행·레코드 수정 같은 쓰기(writes)는 비용이 크고 되돌리기 어려움. MCP·A2A 모두 인증(authentication)에서 멈추고 이식 가능한 인가 표준이 없음. Databricks의 오픈소스 Omnigent 같은 메타 하니스(meta-harness)가 세션 이력 기반으로 다음 쓰기를 상태 기반 게이팅하는 방향으로 대응 중.
- 클로즈드가 곧 안전은 아니다: 2025년 CVSS 9.3~9.4 인가 실패가 Anthropic Slack MCP, Microsoft Copilot(EchoLeak), Salesforce Agentforce(ForcedLeak), ServiceNow(BodySnatcher) 등 폐쇄형 시스템을 잇달아 강타 — 전부 “검색 권한은 확인됐지만 출력 목적지는 미확인” 패턴. NTIA는 “오픈 가중치를 제한 말고 모니터링하라”고 권고. 다만 폐쇄형이 실제로 앞서는 4개 영역은 통합 하니스, 100만 토큰급 긴 문맥 충실도(Gemini 3 다중 니들 검색 89% vs DeepSeek V4-Pro 41%), 즉시 사용 가능한 컴플라이언스(SOC 2·HIPAA), 책임 소재. DeepSeek는 FLI AI 안전 지수에서 0.37/4.0으로 F등급.
5장 — 다섯 가지 베팅: 계층이 열려 있는 동안 해야 할 일
- 오픈 하니스를 구축하라 — Codex가 GPT-5.5에 맞춰 조율됐듯, 오픈 가중치와 함께 설계·조율된 하니스를 만든다.
- 메모리를 소유하라 — 스택에서 유일하게 복리로 쌓이는 자산. 이식 가능·추가 전용(append-only) 형식으로 자체 방화벽 뒤에 둔다(Mem0 스타 4.7만+, Letta·Zep·LangMem 등).
- 이식 가능한 권한을 해결하라 — 쓰기 표면 문제를 푸는 팀이 지금 모델을 폐쇄형으로 묶어두는 보안 논리 자체를 갖게 된다.
- 미터기를 깨라 — Uber 요금은 보조금 가격에 이용자가 삶을 재편한 뒤 ~92% 인상됐다. 자체 호스팅은 하루 ~8천 대화를 넘으면 손익분기 — 값이 싼 지금 제2 공급원을 확보해둔다.
- 오픈 기본값을 복수화하라 — Qwen이 Llama를 앞서는 지금, 오픈 생태계가 단일 원천으로 쏠리면 그 원천의 정렬 선택·사각지대가 모든 파생물로 전파된다.
워치리스트 4갈래(능력·도입 정체, 하니스 우위 격차 확대, 시장 구조 붕괴, 신뢰·안전 이슈) 중 두 갈래가 동시에 후퇴하면 이 판단을 수정할 신호로 제시.
왜 중요한가
“모델 가격이 0에 수렴하면 경쟁은 하니스로 이동한다”는 프레임은 AI 도구 선택·투자 판단에 실전 함의가 크다 — 특히 Terminal-Bench 2.0→2.1 반전 사례는 “하니스가 모델보다 중요하다”는 성급한 결론에 대한 강력한 반증이며, 동시에 “연구소 통합 하니스가 새로운 해자가 된다”는 잠금 메커니즘을 구체적 수치로 보여준다. 쓰기 권한 표준 부재는 이 위키의 2026-07-20-aisparkup-post-14571-post(에이전트 안티패턴) 노트가 다루는 “쓰기 권한은 읽기 권한과 다른 위험” 논지와 정확히 겹친다.
참고 링크
- 원문: https://discuss.pytorch.kr/t/mozilla-ai-2026-3-3/11305
- 보고서 PDF: https://stateofopensource.ai/state-of-open-source-ai-2026.pdf
- 인터랙티브 웹 리포트: https://stateofopensource.ai/
- Stanford HAI 2026 AI Index: https://hai.stanford.edu/ai-index/2026-ai-index-report/technical-performance
- OpenRouter State of AI: https://openrouter.ai/state-of-ai
- Linux Foundation, 오픈 모델의 숨은 경제학: https://www.linuxfoundation.org/blog/revealing-the-hidden-economics-of-open-models-in-the-ai-era
- Databricks Omnigent 소개: https://www.databricks.com/blog/introducing-omnigent-meta-harness-combine-control-and-share-your-agents