출처: AI Frontier Korea EP 111 — 벤치마크 1등이 탈락했다? 독파모 4파전 결과 살펴보기 길이: 1:28:31 · 채널: AI Frontier Korea (노정석) 자막: 한국어 자동자막을 문맥에 맞게 다듬어 정리 구성: 독자 파운데이션 모델(독파모) 선정 결과 → 소버린 AI의 의미 → continual learning과 비검증 가능 영역의 실험 루프
한눈에 보는 요약
- 이번 독파모 사업에서는 Artificial Analysis Intelligence Index(AAII) 기준 1위였던 Motif가 탈락하고, 벤치마크 외에 생태계·컨소시엄·전문가 평가·사용자 경험을 포함한 정부 평가표가 최종 결과를 만들었다.
- 모델 품질, 실제 업무 유용성, 생태계의 지속 가능성은 서로 겹치지만 같은 축이 아니다. 영상의 실사용 테스트에서는 문제 유형에 따라 Motif와 Solar의 강점이 갈렸다.
- 소버린 AI는 단순히 가중치를 보유하는 문제가 아니다. 데이터·학습 파이프라인·컴퓨트·서비스 운영·사용자 접점까지 어느 수준을 통제할지 결정하는 문제다.
- Richard Sutton의 continual learning 비전은 고정된 한 번의 학습보다, 환경과 상호작용하며 각 파라미터가 계속 배우는 시스템을 상상하게 한다.
- 폰트와 조판처럼 정답을 객관적으로 채점하기 어려운 영역도, proxy metric·반복 실행·사람의 취향 판정·에이전트 평가를 엮으면 점진적으로 측정 가능한 문제로 바꿀 수 있다.
- 미래의 에이전트 workflow에서는 사람이 모든 결과물을 직접 만들기보다 목표·성공 기준·취향·평가 루프를 설계하고, web interface와 Operator Agent가 실행을 맡는 방향이 제시된다.
이 영상에서 먼저 구분할 세 가지
- 벤치마크 순위 — 동일한 문제 세트에서 모델의 능력을 비교하는 압축된 숫자다. 빠른 방향 탐색에는 유용하지만, 모든 업무의 품질을 대표하지는 않는다.
- 정부 사업의 선정 기준 — 영상에서 소개한 기준은 벤치마크 외에 전문가·사용자·생태계·컨소시엄 역량을 함께 평가한다. 따라서 단일 벤치마크 1위와 사업 선정 결과가 달라질 수 있다.
- 실험실 밖의 사용성 — 모델이 검색, 긴 문맥, 도구 호출, 코딩, 한국어 문화적 맥락에서 어떻게 작동하는지는 별도의 harness와 실제 task set으로 확인해야 한다.
이 구분은 moc-ai-models의 모델 비교 관점과 moc-ai-agents-harness의 평가·실행 루프를 함께 읽을 때 더 선명해진다.
장면별 상세 설명
[00:20] 1. 프론티어 경쟁과 독파모 사업의 출발점

영상은 2026년 8월 22일을 기준으로, GPT-6·Astra 등 프론티어 모델 경쟁이 계속되는 가운데 한국의 독자 파운데이션 모델 사업 결과를 살펴보겠다고 선언하며 시작한다. 세 출연자는 이번 사업을 단순한 모델 성능 대회가 아니라 한국이 어떤 모델·데이터·산업 생태계를 선택할 것인지에 대한 시험으로 본다.
핵심 질문은 “벤치마크에서 가장 높은 모델이 왜 최종 선정되지 않았는가?”다. 이후 장면들은 이 질문을 AAII 순위, 모델 규모와 데이터, 정부 평가표, 직접 사용한 결과, 소버린 AI의 의미로 차례차례 분해한다.
[02:20] 2. AAII가 만드는 단일 순위

화면의 Artificial Analysis Intelligence Index는 여러 능력 평가를 합쳐 모델을 하나의 막대 순위로 보여준다. 출연자는 Opus·Fable·Sol·Grok·Kimi 등 익숙한 모델을 비교하는 데 이 지표가 널리 쓰인다고 설명하고, 이번 국내 후보군에서도 Motif가 가장 높은 점수를 받았다고 말한다.
단일 숫자는 후보를 빠르게 좁히는 데 좋다. 그러나 어떤 데이터와 문제 구성이 들어갔는지, 긴 문맥·도구·한국어·비용·운영 환경을 얼마나 반영하는지는 별도로 확인해야 한다. 이 영상의 후반부는 바로 그 “순위와 실제 일의 간극”을 검토한다.
[04:20] 3. Motif가 2위보다 10점 높았는데도 탈락하다

출연자의 설명에 따르면 Motif는 AAII에서 2위 모델보다 약 10점 높은 1위였다. 그런데 최종 결과에서는 Motif가 빠지고 다른 세 회사가 선정됐다. 화면 속 커서와 순위 차트는 이 역전이 단순한 소문이 아니라 “평가 함수가 달랐기 때문”이라는 문제 제기를 시각적으로 강조한다.
이 장면에서 얻을 실무적 교훈은 명확하다. 중요한 의사결정에서는 “어느 벤치마크에서 1위인가?”와 함께 “우리의 목적 함수에는 무엇이 들어가는가?”를 먼저 적어야 한다.
[06:50] 4. 후보 모델의 규모·컨텍스트·라이선스 비교

AI Frontier 자료 화면은 네 후보를 모델명, 순위, AAII 점수, 파라미터 규모, 활성 파라미터, 컨텍스트 길이, 라이선스로 나란히 비교한다. 표에는 200B~700B급 모델이 보이고, Solar Open 2의 긴 컨텍스트와 모델별 공개 범위도 함께 드러난다.
출연자들은 큰 모델이 반드시 높은 점수를 받지는 않는다고 짚는다. 모델의 크기만 볼 것이 아니라 학습 데이터, post-training, 추론 비용, 긴 문맥을 실제로 쓸 수 있는지, 상업·공공 환경에서 재배포할 수 있는지를 함께 봐야 한다.
[09:00] 5. 토큰과 데이터의 출처를 묻기

다음 표는 모델별 pretraining token 수, 학습 단계, 데이터 출처와 구성 방식을 비교한다. 영상에서는 공개 모델이라고 해도 데이터 수집·정제·컴파일 과정을 전부 투명하게 알 수 있는 것은 아니며, “오픈”이라는 라벨만으로 학습 파이프라인 전체를 판단하기 어렵다고 말한다.
소버린 AI를 논할 때 가중치 파일만 확보하는 접근이 약한 이유도 여기에 있다. 데이터의 법적·문화적 적합성, 재학습할 수 있는 인력과 파이프라인, 데이터가 새로 들어올 때 모델을 갱신할 방법까지 있어야 장기적인 자립성이 생긴다.
[11:00] 6. GPU 지원과 컨소시엄의 현실

화면에는 정부의 GPU 지원, B200 수량, 컨소시엄과 SK Telecom의 배경을 함께 놓은 비교표가 나온다. 출연자들은 모델 성능이 연구팀만의 능력으로 결정되지 않고, GPU를 얼마나 안정적으로 확보하고 학습·서빙·평가를 반복할 수 있는지에 영향을 받는다고 설명한다.
모델 선정은 곧 운영 주체 선정이기도 하다. 같은 가중치라도 컴퓨트 접근권, 장애 대응, inference 최적화, 사용자 피드백을 다시 학습에 넣는 조직 역량에 따라 실제 서비스의 결과가 달라진다.
[13:30] 7. 정부 평가표: 벤치마크 40, 전문가 35, 사용자 25

영상에서 소개한 평가표는 전체 100점 가운데 벤치마크 40점, 전문가 평가 35점, 사용자 평가 25점으로 구성된다. 벤치마크 40점도 AAII 25점과 NIA 15점으로 나뉘어, 한 기관의 단일 순위가 전체 결과를 독점하지 않도록 설계됐다.
이 구조에서는 Motif가 AAII 1위여도 다른 60점에서 손실을 볼 수 있다. 좋은 평가표는 대표 지표 하나를 버리는 것이 아니라, 그 지표가 말하지 못하는 현장 조건을 별도 축으로 드러낸다.
[16:00] 8. 모델 점수에서 생태계 점수로

전문가 평가 화면에는 모델 자체의 토큰 성능 외에 생태계와 응용, 사용자 접근성, NPU·하드웨어 협력 같은 항목이 나타난다. 출연자는 국가 프로젝트라면 “누가 이 모델을 가지고 무엇을 만들 수 있는가”가 모델의 순수 점수만큼 중요하다고 해석한다.
이는 모델을 납품하는 관점과 플랫폼을 키우는 관점의 차이다. 가중치의 우수성은 출발점이고, 문서·SDK·파인튜닝 데이터·개발자 커뮤니티·서비스 파트너가 연결될 때 실제 생태계 가치가 생긴다.
[19:50] 9. 판교어와 공개 사용자 평가

공개 사용자 평가 표에는 AAII, NIA, 전문가, 일반 사용자 등 서로 다른 순위가 함께 표시된다. 출연자는 특정 업계의 “판교어”에 갇히지 않도록 성별·연령·직업 등 다양한 사용자에게 직접 물었다고 설명한다.
전문가와 일반 사용자의 평가는 서로 대체 관계가 아니다. 전문가는 오류 유형과 잠재력을 볼 수 있지만, 일상 사용자는 응답의 자연스러움·한국어 문화 맥락·반복 사용 의향을 더 잘 드러낼 수 있다. 평가자 집단을 명시하지 않으면 사용자 점수도 해석하기 어렵다.
[22:10] 10. 오픈웨이트를 실제로 쓰는 agent harness

300B·700B급 오픈웨이트 모델을 개인이 직접 운영하기는 어렵기 때문에, 출연자들은 제공된 채팅 서비스와 harness를 사용해 모델을 시험했다. 화면의 평가 과제는 저녁 식사 계획, 가스레인지 관련 상식, 소설, IMO 수학, 코딩처럼 검색·상식·추론·창작·도구 사용이 섞인 문제들이다.
이 방식의 장점은 “모델을 한 번 호출했을 때의 인상”을 넘어 실제 작업 단위로 비교할 수 있다는 점이다. 다만 서비스의 system prompt, 검색 도구, 컨텍스트, 온도, 출력 길이가 다르면 모델 자체의 비교가 아니므로 harness 조건을 기록해야 한다.
[26:00] 11. Motif와 Solar의 작업별 강점

실사용 표에서 Solar Pro 4는 웹 검색과 일부 정보 탐색에서 강점을 보였고, 가스레인지 문제처럼 질문의 함정을 정확히 짚는 과제에서는 Motif가 좋은 답을 냈다고 소개된다. 환각을 인식하거나 모르는 것을 구분하는 메타인지형 문제, 수학·코딩에서도 모델별 차이가 관찰된다.
결과는 “누가 전부 우수한가”보다 “어떤 task family에서 누가 안정적인가”에 가깝다. 제품을 고를 때 평균 점수 하나보다 실제 업무를 대표하는 작은 과제 묶음을 만들고, 오류를 유형별로 기록하는 편이 재현성이 높다.
[29:50] 12. 좋은 foundation model은 현재 능력과 잠재력의 결합

화면에는 Motif가 지능형 과제에서, Solar가 일과 지식·범용성에서 강점을 보였다는 식의 요약 문장이 나온다. 출연자는 벤치마크가 체감 지능을 판단하는 데는 꽤 쓸모 있지만, foundation model의 가치는 현재 task 성능뿐 아니라 앞으로 다양한 업무에 적응할 잠재력에도 있다고 말한다.
따라서 모델 선택에는 두 개의 질문이 필요하다. 지금 우리의 일을 가장 잘 처리하는가? 그리고 새로운 데이터·도구·fine-tuning을 받아 더 넓은 일을 하도록 확장할 수 있는가? 전자는 운영 비용과 생산성, 후자는 플랫폼 투자와 관련된다.
[32:00] 13. 정부 평가와 산업 평가의 목적 함수가 다르다

출연자들은 산업 현장이 대체로 “가장 좋은 모델 하나”를 고르려는 반면, 정부 사업은 생태계·국민 사용·컨소시엄·전문가 검증까지 책임져야 한다고 비교한다. 그래서 산업 벤치마크에서 1위인 모델이 공공 사업의 목적 함수에서는 최종 선택을 받지 않을 수 있다.
반대로 여러 기준을 섞은 평가표는 참가자에게 무엇을 개선해야 하는지 명확히 전달하기 어려울 수 있다. 좋은 공공 평가에는 점수뿐 아니라 각 항목의 정의, 평가자, 테스트 세트, 재현 절차, 결과의 불확실성까지 공개되어야 한다.
[35:00] 14. “왜 주권 AI를 만드는가?”

이제 논의가 모델 순위에서 국가·산업의 선택으로 이동한다. 화면의 질문은 “그래서 우리는 왜 주권 AI를 만드는가”이며, 출연자들은 좋은 모델의 정의를 기술 성능만으로 끝내지 않는다.
주권 AI가 필요한 이유로는 언어·문화·법·안보·공급망을 외부 서비스의 선의에만 맡길 수 없다는 점이 제시된다. 여기서 주권은 모든 것을 국내에서 직접 만들겠다는 뜻보다, 핵심 의존성을 식별하고 필요한 수준의 통제권을 확보하겠다는 설계 문제로 읽는 편이 유용하다.
[39:00] 15. 모델 주권과 서비스 주권은 다르다

프론티어 모델의 우위가 빠르게 좁혀지고 모델 공급자가 많아지면, 가중치 자체는 점점 상품화될 수 있다. 그러나 데이터를 어디에 둘지, 요청을 어떤 정책으로 처리할지, 장애·검열·가격·업데이트를 누가 통제할지는 서비스 주권의 문제로 남는다.
이 구분은 “오픈웨이트를 확보하면 충분하다”는 생각을 교정한다. 조직의 핵심 업무가 특정 API에 종속되어 있다면 가중치를 내려받을 수 있어도 서비스 주권은 없다. 반대로 모델을 외부에서 쓰더라도 데이터 경계·라우팅·감사·대체 경로를 통제하면 일정 수준의 운영 주권을 확보할 수 있다.
[44:00] 16. 한국어와 산업 경험을 자산으로 남기기

출연자들은 이번 사업에 참여한 팀들의 경험과 실패도 한국 사회가 축적해야 할 자산이라고 말한다. 한국어의 고유한 표현·문화적 맥락·산업 현장의 업무 방식은 영어권 데이터만으로 완전히 대체하기 어렵다.
이 관점에서 탈락은 곧 폐기와 같지 않다. 데이터·평가 harness·학습 인프라·팀의 운영 노하우가 다음 모델과 다음 사업의 입력으로 남는다면, 한 번의 순위보다 생태계 학습 속도가 더 중요한 성과가 될 수 있다.
[54:00] 17. Sutton의 continual learning 비전

후반부에서 출연자는 Richard Sutton 등이 제시한 Alberta Plan을 다시 읽으며, 지금의 LLM처럼 학습이 끝난 모델을 고정해 두는 방식과 다른 continual learning의 비전을 소개한다. 환경과 상호작용하는 동안 각 파라미터가 작은 학습자처럼 계속 업데이트되고, 상위 메타 학습이 전체 방향을 조정하는 그림이다.
이 아이디어는 “더 큰 사전학습 한 번”의 대안이라기보다, 에이전트가 장기적으로 경험을 축적하는 방법에 대한 질문을 던진다. 실제 시스템에 적용하려면 업데이트 안정성, 망각, 평가 데이터 오염, 권한 상승, 비용 통제가 함께 해결되어야 한다. 관련 배경은 2026-07-08-continual-learning-for-agents-replit과 연결된다.
[01:00:00] 18. LLM의 토큰 흐름을 넘어 관계를 보이기

화면의 “실험 규모 사다리”는 작은 실험에서 중간 규모, frontier 규모로 올라가면서 점수와 feedback을 반복하는 구조를 보여준다. 출연자는 텍스트를 한 토큰씩 읽는 모델과 사람이 관계·구조를 한눈에 파악하는 방식의 차이를 이야기하며, SVG·다이어그램·확대 가능한 인터페이스가 정보를 보존할 수 있다고 설명한다.
중요한 것은 시각화 자체가 아니라 정보의 구조화다. 결과를 선형 텍스트에만 묻어 두지 않고, 가설·실험·관찰·판정을 서로 연결하면 사람과 에이전트가 긴 trace를 다시 읽고 다음 결정을 내리기 쉬워진다.
[01:04:00] 19. 조판은 비검증 가능 문제를 proxy로 바꾸는 첫 실험

조판과 한글 파라메트릭 폰트 실험은 “예쁘다”처럼 직접 정답을 정의하기 어려운 디자인 문제를 다룬다. 화면에는 두 페이지의 한글 텍스트와 글꼴 결과를 비교하는 작업 공간이 보이고, 출연자는 연구가 축적된 영역부터 측정 가능한 proxy를 만들 수 있다고 설명한다.
이때 proxy는 최종 미감의 완전한 대체물이 아니다. 글자 간격, 획의 균형, 인쇄·화면 가독성, 특정 글리프의 일관성처럼 사람이 판단할 요소를 더 작은 평가 항목으로 쪼개는 장치다.
[01:07:00] 20. 파라메트릭 한글 폰트와 어휘 랩

어휘 랩 화면에서는 글리프의 곡선·획·파라미터를 직접 조절하고, 결과를 다시 확인하는 작업이 진행된다. 출연자는 METAFONT 계열처럼 글꼴 생성을 함수화하려는 전통과, 모델이 새로운 글꼴 후보를 빠르게 생성·수정하는 방식을 연결한다.
현재 결과가 곧바로 예쁘고 실용적인 폰트가 되는 것은 아니다. 하지만 사람이 일일이 모든 글리프를 그리는 대신 생성 공간과 규칙을 정의하고, 모델이 후보를 만들며, 평가자가 취향과 품질을 판정하는 구조는 새로운 디자인 도구의 형태를 보여준다.
[01:10:00] 21. 취향을 평가 루프 안에 넣기

다음 화면은 확대된 글리프와 평가 입력 영역을 함께 보여준다. 출연자는 이전에는 폰트 팀이 필요했던 일을 이제는 한 사람이 모델을 directing하면서 밀어붙일 수 있다고 말한다. 비용이 내려간 덕분에 많은 후보를 만들어 취향과 품질을 비교하는 반복 횟수가 늘어난다.
다만 취향을 숫자로 바꾼다고 해서 취향의 문제가 사라지는 것은 아니다. 어떤 proxy를 선택했는지, 누가 판정했는지, 평가 기준이 반복 실행 중 어떻게 변했는지를 기록해야 한다. 그렇지 않으면 모델이 진짜 품질이 아니라 평가자의 빈틈을 최적화하는 proxy hacking이 일어난다.
[01:12:30] 22. 값싼 반복 실행과 hill climbing

화면의 Claude web 작업은 바닐라 HTML5 폰트 에디터와 평가 계획을 만들고, 여러 셀·글리프를 반복적으로 시험하는 흐름을 보여준다. 출연자는 한 번의 실행이 30분 이상 걸리더라도 비용이 충분히 낮아지면 수십 번의 시도를 쌓는 hill climbing이 가능해진다고 설명한다.
이 루프의 기본 형태는 생성 → 실행 → proxy 평가 → 다음 후보 선택이다. 그러나 비검증 가능 영역에서는 평가자의 판단 자체가 루프 안에 들어간다. 그래서 자동화의 핵심은 생성 모델을 고르는 것만이 아니라, 좋은 결과를 판별할 evaluator와 실패를 보존하는 실험 기록을 만드는 것이다.
[01:21:30] 23. 사람의 역할은 목표·평가·취향을 정하는 일로 이동한다

생성된 조판 결과와 책 형태의 화면을 보며, 출연자는 현재 사람이 맡는 핵심 역할이 목표를 정하고 출력물을 평가하는 것이라고 말한다. 모델이 실행을 대신해도 어떤 공간을 탐색할지, 어느 정도의 품질을 합격으로 볼지, 무엇을 버릴지는 여전히 사람이 정의해야 한다.
이것은 “사람이 빠진다”는 말과 다르다. 사람의 노동이 픽셀·코드·문장 생산에서 목적 함수·취향·평가 프로토콜의 설계로 이동한다는 뜻이다. loop-engineering에서 다룬 반복 루프의 실패를 피하려면 목표와 평가를 분리해 명시하는 편이 좋다.
[01:26:20] 24. Claude Code나 Codex가 아닌 web interface

출연자는 영상에서 보여준 작업 대부분이 Claude Code나 Codex가 아니라 web interface에서 이루어졌다고 강조한다. 브라우저 안에서 파일·결과·대화·시각적 비교가 한데 묶이면, 코딩 에이전트에 익숙하지 않은 사람도 반복 실험에 참여할 수 있다.
도구 표면보다 중요한 것은 같은 구조다. 입력을 정의하고, 결과를 만들고, 결과를 평가하고, 다음 실행에 피드백을 전달한다. 이 구조가 안정되면 CLI·IDE·브라우저 중 어느 표면에서도 같은 workflow를 운영할 수 있다.
[01:27:58] 25. Operator Agent가 사용자의 일을 맡는 미래

마지막에는 텍스트로 Operator Agent에 지시하고, 에이전트가 사용자의 일을 전부 다루게 만드는 방향이 제시된다. 이는 단순한 챗봇 답변이 아니라 목표를 이해하고, 웹 도구를 사용하고, 여러 번 실행하며, 결과를 확인하는 업무 대행에 가깝다.
이 미래가 안전하고 유용하려면 에이전트에게 모든 권한을 주는 것만으로는 부족하다. 업무 범위·승인 지점·데이터 경계·평가 기준·실행 trace·중단 조건을 함께 설계해야 한다. 이 관점은 moc-ai-agents, moc-ai-agents-harness, 2026-08-18-ai-frontier-ep110-ai-alignment와 직접 이어진다.
핵심 개념 정리
벤치마크 1위와 사업 선정은 다른 함수다
모델 비교에서는 AAII 같은 composite benchmark가 빠른 공통 언어를 제공한다. 하지만 공공 사업은 모델 자체 외에도 생태계, 컨소시엄, 사용자 접점, 산업 파급력, 운영 가능성을 평가한다. 둘 중 하나가 “진짜”이고 다른 하나가 “가짜”인 것이 아니라 목적 함수가 다르다.
실무에서 모델 도입을 결정할 때는 다음 표처럼 점수의 층위를 분리하는 편이 좋다.
| 층위 | 확인할 질문 | 대표 산출물 |
|---|---|---|
| 능력 | 표준 문제에서 어떤 능력을 보이는가? | 벤치마크 점수, 오류 유형 |
| 업무 | 우리 task set에서 실제로 일을 끝내는가? | harness 실행 기록, pass rate |
| 운영 | 비용·지연·컨텍스트·도구를 감당하는가? | latency, 비용, 장애율 |
| 생태계 | 계속 개선·확장·대체할 수 있는가? | 데이터 파이프라인, 커뮤니티, 파트너 |
| 주권 | 데이터·정책·서비스·공급망을 어느 수준까지 통제하는가? | 경계 문서, 라우팅, 감사 로그 |
소버린 AI는 통제면(control plane)의 설계 문제다
가중치를 직접 보유하는 것은 여러 통제 지점 중 하나다. 모델 선택·라우팅·데이터 보관·학습 업데이트·도구 권한·인간 승인·감사 로그를 누가 결정하는지까지 봐야 서비스 주권의 수준을 말할 수 있다. 따라서 소버린 AI 논의는 모델 개발과 함께 moc-ai-agents-harness의 control plane 문제로 확장된다.
비검증 가능 영역은 proxy와 evaluator의 공동 설계가 필요하다
조판·폰트·문체·브랜드 디자인처럼 “좋음”을 한 줄의 정답으로 쓰기 어려운 영역에서는 완전 자동 채점부터 시도하면 안 된다. 사람이 중요하게 보는 특성을 작은 proxy로 나누고, 반복 생성과 비교를 가능하게 한 뒤, 사람의 취향 판정을 루프에 명시적으로 넣는 순서가 현실적이다.
실전 체크리스트
- 모델 비교 전에 우리 업무를 대표하는 10~30개의 task set과 합격 기준을 적었는가?
- 모델별 API·system prompt·검색·컨텍스트·추론 예산·harness 조건을 동일하게 기록했는가?
- 벤치마크 점수와 실제 업무 성공률을 분리해 보고 있는가?
- 결과가 좋지 않을 때 모델·도구·데이터·평가자·운영 비용 중 어느 층위가 원인인지 분류했는가?
- 소버린 AI 범위를 가중치뿐 아니라 데이터·라우팅·서비스·업데이트·감사까지 정의했는가?
- 비검증 가능 작업에 사용할 proxy metric과 인간 evaluator의 판정 지점을 문서화했는가?
- Operator Agent나 web interface에 위임하기 전에 권한 경계·승인·중단 조건·trace 보존을 정했는가?
원문 인용 모음
자막의 말투와 일부 표기를 읽기 쉽게 다듬었다. 인용은 영상에서 제시된 주장과 질문의 방향을 보존하기 위한 짧은 발췌다.
- [02:20] “한 모델의 성능을 하나의 숫자로 표현한다면 그래도 이걸 가장 많이 보는 것 같아요.”
- [04:20] “가장 위에 있는 모델이 떨어졌다는 거죠.”
- [13:30] “벤치마크 점수가 전체 중 40점인데 그중 25점을 차지하고 있었고요.”
- [16:00] “모델 자체의 토큰 성능, 그것만 보는 게 아니라 생태계 자체를 평가하려고 했던 것 같아요.”
- [29:50] “벤치마크를 보는 게 체감 성능을 판단하는 데도 나쁘지 않다는 생각을 얻었고요.”
- [54:00] “어떻게 그걸 하겠느냐에 대한 힌트를 이번에 좀 줬는데요.”
- [01:04:00] “non-verifiable한 문제들을 verifiable한 문제에 가깝게 점근할 것이냐는 거예요.”
- [01:10:00] “승준님이 혼자 directing하시면서 모델을 끼고 밀어붙이고 계시는 거잖아요.”
- [01:26:20] “다 web interface에서 한 겁니다. 클로드 코드나 Codex가 아니에요.”
- [01:27:58] “Operator Agent에 텍스트로만 지시하고 모든 일은 걔가 다 다루게 만들어 놔서…”
출처와 한계
- 원문:
raw/transcripts/2026-08-25-ai-frontier-ep111-dokpamo-race.ko.srt - 화면 캡처:
assets/youtube/ep-111-dokpamo-race/ - 이 노트는 영상의 한국어 자동자막과 화면을 결합한 학습용 정리다. 정부 평가표의 수치, 후보 모델의 성능, 각 팀의 학습·컨소시엄 정보는 영상에서 설명된 내용을 옮긴 것이며 이 노트에서 별도 검증하지 않았다.
- 화면 장면은 긴 영상에서 주제 전환과 자료 화면이 선명한 시점을 골라 직접 확인했다. 반복적으로 같은 화면이 나온 구간은 대표 장면만 남겼다.