출처 https://youtu.be/ZA2StFPJhEY?si=6rnjrXyaaywaakst · 채널 AI Frontier Korea (노정석) · 길이 1:33:12 · 공개 2026-08-16 포맷 박종현·노정석·최승준이 진행하고 고석현(Sionic AI)이 참여한 대담. 2026년 8월 10일 녹화분으로, Sionic의 B300 데이터센터와 인퍼런스 최적화 사례를 중심으로 모델 서빙·에이전트 조직·컴퓨팅 자본의 변화를 이야기한다. 원본 자막
raw/transcripts/2026-08-17-ai-frontier-ep109-inference-era.ko.srt· 본문은 자막을 기반으로 재구성했으며 가격·성능·수익성 수치는 영상 출연자의 설명과 화면에 나온 사례값이다. 직전 회차 2026-07-26-ai-frontier-ep106-intelligence-supply-war
한눈에 보는 요약
- 모델보다 토큰을 만드는 공장이 중요해진다 — 오픈웨이트 모델의 성능이 빠르게 평준화되면서 차별화 지점은 모델 자체보다 GPU를 얼마나 효율적으로 운영해 토큰을 생산하느냐로 내려온다. Sionic은 이를 ‘토큰 팩토리’로 설명한다.
- 1000 TPS는 벤치마크 숫자보다 작업 방식의 변화를 뜻한다 — 사람의 독해 속도는 대략 초당 20
30토큰인데, 1000 TPS에서는 새 데이터베이스를 1015분, 소설 한 권을 약 1분에 읽는 식의 실시간 상호작용이 가능해진다. - TPS보다 작업 완료 시간이 중요하다 — Kimi처럼 토큰 생성 속도는 낮아도 더 적은 토큰으로 과제를 끝내는 모델이 실제 업무에서는 더 빠를 수 있다. 속도·지능·병렬성의 곱을 봐야 한다.
- Prefill과 decode를 분리하면 같은 GPU의 활용도가 크게 달라진다 — 긴 입력을 한꺼번에 처리하는 prefill과 토큰을 순차 생성하는 decode는 병목이 다르므로, 전용 풀과 KV cache 이동 계층을 설계하는 것이 핵심이다.
- 모델·하드웨어 엔지니어링의 경계가 흐려진다 — Sionic은 최적화 에이전트를 여러 개 띄워 모델 구조와 서빙 설정을 자동 탐색한다. 사람이 목표와 정성적 판단을 주고, 에이전트가 실험·검증·배포를 반복한다.
- 가치는 모델 레이어에서 위아래로 이동한다 — 모델은 상품화되고, 아래쪽의 GPU·전력·데이터센터와 위쪽의 고객 데이터·업무 흐름·애플리케이션이 더 많은 가치를 포착한다.
- 에이전트 조직의 다음 추상화는 control plane과 계약이다 — 사람은 의도, 시작 조건, 완료 조건, 검증 기준을 정하고 기계가 그 사이의 일을 수행한다. 조직 데이터와 에이전트의 실행 궤적 자체가 새로운 자산이 된다.
핵심 한 줄: 인퍼런스는 단순한 모델 호출이 아니라 GPU·네트워크·KV cache·에이전트 계약을 묶어 업무를 완료시키는 생산 시스템이 되고 있다.
장면별 상세 설명
[00:00–03:37] Sionic의 ‘토큰 팩토리’와 온프레미스 인퍼런스

Sionic은 약 100억 원을 투입해 100대 안팎의 B300 GPU를 갖춘 인퍼런스 시설을 구축했다고 소개한다. 대담은 사무실 화면에 띄운 대시보드와 가상 회사 화면을 보여주며, 이 시설의 목적이 단순한 GPU 임대가 아니라 토큰을 대량·저지연으로 생산하는 공장이라는 점에서 출발한다.

냉각은 부수적인 데이터센터 설비가 아니라 GPU 배치와 비용을 결정하는 요소로 설명된다. 뜨거운 통로의 공기를 약 50~60°C로 관리하고, 옥상 냉각탑과 물 미스트를 사용한다. 냉매를 멀리 보내는 방식은 배관 거리와 효율의 제약을 받으므로 GPU와 냉각 설비를 함께 설계해야 한다는 주장이다.

온프레미스 수요가 커지는 이유로 세 가지를 든다. 모델 출시 주기가 짧아졌고, 오픈웨이트 모델의 품질이 올라왔으며, 미국의 프론티어 모델·GPU 수출 통제 속에서 기업 데이터와 업무 흐름을 외부 API에 남겨두기 어려워졌다는 것이다. 따라서 “어떤 모델을 쓰는가”만큼 “어디서, 어떤 네트워크로, 어떤 데이터와 함께 돌리는가”가 중요해진다.
[03:37–11:47] 1000 TPS 데모, HBM 병목, 추측 디코딩

DeepSeek V4 Flash를 이용해 HTML 게임을 생성하는 화면을 시연한다. 일반 제공자는 약 50 TPS를 예상했지만 Sionic 환경에서는 1000 TPS 이상을 목표로 한다고 설명한다. 화면의 한 실행에는 디코드 TPS 1048 tok/s, ACCEPT/STEP 5.88, 19,740토큰, TTFT 243ms가 표시된다. 이 수치는 영상 데모의 한 실행값이지 일반적인 모델 성능 보증값은 아니다.

TPS(tokens per second)는 초당 생성 토큰 수다. 출연자는 LLM이 매 토큰을 만들 때 가중치를 반복적으로 읽기 때문에 HBM 대역폭이 큰 병목이 된다고 설명한다. 여기서 중요한 최적화 축은 다음과 같다.
- Speculative decoding — 작은 draft 모델이 다음 토큰들을 미리 제안하고 큰 모델이 묶어서 검증한다. 제안이 많이 받아들여질수록 큰 모델의 순차 생성을 줄일 수 있다.
- Accept rate — 언어·코드·한국어·복잡한 추론처럼 입력 분포가 달라지면 draft와 본 모델의 예측 일치율도 달라진다. 평균 TPS만으로는 실제 업무 속도를 알 수 없다.
- 양자화의 역설 — 양자화는 메모리 사용량과 읽기 비용을 줄일 수 있지만, draft와 본 모델의 차이를 키워 accept rate를 낮추면 오히려 전체 속도가 느려질 수 있다.
[11:47–22:04] Prefill·decode와 ‘Second Company’
모델의 입력을 한꺼번에 읽는 prefill은 병렬 계산량이 크고 GPU 연산에 가깝다. 이후 한 토큰씩 생성하는 decode는 가중치와 KV cache를 계속 읽어야 하므로 메모리 대역폭과 지연시간에 민감하다. 에이전트가 시스템 프롬프트·스킬·이전 대화·도구 결과를 길게 들고 다니면 컨텍스트와 KV cache가 커져 이 차이가 더 커진다.

Sionic의 Second Company는 Slack·Gmail과 회사의 업무 흐름을 연결해 가상 회사를 복제하는 실험이다. 여러 세션을 병렬로 실행하면 10~20개의 에이전트가 회사의 회의·보고·업무 진행을 실시간에 가깝게 모사할 수 있다. 이를 통해 퇴사한 구성원의 업무 맥락이나 조직의 의사결정 궤적을 에이전트로 재구성할 수 있다는 가능성을 보여준다. 동시에 검증되지 않은 산출물이 대량으로 쏟아지는 ‘AI slop’ 문제도 함께 커진다.

속도가 빨라지면 사람의 일하는 방식도 바뀐다. 지금은 응답을 기다리며 다른 창으로 이동하고 컨텍스트를 전환하지만, 1000 TPS에서는 사람이 실시간으로 결과를 읽고 방향을 수정하는 루프가 가능해진다. 출연자들은 속도를 독립적인 목표로 삼기보다 과제를 끝내는 데 걸린 시간을 측정해야 한다고 강조한다.

Kimi 비교 화면에서는 약 388 tok/s, 4.86 ACCEPT/STEP, 5,783토큰, TTFT 154ms가 표시된다. Flash가 더 높은 TPS를 내더라도 Kimi가 더 적은 토큰으로 더 높은 지능의 작업을 한 번에 마치면 전체 작업 시간은 Kimi가 짧을 수 있다. 즉 실제 지표는 TPS × 지능 × 병렬성과 작업 완료율의 조합에 가깝다.
[22:04–35:26] MTP·물리적 AI와 Prefill/Decode 분리
Sionic은 SOLAR에 MTP(multi-token prediction)를 후처리 학습으로 추가해 일주일 이내에 500~600 TPS급 결과를 얻었다고 말한다. 여러 토큰을 묶어 예측하는 구조가 로봇·자율주행 같은 물리적 AI의 반응 속도에 연결될 수 있으며, 클라우드의 VLA 모델이 추론하고 엣지의 작은 모델이 실제 행동을 수행하는 형태를 상상한다.

화면의 비유는 명확하다. Prefill은 굴착기로 한 번에 큰 흙더미를 옮기는 작업이고, decode는 숟가락으로 한 번에 한 알씩 옮기는 작업이다. 같은 GPU에서 두 작업을 섞으면 큰 prefill 하나가 여러 decode 스트림을 멈춘다. 반대로 prefill과 decode를 별도 풀로 나누면 각 작업의 배치와 하드웨어를 독립적으로 조절할 수 있다.

Kimi 사례에서는 prefill GPU와 decode GPU를 물리적으로 분리하고, 라우터가 세션과 KV cache를 decode 풀로 넘긴다고 설명한다. 긴 컨텍스트와 짧은 컨텍스트를 별도 풀로 보내면 자원 활용이 더 좋아진다. 다만 KV cache가 수~수십 GB가 될 수 있어 노드 사이에 수백 GB/s에서 TB/s급 전송이 필요하다. vLLM·SGLang·NVIDIA Dynamo가 각 조각을 제공하더라도, 실제 제품은 네트워크·스케줄러·장비를 결합하는 운영 노하우에서 차이가 난다.
[35:26–40:28] 자동 최적화 에이전트와 가치 포착 레이어의 이동

Sionic은 GPU 자원과 실험 환경을 에이전트에게 주고, 100개 안팎의 최적화 에이전트가 모델 구조·서빙 설정·하드웨어 배치를 탐색하도록 한다고 소개한다. Kimi 구조를 특정 인프라에 맞추는 작업을 약 15분 만에 반복했다는 사례도 나온다. 사람은 목표와 정성적 분석을 제공하고, 에이전트는 실험·측정·검증의 반복을 맡는다. 이 흐름에서는 모델 엔지니어와 시스템 엔지니어의 경계가 빠르게 흐려진다.
이런 자동화가 널리 퍼지면 모델 레이어의 차별화는 빠르게 상품화된다. 가치가 아래로는 GPU·전력·데이터센터로, 위로는 고객 데이터·업무 흐름·애플리케이션으로 이동한다. 출연자는 이를 전기 콘센트와 가전제품의 관계에 비유한다. 전기는 표준화되지만 어떤 기계와 서비스가 연결되는지가 사용자 가치를 결정한다.
[40:28–49:12] B300 경제성, 네트워크, 인프라를 조직 자산으로 보기
B300 한 장의 가격을 약 6만 달러로 잡고, 한국에서 8-GPU 노드와 네트워크를 구성하는 비용을 수억 원대로 추산한다. 클라우드에서 B300을 시간당 8~10달러 이상에 빌릴 수 있다고 가정하면, 100장 규모의 시설은 낮은 가동률에서도 감가상각과 토큰 매출의 관계를 계산할 수 있다. 영상의 어림셈은 가동률 5%에서 손익분기, 10%에서 약 2배 매출 가능성을 말하지만, 실제 결과는 전력·냉각·네트워크·고장·고객 믹스에 좌우된다.
인프라를 직접 소유하면 prefill 1개와 decode 2개를 직접 케이블로 연결해 고가의 스위치 구성을 줄이고, 유휴 GPU를 최적화 에이전트·학습·내부 업무에 돌릴 수 있다. 반대로 사업 가설을 빨리 검증해야 하는 팀에는 클라우드의 변동비가 더 적합하다. 이 대담의 결론은 “새로 시작한다면 GPU 투자를 진지하게 고려하라”에 가깝다.
GPU와 데이터센터가 인재를 끌어들이는 효과도 언급된다. 구성원이 에이전트를 어떻게 사용했는지, 어떤 문제를 어떤 순서로 풀었는지에 대한 실행 궤적이 조직의 자산이 된다. 단순한 문서보다 실제 업무를 재현할 수 있는 데이터가 Second Company 같은 시스템의 재료가 된다는 관점이다.
[49:12–58:46] 에이전트 조직의 control plane과 NVIDIA Dynamo
현재의 에이전트는 여전히 사람이 중요한 선택을 하고 결과를 확인해야 한다. 다음 단계는 에이전트들을 배치하고, 권한을 주고, 검증하고, 실패를 되돌리는 control plane이다. 이를 조직에 적용하려면 사람의 의도와 기계의 실행 사이에 계약이 필요하다.
- 사람은 목표, 시작 조건, 완료 조건, 허용된 자원과 검증 기준을 정의한다.
- 기계는 그 계약 안에서 검색·코딩·실험·보고·재시도를 수행한다.
- 결과는 또 다른 에이전트나 사람이 검증하고, 실패하면 이전 상태로 돌아간다.
NVIDIA Dynamo와 NIXL은 노드 사이에서 KV cache를 옮기고 GPU 자원에 직접 접근하는 인프라의 예로 소개된다. 논문이나 API 한 개보다 중요한 것은 실제 서비스에서 라우팅·캐시·네트워크·하드웨어를 하나의 실행계층으로 묶는 일이다. 에이전트가 기계적으로 검증할 수 있는 작업을 병렬로 수행하면 몇 주 걸리던 최적화가 몇 시간으로 줄어들 수 있다. 발표자는 AI를 컴파일러에 비유하며, 이제는 기업의 핵심 실행 경로 자체를 최적화할 시점이라고 본다.
[58:46–1:12:12] 고속 인퍼런스의 가격, 산업용 모델, 안정적인 에이전트

화면에는 2.8T 모델, p95 지연시간 2873ms에서 29.2ms로의 감소, 1962 tok/s 등의 최적화 사례값이 소개된다. 이 값은 영상 화면에 제시된 특정 환경의 사례이며 일반 API 성능으로 해석하면 안 된다. 핵심은 모든 사용자가 최고 TPS를 원하는 것은 아니라는 점이다. 일반 사용자는 값싼 지능을 원하지만, 보안·국방·금융처럼 밀리초가 수익과 직결되는 영역은 고속 인퍼런스에 프리미엄을 지불할 수 있다.
산업 현장에서는 거대한 범용 모델을 그대로 호출하는 대신, 도메인 데이터로 SFT를 하고 draft·궤적·검증용 모델을 따로 만들 수 있다. 이 경우 온프레미스 실행은 보안과 비용을 동시에 줄일 수 있다. 모델 품질만 비교하는 대신 한 작업을 몇 번 호출하고, 얼마의 KV cache와 전력을 쓰며, 사람이 얼마나 개입해야 하는지를 함께 계산해야 한다.

에이전트가 생성한 결과를 바로 믿는 대신, 빠른 인퍼런스를 활용해 여러 검증 루프를 돌리면 시스템을 안정화할 수 있다. 영상 후반의 Second Company 화면은 가상 조직의 브리핑과 업무 진행을 보여주며, 에이전트가 실제 조직의 반복 업무를 맡는 방향을 상징한다. 다음 질문은 “에이전트가 일을 할 수 있는가”가 아니라 “어떤 중요 업무를 완전히 위임할 수 있는가”다.
[1:12:12–1:33:12] 네트워크·컴퓨팅 자본·AI for Science·보안
컴퓨팅이 빨라져도 네트워크가 수백 GB에서 TB 단위의 상태를 옮기지 못하면 병목은 남는다. 데이터센터 장애가 발생했을 때 다른 시설로 즉시 넘기기 어려운 이유도 여기에 있다. 전력망과 냉각의 안정성, 광역 네트워크, 데이터 이동 비용은 GPU 수와 별개의 설계 변수다.
후반부는 인퍼런스 수요가 공급을 앞서는 자본 게임으로 확장된다. DeepSeek V4의 일일 토큰 사용량이 6T에서 7T, 8T로 증가했다는 설명과 함께, IDC·파운드리·ASML·HBM·전력망이 차례로 병목이 된다는 전망이 나온다. AI for Science와 AutoML에서는 에이전트가 실험을 자동으로 반복하는 Discovery Loop가 중요해지지만, 알려진 결과를 재현하는 것과 새로운 가설을 만드는 것은 아직 다르다. 장기 연구에 필요한 추론량이 커질수록 연구자보다 컴퓨팅 자본이 먼저 부족해질 수 있다.
사람의 역할은 사라진다기보다 의도를 정하고, 시작과 끝을 계약으로 정의하고, 결과를 검증하는 일로 압축된다. 반면 에이전트 해킹은 인간이 따라가기 어려운 속도로 취약점 탐색, 컨테이너 탈출, 네트워크 연결 시도, 사회공학적 행동을 수행할 수 있다. 권한·네트워크·검증 경계를 control plane에 포함하지 않으면 인퍼런스 속도 자체가 공격 속도가 된다.
핵심 개념 정리
- TPS: 초당 생성 토큰 수. 모델의 지능, 입력 길이, 배치, accept rate, 네트워크를 반영하지 않으므로 단독 비교 지표로 쓰기 어렵다.
- Prefill / Decode: 긴 입력을 병렬 처리하는 단계와 다음 토큰을 순차 생성하는 단계. 서로 다른 병목을 가지므로 분리 서빙이 유리하다.
- Speculative decoding: 작은 draft 모델의 제안을 큰 모델이 검증해 순차 생성 횟수를 줄이는 방식. accept rate가 실제 이득을 좌우한다.
- KV cache: 이미 처리한 컨텍스트의 어텐션 상태. 긴 컨텍스트·에이전트 세션에서는 크기가 커지므로 저장·재사용·노드 간 이동이 핵심 인프라가 된다.
- Token factory: 모델을 호출하는 API가 아니라 GPU·냉각·네트워크·서빙 소프트웨어를 결합해 토큰을 생산하는 운영 시스템.
- Agent contract: 사람이 의도와 시작·완료·검증 조건을 선언하고, 에이전트가 그 사이의 실행을 담당하도록 만드는 작업 경계.
실무 적용 메모
- 모델 도입 검토 시
tok/s대신 실제 업무 하나의 완료 시간, 실패율, 사람 개입 횟수, 총 토큰·전력 비용을 측정한다. - 긴 컨텍스트나 다중 에이전트 시스템은 prefill·decode 분리와 KV cache 이동을 초기 아키텍처에서 검토한다.
- 온프레미스 투자는 보안 요구뿐 아니라 충분한 가동률, 전력·냉각·네트워크 운영 역량, 유휴 GPU의 내부 활용 계획이 있을 때 정당화한다.
- 에이전트 자동화는 프롬프트보다 계약을 먼저 만든다. 허용된 도구, 데이터 범위, 완료 조건, 검증자, 실패 시 복구 경로를 명시한다.
- 고속 에이전트에는 속도에 맞는 검증 루프와 최소 권한 네트워크를 함께 둔다. 빠른 생성과 빠른 공격은 같은 인프라 위에서 일어난다.
인용 가능한 원문
- [00:05:19] “TPS는 초당 생성되는 토큰의 개수입니다.”
- [00:25:44] “Prefill은 포클레인이고, decode는 숟가락입니다.”
- [00:37:42] “가치가 포착되는 레이어가 지금 이동하고 있다.”
- [00:50:14] “Control plane을 어떻게 구현할 거냐.”
- [01:28:11] “시작과 끝을 정의하는 부분만 있고, 중간의 일은 전부 기계가.”
- [01:32:50] “인퍼런스, 인퍼런스, 인퍼런스.”