출처
- source_url: https://discuss.pytorch.kr/t/deepteam-llm-ai/11161
- author: 9bow
- published: Thu, 09 Jul 2026 07:30:09 +0000
- raw: raw source:
web-2026-07-09-pytorchkr-topic-11161-deepteam-llm-agent-red-teaming-framework
개요
DeepTeam은 LLM 애플리케이션과 AI 에이전트를 대상으로 탈옥, 프롬프트 주입, 멀티턴 공격 등을 시뮬레이션하는 오픈소스 레드팀 프레임워크다. 침투 테스트의 대상을 LLM 시스템으로 확장한 도구에 가깝고, 챗봇, RAG 파이프라인, AI 에이전트의 편향, 개인정보 유출, SQL 인젝션 같은 취약점을 사전에 드러내는 데 초점을 둔다. DeepEval 위에 구축되어 있으며 로컬 머신에서 실행되고, 사용자는 테스트 대상 애플리케이션을 감싸는 model_callback 함수를 제공하면 된다. 취약점 탐지뿐 아니라 프로덕션에서 입력과 출력을 검사하는 가드레일도 함께 제공한다. Apache-2.0 라이선스로 공개되어 개인 및 상업적 용도로 사용할 수 있다.
핵심 포인트
-
DeepTeam은 LLM과 AI 에이전트용 오픈소스 레드팀 프레임워크로, 배포 전 악의적 사용자가 시도할 법한 공격을 미리 테스트하는 데 사용된다.
-
지원 취약점은 50가지 이상이며, 데이터 프라이버시, 책임 있는 AI, 보안, 안전, 비즈니스, 에이전트 특화 항목으로 분류된다.
-
공격 기법은 20가지 이상이며, 단일 턴 프롬프트 주입, 롤플레이, 인코딩 우회뿐 아니라 선형 탈옥, 트리 탈옥, Crescendo 탈옥 같은 멀티턴 공격도 포함한다.
-
OWASP Top 10 for LLMs 2025, OWASP Top 10 for Agents 2026, NIST AI RMF, MITRE ATLAS 등 기존 안전·보안 프레임워크를 선택하면 관련 취약점과 공격으로 자동 매핑할 수 있다.
-
레드팀 실행에는 사전 데이터셋이 필요하지 않으며, DeepTeam이 지정된 취약점에 맞춰 적대적 입력을 동적으로 생성하고 model_callback의 응답을 평가한다.
-
평가 결과는 LLM-as-a-Judge 방식으로 로컬에서 통과/실패 이진 점수로 판정되며, 최종 통과율은 통과 응답 비율로 계산된다.
-
프로덕션 방어용으로 ToxicityGuard, PromptInjectionGuard, PrivacyGuard, IllegalGuard, HallucinationGuard, TopicalGuard, CybersecurityGuard 등 7가지 가드레일을 제공한다.
왜 중요한지
LLM 애플리케이션은 일반적인 소프트웨어 취약점뿐 아니라 프롬프트 주입, 탈옥, 민감정보 유출, 에이전트 권한 오남용처럼 모델·에이전트 특유의 위험을 가진다. DeepTeam은 이런 위험을 수동 점검이나 정적 체크리스트에만 의존하지 않고, 실제 공격 시나리오에 가까운 입력을 생성해 실행 전 검증할 수 있게 한다. 특히 RAG, 챗봇, 에이전트처럼 외부 입력과 도구 사용이 결합된 시스템에서는 배포 전 레드팀 테스트와 배포 후 가드레일을 함께 적용하는 흐름이 중요해지고 있다. OWASP, NIST, MITRE 같은 표준 프레임워크와 연결된다는 점도 조직 내 보안 검토나 컴플라이언스 논의에 활용하기 쉽다.
후속으로 볼 링크 / 키워드
원문
공식 자료
- DeepTeam 공식 홈페이지: https://www.trydeepteam.com
- DeepTeam 문서: https://www.trydeepteam.com/docs
- DeepTeam GitHub 저장소: https://github.com/confident-ai/deepteam
- DeepEval GitHub 저장소: https://github.com/confident-ai/deepeval
관련 키워드
- LLM red teaming
- AI agent security
- prompt injection
- jailbreaking
- multi-turn attack
- LLM-as-a-Judge
- RAG security
- guardrails
- OWASP Top 10 for LLMs
- OWASP Top 10 for Agents
- NIST AI RMF
- MITRE ATLAS
원문 보존 위치
원문 전체는 raw source: web-2026-07-09-pytorchkr-topic-11161-deepteam-llm-agent-red-teaming-framework에 source_url 및 HTML 원문과 함께 저장되어 있습니다.