1. 왜 AI Red Team이 2025 새 보안 표준인가
Microsoft AI Red Team 2024 보고서: 100+ GenAI 시스템 평가·평균 8개 이상 신규 취약점 발견·평균 결함 — Jailbreak·Prompt Injection·Data Extraction. Anthropic Constitutional AI 2024: Red Team 운영 — 안전성 +60%·평가 가능성 +40%. Gartner 2024: 2027년까지 75% 기업이 AI Red Team 정착.
전통 Red Team — Network·Endpoint·Web 중심. AI Red Team — 모델·프롬프트·임베딩·도구·Agent 전 영역. AI 공격 — 수학적·심리적·다중 모달리티 — 새 tradecraft 필수.
산업 표준화:
- DEF CON Generative AI Red Team(2023~): 매년 8월·2,000+ 참가
- DARPA AI Cyber Challenge(2024~2025·$30M): 자율 AI 사이버
- NIST AI 100-2 Adversarial ML(2024.1·블로그 MLSecOps)
- OWASP LLM Top 10·Agentic Top 10(블로그 LLM·Agent)
- MITRE ATLAS(블로그 LLM): AI 공격 ATT&CK
- OpenAI Preparedness Framework(2023.12)
- Anthropic Responsible Scaling Policy(2023.9)
- Microsoft AI Red Team Framework(2024)
대표 사고·발견:
- Hong Kong CFO Deepfake(2024.2·블로그 Deepfake): $25M
- Slack AI Prompt Injection(2024.8·블로그 AI Agent)
- Microsoft Copilot Prompt Injection(2024~)
- ChatGPT Jailbreak(다수): DAN·Grandma·Roleplay
- Anthropic Computer Use Demo(2024.10): 의도 외 클릭
- Samsung ChatGPT(2023.3·블로그 LLM): 영업비밀 유출
오해 1 — “AI Red Team = LLM Jailbreak.” Jailbreak·Prompt Injection·Data Extraction·Model Inversion·Backdoor·Tool Abuse·Multi-modal·Multi-agent 모두. 오해 2 — “AI Vendor가 책임.” Microsoft·OpenAI·Anthropic — 자체 운영 책임 강조. 오해 3 — “도구 사면 끝.” 인력·프로세스·지속·이사회 합의가 본질.
압박:
- EU AI Act(2024.8·블로그 별도): 고위험·GPAI Red Team 의무
- EU AI Act Article 56: GPAI 모델 — Adversarial Testing 의무
- US EO 14110(2023.10·EO 14179 2025.1 폐지): AI Red Team
- NIST AI 100-2·600-1·SP 800-218A(블로그 MLSecOps)
- ISO/IEC 42001(블로그 LLM)
- OWASP LLM·Agentic·ML Top 10
- MITRE ATLAS
- 한국 K-AI 가이드라인·금융위 AI Red Team 권고
2. AI Red Team Methodology
AI Red Team Lifecycle(Microsoft AI Red Team 2024):
- Plan: 시나리오·목표·범위
- Probe: 자동 + 수동 공격
- Persist: 발견 — 통제 우회 시도
- Persist & Pivot: 확장·Multi-step
- Report·Mitigate: 보고·대응
OWASP AI Security Testing Guide(2024·v0.1):
- 60+ 테스트 카테고리
- LLM·ML·Agent 통합
Attack Categories:
| 카테고리 | 핵심 |
|---|---|
| Jailbreak | 안전 정책 우회 |
| Prompt Injection | 직접·간접·다중 모달리티 |
| Data Extraction | 학습 데이터 추출 |
| Model Inversion | 입력 재구성 |
| Membership Inference | 학습 데이터 포함 추론 |
| Backdoor Detection | 모델 백도어 탐지 |
| Tool Abuse(블로그 AI Agent) | Agent 도구 남용 |
| Multi-modal | 이미지·오디오·동영상 |
| Multi-agent | Rogue Agent·Cascade |
| Output Manipulation | 결과 조작 |
| System Prompt Leakage | 시스템 프롬프트 추출 |
| Cost·Resource Overload | 비용 폭증 |
Jailbreak Techniques(Microsoft AI Red Team 2024):
- Role-play·Persona(DAN·Grandma)
- Multi-turn(점진 침투)
- Encoding(Base64·Unicode)
- Cipher(암호화 입력)
- Multi-modal(이미지·QR)
- Translation(언어 우회)
- Continuation(완성 유도)
- Crescendo(점진 압박·Microsoft 2024)
Prompt Injection Variants:
- Direct: 사용자 입력
- Indirect: 웹·문서·이메일 — 가장 위험
- Multi-modal: 이미지 내 명령
- Tool Output: 도구 결과 내 명령
- Chained: 다단계 결합
3. Tools·Frameworks
Open Source Tools:
| 도구 | 강점 |
|---|---|
| PyRIT(Microsoft 2024.2·OSS) | Python·Agentic·Multi-turn·시장 점유 1위 |
| Garak(NVIDIA·OSS) | Probe·자동 |
| Promptfoo(YC 2023·OSS) | Eval·Red Team·CI/CD |
| LLM-Guard(Protect AI·OSS) | Guardrails + Red Team |
| Vigil(deadbits·OSS) | LLM 보안 |
| Rebuff(ProtectAI·OSS) | Prompt Injection |
| OpenAI Evals(OSS) | 표준 평가 |
| lm-evaluation-harness(EleutherAI·OSS) | LLM 평가 |
| HELM(Stanford·OSS) | 종합 평가 |
상용 Platforms:
| 솔루션 | 강점 |
|---|---|
| Lakera AI(Red·Guard·Chrome) | 종합·EU |
| Robust Intelligence(Cisco 2024.8) | 평가·Red Team |
| HiddenLayer Model Scanner·AI Red Team | 모델·플랫폼 |
| Protect AI | 종합·NB Defense·ModelScan(블로그 MLSecOps) |
| Microsoft Counterfit(2021~) | Adversarial ML·Microsoft Security Copilot 통합 |
| CrowdStrike Charlotte AI(블로그 SOC) | AI Security |
| Mindgard | Multi-modal Red Team |
| CalypsoAI·Cranium·TrojAI | 종합 |
| PromptArmor | Prompt Injection 차단 |
Agentic AI Red Team(블로그 AI Agent):
- PyRIT Agentic(2024.10): Multi-agent 시나리오
- Promptfoo Agentic·Garak Agent
- Lakera Red Agent
4. Stage 1 — Scoping·범위·정책 (1~3개월)
Scoping:
- 대상 AI 시스템(LLM·Agent·ML·RAG)
- 사용처(고객·임직원·운영)
- 위협 모델·NIST AI 100-2·OWASP LLM/Agentic Top 10
- Risk·Tier 분류
Engagement Rules(블로그 Pentest):
- 합법·윤리·Safe Harbor
- 비파괴·정보 보호
- 일정·자원·예산
- 결과 보고 형식
거버넌스:
- AI Red Team Lead·CISO·CAIO
- 분기 위원회: 보안·연구·법무·임원
- 이사회 보고
팀 구성:
- 자체 Red Team(2~5명): AI·보안 통합
- 외부 컨설팅: Trail of Bits·SpecterOps·HackerOne·Microsoft·Lakera·Robust Intelligence
- Bug Bounty(블로그 별도): HackerOne AI·Bugcrowd AI
도구 결정:
- 시작: PyRIT·Garak·Promptfoo(OSS·무료)
- 성장: Lakera Red·Robust Intelligence·HiddenLayer
- 엔터프라이즈: Microsoft AI Red Team·Mandiant·CrowdStrike
5. Stage 2 — Probing·자동 + 수동 (3~6개월)
자동 Probing:
- Garak: 다중 Probe·자동 실행
- PyRIT: 시나리오 기반·점진
- Promptfoo: CI/CD 통합·정기
Jailbreak Testing:
- 알려진 Jailbreak — Microsoft·Anthropic 공개 카탈로그
- Role-play·Multi-turn·Encoding·Cipher·Multi-modal·Crescendo
- DEF CON Generative AI Red Team 시나리오
Prompt Injection:
- Direct·Indirect·Multi-modal·Tool Output·Chained
- 도구: PyRIT·Promptfoo·Garak·Rebuff
Data Extraction·Model Inversion:
- Training Data Extraction(Carlini 2021)
- Membership Inference
- System Prompt Leakage
- 도구: PyRIT·자체
Multi-modal Testing:
- 이미지·오디오·동영상·QR
- 도구: PyRIT Multi-modal·Mindgard
Tool Abuse(Agentic·블로그 AI Agent):
- 도구 호출 — 의도 외
- Privilege Escalation
- 도구: PyRIT Agentic·Promptfoo Agentic
Multi-step·Multi-agent:
- 점진·체인 공격
- Rogue Agent·Cascade
- 도구: PyRIT·자체
6. Stage 3 — Validation·Bypass (지속)
Guardrails Bypass:
- NeMo Guardrails·Guardrails.ai·Llama Guard(블로그 LLM)
- AWS Bedrock Guardrails·Azure Content Safety
- 우회 — Crescendo·Multi-modal·Encoding
Output Filtering Bypass:
- 차단 패턴 우회
- 정상 응답 형식·악성 내용
- 다국어·역방향·Encoding
Sandbox·Isolation 검증(블로그 AI Agent):
- E2B·Docker·gVisor 우회
- 권한 상승·Escape
Rate Limit·Quota Bypass:
- 비용 폭증
- Resource Exhaustion
- Tool Loop
Continuous Validation:
- 매일·매주 자동
- 신규 Jailbreak·Injection 자동 통합
- CI/CD 통합·CTEM(블로그 별도)
Bug Bounty AI Track(블로그 Bug Bounty):
- HackerOne AI·Bugcrowd AI
- OpenAI·Anthropic·Google Bug Bounty
- 한국 — 자체·플랫폼
7. Stage 4 — Report·Mitigate·운영 (지속)
Reporting:
- Executive Summary: 임원·이사회
- Technical Detail: 보안·개발
- MITRE ATLAS 매핑·OWASP LLM Top 10
- CVSS·DREAD 정량
- Mitigation 권고
Mitigation Categories:
- Input Guardrails(블로그 LLM·AI Agent)
- Output Sanitization
- System Prompt 강화
- Tool Permission(Tier 1~4)
- HITL(Critical Action 의무)
- Monitoring·Anomaly Detection
Workflow Integration:
- Jira·ServiceNow·Linear
- SLA — Critical 7일·High 30일
- Detection-as-Code·CI/CD(블로그 OSINT)
Cross-functional:
- 보안·AI 연구·개발·법무·임원
- 분기 회의·매월 데이터
KPI:
- Coverage(MITRE ATLAS·OWASP)
- Mean Time to Detect·Mitigate
- 발견·시정 비율
- Continuous Improvement
Continuous AI Red Team:
- 매일 자동·매주 수동·분기 외부
- 도구: Promptfoo CI·Lakera Continuous·Microsoft Counterfit
- BAS for AI(블로그 OSINT)
8. Stage 5 — 고도화·DEF CON·DARPA (지속)
DEF CON Generative AI Red Team:
- 매년 8월 Las Vegas
- 2023 첫·2,000+ 참가
- White House·OpenAI·Microsoft·Anthropic·Hugging Face·NVIDIA 후원
- K-AI Red Team 참가 권장
DARPA AI Cyber Challenge(AIxCC):
- 2024.8 Semifinals·2025.8 Finals
- $30M·자율 AI 사이버
- Anthropic·Google·Microsoft·OpenAI 협력
Microsoft AI Red Team:
- 2019~ 운영·100+ GenAI 시스템
- PyRIT 오픈소스화
- AI Red Team Framework
OpenAI Preparedness:
- 2023.12 Framework
- Catastrophic Risk
- Red Team 의무
Anthropic Responsible Scaling:
- 2023.9 Policy
- AI Safety Levels(ASL)
- Constitutional AI
Google·DeepMind Red Team:
- Gemini·Vertex AI
- Sec-Gemini
한국 K-AI Red Team:
- KISA·과기정통부·금융위
- KAIST·POSTECH·국정원
- K-기업 — 삼성·SK·LG·네이버·카카오·KT
고도화 트렌드:
- Continuous AI Red Team: 매일·자동
- Multi-agent Red Team: 자율 Red Team
- Multi-modal Red Team: 통합
- Adversarial AI for Defense: AI vs AI
- K-AI Red Team 글로벌 인증: K-표준
컴플라이언스 매핑:
- EU AI Act Article 56(GPAI Red Team)·블로그 별도
- NIST AI RMF·600-1·100-2·SP 800-218A(블로그 MLSecOps)
- ISO/IEC 42001·23894·24028
- OWASP LLM·Agentic·ML Top 10·MITRE ATLAS
- 한국 K-AI 가이드라인·금융위 AI Red Team
9. 비용·ROI
| 항목 | 비용 (연간) |
|---|---|
| OSS(PyRIT·Garak·Promptfoo·LLM-Guard) | 0 + 인력 |
| 상용 AI Red Team(Lakera·Robust Intelligence·HiddenLayer·Mindgard) | 1~30억 |
| Microsoft Counterfit·CrowdStrike Charlotte AI | 1~10억 |
| Bug Bounty AI(HackerOne·Bugcrowd) | 1~10억 |
| 외부 컨설팅(Trail of Bits·Microsoft·Lakera) | 3천~10억 |
| 인력(AI Red Team 2~5명) | 4~25억 |
| DEF CON·DARPA·산학협력 | 1천~3억 |
| 합계 (중견 K-기업) | 8~89억 |
ROI:
- 홍콩 CFO Deepfake $25M(340억) 형 사고 회피
- Samsung ChatGPT 형 영업비밀 노출 회피
- EU AI Act Article 56 — 미준수 시 매출 7% 또는 €35M
- 사이버보험 — AI Red Team 운영 시 10~15% 할인
- K-AI 글로벌 신뢰
- 직원 AI 생산성·안전 +30%
10. 자가 점검
Scoping:
- 대상 AI 시스템(LLM·Agent·ML·RAG)
- NIST AI 100-2·OWASP LLM/Agentic Top 10·MITRE ATLAS
- Engagement Rules·Safe Harbor
- AI Red Team Lead·CISO·CAIO·분기 위원회·이사회
- 자체 + 외부 + Bug Bounty
- OSS(PyRIT·Garak·Promptfoo) + 상용 + 엔터프라이즈
Probing:
- 자동 Probing(Garak·PyRIT·Promptfoo CI/CD)
- Jailbreak(Role-play·Multi-turn·Crescendo·Encoding·Multi-modal)
- Prompt Injection(Direct·Indirect·Multi-modal·Tool Output)
- Data Extraction·Model Inversion·Membership Inference·System Prompt Leakage
- Multi-modal(이미지·오디오·QR)
- Tool Abuse·Multi-step·Multi-agent(PyRIT Agentic)
Validation·Bypass:
- Guardrails Bypass(NeMo·Guardrails.ai·Llama Guard·Bedrock·Azure Content Safety)
- Output Filtering·Sandbox·Rate Limit
- Continuous Validation·CI/CD
- Bug Bounty AI(HackerOne·Bugcrowd·OpenAI·Anthropic·Google)
Report·Mitigate·운영:
- MITRE ATLAS·OWASP·CVSS 보고
- Mitigation(Guardrails·System Prompt·Tool Permission·HITL·Monitoring)
- Workflow·SLA·Detection-as-Code
- Cross-functional·KPI
- Continuous AI Red Team(매일·매주·분기)
고도화·미래:
- DEF CON Generative AI Red Team 참가
- DARPA AIxCC 추적
- Microsoft·OpenAI·Anthropic·Google Framework 매핑
- 한국 K-AI Red Team·KISA·금융위
- Continuous·Multi-agent·Multi-modal·AI vs AI
- EU AI Act·NIST AI RMF·ISO 42001·OWASP·MITRE ATLAS 매핑
11. 마무리 — AI 시대의 새 보안 표준
AI Red Team·Adversarial Testing·PyRIT·Garak·Promptfoo는 ① Scoping·범위·정책, ② Probing·자동 + 수동, ③ Validation·Bypass, ④ Report·Mitigate·운영, ⑤ 고도화·DEF CON·DARPA — 5단계로 정착시킨다. Microsoft 100+ GenAI 시스템·평균 8개 신규 취약점·Anthropic Constitutional 안전 +60%·DEF CON 2,000+ 참가·DARPA AIxCC $30M이 가르치는 진실: AI Red Team은 AI 시대의 새 보안 표준이다. PyRIT + Garak + Promptfoo + Lakera Red + Microsoft Counterfit + Bug Bounty AI + DEF CON의 통합 운영체가 2025년 표준이고, Continuous·Multi-agent·Multi-modal·AI vs AI·K-AI Red Team 글로벌이 2030년 도전이다.
통합 사이클
- EU CER·CISA 16 Sectors·정보통신기반보호법
- Higher Education·University Cybersecurity
- CTEM·Continuous Threat Exposure Mgmt
- Quantum Networking·QKD·Quantum Internet
- Cryptocurrency Forensics·Chainalysis·OFAC
- MLSecOps·ML Pipeline Security
- Sports·Olympics·Mega Events Cybersecurity
- Smart City Cybersecurity·ENISA·K-스마트시티
- Election Security·Disinformation Defense
- Cybersecurity Tool Consolidation·Vendor Rationalization
- MITRE D3FEND·Detection Engineering
- Deception Technology·Honeypot·MITRE Engage
- Tabletop Exercise·Crisis Simulation
- AI Agent·Agentic AI·MCP
- Deepfake·AI 사기·Synthetic Media
- AI/LLM 보안 OWASP LLM Top 10
- OSINT·Threat Hunting·Purple Team
- Penetration Testing·Red Team
- Bug Bounty·VDP·Responsible Disclosure
- Threat Modeling STRIDE·PASTA·LINDDUN
- CTI 위협 인텔리전스 MISP·STIX
- CWE·CVSS·EPSS·KEV
- DevSecOps Shift-Left CI/CD
- SLSA·OpenSSF·Sigstore
- NIST SSDF SP 800-218
- Privacy Engineering·PETs
- CISO·Security Program·CSMA
- CRQ·Cyber Risk Quantification·FAIR
- GRC 통합·NIST RMF·CCM
- Cybersecurity Workforce·NICE Framework
- ISO 27001 인증
- 한국 ISMS-P
- NIST CSF 2.0
- NIST AI RMF
- EU NIS2
- EU CRA
- EU AI Act
- ISO/IEC 42001 AI Management
- MITRE ATT&CK
