1. 왜 AI/LLM 보안인가 — 새 공격 표면이 등장했다
2022년 ChatGPT 등장 → 3년 만에 ① Samsung 소스코드 유출(2023.3 ChatGPT에 입력), ② OpenAI Redis 버그로 사용자 대화 노출(2023.3), ③ Microsoft AI 직원 38TB 노출(2023.9), ④ Anthropic·OpenAI Prompt Injection 다수 보고(2024), ⑤ Slack AI Prompt Injection으로 DM 추출(2024.8), ⑥ Air Canada 챗봇 환각 손해배상 판결(2024.2), ⑦ GitHub Copilot 라이선스 소송 진행 중.
AI는 SW의 6번째 공격 표면(Network·Application·Endpoint·Cloud·OT 다음). 기존 통제(OWASP Top 10·CWE·SAST)로 부족하고, 모델·데이터·프롬프트·임베딩·플러그인 단위 새 통제가 필요하다.
3대 표준 동시 출시:
- OWASP LLM Top 10 v2025(2025.1) — 10대 위험
- NIST AI 600-1(2024.7) — NIST AI RMF GenAI Profile
- ISO/IEC 42001:2023 — AI 경영시스템(인증 가능)
- MITRE ATLAS(2020~) — AI 공격 ATT&CK 매트릭스
- EU AI Act(2024.8 발효, 2026.8 완전 적용) — 위험 기반 분류·고위험 의무
- 한국 K-AI 가이드라인(2024.5 과기정통부) — NIST AI RMF 한국화
오해 1 — “ChatGPT 안 쓰면 우리는 안전.” Copilot·Slack AI·Notion AI·Salesforce Einstein·SAP Joule — AI는 이미 모든 SaaS에. 오해 2 — “AI 보안은 ML 엔지니어 일.” AppSec·CISO·Legal·HR·Procurement 모두 관여. 오해 3 — “외부 API만 막으면 끝.” RAG·Fine-tuning·임베딩 DB·플러그인이 더 큰 위험.
2. OWASP LLM Top 10 v2025 — 10대 위험
OWASP LLM Top 10(2023.8 v1.0 → 2025.1 v2025) — LLM 애플리케이션 위험.
| ID | 위험 | 핵심 |
|---|---|---|
| LLM01 | Prompt Injection | 직접·간접 프롬프트 주입 |
| LLM02 | Sensitive Information Disclosure | 학습 데이터·시스템 프롬프트·PII 유출 |
| LLM03 | Supply Chain | 모델·데이터셋·플러그인 신뢰 |
| LLM04 | Data and Model Poisoning | 학습·파인튜닝·임베딩 오염 |
| LLM05 | Improper Output Handling | 출력 미검증으로 XSS·SQLi·RCE |
| LLM06 | Excessive Agency | 과도한 도구·권한 부여 |
| LLM07 | System Prompt Leakage | 시스템 프롬프트 노출 |
| LLM08 | Vector and Embedding Weaknesses | RAG·임베딩 DB 공격 |
| LLM09 | Misinformation | 환각·잘못된 추론 |
| LLM10 | Unbounded Consumption | 비용·자원 고갈·DoS |
LLM01 Prompt Injection 상세:
- Direct: 사용자가 “이전 지시 무시하고 …” 입력
- Indirect: 웹페이지·문서·이메일·이미지에 숨겨진 지시
- Multi-modal: 이미지·오디오·동영상 내 명령
- 차단 100% 어려움 → 가드레일·권한 분리·인간 승인
LLM02 Sensitive Information:
- 학습 데이터 추출 공격(Carlini 2021)
- 시스템 프롬프트 유출
- 다른 사용자 대화·로그 노출
- API 키·자격증명 학습 포함
LLM03 Supply Chain:
- Hugging Face 모델 백도어(2024.2 100+ 악성 모델)
- 오염된 데이터셋(Common Crawl·Pile)
- 악성 어댑터·LoRA
- 플러그인·툴 신뢰
3. NIST AI 600-1 GenAI Profile (2024.7)
NIST AI 600-1 — NIST AI RMF(SP 1270)의 GenAI 적용 가이드(2024.7).
12 GenAI 고유 위험:
- CBRN Information: 화학·생물·방사선·핵 정보 생성
- Confabulation(환각): 거짓 정보 신뢰성 있게 생성
- Dangerous/Violent/Hateful Content: 위험·폭력·혐오 콘텐츠
- Data Privacy: 학습·추론 시 PII 유출
- Environmental: 학습·추론 탄소 배출
- Human-AI Configuration: 과도한 의존·오용
- Information Integrity: 미스인포·딥페이크·선거 영향
- Information Security: 사이버보안·취약점
- Intellectual Property: 저작권·상표·라이선스
- Obscene/Degrading/Abusive: 외설·성적 학대
- Toxicity/Bias/Homogenization: 독성·편견·동질화
- Value Chain: 공급망 위험
AI RMF 4 Functions GenAI 적용:
- Govern: AI 정책·R&R·위험 관리
- Map: 컨텍스트·이해관계자·영향
- Measure: 평가·테스트·메트릭
- Manage: 위험 우선순위·완화·모니터링
각 GenAI 위험에 4 Functions × 200+ 권장 활동 매핑.
4. MITRE ATLAS·EU AI Act·ISO 42001
MITRE ATLAS(Adversarial Threat Landscape for Artificial Intelligence Systems) — 2020~, AI 공격용 ATT&CK.
14 Tactics:
- Reconnaissance·Resource Development·Initial Access·ML Model Access·Execution·Persistence·Defense Evasion·Discovery·Collection·ML Attack Staging·Exfiltration·Impact ML·Lateral Movement·Privilege Escalation 등
대표 Techniques:
- AML.T0043 — Adversarial Examples
- AML.T0051 — LLM Prompt Injection (별도 추가)
- AML.T0019 — Train Proxy via Replication
- AML.T0024 — Exfiltration via ML Inference API
- AML.T0048 — Backdoor ML Model
EU AI Act(2024.8 발효):
| 분류 | 의무 |
|---|---|
| Unacceptable Risk | 금지(생체 감시·감정 추론 등) |
| High Risk | 의무 — 위험 관리·데이터 거버넌스·기록·인적 감독·정확성·견고성·사이버보안 |
| Limited Risk | 투명성(딥페이크 표시·챗봇 고지) |
| Minimal Risk | 자율 |
| GPAI(General Purpose AI) | 추가 의무(시스템 위험 모델은 더 엄격) |
발효 일정:
- 2024.8: 발효
- 2025.2: 금지 시스템·AI Literacy
- 2025.8: GPAI 의무
- 2026.8: 고위험 시스템 의무 적용
- 2027.8: 일부 고위험(부속서 III) 적용
ISO/IEC 42001:2023 — AI Management System(인증 가능):
- HLS 10 Clauses + 38 Controls + Annex A 부속
- ISO 27001·9001·14001과 통합 가능
- 한국 KFQ·DNV·BSI·LRQA 인증
5. Stage 1 — 자산·사용처·위험 진단 (1~2개월)
AI 자산 인벤토리:
- 사용 모델: OpenAI·Anthropic·Google·Azure OpenAI·Bedrock·Vertex·자체 학습 모델
- 사용처: 챗봇·요약·검색·코드 생성·이미지·의사결정·자동화
- 데이터 흐름: PII·기밀·소스코드·고객 데이터 → 모델 전달 여부
- 권한: AI가 호출할 수 있는 도구·API·DB·시스템
- 사용자: 직원·고객·외주
Shadow AI 발견:
- ChatGPT·Claude·Gemini·Perplexity 개인 사용
- 자체 GPT·Custom GPT·Gem·Anthropic Project
- 도구: Wing Security·Reco·Skyhigh CASB·Microsoft Defender for Cloud Apps
위험 진단:
- LLM Top 10 자가진단 매트릭스
- NIST AI 600-1 12 위험 평가
- EU AI Act 분류(고위험 여부)
- MITRE ATLAS TTPs 적용 가능성
AIBOM(AI Bill of Materials):
- 모델 출처·라이선스·학습 데이터
- 프롬프트·파라미터·파인튜닝
- 의존 라이브러리·플러그인
- CycloneDX v1.6 AI BOM 표준 지원
- Model Card(Google 2018) + Datasheet for Datasets(Gebru 2018) 통합
6. Stage 2 — 정책·거버넌스·교육 (2~3개월)
AI 사용 정책:
- 허용 사용: 일반 코딩·요약·번역
- 금지 사용: 영업비밀·고객 PII·소스코드·계약서·재무 정보
- 승인 필요: 외부 발표·의사결정·자동 액션
- 금지 모델: 미승인 SaaS·중국 모델(보안 정책 따라)·HKMA·EU 데이터 주권 영향
AI 거버넌스 체계:
- AI Council: CTO·CISO·CPO·CCO·CLO·CHRO·사업부장 — 분기 운영
- AI Risk Officer: 전담자 1명+
- AI Use Case Registry: 모든 AI 사용 등록·심사·승인
- AI Ethics Committee: 영향력 큰 사용 윤리 검토
역할 정의:
- Model Provider: OpenAI·Anthropic 등 (계약·SLA)
- AI System Integrator: 우리 회사 AppSec·MLOps
- AI Deployer: 사업부·운영
- AI End User: 직원·고객
교육:
- 전 직원 분기 AI 보안 교육
- 개발자 LLM Top 10 심화
- 임원·법무 EU AI Act·ISO 42001
- 영업·마케팅 — 프롬프트 위생·기밀 보호
한국 K-AI 가이드라인(2024.5 과기정통부) 매핑:
- 6 원칙(인간 존엄·안전·투명·책임·차별 금지·환경)
- 산업별 적용 사례
- 자율점검 도구
7. Stage 3 — 기술 통제·가드레일 (3~6개월)
프롬프트·입력 가드레일:
- 입력 정화: 프롬프트 인젝션 패턴 차단
- 입력 분리: 시스템 프롬프트·사용자·문서·도구 출력 명확히 구분(Delimiter·XML 태그)
- Few-shot Examples: 안전한 응답 사례
- Output 사전 검증: 차단 패턴
모델 가드레일:
- NeMo Guardrails(NVIDIA): Rails로 정책 정의
- Guardrails.ai: Validators·Rails
- Llama Guard(Meta): 안전성 분류기
- Azure Content Safety: 욕설·성적·자해·폭력
- AWS Bedrock Guardrails: PII 차단·주제 필터
- OpenAI Moderation API: 13 카테고리
Output 처리(LLM05):
- HTML·SQL·Shell 출력 시 컨텍스트 인코딩
- 절대 직접 eval·subprocess·DB 실행 X
- 인간 승인 게이트(Critical Action)
RAG·임베딩 보안(LLM08):
- 임베딩 DB(Pinecone·Weaviate·Qdrant·Chroma·Milvus) 접근통제
- 다중 테넌트 격리
- 임베딩 추출 공격 방어
- 문서 권한과 RAG 결과 권한 일치
툴·플러그인 권한(LLM06):
- 최소권한 — 읽기만·쓰기만 분리
- Critical Action(메일 발송·결제·삭제) 인간 승인 필수
- 세션 단위 권한·만료
- 감사 로그
비용·자원 통제(LLM10):
- Rate Limit(사용자·IP·API Key)
- Token Quota
- 최대 응답 시간
- 비정상 패턴 알람
모델 공급망(LLM03):
- 모델 출처 검증(Hugging Face 서명·해시)
- 학습 데이터셋 검증
- 모델 카드·라이선스 확인
- AIBOM 등록
민감 데이터(LLM02):
- 입력 PII 차단(Presidio·AWS Comprehend·Azure PII)
- 시스템 프롬프트 분리·인코딩
- DLP 통합(Microsoft Purview·Forcepoint·Symantec)
- 학습 시 PII 제거·익명화
8. Stage 4 — 모니터링·평가·Red Team (지속)
모니터링:
- 모든 프롬프트·응답 로깅(PII 마스킹)
- 비정상 패턴(Jailbreak·Prompt Injection 시도)
- 비용·토큰 사용 추적
- 도구: Helicone·Langfuse·Lakera·Robust Intelligence·Protect AI
평가(Eval):
- 정확성(Accuracy·Hallucination Rate)
- 안전성(Harmful Output Rate)
- 견고성(Robustness·Adversarial)
- 편견(Bias·Fairness)
- 도구: OpenAI Evals·RAGAS·TruLens·Promptfoo·lm-evaluation-harness·HELM
AI Red Team:
- 프롬프트 인젝션·Jailbreak·Data Extraction
- 도구: PyRIT(Microsoft 2024.2)·Garak(NVIDIA)·Promptfoo·Lakera
- 분기 1회+ 외부 AI Red Team(Robust Intelligence·HiddenLayer·Lakera·Trail of Bits)
- MITRE ATLAS TTPs 시나리오
LLM Pentest:
- OWASP LLM Top 10 매트릭스
- BAS-style 자동 시뮬레이션
- 결과 → 가드레일·시스템 프롬프트 튜닝
Compliance Mapping:
- EU AI Act 의무(고위험): 위험관리·데이터·기록·감독·정확성·견고성·사이버보안
- ISO/IEC 42001: 38 Controls 매핑
- NIST AI RMF: 4 Functions 활동
- GDPR Article 22(자동 의사결정), Article 35(DPIA)
9. Stage 5 — 운영·인증·고도화 (지속)
운영 KPI:
- AI 사용 등록률 100%
- 가드레일 통과율
- Prompt Injection 탐지·차단 수
- 비용·토큰 효율
- 인시던트 수·MTTR
- Eval 점수 추세
인증·감사:
- ISO/IEC 42001: AI 경영시스템 인증(3년)
- ISO/IEC 23894: AI 위험 관리(가이드)
- ISO/IEC 27001 + 42001 통합
- EU AI Act CE 마킹(고위험)
- NIST AI RMF 자가증명
- SOC 2 + AI Trust Service: 신규 추가
고도화:
- Confidential AI: NVIDIA H100 CC·Intel TDX·AMD SEV-SNP — 모델·데이터 격리
- Federated Learning: 분산 학습·원본 미공유
- Differential Privacy: 학습 데이터 익명화
- Homomorphic Encryption: 암호화 상태 추론
- AI Watermarking: 출력 콘텐츠 워터마크(C2PA)
- Provenance: 콘텐츠 출처 증명(C2PA Content Credentials)
Agentic AI 추가 위험(2025~):
- AutoGPT·LangGraph·CrewAI·Autonomous Agents
- 자율 의사결정·실행 → Excessive Agency 폭증
- 복합 도구 체인 — 각 단계 통제 필요
- OWASP Agentic Threat & Mitigations Guide(2025)
MCP(Model Context Protocol·Anthropic 2024.11):
- 표준 도구 연결 프로토콜
- 보안 모델: 권한·승인·감사
- 신뢰 경계 명시·관리
10. 비용·ROI
| 항목 | 비용 (연간) |
|---|---|
| AI 거버넌스·정책·교육 | 1천~3억 |
| 가드레일 도구(NeMo·Lakera·Robust) | 1~10억 |
| CASB·DLP AI 확장 | 1~5억 |
| AIBOM·등록 시스템 | 3천~3억 |
| 평가·Red Team(외부 분기) | 5천~5억 |
| 인력(AI Security 1~5명) | 2~25억 |
| ISO 42001 인증(첫해) | 5천~3억 |
| 합계 (중견 제조사) | 5~54억 |
ROI:
- AI 인시던트 1건 평균 손실(Samsung 케이스 보고서) 100억~수조 (영업비밀)
- 평판 손실(Air Canada형) 비계량
- EU AI Act 위반 — 매출 7% 또는 3,500만유로 中 大
- ISO 42001 인증 — RFP·신뢰
- 사이버보험 — AI 통제 시 10~15% 할인
- 직원 AI 생산성 +30%(제대로 도입 시)
11. 자가 점검
진단:
- AI 자산 인벤토리·Shadow AI 발견
- 사용처·데이터 흐름 매핑
- LLM Top 10·NIST 12위험·MITRE ATLAS 자가진단
- EU AI Act 분류
- AIBOM(CycloneDX v1.6) 생성
거버넌스:
- AI 사용 정책·CEO 승인
- AI Council 분기
- AI Risk Officer 지정
- Use Case Registry·승인 프로세스
- 전 직원 교육·개발자 심화
기술 통제:
- 입력 가드레일(Prompt Injection 차단)
- 출력 가드레일(NeMo·Guardrails.ai·Llama Guard)
- PII 입력 차단(Presidio·DLP)
- 시스템 프롬프트 분리·보호
- 툴·플러그인 최소권한·승인 게이트
- Rate Limit·Token Quota
- RAG 임베딩 권한
- 모델 공급망(서명·해시·라이선스)
모니터링·평가:
- 프롬프트·응답 로깅
- Eval 자동화(Promptfoo·TruLens·HELM)
- AI Red Team 분기(PyRIT·Garak)
- 인시던트 IR Playbook(LLM 특화)
- MITRE ATLAS 적용범위
인증·미래:
- ISO/IEC 42001 인증 또는 로드맵
- EU AI Act 고위험 의무 매핑
- NIST AI RMF 자가증명
- Confidential AI 검토
- C2PA·Watermarking
- Agentic AI·MCP 보안 검토
12. 마무리 — AI는 새 SW 공급망이다
AI/LLM 보안은 ① 자산·사용처·위험 진단, ② 정책·거버넌스·교육, ③ 기술 통제·가드레일, ④ 모니터링·평가·Red Team, ⑤ 운영·인증·고도화 — 5단계로 정착시킨다. 기존 AppSec 통제로 부족하고, 모델·프롬프트·임베딩·툴·공급망 단위 새 통제가 필요하다. 2026년 EU AI Act 고위험 의무 + ISO/IEC 42001 인증 흐름 + Agentic AI 폭증으로 지금 시작이 마지막 골든타임이다.
통합 사이클
- NIST PQC·FIPS 140-3
- Penetration Testing·Red Team
- CTI 위협 인텔리전스 MISP·STIX
- 침해사고 대응 NIST SP 800-61
- BCP·DRP·ISO 22301
- DevSecOps Shift-Left CI/CD
- Threat Modeling STRIDE·PASTA·LINDDUN
- CWE·CVSS·EPSS·KEV
- FIDO2·WebAuthn·Passkey
- SLSA·OpenSSF·Sigstore
- NIST SSDF SP 800-218
- Zero Trust Architecture
- OWASP Top 10·ASVS·SAMM
- ISO 27001 인증
- 한국 ISMS-P
- NIST CSF 2.0
- NIST AI RMF
- EU AI Act
- EU NIS2
- EU CRA
- ISO/IEC 42001 AI Management
- HITRUST CSF
- MITRE ATT&CK
