제조업 AI/LLM 보안(OWASP LLM Top 10·NIST AI 600-1·ISO/IEC 42001) 실무 완벽 가이드 — Prompt Injection에서 신뢰 가능 AI 운영까지 5단계 로드맵

중소·중견 한국 제조사가 OWASP LLM Top 10:2025·NIST AI 600-1 GenAI Profile·ISO/IEC 42001 AI 보안 체계를 진단·설계·가드레일·운영·고도화까지 진짜 무사히 정착시키는 5단계 로드맵. LLM01 Prompt Injection·LLM02 Sensitive Info Disclosure·LLM03 Supply Chain· LLM04 Data/Model Poisoning·LLM05 Improper Output Handling·LLM06 Excessive Agency·LLM07 System Prompt Leakage· LLM08 Vector/Embedding·LLM09 Misinformation·LLM10 Unbounded Consumption, NIST AI RMF GenAI Profile, EU AI Act, MITRE ATLAS, AIBOM 실무.

1. 왜 AI/LLM 보안인가 — 새 공격 표면이 등장했다

2022년 ChatGPT 등장 → 3년 만에 ① Samsung 소스코드 유출(2023.3 ChatGPT에 입력), ② OpenAI Redis 버그로 사용자 대화 노출(2023.3), ③ Microsoft AI 직원 38TB 노출(2023.9), ④ Anthropic·OpenAI Prompt Injection 다수 보고(2024), ⑤ Slack AI Prompt Injection으로 DM 추출(2024.8), ⑥ Air Canada 챗봇 환각 손해배상 판결(2024.2), ⑦ GitHub Copilot 라이선스 소송 진행 중.

AI는 SW의 6번째 공격 표면(Network·Application·Endpoint·Cloud·OT 다음). 기존 통제(OWASP Top 10·CWE·SAST)로 부족하고, 모델·데이터·프롬프트·임베딩·플러그인 단위 새 통제가 필요하다.

3대 표준 동시 출시:

  • OWASP LLM Top 10 v2025(2025.1) — 10대 위험
  • NIST AI 600-1(2024.7) — NIST AI RMF GenAI Profile
  • ISO/IEC 42001:2023 — AI 경영시스템(인증 가능)
  • MITRE ATLAS(2020~) — AI 공격 ATT&CK 매트릭스
  • EU AI Act(2024.8 발효, 2026.8 완전 적용) — 위험 기반 분류·고위험 의무
  • 한국 K-AI 가이드라인(2024.5 과기정통부) — NIST AI RMF 한국화

오해 1 — “ChatGPT 안 쓰면 우리는 안전.” Copilot·Slack AI·Notion AI·Salesforce Einstein·SAP Joule — AI는 이미 모든 SaaS에. 오해 2 — “AI 보안은 ML 엔지니어 일.” AppSec·CISO·Legal·HR·Procurement 모두 관여. 오해 3 — “외부 API만 막으면 끝.” RAG·Fine-tuning·임베딩 DB·플러그인이 더 큰 위험.

2. OWASP LLM Top 10 v2025 — 10대 위험

OWASP LLM Top 10(2023.8 v1.0 → 2025.1 v2025) — LLM 애플리케이션 위험.

ID위험핵심
LLM01Prompt Injection직접·간접 프롬프트 주입
LLM02Sensitive Information Disclosure학습 데이터·시스템 프롬프트·PII 유출
LLM03Supply Chain모델·데이터셋·플러그인 신뢰
LLM04Data and Model Poisoning학습·파인튜닝·임베딩 오염
LLM05Improper Output Handling출력 미검증으로 XSS·SQLi·RCE
LLM06Excessive Agency과도한 도구·권한 부여
LLM07System Prompt Leakage시스템 프롬프트 노출
LLM08Vector and Embedding WeaknessesRAG·임베딩 DB 공격
LLM09Misinformation환각·잘못된 추론
LLM10Unbounded Consumption비용·자원 고갈·DoS

LLM01 Prompt Injection 상세:

  • Direct: 사용자가 “이전 지시 무시하고 …” 입력
  • Indirect: 웹페이지·문서·이메일·이미지에 숨겨진 지시
  • Multi-modal: 이미지·오디오·동영상 내 명령
  • 차단 100% 어려움 → 가드레일·권한 분리·인간 승인

LLM02 Sensitive Information:

  • 학습 데이터 추출 공격(Carlini 2021)
  • 시스템 프롬프트 유출
  • 다른 사용자 대화·로그 노출
  • API 키·자격증명 학습 포함

LLM03 Supply Chain:

  • Hugging Face 모델 백도어(2024.2 100+ 악성 모델)
  • 오염된 데이터셋(Common Crawl·Pile)
  • 악성 어댑터·LoRA
  • 플러그인·툴 신뢰

3. NIST AI 600-1 GenAI Profile (2024.7)

NIST AI 600-1 — NIST AI RMF(SP 1270)의 GenAI 적용 가이드(2024.7).

12 GenAI 고유 위험:

  1. CBRN Information: 화학·생물·방사선·핵 정보 생성
  2. Confabulation(환각): 거짓 정보 신뢰성 있게 생성
  3. Dangerous/Violent/Hateful Content: 위험·폭력·혐오 콘텐츠
  4. Data Privacy: 학습·추론 시 PII 유출
  5. Environmental: 학습·추론 탄소 배출
  6. Human-AI Configuration: 과도한 의존·오용
  7. Information Integrity: 미스인포·딥페이크·선거 영향
  8. Information Security: 사이버보안·취약점
  9. Intellectual Property: 저작권·상표·라이선스
  10. Obscene/Degrading/Abusive: 외설·성적 학대
  11. Toxicity/Bias/Homogenization: 독성·편견·동질화
  12. Value Chain: 공급망 위험

AI RMF 4 Functions GenAI 적용:

  • Govern: AI 정책·R&R·위험 관리
  • Map: 컨텍스트·이해관계자·영향
  • Measure: 평가·테스트·메트릭
  • Manage: 위험 우선순위·완화·모니터링

각 GenAI 위험에 4 Functions × 200+ 권장 활동 매핑.

4. MITRE ATLAS·EU AI Act·ISO 42001

MITRE ATLAS(Adversarial Threat Landscape for Artificial Intelligence Systems) — 2020~, AI 공격용 ATT&CK.

14 Tactics:

  • Reconnaissance·Resource Development·Initial Access·ML Model Access·Execution·Persistence·Defense Evasion·Discovery·Collection·ML Attack Staging·Exfiltration·Impact ML·Lateral Movement·Privilege Escalation 등

대표 Techniques:

  • AML.T0043 — Adversarial Examples
  • AML.T0051 — LLM Prompt Injection (별도 추가)
  • AML.T0019 — Train Proxy via Replication
  • AML.T0024 — Exfiltration via ML Inference API
  • AML.T0048 — Backdoor ML Model

EU AI Act(2024.8 발효):

분류의무
Unacceptable Risk금지(생체 감시·감정 추론 등)
High Risk의무 — 위험 관리·데이터 거버넌스·기록·인적 감독·정확성·견고성·사이버보안
Limited Risk투명성(딥페이크 표시·챗봇 고지)
Minimal Risk자율
GPAI(General Purpose AI)추가 의무(시스템 위험 모델은 더 엄격)

발효 일정:

  • 2024.8: 발효
  • 2025.2: 금지 시스템·AI Literacy
  • 2025.8: GPAI 의무
  • 2026.8: 고위험 시스템 의무 적용
  • 2027.8: 일부 고위험(부속서 III) 적용

ISO/IEC 42001:2023 — AI Management System(인증 가능):

  • HLS 10 Clauses + 38 Controls + Annex A 부속
  • ISO 27001·9001·14001과 통합 가능
  • 한국 KFQ·DNV·BSI·LRQA 인증

5. Stage 1 — 자산·사용처·위험 진단 (1~2개월)

AI 자산 인벤토리:

  • 사용 모델: OpenAI·Anthropic·Google·Azure OpenAI·Bedrock·Vertex·자체 학습 모델
  • 사용처: 챗봇·요약·검색·코드 생성·이미지·의사결정·자동화
  • 데이터 흐름: PII·기밀·소스코드·고객 데이터 → 모델 전달 여부
  • 권한: AI가 호출할 수 있는 도구·API·DB·시스템
  • 사용자: 직원·고객·외주

Shadow AI 발견:

  • ChatGPT·Claude·Gemini·Perplexity 개인 사용
  • 자체 GPT·Custom GPT·Gem·Anthropic Project
  • 도구: Wing Security·Reco·Skyhigh CASB·Microsoft Defender for Cloud Apps

위험 진단:

  • LLM Top 10 자가진단 매트릭스
  • NIST AI 600-1 12 위험 평가
  • EU AI Act 분류(고위험 여부)
  • MITRE ATLAS TTPs 적용 가능성

AIBOM(AI Bill of Materials):

  • 모델 출처·라이선스·학습 데이터
  • 프롬프트·파라미터·파인튜닝
  • 의존 라이브러리·플러그인
  • CycloneDX v1.6 AI BOM 표준 지원
  • Model Card(Google 2018) + Datasheet for Datasets(Gebru 2018) 통합

6. Stage 2 — 정책·거버넌스·교육 (2~3개월)

AI 사용 정책:

  • 허용 사용: 일반 코딩·요약·번역
  • 금지 사용: 영업비밀·고객 PII·소스코드·계약서·재무 정보
  • 승인 필요: 외부 발표·의사결정·자동 액션
  • 금지 모델: 미승인 SaaS·중국 모델(보안 정책 따라)·HKMA·EU 데이터 주권 영향

AI 거버넌스 체계:

  • AI Council: CTO·CISO·CPO·CCO·CLO·CHRO·사업부장 — 분기 운영
  • AI Risk Officer: 전담자 1명+
  • AI Use Case Registry: 모든 AI 사용 등록·심사·승인
  • AI Ethics Committee: 영향력 큰 사용 윤리 검토

역할 정의:

  • Model Provider: OpenAI·Anthropic 등 (계약·SLA)
  • AI System Integrator: 우리 회사 AppSec·MLOps
  • AI Deployer: 사업부·운영
  • AI End User: 직원·고객

교육:

  • 전 직원 분기 AI 보안 교육
  • 개발자 LLM Top 10 심화
  • 임원·법무 EU AI Act·ISO 42001
  • 영업·마케팅 — 프롬프트 위생·기밀 보호

한국 K-AI 가이드라인(2024.5 과기정통부) 매핑:

  • 6 원칙(인간 존엄·안전·투명·책임·차별 금지·환경)
  • 산업별 적용 사례
  • 자율점검 도구

7. Stage 3 — 기술 통제·가드레일 (3~6개월)

프롬프트·입력 가드레일:

  • 입력 정화: 프롬프트 인젝션 패턴 차단
  • 입력 분리: 시스템 프롬프트·사용자·문서·도구 출력 명확히 구분(Delimiter·XML 태그)
  • Few-shot Examples: 안전한 응답 사례
  • Output 사전 검증: 차단 패턴

모델 가드레일:

  • NeMo Guardrails(NVIDIA): Rails로 정책 정의
  • Guardrails.ai: Validators·Rails
  • Llama Guard(Meta): 안전성 분류기
  • Azure Content Safety: 욕설·성적·자해·폭력
  • AWS Bedrock Guardrails: PII 차단·주제 필터
  • OpenAI Moderation API: 13 카테고리

Output 처리(LLM05):

  • HTML·SQL·Shell 출력 시 컨텍스트 인코딩
  • 절대 직접 eval·subprocess·DB 실행 X
  • 인간 승인 게이트(Critical Action)

RAG·임베딩 보안(LLM08):

  • 임베딩 DB(Pinecone·Weaviate·Qdrant·Chroma·Milvus) 접근통제
  • 다중 테넌트 격리
  • 임베딩 추출 공격 방어
  • 문서 권한과 RAG 결과 권한 일치

툴·플러그인 권한(LLM06):

  • 최소권한 — 읽기만·쓰기만 분리
  • Critical Action(메일 발송·결제·삭제) 인간 승인 필수
  • 세션 단위 권한·만료
  • 감사 로그

비용·자원 통제(LLM10):

  • Rate Limit(사용자·IP·API Key)
  • Token Quota
  • 최대 응답 시간
  • 비정상 패턴 알람

모델 공급망(LLM03):

  • 모델 출처 검증(Hugging Face 서명·해시)
  • 학습 데이터셋 검증
  • 모델 카드·라이선스 확인
  • AIBOM 등록

민감 데이터(LLM02):

  • 입력 PII 차단(Presidio·AWS Comprehend·Azure PII)
  • 시스템 프롬프트 분리·인코딩
  • DLP 통합(Microsoft Purview·Forcepoint·Symantec)
  • 학습 시 PII 제거·익명화

8. Stage 4 — 모니터링·평가·Red Team (지속)

모니터링:

  • 모든 프롬프트·응답 로깅(PII 마스킹)
  • 비정상 패턴(Jailbreak·Prompt Injection 시도)
  • 비용·토큰 사용 추적
  • 도구: Helicone·Langfuse·Lakera·Robust Intelligence·Protect AI

평가(Eval):

  • 정확성(Accuracy·Hallucination Rate)
  • 안전성(Harmful Output Rate)
  • 견고성(Robustness·Adversarial)
  • 편견(Bias·Fairness)
  • 도구: OpenAI Evals·RAGAS·TruLens·Promptfoo·lm-evaluation-harness·HELM

AI Red Team:

  • 프롬프트 인젝션·Jailbreak·Data Extraction
  • 도구: PyRIT(Microsoft 2024.2)·Garak(NVIDIA)·Promptfoo·Lakera
  • 분기 1회+ 외부 AI Red Team(Robust Intelligence·HiddenLayer·Lakera·Trail of Bits)
  • MITRE ATLAS TTPs 시나리오

LLM Pentest:

  • OWASP LLM Top 10 매트릭스
  • BAS-style 자동 시뮬레이션
  • 결과 → 가드레일·시스템 프롬프트 튜닝

Compliance Mapping:

  • EU AI Act 의무(고위험): 위험관리·데이터·기록·감독·정확성·견고성·사이버보안
  • ISO/IEC 42001: 38 Controls 매핑
  • NIST AI RMF: 4 Functions 활동
  • GDPR Article 22(자동 의사결정), Article 35(DPIA)

9. Stage 5 — 운영·인증·고도화 (지속)

운영 KPI:

  • AI 사용 등록률 100%
  • 가드레일 통과율
  • Prompt Injection 탐지·차단 수
  • 비용·토큰 효율
  • 인시던트 수·MTTR
  • Eval 점수 추세

인증·감사:

  • ISO/IEC 42001: AI 경영시스템 인증(3년)
  • ISO/IEC 23894: AI 위험 관리(가이드)
  • ISO/IEC 27001 + 42001 통합
  • EU AI Act CE 마킹(고위험)
  • NIST AI RMF 자가증명
  • SOC 2 + AI Trust Service: 신규 추가

고도화:

  • Confidential AI: NVIDIA H100 CC·Intel TDX·AMD SEV-SNP — 모델·데이터 격리
  • Federated Learning: 분산 학습·원본 미공유
  • Differential Privacy: 학습 데이터 익명화
  • Homomorphic Encryption: 암호화 상태 추론
  • AI Watermarking: 출력 콘텐츠 워터마크(C2PA)
  • Provenance: 콘텐츠 출처 증명(C2PA Content Credentials)

Agentic AI 추가 위험(2025~):

  • AutoGPT·LangGraph·CrewAI·Autonomous Agents
  • 자율 의사결정·실행 → Excessive Agency 폭증
  • 복합 도구 체인 — 각 단계 통제 필요
  • OWASP Agentic Threat & Mitigations Guide(2025)

MCP(Model Context Protocol·Anthropic 2024.11):

  • 표준 도구 연결 프로토콜
  • 보안 모델: 권한·승인·감사
  • 신뢰 경계 명시·관리

10. 비용·ROI

항목비용 (연간)
AI 거버넌스·정책·교육1천~3억
가드레일 도구(NeMo·Lakera·Robust)1~10억
CASB·DLP AI 확장1~5억
AIBOM·등록 시스템3천~3억
평가·Red Team(외부 분기)5천~5억
인력(AI Security 1~5명)2~25억
ISO 42001 인증(첫해)5천~3억
합계 (중견 제조사)5~54억

ROI:

  • AI 인시던트 1건 평균 손실(Samsung 케이스 보고서) 100억~수조 (영업비밀)
  • 평판 손실(Air Canada형) 비계량
  • EU AI Act 위반 — 매출 7% 또는 3,500만유로 中 大
  • ISO 42001 인증 — RFP·신뢰
  • 사이버보험 — AI 통제 시 10~15% 할인
  • 직원 AI 생산성 +30%(제대로 도입 시)

11. 자가 점검

진단:

  • AI 자산 인벤토리·Shadow AI 발견
  • 사용처·데이터 흐름 매핑
  • LLM Top 10·NIST 12위험·MITRE ATLAS 자가진단
  • EU AI Act 분류
  • AIBOM(CycloneDX v1.6) 생성

거버넌스:

  • AI 사용 정책·CEO 승인
  • AI Council 분기
  • AI Risk Officer 지정
  • Use Case Registry·승인 프로세스
  • 전 직원 교육·개발자 심화

기술 통제:

  • 입력 가드레일(Prompt Injection 차단)
  • 출력 가드레일(NeMo·Guardrails.ai·Llama Guard)
  • PII 입력 차단(Presidio·DLP)
  • 시스템 프롬프트 분리·보호
  • 툴·플러그인 최소권한·승인 게이트
  • Rate Limit·Token Quota
  • RAG 임베딩 권한
  • 모델 공급망(서명·해시·라이선스)

모니터링·평가:

  • 프롬프트·응답 로깅
  • Eval 자동화(Promptfoo·TruLens·HELM)
  • AI Red Team 분기(PyRIT·Garak)
  • 인시던트 IR Playbook(LLM 특화)
  • MITRE ATLAS 적용범위

인증·미래:

  • ISO/IEC 42001 인증 또는 로드맵
  • EU AI Act 고위험 의무 매핑
  • NIST AI RMF 자가증명
  • Confidential AI 검토
  • C2PA·Watermarking
  • Agentic AI·MCP 보안 검토

12. 마무리 — AI는 새 SW 공급망이다

AI/LLM 보안은 ① 자산·사용처·위험 진단, ② 정책·거버넌스·교육, ③ 기술 통제·가드레일, ④ 모니터링·평가·Red Team, ⑤ 운영·인증·고도화 — 5단계로 정착시킨다. 기존 AppSec 통제로 부족하고, 모델·프롬프트·임베딩·툴·공급망 단위 새 통제가 필요하다. 2026년 EU AI Act 고위험 의무 + ISO/IEC 42001 인증 흐름 + Agentic AI 폭증으로 지금 시작이 마지막 골든타임이다.

통합 사이클