제조업 AI Agent·Agentic AI·MCP·OWASP Agentic Top 10 보안 실무 완벽 가이드 — 자율 에이전트 위험에서 인간 통제까지 5단계 로드맵

중소·중견 한국 제조사가 AI Agent·Agentic AI·MCP(Model Context Protocol)·자율 시스템 보안 체계를 진단·정책·통제·운영·고도화까지 진짜 무사히 정착시키는 5단계 로드맵. OWASP Agentic Top 10 v1.0(2025), MCP(Anthropic 2024.11), Anthropic Computer Use·OpenAI Operator·Google Project Astra·Microsoft Copilot Agents·Salesforce Agentforce·ServiceNow Now Assist, LangGraph·AutoGen·CrewAI·LangChain·Llama Stack·Cybersecurity Risk·Agent Identity·HITL·NIST AI 600-1 매핑 실무.

1. 왜 AI Agent·Agentic AI 보안인가 — 자율 시스템의 새 위험

2024년 가속: ChatGPT(2022.11) → Copilot(2023) → GPT-4o(2024.5)·Claude 3.5(2024.6)Agentic AI 폭발(2024.10~). LLM이 단순 응답에서 자율 계획·도구 호출·실행 진화. 모든 SaaS·Cloud·OS — Agent 통합 가속.

2024 Agent 출시 폭증:

  • Anthropic Computer Use(2024.10): Claude가 화면·마우스·키보드 사용
  • OpenAI Operator(2025.1): 자율 웹 브라우징·예약·구매
  • Google Project Astra(2024.12): Multi-modal 에이전트
  • Microsoft Copilot Agents(2024.10): M365·SharePoint·Teams 자동
  • Salesforce Agentforce(2024.10): CRM 자율 영업
  • ServiceNow Now Assist·Workday AI·SAP Joule
  • LangGraph·AutoGen(Microsoft)·CrewAI·LlamaIndex·Llama Stack(Meta)
  • MCP(Model Context Protocol·Anthropic 2024.11): 표준 도구 연결 프로토콜

대표 위험·사고:

  • Slack AI Prompt Injection(2024.8): 외부 메시지로 DM 추출
  • Microsoft Copilot Prompt Injection(2024~): 이메일·문서로 명령 주입
  • Anthropic Computer Use Demo(2024.10): 의도하지 않은 클릭·다운로드
  • GitHub Copilot 자율 PR: 코드 누출 사례
  • Auto-GPT(2023): 무한 루프·예산 폭증
  • Air Canada 챗봇(2024.2): AI 환각 손해배상 판결

오해 1 — “Agent는 LLM 위 한 층.” 위험 표면 — 도구 호출·외부 데이터·자율 결정·다단계 작업 모두 새 위험. 오해 2 — “Sandbox에서 격리.” Agent의 외부 도구 호출 — Sandbox 우회·실제 시스템 영향. 오해 3 — “Human in the Loop이면 안전.” 100건 중 1건이라도 위험 — 누적 영향 큼·승인 피로(Approval Fatigue).

압박:

  • EU AI Act(2024.8 발효): Agent — GPAI 시스템 적용 가능·고위험 검토
  • NIST AI 600-1(블로그 LLM): GenAI Profile·Agentic 시나리오
  • NIST AI 100-2 Adversarial ML(2024.1)
  • MITRE ATLAS·OWASP LLM Top 10·Agentic Top 10
  • ISO/IEC 42001 AI Management(블로그 LLM)
  • OpenAI·Anthropic·Google Responsible Scaling Policies

2. OWASP Agentic AI Top 10 v1.0 (2025)

OWASP Agentic AI Threats and Mitigations Guide(2025.1):

ID위험
A1Memory Poisoning
A2Tool Misuse
A3Privilege Compromise
A4Resource Overload
A5Cascading Hallucination Attacks
A6Intent Breaking & Goal Manipulation
A7Misaligned Behaviors
A8Repudiation & Untraceability
A9Identity Spoofing & Impersonation
A10Overwhelming Human-in-the-Loop
A11Unexpected RCE & Code Attacks
A12Agent Communication Poisoning
A13Rogue Agents in Multi-Agent Systems
A14Human Attacks on Multi-Agent Systems
A15Human Manipulation

A1 Memory Poisoning — 장기 메모리·벡터 DB에 악성 주입. A2 Tool Misuse — 의도된 도구 → 악의적 활용. A3 Privilege Compromise — Agent 권한 상승. A5 Cascading Hallucination — 환각이 다른 Agent·도구로 전파. A10 Overwhelming HITL — 너무 많은 승인 요청 → 승인 피로 → 위험 승인. A13 Rogue Agents — 다중 Agent 협업 중 한 Agent 침해 → 전체 영향.

3. Agent Frameworks·MCP

Agent Framework 매트릭스:

프레임워크특징
LangChain·LangGraph시장 점유 1위·LangGraph(2024.1)·State Machine
AutoGen(Microsoft)Multi-agent 협업·Group Chat
CrewAIRole-based 협업
LlamaIndexRAG 강함 + Agent
AutoGPT·BabyAGI초창기·자율 무한
Semantic Kernel(Microsoft)C#·플러그인
OpenAI Assistants API·SwarmOpenAI Native·Swarm OSS(2024.10)
Llama Stack(Meta·2024.10)Llama 통합
Anthropic Agent SDKClaude·MCP 통합

MCP(Model Context Protocol·Anthropic 2024.11):

  • 표준 도구·데이터 연결 프로토콜
  • LSP(Language Server Protocol) 영감
  • MCP Server: 도구·자원 노출(예: Filesystem·GitHub·Slack)
  • MCP Client: Agent·LLM 클라이언트
  • Transport: stdio·HTTP·SSE
  • Capabilities: Tools·Resources·Prompts
  • 보안 모델: 권한·승인·감사 — 매우 빠른 진화

Korea·Industry MCP:

  • 2025 한국 — Naver·Kakao·삼성·LG Agent 출시 가속
  • 제조업 — Quality·Inventory·Predictive Maintenance Agent
  • 자율주행·로봇 — Vision·Decision Agent

4. Agent 보안 위협 분석

전형적 Agent Pipeline:

사용자 입력 → LLM(Plan) → 도구 선택 → 외부 호출 → 결과 분석 → 다음 계획
                ↑                                          ↓
              메모리·RAG          (모든 단계 — Prompt Injection)

위협 카테고리:

Input Manipulation:

  • Direct Prompt Injection
  • Indirect Prompt Injection(웹·문서·이메일·이미지·QR 코드)
  • Multi-modal Injection(이미지·오디오 내 명령)
  • Tool Output Injection(도구가 반환한 데이터 내 명령)

Tool Abuse:

  • 의도한 도구 — 의외 활용
  • Email 도구로 외부 발송
  • File 도구로 데이터 추출
  • Browser 도구로 외부 사이트 접근
  • API 도구로 인가되지 않은 호출

Privilege·Identity:

  • Agent가 사용자 권한으로 작동
  • Sub-agent에 권한 위임
  • Cross-tenant 데이터 노출
  • Token·자격증명 도용

Memory·RAG Poisoning:

  • 장기 메모리 악성 주입
  • 벡터 DB 임베딩 오염
  • 다음 사용자가 영향

Multi-Agent Risk:

  • Agent 간 통신 침해
  • Cascading Failure
  • Rogue Agent
  • Coordination Attack

5. Stage 1 — Agent 자산·정책 (1~2개월)

Agent Inventory:

  • 사용 중 Agent — 자체·SaaS·외주
  • Foundation Model·Framework·MCP 서버
  • 사용처 — 고객·임직원·운영
  • 데이터 흐름·도구·API

Shadow Agent Discovery:

  • 직원 사용 Auto-GPT·CrewAI·LangChain 등 자체 운영
  • M365 Copilot·Salesforce Agentforce·Workday AI 도입
  • Browser Agent(Comet·Arc Dia)
  • 도구: Wing Security·Reco·Adaptive Shield·Push Security AI

위험 진단:

  • OWASP Agentic Top 10 v1.0 자가진단
  • NIST AI 600-1 12 위험·Agentic 확장(블로그 LLM)
  • MITRE ATLAS·Multi-Agent 위협 모델

AI Agent Policy:

  • 허용 사용: 일반 코딩·요약·문서·이메일 보조
  • 승인 필요: 외부 발송·송금·계약·HR·재무
  • 금지: PII 입력·소스코드·M&A 정보·기밀
  • Critical Action HITL 의무: 송금·계약·삭제·외부 통보

거버넌스:

  • AI Agent Council: CISO·CTO·CPO·CCO·CFO·HR
  • 분기 운영·도입 승인
  • AI Trust Officer(2024 신규)

6. Stage 2 — Identity·권한·HITL (2~4개월)

Agent Identity(블로그 IAM):

  • 각 Agent — 고유 신원·SPIFFE·X.509
  • Workload Identity 적용
  • Service Account 분리·자동 회전
  • 도구: Astrix·Aembit·Andromeda Security·Oasis Security

권한 모델:

  • Agent별 최소권한: 기능 단위 분리
  • 사용자 권한 ≠ Agent 권한: 별도 평가
  • Step-up Auth: 민감 작업 시 사용자 재인증
  • JIT·Approval Workflow(블로그 IAM): 권한 시간 제한

HITL(Human-in-the-Loop):

  • Critical Action 의무:
    • 송금·결제·구매
    • 외부 발송(이메일·메시지·소셜)
    • 데이터 삭제·수정
    • 계약·법적 결정
    • HR·인사·HR
  • Tier별 승인:
    • Tier 1: 자동
    • Tier 2: Notify(알람 + 자동 또는 취소)
    • Tier 3: Approval(승인 필수)
    • Tier 4: Multi-approval(2명+)

Approval Fatigue 방지:

  • Batch Approval·요약
  • Risk-based — 위험 점수에 따라
  • 분석 시간 보장(즉시 승인 금지)
  • 정기 권한 검토

Tool 권한 매트릭스:

  • 도구별 Read·Write·Execute 분리
  • 위험 도구(File Write·Email Send·API Call) — Approval
  • Sandbox(파일시스템·네트워크 격리)

7. Stage 3 — Gardrail·검증·감사 (3~6개월)

Input Guardrails(블로그 LLM):

  • Prompt Injection 차단
  • 입력 분리(System·User·Tool Output XML 태그)
  • PII 차단(Presidio·Microsoft Purview)
  • Multi-modal 입력 검증

Output Guardrails:

  • 모델 출력 사전 검증·정화
  • 외부 도구·시스템 영향 분석
  • 도구: NeMo Guardrails·Guardrails.ai·Llama Guard·Azure Content Safety·AWS Bedrock Guardrails·Lakera Guard·Protect AI

Tool Output Sanitization:

  • 도구 반환 데이터 — Prompt Injection 차단
  • 외부 데이터 — 신뢰 X·Quarantine 우선
  • HTML·SQL·Shell 컨텍스트 인코딩

Sandbox·Isolation:

  • Container: Docker·gVisor·Firecracker
  • VM: Confidential Computing(블로그 HW)
  • WebContainer·Pyodide: 브라우저 격리
  • E2B(2024 신규): Code Interpreter Sandbox

감사 로그(A8 Untraceability 대응):

  • 모든 Agent 행동 로그
  • LLM 호출·도구 호출·외부 영향
  • 사용자 행동·승인·결과
  • SIEM·SOAR 통합

도구:

  • Helicone·Langfuse·LangSmith·Phoenix(Arize)·Datadog LLM Observability
  • 비용·성능·이상 행동

8. Stage 4 — Multi-Agent·통합·운영 (지속)

Multi-Agent Security:

  • Agent 간 통신 — mTLS·서명
  • Identity 검증·신뢰 경계
  • Rogue Agent 격리·해지
  • Coordination 검증

MCP Security:

  • MCP Server — 신뢰·서명·SBOM
  • Capability 최소화
  • 권한 분리·감사
  • Marketplace — 신뢰 평가·VDP

모니터링:

  • LLM Eval·성능 추세(블로그 LLM)
  • 도구 호출 이상(빈도·패턴)
  • 비용 폭증 알람
  • Prompt Injection 탐지

ITDR for Agent(블로그 IAM):

  • Agent Identity 침해 탐지
  • 권한 상승·이상 행동
  • Token·자격증명 도용

Red Team for Agent(블로그 Pentest):

  • PyRIT(Microsoft)·Garak(NVIDIA)·Promptfoo·Lakera Red Team
  • Adversarial Agent·Multi-Agent 시나리오
  • 분기 1+ 외부 Red Team(Robust Intelligence·HiddenLayer)

Continuous Eval:

  • 정확성·안전성·견고성·편견
  • 도구: OpenAI Evals·RAGAS·TruLens·Promptfoo·HELM
  • A/B Test·Canary 배포

거버넌스:

  • AI Agent Council 분기
  • 이사회 보고
  • ISO/IEC 42001(블로그 LLM)
  • NIST AI RMF·EU AI Act 매핑

9. Stage 5 — 고도화·미래 (지속)

Agent의 미래:

  • Computer Use(Anthropic·2024.10): 화면·마우스·키보드
  • Operator(OpenAI·2025.1): 자율 웹
  • Project Astra(Google·2024.12): Multi-modal·Real-time
  • AI Phone Agent: 음성 통화·Vishing 위험
  • Robotic Agent: Vision·Manipulation·Real-world 영향
  • Autonomous Vehicle Agent: 자율주행 결합

제조업 특화:

  • Quality Inspection Agent: Vision·자율 결정
  • Predictive Maintenance Agent: 센서·예측·조치
  • Supply Chain Agent: 발주·계약·물류
  • Customer Support Agent: 고객 응대·환불·계약
  • R&D Agent: 문헌·실험 설계

위험 — 미래:

  • Autonomy Creep: 점진적 권한 확장·이사회 인지 없음
  • Multi-Agent Cascade: 한 Agent 침해 → 전체
  • AI Worm: Agent 간 자기 복제 멀웨어
  • Computer Use 우회: 의도하지 않은 시스템 영향
  • Deepfake + Agent: 자율 사기(블로그 Deepfake)

고도화:

  • Confidential AI Agent: TEE·Confidential Computing
  • Federated Agent: 분산 학습·실행
  • Quantum AI: 양자 + AI 결합
  • AI Constitutional Models(Anthropic): 자체 가치·통제
  • AI Safety Research: Alignment·Interpretability·Mechanistic
  • Red Teaming Plus: BAS for Agent

컴플라이언스 매핑:

  • OWASP Agentic Top 10·LLM Top 10·API Top 10·Mobile Top 10
  • NIST AI RMF·600-1·AI 100-2
  • ISO/IEC 42001·23894·24028
  • EU AI Act GPAI·고위험
  • US EO 14110·Voluntary AI Commitments
  • 한국 K-AI 가이드라인·EU AI Act 매핑

10. 비용·ROI

항목비용 (연간)
Agent 거버넌스·정책3천~3억
가드레일(NeMo·Guardrails.ai·Lakera·Protect AI)1~10억
Identity for Agent(Astrix·Aembit)1~10억
LLM Observability(Langfuse·Helicone·Datadog)3천~3억
Sandbox(E2B·Confidential Computing)3천~5억
Red Team·Pentest for Agent5천~5억
인력(AI Security·Trust 1~3명)2~15억
ISO/IEC 42001 인증5천~3억
합계 (중견 제조사)5~50억

ROI:

  • Slack AI·Microsoft Copilot 형 인시던트 회피
  • Air Canada 형 손해배상 회피
  • EU AI Act 위반 — 매출 7% 또는 €35M 中 大
  • Samsung ChatGPT 형 영업비밀 노출 회피
  • 사이버보험 — AI 통제 시 10~15% 할인
  • 직원 AI 생산성 +30~50% (제대로 도입 시)

11. 자가 점검

자산·정책:

  • Agent 인벤토리·Shadow Discovery
  • OWASP Agentic Top 10 자가진단
  • AI Agent Policy(허용·승인·금지)
  • AI Agent Council·AI Trust Officer

Identity·권한·HITL:

  • Agent별 신원·SPIFFE
  • 최소권한·사용자 권한 분리
  • Critical Action HITL 의무
  • Approval Fatigue 방지
  • Tool 권한 매트릭스

Gardrail·검증·감사:

  • Input Guardrails(Prompt Injection 차단)
  • Output Guardrails(NeMo·Guardrails.ai·Llama Guard)
  • Tool Output Sanitization
  • Sandbox(Container·Confidential Computing)
  • 감사 로그·SIEM·SOAR 통합
  • Langfuse·Helicone·Phoenix Observability

Multi-Agent·MCP·운영:

  • Agent 간 mTLS·서명·Identity
  • MCP Server 신뢰·서명·SBOM
  • Rogue Agent 격리·해지
  • ITDR for Agent
  • Red Team·BAS for Agent(PyRIT·Garak)
  • Continuous Eval(Promptfoo·HELM)

고도화·미래·매핑:

  • Computer Use·Operator·Astra 평가
  • 제조업 Agent(Quality·Maintenance·Supply Chain·R&D)
  • Confidential AI Agent
  • OWASP·NIST·ISO 42001·EU AI Act·K-AI 매핑

12. 마무리 — 자율 시스템에 인간 통제를

AI Agent·Agentic AI·MCP 보안은 ① Agent 자산·정책, ② Identity·권한·HITL, ③ Gardrail·검증·감사, ④ Multi-Agent·통합·운영, ⑤ 고도화·미래 — 5단계로 정착시킨다. 2024.10~ Computer Use·Operator·Astra·Copilot Agents·Agentforce — Agent가 일상에 들어왔다. OWASP Agentic Top 10 + MCP + HITL + Sandbox + Continuous Eval의 통합 운영체가 2025년 표준이고, Confidential AI Agent + AI Constitutional + Multi-Agent Coordination 보안이 2030년 도전이다. 자율 시스템의 신뢰는 통제·감사·HITL에서 시작한다.

통합 사이클