핵심 POINT
최근 AI가 외부 시스템에 우회 침투하거나 악성코드 삽입을 시도하는 등 인간의 통제를 벗어난 이상행동을 시도하는 사례가 증가하고 있습니다.
부적절한 도구 설계나 메모리 오염 등 새로운 보안 위협에 적절하게 대응하지 않는다면 AI 에이전트의 권한 오남용이나 정보 유출로 이어질 수 있습니다.
최소 권한 원칙, 에이전트 가드레일, 실시간 모니터링 등 다층 방어 체계와 실전 공격 시나리오로 검증하는 AI 레드티밍을 통해 AI 보안 정책을 강화할 수 있습니다.
최근 오픈AI의 미공개 AI 모델이 사이버보안 벤치마크 테스트 중 과제의 보상을 얻는 데 집중한 나머지, 정상적인 평가 절차 대신 시스템의 허점을 이용해 외부 플랫폼에 침투한 사건이 화제를 모았습니다.
AI 에이전트들은 탈취한 접속 정보와 제로데이 취약점을 연쇄적으로 이용해 침투 경로를 만들어냈습니다. 특히 내부 평가 환경에서 작동하던 AI 모델이 시스템의 통제 범위를 벗어나 외부 플랫폼까지 공격했다는 점에서 AI 에이전트의 자율적인 행동에 대한 깊은 우려를 낳았습니다.
영국 인공지능보안연구소(AISI)에서 실시한 안전성 평가에서도 안전장치를 제거한 일부 AI 에이전트가 가짜 신분으로 이메일과 메시지를 전송하고, 오픈소스 프로젝트에 악성코드를 심으려 한 이상행동이 확인됐습니다.
"오픈AI, 허깅페이스 해킹 세부 내용 공개...자체 시스템 먼저 해킹·정보 공유까지"
"앤트로픽·오픈AI 이어 메타까지...가짜 신분으로 외부 기관 '자율 해킹'"
이처럼 AI가 주어진 목표를 달성하는 과정에서 시스템 제약을 우회하거나 피싱과 같은 수법을 이용하는 등 승인되지 않은 행동을 선택하는 사례가 지속적으로 보고되고 있습니다. 이는 AI가 단순 질의응답 수준을 넘어 스스로 판단하고 행동하는 지능형 에이전트로 진화했기 때문입니다.
■ AI 에이전트란? 기존 AI와 무엇이 다를까?
출처 : Magnific
미국 국립표준기술연구소(NIST)는 AI 에이전트를 "현실의 시스템이나 환경에 영향을 미치는 자율 행동을 계획하고 수행할 수 있는 시스템"으로 정의합니다. 기존 생성형 AI가 사용자의 질문에 답하거나 결과물을 작성하는 데 초점을 맞췄다면, AI 에이전트는 목표 달성을 위한 전체 과정을 스스로 설계하고 실행합니다. 이 과정에서 필요한 도구와 데이터를 직접 선택하고, 실행 결과를 평가하여 다음 행동까지 결정합니다.
AI 에이전트의 주요 특징
✔️ 목표가 설정되면 작업의 우선순위를 정하고 다음 행동을 자율적으로 판단합니다.
✔️ 목표 달성을 위해 API와 데이터베이스, 파일 시스템 등 필요한 도구와 시스템을 활용합니다.
✔️ 코드를 작성하거나 시스템 명령어를 실행해 실제 환경의 상태를 변경할 수 있습니다.
✔️ 실행 결과를 확인한 뒤 실패 원인을 분석하고, 목표를 달성할 때까지 다른 방법을 시도합니다.
■ AI 에이전트 보안이 중요한 이유
출처 : Magnific
자율성과 실행 능력은 AI 에이전트의 활용도를 높이는 요소이지만, 잘못된 판단이 곧바로 실제 행동으로 이어질 수 있는 구조적 위험을 동반합니다. 특히 연결된 시스템이 많고 부여된 권한이 클수록 단 한 번의 오작동이 광범위한 피해로 연결될 수 있습니다. 부적절한 프롬프트 입력으로 기업의 기밀 문서나 개인정보가 유출되거나, 사내 챗봇이 승인되지 않은 환불 절차를 진행하는 사례가 발생할 수 있습니다.
따라서 AI 에이전트를 안정적으로 운영하려면 어떤 권한을 부여하고 어떤 행동까지 허용할 것인지 명확히 정해야 합니다. 또한 실제 운영 환경에서 통제 장치가 제대로 작동하는지 지속적으로 검증하는 과정이 필요합니다.
■ 대표적인 AI 에이전트 보안 위협 유형 4가지
한국인터넷진흥원(KISA)이 SK쉴더스의 전문 화이트해커 그룹 EQST 등과 공동으로 제작해 배포한 「AI 보안 위협 대응 매뉴얼」은 LLM 에이전트가 외부 도구와 상호작용하며 발생시킬 수 있는 대표적 위협을 다음과 같이 분류합니다.
| 유형 | 정의 | 영향 |
|---|---|---|
| 부적절한 도구 설계 | 도구에 과도한 권한이 부여되거나 입력값 검증이 미흡한 상태 | 임의 명령 실행, 외부 API 오남용, 민감정보 유출 |
| 에이전트 하이재킹 | 외부 콘텐츠에 숨겨진 악성 프롬프트를 정상 지시로 착각 | 대화 내역이나 민감정보 유출, 데이터 삭제·조작 |
| 에이전트 DoS | 무한 루프나 과도한 API 호출로 자원·비용 고갈 | 정상 요청 처리 지연, 서비스 응답 속도 하락 |
| 에이전트 메모리 오염 | 메모리에 악성 데이터가 삽입돼 이후 추론에 지속적 영향 | 왜곡된 응답 생성, 비인가 도구 호출·이메일 발송 등 2차 피해 |
[표 1] AI 에이전트 4대 보안 위협
1) 부적절한 도구 설계 (Improper Tool Design)
지능형 에이전트에게 부여된 도구 권한이 필요한 최소 수준을 초과하거나, 입력값 검증과 실행 조건이 명확히 제한되지 않은 경우 발생합니다. 악성 입력이 들어오면 시스템 오동작이나 정보 유출이 일어나고, 임의 명령 실행이나 외부 API 오남용으로 시스템이 장악될 수도 있습니다.
2) 에이전트 하이재킹 (Agent Hijacking)
외부 데이터(웹 페이지, 문서 등)에 숨겨진 악성 프롬프트를 에이전트가 정상 지시로 착각해 의도치 않은 작업을 수행하는 위협입니다. 신뢰할 수 없는 외부 콘텐츠 조회 권한과 상태 변경 권한이 같은 에이전트에 함께 부여됐거나, 읽기·쓰기 작업이 분리되지 않은 경우 발생합니다. 대화 내역이나 개인정보 및 인증정보 유출로 이어질 수 있습니다.
3) 에이전트 DoS (Denial of Service)
에이전트가 무한 루프에 빠지거나 과도한 API 호출을 반복해 시스템 자원과 비용을 고갈시키는 위협입니다. '완벽해질 때까지 반복하라'는 모호한 종료 조건이나 실패 시 무제한 재시도 로직, 여러 에이전트가 서로에게 작업을 위임하는 순환 구조에 의해 발생합니다. 정상 사용자의 요청 처리가 지연되고 서비스 응답 속도가 급격히 저하될 수 있습니다.
4) 에이전트 메모리 오염 (Memory Poisoning)
에이전트의 메모리에 악성 데이터가 삽입돼 이후의 추론과 판단 과정에 지속적으로 영향을 미치는 위협입니다. 신뢰할 수 없는 입력이 검증 없이 메모리에 반영되면, 에이전트가 잘못된 정보를 사실로 인식하거나 공격자가 의도한 방향으로 왜곡된 응답을 생성하게 됩니다. 오염된 메모리를 기반으로 비인가 도구 호출, 이메일 발송 등 2차 피해가 이어질 수 있습니다.
■ AI 에이전트, 어떻게 통제해야 할까?
AI 에이전트를 안정적으로 운영하기 위해서는 설계부터 운영 전 단계에 걸쳐 다층적인 통제 장치가 필요합니다. 「AI 보안 위협 대응 매뉴얼」은 다음과 같은 방안을 권고하고 있습니다.
| 대응 방안 | 핵심 내용 |
|---|---|
| 최소 권한·역할 기반 접근 제어 | 요청자 권한 범위 내 자원 접근, 임시 권한 자동 회수 |
| Human-in-the-Loop 검증 | 고위험 결정에 대한 인간 승인 절차 마련 |
| 에이전트 가드레일 | 행동 사전 검증, 범위 제한, 결과 검증 3단계 보안 정책 도입 |
| 실행 권한 정보 분리 | API 키와 같은 민감정보는 미들웨어 레이어에서 별도 관리 |
| 실시간 모니터링 | 도구 호출, 권한 오남용 등 이상행동 상시 추적 |
[표 2] AI 에이전트 보안 위협 대응 방안
1) 최소 권한·역할 기반 접근 제어
AI 에이전트에는 시스템 전체 권한이 아닌, 요청자의 권한 수준 이하로 제한된 최소 권한만 부여해야 합니다. 권한은 역할별로 세분화하고, 필요한 경우에만 임시 권한을 발급해 작업 종료 후 자동 회수해야 합니다. 이 원칙만으로도 권한 남용과 정보 유출 위험을 크게 줄일 수 있습니다.
2) Human-in-the-Loop(HITL) 검증 체계
금융 거래·보안 정책 변경 같은 고위험 조치는 자동 실행되지 않도록 반드시 인간의 승인 절차를 두어야 합니다. 모든 결정에 사람이 개입하면 효율성이 떨어지므로, 조치의 위험 수준에 따라 개입 여부를 차등 적용하는 위험 기반 접근법을 병행해야 합니다.
3) 에이전트 가드레일 도입
에이전트의 행동(action)은 실행 전 사전 검증, 고위험 행동 통제, 실행 결과 검증 등의 다단계 가드레일을 적용해야 합니다. 도구 실행 전에는 허용 목록과 인자 값을 검증하고, 파일 삭제나 외부 송금과 같은 고위험 행동은 기본적으로 차단하거나 HITL과 연계해야 합니다. 또한 외부 도구의 응답은 신뢰할 수 없는 입력으로 간주해 프롬프트인젝션 시도나 악성 지시문이 포함됐는지 검사해야 합니다.
4) 실행 권한 정보 분리 관리
API 키, 인증 토큰 같은 민감정보는 LLM 컨텍스트가 아닌 별도의 미들웨어 레이어나 안전한 비밀 관리 시스템에서 관리해야 합니다. LLM이 이러한 정보를 직접 파라미터로 다루지 않도록 분리해야 프롬프트 인젝션을 통한 자격증명 탈취 위험을 줄일 수 있습니다.
5) 실시간 모니터링
에이전트는 여러 단계에 걸쳐 자율적으로 작업을 수행하기 때문에, 단일 입출력 감시만으로는 위험을 포착하기 어렵습니다. 도구 호출 패턴, 권한 오남용, 계획과 실행 결과의 일치 여부, 메모리 이상 징후를 별도로 추적해 의도하지 않은 동작을 조기에 탐지하는 체계를 갖춰야 합니다.
■ AI 레드티밍이 필수인 이유
출처 : Magnific
AI 보안 대응책을 마련했더라도 실제 환경에서 제대로 작동하는지 검증하는 과정이 필요합니다. AI 서비스는 사용자와 실시간으로 정보를 주고받고 외부 데이터 및 시스템과 연결되며, 모델과 기능도 지속적으로 변경되기 때문입니다. 설계·개발 단계의 점검만으로는 운영 과정에서 발생하는 허점과 새로운 취약점을 모두 발견하기 어렵습니다.
AI 레드티밍은 실제 공격자가 활용할 수 있는 다양한 시나리오를 실행해 AI 시스템의 취약점과 통제 장치의 한계를 확인하는 과정입니다. 발견된 취약점은 심각도와 예상 피해를 기준으로 우선순위를 정하고, 보안 패치와 탐지 규칙 추가, 프롬프트 및 권한 설정 개선 등 필요한 조치로 연결합니다. 이후 같은 시나리오를 다시 실행해 취약점이 제대로 개선됐는지 확인합니다.
AI 레드티밍의 필요성과 구체적인 수행 방법은 EQST와 한국인터넷진흥원(KISA)이 함께 발간한 「AI 보안 레드티밍 가이드」에서 자세히 확인할 수 있습니다.
■ SK쉴더스 AI 레드팀 역량 입증
SK쉴더스 EQST는 다양한 산업에서 축적한 침해 대응 경험과 위협 인텔리전스를 바탕으로 실제 공격 상황을 가정한 AI 레드팀 서비스를 제공하고 있습니다. AI 시스템의 취약점을 사전에 찾아내고 위험 수준을 분석해 보안 대책을 수립할 수 있도록 지원합니다.
SK쉴더스 AI 레드팀은 대규모 언어모델의 주요 보안 위협을 정리한 글로벌 가이드인 'OWASP Top 10 for LLM'을 반영한 자체 프레임워크를 활용하며, 이를 통해 AI 모델뿐만 아니라 데이터와 애플리케이션, 외부 시스템 연동 과정에서 발생할 수 있는 위험까지 체계적으로 점검하고 대응 방안을 제시합니다.
또한 SK쉴더스 AI 레드팀은 국내 최대 규모 AI 보안 경진대회인 'Judgement Day' 우승에 이어, 세계적인 해킹 대회 'DEF CON CTF' 본선에 진출하며 실전 역량을 입증하고 있습니다.
"SK쉴더스 AI 레드팀, Judgement Day 우승"
AI 에이전트는 생산성 혁신의 도구인 동시에, 새로운 공격 표면을 만들어 보안 위험을 확대할 수도 있습니다. AI 에이전트에 사내 데이터 접근과 업무 도구 실행 권한 등을 부여하고 있다면, 그 행동과 결과를 검증하는 체계를 반드시 점검해 봐야 합니다. SK쉴더스는 검증된 EQST 역량과 통합 AI 보안 서비스로, 기업의 안전한 AI 활용을 지원합니다.
■ 자주 묻는 질문
Q1. AI 에이전트가 챗봇과 같은 일반 AI 서비스보다 보안에 미치는 영향이 큰 이유는 무엇인가요?
A. AI 에이전트는 답변을 생성하는 것을 넘어 메일 발송, 파일 수정, 외부 API 호출, 코드 실행 등 실제 작업을 수행할 수 있습니다. 사람의 개입 없이 여러 단계의 작업을 연속적으로 처리하고 다양한 도구의 권한을 함께 활용하기 때문에, 잘못된 판단이나 명령이 실제 시스템의 피해로 빠르게 이어질 수 있습니다.
Q2. HITL(Human-in-the-Loop)을 도입하면 AI 에이전트의 자동화 효율이 떨어지지 않나요?
A. 모든 결정에 사람이 개입하면 효율이 크게 저하됩니다. 그래서 조치의 위험 수준에 따라 개입 여부를 차등 적용하는 위험 기반 접근법이 권장됩니다. 단순 정보 조회는 자동 실행하되, 금융 거래·외부 송금·보안 정책 변경처럼 되돌리기 어려운 고위험 조치에만 인간 승인 절차를 두는 방식으로 효율성과 안전성을 동시에 확보할 수 있습니다.
Q3. AI 레드팀은 기존 모의해킹과 무엇이 다른가요?
A. 기존 모의해킹이 애플리케이션과 인프라의 기술적 취약점과 공격 표면을 주로 점검한다면, AI 레드팀은 AI 에이전트와 연계 시스템 전반을 대상으로 에이전트 하이재킹, 메모리 오염 같은 고유의 위협을 함께 점검합니다. 또한 AI 서비스는 출력이 매번 달라지는 특성을 가지고 있고, 지속적으로 새로운 모델이 출시되므로 일회성 점검이 아닌 재검증을 반복하는 검증 체계가 필요합니다.
Q4. 사내에 AI 보안 전문가가 없어도 AI 레드팀을 도입할 수 있나요?
A. 가능합니다. 서비스형 레드팀(RTaaS) 형태로 외부 전문가가 공격자 관점의 검증을 대행합니다. 내부 담당자는 시스템과 업무 환경에 대한 이해도가 높고, 외부 전문가는 공격자 관점에서 취약점을 점검할 수 있습니다. 따라서 외부 화이트해커 조직과 협업하면 내부 점검만으로 발견하기 어려운 보안 사각지대를 보완할 수 있습니다. SK쉴더스 EQST 같은 검증된 조직을 통해 최신 공격 트렌드가 반영된 진단을 받을 수 있습니다.
[콘텐츠 출처]
"오픈AI, 허깅페이스 해킹 세부 내용 공개...자체 시스템 먼저 해킹·정보 공유까지"
"앤트로픽·오픈AI 이어 메타까지...가짜 신분으로 외부 기관 '자율 해킹'"



