※ 본 포스트는 "WHS 4th 팀 프로젝트"에 앞서 선행 연구 학습을 위해 읽은 논문의 요약본입니다.
※ 비영리적인 순수한 학습 기록용입니다.
※ 저작권 문제가 있을 경우, 즉시 수정 또는 삭제하겠습니다.
포스팅에 앞서 해당 논문은 아래의 링크에서 확인할 수 있습니다.
[논문 바로가기]

최첨단 AI 시스템은 코드베이스 검사, 취약점 탐지 및 악용을 포함한 사이버 보안 작업에서 점점 더 많은 능력을 발휘하고 있습니다. 그러나 이러한 공격 능력을 평가하는 것은 개방적이고 재현 가능하며 여러 호스트로 구성된 사이버 훈련장(cyber ranges)에 대한 제한된 접근으로 인해 여전히 제약을 받습니다. 기존의 공개 벤치마크는 CTF 문제 해결, 취약점 재현, 익스플로잇 생성과 같은 고립된 기술들을 포착하지만, 노출된 서비스 발견, 거점 확보, 내부 정보 수집, 그리고 여러 호스트로 손상 범위를 확장하는 등 현실적인 침입 워크플로를 종종 추상화(생략)합니다. 최첨단 AI 시스템이 현실적인 공격 조건에서 평가되는 경우가 드물기 때문에, 이러한 격차는 새롭게 떠오르는 위험을 조기에 관찰하기 어렵게 만듭니다.
우리는 현실적인 사이버 훈련장에서 자율적인 사이버 공격 능력을 측정하기 위한 최초의 개방형 다중 훈련장 인프라인 AgentCyberRange를 소개합니다. 이는 15개의 실제 웹 애플리케이션에 걸친 110개의 취약점과 156개의 내부 호스트를 갖춘 8개의 기업형 사이버 훈련장을 결합하며, 실행, 오케스트레이션, 결과 수집 및 검증을 위한 툴체인인 Cage를 포함합니다. 이 벤치마크는 두 가지 핵심 단계를 다룹니다. 에이전트가 노출된 애플리케이션을 탐색하고 취약점을 검증하는 '웹 악용(web exploitation)' 단계와, 에이전트가 초기 거점을 더 넓은 내부 시스템 장악으로 확장하는 '사후 악용(post exploitation)' 단계입니다.
우리는 동일한 프롬프트와 예산 조건 하에서 6개의 최첨단 AI 시스템을 평가했습니다. Codex가 적용된 GPT-5.5가 가장 우수한 성능을 보여주었으며, 웹 악용 작업의 16.1%, 사후 악용 작업의 31.7%를 해결했습니다. 더 구체적인 힌트가 주어지면 이 비율은 각각 33.0%와 46.3%로 증가합니다. 우리는 또한 인기 있는 프로젝트의 알려지지 않은(제로데이) 취약점 발견과 호스트 방어를 우회하는 페이로드 변형 등 벤치마크 외적인 성과도 관찰했습니다. 이러한 결과는 현실적이고 재현 가능한 조건에서 새롭게 부상하는 AI의 공격 능력을 관찰하기 위해 개방형 사이버 훈련장 평가가 필수적임을 보여줍니다.
이번에 리뷰할 논문은 2026년 6월 공개된 "AgentCyberRange: Benchmarking Frontier AI Systems in Realistic Cyber Ranges"입니다. 이 논문은 실제 웹 애플리케이션과 기업형 내부망을 모사한 환경에서 최신 AI 에이전트의 자율 공격 능력을 평가합니다.
앞서 살펴본 HackWorld가 GUI 기반 Computer-Use Agent의 Web CTF 수행 능력과 실패 양상을 보여 주었다면, AgentCyberRange는 터미널 기반 에이전트가 현실적인 웹 서비스와 다중 호스트 네트워크에서 얼마나 긴 공격 흐름을 수행할 수 있는지에 초점을 맞춥니다.
1. Introduction
최신 AI 시스템은 코드 분석, 취약점 탐지, Exploit 작성과 같은 상호작용형 사이버 보안 작업을 수행할 수 있을 만큼 발전했습니다. 이에 따라 현재의 AI 시스템이 현실적인 사이버 공격을 자율적으로 수행할 수 있는지를 평가할 필요성도 커지고 있습니다.
하지만 현실적인 공격은 하나의 취약점을 찾고 Exploit하는 것으로 끝나지 않습니다. 외부에 노출된 서비스를 발견하고, 최초 거점을 확보한 다음, 내부 정보를 수집하고 여러 호스트로 장악 범위를 넓혀 가는 연속적인 과정이 필요합니다.
기존 공개 벤치마크는 CTF 풀이, 취약점 재현, Exploit 생성과 같은 개별 능력을 평가해 왔지만, 이러한 능력을 현실적인 End-to-End 공격 흐름 안에서 평가하기에는 한계가 있었습니다. 특히 공개적이고 재현 가능한 Multi-host Cyber Range가 부족하여 최신 AI의 공격 능력이 실제 침투로 어떻게 이어지는지 관찰하기 어려웠습니다.
이를 해결하기 위해 연구진은 실제 웹 애플리케이션 15개의 취약점 110개와, 내부 호스트 156대로 구성된 기업형 Cyber Range 8개를 포함하는 AgentCyberRange를 제안합니다. AgentCyberRange는 Web Exploitation과 Post Exploitation을 함께 평가하며, 실행과 결과 수집 및 자동 검증을 담당하는 CAGE 파이프라인도 제공합니다.
연구진은 동일한 Prompt와 Budget 조건에서 6개의 최신 AI 시스템을 평가했습니다.
그 결과 최신 에이전트가 실제 취약점을 공격하고, Benchmark 밖의 취약점을 발견하며, 방어 프로그램에 맞춰 Payload를 변형할 수 있음을 확인했습니다. 동시에 공격 표면 탐색과 다단계 공격 계획은 여전히 주요한 한계로 나타났습니다.
2. Background and Related Work
기존 연구는 CTF 해결, 취약점 재현, Exploit 생성 등 개별 능력을 주로 평가했습니다.
AgentCyberRange는 여기서 더 나아가 외부 공격 표면 탐색, 최초 거점 확보, 내부 정보 수집, 권한 상승과 다중 호스트 장악으로 이어지는 현실적인 공격 흐름을 평가 대상으로 삼았습니다.
3. AgentCyberRange
AgentCyberRange는 Web Exploitation과 Post Exploitation이라는 두 가지 공격 단계를 다룹니다.
| 구분 | WebExploitBench | PostExploitBench |
|---|---|---|
| 평가 대상 | 외부에 노출된 웹 애플리케이션의 탐색과 취약점 악용 | 최초 침투 이후 내부망에서의 공격 확장 |
| 규모 | 실제 웹 애플리케이션 15개, 취약점 110개 | Cyber Range 8개, 내부 호스트 156대 |
| 주요 능력 | Endpoint 탐색, 취약점 식별, PoC 작성 | 내부 정찰, 권한 상승, Credential 수집, Pivoting, Lateral Movement |
WebExploitBench의 취약점 110개는 Zero-day 18개, One-day 56개, Synthetic 취약점 36개로 구성됩니다.
Synthetic 취약점은 단순히 눈에 보이는 URL에 배치되지 않습니다. 실제 애플리케이션의 기능 안쪽에 숨겨져 있어, 에이전트가 로그인이나 메뉴 이동 등을 거쳐 공격 가능한 Endpoint를 직접 찾아야 합니다. 이를 통해 알려진 Payload를 실행하는 능력뿐만 아니라 공격 표면을 탐색하는 능력도 평가합니다.
PostExploitBench는 8개의 기업형 Cyber Range와 156대의 내부 호스트로 구성됩니다. 이 가운데 실제 공격 체인에 포함된 호스트는 43대이며, 나머지 113대는 Decoy입니다.
평가에는 내부 정찰, Credential Discovery, 권한 상승, 측면 이동, Persistence, Defense Evasion 등 12개 범주의 Post-Exploitation 기술이 포함됩니다. 일부 환경에서는 호스트가 주기적으로 재시작되거나 방어 프로그램이 Payload를 차단하며, 에이전트형 방어자가 반복 로그인 실패와 과도한 스캔에 반응하기도 합니다.
AgentCyberRange는 에이전트에게 제공하는 정보에 따라 난이도를 Level 0부터 Level 2까지 구분합니다.
| 난이도 | Web Exploitation | Post Exploitation |
|---|---|---|
| Level 0 | Target URL만 제공 | 진입점 IP만 제공 |
| Level 1 | 취약한 URL 제공 | Network Topology 제공 |
| Level 2 | 취약점 유형까지 제공 | 구체적인 CVE 또는 취약점 정보 제공 |
이를 통해 에이전트가 공격 기술이 부족해서 실패했는지, 공격할 위치와 정보를 찾지 못해서 실패했는지 구분할 수 있습니다.

4. Cage Pipeline
연구진은 서로 다른 AI 에이전트를 같은 조건에서 반복 평가하기 위해 CAGE(Cyber Agent Evaluation)라는 자동화 파이프라인을 개발했습니다.
CAGE는 Codex, Claude Code, Qwen Code처럼 실행 방식이 다른 에이전트를 공통 인터페이스로 연결합니다. 각 실험을 격리된 Container에서 실행하며 모델 상호작용, Token 사용량, 실행 과정과 종료 원인을 기록합니다.
또한 에이전트가 스스로 성공했다고 보고하는 것만으로는 성공으로 인정하지 않습니다. 실제 환경에서 관찰할 수 있는 공격 결과를 Verifier가 확인합니다.
- SQL Injection을 통해 DB의 무작위 Canary 값을 읽었는지 확인
- Benchmark가 의도한 Endpoint를 실제로 공격했는지 대조
- 일반 권한 장악은
/tmp아래의 Marker 파일로 확인 - Root 권한 장악은
/root아래의 Marker 파일로 확인
이처럼 LLM의 답변이 아닌 실제 보안 효과를 기준으로 채점한다는 점이 CAGE의 중요한 특징입니다.
다만 Marker 기반 검증은 일부 단계까지 진행한 결과나, 미리 정의하지 않은 유효한 공격 경로를 놓칠 수 있습니다. 정답에 없는 취약점은 별도의 수동 검증이 필요합니다.
5. Experimental Evaluation
연구진은 GPT-5.5, Claude Opus 4.7, GLM-5.1, DeepSeek-V4-Pro, Qwen-3.7-Max, Kimi-2.6의 여섯 모델·에이전트 조합을 평가했습니다.
모든 에이전트에는 nmap, ffuf, Metasploit, sqlmap, frpc, hydra 등 실제 침투 테스트에서 사용하는 도구가 제공되었습니다. Web Exploitation은 150 Step, Post Exploitation은 500 Step으로 제한했으며, 각 작업에는 최대 2시간이 주어졌습니다.
논문에서는 결과를 다음 세 가지 지표로 구분합니다.
| 지표 | 의미 |
|---|---|
| Pass@1 | 한 번의 실행에서 얻은 성공률 |
| Pass@3 (Avg.) | 독립적인 세 번의 실행 성공률을 평균한 값 |
| Pass@3 (Max) | 세 번 중 한 번이라도 성공하면 해결한 것으로 계산한 값 |
힌트가 없는 Level 0에서 GPT-5.5와 Codex 조합이 가장 높은 성능을 기록했습니다.
| 평가 항목 | Pass@1 | Pass@3 (Avg.) | Pass@3 (Max) |
|---|---|---|---|
| Web Exploitation | 19.09% | 16.06% | 28.18% |
| Post Exploitation | 31.71% | 31.71% | 43.90% |
Web Exploitation에서 GPT-5.5는 Pass@3 (Max) 기준으로 110개 중 31개의 고유 취약점을 발견했습니다. 하지만 초기 URL에서 취약한 Endpoint까지 도달하는 과정이 길어질수록 탐지율이 크게 낮아졌습니다. Vulnerability Depth 2에서는 탐지율이 35%였지만, Depth 6에서는 11%까지 감소했습니다.
취약한 URL을 알려 주는 Level 1에서 성능이 크게 상승한 결과도 Endpoint Discovery가 주요 병목이라는 점을 보여 줍니다.
Post Exploitation에서는 에이전트가 방어 프로그램에 의해 Webshell이 삭제되자 Payload를 변형하여 다시 거점을 확보하는 적응형 공격을 수행했습니다. 반면 Honeypot과 취약점이 없는 호스트에 많은 Step을 소비하고, 반복적인 스캔으로 경고 로그를 남기는 모습도 보였습니다.
또한 Shell을 획득한 뒤 Credential과 내부 정보를 체계적으로 찾고, 이를 다음 호스트의 공격으로 연결하는 과정에서 자주 실패했습니다. 최신 에이전트가 Credential Reuse, Tunneling, Privilege Escalation을 연결한 사례도 있었지만, 같은 조건에서도 실행마다 결과가 크게 달라 아직 안정적인 자율형 공격자라고 보기는 어려웠습니다.
실험 도중 GPT-5.5와 Codex는 Benchmark 정답에 포함되지 않았던 ComfyUI의 Arbitrary File Write Zero-day도 발견했습니다. 이는 현재의 AI 에이전트가 알려진 취약점을 재현하는 것뿐만 아니라, 실제 애플리케이션에서 새로운 취약점을 발견할 가능성도 보여 줍니다.


6. Discussion
AgentCyberRange는 최신 AI 에이전트가 실제 웹 취약점을 Exploit하고, 여러 네트워크에서 Credential Reuse와 권한 상승, Tunneling을 연결하며, 방어에 맞춰 Payload를 변형할 수 있음을 보여 줍니다.
그러나 다음과 같은 한계도 확인되었습니다.
- 깊은 Endpoint와 애플리케이션 기능을 탐색하는 능력
- 공격 가치가 높은 Target의 우선순위 판단
- Credential과 내부 정보의 체계적인 수집
- 여러 단계로 구성된 공격 계획의 유지
- 동일한 조건에서 결과를 반복하는 안정성
- Honeypot과 불필요한 경고를 피하는 은밀성
논문은 현실적인 Cyber Range 평가가 최신 AI 시스템의 공격 능력을 관찰하기 위한 핵심 평가 방식이 되어야 한다고 설명합니다.
다만 Phishing, Windows Domain 공격, Cloud IAM 악용, Supply Chain 공격과 Social Engineering은 이번 평가 범위에 포함되지 않았습니다.
결과 역시 사용한 모델, Agent Harness, Prompt, Tool과 Budget에 따라 달라질 수 있습니다.
7. Conclusion
결론적으로 AgentCyberRange는 최신 AI 에이전트가 실제 웹 애플리케이션을 공격하고, 기업형 내부망에서 Post Exploitation을 수행하며, 방어에 맞춰 공격 방법을 변경할 수 있음을 보여 줍니다.
그러나 공격 표면 탐색, 정보 연결, Target 우선순위 설정과 긴 공격 체인의 안정성에는 여전히 한계가 있었습니다.
해당 논문에서 프로젝트를 위해 아래의 내용들을 참고할 수 있습니다.
- AgentCyberRange의 결과는 Decoy, 깊은 기능 경로, 불필요한 공격 표면, 동적으로 반응하는 방어 환경이 에이전트의 탐색 비용을 증가시킬 가능성을 보여 줍니다.
- 향후 PoC에서는 공격 성공 여부뿐만 아니라 다음 항목을 함께 측정할 필요가 있습니다.
- 성공까지 사용한 Step과 Tool Call
- Token 사용량과 실행 시간
- 추정 API 비용
- 실패와 재시도 횟수
- Decoy와 무관한 Endpoint에 소비한 행동 수
- 위 항목은 AgentCyberRange가 공식적인 저항성 지표로 제안한 것은 아닙니다.
- 논문에서 기록한 Step, Token Cost, 시간과 실패 패턴을 바탕으로 RUBY 프로젝트에 적용해 볼 평가 항목입니다.
- 또한 논문에서는 같은 조건에서도 실행마다 결과가 달랐고, 차단된 Payload를 변형해 다시 공격하는 행동도 관찰되었습니다.
- 따라서 한 번의 공격을 막은 결과만으로 저항력을 판단하기보다는, 반복·적응형 공격에서도 자원 소모 증가가 유지되는지 보조적으로 확인해야 합니다.

'Security > Paper & Report' 카테고리의 다른 글
| [Report] Cloudflare AI Labyrinth (0) | 2026.08.13 |
|---|---|
| [Paper] HackWorld: Evaluating Computer-Use Agents on Exploiting Web Application Vulnerabilities (0) | 2026.08.10 |
| [Paper] PentestGPT: Evaluating and Harnessing Large Language Models for Automated Penetration Testing (0) | 2026.08.07 |
| [Report] LLM OWASP #10: 2025 무제한 소비 (0) | 2026.04.24 |
| [Report] LLM OWASP #09: 2025 허위 정보 (0) | 2026.04.23 |