Security/Paper & Report

[Paper] HackWorld: Evaluating Computer-Use Agents on Exploiting Web Application Vulnerabilities

Opal1031 2026. 8. 10. 14:59
※ 본 포스트는 "WHS 4th 팀 프로젝트"에 앞서 선행 연구 학습을 위해 읽은 논문의 요약본입니다.

※ 비영리적인 순수한 학습 기록용입니다.

※ 저작권 문제가 있을 경우, 즉시 수정 또는 삭제하겠습니다.

 

포스팅에 앞서 해당 논문은 아래의 링크에서 확인할 수 있습니다.
[논문 바로가기]

웹 애플리케이션은 중요한 서비스와 민감한 데이터로 향하는 관문 역할을 하기 때문에 사이버 공격의 주요 표적이 됩니다.

전통적인 모의 해킹(penetration testing)은 비용이 많이 들고 고도의 전문 지식을 요구하여, 지속적으로 성장하는 웹 생태계에 맞춰 그 규모를 확장하기가 어렵습니다.

언어 모델 에이전트가 사이버 보안 분야에서 가능성을 보여주고 있기는 하지만, 현대의 웹 애플리케이션은 시각적 이해, 동적 콘텐츠 처리, 그리고 오직 컴퓨터 사용 에이전트(CUAs, Computer-Use Agents)만이 수행할 수 있는 다단계 상호작용을 요구합니다. 그러나 그래픽 인터페이스(GUI)를 통해 취약점을 발견하고 공격(exploit)하는 이들의 능력은 아직 거의 연구되지 않은 상태입니다.

이에 우리는 시각적 상호작용을 통해 웹 애플리케이션 취약점을 공격하는 CUA의 능력을 체계적으로 평가하기 위한 최초의 프레임워크인 HackWorld를 제안합니다.

(위험 요소가 제거된) 인위적으로 정제된 기존 벤치마크들과 달리, HackWorld는 11개 프레임워크와 7개 프로그래밍 언어에 걸친 36개의 실제 애플리케이션을 포함하며, 인젝션 취약점, 인증 우회, 안전하지 않은 입력 처리와 같은 현실적인 결함들을 담고 있습니다. 이 프레임워크는 캡처 더 플래그(CTF, Capture-the-Flag) 방식을 사용하여, 복잡한 웹 인터페이스를 탐색하는 동시에 이러한 약점들을 식별하고 공격하는 CUA의 역량을 테스트합니다.

최첨단 CUA들을 평가한 결과 우려스러운 동향이 드러났습니다. 바로 공격 성공률이 12% 미만에 불과하며, 사이버 보안에 대한 인식이 낮다는 점입니다. CUA는 다단계 공격 계획에 자주 실패하며 보안 도구를 잘못 사용하는 경향을 보였습니다.

이러한 결과는 웹 보안 환경에서 CUA가 가진 현재의 한계를 노출시키며, 효과적인 취약점 탐지 및 공격이 가능한 '보안을 잘 인지하는(security-aware)' 에이전트를 개발해야 할 필요성과 기회를 강조합니다.

 

이번에 리뷰할 논문은 2025년 공개되고 ICLR 2026에 발표된 "HackWorld"입니다.

 

이전에 읽었던 PentestGPT에서는 LLM이 침투 테스트 과정에서 어느 정도의 능력을 보이는지 평가하고, 긴 공격 과정에서 발생하는 Context Loss를 Agent 구조를 통해 보완하는 방법을 다뤘습니다.

 

HackWorld는 여기서 조금 다른 질문에서 출발합니다.

 

최근의 Computer-Use Agent(CUA)는 단순히 텍스트로 명령을 생성하는 것을 넘어 화면을 직접 보고 마우스와 키보드를 조작하면서 컴퓨터를 사용할 수 있습니다. 그렇다면 이러한 Agent 실제 애플리케이션을 직접 탐색하면서 취약점을 발견하고 공격까지 수행할 있는가가 논문의 핵심 질문입니다.


Ch01. Introduction

기존의 Computer-Use Agent 연구에서는 WebArena, OSWorld와 같은 Benchmark를 이용해 웹사이트 탐색이나 일반적인 컴퓨터 작업 수행 능력을 평가해 왔습니다. 하지만 이러한 환경은 대부분 정상적으로 동작하는 애플리케이션을 가정하고 있으며, 웹 애플리케이션 내부에 존재할 수 있는 보안 취약점은 평가 대상으로 거의 고려하지 않았습니다.

 

실제 웹 환경에는 SQL Injection, XSS, Authentication Bypass, 잘못된 Access Control과 같은 다양한 취약점이 존재할 수 있습니다.

따라서 Agent가 실제 환경에서 사용되기 시작한다면 단순히 화면을 잘 조작하는 것뿐만 아니라, 보안에 민감한 상황에서 어떤 행동을 하는지 역시 평가할 필요가 있습니다.

 

논문에서는 이를 확인하기 위해 HackWorld를 제안합니다.

HackWorld는 일반적인 Computer-Use Agent에게 취약한 웹 애플리케이션과 보안 도구가 포함된 환경을 제공하고, Agent가 직접 취약점을 찾아 Flag를 획득할 수 있는지를 평가하는 Benchmark입니다.

 

이 논문의 핵심 질문은 다음과 같이 정리할 수 있습니다.

Computer-Use Agent는 GUI 환경을 직접 조작하면서 웹 애플리케이션의 취약점을 발견하고 Exploit할 수 있는가?

 

또 하나 중요하게 볼 수 있는 질문은 다음과 같습니다.

공격에 실패한다면 병목은 화면 인식과 조작 능력에 있는가, 아니면 보안 추론과 공격 전략에 있는가?

 

이를 확인하기 위해 연구진은 HackWorld 환경을 구축하고 여러 CUA를 서로 다른 Observation Space에서 평가한 뒤, 성공률뿐 아니라 Agent가 어떤 보안 도구를 사용하고 어떤 과정에서 실패하는지도 함께 분석합니다.

 

Figure 1

Agent가 환경을 직접 탐색하면서 Local File Inclusion 취약점을 발견하고, 해당 취약점을 이용해 최종적으로 Flag를 획득하는 전체 흐름을 보여줍니다.


Ch02. HackWorld Environment

HackWorld의 가장 큰 특징은 Agent가 단순히 명령어나 HTTP Request만 생성하는 것이 아니라 Kali Linux의 GUI 환경 전체를 직접 조작한다는 점입니다.

 

Figure 2

Figure 2는 HackWorld의 전체 평가 구조를 보여줍니다.

 

기존 연구에서는 LLM을 이용한 사이버 보안 능력을 평가하기 위해 CyberSecEval, Cybench, NYU CTF Bench와 같은 다양한 Benchmark가 제안되었습니다. 이러한 연구들은 LLM이 취약점을 분석하거나 CTF 문제를 해결할 수 있는지를 평가했지만, 대부분 텍스트 기반 환경이나 명령 실행을 중심으로 구성되어 있습니다. 한편 WebArena, OSWorld와 같은 연구에서는 화면을 보고 컴퓨터를 직접 조작하는 Computer-Use Agent의 능력을 평가했지만, 보안 취약점 공격은 주요 평가 대상이 아니었습니다.

 

HackWorld는 이 두 연구 흐름을 결합해 Computer-Use Agent가 GUI 환경에서 실제 보안 도구를 사용하며 웹 취약점을 공격할 수 있는지를 평가합니다.


Ch03. HackWorld

HackWorld는 실제 Web CTF 문제를 기반으로 Computer-Use Agent의 웹 공격 능력을 평가하는 Benchmark입니다.

총 36개의 Challenge로 구성되어 있으며 NYU CTF Bench, Cybench, InterCode-CTF의 문제를 사용합니다.

 

Benchmark에는 7개의 프로그래밍 언어와 11개의 Web Framework가 포함되어 특정 기술 스택에만 편향되지 않도록 구성했습니다.

Agent에게는 Kali Linux 환경이 제공되며 Browser뿐만 아니라 Burp Suite, Nikto, DirBuster, Wfuzz 등 실제 침투 테스트에서 사용하는 보안 도구도 직접 사용할 수 있습니다.

 

Agent는 화면을 관찰하고 필요한 Tool을 선택한 뒤 웹 애플리케이션을 탐색하며, 최종적으로 Flag를 획득하는 것을 목표로 합니다.


Ch04. Experiments

연구진은 Claude-3.5-Sonnet, Claude-3.7-Sonnet, Claude-4-Sonnet, Claude-4-Opus와 UI-TARS, Qwen-2.5-VL 등의 모델을 HackWorld에서 평가했습니다. 또한 화면 정보를 제공하는 방식이 공격 성능에 영향을 주는지 확인하기 위해 Screenshot, Screenshot + Accessibility Tree, Set-of-Marks의 세 가지 Observation Space를 사용했습니다.

 

실험 결과 가장 좋은 성능을 보인 Claude-3.7-Sonnet도 개별 조건에서 최대 11.11%의 성공률을 기록했습니다. 또한 Accessibility Tree나 Set-of-Marks를 추가해 Agent의 화면 인식을 보조하더라도 공격 성공률이 크게 증가하지 않았습니다.

 

이를 통해 현재 Agent의 주요 한계가 단순한 GUI 인식 능력보다는 수집한 정보를 연결하고 공격 방법을 결정하는 Reasoning과 Planning 과정에 있다는 것을 확인할 수 있습니다. 논문에서는 Tool Usage도 함께 분석했는데, Tool을 많이 사용하는 Agent가 반드시 높은 성능을 보이지는 않았습니다. 중요한 것은 Tool 사용 횟수보다 적절한 Tool을 선택하고, 실행 결과를 다음 공격 단계에 제대로 활용하는 능력이었습니다.

 

Table 3


Ch05. Analysis

연구진은 Agent의 공격 성능에 영향을 줄 수 있는 여러 요소를 추가로 분석합니다.

특히 Agent에게 허용되는 Step 수를 증가시켜 더 많은 탐색과 공격을 수행할 수 있도록 했을 때 성능이 어떻게 변화하는지 확인했습니다.

 

Table 4

Claude-3.7-Sonnet의 경우 15 Step과 50 Step에서는 11.1%의 성공률을 기록했지만, 100 Step에서는 16.7%까지 증가했습니다. 즉 동일한 Agent라도 공격을 수행할 수 있는 실행 Budget이 증가하면 추가적인 취약점을 발견하거나 공격에 성공할 가능성이 높아질 수 있습니다.

 

이는 Agent의 공격 능력을 평가할 때 모델 성능뿐만 아니라 Step, 시간, Token 등 Agent에게 주어진 실행 Budget도 함께 고려해야 한다는 것을 보여줍니다.


Ch06. Discussion and Future Work

연구진은 Agent의 실행 과정을 분석해 현재 Computer-Use Agent가 웹 공격 과정에서 반복적으로 보이는 실패 패턴을 확인했습니다.


대표적으로 잘못된 Tool 선택, Tool Output 활용 실패, 실패 이후 계획 수정 부족, 불완전한 Enumeration, Session 관리 문제, Service 오분류, 피상적인 SQL Injection 테스트, 동일 행동을 반복하는 Dead Loop 등이 나타났습니다.

 

이러한 실패 사례를 종합하면 Agent가 개별적인 보안 지식이나 Tool 사용 방법을 전혀 모르는 것은 아니지만, 여러 단계에서 얻은 정보를 유지하고 하나의 공격 전략으로 연결하는 능력이 부족하다는 것을 확인할 수 있습니다. 또한 기존의 보안 Tool은 대부분 사람이 사용하는 것을 기준으로 설계되어 있기 때문에 긴 CLI 출력이나 비정형적인 Error Message를 Agent가 다시 해석해야 한다는 문제도 있습니다.

 

논문에서는 향후 Agent가 보안 Tool을 더 효과적으로 사용할 수 있도록 Machine-readable Output이나 구조화된 Interface와 같은 Agent eXperience(AX)를 고려할 필요가 있다고 제안합니다.


Ch07. Conclusion

HackWorld는 Computer-Use Agent가 실제 GUI 환경에서 웹 취약점을 얼마나 발견하고 Exploit할 수 있는지를 평가하기 위한 Benchmark입니다.

 

실험 결과 현재의 Agent는 화면을 직접 조작하고 실제 보안 도구를 사용할 수 있지만, 전체적인 웹 공격 성공률은 아직 낮은 수준이었습니다. 특히 단순한 화면 인식보다는 수집한 정보를 연결하고, 공격 계획을 수립하고, 실패 이후 전략을 수정하며, Tool의 결과를 다음 단계에 활용하는 과정에서 많은 실패가 발생했습니다.

 

따라서 현재 Computer-Use Agent의 웹 공격 능력에서 중요한 부분은 단순한 Perception보다는 Security-aware Reasoning과 장기적인 Attack Planning 능력이라고 볼 수 있습니다.


해당 논문에서 프로젝트를 위해 아래의 내용들을 참고할 수 있습니다.

  • HackWorld에서 확인된 Agent의 8가지 실패 패턴을 자동화 공격 Agent의 공통적인 약점으로 참고할 수 있습니다.
  • 잘못된 Tool 선택, 정보 활용 실패, Plan Repair 부족, Dead Loop 등의 특성을 이용해 Agent의 탐색과 판단 비용을 증가시키는 방향을 고려할 수 있습니다.
  • 공격 성공 여부뿐만 아니라 Step, Token, Tool Call, 실행 시간, 반복 행동 등의 비용을 함께 측정할 수 있습니다.
  • Agent가 잘못된 판단을 한 이후 정상적인 공격 경로로 돌아오기까지 필요한 비용을 Recovery Cost와 같은 지표로 평가할 수 있습니다.
  • 동일한 모델과 공격 조건에서 방어 기법 적용 전후의 공격 성공률과 자원 소비량을 비교하면 시스템의 저항성 증가 정도를 정량적으로 평가할 수 있습니다.