PAPER 3

[Paper] AGENTCYBERRANGE: Benchmarking Frontier AISystems in Realistic Cyber Ranges

※ 본 포스트는 "WHS 4th 팀 프로젝트"에 앞서 선행 연구 학습을 위해 읽은 논문의 요약본입니다.※ 비영리적인 순수한 학습 기록용입니다.※ 저작권 문제가 있을 경우, 즉시 수정 또는 삭제하겠습니다. 포스팅에 앞서 해당 논문은 아래의 링크에서 확인할 수 있습니다.[논문 바로가기]최첨단 AI 시스템은 코드베이스 검사, 취약점 탐지 및 악용을 포함한 사이버 보안 작업에서 점점 더 많은 능력을 발휘하고 있습니다. 그러나 이러한 공격 능력을 평가하는 것은 개방적이고 재현 가능하며 여러 호스트로 구성된 사이버 훈련장(cyber ranges)에 대한 제한된 접근으로 인해 여전히 제약을 받습니다. 기존의 공개 벤치마크는 CTF 문제 해결, 취약점 재현, 익스플로잇 생성과 같은 고립된 기술들을 포착하지만, 노출된 ..

[Paper] HackWorld: Evaluating Computer-Use Agents on Exploiting Web Application Vulnerabilities

※ 본 포스트는 "WHS 4th 팀 프로젝트"에 앞서 선행 연구 학습을 위해 읽은 논문의 요약본입니다.※ 비영리적인 순수한 학습 기록용입니다.※ 저작권 문제가 있을 경우, 즉시 수정 또는 삭제하겠습니다. 포스팅에 앞서 해당 논문은 아래의 링크에서 확인할 수 있습니다.[논문 바로가기]웹 애플리케이션은 중요한 서비스와 민감한 데이터로 향하는 관문 역할을 하기 때문에 사이버 공격의 주요 표적이 됩니다.전통적인 모의 해킹(penetration testing)은 비용이 많이 들고 고도의 전문 지식을 요구하여, 지속적으로 성장하는 웹 생태계에 맞춰 그 규모를 확장하기가 어렵습니다.언어 모델 에이전트가 사이버 보안 분야에서 가능성을 보여주고 있기는 하지만, 현대의 웹 애플리케이션은 시각적 이해, 동적 콘텐츠 처리, ..

[Paper] PentestGPT: Evaluating and Harnessing Large Language Models for Automated Penetration Testing

※ 본 포스트는 "WHS 4th 팀 프로젝트"에 앞서 선행 연구 학습을 위해 읽은 논문의 요약본입니다.※ 비영리적인 순수한 학습 기록용입니다.※ 저작권 문제가 있을 경우, 즉시 수정 또는 삭제하겠습니다.포스팅에 앞서 해당 논문은 아래의 링크에서 확인할 수 있습니다.[논문 바로가기]시스템 보안을 보장하는 데 필수적인 산업 현장의 침투 테스트는 인간 전문가에게 요구되는 광범위한 전문 지식 때문에 전통적으로 자동화에 어려움을 겪어왔습니다.대규모 언어 모델(LLM)은 다양한 영역에서 상당한 발전을 보여왔으며, 그 새로운 능력들은 산업 혁신의 잠재력을 시사합니다.본 연구에서는 실제 침투 테스트 대상을 사용하여 포괄적인 벤치마크를 구축하고, 이를 통해 침투 테스트 영역에서 LLM의 역량을 탐구합니다.연구 결과, L..