Security/Paper & Report

[Report] LLM OWASP #08: 2025 벡터 및 임베딩 취약점

Opal1031 2026. 4. 23. 18:36
※ 본 포스트는 "SW 산학협력 프로젝트"에 앞서 LLM 및 AI와 관련된 학습을 위해 읽은 논문의 요약본입니다.

※ 비영리적인 순수한 학습 기록용입니다.

※ 저작권 문제가 있을 경우, 즉시 수정 또는 삭제하겠습니다.

포스팅에 앞서 해당 논문은 아래의 링크에서 확인할 수 있습니다.
OWASP Top 10 2025 번역본


LLM08: 2025 벡터 및 임베딩 취약점

여덟 번째 챕터의 주제는 "벡터 및 임베딩 취약점"이다.

 

벡터 및 임베딩 취약점

LLM과 RAG를 활용하는 시스템에서 중요한 보안 위험을 초래할 수 있다.

 

RAG (Getrieval-Augmented Generation, 검생 증강 생성)

LLM이 답변을 생성하기 전에 외부의 신뢰 가능한 지식 기반에서 관련 정보를 검색하여, 이를 바탕으로 정확하고 최신화 된 응답을 제공하는 AI 기술


일반적 취약점 예시

무단 접근 및 데이터 유출

  • 부적절하거나 미흡한 접근 제어정책으로 민감 정보를 포함한 임베딩에 무단 접근 가능
  • RAG 과정에서 저작권 자료와 관련한 법적 문제 발생 가능

교차 커넥스트 정보 유출 및 데이터 연합 충돌

  • 멀티테넌트 환경에서 동일한 벡터 DB를 공유할 경우 컨텍스트 유출 발생 가능
  • 여러 출처 데이터가 서로 충돌하여 데이터 연합 오류 발생 가능

    멀티테넌트 환경
    하나의 소프트웨어 인스턴스나 인프라를 여러 고객(테넌트)이 공유하는 아키텍쳐

임베딩 역추적 공격

임베딩 취약점을 악용하여 원본 정보 역추적 및 데이터 원본 복원으로 기밀성 침해

 

데이터 오염 공격

오염된 데이터는 모델 출력 조작에 사용 가능

 

모델 행동 변화

RAG 과정에서 모델 동작을 의도치 않게 변경하여, 특정 애플리케이션에서의 모델의 효과성 저하


예방 및 완화 전략

01. 권한 및 접근 제어

세분화된 접근 제어 구현 및 서로 다른 이용자 그룹 간의 무단 접근 방지

 

02. 데이터 검증 및 출처 인증

  • 지식 소스의 신뢰성 확보를 위한 강력한 데이터 검증 파이프라인 구축
  • 정기적인 감사 수행을 통해 무결성 검증 및 데이터 오염 여부 확인

03. 데이터 결합 및 분류 검토

  • 서로 다른 출처의 데이터 결합 시, 결합된 데이터셋 검토
  • 지식 DB내의 접근 수준 제어 및 데이터 불일치 오류 방지

04. 모니터링 및 고링

검색 활동에 대한 변경 불가능한 로그 유지 및 모니터링 시스템 구축


공격 시나리오 예시

#01. 데이터 오염

이력서에 숨겨진 텍스트까지 시스템이 포함하여 분석 -> 숨겨진 명령을 따르는 결과 제공

  • 서식을 무시하고 숨겨진 내용을 감지할 수 있는 텍스트 추출 도구 도입으로 해결

#02. 접근 통제 실패 및 데이터 유출 위험

멀티테넌트 환경에서 특정 그룹의 임베딩이 다른 그룹의 LLM 쿼리에 검색 -> 민감한 비즈니스 정보 유출

  • 권한 인식 벡터 DB 구현으로 접근 제한

#03. 기본 모델의 행동 변화

검색 증강 후 기본 모델의 동작 일부 변경 -> 답변의 유용성 하락

  • RAG가 기본 모델의 행동에 미치는 영향 모니터링
  • 증강 프로세스의 적절한 조정을 통한 특성 유지