TL;DR

  • 일본의 Layer8 Co., Ltd.가 개발한 인공지능( AI) 침투 테스트 에이전트 Trident가 2026년 3분기 HackerOne VDP 순위 세계 1위를 기록했으며, 3인 팀이 벤처캐피털 자금 없이 개발하고 하루 약 1시간의 검토·제출만으로 운영함.
  • Trident는 웹 애플리케이션의 취약점을 자율적으로 찾고, 악용 조건과 영향을 검증하며, 50개 프로그램에서 총 568건의 보고서를 분류 심사 대상으로 제출함.
  • 내부용 부품 주문 시스템 공격 사례에서 인증 우회와 SQL 인젝션을 연결해 계정 없이 무단 접근하고, 데이터 유출·변조 및 업무 애플리케이션 접근 위험을 확인함.
  • 24개 에이전트 다중 에이전트 구조와 프롬프트·시스템 수준의 이중 가드레일을 적용해 각 단계의 조정과 자동 실행 안전성을 확보함.
  • 기존 벤치마크의 상한 포화와 단계별 성능 측정 한계를 해결하기 위해 자체 벤치마크를 개발하고, 단계별 성능 개선과 비용 최적화를 지속 평가함.

서론

  • Layer8 Co., Ltd.는 연구 계정 l8_trident가 AI 침투 테스트 에이전트 Trident를 기반으로 2026년 3분기(7월 1일~9월 30일) HackerOne VDP 순위 세계 1위에 올랐다고 발표함.
  • Trident는 웹 애플리케이션에서 취약점을 자율적으로 찾고, 이를 악용하는 데 필요한 조건과 그 영향을 검증함.
  • 일본의 소프트웨어·보안 엔지니어 3명으로 구성된 팀은 2025년 5월 개발을 시작한 뒤 벤처캐피털 자금 없이 성능과 안전성을 폭넓게 개선했으며, HackerOne VDP를 통해 실제 시스템에서 효과를 검증함.
  • Trident를 개발한 일본 엔지니어 3명 중 1명이 HackerOne 운영을 담당했으며, 매일 약 1시간 동안 Trident의 결과를 검토하고 제출함. 그 밖의 모든 단계는 자동화됨.

HackerOne 성과

  • 취약점 공개 프로그램(VDP)은 기업이나 조직이 정한 정책에 따라 외부 연구자가 취약점을 테스트하도록 허용하는 프로그램임.
  • 취약점 보고서는 악용에 필요한 조건과 그에 따른 사업상 영향을 입증해야 하며, 악용 가능한 영향이 없는 발견 사항은 분류 심사 대상으로 접수되지 않음.
  • 2026년 7월 1일~9월 30일 사이 50개 프로그램에서 총 568건의 보고서가 분류 심사됨.
  • 치명적(Critical): 65건
  • 높음(High): 104건
  • 중간(Medium): 378건
  • 낮음(Low): 21건
  • 합계: 568건

공격 사례 연구

  • 다음은 식별 정보를 생략한 실제 공격 사례임.
  • 대상은 내부용으로 설계된 대리점 부품 주문 시스템임. Trident는 인증 우회와 SQL 인젝션을 연결해 유효한 계정 없이 애플리케이션을 공격함.
  • Trident는 먼저 서버가 브라우저에서 전송된 정보를 신뢰해 세션을 생성하고, ID 공급자(IdP)의 인증 결과를 확인하지 않는 점을 발견함. 다만 조작한 사용자 이름은 등록 사용자와 대조하는 후속 검사에서 거부됨.
  • 다음 페이지에서 해당 검사는 세션에 저장된 사용자 이름을 정제 없이 SQL 쿼리에 직접 삽입함. 이에 따라 SQL 인젝션으로 쿼리 조건을 바꾸고 등록 사용자 검사를 우회할 수 있었음.
  • 남은 검사는 제출된 사이트 코드와 등록 사용자에게 할당된 코드를 비교함. 코드가 일치하지 않으면 오류 메시지에 올바른 코드가 노출됐으며, 해당 코드로 요청을 다시 제출하면 업무 애플리케이션에 무단 접근할 수 있었음.
  • 취약점으로 인한 결과는 다음과 같음.
  • 데이터 공개·변조 위험: SQL 인젝션으로 기밀 정보를 추출하고 데이터를 수정할 수 있음. 주문 데이터 변조는 부품 조달에도 차질을 일으킬 수 있음.
  • 업무 애플리케이션 무단 접근: 인증 우회로 외부 공격자가 사용자 관리 및 주문 관리 화면에 접근할 수 있음.
  • 해당 취약점 보고서를 신속히 제출함.

워크플로

  • Trident는 애플리케이션 매핑과 취약점 발견부터 악용 검증, 재현 단계·증거·영향 기록까지 자율적으로 수행하는 AI 에이전트를 중심으로 구축됨.
  • 결과는 취약점 등록부에 누적되며, 사내 보안 엔지니어 1명이 보고서를 검토하고 제출함.
  • 이러한 역할 분담으로 소규모 팀이 오탐 없이 대규모 테스트를 수행할 수 있었음.

아키텍처와 설계 결정

  • Trident는 정찰, 취약점 분석, 악용, 검증 등의 작업을 24개 에이전트가 함께 수행하는 다중 에이전트 아키텍처를 사용함.
  • AI 침투 테스트 에이전트를 자율적으로 작동시키는 과정에서 두 가지 주요 설계 과제가 있었음.
  • 정찰, 취약점 발견, 악용, 검증에 서로 다른 요구 사항을 적용하는 방법
  • 사람의 감독 없이 범위 밖 접근과 과도한 요청을 방지하는 방법
  • 가장 중요한 두 가지 설계 결정은 다음과 같음.

다중 에이전트 아키텍처를 선택한 이유

  • Trident를 다중 에이전트 시스템으로 구축한 이유는 다음과 같음.
  • 단계별 조정이 쉬움: 모델, 시스템 프롬프트, 도구 집합, 가드레일을 각 단계에 맞춰 독립적으로 최적화할 수 있음. 정찰과 악용에는 매우 다른 기능과 가드레일이 필요하므로 이러한 유연성이 중요함.
  • 단계별 오탐 검사기 추가 가능: 자동 필터를 각 단계에 맞춰 최적화할 수 있음.
  • 상태 관리 분리 가능: 일부 단계는 자체 상태 관리나 망각 동작을 적용할 때 이점을 얻음.
  • 여러 에이전트와 공유 상태를 관리하면 복잡성이 커지는 상충 관계가 있음. 그럼에도 이점이 비용보다 크다고 판단함.

자율 실행을 위한 가드레일

  • 사람의 개입 없이 완전 자동화하는 방식을 선택했으므로, 사람의 감독이 없는 상태에서 안전하게 작동하도록 가드레일을 마련하는 일이 필수임.
  • Trident는 두 계층으로 가드레일을 구현함.
  • 프롬프트 수준 가드레일: 각 에이전트의 시스템 프롬프트에 허용된 범위와 금지된 동작을 명시함.
  • 시스템 수준 가드레일: 모든 트래픽이 가로채기 프록시인 L7 Egress Gateway를 통과하며, 범위 밖 호스트로 향하는 요청을 차단하고 요청 속도 제한을 적용하며 알 수 없는 프로토콜을 거부함.
  • 프롬프트 수준 가드레일에만 의존하면 LLM이 지시를 무시하거나 잘못 이해하는 순간 안전성이 무너짐. 완전 자동화에는 LLM의 동작과 독립적으로 제약을 강제하는 시스템 수준 가드레일이 필요함.
  • 가로채기 프록시를 통과하는 요청과 응답도 기록되며, 검사를 위해 스캐너로 자동 전송됨.

기존 벤치마크만으로는 부족했던 이유

  • 다중 에이전트 아키텍처의 장점인 개별 단계 조정을 지속하려면 단계별 성능 차이를 측정할 수 있는 벤치마크가 필요함.
  • PortSwigger Academy Lab과 XBOW Benchmark는 AI 침투 테스트 에이전트 평가에 흔히 사용됨.
  • 두 벤치마크는 전체 공격 체인의 역량을 측정하는 데 유용하지만, Trident 개발 과정에서 다음과 같은 한계가 드러남.
  • 모델 역량이 향상되면서 기존 벤치마크가 상위 구간에서 포화되기 시작함.
  • 웹 브라우저를 이용한 초기 정찰이나 악용 단계의 안전성 검사처럼 세밀한 조정 차이를 측정하기 어려움.
  • 모델을 바꾼 뒤 특정 단계만 성능이 나빠지는 회귀를 발견하기 어려움.
  • 이에 단계별 성능 개선과 비용 최적화를 위한 자체 벤치마크를 개발하고, 이를 지속 평가에 사용함.

결론

  • HackerOne VDP 작업을 통해 완전 자동화된 취약점 발견과 악용 검증 방식인 Trident의 효과를 실제 시스템에서 검증함.
  • 하루 약 1시간 동안 한 사람이 보고서를 검토하고 제출하는 운영으로 2026년 3분기 세계 1위를 기록함.
  • 더 발전된 공격 체인의 자동화와 더 폭넓은 대상 지원을 위해 연구개발을 이어갈 예정임.