TL;DR

  • Skyvern이 브라우저 에이전트의 RAG 기반 사전 처리 구조를 다시 작성해, Odysseys 벤치마크에서 90.5% 성공률을 기록하고 약 10만 건의 실제 실행에서 속도를 2.3배 높임.
  • 기존 구조는 웹사이트의 상호작용 요소를 정확히 파악하는 DOM 파싱에 의존해, 요소 식별 오류가 전체 실행 실패로 이어지는 병목이었음.
  • 새 구조는 에이전트에 최소한의 초기 문맥만 제공하고, 필요할 때 HTML 스캔과 웹 조작 등 도구를 사용해 추가 정보를 가져오도록 함.
  • 새 구조에서 실행당 평균 시간은 593초에서 262초로, 비용은 0.039달러에서 0.030달러로 감소함.
  • 이미지가 포함된 호출 비율은 27%에서 2.7%로 줄고 프롬프트 캐시 적중률은 27%에서 79.7%로 높아졌으며, 토큰 사용량 증가는 캐시 토큰 할인으로 상쇄됨.

Skyvern이란?

  • Skyvern은 비기술 팀이 프롬프트를 이용해 브라우저 자동화를 구축하도록 돕는 오픈소스 프레임워크임.
  • 모델에 종속되지 않아 Claude 같은 폐쇄형 모델이나 Deepseek 같은 오픈 모델로 실행 가능함.
  • 의료 포털 이용, 송장이나 공과금 청구서 가져오기, 정부 양식 작성, 구직 지원 등 자동화에 수천 개 기업이 활용함.

RAG 기반 구조의 한계

  • 검색 증강 생성(Retrieval Augmented Generation, RAG)은 정보 검색 결과를 대형 언어 모델(LLM)에 전달해 더 나은 판단을 돕는 방식임. 예를 들어 문서에 관해 LLM에 질문하기 전에 문서를 파싱해 모델에 제공할 수 있음.
  • RAG 기반 LLM 프레임워크는 지식 기반에서 정보를 가져와 문맥으로 변환한 뒤, 판단을 위해 LLM에 전달함.
  • Skyvern 첫 버전도 이 방식을 따라 웹사이트를 불러오고, 화면을 캡처하고 주석을 추가한 뒤, 요소 목록을 간결하게 만들어 LLM에 행동을 요청함.
  • 웹사이트의 상호작용 요소를 100% 정확도로 식별할 수 있다면 잘 작동하는 구조였지만, 실제 웹은 복잡해 모든 요소를 정확히 식별하는 일이 어려웠음.
  • 상호작용 요소 식별용 유틸리티는 사실상 새로운 DOM 인터프리터를 만드는 작업으로 변했고, Shadow DOM, iframe, Select2 드롭다운, Kendo UI 위젯, Canvas 요소 등의 처리가 끝없는 과제가 됨.
  • 더 나은 LLM을 사용해도 에이전트 성능이 개선되지 않았으며, DOM 파싱 로직이 병목으로 작용함. 요소를 올바르게 식별하지 못하면 에이전트 실행 전체가 실패함.

LLM에 더 많은 자유 부여

  • RAG 시스템은 주의하지 않으면 전처리 계층이 모든 LLM 호출 전에 항상 실행된다고 가정해, 전처리가 필요한 시점을 LLM이 선택하지 못하게 할 수 있음.
  • LLM의 지시 이행 능력이 부족하던 시기에는 이런 설계가 적절했지만, Opus 4.5 이후 공개된 모델에서는 지시 이행이 큰 문제가 아니게 됨.
  • 코딩 에이전트는 임베딩 기반 코드 검색에서 grep 방식 검색으로 이동 중임. 모델이 필요한 문맥을 가져오기 위해 기본 도구를 사용하는 능력이 향상되고 있기 때문임.
  • Pi 같은 미니멀 코딩 에이전트의 인기가 높아지고 있으며, Prime-intellect 등 Pi 확장 기능은 하네스를 조정하고 에이전트가 필요에 따라 Python 코드를 생성·실행하도록 해 ARC-AGI-3 벤치마크에서 최고 성능을 기록함.
  • 이에 따라 브라우저 에이전트도 최소한의 문맥으로 시작하고, 필요에 따라 추가 문맥을 가져오는 방식이 가능한지 검토함.
  • 새 에이전트에 제공하는 도구는 다음과 같음.
  • 모델이 생성한 JavaScript로 HTML 스캔
  • Click, Type, Scroll, 탭 전환 등 rustwright가 지원하는 웹사이트 동작 수행
  • 스크린샷 촬영
  • 실행을 최종 상태로 표시: 성공 또는 사유를 포함한 실패

벤치마크 및 실제 실행 결과

  • 새 구조가 성능을 높이는 대신 비용을 늘리고 처리 속도를 늦출 것으로 예상함. 같은 작업을 완료하는 데 LLM 호출이 늘어날 것으로 봤기 때문임.
  • 가설 검증을 위해 정확도 측정에는 공개 브라우저 에이전트 벤치마크인 Odysseys를 사용하고, 속도와 비용 측정에는 약 10만 건의 고객 실행을 대상으로 실시간 A/B 테스트를 진행함.

Odysseys 벤치마크 결과

  • Skyvern 3.0은 Odysseys 벤치마크에서 90.5%의 완전 루브릭 성공률을 기록하며 최고 성능을 달성함.
  • 실행 효율도 예상보다 높았으며, 평균 단계 수는 65.4단계임.

프로덕션 A/B 테스트 결과

  • 약 10만 건의 실행에서 Skyvern 2.0과 Skyvern 3.0의 측정 결과는 다음과 같음.
  • 평균 실행 시간: 593초 → 262초, 2.3배 단축
  • 실행당 총비용: 0.039달러 → 0.030달러, 22.5% 감소
  • 새 구조는 예상과 달리 더 빠르고 저렴했음.
  • 이미지가 포함된 스크린샷 사용 비율은 전체 LLM 호출의 27%에서 2.7%로 90% 감소함. 이미지가 포함된 호출은 비전 인코더를 거쳐야 하며, 일반적으로 텍스트 전용 인코더보다 1.7배 느림.
  • 토큰 사용량은 실행당 18만 8,000개에서 28만 6,000개로 52% 증가함.
  • 평균 턴 수, 즉 LLM 호출 수는 6.4회에서 23회로 3.59배 증가했지만, 턴당 토큰 수는 2만 9,000개에서 1만 2,000개로 59% 감소함.
  • 스크린샷이나 HTML을 매 턴마다 불러오지 않으면서 프롬프트에서 캐시할 수 있는 비중이 커져, 프롬프트 캐시 적중률은 27%에서 79.7%로 195% 증가함.
  • 캐시된 토큰에는 70% 할인이 적용되므로, 토큰 사용량 증가에도 전체 비용이 감소함.

브라우저 에이전트는 해결됐을까?

  • 브라우저 에이전트 문제는 아직 해결되지 않았으며, 비용·속도·정확도 세 측면 모두 개선 여지가 있음.
  • 팀은 Jev 같은 ‘시스템 1 모델’이 브라우저 에이전트에서 할 수 있는 역할을 살펴보는 중임.
  • 현재 세대 모델은 64K 문맥 창과 이미지 처리 기능 부재 등 제약이 있으며, 이로 인해 정확도가 받아들이기 어려운 수준으로 떨어짐. 향후 6~12개월 동안 상황이 바뀔 것으로 예상함.
  • Skyvern은 오픈소스 또는 클라우드 버전으로 사용할 수 있음.