
Greptile은 알려진 버그의 69%를 찾아냈고, 발견한 항목 가운데 68%가 실제 문제로 판정됐다. 오픈소스 코드 리뷰 도구 OpenQodex는 각각 31%와 86%였다.
이 글은 오픈소스라는 이유만으로 검증이 부족한 도구를 내놓아도 되는 것은 아니라고 주장한다. 특히 유료 제품의 대체재라고 홍보한다면, 무엇을 시험했고 어디에서 부족했는지 결과를 공개해야 한다는 입장이다.
무엇을 비교했나
글의 화자는 최근 X에서 CodeRabbit을 대체한다는 OpenQodex 광고를 반복해서 본 뒤, 실제 성능을 평가했다. 평가에는 Greptile, OpenQodex, 그리고 코드 리뷰 기능을 추가한 오픈소스 도구 shadowclone이 포함됐다. shadowclone은 에이전트가 사용하는 도구나 모델이 달라도 사용자의 엔지니어링 선호를 따르도록 돕는 도구다.
비교한 것은 알려진 버그를 얼마나 찾아냈는지와 발견 항목 중 실제 문제로 판정된 비율이다. 실제 문제인지를 판단할 때는 두 개의 모델 심판을 사용했다.
| 도구 | 알려진 버그 발견 비율 | 발견 항목 중 실제 문제로 판정된 비율 |
|---|---|---|
| Greptile | 69% | 68% |
| shadowclone 클라우드 봇 | 38% | 96% |
| shadowclone 로컬 리뷰어 | 36% | 91% |
| OpenQodex | 31% | 86% |
shadowclone의 리뷰어는 각 PR에서 세 번 실행됐다. 글의 화자는 자신의 봇이 실제 문제로 판정된 발견 항목의 비율은 더 높았지만, Greptile이 찾은 실제 버그 네 개를 놓쳤다고 적었다. 전체 평가 결과는 shadowclone 저장소의 코드 리뷰 평가 자료에서 확인할 수 있다. 평가를 다시 실행할 수 있는 도구도 오픈소스로 공개됐다고 한다.
이 결과로 어디까지 말할 수 있나
이 비교는 OpenQodex가 CodeRabbit을 대체한다고 홍보하려면 근거를 제시해야 한다는 주장을 뒷받침하는 사례다. 동시에 shadowclone도 Greptile이 잡아낸 버그를 놓쳤다. 글의 화자는 그 결과를 공개하면 개선할 지점을 찾을 수 있지만, 이를 두고 Greptile을 끝장낼 도구라고 부르지는 않겠다고 말한다.
오픈소스로 도구를 만들고 공개하는 일 자체에는 긍정적이다. 다만 기존 제품을 대체한다고 내세울 때는 실제 비교 결과와 부족한 점도 함께 보여야 한다는 것이 글의 주장이다. 원문은 평가에 사용한 코드와 알려진 버그의 구성, 두 모델 심판의 판정 기준은 밝히지 않는다.
댓글 (0)
로그인하면 이 기사에 내 생각을 남길 수 있어요