TL;DR

  • AfterVibe는 vibe 코딩 세션의 코드와 대화 기록을 바탕으로 자연어 명세를 복원하고, 이를 통해 AI 생성 코드의 검토 기준을 코드에서 명세로 옮길 가능성을 제시함.
  • 대규모 언어 모델(LLM)이 개발자 의도를 추상적인 자연어 명세로 추출하고, 명세만 받은 두 번째 AI 에이전트가 코드를 재생성하는 방식임.
  • 재생성 코드와 원본 코드는 다중 계층 검증 파이프라인에서 비교되며, 동등성이 확인되지 않으면 명세를 반복적으로 다듬음.
  • 기업 내부 코딩 세션의 실제 프로젝트 72개에서 재생성 점수 평균 5.06/6.0을 기록했으며, 반복 개선 후 5.74까지 높아짐.
  • 명세가 구현 방법을 과도하게 지정하지 않으면서도 여러 독립 재생성에서 높은 성능을 보여, 인간 검토와 공식 기록의 주요 산출물이 될 가능성을 시사함.

AfterVibe의 명세 복원과 검증

  • Matteo Paltenghi와 Satish Chandra가 AfterVibe를 제시함. 입력은 코드 산출물과 그 산출물을 만든 대화의 진행 기록임.
  • AfterVibe는 LLM으로 개발자 의도를 담은 추상적인 자연어 명세를 추출함.
  • 검증 단계에서는 별도의 AI 에이전트가 명세만을 바탕으로 산출물을 재구현하며, 생성된 코드를 원본과 다중 계층 검증 파이프라인에서 비교함.
  • 명세의 품질은 에이전트가 명세를 바탕으로 검증을 통과하는 코드를 재생성할 수 있는지로 측정함. 검증기가 구현을 동등하다고 판단하면 명세를 강한 것으로 간주하고, 그렇지 않으면 반복적으로 개선함.

실제 프로젝트 평가 결과

  • 기업 내부 코딩 세션에서 나온 실제 vibe 코딩 프로젝트 72개를 대상으로 평가함.
  • 복원된 명세는 의도적으로 추상적이며, 동작상의 의도는 포착하되 구현 방식을 규정하지 않는 형태임.
  • 여러 차례 독립적으로 재생성한 결과의 평균 점수는 6.0점 만점에 5.06점이며, 세부 구현은 서로 다양하게 나타남. 이는 명세가 무엇을 만들지 제한하면서도 어떻게 만들지 과도하게 지정하지 않음을 보여줌.
  • 복원 명세는 기존 사람이 작성한 설명보다 높은 성능을 보였으며, 반복적인 개선을 거쳐 점수를 5.74까지 높일 수 있음.

코드 검토에서 명세 검토로

  • AI 생성 코드가 관례적인 코드 검토 속도를 앞지르는 상황에서, 코드가 아닌 명세가 인간 검토의 주요 산출물이자 공식 기록의 원천이 될 가능성이 제시됨.

논문 정보