TL;DR

  • GLM 5.3 Flash만으로 9월 한 달 코딩을 시도했지만, 2B 토큰 중 1B 토큰만 목표 모델에 사용돼 도전은 절반의 성공에 그침.
  • 첫 보름 동안은 해당 모델만 사용했고, 비용은 68달러, 에너지 사용량은 약 4kWh, 탄소 배출량은 365g으로 예산 안에 듦.
  • Wagtail MCP 서버 프로토타입에 부적절한 모델을 선택해 거의 하룻밤 사이 4억 5천만 토큰, 150달러, 5kWh를 사용함.
  • 추론 제공업체의 용량 문제로 GLM 5.3 Flash 성능이 저하돼 DeepSeek V4.1 Flash와 Qwen 3.8 Flash로 전환함.
  • 다음 달에는 사용량과 에너지·비용을 꾸준히 측정하고 실험 예산을 별도로 마련해, 일상적인 개발 작업의 대부분을 저렴한 플래시급 모델로 처리하는 것이 목표임.

한 달간의 토큰 사용량

  • 에이전트 사용량 추적 도구인 AgentsView의 집계에서 한 달 동안 사용한 전체 토큰은 약 2B임.
  • 목표는 청록색으로 표시된 GLM 5.3 Flash만 한 달 내내 사용하는 것이었으며, 첫 보름 동안은 목표를 지킴.
  • 해당 모델 사용 비용은 68달러로 예산 범위에 들었고, 에너지 사용량은 약 4kWh, 탄소 배출량은 365g임.
  • 그러나 월 후반에는 다른 모델에 1B 토큰을 사용함.

예상치 못한 장애물

바이브 코딩의 비용

  • 실험용 Wagtail MCP 서버는 바이브 코딩으로 만든 프로토타입이며, 프로토타입에는 적합한 방식이지만 그에 따른 비용도 발생함.
  • 프로토타입에 적절하지 않은 모델을 선택한 결과 거의 하룻밤 사이 4억 5천만 토큰, 150달러, 5kWh를 사용함.
  • MCP 서버는 잘 작동하고 기능을 보여 주는 훌륭한 데모도 마련했지만, 비슷한 결과를 큰 추가 노력 없이도 비용을 대략 5분의 1로 얻을 수 있었을 가능성이 있음.
  • 모델 선택과 에이전트 활용 패턴을 신중히 검토하고, 프로토타입에 쓸 예산을 책정해야 한다는 교훈임.

인프라 문제

  • 추론 제공업체 비교를 다뤄 왔지만, 선택한 제공업체가 매우 인기 있는 데다 대형 연구소처럼 많은 GPU 용량을 확보하지 못해 인프라 가용성 문제가 발생함.
  • 관련 작업에 적합한 모델 가운데 GLM 5.3 Flash가 파레토 프런티어에서 높은 위치를 차지한 점이 성능 저하의 원인일 가능성이 큼.
  • 이에 따라 DeepSeek V4.1 Flash와 Qwen 3.8 Flash 등 유사한 모델로 전환함. 전환 자체는 간단했지만 예상하지 못한 일이었음.

실험과 연구개발 비용

  • 일상적인 엔지니어링 작업에 한 모델을 사용하는 것과 별개로, 제공업체의 신제품을 따라잡기 위해 다양한 모델을 계속 실험할 필요가 있음.
  • 특히 Wagtail 작업에서 모델 성능을 벤치마크하기 시작하면서 폭넓은 모델의 데이터가 중요해짐.
  • 구체적인 벤치마크 데이터는 더 효율적인 모델을 선택하도록 안내하는 데 도움이 되며, 에이전트 스킬이나 에이전트와 잘 작동하도록 설계된 새 CLI 프로토타입으로 효율적인 선택지를 실용화하는 데도 활용할 수 있음.

교훈과 다음 단계

  • 목표 모델 사용률은 50%, 즉 전체 2B 토큰 중 1B 토큰이었고, 에너지 사용량은 목표한 10kWh 대신 약 35kWh였음.
  • 도전 자체는 기술적으로 실패했지만, 현재 상황에서 중요한 교훈을 얻음.
  • 토큰뿐 아니라 에너지 사용량과 비용을 포함해 사용량을 현지에서 지속적으로 측정·보고하고, 투입한 사용량이 구체적인 긍정적 결과로 이어지는지도 살펴볼 필요가 있음.
  • 일상 작업만이 아니라 실험을 위한 예산도 마련하고, 어떤 프로토타입을 어떤 방식으로 만들지 더 신중하게 결정할 필요가 있음.
  • 프롬프트 선택과 다중 에이전트 기법을 개선하고, 오케스트레이터·정찰자·구현자·검토자 역할을 구분하며 목표 범위를 제한하는 방식도 살펴볼 과제임.
  • 더 효율적인 기법과 모델을 계속 찾을 필요가 있음. Jev-style decision diffusion models는 실제로 높은 효율로 실행할 수 있다면 유망하며, 최신 플래그십 모델도 효율성 측면에서 긍정적인 방향을 보임.
  • 일상적인 개발 작업은 저렴한 플래시급 모델 한두 개에 집중하는 방식으로 충분히 수행 가능함.
  • 의미가 불분명한 토큰 수가 아니라 비용이나 에너지 사용량을 기준으로, AI 추론 작업의 대부분을 효율적인 모델로 처리하는 것이 다음 달 목표임.
  • 11월 Wagtail Space 2026에서 진행 상황을 공유할 예정임.