Windows 10 지원 종료로 사용이 줄어든 PC를 온프레미스 대규모 언어 모델(LLM) 서버로 바꾸는 방안을 평가한 연구가 나왔다. 단일 소비자용 NVIDIA GPU를 장착한 재활용 워크스테이션에서 일부 모델은 초당 29~65토큰을 안정적으로 생성했지만, 속도와 답변 정확도는 일치하지 않았다. 연구진은 이런 구성이 개인정보 통제와 중·고가 클라우드 대안의 비용 절감에 유용할 수 있다고 봤다.
성능과 하드웨어 조건
평가 장비는 Dell Precision T7810 워크스테이션에 NVIDIA GeForce RTX 3060(12GB VRAM)을 장착한 구성이다. Proxmox 9 가상화 환경에서 Ollama와 Open WebUI를 사용했고, GPU 전력은 최대 140W로 제한했다. 8개 오픈 웨이트 모델을 10종의 프롬프트로 시험했으며, 처리량 측정은 모델마다 5회 반복했다.
GPU 메모리에 모델과 문맥 캐시가 모두 들어간 6개 모델은 측정 지점 전반에서 초당 변동폭이 2토큰 미만이었다. 이 가운데 gemma4:e4b는 초당 59~65토큰으로 가장 빨랐다. 정답 정확도 평가에서는 gemma4:e4b가 HumanEval 코드 생성에서 91.5%를 기록했고, 산술 문제 GSM8K에서는 granite4.1:8b가 92.0%로 가장 높았다. 따라서 처리 속도만으로 모델을 고르기보다 실제 작업에 맞는 정확도 평가도 함께 봐야 한다.
용량 한계도 뚜렷했다. 모델 가중치와 문맥 캐시가 12GB VRAM을 넘으면 일부 계산이 CPU로 넘어가 성능이 낮아질 수 있다. 테스트에서 20B 모델 gpt-oss:20b는 VRAM을 초과해 초당 17~19토큰을 기록했고, 측정 변동도 컸다. 반대로 1.5B 모델 deepseek-r1은 초당 190~201토큰으로 가장 빨랐지만 정확도는 가장 낮았고, HumanEval 문제의 33%에서 답을 내놓지 못했다. Ollama의 기본 문맥 길이 4,096토큰도 모델에 따라 긴 추론이나 문서 입력의 제약이 될 수 있다.
비용·개인정보·한계
연구의 비용 계산은 하루 500회 질의, 질의당 입력 500토큰과 출력 1,500토큰, 연간 200일 사용을 가정했다. 영국 전기요금과 장비의 전력 측정치를 적용한 연간 전기료 추정치는 207달러였다. 연구가 비교한 종량제 클라우드 모델 중 Gemini 3 Flash는 연 48.75달러로 더 저렴했지만, Gemini 2.5 Pro는 1,562.50달러, Claude 4 Opus는 12,000달러로 추산됐다. 가격은 연구가 참고한 시점의 자료에 기반하므로 실제 도입 전 최신 요금을 확인해야 한다.
사용 단계의 연간 탄소 배출량은 로컬 서버 115kg CO2e, Gemini 3 Flash 170kg, Gemini 2.5 Pro 1,132kg, Claude 4 Opus 1,387kg으로 추산됐다. 다만 클라우드 모델의 구조와 데이터센터 경로 등이 공개되지 않아 해당 수치는 정확한 측정치가 아니라 대략적인 비교다. 기존 장비를 재사용하면 새 하드웨어 제조에 따른 배출을 피할 수 있다는 점도 연구는 고려했다.
로컬 추론은 프롬프트와 문서가 외부 서버로 전송되지 않는 구성을 만들 수 있고, 구독료나 사업자 정책에 대한 의존도 줄인다. 반면 인터넷 검색이나 최신 정보에 접근하지 못하고, 전력·유지보수·보안 패치와 장애 대응을 운영자가 맡아야 한다. 연구는 단일 워크스테이션과 제한된 모델·작업만 평가했으며, 전력 소비와 비용은 사용량 및 전기요금에 따라 달라진다. 특정 규제 준수 여부를 검증한 연구도 아니다.
논문은 Frontiers in Computer Science에 게재됐다. 평가 도구와 코드는 GitHub 저장소에서, 데이터는 Zenodo 데이터셋과 벤치마크 자료에서 확인할 수 있다.
댓글 (0)
로그인하면 이 기사에 내 생각을 남길 수 있어요