TL;DR
- AI 워크로드의 작업 유형·개인정보 보호·지연 시간 허용치·연결성·예산을 바탕으로 실행 위치와 모델을 추천하는 의사결정 엔진임.
- 기존 엣지·클라우드 AI 배포 도구와 달리, SDK·플랫폼·하드웨어를 선택하기 전 빠르게 검토하는 의사결정 계층을 탐색함.
- 첫 벤치마크에서 로컬은 요청당 약 2.9~5.3초, 엣지 모의 실행은 3.5~4.7초, AWS Bedrock의 Claude Haiku 4.5는 1.1~1.5초임.
- 해당 요약 작업에서 클라우드가 로컬보다 일관되게 빨랐으며, 주요 절충점은 지연 시간이나 비용보다 개인정보 보호와 오프라인 실행 여부임.
- 현재 프로젝트는 초기 탐색 단계이며, 실제 엣지 하드웨어 테스트와 요약 이외의 작업·모델 범위 확장 등이 다음 단계임.
AI 워크로드 배치 의사결정 엔진
- 핵심 질문은 AI 워크로드를 기기·엣지·클라우드 중 어디에서 실행하고, 품질·개인정보 보호·지연 시간·비용·에너지·하드웨어 요구 사항을 충족하려면 어떤 모델을 사용해야 하는지임.
- 엣지·클라우드 AI를 새로 발명했다는 주장은 아님. 해당 분야는 성숙했으며
RunAnywhere, AWS Greengrass, Azure IoT Edge 같은 도구가 배포와 기기 플릿 관리를 이미 해결하고 있음. - 프로젝트가 탐색하는 공백은 SDK·플랫폼·하드웨어를 선택하기 전에 워크로드 실행 위치를 알려주는 빠르고 부담 없는 의사결정 계층임.
구성 요소
decide.py: 명령줄 인터페이스(CLI) 의사결정 엔진임. 작업 유형·개인정보 보호·지연 시간 허용치·연결성·예산에 관한 다섯 가지 질문에 답하면 실제 벤치마크 데이터에 근거한 추론과 함께 로컬·기기 또는 클라우드 실행을 추천함.app.py: 같은 의사결정 엔진을 간단한 Streamlit 웹 앱으로 제공해 시연하기 쉽게 구성함.benchmark.py: 아래 벤치마크 데이터를 생성하는 스크립트임. 같은 요약 작업을 Ollama 기반 로컬 모델, 약한 하드웨어의 대용으로 스레드 수를 제한한 엣지 모의 실행, AWS Bedrock 기반 클라우드 모델에서 수행함.placement_benchmark_results.xlsx: 벤치마크 실행의 전체 결과 파일임.
첫 벤치마크 결과 — 2026년 10월
- 작업은 뉴스 형식의 짧은 문단 다섯 개를 요약하는 것임.
- 로컬: 노트북에서
llama3.2:1b를 최대 성능으로 실행했으며 요청당 약 2.9~5.3초, 비용 0달러임. - 엣지 모의 실행: 같은 모델에서 CPU 스레드 하나를 사용했으며 요청당 약 3.5~4.7초, 비용 0달러임.
- 클라우드: Bedrock을 통한 Claude Haiku 4.5 실행 결과는 요청당 약 1.1~1.5초, 비용은 약 0.0001~0.00015달러임.
- 이 작업에서는 클라우드가 로컬보다 일관되게 빨랐음. 이는 실험 전 가정했던 ‘로컬이 항상 지연 시간에서 우세하다’는 생각과 달랐음.
- 이 규모에서 비용도 매우 작았음. 데이터에서 실제 절충점은 지연 시간이나 비용이 아니라 개인정보 보호와 오프라인 실행 가능성이었으며, 이 두 가지는 로컬·엣지에서만 제공 가능함.
- 엣지 수치의 한계: ‘엣지 모의 실행’은 노트북의 CPU 스레드 수를 제한해 더 약한 하드웨어를 근사한 것으로, Raspberry Pi처럼 메모리와 전력이 제한된 실제 엣지 하드웨어에서 테스트한 결과는 아님.
- 실제 엣지 하드웨어 테스트는 다음 단계로 계획되어 있으며, 이전 연구 때 마련한 Raspberry Pi를 찾아야 함.
실행 방법
- 의사결정 엔진(CLI)은
python3 decide.py로 실행함. - 의사결정 엔진 웹 UI는
pip install streamlit로 Streamlit을 설치한 다음streamlit run app.py로 실행함. - 벤치마크 재현에는
llama3.2:1b를 내려받은 Ollama와 Bedrock 접근 권한이 있는 AWS 자격 증명이 필요함. ollama pull llama3.2:1b로 모델을 가져오고,pip install requests boto3로 의존성을 설치한 뒤python3 benchmark.py로 벤치마크를 실행함.
프로젝트를 만드는 배경
- 2017년에 Raspberry Pi·네트워킹·기기 제어를 중심으로 엣지·클라우드 워크로드 배치를 연구했으며, 현재는 AWS·Azure·Bedrock을 직접 다루는 클라우드·인프라 엔지니어링 업무를 수행함.
- 이 프로젝트는 그 경험을 AI 워크로드를 어떻게 배치해야 하는지 탐색하는 출발점으로 활용함. 과거 연구를 반복하는 것이 아니라, 같은 근본 질문을 현재 관점에서 다루는 작업임.
- 완성된 제품이 아니라 초기 탐색 단계이며, 피드백·질문·반론을 환영함.
다음 단계
- 실제 엣지 하드웨어 테스트: 모의 실행이 아닌 Raspberry Pi 사용
- 요약을 넘어 모델·작업 범위 확대
- 가능성 검토: 워크로드 설명만으로 실행 전에 비용·지연 시간을 추정하는 기능
댓글 (0)
로그인하면 이 기사에 내 생각을 남길 수 있어요