TL;DR

  • OntoPrune은 온톨로지 기반으로 로컬 소형 언어 모델(SLM)의 코드 컨텍스트를 최소 계약으로 변환해 입력 토큰을 최대 83% 줄이고, CPU에서 첫 토큰까지의 시간(TTFT)을 6.7배 단축하며 API 환각을 방지하는 미들웨어임.
  • 12코어 로컬 CPU에서 300줄이 넘는 sample_service.py를 평가한 결과, 입력 토큰이 2,390개에서 406개로 감소함.
  • qwen2.5-coder:3b의 TTFT가 22.4초에서 3.3초로 줄고, 전체 실행 시간도 59.9초에서 16.5초로 감소함.
  • OntoPrune은 MCP 서버, Python 라이브러리, 명령줄 인터페이스(CLI)로 제공되며, 여러 파일 간 의존성을 해결하고 응답 코드의 계약 위반을 검사함.
  • 상업적 적용 방안으로 토큰 절감 미들웨어, 로컬 우선 개발 도구, 에이전트 코드의 규정 준수 및 CI/CD 보안 게이트를 제안함.

OntoPrune

  • OntoPrune은 로컬 소형 언어 모델(SLM)을 위한 신경기호 기반 컨텍스트 가지치기 미들웨어임.
  • 경량 번역 미들웨어로서 소스 코드를 온톨로지 표현(RDF/SPARQL)을 사용한 최소 컨텍스트 계약으로 변환함.
  • 입력 토큰과 첫 토큰까지의 시간(TTFT)을 크게 줄이고 API 환각을 방지함.

CPU 실증 벤치마크 결과

  • 12코어 로컬 CPU에서 300줄이 넘는 sample_service.py를 스트리밍 방식으로 실제 평가함.
  • 전체 파일을 사용하는 기본 방식과 스텁을 사용하는 OntoPrune의 결과는 다음과 같음.
  • CPU 오버헤드: 기본 방식 0.02밀리초, OntoPrune 9.9밀리초; 목표치 15밀리초 이하 대비 10밀리초 이하임.
  • 입력 토큰: 기본 방식 2,390개, OntoPrune 406개; 83.0% 감소, 약 6배 적음.
  • qwen2.5-coder:3b의 TTFT: 기본 방식 22.4초, OntoPrune 3.3초; 6.7배 빨라지고 19.1초 절감됨.
  • 3B 모델 전체 실행 시간: 기본 방식 59.9초, OntoPrune 16.5초; 72.5% 감소, 3.6배 빨라짐.
  • API 환각: 기본 방식에서 잘못된 메서드 1개, OntoPrune에서 0개; 계약 정확도 100%임.

설치

  • 기본 설치 명령은 pip install -e .임.
  • 벤치마킹 의존성을 포함하는 설치 명령은 pip install -e ".[dev,benchmark]"임.

사용 모드

1. MCP 서버(Model Context Protocol)

  • OntoPrune에는 ontoprune-mcp 네이티브 MCP 서버가 포함되며, Cursor, Claude Desktop, Gemini CLI 또는 다른 에이전트와 통합 가능함.
  • 표준 입출력(stdio) 전송 방식으로 서버를 실행하는 명령은 ontoprune-mcp임.
  • claude_desktop_config.json 또는 유사한 설정 파일에서 ontoprune 서버의 명령을 ontoprune-mcp로 지정함.
  • 제공되는 MCP 도구는 다음과 같음.
  • prune_context(file_path, target_symbol, format='stubs', include_body=False, project_root=None): 프로젝트 내 여러 파일의 의존성을 해결해 400토큰 미만의 최소 가지치기 계약을 추출함.
  • verify_response(response_code, contract_or_file, target_symbol): 생성 코드와 계약 또는 파일을 비교해 환각을 탐지함.

2. Python 라이브러리

  • ontoprune.translate로 파일을 스텁 형식의 압축된 컨텍스트로 변환하며, 프로젝트 모듈 사이의 상대 및 절대 임포트를 자동으로 해결함.
  • 예시 설정은 services/order_service.py의 procesar_orden을 대상으로 fmt="stubs"와 multi_module=True를 지정하는 방식임.
  • ontoprune.check로 모델 응답을 계약과 대조하고, 위반 항목이 없으면 코드가 계약에 100% 유효함을 확인함.

3. 명령줄 인터페이스(CLI) 및 파이프

  • 다중 모듈 프로젝트에서 함수를 번역하는 명령은 ontoprune translate services/order_service.py procesar_orden --format stubs임.
  • 모듈형 프로젝트에서 Ollama와 직접 연결하는 파이프는 ontoprune translate services/order_service.py procesar_orden | ollama run qwen2.5-coder:3b임.

4. 실증 벤치마크 실행

  • 기본 방식과 OntoPrune을 비교하고 형식별 제거 실험을 수행하는 명령은 python -m ontoprune.benchmark --file fixtures/sample_service.py --func procesar_orden --backend ollama --model qwen2.5-coder:3b --compare-formats임.

수익화 모델 및 상업적 적용

  • OntoPrune은 AI 엔지니어링의 비용과 신뢰성 문제 두 가지를 해결하는 방안을 제시함.

1. 토큰 비용 최적화 게이트웨이(B2B SaaS/절감 미들웨어)

  • 문제: Devin, Cursor, Copilot Workspace 같은 자율 코드 에이전트를 운영하는 팀은 월 수천 달러를 입력 토큰에 지출하며, 그중 80% 초과가 관련 없는 코드임.
  • 해결책: OntoPrune을 프록시 또는 사이드카로 사용해 Gemini, Claude, OpenAI 같은 상용 API로 보내기 전에 컨텍스트를 가지치기하고 토큰 비용을 85% 절감함.
  • 수익화: 발생한 월간 절감액의 10%를 받는 게인셰어 방식 등 절감액 비율에 기반한 과금임.

2. 로컬 우선 개발 도구(프로페셔널 에디션/팀)

  • 문제: 엄격한 개인정보 보호가 필요한 개발자와 기업은 노트북이나 로컬 서버에서 Ollama 또는 vLLM으로 SLM을 실행하며, CPU에서 감당하기 어려운 지연을 겪음.
  • 해결책: OntoPrune으로 TTFT를 22초에서 3.3초로 단축해 6.7배 빠르게 함.
  • 수익화: 개인 개발자용 오픈소스 버전과 다중 저장소 지원, 텔레메트리, 아키텍처 준수 규칙을 제공하는 팀용 엔터프라이즈 라이선스임.

3. 에이전트 규정 준수 및 CI/CD 보안 게이트

  • 문제: 코드 에이전트가 API를 환각하고 소프트웨어 계약을 위반해 프로덕션을 손상할 수 있음.
  • 해결책: ontoprune check를 GitHub Actions 또는 GitLab CI의 자동화 단계로 실행해 시스템 그래프에서 허가되지 않은 호출이 포함된 풀 리퀘스트를 차단함.
  • 수익화: 에이전트 생성 코드에 대한 감사 및 보안 SaaS 모델임.