TL;DR
- Neurometric Task Router는 공개 벤치마크 근거와 사용자가 설정한 품질·지연 시간 조건을 바탕으로 작업별 모델을 선택하고, 조건을 충족하는 모델의 폴백 순서를 제공하는 라우팅 서비스임.
- 사용자는 공개된 작업을 선택하고 최소 품질 기준과 선택적 p50 지연 시간 상한을 설정하며, 최저 비용·균형·최고 품질 라우팅 정책을 선택함.
OpenAISDK에서 기본 URL을https://api.neurometric.ai/v1로 지정하고taskrouter/<slug>모델 별칭을 사용하면, 적격 모델이 바뀌어도 안정적인 API 별칭을 유지함.- 서비스는 263개 공개 작업과 3,120개 측정 모델 결과를 제공하며, 라우팅 요금은 월 1,000회 무료, 이후 1,000회당 0.15달러이고 추론 요금은 제공업체 가격에 추가 마크업 없이 부과됨.
- 예시 작업에서 Claude Opus 4.7을 고정 사용하는 비용은 이메일 10만 건당 666달러, 품질 목표 90%로 Qwen3 235B에 라우팅하는 비용은 라우팅 요금을 포함해 15.21달러로, 제시된 절감액은 635.94달러(95%)임.
작업별 지능형 라우팅
- 일반 가격표나 종합 순위표 대신 실제 작업의 측정 결과를 바탕으로 추론 모델을 선택하는 방식임.
- 작업별 품질 목표를 설정하면 기준을 충족하는 모델, 선택 모델, 폴백 순서를 공개 벤치마크 근거와 함께 확인할 수 있음.
- 예시 경로는
Quick-Reply작업, 최소 품질 90%, 최저 비용 정책이며 선택 모델은 Qwen3 4B Instruct 2507임. - 선택 근거는 측정된 비용 가운데 90% 품질 목표를 충족하는 최저 비용 모델이라는 점이며, 폴백 순서는 Gemma 4 E4B IT → Ministral 8B Instruct 2410 → Granite 4.1 8B임.
- 작업 예시에는 FDD Item 19 Summarizer, Shareholder Resolution Sentiment Analyzer, Email Unsubscribe Reason Classification, Manager-Coach, Patient Satisfaction Complaint Classification, Empathy-Edge, Support-Poly, Ticket-Clean, Interview-Analyst, Bankruptcy Proof of Claim Auditor, Digital-Post가 포함됨.
- 예시 측정표의 모델 결과는 다음과 같음.
- Nemotron Nano 9B v2: 품질 100.0%, p50 2.33초, 10만 티켓당 9.402달러, 적격.
- Qwen3 235B A22B: 품질 99.0%, p50 1.12초, 10만 티켓당 11.198달러, 적격.
- DeepSeek V3: 품질 100.0%, p50 1.07초, 10만 티켓당 24.696달러, 적격.
- Mistral Large 2407: 품질 100.0%, p50 1.47초, 10만 티켓당 153.30달러, 적격.
- Arcee Trinity Large Thinking: 품질 99.0%, p50 1.41초, 10만 티켓당 42.08달러, 적격.
- GPT-5.4: 품질 100.0%, p50 1.31초, 10만 티켓당 145.50달러, 적격.
- Claude Opus 4.7: 품질 100.0%, p50 2.04초, 10만 티켓당 490.60달러, 적격.
- Gemini 3.1 Pro Preview: 품질 100.0%, p50 3.97초, 10만 티켓당 455.60달러, 적격.
- Gemma 4 E4B IT: 품질 95.0%, p50 0.47초, 10만 티켓당 1.0234달러, 폴백 1.
- Granite 4.1 8B: 품질 99.0%, p50 0.72초, 10만 티켓당 2.13달러, 폴백 3.
- Ministral 8B Instruct 2410: 품질 100.0%, p50 1.39초, 10만 티켓당 1.3061달러, 폴백 2.
- Qwen3 4B Instruct 2507: 품질 100.0%, p50 1.80초, 10만 티켓당 0.4906달러, 선택 모델.
- 비용과 품질은 공개 평가 세트의 측정치이며 모든 요청에 대한 보장은 아님. 화면의 근거 미리보기는 실시간 요청 결과가 아니며, 경로를 만들 때 현재 사용 가능성을 확인함.
- 적격 모델이 바뀌어도 API 별칭은 안정적으로 유지됨.
작업 인식 라우팅의 차이
- 모델은 작업에 따라 성능이 달라질 수 있어 일반 순위표만으로는 특정 작업에 적합한 모델을 판단하기 어려우며, 작업별 측정치가 선택 근거가 됨.
- 직접 모델을 선택할 경우 일반 벤치마크와 가격표를 비교하고, 작업 평가를 직접 구축·실행하며, 새 모델이 나올 때마다 검토해 통합을 갱신하고 폴백 체인을 관리해야 함.
- Task Router에서는 실행할 작업의 공개 근거를 확인하고 품질 하한과 선택적 지연 시간 상한을 설정하며, 적격 모델이 바뀌어도 경로 별칭과 순서가 정해진 적격 모델 폴백 체인을 사용함.
개발자용 설정
- 경로 생성 단계에서 공개 작업을 선택하고 품질 하한과 라우팅 프리셋을 설정함.
OpenAISDK의 기본 URL을https://api.neurometric.ai/v1로 지정하고 조직 API 키 및taskrouter/<slug>별칭을 사용함.- 자동 최적화를 켜면 적격 모델과 가격이 바뀔 때 경로가 이에 맞춰 조정될 수 있음.
- 예시에서는
NEUROMETRIC_API_KEY를 API 키로 사용하고,taskrouter/privilege-triage별칭으로 채팅 완성 요청을 보냄. 실제 별칭은 생성한 경로에 표시된 값을 사용함.
요금 및 절감 예시
- 라우팅 결정은 월 1,000회까지 무료이며, 이후 1,000회당 0.15달러임. 추론 비용은 제공업체 가격으로 별도 부과되며 마크업은 없음.
- 변호사-의뢰인 비밀 특권 분류 작업에서 이메일 10만 건을 처리하는 예시는 다음과 같음.
- Claude Opus 4.7만 사용: 666.00달러.
- 품질 목표 90%에 맞춰 Qwen3 235B로 라우팅: 품질 91%, 15.21달러.
- 라우팅 요금: 첫 1,000회 무료, 나머지 99,000회 기준 14.85달러.
- 제시된 절감액: 635.94달러, 95%.
- 라우팅이 비용을 절감하는 경우에만 경제성이 있다는 전제 아래 해당 작업의 계산 예시를 제시함.
Task Explorer와 지원 작업
- Task Explorer는 무료이며, 작업을 설명하고 측정된 품질·비용·속도를 비교한 뒤 도입 전에 근거를 확인할 수 있음.
- 작업이 지원되지 않으면 Task Explorer에서 관련 공개 근거를 찾고, 맞는 항목이 없을 경우 벤치마크 검토 요청을 제출할 수 있음.
- Explorer, Tasks, Models, Providers는 공개 이용 가능함. Playground 요청 실행, 관심 목록 저장, 프로덕션 경로 생성에는 로그인이 필요함.
개발자 질문
OpenAISDK를 사용하고 기본 URL을api.neurometric.ai/v1로 설정한 뒤 경로에 표시된 모델 별칭을 지정하는 방식임.- 품질 하한을 통과하는 모델이 없으면 새 경로를 활성화할 수 없음. 대체 모델이 기준을 통과하지 못하면 최적화기는 기존 경로의 마지막 정상 계획을 유지함.
- OpenRouter는 추론 제공업체이며, Task Router는 작업별 벤치마크 근거와 적격 모델 후보의 순서를 정하는 정책을 추가함.
- 사용자는 최저 비용·균형·최고 품질 정책, 품질 하한, p50 지연 시간 상한, 자동 최적화 활성화 여부를 설정할 수 있음.
댓글 (0)
로그인하면 이 기사에 내 생각을 남길 수 있어요