TL;DR
- Positron은 모든 규모의 트랜스포머 모델 추론에서 최고 성능, 최저 전력, 최적의 총소유비용(TCO)을 제공하는 전용 하드웨어를 내세움.
- 현재 최대 500B 파라미터 모델을 지원하는 추론 장비를 출하 중이며, 2027년에는 최대 18.4TB Asimov 메모리를 갖춘 제품과 칩을 선보일 예정임.
- 학습된 HuggingFace Transformers Library 모델을 Positron Model Manager에 올리고, OpenAI API 호환 엔드포인트로 연결하는 세 단계 흐름을 제시함.
- 시뮬레이션 기준 Asimov는 400토큰/초/사용자에서 Blackwell의 최대 제시 속도인 170토큰/초/사용자와 비교해, 빠른 요금제의 토큰 가격을 두 배로 가정할 때 TCO 달러당 매출 24.8배를 기록함.
- 토큰 효율 비교는 모델·토큰 구성·비용 가정에 따라 달라지며, 성능 수치는 Asimov의 사이클 단위 정확도 시뮬레이션과 외부 GPU 데이터를 바탕으로 함.
제품과 비전
- Positron은 트랜스포머 모델 추론을 대상으로 모든 규모에서 최고 성능, 최저 전력, 최적의 총소유비용(TCO)을 제공하는 전용 하드웨어를 표방함.
- 현재 출하 중인 제품은 최대 500B 파라미터 모델을 지원하는 양산 준비 완료 추론 장비임.
- 2027년 출시 예정 제품은 다음과 같음.
- 4개 또는 8개의 Asimov 칩으로 구동되는 최대 18.4TB Asimov 메모리 탑재형 Superintelligence-in-a-Box
- 칩당 최대 2.3TB 메모리를 갖춘 전용 AI 추론 가속기 실리콘
- ‘The Positronic Brain’은 AI 인프라에 대한 Positron의 관점과 구축하려는 미래를 다루는 비전임.
모든 트랜스포머 모델을 Positron에서 실행
- Positron은 모든 트랜스포머 모델을 시간과 수고를 들이지 않고 원활하게 지원한다고 설명함.
- 학습된 HuggingFace Transformers Library 모델을 하드웨어에 직접 매핑해 성능과 사용 편의성을 높이는 방식임.
- 모델 적용 절차는 세 단계임.
- 1단계: HuggingFace Transformers Library를 사용해 모델을 개발하거나 확보함.
- 2단계:
.pt또는.safetensors형식의 학습된 모델 파일을 Positron Model Manager에 업로드하거나 링크함. - 3단계: 애플리케이션이 Positron의 OpenAI API 호환 엔드포인트를 사용하도록 클라이언트를 변경함.
Positron의 성능과 매출 비교
- Positron은 빠른 토큰 생성과 더 높은 수익 잠재력을 강조하며, 빠른 처리 등급에 토큰 판매 가격 2배를 적용하는 가정에서 TCO 달러당 매출 24.8배를 제시함.
- 해당 프리미엄 등급 시나리오에서는 Asimov를 400토큰/초/사용자, Blackwell을 제시된 최대 속도인 170토큰/초/사용자에서 비교함.
- 빠른 추론에 프리미엄 가격이 적용되는 시장 사례로 Claude Fast Mode의 표준 요금 대비 2배 요금과 GPT-5.5의 표준 요금 대비 2.5배인 Priority 처리를 제시함.
- DeepSeek R1 0528 671B, FP4, 입력 8K·출력 1K 조건의 비교 수치는 다음과 같음.
- 사용자당 초당 100토큰: Positron Asimov TitanRack(시뮬레이션)은 NVIDIA Blackwell GB300 NVL72보다 달러당 토큰이 2.4배 많으며, 각각 570만 대 240만 토큰/달러임.
- 사용자당 초당 170토큰: 달러당 토큰이 26배 많으며, 각각 570만 대 22만 1,000토큰/달러임. Blackwell은 제시된 최대 상호작용 속도 기준임.
- 사용자당 초당 400토큰: 동일한 토큰당 비용에서 Asimov가 4.1배 더 빠르며, 각각 400 대 97토큰/초/사용자임. 이 비교의 효율 기준은 270만 토큰/달러임.
- Asimov 성능은 사이클 단위 정확도 시뮬레이션에 기반하며, GPU 데이터 출처는 SemiAnalysis InferenceX임.
비교 방법과 가정
- 첫 번째와 두 번째 비교는 생성 속도를 동일하게 맞춘 기기 비교임. 두 번째 지점은 Blackwell의 제시된 최대 상호작용 속도에 가까움.
- 세 번째 비교는 세로축 값을 일정하게 유지하고, Asimov의 사용자당 초당 400토큰과 효율이 같은 Blackwell 곡선상의 지점을 비교함. 해당 표기에는 두 기기의 생성 속도와 공통 효율 값이 포함됨.
- 달러 기준은 네오클라우드 소유 가정에서 자본 비용과 운영 비용을 합산한 모델링 TCO 달러당 총 토큰 수임. 전력 기준은 전체 유틸리티 전력 1MW당 토큰 처리량임.
- 그래프 축은 실제 단위와 선형 척도를 사용함. 그래프는 사용자당 초당 75~450토큰 범위에 초점을 맞추며, 세로축은 0에서 시작해 해당 범위의 값까지 표시함.
- 프리미엄 등급 시나리오는 Asimov의 사용자당 초당 400토큰과 Blackwell의 제시된 최대 속도인 초당 170토큰을 비교함. 매출 증가는 각 작동 지점의 토큰 효율에 2배 판매 가격 배수를 적용해 계산함.
- 시나리오는 양쪽 기기에서 입력·출력 토큰 비율을 8K/1K로 동일하게 두고, 생성 토큰 중 판매되는 비율도 동일하다고 가정함. 빠른 등급에서는 입력과 출력 가격을 모두 두 배로 적용하며, 절대 판매 가격은 가정하지 않음.
- 제시된 수치는 이익률이나 추가 속도 향상이 아니라 매출 비율임.
- 시장 참고 사례로 Anthropic은 Claude Opus 5와 4.8 Fast Mode의 요금을 100만 토큰당 입력 10달러, 출력 50달러로 제시하며, 표준 요금인 입력 5달러, 출력 25달러와 비교해 최대 2.5배 높은 출력 속도를 광고함. 해당 정보의 확인일은 2026년 9월 10일임.
- OpenAI도 GPT-5.5 Priority 처리를 표준 요금의 2.5배로 출시함. 공개된 서비스 등급은 빠른 추론에 프리미엄 가격이 책정되는 사례이며, 위 매출 비교에는 2배 판매 가격 배수가 적용됨.
댓글 (0)
로그인하면 이 기사에 내 생각을 남길 수 있어요