TL;DR
- Ultrafast는 OpenAI API에서 가장 빠른 서비스 등급이며, GPT-6 Astra에 폭넓게 제공되고 GPT-5.6 Sol에는 프리뷰로 제공됨.
- 더 높은 비용을 감수할 만큼 속도가 중요할 때 사용하는 등급임.
- 여러 도구 호출을 빠르게 수행하는 에이전트 애플리케이션에는 네트워크 오버헤드를 줄이는 지속형 WebSocket 연결이 특히 권장됨.
- GPT-6 Astra용 Ultrafast는 현재 모든 API 사용자에게 낮은 요청 한도로 제공되며, 조직의 OpenAI 계정 팀에 연락하면 한도 상향이나 GPT-5.6 Sol 프리뷰 접근을 요청할 수 있음.
- 각
response.create이벤트에서 모델을gpt-6-astra, 서비스 등급을ultrafast로 설정하며, HTTP 요청도 지원됨.
요청 구성
- 각
response.create이벤트에서model을gpt-6-astra,service_tier를ultrafast로 설정함.
하나의 WebSocket에서 여러 턴에 Ultrafast 사용
- JavaScript와 Python 예제는 하나의 WebSocket 연결에서 두 개의 응답을 순차적으로 스트리밍함.
- 각 요청에
model과service_tier를 지정하고, 두 번째 요청에는 첫 번째 응답의 ID를previous_response_id로 전달함. - 응답이 완료되면 새 응답 ID를 저장하며, 텍스트 델타를 출력하고 실패·미완료 이벤트 또는 연결 종료를 오류로 처리함.
- 이후 턴과 도구 결과에도 연결을 재사용할 수 있음. 자세한 내용은 증분 입력으로 이어가기를 참조함.
HTTP 대안
- SDK를 통한 HTTP 요청으로도 Ultrafast 응답을 생성할 수 있으며, JavaScript, Python, Go, Java, Ruby 및
curl예제가 제시됨. - 예제는 요청에
model: gpt-6-astra와service_tier: ultrafast를 지정하고 응답 텍스트를 출력함. - 예제의 HTTP 요청은 응답 전체가 완료될 때까지 기다리며, 도착하는 즉시 출력을 표시하려면 스트리밍을 활성화함.
- 도구 호출이 잦은 에이전트 애플리케이션에는 요청 간 오버헤드를 줄이도록 지속형 WebSocket 연결을 사용함.
이용 가능성
- GPT-6 Astra의 기본 Ultrafast 토큰 처리량 한도는 API 사용 등급별로 분당 Tier 1–3에서 500,000토큰, Tier 4에서 1,000,000토큰, Tier 5에서 5,000,000토큰임.
- 입력, 캐시된 입력, 캐시 쓰기 및 출력 가격은 Ultrafast 가격표에서 확인할 수 있음.
- Ultrafast는 미국 데이터 상주 및 글로벌 처리만 지원하며, EU 및 기타 미국 외 지역 처리 엔드포인트는 지원하지 않음.
댓글 (0)
로그인하면 이 기사에 내 생각을 남길 수 있어요