TL;DR
- Google의 독점 추론 모델 Gemini 4 Argon (High)는 인공지능 지수 53점으로 비슷한 가격대 모델의 중앙값 26점을 크게 웃도는 성능임.
- 입력은 텍스트·이미지, 출력은 텍스트를 지원하며 문맥 창은 100만 토큰임.
- 입력 가격은 100만 토큰당 2달러, 출력 가격은 10달러이며 지능 지수 평가 작업당 평균 비용은 1.99달러임.
- 지능 지수 평가에서 생성한 출력은 1억 1,000만 토큰으로, 비교 모델 중앙값 8,200만 토큰보다 다소 많은 편임.
- 2026년 9월 30일 출시 모델로 가중치와 파라미터 수는 공개되지 않았으며, API 제공 업체는 1곳임.
모델 개요
- Gemini 4 Argon (High)는 Google이 출시한 독점 추론 모델이며, 페이지에 표시된 출시일은 2026년 9월 30일임.
- Artificial Analysis Intelligence Index에서 53점, 전체 223개 모델 중 8위를 기록하며, 비슷한 가격대 추론 모델의 중앙값인 26점을 크게 웃도는 수준임.
- 평가 과정에서 총 1억 1,000만 출력 토큰을 생성해 비슷한 가격대 추론 모델의 중앙값인 8,200만 토큰보다 다소 많은 편임.
- 속도 지표는 공개되지 않았으며, 속도 평가는 제공되지 않음.
가격 및 비용
- Google API 기준 입력 가격은 100만 토큰당 2달러, 출력 가격은 100만 토큰당 10달러임. 페이지는 두 가격을 각각 중간 수준으로 설명하며, 비교 모델의 중앙값도 입력 2달러와 출력 10달러임.
- 캐시 할인율은 95%로 표시되며, 지능 지수 평가 작업당 평균 비용은 1.99달러임.
- 캐시 적중·입력·출력 비율을 7:2:1로 적용한 혼합 가격은 100만 토큰당 1.47달러임. 가격은 제공 업체에 따라 달라질 수 있음.
- 평가 작업 비용은 입력, 캐시 적중, 캐시 쓰기, 추론 및 답변 토큰 가격을 반영하고, 각 평가의 지능 지수 가중치에 따라 산출됨.
기술 사양
- 입력 방식은 텍스트와 이미지, 출력 방식은 텍스트임. 이미지 입력을 통해 이미지 분석, 설명 및 질문 답변이 가능함.
- 문맥 창은 100만 토큰으로, 페이지는 12포인트 Arial 기준 A4 약 1,500쪽 분량에 해당한다고 설명함. 문맥 창은 입력과 출력 토큰을 합산한 최대 한도이며, 출력 토큰 한도는 모델에 따라 더 낮을 수 있음.
- 복잡한 문제를 답변하기 전에 확장 사고 또는 연쇄적 사고 추론을 수행하는 추론 모델임.
- 모델 가중치는 공개되지 않았으며, Google은 모델 크기와 파라미터 수를 공개하지 않음.
지능 지수 및 평가
- Artificial Analysis Intelligence Index 버전 4.3.2는 10개 평가를 포함함: AA-Briefcase v1.1, GDPval-AA v2.1, AutomationBench-AA, Terminal-Bench 4.0, SciCode, Humanity’s Last Exam, GDP.pdf, CritPt, AA-Omniscience, AA-LCR v1.1.
- 개별 평가의 측정 영역은 다음과 같음.
- AA-Briefcase v1.1: 에이전트형 지식 업무
- GDPval-AA v2.1: 실제 업무 과제
- AutomationBench-AA: 에이전트형 서비스형 소프트웨어(SaaS) 작업 흐름
- Terminal-Bench 4.0: 에이전트형 코딩 및 터미널 활용
- SciCode: 코딩
- Humanity’s Last Exam: 추론 및 지식
- GDP.pdf: 전문 문서 추론
- CritPt: 물리학 추론
- AA-Omniscience: 지식 정확도와 환각 억제
- AA-LCR v1.1: 긴 문맥 추론
- 추가 평가 목록에는 Harvey LAB-AA의 법률 에이전트 업무, EnterpriseOps-Gym-AA의 에이전트형 비즈니스 운영, Terminal-Bench-Science 0.1의 터미널 기반 과학 연구 작업 흐름, AA-Analyst의 스프레드시트·문서 정량 분석, ITBench-AA의 Kubernetes 장애 원인 분석, MMMU-Pro의 시각 추론, MLCR-AA의 의료 장문맥 추론이 포함됨.
- AA-Briefcase Elo는 채점 기준 통과율, 분석 품질 Elo, 프레젠테이션 Elo를 합산한 지표임. 채점 기준 성능은 가상 일대일 대결을 통해 Elo로 변환됨.
- AA-Omniscience 지수는 지식 신뢰도와 환각을 측정하며, 정답에 점수를 주고 환각에 감점을 적용하되 답변 거부에는 불이익을 주지 않음. 점수 범위는 -100~100이며, 0점은 정답과 오답 수가 같음을, 음수는 오답이 정답보다 많음을 뜻함.
- 지능 지수 비교는 모델 유형과 가격대에 따라 비교 집단을 달리함. 추론 모델은 추론 모델과 비추론 모델 모두와 비교하고, 독점 모델은 비슷한 가격대의 독점 및 오픈 웨이트 모델과 비교함.
자주 묻는 질문
- Gemini 4 Argon (High)은 Google API를 통해 API 제공 업체 1곳에서 사용할 수 있음.
- 입력 지원 방식은 텍스트와 이미지이며, 출력 지원 방식은 텍스트임. 따라서 텍스트·이미지 입력을 처리하고 텍스트를 생성하는 멀티모달 모델임.
- Artificial Analysis Intelligence Index 점수는 53점이며, 지능·추론·지식·수학·코딩 등을 아우르는 복합 평가 점수임.
- Google은 독점 모델의 파라미터 수를 공개하지 않음.
댓글 (0)
로그인하면 이 기사에 내 생각을 남길 수 있어요