TL;DR
- Google은 Gemini 4가 업계 벤치마크에서는 좋은 성과를 내지만 실제 코딩 작업에서는 한계가 있다는 사내 회의론에 직면해 있으며, 경쟁사 모델을 따라잡았는지에 대한 의견도 엇갈림.
- Google은 6월 출시를 계획했던 Gemini 3.5 Pro를 중단했으며, 대형 모델 학습에는 최대 4억 달러가 들 수 있음.
- 직원들 사이에서는 Gemini 4가 프런티어 수준이라는 의견과 Anthropic·OpenAI 모델보다 일부 영역에서 뒤처질 것이라는 의견이 공존함.
- Google 제품 대부분이 Gemini에 의존하고 있어, 최첨단 모델 출시 실패는 검색·소프트웨어 플랫폼 경쟁에서 불리하게 작용할 수 있음.
- 벤치마크 점수에 집중하는 ‘벤치맥싱(benchmaxxing)’이 실제 사용성과 제품 품질을 떨어뜨릴 수 있다는 우려가 제기됨.
Gemini 4를 둘러싼 사내 회의론
- Alphabet의 Google은 Gemini 4 출시를 준비하는 가운데 코딩 등 주요 영역에서 모델 성능이 얼마나 우수한지를 놓고 내부 회의론에 직면함.
- 업계에서 모델 효능을 측정하는 벤치마크에서는 좋은 성과를 보였지만, 실제로 업무에 투입하면 성능이 떨어지고 일부 코딩 작업을 처리하는 데 어려움이 있다는 내부 평가가 나옴.
- Google은 OpenAI와 Anthropic을 따라잡을 모델을 개발하는 데 최근 어려움을 겪어 왔음.
- 내부 사안을 논의하기 위해 익명을 요청한 관계자들에 따르면, Google은 6월에 Gemini 3.5 Pro라는 다른 버전을 출시할 계획이었으나 해당 작업을 중단함.
- Google은 Gemini 4가 코딩 등 일부 영역에서 기대에 못 미친다고 표현하는 것은 부정확하다고 반박함. Google은 지난주 Google DeepMind 책임자 Koray Kavukcuoglu가 모델 성능에 고무됐다고 밝힌 발언을 Bloomberg에 안내함.
“팀을 전적으로 신뢰함. 우리가 언제나 프런티어에 있을 것이라는 점은 내게 확실함.”
- Google 내부의 평가는 엇갈림.
- 일부 직원은 Anthropic의 Fable과 OpenAI의 Astra가 Gemini보다 빠르게 개선되고 있으며, Gemini 4가 가장 좋은 성능을 내더라도 일부 영역에서는 두 모델에 뒤처질 것으로 봄.
- 모델 개발에 정통한 다른 Google 직원은 Gemini 4가 프런티어 수준이라는 데 회사 내부의 “폭넓은 합의”가 있다고 밝힘. 이 직원은 Google이 모델을 엄격하게 시험했으며, 실제의 복잡하고 정돈되지 않은 코딩 작업에서 어려움을 겪는다는 주장도 부인함.
- Google 제품 대부분은 검색 상단의 AI 답변부터 Maps, Gmail, Chrome까지 Gemini 모델에 기반하며, 각 제품의 사용자는 10억 명을 넘음. 이는 일부 경쟁사가 갖추지 못한 유통상의 이점임.
- OpenAI와 Anthropic은 모델 판매를 넘어 코딩 에이전트 등 자체 제품 개발로 영역을 넓히고 있음. 최첨단 모델을 내놓지 못하면 검색과 소프트웨어의 미래가 경쟁사 플랫폼에서 이뤄져야 한다고 소비자·개발자·기업을 설득할 시간을 경쟁사에 더 줄 수 있음.
- Google은 마지막 Pro 모델이 2월에 출시된 뒤에도 기업용 Gemini, 소비자용 챗봇 앱, Google 검색의 AI Mode 등 AI 제품이 성장했다고 밝힘. 이 중 소비자용 챗봇 앱과 AI Mode는 각각 사용자 10억 명을 넘김.
Gemini 3와 취소된 Gemini 3.5 Pro
- Google은 지난해 11월 Gemini 3를 공개했으며, 이 모델은 호평을 받으며 OpenAI와 Anthropic을 따라잡으려는 Google의 노력에서 전환점으로 널리 평가됨.
- Google은 5월 I/O 콘퍼런스에서 Gemini 3.5 Pro를 발표하고 다음 달 출시를 약속했지만, 출시 시점이 지나간 뒤 해당 모델 개발을 중단함.
- Bloomberg Intelligence 애널리스트 Mandeep Singh에 따르면, 이 같은 결정은 Google의 AI 포부에 차질을 준 데 더해 상당한 시간과 비용을 소모했을 가능성이 있음. 모델 학습에는 최대 4억 달러가 필요할 수 있으며, 고액 연봉의 AI 연구원을 투입하면 비용이 더 늘어날 수 있음.
- Gemini 4는 코딩 능력이 고르지 않다는 내부 평가를 받고 있음. 한 관계자는 앱과 웹사이트의 외관과 사용감을 결정하는 프런트엔드 디자인에 Gemini가 특히 능숙하지 않다고 밝힘.
- AI 코딩 도구 시장에서 경쟁에 어려움을 겪어 온 Google에 이는 잠재적으로 심각한 차질임.
- 개발 상황을 아는 한 관계자는 Gemini 4가 매우 큰 모델이라고 설명함. 대형 모델은 일반적으로 실행 비용이 높아 Google의 수익 마진에 압박을 줄 수 있음.
‘벤치맥싱’과 실제 제품 성능
- 전문가들은 Google이 벤치마크 점수에 집중하는 업계의 경향에 영향을 받고 있을 수 있다고 봄. ‘벤치맥싱’은 엔지니어가 실제로 일을 잘 수행하는 제품을 만드는 것보다 높은 점수를 얻는 데 더 집중하는 현상임.
- AI 연구소는 고객이 벤치마크 점수로 모델을 평가하는 경우가 많아 이런 경향을 보임. 모델을 잘 아는 두 관계자는 Gemini 4도 이 과정의 영향을 받는 것으로 보인다고 밝힘.
- AI 스타트업 Surge AI의 창업자 Edwin Chen은 벤치마크에 의존하면 연구소가 사용하기 쉽고 잘 설계된 앱보다 특정 프로그래밍 언어로 코드를 작성하는 모델 개발에 집중할 수 있다고 말함.
“우리 아이가 SAT에서 아주 좋은 점수를 받았다고 하는 것과 비슷함. 하지만 SAT 점수가 현실에서의 성과로 이어지는 것은 아님. 대단히 해로운 문제임.”
- Gemini 4에는 강점도 있음. 모델에 정통한 한 관계자는 영상에서 메타데이터를 추출하는 등 텍스트를 넘어선 입력을 이해하는 능력이 두드러진다고 설명함.
- 같은 관계자는 안전성, 사이버 보안, 명확하고 자연스럽게 소통하는 능력도 Gemini 4의 강점으로 꼽음.
Google의 조직 과제와 경쟁사 동향
- Google 내부에는 좌절감이 뚜렷함. 이전 Bloomberg 기사에서 인터뷰한 연구원들은 Google이 기술을 거의 모든 제품에 접목하려는 방대한 관료주의를 비판했으며, 계속 바뀌는 지시와 우선순위 때문에 일관된 전략에 집중하기 어렵다고 말함.
- 전설적인 엔지니어 Jeff Dean, 노벨상 수상자 John Jumper, AI 붐을 뒷받침하는 기술의 발명에 기여한 Noam Shazeer 등 유명 AI 연구자들이 Google을 떠남.
- 오랫동안 Google의 AI 연구를 이끈 Demis Hassabis는 8월 새로 회장직을 맡았으며, DeepMind의 일상 운영은 오랜 측근인 Kavukcuoglu에게 넘김.
- Google이 격차를 좁히려는 동안 경쟁사들은 계속 빠르게 발전하고 있음. AI 에이전트가 외부 조직을 해킹한 사건이 잇따른 뒤 일부 프런티어 모델 개발이 둔화될 수 있다는 이야기가 나왔지만, 경쟁사들의 진전은 이어짐.
- Meta Platforms는 이달 초 온라인 쇼핑과 예약 같은 일상 작업을 완료할 수 있다고 설명한 AI 에이전트 Muse를 출시했으며, 앱은 빠르게 다운로드 순위 최상단에 올랐음.
댓글 (0)
로그인하면 이 기사에 내 생각을 남길 수 있어요