[딜사이트 이수민 인턴기자] 구글이 새로운 AI모델 '제미나이4 아르곤(Gemini 4 Argon)'을 공개하며 최상위 AI 경쟁에 다시 합류했다. 독립 평가에서는 오픈AI의 최상위 모델 GPT-6 Astra(아스트라)와 같은 점수를 기록하며 선두권에 진입했다.
구글은 지난 30일(현지시간) 제미나이 4세대의 첫 최상위 모델인 아르곤을 공개했다. 구글은 복잡한 소프트웨어 개발과 금융·법률 등 기업 업무와 사이버보안에 특화한 프런티어 모델이라고 소개했다. 프런티어 모델은 업계 최고 수준의 성능을 목표로 개발한 첨단 AI모델을 말한다.
구글 내부에서는 아르곤이 정해진 평가에서는 높은 점수를 내지만 일부 코딩 작업에서는 기대에 미치지 못한다는 지적이 나오고 있다. 아르곤은 현재 일부 사이버보안 파트너들에게 우선 제공하고 일반 공개은 아직 되지 않았다.
◆ 7개월 공백 끝에 컴백…최상위권 재진입
구글은 당초 지난 6월 '제미나이3.5 프로(Gemini 3.5 Pro)'를 내놓을 예정이었지만 출시를 수개월 미뤘다. 외신에서는 소프트웨어 코딩 등에서 내부 목표치를 충족하지 못한 것이 지연 배경이라고 보도했다.
구글이 약 7개월간 최상위급 신모델을 내놓지 않은 사이 오픈AI와 앤트로픽은 한층 강화된 프론티어급 모델을 잇달아 내놓으며 격차를 벌렸다. 하지만 이번 아르곤 공개를 계기로 AI 모델 평가기관 아티피셜 애널리시스(Artificial Analysis)는 구글이 다시 최상위 AI모델 ‘삼파전’으로 복귀했다고 평가했다.
지난 30일 아티피셜 애널리시스가 공개한 평가에서 아르곤은 지능지수(Intelligence Index) 53점을 받았다. 오픈AI의 아스트라와 같은 점수다. 기존 제미나이 3.1 프로 프리뷰(Gemini 3.1 Pro Preview)의 30점과 비교하면 23점 상승했다.
독립 평가와 별개로 구글이 공개한 자료에서 아르곤은 기업의 실제 지식 업무를 평가하는 발스 인덱스(Vals Index)에서 68.9%를 기록했다. 아스트라는 63.1%, 클로드 오퍼스(Claude Opus) 5.5는 67.0%였다.
금융 업무를 평가하는 파이낸스 에이전트 v2(Finance Agent v2)에서도 아르곤은 65.4%였다. 아스타라의 53.5%, 클로드 오퍼스5.5의 58.6%를 앞섰다.
아르곤의 가격경쟁력도 눈에 띈다. 아티피셜 애널리시스에 따르면 할인 가격을 적용한 아르곤의 평가 작업당 비용은 1.99달러(2700원)로 아스트라의 약 60% 수준이다. 단 초기 할인 종료 후에는 같은 평가 작업당 비용이 3.98달러로 높아져 아스트라보다 약 22% 비싸진다.
하지만 아르곤은 같은 평가에서 작업당 평균 6만2000개의 출력 토큰을 사용한다. 아스트라의 2만7000개보다 두 배 이상 많다. 아르곤은 출력 토큰 사용량이 많지만 낮은 토큰당 요금으로 초기 평가 비용을 낮췄다.
◆내부선에서는 부정적 목소리…"실제 코딩은 다르다"
일부 외신에서는 지난 30일 제미나이4 개발 상황을 잘 아는 관계자들을 인용해, 모델이 벤치마크에서는 좋은 성적을 내지만 일부 실제 코딩 작업에서는 성능이 고르지 않다는 내부 평가가 나온다고 보도했다. 일부 직원은 앤트로픽과 오픈AI 모델의 개선 속도가 제미나이보다 빠르다고 평가했다.
구글은 이에 대해서 부정확한 주장이라고 반박했다. 구글 내부적으로 이미 제미나이4가 최상위 프런티어 모델 수준에 도달했다는 데 폭넓은 공감대가 있다고 밝혔다.
지난 30일 구글 딥마인드(Google DeepMind)의 자료에 따르면 장시간 소프트웨어 개발 능력을 측정하는 딥SWE v1.1(DeepSWE v1.1)에서 아르곤은 77.9%를 기록했다. 아스트라의 74.1%와 클로드 오퍼스 5.5의 74.2%를 앞섰다. 바이브 코드 벤치(Vibe Code Bench)에서도 91.9%로 경쟁 모델보다 높은 점수를 냈다.
반면 소프트웨어 개발 능력을 평가하는 프런티어SWE v2(FrontierSWE v2)에서 아르곤은 55.0%를 기록했다. 아스트라는 65.5%, 클로드 오퍼스 5.5는 62.3%였다. 실제 개발환경에 가까운 터미널 작업을 평가하는 터미널벤치 4.0(Terminal-Bench 4.0)에서도 아르곤은 57.4%였다. 아스트라의 58.2%, 클로드 오퍼스 5.5의 66.4%에 뒤지는 수치다.
'코딩 성능'이라는 같은 범주에서도 어떤 문제와 환경을 주느냐에 따라 선두 모델이 달라진다. 아르곤의 벤치마크 성적 자체가 낮은 것은 아니지만 특정 평가의 1위만으로 실제 개발 업무에서도 우위에 있다고 단정하기 어렵다.
구글은 현재 아르곤을 페어윈드 프로그램(Fairwind Program)을 통해 일부 사이버보안 전문가에게 우선 제공하고 있다. 향후 유료 API 고객과 구글 AI 울트라 가입자부터 제공 범위를 넓힐 계획이다. 하지만 아직 구체적인 일정은 공개하지 않았다.
이번 발표로 구글의 아르곤은 다시 오픈AI·앤트로픽과 최상위 모델 성늘을 겨룰 수 있는 수준으로 올라왔다. 게다가 구글은 검색과 지메일(Gmail), 워크스페이스, 클라우드 등 AI를 바로 붙일 수 있는 거대한 서비스 기반을 갖고 있다.
아르곤의 성능이 실제 업무에서도 벤치마크 수준을 보여준다면 기존 서비스 기반을 발판 삼아 AI 서비스 시장에서 영향력을 빠르게 확대할 수 있다. 다만 실제 시장 경쟁력은 일반 공개 이후의 업무별 성능과 처리시간, 할인 종료 후 비용에 따라 달라질 전망이다.
ⓒ새로운 눈으로 시장을 바라봅니다. 딜사이트 무단전재 배포금지
Home
