구글 Gemini 4 Argon 공개, 코딩·보안 성능보다 먼저 확인할 ‘제한 배포’

구글이 9월 30일 새로운 AI 모델 Gemini 4 Argon을 발표했다.

구글이 9월 30일 새로운 AI 모델 Gemini 4 Argon을 발표했다. 코딩과 법률·금융 업무, 사이버 보안을 주요 활용 분야로 내세웠으며, 우선 제공 대상은 Fairwind 프로그램의 신뢰할 수 있는 보안 파트너들이다.

발표와 일반 이용자에게 제공되는 시점은 구분해야 한다. 구글은 유료 API 고객과 Google AI Ultra 구독자부터 접근을 확대할 계획을 밝혔지만, 이번 발표에는 일반 제공의 구체적인 날짜를 제시하지 않았다.

눈여겨볼 부분은 긴 작업을 이어가는 능력과 보안 취약점 수정이다. 다만 공개된 성능표와 가격에는 평가 조건, 제한된 접근, 출시 기념 요금이라는 전제가 붙는다.

Key Facts

구글은 Argon의 출력 토큰 한도를 기존 6만 4천 개에서 100만 개로 확대했다고 설명했다. 토큰은 모델이 처리하는 텍스트의 단위다. 여기서 늘어난 것은 모델이 생성할 수 있는 출력의 한도이며, 입력 문서를 얼마나 많이 읽는지와는 구분해서 봐야 한다.

긴 출력에는 중간 추론과 작업 결과를 담을 여지가 커진다는 의미가 있다. 예를 들어 코드 변경의 근거와 결과를 길게 정리하는 작업을 생각할 수 있다. 그러나 출력 한도가 커졌다고 답의 정확성이나 작업 완료가 보장되는 것은 아니다. 구글의 목표는 복잡한 작업을 여러 단계에 걸쳐 지속하는 능력을 높이는 데 있다.

Performance and Evidence

Google DeepMind의 성능표에서 Argon은 장기 소프트웨어 작업 평가인 DeepSWE v1.1에서 77.9%, 기업 업무 실행 평가인 AutomationBench에서 51.3%를 기록했다. 보안 취약점 수정 평가인 CWE-bench v1에서는 68.0%로 GPT-6 Astra와 같은 점수다. 이 수치는 서로 다른 능력을 평가하므로 하나의 종합 정확도로 읽어서는 안 된다.

같은 표에는 Argon이 뒤지는 항목도 있다. 컴퓨터 사용 평가인 OSWorld 2.0의 오프라인 부분 점수는 Argon 69.2%, GPT-6 Astra 72.6%다. Terminal-Bench Science 0.1에서는 각각 57.6%와 68.1%다. 코딩이나 기업 업무에서의 강점이 모든 컴퓨터 작업과 과학 과제의 우위를 뜻하지 않는다는 점을 보여준다.

평가 방식도 확인할 필요가 있다. 구글의 방법론 문서는 별도 표기가 없으면 한 번의 시도에 대한 성공률을 사용하고, 대체로 가장 높은 추론 설정으로 평가했다고 설명한다. 다른 회사 모델의 결과는 별도 설명이 없는 경우 각 공급자가 공개한 수치를 가져왔다.

DeepSWE의 Argon 점수는 구글이 mini-swe라는 에이전트 실행 틀을 이용해 계산한 값이다. 반면 일부 경쟁 모델 수치는 공개 순위표나 시스템 카드에서 가져왔다. 따라서 이 표를 같은 환경에서 전 모델을 다시 시험한 독립 비교로 소개하기는 어렵다. 모델 선택에 활용하되, 실제 저장소와 도구 권한을 맞춘 재검증이 필요하다는 해석이 적절하다.

보안 점수의 의미는 평가 과정을 보면 더 분명해진다. CWE-bench는 취약점의 위치나 개수를 미리 알려주는 대신, 실제 공개 저장소의 코드를 조사하고 문제를 수정하도록 한다. 프로그램으로 검사한 성공 판정에는 공격 재현이 더 이상 작동하지 않는지와 기존 테스트를 모두 통과하는지가 함께 포함된다.

운영자가 공개한 BlurHash 이미지 디코더 예시에서는 잘못된 문자열이 들어왔을 때 프로그램이 비정상 종료되지 않고 처리 가능한 오류를 반환해야 한다. 동시에 정상 문자열을 넣으면 기존과 같은 이미지 결과가 나와야 한다. 눈에 띄는 입력 오류 하나만 막는 패치로는 이 두 조건을 충족하지 못할 수 있다.

이 예시는 보안 코드의 수정에서 무엇을 확인해야 하는지 보여준다. AI가 그럴듯한 변경 설명을 작성했는지보다, 위험한 입력을 거부하고 정상 사용의 결과를 보존하는지가 핵심이다. 공개 평가의 성공률을 개별 서비스의 안전 보증으로 받아들이기 어려운 이유이기도 하다.

Cyber Defense and Access

Fairwind는 정부, 의료기관, 통신 등 중요한 서비스를 지키는 조직에 고도화된 모델을 먼저 제공하는 프로그램이다. 공식 안내는 일부 파트너가 Argon을 단독으로 쓰거나, 취약점 수정용 에이전트 CodeMender와 함께 사용할 수 있다고 설명한다. 프로그램에 속한 모든 조직이 자동으로 Argon을 받는다는 의미는 아니다.

접근에는 운영 조건이 붙는다. 참여 조직은 이용자 인증, 피싱에 강한 다중요소 인증, 적절한 접근 통제를 적용하고 직원의 이용을 추적해야 한다. 모델 접근은 내부 보안·사고 대응·침투 테스트 팀으로 제한되며, 접근 권한의 공유·재판매도 허용되지 않는다.

취약점 탐지와 패치는 방어에 도움이 되지만, 같은 능력은 공격에도 쓰일 수 있다. Fairwind의 공식 정책은 승인된 위협 시뮬레이션과 분석을 방어·학술 연구 목적으로 제한한다. 중요한 것은 모델이 만들어낸 수정안을 받아보는 단계와 운영 시스템에 적용하는 단계를 구분하는 일이다. 담당자는 변경 범위, 기존 기능의 유지, 재현 테스트를 확인할 수 있어야 한다.

Pricing and Availability

공개된 출시 기념 API 가격은 토큰 100만 개당 입력 2달러, 출력 10달러다. 캐시된 입력은 일반 입력보다 95% 저렴하게 책정됐다. 공식 발표의 각주는 기념 기간이 끝나면 입력 4달러, 출력 20달러가 적용된다고 명시한다.

기념 기간이 언제 끝나는지는 이 발표에 구체적으로 적혀 있지 않다. 도입 비용을 계산할 때는 초기 가격과 이후 가격을 각각 봐야 한다. 출력량이 큰 작업을 계획한다면 처리 시간을 비롯해 결과를 검토하는 비용도 함께 고려할 필요가 있다. 공개 요금 자체가 지금 모든 이용자에게 API가 열려 있다는 뜻은 아니다.

What It Means

이번 발표는 AI를 평가하는 기준을 더 구체적으로 만들 필요가 있음을 보여준다. 개발팀이라면 실제 오류를 얼마나 고치는지와 수정 뒤 테스트를 통과하는지를, 보안팀이라면 허가된 범위 안에서 취약점을 재현하고 안전한 패치를 제안하는지를 봐야 한다. 서로 다른 평가 점수만으로 이런 운영 조건까지 확인할 수는 없다.

다음 확인 지점은 유료 API·Ultra 이용자에게 언제, 어떤 조건으로 접근이 열리는지와 실제 업무에서의 처리 시간·비용이다. 지금 확인할 수 있는 것은 구글이 공개한 성능과 단계적 제공 계획이다. 독립적인 현장 성능은 일반 이용 확대 이후의 검증과 구분해 판단해야 한다.

Sources