azosi · 2026.10.2 00:04 · 조회 1
구글, Gemini 4 Argon 공개 — 100만 토큰 출력·$2/$10 가격의 단계적 프론티어
구글 딥마인드가 2026년 9월 30일 새 프론티어 모델 Gemini 4 Argon을 공식 발표했다. 발표 직후 어제(10월 1일) 미국 백악관에서 열린 AI 안전 자발적 합의(VSAAF)에 Pichai CEO가 서명하면서 "가장 강력한 모델은 신중하게 단계적으로 내보낸다"는 메시지를 동시에 내보였다.
무엇이 발표됐나
Koray Kavukcuoglu SVP(Chief AI Architect)가 작성한 공식 블로그 글의 핵심 발표 내용은 다음과 같다.
- 출력 토큰 100만 개: 기존 64,000개에서 업계 최고 수준으로 확대. 장시간 다단계 추론이 한 번의 실행에서 가능해진다.
- 도입 가격 $2 / 출력 $10(100만 토큰당), 캐시 입력은 입력가 대비 95% 할인. 프로모션 종료 후에는 $4/$20로 책정된다.
- 단계적 배포: 우선 Fairwind Program에 가입한 검증된 사이버 방어팀과 미국 정부의 자발적 사전 검토 프로세스에 먼저 제공한다. 일반 개발자·기업·소비자에게는 추후 점진 확대.
- **DeepSWE v1.1 77.9%**로 state-of-the-art를 기록했다고 DeepMind 모델 카드에 명시됐다.
1차 출처로 확인된 핵심 수치
DeepMind 모델 카드와 평가 방법론 페이지의 공식 표에서 직접 확인한 값은 다음과 같다(2026년 10월 기준 측정).
| 벤치마크 | 영역 | Gemini 4 Argon |
|---|---|---|
| Vals Index | 지식 업무 | 68.9% |
| Vals Finance Agent v2 | 금융 | 65.4% |
| Harvey's Legal Agent | 법률 | 19.6% |
| DeepSWE v1.1 | 에이전틱 코딩 | 77.9% |
| Vibe Code Bench | 에이전틱 코딩 | 91.9% |
| LABBench 2 | 과학·수학 | 88.8% |
| RiemannBench | 과학·수학 | 76.0% |
| GraphWalks (256k~1M) | 장문맥 | 84.2% |
| Agent's Last Exam | 컴퓨터 사용 | 39.5% |
| CWE-bench v1 | 사이버 | 68.0% |
| LVBench | 멀티모달 | 91.7% |
DeepSWE v1.1의 77.9%는 자체 측정이며, 다른 모델(예: GPT-6 Astra 74.1%, Claude Fable 5.1 67.4%)과 비교해 Argon이 가장 높다. 단, FrontierSWE v2와 Terminal-bench 4.0, PostTrainBench에서는 GPT-6 Astra 또는 Claude Opus 5.5가 앞선다. "18개 중 12개 벤치마크에서 경쟁 모델을 앞질렀다"는 회사 측 자기 평가도 같은 페이지에서 확인할 수 있다.
배포 방식의 의미
Argon은 DeepMind의 표현을 빌리자면 "Safely releasing frontier capabilities at this level requires a phased approach" — 즉 일반 공개 시점이 정해져 있지 않다. 먼저 사이버 방어 파트너에게만 공개하고, 미국 정부 자발적 검토를 거친 뒤에야 개발자·기업·소비자 단계로 확장한다는 구조다. 6월 워싱턴이 Anthropic의 Claude Mythos·Fable 공개를 일시 중단시켰던 사건 이후, 모든 프론티어 모델이 사실상 비슷한 검증 단계를 밟고 있다.
내부 사용 사례에서 드러난 두 가지 효과
DeepMind 공식 블로그에 따르면 Argon은 이미 구글 내부에서 사용 중이다.
- 양자 알고리즘 최적화: Argon이 수 분 안에 기존 공개 문헌 대비 40% 더 나은 결과를 제출한 사례가 있다고 회사 측이 밝혔다.
- 메모리 최적화: 데이터센터 텔레메트리 분석을 통해 자율적으로 메모리 최적화를 적용, 300 TiB 이상을 절감했고, 종합적으로는 500 TiB ~ 1 PiB까지 절감이 가능할 것으로 추산한다고 명시했다.
시사점
세 가지로 정리된다.
첫째, 장문맥·장시간 작업이 새로운 프론티어의 경쟁축이 됐다. 입력은 이미 GPT-6 Astra·Claude Fable가 1M 토큰에 도달했고, 이제는 출력 1M 토큰이 다음 기준점으로 떠올랐다. 한 번의 실행에서 더 길고 다단계 작업을 끝내는 능력이 곧 실사용 시나리오의 차별점이 된다.
둘째, 프론티어 모델은 이제 가격 경쟁 구간으로 진입했다. GPT-6.1 Sol이 $2/$10 가격으로 등장했고, Gemini 4 Argon도 같은 가격대에 첫선을 보였다. 2026년 하반기부터 GPT·Claude·Gemini가 모두 같은 가격대에 모이면서, API 사용자가 업체를 갈아타는 비용이 실질적으로 사라지는 셈이다.
셋째, 공개 전 검증 단계가 사실상 표준이 됐다. Anthropic Mythos → OpenAI GPT-6.1 Sol → Google Argon 순서로, 모든 회사가 검증된 소수 사용자에게 먼저 공개하고 확대하는 방식을 채택하고 있다. 어제 Pichai가 백악관 자발적 합의에 서명한 것도 같은 흐름의 연장선이다.
출처
- Google Blog — Gemini 4 Argon: our next era of frontier intelligence (2026-09-30): https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-4-argon/
- Google DeepMind — Gemini 모델 페이지: https://deepmind.google/models/gemini/
- Google DeepMind — Gemini 4 Argon 평가 방법론 (2026-10-01): https://deepmind.google/models/evals-methodology/gemini-4-argon
- Google Blog — Fairwind Program (2026-09-02): https://blog.google/innovation-and-ai/technology/safety-security/fairwind-program/
본 글은 Google 공식 블로그와 Google DeepMind 모델 카드·평가 방법론 페이지를 1차 출처로 삼아 작성되었습니다. 벤치마크 수치는 모두 모델 카드 공식 표에서 직접 인용했습니다.
댓글
아직 댓글이 없습니다.
댓글을 작성하려면 로그인이 필요합니다.