Date: 2026-07-26 Topic: AI 모델·개발 도구 Primary source: Anthropic
앤트로픽은 7월 24일(현지시간) 새 범용 AI 모델 ‘클로드 오퍼스 5’를 출시했다. 오퍼스 4.8과 같은 API 가격을 유지하면서 코딩과 지식 업무 성능을 높였고, 더 강력하지만 비싼 상위 모델 페이블 5에 가까운 결과를 절반 수준의 작업 비용으로 제공한다는 것이 회사의 설명이다.
오퍼스 5는 이날부터 클로드 웹·앱과 API, 클로드 코드 등 모든 플랫폼에서 사용할 수 있다. 일반 개발자와 기업은 성능뿐 아니라 비용, 처리 속도, 보안 제한을 함께 비교해 모델을 고를 수 있게 됐다. 다만 공개된 성능 수치 상당수는 앤트로픽과 협력사가 측정한 결과여서 독립 평가가 더 필요하다.
News Brief
이번 발표의 핵심은 단순히 더 높은 벤치마크 점수를 내세운 것이 아니다. 앤트로픽은 오퍼스 5를 매일 반복해서 쓰는 코딩·문서·분석 업무에 맞춘 모델로 설명했다. 클로드 맥스에서는 기본 모델이 됐고, 클로드 프로에서는 이용 가능한 가장 강한 모델로 배치됐다.
- API 모델명:
claude-opus-5 - 기본 가격: 입력 100만 토큰당 5달러, 출력 100만 토큰당 25달러
- 빠른 모드: 기본보다 약 2.5배 빠르며 가격은 두 배
- 제공 범위: 클로드 서비스와 클로드 코드, 클로드 코워크, 클로드 API
- 일반 이용 시 별도의 데이터 보존 의무 없음
가격은 오퍼스 4.8과 같다. 따라서 기존 오퍼스 사용자는 예산을 그대로 유지하면서 새 모델로 바꿀 수 있고, 페이블 5를 쓰던 팀은 일부 작업을 오퍼스 5로 옮겨 비용을 낮출 여지가 생겼다.
Key Details
앤트로픽은 오퍼스 5가 코딩, 컴퓨터 조작, 업무 자동화에서 비용 대비 성능을 높였다고 밝혔다. 회사 측 측정에 따르면 CursorBench 3.2의 최대 추론 설정에서 페이블 5의 최고 점수와 0.5% 이내 차이를 보였으며, 작업당 비용은 절반 수준이었다. 컴퓨터 사용 능력을 평가하는 OSWorld 2.0에서는 페이블 5의 최고 결과를 약 3분의 1 비용으로 넘어섰다고 설명했다.
모델이 답을 한 번 생성하고 끝내기보다 자신의 작업을 확인하고 수정하는 능력도 강조됐다. 앤트로픽이 공개한 사례에서 오퍼스 5는 입력 자료를 직접 볼 수 없는 상황에서 이미지 분석 절차를 만들어 기계 부품의 3D 모델을 재구성했고, 오픈소스 패키지의 버그를 고치면서 기존 패치가 놓친 원인까지 찾아냈다. 다만 이러한 사례와 수치는 출시사가 설계한 평가 또는 사전 이용 고객의 결과라는 점을 함께 봐야 한다.
과학 분야에서도 유기화학 내부 평가 점수가 오퍼스 4.8보다 10.2%포인트 높아졌다고 발표했다. 그렇다고 오퍼스 5가 모든 분야에서 앤트로픽의 최상위 모델인 것은 아니다. 공격적 사이버보안과 고위험 생물학 연구에서는 페이블 5나 미토스 5가 더 강한 것으로 분류된다.
Safety and Controls
오퍼스 5는 소스코드에서 취약점을 찾는 작업은 허용하지만, 바이너리를 대상으로 한 취약점 탐색과 침투 테스트, 실제 공격 코드 생성은 차단한다. 앤트로픽은 이 보안 분류기가 페이블 5보다 약 85% 적게 개입할 것으로 예상했다. 보안 연구에 필요한 정상적인 요청이 과도하게 막히는 문제를 줄이되, 실행 가능한 공격으로 이어질 가능성이 큰 작업은 제한하겠다는 설계다.
안전 분류기가 요청을 막았을 때는 오퍼스 4.8로 자동 전환할 수 있다. 클로드 웹·앱과 클로드 코드, 클로드 코워크에서는 기본 적용되며 API에서는 베타 기능으로 선택할 수 있다. 이용자 입장에서는 단순한 거절 메시지 대신, 위험도가 낮은 모델이 처리할 수 있는 범위에서 답을 받는 방식이다.
Background
최신 AI 모델을 업무에 적용할 때 기업이 부담하는 비용은 호출 한 번의 토큰 가격만으로 결정되지 않는다. 한 작업을 끝내기까지 필요한 재시도 횟수, 도구 호출량, 처리 시간, 사람이 결과를 검수하는 시간까지 합쳐야 실제 비용이 나온다. 오퍼스 5가 ‘작업당 비용’을 반복해서 강조한 이유도 여기에 있다.
오퍼스 5는 오퍼스 4.8 출시 약 두 달 만에 나왔다. 짧아진 출시 간격은 모델 회사들이 최고 점수 하나로 경쟁하기보다, 같은 제품군 안에서 성능과 가격, 안전 제한이 다른 모델을 촘촘하게 배치하는 방향으로 움직이고 있음을 보여준다.
Core Lens
이번 경쟁의 기준은 가장 똑똑한 모델 하나가 아니라, 실제 업무를 끝낼 때까지 얼마가 들고 어느 정도의 통제가 가능한가로 이동하고 있다.
What It Means
개발팀에는 모델 선택이 한 번의 구매 결정이 아니라 작업별 배치 문제가 된다. 어려운 설계나 긴 분석에는 강한 모델을 쓰고, 반복적인 구현과 검토에는 비용 효율이 높은 모델을 연결하는 식이다. 자동 대체 기능까지 더해지면 하나의 서비스 안에서도 요청의 위험도와 난도에 따라 모델이 달라질 수 있다.
기업은 벤치마크 순위보다 자체 업무로 시험해 볼 필요가 있다. 코드 수정의 성공률, 재작업 횟수, 응답 지연, 보안 필터로 중단되는 비율을 함께 측정해야 가격표가 실제 절감으로 이어지는지 알 수 있다. 출시사가 제시한 결과와 외부 평가가 일치하는지도 중요한 확인 항목이다.
What To Watch
- 독립 벤치마크에서 비용 대비 성능 주장이 재현되는지
- 클로드 코드의 장시간 작업에서 오류와 재시도가 실제로 줄어드는지
- 자동 모델 전환이 응답 품질과 예측 가능한 운영에 어떤 영향을 주는지
- 기업 고객이 페이블 5 작업을 오퍼스 5로 얼마나 이전하는지
- 보안 연구 허용 범위가 정상적인 방어 업무와 공격 가능성을 적절히 구분하는지