OpenAI GPT-5.6 출시, 더 강한 모델보다 '쓸 수 있는 성능'을 앞세우다

OpenAI가 GPT-5.6 Sol, Terra, Luna를 정식 출시하고 ChatGPT, Codex, API에 배포를 시작했다. 이번 발표는 최고 성능뿐 아니라 토큰 효율, 멀티 에이전트, Programmatic Tool Calling, 보안 통제를 함께 강조한다.

Date: 2026-07-10 Topic: AI Primary source: OpenAI

OpenAI가 2026년 7월 9일 GPT-5.6 모델군을 정식 출시했다. 새 모델군은 플래그십 모델인 Sol, 일상 업무용 균형 모델 Terra, 저비용 모델 Luna로 나뉘며, ChatGPT, Codex, OpenAI API에서 순차적으로 제공된다. OpenAI는 이번 발표에서 단순한 최고 성능보다 토큰당 효율, 업무 완성도, 보안 통제, 개발자용 에이전트 기능을 핵심 변화로 설명했다.

가장 큰 변화는 GPT-5.6을 더 오래 생각하는 모델이 아니라, 여러 도구와 작업 흐름을 직접 조정하는 모델로 포지셔닝했다는 점이다. OpenAI는 max와 ultra 같은 높은 추론 설정, API의 Programmatic Tool Calling, 베타 형태의 멀티 에이전트 기능을 함께 공개했다. 영향을 받는 쪽은 ChatGPT 유료 사용자, Codex 사용자, API 개발자, 그리고 AI를 문서·코딩·보안·연구 업무에 붙여 쓰는 기업 고객이다.

News Brief

  • OpenAI는 GPT-5.6 Sol, Terra, Luna를 일반 제공한다고 밝혔다.
  • 제공 범위는 ChatGPT, ChatGPT Work, Codex, OpenAI API이며, 전 세계 배포는 발표일부터 24시간에 걸쳐 진행된다.
  • Sol은 최고 성능 모델, Terra는 GPT-5.5와 경쟁 가능한 낮은 비용 모델, Luna는 가장 빠르고 저렴한 모델로 소개됐다.
  • API 가격은 100만 토큰 기준 Sol이 입력 5달러·출력 30달러, Terra가 입력 2.50달러·출력 15달러, Luna가 입력 1달러·출력 6달러다.
  • OpenAI는 코딩, 지식 업무, 사이버보안, 과학 연구에서 이전 모델 대비 성능과 효율이 개선됐다고 주장했다.

Key Details

이번 발표에서 눈에 띄는 지점은 모델 이름보다 사용 방식이다. OpenAI는 GPT-5.6 Sol이 복잡한 작업에서 더 많은 시간을 쓰는 max, 여러 에이전트를 병렬로 조정하는 ultra 설정을 제공한다고 설명했다. Codex에서는 Plus 이상 요금제부터 ultra를 쓸 수 있고, ChatGPT Work에서는 Pro와 Enterprise 사용자에게 제공된다.

개발자용 API에도 변화가 있다. Responses API의 Programmatic Tool Calling은 모델이 중간 결과를 모두 대화로 되돌려 보내지 않고, 필요한 데이터를 걸러내거나 간단한 프로그램을 메모리 안에서 실행하며 다음 단계를 정할 수 있게 한다. OpenAI는 이 기능이 Zero Data Retention 환경과도 호환된다고 밝혔다. 멀티 에이전트 기능은 우선 베타로 제공되며, 하나의 요청 안에서 여러 하위 에이전트가 동시에 작업하고 결과를 합치는 방식이다.

성능 수치도 함께 공개됐다. OpenAI에 따르면 GPT-5.6 Sol은 Artificial Analysis Coding Agent Index에서 80점을 기록했고, Terminal-Bench 2.1에서는 Sol Ultra가 91.9%를 기록했다. 사이버보안 평가에서는 SEC-Bench Pro 71.2%, ExploitBench 73.5%를 제시했다. 다만 이 수치들은 OpenAI 발표 자료의 평가 조건과 추정 비용에 기반하므로, 실제 업무 성능은 프롬프트, 도구, 권한, 데이터 품질에 따라 달라질 수 있다.

Background

최근 대형 AI 모델 경쟁은 "누가 더 똑똑한가"에서 "누가 더 안정적으로 일을 끝내는가"로 옮겨가고 있다. 사용자는 모델 점수보다 코드를 고치고, 문서를 정리하고, 브라우저와 파일을 오가며, 기업의 내부 도구와 연결되는 경험을 더 직접적으로 느낀다. GPT-5.6 발표가 코딩 벤치마크, 문서·프레젠테이션 품질, 컴퓨터 사용, 보안 통제를 한꺼번에 다룬 것도 이 흐름과 맞닿아 있다.

특히 기업 고객에게 중요한 문제는 비용이다. 성능이 조금 높아져도 토큰 사용량과 지연 시간이 커지면 실제 도입 비용이 빠르게 올라간다. OpenAI가 이번 발표에서 "성능당 비용"과 캐시 가격, 토큰 효율을 반복해서 강조한 이유도 여기에 있다. 모델을 한두 번 시험하는 단계와 매일 수천 건의 업무에 붙이는 단계는 경제성이 전혀 다르다.

Core Lens
GPT-5.6의 핵심은 최고 점수 경쟁보다, AI가 긴 업무를 맡아도 비용과 통제를 감당할 수 있게 만드는 제품화에 가깝다.

What It Means

GPT-5.6은 OpenAI가 모델을 단순한 답변 엔진이 아니라 업무 운영 계층으로 밀고 있다는 신호다. 사용자가 한 문장을 입력하면 모델이 도구를 호출하고, 중간 결과를 정리하고, 여러 갈래의 작업을 나눈 뒤, 최종 산출물까지 다듬는 구조가 더 중요해졌다. 이 방향은 개발자에게는 편리하지만, 동시에 관찰 가능성, 권한 관리, 비용 예측이라는 새 숙제를 만든다.

보안 측면에서도 의미가 작지 않다. OpenAI는 GPT-5.6이 사이버보안과 생명과학에서 더 강해졌지만 Critical 임계값은 넘지 않았다고 설명했다. 또 고위험 기능은 신뢰된 사용자와 조직에 더 정밀하게 제공하고, 실시간 점검과 계정 수준 통제를 결합한다고 밝혔다. 이는 강한 모델을 무조건 막기보다, 방어 목적의 사용은 살리고 악용 가능성이 큰 요청은 더 세밀하게 제한하려는 접근이다.

국내 기업과 개발자에게는 두 가지 질문이 남는다. 첫째, GPT-5.6의 효율 개선이 한국어 업무, 사내 문서, 로컬 규정 문맥에서도 비슷하게 나타나는가. 둘째, 더 자율적인 에이전트 기능을 도입할 때 사내 시스템 접근권, 감사 로그, 데이터 보존 정책을 어떻게 맞출 것인가. 성능 발표만 보고 도입을 결정하기보다, 실제 업무 흐름에서 작은 파일럿을 돌려보는 쪽이 현실적이다.

What To Watch

  • 실제 배포 후 24시간 안에 ChatGPT, Codex, API에서 지역·요금제별 접근성이 어떻게 열리는지 확인할 필요가 있다.
  • ultra와 멀티 에이전트 기능은 결과 품질만큼 비용과 지연 시간도 함께 봐야 한다.
  • Programmatic Tool Calling이 기존 함수 호출, 워크플로 자동화, 에이전트 프레임워크와 어떻게 겹치거나 대체되는지 살펴볼 만하다.
  • 사이버보안 기능은 방어 업무에 유용할 수 있지만, 조직별 권한 검증과 로그 정책 없이는 운영 리스크가 생길 수 있다.
  • 발표 자료의 벤치마크 수치가 실제 한국어 문서 작성, 코드베이스 유지보수, 업무 자동화에서 재현되는지 별도 검증이 필요하다.

Sources