Date: 2026-08-14 Topic: AI inference and API infrastructure Primary source: OpenAI
OpenAI가 2026년 8월 13일(미국 현지시간) GPT-5.6 Sol을 표준 처리보다 최대 14배 빠르게 실행하는 새 API 서비스 등급 ‘Ultrafast’를 공개했다. Cerebras의 추론 시스템을 이용해 초당 최대 750개의 출력 토큰을 생성하며, 우선 일부 고객을 대상으로 제한적인 프리뷰를 시작한다.
이번 발표의 요점은 작은 모델로 바꾸지 않고도 OpenAI의 최상위 모델을 속도가 중요한 업무에 투입할 수 있다는 데 있다. 장애 대응, 실시간 고객 상담, 금융·보안 분석처럼 답을 기다리는 몇 초가 업무 결과를 바꾸는 기업과 개발자가 주요 대상이다. 다만 실제 속도는 작업 조건에 따라 달라질 수 있고, 일반 공개 일정과 별도 가격은 아직 발표되지 않았다.
What Happened
OpenAI는 Ultrafast를 GPT-5.6 Sol 전용의 새로운 처리 등급으로 소개했다. 기존에는 응답 시간을 줄이려면 보통 더 작거나 특정 용도에 맞춘 모델을 선택해야 했지만, Ultrafast는 최상위 모델의 능력을 유지한 채 출력 속도를 크게 높이는 방향을 택했다.
서비스는 OpenAI API에서 먼저 제공된다. 현재는 초기 고객군만 사용할 수 있으며, OpenAI는 실제 업무에서 속도 향상이 어떤 차이를 만드는지 관찰한 뒤 용량이 확보되는 대로 접근 범위를 넓힐 계획이다. 따라서 이번 발표는 전면 출시가 아니라 생산 환경을 이용한 제한적 검증 단계로 보는 편이 정확하다.
Key Details
- 대상 모델은 GPT-5.6 제품군의 최상위 모델인
GPT-5.6 Sol이다. - OpenAI가 제시한 성능은 표준 처리 대비 최대 14배, 출력 속도는 초당 최대 750토큰이다.
- 기반 추론 인프라는 AI 가속기 업체 Cerebras가 제공한다.
- 우선 적용 대상으로 장애 대응, 금융·보안 분석, 고객 지원과 음성 서비스, 전자상거래, 실시간 연구가 제시됐다.
- 초기 제공 방식은 OpenAI API의 제한적 프리뷰이며, 신청 고객 모두가 즉시 사용할 수 있는 상태는 아니다.
- Ultrafast의 별도 요금과 광범위한 출시 시점은 공식 발표에 포함되지 않았다.
‘최대’ 수치는 모든 요청에서 보장되는 평균 속도가 아니다. 입력 길이, 출력 길이, 도구 호출, 네트워크 지연, 동시 사용량 등에 따라 사용자가 느끼는 전체 응답 시간은 달라질 수 있다. 초당 출력 토큰 수가 빨라도 모델이 첫 답을 내놓기까지 걸리는 시간이나 외부 도구의 처리 시간이 길다면 서비스 전체는 그만큼 늦어진다.
Background
GPT-5.6 Sol은 복잡한 전문 업무를 겨냥한 OpenAI의 플래그십 모델이다. 일반 API 가격은 100만 토큰당 입력 5달러, 출력 30달러로 안내돼 있지만, 이 금액을 Ultrafast에도 그대로 적용할 수 있는지는 확인되지 않았다. 속도 우선 등급은 더 많은 전용 연산 자원을 요구할 가능성이 있으므로 실제 도입 판단에는 별도 가격과 사용량 제한 확인이 필요하다.
OpenAI와 Cerebras의 협력은 갑자기 시작된 것이 아니다. 두 회사는 2026년 1월, 750메가와트 규모의 Cerebras 시스템을 단계적으로 배치하는 다년 계약을 발표했다. Cerebras는 여러 개의 일반적인 GPU를 연결하는 방식과 달리 웨이퍼 크기의 대형 칩을 이용해 모델 추론 과정에서 발생하는 데이터 이동 지연을 줄이는 설계를 앞세우고 있다. Ultrafast는 이 협력이 실제 OpenAI API 상품으로 드러난 사례다.
Core Lens
Ultrafast의 의미는 답변이 빨리 표시되는 데 그치지 않고, 높은 성능의 모델을 사람이 기다리기 어려운 실시간 업무에 넣을 수 있는지 시험한다는 데 있다.
What It Changes for Developers
개발자에게 속도 향상은 단순한 체감 품질 이상의 변화가 될 수 있다. 예를 들어 장애가 진행되는 동안 로그와 최근 코드 변경을 함께 분석하거나, 고객과 통화하는 중에 여러 사내 시스템을 조회해 답을 만드는 서비스는 모델이 늦으면 업무 흐름 자체가 끊긴다. 충분히 빠른 추론은 이런 작업을 사후 분석에서 대화형 작업으로 바꿀 여지가 있다.
그러나 빠른 출력이 정확성이나 안정성을 자동으로 보장하지는 않는다. 기업은 실제 도입 전에 대표 업무를 이용해 첫 토큰 지연, 전체 완료 시간, 정답률, 도구 호출 실패율, 요청당 비용을 함께 측정해야 한다. 표준 처리와 Ultrafast를 같은 조건에서 비교해야 속도가 추가 비용을 정당화하는지도 판단할 수 있다.
속도 때문에 사람의 검토 단계를 없애는 것도 경계할 부분이다. OpenAI 역시 장애 대응 사례에서 엔지니어가 최종 판단과 배포 책임을 맡는다고 설명했다. 분석 결과가 빨리 나온다는 이유로 금융 거래, 보안 차단, 운영 배포까지 자동 승인하면 오류 역시 같은 속도로 확대될 수 있다.
What To Watch
- 제한적 프리뷰가 일반 API 고객에게 언제 확대되는지
- Ultrafast 전용 가격과 사용량·속도 제한이 어떻게 책정되는지
- ‘최대 750토큰/초’가 실제 장문 응답과 도구 사용 업무에서도 유지되는지
- 더 빠른 추론이 음성 상담과 장애 대응에서 실제 완료 시간과 성공률을 얼마나 개선하는지
- Cerebras 기반 용량이 늘어날 때 지역별 가용성과 서비스 안정성이 어떻게 달라지는지
이번 발표는 최고 성능 모델과 빠른 모델을 따로 선택하던 구도를 좁히려는 시도다. 다만 지금 확인된 것은 일부 고객을 대상으로 한 초기 성능과 회사가 제시한 활용 사례다. Ultrafast의 실질적인 경쟁력은 공개 범위가 넓어진 뒤 가격, 평균 지연시간, 안정성까지 함께 비교할 수 있을 때 더 분명해질 것이다.