OpenAI가 공개한 첫 자체 추론 칩의 성능과 남은 과제

OpenAI가 2026년 8월 25일 자체 설계한 첫 AI 추론 칩 ‘할라페뇨(Jalapeño)’의 초기 성능 측정 결과를 공개했다.

Date: 2026-08-26 Topic: AI 반도체 Primary source: OpenAI

OpenAI가 2026년 8월 25일 자체 설계한 첫 AI 추론 칩 ‘할라페뇨(Jalapeño)’의 초기 성능 측정 결과를 공개했다. 회사는 GPT-OSS 120B, 딥시크 R1 670B, 키미 K2.5 1T 모델을 구동한 시험에서 할라페뇨가 비교 대상 상용 시스템보다 전력당 처리량은 높고 응답 지연시간은 짧았다고 밝혔다.

이번 발표는 새 칩의 존재를 알리는 데서 한 단계 더 나아가 실제 작동 중인 실리콘의 수치를 제시했다는 데 의미가 있다. 다만 공개된 결과는 OpenAI가 선택한 조건에서 측정한 초기 벤치마크다. ChatGPT와 API 이용자가 체감할 비용·속도 개선, 대규모 운영 안정성, 엔비디아 의존도 변화는 실제 배치가 진행된 뒤 확인해야 한다.

What Happened

OpenAI는 지난 6월 브로드컴과 함께 할라페뇨를 공개하면서 이를 대규모 언어 모델의 추론에 맞춘 전용 가속기라고 설명했다. 추론은 모델을 새로 학습시키는 과정이 아니라, 이미 학습된 모델이 사용자의 질문을 받아 답을 만드는 과정이다. ChatGPT의 응답이나 API 호출이 발생할 때마다 반복되는 만큼 속도와 전력 효율이 서비스 비용에 직접 연결된다.

8월 25일 공개한 첫 측정 결과에서 OpenAI는 할라페뇨가 처리량과 지연시간 가운데 하나를 얻기 위해 다른 하나를 크게 포기해야 했던 기존 시스템의 절충을 줄였다고 주장했다. 한 번에 많은 요청을 처리하면서도 개별 사용자가 다음 토큰을 기다리는 시간을 짧게 유지했다는 뜻이다.

이번 비교에는 OpenAI 내부 모델만 사용되지 않았다. GPT-OSS 120B뿐 아니라 딥시크 R1과 키미 K2.5도 포함돼, 특정 모델 하나에만 맞춘 결과가 아니라는 점을 보여주려 했다. 측정에는 SemiAnalysis가 운영하는 공개 추론 벤치마크 InferenceX의 방식이 사용됐다.

Key Details

OpenAI가 공개한 주요 수치는 다음과 같다. 모두 회사가 발표한 특정 모델·정밀도·입출력 길이 조건의 결과이므로, 모든 실제 서비스 환경에 그대로 적용되는 수치로 보기는 어렵다.

  • 최고 처리량 구간에서 전력 1와트당 처리한 AI 작업량은 비교 시스템보다 약 1.5~1.9배 많았다.
  • 요청부터 응답 완료까지 걸린 종단 간 지연시간은 약 1.7~3.6배 짧았다.
  • 빠른 상호작용이 중요한 조건에서는 사용자당 성능이 약 2.1~4.1배 높았다.
  • GPT-OSS 120B 시험에서는 700W 패키지 전력의 할라페뇨를 1,200W의 엔비디아 GB200과 비교했다.
  • 딥시크 R1 670B와 키미 K2.5 1T 시험에서는 할라페뇨를 1,400W의 엔비디아 GB300과 비교했다.

칩만 따로 설계한 것도 아니다. OpenAI는 모델, 추론 소프트웨어, 메모리, 네트워크와 시스템을 함께 조정하는 방식으로 효율을 끌어올렸다고 설명한다. 브로드컴은 실리콘 구현과 네트워킹 기술을, 셀레스티카는 보드·랙·시스템 통합을 맡았다. OpenAI 모델도 칩 설계와 초기 구동, 최적화 작업에 활용됐다.

Background

생성형 AI 서비스는 모델이 커질수록 학습 비용뿐 아니라 매일 답변을 생성하는 추론 비용도 빠르게 늘어난다. 사용자가 많고 AI 에이전트가 여러 도구를 반복 호출하면 같은 요청 안에서도 추론이 여러 번 일어난다. 전력당 더 많은 토큰을 처리하고 응답 대기시간을 줄이는 능력이 곧 서비스 용량과 원가 경쟁력이 되는 이유다.

구글의 TPU, 아마존의 인퍼런시아와 트레이니움처럼 대형 AI·클라우드 기업이 자체 칩을 만드는 것도 같은 맥락이다. 자사 모델과 서비스에 맞춰 하드웨어를 설계하면 범용 GPU보다 특정 작업의 효율을 높이고 공급 선택지를 늘릴 수 있다. OpenAI 역시 할라페뇨를 외부 판매용 제품보다는 자사 서비스를 위한 1차 공급원으로 활용할 계획이다.

그렇다고 할라페뇨가 곧바로 엔비디아 GPU를 대체한다는 뜻은 아니다. 첫 제품은 추론용이며 새 모델을 만드는 대규모 학습 작업은 대상이 아니다. OpenAI는 엔비디아를 비롯한 여러 업체의 가속기를 계속 사용하면서, 작업 성격에 따라 자체 칩을 함께 배치하는 다중 공급 전략을 택하고 있다.

Core Lens
이번 발표의 핵심은 가장 빠른 칩 한 개가 아니라, OpenAI가 모델 개발부터 서비스 운영과 반도체까지 직접 조정할 수 있는 선택지를 확보했다는 데 있다.

What It Means

할라페뇨가 공개 수치에 가까운 효율을 대규모 환경에서도 유지한다면 OpenAI는 같은 전력과 데이터센터 공간으로 더 많은 요청을 처리할 수 있다. 이는 응답 속도 개선뿐 아니라 API 가격, 혼잡 시간의 접근성, 긴 작업을 수행하는 에이전트의 운영비에도 영향을 줄 수 있다. 하드웨어 공급 협상에서 선택지가 하나 더 생긴다는 점도 중요하다.

그러나 아직 비용 구조 전체를 판단할 자료는 부족하다. 칩의 제조 수율과 가격, 랙 단위 네트워크 효율, 냉각비, 장애율, 소프트웨어 전환 비용이 공개되지 않았기 때문이다. 벤치마크에서 앞섰더라도 실제 데이터센터에서 안정적으로 대량 배치하지 못하면 서비스 원가 개선은 제한적일 수 있다.

비교 시점도 유의해야 한다. TechCrunch는 할라페뇨가 본격적으로 배치될 무렵 경쟁사의 다음 세대 제품이 진전될 수 있다고 지적했다. 따라서 이번 결과는 시장의 최종 승자를 가리는 판정이라기보다, OpenAI가 자체 추론 반도체를 실제 경쟁 가능한 단계까지 끌어올렸다는 첫 신호에 가깝다.

What To Watch

  • 할라페뇨가 ChatGPT나 OpenAI API의 어떤 작업에 먼저 투입되는지
  • 공개 벤치마크 결과를 외부 연구자와 운영자가 같은 조건에서 재현할 수 있는지
  • 칩 단위 성능이 랙과 데이터센터 전체의 비용·전력 절감으로 이어지는지
  • 후속 세대가 추론을 넘어 학습 영역까지 확장되는지
  • 실제 서비스의 가격, 응답 속도, 이용 한도에 변화가 생기는지

Sources