OpenAI Open-Sources Codex Security CLI for Repository Scanning

OpenAI가 7월 29일(현지시간) 코드 저장소의 취약점을 찾고 검증하는 `Codex Security CLI`와 TypeScript SDK의 초기 버전을 오픈소스로 공개했다.

Date: 2026-07-31 Topic: AI Application Security Primary source: OpenAI Codex Security repository and documentation

OpenAI가 7월 29일(현지시간) 코드 저장소의 취약점을 찾고 검증하는 Codex Security CLI와 TypeScript SDK의 초기 버전을 오픈소스로 공개했다. 개발자는 npm으로 설치해 저장소 전체나 변경분을 검사하고, 이전 결과와 비교하거나 CI/CD에 보안 검사를 연결할 수 있다.

이번 공개로 지난 3월 웹에서 리서치 프리뷰로 선보인 Codex Security를 로컬 터미널과 자동화 도구에서도 다룰 수 있게 됐다. 다만 공개 패키지와 실제 스캔 권한은 별개다. 저장소는 Apache 2.0 라이선스로 열렸지만 스캔에는 Codex Security 접근 권한이 필요하며, 계정과 대상 저장소에 따라 보안 연구용 신뢰 접근 인증이 추가로 요구될 수 있다.

즉 누구나 제한 없이 쓰는 무료 스캐너가 등장했다기보다, OpenAI의 AI 보안 분석을 개발 현장에 연결할 공개 인터페이스가 마련된 것이다. 도입 전에는 접근 자격과 결과 보관 방식, 검사 범위를 함께 확인해야 한다.

What Happened

OpenAI는 공식 계정을 통해 Codex Security CLI를 조용히 공개한 뒤 개발자 커뮤니티가 먼저 발견했다고 알렸다. @openai/codex-security는 명령줄 도구와 TypeScript SDK를 제공하며, 취약점을 찾고 근거를 확인한 다음 수정 여부를 다시 검사하는 흐름을 지원한다.

전신인 보안 연구 에이전트 ‘Aardvark’는 2025년 비공개 베타로 시작됐고, 2026년 3월에는 프로젝트별 위협 모델을 만들고 취약점을 검증·수정하는 Codex Security 리서치 프리뷰로 공개됐다. 이번에는 그 기능이 터미널, 대량 저장소 검사, 사전 커밋 검사와 CI 파이프라인으로 확장됐다. 공식 문서는 패키지를 공개 소프트웨어로 설명하지만 스캔 서비스는 여전히 별도 접근 권한이 필요하다고 안내한다.

Key Details

  • 설치 환경: Node.js 22 이상이 필요하며, 스캔 실행과 결과 내보내기에는 Python 3.10 이상도 필요하다.
  • 검사 대상: 저장소 전체, 특정 경로, 기준 브랜치와의 차이, 커밋 전 작업 트리와 딥 스캔을 선택할 수 있다.
  • 결과물: report.md와 발견 항목·검사 범위·실행 정보를 담은 JSON 파일을 남기며, SARIF로도 내보낼 수 있다.
  • 변경 추적: 두 번의 스캔에서 같은 원인을 가진 항목을 연결해 신규, 지속, 재발, 해결, 확인 불가 상태로 구분한다.
  • 자동화: 지정한 심각도 이상의 문제가 나오면 CI를 실패시키고, Git 사전 커밋 검사나 여러 저장소의 병렬 검사도 실행할 수 있다.

로컬에서는 ChatGPT 계정으로 로그인할 수 있고 CI에서는 API 키를 사용한다. 결과에는 소스 코드 일부와 취약점 정보가 들어갈 수 있으므로 저장소 밖의 비공개 위치에 보관하는 편이 안전하다.

Background

정적 애플리케이션 보안 테스트(SAST)는 입력값이 코드 안에서 어떻게 이동하는지 규칙에 따라 추적하는 데 강하다. Codex Security는 저장소의 구조와 신뢰 경계, 의도한 동작을 파악한 뒤 실제 공격 경로인지 검증하려 한다. OpenAI는 이 방식이 오탐을 줄이고 수정 가능한 결과에 집중하도록 설계됐다고 설명한다.

전통적인 보안 검사를 대체한다는 뜻은 아니다. OpenAI도 SAST가 여전히 중요하다고 밝힌다. 규칙 기반 검사의 반복성과 속도에, 여러 파일과 시스템 동작을 함께 이해하는 AI 분석을 보완하는 구도에 가깝다.

OpenAI의 6월 자체 집계로는 Codex Security 클라우드가 3만 개가 넘는 코드베이스에서 3천만 건 이상의 커밋을 검사했다. 사람이 해결됐다고 표시한 항목은 7만 건 이상이다. 회사가 공개한 운영 지표이므로 독립적인 정확도 평가와는 구분해야 한다.

Core Lens
이번 공개의 핵심은 AI가 취약점을 찾는다는 사실보다, 그 분석을 개발자의 터미널과 CI/CD가 반복해서 실행하고 추적할 수 있는 작업 단위로 옮겼다는 데 있다.

What Changes for Developers

가장 직접적인 변화는 보안 검사를 코드 작업 흐름 안에서 실행할 수 있다는 점이다. 풀리퀘스트 변경분을 검사하고 결과를 SARIF로 보관하며, 수정 뒤 같은 설정으로 다시 확인하는 과정까지 자동화할 수 있다. TypeScript SDK로 사내 도구에 검사 기능을 넣을 수도 있다.

그러나 AI 기반 검사는 같은 설정에서도 결과가 달라질 수 있다. 공식 FAQ도 발견 항목이 사라졌다는 이유만으로 수정 완료를 단정할 수 없다고 경고한다. coverage.json으로 원래 경로가 충분히 검사됐는지 확인하고, 중요한 문제는 사람이 다시 재현해야 한다.

실무에서는 Codex Security를 단독 판정기보다 기존 SAST, 의존성 검사와 코드 리뷰를 잇는 보조 분석가로 두는 편이 현실적이다. AI가 제안한 심각도와 패치도 담당자가 최종 판단해야 한다.

What To Watch

  • OpenAI가 리서치 프리뷰 이후 스캔 접근 권한과 요금 체계를 어떻게 정리하는지
  • 반복 실행 때 결과와 심각도 판정이 얼마나 안정적으로 유지되는지
  • complete, partial, unknown 검사 범위를 팀이 배포 기준에 어떻게 반영하는지
  • 오픈소스 CLI와 서버 분석 기능의 경계가 얼마나 넓어지는지
  • SARIF 대시보드와 기존 보안 제품이 실제 조직에서 어떻게 결합되는지

초기 공개 단계인 만큼 설치의 간편함보다 결과를 신뢰하는 절차가 중요하다. 실제 사고 감소로 이어지는지는 접근 확대와 독립적인 현장 평가를 더 지켜봐야 한다.

Sources