Date: 2026-05-25 Topic: AI security Primary source: Anthropic
Anthropic은 2026년 5월 22일 Project Glasswing의 첫 업데이트를 공개하며, Claude Mythos Preview와 약 50개 파트너가 한 달 동안 중요 소프트웨어에서 1만 건이 넘는 고위험 또는 치명 등급 취약점을 찾아냈다고 밝혔다. 이 프로젝트는 강력한 AI가 공격자 손에 들어가기 전에 같은 능력을 방어 목적으로 먼저 쓰자는 취지로 시작됐다.
이번 발표의 핵심은 “AI가 취약점을 찾을 수 있다”는 가능성이 아니라, 이미 발견 속도가 검증과 패치 속도를 앞지르기 시작했다는 점이다. Anthropic은 지금의 병목이 새 취약점 탐색이 아니라 발견된 취약점을 확인하고, 책임 있게 공개하며, 실제 제품에 패치하는 과정으로 이동했다고 설명했다.
Mozilla, Cloudflare, Palo Alto Networks 같은 참여 기업의 공개 사례도 같은 흐름을 보여준다. Firefox는 Claude Mythos Preview를 활용한 평가에서 271개 취약점을 찾아 고쳤고, Cloudflare는 Mythos가 작은 버그를 연결해 실제 공격 가능성을 증명하는 능력이 기존 자동 스캐너와 다르다고 평가했다.
What Happened
Anthropic은 4월 시작한 Project Glasswing의 초기 결과를 5월 22일 공개했다. Glasswing은 Claude Mythos Preview라는 아직 일반 공개되지 않은 보안 특화 프런티어 모델을 주요 소프트웨어 기업과 보안 조직에 제한적으로 제공해, 인터넷과 기업 시스템의 기반이 되는 소프트웨어를 먼저 점검하는 프로그램이다.
공개된 수치만 보면 규모가 크다.
- 약 50개 파트너가 참여했다.
- 파트너들이 찾은 고위험 또는 치명 등급 취약점은 총 1만 건 이상으로 집계됐다.
- Anthropic은 별도로 1,000개가 넘는 오픈소스 프로젝트를 스캔했다.
- 그 과정에서 Mythos Preview가 추정한 고위험 또는 치명 등급 취약점은 6,202건, 전체 취약점 추정치는 23,019건이었다.
- Anthropic은 현재의 사후 검증 비율을 적용하면 오픈소스 코드에서만 약 3,900건의 실제 고위험 또는 치명 취약점이 표면화될 수 있다고 봤다.
Anthropic은 세부 취약점 내용을 바로 공개하지 않았다. 소프트웨어 업계의 통상적인 책임 공개 관행처럼, 사용자가 패치를 적용할 시간을 확보해야 하기 때문이다. 대신 파트너의 공개 사례와 집계 수치, 평가 결과를 중심으로 Mythos Preview의 성능과 방어 측의 부담을 설명했다.
Key Details
Mozilla의 사례는 이번 발표를 이해하기 좋은 기준점이다. Mozilla는 5월 7일 기술 블로그에서 Firefox를 강화하기 위해 Claude Mythos Preview와 다른 AI 모델을 어떻게 사용했는지 공개했다. Firefox 150 릴리스에서 Claude Mythos Preview가 식별한 271개 버그를 고쳤고, 4월 전체로는 423개 보안 버그 수정이 이뤄졌다고 설명했다.
중요한 점은 모델 하나를 코드 저장소에 던져놓고 “취약점을 찾아라”라고 시킨 것이 아니라는 점이다. Mozilla는 기존 퍼징 인프라 위에 에이전트형 하네스를 만들고, 특정 파일과 기능을 좁혀 조사하게 했으며, 재현 가능한 테스트 케이스를 만들고 실행하도록 했다. 발견, 중복 제거, 트리아지, 버그 추적, 패치 릴리스까지 이어지는 파이프라인이 있었기 때문에 많은 발견을 실제 수정으로 연결할 수 있었다.
Cloudflare도 비슷한 결론을 냈다. Cloudflare는 5월 18일 블로그에서 Mythos Preview가 단순히 의심스러운 코드를 많이 찍어내는 도구가 아니라, 작은 취약점 조각을 연결해 공격 체인을 만들고, 해당 버그가 실제로 동작하는지 증명하는 코드를 작성하고 실행하는 능력이 두드러졌다고 설명했다. 다만 Cloudflare는 거대한 코드베이스 전체를 한 번에 맡기는 방식은 좋은 커버리지를 만들기 어렵고, 좁은 작업을 병렬로 쪼개고 별도 검증 에이전트를 두는 구조가 필요하다고 봤다.
Palo Alto Networks의 Unit 42도 5월 위협 브리핑에서 Anthropic Mythos와 OpenAI 모델을 테스트한 결과를 언급했다. 130개가 넘는 제품을 초기 스캔한 뒤 26개 CVE, 75개 이슈를 다루는 권고를 냈고, 이는 평소 한 달에 5개 미만의 CVE를 다루던 규모보다 훨씬 컸다고 밝혔다. 이 취약점들은 당시 실제 악용 사례는 없었고, SaaS 제품은 중요한 취약점 패치를 완료했으며 고객 운영 제품에도 패치를 제공했다고 설명했다.
Background
지금까지 보안 자동화는 크게 두 갈래로 이해됐다. 하나는 정적 분석이나 퍼징처럼 코드를 빠르게 훑어 이상 징후를 찾는 도구이고, 다른 하나는 사람이 발견한 취약점을 정리하거나 재현을 돕는 보조 도구였다. 문제는 자동 도구가 너무 많은 오탐을 만들면 유지보수자가 이를 확인하는 데 시간을 빼앗긴다는 점이었다.
이번 Glasswing 발표가 주목받는 이유는 모델의 역할이 단순 알림을 넘어섰기 때문이다. Mythos Preview는 일부 사례에서 취약점 후보를 찾는 데 그치지 않고, 공격자가 실제로 어떤 순서로 여러 약점을 연결할 수 있는지 추론하고, 재현 코드로 확인하는 단계까지 수행했다. 이것이 사실이라면 방어자는 “발견된 버그가 진짜인가”를 확인하는 시간은 줄일 수 있지만, 동시에 한 번에 처리해야 할 실제 버그의 양은 크게 늘어난다.
Core Lens
이번 뉴스는 AI가 보안을 대신한다는 이야기보다, AI 때문에 보안 조직의 병목이 발견에서 검증, 우선순위 결정, 패치 배포로 이동했다는 이야기다.
What It Means
가장 직접적인 변화는 패치 운영의 압박이다. 취약점 탐색 속도가 빨라지면 기업은 더 많은 패치를 더 자주 내야 한다. 하지만 패치를 서두르다 회귀 테스트를 줄이면 새 장애나 새 취약점을 만들 수 있다. Cloudflare가 “더 빠른 패치만으로는 충분하지 않다”고 지적한 이유도 여기에 있다.
두 번째 변화는 보안 아키텍처의 중요성이다. 모든 버그를 즉시 없앨 수 없다면, 버그 하나가 전체 시스템 장악으로 이어지지 않도록 경계를 나누고, 접근 권한을 좁히고, 앞단에서 악용을 차단하는 구조가 필요하다. AI가 발견 속도를 높일수록 “버그가 없을 것”이라는 가정보다 “버그가 있어도 피해가 제한될 것”이라는 설계가 더 중요해진다.
세 번째는 오픈소스 유지보수자의 부담이다. AI가 실제 취약점을 더 많이 찾는 동시에, 품질 낮은 자동 보고도 늘릴 수 있다. 따라서 앞으로 중요한 것은 모델 이름보다 운영 체계다. 재현 가능한 테스트, 중복 제거, 사람의 최종 판단, 책임 있는 공개 절차가 함께 있어야 AI 보안 도구가 도움이 된다.
What To Watch
앞으로 확인해야 할 지점은 세 가지다.
- Anthropic이 발견한 취약점 중 실제 패치와 공개 advisory로 이어지는 비율
- Mythos급 모델이 더 넓게 배포될 때 공격자와 방어자 중 어느 쪽이 먼저 운영 역량을 갖추는지
- 기업 보안팀이 단순 스캔 도구가 아니라 검증, 우선순위 결정, 배포까지 묶은 파이프라인을 구축할 수 있는지
한국 기업과 개발팀에도 이 이슈는 남의 일이 아니다. 많은 서비스가 오픈소스 라이브러리, 클라우드, 브라우저, CI/CD, SaaS 도구에 의존한다. AI가 그 기반 소프트웨어의 숨은 취약점을 빠르게 드러내기 시작했다면, 보안 대응도 “월간 점검”이 아니라 지속적인 확인과 빠른 배포 체계로 바뀌어야 한다.