GPU 옆으로 확장되는 AI 메모리, Astera Labs가 새 Leo 컨트롤러를 공개했다

GPU 옆으로 확장되는 AI 메모리, Astera Labs가 새 Leo 컨트롤러를 공개했다

Date: 2026-09-16 Topic: AI Infrastructure Primary source: Astera Labs

데이터센터 연결 반도체 기업 Astera Labs가 9월 15일 AI 추론과 클라우드 서버의 메모리 병목을 겨냥한 Leo 스마트 메모리 컨트롤러 신제품 3종을 발표했다. 새 제품은 GPU 가까이에 별도 메모리 계층을 두는 Leo X-Series와, CPU 메모리를 확장하거나 여러 서버가 나눠 쓰도록 설계한 Leo 2 E-Series·P-Series다.

회사는 에이전트형 AI가 긴 대화와 도구 호출 기록을 유지하면서 KV 캐시가 커지자, 비싼 GPU 메모리만 늘리는 대신 PCIe·CXL 연결로 외부 메모리를 더 효율적으로 쓰는 방식을 제시했다. 특정 내부 시험에서는 첫 토큰 응답 시간이 최대 62% 짧아지고 초당 처리 토큰은 22% 늘었다고 밝혔다. 다만 이 수치는 제한된 구성에서 나온 회사 측 측정값이며 독립 검증 결과는 아니다.

신제품은 현재 하이퍼스케일 고객에게 샘플로 제공되고 있다. 실제 도입을 검토할 클라우드 사업자와 AI 인프라 운영자에게는 제품 출시 자체보다, GPU 활용률과 추론 비용을 메모리 배치 방식으로 얼마나 개선할 수 있는지가 더 중요한 쟁점이다.

What Happened

Astera Labs는 미국 산호세에서 Leo X-Series와 Leo 2 E-Series·P-Series를 공개했다. 기존 Leo 제품군이 주로 CPU에 연결된 CXL 메모리 확장에 초점을 맞췄다면, 이번에는 GPU 쪽 패브릭에 직접 붙는 메모리 계층과 랙 단위 메모리 공유까지 범위를 넓혔다.

Leo X-Series는 회사의 Scorpio 패브릭 스위치와 함께 사용해 GPU가 필요로 하는 KV 캐시를 CPU 메모리 경로 밖의 전용 메모리에 둘 수 있도록 설계됐다. Leo 2 E-Series는 CPU에 연결하는 메모리 확장용이고, P-Series는 두 개의 호스트 연결을 이용한 메모리 풀링과 공유를 지원한다. E·P-Series는 PCIe 6.0과 CXL 3.2를 지원하며 DDR4와 DDR5를 함께 활용할 수 있다.

회사는 세 제품군이 현재 고객 샘플링 단계라고 설명했지만, 정식 양산 일정과 가격, 실제 고객 이름은 공개하지 않았다. 9월 15일부터 17일까지 열린 AI Infra Summit 2026에서 관련 기능을 시연할 계획이라고 밝혔다.

Key Details

제품 연결 위치와 역할 발표된 핵심 기능
Leo X-Series GPU·가속기 쪽 패브릭 긴 문맥의 KV 캐시를 전용 외부 메모리로 옮겨 CPU 메모리 경합 완화
Leo 2 E-Series CPU 호스트 PCIe 6.0 x16, CXL 3.2 기반 DDR4·DDR5 메모리 확장
Leo 2 P-Series CPU 및 랙 단위 두 개의 x8 연결을 이용한 메모리 풀링·공유와 동적 용량 관리

Astera Labs의 기술 자료에 따르면 성능 시험은 NVIDIA H200 GPU 4개, Qwen2.5-32B 모델, 사용자 세션 10개, 세션당 3만2천 토큰 문맥을 사용했다. CPU 메모리에 부하를 추가한 조건에서 첫 토큰 생성 시간은 413밀리초에서 158밀리초로 줄어 최대 62% 개선됐고, 회사가 구성한 에이전트형 워크로드의 처리량은 22% 증가했다.

이 숫자는 제품의 가능성을 보여주는 참고값이지 모든 AI 서비스에 그대로 적용되는 보장은 아니다. 모델 크기, 동시 사용자 수, 캐시 적중률, PCIe 토폴로지와 소프트웨어 구성에 따라 결과가 달라질 수 있다. 시험에는 KV 캐시를 외부 메모리로 옮기는 LMCache 수정본도 사용됐다.

Why Memory Matters

대규모 언어 모델은 답변을 생성할 때 이전 토큰의 연산 결과를 KV 캐시에 보관한다. 대화가 길어지고 에이전트가 검색·도구 호출을 반복할수록 이 캐시가 커져 GPU의 고대역폭 메모리인 HBM을 빠르게 차지한다. 일부 캐시를 CPU DRAM이나 저장장치로 내보낼 수 있지만, 다시 GPU로 가져오는 과정에서 대기 시간이 생기고 여러 GPU가 같은 CPU 메모리 대역폭을 다투면 병목이 커진다.

Leo X-Series의 접근은 KV 캐시 전용 메모리를 GPU에 더 가까운 경로에 두어 이 경합을 줄이는 것이다. 반면 Leo 2 제품군은 CXL을 통해 CPU가 접근할 수 있는 메모리 용량을 확장하거나 여러 호스트가 용량을 나눠 쓰는 데 초점을 맞춘다. CXL은 프로세서와 메모리·가속기를 낮은 지연으로 연결하면서 일관된 메모리 접근을 지원하는 개방형 규격이다. CXL 3.2에서는 메모리 장치 관리와 오류 기록, 보안 기능이 보강됐다.

Core Lens
이번 발표의 핵심은 GPU를 더 많이 사는 경쟁만이 아니라, 이미 확보한 연산 장치가 메모리를 기다리며 쉬지 않도록 데이터의 위치와 이동 경로를 다시 설계하는 경쟁이 커지고 있다는 점이다.

What It Means

AI 인프라의 성능을 GPU 개수 하나로 설명하기는 점점 어려워지고 있다. 모델의 문맥이 길어지고 여러 에이전트 세션이 동시에 작동하면 메모리 용량뿐 아니라 캐시를 옮기는 경로, 지연 시간의 변동 폭, 사용하지 않는 메모리를 재배치하는 능력이 서비스 비용에 직접 영향을 준다. Astera Labs가 내세운 제품군은 이 문제를 칩 하나가 아니라 스위치·컨트롤러·관리 소프트웨어를 묶은 랙 단위 설계로 풀려는 시도다.

또 하나의 변화는 DDR4 같은 기존 자원을 새 서버에서도 재사용하려는 요구다. 회사는 메모리 상태 점검과 자동 복구 기능을 통해 기존 DIMM을 선별해 활용할 수 있다고 설명한다. 이 방식이 실제 운영 환경에서도 안정적으로 작동한다면 공급 제약과 교체 비용을 줄일 수 있지만, 장기간의 장애율과 성능 일관성은 고객 배포 자료가 나온 뒤 판단해야 한다.

What To Watch

  • 하이퍼스케일 고객의 샘플 평가가 언제 양산 주문과 실제 서비스 배치로 이어지는지
  • 제3자 시험에서도 첫 토큰 지연과 처리량 개선 폭이 재현되는지
  • LMCache·vLLM 같은 추론 소프트웨어가 별도 수정 없이 제품을 폭넓게 지원하게 되는지
  • CXL 3.2 호스트, 스위치, 메모리 모듈 사이의 상호운용성과 장애 대응이 대규모 랙에서 검증되는지
  • DDR4 재사용이 초기 비용뿐 아니라 전력 소비와 유지보수까지 포함한 총비용을 실제로 낮추는지

Sources