원글2026.08.30
오픈AI 자체 칩 잘라페뇨 벤치마크 공개
오픈AI가 8월 25일 반도체 학회 핫칩스에서 자체 추론용 칩 잘라페뇨의 성능 수치를 공개했습니다. 엔비디아의 현재 세대 제품과 비교해 와트당 처리량이 최대 1.9배 높다는 것이 발표의 골자입니다.
오픈AI는 이날 발표에서 잘라페뇨의 벤치마크를 공개했습니다. 이 칩의 존재는 6월 24일 브로드컴과 함께 처음 알렸고, 이번에 공개된 것은 성능 수치입니다. 공정은 TSMC의 N3P를 썼고, 설계 착수부터 테이프아웃까지 16개월이 걸렸습니다. 소비전력은 700와트, 메모리는 HBM4로 대역폭이 초당 15.4테라바이트, 연산 성능은 MXFP4 기준 13.4페타플롭스입니다.
세미애널리시스가 운영하는 공개 비교 플랫폼 인퍼런스X에서 잰 결과, 엔비디아의 GB200과 GB300 대비 와트당 처리량이 최대 1.9배 높고 지연은 최대 3.6배 낮았습니다. GPT-OSS와 딥시크 R1, 키미 K2.5를 돌린 세 결과의 범위는 1.5배에서 1.9배입니다. 사용자 한 명 기준 토큰 생성 속도는 딥시크 R1에서 초당 700개 이상, GPT-OSS에서 초당 1,400개 안팎으로 측정됐습니다.
전력 계약이 배치 물량을 정합니다
데이터센터에 놓을 수 있는 칩의 개수는 장비 예산보다 계약된 전력에 따라 정해집니다. 460메가와트를 확보한 사업자는 그 한도 안에 들어가는 만큼만 장비를 넣을 수 있습니다. 이런 조건에서는 칩 한 장의 가격보다 1와트가 초당 몇 개의 토큰을 만들어 내는지가 원가를 좌우합니다. 잘라페뇨의 700와트와 엔비디아 루빈의 900에서 1,150와트라는 차이는 같은 전력 예산 안에 장비를 몇 대 더 넣을 수 있는지의 차이로 이어집니다.
추론 작업에서는 메모리의 비중이 특히 큽니다. 모델은 답을 한 토큰씩 만들 때마다 가중치와 앞서 쌓아 둔 문맥을 다시 읽어야 하는데, 연산기가 빨라도 데이터를 읽어 오는 속도가 느리면 그 시간만큼 연산기가 놀게 됩니다. 오픈AI는 데이터 이동을 줄이고 모델 상태와 문맥 저장소를 연산기 가까이 두는 방향으로 설계했다고 밝혔습니다. HBM4의 초당 15.4테라바이트라는 대역폭이 그 설계에서 나온 수치입니다.
쓰는 쪽이 설계하면 회로를 줄일 수 있습니다
범용 가속기는 훈련과 추론, 과학 계산을 모두 처리합니다. 이 때문에 특정 작업에서 쓰이지 않는 회로도 전력을 소비하게 됩니다. 자기 모델이 실제로 어떤 연산을 하는지 아는 쪽은 넣어야 할 기능의 목록을 좁힐 수 있고, 줄인 만큼 같은 면적에 연산기를 더 넣습니다. 오픈AI가 MXFP4라는 낮은 정밀도 형식에 맞춰 설계한 것도 같은 맥락입니다.
비슷한 접근은 구글에서 먼저 나왔습니다. 구글은 자사 서비스의 추론 부하를 감당하려고 텐서처리장치를 만들어 2015년부터 자체 데이터센터에 넣었습니다. 1세대는 추론만 처리하는 제품이었고, 설계의 근거는 자기 워크로드를 안다는 것이었습니다. 다만 구글은 이 칩을 외부에 팔지 않고 내부에서만 썼으며, 자체 칩을 만드는 동안에도 엔비디아 제품을 계속 구매했습니다.
벤치마크의 한계
세미애널리시스는 잘라페뇨를 범용 추론 전용 반도체로 분류했습니다. 오픈AI 모델에만 맞춰 최적화한 제품으로 보지 않았다는 뜻입니다.
다만 이 수치를 공개한 쪽은 칩을 만든 회사 본인입니다. 비교 대상도 엔비디아의 현재 세대인 GB200과 GB300이며, 함께 언급된 루빈의 소비전력은 출시 전 수치입니다. 오픈AI 하드웨어 총괄 리처드 호는 잘라페뇨가 본격 배치될 무렵이면 경쟁 제품이 크게 앞서 있을 수 있다고 인정했습니다. 올해 말 예정된 물량도 아주 적습니다.
이번 발표에서 눈여겨볼 대목은 오픈AI가 비교의 기준으로 와트당 처리량을 골랐다는 점입니다. 첫 세대 자체 칩이 범용 가속기의 절대 성능을 앞섰다는 주장은 이번에도 나오지 않았습니다. 전력이 배치의 상한을 정하는 조건에서는 미리 팔아 둔 계산 능력의 원가도 칩 가격보다 와트당 토큰 수에 따라 정해집니다. 6년치 전력을 확보해 둔 사업자가 그 안에 어떤 장비를 놓느냐에 따라 같은 계약의 셈이 달라집니다.
메모리 쪽도 함께 볼 만합니다. 자체 칩이 앞섰다고 밝힌 항목이 결국 메모리 대역폭에 기대고 있어, 병목이 연산기에서 메모리로 옮겨 가고 있다는 관측에 근거가 하나 더 붙습니다. 다만 벤치마크와 실제 배치 사이에는 아직 거리가 있습니다. 물량은 아직 오지 않았고, 그 물량이 놓일 전력 설비도 지어지는 중입니다.