원글2026.10.03
엔비디아 베라 루빈, 코어위브에서 첫 상용 가동
클라우드 업체 코어위브가 엔비디아의 차세대 랙 시스템 베라 루빈 NVL72를 실제 고객 작업에 처음 투입했습니다. 첫 고객인 코딩 에이전트 업체 코그니션은 전 세대 GB200 NVL72와 비교해 GPU 한 개당 추론 처리량이 최대 4.8배 늘었다고 밝혔습니다.
코어위브는 9월 30일 샌프란시스코에서 열린 자사 행사에서 베라 루빈 NVL72를 고객 프로덕션 환경에 올렸다고 발표했고, 10월 2일 측정 결과를 담은 상세 글을 냈습니다(지난 자료·원공개 09/30). 첫 고객은 자율 코딩 에이전트 데빈을 만드는 코그니션입니다. 두 회사는 9월 초 클러스터를 세웠고, 코그니션은 랙을 넘겨받은 지 며칠 만에 실제 작업을 돌리기 시작했습니다. 코어위브는 현재 여러 지역에 GPU 수백 개 규모로 제한적으로 공급하는 단계라고 설명했습니다.
베라 루빈 NVL72는 한 랙에 루빈 GPU 72개와 베라 CPU 36개를 넣고 액체로 식히는 시스템입니다. 랙 전체의 HBM4 메모리는 20.7TB, 메모리 대역폭은 약 1,400TB/s이고, GPU끼리 데이터를 주고받는 NVLink 6의 대역폭은 216TB/s입니다. 엔비디아가 공개한 전 세대 GB200 NVL72는 HBM3e 13.4TB, 메모리 대역폭 576TB/s, NVLink 130TB/s입니다.
코그니션이 직접 잰 처리량은 4.8배
코그니션은 자사 코딩 모델 SWE-2의 실제 작업을 두 세대 랙에 똑같이 올려 비교했습니다. 사용자 한 명이 체감하는 응답 속도를 같은 수준으로 맞춘 조건에서, 루빈 랙의 GPU 한 개당 총 토큰 처리량은 GB200 NVL72의 최대 4.8배였습니다. 모델이 시행착오를 거쳐 스스로 고쳐 나가는 강화학습 작업에서는 GPU 한 개당 출력 토큰이 3.8배였습니다. 코그니션의 실라스 알베르티 연구 담당 수석부사장은 에이전트 코딩이 긴 문맥과 많은 동시 요청, 빠른 추론을 한꺼번에 요구하는 까다로운 작업이라고 설명했습니다.
사양 배수보다 처리량이 더 늘어난 이유
메모리 용량은 1.5배, 대역폭은 2.4배 늘었는데 처리량은 4.8배가 됐습니다. 대형 언어모델이 답을 만들 때는 토큰을 하나씩 이어 붙이는데, 이 단계의 속도는 연산 능력보다 메모리에서 모델 가중치와 지금까지의 대화 기록(KV 캐시라고 부르는 임시 저장분)을 읽어 오는 속도에 더 크게 묶입니다. 코딩 에이전트는 코드 저장소를 통째로 문맥에 넣어 두고 도구를 수십 차례 호출하기 때문에 이 기록이 특히 큽니다.
메모리가 넓고 빨라지면 GPU 한 개가 동시에 붙잡아 둘 수 있는 요청 수가 늘어납니다. 여러 요청을 한 번에 묶어 처리할수록 같은 메모리 읽기로 더 많은 토큰을 만들 수 있어, GPU 한 개당 처리량은 사양 배수보다 크게 늘 수 있습니다. 여기에 칩 자체의 연산 성능 향상도 더해지지만, 항목별로 얼마씩 기여했는지는 공개되지 않았습니다. 코어위브는 앞서 딥시크 R1 추론에서 같은 응답 속도 기준 메가와트당 토큰이 GB200 대비 최대 10배라는 수치도 제시한 바 있습니다.
측정 조건과 가격은 공개되지 않았습니다
이번 수치는 코그니션 한 회사의 작업으로 잰 결과로, 업계 공통 벤치마크와는 측정 조건이 다릅니다. 기술 매체 스토리지리뷰는 모델 크기와 문맥 길이, 묶어서 처리한 요청 수가 모두 공개되지 않았다고 지적했습니다. 측정은 고객사가 했지만 결과는 코어위브의 발표 채널로 나왔고, 엔비디아는 코어위브의 주요 주주이기도 합니다. 루빈 인스턴스의 시간당 요금도 아직 나오지 않았습니다.
같은 발표에서 코어위브는 베라 CPU만 128개를 넣은 랙을 곧 내놓겠다고 밝혔습니다. 에이전트가 코드를 실행해 보는 격리된 작업 공간을 랙 하나에 1만 1천 개 넘게 띄울 수 있다는 설명인데, 이 제품은 출시 일정이 정해지지 않았습니다.
GPU 임대료 계산이 다시 시작되는 지점
이번 발표에서 눈여겨볼 대목은 새 세대 성능이 사양표보다 고객 작업 단위의 처리량으로 먼저 공개됐다는 점입니다. GPU 한 개로 만드는 토큰이 네 배 안팎으로 늘면, GPU를 시간 단위로 빌려주는 클라우드 업체가 매길 수 있는 요금의 범위와 구형 GB200의 임대료가 함께 다시 계산됩니다. GPU를 담보로 자금을 빌려 데이터센터를 지어 온 업체들은 구형 장비의 잔존가치를 얼마로 잡을지도 함께 따져야 합니다.
다만 측정 조건과 가격이 공개되지 않은 만큼, 토큰 한 개의 원가가 실제로 얼마나 내려가는지는 루빈 인스턴스 요금이 나오고 다른 고객의 측정치가 쌓인 뒤에 확인할 수 있습니다.