코그니션 '4.8배' 벤치마크가 증명한 건 처리량…에이전트 비용 절감은 아니다

코어위브의 첫 베라 루빈(Vera Rubin) 고객인 코그니션은 4.8배의 처리량 벤치마크를 공개했지만 비용 수치는 내놓지 않았다. 한편 코어위브는 7월 이후 GPU 가격을 35% 인상했다. CRWV 주주들에게 필요한 숫자, 즉 디빈(Devin) 세션 완료 건당 비용은 어느 발표 자료에도 존재하지 않는다.

원문 읽기

Vincent JiangVincent Jiang · 3 min read
Share
엔비디아 DGX GB200 랙 전체 모습. 코그니션의 베라 루빈 벤치마크가 기준 시스템으로 사용한 이전 세대 NVL72 등급의 장비다.
1 / 6Slide 1 of 6
엔비디아 DGX GB200 랙. 코그니션의 베라 루빈 벤치마크에서 처리량 1.0배 기준이 되는 이전 세대 NVL72 시스템이다. 코어위브에서 디빈을 구동하는 새 베라 루빈 NVL72 랙은 아직 공개된 적이 없다.

코그니션은 주요 성과를 발표할 때 숫자를 꼭 붙이는 습관이 있다. 9월 8일에는 시리즈 E 투자 유치였다. 기업가치 480억 달러를 매겨 20억 달러가 넘는 자금을 모았고, 회사가 발표한 연환산(런레이트) 매출은 5월 4억9200만 달러에서 9억 달러 가까이로 불어났다 1. 9월 29일에는 몽고DB와 디빈을 기업 시스템 이전의 엔진으로 팔겠다는 파트너십이었다 2. 그리고 9월 30일 코어위브가 연 '풀리 커넥티드(Fully Connected)' 컨퍼런스에서 코그니션은 엔비디아의 베라 루빈 NVL72에서 상용 워크로드를 구동하는 세계 최초의 고객이 됐다. SWE-2 추론 워크로드에서 GB200 NVL72 대비 총 토큰 처리량이 최대 4.8배에 달한다고 보고했고, 강화학습에서는 3.8배였다 134.

청구서 없는 벤치마크

발표 자료들은 한결같이 같은 자리가 비어 있다. 절대 처리량 수치도, 가격도, 에너지 사용량도, 비교를 재현할 수 있을 만큼의 구성 정보도, 완료된 작업 수도 없다 1. 코어위브는 결과를 '독립 벤치마크'라고 불렀지만 벤치마크를 실행한 이는 코그니션 자체 엔지니어들이었고 비교 대상도 코어위브 자신의 클라우드에 놓인 기준 시스템이었다 4. 숫자를 돈으로 옮긴 유일한 대목은 말뿐이다. 코어위브의 제품·엔지니어링 담당 부사장(EVP) 첸 골드버그는 이런 성능 향상이 GPU당 동시에 돌릴 수 있는 디빈 세션 수를 늘리고 '세션당 비용이 낮아진다'고 말했다. 그 비용을 공개한 발표 자료는 없다 34.

성능 향상 두 개, 기준 시스템 하나, 비용은 어디에도 없다

0x2x4x6xGB200 기준 시스템베라 루빈에서의 SWE-2 추론(코그니션)베라 루빈 강화학습 출력 토큰(코그니션)3.8x4.8x
Data
토큰 처리량(GB200 기준 시스템 대비 배수)
GB200 기준 시스템1x
베라 루빈에서의 SWE-2 추론(코그니션)4.8x
베라 루빈 강화학습 출력 토큰(코그니션)3.8x
모든 값은 GB200 NVL72 기준 시스템 대비 배수로 나타낸 토큰 처리량으로, 벤치마크 측이 제시한 방법론이 정의한 비교 방식이다. 기준 시스템은 정의상 1.0배이며, 코그니션이 발표한 베라 루빈 NVL72에서의 향상 폭은 이를 기준으로 잰 값이다 [1][4]. 두 향상 폭 모두 업체 연계 벤치마크 결과로 절대 수치와 가격, 에너지 사용량은 공개되지 않았다. 출처: RuntimeWire [1]; Business Wire(야후 파이낸스 게재) [4].1,4

장부가 더 무거운 쪽은 코어위브다

판돈은 두 개의 장부에 걸려 있다. 코그니션은 디빈 가격을 클로드 코드(Claude Code)와 커서와 견줘야 하는 와중에, 20억 달러 투자 유치로 확보한 컴퓨트가 장시간 돌아가는 에이전트 작업을 더 싸게 만들어 준다는 점을 증명해야 한다 1. 코어위브의 장부는 더 무겁다. 코어위브는 용량 1MW당 10배의 수요가 있다고 밝히고 있으며 2030년까지 8GW 구축 목표를 고수하고 있다. 컨퍼런스가 끝난 뒤에는 캔터 피츠제럴드가 이 종목에 '비중 확대(Overweight)' 투자의견과 목표주가 176달러를 유지했다 5. 이런 증설은 수요 증거를 내걸고 자금을 조달하고 있는데, 그 수요 증거의 첫 공개 데이터가 바로 고객사와 공급업체가 공동으로 작성한 벤치마크다. 결국 그 위험을 떠안는 쪽은 CRWV 주주들이다.

빠져 있는 숫자는 세션당 비용이다

처리량은 경제성이 아니다. 디빈 세션 하나가 더 많은 토큰을 소모한다면 초당 토큰 처리량이 4.8배 늘어난 것도 완료된 작업 하나당 비용으로 환산하면 훨씬 초라한 수치로 줄어든다. 캔터 피츠제럴드 보고서에 따르면 코어위브는 7월 이후 가격을 25% 올린 데 이어 거기에 10%를 더 얹었다 5. 코어위브가 직접 내세운 칩 수준의 수치, 즉 딥시크 R1에서 GB200 대비 1MW당 10배의 토큰 처리량 역시 효율 지표일 뿐 청구서가 아니다. 이 수치는 정작 모든 비용 수치를 빠뜨린 바로 그 보도자료에 실려 있다 4. 한편 코그니션은 하루 전 몽고DB의 기업 시스템 이전 사업에도 같은 에이전트를 팔아 넣으며, 5~6시간 걸리던 작업이 이제 1시간 남짓에 끝난다고 약속했다 2. 이번 주의 진짜 질문은 AI 코딩의 작업당 가격 인하가 효율 개선으로 뒷받침되는 것인지, 자본으로 뒷받침되는 것인지다. 두 회사 중 어느 한쪽이라도 베라 루빈과 GB200의 세션당 비용을 공개하기 전까지 시장은 비용이 아니라 배수에 값을 매기고 있다. 처리량은 경제성이 아니다.

Deepdive

AI-generated from this story and its cited sources. Not investment advice.

Reader comments

0 comments

    Sign up

    Get your curated digest

    After email confirmation, you will receive a daily digest of the most relevant news that matter to your portfolio