AI & Tech

[블랙웰 다음은 ‘베라 루빈’?] – 엔비디아가 공개한 차세대 AI 플랫폼의 정체

TrendIssueGuide 2026. 8. 30. 08:10
728x90
반응형
SMALL

 

“AI가 더 똑똑해지려면 GPU도 완전히 달라져야 할까?”

ChatGPT를 비롯한 생성형 AI가 빠르게 발전하면서 AI 모델의 성능만큼이나 중요해진 것이 있습니다.

바로 AI를 실제로 돌리는 컴퓨터입니다.

우리가 스마트폰이나 노트북에서 AI에게 질문하는 순간, 뒤에서는 거대한 데이터센터의 수많은 GPU가 모델을 실행하고 답변을 만들어냅니다.

 

특히 최근 AI는 단순히 질문 하나에 답하는 것을 넘어 스스로 여러 단계를 거쳐 문제를 해결하는 ‘AI 에이전트(Agentic AI)’​로 발전하고 있습니다.

검색하고, 추론하고, 코드를 실행하고, 외부 도구를 사용하고, 결과를 다시 검토하는 과정이 반복되면서 필요한 연산량도 크게 늘어나고 있죠.

 

그리고 이런 시대를 겨냥해 NVIDIA가 내놓은 차세대 AI 컴퓨팅 플랫폼이 바로 ‘Vera Rubin(베라 루빈)’​입니다.

2026년 8월 현재 Vera Rubin은 단순한 미래 계획을 넘어 본격적인 생산과 공급 단계에 들어섰습니다. NVIDIA는 2026년 5월 Vera Rubin 플랫폼의 양산 확대를 발표했고, 8월에는 Vera CPU와 Rubin GPU가 AWS를 비롯한 주요 AI 기업과 클라우드 사업자에게 공급되기 시작했다고 밝혔습니다.

 

오늘은 TIG(TrendIssueGuide)​
Blackwell의 다음 세대로 등장한 NVIDIA Vera Rubin이 무엇인지,
왜 단순한 GPU가 아니라 하나의 거대한 AI 플랫폼으로 불리는지 쉽게 알아보겠습니다.

반응형
728x90
SMALL

🟢 먼저, ‘Vera Rubin’이 뭐야?

Vera Rubin을 이해하려면 먼저 NVIDIA의 GPU 세대를 살펴볼 필요가 있습니다.

NVIDIA는 AI 연산을 위한 GPU 아키텍처를 지속적으로 발전시켜 왔습니다.

Ampere

Hopper

Blackwell

Rubin

으로 이어지는 흐름입니다.

여기서 Rubin은 Blackwell 다음 세대의 GPU 아키텍처입니다.

 

하지만 Vera Rubin = Rubin GPU 하나라고 생각하면 정확하지 않습니다.

Vera Rubin은

🧠 Vera CPU

Rubin GPU

🔗 NVLink 6 Switch

🌐 ConnectX-9 SuperNIC

🛡️ BlueField-4 DPU

📡 Spectrum-6 Ethernet Switch

등을 하나의 거대한 AI 시스템으로 함께 설계한 플랫폼입니다.

2026년 3월에는 여기에 Groq 3 LPU까지 통합되면서 NVIDIA는 Vera Rubin을 7개의 핵심 칩을 결합한 AI 플랫폼으로 설명하고 있습니다.

 

즉,

“엄청 빠른 GPU 하나를 만들자.”

가 아니라

“CPU부터 GPU, 네트워크, 스토리지까지 AI에 맞춰 함께 설계하자.”

라는 접근입니다.


👩‍🔬 그런데 왜 이름이 ‘베라 루빈’일까?

Vera Rubin이라는 이름은 실제 인물에서 가져왔습니다.

바로 미국의 천문학자 베라 플로렌스 쿠퍼 루빈(Vera Florence Cooper Rubin)​입니다.

베라 루빈은 은하의 회전 속도를 관측하면서 눈에 보이는 물질만으로는 설명하기 어려운 현상을 밝혀내 암흑물질 존재를 뒷받침하는 중요한 관측 증거를 제시한 천문학자로 잘 알려져 있습니다.

NVIDIA는 이전에도

Hopper → 컴퓨터 과학자 그레이스 호퍼

Blackwell → 수학자 데이비드 블랙웰

처럼 과학자와 수학자의 이름을 아키텍처에 사용해왔습니다.

 

Rubin 역시 이러한 명명 방식의 연장선입니다.

흥미롭게도 NVIDIA는 CPU에도 별도의 이름을 붙였습니다.

Vera CPU + Rubin GPU

두 기술을 결합한 것이 바로

Vera Rubin

플랫폼입니다.


🤔 그런데 Blackwell도 엄청 빠른데 왜 또 필요할까?

핵심은 AI가 사용하는 컴퓨팅 방식이 달라지고 있기 때문입니다.

초기의 생성형 AI는 비교적 단순했습니다.

사용자 질문

AI 모델 추론

답변 생성

하지만 AI 에이전트는 다릅니다.

예를 들어 사용자가

“다음 주 제주 여행을 계획하고 가장 적합한 항공편과 숙소를 비교해줘.”

라고 요청했다고 가정해봅시다.

 

AI 에이전트는 단순히 문장 하나를 생성하는 것이 아니라,

요청 이해

정보 검색

조건 비교

여러 단계 추론

외부 도구 사용

결과 확인

추가 추론

최종 답변

같은 과정을 반복할 수 있습니다.

NVIDIA는 이런 에이전틱 AI에서 하나의 요청이 추론·검색·도구 사용·응답 생성으로 이어지는 수많은 단계를 만들 수 있다고 설명합니다.

AI가 단순히 ‘대답하는 프로그램’​에서 ‘일을 수행하는 프로그램’​으로 바뀌면서 컴퓨터 역시 훨씬 많은 연산을 처리해야 하는 것입니다.


🧠 그래서 CPU도 AI에 맞게 바꿨다

AI라고 하면 대부분 GPU부터 떠올립니다.

하지만 AI 에이전트 시대에는 CPU 역할도 중요해지고 있습니다.

AI 에이전트는 모델만 계속 실행하는 것이 아니라

코드를 실행하고,

데이터를 처리하고,

여러 프로그램을 조율하고,

GPU에 필요한 데이터를 전달하고,

수많은 작업을 동시에 관리해야 합니다.

이 역할을 담당하는 것이 Vera CPU입니다.

Vera에는 NVIDIA가 자체 설계한 Olympus 코어 88개가 들어갑니다.

 

또한 최대 1.5TB의 LPDDR5X 메모리를 지원하고, Rubin GPU와 연결할 때 NVLink-C2C를 통해 CPU와 GPU 사이에서 최대 1.8TB/s의 일관된 대역폭을 제공합니다.

쉽게 표현하면,

Rubin GPU가 AI의 강력한 계산 엔진이라면

Vera CPU는 수많은 AI 작업을 관리하고 GPU가 쉬지 않도록 일을 공급하는 관리자

에 가깝습니다.


⚡ 핵심은 역시 ‘Rubin GPU’

Vera Rubin의 중심에는 차세대 Rubin GPU가 있습니다.

Rubin GPU에는 HBM4 고대역폭 메모리가 적용됐습니다.

GPU 하나가 최대

288GB HBM4 메모리

초당 최대 22TB의 메모리 대역폭

을 제공하며, NVIDIA의 NVFP4 형식 기준 최대 50페타플롭스(PFLOPS)​의 AI 연산 성능을 제공합니다.

왜 메모리 대역폭이 중요할까요?

 

최근 AI 모델은 점점 커지고 있고,

한 번에 처리해야 하는 문맥(Context)도 길어지고 있으며,

여러 사용자의 요청을 동시에 처리해야 합니다.

따라서 단순히 계산만 빠른 것이 아니라 GPU가 엄청난 양의 데이터를 빠르게 읽고 전달하는 능력도 중요합니다.

특히 수조 개 매개변수 규모의 모델이나 긴 컨텍스트를 처리하는 AI에서는 이런 차이가 더욱 중요해집니다.


🏢 GPU 72개를 하나의 컴퓨터처럼 만든다?

Vera Rubin에서 가장 흥미로운 제품 중 하나가

Vera Rubin NVL72

입니다.

이름의 72에는 이유가 있습니다.

하나의 랙 안에

Rubin GPU 72개

Vera CPU 36개

가 들어갑니다.

그리고 GPU들을 NVLink 6라는 초고속 연결 기술로 묶습니다.

일반적인 컴퓨터 여러 대를 네트워크로 연결하는 것과는 차원이 다릅니다.

NVLink 6는 GPU당 최대 3.6TB/s의 양방향 GPU 간 대역폭을 제공하며, 72개의 GPU가 서로 빠르게 데이터를 주고받도록 설계됐습니다.

 

즉,

GPU 1

↕️

GPU 2

↕️

GPU 3

↕️

↕️

GPU 72

가 각각 따로 움직이는 것이 아니라,

거대한 하나의 AI 가속기처럼 협력하도록 만드는 것입니다.


🧩 왜 GPU를 이렇게 많이 연결해야 할까?

현재 최첨단 AI 모델은 GPU 한 장에 전부 넣어서 실행하기 어려운 경우가 많습니다.

모델 자체가 매우 크기 때문입니다.

그래서 실제 AI 데이터센터에서는 모델을 여러 GPU에 나눠서 처리합니다.

문제는 GPU끼리 계속 데이터를 주고받아야 한다는 것입니다.

아무리 GPU 자체가 빨라도

“다른 GPU에서 데이터가 올 때까지 기다려야 한다면?”

전체 시스템 속도는 떨어집니다.

그래서 AI 컴퓨터에서는 GPU 자체의 연산 성능만큼 GPU 사이의 통신 속도가 중요합니다.

Vera Rubin에서 NVLink 6가 핵심 기술로 들어가는 이유입니다.


🏭 이제 ‘컴퓨터’가 아니라 ‘AI 팩토리’

NVIDIA가 최근 자주 사용하는 표현이 있습니다.

바로 AI Factory, 즉 AI 팩토리​입니다.

전통적인 데이터센터가 데이터를 저장하고 프로그램을 실행하는 곳이었다면,

AI 데이터센터는 막대한 연산을 투입해

토큰(Token)

이라는 AI 결과물을 끊임없이 만들어냅니다.

그래서 NVIDIA는 데이터센터를 일종의 ‘지능 생산 공장’​처럼 바라보고 있습니다.

여기서 중요한 변화가 있습니다.

 

과거에는

“GPU 한 개가 얼마나 빠른가?”

가 중요했다면,

이제는

“데이터센터 전체가 얼마나 많은 AI 작업을 효율적으로 처리하는가?”

가 더 중요해지고 있다는 것입니다.

Vera Rubin 역시 바로 이 관점에서 설계됐습니다.

NVIDIA는 2026년 5월 Vera Rubin이 이전 세대 Grace Blackwell 플랫폼과 비교해 대규모 환경에서 최대 10배의 에이전트 처리량을 제공한다고 발표했습니다. 이는 NVIDIA가 제시한 자사 플랫폼 기준 성능 수치입니다.


💰 AI 시대에는 ‘토큰 가격’도 중요하다

AI 회사 입장에서 중요한 것은 단순히 GPU가 얼마나 빠른지가 아닙니다.

“AI 답변 하나를 만드는 데 얼마가 드는가?”

도 중요합니다.

ChatGPT 같은 생성형 AI는 사용자가 질문할 때마다 토큰을 생성합니다.

사용자가 수억 명으로 늘어나면 아주 작은 비용 차이도 데이터센터 전체에서는 엄청난 차이가 됩니다.

그래서 AI 인프라에서는

초당 얼마나 많은 토큰을 만들 수 있는지

전력 1W당 얼마나 많은 토큰을 생성하는지

100만 토큰을 생성하는 비용이 얼마인지

같은 지표가 중요해지고 있습니다.

 

NVIDIA는 Vera Rubin NVL72가 Blackwell과 비교해 AI 추론에서 100만 토큰당 비용을 최대 10분의 1 수준으로 낮추도록 설계됐다고 설명합니다. 또한 특정 MoE 모델 학습에서는 필요한 GPU 수를 최대 4분의 1로 줄이는 것을 플랫폼의 주요 성능 향상으로 제시했습니다.

다만 이는 NVIDIA가 자사 조건과 워크로드를 기준으로 제시한 비교 수치이므로 실제 비용과 성능은 사용하는 모델과 시스템 구성에 따라 달라질 수 있습니다.


⚡ 그런데 전력은 괜찮을까?

AI 데이터센터의 가장 큰 문제 중 하나는 전력입니다.

AI 모델이 커질수록 더 많은 GPU가 필요하고,

GPU가 많아지면 전력 소비와 발열도 증가합니다.

그래서 최근 AI 반도체 경쟁에서는

“얼마나 빠른가?”

뿐 아니라

“같은 전력으로 얼마나 많은 AI 작업을 처리할 수 있는가?”

가 중요한 기준이 되고 있습니다.

실제로 CoreWeave가 2026년 공개한 DeepSeek-R1 기반 초기 벤치마크에서는 Vera Rubin이 Grace Blackwell NVL72 대비 메가와트당 처리량을 10배 높인 결과가 제시됐습니다. 다만 이 역시 특정 모델과 벤치마크 조건에서 측정된 결과입니다.

 

즉 앞으로 AI 반도체 경쟁은 단순한 속도 경쟁을 넘어

성능 + 전력 + 냉각 + 네트워크 + 비용

전체를 최적화하는 경쟁으로 바뀌고 있습니다.


🔗 그래서 NVIDIA가 네트워크까지 만드는 이유

여기서 한 가지 재미있는 질문이 생깁니다.

“GPU 회사가 왜 네트워크 장비까지 만들지?”

이유는 AI 데이터센터가 커질수록 통신이 병목현상이 되기 때문입니다.

GPU 수십 개를 넘어

수천 개,

수만 개,

더 나아가 수십만 개의 GPU를 연결하려면

GPU 자체만 빨라서는 안 됩니다.

GPU 사이에서 데이터를 빠르게 이동시키는 네트워크가 필요합니다.

 

그래서 Vera Rubin 플랫폼에는

NVLink 6

ConnectX-9 SuperNIC

Spectrum-6 Ethernet

BlueField-4 DPU

같은 기술이 함께 들어갑니다.

NVIDIA는 GPU 회사에서 점점

‘AI 데이터센터 전체를 설계하는 회사’

에 가까워지고 있는 셈입니다.


🤖 그리고 2026년, ‘Groq’까지 들어왔다

2026년 Vera Rubin 플랫폼에는 또 하나 흥미로운 변화가 생겼습니다.

바로 Groq 3 LPX입니다.

NVIDIA는 2026년 3월 Groq 3 LPU를 Vera Rubin 플랫폼에 통합한다고 발표했고, 8월 24일에는 Groq 3 LPX가 본격적인 양산에 들어갔다고 밝혔습니다.

Groq 3 LPX는 특히 빠른 토큰 생성이 중요한 AI 추론을 겨냥합니다.

AI 에이전트는 한 번의 질문에 답하기 위해 수백 번, 수천 번에 걸쳐 추론을 반복할 수 있습니다.

따라서 각각의 토큰을 얼마나 빠르게 생성하는지가 실제 사용자에게 느껴지는 AI 속도에 직접적인 영향을 줄 수 있습니다.

 

즉 Vera Rubin은 이제

Rubin GPU → 범용 AI 학습·추론

Groq 3 LPX → 초고속 토큰 생성

처럼 서로 다른 AI 작업에 특화된 컴퓨팅을 조합하는 방향으로도 확장되고 있습니다.


🌍 이미 실제 공급도 시작됐다

Vera Rubin은 더 이상 발표만 된 미래 기술이 아닙니다.

NVIDIA는 2026년 5월 Vera Rubin의 본격적인 양산 확대를 발표했고, 7월에는 CoreWeave, Google Cloud, Microsoft Azure, Oracle Cloud Infrastructure, Nebius 등에서 Vera Rubin NVL72 시스템이 가동 또는 배치 단계에 있다고 밝혔습니다.

2026년 8월 27일에는 AWS가 첫 Vera CPU 서버와 Rubin GPU를 전달받았다는 소식도 공개됐습니다.

NVIDIA에 따르면 Vera CPU 시스템은 OpenAI와 Anthropic 등 주요 AI 연구기업에도 전달됐습니다.

즉 2026년은 Blackwell 이후의 Rubin 시대가 실제 데이터센터로 들어가기 시작하는 시점이라고 볼 수 있습니다.


🚀 Vera Rubin 다음도 이미 정해져 있다?

AI 반도체 경쟁이 얼마나 빠른지는 NVIDIA의 로드맵에서도 확인할 수 있습니다.

NVIDIA는 하나의 아키텍처를 오랫동안 사용하는 대신 새로운 AI 플랫폼을 빠르게 내놓는 전략을 이어가고 있습니다.

중요한 것은 이제 GPU 세대가 바뀔 때마다 단순히 칩만 교체되는 것이 아니라는 점입니다.

GPU,

CPU,

메모리,

네트워크,

스토리지,

냉각,

소프트웨어

가 함께 바뀌는 플랫폼 단위의 세대교체가 일어나고 있습니다.

Vera Rubin이 중요한 이유도 바로 여기에 있습니다.


🔥 결국 ‘GPU 전쟁’에서 ‘AI 공장 전쟁’으로

Blackwell과 Rubin을 단순히

“어느 GPU가 몇 배 빠르다.”

라는 식으로만 보면 최근 AI 인프라 경쟁의 핵심을 놓칠 수 있습니다.

NVIDIA가 Vera Rubin에서 보여주는 방향은 더 큽니다.

과거에는

CPU + GPU + 서버

가 각각 중요한 부품이었다면,

이제는

CPU

GPU

초고속 메모리

GPU 연결 기술

네트워크

스토리지

소프트웨어

를 하나의 시스템처럼 설계합니다.

 

그리고 여러 랙을 다시 연결해 거대한 하나의 AI 컴퓨터처럼 움직이게 합니다.

결국 AI 반도체 경쟁의 단위가

‘칩’ → ‘서버’ → ‘랙’ → ‘데이터센터 전체’

로 점점 커지고 있는 것입니다.


⭐ 결론: ‘Vera Rubin’은 새로운 GPU 이름이 아니다

Vera Rubin을 한마디로 정리하면

“AI 에이전트 시대를 위해 NVIDIA가 만든 차세대 AI 컴퓨팅 플랫폼”

이라고 할 수 있습니다.

핵심에는 차세대 Rubin GPU가 있지만,

Vera CPU,

HBM4,

NVLink 6,

ConnectX-9,

BlueField-4,

Spectrum-6,

그리고 Groq 3 LPX까지

여러 종류의 칩과 네트워크 기술이 하나의 거대한 AI 시스템을 구성합니다.

 

특히 AI가 단순히 질문에 답하는 것을 넘어

생각하고,

검색하고,

도구를 사용하고,

코드를 실행하고,

여러 단계에 걸쳐 일을 처리하는

AI 에이전트로 발전하면서 필요한 컴퓨팅 인프라도 달라지고 있습니다.

그리고 2026년 Vera Rubin의 본격적인 양산과 공급은 그 변화를 보여주는 대표적인 사례입니다.

 

Blackwell 시대의 질문이

“AI를 얼마나 빠르게 학습시킬 수 있을까?”

였다면,

Vera Rubin 시대에는 질문이 조금 달라질지도 모릅니다.

“수많은 AI 에이전트를 얼마나 빠르고 저렴하고 효율적으로 동시에 움직일 수 있을까?”

AI 경쟁의 무대가 이제 모델을 넘어 거대한 ‘AI 공장’으로 확대되고 있습니다. 🤖⚡🏭

이 포스팅은 쿠팡 파트너스 활동의 일환으로, 이에 따른 일정액의 수수료를 제공받습니다.

728x90
반응형
LIST