AI RACE— AI Race
Business

NVIDIA와 CoreWeave, Vera Rubin NVL72와 Vera CPU를 배포해 에이전트 AI 생산성 가속

CoreWeave가 NVIDIA의 Vera Rubin NVL72 GPU와 Vera CPU를 클라우드에 출시, 토큰 처리량을 최대 4.8배, 샌드박스 시작을 3배 가속화해 에이전트 AI 워크로드를 지원한다.

2026. 09. 30. 22:00
NVIDIA và CoreWeave ra mắt hạ tầng “Agentic AI” mới: Vera Rubin NVL72 và CPU Vera trên đám mây

1. 발표 및 주요 플레이어

2026년 9월 30일, NVIDIA와 클라우드 컴퓨팅 전문 기업 CoreWeave가 차세대 AI 인프라가 이제 실제 운영 중이라고 발표했다. 샌프란시스코에서 열린 CoreWeave Fully Connected 행사에서 양사는 NVIDIA Vera Rubin NVL72 시스템(스펙트럼‑X 102.4 Tbps 이더넷과 결합)과 에이전트 AI 전용으로 설계된 최초의 NVIDIA Vera CPU를 공개했다. Devin AI 소프트웨어 엔지니어를 개발한 응용 AI 연구소 Cognition이 Vera Rubin 플랫폼에서 최초로 프로덕션 워크로드를 실행하는 고객이 되었다.

2. 기술 세부 사항 및 초기 결과

  • Hardware rollout: CoreWeave는 첫 번째 Vera Rubin NVL72 생산 랙을 인수해 CoreWeave Cloud를 통해 고객에게 제공함으로써, 이 플랫폼을 공개한 최초의 클라우드 제공업체 중 하나가 되었다. 이번 배포에는 128개의 Vera CPU가 포함돼 단일 랙에 11,264개의 코어를 제공하며, 11,000개가 넘는 동시 격리 환경을 지원한다.
  • Performance gains: Cognition은 실제 소프트웨어 엔지니어링 워크로드(FrontierCode 샘플)에서 GB200 NVL72 기준 모델과 Vera Rubin NVL72를 비교 테스트했다. 그 결과 SWE‑2 추론 시 토큰 처리량이 최대 4.8배 향상돼 실시간 코드 생성 속도가 빨라지고 다단계 추론이 보다 민첩해졌다.
  • Sandbox acceleration: CoreWeave Sandboxes를 활용한 테스트에서 Vera CPU는 에이전트 샌드박스 시작 시간이 3배 이상 빨라졌으며, Terminal‑Bench 스위트 전체에서 1.7배의 성능 향상을 기록했다. 각 샌드박스는 하드웨어 격리 환경에서 실행되며, Spectrum‑X 스위치와 BlueField‑4 DPU가 저지연·보안 통신을 보장한다.
  • Software stack: AI 팩토리는 NVIDIA Dynamo(오픈소스 추론 프레임워크) 위에서 동작한다. Dynamo는 또한 RL Rollouts라는 프라이빗 프리뷰 기능을 지원해, 재배포 없이 새로운 체크포인트를 실시간 배포에 로드한다.
  • CoreWeave Forge: 프로덕션과 학습 사이의 루프를 닫기 위해 CoreWeave는 Weights & Biases, OpenPipe 사후 학습 도구, marimo 노트북 프로젝트를 하나로 묶은 통합 환경 Forge를 선보였다. 새로운 서비스는 다음과 같다:
  • CoreWeave ARIA – AI‑지원 연구·코딩 어시스턴트로 실행을 분석하고 실험을 제안하며 GitHub에 변경 사항을 기록한다.
  • CoreWeave Agent Lens – 프로덕션 에이전트 가시성을 제공해 장애 탐지를 20 % 개선하고 복구 비용을 절반으로 낮춘다.
  • CoreWeave Sandboxes – 이제 GA 단계에 진입했으며, 에이전트, 툴 호출, RL, 평가 등을 CPU 또는 GPU 격리 환경에서 서버리스 혹은 기존 학습 인프라 위에서 실행한다. 서버리스 감독형 파인튜닝 및 RL은 자체 관리 환경 대비 1.4배 빠르고 비용은 40 % 낮다.
  • Early adopters: Cognition 외에도 Canva, Capital One, MasterClass, 그리고 의료 서비스 제공업체 Ennoble Care가 Forge 기반 구축을 시작했다. Ennoble Care는 CoreWeave Kubernetes Service에서 예약형 NVIDIA RTX PRO 6000 GPU를 활용해 임상 문서화 및 의사결정 지원 에이전트를 운영한다.

Quotes:

“NVIDIA 가속 컴퓨팅은 세대를 초월해 가치를 제공한다”고 NVIDIA의 하이퍼스케일·HPC 부문 부사장 Ian Buck이 말했다. “CoreWeave의 V100 GPU는 Volta 출시 후 거의 10년이 지난 지금도 고객 워크로드를 실행하고 있으며, CoreWeave가 Vera Rubin NVL72를 생산에 투입하고 있다.”
“에이전트 코딩은 복잡한 워크로드다. 긴 컨텍스트, 높은 동시성, 토큰 양이 많아 토큰당 비용이 우리가 제공할 수 있는 범위를 결정한다”고 Silas Alberti(Cognition 창립팀 멤버)가 언급했다. “모든 것을 하나의 플랫폼에서 운영하고, NVIDIA와 CoreWeave 엔지니어가 우리와 함께 어려운 문제를 해결해 주는 것이 단일 사양보다 우리에게 더 중요하다.”

3. 산업적 함의

이번 출시는 에이전트 AI로의 전환이 가속화되고 있음을 보여준다. 대형 언어 모델이 자율 소프트웨어 엔지니어, 임상의, 고객 서비스 봇 등으로 역할을 확대하면서, 학습부터 실시간 추론까지 전 과정을 아우르는 풀스택 멀티세대 플랫폼을 제공하는 NVIDIA와 CoreWeave는 프로토타입 단계에서 프로덕션 단계로 전환되는 과정에서 발생하던 파편화를 크게 줄이고자 한다. V100 GPU에 대한 10년 ROI를 강조한 것은 NVIDIA 하드웨어 로드맵의 장기적 지속 가능성을 부각시키는 전략이며, 이는 AWS, Azure, Google Cloud 등 경쟁사들이 자체 AI‑최적화 CPU와 네트워킹 솔루션을 내놓는 상황과 대비된다.

고대역폭 Spectrum‑X 이더넷, BlueField‑4 DPU, 전용 Vera CPU가 결합된 이번 솔루션은 저지연 서빙과 대규모 병렬 학습이라는 에이전트 워크로드의 이중 요구를 동시에 충족한다. 특히 의료, 금융, 크리에이티브 분야 등에서 자율 AI 에이전트를 도입하려는 기업이 늘어남에 따라, 수천 개의 격리 샌드박스를 신속히 띄울 수 있는 능력은 클라우드 선택에 있어 결정적인 요소가 될 전망이다.

---

All figures and quotes are taken from the NVIDIA blog post “From Training to Production, NVIDIA and CoreWeave Close the Loop on Agentic AI” dated September 30, 2026.

관련 기사