
B200 GB200 핵심만 먼저 정리하면
B200과 GB200 중 무엇을 살지는 성능표가 아니라 건물이 먼저 결정합니다. HGX B200 계열의 8-GPU 노드는 DGX B200 기준 10RU에 시스템 최대 소비전력이 약 14.3kW이고 공랭 옵션도 있습니다. 반면 GB200 NVL72는 랙 1대가 약 120kW를 쓰며 액체냉각을 전제로 설계된 랙스케일 제품입니다(NVIDIA 공식 문서 기준, 2026년 8월 10일 확인). 기존 전산실이 랙당 120kW 급전과 직접칩냉각(DCLC) 배관을 받아줄 수 없다면 GB200 NVL72는 견적을 받아볼 필요조차 없이 후보에서 빠집니다.
두 번째 관문은 비용 배수입니다. NVIDIA는 GB200 NVL72가 H100 대비 LLM 학습 4배, 추론 30배, 에너지 효율 25배라고 공표합니다. 그런데 전문 분석기관 SemiAnalysis는 2025년 8월 분석에서 GB200 NVL72의 TCO를 H100의 약 1.6배로 추정했습니다. 실효 성능이 1.6배를 넘지 못하면 도입은 손해라는 뜻입니다. 세 번째는 정밀도입니다. B200이 크게 앞서는 구간은 NVFP4이므로, 사내 모델의 FP4 커널이 준비돼 있는지가 도입 가치의 절반을 좌우합니다. 이 세 가지를 먼저 통과한 뒤에야 벤치마크 비교가 의미를 갖습니다.
Q1. HGX B200 노드와 GB200 NVL72, 우리 전산실에 들어가는 쪽은 어느 것입니까
시설 조건부터 표로 대조하면 판단이 즉시 끝나는 경우가 많습니다. 아래 수치는 NVIDIA DGX B200 User Guide와 DGX GB Rack Scale Systems User Guide 기준입니다(2026년 8월 10일 확인).
| 항목 | DGX B200 (8-GPU 노드) | GB200 NVL72 (랙) |
|---|---|---|
| 폼팩터 | 10RU (444×482.3×897.1mm) | 랙 전체 (컴퓨트 트레이 18 + NVLink 스위치 트레이 9) |
| GPU 수 | 8 (B200 SXM) | 72 (+ Grace CPU 36) |
| 최대 소비전력 | 약 14.3kW | 약 120kW |
| 냉각 | 공랭 가능, 1,550 CFM 필요 | 액랭 전제 설계 |
| 발열 | 48,794 BTU/hr | 랙 단위 CDU 필요 |
| 중량 | 최대 142.4kg | 파워 셸프 8개 포함 랙 단위 |
| 운용 온도 | 10~35°C | 공식 냉각수 요구치 미공개 |
일반 기업 전산실의 랙 급전은 보통 5~15kW 수준입니다. 그래서 14.3kW 노드 한 대는 랙 한 개를 통째로 쓰는 조건으로 겨우 수용되고, 120kW 랙은 급전·차단기·바닥 하중·CDU를 모두 새로 설계해야 합니다. 실측 참고치로, ServeTheHome이 리뷰한 ASRock Rack 8U8X-GNR2 SYN B200 서버는 유휴 약 2.9kW, 최대 부하 약 12.5kW를 기록했고 3kW Titanium PSU 12개(6+6 이중화)로 구성돼 있었습니다. 섀시·CPU·NIC 구성이 다르므로 DGX B200 공칭 14.3kW와 직접 비교하기는 어렵습니다. 시설 설계는 공칭치로, 전기요금 추정은 실측 12.5kW대로 이원 적용하는 편이 안전합니다. 참고로 GB200 NVL72의 냉각수 유량, 입수 온도 상한, CDU 용량 요구치는 NVIDIA 공개 문서에서 확인되지 않았습니다(확인 필요). 2차 자료에 떠도는 "모듈당 2~3 L/min, 입수 45°C 이하" 같은 값은 근거를 확보하지 못했으므로 시설 설계 근거로 쓰면 안 됩니다.
Q2. NVIDIA가 말하는 "H100 대비 학습 4배, 추론 30배"를 그대로 믿어도 됩니까
배수는 사실이되 조건부입니다. 성능 배수와 비용 배수를 같은 화면에 놓고 봐야 합니다.
| 지표 | 값 | 출처 성격 |
|---|---|---|
| GB200 NVL72 학습 (vs H100) | 4배 | NVIDIA 공칭 |
| GB200 NVL72 추론 (vs H100) | 30배 | NVIDIA 공칭 |
| DGX B200 학습/추론 (vs DGX H100) | 3배 / 15배 | NVIDIA 공칭 |
| GB200 NVL72 TCO (vs H100) | 약 1.6배 | SemiAnalysis 분석 (2025년 8월 기준) |
| 자본지출 참고치 | H100 서버 약 $250k/대, NVL72 랙 약 $3.9M/랙 | SemiAnalysis 분석, 정가 아님 |
여기서 도출되는 실무 규칙은 단순합니다. 손익분기는 4배가 아니라 1.6배입니다. 우리 워크로드에서 실효 성능 향상이 1.6배를 넘지 못하면 도입은 비용만 늘리는 결정이 됩니다. 이 손익분기는 응답속도 목표에 따라 흔들리기도 합니다. SemiAnalysis의 InferenceX v2(2026년 2월 테스트, 8K 입력 / 1K 출력 조건)에 따르면 GB200 NVL72의 랙스케일 이점은 다중노드 B200 구성 대비 대역폭·TCO 기준 약 9배까지 벌어집니다. 다만 이 격차는 대화형 응답속도가 올라갈수록 줄어들어 130 tok/s/user를 넘으면 사실상 사라집니다. 반대로 35 tok/s/user 구간에서는 MTP를 켠 B200 노드가 비교군 중 최고 토큰당 비용 효율을 기록했습니다.
또 하나 유의할 점은 비교 기준 세대입니다. DGX B200의 "추론 15배"는 DGX H100(FP8 세대) 대비 FP4 성능을 놓고 계산한 값입니다. 세대와 정밀도가 동시에 바뀐 배수이므로, H200을 이미 운용 중인 조직이 자사 대비 15배를 기대하면 어긋납니다. 참고로 NVIDIA는 B200, HGX B200, DGX B200, GB200 NVL72의 공식 정가를 공개하지 않습니다. 유통되는 견적 수치는 모두 재판매·분석 매체 기준이므로 내부 품의서에 올릴 때는 "당사 견적 기준, 정가 아님"과 견적 시점을 반드시 병기해야 합니다.
Q3. B200을 사면 H200보다 무조건 토큰당 비용이 싸집니까
아닙니다. 모델이 FP4로 실제 서빙되는지가 갈림길입니다. SemiAnalysis InferenceX의 두 사례를 나란히 보면 결론이 뒤집힙니다.
| 모델·조건 | B200 | H200 | 판단 |
|---|---|---|---|
| DeepSeek R1 0528 671B, NVFP4, 59 tok/s/user | 2,700.6 tok/s/chip | 422.2 tok/s/chip | B200 약 6.4배 |
| 위 조건 토큰 100만 개당 비용 | $0.177 | $0.804 | B200 약 1/4.5 |
| Kimi K2.6 | tok/s/GPU 7% 우위 | 토큰당 32% 저렴 | H200 우세 |
같은 하드웨어인데 모델이 바뀌자 비용 우위가 뒤집혔습니다. B200의 이점 대부분이 NVFP4 경로에서 나오기 때문입니다. FP4 커널이 준비되지 않았거나 FP16/BF16 위주로 서빙하는 조직이라면 직전 세대 H200이 토큰당 비용에서 이깁니다.
소프트웨어 성숙도도 함께 봐야 합니다. 개발자 커뮤니티에서는 B200(sm_100) 환경에서 NGC 컨테이너의 NVIDIA 커스텀 빌드 PyTorch를 PyPI 버전으로 덮어쓰면 "CUDA error: no kernel image is available for execution on the device"가 발생한다는 보고가 반복됩니다. 해결책은 NVIDIA 컨테이너를 베이스로 유지하고 vLLM만 수동 업그레이드하는 방식으로 정리되는 분위기입니다. 이는 공식 확인 자료가 아니라 2026년 8월 10일 기준으로 확인된 커뮤니티·기술 블로그 보고이며, NVFP4 모델의 vLLM 동작이 버전에 따라 되기도 하고 안 되기도 한다는 상반된 보고도 함께 있습니다. vLLM 프로젝트가 2025년 11월 17일 개설한 트래킹 이슈에는 멀티노드 elastic TP 미완, MoE용 DeepEP 커널 통합 필요, NVFP4 기반 EPLB 미완, FP8 prefill attention 초기 단계, 128K 롱시퀀스 성능 개선 필요 항목이 정리돼 있습니다. 도입 전 "우리 모델의 FP4 커널이 있는가", "운영 스택을 NVIDIA 컨테이너로 고정할 수 있는가" 두 문항을 반드시 통과시켜야 합니다.
Q4. 상위 세대 B300·GB300이 나온 지금, B200을 사는 것이 뒤처지는 선택입니까
워크로드에 FP64가 섞여 있다면 오히려 반대입니다. NVIDIA HGX 공식 스펙표를 비교하면 세대 교체가 일방적 상향이 아니라는 사실이 드러납니다.
| 항목 | HGX B200 | HGX B300 |
|---|---|---|
| FP4 Tensor (sparse | dense) | 144 | 72 PFLOPS | 144 | 108 PFLOPS |
| FP8/FP6 | 72 PFLOPS | 72 PFLOPS |
| INT8 | 72 POPS | 3 POPS |
| FP16/BF16 | 36 PFLOPS | 36 PFLOPS |
| FP64 | 296 TFLOPS | 10 TFLOPS |
| 총 메모리 | 1.4TB | 2.1TB |
| 네트워킹 | 0.8TB/s | 1.6TB/s |
FP64가 296 TFLOPS에서 10 TFLOPS로, 약 30배 줄었습니다. INT8도 72 POPS에서 3 POPS로 급감했습니다. 유체해석·구조해석·기상 시뮬레이션 같은 배정밀도 HPC가 클러스터에 섞여 있거나 INT8 레거시 추론 자산이 많은 조직이라면 상위 세대가 오답이 됩니다. 반대로 대형 MoE 추론처럼 메모리 용량이 병목인 경우에는 B300(2.1TB)이나 GB300 NVL72(GPU 메모리 20TB, GB200은 13.4TB)가 유리합니다.
실측 격차는 생각만큼 크지 않습니다. MLPerf Training v5.1의 Llama 2-70B LoRA 파인튜닝 결과를 보면 Oracle의 GB200 NVL72(72 GPU)가 1.598분, Lambda의 GB300 NVL72(72 GPU)가 1.26분으로 GB300이 약 1.27배 빨랐고, Oracle의 B200 64 GPU 구성은 2.019분이었습니다. 세대 프리미엄이 27% 수준이라면 조달 가격 차이와 저울질할 여지가 충분합니다. 참고로 "HGX B300이 B200 대비 학습 시간을 평균 12.6% 단축한다"는 수치도 유통되지만 원문 본문을 확인하지 못해 그대로 인용하기는 어렵습니다.
Q5. 도입을 결정한 뒤에 발목을 잡는 운영상 함정에는 무엇이 있습니까
카탈로그에 안 적힌 부분에서 일정이 밀립니다. NVIDIA가 DGX B200 Firmware Update Guide의 Known Issues에 공식 기재한 제약만 추려도 다음과 같습니다. GPU 트레이는 개별 컴포넌트 단위 업데이트가 불가능해 트레이 전체를 갱신해야 하고, 펌웨어는 엔터프라이즈 지원 포털에서 수동으로 내려받아야 하며, ConnectX-7 펌웨어 적용에는 재부팅이 아니라 AC 전원 재인가가 필요합니다. AC 사이클 이후 BMC 기동에 최대 10분이 걸리고, VBIOS는 특정 중간 버전을 경유해야 업데이트가 성공합니다. 무중단 운영을 전제로 SLA를 설계했다면 이 항목들이 그대로 위약 사유가 됩니다.
신뢰성 측면에서는 SemiAnalysis가 2025년 8월 분석 시점 기준으로 "GB200 NVL72에서 완료된 대규모 학습 런이 아직 없다"며 NVLink 구리 백플레인의 신뢰성과 진단·디버깅 도구 부족을 리스크로 지목한 바 있습니다. 2026년 현재 상황은 재확인이 필요한 항목이며, 이 글 시점에서 갱신된 1차 자료를 확보하지 못했습니다. 액랭 쪽에서는 GB200 캐비닛의 분기관·퀵커넥터·호스 등 외주 부품에서 누수가 발견돼 긴급 대응했다는 대만 공급망 인용 보도가 있었고 양산 전 수정돼 납기 영향은 없었다고 전해졌으나, 이는 1차 자료로 확인되지 않은 보도입니다.
경쟁 제품을 함께 검토한다면 AMD Instinct MI355X는 288GB HBM3E와 8TB/s 대역폭, FP4/FP6 최대 10 PFLOPS로 GPU당 메모리 용량에서 B200(180GB)을 앞섭니다. 다만 InferenceX v2 실측에서는 FP8 분리 서빙에서 B200과 경쟁 가능한 반면, FP4와 분리 서빙과 wide EP를 결합한 실제 프로덕션 구성에서는 조합 안정성 문제로 크게 뒤처지는 양상이 관찰됐습니다. 널리 유통되는 TBP 1,400W라는 수치는 AMD 공식 문서 본문에서 확인하지 못했습니다.
정리
도입 검토는 벤치마크가 아니라 시설 조건에서 시작해야 합니다. 랙당 120kW와 액랭을 감당할 수 없다면 GB200 NVL72는 후보에서 빠지고, 10RU·14.3kW·공랭 옵션이 있는 HGX B200 계열이 현실적인 선택지로 남습니다. 성능 배수(공칭 4배·30배)와 비용 배수(TCO 약 1.6배)는 항상 함께 계산하고, 목표 응답속도가 130 tok/s/user를 넘는 서비스라면 랙스케일의 대역폭 이점이 사라진다는 점을 전제로 삼아야 합니다. 마지막으로 사내 모델의 NVFP4 커널 준비 여부와 FP64 워크로드 비중을 확인하면 B200과 B300 사이의 선택도 자연스럽게 갈립니다. 가격은 NVIDIA 공식 미공개이므로 어떤 견적이든 시점과 출처를 명시해 비교하시기 바랍니다.
참고 자료
조사 기준일: 2026년 08월 10일
본문의 수치는 아래 자료에서 확인한 것입니다. 제조사 공식 자료(T1)와 전문 매체 실측(T2)을 구분해 표기했습니다. 가격·공급 상황은 변동이 크므로 기준일 이후의 값은 다시 확인해야 합니다.
Tier 1 — 제조사 공식 (모두 2026-08-10 확인)
- NVIDIA HGX 플랫폼 공식 페이지 (HGX B200/B300 스펙표) — https://www.nvidia.com/en-us/data-center/hgx/
- NVIDIA GB200 NVL72 공식 페이지 (스펙표·성능 주장) — https://www.nvidia.com/en-us/data-center/gb200-nvl72/
- NVIDIA GB300 NVL72 공식 페이지 — https://www.nvidia.com/en-us/data-center/gb300-nvl72/
- NVIDIA DGX B200 공식 제품 페이지 — https://www.nvidia.com/en-us/data-center/dgx-b200/
- NVIDIA DGX B200 User Guide — Introduction (하드웨어 스펙) — https://docs.nvidia.com/dgx/dgxb200-user-guide/introduction-to-dgxb200.html
- NVIDIA DGX B200 Firmware Update Guide — Known Issues — https://docs.nvidia.com/dgx/dgxb200-fw-update-guide/known-issues.html
- NVIDIA DGX GB Rack Scale Systems User Guide — Hardware (NVL72 랙 전력·트레이 구성) — https://docs.nvidia.com/dgx/dgxgb200-user-guide/hardware.html
- NVIDIA HGX AI Factory Enterprise Reference Architecture — Components — https://docs.nvidia.com/enterprise-reference-architectures/hgx-ai-factory/latest/components.html
- Lenovo Press — ThinkSystem NVIDIA HGX B200 180GB 1000W GPU 제품 가이드 (OEM 공식, B200 단품 스펙) — https://lenovopress.lenovo.com/lp2226-thinksystem-nvidia-b200-180gb-1000w-gpu
- AMD Instinct MI355X 공식 제품 페이지 (경쟁 제품 T1) — https://www.amd.com/en/products/accelerators/instinct/mi350/mi355x.html
- AMD Instinct System Acceptance Guide — MI355X — https://instinct.docs.amd.com/projects/system-acceptance/en/latest/gpus/mi355x.html
Tier 2 — 전문 매체 실측·기술 분석 (모두 2026-08-10 확인)
- ServeTheHome — ASRock Rack 8U8X-GNR2 SYN B200 리뷰 (HGX B200 8-GPU 서버 전력 실측) — https://www.servethehome.com/asrock-rack-8u8x-gnr2-syn-b200-review-nvidia-hgx-b200-8-gpu-server-intel-xeon/5/
- ServeTheHome — This is the NVIDIA DGX GB200 NVL72 (랙 실물·120kW) — https://www.servethehome.com/this-is-the-nvidia-dgx-gb200-nvl72/
- ServeTheHome — Exploring the NVIDIA HGX B200 Lambda AI Cluster at Cologix with Supermicro — https://www.servethehome.com/exploring-the-nvidia-hgx-b200-lambda-ai-cluster-at-cologix-with-supermicro/
- SemiAnalysis InferenceX — DeepSeek R1: B200 vs H200 — https://inferencex.semianalysis.com/compare/b200-vs-h200
- SemiAnalysis — InferenceX v2: NVIDIA Blackwell vs AMD vs Hopper (2026-02 테스트) — https://newsletter.semianalysis.com/p/inferencex-v2-nvidia-blackwell-vs
- SemiAnalysis — H100 vs GB200 NVL72 Training Benchmarks: Power, TCO, and Reliability (2025-08, 일부 유료 구간) — https://newsletter.semianalysis.com/p/h100-vs-gb200-nvl72-training-benchmarks
- Lambda — MLPerf Training v5.1: GB300 NVL72 vs GB200 NVL72 vs B200 (MLCommons 제출 결과 기반) — https://lambda.ai/blog/lambda-mlperf-training-benchmarks-v5.1
- Nebius — MLPerf Training v5.1 결과 (B200/B300 비교, 원문 본문 미확인) — https://nebius.com/blog/posts/mlperf-training-v5-1-results
Tier 3 — 커뮤니티·개발자 보고 (수치 근거 아님, 모두 2026-08-10 확인)
- vLLM GitHub Issue #28883 — (G)B200/300 performance improvements 트래킹 (2025-11-17 개설) — https://github.com/vllm-project/vllm/issues/28883
- vLLM 포럼 — How to apply FA4 on B200 — https://discuss.vllm.ai/t/how-to-apply-fa4-on-b200/2133
- Medium — Fix for vLLM Incompatibility on B200 (sm_100 PyTorch 이슈) — https://medium.com/@imen.selmi/fix-for-vllm-incompatibility-on-b200-keep-nvidia-pytorch-use-newer-vllm-8e0b3a0a4d16
- Hacker News — Virtualizing Nvidia HGX B200 GPUs with Open Source (NVLink 가상화 난이도) — https://news.ycombinator.com/item?id=46312792
- Hacker News — Nvidia and AMD's NVL72 and Helios rack systems aren't for the enterprise — https://news.ycombinator.com/item?id=44299850
- TweakTown — GB200 AI 서버 캐비닛 액랭 누수 보도 (공급망 인용, 1차 자료 미확인) — https://www.tweaktown.com/news/99446/nvidias-new-gb200-ai-server-cabinets-leaks-in-liquid-cooling-system-emergency-work-to-fix-it/index.html
- NVIDIA Developer Forums — VFIO Passthrough for HGX B200 system — https://forums.developer.nvidia.com/t/vfio-passthrough-for-hgx-b200-system/339906