도입·구매 판단

엔터프라이즈 GPU 도입 전 H100·H200 스펙 비교 가이드

mdit 2026. 7. 31. 16:53


H100 개요

H100 개요

대규모 AI 모델을 학습하거나 서빙하는 조직이라면 한 번쯤 H100과 H200 중 무엇을 도입해야 하는지 고민하게 된다. 두 제품은 이름만 보면 세대 차이가 큰 것처럼 느껴지지만, 실제로는 연산 성능(TFLOPS)이 완전히 동일하고 메모리 용량·대역폭만 달라진 파생 모델에 가깝다. 이 차이를 정확히 이해하지 못하면 워크로드에 맞지 않는 장비를 고가에 도입하는 실수로 이어질 수 있다. 특히 제조사 공칭 스펙은 스파시티(sparsity) 적용 기준으로 표기되는 경우가 많아, 실제 학습·추론 처리량을 스펙시트 수치만으로 추정하면 상당한 괴리가 발생한다. 이 글은 2026년 7월 31일 기준 확인 가능한 제조사 공식 자료와 전문 매체 실측 벤치마크를 대조해, 도입 검토 시 반드시 짚어야 할 기준을 정리했다.


1. H100·H200 폼팩터별 확정 스펙 비교

1. H100·H200 폼팩터별 확정 스펙 비교

H100은 SXM, PCIe, NVL(듀얼카드) 세 가지 폼팩터로 출시되어 있고, H200은 SXM과 NVL 구성이 존재한다. 각 폼팩터는 전력·메모리·확장성이 다르므로 워크로드 규모에 맞춰 선택해야 한다.

항목 H100 SXM H100 PCIe H100 NVL(듀얼) H200 SXM H200 NVL
메모리 용량 80GB HBM3 80GB HBM2e 카드당 94GB HBM3 141GB HBM3e 141GB HBM3e
메모리 대역폭 3.35TB/s 2.0TB/s 3.9TB/s 4.8TB/s 4.8TB/s
FP8 TFLOPS(스파시티 적용) 3,958 3,026 3,341 3,958 3,341
NVLink 대역폭 900GB/s - 600GB/s 900GB/s GPU당 900GB/s
최대 TDP 700W(조정 가능) 350W 350~400W(조정 가능) 700W(조정 가능) 600W(조정 가능)

[T1: NVIDIA H100·H200 공식 제품 페이지, NVIDIA H100 PCIe Product Brief PB-11133-001, 2026-07-31 확인]

표에서 보듯 연산 성능(FP8/TF32 TFLOPS)은 SXM 기준으로 H100과 H200이 완전히 동일하다. 달라지는 것은 메모리 용량(약 1.76배)과 대역폭(약 1.4배)뿐이다. 즉 H200은 "더 빠른 GPU"가 아니라 "같은 연산 능력에 더 큰 메모리 창고를 얹은 GPU"로 이해하는 편이 정확하다. 참고로 차세대 제품인 DGX B200은 8-GPU 구성 기준 총 메모리 1,440GB, NVLink 스위치 2기로 집계 대역폭 14.4TB/s를 지원한다[T1: NVIDIA DGX B200 공식 데이터시트].


2. 공칭 스펙과 실측 벤치마크의 괴리

2. 공칭 스펙과 실측 벤치마크의 괴리

도입 검토에서 가장 자주 발생하는 오류는 제조사 공칭 스펙(특히 스파시티 적용 FP8·TF32 수치)을 실제 처리량으로 오인하는 경우다. SemiAnalysis가 진행한 GEMM 실측 벤치마크에 따르면 실제 처리량은 공칭치를 상당폭 밑돈다.

항목 공칭(T1) 실측(T2) 비고
BF16 GEMM 처리량 989.5 TFLOPS 약 720 TFLOP/s 실측이 공칭 대비 약 73% 수준
FP8 처리량 3,958 TFLOPS(스파시티 적용) 약 1,280 TFLOP/s 조건(스파시티 적용 여부)이 달라 격차가 커 보임

[T1: NVIDIA 공식 스펙 + T2: SemiAnalysis, MI300X vs H100 vs H200 Benchmark Part 1: Training]

반면 MLPerf Inference v4.0의 Llama 2 70B(Offline 시나리오) 벤치마크에서는 H100이 22,290 tok/s, H200이 31,712 tok/s를 기록해 H200이 약 42% 높은 처리량을 보였다[T2: MLCommons MLPerf Inference v4.0 결과]. 이는 연산 성능 차이가 아니라 메모리 대역폭 확대(3.35→4.8TB/s)로 병목이 풀린 결과다. 특히 장문맥(long-context) 추론에서는 H200이 H100 대비 1.83~2.14배까지 처리량 이득을 보인다는 클라우드 업체 실측 정리 자료도 있다[T2: 다수 GPU 클라우드 업체 실측 정리]. 학습처럼 연산 바운드 워크로드에서는 H200의 이득이 제한적이고, 긴 컨텍스트·대형 배치 추론처럼 메모리 바운드 워크로드에서는 H200의 이득이 뚜렷하다.


3. 전력·냉각·리드타임 — 스펙 밖의 도입 조건

3. 전력·냉각·리드타임 — 스펙 밖의 도입 조건

스펙시트에는 잘 드러나지 않지만 실제 도입 현장에서 병목이 되는 요소가 전력 설계와 공급 일정이다. ServeTheHome이 실측한 Aivres KR6288 HGX H200 8-GPU 서버 기준, 유휴 상태에서도 2kW 이상을 소비하며 최대 부하 시 10kW를 초과한다[T2: ServeTheHome, Aivres KR6288 HGX H200 Server Review]. GPU 8기(700W×8=5.6kW)에 CPU·메모리(1kW 이상), NIC·PCIe 스위치·SSD, 냉각팬 등이 더해져 GPU 소비전력만으로 계산한 값보다 약 15% 추가 전력이 소요된다.

검토 항목 확인된 수치/이슈 출처
8-GPU 서버 최대 전력 10kW 초과 T2: ServeTheHome
유휴 전력 2kW 이상 T2: ServeTheHome
H200 리드타임 시장 보고상 수개월~장기(확인 필요) 국내 GPU 조달 전문 매체 보도(공식 발표 아님)
B200 리드타임 H200 대비 더 길다는 시장 보고(12개월 이상, 2026년 2월 기준, 확인 필요) 시장 분석 보도, 공식 데이터 아님

기존 랙·PDU(전력분배장치) 용량으로 8-GPU급 서버를 감당할 수 있는지 사전에 반드시 확인해야 한다. 또한 H100·H200·B200 모두 NVIDIA가 공식 소매가를 발표하지 않으므로, 시중에 도는 가격대(H100 약 2만5천~4만 달러, H200 약 3만1천 달러 수준으로 인용되는 수치 등)는 모두 리셀러·클라우드 사업자 추정치이며 T1로 확인되지 않은 값이라는 점을 유념해야 한다. 도입 견적은 항상 채널과 시점을 명시해 별도로 확인하는 것이 안전하다.


4. 경쟁·대체 제품과 도입 타이밍

4. 경쟁·대체 제품과 도입 타이밍

H100·H200 도입을 검토할 때는 AMD Instinct MI300X, 그리고 차세대 NVIDIA Blackwell(B200)과의 위치도 함께 판단할 필요가 있다.

AMD Instinct MI300X와의 비교

MI300X는 HBM3 192GB, 대역폭 최대 5.3TB/s, BF16 공칭 1,307 TFLOPS로 공칭 스펙만 보면 메모리·연산 모두 H100/H200보다 우위에 있다(다만 이 수치는 검색 요약 기준으로 확보되었고 AMD 공식 원문 직접 확인은 실패해 재확인이 필요하다). 그러나 SemiAnalysis의 실측 결과 학습 워크로드에서는 H100/H200이 BF16 기준 약 14%, FP8 기준 약 22% 더 빠른 처리량을 기록했다. 이는 하드웨어 스펙보다 ROCm 소프트웨어 스택의 성숙도 차이가 주된 원인으로 지목된다. 메모리 용량이 절대적으로 중요한 초대형 모델 서빙에는 MI300X가 대안이 될 수 있지만, 학습·범용 워크로드 안정성 측면에서는 아직 NVIDIA 진영이 우위라는 평가가 실사용 후기에서도 반복된다.

B200 대기 vs 즉시 도입

B200은 액체냉각이 사실상 표준화되는 세대로, 리드타임이 H200보다 더 길다는 시장 보고가 있다(공식 데이터 아님, 확인 필요). 6개월 내 도입이 시급하다면 H100/H200이 현실적인 선택이고, 3~5년 운용 관점에서 최신 세대 성능을 우선한다면 B200 대기를 검토 대상에 올리는 것이 합리적이다. 이미 H100을 보유한 조직이라면, 워크로드가 메모리 바운드(긴 컨텍스트, 대형 배치 추론)인지 먼저 진단한 뒤 H200 업그레이드 여부를 판단해야 한다. 순수 연산 바운드 워크로드에서는 업그레이드 이득이 크지 않다.


5. 실사용자 보고 이슈와 자주 묻는 질문

5. 실사용자 보고 이슈와 자주 묻는 질문

아래 내용은 검증된 수치가 아니라 실사용자·커뮤니티에서 반복적으로 보고된 관찰이며, 공식 확인 자료가 아니라는 점을 밝혀둔다.

  • 대규모 클러스터 하드웨어 장애: Meta가 16,384개 H100으로 구성한 클러스터에서 Llama 3 학습 중 약 3시간마다 1회 중단이 발생했고, 전체 장애의 절반이 GPU·HBM3 메모리 원인이었다는 보도가 있었다[T3: Tom's Hardware 보도 제목 기준, 재현 정도: 초대형 클러스터 1건 사례]. 다만 이는 1.6만 GPU급 초대형 클러스터 사례로, 일반 기업의 도입 규모(수 대~수십 대)에 그대로 적용하기는 어렵다.
  • NVLink 관련 설정 오류: NVIDIA 개발자 포럼에는 "NVLink error 74" 같은 오류 코드나 파티션 미인식 문제가 다수 보고되어 있으며, 서버 벤더 조합에 따라 NVLink 브리지 인식 문제가 반복적으로 언급된다[T3: NVIDIA Developer Forums, 다수 보고].
  • 전력·냉각 과소평가: 데이터센터 운영자 커뮤니티에서는 8-GPU급 시스템 도입 후 "예상보다 PDU·UPS 증설이 필요했다"는 유형의 불만이 다수 보고된다[T3: 데이터센터 운영자 커뮤니티, 다수 보고].

Q. H200을 도입하면 학습 속도가 자동으로 빨라지나?
연산 성능(TFLOPS)이 H100과 동일하므로, 순수 연산 바운드 학습에서는 속도 개선이 제한적이다. 메모리 대역폭이 병목인 워크로드(긴 시퀀스, 대형 배치)에서만 실질적인 이득이 나타난다.

Q. 스펙시트의 FP8 TFLOPS 수치를 그대로 믿어도 되나?
믿지 않는 것이 안전하다. 해당 수치는 대부분 스파시티 적용 조건이며, 실측 GEMM 처리량은 공칭 대비 70%대 수준에 그친 사례가 보고되어 있다. 반드시 MLPerf 등 3자 벤치마크를 함께 확인해야 한다.

Q. 8-GPU 서버 도입 시 무엇을 가장 먼저 점검해야 하나?
기존 랙의 전력 밀도와 PDU 용량이다. 유휴 상태에서도 2kW 이상, 최대 부하 시 10kW를 넘길 수 있으므로 사전 전력 설계 검토가 스펙 비교보다 우선되어야 한다.


정리

H100과 H200은 연산 성능이 동일하고 메모리 용량·대역폭만 강화된 관계이므로, 도입 판단은 워크로드가 연산 바운드인지 메모리 바운드인지 먼저 진단하는 데서 출발해야 한다. 제조사 공칭 스펙(특히 스파시티 적용 수치)과 실측 벤치마크 사이에는 상당한 괴리가 있으므로 MLPerf 등 3자 벤치마크를 반드시 함께 확인하고, 전력·냉각·리드타임·가격처럼 스펙시트에 드러나지 않는 도입 조건까지 종합적으로 검토하는 것이 바람직하다.


참고 자료

조사 기준일: 2026년 07월 31일

본문의 수치는 아래 자료에서 확인한 것입니다. 제조사 공식 자료(T1)와 전문 매체 실측(T2)을 구분해 표기했습니다. 가격·공급 상황은 변동이 크므로 기준일 이후의 값은 다시 확인해야 합니다.

Tier 1 (제조사 공식)
- NVIDIA H100 공식 제품 페이지 — https://www.nvidia.com/en-us/data-center/h100/ (확인일: 2026-07-31)
- NVIDIA H100 PCIe GPU Product Brief (PB-11133-001) — https://www.nvidia.com/content/dam/en-zz/Solutions/gtcs22/data-center/h100/PB-11133-001_v01.pdf (확인일: 2026-07-31)
- NVIDIA H200 공식 제품 페이지 — https://www.nvidia.com/en-us/data-center/h200/ (확인일: 2026-07-31)
- NVIDIA DGX B200 공식 데이터시트 — https://resources.nvidia.com/en-us-dgx-systems/dgx-b200-datasheet (확인일: 2026-07-31)
- AMD Instinct MI300X 공식 제품 페이지(검색 요약만 확보, 원문 직접 확인 실패) — https://www.amd.com/en/products/accelerators/instinct/mi300/mi300x.html
Tier 2 (전문 매체·벤치마크)
- ServeTheHome, Aivres KR6288 NVIDIA HGX H200 Server Review — https://www.servethehome.com/aivres-kr6288-nvidia-hgx-h200-server-review-intel-xeon/5/ (확인일: 2026-07-31)
- SemiAnalysis, MI300X vs H100 vs H200 Benchmark Part 1: Training — https://newsletter.semianalysis.com/p/mi300x-vs-h100-vs-h200-benchmark-part-1-training (확인일: 2026-07-31)
- MLCommons, MLPerf Inference v4.0 Llama 2 70B 벤치마크 — https://mlcommons.org/2024/03/mlperf-llama2-70b/ (검색 요약 확인, 2026-07-31)
- Tom's Hardware, Faulty Nvidia H100 GPUs and HBM3 memory caused half of failures during Llama 3 training — https://www.tomshardware.com/tech-industry/artificial-intelligence/faulty-nvidia-h100-gpus-and-hbm3-memory-caused-half-of-the-failures-during-llama-3-training-one-failure-every-three-hours-for-metas-16384-gpu-training-cluster (제목 수준만 확인, 2026-07-31)
Tier 3 (커뮤니티/미검증)
- NVIDIA Developer Forums, NVLink 관련 오류 게시글 다수 (예: forums.developer.nvidia.com/t/nvlink-error-74-fatal-error-detected) (확인일: 2026-07-31)
- 국내 GPU 조달 전문 블로그(엑스디노드), 2026년 GPU 수급·리드타임 관련 게시글 — 공식 발표 아님, 시장 추정 (확인일: 2026-07-31)