2026/08/11 2

로컬 LLM 모델 크기별 VRAM 계산법 총정리 (8B~120B 실측 기준)

로컬 LLM VRAM 개요로컬에서 대형 언어 모델을 돌리려는 사람이 가장 먼저 검색하는 문장은 대체로 "70B 모델 돌리려면 VRAM 얼마나 필요한가요"입니다. 가장 흔하게 돌아오는 답은 "파라미터 수 곱하기 2"고요. 이 답은 절반만 맞습니다. NVIDIA는 기술 블로그에서 Llama 3 70B을 FP16으로 로드하면 약 140GB, Llama 4 Scout(109B)는 약 218GB가 필요하다고 밝혔습니다. 파라미터 1개당 2바이트라는 산술과 정확히 맞는 수치입니다. 문제는 그다음입니다. 같은 회사가 NIM 문서에서 Llama 3.1 8B Instruct의 FP16 프로파일 최소 요구 사항을 24GB로 적어 두었습니다. 순수 가중치는 16GB인데 8GB가 더 붙었습니다.이 8GB의 정체가 KV 캐시와..

카테고리 없음 2026.08.11

B200 GB200 NVL72 도입 검토 기준 총정리 – 전력·TCO·FP4 판단법

B200 GB200 핵심만 먼저 정리하면B200과 GB200 중 무엇을 살지는 성능표가 아니라 건물이 먼저 결정합니다. HGX B200 계열의 8-GPU 노드는 DGX B200 기준 10RU에 시스템 최대 소비전력이 약 14.3kW이고 공랭 옵션도 있습니다. 반면 GB200 NVL72는 랙 1대가 약 120kW를 쓰며 액체냉각을 전제로 설계된 랙스케일 제품입니다(NVIDIA 공식 문서 기준, 2026년 8월 10일 확인). 기존 전산실이 랙당 120kW 급전과 직접칩냉각(DCLC) 배관을 받아줄 수 없다면 GB200 NVL72는 견적을 받아볼 필요조차 없이 후보에서 빠집니다.두 번째 관문은 비용 배수입니다. NVIDIA는 GB200 NVL72가 H100 대비 LLM 학습 4배, 추론 30배, 에너지 효율..

카테고리 없음 2026.08.11