로컬 LLM VRAM 개요로컬에서 대형 언어 모델을 돌리려는 사람이 가장 먼저 검색하는 문장은 대체로 "70B 모델 돌리려면 VRAM 얼마나 필요한가요"입니다. 가장 흔하게 돌아오는 답은 "파라미터 수 곱하기 2"고요. 이 답은 절반만 맞습니다. NVIDIA는 기술 블로그에서 Llama 3 70B을 FP16으로 로드하면 약 140GB, Llama 4 Scout(109B)는 약 218GB가 필요하다고 밝혔습니다. 파라미터 1개당 2바이트라는 산술과 정확히 맞는 수치입니다. 문제는 그다음입니다. 같은 회사가 NIM 문서에서 Llama 3.1 8B Instruct의 FP16 프로파일 최소 요구 사항을 24GB로 적어 두었습니다. 순수 가중치는 16GB인데 8GB가 더 붙었습니다.이 8GB의 정체가 KV 캐시와..