
로컬 LLM VRAM 개요
로컬에서 대형 언어 모델을 돌리려는 사람이 가장 먼저 검색하는 문장은 대체로 "70B 모델 돌리려면 VRAM 얼마나 필요한가요"입니다. 가장 흔하게 돌아오는 답은 "파라미터 수 곱하기 2"고요. 이 답은 절반만 맞습니다. NVIDIA는 기술 블로그에서 Llama 3 70B을 FP16으로 로드하면 약 140GB, Llama 4 Scout(109B)는 약 218GB가 필요하다고 밝혔습니다. 파라미터 1개당 2바이트라는 산술과 정확히 맞는 수치입니다. 문제는 그다음입니다. 같은 회사가 NIM 문서에서 Llama 3.1 8B Instruct의 FP16 프로파일 최소 요구 사항을 24GB로 적어 두었습니다. 순수 가중치는 16GB인데 8GB가 더 붙었습니다.
이 8GB의 정체가 KV 캐시와 액티베이션, 그리고 런타임 오버헤드입니다. 이 항목은 모델 크기가 아니라 컨텍스트 길이와 동시 사용자 수를 따라 늘어납니다. NVIDIA 자료를 보면 Llama 3 70B을 128k 컨텍스트, 배치 1(사용자 1명)로 돌릴 때 KV 캐시만 약 40GB가 추가로 필요하고, 이 값은 사용자 수에 선형 비례합니다. 70B을 Q4로 양자화하면 가중치가 약 35GB인데, 컨텍스트 하나가 그보다 큰 40GB를 먹는다는 뜻입니다.
이 글은 2026년 8월 12일 기준으로 확인 가능한 제조사 공식 수치와 연구기관 실측 벤치마크를 대조해, 모델 크기별로 실제 필요한 VRAM을 세 항목으로 분해합니다. 직접 장비를 장기간 운용한 기록이 아니라 공개 자료를 교차 검증해 정리한 문서임을 먼저 밝힙니다.
1. 파라미터 수 × 정밀도: 시작점은 맞지만 답은 아닙니다
가중치 메모리는 단순한 곱셈입니다. 파라미터 1개를 몇 바이트로 저장하느냐가 전부입니다.
| 정밀도 | 파라미터당 바이트 | 8B | 32B | 70B | 120B |
|---|---|---|---|---|---|
| FP16 / BF16 | 2.0 | 16GB | 64GB | 140GB | 240GB |
| FP8 | 1.0 | 8GB | 32GB | 70GB | 120GB |
| FP4 / INT4 (Q4) | 0.5 | 4GB | 16GB | 35GB | 60GB |
| Q5_K_M (근사) | 약 0.7 | 5.6GB | 22GB | 49GB | 84GB |
| Q8 | 1.0 | 8GB | 32GB | 70GB | 120GB |
이 표의 신뢰 근거는 두 건의 제조사 발표치입니다. NVIDIA가 공개한 Llama 3 70B FP16 = 140GB(70×2), Llama 4 Scout 109B FP16 = 218GB(109×2)가 산술과 오차 없이 맞아떨어집니다. FP16 2바이트, FP8 1바이트, FP4 0.5바이트라는 규칙 자체는 검증된 것으로 봐도 무방합니다.
여기서 실무자가 놓치는 지점이 두 가지 있습니다.
첫째, 양자화는 모델 등급을 한 단계 올려 주는 지렛대입니다. 24GB 카드 한 장으로 32B FP16(64GB)은 불가능하지만 32B Q4(16GB)는 여유가 생깁니다. 다만 품질 손실이 따릅니다. Q4_K_M 양자화가 FP16 대비 VRAM을 약 절반으로 줄이면서 perplexity 상승은 0.2~0.5 포인트, 벤치마크 품질 저하는 3~5% 수준이라는 정리가 로컬LLM 가이드 매체들에서 반복 인용되지만, 이 수치는 제조사나 전문 연구기관의 정식 벤치마크가 아니라 2차 종합에 가깝습니다. 참고치로만 쓰시고 실제 업무 프롬프트로 A/B 비교하시는 편이 안전합니다.
둘째, MoE 구조는 이 계산이 다르게 적용됩니다. OpenAI 공식 모델 카드 기준 gpt-oss-120b는 총 117B 파라미터에 활성 파라미터가 5.1B이고, MoE 가중치를 MXFP4로 양자화해 80GB GPU 한 장(H100·MI300X)에 적재됩니다. gpt-oss-20b는 총 21B·활성 3.6B로 16GB 안에서 구동됩니다. 총 파라미터로 계산하면 안 들어갈 모델이 실제로는 들어가는 이유입니다. 다만 메모리에 올라가는 것과 속도가 나오는 것은 별개인데, 이 부분은 3번 섹션에서 다루겠습니다.
2. KV 캐시: 컨텍스트 길이가 진짜 VRAM 킬러입니다
가중치 계산까지는 검색하면 어디서나 나옵니다. 견적이 틀어지는 지점은 언제나 KV 캐시입니다.
KV 캐시는 이미 처리한 토큰의 키·값 벡터를 저장해 두는 영역입니다. 토큰이 쌓일수록 커지고, 사용자가 늘면 사용자 수만큼 배로 늘어납니다. NVIDIA가 공개한 기준점 하나를 붙잡고 보시면 감이 잡힙니다.
| 조건 | 가중치 | KV 캐시 | 합계 |
|---|---|---|---|
| Llama 3 70B, FP16, 128k 컨텍스트, 사용자 1명 | 140GB | 약 40GB | 약 180GB |
| Llama 3 70B, Q4, 128k 컨텍스트, 사용자 1명 | 약 35GB | 약 40GB | 약 75GB |
| 위 조건에서 동시 사용자 4명 | 약 35GB | 약 160GB(선형 비례) | 약 195GB |
세 번째 행이 이 글에서 가장 중요한 줄입니다. 양자화로 가중치를 4분의 1로 줄여 봐야, 동시 사용자 4명이 128k 컨텍스트를 쓰는 순간 전체 요구량은 오히려 FP16 단일 사용자보다 커집니다. VRAM 견적에서 모델 크기는 상수이고 컨텍스트와 동시성은 변수입니다.
작은 모델에서도 같은 역전이 관측됩니다. 커뮤니티와 가이드 매체에서 반복 공유되는 사례로, 7B Q4 가중치가 3.5GB 수준인데 32k 컨텍스트의 KV 캐시가 4.5GB 붙어 가중치보다 커진다는 보고가 있습니다. 32k에서 64k로 올리면 캐시가 배로 늘어 모델 등급을 낮추거나 멀티 GPU로 가야 한다는 이야기도 함께 나옵니다. 이 수치들은 2026년 8월 확인 시점 기준 커뮤니티 보고이며 공식 확인 자료가 아닙니다. 다만 위의 NVIDIA 공식 수치(70B·128k에서 40GB)와 방향이 일치한다는 점은 참고할 만합니다.
한 가지 덧붙이면, NVIDIA는 "70B·128k·배치1 = 40GB"라는 결과치만 공개했고 레이어 수·KV 헤드 수·헤드 차원을 넣어 계산하는 공식 계산기는 제공하지 않습니다(확인 필요 — 공식 자료 미확인). 다른 모델의 KV 캐시를 정확히 산출하려면 해당 모델의 config를 직접 확인해야 합니다.
도입 검토 담당자가 견적을 받을 때 반드시 되물어야 할 질문은 "몇 B 모델이냐"가 아니라 "컨텍스트 몇 토큰, 동시 몇 명이냐"입니다. 이 두 값이 빠진 VRAM 견적은 전부 재계산 대상으로 보셔야 합니다.
3. 공칭 VRAM의 100%는 쓸 수 없습니다: 오버헤드와 대역폭
계산이 딱 맞아떨어져도 실패하는 이유가 두 가지 있습니다.
3-1. 런타임 오버헤드
NVIDIA는 자사 기술 블로그에서 GH200(GPU 메모리 96GB)에 Llama 3 70B FP16을 올렸을 때 발생한 OOM 로그를 그대로 공개했습니다. "97.871GB 중 96.746GB 소진"이라는 문구입니다. 공칭 96GB 카드의 실제 가용분이 96.7GB 언저리이고 나머지는 런타임이 가져간다는 뜻입니다. 앞서 언급한 8B FP16 = 24GB 요구 사항도 같은 맥락입니다. 순수 가중치 16GB에 8GB가 얹혀 있습니다.
실무 공식은 이렇게 정리됩니다.
필요 VRAM = 가중치 + KV 캐시(컨텍스트 × 동시 사용자) + 런타임 오버헤드 + 공칭 용량의 5~10% 여유
96GB 카드에 96GB 모델은 들어가지 않습니다. 제조사가 자사 OOM 로그로 이 사실을 공개해 둔 셈입니다.
3-2. 대역폭이 속도를 결정합니다
용량이 맞아도 대역폭이 안 맞으면 "돌아가긴 하는데 못 씁니다". LMSYS Org가 공개한 DGX Spark 리뷰 실측이 이를 명확히 보여 줍니다.
| 기기 | 메모리 | 대역폭 | gpt-oss-20b prefill | gpt-oss-20b decode |
|---|---|---|---|---|
| DGX Spark(GB10) | 128GB LPDDR5X | 273GB/s | 2,053 tok/s | 49.7 tok/s |
| RTX PRO 6000 Blackwell | 96GB GDDR7 | 1,792GB/s | 10,108 tok/s | 215 tok/s |
| GeForce RTX 5090 | 32GB GDDR7 | 1,792GB/s | 8,519 tok/s | 205 tok/s |
decode 속도가 4배 이상 갈립니다. LMSYS는 DGX Spark의 273GB/s 대역폭이 "경험적으로 확인된 핵심 병목"이라고 밝혔습니다. 같은 리뷰에서 Llama 3.1 70B(FP8, SGLang)의 decode는 2.7 tok/s로 측정됐습니다. 128GB에 올라가긴 하지만 대화형으로 쓸 속도는 아닙니다.
NVIDIA는 DGX Spark를 두고 추론 기준 최대 200B 파라미터, 파인튜닝 기준 최대 70B 모델을 지원한다고 공식 표기합니다. 이 표기와 위 실측은 모순이 아닙니다. 적재 가능과 실용 속도는 다른 이야기라는 것뿐입니다.
참고로 ServeTheHome은 같은 DGX Spark에서 gpt-oss-120b 기준 약 14.5 tok/s를 측정하고 "스펙 대비 저조하다"고 평가했습니다. 전문 매체 간에도 수치가 갈리므로, 모델과 런타임(Ollama·SGLang·llama.cpp)에 따라 10~50 tok/s 범위로 이해하시는 편이 현실적입니다.
4. VRAM 용량별 하드웨어 선택 기준
2026년 8월 기준 제조사 공식 스펙으로 정리한 표입니다.
| 제품 | 메모리 | 대역폭 | 전력 | 특징 |
|---|---|---|---|---|
| GeForce RTX 5090 | 32GB GDDR7 | 1,792GB/s(주1) | TGP 575W | 512비트, CUDA 21,760, 3,352 AI TOPS |
| RTX PRO 5000 Blackwell | 48GB 또는 72GB GDDR7+ECC | 1,344GB/s | 300W | 듀얼 슬롯 10.5인치 |
| RTX PRO 6000 Blackwell WS | 96GB GDDR7+ECC | 1,792GB/s | 600W | MIG 4분할, 4,000 AI TOPS(FP4·희소성 이론치) |
| DGX Spark(GB10) | 128GB LPDDR5X 통합 | 273GB/s | 외부 전원 240W | Arm 20코어, FP4 최대 1 PFLOP |
| H200 NVL | 141GB HBM3e | 4.8TB/s | 데이터센터급 | 4-way NVLink 시 합산 564GB / 1.8TB/s |
(주1) RTX 5090의 1,792GB/s는 GeForce 뉴스룸 서술에 등장하며 제품 페이지 스펙표에는 수치가 명시돼 있지 않습니다(확인 필요 — 데이터시트 재확인 요망).
어느 구간에서 무엇을 고르는가
32GB(RTX 5090) — 30B 이하 모델을 최대 속도로 돌리는 구간입니다. 70B FP16(140GB)은 불가능하고, 70B Q4(약 35GB)도 이미 초과입니다. KV 캐시까지 얹으면 확실히 넘어갑니다. 반대로 대역폭은 RTX PRO 6000과 동일하므로, 32GB 안에 들어가는 모델이라면 속도 손해는 거의 없습니다.
72GB(RTX PRO 5000) — 32B~70B급을 FP8·Q8로 카드 한 장에 담아야 하고 전력·발열·슬롯 제약이 있는 워크스테이션에 적합합니다. 300W라는 점이 결정적입니다. 96GB가 필요하지 않다면 300W 카드 두 장(144GB)이 600W 카드 한 장(96GB)보다 총 VRAM에서 유리해지는 구간이 생깁니다.
96GB(RTX PRO 6000) — gpt-oss-120b(80GB급)를 카드 한 장에 올릴 수 있는 구간입니다. ECC와 MIG 4분할이 필요한 업무 환경이라면 여기가 답입니다. RTX 5090과 대역폭이 같으므로 실측 성능차는 종합 10~15% 수준으로 보고됩니다. 이 조합에서 추가 비용의 대가는 속도가 아니라 용량 3배입니다.
128GB(DGX Spark) — 용량은 가장 크지만 대역폭은 RTX PRO 6000의 약 15% 수준입니다. 대형 모델을 일단 올려 프로토타이핑하거나 최대 70B까지 파인튜닝하는 개발자 데스크로는 유효하고, 다수 사용자 실시간 서빙에는 부적합합니다. Founders Edition MSRP는 2026년 2월 넷째 주부터 $3,999에서 $4,699로 인상됐으며, NVIDIA는 사유를 "업계 전반의 메모리 공급 제약"으로 밝히고 하드웨어·구성 변경은 없다고 못 박았습니다(2026년 2월 23일 공지, 정가 기준·국내 유통가 별도).
141GB 이상(H200 NVL) — 405B FP8 같은 초대형 모델이나 동시 접속 수십~수백 명 서빙 구간입니다. NIM 문서 기준 Llama 3.1 405B Instruct는 H100 SXM(80GB) 8장에 FP8, FP16은 16장이 필요합니다.
각 제품의 NVIDIA 공식 MSRP는 제품 페이지에 게재돼 있지 않습니다(확인 필요). 유통가는 시점과 채널에 따라 변동 폭이 크므로, 견적 시 확인 날짜를 함께 기록해 두시길 권합니다.
5. 자주 겪는 실패 패턴과 FAQ
실사용자들이 커뮤니티에 반복해서 올리는 문제 유형을 정리했습니다. 아래 항목들은 2026년 8월 확인 시점 기준 커뮤니티 보고이며 공식 확인 자료가 아닙니다.
Q. 모델은 로드됐는데 갑자기 느려집니다.
VRAM을 넘기는 순간 일부 레이어가 시스템 RAM으로 넘어가면서 성능이 절벽처럼 떨어진다는 보고가 가장 흔합니다. Ollama나 llama.cpp에서 30~100 tok/s대에서 2~10 tok/s대로 급락한다는 이야기입니다. 원인은 대개 컨텍스트를 늘렸거나 동시 요청이 겹친 경우입니다. 2번 섹션의 KV 캐시 계산을 다시 해 보셔야 합니다.
Q. 처음부터 너무 느립니다.
"GPU가 안 잡혀서 CPU로 돌고 있었다"가 로컬LLM 최다 문의 유형이라는 보고가 있습니다. 드라이버나 CUDA 미설치가 원인인 경우가 많습니다. 로 GPU 사용률이 실제로 올라가는지부터 확인하시는 편이 빠릅니다.
Q. 예산을 줄이면서 70B을 돌릴 방법이 있습니까.
중고 RTX 3090 두 장(합계 48GB)으로 70B을 Q4 대신 Q5~Q6로 돌린다는 구성이 반복 언급됩니다. 다만 가격은 중고 시세이고 정가 기준이 아니며, 멀티 GPU 구성은 전력·슬롯·PCIe 레인 제약을 함께 계산해야 합니다.
Q. 배치를 키우면 처리량이 오르나요.
오릅니다. LMSYS 실측에서 DGX Spark의 Llama 3.1 8B(FP8)는 배치 1에서 20.5 tok/s, 배치 32에서 368 tok/s로 총 처리량이 약 18배 올랐습니다. 다만 배치 증가분만큼 KV 캐시 VRAM이 추가로 필요합니다. 공짜가 아닙니다.
Q. 멀티노드로 묶으면 되지 않나요.
DGX Spark 2노드로 Qwen3-235B(Q4_K_XL, 134GB)를 노드당 약 63~64.5GB로 분산해 단일 노드 약 1.8 tok/s에서 2노드 약 12.5 tok/s로 올렸다는 사용자 리포트가 NVIDIA 개발자 포럼에 올라와 있습니다. 다만 같은 글에서 GB10/SM121용 네이티브 멀티노드 추론 스택이 아직 준비되지 않아 vLLM+Ray가 실패했고 llama.cpp RPC로 우회했다고 밝혔습니다. 공식 벤치마크가 아닌 개인 보고이며, 2026년 8월 기준으로 검증되지 않았습니다.
정리
로컬 LLM의 VRAM 요구량은 "파라미터 수 × 정밀도 바이트"로 시작하지만 거기서 끝나지 않습니다. NVIDIA 공식 수치로 확인되는 것만 봐도 8B FP16이 가중치 16GB에 오버헤드 8GB를 더해 24GB를 요구하고, 70B을 128k 컨텍스트로 돌리면 사용자 1명당 KV 캐시 40GB가 별도로 붙습니다. 이 값은 동시 사용자 수에 선형 비례합니다.
실무 사이징 공식은 가중치 + KV 캐시 + 런타임 오버헤드 + 공칭 용량의 5~10% 여유이며, 견적의 핵심 입력값은 모델 크기가 아니라 컨텍스트 길이와 동시 사용자 수입니다. 마지막으로 용량과 대역폭은 분리해서 봐야 합니다. VRAM 용량은 무엇을 올릴 수 있는지를, 대역폭은 얼마나 빠른지를 결정합니다. DGX Spark가 128GB로 70B을 적재하고도 decode 2.7 tok/s를 기록한 실측이 그 차이를 가장 선명하게 보여 줍니다. 이 둘을 함께 설명하지 않는 자료는 한 번 더 검증하시길 권합니다.
참고 자료
조사 기준일: 2026년 08월 09일
본문의 수치는 아래 자료에서 확인한 것입니다. 제조사 공식 자료(T1)와 전문 매체 실측(T2)을 구분해 표기했습니다. 가격·공급 상황은 변동이 크므로 기준일 이후의 값은 다시 확인해야 합니다.
Tier 1 (제조사 공식) — 전 항목 확인일 2026-08-09
- NVIDIA DGX Spark User Guide, Hardware Overview — https://docs.nvidia.com/dgx/dgx-spark/hardware.html (WebFetch 확인)
- NVIDIA DGX Spark 제품 페이지 — https://www.nvidia.com/en-us/products/workstations/dgx-spark/
- NVIDIA Newsroom, "NVIDIA DGX Spark Arrives for World's AI Developers" — https://nvidianews.nvidia.com/news/nvidia-dgx-spark-arrives-for-worlds-ai-developers
- NVIDIA 공식 공지, "2/23/2026 Price Change Announcement" — https://forums.developer.nvidia.com/t/2-23-2026-price-change-announcement/361713 (WebFetch 확인)
- NVIDIA RTX PRO 6000 Blackwell Workstation Edition — https://www.nvidia.com/en-us/products/workstations/professional-desktop-gpus/rtx-pro-6000/ (WebFetch 확인)
- NVIDIA RTX PRO 6000 Blackwell Series (3종 비교) — https://www.nvidia.com/en-us/products/workstations/professional-desktop-gpus/rtx-pro-6000-family/ (WebFetch 확인)
- NVIDIA RTX PRO 5000 Blackwell — https://www.nvidia.com/en-us/products/workstations/professional-desktop-gpus/rtx-pro-5000/ (WebFetch 확인)
- NVIDIA Blog, "Now Generally Available, NVIDIA RTX PRO 5000 72GB Blackwell GPU" — https://blogs.nvidia.com/blog/rtx-pro-5000-72gb-blackwell-gpu/ (WebFetch 확인)
- NVIDIA GeForce RTX 5090 — https://www.nvidia.com/en-us/geforce/graphics-cards/50-series/rtx-5090/ (WebFetch 확인)
- NVIDIA H200 Tensor Core GPU — https://www.nvidia.com/en-us/data-center/h200/
- NVIDIA NIM for LLMs 1.15.0, Supported Models — https://docs.nvidia.com/nim/large-language-models/1.15.0/supported-models.html (WebFetch 확인)
- NVIDIA Technical Blog, "Accelerate Large-Scale LLM Inference and KV Cache Offload with CPU-GPU Memory Sharing" — https://developer.nvidia.com/blog/accelerate-large-scale-llm-inference-and-kv-cache-offload-with-cpu-gpu-memory-sharing/ (WebFetch 확인)
- OpenAI 공식 모델 카드, openai/gpt-oss-120b — https://huggingface.co/openai/gpt-oss-120b (WebFetch 확인)
- OpenAI, "Introducing gpt-oss" — https://openai.com/index/introducing-gpt-oss/ (403으로 본문 미확인 — 내용은 HF 공식 모델 카드로 대체 확인)
Tier 2 (전문 매체·연구기관 실측) — 확인일 2026-08-09
- LMSYS Org, "NVIDIA DGX Spark In-Depth Review: A New Standard for Local AI Inference" — https://www.lmsys.org/blog/2025-10-13-nvidia-dgx-spark/ (WebFetch 확인)
- ServeTheHome, "NVIDIA DGX Spark Review — The GB10 Machine is so Freaking Cool" (p.2) — https://www.servethehome.com/nvidia-dgx-spark-review-the-gb10-machine-is-so-freaking-cool/2/ (WebFetch 확인)
- ServeTheHome, "NVIDIA RTX Pro 6000 Blackwell Family for Workstations and Servers" — https://www.servethehome.com/nvidia-rtx-pro-6000-blackwell-family-for-workstations-and-servers/ (WebFetch 확인)
- Tom's Hardware, "RTX Pro 6000 Blackwell tested, performs roughly 10-15% faster than a stock RTX 5090" — https://www.tomshardware.com/pc-components/gpus/rtx-pro-6000-blackwell-tested-performs-roughly-10-15-percent-faster-than-a-stock-rtx-5090 (본문 페이월로 WebFetch 실패 — 검색 결과 요약분만 반영, 재확인 필요)
- TechPowerUp, "NVIDIA RTX PRO 6000 Blackwell Underperforms with Pre-Release Drivers" — https://www.techpowerup.com/336267/
Tier 3 (커뮤니티 — 수치 근거 아님) — 확인일 2026-08-09
- NVIDIA Developer Forums, "DGX Spark Multi-Node LLM Inference Report for Qwen3-235B model" — https://forums.developer.nvidia.com/t/dgx-spark-multi-node-llm-inference-report-for-qwen3-235b-model/355126 (WebFetch 확인)
- NVIDIA Developer Forums, "AirLLM and the Theoretical Scale of DGX Spark" — https://forums.developer.nvidia.com/t/airllm-and-the-theoretical-scale-of-dgx-spark/377428 (WebFetch 확인)
- NVIDIA Developer Forums, "DGX Spark price increase" / "nVIDIA not honouring DGX Spark reserve price?" — https://forums.developer.nvidia.com/t/dgx-spark-price-increase/361640
- ServeTheHome DGX Spark 리뷰 댓글란 (M2 Max·Strix Halo 반례 보고)
- 로컬LLM 가이드 매체 종합(llmhardware.io, localllm.in, vrlatech.com 등) — 커뮤니티 관찰 전언 성격이며 T1/T2 검증 미완
※ r/LocalLLaMA 원문은 크롤러 접근 제한으로 직접 확인 불가. 위 Tier 3 항목 중 커뮤니티 전언은 2차 인용이므로 다음 리서치에서 원문 재확인 필요.