로컬 LLM

로컬 LLM GPU 선택 기준 2026 총정리 (RTX 5090·DGX Spark)

mdit 2026. 8. 17. 01:36

로컬 LLM용 그래픽카드를 고를 때 VRAM 용량, 메모리 대역폭, 양자화 포맷 지원 중 무엇을 먼저 봐야 하는지 2026년 8월 기준 공식 사양과 독립 측정치로 정리했습니다. RTX 5090·RTX PRO 6000·DGX Spark·Mac Studio 실측 비교 포함.

로컬 LLM GPU 핵심만 먼저 정리하면

로컬 LLM용 그래픽카드 선택은 "VRAM 용량 → 메모리 대역폭 → 양자화 포맷 지원"이라는 3단 관문으로 정리됩니다. 첫 관문인 용량은 모델이 메모리에 통째로 올라가느냐를 결정합니다. 여기서 탈락하면 속도가 수십 배 떨어지니 다른 사양은 볼 필요도 없습니다. 두 번째 관문인 대역폭은 초당 몇 글자가 나오는지를 좌우하는데, 통합 메모리 제품이 여기서 크게 밀립니다. LMSYS 독립 측정에서 DGX Spark는 gpt-oss-20b 배치 1 조건에서 초당 49.7토큰, 같은 조건의 RTX PRO 6000은 215토큰으로 약 4배 차이가 났고 병목은 273GB/s 통합 메모리 대역폭으로 지목됐습니다(2025-10-13 측정 기준). 세 번째 관문은 가장 많이 간과되는데, VRAM이 넉넉해도 쓰려던 양자화 파일이 안 올라가는 경우가 실제로 보고됐습니다. 여기에 2026년 특유의 변수가 하나 더 붙습니다. 지금 가격을 움직이는 건 GPU 성능 경쟁이 아니라 메모리 수급이며, 국내 RTX 50 시리즈는 2026년 8월부터 최대 30% 인상됐습니다(ZDNet Korea 2026-08-03 보도 기준). 3개월 전 가격표로 만든 가성비 계산은 지금 대부분 깨져 있다고 보는 편이 안전합니다.


Q1. VRAM 용량과 메모리 대역폭 중 무엇을 먼저 봐야 하나요?

Q1. VRAM 용량과 메모리 대역폭 중 무엇을 먼저 봐야 하나요?

순서가 정해져 있습니다. 용량이 먼저고, 대역폭은 그다음입니다. 용량은 통과·탈락을 가르는 이진 조건이고, 대역폭은 통과한 뒤의 속도를 정하는 연속 조건입니다. 모델 가중치가 VRAM에 다 안 들어가면 시스템 메모리나 SSD로 넘어가면서 체감 속도가 무너집니다. 반대로 일단 들어가기만 하면 한두 세대 지난 카드도 실용 범위에 들어옵니다.

용량 눈금은 모델 쪽 요구사항에서 역산하는 게 정확합니다. gpt-oss-120b는 117B 파라미터에 활성 5.1B인 MoE 구조로, MXFP4 양자화를 적용해 80GB GPU 한 장에 올라가도록 설계됐다고 공식 모델 카드에 명시돼 있습니다. gpt-oss-20b는 21B/활성 3.6B로 저지연·로컬 용도로 규정돼 있습니다. 이걸 기준선으로 잡으면 아래 표가 나옵니다.

VRAM 용량 4비트 기준 실용 모델 급 대표 제품 비고
16GB 20B급 RTX 5060 Ti 등 컨텍스트 길게 잡으면 빠듯
24~32GB 30B급 RTX 5090(32GB), Radeon AI PRO R9700(32GB) 대화형 보조에 적합
72~96GB 120B급 단일 카드 RTX PRO 5000(72GB), RTX PRO 6000(96GB) 80GB 기준선 충족
128GB 120B급 이상 적재 DGX Spark, Ryzen AI Max+ 395, Mac 계열 적재는 되나 속도는 별개

대역폭은 같은 용량 안에서 체감을 가릅니다. RTX PRO 6000은 1,792GB/s, DGX Spark는 273GB/s약 6.6배 차이가 나고, 이 값이 그대로 단일 사용자 응답 속도 차이로 이어집니다. Mac Studio M3 Ultra의 819GB/s는 통합 메모리 진영에서 예외적으로 높은 편이나, 이번 조사에서 M3 Ultra의 독립 LLM 실측치는 확보하지 못했습니다.


Q2. DGX Spark 같은 128GB 통합 메모리 박스, 그래픽카드 대신 살 만한가요?

Q2. DGX Spark 같은 128GB 통합 메모리 박스, 그래픽카드 대신 살 만한가요?

"큰 모델을 올릴 수 있느냐"와 "빠르게 답이 나오느냐"는 완전히 다른 축이고, 이 제품군은 전자에만 강합니다. 마케팅 문구의 1페타플롭은 FP4 텐서 연산 이론 피크값이지 실사용 처리량이 아닙니다.

LMSYS의 독립 리뷰(2025-10-13 측정 기준) 수치를 보면 성격이 뚜렷합니다.

조건 DGX Spark RTX 5090 RTX PRO 6000
gpt-oss-20b(MXFP4) 배치 1 프리필 2,053 tok/s 8,519 tok/s 10,108 tok/s
동일 조건 디코딩 49.7 tok/s 205 tok/s 215 tok/s
메모리 대역폭 273GB/s 512-bit GDDR7 1,792GB/s

같은 리뷰에서 Llama 3.1 8B는 배치 1의 20.5 tok/s에서 배치 32의 368 tok/s로 확장됐습니다. 이게 핵심 단서입니다. 동시 요청을 몰아서 처리하는 배치 작업에서는 총 처리량이 올라가지만, 사용자 한 명이 기다리는 체감 속도는 개선되지 않습니다. 그래서 IDE 코딩 보조나 실시간 대화에는 부적합, 야간 일괄 처리·문서 대량 요약에는 합리적이라는 결론이 나옵니다.

가격도 짚어야 합니다. DGX Spark 정가는 3,999달러에서 4,699달러로 인상됐고, NVIDIA 공식 공지(2026-02-25 게시)는 사유를 산업 전반의 메모리 공급 제약으로 적으면서 하드웨어나 구성 변경은 없다고 명시했습니다. 성능 개선 없이 17.5% 오른 셈입니다.

⚠️ 위 측정치는 2025년 10월 시점의 소프트웨어 스택 기준입니다. NVIDIA는 2026-01-05 개발자 블로그에서 llama.cpp MoE 모델 평균 35% 향상을 공지했으므로 현재 격차는 다를 수 있습니다. 동급 조건의 2026년 독립 재측정은 이번 조사에서 찾지 못했습니다.


Q3. VRAM만 크면 되는 줄 알았는데, 양자화 포맷 지원이 왜 문제가 되나요?

Q3. VRAM만 크면 되는 줄 알았는데, 양자화 포맷 지원이 왜 문제가 되나요?

용량 충족은 필요조건일 뿐 충분조건이 아닙니다. 실제로 192GB VRAM 구성에서 대부분의 양자화 포맷이 실행에 실패한 사례가 공개돼 있습니다.

StorageReview는 2025-12-01 리뷰에서 Maxsun Arc Pro B60 Dual 48GB 4장(GPU 8개, 총 192GB VRAM)을 EPYC 9374F 서버에 얹고 Intel LLM Scaler 개발 브랜치와 vLLM으로 측정했습니다. 처리량 자체는 나쁘지 않았습니다. GPT-OSS 20B가 GPU 4개·배치 16에서 626.84 tok/s, Mistral 24B가 GPU 8개·배치 256에서 574.16 tok/s를 기록했습니다. 문제는 다른 데 있었습니다. MXFP4로 학습된 gpt-oss 계열만 동작했고 INT4·FP8·AWQ는 전부 실패했습니다. 리뷰어는 초기 드라이버 단계이며 결과가 예비적이라고 단서를 달았습니다.

이 사례가 주는 실무 교훈은 명확합니다. 커뮤니티에서 받아 쓰는 GGUF·AWQ 체크포인트를 자유롭게 돌릴 계획이라면, VRAM 숫자보다 소프트웨어 스택 호환성을 먼저 확인해야 합니다. 확인 순서는 이렇습니다.

  1. AMD를 고려한다면 ROCm 공식 지원 목록에 해당 카드가 있는지 확인합니다. 현행 프로덕션 버전은 ROCm 7.14.0이며 RX 9070 XT, RX 7900 XTX, Radeon AI PRO R9700·R9600D 등이 포함돼 있습니다. 단, 이 문서는 Linux 전용이며 Windows 정보를 담고 있지 않습니다.
  2. 목록 밖이라면 Ollama의 Vulkan 백엔드가 사실상의 폴백입니다. 공식 문서상 Vulkan은 기본 활성화 상태이고, Windows는 대개 무설정, Linux는 별도 구성 요소 설치가 필요합니다.
  3. NVIDIA는 컴퓨트 능력 5.0 이상 + 드라이버 550 이상이 기준선이며, CC 5.0~6.2 구형 카드는 드라이버 570 이상이 필요합니다.

한 가지 더 있습니다. Ollama 문서는 스케줄러가 GPU 라이브러리가 보고하는 VRAM 값을 근거로 배치를 결정한다고 밝히고 있습니다. 드라이버가 VRAM을 제대로 보고하지 못하는 환경에서는 모델 크기 근사치에 의존한 추정 스케줄링이 일어난다는 뜻입니다.

Intel Arc Pro B60의 2026년 정식 릴리스에서 INT4·AWQ 문제가 해결됐는지는 이번 조사에서 확인하지 못했습니다. 구매 전 최신 릴리스 노트를 직접 확인하시기 바랍니다.


Q4. 지금 사는 게 나을까요, 다음 세대를 기다리는 게 나을까요?

Q4. 지금 사는 게 나을까요, 다음 세대를 기다리는 게 나을까요?

"기다리면 싸진다"는 전제 자체가 2026년에는 근거가 약합니다. 확인된 사실들이 대부분 반대 방향을 가리킵니다.

항목 변동 내용 기준 시점
DGX Spark 정가 $3,999 → $4,699 (+17.5%) 2026-02-25 공지, 전 지역 적용
국내 RTX 50 시리즈 최대 30% 인상 2026-08-03 보도
RTX 5090 국내 실판매가 730만원대 동일
RTX 5070(12GB) 약 20만원 인상 → 110만원대 동일
AMD 파트너 공급가 GPU 다이+VRAM 키트 최소 10% 인상 2026-07-31 통보, 8월 적용

국내 인상 근거로는 TSMC 선단 공정 웨이퍼 가격 인상과 GDDR7 개당 20달러 초반대 상승이 지목됐으며, 취재원은 국내 복수 수입사·유통사 관계자입니다. AMD 인상 대상은 완제 그래픽카드가 아니라 파트너 공급용 키트이므로 기존 재고는 당분간 이전 가격이 유지될 수 있다는 단서가 붙었습니다.

MSRP 기준 계산도 지금은 성립하지 않습니다. 2026-08-17 확인 시점 기준, NVIDIA RTX 5090 공식 제품 페이지의 가격·출시일란은 플레이스홀더 상태로 비어 있습니다. 사양은 32GB GDDR7, 512-bit, CUDA 코어 21,760개, TGP 575W로 정상 표기돼 있으나 가격만 빠져 있습니다. NVIDIA가 MSRP를 공식 조정한 것인지 표시만 비운 것인지는 확인되지 않았습니다.

대기 전략의 근거로 자주 거론되는 24GB RTX 5080 Super 등 RTX 50 SUPER 시리즈GDDR7 수급 문제로 무기한 연기 또는 취소됐다는 보도가 다수 있으나 NVIDIA 공식 발표는 확인되지 않았습니다(확인 필요 — 미확인 사항). 미확인 정보를 조달 계획의 전제로 삼는 것은 권하기 어렵습니다.

확정된 신제품은 하나입니다. NVIDIA는 2026-05-31 Computex에서 RTX Spark를 발표했고, 128GB 통합 메모리·20코어 Grace CPU·6,144 CUDA 코어에 ASUS·Dell·HP·Lenovo·MSI 등이 파트너로 참여합니다. 다만 출시 시점이 "올가을"이라 2026-08-17 기준으로는 구매할 수 없습니다. 같은 발표에서 제시된 llama.cpp 2배·vLLM 2.6배 성능 향상 수치는 측정 모델·배치·양자화 조건이 명시돼 있지 않습니다.


Q5. 예산과 용도별로 정리하면 어떤 선택지가 남나요?

용도를 먼저 확정하고 제품을 고르는 순서가 낭비를 줄입니다. 네 갈래로 나뉩니다.

첫째, 대화형 속도가 최우선인 경우(코딩 보조·실시간 채팅). 32GB급 단일 dGPU가 답입니다. RTX 5090은 32GB GDDR7·575W로 배치 1 디코딩 205 tok/s를 냈지만 국내 730만원대(2026-08-03 기준)라는 벽이 있습니다. 대안으로 Radeon AI PRO R9700(32GB, 300W, 정가 $1,299)R9600D(32GB, 640GB/s, TBP 150W 싱글 슬롯 패시브)가 있고 둘 다 ROCm 7.14 공식 지원 목록에 포함돼 있습니다. AMD 사양·가격 정보는 amd.com 접근 차단으로 원문 대조를 하지 못해 2차 출처 기준입니다. 특히 R9600D의 150W 싱글 슬롯 구성은 슬롯·전력이 빡빡한 케이스에 다중 장착할 때 사실상 유일한 선택지입니다.

둘째, 120B급을 단일 카드에 올려야 하는 소규모 사내 서버. RTX PRO 6000 Blackwell 96GB GDDR7 ECC가 이번 조사에서 확인된 단일 기기 최고 디코딩 성능(215 tok/s)입니다. 1,792GB/s 대역폭, 600W, 듀얼 슬롯 구성입니다. RTX PRO 5000 72GB는 2025-12-18 정식 출시됐고 2,142 TOPS를 표방하나 NVIDIA가 가격을 공개하지 않았습니다. 리셀러 기준 1만 달러 안팎 언급은 있으나 원문 대조를 하지 못했습니다.

셋째, 용량 우선·속도 타협. DGX Spark(128GB, 273GB/s, $4,699), Ryzen AI Max+ 395 계열(128GB, 이론 256GB/s), Mac Studio M3 Ultra(96GB부터, 819GB/s)가 후보입니다. Ryzen AI Max+ 계열은 실효 대역폭이 180GB/s 수준이라는 사용자 보고가 반복 관찰되는데, 이는 공식 확인 자료가 아니며 수치 근거로 쓸 수 없습니다. 반대로 ROCm이 추론용으로 쓸 만해졌다는 평가도 함께 관찰됩니다. 맥 진영은 MacBook Pro M5 Pro·M5 Max가 최대 128GB 구성을 지원하며 대역폭은 M5 Max 40코어 기준 614GB/s입니다. 2026-08-17 기준 Apple 공식 Mac Studio 구성은 M4 Max와 M3 Ultra 두 종이며, M5 Mac Studio 관련 보도는 전부 미확인 루머입니다.

넷째, 절대 피해야 할 판단.1인칭 사용 후기에 나오는 중고 다중 GPU 시세를 예산 근거로 삼는 것 — 중고 RTX 3090 4장 구성이 5090 2장보다 유리하다는 계산이 커뮤니티에 반복 등장하고 $600~800대가 거론되나, 지역·시점 편차가 크고 공식 확인 자료가 없습니다.RTX 3090의 NVLink로 VRAM을 통합해 대형 모델을 돌린다는 주장이를 뒷받침하는 공식 문서를 찾지 못했고(확인 필요 — 미확인 사항), llama.cpp·vLLM의 다중 GPU 처리는 메모리 통합이 아니라 텐서·레이어 분할입니다.


정리

로컬 LLM용 GPU는 VRAM 용량으로 후보를 거르고, 메모리 대역폭으로 체감 속도를 예측하며, 양자화 포맷 지원으로 최종 검증하는 순서로 고르면 실패 확률이 가장 낮습니다. 대화형 용도라면 32GB급 dGPU, 120B급 단일 카드 운용이라면 72~96GB 프로 카드, 배치 처리 위주라면 128GB 통합 메모리 박스가 각각의 자리에 맞습니다. 2026년 8월 현재 가격을 움직이는 변수는 성능이 아니라 메모리 수급이며, DGX Spark 17.5% 인상과 국내 RTX 50 최대 30% 인상이 모두 같은 원인을 지목하고 있습니다. RTX 50 SUPER 24GB 라인업 등 미확인 정보를 대기 전략의 근거로 삼지 말고, 확정된 사양과 실측 수치만으로 판단하시기 바랍니다.


함께 보면 좋은 글


참고 자료

조사 기준일: 2026년 08월 17일

본문의 수치는 아래 자료에서 확인한 것입니다. 제조사 공식 자료(T1)와 전문 매체 실측(T2)을 구분해 표기했습니다. 가격·공급 상황은 변동이 크므로 기준일 이후의 값은 다시 확인해야 합니다.

Tier 1 — 원문 WebFetch 대조 완료 (전부 2026-08-17 확인)
- NVIDIA DGX Spark 제품 페이지 — https://www.nvidia.com/en-us/products/workstations/dgx-spark/
- NVIDIA Developer Forums, "2/23/2026 Price Change Announcement" (2026-02-25 게시) — https://forums.developer.nvidia.com/t/2-23-2026-price-change-announcement/361713
- NVIDIA GeForce RTX 5090 제품 페이지 — https://www.nvidia.com/en-us/geforce/graphics-cards/50-series/rtx-5090/
- NVIDIA RTX PRO 6000 Blackwell Workstation Edition — https://www.nvidia.com/en-us/products/workstations/professional-desktop-gpus/rtx-pro-6000/
- NVIDIA Blog, RTX PRO 5000 72GB Blackwell GA (2025-12-18) — https://blogs.nvidia.com/blog/rtx-pro-5000-72gb-blackwell-gpu/
- NVIDIA GeForce News, Computex 2026 발표 (2026-05-31) — https://www.nvidia.com/en-us/geforce/news/computex-2026-nvidia-geforce-rtx-announcements/
- NVIDIA Developer Blog, DGX Spark 소프트웨어·모델 최적화 (2026-01-05) — https://developer.nvidia.com/blog/new-software-and-model-optimizations-supercharge-nvidia-dgx-spark
- Apple Mac Studio 기술 사양 — https://www.apple.com/mac-studio/specs/
- Apple MacBook Pro 기술 사양 — https://www.apple.com/macbook-pro/specs/
- AMD ROCm 설치 문서, System requirements (ROCm 7.14.0) — https://rocm.docs.amd.com/projects/install-on-linux/en/latest/reference/system-requirements.html
- Ollama 공식 문서, GPU — https://docs.ollama.com/gpu
- Hugging Face, openai/gpt-oss-120b 모델 카드 — https://huggingface.co/openai/gpt-oss-120b
Tier 2 — 원문 WebFetch 대조 완료
- LMSYS Org, "NVIDIA DGX Spark In-Depth Review" (2025-10-13) — https://www.lmsys.org/blog/2025-10-13-nvidia-dgx-spark/
- StorageReview, "Intel Arc Pro B60 Battlematrix Preview: 192GB of VRAM for On-Premise AI" (2025-12-01) — https://www.storagereview.com/review/intel-arc-pro-b60-battlematrix-preview-192gb-of-vram-for-on-premise-ai
- igor'sLAB, "AMD Radeon AI PRO R9600D: 32 GB VRAM for local AI" (2026-05-12) — https://www.igorslab.de/en/amd-radeon-ai-pro-r9600d-32-gb-vram-local-ai/
- ZDNet Korea, "엔비디아 '지포스 RTX 50' 그래픽카드, 이달부터 최대 30% 가격 인상" (2026-08-03) — https://zdnet.co.kr/view/?no=20260803150150
Tier 2 — 검색 결과 수준만 확인 (원문 대조 실패, 403/차단)
- Tom's Hardware GPU 가격 추적 — https://www.tomshardware.com/pc-components/gpus/lowest-gpu-prices-tracking (본문 접근 실패)
- TechPowerUp, AMD 10% GPU 가격 인상 — https://www.techpowerup.com/343197/amd-prepares-10-gpu-price-hike-amid-memory-shortage (403)
- VideoCardz, AMD Radeon GPU·메모리 키트 8월 10% 인상 — https://videocardz.com/newz/amd-radeon-gpu-and-memory-kit-prices-reportedly-rising-10-in-august (403)
- Phoronix, Radeon AI PRO R9700 Linux 성능 리뷰 — https://www.phoronix.com/review/amd-radeon-ai-pro-r9700 (403)
- TechPowerUp, RTX 50 SUPER GDDR7 수급 관련 보도 — https://www.techpowerup.com/342705/gddr7-shortage-could-stop-nvidia-geforce-rtx-50-series-super-rollout (403)
- Intel Newsroom, Crescent Island 발표 — https://newsroom.intel.com/artificial-intelligence/intel-to-expand-ai-accelerator-portfolio-with-new-gpu (미대조)
Tier 3 — 수치 근거로 사용 금지
- Hacker News, 로컬 LLM 관련 게시물 (2026-07-14 ~ 07-28) — hn.algolia.com API로 확인
- r/LocalLLaMA 인용문 (Strix Halo·ROCm·3090 다중 구성) — reddit.com 직접 접근 차단으로 원 스레드 미대조
- 루리웹 "RTX 5090 가격 근황" — https://bbs.ruliweb.com/community/board/300143/read/75505978
접근 실패로 이번 조사에서 배제한 출처
- amd.com 전 도메인 (제품 페이지·블로그·개발자 기술 문서) — ECONNRESET / 타임아웃 반복. AMD 하드웨어 관련 사양·가격은 전부 T2 이하로 처리했다.
- openai.com (gpt-oss 발표문) — 403. 대신 Hugging Face 공식 모델 카드로 대체 확인.
- 다나와 가격비교 MCP 커넥터 — 인증 미완료로 이번 세션에서 사용 불가. 국내 실시간 최저가 대조를 하지 못했다. claude.ai 커넥터 설정에서 인증하면 다음 조사에서 국내 가격을 T2로 직접 확인할 수 있다.