로컬 LLM

Qwen3.8 27B 로컬 실행 요건 총정리: 17GB의 진짜 의미

mdit 2026. 8. 17. 22:09

Qwen3.8 27B를 개인 PC와 맥에서 돌리려면 얼마가 필요한지 정리했습니다. 4비트 17~19GB의 정확한 해석, 배포처별 GGUF 용량 차이, 262K 컨텍스트 KV 캐시 16GB, 엔진별 속도 격차까지 2026년 8월 기준 자료로 대조했습니다.

Qwen3.8 27B 핵심만 먼저 정리하면

결론부터 말하면 이 모델의 공식 모델카드에는 VRAM 요구 수치가 단 한 줄도 없습니다. 로컬 실행 요건이라고 돌아다니는 숫자는 전부 Unsloth·Ollama·vLLM·SGLang 같은 배포·엔진 측 문서에서 나온 값이라, 인용할 때 출처와 조건을 함께 봐야 합니다. 가장 널리 인용되는 4비트 양자화 17~19GB는 그래픽카드 메모리만 뜻하지 않고 "RAM + VRAM 합계"를 가리킵니다. 이 한 단어 차이 때문에 "16GB 맥북에서 된다"는 말이 절반만 맞습니다.

실제 체감 기준선은 통합 메모리 또는 VRAM 24GB 이상입니다. 16GB급 기기에서는 2비트로 낮춰야 겨우 돌아가고, 속도는 초당 3토큰 안팎으로 떨어집니다. 여기에 컨텍스트를 늘리면 262K에서 f16 KV 캐시만 약 16GB가 추가로 붙고, 이미지·영상을 쓰려면 비전 프로젝터(mmproj) 0.63~0.93GB가 별도로 더해집니다. 기본 추론 강도가 라서 설정을 그대로 두면 간단한 요청 하나에 20분 넘게 쓰는 사례도 독립 리뷰에서 보고됐습니다. 이 글은 2026년 8월 17일 확인 기준 자료를 정리한 것이며, 양자화 배포본과 엔진 버전이 주 단위로 바뀌므로 재확인이 필요합니다.


Q1. 4비트 17GB면 제 16GB 그래픽카드에서 돌아가나요?

Q1. 4비트 17GB면 제 16GB 그래픽카드에서 돌아가나요?

아닙니다. 여기서 가장 많이 오해가 생깁니다. Unsloth 공식 문서가 제시하는 표는 양자화별 필요 메모리를 아래와 같이 안내하며, 핵심 원칙으로 "RAM+VRAM ≈ 양자화 파일 크기"를 제시합니다. 17GB는 그래픽카드 단독 용량이 아니라 시스템 메모리와 VRAM을 합친 예산입니다.

양자화 필요 메모리(RAM+VRAM) 실질적 위치
2비트 11~13GB 품질 손실 큼, 최후의 수단
3비트 13~16GB 16GB 기기의 현실적 상한
4비트 17~19GB (권장) RTX 5080·4090, 24GB Mac
6비트 24GB 여유 있는 24GB급
8비트 31GB 32GB 이상
BF16 56GB 서버·다중 GPU

문서는 4비트가 "RTX 5080, 4090 또는 24GB RAM Mac" 수준 기기에서 동작한다고 적고, 예산에 미달해도 디스크 오프로딩으로 동작은 하되 훨씬 느려진다고 덧붙입니다. 문제는 그 "느려짐"의 정도입니다.

제3자 실측 정리에 따르면 M2 Pro 16GB 통합 메모리에서 4비트는 프롬프트 처리 후 생성이 아예 실패했고, 2비트로 낮췄을 때 합성 벤치 7.11 tok/s, 7,072토큰짜리 실사용 프롬프트에서는 2.91 tok/s까지 하락했습니다(2026년 8월 17일 확인, 공식 확인 자료가 아닌 제3자 측정치입니다). 노트북 환경(12GB GPU + 32GB 시스템 RAM, 동적 Q4 오프로드) 측정은 긴 응답 3.26 tok/s, 짧은 응답 4.42~4.53 tok/s였습니다. 같은 문서가 제시한 체감 기준은 3 tok/s 미만은 불편, 3~8은 인내 필요, 8~20은 대화·코딩에 쾌적입니다. 계산 기반 추정 사이트 역시 권장 최소를 24GB 카드(4090·3090·5090)로 잡고, 16GB 카드는 Q3_K_M이나 부분 CPU 오프로드로 제한된다고 명시합니다.


Q2. 배포처마다 Q4_K_M 용량이 다른데 어떤 걸 받아야 하나요?

Q2. 배포처마다 Q4_K_M 용량이 다른데 어떤 걸 받아야 하나요?

같은 이름표가 붙었는데 파일 크기가 다릅니다. 그리고 그 차이가 16GB 카드에서 되느냐 안 되느냐를 가르는 폭이라 그냥 넘길 수 없습니다.

배포처 Q4_K_M 그 외 비고
LM Studio 커뮤니티 16.8GB Q6_K 22.4GB / Q8_0 29GB llama.cpp b10430으로 제작, mmproj 언급 없음
Unsloth 17.11GB 2비트 UD-IQ2_XXS 9.01GB, 3비트 UD-Q3_K_XL 13.44GB 동적 양자화 계열
ggml-org(llama.cpp) 18.97GB Q8_0 28.6GB / BF16 53.8GB MTP 헤드 별도 파일 제공
Ollama 18GB + 931MB 합계 약 18.9GB, 비전 프로젝터 포함

최소 16.8GB와 최대 18.97GB, 약 2GB가 벌어집니다. 선택 기준은 이렇게 정리됩니다. 메모리가 빠듯하면 LM Studio 빌드가 가장 작고, 속도를 끌어올리고 싶으면 MTP(다중 토큰 예측) 헤드가 분리 제공되는 ggml-org 빌드가 유리합니다(MTP Q8_0 3.16GB, MTP BF16 5.95GB). 이미지·영상 입력이 필요하면 mmproj가 함께 제공되는 Ollama 배포본이 설정 부담이 적습니다.

주의할 점은 비전입니다. 이 모델은 이미지·비디오를 네이티브로 받는 비전-언어 모델이지만, 로컬에서는 프로젝터가 본체와 분리된 별도 파일입니다. LM Studio·ggml-org GGUF 페이지에는 mmproj 언급이 없어, 받은 파일이 텍스트 전용일 가능성이 있습니다. 메모리 계산에도 0.63~0.93GB를 따로 더해야 합니다. GGUF는 llama.cpp 릴리즈 b10430 기준으로 만들어졌고 내부 아키텍처 식별자가 입니다. 구버전 Ollama나 LM Studio는 이 아키텍처를 읽지 못할 수 있으니 먼저 런타임부터 갱신하는 편이 안전합니다.


Q3. 262K 컨텍스트를 쓰려면 메모리가 얼마나 더 필요한가요?

Q3. 262K 컨텍스트를 쓰려면 메모리가 얼마나 더 필요한가요?

가중치만 올려놓고 끝이 아닙니다. 컨텍스트 길이에 비례해 KV 캐시가 별도로 쌓입니다. 이 모델의 구조는 64개 층이 16 × (3 × Gated DeltaNet → 1 × Gated Attention) 형태로 배열돼, 64개 층 중 48개가 선형 어텐션이고 16개만 전체 어텐션입니다. KV 헤드도 4개뿐입니다. 이 두 조건 덕분에 동급 밀집 모델보다 캐시가 작습니다.

컨텍스트 f16 KV 캐시 FP8 캐시 Q4 가중치 포함 총량(개략)
8K 약 0.5GB 약 0.25GB 약 17.5GB
32K 약 2GB 약 1GB 약 19GB
128K 약 8GB 약 4GB 약 25GB
262K(원생 최대) 약 16GB 약 8GB 약 33GB 이상

여기서 나오는 결론이 명확합니다. 24GB 카드 한 장으로 262K 컨텍스트는 사실상 불가능하며, 현실적 상한은 Q4 + 32K~64K 조합입니다. 262K를 쓰려면 캐시를 절반으로 줄이는 것이 전제라, vLLM 공식 레시피도 두 예시 모두 --max-model-len 262144 --kv-cache-dtype fp8을 함께 씁니다.

1M 컨텍스트는 별개의 이야기입니다. 모델카드 표현은 "262,144 natively and extensible up to 1,000,000 tokens"인데, 확장은 기본값이 아니라 config.jsonrope_parameters를 YaRN 설정으로 직접 고쳐야 열립니다(rope_theta 1000만, 4.0 등). 그리고 모델카드 자신이 부작용을 경고합니다 — 스케일링 계수가 입력 길이와 무관하게 고정되므로 짧은 텍스트 성능이 떨어질 수 있어, 장문 처리가 필요할 때만 바꾸라는 권고입니다. vLLM에서는 중첩된 text_config 오버라이드가 추가로 필요합니다. 한 가지 남는 변수는 선형 어텐션 48개 층의 상태 메모리가 위 표에서 제외돼 있다는 점입니다. 제3자 두 곳이 동일하게 단서를 달았고 이에 대한 1차 수치는 아직 없어, 장문에서는 표보다 더 필요할 수 있습니다(확인되지 않은 항목입니다).


Q4. 공개된 속도가 3 tok/s부터 206 tok/s까지인데 뭘 믿어야 하나요?

Q4. 공개된 속도가 3 tok/s부터 206 tok/s까지인데 뭘 믿어야 하나요?

둘 다 사실이고, 서로 다른 축의 숫자입니다. 같은 가중치라도 엔진·양자화·가속 기법 조합에 따라 결과가 70배까지 벌어집니다. 그래서 속도를 볼 때는 반드시 "어느 장비에서, 어느 경로로"를 함께 확인해야 합니다.

조건 측정치 근거 등급
M2 Pro 16GB, 2비트, 긴 프롬프트 2.91 tok/s 제3자 측정
노트북 12GB GPU + 32GB RAM, Q4 오프로드 3.26~4.53 tok/s 제3자 측정
M5 Max 128GB / DGX Spark, LM Studio Q4_K_M 15~30 tok/s 독립 리뷰
Ryzen AI Max+ 395, llama.cpp Vulkan, MTP=4 최대 24.5 tok/s 원문 대조 실패, 검색 인덱스 인용
DGX Spark, SGLang 38.28 tok/s 원문 대조 실패
Radeon AI PRO R9700 32GB 1장, Vulkan, MTP=2 최대 51.8 tok/s 원문 대조 실패
RTX 5090 1장, NVFP4 + DSpark 투기적 디코딩 206.1 tok/s 원문 대조 실패

주의할 것은 표의 맨 아래 두 줄입니다. AMD 공식 블로그는 3회 시도 모두 타임아웃, SGLang 공식 게시물은 HTTP 402로 열리지 않아 원문을 직접 대조하지 못했습니다. 검색 인덱스에 인용된 형태로만 확인한 값이므로 공식 보증치로 다루지 않는 편이 맞습니다.

가장 실용적인 지렛대는 MTP 투기적 디코딩입니다. 한 독립 리뷰는 llama.cpp에서 --spec-type draft-mtp를 켜자 LM Studio 기본 GGUF 대비 약 72% 빨라졌다고 보고했습니다. 다만 관련 PR 본문이 명시한 지원 모델 목록에 Qwen3.8이 열거되지 않아, 3.8에서 공식 지원 범위인지는 확인되지 않았습니다(동작한 정황만 있습니다). 엔진 선택 기준을 요약하면 이렇습니다. 24GB 미만·Mac·AMD 소비자 하드웨어라면 GGUF 경로가 사실상 유일한 선택이고, 32GB급 NVIDIA Blackwell로 다중 요청을 받아야 한다면 NVFP4 + vLLM/SGLang이 자릿수가 다른 처리량을 냅니다.


Q5. 설치는 끝났는데 답변이 21분씩 걸립니다. 무엇을 먼저 봐야 하나요?

Q5. 설치는 끝났는데 답변이 21분씩 걸립니다. 무엇을 먼저 봐야 하나요?

기본 추론 강도부터 내려야 합니다. 이 모델은 사고 모드가 기본 활성이고, reasoning_effort의 기본값이 최상단인 입니다(, 선택 가능, Unsloth 문서는 까지 4단계로 안내). 독립 리뷰의 실측이 이 기본값의 대가를 보여줍니다 — 펠리컨 SVG를 그리는 단순 요청 한 번에 추론 토큰 22,276개를 써서 출력 3,223토큰을 만들며 21분이 걸렸고, 컨텍스트 한도도 8,192에서 262,144로 올려야 했습니다. 해당 리뷰의 첫 권고는 기본값을 무시하고 낮은 추론 강도 또는 추론 없이 시작하라는 것입니다.

두 번째로 preserve_thinking도 기본 활성이라 이전 턴의 추론 블록이 계속 유지됩니다. 컨텍스트 소비와 캐시 전략에 직접 영향을 주므로 서비스에 붙이기 전에 정책을 정해두는 편이 좋습니다. 샘플링 값은 두 공식 문서가 동일하게 제시해 교차 확인됐습니다.

모드 temperature top_p top_k 기타
사고(thinking) 1.0 0.95 20 presence_penalty 0.0
비사고(instruct) 0.7 0.80 20 presence_penalty 1.5

설치 단계에서 걸리는 함정도 미리 정리해 둡니다. NVIDIA 장치에서 MXFP4는 선형 어텐션을 지원하지 않으므로 NVFP4를 써야 합니다(vLLM 공식 레시피 명시). vLLM은 0.17.0 이상, transformers 5.8.0 이상을 요구하고, SGLang에서 투기적 디코딩을 켜면 미지정 시 48로 재설정되며 Mamba 계열 설정은 TP=1 전제입니다. 공개 직후 chat template 회귀(빈 think 태그 등)가 여러 곳에서 언급되지만 확인 가능한 1차 경로가 없어 이 글에서는 단정하지 않습니다.

끝으로 판단에 필요한 두 가지를 덧붙입니다. 첫째, 이 모델의 종합 지능에 대한 독립 측정치는 현재 존재하지 않습니다. Artificial Analysis에 아직 등재되지 않아, 공개된 성능 수치는 전부 자사 발표이거나 그것을 옮긴 것입니다. 자사 표 안에서도 Terminal Bench 2.1은 73.0 대 78.2, GPQA Diamond는 89.2 대 91.3으로 비교 대상에 뒤집니다. 둘째, 로컬과 호스팅의 비용 구조입니다. 2026년 8월 17일 확인 기준 OpenRouter 가격은 입력 100만 토큰당 $0.40, 출력 100만 토큰당 $3.00이며 컨텍스트는 262K입니다. 출력 단가가 입력의 7.5배인 구조에서 사고를 켜고 쓰면 비용이 빠르게 불어나므로, 역설적으로 "과다 사고" 성향이 로컬 실행의 경제적 근거를 강화합니다. 반대로 지연이 중요한 대화형 용도라면 호스팅이 유리합니다.


정리

"17GB면 된다"는 문장의 진짜 뜻은 "RAM과 VRAM을 합쳐 17GB"이며, 실질적 기준선은 24GB 이상 메모리입니다. 여기에 컨텍스트에 비례하는 KV 캐시(262K에서 f16 약 16GB)비전 프로젝터 0.63~0.93GB를 따로 더해 예산을 짜야 하고, 같은 Q4_K_M도 배포처에 따라 16.8~18.97GB로 2GB가 벌어진다는 점을 확인한 뒤 내려받는 편이 안전합니다.

속도 수치는 엔진·양자화·MTP 사용 여부에 따라 초당 3토큰에서 206토큰까지 갈리므로 남의 장비 숫자를 그대로 대입하면 거의 틀립니다. 설치 직후에는 기본값 부터 낮추는 것이 체감을 가장 크게 바꿉니다. 다만 공식 모델카드에 메모리 요건이 전혀 없고 독립 벤치마크도 아직 없다는 점을 전제로, 이 글의 모든 수치는 2026년 8월 17일 확인 시점 기준이며 배포본과 엔진 버전에 따라 바뀔 수 있습니다.


함께 보면 좋은 글


참고 자료

조사 기준일: 2026년 08월 17일

본문의 수치는 아래 자료에서 확인한 것입니다. 제조사 공식 자료(T1)와 전문 매체 실측(T2)을 구분해 표기했습니다. 가격·공급 상황은 변동이 크므로 기준일 이후의 값은 다시 확인해야 합니다.

Tier 1 — 원문을 열어 대조한 1차 자료

Tier 2 — 독립 측정·제3자 검증·매체

원문 대조 실패 — T1으로 올리지 않은 자료

수치로 채택하지 않은 자료 (커뮤니티 집계 기반, 3절 마지막 행 근거)