
오픈웨이트 LLM 순위 상위권 중 실제로 개인 PC에서 돌아가는 모델은 몇 개일까. Kimi K3 1.56TB부터 Qwen3.8-27B 18GB까지 파라미터·VRAM·라이선스를 2026년 8월 기준 수치로 비교했다.
오픈소스 LLM 순위, 무엇을 기준으로 비교해야 할까
오픈웨이트 모델 순위표를 보고 "1위 모델을 내 PC에 깔아보자"고 생각했다면 시작부터 어긋난 접근이다. 2026년 8월 18일 기준 Artificial Analysis Intelligence Index v4.1.1에서 오픈웨이트 1위인 Kimi K3는 Hugging Face 리포지토리 실물이 safetensors 96샤드 합계 약 1.56TB다. 샤드 하나가 16.6~17GB이니, 샤드 한 개조차 웬만한 그래픽카드 메모리를 가득 채운다. 순위표는 이 사실을 알려주지 않는다.
이 간극은 통계로도 확인된다. Hugging Face가 2026년 8월 14일 공개한 집계를 보면 누적 다운로드의 83%를 10억 파라미터 미만 모델이 가져가고, 1,000억 파라미터 초과 모델은 1%에 그친다. 2026년 활동만 한정해도 700억 초과는 3%다. 순위표 상단과 실제 사용 분포가 거의 반대 방향을 가리키는 셈이다.
비교 기준은 세 축으로 나뉜다. 첫째는 역량 지수(종합 벤치마크), 둘째는 하드웨어 적합성(총 파라미터·양자화 후 용량·컨텍스트 KV 캐시), 셋째는 라이선스와 배포 경로다. 이 셋 중 하나만 보고 결정하면 반드시 어딘가에서 막힌다. 성능만 보면 다운로드조차 못 하고, 용량만 보면 쓸모없는 모델을 받으며, 라이선스를 빠뜨리면 회사 제품에 넣은 뒤 문제가 생긴다.
이 글은 2026년 8월 18일 확인 기준으로 세 축을 함께 놓고 비교한다. 수치는 각 모델의 공식 모델 카드와 Artificial Analysis 측정치를 출처로 삼았고, 확인하지 못한 항목은 미확인 상태를 그대로 표기했다.
비교 기준 정리
로컬 실행 가능성을 판단할 때 실제로 확인해야 하는 항목은 다음과 같다. 순위표 한 칸에 담기지 않는 것들이 대부분이다.
| 기준 항목 | 단위·형태 | 확인 방법 | 놓치기 쉬운 점 |
|---|---|---|---|
| 총 파라미터 | B(십억)·T(조) | 모델 카드 상단 | 활성 파라미터가 작아도 총량은 전부 메모리에 올라간다 |
| 활성 파라미터 | B | MoE 모델만 해당 | 연산량만 줄지, 적재량은 안 줄어든다 |
| 양자화 후 실물 용량 | GB | Ollama 태그·GGUF 리포 | Q4 기준 대략 총 파라미터의 절반 GB가 목표선 |
| 컨텍스트 창 | 토큰 | 모델 카드 | 창을 다 쓰면 KV 캐시가 가중치 위에 추가로 얹힌다 |
| 종합 역량 지수 | AA Index | Artificial Analysis | 단일 벤치와 순서가 다르다 |
| 출력 장황도 | 총 출력 토큰 | AA 모델 페이지 | 점수표에 안 나오는 실사용 대기 시간 |
| 라이선스 | 문자열 | LICENSE 원문 | 같은 브랜드 안에서도 조건이 갈린다 |
| 공식 로컬 태그 | Ollama·LM Studio | 런타임 라이브러리 | cloud 태그만 있으면 로컬 실행 경로가 없다 |
가장 자주 오해되는 항목은 활성 파라미터다. Qwen3.6-35B-A3B는 토큰당 30억 파라미터만 활성화하는 MoE 구조지만, 가중치 350억 개 전체를 메모리에 적재해야 한다. 실제로 이 모델의 공식 배포 가이드는 GPU 8장 텐서 병렬을 권장하고, 메모리 부족(OOM) 시 컨텍스트 창을 줄이라고 안내한다. "3B만 활성이니 가볍다"는 설명은 연산 효율 이야기지 메모리 이야기가 아니다.
두 번째로 중요한 건 공식 로컬 태그의 존재 여부다. Ollama 라이브러리 기준으로 glm-5.2는 태그가 glm-5.2:cloud 하나뿐이며 로컬 양자화 태그가 없다. 역시 cloud 태그로 등재돼 있다. 다만 gpt-oss처럼 로컬 태그와 cloud 태그를 함께 가진 사례도 있으므로, cloud 태그가 있다고 해서 "클라우드 전용"이라 단정할 수는 없다.
세 번째는 양자화에 따른 장문맥 품질 저하인데, 이 항목은 어떤 벤더도 공식 수치를 내놓지 않는다. Q4로 내렸을 때 100만 토큰 컨텍스트 성능이 얼마나 떨어지는지, 1차 자료는 2026년 8월 18일 기준 확인하지 못했다. 이 부분은 미확인 영역으로 남겨두는 것이 정확하다.
옵션·유형별 비교
먼저 종합 순위와 로컬 실행 가능성을 나란히 놓아보자. AA Intelligence Index v4.1.1은 GDPval-AA v2, Terminal-Bench v2.1, GPQA Diamond 등 9개 평가의 가중 합산이며 단일 벤치가 아니다.
| 순위 | 모델 | AA 지수 | 총 파라미터 | 로컬 1대 실행 |
|---|---|---|---|---|
| 1 | Kimi K3 (max) | 60 | 2.8T | 불가 |
| 2 | DeepSeek V4 Pro | 53 | 1.6T | 불가 |
| 3 | GLM-5.2 (max) | 53 | 753B | 불가 |
| 4 | Qwen3.8 27B | 52 | 27B | 가능(18GB) |
| 5 | Motif 3 | 47 | 314B | 불가 |
| 6 | MiniMax-M3 | 45 | 428B | 불가 |
| 8 | Nemotron 3 Ultra | 38 | 550B | 불가 |
| 9 | Solar Open2 250B | 37 | 250B | 불가 |
| 10 | Muse Glimmer (high) | 35 | 30B | 가능(17GB Q4) |
| 11 | gpt-oss-120b (high) | 24 | 117B | 가능(65GB) |
상위 11개 중 소비자용 그래픽카드 한 장에 들어가는 모델은 사실상 두 개다. 참고로 전체 모델(비공개 포함) 1위는 Claude Opus 5(max) 63으로, 오픈웨이트 최상단과 프런티어의 지수 격차는 3점이다.
다음은 24GB VRAM 한 장을 전제로 한 3파 비교다.
| 항목 | Qwen3.8-27B | Muse Glimmer 30B | Gemma 4 31B |
|---|---|---|---|
| 배포 주체 | Alibaba | Meta | |
| 라이선스 | Apache 2.0 | Apache 2.0 | Apache 2.0 |
| Q4 로컬 용량 | 18GB(Ollama 공식) | 17GB(24GB VRAM 타깃) | 모델 카드 미기재 |
| 컨텍스트 | 262,144 → 1,000,000 | 131,072+ | 256K |
| 모달리티 | 텍스트·이미지·영상 | 텍스트·이미지 | 텍스트·이미지·영상 |
| AA 지수 | 52 | 35 | 30 |
| 자사 SWE-bench | Pro 61.7 | Verified 76.0 | 미기재 |
| 측정 출력 속도 | 자료 미확인 | 110.9 tok/s | 36.0 tok/s |
| 로컬 실행 명령 | ollama run qwen3.8:27b |
Ollama·LM Studio 통합 | gemma4 로컬 태그 미확인 |
Qwen3.8-27B는 dense 27B 구조에 Apache 2.0이며, Ollama v0.32.12(2026년 8월 14일)에서 정식 지원됐다. Apple Silicon용으로는 qwen3.8:27b-mlx 태그가 별도로 있다. 다만 AA 평가 과정에서 출력 토큰 1억 6,000만 개를 소모해 중앙값 4,300만의 약 3.7배를 기록했고, 페이지에는 매우 장황하다는 평가가 붙었다.
Muse Glimmer 30B는 모델 카드가 양자화별 목표 VRAM을 직접 명시한 드문 사례다. K-Quant 17GB판은 24GB VRAM, K-Quant-Dynamic판은 32GB VRAM이 목표다. 추측 디코딩용 DFlash 드래프터(16토큰 블록 예측)와 ExecuTorch 빌드가 함께 배포된다.
8~16GB 구간에서는 선택지가 좁아진다. gpt-oss-20b는 Ollama 기준 14GB, 시스템 메모리 16GB, MXFP4 4.25비트로 돌아가지만 2025년 8월 원본이 그대로 유지 중이고, 형제 모델 gpt-oss-120b의 AA 지수는 24로 오픈웨이트 최하단이다. Gemma 4 E2B(유효 2.3B)는 자사 벤치 MMLU Pro 60.0, AIME 2026 37.5로 요약·분류·오디오 처리용이지 추론용이 아니다.
상황별 추천
개인이 24GB 그래픽카드 한 장으로 최고 성능을 원하는 경우 — Qwen3.8-27B가 현재 유일하게 "순위표 상단이면서 소비자 GPU에 들어가는" 선택지다. AA 지수 52로 오픈웨이트 4위인데, 위 세 자리는 각각 2.8T·1.6T·753B다. 다만 262K 컨텍스트를 실제로 쓰려면 KV 캐시가 18GB 위에 별도로 얹히므로 여유가 빠듯하다. 출력이 장황해 체감 대기 시간이 길다는 점도 감수해야 한다.
에이전트·툴 호출 자동화가 목적이라면 Muse Glimmer 30B를 먼저 살펴볼 만하다. AA 지수는 35로 낮지만 자사 SWE-Bench Verified 76.0, MCP Atlas 75.5를 제시하고, Meta 공식 개발자 페이지가 컨슈머 GPU 또는 Mac 1대로 충분하다고 명시한다. 배포 엔지니어링이 패키징 단계에서 끝나 있다는 점이 실질 차이다. AA 측정 API 가격은 입력 100만 토큰당 0.32달러, 출력 1.35달러로 동급 오픈웨이트 대비 비싼 편이라는 평가가 붙어 있다(2026년 8월 18일 기준).
노트북·맥북 에어급 8~16GB 환경이라면 gpt-oss-20b가 무난한 기본값이다. 성능 기대치는 낮춰야 한다. 라즈베리파이·Jetson Orin Nano 같은 임베디드 오프라인 실행이 목적이면 Gemma 4 E2B·E4B가 Google 공식 주장 범위에 든다.
사내 온프레미스 구축이고 한국어 비중이 높다면 후보는 둘이다. Motif 3(Moreh)는 MIT 라이선스, 314B/13.2B 활성, AA 지수 47로 오픈웨이트 5위이며 이는 MiniMax-M3(45)·Solar Open2(37)보다 위다. Solar Open 2 250B-A15B(Upstage)는 활성 15B, 1M 컨텍스트, 한·영·일 공식 지원이나 라이선스는 자체 Upstage Solar License다. 둘 다 개인 로컬 실행 범위 밖이며, 서버급 멀티 GPU 구성이 전제다.
셀프호스팅으로 최상위 성능을 노리는 경우 라이선스가 갈림길이다. DeepSeek V4-Pro(1.6T)와 GLM-5.2(753B)는 MIT로 이 급에서 조건 없는 허용에 해당한다. Kimi K3는 성능 1위지만 자체 "Kimi K3 License"로 매출·이용자 수 조건이 붙는다.
자주 하는 실수
첫째, 브랜드명만 보고 라이선스를 같다고 가정하는 것. 같은 Qwen3.8 계열 안에서도 27B는 Apache 2.0이지만, Qwen3.8-2.4T-A95B(Max 계열)는 qwen3.8-max 전용 라이선스다. 12개월 누적 매출 5,000만 달러 이상 기업이 MaaS·AI 코딩 어시스턴트 사업에 쓰려면 별도 상용 계약이 필요하고, 월간 사용자 1억 초과 또는 월 매출 2,000만 달러 초과 제품은 UI에 모델명을 표시해야 한다. 다만 제3자에게 기능을 제공하지 않는 내부 사용은 5,000만 달러 임계의 예외다. 개인 사용은 대체로 문제없지만, 회사 제품 탑재 계획이 있다면 모델별 LICENSE 원문을 한 번은 열어야 한다.
둘째, 발표 시점 순위를 현재형으로 인용하는 것. Gemma 4 공식 블로그가 제시한 "오픈 모델 3위(31B)·6위(26B)"는 본문에 명시된 대로 2026년 4월 1일 스냅샷이다. 4개월 반이 지난 2026년 8월 18일 기준 AA v4.1.1에서 Gemma 4 31B는 지수 30으로 상위 10위권 경계에 있다. 같은 맥락에서 자사 벤치 조건도 확인해야 한다. 조건이 다른 값끼리 비교하면 성립하지 않는다.
셋째, 단일 벤치 서열을 종합 서열로 착각하는 것. 자사 발표 SWE-bench Verified 기준으로는 MiniMax-M3 80.5 > Motif 3 76.2 > Muse Glimmer 76.0 순이지만, AA 종합 지수는 Qwen3.8 27B 52 > Motif 3 47 > MiniMax-M3 45 > Muse Glimmer 35로 순서가 다르다. 여기에 더해 가중치를 내려받는 순간 벤더의 거부 정책은 사라진다는 점도 계산에 넣어야 한다. SaferAI 측정에서 GLM-5.2는 주어진 공격적 사이버·생물 과제를 하나도 거부하지 않았고, Z.ai는 안전 프레임워크와 사전 배포 테스트 결과를 공개하지 않았다.
정리
순위표 1위와 내 장비에서 돌아가는 모델은 완전히 다른 목록이며, 2026년 8월 18일 기준 오픈웨이트 상위 11개 중 소비자 GPU 한 장에 들어가는 건 Qwen3.8-27B(18GB)와 Muse Glimmer 30B(17GB Q4) 정도다. 총 파라미터·양자화 후 용량·공식 로컬 태그를 먼저 확인하고, 그다음 AA 지수 같은 종합 역량을 보는 순서가 실용적이다. MoE 모델의 활성 파라미터는 연산량 지표일 뿐 적재량 지표가 아니라는 점, 그리고 라이선스는 같은 브랜드 안에서도 갈린다는 점이 가장 자주 놓치는 두 함정이다. 하나로 줄이면 이렇다 — 성능 순위표가 아니라 "내 VRAM 용량 → 양자화 후 실물 GB → 라이선스 → 종합 지수" 순서로 좁혀 들어가야 실제로 쓸 모델이 남는다.
함께 보면 좋은 글
- Stripe OpenRouter 인수설, 개발자 게이트웨이 선택 기준 총정리
- GPT-5.6 Luna 80% 인하 vs Gemini 3.7 Flash 도입가 — 2026년 8월 AI API 단가 재계산 실무 가이드
참고 자료
조사 기준일: 2026년 08월 18일
본문의 수치는 아래 자료에서 확인한 것입니다. 제조사 공식 자료(T1)와 전문 매체 실측(T2)을 구분해 표기했습니다. 가격·공급 상황은 변동이 크므로 기준일 이후의 값은 다시 확인해야 합니다.
Tier 1 — 공식 1차 자료 (모두 2026-08-18 WebFetch로 원문 확인)
모델 카드·공식 블로그
- Hugging Face moonshotai/Kimi-K3 모델 카드 — https://huggingface.co/moonshotai/Kimi-K3
- Hugging Face moonshotai/Kimi-K3 파일 트리(1.56 TB, 96샤드) — https://huggingface.co/moonshotai/Kimi-K3/tree/main
- Hugging Face deepseek-ai/DeepSeek-V4-Pro — https://huggingface.co/deepseek-ai/DeepSeek-V4-Pro
- Hugging Face deepseek-ai/DeepSeek-V4-Flash — https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash
- Z.ai(zai-org) 공식 블로그 "GLM-5.2: Built for Long-Horizon Tasks", 게시 2026-06-17 — https://huggingface.co/blog/zai-org/glm-52-blog
- Hugging Face Qwen/Qwen3.8-27B — https://huggingface.co/Qwen/Qwen3.8-27B
- Hugging Face Qwen/Qwen3.8-2.4T-A95B — https://huggingface.co/Qwen/Qwen3.8-2.4T-A95B
- Qwen3.8-Max LICENSE 원문 — https://huggingface.co/Qwen/Qwen3.8-2.4T-A95B/blob/main/LICENSE
- Hugging Face Qwen/Qwen3.6-35B-A3B — https://huggingface.co/Qwen/Qwen3.6-35B-A3B
- Hugging Face Qwen/Qwen3.5-9B — https://huggingface.co/Qwen/Qwen3.5-9B
- Google "Gemma 4: Byte for byte, the most capable open models", 2026-04-02 — https://blog.google/innovation-and-ai/technology/developers-tools/gemma-4/
- Google AI for Developers, Gemma 4 model card — https://ai.google.dev/gemma/docs/core/model_card_4
- Hugging Face meta-models/Muse-Glimmer-30B — https://huggingface.co/meta-models/Muse-Glimmer-30B
- Meta 개발자 사이트, Muse Glimmer — https://developer.meta.com/ai/models/muse-glimmer/
- Hugging Face Motif-Technologies/Motif-3 — https://huggingface.co/Motif-Technologies/Motif-3
- Hugging Face upstage/Solar-Open2-250B — https://huggingface.co/upstage/Solar-Open2-250B
- Hugging Face MiniMaxAI/MiniMax-M3 — https://huggingface.co/MiniMaxAI/MiniMax-M3
- NVIDIA Newsroom "NVIDIA Debuts Nemotron 3 Family of Open Models", 2025-12-15 — https://nvidianews.nvidia.com/news/nvidia-debuts-nemotron-3-family-of-open-models
로컬 런타임 공식 자료
- Ollama 릴리스 v0.32.12, 2026-08-14 — https://github.com/ollama/ollama/releases/tag/v0.32.12
- Ollama 모델 라이브러리(전체) — https://ollama.com/library
- Ollama qwen3.8 태그 목록 — https://ollama.com/library/qwen3.8
- Ollama glm-5.2 태그 목록(cloud 단일 태그) — https://ollama.com/library/glm-5.2
- Ollama 태그 목록 — https://ollama.com/library/gpt-oss
Tier 2 — 독립 검증 (모두 2026-08-18 확인)
- Artificial Analysis, 오픈웨이트 모델 순위(Intelligence Index v4.1.1) — https://artificialanalysis.ai/models/open-source (동일 페이지 2회 조회 교차 검증)
- Artificial Analysis, 전체 모델 리더보드 — https://artificialanalysis.ai/leaderboards/models
- Artificial Analysis, Qwen3.8 27B — https://artificialanalysis.ai/models/qwen3-8-27b
- Artificial Analysis, Muse Glimmer — https://artificialanalysis.ai/models/muse-glimmer
- Artificial Analysis, Gemma 4 31B — https://artificialanalysis.ai/models/gemma-4-31b
- Hugging Face 블로그 "State of Open Models: Summer 2026", 2026-08-14 — https://huggingface.co/blog/state-of-open-models-summer-2026
- Hugging Face GGUF 리포 다운로드 순위 — https://huggingface.co/models?sort=downloads&search=gguf
- Hugging Face GLM-5.2 GGUF 검색 결과 — https://huggingface.co/models?search=GLM-5.2-GGUF
- Nathan Lambert(interconnects.ai) "GLM-5.2 is the step change for open agents", 2026-06-22 — https://www.interconnects.ai/p/glm-52-is-the-step-change-for-open
- Nathan Lambert(interconnects.ai) "Kimi K3: The open-weights escalation", 2026-07-20 — https://www.interconnects.ai/p/kimi-k3-the-open-weights-escalation
- TechCrunch "Moonshot's upcoming Kimi 3 is expected to close the gap with Anthropic's Opus 4.8", 2026-07-16 — https://techcrunch.com/2026/07/16/moonshots-upcoming-kimi-3-is-expected-to-close-the-gap-with-anthropics-opus-4-8/
- TechCrunch "Open-weight AI models are catching up to the frontier. The safety gap remains.", 2026-08-04 — https://techcrunch.com/2026/08/04/open-weight-ai-models-are-catching-up-to-the-frontier-the-safety-gap-remains/
- MarkTechPost "Best Local LLMs You Can Run on a Single 24GB GPU in 2026", 2026-07-19 — https://www.marktechpost.com/2026/07/19/best-local-llms-you-can-run-on-a-single-24gb-gpu-in-2026-qwen-gemma-mistral-deepseek-compared/
조사하지 않은 영역
- Tier 3(레딧·X·유튜브·Hacker News 등 커뮤니티): 이번 리서치 범위에서 제외. 로컬 실행 체감 속도·양자화 품질 저하에 대한 사용자 보고는 이 문서에 반영되지 않았다.
- 검색 과정에서 다수의 SEO형 요약 사이트(벤치마크 집계 블로그, 모델 소개 페이지 등)가 노출됐으나, 원문 대조가 불가능하거나 1차 자료를 재가공한 것이어서 인용하지 않았다.
'로컬 LLM' 카테고리의 다른 글
| GLM-5.3 로컬 실행 요건과 대안 총정리 (2026.08 기준) (0) | 2026.08.21 |
|---|---|
| DeepSeek V4 로컬 실행 요건 정리 — Flash 128GB, Pro는 8장 노드 (0) | 2026.08.20 |
| Qwen3.8 27B 로컬 실행 요건 총정리: 17GB의 진짜 의미 (0) | 2026.08.17 |
| 로컬 LLM GPU 선택 기준 2026 총정리 (RTX 5090·DGX Spark) (0) | 2026.08.17 |