로컬 LLM

GLM-5.3 로컬 실행 요건과 대안 총정리 (2026.08 기준)

mdit 2026. 8. 21. 01:04

GLM-5.3은 2026년 8월 20일 기준 가중치가 공개되지 않아 로컬 실행이 불가능하다. GLM-5.2 기준 양자화별 메모리 요건과 API 비용을 비교해 실행 가능 여부를 판단한다.

GLM 5.3 개요

GLM 5.3 개요

GLM-5.3을 지금 내 서버에서 돌릴 수는 없다. Z.ai가 2026년 8월 18일 공식 릴리즈 노트에 이 모델을 올렸지만, 같은 시점(2026-08-20) 기준으로 조직의 GitHub·Hugging Face 저장소에는 GLM-5.3 가중치가 존재하지 않는다. 모델 자체는 컨텍스트 1M 토큰, 최대 출력 128K 토큰, 텍스트 전용(비전 입력 미지원) 구조이며 추론(reasoning)이 필수로 걸려 있어 effort 레벨을 ·· 중 하나로 지정해야 한다. 이 글은 "로컬실행요건"이라는 개발자 관점 질문에 답하기 위해, 아직 공개되지 않은 5.3 대신 동일 베이스로 알려진 GLM-5.2의 실측 하드웨어 요건을 기준으로 정리하고, API로 GLM-5.3을 쓰는 경우의 비용까지 함께 다룬다. 벤치마크 성능 비교나 도입 여부 판단은 다루지 않는다.


1. GLM-5.3 로컬 실행이 아직 불가능한 이유

1. GLM-5.3 로컬 실행이 아직 불가능한 이유

결론은 단순하다. 가중치 파일 자체가 없다. GitHub zai-org/GLM-5 저장소의 README는 GLM-5.2·5.1·5까지만 다루고 GLM-5.3을 언급하지 않으며, Hugging Face에도 대응하는 모델 카드가 없다(2026-08-20 확인). 공식 가격표(docs.z.ai/guides/overview/pricing)에는 GLM-5.3이 100만 토큰당 입력 $1.4, 캐시 입력 $0.26, 출력 $4.4로 등재돼 있어 API 호출은 가능하지만, 현재 접근 경로는 GLM Coding Plan 구독과 ZCode 중심이고 일반 API의 완전 개방 여부는 문서 간 서술이 엇갈려 확인이 필요한 상태다.

발표 시점 자체도 혼란스럽다. 매체(the-decoder)는 발표일을 2026-08-14로 보도했고, 안전 평가·하드닝을 위해 가중치 공개를 약 2주 유예한다고 전했다. 반면 Z.ai 공식 릴리즈 노트의 항목 날짜는 2026-08-18로 표기돼 있어 4일의 간극이 있다. 이 유예가 사고가 아니라 CyberGym 벤치마크에서 84.5%라는 높은 점수가 나온 뒤 취한 의도된 조치라는 점도 함께 보도됐다(SCMP, 2026-08-14). 따라서 "약 2주 후(2026-08-28 전후)" 공개설은 T2 보도에 근거한 추정일 뿐, Z.ai가 명시한 확정 날짜는 아니라는 점을 분명히 해둔다(확인 필요).


2. GLM-5.2 기준 실질 하드웨어 요건

2. GLM-5.2 기준 실질 하드웨어 요건

GLM-5.3의 정확한 로컬 요건을 지금 계산할 수는 없지만, 같은 베이스(744B 총 파라미터 / 40B 활성 MoE, 1M 컨텍스트)를 쓰는 GLM-5.2의 실측 수치는 5.3 공개 이후에도 거의 그대로 이어질 가능성이 높다. Unsloth가 배포한 GGUF 실제 파일 크기와, Unsloth 공식 문서가 제시하는 양자화 비트별 최소 메모리(RAM+VRAM 합산)는 다음과 같다.

양자화 GGUF 파일 크기 최소 메모리(RAM+VRAM)
BF16 1,510GB -
Q8_0 801GB 약 810GB
UD-Q4_K_XL 467GB 372~475GB
UD-IQ4_XS 365GB 290~360GB
UD-Q3_K_XL 343GB 290~360GB
UD-IQ2_M 239GB 245GB
UD-IQ1_S 217GB 223GB

여기서 가장 중요한 함정은 "24GB GPU 한 장으로 돌린다"는 표현이 그래픽카드 VRAM만을 의미하지 않는다는 점이다. Unsloth 문서가 말하는 2bit(UD-IQ2_M) 구성은 시스템 RAM을 포함한 합산 245GB가 전제이며, 256GB 통합 메모리 Mac이나 24GB GPU 1장 + 대용량 시스템 RAM 조합에서만 성립한다. 그래픽카드 VRAM 24GB만 갖춘 일반 데스크톱으로는 최상위 양자화조차 실행되지 않는다. 파라미터 수 표기도 출처마다 744B(GitHub)·753B(Hugging Face)·754B(Unsloth GGUF)로 갈려, 메모리 산정 시 소폭의 오차 요인으로 남는다.


3. 서빙 프레임워크·마이그레이션 체크리스트

3. 서빙 프레임워크·마이그레이션 체크리스트

로컬 서빙을 준비한다면 프레임워크 최소 버전을 먼저 맞춰야 한다. GLM-5.2 공식 모델카드(Hugging Face)가 명시한 지원 프레임워크는 아래와 같다.

프레임워크 최소 버전
SGLang v0.5.13.post1 이상
vLLM v0.23.0 이상
Transformers 최신 버전
KTransformers 지원
Unsloth 지원

GLM-5.3으로 넘어갈 때 반드시 손봐야 할 코드는 reasoning 설정이다. 기존에 thinking.type: "disabled"로 추론을 꺼두던 방식은 GLM-5.3에서 더 이상 동작하지 않는다. 추론이 필수 항목으로 바뀌었기 때문에 thinking.type: "enabled" + reasoning_effort: "low"로 교체해야 하며, 기본값이 로 설정돼 있어 아무 설정 없이 그대로 호출하면 출력 토큰 비용이 예상보다 크게 튈 수 있다. 라이선스도 확인이 필요한 지점이다. GLM-5.2는 Hugging Face 모델카드에는 , GitHub 저장소에는 Apache-2.0으로 표기돼 있어 두 문서가 서로 다른 라이선스를 명시하고 있으며, GLM-5.3 가중치에 어떤 라이선스가 붙을지는 아직 공개되지 않았다(확인 필요).


4. 로컬 vs API — 비용 판단 기준

4. 로컬 vs API — 비용 판단 기준

로컬 서버를 구축할지, API를 그대로 쓸지는 결국 메모리 투자 비용과 사용량의 함수다. 2026년 8월 기준 GLM-5.3 API 가격은 100만 토큰당 입력 $1.4, 캐시 입력 $0.26(한시적 무료 표기), 출력 $4.4다. 4bit(UD-Q4_K_XL, 467GB) 구성을 로컬로 갖추려면 대용량 서버급 메모리 투자가 필요하고, 이 비용을 상쇄하려면 상당한 호출량이 쌓여야 손익분기가 맞는다. 반복되는 긴 컨텍스트를 다루는 워크로드라면 캐시 입력 단가가 낮아 API 쪽이 특히 유리하다.

로컬을 굳이 택할 이유는 비용 최적화보다 데이터를 외부로 내보낼 수 없는 요건일 때다. 이 경우에도 GLM-5.3 가중치가 공개되기 전까지는 GLM-5.2로 파이프라인을 미리 구성해두는 것이 현실적인 대안이다. 같은 서빙 스택(SGLang·vLLM 버전)과 메모리 예산이 그대로 재사용될 가능성이 높기 때문에, 5.2 기준으로 인프라를 검증해두면 5.3 가중치가 풀렸을 때 재투자 부담이 줄어든다. 다만 이는 두 모델이 "동일 베이스"라는 전제에 기반한 예상이며, GLM-5.3의 정식 배포 사양(FP8 지원 여부, MTP 레이어 포함 여부 등)은 아직 공식 확인이 안 된 항목이다.


5. 확인 필요 항목 및 자주 묻는 질문

5. 확인 필요 항목 및 자주 묻는 질문

아래는 2026년 8월 20일 기준으로 아직 공식 문서로 확인되지 않은 항목이다. 단정하지 않고 미확인 상태로 남겨둔다.

  • GLM-5.3 가중치 공개 확정 날짜 (매체 추정만 존재, 공식 날짜 미확인)
  • GLM-5.3 가중치의 정확한 라이선스 (GLM-5.2조차 문서 간 mit·Apache-2.0으로 엇갈림)
  • GLM-5.3의 FP8 배포 여부·MTP 레이어(speculative decoding) 지원 여부
  • 일반 API의 완전 개방 여부 및 GLM Coding Plan 구독료 실액
  • 로컬 실측 토큰/초 처리량 (신뢰할 수 있는 1·2등급 출처를 확보하지 못함)

Q. GLM-5.3이 풀리면 GLM-5.2보다 메모리가 더 필요할까?
공식 발표 자료 어디에도 파라미터 규모가 커졌다는 언급은 없다. 같은 744B/40B 활성 구조를 유지한다는 전제가 맞다면 위 표의 요건이 그대로 적용될 가능성이 높지만, 이는 추정이며 5.3 자체의 공식 사양 문서가 나와야 확정된다.

Q. 개인 워크스테이션(GPU 24GB, RAM 64GB)으로는 아예 안 되나?
Unsloth 최소 요건표 기준으로 가장 가벼운 1bit(UD-IQ1_S)조차 합산 223GB가 필요하므로, RAM 64GB 수준의 일반 워크스테이션으로는 어떤 양자화 단계에서도 실행이 불가능하다.


정리

GLM-5.3은 2026년 8월 20일 기준 가중치가 공개되지 않아 로컬 실행 자체가 불가능하며, API로만 접근할 수 있는 단계다. 하드웨어 계획을 지금 세워야 한다면 같은 베이스로 알려진 GLM-5.2의 실측 요건(2bit 최소 245GB, 4bit 372~475GB)을 기준으로 삼는 것이 현실적이며, 파라미터 수·라이선스 표기가 출처마다 엇갈리는 점은 감안해야 한다. 가중치 공개 날짜와 정식 배포 사양은 아직 확인되지 않았으므로, 이후 공식 문서가 나오는 시점에 다시 점검할 필요가 있다.


함께 보면 좋은 글


참고 자료

조사 기준일: 2026년 08월 21일

본문의 수치는 아래 자료에서 확인한 것입니다. 제조사 공식 자료(T1)와 전문 매체 실측(T2)을 구분해 표기했습니다. 가격·공급 상황은 변동이 크므로 기준일 이후의 값은 다시 확인해야 합니다.

Tier 1
- https://z.ai/blog/glm-5.3 (확인일 2026-08-21, r.jina.ai 경유 전문 확인)
- https://docs.z.ai/guides/llm/glm-5.3 (확인일 2026-08-21)
- https://huggingface.co/zai-org (조직 전체 모델 목록, 확인일 2026-08-21)
- https://huggingface.co/zai-org/GLM-5.2 (모델카드, 확인일 2026-08-21)
Tier 2
- https://www.marktechpost.com/2026/08/14/z-ai-ships-glm-5-3-without-retraining-the-base-model-better-at-complex-coding-and-long-horizon-tasks/ (확인일 2026-08-21)
- https://mlq.ai/news/zai-delays-glm-53-weights-after-cybersecurity-tests-show-strong-exploit-capability/ (검색 결과 기반, 직접 fetch 실패 — 403)
- https://the-decoder.com/zhipu-ai-releases-glm-5-3-claims-its-the-strongest-open-weights-coding-model/ (확인일 2026-08-21)
- https://venturebeat.com/technology/glm-5-3-hits-the-api-at-1-4-4-4-per-million-tokens (검색 스니펫 기반, 확인 필요 — 직접 fetch 안 함)
- 서드파티 GLM-5.2 로컬 배포 가이드 다수(Spheron, AI Made Tools, Nitin Rachabathuni) — 검색 스니펫 기반, 개별 fetch 안 함, 수치는 참고용