AI 모델

오픈소스 AI 모델 중국 미국 비교, 스펙·가격으로 보는 선택 기준

mdit 2026. 8. 4. 09:22


중국 AI 모델 개요

중국 AI 모델 개요

2026년 8월 현재 AI 모델 시장을 "어느 나라가 이기고 있는가"라는 프레임으로만 보면 정작 중요한 실무 판단을 놓치기 쉽다. 실제로 하드웨어 구매나 서비스 설계에 더 직접적으로 영향을 주는 축은 오픈웨이트냐 폐쇄형이냐의 구분이다. DeepSeek·Qwen·GLM·Kimi 등 중국 기업이 내놓은 최상위권 모델은 거의 전부 MIT, Apache 2.0 또는 자체 커스텀 라이선스로 가중치 자체를 공개하고 있어 기업이 자체 GPU 서버에 직접 올려 구동할 수 있다. 반면 OpenAI의 GPT-5.4, Anthropic의 Claude Opus 4.5, Google의 Gemini 3.1 Pro는 모두 API 전용 폐쇄형 모델이라 가중치를 내려받아 자체 인프라에서 돌리는 선택지 자체가 없다. 이 글에서는 국가별 우열 비교가 아니라, 실제 도입·구축 의사결정에 필요한 스펙·성능·라이선스·비용 데이터를 순서대로 정리한다.


1. 중국 vs 미국 주요 모델 스펙 비교

1. 중국 vs 미국 주요 모델 스펙 비교

2026년 8월 3일 기준으로 확인 가능한 주요 모델의 공식 스펙은 아래와 같다. 총 파라미터 수만 보면 중국 모델들이 압도적으로 커 보이지만, 대부분 MoE(Mixture of Experts) 구조라 실제 연산에 쓰이는 활성 파라미터는 훨씬 작다는 점을 함께 봐야 한다.

모델 개발사 총 파라미터 활성 파라미터 컨텍스트 라이선스
DeepSeek-V3.2 DeepSeek AI(중국) 685B 확인 필요(공식 미확인) 128K MIT(오픈웨이트)
DeepSeek-V4-Pro DeepSeek AI(중국) 1.6T 49B 100만 토큰 MIT(오픈웨이트)
Qwen3-235B-A22B Alibaba(중국) 235B 22B 32K(YaRN 확장 시 128K) Apache 2.0
GLM-5.2 Zhipu/Z.ai(중국) 753B 확인 필요(공식 미확인, 약 40B 추정) 약 100만 토큰 MIT(오픈웨이트)
Kimi K3 Moonshot AI(중국) 2.8T 104B(전문가 896개 중 16개) 1,048,576 토큰 Kimi K3 자체 라이선스
GPT-5.4 OpenAI(미국) 비공개 비공개 1,050,000 토큰 폐쇄형(API 전용)
Claude Opus 4.5 Anthropic(미국) 비공개 비공개 200,000 토큰 폐쇄형(API 전용)
Gemini 3.1 Pro Google(미국) 비공개 비공개 최대 100만 토큰 폐쇄형(API 전용)
Llama 4 Maverick Meta(미국) 400B 17B(전문가 128개) Llama 4 커뮤니티 라이선스
gpt-oss-120b OpenAI(미국) 117B 5.1B Apache 2.0(오픈웨이트)

표에서 드러나듯 "오픈웨이트로 공개된 초대형 모델"은 사실상 중국 4개사(DeepSeek·Qwen·Zhipu·Moonshot)와 미국 쪽 Llama·gpt-oss 계열에 한정된다. GPT-5.4·Claude Opus 4.5·Gemini 3.1 Pro는 애초에 자체 구축 대상이 아니라 API 구독 대상이라는 점을 먼저 구분해야 한다.


2. API 가격 비교 (2026년 8월 3일 조회 기준)

2. API 가격 비교 (2026년 8월 3일 조회 기준)

폐쇄형 모델은 API 사용량 기준 종량 과금이 적용된다. 아래 가격은 2026년 8월 3일 조회 시점의 정가 스냅샷이며, 환율·프로모션에 따라 실제 청구액은 달라질 수 있다.

모델 입력 가격(백만 토큰당) 출력 가격(백만 토큰당) 최대 출력 토큰
GPT-5.4 $2.50 $15 128,000
Claude Opus 4.5 $5 $25 확인 필요(공식 수치 미확인)
Gemini 3.1 Pro 비공개(2026-08-03 확인 시점 기준 공식 단가표 미확인) 비공개 64,000

중국 오픈웨이트 모델은 자체 API 서비스로도 이용 가능하지만, 애초에 가중치를 내려받아 자체 서버에서 구동하면 토큰당 과금 자체가 발생하지 않는다는 점이 폐쇄형 모델과의 가장 큰 실무적 차이다. 다만 자체 구동에는 GPU 구매·전력·운영 인력 비용이 별도로 들어가므로, 사용량이 적은 경우 오히려 API가 더 저렴할 수 있다.


3. 벤치마크로 본 실제 성능 격차

3. 벤치마크로 본 실제 성능 격차

스탠퍼드 HAI(Stanford Human-Centered AI Institute)의 AI Index 2026 보고서에 따르면, Chatbot Arena 기준 최상위 폐쇄형 모델(Claude Opus 4.6, 1503점)이 최상위 오픈모델(GLM-5, 1454점)을 49점, 비율로는 약 3.4% 앞서는 것으로 나타났다. 이 격차는 2024년 8월에는 0.3%까지 좁혀졌다가 2025년 다시 3.3% 수준으로 재확대된 것으로 보고됐다. 다만 지식 평가(MMLU), 수학(AIME·MATH-500), 대학원급 과학 문제(GPQA Diamond) 같은 특정 과업 벤치마크에서는 두 진영의 격차가 사실상 0에 가깝게 수렴한다는 점도 함께 보고됐다.

오픈웨이트 모델 내부 순위는 Artificial Analysis Intelligence Index를 인용한 2차 보도(tech-insider.org, 2026년 하반기 스냅샷)에서 GLM-5.2가 51점으로 오픈웨이트 1위, DeepSeek V4-Pro가 44점, Kimi K2.6이 43점으로 뒤를 잇는다고 전해졌다. 다만 이 수치는 Artificial Analysis 공식 사이트에서 직접 확인되지 않은 2차 인용 자료이므로 참고용으로만 활용해야 한다. 같은 보도에서는 DeepSeek 계열이 종합 점수와 무관하게 SWE-bench Verified·LiveCodeBench 등 코딩 벤치마크와 가격 경쟁력에서는 GLM-5.2를 앞선다고도 전했다.

업계 매체 The Register는 2025년 7월 보도에서 중국이 DeepSeek R1(671B), Kimi 2(1T MoE) 등 대형 오픈모델을 잇달아 공개한 반면, 같은 기간 미국이 내놓은 최고 오픈모델은 Llama 4뿐이었고 평가가 부진했다고 지적한 바 있다. 다만 이 보도는 정량적 성능 수치를 제시하지는 않았다.


4. 자체 GPU 서버 구축 시 고려할 점 — 총 파라미터의 함정

4. 자체 GPU 서버 구축 시 고려할 점 — 총 파라미터의 함정

671B~2.8T 규모의 모델을 보면 "이걸 돌리려면 GPU가 얼마나 필요할까"라는 걱정이 먼저 든다. 그러나 실측 데이터를 보면 총 파라미터 수만으로 필요 자원을 계산하면 크게 과대평가하게 된다.

SemiAnalysis InferenceX와 LMSYS Org 기술 블로그가 공개한 DeepSeek-V3(671B, V3.2 이전 세대) 실측 서빙 데이터에 따르면, 8×H100 GPU(텐서병렬 8) 단일 노드 구성에서는 노드당 약 620~821 tokens/s의 처리량을 보였지만, 대규모 전문가병렬(EP72, 9노드×8GPU) 구성으로 확장하면 노드당 17,373~22,282 tokens/s까지 처리량이 늘어난 것으로 보고됐다. 즉 같은 모델이라도 배포 구성(병렬화 전략)에 따라 처리량이 수십 배 차이 난다.

이 때문에 실제 하드웨어 사이징의 기준은 "총 파라미터"가 아니라 활성 파라미터 + 양자화 방식 + 병렬화 전략으로 잡아야 한다. 예를 들어 2.8T급 Kimi K3나 1.6T급 DeepSeek V4-Pro도 실제 활성 파라미터는 49B~104B 수준에 불과해, NVIDIA가 공개한 DeepSeek-V3.2-NVFP4 양자화판처럼 FP8을 NVFP4로 낮춰 비트당 용량을 약 1.66배 절감하면 B200 GPU 8장(텐서병렬 8) 구성으로도 서비스 가능한 수준이 된다. 반대로 Llama 4 Scout(109B/활성 17B)는 INT4 양자화 시 단일 H100 GPU로도 구동 가능해, 초대형 모델이 곧 초대형 인프라를 의미하지는 않는다는 점을 보여준다.

모델 총 파라미터 활성 파라미터 참고 구동 사양
Kimi K3 2.8T 104B 대규모 전문가병렬 인프라 필요
DeepSeek-V4-Pro 1.6T 49B NVFP4 양자화 시 B200 8장(TP8)
GLM-5.2 753B 확인 필요(미확인)
Llama 4 Maverick 400B 17B 단일 H100 DGX 호스트
Llama 4 Scout 109B 17B INT4 양자화 시 단일 H100
gpt-oss-120b 117B 5.1B 단일 80GB GPU

5. 라이선스 주의사항과 실사용자 보고 이슈

5. 라이선스 주의사항과 실사용자 보고 이슈

라이선스는 스펙표만 보고 넘어가기 쉬운데, 실제 도입 단계에서 걸림돌이 되는 사례가 꾸준히 보고된다. Kimi K2·K3의 "Modified MIT 라이선스"는 월 활성 사용자 1억 명 또는 매출 2천만 달러를 초과하면 제품 UI에 "Kimi K2/K3" 브랜드를 표시해야 하는 의무 조항을 포함하고 있는데, 업계 매체와 블로그(aitooldiscovery.com, Medium 등)에서는 이 조항을 도입 검토 단계에서 놓치기 쉽다는 지적이 되풀이해 나온다고 보고했다. 이는 공식 확인 자료라기보다 커뮤니티·업계 매체의 반복 관찰 보고이므로 실제 도입 전에는 라이선스 원문을 직접 확인해야 한다.

Cursor의 코딩 에이전트 "Composer 2"가 사전 고지 없이 Kimi K2.5 기반으로 판단된다는 보고가 업계 매체에서 다수 확산되며, 오픈웨이트 모델 기반 상용 제품의 출처 표시 관행을 둘러싼 논쟁도 있었다고 전해진다. 비용 절감과 데이터 자체 보관을 목적으로 미국 스타트업들이 DeepSeek·Qwen 등 중국 오픈모델을 자체 인프라에서 구동하는 사례가 늘고 있다는 창업자 인터뷰 기반 보고(davefriedman.substack.com 등)도 다수 관찰되지만, 이는 정량 벤치마크가 아닌 인터뷰 기반 보고임을 함께 밝혀둔다.

Q. 671B~2.8T급 모델을 개인 PC에서 돌릴 수 있나?
사실상 어렵다는 것이 개발자 커뮤니티(HuggingFace 토론 등)의 다수 보고다. Q4·INT4 같은 양자화 없이는 개인·중소기업 하드웨어로 구동이 사실상 불가능하다는 불만이 다수 관찰되며, 대안으로 32B 이하의 증류(distill) 모델을 택하는 사례가 많다고 전해진다.

Q. 중국 오픈모델 출시가 엔비디아 등 반도체 업계에 미치는 영향은?
Kimi K3 출시 직후 엔비디아 주가와 필라델피아 반도체지수가 단기 하락한 사례가 있어 "저비용 중국 모델이 GPU 수요를 줄일 것"이라는 시장 우려가 신랑재경 등 중국 매체에서 제기됐지만, 동시에 자체 호스팅 수요 증가로 온프레미스 GPU 판매가 오히려 늘 것이라는 반대 해석도 업계에서 병존하고 있어 단정하기 어렵다.


정리

중국 오픈웨이트 모델(DeepSeek·Qwen·GLM·Kimi)과 미국 폐쇄형 모델(GPT·Claude·Gemini)의 가장 실질적인 차이는 성능 우열이 아니라 자체 구축 가능 여부다. 종합 지능 지수는 미국 폐쇄형이 3~4%p 근소 우위를 유지하지만 코딩·수학 등 특정 과업에서는 격차가 거의 없다. 온프레미스 GPU 서버를 검토한다면 총 파라미터가 아니라 활성 파라미터·양자화 방식·병렬화 전략을 기준으로 사이징해야 하며, Kimi 계열처럼 커스텀 라이선스의 상업 조건은 도입 전 원문 확인이 필수다.


참고 자료

조사 기준일: 2026년 08월 03일

본문의 수치는 아래 자료에서 확인한 것입니다. 제조사 공식 자료(T1)와 전문 매체 실측(T2)을 구분해 표기했습니다. 가격·공급 상황은 변동이 크므로 기준일 이후의 값은 다시 확인해야 합니다.

Tier 1
- https://huggingface.co/deepseek-ai/DeepSeek-V3.2 (확인일 2026-08-03)
- https://arxiv.org/html/2512.02556v1 — DeepSeek-V3.2 기술보고서 (확인일 2026-08-03)
- https://huggingface.co/deepseek-ai/DeepSeek-V4-Pro (확인일 2026-08-03)
- https://huggingface.co/nvidia/DeepSeek-V3.2-NVFP4 (확인일 2026-08-03)
- https://qwenlm.github.io/blog/qwen3/ (확인일 2026-08-03)
- https://huggingface.co/zai-org/GLM-5.2 (확인일 2026-08-03)
- https://huggingface.co/moonshotai/Kimi-K3 (확인일 2026-08-03)
- https://huggingface.co/moonshotai/Kimi-K2-Instruct, https://huggingface.co/moonshotai/Kimi-K2-Thinking (확인일 2026-08-03)
- https://developers.openai.com/api/docs/models/gpt-5.4 (확인일 2026-08-03)
- https://www.anthropic.com/news/claude-opus-4-5, https://platform.claude.com/docs/en/about-claude/pricing (확인일 2026-08-03)
- Google DeepMind 공식 모델 카드(Gemini 3.1 Pro) (확인일 2026-08-03)
- https://ai.meta.com/blog/llama-4-multimodal-intelligence/ (확인일 2026-08-03)
- https://openai.com/index/introducing-gpt-oss/, https://openai.com/index/gpt-oss-model-card/ (확인일 2026-08-03)
Tier 2
- Stanford HAI AI Index 2026 (thenextweb.com, chinabizinsider.com 보도 인용, 확인일 2026-08-03)
- https://www.theregister.com/2025/07/19/openai_us_china/ (확인일 2026-08-03)
- tech-insider.org — Artificial Analysis Intelligence Index 인용 기사 (확인일 2026-08-03)
- https://inferencex.semianalysis.com — DeepSeek 추론 벤치마크 (확인일 2026-08-03)
- https://www.lmsys.org/blog/2025-05-05-large-scale-ep/ (확인일 2026-08-03)
Tier 3
- aitooldiscovery.com, Medium(Kimi K2.6 관련 후기) (확인일 2026-08-03)
- davefriedman.substack.com — 미국 스타트업의 중국 오픈모델 채택 인터뷰 (확인일 2026-08-03)
- HuggingFace/Dev.to 커뮤니티 토론(로컬 구동·양자화 관련) (확인일 2026-08-03)
- 신랑재경(sina.com.cn) 등 중국 매체 — 중국 오픈모델 출시와 엔비디아 주가 반응 보도 (확인일 2026-08-03)