AI 모델

Grok 4.6 달라진 점 총정리 — 초보자용 비교 가이드

mdit 2026. 8. 20. 12:36

2026년 8월 12일 공개된 Grok 4.6이 4.5에서 무엇이 달라졌는지, 컨텍스트·가격·속도·독립 측정치를 기준으로 비교했습니다. 발표문과 실측 사이 간극까지 정리합니다.

Grok 4.6, 무엇을 기준으로 비교해야 할까

Grok 4.6, 무엇을 기준으로 비교해야 할까

Grok 4.6에서 실제로 달라진 것은 "한 번에 읽는 분량"이 아니라 "여러 단계짜리 일을 끝까지 붙잡는 능력"입니다. 2026년 8월 12일 공개된 xAI 공식 포스트를 보면 컨텍스트 창은 500,000토큰으로 4.5와 같고, 독립 측정기관 Artificial Analysis의 지능 지수는 56에서 61로 5점 올랐습니다(2026년 8월 20일 확인). 이 글은 그 변화를 컨텍스트·가격·속도·검증 가능성 네 축으로 비교했습니다. 파라미터 수나 내부 아키텍처는 공식 문서에 없어 다루지 않습니다.

여기서 판단 기준이 갈립니다. 새 모델 소식을 볼 때 대부분 "점수가 올랐는지"만 보는데, 체감을 결정하는 건 세 가지입니다. 첫째, 응답이 시작되기까지 기다리는 시간. Artificial Analysis 측정에서 Grok 4.6은 첫 토큰까지 45.15초가 걸렸습니다. 같은 가격대 추론 모델의 중앙값은 2.79초였습니다. 둘째, 내가 이 모델을 쓸 수 있는 곳이 있는지. 공식 포스트에 적힌 채널은 Cursor, Grok Build, API, 그리고 OpenRouter·Vercel·Cloudflare 같은 파트너뿐이고 소비자용 Grok 앱·grok.com·X·SuperGrok은 언급이 없습니다(확인 필요 — 공식 문서 미확인). 셋째, 같은 단가인데 실제 청구액은 달라질 수 있다는 점. 이 세 축을 빼놓고 지수만 보면 판단이 어긋납니다.

용어를 한 줄로 정리하면, 컨텍스트 창은 모델이 한 번의 대화에서 참고하는 글자 분량이고, 추론 강도(reasoning effort)는 답하기 전에 얼마나 오래 생각할지 정하는 설정입니다. Grok 4.6은 low / medium / high(기본) / xhigh 4단계를 지원합니다.


비교 기준 정리

Grok 4.6과 4.5를 놓고 볼 때 확인해야 할 항목을 표로 정리했습니다. 모든 수치는 2026년 8월 20일 기준입니다.

비교 항목 단위·기준 초보자가 놓치는 주의점
컨텍스트 창 토큰 4.6도 500,000토큰, 4.5와 같습니다. "더 커졌다"고 오해하기 쉬운 지점입니다
입력·출력 형식 텍스트/이미지 입력은 텍스트+이미지, 출력은 텍스트만. 문서상 출력 길이 제한은 없다고 표기됩니다
지식 컷오프 날짜 2026년 2월 1일. 그 이후 사건은 모델이 스스로 알지 못합니다
추론 강도 4단계 low·medium·high·xhigh. 기본값이 high라서 아무 설정 없이 쓰면 가장 비싼 쪽으로 돌아갑니다
입력 단가 1M 토큰당 달러 $2(프롬프트 200k 미만) → 200k 이상이면 $4
캐시 입력 단가 1M 토큰당 달러 $0.50 → 200k 이상 구간 $1.00. 4.5의 $0.30에서 오른 유일한 항목입니다
출력 단가 1M 토큰당 달러 $6 → 200k 이상이면 $12
지능 지수 Artificial Analysis Index 61(추론 강도 high 조건, 9개 평가 합산)
태스크당 실측 비용 달러 Grok 4.6 high $0.84 vs 4.5 high $0.36
출력 속도 tokens/second 59.9 tok/s(동급 평균 74보다 느림)
안전 문서 모델카드 유무 모델카드·시스템카드 미공개. 개선 주장을 대조할 1차 문서가 없습니다

이 표에서 가장 중요한 줄은 가격의 2단 구조입니다. xAI 개발자 문서는 프롬프트가 기준 토큰 수에 도달한 요청이면 그 요청의 모든 토큰에 상위 요율을 적용한다고 명시합니다. 초과분만 비싸지는 게 아니라 요청 전체가 비싸집니다. 광고 문구의 "$2 / $6부터"는 프롬프트가 200,000토큰에 닿지 않을 때만 유효한 값입니다. 500k 컨텍스트를 실제로 활용하는 순간 단가는 두 배가 됩니다.


옵션·유형별 비교

옵션·유형별 비교

먼저 같은 계열 안에서 4.5와 4.6이 어떻게 다른지 봅니다.

항목 Grok 4.5 (high) Grok 4.6 (high) 변화
컨텍스트 500,000토큰 500,000토큰 변화 없음
AA 지능 지수 56 61 +5
입력 단가(200k 미만) $2 $2 동결
출력 단가(200k 미만) $6 $6 동결
캐시 입력 $0.30 $0.50 약 67% 인상
태스크당 실측 비용 $0.36 $0.84 약 2.3배

읽어야 할 결론은 분명합니다. 단가는 그대로인데 실제 지출은 두 배 넘게 늘었습니다. 토큰 값이 오른 게 아니라 모델이 답을 만들며 쓰는 토큰 자체가 늘어난 구조입니다. Artificial Analysis는 지능 지수 완주에 출력 72M 토큰, 비용 $1,068.47을 소모했다고 기록했습니다. "같은 값에 더 똑똑해진 교체"가 아니라 "더 많이 생각하고 더 많이 청구되는 교체"인 셈입니다.

경쟁 모델과의 위치도 함께 봐야 합니다. 2026년 8월 20일 기준 가격과 지수입니다.

모델 입력/출력(1M 토큰당) AA 지능 지수 장문 구간 특징
Grok 4.6 (high) $2 / $6 → 200k↑ $4 / $12 61 200k에서 단가가 두 배로 꺾입니다
Claude Opus 5 (max·xhigh) $5 / $25 63(최상위) 최고 정확도, 단가는 2.5~4배
Claude Fable 5 (fallback) $10 / $50, 캐시 히트 $1 62 1M 컨텍스트 전 구간 동일 단가
GPT-5.6 Sol (max) $5 / $30로 알려짐 61(동점) 원문 페이지 접근 실패로 가격은 확인 필요

Artificial Analysis 리더보드에서 Grok 4.6은 변종 포함 182개 모델 중 6위, 1위 Claude Opus 5(63)와는 2점 차입니다. 다만 Claude Fable 5는 90만 토큰 요청도 9천 토큰 요청과 같은 토큰당 단가로 과금한다고 공식 문서가 밝히고 있어, 장문 구간에서는 Grok의 단가 우위가 절반으로 줄어듭니다.

한 가지 짚어야 할 것이 있습니다. 발표 당일 널리 인용된 "1753 ELO"는 xAI 자사 표의 GDPval-AA v2 항목 값입니다. 2026년 8월 LMArena 상위권이 약 1,525점대인 것과 비교하면 애초에 다른 스케일인데, 일부 매체가 이를 챗봇 아레나 점수로 옮겨 적었습니다. 사실과 다른 인용입니다.

속도 측정치도 서로 엇갈립니다. Artificial Analysis는 첫 토큰까지 45.15초, OpenRouter 실측은 지연 0.83초(P50), 처리량 52 tok/s(P50), 24시간 가동률 99.92%로 기록했습니다. 추론 토큰을 포함해 세는지 여부 때문으로 추정되지만 측정 정의 문서를 대조하지 못했습니다(확인 못 함).


상황별 추천

상황별 추천

지금 당장 Grok 4.6을 만져보고 싶은 일반 사용자라면, 서두르지 않아도 됩니다. 공식 안내에 적힌 채널은 Cursor·Grok Build·API·파트너(OpenRouter, Vercel, Cloudflare)뿐이고, 2026년 8월 14일 GitHub Copilot에 추가됐습니다. 소비자용 Grok 앱 지원 여부와 EU 가용성은 공식 문서에 언급이 없습니다(확인 필요 — 공식 문서 미확인). 규제 지역에서 서비스를 준비한다면 별도 확인 없이 도입을 확정하는 건 위험합니다.

긴 문서를 한 번에 넣고 오래 돌리는 작업이 목적이라면, Grok 4.6의 구조를 알고 들어가야 합니다. 프롬프트를 200,000토큰 직전에서 압축하거나 분할하는 것이 가장 큰 절감 지점입니다. 200k에 닿는 순간 그 요청의 모든 토큰이 $4 / $12로 계산되므로, 199k와 201k의 청구액 차이는 단순한 1% 차이가 아닙니다. 반대로 애초에 200k를 훌쩍 넘는 워크로드가 상시라면, 전 구간 동일 단가인 Claude Fable 5 쪽이 계산이 단순하고 캐시 히트 단가도 유리합니다.

대화형으로 빠르게 주고받는 용도라면 Grok 4.6은 맞지 않습니다. 출력 속도 59.9 tok/s는 동급 평균 74보다 느리고, 첫 응답 지연 측정치는 45초대입니다. 사람이 화면을 보며 기다리는 UX에서는 체감이 나쁩니다. 이럴 때는 추론 강도를 high(기본)에서 medium이나 low로 내려 다시 측정해볼 만합니다.

최고 정확도가 필요한 판단 업무라면 Claude Opus 5(AA 63)가 여전히 위에 있습니다. 단가를 우선하되 성능은 동급이어도 좋다면, GPT-5.6 Sol과 지수 61로 동점인 Grok 4.6이 $2 / $6 구간에서 유리합니다. 검증 가능한 안전 문서가 도입 조건인 조직은 Grok 4.6을 선택하기 어렵습니다. 모델카드·시스템카드가 공개되지 않았기 때문입니다.

기존에 Grok 4.5를 쓰던 개발자라면 교체 자체는 간단합니다. 모델 ID를 grok-4.6으로 문자열만 바꾸면 되고, 툴 콜·구조화 출력·추론 강도 4단계를 지원합니다. 다만 캐시 의존도가 높은 에이전트는 실질 인상을 겪습니다. 캐시 입력이 $0.30에서 $0.50으로 올랐기 때문입니다. Grok Build와 Cursor에서는 첫 주 사용량 2배 제공이 공식 안내에 있었으니, 해당 창구를 통한 시험은 비용 부담이 덜했을 것입니다.


자주 하는 실수

자주 하는 실수

첫째, 가격을 "$2 / $6"로만 기억하는 것입니다. 가장 흔하고 가장 비싸게 치르는 실수입니다. 공식 포스트는 "$2부터"라고만 적고 2단 구조를 본문에 설명하지 않습니다. 개발자 문서에 들어가서야 200k 이상 요청 전체가 $4 / $12로 계산된다는 조항이 나옵니다. 여기에 fast 변종은 2배라는 조건까지 겹칩니다. 예산을 짤 때 광고 단가만 넣으면 장문 워크로드에서 실제 청구액이 계획의 두 배 이상으로 뜁니다.

둘째, 벤치마크 점수만 보고 총비용을 계산하지 않는 것입니다. 지수는 56에서 61로 올랐고 토큰 단가는 동결됐으니 "무료 업그레이드"로 보입니다. 그런데 태스크당 실측 비용은 $0.36에서 $0.84로 약 2.3배입니다. 벤치마크 점수와 청구서는 다른 축입니다. 점수 표를 볼 때는 그 점수를 낸 조건(추론 강도 high)과 그 조건에서 소모한 토큰량을 함께 봐야 합니다.

셋째, 발표문의 "즉시 사용 가능"을 내 환경에도 적용되는 말로 읽는 것입니다. 공식 포스트의 가용 채널 목록에 소비자 앱이 없고, GitHub Copilot은 이틀 뒤에 추가됐으며 일부 엔터프라이즈는 관리자 활성화가 필요합니다. 안전 서술도 한 문장 수준으로만 제시됐습니다. 발표 당일 코멘터리에 안전 문서화가 다른 주요 개발사보다 뒤처진다는 지적4.5에서 얼마나 개선된 것인지 불확실하다는 회의론이 함께 실렸다는 점도 참고할 만합니다. Grok 4.7이 3~4주 내 나온다는 발언도 있었지만 일정·스펙 모두 미확정입니다.


정리

Grok 4.6에서 달라진 것은 컨텍스트가 아니라 사고 지속력입니다. 500,000토큰은 그대로이고 독립 측정 지수만 56 → 61로 올랐으며, 그 대가로 태스크당 실측 비용이 약 2.3배가 됐습니다. 고를 기준은 한 줄로 요약됩니다 — 프롬프트가 200,000토큰 아래로 유지되는 대량 배치 작업이면 Grok 4.6이 가격 대비 가장 낫고, 장문 컨텍스트·저지연 대화·검증 가능한 안전 문서가 필요하면 Claude 계열을 봐야 합니다. 모든 가격·점수는 2026년 8월 20일 기준이며, 소비자 앱 지원과 EU 가용성은 아직 공식 문서로 확인되지 않았습니다.


함께 보면 좋은 글


참고 자료

조사 기준일: 2026년 08월 20일

본문의 수치는 아래 자료에서 확인한 것입니다. 제조사 공식 자료(T1)와 전문 매체 실측(T2)을 구분해 표기했습니다. 가격·공급 상황은 변동이 크므로 기준일 이후의 값은 다시 확인해야 합니다.

Tier 1 (모두 2026-08-20 확인)
- https://x.ai/news/grok-4-6 (2026-08-12)
- https://docs.x.ai/developers/grok-4-6
- https://docs.x.ai/developers/models
- https://docs.x.ai/developers/release-notes
- https://x.ai/news/grok-4-6-github-copilot (2026-08-14)
- https://platform.claude.com/docs/en/about-claude/pricing
Tier 2 (모두 2026-08-20 확인)
- https://artificialanalysis.ai/models/grok-4-6
- https://artificialanalysis.ai/leaderboards/models
- https://openrouter.ai/x-ai/grok-4.6
- https://www.testingcatalog.com/icymi-xai-releases-grok-4-6-for-long-running-agent-work/
- https://www.techmeme.com/260812/p39
접근 실패(본문 대조 못 함)
- https://venturebeat.com/technology/spacexai-debuts-grok-4-6-... (HTTP 403)
- https://openai.com/index/advancing-the-price-performance-frontier-with-gpt-5-6/ (HTTP 403)
- https://arena.ai/leaderboard (리더보드 값 미노출)