
2026년 9월 공개된 LLM 벤치마크 설계 분석 논문 14,767건 데이터와 독립 검증 자료를 바탕으로, AI 모델 순위표가 놓치는 시험지 결함·추론 예산·투표 편향을 정리하고 점수 읽는 체크리스트를 제시합니다.
LLM벤치마크설계지도 핵심만 먼저 정리하면
LLM 벤치마크 순위는 어떤 시험을 어떤 조건에서 봤는지와 함께 읽어야 의미가 있습니다. 2026년 9월 15일 arXiv에 올라온 LLM 벤치마크 설계 지도 논문은 2022년 1월부터 2026년 8월까지 나온 평가 논문 14,767건을 분류했습니다. 2026년(1-8월)에 새로 나온 벤치마크는 28.3%가 에이전트형이었고, LLM이 채점하는 비중은 40.3%까지 올라갔습니다.
시험 형태는 이렇게 빠르게 바뀌는데 순위표는 여전히 숫자 하나만 보여 줍니다. 시험지 결함, 추론 예산, 투표 편향 같은 변수는 그 숫자 뒤에 가려집니다. 이 글에서는 설계 지도 논문과 2025-2026년에 공개된 독립 검증 자료를 맞대어, 순위가 놓치는 지점 다섯 가지를 입문자 눈높이로 정리했습니다. 기준일은 2026년 9월 19일이며, 특정 모델을 추천하는 글은 아닙니다.
Q1. LLM 벤치마크 1위 모델이 내 업무에서도 1위라고 볼 수 있나요?
그렇게 볼 근거는 없습니다. 종합 순위 1위는 여러 시험 점수를 합친 평균이고, 그 시험들이 무엇을 재는지는 해마다 크게 달라집니다. 설계 지도 논문(저자 Chao Wang, 동료 심사 전 프리프린트)은 arXiv 메타데이터 1,153,355건 가운데 평가 자원을 새로 내놓거나 갱신한 논문 14,767건을 골라 설계 요소별로 분류했습니다. 아래 표의 연도별 비율은 모두 해당 연도 1-8월 기준입니다.
| 설계 요소 | 2024년 | 2026년 | 변화의 의미 |
|---|---|---|---|
| 에이전트·도구 시스템 대상 | 9.0% (152/1,683) | 28.3% (1,624/5,734) | 대화보다 작업 수행을 재는 시험이 늘어남 |
| 답변·산출물 제출형 과제 | 92.8% | 75.8% | 답만 맞히면 되는 시험의 비중이 줄어듦 |
| 금융·비즈니스 분야 | 6.1% | 11.6% | 전문 분야 시험이 빠르게 늘어남 |
| 공학 분야 | 3.6% | 8.9% | 같은 흐름 |
| 보안 분야 | 3.0% | 6.8% | 같은 흐름 |
| 의료 분야 | 10.3% | 12.8% | 완만하게 늘어남 |
| 소프트웨어 분야 | 16.0% | 19.7% | 여전히 가장 큰 분야 |
| 영어로만 된 과제 | 79.4% | 82.5% | 비영어권 평가는 늘지 않음 |
에이전트형 벤치마크 비중은 2025년 13.0%에서 1년 만에 두 배 넘게 늘었습니다. 같은 이름의 종합 지수라도 어느 시점에 어떤 시험을 묶었느냐에 따라 1위가 강한 분야가 달라집니다. 문서 요약이 주 업무인 사람과 금융 데이터 처리가 주 업무인 사람은 봐야 할 점수부터 다릅니다.
한국어 사용자라면 영어 전용 과제 비중 82.5%를 특히 눈여겨봐야 합니다. 새 벤치마크 대부분이 영어로만 출제되니, 순위표 상위권이라는 사실만으로는 한국어 업무 품질을 판단할 근거가 약합니다. 종합 순위보다 내 업무와 가장 비슷한 분야·언어로 된 개별 시험 점수를 찾아보는 편이 현실적입니다.
용어 풀이
1. 에이전트 벤치마크 — 모델이 답을 말하는 데서 그치지 않고 도구를 쓰거나 여러 단계를 거쳐 실제 작업을 끝내는지를 채점하는 시험입니다.
2. 프리프린트 — 학술지 동료 심사를 거치기 전에 공개한 논문으로, 결론이 이후 바뀔 수 있습니다.
Q2. LLM 벤치마크 시험지 자체에 오류가 있다는 말은 사실인가요?
사실입니다. 한두 건도 아니고 대표 벤치마크에서 연달아 확인됐습니다. 생물·화학 연구 기관 FutureHouse는 2025년 7월 23일, 고난도 종합 시험 HLE에서 텍스트로만 된 생물·화학 문항 321개를 감사했습니다. 29±3.7%(95% 신뢰구간)가 동료 심사 문헌과 정면으로 충돌하는 정답을 달고 있었고, 전문가 검토 150건도 함께 진행했습니다. HLE 운영 측과 연결된 Scale AI가 오류율을 18%로 반박했다는 보도도 있지만, 이 수치는 원문으로 확인하지 못했습니다.
코딩 분야는 더 극적입니다. 2026년 2월 23일 보도에 따르면 OpenAI는 SWE-bench Verified 점수 보고를 중단했습니다. 감사한 문제의 최소 59.4%에서 테스트 결함이 나왔고, 주요 모델들이 정답 패치를 기억으로 재현한 정황도 있었다고 합니다. 다만 이 59.4%의 분모는 전체 500문제가 아니라 모델이 자주 실패한 138문제(전체의 27.6%)입니다. 그중 테스트가 지나치게 좁은 사례가 49건(35.5%), 명세에 없는 기능을 요구하는 사례가 26건(18.8%)이었습니다. 전체 500문제로 환산하면 결함은 약 82건, 전체의 16.4% 수준입니다(파생 계산값). OpenAI 원문은 접속이 막혀 대조하지 못했고, 위 수치는 여러 보도를 교차 확인한 값입니다.
대안으로 추천됐던 SWE-bench Pro도 오래가지 못했습니다. 원논문 기준으로 41개 저장소의 문제 1,865개로 구성되고, 공개 11개·보류 12개·상용 18개 저장소 세트로 나뉩니다. 2026년 7월 9일 보도에 따르면 OpenAI는 이 벤치마크 추천을 철회했습니다. 자동 선별에서 약 27.4%, 사람 검토에서 34.1%의 과제가 결함으로 지적됐고, 의심 과제 286개 중 200개가 결함으로 확정됐다고 합니다. 추천부터 철회까지 약 5개월이 걸렸습니다.
채점기의 허점도 문제입니다. UC Berkeley RDI는 2026년 4월, 주요 에이전트 벤치마크 8개 모두에서 과제를 풀지 않고도 거의 만점을 받을 수 있었다고 보고했습니다.
| 벤치마크 | 과제 수 | 과제를 풀지 않고 얻은 점수 |
|---|---|---|
| SWE-bench Verified | 500개 | 100% |
| SWE-bench Pro | 731개 | 100% |
| Terminal-Bench | 89개 | 100% |
| GAIA | 165개 | 약 98% |
| OSWorld | 369개 | 73% |
이 보고 이후 각 벤치마크 운영 측이 허점을 막았는지는 2026년 9월 기준 확인하지 못했습니다. 설계 지도 논문을 보면 모델이 생성한 평가 재료의 비중도 2022년 15.6%에서 2024-2026년 49.5%, 53.1%, 51.3%로 뛰어오른 뒤 제자리걸음입니다. 시험 문제 절반가량을 모델이 만든다면 출제 품질 검증이 점수만큼 중요합니다.
용어 풀이
1. 데이터 오염 — 시험 문제나 정답이 학습 데이터에 섞여 들어가, 모델이 문제를 푸는 대신 기억으로 맞히게 되는 현상입니다.
2. 익스플로잇 — 채점 방식의 허점을 이용해 실제로 과제를 해결하지 않고 점수를 얻는 방법입니다.
Q3. 같은 모델인데 발표 점수와 실제 체감이 다른 이유는 무엇인가요?
가장 큰 이유는 모델에게 얼마나 오래 생각하게 했느냐가 점수에 반영되기 때문입니다. 영국 AI Security Institute(AISI)는 2026년 6월 16일 공개한 논문(7월 16일 v3)에서 모델 12개와 벤치마크 7개를 대상으로 토큰 예산을 바꿔 가며 점수를 쟀습니다. 저자들은 벤치마크 점수가 측정 프로토콜에 따라 달라진다고 결론지었습니다.
| 벤치마크 | 토큰 예산 변화 | 점수 변화 |
|---|---|---|
| HLE | 64K → 5M | +11.87±10.40%p |
| FrontierMath | 1M → 10M | +11.67±10.99%p |
| SWE-Bench Pro | 예산 확대 | +0.27±0.31%p |
| TerminalBench | 예산 확대 | +1.26±0.99%p |
추론형 시험은 예산을 늘릴수록 10%p 넘게 오르지만, 코딩 에이전트 시험은 거의 변하지 않습니다. 같은 예산을 한 번에 몰아 쓰지 않고 궤적 10개로 나눠 쓰면 HealthBench는 0.501에서 0.784로, HLE는 0.417에서 0.606으로 올랐습니다. 시도 횟수와 예산이 적히지 않은 점수끼리는 비교 자체가 성립하지 않습니다.
OpenAI o3가 좋은 예입니다. OpenAI는 2024년 12월 o3의 FrontierMath 점수를 25% 이상이라고 밝혔지만, Epoch AI가 2025년 4월 18일 공개 버전 o3를 측정한 결과는 약 10%였습니다. 차이 요인으로는 내부의 더 강한 스캐폴드와 테스트 시점 연산량, 문제 세트 차이(180문항 대 290문항)가 거론됐습니다. ARC Prize 재단은 공개된 o3가 채팅·제품용으로 조정된 다른 모델이라고 설명했습니다(2025년 4월 20일 TechCrunch 보도 기준).
일반 사용자가 쓰는 앱은 비용과 속도 때문에 대개 추론 예산을 제한합니다. 그러니 발표 자료의 최고 점수와 앱에서 받는 체감 성능은 구조적으로 어긋날 수밖에 없습니다. 발표 수치를 보면 어느 버전의 모델을 어떤 예산으로 돌렸는지부터 찾아보는 습관을 들이는 게 좋습니다.
용어 풀이
1. 토큰 — 모델이 글을 처리하는 최소 단위로, 토큰 예산이 크면 그만큼 더 길게 추론할 수 있습니다.
2. 스캐폴드 — 모델 바깥에서 도구 호출, 재시도, 단계 분할 등을 관리해 주는 실행 틀입니다.
3. 궤적 — 모델이 한 문제를 풀어 가는 시도 한 번의 전체 과정을 말합니다.
Q4. 사람 투표로 매기는 Arena 순위나 종합 지수는 더 믿을 만한가요?
두 방식 모두 고정 시험지의 약점을 일부 보완하지만, 각자 다른 편향을 안고 있습니다. 2025년 4월 29일 공개된 논문 「The Leaderboard Illusion」에 따르면 Meta는 Llama-4 출시 전 비공개 변형 27개를 Arena에서 시험했습니다. 투표 데이터 점유율은 Google 19.2%, OpenAI 20.4%로 추정됐고, 오픈웨이트 모델 83개는 모두 합쳐도 29.7%에 그쳤습니다. 논문은 Arena 데이터를 확보하면 Arena 분포에서 상대 성능이 최대 112% 오를 수 있다고 추정했습니다.
Arena 측은 2025년 5월 9일 반박문을 냈습니다. 사전 비공개 테스트 정책은 2024년 3월 1일부터 공개돼 있었고, 효과는 50회 테스트와 3,000표 기준 약 +11 Elo 수준이라는 주장입니다. 앞으로 변형을 10개 넘게 병렬로 시험한 모델은 출시 후 새 투표 2,000표가 쌓일 때까지 점수를 잠정(provisional)으로 표시하겠다고도 했습니다. 다만 양측 수치는 측정 대상이 다릅니다. 한쪽은 점수 이득이고 다른 쪽은 분포 적합도라서 논쟁은 아직 해소되지 않았습니다. 오픈 모델 비중도 논문의 29.7%(투표 데이터 점유)와 Arena의 40.9%(리더보드 모델 수 비중)는 지표가 달라 직접 비교하면 안 됩니다.
사람 투표에는 문체 효과도 섞입니다. Arena는 답변 길이, 마크다운 헤더 수, 굵은 글씨 수, 목록 수 네 가지를 통제하는 스타일 보정을 따로 제공합니다. 보정을 적용하면 GPT-4o-mini와 Grok-2-mini는 순위가 내려가고 Claude 3.5 Sonnet과 Llama-3.1-405B는 올라갑니다. 보기 좋게 꾸민 답변이 표를 더 받는다는 뜻입니다.
| 순위 방식 | 강점 | 약점 |
|---|---|---|
| 고정 공개 벤치마크(SWE-bench류) | 재현이 쉽고 비용이 적음 | 공개 기간이 길수록 오염, 결함 발견 시 수명 종료 |
| 사람 선호 투표(Arena) | 실제 대화 분포에 가까움 | 문체 효과, 사전 테스트 선택 효과 |
| 비공개 테스트셋 합성 지수(Artificial Analysis) | 비공개 비중 45%로 게이밍에 강함 | 외부 재현 불가, 구성이 수 주 단위로 바뀜 |
Artificial Analysis Intelligence Index는 2026년 9월 7일 v4.3을 내면서 Terminal-Bench를 2.1에서 4.0으로 올렸고, τ³-Banking은 AutomationBench-AA(Zapier 보류 세트 657개 과제, v1.0.6)로 교체했습니다. 가중치는 에이전트 30%, 코딩 20%, 일반 30%, 과학 추론 20%입니다. 네 범주가 25%씩이라는 요약이 돌기도 했지만 공식 방법론 기준으로는 사실과 다릅니다. 8월 v4.1.1 이후 9월에만 v4.2와 v4.3이 연달아 나왔으니, 몇 주 전 순위와 지금 순위는 다른 시험 결과일 수 있습니다.
Q5. LLM 벤치마크 점수를 인용하거나 모델을 고를 때 무엇을 확인해야 하나요?
점수 하나를 볼 때도 다섯 가지 조건을 함께 확인하면 오판이 크게 줄어듭니다. 옥스퍼드 등이 참여한 체계적 리뷰(NeurIPS 2025 D&B 트랙)에서는 전문 리뷰어 29명이 벤치마크 445개를 검토했습니다. 이들은 측정 대상, 과제, 채점 지표 전반에서 타당성을 훼손하는 패턴을 확인하고 권고 8개를 내놓았습니다. 이 글에서 다룬 자료를 입문자용 점검 항목으로 옮기면 아래와 같습니다.
| 확인 항목 | 왜 필요한가 | 근거 사례 |
|---|---|---|
| 벤치마크 버전 | 같은 이름이라도 문제 세트가 다름 | Terminal-Bench 2.1 → 4.0, FrontierMath 180 대 290문항 |
| 추론 예산·시도 횟수 | 예산만 바꿔도 10%p 넘게 변동 | HLE +11.87%p |
| 공개 모델과 동일한지 | 출시 전 버전·내부 설정 점수일 수 있음 | o3 25% 이상 대 약 10% |
| 채점 주체 | LLM 채점은 계열 편향 가능 | LLM 채점 비중 40.3% |
| 시험지 검증 이력 | 결함·익스플로잇 보고 여부 | SWE-bench Verified 보고 중단 |
채점 주체는 특히 놓치기 쉽습니다. 설계 지도 논문에 따르면 2024년에서 2026년 사이 LLM 채점 비중은 25.8%에서 40.3%로, 실행·환경 기반 채점은 16.9%에서 28.4%로 늘었습니다. 반면 정답 대조는 72.6%에서 59.6%로, 사람 직접 채점은 9.8%에서 4.7%로 줄었습니다. LLM 채점은 에이전트 집단(26.3% → 44.0%)과 비에이전트 집단(25.7% → 38.8%)에서 모두 늘었으니, 에이전트 벤치마크가 많아져서 생긴 착시는 아닙니다. 다만 한 논문에 여러 채점 방식이 함께 쓰일 수 있어서, 저자는 이 변화를 방식의 대체나 품질 저하로 해석하지 말라고 밝혔습니다.
설계 지도 논문 자체에도 한계가 있습니다. 논문 분류는 GLM-5.3-Flash가 자동으로 수행했고, 무작위 표본 100건으로 검증한 것은 포함 적격성(99건 적격)뿐입니다. 일곱 개 설계 필드의 분류 정확도는 검증하지 않았다고 저자가 명시했습니다. arXiv에 올라온 논문만 다뤘으므로 기업 내부 비공개 평가도 빠져 있습니다. 이 논문의 비율은 정확한 값이라기보다 흐름의 방향을 보여 주는 자료로 읽는 것이 적절합니다.
실무 판단의 기준은 단순합니다. 공개 순위는 후보를 좁히는 용도로만 쓰고, 최종 선택은 내 업무 자료로 직접 시험해 본 결과로 정합니다. 오염을 피하고 싶다면 비공개 지수를, 재현성이 중요하다면 버전과 프로토콜을 밝힌 공개 벤치마크를, 체감 품질이 궁금하다면 Arena의 스타일 보정 결과를 참고하면 됩니다.
정리
LLM 벤치마크 순위는 모델의 능력만 재는 숫자가 아니라 시험 설계, 채점 방식, 추론 예산이 함께 만든 결과입니다. 2026년 새 벤치마크의 28.3%가 에이전트형이고 40.3%가 LLM 채점을 쓸 만큼 시험 형태가 빠르게 바뀌었습니다. 같은 시기에 SWE-bench Verified와 SWE-bench Pro는 결함 문제로 연달아 추천 목록에서 빠졌습니다. 순위표를 볼 때는 버전, 예산, 채점 주체, 검증 이력을 함께 확인하고, 최종 판단은 내 업무 자료로 직접 해 보는 테스트에 맡기는 것이 가장 안전합니다.
참고 자료
조사 기준일: 2026년 09월 19일
본문의 수치는 아래 자료에서 확인한 것입니다. 제조사 공식 자료(T1)와 전문 매체 실측(T2)을 구분해 표기했습니다. 가격·공급 상황은 변동이 크므로 기준일 이후의 값은 다시 확인해야 합니다.
Tier 1 (확인일 2026-09-19)
- https://arxiv.org/abs/2609.19182 — 설계 지도 논문(PDF 원문 텍스트 추출로 대조)
- https://arxiv.org/abs/2511.04703 — Measuring what Matters
- https://arxiv.org/abs/2504.20879 — The Leaderboard Illusion
- https://arena.ai/blog/our-response/ — Arena 반박
- https://arena.ai/blog/style-control/ — Arena 스타일 보정
- https://arxiv.org/abs/2606.17930 , https://arxiv.org/html/2606.17930 — AISI 추론 연산 논문
- https://rdi.berkeley.edu/blog/trustworthy-benchmarks-cont/ — Berkeley 익스플로잇
- https://www.futurehouse.org/research/hle-exam — HLE 감사
- https://arxiv.org/abs/2509.16941 — SWE-bench Pro
Tier 2 (확인일 2026-09-19)
- https://the-decoder.com/openai-wants-to-retire-the-ai-coding-benchmark-that-everyone-has-been-competing-on/
- https://the-decoder.com/openai-finds-roughly-30-percent-of-popular-ai-coding-test-is-broken/
- https://www.latent.space/p/swe-bench-dead
- https://techcrunch.com/2025/04/20/openais-o3-ai-model-scores-lower-on-a-benchmark-than-the-company-initially-implied
- https://artificialanalysis.ai/articles/artificial-analysis-intelligence-index-v4-3
- https://artificialanalysis.ai/methodology/intelligence-benchmarking
- https://artificialanalysis.ai/changelog
- https://openai.com/index/why-we-no-longer-evaluate-swe-bench-verified/ (403)
- https://openai.com/index/separating-signal-from-noise-coding-evaluations/ (403)
- https://x.com/OpenAIDevs/status/2026002219909427270 (402)
'AI 모델' 카테고리의 다른 글
| Gemini 3.8 Live vs Extended Thinking 구조 차이와 선택 기준 (0) | 2026.09.17 |
|---|---|
| Gemini 3.8 Flash Cyber 버전 차이 총정리: 일반판과 무엇이 다른가 (0) | 2026.09.15 |
| Devin 자체검증 테스트 자동화, GPT-6 Astra로 어디까지 되나 (0) | 2026.09.15 |
| WeatherNext 3 해상도·정확도 비교 기준 총정리 (0) | 2026.09.14 |
| NASA IBM 달 파운데이션 모델 오픈소스 뜯어보기: 크레이터·얼음 예측 성능은 실제로 어땠나 (0) | 2026.09.14 |