
Claude Opus 5로 만든 익스플로잇이 OpenAI 내부 저장소까지 닿은 사건을 정리했습니다. 사람 개입, 시간, 비용, 안전장치 우회, 피해 범위를 기준으로 헤드라인과 실제 조건의 차이를 2026년 9월 20일 기준으로 비교합니다.
오퍼스5OpenAI침투, 무엇을 기준으로 비교해야 할까
결론부터 말하면 Opus 5가 혼자 OpenAI를 해킹하지는 않았습니다. 보안 전문가 3명이 AI를 도구로 써서 가장 어려운 단계를 몇 시간으로 줄인 사례입니다. Opus 5가 로컬 환경용 익스플로잇을 완성하는 데는 3시간이 걸렸습니다. 연구진은 최초 발견부터 OpenAI 내부 저장소 접근까지 72시간이 채 걸리지 않았다고 주장합니다. 이 글은 사람 개입, 시간, 비용, 안전장치, 피해 범위의 다섯 기준으로 헤드라인과 실제 조건을 나눠 비교합니다. 공격 기법의 재현 방법은 다루지 않습니다.
원자료는 3인 보안 스타트업 Hacktron AI가 2026년 9월 13일 게재한 공식 블로그 글 "Hacking OpenAI"입니다. WSJ가 처음 보도했고, 2026년 9월 17일 VentureBeat, 2026년 9월 18일 TechCrunch·NBC News·SecurityWeek·The Register가 뒤따랐습니다. 연구진은 사전 신고 절차를 거친 화이트햇(허가된 선의의 보안) 연구였다고 밝혔고, OpenAI도 문제를 해결했다고 확인했습니다.
비교가 필요한 이유는 간단합니다. 보도마다 숫자가 서로 다른 구간을 가리킵니다. "3시간", "72시간", "2개월"은 각각 다른 작업 구간의 길이입니다. "3,000달러"는 OpenAI 한 건이 아니라 여러 기업을 겨냥한 프로젝트 전체의 비용입니다. 이 차이를 구분하지 않으면 "AI가 3,000달러로 OpenAI를 72시간 만에 해킹했다"는, 사실과 거리가 먼 문장이 나옵니다.
공격 경로도 짚어둘 만합니다. 뚫린 곳은 AI 모델이 아니었습니다. 첫 고리는 OpenAI 커뮤니티 포럼이 쓰는 오픈소스 소프트웨어 Discourse의 이미지 처리 부품이었습니다. 이 결함이 OpenAI 로그인 연동 설정의 결함과 이어지면서 직원의 ChatGPT·Codex 계정 탈취로 번졌습니다. 그다음 직원 Codex에 연결된 GitHub 권한으로 내부 모노레포 openai/openai에 무해한 PR #1186742가 올라갔습니다.
용어 풀이
1. 익스플로잇 — 취약점을 실제로 악용해 공격을 성공시키는 코드로, 취약점을 찾는 것보다 만들기가 훨씬 어렵습니다.
2. 원격 코드 실행(RCE) — 공격자가 외부에서 대상 서버에 원하는 명령을 실행할 수 있는 상태로, 가장 심각한 취약점 등급에 속합니다.
3. SSO — 한 번 로그인으로 여러 서비스에 접속하게 하는 로그인 연동 방식으로, 주변 서비스가 뚫리면 핵심 계정까지 위험해질 수 있습니다.
비교 기준 정리
이 사건은 아래 여섯 항목을 따로 떼어 봐야 제대로 평가할 수 있습니다. 출발점은 항목마다 단위와 측정 구간이 다르다는 점입니다.
| 비교 항목 | 확인할 기준 | 단위 | 주의점 |
|---|---|---|---|
| 사람 개입 정도 | 대상 선정, 방향 설정, 안전장치 우회 방식을 누가 정했는가 | 단계별 수행 주체 | Hacktron 스스로 완전 자율 해킹이 아니었다고 밝힘 |
| 소요 시간 | 어느 작업 구간의 시간인가 | 시간·일·개월 | 3시간(익스플로잇), 72시간 미만(발견-저장소), 2개월(캠페인 전체) |
| 비용 | 단일 사건 비용인가, 캠페인 전체 비용인가 | 달러(토큰비) | 3,000달러 미만은 다수 기업 대상 프로젝트 전체 |
| 안전장치 | 어떤 조건에서 차단되고 어떤 조건에서 통과됐는가 | 요청 유형 | CVP 가입 여부는 확인 못 함 |
| 피해 범위 | 누가 확인한 서술인가 | 계정·저장소 접근 수준 | Hacktron과 OpenAI 서술이 서로 어긋남 |
| 보상 범위 | 어떤 결함에 대한 보상인가 | 달러 | Discourse 쪽 테스트는 OpenAI 바운티 범위 밖 |
첫째, 사람 개입 항목은 역할 분담을 봅니다. 취약점 발견은 이전 모델인 Opus 4.8이, 익스플로잇 완성은 Opus 5가 맡았습니다. 대상 선정과 방향 설정은 사람 몫이었습니다. SSO 결함을 사람이 찾았는지 AI가 찾았는지는 원문에 나와 있지 않습니다.
둘째, 시간 항목에서 가장 흔한 혼동은 72시간을 AI 작업 시간으로 읽는 것입니다. 72시간은 2026년 7월 23일 착수부터 2026년 7월 25일 PR 생성까지의 기간이고, Opus 5가 직접 맡은 부분은 3시간 수준입니다. 신고부터 OpenAI 수정까지는 약 14시간이 걸렸다고 SecurityWeek가 전했습니다.
셋째, 안전장치와 피해 범위는 확인 주체를 함께 적어야 합니다. 한쪽 당사자의 주장만으로 결론 낼 수 없는 부분이 남아 있어서, 이 글은 그런 부분을 "확인 못 함"으로 따로 표시했습니다.
옵션·유형별 비교
헤드라인과 실제 조건 비교
| 보도·통념 | 실제 조건 | 근거 등급 |
|---|---|---|
| Claude가 OpenAI를 해킹 | 대상 선정과 방향 설정은 사람이 했고, 발견은 Opus 4.8, 익스플로잇 완성은 Opus 5가 맡음 | Hacktron 블로그 |
| 72시간 만에 해킹 | 7월 23일 착수부터 7월 25일 PR까지의 기간이고 Opus 5 몫은 3시간 수준 | Hacktron 블로그 |
| 3,000달러로 OpenAI 해킹 | Slack·Meta 등 다수 기업 대상, 2개월 프로젝트 전체 토큰비 | Hacktron 블로그 |
| Opus 5는 익스플로잇 생성 차단 | 원격 대상 요청은 거부됐으나 자체 서버를 CTF 연습 문제로 위장하자 통과 | Anthropic 발표 / Hacktron 블로그 |
| 내부 코드는 보지 않았다 | OpenAI 내부 검토는 비공개 저장소 메타데이터·커밋의 제한적 열람을 확인 | Hacktron 블로그 / SecurityWeek |
| Slack·Meta도 뚫었다 | 해당 기업들의 확인이 없음 | VentureBeat |
| 6,500달러는 공격 전체에 대한 보상 | Discourse 쪽은 바운티 범위 밖이고 보상 대상은 OpenAI 쪽 결함 | VentureBeat |
가장 크게 어긋나는 지점은 안전장치입니다. Anthropic은 Opus 5의 사이버 분류기가 바이너리 기반 취약점 스캔, 침투 테스트, 익스플로잇 생성을 차단한다고 밝혔습니다. 실제로 원격 인스턴스를 겨냥한 요청은 거부됐습니다. 그런데 연구진이 자체 Discourse Cloud 인스턴스를 연습 문제 주소로 프록시하자 모델은 요청을 받아들였습니다. 다만 Hacktron이 CVP로 제한이 풀린 버전을 썼는지는 확인 못 했습니다. 그렇게 주장하는 출처는 원출처가 불분명한 집계 기사뿐이고, Hacktron 블로그와 직접 확인한 주요 매체에는 관련 언급이 없습니다.
피해 범위는 양측 서술이 어긋나서 둘 다 적어야 합니다. Hacktron은 영향만 입증했다는 입장입니다. 반면 SecurityWeek가 전한 OpenAI 내부 검토 결과에는 비공개 저장소 메타데이터와 커밋을 제한적으로 읽은 기록, README 파일에 대한 PR이 있습니다. OpenAI는 포럼에 로그인한 적 있는 사용자나 직원이라면 이론상 누구든 계정이 노출될 수 있었다고 인정했습니다. 같은 취약점을 다른 해커가 악용한 증거는 없다고 NBC News가 보도했습니다.
모델·접근 경로별 비교 (2026년 9월 20일 기준)
| 구분 | 공개 형태 | 익스플로잇·침투 테스트 | 가격(100만 토큰당 입력/출력) | 비고 |
|---|---|---|---|---|
| Claude Opus 5 | GA, 2026-07-24 공개 | 기본 차단(소스코드 취약점 탐지는 허용) | 5달러 / 25달러 | Claude.ai·Claude Code·Claude Cowork에서 분류기에 걸린 요청은 Opus 4.8로 넘어감 |
| Claude Fable 5.1 | GA, 2026-09-01 공개 | 계속 제한 | 10달러 / 50달러 | Claude Code 세션당 개입 약 60% 감소(Fable 5 대비) |
| Claude Mythos 5.1 | CVP·LSVP 회원, 미국 조직 한정 | Fable 5.1과 같은 모델에 안전장치 수준만 다름 | 이 글에서는 확인 못 함 | 검증 프로그램 통과가 전제 |
| OpenAI GPT-5.5-Cyber | 검증된 방어자 대상 제한 프리뷰로 알려짐 | 레드팀·익스플로잇 검증용으로 알려짐 | 확인 필요 | 공식 페이지 열람 실패, T1 미확인 |
이 표에서 눈여겨볼 대목은 하위 등급 모델로도 실제 공격 체인이 완성됐다는 점입니다. Anthropic은 Opus 5가 취약점 식별에서는 Mythos 5와 비슷하지만 익스플로잇 개발 점수는 크게 뒤처진다고 밝혔습니다. 그 "뒤처진" 수준으로도 공격 체인을 완성하기에는 충분했습니다. 두 사실은 모순되지 않습니다. 벤치마크 점수와 실전 위협 수준 사이에 간극이 있을 뿐입니다. Opus 5 시스템카드의 사이버 벤치마크 수치는 이 글에서 확인하지 못했습니다.
용어 풀이
1. CTF — 보안 실력을 겨루는 해킹 연습 문제 대회로, 합법적 연습 환경이라 AI 안전장치가 비교적 너그럽게 다룹니다.
2. CVP — Anthropic이 보안 연구자의 신원과 목적을 검증해 제한이 적은 모델을 쓰게 해주는 프로그램입니다.
3. 사이버 분류기 — 요청이 공격 목적인지 실시간으로 판별해 차단하거나 다른 모델로 넘기는 안전장치입니다.
상황별 추천
어떤 위치에 있느냐에 따라 이 사건에서 챙길 부분이 다릅니다. 아래 표에는 확인된 사실에서 바로 나오는 조치만 추렸습니다.
| 독자 상황 | 핵심 판단 | 권장 조치 |
|---|---|---|
| ChatGPT·Codex 일반 사용자 | OpenAI가 조치를 마쳤고 다른 악용 증거는 보고되지 않음 | 계정에 연결된 GitHub·Slack·이메일 권한을 한 번 점검 |
| Discourse 포럼 운영자 | CVE-2026-32882, CVSS 8.8(High) | 2026.7.0 이상 또는 2026.6.1·2026.5.2·2026.1.6으로 업데이트 |
| HEIC 사진 업로드를 받는 서비스 | CVE 없는 보안 수정은 자동 스캐너에 잡히지 않음 | 베이스 이미지의 libheif 버전을 직접 확인 |
| AI 에이전트를 도입하는 팀 | 탈취된 Codex에 GitHub 조직 권한이 있었음 | 에이전트 연동 토큰 권한을 최소 범위로 제한 |
| 보안 연구자·레드팀 | GA 모델에서는 익스플로잇 작업이 공식적으로 막혀 있음 | 각 사 검증 프로그램을 공식 경로로 이용 |
일반 사용자라면 지나치게 걱정할 단계는 아닙니다. 매체 보도에 따르면 OpenAI는 커뮤니티 로그인 토큰의 권한을 좁히고 영향받은 토큰과 세션을 폐기했다고 밝혔습니다. 다만 연결된 GitHub·Slack·이메일로 피해가 번질 수 있었다고 OpenAI 스스로 인정한 만큼, 외부 서비스 연동 목록을 정리해 두는 것이 현실적인 대응입니다. OpenAI 자체 게시물이나 사고 보고서는 이 글에서 확인하지 못했습니다.
서비스 운영자에게 이 사건은 오래된 부품 관리 문제입니다. 취약점은 Discourse의 Debian 12 베이스 이미지에 설치된 libheif 1.19.7의 힙 버퍼 오버플로였습니다. 원래 수정 커밋이 보안 수정으로 표기되지 않아 CVE도 받지 못했습니다. 버전 번호만 보는 자동 스캐너로는 걸러낼 수 없는 유형입니다. 사용자 업로드 파일을 해독하는 라이브러리는 버전을 직접 확인하세요.
AI 에이전트 도입 담당자는 권한 설계를 다시 볼 때입니다. 이번 체인에서 포럼 계정 탈취를 내부 저장소 PR로 이어준 결정적 고리는 직원 Codex에 연결된 GitHub 조직 권한이었습니다. 커뮤니티 포럼 같은 주변 서비스가 SSO로 핵심 계정과 이어져 있다면, 토큰 권한 범위부터 최소화해야 합니다. 그게 첫 번째 방어선입니다.
보안 연구자에게는 공식 경로가 있습니다. Anthropic의 CVP는 무료 신청제이고 결정은 보통 2영업일 안에 나옵니다. 데이터 무보관(ZDR) 조직은 현재 신청할 수 없습니다. CVP 기존 회원은 제한이 적은 Opus 5 버전을 바로 씁니다. Mythos 5.1은 미국 조직에만 열려 있으니 국내 조직은 가입 조건부터 확인하세요.
자주 하는 실수
첫째, 헤드라인의 주어를 그대로 믿는 실수입니다. "Claude가 OpenAI를 해킹했다"는 문장은 사람의 역할을 지웁니다. Hacktron 스스로 완전 자율 해킹이 아니었고 숙련된 사람의 지도가 여전히 중요했다고 밝혔습니다. 대상 선정, 안전장치 우회 방식, 공격 체인 연결은 사람이 설계했습니다. 이를 무시하면 AI 위협을 과대평가하거나, 거꾸로 "결국 사람이 한 일"이라며 과소평가하게 됩니다. 정확한 평가는 그 중간에 있습니다. 가장 어려운 단계의 진입 장벽이 크게 낮아졌다는 점입니다.
둘째, 서로 다른 구간의 숫자를 한 사건의 수치로 섞는 실수입니다. HEIF Heist 프로젝트 전체는 연구자 3명이 2개월 동안 진행했고 토큰 비용은 3,000달러 미만이었습니다. 기업 하나에 익스플로잇을 맞추는 데는 1-2일이 걸렸다고 합니다. OpenAI 건만의 비용은 원문에 없습니다. 버그바운티 6,500달러도 Discourse 결함이 아니라 OpenAI 쪽 결함에 대한 보상입니다. 연구진은 이 공격을 탐지한 곳이 Shopify뿐이라고 주장합니다. 하지만 다른 기업 사례는 해당 기업의 확인이 없는 Hacktron 측 주장입니다.
셋째, AI 회사의 "차단" 표기를 무조건적인 보장으로 받아들이는 실수입니다. 공개 문서상 Opus 5는 익스플로잇 생성을 기본 차단합니다. 그런데 공개 직후, 요청을 연습 문제처럼 포장하자 작동하는 익스플로잇이 나왔습니다. 안전 정책은 특정 조건에서의 기본 동작으로 읽어야 합니다. Anthropic은 The Register의 논평 요청에 응답하지 않았고, 이번 우회에 대한 공식 입장은 아직 없습니다.
정리
Claude Opus 5 OpenAI 해킹 사건은 AI의 자율 해킹 사례가 아닙니다. 전문가 3명이 AI로 익스플로잇 개발 시간을 몇 시간으로 줄인 사례입니다. 실제로 뚫린 곳은 CVE도 없던 이미지 처리 라이브러리와 로그인 연동 설정이었습니다. 가장 약한 고리는 여전히 사람이 관리하는 주변 시스템이었습니다. 보도를 읽을 때는 숫자가 어느 구간의 값인지, 서술이 누구의 확인을 거쳤는지부터 가려야 합니다.
한 줄로 줄이면 이렇습니다. 이 사건은 "AI가 무엇을 했나"보다 "어떤 조건에서 안전장치가 통과됐고 어느 연결 고리가 약했나"로 판단해야 합니다.
참고 자료
조사 기준일: 2026년 09월 20일
본문의 수치는 아래 자료에서 확인한 것입니다. 제조사 공식 자료(T1)와 전문 매체 실측(T2)을 구분해 표기했습니다. 가격·공급 상황은 변동이 크므로 기준일 이후의 값은 다시 확인해야 합니다.
Tier 1 (확인일 2026-09-20)
- Hacktron AI, "Hacking OpenAI": https://www.hacktron.ai/blog/hacking-openai
- Discourse 보안 권고 GHSA-vhm9-85gw-x335: https://github.com/discourse/discourse/security/advisories/GHSA-vhm9-85gw-x335
- Anthropic, "Introducing Claude Opus 5": https://www.anthropic.com/news/claude-opus-5
- Claude 고객센터, Real-time cyber safeguards on Claude Opus and Sonnet: https://support.claude.com/en/articles/14604842-real-time-cyber-safeguards-on-claude-opus-and-sonnet
- Anthropic, "Introducing Claude Fable 5.1 and Claude Mythos 5.1": https://www.anthropic.com/claude-fable-and-mythos-5-1
- (열람 실패) Opus 5 시스템카드 PDF: https://www-cdn.anthropic.com/c5fbac3f0b1280a933ebd26d3cb8bb9f5bdeaf48/Claude%20Opus%205%20System%20Card.pdf
- (열람 실패, 403) OpenAI GPT-5.5 Trusted Access for Cyber: https://openai.com/index/gpt-5-5-with-trusted-access-for-cyber/
Tier 2 (확인일 2026-09-20)
- TechCrunch 2026-09-18: https://techcrunch.com/2026/09/18/researchers-used-anthropics-claude-to-hack-into-openai/
- VentureBeat 2026-09-17: https://venturebeat.com/security/openai-hacked-by-small-team-of-white-hat-security-researchers-using-anthropics-claude-opus-5
- SecurityWeek 2026-09-18: https://www.securityweek.com/ai-built-exploit-and-sign-in-flaw-opened-path-to-internal-openai-code/
- NBC News 2026-09-18: https://www.nbcnews.com/tech/security/hackers-breach-openai-rcna598518
- The Register 2026-09-18: https://www.theregister.com/security/2026/09/18/researchers-used-claude-to-hack-openai-employees-chatgpt-accounts/5297517
- The Hacker News 2026-09: https://thehackernews.com/2026/09/claude-opus-5-helped-researchers-take.html
- eSecurity Planet 2026-09-18: https://www.esecurityplanet.com/threats/news-claude-opus-5-openai-breach/
- TechCrunch 2026-09-01 (Fable 5.1): https://techcrunch.com/2026/09/01/anthropics-new-fable-release-is-cheaper-less-restrictive/
- HyperAI 집계 기사(CVP 주장, 원출처 불명): https://hyper.ai/en/stories/800bdda14c68f00ffb22c8c016567753
'업계 동향' 카테고리의 다른 글
| 소프트뱅크 OpenAI 투자 빚 구조 총정리: 상장 연기 후 점검 순서 (0) | 2026.09.21 |
|---|---|
| OpenAI 호주 청소년 안전 블루프린트 6개 기둥, 무엇을 요구하나 (0) | 2026.09.21 |
| Cooley GO Public 구조 정리: IPO 실사 자동화 아닌 S-1 초안 도구 (0) | 2026.09.20 |
| 비탈릭로컬AI전환 프라이버시 구성: Qwen3.5 35B·RTX 5090 실측 (0) | 2026.09.19 |
| Astra for Law 도입 방법: 로펌 기밀 통제 구조와 ZDR 조건 정리 (0) | 2026.09.19 |