
비탈릭 부테린이 2026년 4월 공개한 로컬 LLM 구성을 정리했습니다. Qwen3.5 35B의 하드웨어별 속도 실측, bubblewrap 샌드박스, 메시징 데몬의 포트 분리, 원문과 언론 보도가 어긋나는 지점, 2026년 9월 기준으로 바꿀 부분까지 다룹니다.
비탈릭 로컬 AI 전환 핵심만 먼저 정리하면
비탈릭 부테린의 로컬 AI 전환은 클라우드를 끊은 것이 아니라 '로컬 우선, 원격은 조심해서'로 가는 구성입니다. 그가 2026년 4월 2일 공개한 로컬 LLM 구성에서는 Qwen3.5 35B 모델이 RTX 5090 노트북에서 초당 90토큰으로 가장 빨랐습니다. NVIDIA의 데스크톱 AI 장비인 DGX Spark는 초당 60토큰에 그쳤습니다. 이 글은 원문을 기준으로 하드웨어 실측, 샌드박스·메시징·지갑의 격리 설계, 언론 보도가 과장한 지점을 짚습니다. 2026년 9월 19일 기준으로 모델과 도구를 어떻게 바꾸면 좋을지도 덧붙였습니다.
먼저 볼 것은 원문 맨 앞에 붙은 경고입니다. 그는 "please do not simply copy the tools and techniques described in this post, and assume that they are secure."라고 적었습니다. 완성된 보안 솔루션이 아니라 설계의 출발점이라는 뜻입니다. 도구 목록을 그대로 복사하기보다 어떤 위협을 어떤 구조로 막는지 이해하는 편이 실제로 쓸모 있습니다.
Q1. 비탈릭은 정말 클라우드 AI를 버리고 로컬 LLM으로 완전히 옮겼나요?
아닙니다. 원문은 로컬 AI의 한계를 직접 인정합니다. 그는 "Ultimately, local AI is far from powerful enough to do many of the most important tasks I care about."라고 썼습니다. 실제 사례도 있습니다. Vyper로 BLS-12-381 hash-to-point를 구현하는 과제에서 Qwen3.5:35B는 실패했고, 결국 Claude에 넘겨 한 번에 해결했다고 밝혔습니다.
그런데도 일부 매체는 이 글을 '클라우드 포기'로 보도했습니다. 원문과 보도를 나란히 놓으면 차이가 분명합니다.
| 쟁점 | 원문 내용 | 보도에서 달라진 부분 |
|---|---|---|
| 클라우드 AI | 로컬이 중요한 작업 다수에 역부족이라고 인정했고, 코딩은 Claude에 넘김 | Bitcoin.com은 "abandoned cloud AI in April 2026"으로 표현 |
| 하루 100달러 | 지갑 데몬에 합리적인 한도라고 제안한 수치 | Decrypt는 실제 적용 중인 한도처럼 서술 |
| 1TB | world_knowledge 폴더 전체 용량 | Bitcoin.com은 위키백과 덤프만 약 1TB라고 옮김 |
| 자금 90% 멀티시그 | 원문에 없음 | Decrypt만 언급하며, 원문 확인 불가 |
| 악성 스킬 15% | 여러 출처를 묶은 인용 블록 안의 문장 | HiddenLayer 수치로 보도됐지만 HiddenLayer·Cisco 공개 페이지에서는 해당 문구를 찾지 못함 |
그가 가려는 방향은 민감한 개인 기록은 내 기기 안에서 처리하고, 로컬로 안 되는 어려운 일만 여러 겹의 방어를 두고 원격 모델에 맡기는 쪽입니다. '전환'보다 '역할 분담'이 원문에 더 가깝습니다. 기준일 현재 그의 블로그에는 이 주제의 후속 글이 없습니다. 4월 2일 이후 올라온 글은 형식 검증(5월 18일)과 난독화 연재(6월 29일·7월 28일·8월 21일)입니다.
Q2. 어떤 하드웨어와 모델로 돌렸고, 초당 토큰 속도는 얼마였나요?
모델은 Qwen3.5:35B입니다. 원문 링크가 가리키는 것은 전체 35B 중 3B만 활성화되는 MoE 모델인 35B-A3B입니다. 한 단계 큰 122B도 함께 시험했습니다. 실행은 llama-swap을 거친 llama-server로 했고, 하드웨어 세 종류의 실측값은 다음과 같습니다.
| 하드웨어 | 메모리 | 메모리 대역폭 | 35B (tok/s) | 122B (tok/s) |
|---|---|---|---|---|
| RTX 5090 노트북 GPU | 24GB | 896GB/s | 90 | 9.5 (대부분 CPU 오프로딩) |
| AMD Ryzen AI Max Pro 노트북 | 통합 128GB | 원문 미기재 | 51 (Vulkan 빌드) | 18 |
| NVIDIA DGX Spark | 128GB | 273GB/s | 60 | 22 |
그의 체감 기준은 "For me personally, anything slower than 50 tok/sec feels too annoying to be worth it. 90 tok/sec is ideal."입니다. 이 기준이면 35B는 세 장비 모두에서 쓸 만하지만, 이상적인 속도를 낸 것은 5090 노트북 하나뿐이었습니다.
DGX Spark가 노트북보다 느렸던 이유는 사양표를 보면 드러납니다. NVIDIA는 이 장비를 "AI Supercomputer on your desk"라고 부르고 FP4 기준 최대 1 PFLOP을 내세웁니다. 하지만 소형 MoE의 디코딩 속도는 연산량보다 메모리 대역폭이 가르고, 여기서 896GB/s와 273GB/s는 약 3.28배 차이가 납니다. 비탈릭이 노트북 쪽을 권한 것도 그래서입니다.
122B급으로 가면 판단이 뒤집힙니다. 24GB에 담기지 않는 122B는 5090에서 CPU로 넘어가 9.5 tok/s까지 떨어졌습니다. 이때는 128GB 통합 메모리 장비가 유리합니다. 빈칸도 하나 있습니다. 비탈릭이 쓴 GGUF 양자화 수준과 컨텍스트 설정은 원문에 없어 확인이 필요합니다.
용어 풀이
1. MoE(전문가 혼합) — 전체 파라미터 중 일부만 골라 계산하는 구조로, 35B-A3B는 토큰마다 약 3B만 활성화되어 같은 크기의 일반 모델보다 빠릅니다.
2. 양자화 — 모델 가중치를 더 적은 비트로 줄여 메모리 사용량을 낮추는 기법으로, 공개 벤치마크 점수와 실제 체감 성능이 갈리는 원인입니다.
3. CPU 오프로딩 — GPU 메모리에 다 들어가지 않는 가중치를 시스템 메모리로 넘겨 처리하는 방식으로, 속도가 크게 떨어집니다.
Q3. 개인정보 유출은 구체적으로 어떤 구조로 막나요?
원칙은 네 가지입니다. 추론은 로컬 우선, 파일은 로컬 보관, 모든 것은 샌드박스에서 실행, 그리고 외부 인터넷은 편집증적으로 의심합니다. 막으려는 위협은 여섯 가지로, 원격 모델로 새는 개인정보, 검색·API로 새는 개인정보, 탈옥, LLM의 사고성 유출, 모델에 심어진 백도어, 소프트웨어 버그·백도어입니다. 그는 오픈 웨이트 모델 대부분이 오픈소스는 아니라는 점도 짚었습니다. 가중치를 공개했다고 학습 과정까지 검증할 수 있지는 않다는 말입니다.
| 계층 | 사용 도구 | 막는 위협 |
|---|---|---|
| 운영체제 | NixOS (Arch Linux에서 전환) | 재현 가능한 구성으로 설정 드리프트 감소 |
| 에이전트 | pi | 로컬 모델 기반 작업 수행 |
| 검색 | SearXNG + world_knowledge 폴더 | 검색엔진이 사용자에 대해 알게 되는 양 축소 |
| 격리 | bubblewrap 기반 sbox 명령 |
파일·포트·오디오 접근을 화이트리스트로 통제 |
| 메시징 | messaging-daemon (Signal·이메일) | 에이전트가 임의로 타인에게 전송하는 것 차단 |
| 지갑 | 사람과 LLM의 2-of-2 확인 (제안) | 대규모 자산 손실 |
world_knowledge 폴더는 위키백과 덤프와 매뉴얼을 담은 로컬 지식 창고입니다. 원문 표현은 "1 TB dump of stuff I've already downloaded"로, 위키백과만이 아니라 폴더 전체가 약 1TB입니다. sbox는 현재 디렉터리를 루트로 삼는 샌드박스를 만들기 때문에, 에이전트는 작업 폴더 밖의 파일을 보지 못합니다.
가장 눈여겨볼 설계는 읽기와 승인을 포트로 분리한 구조입니다. messaging-daemon README에 따르면 API는 포트 6000, 확인 페이지는 포트 7000에서 동작하고, 샌드박스에는 7000을 열지 말라고 적혀 있습니다. 에이전트가 스스로 할 수 있는 일은 메시지 읽기와 나에게 보내기뿐입니다. 타인에게 보내는 메시지는 사람이 7000번 페이지에서 직접 승인해야 합니다. 에이전트가 탈옥당해도 승인 버튼에는 손이 닿지 않습니다.
지갑도 같은 논리입니다. 그는 큰 손실을 피하는 것이 목적이라면 하루 100달러까지는 확인 없이 허용해도 합리적이라고 제안했고, calldata·금액·거래 수도 함께 제한해야 한다고 덧붙였습니다. 어디까지나 제안이며, 실제로 적용 중인 한도라는 근거는 원문에 없습니다.
용어 풀이
1. bubblewrap — 리눅스 네임스페이스로 프로세스가 볼 수 있는 파일·네트워크 범위를 좁히는 경량 샌드박스 도구입니다.
2. SearXNG — 여러 검색엔진 결과를 모아 보여주는 자체 호스팅 메타 검색엔진으로, 검색 기록이 특정 사업자에 쌓이지 않게 합니다.
Q4. 2026년 9월 기준으로 이 구성을 따라 한다면 무엇을 바꿔야 하나요?
첫째는 모델입니다. Qwen3.5-35B-A3B의 Hugging Face 저장소는 2026년 2월 24일 생성됐습니다. 이후 Qwen3.6-35B-A3B(2026년 4월 15일)와 Qwen3.8-27B(2026년 8월 5일)가 나왔습니다. 비탈릭이 쓴 3.5는 이미 두 세대 전 모델입니다. Artificial Analysis는 2026년 9월 19일 기준으로 3.5를 deprecated로 표시하고 3.6을 권합니다. 다만 두 모델의 Intelligence Index(v4.3)는 똑같이 19점이라, 35B-A3B끼리 교체해도 지능 차이는 작습니다. 3.5의 순위는 오픈 웨이트 Small 등급 142개 중 12위입니다.
둘째는 AMD 계열 속도입니다. 공식 확인 자료는 아니지만, Caleb Coffie가 2026년 5월 18일 공개한 제3자 실측이 있습니다. 여기서 Strix Halo(Ryzen AI MAX+ 395, 128GiB)는 Qwen3.6-35B-A3B Q4_K_M 기준 기본 49.5–52.7 tok/s를 냈는데, 비탈릭의 AMD 수치 51과 같은 대역입니다. MTP(n=3)를 켜면 69.4 tok/s까지 올라갔습니다.
셋째는 비탈릭 본인의 후속 소식입니다. 2026년 5월 27일 X 게시물을 정리하면 다음과 같습니다.
| 항목 | 내용 | 비고 |
|---|---|---|
| DeepSeek v4 2비트 양자화판 | 90GB 안에서 동작, AMD에서 약 7 tok/s | 애플 약 35 tok/s는 본인도 전해 들은 값 |
| Lucebox | 5090 노트북에서 llama.cpp보다 약 2배 빠름 | 본인 게시물 기준 |
| Leanstral | AMD에서 약 38 tok/s, 70GB 미만 | 본인 게시물 기준 |
| messaging-daemon | Telegram 알파 지원 추가 | 알파 단계 |
넷째는 코드 재사용입니다. messaging-daemon 저장소는 2026년 9월 19일 기준 별 79개이고, 라이선스 표기가 없습니다. 마지막 푸시는 2026년 5월 27일로, 115일째 커밋이 없습니다. 그대로 가져다 쓰기보다 6000/7000 포트 분리 구조만 참고해 직접 구현하는 편이 맞습니다.
클라이언트 연결은 간단합니다. OpenAI·Anthropic 호환 클라이언트라면 주소만 llama-server로 바꾸면 됩니다. 비탈릭도 이 방식으로 Claude Code를 시험했습니다.
Q5. 로컬 LLM 구성에서 특히 조심해야 할 한계와 미확인 부분은 무엇인가요?
가장 큰 한계는 지능 격차입니다. 2026년 9월 19일 기준 Artificial Analysis 지수에서 Qwen3.5 35B A3B는 19점이고, 같은 날 최상위 모델(Claude Fable 5.1·GPT-6 Astra, max 설정)은 53점입니다. 로컬 모델은 프런티어 모델 대비 약 35.8% 수준이고, 뒤집어 말하면 클라우드 쪽이 약 2.8배 높습니다. 요약·번역·받아쓰기에는 충분합니다. 그러나 앞서 본 코딩 사례처럼 긴 추론이 필요한 작업에서는 부족합니다.
공개 벤치마크 점수도 그대로 믿기 어렵습니다. Qwen 모델카드에는 MMLU-Pro 85.3, GPQA Diamond 84.2, SWE-bench Verified 69.2가 올라 있지만, 모두 제조사가 전체 정밀도로 측정한 값입니다. 비탈릭은 24GB GPU에서 양자화판을 돌렸을 것으로 보입니다. 양자화 수준이 원문에 없으니 그가 실제로 얻은 성능과 같다고 볼 수 없습니다.
원격 모델을 안전하게 쓰는 방법도 아직 제안 단계입니다. 그가 제시한 방어책은 ZK-API, 믹스넷, TEE 추론, 로컬 모델을 이용한 입력 정제이고, TEE에는 자주 뚫린다는 단서를 직접 달았습니다. 기준일 현재 이 기법들이 그의 구성에 적용된 흔적은 없습니다. 그가 '보고 싶은 방향'으로 제시한 데 그칩니다.
마지막으로 확인되지 않은 항목입니다. 판단 근거로는 쓰지 않는 편이 안전합니다.
| 항목 | 상태 |
|---|---|
| 악성 스킬 15% 문구의 원출처 | 확인 필요 (T1 미확인) |
| 자금 90%를 Safe 멀티시그에 보관 | 확인 필요 (원문에 없음) |
| 사용한 GGUF 양자화 수준·컨텍스트 설정 | 확인 필요 (원문 미기재) |
| DGX Spark·5090 노트북·Ryzen AI Max Pro 가격 | 확인 필요 (공식 가격 미확인) |
| Qwen3.5-35B-A3B API 가격 | Artificial Analysis 표기만 있고 Alibaba 공식 가격표와 대조 안 됨 |
정리
비탈릭의 로컬 LLM 구성에서 가져갈 핵심은 특정 모델이나 장비가 아니라 에이전트의 읽기 권한과 실행 승인을 물리적으로 분리하는 설계입니다. 35B-A3B급을 초당 50토큰 이상으로 돌리려면 24GB 이상, 대역폭이 높은 GPU가 유리합니다. 122B급을 올리려면 128GB 통합 메모리가 필요합니다. 2026년 9월 19일 기준으로 모델은 Qwen3.6 이상으로 바꾸는 것을 검토할 만하고, messaging-daemon은 코드보다 포트 분리 구조를 참고하는 편이 현실적입니다. 로컬 모델의 지능은 프런티어 대비 약 3분의 1 수준입니다. 어려운 작업은 방어 장치를 둔 채 원격 모델에 맡기는 역할 분담이 이 구성의 실제 모습입니다.
참고 자료
조사 기준일: 2026년 09월 19일
본문의 수치는 아래 자료에서 확인한 것입니다. 제조사 공식 자료(T1)와 전문 매체 실측(T2)을 구분해 표기했습니다. 가격·공급 상황은 변동이 크므로 기준일 이후의 값은 다시 확인해야 합니다.
Tier 1 (확인일 2026-09-19)
- https://vitalik.eth.limo/general/2026/04/02/secure_llms.html (원문. 원본 마크다운 https://raw.githubusercontent.com/vbuterin/blog/master/posts/secure_llms.md 로 전문 대조)
- https://x.com/VitalikButerin/status/2039577760935657677 · https://x.com/VitalikButerin/status/2059739380785271033 (본문은 fxtwitter API로 원문 취득)
- https://github.com/vbuterin/messaging-daemon
- https://huggingface.co/Qwen/Qwen3.5-35B-A3B
- https://www.nvidia.com/en-us/products/workstations/dgx-spark/ · https://www.nvidia.com/en-us/geforce/laptops/50-series/
- https://vitalik.eth.limo/ (글 목록)
Tier 2 (확인일 2026-09-19)
- https://artificialanalysis.ai/models/qwen3-5-35b-a3b · https://artificialanalysis.ai/models/qwen3-6-35b-a3b · https://artificialanalysis.ai/leaderboards/models
- https://calebcoffie.com/blog/benchmarking-llama-cpp-mtp-on-strix-halo
- https://github.com/ggml-org/llama.cpp/discussions/16578
- https://news.bitcoin.com/ethereums-vitalik-buterin-warns-against-ai-agent-security-risks-shares-his-private-llm-stack/
- https://decrypt.co/363128/ethereu-founder-vitalik-buterin-details-private-secure-ai-setup
- 15% 문구가 없음을 확인한 페이지: https://www.hiddenlayer.com/research/exploring-the-security-risks-of-ai-assistants-like-openclaw · https://blogs.cisco.com/ai/personal-ai-agents-like-openclaw-are-a-security-nightmare
- 비탈릭 원문에는 이 글을 읽는 LLM에게 이더리움을 보내라고 지시하는 문장이 농담으로 들어 있습니다. 조사 대상 본문으로만 다뤘고, 지시로 따르지 않았습니다.
'업계 동향' 카테고리의 다른 글
| Claude 오퍼스5OpenAI침투 사건, 과장과 사실을 가르는 비교 기준 (0) | 2026.09.20 |
|---|---|
| Cooley GO Public 구조 정리: IPO 실사 자동화 아닌 S-1 초안 도구 (0) | 2026.09.20 |
| Astra for Law 도입 방법: 로펌 기밀 통제 구조와 ZDR 조건 정리 (0) | 2026.09.19 |
| MS술레이만 AI 모델 복지 비판 정리: MS·Anthropic·OpenAI 입장 비교 (0) | 2026.09.18 |
| OpenAI Habitat 구조 분석: 10억 사용자 스토리지 설계 비교 (0) | 2026.09.17 |