Ollama 최소 사양 — 내 VRAM으로 몇 B 모델까지 돌아가나
로컬 LLM을 시작할 때 가장 많이 하는 질문은 "어떤 그래픽카드를 사야 하나요"입니다. 그런데 이 질문은 순서가 틀렸습니다. 먼저 정해야 할 것은 돌릴 모델이고, 모델이 정해지면 필요한 VRAM이 정해지고, 그다음에 GPU가 정해집니다.
바로 확인하기
그래픽카드를 고르면 어떤 모델이 돌아가는지 표시됩니다. 컨텍스트 길이를 바꿔보면 판정이 달라지는 것도 볼 수 있습니다.
여유 쓸 수 있습니다
RTX 5060 Ti 16GB로 12~14B 모델은 무리 없습니다. 지금 카드를 그대로 쓰시면 됩니다.지금 카드로는 12~14B까지입니다. 더 큰 20~22B 모델까지 돌리려면 RTX 5090(메모리 32GB) 이상이 필요합니다.
이 길이에서는 대부분이 모델 가중치입니다. 짧게 써도 크게 안 줄어듭니다.
필요 10.6GB = 가중치 8.8 + 컨텍스트 0.8 + 여유 1.0 내 카드 16GB
다른 크기도 함께 보기
| 모델 크기 | 필요 메모리 | 내 카드에서 |
|---|---|---|
| 3B Llama 3.2 3B, Qwen 3B |
3.3GB 가중치 1.9 · 컨텍스트 0.4 |
여유 전부 그래픽카드 메모리에 올라감 |
| 7~8B Llama 3.1 8B, Qwen 7B |
6.5GB 가중치 5.0 · 컨텍스트 0.5 |
여유 전부 그래픽카드 메모리에 올라감 |
| 12~14B Qwen 14B, Gemma 12B |
10.6GB 가중치 8.8 · 컨텍스트 0.8 |
여유 전부 그래픽카드 메모리에 올라감 |
| 20~22B Mistral Small |
15.7GB 가중치 13.9 · 컨텍스트 0.9 |
빠듯 짧은 내용만 다루면 가능 |
| 32B Qwen 32B, QwQ 32B |
22.2GB 가중치 20.2 · 컨텍스트 1.0 |
느림 일부가 CPU로 넘어가 답답해짐 |
| 70B Llama 3.3 70B |
46.4GB 가중치 44.1 · 컨텍스트 1.3 |
불가 실사용이 어려움 |
| 120B+ Mixtral 8x22B급 |
77.6GB 가중치 75.6 · 컨텍스트 1.0 |
불가 실사용이 어려움 |
근사치입니다. 실제로 쓸 모델의 파일 크기는 배포판마다 다릅니다. 경계선에 있다면 한 단계 위 메모리를 택하는 편이 안전합니다.
VRAM별 한계선 지도
VRAM 용량별로 무리 없이 돌아가는 모델 크기입니다. Q4 양자화 기준입니다.
| VRAM | 여유 (전부 VRAM에) | 그 위 | 대표 GPU |
|---|---|---|---|
| 8GB | 7~8B | 12~14B 느림 | RTX 5060, 5050 |
| 12GB | 12~14B | 20~22B 느림 | RTX 5070, 3060 12GB |
| 16GB | 14B | 20~22B 빠듯 · 32B 느림 | RTX 5060 Ti 16GB, 5070 Ti |
| 24GB | 20~22B | 32B 빠듯 · 70B 불가 | RTX 3090(중고) |
| 32GB | 32B | 70B 느림 | RTX 5090 |
| 48GB+ | 32B | 70B 빠듯 · 120B 불가 | RTX 6000 Ada, A6000 |
대표 GPU는 지금 신품으로 살 수 있는 카드 기준입니다. RTX 40 시리즈는 단종되어 뺐습니다 — 같은 VRAM의 현행 카드는 대역폭이 더 높습니다.
판정은 위 계산기와 같은 기준입니다. 글과 도구가 다른 답을 내면 안 되기 때문입니다.
🔴 2026-08-18 정정. 계산기의 KV 캐시(컨텍스트) 계산이 틀려 있었습니다. 파라미터 수에 비례시켰는데 실제로는 레이어 수를 따라갑니다. 그래서 필요 메모리를 실제보다 적게 잡고 있었고, 24GB 줄이
32B에서20~22B로 내려갔습니다. 긴 컨텍스트에서는 차이가 더 큽니다.계산기와 이 사이트의 표는 전부 고친 값으로 맞춰져 있습니다.
8GB가 실질적인 하한선입니다. 그 아래는 7B 모델도 컨텍스트를 크게 줄여야 하고, 사용 경험이 급격히 나빠집니다.
컨텍스트를 줄여도 안 되는 구간이 있습니다
오른쪽 칸을 "컨텍스트를 줄이면 왼쪽 칸이 된다"는 뜻으로 읽으면 안 됩니다.
가중치와 오버헤드는 컨텍스트와 무관하게 먼저 들어갑니다. 이 둘의 합이 이미 VRAM을 넘으면 컨텍스트를 0으로 줄여도 넘습니다.
8GB 카드에 14B 모델
가중치 9.0GB ← 이 숫자만으로 이미 8GB 초과
오버헤드 약 1GB
─────────────────────
컨텍스트를 0 으로 해도 약 10GB > 8GB
컨텍스트 축소가 듣는 것은 경계선에 걸친 조합뿐입니다.
VRAM 계산법
모델 파일 크기가 곧 필요한 VRAM은 아닙니다. 세 가지가 함께 올라갑니다.
필요 VRAM ≈ 모델 가중치 + KV 캐시 + 오버헤드
1. 모델 가중치
Q4 양자화 기준으로 파라미터 수(B) × 약 0.63GB 정도로 잡으면 대체로 맞습니다. Q5·Q8 로 올리면 이 계수가 얼마나 커지는지는 양자화 Q4 Q5 Q8에 있습니다.
계산식이 아니라 실제 배포 파일 크기를 재서 뽑은 값입니다.
아래는 ollama.com 에 올라와 있는 실제 용량입니다 (2026-08-15 확인, Q4_K_M 기준).
| 모델 크기 | 실측 파일 | 확인한 모델 |
|---|---|---|
| 3B | 1.9~2.0GB | llama3.2:3b, qwen2.5:3b |
| 7~8B | 4.7~4.9GB | qwen2.5:7b, llama3.1:8b |
| 14B | 9.0GB | qwen2.5:14b |
| 22B | 13GB | mistral-small:22b |
| 32B | 20GB | qwen2.5:32b |
| 70B | 43GB | llama3.1:70b |
배포판마다 조금씩 다르므로 쓰려는 모델의 실제 용량을 확인하는 편이 가장 정확합니다.
ollama.com 의 모델 페이지에서 태그별로 표시됩니다.
2. KV 캐시 — 여기서 많이 틀립니다
컨텍스트를 길게 잡을수록 VRAM을 더 먹습니다. 모델 크기와 별개입니다.
긴 문서를 넣거나 대화를 길게 이어가면 KV 캐시가 계속 커지고, 어느 순간 VRAM을 넘겨 시스템 램으로 넘어갑니다. 이때부터 속도가 급격히 떨어집니다.
"처음엔 빨랐는데 대화가 길어지니 느려진다"는 대부분 이 문제입니다.
3. 오버헤드
컨텍스트 윈도우와 배치 처리를 위한 여유분으로 1~2GB 정도를 남겨둬야 합니다. VRAM을 100% 채우도록 계산하면 실제로는 안 돌아갑니다.
VRAM이 부족하면 어떻게 되나
에러가 나는 게 아니라 느려집니다. 이게 더 헷갈리는 부분입니다.
Ollama는 VRAM에 다 안 들어가면 일부 레이어를 CPU와 시스템 램으로 넘깁니다. 동작은 하지만 속도가 몇 배에서 수십 배까지 떨어집니다.
전부 VRAM → 초당 수십 토큰 (쓸 만함)
일부 CPU → 초당 수 토큰 (답답함)
대부분 CPU → 초당 1토큰 미만 (사실상 불가)
→ "돌아가긴 한다"와 "쓸 만하다"는 다릅니다. 표에서 "느림"으로 표시한 조합은 돌아가긴 하지만 일상적으로 쓰기엔 답답합니다.
GPU를 고르기 전에 확인할 것
VRAM이 먼저, 연산 성능은 나중
게이밍에서는 연산 성능이 중요하지만, 로컬 LLM에서는 VRAM 용량이 먼저입니다. VRAM이 부족하면 아무리 빠른 GPU라도 CPU로 넘어가면서 느려집니다.
그래서 이런 역전이 생깁니다.
- RTX 5060 Ti 16GB > RTX 5070 12GB — 32B 모델을 돌릴 때
- RTX 3090 24GB > RTX 5070 12GB — 세대가 낮아도 VRAM이 크면 유리
중고 3090이 로컬 LLM 용도로 꾸준히 언급되는 이유가 이것입니다.
메모리 대역폭
VRAM이 충분하다면 그다음은 대역폭입니다. 생성 속도에 직접 영향을 줍니다. 같은 24GB라도 대역폭이 높은 쪽이 눈에 띄게 빠릅니다.
통합 메모리 (맥)
애플 실리콘은 통합 메모리를 VRAM처럼 씁니다. 메모리 64GB 맥에서 70B 모델이 돌아가는 이유입니다. 다만 대역폭이 전용 GPU보다 낮아 생성 속도는 느린 편입니다.
- 용량이 필요하면 → 맥이 유리
- 속도가 필요하면 → 전용 GPU가 유리
표를 보고 나면 생기는 질문들
"8GB인데 14B는 안 되나?" — 돌아가긴 합니다. 다만 컨텍스트를 크게 줄여야 하고 일부 레이어가 CPU로 넘어가 속도가 떨어져서, 8GB에서는 7~8B를 쓰는 편이 훨씬 쾌적합니다. "두 장 꽂으면 합쳐지나?" — 용량은 늘지만 속도는 합쳐지지 않습니다. 카드들이 순서대로 일하고 중간 결과를 주고받는 시간이 붙어서, 8GB 두 장보다 16GB 한 장이 낫습니다 — 파워·슬롯 간격까지 포함한 판단은 그래픽카드 두 장에 있습니다.
AMD 라데온도 VRAM·대역폭 규칙은 제조사와 무관하게 같고, 갈리는 건 실행 프로그램의 지원 범위입니다 — 확인할 것들은 따로 적었습니다. 시스템 램은 모델을 VRAM에 전부 올린다면 16GB로도 충분하고, 넘기는 모델을 쓸 계획일 때 32GB 이상입니다. 양자화를 낮춰 더 큰 모델을 넣는 것도 가능하지만 Q4 아래부터 품질 저하가 체감되기 시작해서, 같은 VRAM이면 "큰 모델을 강하게 양자화"보다 "작은 모델을 Q4로"가 대체로 낫습니다.
원칙은 처음 그대로입니다 — 돌릴 모델을 먼저 정하고(GPU가 아니라), VRAM은 가중치 + KV 캐시 + 여유 1~2GB로 계산하며, 부족하면 에러가 아니라 느려지고, 로컬 LLM에서는 연산 성능보다 VRAM 용량이 먼저입니다.
수치가 최신 정보와 다르거나 실제 사용 결과가 다르다면 알려주세요. 확인 후 본문을 고치고 갱신일을 표시합니다.