Ollama 최소 사양 — 내 VRAM으로 몇 B 모델까지 돌아가나
로컬 LLM을 시작할 때 가장 많이 하는 질문은 "어떤 그래픽카드를 사야 하나요"입니다. 그런데 이 질문은 순서가 틀렸습니다. 먼저 정해야 할 것은 돌릴 모델이고, 모델이 정해지면 필요한 VRAM이 정해지고, 그다음에 GPU가 정해집니다.
바로 확인하기
그래픽카드를 고르면 어떤 모델이 돌아가는지 표시됩니다. 컨텍스트 길이를 바꿔보면 판정이 달라지는 것도 볼 수 있습니다.
결론부터
VRAM 용량별로 무리 없이 돌아가는 모델 크기입니다. Q4 양자화 기준입니다.
| VRAM | 편하게 돌아감 | 가능하지만 빠듯함 | 대표 GPU |
|---|---|---|---|
| 8GB | 7~8B | 13~14B (컨텍스트 축소) | RTX 4060, 3070 |
| 12GB | 13~14B | 20B대 | RTX 4070, 3080 12GB |
| 16GB | 14B | 32B (컨텍스트 축소) | RTX 4070 Ti Super, 4060 Ti 16GB |
| 24GB | 32B | 70B (강한 양자화 필요) | RTX 4090, 3090 |
| 48GB+ | 70B | 100B+ | RTX 6000 Ada, A6000 |
8GB가 실질적인 하한선입니다. 그 아래는 7B 모델도 컨텍스트를 크게 줄여야 하고, 사용 경험이 급격히 나빠집니다.
VRAM 계산법
모델 파일 크기가 곧 필요한 VRAM은 아닙니다. 세 가지가 함께 올라갑니다.
필요 VRAM ≈ 모델 가중치 + KV 캐시 + 오버헤드
1. 모델 가중치
Q4 양자화 기준으로 파라미터 수(B) × 약 0.6GB 정도로 잡으면 대체로 맞습니다.
| 모델 크기 | Q4 가중치 (대략) |
|---|---|
| 7B | 약 4.5GB |
| 14B | 약 9GB |
| 32B | 약 20GB |
| 70B | 약 42GB |
2. KV 캐시 — 여기서 많이 틀립니다
컨텍스트를 길게 잡을수록 VRAM을 더 먹습니다. 모델 크기와 별개입니다.
긴 문서를 넣거나 대화를 길게 이어가면 KV 캐시가 계속 커지고, 어느 순간 VRAM을 넘겨 시스템 램으로 넘어갑니다. 이때부터 속도가 급격히 떨어집니다.
"처음엔 빨랐는데 대화가 길어지니 느려진다"는 대부분 이 문제입니다.
3. 오버헤드
컨텍스트 윈도우와 배치 처리를 위한 여유분으로 1~2GB 정도를 남겨둬야 합니다. VRAM을 100% 채우도록 계산하면 실제로는 안 돌아갑니다.
VRAM이 부족하면 어떻게 되나
에러가 나는 게 아니라 느려집니다. 이게 더 헷갈리는 부분입니다.
Ollama는 VRAM에 다 안 들어가면 일부 레이어를 CPU와 시스템 램으로 넘깁니다. 동작은 하지만 속도가 몇 배에서 수십 배까지 떨어집니다.
전부 VRAM → 초당 수십 토큰 (쓸 만함)
일부 CPU → 초당 수 토큰 (답답함)
대부분 CPU → 초당 1토큰 미만 (사실상 불가)
→ "돌아가긴 한다"와 "쓸 만하다"는 다릅니다. 표에서 "빠듯함"으로 표시한 조합은 돌아가긴 하지만 일상적으로 쓰기엔 답답할 수 있습니다.
GPU를 고르기 전에 확인할 것
VRAM이 먼저, 연산 성능은 나중
게이밍에서는 연산 성능이 중요하지만, 로컬 LLM에서는 VRAM 용량이 먼저입니다. VRAM이 부족하면 아무리 빠른 GPU라도 CPU로 넘어가면서 느려집니다.
그래서 이런 역전이 생깁니다.
- RTX 4060 Ti 16GB > RTX 4070 12GB — 32B 모델을 돌릴 때
- RTX 3090 24GB > RTX 4070 Ti 12GB — 세대가 낮아도 VRAM이 크면 유리
중고 3090이 로컬 LLM 용도로 꾸준히 언급되는 이유가 이것입니다.
메모리 대역폭
VRAM이 충분하다면 그다음은 대역폭입니다. 생성 속도에 직접 영향을 줍니다. 같은 24GB라도 대역폭이 높은 쪽이 눈에 띄게 빠릅니다.
통합 메모리 (맥)
애플 실리콘은 통합 메모리를 VRAM처럼 씁니다. 메모리 64GB 맥에서 70B 모델이 돌아가는 이유입니다. 다만 대역폭이 전용 GPU보다 낮아 생성 속도는 느린 편입니다.
- 용량이 필요하면 → 맥이 유리
- 속도가 필요하면 → 전용 GPU가 유리
자주 묻는 질문
VRAM 8GB인데 14B 모델을 돌릴 수 있나요
돌아가긴 합니다. 다만 컨텍스트를 크게 줄여야 하고, 일부 레이어가 CPU로 넘어가 속도가 떨어집니다. 8GB에서는 7~8B 모델을 쓰는 편이 훨씬 쾌적합니다.
그래픽카드 두 장을 꽂으면 VRAM이 합쳐지나요
Ollama는 여러 GPU에 레이어를 나눠 올릴 수 있어 큰 모델을 돌리는 데 도움이 됩니다. 다만 단순히 용량이 더해지는 것은 아니고, 카드 간 통신 오버헤드가 생겨 같은 용량의 단일 카드보다 느립니다.
시스템 램은 얼마나 필요한가요
모델을 VRAM에 전부 올린다면 시스템 램은 16GB로도 충분합니다. 다만 VRAM을 넘기는 모델을 쓸 계획이라면 32GB 이상을 권합니다.
양자화를 낮추면 더 큰 모델을 돌릴 수 있나요
가능합니다. Q4 대신 Q3나 Q2를 쓰면 용량이 줄어듭니다. 다만 Q4 아래로 내려가면 품질 저하가 체감되기 시작합니다. 같은 VRAM이라면 "더 큰 모델을 강하게 양자화"보다 "작은 모델을 Q4로"가 대체로 낫습니다.
정리
- 돌릴 모델을 먼저 정합니다 — GPU가 아니라
- VRAM = 가중치 + KV 캐시 + 여유 1~2GB로 계산합니다
- VRAM이 부족하면 에러가 아니라 느려집니다
- 로컬 LLM에서는 연산 성능보다 VRAM 용량이 먼저입니다
수치가 최신 정보와 다르거나 실제 사용 결과가 다르다면 알려주세요. 확인 후 본문을 고치고 갱신일을 표시합니다.