VRAM 8GB에서 최대한 뽑아쓰기 — 카드를 바꾸기 전에
8GB 카드로 로컬 LLM을 시작한 분들이 가장 먼저 부딪히는 게 "14B가 안 돌아간다"입니다.
그 벽은 사라지지 않습니다 — 모델 파일만 9GB이기 때문입니다. 다만 8GB 안에서 할 수 있는 게 생각보다 많습니다. 카드를 바꾸기 전에 이것부터 해보세요.
1. 컨텍스트는 늘려도 됩니다
가장 많이 오해하는 부분입니다. 컨텍스트를 아껴봐야 얻는 게 별로 없습니다.
8B 모델을 8GB 카드에서 돌릴 때, 컨텍스트를 늘려도 이 정도만 늘어납니다.
| 다루는 길이 | 필요 메모리 | 판정 |
|---|---|---|
| 짧은 대화 | 약 6.1GB | 여유 |
| A4 두세 장 | 약 6.1GB | 여유 |
| A4 열 장 | 약 6.4GB | 여유 |
| 아주 긴 내용 | 약 6.8GB | 여유 |
가장 긴 설정으로 써도 6.8GB입니다. 8GB 안에 넉넉히 들어갑니다.
메모리를 잡아먹는 건 가중치이고, 컨텍스트 몫은 그에 비하면 작습니다. 그러니 8B를 쓰신다면 컨텍스트를 아끼실 이유가 없습니다. 긴 문서를 넣고 요약시켜도 됩니다.
2. 양자화를 올리면 안 됩니다
"Q4 대신 Q8을 쓰면 더 똑똑해지지 않나" — 8GB에서는 안 됩니다.
| 양자화 | 8B 모델 | 8GB 카드에서 |
|---|---|---|
| Q4 (표준) | 약 6.1GB | 여유 |
| Q5 | 약 7.0GB | 여유 |
| Q8 | 약 9.8GB | 느림 |
Q8로 올리면 8B조차 안 들어갑니다. 용량이 Q4 대비 73% 늘어나기 때문입니다.
Q5는 들어가지만 여유가 줄어듭니다. 8GB에서는 Q4가 정답이고, 이건 대부분의 경우에도 그렇습니다.
3. 8B를 제대로 고르세요
같은 8B라도 모델마다 잘하는 게 다릅니다. 크기가 고정이라면 종류를 고르는 게 유일하게 남은 선택지입니다.
- 한국어 위주라면 한국어를 잘하는 계열
- 코드 위주라면 코드 특화 계열
- 범용이면 무난한 계열
ollama.com/library 에서 8B 근처 모델들을 몇 개 받아 비교해 보세요.
받는 것은 용량만 있으면 되고, 안 쓰는 건 ollama rm 으로 지우면 됩니다.
설치와 명령어는 Ollama 설치 가이드에 있습니다.
4. 3B도 다시 보세요
용도에 따라서는 3B로 충분합니다.
| 용도 | 3B로 되나 |
|---|---|
| 번역 | 됩니다 |
| 맞춤법·문장 다듬기 | 됩니다 |
| 간단한 질문 | 됩니다 |
| 요약 | 짧은 글이면 됩니다 |
| 코드 작성 | 어렵습니다 |
| 복잡한 추론 | 어렵습니다 |
3B는 약 2.9GB라 8GB에서 아주 여유롭습니다. 빠르기도 훨씬 빠릅니다. 간단한 작업은 3B로 돌리고, 무거운 것만 8B로 돌리는 식으로 나눠 쓰면 체감이 좋아집니다.
5. 다른 프로그램이 VRAM을 먹고 있습니다
게임이나 브라우저도 VRAM을 씁니다.
- 브라우저 탭이 많으면 수백 MB에서 1GB 이상
- 영상 편집 프로그램
- 게임 런처
8GB는 여유가 적어서 이런 것들이 체감에 영향을 줍니다. 작업 관리자 → 성능 → GPU 에서 전용 GPU 메모리 사용량을 확인해 보세요. 모델을 올리기 전에 이미 2GB가 차 있다면 그만큼 손해입니다.
6. 안 쓰는 모델은 메모리에서 내리세요
Ollama는 모델을 한 번 올리면 잠시 메모리에 유지합니다.
ollama ps 로 확인하고, 다른 모델을 쓸 거면 정리하는 편이 낫습니다.
두 모델이 동시에 올라가 있으면 VRAM을 나눠 씁니다. 8GB에서는 치명적입니다.
그래도 14B가 필요하다면
여기까지 해도 안 되는 게 있습니다. 14B 이상은 8GB로 해결되지 않습니다.
14B 모델 파일만 9.0GB → 8GB 카드에 애초에 안 들어감
이때는 카드를 바꾸는 수밖에 없습니다.
| 목표 | 필요한 VRAM | 신품 선택지 |
|---|---|---|
| 14B 여유 | 12GB | RTX 5070 |
| 22B까지 | 16GB | RTX 5060 Ti 16GB |
| 32B 여유 | 32GB | RTX 5090 |
비교는 5060 Ti 16GB vs 5070에 있습니다.
자주 묻는 질문
8GB에서 14B를 억지로 돌리면 어떻게 되나요
돌아갑니다. 다만 일부가 CPU로 넘어가 몇 배에서 수십 배 느려집니다. 에러 없이 그냥 느려져서 처음에는 원인을 알기 어렵습니다.
컨텍스트를 최대로 해도 정말 괜찮나요
8B 기준으로는 괜찮습니다. 위 표대로 가장 긴 설정에서도 6.8GB입니다. 다만 14B처럼 이미 빠듯한 모델에서는 컨텍스트가 결정타가 될 수 있습니다.
Q3나 Q2로 내리면 14B가 들어가나요
용량은 줄어듭니다. 다만 Q4 아래로 가면 품질 저하가 체감되기 시작합니다. "14B를 강하게 양자화"보다 "8B를 Q4로"가 대체로 낫습니다.
램을 늘리면 도움이 되나요
VRAM을 넘긴 부분을 램이 떠맡으므로 최소한의 도움은 됩니다. 다만 속도 문제는 해결되지 않습니다. 자세한 기준은 램 16GB vs 32GB에 있습니다.
8GB 카드 두 장을 꽂으면요
용량이 단순히 합쳐지지 않고 통신 오버헤드가 생깁니다. 8GB 두 장보다 16GB 한 장이 낫습니다.
정리
- 컨텍스트는 아끼지 마세요. 8B는 가장 긴 설정에서도 6.8GB입니다
- 양자화는 Q4를 유지하세요. Q8로 올리면 8B도 안 들어갑니다
- 3B를 다시 보세요. 번역·다듬기는 3B로 충분하고 훨씬 빠릅니다
- 다른 프로그램이 먹는 VRAM을 확인하세요
- 14B 이상은 8GB로 해결되지 않습니다. 그때는 카드를 바꿔야 합니다
8GB 카드의 한계선 자체는 8GB로 어디까지 되나에 정리했습니다.
실제 사용 결과가 다르면 알려주세요. 확인 후 갱신합니다.