VRAM 8GB에서 최대한 뽑아쓰기 — 카드를 바꾸기 전에

8GB 카드로 로컬 LLM을 시작한 분들이 가장 먼저 부딪히는 게 "14B가 안 돌아간다"입니다.

그 벽은 사라지지 않습니다 — 모델 파일만 9GB이기 때문입니다. 다만 8GB 안에서 할 수 있는 게 생각보다 많습니다. 카드를 바꾸기 전에 이것부터 해보세요.

1. 컨텍스트는 짧을 때만 공짜입니다

🔴 2026-08-18 정정 — 이 절의 결론이 뒤집혔습니다.

이전 판은 "컨텍스트는 늘려도 됩니다. 가장 긴 설정에서도 6.8GB"라고 적었습니다. 틀렸습니다. 계산기가 KV 캐시(컨텍스트가 쓰는 메모리)를 파라미터 수에 비례시키고 있었는데, 실제로는 레이어 수를 따라갑니다. 그래서 긴 컨텍스트에서 실제보다 최대 5 배 적게 잡고 있었습니다.

아래는 고친 값입니다. 8GB 에서 긴 컨텍스트는 공짜가 아닙니다.

8B 모델을 8GB 카드에서 돌릴 때, 다루는 길이에 따라 이렇게 달라집니다.

다루는 길이가중치컨텍스트필요 메모리판정
짧은 대화5.0GB0.3GB약 6.3GB여유
A4 두세 장5.0GB0.5GB약 6.5GB여유
A4 열 장5.0GB2.0GB약 8.0GB느림
아주 긴 내용5.0GB4.0GB약 10.0GB느림

가장 긴 설정에서는 컨텍스트가 가중치의 80% 까지 올라갑니다. 모델은 5GB 인데 대화 기록이 4GB 를 먹는 셈입니다.

왜 이렇게 커지나

KV 캐시는 레이어마다 토큰 하나씩을 전부 기억해 둡니다.

토큰당 KV = 2(K,V) × 레이어 수 × KV 헤드 수 × 헤드 차원 × 2바이트

8B 모델은 레이어가 32 개라 토큰 하나에 128KB 씩 듭니다. 32,000 토큰이면 그것만 4GB 입니다.

그래서 파라미터가 아니라 레이어 수가 정합니다. 3B 와 8B 의 컨텍스트 몫이 비슷한 이유이기도 합니다(레이어가 28 vs 32).

그래서 어떻게 쓰나

A4 두세 장까지는 신경 쓰지 않으셔도 됩니다. 여기까지가 공짜 구간입니다.

긴 문서를 통째로 넣는 작업은 8GB 에서 무리입니다. 넣으면 돌아가긴 하는데 일부가 CPU 로 넘어가 답답해집니다.

짧은 대화 · 번역 · 코드 몇 줄   →  마음껏 쓰세요
긴 문서 요약 · 코드베이스 전체  →  8GB 로는 빠듯합니다

긴 문서를 자주 다루신다면 컨텍스트를 줄이는 것보다 모델을 3B 로 내리는 편이 낫습니다. 3B 는 가중치가 1.9GB 라 컨텍스트를 4GB 써도 총 7GB 안쪽입니다.

Ollama 에서 이 길이를 실제로 정하는 설정(num_ctx)과, 기본값이 작아 긴 입력이 조용히 잘리는 문제는 컨텍스트 길이 설정에 따로 정리했습니다.

2. 양자화를 올리면 안 됩니다

"Q4 대신 Q8을 쓰면 더 똑똑해지지 않나" — 8GB에서는 안 됩니다.

양자화8B 모델8GB 카드에서
Q4 (표준)약 6.5GB여유
Q5약 7.4GB빠듯
Q8약 10.2GB느림

Q8로 올리면 8B조차 안 들어갑니다. 용량이 Q4 대비 73% 늘어나기 때문입니다.

Q5도 "빠듯"이라 긴 내용을 다루면 밀립니다. 8GB에서는 Q4가 정답이고, 이건 대부분의 경우에도 그렇습니다.

올려서 얻는 게 정확히 무엇인지는 양자화 Q4 Q5 Q8에 실측 용량으로 정리했습니다.

3. 8B를 제대로 고르세요

같은 8B라도 모델마다 잘하는 게 다릅니다. 크기가 고정이라면 종류를 고르는 게 유일하게 남은 선택지입니다.

  • 한국어 위주라면 한국어를 잘하는 계열
  • 코드 위주라면 코드 특화 계열
  • 범용이면 무난한 계열

ollama.com/library 에서 8B 근처 모델들을 몇 개 받아 비교해 보세요. 받는 것은 용량만 있으면 되고, 안 쓰는 건 ollama rm 으로 지우면 됩니다.

설치와 명령어는 Ollama 설치 가이드에 있습니다.

4. 3B도 다시 보세요

용도에 따라서는 3B로 충분합니다.

용도3B로 되나
번역됩니다
맞춤법·문장 다듬기됩니다
간단한 질문됩니다
요약짧은 글이면 됩니다
코드 작성어렵습니다
복잡한 추론어렵습니다

3B는 약 3.3GB라 8GB에서 아주 여유롭습니다. 빠르기도 훨씬 빠릅니다. 간단한 작업은 3B로 돌리고, 무거운 것만 8B로 돌리는 식으로 나눠 쓰면 체감이 좋아집니다.

그리고 긴 문서를 다룰 때는 3B 가 유일한 답일 수 있습니다. 가중치가 작아서 남는 자리를 컨텍스트에 쓸 수 있기 때문입니다 — 위 1절 참고.

5. 다른 프로그램이 VRAM을 먹고 있습니다

게임이나 브라우저도 VRAM을 씁니다.

  • 브라우저 탭이 많으면 수백 MB에서 1GB 이상
  • 영상 편집 프로그램
  • 게임 런처

8GB는 여유가 적어서 이런 것들이 체감에 영향을 줍니다. 작업 관리자 → 성능 → GPU 에서 전용 GPU 메모리 사용량을 확인해 보세요. 모델을 올리기 전에 이미 2GB가 차 있다면 그만큼 손해입니다.

6. 안 쓰는 모델은 메모리에서 내리세요

Ollama는 모델을 한 번 올리면 잠시 메모리에 유지합니다. ollama ps 로 확인하고, 다른 모델을 쓸 거면 정리하는 편이 낫습니다.

두 모델이 동시에 올라가 있으면 VRAM을 나눠 씁니다. 8GB에서는 치명적입니다.

그래도 14B가 필요하다면

여기까지 해도 안 되는 게 있습니다. 14B 이상은 8GB로 해결되지 않습니다.

14B 모델 파일만 9.0GB  →  8GB 카드에 애초에 안 들어감

이때는 카드를 바꾸는 수밖에 없습니다.

목표필요한 VRAM신품 선택지
14B 여유12GBRTX 5070
22B까지16GBRTX 5060 Ti 16GB
32B 여유32GBRTX 5090

비교는 5060 Ti 16GB vs 5070에 있습니다.

여유 쓸 수 있습니다

RTX 5060 Ti 16GB로 12~14B 모델은 무리 없습니다. 지금 카드를 그대로 쓰시면 됩니다.지금 카드로는 12~14B까지입니다. 더 큰 20~22B 모델까지 돌리려면 RTX 5090(메모리 32GB) 이상이 필요합니다.

이 길이에서는 대부분이 모델 가중치입니다. 짧게 써도 크게 안 줄어듭니다.

필요 10.6GB = 가중치 8.8 + 컨텍스트 0.8 + 여유 1.0 내 카드 16GB

다른 크기도 함께 보기
모델 크기필요 메모리내 카드에서
3B
Llama 3.2 3B, Qwen 3B
3.3GB
가중치 1.9 · 컨텍스트 0.4
여유
전부 그래픽카드 메모리에 올라감
7~8B
Llama 3.1 8B, Qwen 7B
6.5GB
가중치 5.0 · 컨텍스트 0.5
여유
전부 그래픽카드 메모리에 올라감
12~14B
Qwen 14B, Gemma 12B
10.6GB
가중치 8.8 · 컨텍스트 0.8
여유
전부 그래픽카드 메모리에 올라감
20~22B
Mistral Small
15.7GB
가중치 13.9 · 컨텍스트 0.9
빠듯
짧은 내용만 다루면 가능
32B
Qwen 32B, QwQ 32B
22.2GB
가중치 20.2 · 컨텍스트 1.0
느림
일부가 CPU로 넘어가 답답해짐
70B
Llama 3.3 70B
46.4GB
가중치 44.1 · 컨텍스트 1.3
불가
실사용이 어려움
120B+
Mixtral 8x22B급
77.6GB
가중치 75.6 · 컨텍스트 1.0
불가
실사용이 어려움

근사치입니다. 실제로 쓸 모델의 파일 크기는 배포판마다 다릅니다. 경계선에 있다면 한 단계 위 메모리를 택하는 편이 안전합니다.

자주 묻는 질문

8GB에서 14B를 억지로 돌리면 어떻게 되나요

돌아갑니다. 다만 일부가 CPU로 넘어가 몇 배에서 수십 배 느려집니다. 에러 없이 그냥 느려져서 처음에는 원인을 알기 어렵습니다.

컨텍스트를 최대로 해도 정말 괜찮나요

아닙니다. 이전 판에서 괜찮다고 적었는데 계산이 틀렸습니다. 8B 기준으로 가장 긴 설정이면 컨텍스트만 4GB 라 총 10GB 가 되고, 8GB 를 넘깁니다. A4 두세 장까지가 공짜 구간입니다.

Q3나 Q2로 내리면 14B가 들어가나요

용량은 줄어듭니다. 다만 Q4 아래로 가면 품질 저하가 체감되기 시작합니다. "14B를 강하게 양자화"보다 "8B를 Q4로"가 대체로 낫습니다.

램을 늘리면 도움이 되나요

VRAM을 넘긴 부분을 램이 떠맡으므로 최소한의 도움은 됩니다. 다만 속도 문제는 해결되지 않습니다. 자세한 기준은 램 16GB vs 32GB에 있습니다.

8GB 카드 두 장을 꽂으면요

총량은 16GB 가 되지만 속도는 합쳐지지 않고, 전력과 발열은 두 배입니다. 8GB 두 장보다 16GB 한 장이 낫습니다. 왜 그런지는 그래픽카드 두 장에 정리했습니다.

정리

  1. 컨텍스트는 A4 두세 장까지가 공짜입니다. 그 위로는 GB 단위로 붙습니다
  2. 양자화는 Q4를 유지하세요. Q8로 올리면 8B도 안 들어갑니다
  3. 3B를 다시 보세요. 번역·다듬기는 3B로 충분하고 훨씬 빠릅니다
  4. 다른 프로그램이 먹는 VRAM을 확인하세요
  5. 14B 이상은 8GB로 해결되지 않습니다. 그때는 카드를 바꿔야 합니다

8GB 카드의 한계선 자체는 8GB로 어디까지 되나에 정리했습니다.

실제 사용 결과가 다르면 알려주세요. 확인 후 갱신합니다.

VRAM 8GB 로컬LLM 양자화 Ollama