양자화 Q4 Q5 Q8 — 올리면 뭐가 좋아지나
Ollama에서 모델을 받다 보면 q4_K_M, q5_K_M, q8_0 같은 꼬리표를 보게 됩니다.
숫자가 클수록 좋아 보이지만, 그만큼 VRAM을 더 씁니다. 그 거래가 남는 장사인지 계산해 봤습니다.
양자화가 뭔가요
모델을 압축해서 용량을 줄이는 기술입니다.
원본 모델은 숫자 하나를 정밀하게 저장하는데, 양자화는 그 정밀도를 낮춰서 파일을 작게 만듭니다. 사진을 JPEG로 저장하는 것과 비슷한 발상입니다.
Q 뒤의 숫자가 정밀도입니다. Q8이 Q4보다 정밀합니다.
용량이 얼마나 차이나나
ollama.com 의 실제 배포 파일 크기를 재서 뽑은 값입니다(2026-08-15 확인).
| 양자화 | 파라미터당 | Q4 대비 |
|---|---|---|
| Q4 | 0.63 GB | 기준 |
| Q5 | 0.74 GB | +17% |
| Q8 | 1.09 GB | +73% |
Q8은 Q4보다 73% 더 씁니다. 거의 두 배에 가깝습니다.
14B 모델로 환산하면 이렇습니다.
| 양자화 | 14B 필요 메모리 | 여유롭게 돌리려면 |
|---|---|---|
| Q4 | 약 10.0GB | 12GB |
| Q5 | 약 11.5GB | 16GB |
| Q8 | 약 16.4GB | 24GB 이상 |
같은 14B 모델인데 필요한 카드가 12GB에서 24GB로 바뀝니다. 가격대가 완전히 달라지는 폭입니다.
계산기의 "다른 용도도 함께 보기"를 열면 품질 설정을 바꿔볼 수 있습니다.
그래서 뭐가 좋아지나
정밀도가 올라간 만큼 원본에 가까워집니다.
다만 Q4에서 Q8로 올렸을 때 체감 차이는 크지 않다는 것이 일반적인 경향입니다. Q4가 사실상 표준으로 자리 잡은 이유이기도 합니다.
⚠️ 이 부분은 저희가 직접 측정한 것이 아닙니다. 공개된 자료와 커뮤니티 보고를 근거로 한 서술입니다. 용량 수치는 실측이지만, 품질 차이는 그렇지 않습니다.
핵심 — 같은 VRAM이면 어느 쪽인가
여기가 실제로 판단이 필요한 지점입니다.
16GB 카드를 가지고 있다고 해봅시다. 두 가지 선택이 있습니다.
A. 14B 를 Q8 로 → 16.4GB → 안 들어감
B. 14B 를 Q4 로 → 10.0GB → 여유
C. 22B 를 Q4 로 → 15.1GB → 빠듯하게 들어감
A는 아예 안 됩니다. 그러면 B와 C 중에서 고르게 되는데, 대체로 C가 낫습니다. 더 큰 모델이 주는 이득이 양자화 정밀도보다 크기 때문입니다.
같은 VRAM이라면 "작은 모델을 Q8로"보다 "큰 모델을 Q4로"가 대체로 낫습니다.
이건 반대 방향으로도 성립합니다. Q4 아래(Q3, Q2)로 내려서 더 큰 모델을 욱여넣는 것은 권하지 않습니다. 그 아래로는 품질 저하가 체감되기 시작합니다.
Q2·Q3 ← 너무 낮음, 품질 저하 체감
Q4 ← 여기가 균형점
Q5 ← 여유 있으면 고려
Q8 ← 용량 대비 이득이 작음
언제 Q5나 Q8을 쓰나
VRAM이 남을 때만입니다.
| 상황 | 권장 |
|---|---|
| VRAM이 빠듯하다 | Q4 — 고민할 필요 없습니다 |
| 한 단계 큰 모델이 Q4로 들어간다 | 큰 모델 + Q4 |
| 더 큰 모델이 어차피 안 들어간다 | Q5로 올려볼 만합니다 |
| VRAM이 크게 남는다 | Q8도 괜찮습니다 |
세 번째가 실제로 쓸모 있는 경우입니다. 다만 생각보다 자리가 좁습니다.
예를 들어 12GB 카드에서 14B는 Q4로 10.0GB이고, 그다음 크기(22B)는 Q4로도 15.1GB라 어차피 안 들어갑니다. 그러면 Q5를 시도해 볼 만한데 14B Q5가 11.5GB라 여유가 아니라 "빠듯"입니다. 긴 내용을 다루면 밀립니다.
16GB 카드라면 14B Q5가 11.5GB로 여유롭게 들어갑니다. Q5를 편하게 쓸 수 있는 건 16GB부터입니다.
VRAM별 정리
Q4 기준으로 여유롭게 돌아가는 조합입니다.
| VRAM | Q4 | Q5 | Q8 |
|---|---|---|---|
| 8GB | 7~8B | 7~8B | 3B |
| 12GB | 12~14B | 7~8B | 7~8B |
| 16GB | 12~14B | 12~14B | 7~8B |
| 24GB | 32B | 20~22B | 12~14B |
| 32GB | 32B | 32B | 20~22B |
Q8 칸은 Q4보다 한두 체급 내려갑니다. 16GB 카드에서 Q8을 쓰면 7~8B가 상한입니다 — Q4였다면 14B가 돌아갈 자리입니다.
12GB 줄이 특히 아깝습니다. Q4로는 14B가 여유롭게 도는데, Q5로만 올려도 곧바로 8B로 내려갑니다(14B Q5 = 11.5GB, 12GB의 90%인 10.8GB를 넘김).
자주 묻는 질문
Ollama에서 기본으로 받으면 뭐가 오나요
대개 Q4 계열이 기본입니다. 태그를 붙이지 않으면 기본값이 받아집니다. 크기를 정확히 알고 싶다면 태그를 직접 지정하세요.
K_M, K_S 같은 건 뭔가요
같은 Q4 안에서도 세부 방식이 나뉜 것입니다.
K_M 이 무난한 선택으로 널리 쓰입니다. 처음에는 신경 쓰지 않으셔도 됩니다.
Q4로 받았는데 파일 크기가 표와 다릅니다
배포판마다 조금씩 다릅니다. 위 수치는 대표 모델 9종의 평균이라
개별 모델은 ±10% 정도 차이날 수 있습니다.
정확한 값은 ollama.com 의 해당 모델 페이지에서 확인하세요.
양자화하면 한국어가 나빠지나요
양자화는 언어를 가리지 않고 전체 정밀도를 낮춥니다. 다만 원래 한국어가 약한 모델은 양자화 후 더 티가 날 수 있습니다. 모델 종류를 먼저 고르시는 편이 낫습니다.
32B를 Q8로 쓰려면 어떤 카드가 필요한가요
32B Q8이면 약 36GB입니다. 개인용 그래픽카드로는 불가능합니다. 맥 통합메모리 64GB 이상이라면 가능합니다 — 맥 통합메모리 글을 참고하세요.
정리
- Q8은 Q4보다 용량을 73% 더 씁니다. 거의 두 배입니다
- 같은 14B라도 Q4는 12GB, Q8은 24GB 이상이 필요합니다
- 같은 VRAM이면 "큰 모델 + Q4"가 대체로 낫습니다
- Q4 아래로는 내려가지 마세요. 품질 저하가 체감됩니다
- Q5·Q8은 VRAM이 남을 때만 고려하세요
VRAM 용량별 전체 표는 Ollama 최소 사양 정리에, 8GB에서의 실전 요령은 8GB 활용법에 있습니다.
실제 사용 결과가 다르면 알려주세요. 확인 후 갱신합니다.