양자화 Q4 Q5 Q8 — 올리면 뭐가 좋아지나

Ollama에서 모델을 받다 보면 q4_K_M, q5_K_M, q8_0 같은 꼬리표를 보게 됩니다.

숫자가 클수록 좋아 보이지만, 그만큼 VRAM을 더 씁니다. 그 거래가 남는 장사인지 계산해 봤습니다.

양자화가 뭔가요

모델을 압축해서 용량을 줄이는 기술입니다.

원본 모델은 숫자 하나를 정밀하게 저장하는데, 양자화는 그 정밀도를 낮춰서 파일을 작게 만듭니다. 사진을 JPEG로 저장하는 것과 비슷한 발상입니다.

Q 뒤의 숫자가 정밀도입니다. Q8이 Q4보다 정밀합니다.

용량이 얼마나 차이나나

ollama.com 의 실제 배포 파일 크기를 재서 뽑은 값입니다(2026-08-15 확인).

양자화파라미터당Q4 대비
Q40.63 GB기준
Q50.74 GB+17%
Q81.09 GB+73%

Q8은 Q4보다 73% 더 씁니다. 거의 두 배에 가깝습니다.

14B 모델로 환산하면 이렇습니다.

양자화14B 필요 메모리여유롭게 돌리려면
Q4약 10.0GB12GB
Q5약 11.5GB16GB
Q8약 16.4GB24GB 이상

같은 14B 모델인데 필요한 카드가 12GB에서 24GB로 바뀝니다. 가격대가 완전히 달라지는 폭입니다.

계산기의 "다른 용도도 함께 보기"를 열면 품질 설정을 바꿔볼 수 있습니다.

그래서 뭐가 좋아지나

정밀도가 올라간 만큼 원본에 가까워집니다.

다만 Q4에서 Q8로 올렸을 때 체감 차이는 크지 않다는 것이 일반적인 경향입니다. Q4가 사실상 표준으로 자리 잡은 이유이기도 합니다.

⚠️ 이 부분은 저희가 직접 측정한 것이 아닙니다. 공개된 자료와 커뮤니티 보고를 근거로 한 서술입니다. 용량 수치는 실측이지만, 품질 차이는 그렇지 않습니다.

핵심 — 같은 VRAM이면 어느 쪽인가

여기가 실제로 판단이 필요한 지점입니다.

16GB 카드를 가지고 있다고 해봅시다. 두 가지 선택이 있습니다.

A.  14B 를 Q8 로      →  16.4GB  →  안 들어감
B.  14B 를 Q4 로      →  10.0GB  →  여유
C.  22B 를 Q4 로      →  15.1GB  →  빠듯하게 들어감

A는 아예 안 됩니다. 그러면 B와 C 중에서 고르게 되는데, 대체로 C가 낫습니다. 더 큰 모델이 주는 이득이 양자화 정밀도보다 크기 때문입니다.

같은 VRAM이라면 "작은 모델을 Q8로"보다 "큰 모델을 Q4로"가 대체로 낫습니다.

이건 반대 방향으로도 성립합니다. Q4 아래(Q3, Q2)로 내려서 더 큰 모델을 욱여넣는 것은 권하지 않습니다. 그 아래로는 품질 저하가 체감되기 시작합니다.

Q2·Q3   ←  너무 낮음, 품질 저하 체감
Q4      ←  여기가 균형점
Q5      ←  여유 있으면 고려
Q8      ←  용량 대비 이득이 작음

언제 Q5나 Q8을 쓰나

VRAM이 남을 때만입니다.

상황권장
VRAM이 빠듯하다Q4 — 고민할 필요 없습니다
한 단계 큰 모델이 Q4로 들어간다큰 모델 + Q4
더 큰 모델이 어차피 안 들어간다Q5로 올려볼 만합니다
VRAM이 크게 남는다Q8도 괜찮습니다

세 번째가 실제로 쓸모 있는 경우입니다. 다만 생각보다 자리가 좁습니다.

예를 들어 12GB 카드에서 14B는 Q4로 10.0GB이고, 그다음 크기(22B)는 Q4로도 15.1GB라 어차피 안 들어갑니다. 그러면 Q5를 시도해 볼 만한데 14B Q5가 11.5GB라 여유가 아니라 "빠듯"입니다. 긴 내용을 다루면 밀립니다.

16GB 카드라면 14B Q5가 11.5GB로 여유롭게 들어갑니다. Q5를 편하게 쓸 수 있는 건 16GB부터입니다.

VRAM별 정리

Q4 기준으로 여유롭게 돌아가는 조합입니다.

VRAMQ4Q5Q8
8GB7~8B7~8B3B
12GB12~14B7~8B7~8B
16GB12~14B12~14B7~8B
24GB32B20~22B12~14B
32GB32B32B20~22B

Q8 칸은 Q4보다 한두 체급 내려갑니다. 16GB 카드에서 Q8을 쓰면 7~8B가 상한입니다 — Q4였다면 14B가 돌아갈 자리입니다.

12GB 줄이 특히 아깝습니다. Q4로는 14B가 여유롭게 도는데, Q5로만 올려도 곧바로 8B로 내려갑니다(14B Q5 = 11.5GB, 12GB의 90%인 10.8GB를 넘김).

자주 묻는 질문

Ollama에서 기본으로 받으면 뭐가 오나요

대개 Q4 계열이 기본입니다. 태그를 붙이지 않으면 기본값이 받아집니다. 크기를 정확히 알고 싶다면 태그를 직접 지정하세요.

K_M, K_S 같은 건 뭔가요

같은 Q4 안에서도 세부 방식이 나뉜 것입니다. K_M 이 무난한 선택으로 널리 쓰입니다. 처음에는 신경 쓰지 않으셔도 됩니다.

Q4로 받았는데 파일 크기가 표와 다릅니다

배포판마다 조금씩 다릅니다. 위 수치는 대표 모델 9종의 평균이라 개별 모델은 ±10% 정도 차이날 수 있습니다. 정확한 값은 ollama.com 의 해당 모델 페이지에서 확인하세요.

양자화하면 한국어가 나빠지나요

양자화는 언어를 가리지 않고 전체 정밀도를 낮춥니다. 다만 원래 한국어가 약한 모델은 양자화 후 더 티가 날 수 있습니다. 모델 종류를 먼저 고르시는 편이 낫습니다.

32B를 Q8로 쓰려면 어떤 카드가 필요한가요

32B Q8이면 약 36GB입니다. 개인용 그래픽카드로는 불가능합니다. 맥 통합메모리 64GB 이상이라면 가능합니다 — 맥 통합메모리 글을 참고하세요.

정리

  1. Q8은 Q4보다 용량을 73% 더 씁니다. 거의 두 배입니다
  2. 같은 14B라도 Q4는 12GB, Q8은 24GB 이상이 필요합니다
  3. 같은 VRAM이면 "큰 모델 + Q4"가 대체로 낫습니다
  4. Q4 아래로는 내려가지 마세요. 품질 저하가 체감됩니다
  5. Q5·Q8은 VRAM이 남을 때만 고려하세요

VRAM 용량별 전체 표는 Ollama 최소 사양 정리에, 8GB에서의 실전 요령은 8GB 활용법에 있습니다.

실제 사용 결과가 다르면 알려주세요. 확인 후 갱신합니다.

양자화 Q4 로컬LLM VRAM Ollama