램 16GB vs 32GB — 로컬 LLM과 개발에서 갈리는 지점

"로컬 LLM 하려면 램 몇 GB 필요해요?"

가장 많이 돌아오는 답이 "32GB 사세요"입니다. 틀린 답은 아니지만 쓸모도 적습니다. 왜 32GB인지, 16GB로는 정확히 어디서 막히는지를 알아야 판단이 됩니다.

그리고 로컬 LLM에서는 그 답이 본인 GPU에 따라 달라집니다.

답은 네 갈래뿐입니다

모델이 VRAM에 전부 들어가면 16GB로 충분하고, 조금(2~3GB) 넘기면 16GB로 버티지만 여유가 없고, 크게(5GB 이상) 넘기면 32GB가 필요하고, GPU 없이 CPU로만 돌리면 모델 크기 + 8GB를 잡아야 합니다.

핵심은 "VRAM을 얼마나 넘기느냐"입니다. 넘긴 만큼이 시스템 램으로 넘어오기 때문입니다.

램과 VRAM이 각각 무슨 일을 하는지는 로컬 LLM 램 몇 GB 필요한가에 정리했습니다. 이 글은 그다음, "그래서 몇 GB를 사느냐"입니다.

램 요구량은 GPU가 정합니다

여기가 이 글의 핵심입니다.

모델이 VRAM에 다 들어가면 시스템 램은 거의 놀고 있습니다. 못 들어간 만큼만 CPU와 시스템 램이 떠맡습니다. 그러니 계산이 됩니다.

CPU로 넘어가는 양 = 모델이 필요한 메모리 − 내 VRAM

Q4 양자화, A4 두세 장 분량 기준입니다.

모델필요8GB (5060)12GB (5070)16GB (5060 Ti)24GB (3090)
7~8B6.5GB전부 VRAM전부 VRAM전부 VRAM전부 VRAM
12~14B10.6GB+2.6GB전부 VRAM전부 VRAM전부 VRAM
20~22B15.7GB+7.7GB+3.7GB전부 VRAM전부 VRAM
32B22.2GB+14.2GB+10.2GB+6.2GB전부 VRAM

내 조합에서 얼마가 넘어가는지는 아래 계산기로 확인하실 수 있습니다.

여유 쓸 수 있습니다

RTX 5060 Ti 16GB로 12~14B 모델은 무리 없습니다. 지금 카드를 그대로 쓰시면 됩니다.지금 카드로는 12~14B까지입니다. 더 큰 20~22B 모델까지 돌리려면 RTX 5090(메모리 32GB) 이상이 필요합니다.

이 길이에서는 대부분이 모델 가중치입니다. 짧게 써도 크게 안 줄어듭니다.

필요 10.6GB = 가중치 8.8 + 컨텍스트 0.8 + 여유 1.0 내 카드 16GB

다른 크기도 함께 보기
모델 크기필요 메모리내 카드에서
3B
Llama 3.2 3B, Qwen 3B
3.3GB
가중치 1.9 · 컨텍스트 0.4
여유
전부 그래픽카드 메모리에 올라감
7~8B
Llama 3.1 8B, Qwen 7B
6.5GB
가중치 5.0 · 컨텍스트 0.5
여유
전부 그래픽카드 메모리에 올라감
12~14B
Qwen 14B, Gemma 12B
10.6GB
가중치 8.8 · 컨텍스트 0.8
여유
전부 그래픽카드 메모리에 올라감
20~22B
Mistral Small
15.7GB
가중치 13.9 · 컨텍스트 0.9
빠듯
짧은 내용만 다루면 가능
32B
Qwen 32B, QwQ 32B
22.2GB
가중치 20.2 · 컨텍스트 1.0
느림
일부가 CPU로 넘어가 답답해짐
70B
Llama 3.3 70B
46.4GB
가중치 44.1 · 컨텍스트 1.3
불가
실사용이 어려움
120B+
Mixtral 8x22B급
77.6GB
가중치 75.6 · 컨텍스트 1.0
불가
실사용이 어려움

근사치입니다. 실제로 쓸 모델의 파일 크기는 배포판마다 다릅니다. 경계선에 있다면 한 단계 위 메모리를 택하는 편이 안전합니다.

이 숫자를 어떻게 읽나

넘어온 양 위에 운영체제와 쓰던 프로그램이 얹힙니다.

16GB 시스템
  윈도우 + 브라우저 + 에디터   대략 6~8GB
  남는 몫                      8~10GB

위 표와 겹쳐 보면 이렇게 갈립니다.

  • +2.6GB (5060으로 14B) → 16GB로 됩니다
  • +7.7GB (5060으로 22B) → 16GB로는 빠듯합니다. 다른 프로그램을 닫아야 합니다
  • +14.2GB (5060으로 32B) → 16GB로는 안 됩니다

"32GB 사세요"가 맞는 경우는 세 번째입니다. 첫 번째에는 돈 낭비입니다.

로컬 LLM 말고, 개발 작업만 봐도

램을 먹는 건 LLM만이 아닙니다. 16GB가 실제로 터지는 순간들입니다.

  • 도커 컨테이너 여러 개 — 특히 DB·메시지큐를 같이 띄울 때
  • 안드로이드 에뮬레이터 — 하나가 통째로 가상머신입니다
  • IDE + 브라우저 탭 수십 개 — 각각은 작아도 합치면 큽니다
  • WSL2 — 리눅스에 별도로 램을 떼어 줍니다
  • 가상머신

이 중 둘 이상을 동시에 한다면 16GB는 좁습니다. 하나씩만 쓴다면 16GB로도 지장이 없습니다.

지금 내 램이 부족한지 확인하는 법

사기 전에 재보는 게 가장 정확합니다.

윈도우

  1. Ctrl + Shift + Esc → 작업 관리자
  2. 성능 탭 → 메모리
  3. 평소 작업을 다 띄운 상태에서 "사용 중" 수치를 봅니다

판단 기준입니다.

사용 중판단
8GB 이하16GB로 충분합니다
10~13GB32GB를 고려할 만합니다
14GB 이상이미 부족합니다. 스왑이 일어나고 있을 가능성이 큽니다

"커밋된 메모리"가 물리 램보다 크면 이미 디스크로 넘어가고 있다는 뜻입니다. 사용률이 높게 나와 불안하다면 — 그 숫자 자체는 판정 기준이 아닙니다. 이때는 체감이 확실히 나빠집니다.

32GB로 올릴 때 확인할 것

1. 듀얼 채널로 꽂으세요

같은 32GB라도 16GB 두 장이 32GB 한 장보다 빠릅니다. 메모리 대역폭이 두 배가 되기 때문입니다 — 두 장이냐 한 장이냐의 갈림길은 따로 정리했습니다.

CPU 오프로딩이 일어나는 상황에서는 이 차이가 그대로 체감됩니다. 넘어간 레이어를 시스템 램에서 읽어야 하는데, 그 속도가 두 배가 되는 셈입니다.

메인보드 슬롯이 4개면 보통 2번·4번에 꽂습니다. 설명서를 확인하세요. 지금 듀얼로 돌고 있는지 확인하는 법은 듀얼 채널 확인법에 있습니다.

2. 규격을 확인하세요

DDR4와 DDR5는 물리적으로 호환되지 않습니다. 슬롯 모양이 다릅니다. 메인보드가 받는 규격을 먼저 확인하세요.

이미 16GB 한 장이 꽂혀 있다면 같은 규격·같은 용량으로 한 장 더 사서 듀얼 채널을 만드는 것이 가장 싸게 가는 방법입니다.

3. 기존 램과 섞을 때

제조사·클럭이 다른 램을 섞으면 낮은 쪽에 맞춰지고, 드물게 불안정할 수 있습니다. 가능하면 같은 제품 두 장이 안전합니다.

노트북은 사정이 다릅니다

최근 얇은 노트북은 램이 메인보드에 납땜되어 있어 나중에 못 늘립니다. LPDDR 계열을 쓰는 모델이 특히 그렇습니다.

  • 살 때 "램 슬롯이 있는지"를 확인하세요
  • 슬롯이 없다면 살 때 32GB를 골라야 합니다
  • 게이밍 노트북이나 두꺼운 모델은 슬롯이 있는 경우가 많습니다

맥은 전부 통합 메모리라 나중에 못 늘립니다. 살 때 정해야 합니다. 게다가 맥은 램이 VRAM 역할까지 하므로 계산이 다릅니다 — 램과 VRAM의 차이를 참고하세요.

64GB는 언제 필요한가

  • GPU 없이 CPU로만 큰 모델을 돌릴 계획
  • 32B 이상을 오프로딩으로 상시 사용
  • 가상머신 여러 대를 동시에
  • 대용량 데이터 처리

그 외에는 64GB가 성능을 올려주지 않습니다. 남는 램은 그냥 남습니다 — VRAM처럼 쓰이지 않습니다.

큰 모델을 쓰고 싶다면 램이 아니라 VRAM을 늘려야 합니다. 32B를 제대로 쓰려면 램 64GB가 아니라 VRAM 24GB 이상입니다.

사면서 같이 나오는 고민들

"늘리면 빨라지나"부터 — 모델이 이미 VRAM에 전부 올라가고 있다면 램을 늘려도 차이가 없습니다. 반대로 CPU 오프로딩이 일어나고 있었다면 체감합니다. 위 표에서 내 GPU와 모델 조합이 "전부 VRAM"인지가 그 판정입니다.

32GB냐 64GB냐에서 고민된다면 — 32B 이상을 오프로딩으로 쓸 계획이 없는 한 32GB로 충분하고, 그 차액은 VRAM이 더 큰 그래픽카드에 쓰는 편이 로컬 LLM에서는 훨씬 낫습니다. LLM 밖의 작업(가상머신·해석·영상)까지 포함한 판정은 64GB 글에 따로 있습니다.

DDR4냐 DDR5냐는 애초에 고를 수 있는 게 아닙니다 — 메인보드가 정합니다(왜 그런지는 여기). 오프로딩을 자주 하면 대역폭 높은 DDR5가 유리한 방향이긴 하지만, 이것 때문에 보드와 CPU까지 바꿀 정도의 차이는 아닙니다.

클럭은 용량만큼 중요하지 않습니다 — 우선순위는 용량 → 듀얼 채널 → 클럭 순입니다. 그리고 이미 산 클럭조차 기본 설정으로는 안 나옵니다. DDR5-6000을 사도 켜지 않으면 4800으로 돕니다 — XMP·EXPO 확인법이 그 글입니다.

16GB 한 장에 8GB를 더 꽂는 조합은 동작은 하지만 용량이 다르면 듀얼 채널 이득을 온전히 못 받습니다(겹치는 만큼만 듀얼로 도는 경우가 많습니다). 같은 용량 한 장을 더 꽂는 편이 낫습니다.

결론은 처음의 그 문장으로 돌아갑니다 — "32GB 사세요"는 답이 아니라, VRAM을 얼마나 넘기느냐가 답을 정합니다. 다 들어가면 16GB, 5GB 이상 넘치면 32GB, 큰 모델이 목표라면 램이 아니라 VRAM. 그리고 노트북과 맥은 나중에 못 늘리니 살 때 정해야 합니다. 내 GPU에서 어떤 모델이 돌아가는지는 Ollama 최소 사양 정리에 있습니다.

수치가 실제 환경과 다르면 알려주세요. 확인 후 갱신합니다.

RAM 메모리 로컬LLM 개발용PC DDR5