램 16GB vs 32GB — 로컬 LLM과 개발에서 갈리는 지점
"로컬 LLM 하려면 램 몇 GB 필요해요?"
가장 많이 돌아오는 답이 "32GB 사세요"입니다. 틀린 답은 아니지만 쓸모도 적습니다. 왜 32GB인지, 16GB로는 정확히 어디서 막히는지를 알아야 판단이 됩니다.
그리고 로컬 LLM에서는 그 답이 본인 GPU에 따라 달라집니다.
결론부터
| 상황 | 필요한 시스템 램 |
|---|---|
| 모델이 VRAM에 전부 들어감 | 16GB 로 충분 |
| VRAM을 조금 넘김 (2~3GB) | 16GB로 가능하지만 여유 없음 |
| VRAM을 크게 넘김 (5GB 이상) | 32GB |
| GPU 없이 CPU로만 | 모델 크기 + 8GB |
핵심은 "VRAM을 얼마나 넘기느냐"입니다. 넘긴 만큼이 시스템 램으로 넘어오기 때문입니다.
램과 VRAM이 각각 무슨 일을 하는지는 로컬 LLM 램 몇 GB 필요한가에 정리했습니다. 이 글은 그다음, "그래서 몇 GB를 사느냐"입니다.
램 요구량은 GPU가 정합니다
여기가 이 글의 핵심입니다.
모델이 VRAM에 다 들어가면 시스템 램은 거의 놀고 있습니다. 못 들어간 만큼만 CPU와 시스템 램이 떠맡습니다. 그러니 계산이 됩니다.
CPU로 넘어가는 양 = 모델이 필요한 메모리 − 내 VRAM
Q4 양자화, A4 두세 장 분량 기준입니다.
| 모델 | 필요 | 8GB (5060) | 12GB (5070) | 16GB (5060 Ti) | 24GB (3090) |
|---|---|---|---|---|---|
| 7~8B | 6.1GB | 전부 VRAM | 전부 VRAM | 전부 VRAM | 전부 VRAM |
| 12~14B | 10.0GB | +2.0GB | 전부 VRAM | 전부 VRAM | 전부 VRAM |
| 20~22B | 15.1GB | +7.1GB | +3.1GB | 전부 VRAM | 전부 VRAM |
| 32B | 21.5GB | +13.5GB | +9.5GB | +5.5GB | 전부 VRAM |
내 조합에서 얼마가 넘어가는지는 아래 계산기로 확인하실 수 있습니다.
이 숫자를 어떻게 읽나
넘어온 양 위에 운영체제와 쓰던 프로그램이 얹힙니다.
16GB 시스템
윈도우 + 브라우저 + 에디터 대략 6~8GB
남는 몫 8~10GB
위 표와 겹쳐 보면 이렇게 갈립니다.
- +2.0GB (5060으로 14B) → 16GB로 됩니다
- +7.1GB (5060으로 22B) → 16GB로는 빠듯합니다. 다른 프로그램을 닫아야 합니다
- +13.5GB (5060으로 32B) → 16GB로는 안 됩니다
"32GB 사세요"가 맞는 경우는 세 번째입니다. 첫 번째에는 돈 낭비입니다.
로컬 LLM 말고, 개발 작업만 봐도
램을 먹는 건 LLM만이 아닙니다. 16GB가 실제로 터지는 순간들입니다.
- 도커 컨테이너 여러 개 — 특히 DB·메시지큐를 같이 띄울 때
- 안드로이드 에뮬레이터 — 하나가 통째로 가상머신입니다
- IDE + 브라우저 탭 수십 개 — 각각은 작아도 합치면 큽니다
- WSL2 — 리눅스에 별도로 램을 떼어 줍니다
- 가상머신
이 중 둘 이상을 동시에 한다면 16GB는 좁습니다. 하나씩만 쓴다면 16GB로도 지장이 없습니다.
지금 내 램이 부족한지 확인하는 법
사기 전에 재보는 게 가장 정확합니다.
윈도우
Ctrl+Shift+Esc→ 작업 관리자- 성능 탭 → 메모리
- 평소 작업을 다 띄운 상태에서 "사용 중" 수치를 봅니다
판단 기준입니다.
| 사용 중 | 판단 |
|---|---|
| 8GB 이하 | 16GB로 충분합니다 |
| 10~13GB | 32GB를 고려할 만합니다 |
| 14GB 이상 | 이미 부족합니다. 스왑이 일어나고 있을 가능성이 큽니다 |
"커밋된 메모리"가 물리 램보다 크면 이미 디스크로 넘어가고 있다는 뜻입니다. 이때는 체감이 확실히 나빠집니다.
32GB로 올릴 때 확인할 것
1. 듀얼 채널로 꽂으세요
같은 32GB라도 16GB 두 장이 32GB 한 장보다 빠릅니다. 메모리 대역폭이 두 배가 되기 때문입니다.
CPU 오프로딩이 일어나는 상황에서는 이 차이가 그대로 체감됩니다. 넘어간 레이어를 시스템 램에서 읽어야 하는데, 그 속도가 두 배가 되는 셈입니다.
메인보드 슬롯이 4개면 보통 2번·4번에 꽂습니다. 설명서를 확인하세요.
2. 규격을 확인하세요
DDR4와 DDR5는 물리적으로 호환되지 않습니다. 슬롯 모양이 다릅니다. 메인보드가 받는 규격을 먼저 확인하세요.
이미 16GB 한 장이 꽂혀 있다면 같은 규격·같은 용량으로 한 장 더 사서 듀얼 채널을 만드는 것이 가장 싸게 가는 방법입니다.
3. 기존 램과 섞을 때
제조사·클럭이 다른 램을 섞으면 낮은 쪽에 맞춰지고, 드물게 불안정할 수 있습니다. 가능하면 같은 제품 두 장이 안전합니다.
노트북은 사정이 다릅니다
최근 얇은 노트북은 램이 메인보드에 납땜되어 있어 나중에 못 늘립니다. LPDDR 계열을 쓰는 모델이 특히 그렇습니다.
- 살 때 "램 슬롯이 있는지"를 확인하세요
- 슬롯이 없다면 살 때 32GB를 골라야 합니다
- 게이밍 노트북이나 두꺼운 모델은 슬롯이 있는 경우가 많습니다
맥은 전부 통합 메모리라 나중에 못 늘립니다. 살 때 정해야 합니다. 게다가 맥은 램이 VRAM 역할까지 하므로 계산이 다릅니다 — 램과 VRAM의 차이를 참고하세요.
64GB는 언제 필요한가
- GPU 없이 CPU로만 큰 모델을 돌릴 계획
- 32B 이상을 오프로딩으로 상시 사용
- 가상머신 여러 대를 동시에
- 대용량 데이터 처리
그 외에는 64GB가 성능을 올려주지 않습니다. 남는 램은 그냥 남습니다 — VRAM처럼 쓰이지 않습니다.
큰 모델을 쓰고 싶다면 램이 아니라 VRAM을 늘려야 합니다. 32B를 제대로 쓰려면 램 64GB가 아니라 VRAM 24GB 이상입니다.
자주 묻는 질문
16GB에서 32GB로 늘리면 로컬 LLM이 빨라지나요
모델이 이미 VRAM에 전부 올라가고 있다면 차이가 없습니다. 반대로 CPU 오프로딩이 일어나고 있었다면 체감할 수 있습니다.
위 표에서 내 GPU와 모델 조합이 "전부 VRAM"이면 램을 늘려도 그대로입니다.
32GB와 64GB 중에 고민입니다
지금 32B 이상을 오프로딩으로 쓸 계획이 없다면 32GB로 충분합니다. 그 돈을 VRAM이 더 큰 그래픽카드에 쓰는 편이 로컬 LLM에서는 훨씬 낫습니다.
DDR4와 DDR5 중 어느 쪽이 유리한가요
CPU 오프로딩을 자주 한다면 대역폭이 높은 DDR5가 유리합니다. 모델이 VRAM에 다 올라가는 환경이라면 차이가 크지 않습니다. 이것 때문에 메인보드와 CPU까지 바꿀 정도의 차이는 아닙니다.
램 클럭도 중요한가요
용량만큼은 아닙니다. 우선순위는 용량 → 듀얼 채널 → 클럭 순입니다. 32GB 싱글 채널보다 32GB 듀얼 채널이 먼저입니다.
16GB 한 장이 있는데 8GB를 더 꽂아도 되나요
동작은 합니다. 다만 용량이 다르면 듀얼 채널 이득을 온전히 못 받습니다 (겹치는 만큼만 듀얼로 동작하는 경우가 많습니다). 같은 용량 한 장을 더 꽂는 편이 낫습니다.
정리
- "32GB 사세요"는 답이 아닙니다. VRAM을 얼마나 넘기느냐가 정합니다
- 모델이 VRAM에 다 들어가면 16GB로 충분합니다
- 넘어가는 양이 5GB 이상이면 32GB가 필요합니다
- 도커·에뮬레이터·VM을 둘 이상 동시에 쓰면 그것만으로도 32GB입니다
- 큰 모델을 쓰고 싶으면 램이 아니라 VRAM을 늘려야 합니다
- 노트북·맥은 나중에 못 늘립니다. 살 때 정하세요
내 GPU에서 어떤 모델이 돌아가는지는 Ollama 최소 사양 정리에 있습니다.
수치가 실제 환경과 다르면 알려주세요. 확인 후 갱신합니다.