램 16GB vs 32GB — 로컬 LLM과 개발에서 갈리는 지점

"로컬 LLM 하려면 램 몇 GB 필요해요?"

가장 많이 돌아오는 답이 "32GB 사세요"입니다. 틀린 답은 아니지만 쓸모도 적습니다. 왜 32GB인지, 16GB로는 정확히 어디서 막히는지를 알아야 판단이 됩니다.

그리고 로컬 LLM에서는 그 답이 본인 GPU에 따라 달라집니다.

결론부터

상황필요한 시스템 램
모델이 VRAM에 전부 들어감16GB 로 충분
VRAM을 조금 넘김 (2~3GB)16GB로 가능하지만 여유 없음
VRAM을 크게 넘김 (5GB 이상)32GB
GPU 없이 CPU로만모델 크기 + 8GB

핵심은 "VRAM을 얼마나 넘기느냐"입니다. 넘긴 만큼이 시스템 램으로 넘어오기 때문입니다.

램과 VRAM이 각각 무슨 일을 하는지는 로컬 LLM 램 몇 GB 필요한가에 정리했습니다. 이 글은 그다음, "그래서 몇 GB를 사느냐"입니다.

램 요구량은 GPU가 정합니다

여기가 이 글의 핵심입니다.

모델이 VRAM에 다 들어가면 시스템 램은 거의 놀고 있습니다. 못 들어간 만큼만 CPU와 시스템 램이 떠맡습니다. 그러니 계산이 됩니다.

CPU로 넘어가는 양 = 모델이 필요한 메모리 − 내 VRAM

Q4 양자화, A4 두세 장 분량 기준입니다.

모델필요8GB (5060)12GB (5070)16GB (5060 Ti)24GB (3090)
7~8B6.1GB전부 VRAM전부 VRAM전부 VRAM전부 VRAM
12~14B10.0GB+2.0GB전부 VRAM전부 VRAM전부 VRAM
20~22B15.1GB+7.1GB+3.1GB전부 VRAM전부 VRAM
32B21.5GB+13.5GB+9.5GB+5.5GB전부 VRAM

내 조합에서 얼마가 넘어가는지는 아래 계산기로 확인하실 수 있습니다.

이 숫자를 어떻게 읽나

넘어온 양 위에 운영체제와 쓰던 프로그램이 얹힙니다.

16GB 시스템
  윈도우 + 브라우저 + 에디터   대략 6~8GB
  남는 몫                      8~10GB

위 표와 겹쳐 보면 이렇게 갈립니다.

  • +2.0GB (5060으로 14B) → 16GB로 됩니다
  • +7.1GB (5060으로 22B) → 16GB로는 빠듯합니다. 다른 프로그램을 닫아야 합니다
  • +13.5GB (5060으로 32B) → 16GB로는 안 됩니다

"32GB 사세요"가 맞는 경우는 세 번째입니다. 첫 번째에는 돈 낭비입니다.

로컬 LLM 말고, 개발 작업만 봐도

램을 먹는 건 LLM만이 아닙니다. 16GB가 실제로 터지는 순간들입니다.

  • 도커 컨테이너 여러 개 — 특히 DB·메시지큐를 같이 띄울 때
  • 안드로이드 에뮬레이터 — 하나가 통째로 가상머신입니다
  • IDE + 브라우저 탭 수십 개 — 각각은 작아도 합치면 큽니다
  • WSL2 — 리눅스에 별도로 램을 떼어 줍니다
  • 가상머신

이 중 둘 이상을 동시에 한다면 16GB는 좁습니다. 하나씩만 쓴다면 16GB로도 지장이 없습니다.

지금 내 램이 부족한지 확인하는 법

사기 전에 재보는 게 가장 정확합니다.

윈도우

  1. Ctrl + Shift + Esc → 작업 관리자
  2. 성능 탭 → 메모리
  3. 평소 작업을 다 띄운 상태에서 "사용 중" 수치를 봅니다

판단 기준입니다.

사용 중판단
8GB 이하16GB로 충분합니다
10~13GB32GB를 고려할 만합니다
14GB 이상이미 부족합니다. 스왑이 일어나고 있을 가능성이 큽니다

"커밋된 메모리"가 물리 램보다 크면 이미 디스크로 넘어가고 있다는 뜻입니다. 이때는 체감이 확실히 나빠집니다.

32GB로 올릴 때 확인할 것

1. 듀얼 채널로 꽂으세요

같은 32GB라도 16GB 두 장이 32GB 한 장보다 빠릅니다. 메모리 대역폭이 두 배가 되기 때문입니다.

CPU 오프로딩이 일어나는 상황에서는 이 차이가 그대로 체감됩니다. 넘어간 레이어를 시스템 램에서 읽어야 하는데, 그 속도가 두 배가 되는 셈입니다.

메인보드 슬롯이 4개면 보통 2번·4번에 꽂습니다. 설명서를 확인하세요.

2. 규격을 확인하세요

DDR4와 DDR5는 물리적으로 호환되지 않습니다. 슬롯 모양이 다릅니다. 메인보드가 받는 규격을 먼저 확인하세요.

이미 16GB 한 장이 꽂혀 있다면 같은 규격·같은 용량으로 한 장 더 사서 듀얼 채널을 만드는 것이 가장 싸게 가는 방법입니다.

3. 기존 램과 섞을 때

제조사·클럭이 다른 램을 섞으면 낮은 쪽에 맞춰지고, 드물게 불안정할 수 있습니다. 가능하면 같은 제품 두 장이 안전합니다.

노트북은 사정이 다릅니다

최근 얇은 노트북은 램이 메인보드에 납땜되어 있어 나중에 못 늘립니다. LPDDR 계열을 쓰는 모델이 특히 그렇습니다.

  • 살 때 "램 슬롯이 있는지"를 확인하세요
  • 슬롯이 없다면 살 때 32GB를 골라야 합니다
  • 게이밍 노트북이나 두꺼운 모델은 슬롯이 있는 경우가 많습니다

맥은 전부 통합 메모리라 나중에 못 늘립니다. 살 때 정해야 합니다. 게다가 맥은 램이 VRAM 역할까지 하므로 계산이 다릅니다 — 램과 VRAM의 차이를 참고하세요.

64GB는 언제 필요한가

  • GPU 없이 CPU로만 큰 모델을 돌릴 계획
  • 32B 이상을 오프로딩으로 상시 사용
  • 가상머신 여러 대를 동시에
  • 대용량 데이터 처리

그 외에는 64GB가 성능을 올려주지 않습니다. 남는 램은 그냥 남습니다 — VRAM처럼 쓰이지 않습니다.

큰 모델을 쓰고 싶다면 램이 아니라 VRAM을 늘려야 합니다. 32B를 제대로 쓰려면 램 64GB가 아니라 VRAM 24GB 이상입니다.

자주 묻는 질문

16GB에서 32GB로 늘리면 로컬 LLM이 빨라지나요

모델이 이미 VRAM에 전부 올라가고 있다면 차이가 없습니다. 반대로 CPU 오프로딩이 일어나고 있었다면 체감할 수 있습니다.

위 표에서 내 GPU와 모델 조합이 "전부 VRAM"이면 램을 늘려도 그대로입니다.

32GB와 64GB 중에 고민입니다

지금 32B 이상을 오프로딩으로 쓸 계획이 없다면 32GB로 충분합니다. 그 돈을 VRAM이 더 큰 그래픽카드에 쓰는 편이 로컬 LLM에서는 훨씬 낫습니다.

DDR4와 DDR5 중 어느 쪽이 유리한가요

CPU 오프로딩을 자주 한다면 대역폭이 높은 DDR5가 유리합니다. 모델이 VRAM에 다 올라가는 환경이라면 차이가 크지 않습니다. 이것 때문에 메인보드와 CPU까지 바꿀 정도의 차이는 아닙니다.

램 클럭도 중요한가요

용량만큼은 아닙니다. 우선순위는 용량 → 듀얼 채널 → 클럭 순입니다. 32GB 싱글 채널보다 32GB 듀얼 채널이 먼저입니다.

16GB 한 장이 있는데 8GB를 더 꽂아도 되나요

동작은 합니다. 다만 용량이 다르면 듀얼 채널 이득을 온전히 못 받습니다 (겹치는 만큼만 듀얼로 동작하는 경우가 많습니다). 같은 용량 한 장을 더 꽂는 편이 낫습니다.

정리

  1. "32GB 사세요"는 답이 아닙니다. VRAM을 얼마나 넘기느냐가 정합니다
  2. 모델이 VRAM에 다 들어가면 16GB로 충분합니다
  3. 넘어가는 양이 5GB 이상이면 32GB가 필요합니다
  4. 도커·에뮬레이터·VM을 둘 이상 동시에 쓰면 그것만으로도 32GB입니다
  5. 큰 모델을 쓰고 싶으면 램이 아니라 VRAM을 늘려야 합니다
  6. 노트북·맥은 나중에 못 늘립니다. 살 때 정하세요

내 GPU에서 어떤 모델이 돌아가는지는 Ollama 최소 사양 정리에 있습니다.

수치가 실제 환경과 다르면 알려주세요. 확인 후 갱신합니다.

RAM 메모리 로컬LLM 개발용PC DDR5