그래픽카드 없이 로컬 LLM — CPU로 돌리면 얼마나 느린가
"그래픽카드가 없는데 로컬 LLM이 되나요?"
됩니다. 그런데 대부분 써보고는 포기합니다. 너무 느리기 때문입니다.
왜 느린지는 짐작이 아니라 숫자로 설명됩니다.
결론부터
| 가능 여부 | 실용성 | |
|---|---|---|
| 3B 모델 | 돌아감 | 견딜 만합니다 |
| 7~8B 모델 | 돌아감 | 답답합니다 |
| 14B 이상 | 돌아감 | 사실상 불가 |
CPU만으로는 3B가 현실적인 상한입니다. 7~8B도 되긴 하지만, 답변 하나에 한참 걸립니다.
왜 느린가 — 대역폭 때문입니다
LLM은 답변 한 글자를 만들 때마다 모델 전체를 한 번씩 읽습니다. 그래서 속도를 정하는 건 연산 능력이 아니라 메모리를 얼마나 빨리 읽느냐입니다.
시스템 램의 대역폭은 계산됩니다
DDR5-5600 듀얼채널
5600 × 8바이트 × 2채널 = 89,600 MB/s = 약 89.6 GB/s
DDR4-3200 듀얼채널
3200 × 8바이트 × 2채널 = 51,200 MB/s = 약 51.2 GB/s
그래픽카드와 나란히 놓으면 이렇습니다.
| 대역폭 | DDR5-5600 대비 | |
|---|---|---|
| RTX 5090 | 1792 GB/s | 20배 |
| RTX 5070 | 672 GB/s | 7.5배 |
| RTX 5060 | 448 GB/s | 5배 |
| Mac M5 | 153 GB/s | 1.7배 |
| DDR5-5600 듀얼 | 89.6 GB/s | 1배 |
| DDR4-3200 듀얼 | 51.2 GB/s | 0.6배 |
가장 저렴한 신품 그래픽카드와 비교해도 5배 차이입니다.
다만 이 배수가 곧 체감 속도 배수는 아닙니다. CPU 쪽은 연산 능력에서도 밀리고, 실제 차이는 이보다 더 벌어지는 경우가 많습니다.
그래도 해볼 만한 경우
1. 될지 안 될지 먼저 보고 싶을 때
사기 전에 체험하는 용도로는 충분합니다. 3B 모델을 받아 돌려보면 "이런 거구나"는 확실히 알 수 있습니다.
그다음에 그래픽카드를 살지 정하면 됩니다. 시작 가이드에서도 같은 순서를 권합니다.
2. 속도가 상관없는 작업
밤새 돌려두는 일괄 처리라면 느려도 상관없습니다. 문서 수백 개를 정리해두는 식의 작업이 여기 해당합니다.
3. 맥이라면 이야기가 다릅니다
애플 실리콘은 전용 그래픽카드가 없어도 통합 메모리를 GPU가 씁니다. 그래서 "CPU로만 돌린다"에 해당하지 않습니다.
맥북에어라도 M5 기준 153 GB/s로 DDR5보다 빠릅니다. 자세한 내용은 맥 통합메모리 글에 있습니다.
내장그래픽은 도움이 되나요
거의 안 됩니다.
내장그래픽은 별도 메모리가 없어서 시스템 램을 나눠 씁니다. 결국 같은 대역폭을 쓰므로 CPU로 돌리는 것과 크게 다르지 않습니다.
전용 그래픽카드의 값어치는 연산 능력보다 전용 고속 메모리에 있습니다.
CPU로 돌릴 때 램은 얼마나 필요한가
VRAM에 안 올리므로 모델이 통째로 시스템 램에 들어갑니다.
| 모델 | 파일 크기 (Q4) | 필요한 램 |
|---|---|---|
| 3B | 약 2GB | 8GB로 가능 |
| 7~8B | 약 4.7GB | 16GB 권장 |
| 14B | 약 9GB | 16GB로 빠듯, 32GB 권장 |
| 32B | 약 20GB | 32GB 이상 |
모델 크기 + 8GB 정도로 잡으면 대체로 맞습니다. 운영체제와 다른 프로그램 몫이 필요하기 때문입니다.
램이 모자라면 디스크로 넘어가는데, 그때는 초당 1토큰도 안 나옵니다. 자세한 기준은 램 16GB vs 32GB에 있습니다.
속도를 조금이라도 올리려면
CPU로 돌리기로 했다면 이 정도가 할 수 있는 전부입니다.
듀얼 채널로 꽂으세요 같은 32GB라도 16GB 두 장이 대역폭 두 배입니다. CPU 추론에서는 이게 그대로 속도입니다. 싱글 채널이면 절반만 씁니다.
작은 모델을 쓰세요 3B와 8B는 읽어야 할 양이 두 배 이상 차이납니다.
컨텍스트를 줄이세요 긴 대화는 그만큼 더 읽어야 합니다.
기대치를 낮추세요 CPU 추론은 근본적으로 대역폭에 막혀 있어서, 설정으로 해결되지 않습니다.
자주 묻는 질문
CPU가 좋으면 빨라지나요
조금 빨라지지만 크게 달라지지 않습니다. 병목이 연산이 아니라 메모리 읽기 속도이기 때문입니다. 코어를 늘려도 램에서 읽어오는 속도가 그대로면 한계가 있습니다.
DDR5로 바꾸면 얼마나 빨라지나요
DDR4-3200에서 DDR5-5600이면 대역폭이 약 1.75배입니다. 체감이 되긴 하지만, 그래픽카드와의 격차를 메우지는 못합니다. 이것 때문에 메인보드와 CPU까지 바꿀 정도는 아닙니다.
그래픽카드를 사면 얼마나 나아지나요
가장 저렴한 신품(RTX 5060)만 해도 대역폭이 5배입니다. 게다가 모델이 VRAM에 다 올라가면 시스템 램은 거의 쓰이지 않습니다. 차원이 다른 경험이 됩니다.
어느 카드가 맞는지는 Ollama 최소 사양 정리를 보세요.
노트북 내장그래픽으로는요
위에 적은 대로 내장그래픽은 시스템 램을 나눠 쓰므로 큰 도움이 안 됩니다. 다만 최근 노트북용 통합 칩 중에는 대역폭이 높은 것도 있으니, 본인 기기의 메모리 규격을 확인해 보세요.
램만 잔뜩 늘리면 큰 모델이 돌아가나요
돌아가긴 합니다. 32B도 램 32GB면 올라갑니다. 다만 대역폭이 그대로라 속도는 더 느려집니다 — 읽을 양이 늘었기 때문입니다. 용량 문제가 아니라 속도 문제입니다.
정리
- CPU만으로도 돌아갑니다. 다만 3B가 현실적인 상한입니다
- 느린 이유는 대역폭입니다. DDR5-5600이 89.6GB/s, RTX 5060이 448GB/s
- 내장그래픽은 시스템 램을 나눠 쓰므로 큰 도움이 안 됩니다
- 맥은 예외입니다. 통합 메모리를 GPU가 직접 씁니다
- 사기 전 체험용으로는 충분합니다. 써보고 결정하세요
처음이시라면 시작 가이드부터, 설치는 Ollama 설치 가이드를 보세요.
수치가 실제 환경과 다르면 알려주세요. 확인 후 갱신합니다.