VRAM 계산기 — 내 그래픽카드로 돌아가는 로컬 LLM
그래픽카드와 설정을 고르면 어떤 크기의 모델이 여유 있게 돌아가는지 표로 보여줍니다.
여유 쓸 수 있습니다
RTX 5060 Ti 16GB로 12~14B 모델은 무리 없습니다. 지금 카드를 그대로 쓰시면 됩니다.지금 카드로는 12~14B까지입니다. 더 큰 20~22B 모델까지 돌리려면 RTX 5090(메모리 32GB) 이상이 필요합니다.
이 길이에서는 대부분이 모델 가중치입니다. 짧게 써도 크게 안 줄어듭니다.
필요 10.6GB = 가중치 8.8 + 컨텍스트 0.8 + 여유 1.0 내 카드 16GB
다른 크기도 함께 보기
| 모델 크기 | 필요 메모리 | 내 카드에서 |
|---|---|---|
| 3B Llama 3.2 3B, Qwen 3B |
3.3GB 가중치 1.9 · 컨텍스트 0.4 |
여유 전부 그래픽카드 메모리에 올라감 |
| 7~8B Llama 3.1 8B, Qwen 7B |
6.5GB 가중치 5.0 · 컨텍스트 0.5 |
여유 전부 그래픽카드 메모리에 올라감 |
| 12~14B Qwen 14B, Gemma 12B |
10.6GB 가중치 8.8 · 컨텍스트 0.8 |
여유 전부 그래픽카드 메모리에 올라감 |
| 20~22B Mistral Small |
15.7GB 가중치 13.9 · 컨텍스트 0.9 |
빠듯 짧은 내용만 다루면 가능 |
| 32B Qwen 32B, QwQ 32B |
22.2GB 가중치 20.2 · 컨텍스트 1.0 |
느림 일부가 CPU로 넘어가 답답해짐 |
| 70B Llama 3.3 70B |
46.4GB 가중치 44.1 · 컨텍스트 1.3 |
불가 실사용이 어려움 |
| 120B+ Mixtral 8x22B급 |
77.6GB 가중치 75.6 · 컨텍스트 1.0 |
불가 실사용이 어려움 |
근사치입니다. 실제로 쓸 모델의 파일 크기는 배포판마다 다릅니다. 경계선에 있다면 한 단계 위 메모리를 택하는 편이 안전합니다.
내 그래픽카드 확인하는 법
모델명을 모르셔도 1분이면 확인됩니다.
윈도우
Ctrl+Shift+Esc를 눌러 작업 관리자를 엽니다- 성능 탭 → 왼쪽 목록에서 GPU 클릭
- 오른쪽 위에 카드 이름이 나옵니다 (예: NVIDIA GeForce RTX 4060 Ti)
- 오른쪽 아래 전용 GPU 메모리가 이 계산기에서 말하는 메모리입니다
맥
화면 왼쪽 위 사과 아이콘 → 이 Mac에 관하여. 메모리 항목에 적힌 숫자를 그대로 고르시면 됩니다.
이 계산기가 실제로 계산하는 것
그래픽카드 메모리를 얼마나 쓰는지는 세 가지가 정합니다.
- 모델 자체의 크기 — 똑똑할수록 큽니다
- 한 번에 다루는 내용의 길이 — 길수록 메모리를 더 씁니다
- 여유 공간 — 프로그램이 돌아가는 데 필요한 몫
두 번째가 자주 놓치는 부분입니다. "처음엔 빨랐는데 대화가 길어지니 느려진다"는 대부분 여기서 옵니다. 같은 모델이라도 긴 문서를 넣으면 메모리를 훨씬 많이 씁니다.
메모리가 모자라면 어떻게 되나요
에러가 나지 않습니다. 그냥 느려집니다. 이게 헷갈리는 지점입니다.
그래픽카드에 다 안 들어가면 프로그램이 나머지를 컴퓨터의 일반 메모리로 넘깁니다. 동작은 하지만 속도가 몇 배에서 수십 배까지 떨어집니다.
| 표시 | 뜻 |
|---|---|
| 여유 | 쾌적하게 씁니다 |
| 빠듯 | 짧은 내용만 다루면 됩니다 |
| 느림 | 답답할 정도로 느려집니다 |
| 불가 | 사실상 못 씁니다 |
"돌아간다"와 "쓸 만하다"는 다릅니다.
이 결과를 얼마나 믿어야 하나요
근사치입니다. 실제로 쓰는 프로그램과 모델 종류에 따라 조금씩 달라집니다.
그래서 경계선에 있다면 한 단계 위를 택하는 편이 안전합니다. 메모리가 남는 것은 손해가 아니지만, 모자라면 아예 못 씁니다.
더 자세한 내용은 Ollama 최소 사양 정리에 있습니다.