로컬 LLM 처음이라면 — 용어 없이 읽는 시작 가이드

"내 컴퓨터에서 AI를 돌린다"는 이야기를 보고 오셨다면, 아마 이런 상태일 겁니다.

  • 되는지 안 되는지부터 모르겠다
  • VRAM, 양자화, 7B 같은 말이 무슨 뜻인지 모르겠다
  • 뭘 사야 하는지는 더 모르겠다

셋 다 몰라도 됩니다. 순서대로만 확인하면 됩니다.

1. 로컬 LLM이 뭔가요

ChatGPT 같은 걸 인터넷 없이 내 컴퓨터 안에서 돌리는 것입니다.

인터넷 서비스로컬 LLM
비용매달 구독료전기요금만
개인정보서버로 전송됨내 컴퓨터 밖으로 안 나감
인터넷필요필요 없음
성능최상급내 장비 수준까지

공짜이고 내 자료가 밖으로 안 나간다는 게 핵심입니다. 대신 아무 컴퓨터에서나 잘 돌지는 않습니다.

2. 되는지부터 확인하세요

필요한 건 그래픽카드의 메모리입니다. 컴퓨터 전체 사양이 아닙니다.

윈도우에서 확인하는 법

  1. Ctrl + Shift + Esc 를 눌러 작업 관리자를 엽니다
  2. 성능 탭 → 왼쪽에서 GPU 클릭
  3. 오른쪽 아래 전용 GPU 메모리 숫자를 봅니다

맥에서 확인하는 법

화면 왼쪽 위 사과 아이콘 → 이 Mac에 관하여 → 메모리 숫자를 봅니다.

이 숫자만 알면 됩니다. 아래 계산기에 넣어보세요.

여유 쓸 수 있습니다

RTX 5060 Ti 16GB로 12~14B 모델은 무리 없습니다. 지금 카드를 그대로 쓰시면 됩니다.지금 카드로는 12~14B까지입니다. 더 큰 20~22B 모델까지 돌리려면 RTX 5090(메모리 32GB) 이상이 필요합니다.

이 길이에서는 대부분이 모델 가중치입니다. 짧게 써도 크게 안 줄어듭니다.

필요 10.6GB = 가중치 8.8 + 컨텍스트 0.8 + 여유 1.0 내 카드 16GB

다른 크기도 함께 보기
모델 크기필요 메모리내 카드에서
3B
Llama 3.2 3B, Qwen 3B
3.3GB
가중치 1.9 · 컨텍스트 0.4
여유
전부 그래픽카드 메모리에 올라감
7~8B
Llama 3.1 8B, Qwen 7B
6.5GB
가중치 5.0 · 컨텍스트 0.5
여유
전부 그래픽카드 메모리에 올라감
12~14B
Qwen 14B, Gemma 12B
10.6GB
가중치 8.8 · 컨텍스트 0.8
여유
전부 그래픽카드 메모리에 올라감
20~22B
Mistral Small
15.7GB
가중치 13.9 · 컨텍스트 0.9
빠듯
짧은 내용만 다루면 가능
32B
Qwen 32B, QwQ 32B
22.2GB
가중치 20.2 · 컨텍스트 1.0
느림
일부가 CPU로 넘어가 답답해짐
70B
Llama 3.3 70B
46.4GB
가중치 44.1 · 컨텍스트 1.3
불가
실사용이 어려움
120B+
Mixtral 8x22B급
77.6GB
가중치 75.6 · 컨텍스트 1.0
불가
실사용이 어려움

근사치입니다. 실제로 쓸 모델의 파일 크기는 배포판마다 다릅니다. 경계선에 있다면 한 단계 위 메모리를 택하는 편이 안전합니다.

3. 결과를 어떻게 읽나요

계산기가 네 가지 중 하나로 답합니다.

표시뜻
여유쾌적하게 씁니다
빠듯되긴 하는데 짧은 내용만
느림답답할 정도로 느립니다
불가사실상 못 씁니다

"느림"이 가장 헷갈리는 지점입니다. 에러가 나면 안 되는 줄 알 텐데, 로컬 LLM은 에러 없이 그냥 느려집니다.

8GB 카드에 14B 모델을 올리면 2GB가 CPU로 넘어가 느려진다 8GB 카드에 14B 모델을 올리면 VRAM 안 · 8GB +2GB 그래픽카드가 처리 — 빠름 CPU 로 이 2GB 때문에 전체가 느려집니다. 에러가 나는 게 아니라 속도만 떨어져서 원인을 알기 어렵습니다.
넘친 몫은 시스템 램과 CPU 가 떠맡습니다. 대역폭이 VRAM 의 10 분의 1 수준이라 그만큼 느려집니다.

그래서 "돌아간다"와 "쓸 만하다"는 다릅니다.

4. 대충 이 정도입니다

숫자를 외울 필요는 없습니다. 감만 잡으시면 됩니다.

그래픽카드 메모리할 수 있는 것
8GB번역, 간단한 질문, 짧은 글 다듬기
12GB코딩 도우미, 문서 요약
16GB위 전부 + 조금 더 큰 모델
24GB 이상전문적인 작업

8GB가 사실상 하한선입니다. 그 아래는 답답합니다.

5. 그래서 뭘 사야 하나요

아직 사지 마세요. 순서가 있습니다.

  1. 지금 컴퓨터로 먼저 해보세요. 8GB만 있어도 시작은 됩니다
  2. 써보고 답답한 지점이 생기면 그때 뭐가 부족한지 압니다
  3. 그다음에 사면 됩니다

로컬 LLM은 안 써보고는 뭐가 필요한지 알 수 없습니다. "코딩 보조로 쓰고 싶다"는 걸 알아야 12GB가 필요한 줄 압니다.

6. 용어 — 여기까지 왔으면 이제 봐도 됩니다

앞에서 일부러 안 썼던 말들입니다.

VRAM (브이램) 그래픽카드에 붙어 있는 메모리입니다. 위에서 확인한 "전용 GPU 메모리"가 이겁니다. 컴퓨터 램과는 다른 것입니다.

7B, 14B, 32B AI 모델의 크기입니다. B는 10억(billion)이고, 숫자가 클수록 똑똑하고 무겁습니다. 사람으로 치면 "얼마나 많이 배웠나"에 가깝습니다.

양자화 (Q4, Q8) 모델을 압축해서 용량을 줄이는 기술입니다. Q4가 사실상 표준이고, 그보다 낮추면 품질이 떨어지기 시작합니다. 몰라도 됩니다 — 기본값이 Q4입니다. 올렸을 때 용량이 얼마나 늘어나는지는 양자화 Q4 Q5 Q8에 있습니다.

컨텍스트 AI가 한 번에 기억하는 내용의 길이입니다. 길수록 메모리를 더 씁니다. "처음엔 빨랐는데 대화가 길어지니 느려진다"가 이것 때문입니다.

Ollama (올라마) 로컬 LLM을 돌리는 프로그램 중 가장 많이 쓰는 것입니다. 설치하고 명령어 한 줄이면 시작됩니다.

7. 다음은 여기부터

이제 궁금한 게 생겼을 겁니다. 상황에 맞는 곳으로 가세요.

"일단 깔아보고 싶다" → Ollama 설치부터 첫 대화까지

"그래픽카드가 없는데요" → CPU로 돌리면 얼마나 느린가

"내 카드로 뭐가 되는지 더 자세히" → Ollama 최소 사양 — VRAM별 정리

"8GB인데 아쉽다" → 8GB 카드의 한계선 — 어디까지 되나 → 8GB에서 최대한 뽑아쓰기 — 카드를 바꾸기 전에

"Q4니 Q8이니 하는 건 뭔가요" → 양자화 Q4 Q5 Q8 — 올리면 뭐가 좋아지나

"노트북으로 하려는데요" → 로컬 LLM 되는 노트북 고르기 — 이름이 같아도 VRAM이 다릅니다

"램을 늘리면 되나요" → 램과 VRAM은 뭐가 다른가 → 램 16GB vs 32GB

"살 카드를 고르고 있다" → 5060 Ti 16GB vs 5070 — 신품 중급 → 중고 3060 12GB — 최대한 싸게 → 중고 3090 vs 신품 — 큰 모델을 노릴 때 → 5070 Ti vs 5080 — 상급에서 갈리는 지점 → RTX 5090 32GB — 개인용 상한선

"제 카드가 라데온인데요" → AMD 라데온으로 로컬 LLM

"카드를 두 장 꽂으면 되지 않나요" → 그래픽카드 두 장 — VRAM이 합쳐지나요

"전기요금이 걱정됩니다" → 로컬 LLM 전기요금 — 정말 공짜인가

"맥인데요" → 맥 통합메모리 몇 GB를 사야 하나

자주 묻는 질문

그래픽카드가 없어도 되나요

돌아가긴 합니다. 다만 CPU만으로는 매우 느려서, 한 글자씩 나오는 수준입니다. 체험은 되지만 실제로 쓰기는 어렵습니다. 왜 그런지는 CPU로 돌리면 얼마나 느린가에 계산해 뒀습니다.

노트북으로도 되나요

노트북 그래픽카드의 메모리를 확인하세요. 같은 이름이라도 데스크톱보다 메모리가 적은 경우가 많습니다. 확인 방법은 위 2번과 같습니다.

노트북 RTX 5070 은 8GB, 데스크톱 5070 은 12GB입니다. 이름만 보고 사면 어긋납니다 — 로컬 LLM 되는 노트북 고르기에 표를 넣어뒀습니다.

인터넷 서비스보다 성능이 떨어지나요

떨어집니다. 개인 장비에서 돌릴 수 있는 크기에 한계가 있기 때문입니다. 다만 번역·요약·간단한 코딩 보조 같은 일상적인 작업은 충분히 됩니다.

클로드 코드·커서 같은 클라우드 도구와 무엇이 다른지, 어느 쪽이 사양을 타는지는 AI 코딩 도구와 사양에 갈라 뒀습니다.

무료인가요

모델과 프로그램 모두 무료입니다. 전기요금만 듭니다. 다만 장비가 부족하면 그걸 사는 비용이 듭니다.

전기요금이 얼마인지는 계산해 두었습니다 — 하루 한두 시간이면 신경 쓸 금액이 아니고, 24시간 켜두면 이야기가 달라집니다. 로컬 LLM 전기요금에 계산식과 확인처를 적었습니다.

얼마나 어렵나요

Ollama 기준으로 설치 후 명령어 한 줄입니다. 어려운 건 설치가 아니라 내 장비로 뭐가 되는지 판단하는 것이고, 그게 이 사이트가 하는 일입니다.

정리

  1. 필요한 건 그래픽카드 메모리 하나입니다
  2. 8GB가 하한선, 12GB면 코딩 보조까지 됩니다
  3. 메모리가 모자라면 에러가 아니라 느려집니다
  4. 사기 전에 지금 장비로 먼저 해보세요
  5. 용어는 나중에 알아도 됩니다

궁금한 게 풀리지 않으면 알려주세요. 같은 질문이 반복되면 글로 정리합니다.

로컬LLM 입문 Ollama VRAM 초보