로컬 LLM 처음이라면 — 용어 없이 읽는 시작 가이드

"내 컴퓨터에서 AI를 돌린다"는 이야기를 보고 오셨다면, 아마 이런 상태일 겁니다.

  • 되는지 안 되는지부터 모르겠다
  • VRAM, 양자화, 7B 같은 말이 무슨 뜻인지 모르겠다
  • 뭘 사야 하는지는 더 모르겠다

셋 다 몰라도 됩니다. 순서대로만 확인하면 됩니다.

1. 로컬 LLM이 뭔가요

ChatGPT 같은 걸 인터넷 없이 내 컴퓨터 안에서 돌리는 것입니다.

인터넷 서비스로컬 LLM
비용매달 구독료전기요금만
개인정보서버로 전송됨내 컴퓨터 밖으로 안 나감
인터넷필요필요 없음
성능최상급내 장비 수준까지

공짜이고 내 자료가 밖으로 안 나간다는 게 핵심입니다. 대신 아무 컴퓨터에서나 잘 돌지는 않습니다.

2. 되는지부터 확인하세요

필요한 건 그래픽카드의 메모리입니다. 컴퓨터 전체 사양이 아닙니다.

윈도우에서 확인하는 법

  1. Ctrl + Shift + Esc 를 눌러 작업 관리자를 엽니다
  2. 성능 탭 → 왼쪽에서 GPU 클릭
  3. 오른쪽 아래 전용 GPU 메모리 숫자를 봅니다

맥에서 확인하는 법

화면 왼쪽 위 사과 아이콘 → 이 Mac에 관하여 → 메모리 숫자를 봅니다.

이 숫자만 알면 됩니다. 아래 계산기에 넣어보세요.

3. 결과를 어떻게 읽나요

계산기가 네 가지 중 하나로 답합니다.

표시
여유쾌적하게 씁니다
빠듯되긴 하는데 짧은 내용만
느림답답할 정도로 느립니다
불가사실상 못 씁니다

"느림"이 가장 헷갈리는 지점입니다. 에러가 나면 안 되는 줄 알 텐데, 로컬 LLM은 에러 없이 그냥 느려집니다.

8GB 카드에 14B 모델을 올리면 2GB가 CPU로 넘어가 느려진다 8GB 카드에 14B 모델을 올리면 VRAM 안 · 8GB +2GB 그래픽카드가 처리 — 빠름 CPU 로 이 2GB 때문에 전체가 느려집니다. 에러가 나는 게 아니라 속도만 떨어져서 원인을 알기 어렵습니다.
넘친 몫은 시스템 램과 CPU 가 떠맡습니다. 대역폭이 VRAM 의 10 분의 1 수준이라 그만큼 느려집니다.

그래서 "돌아간다"와 "쓸 만하다"는 다릅니다.

4. 대충 이 정도입니다

숫자를 외울 필요는 없습니다. 감만 잡으시면 됩니다.

그래픽카드 메모리할 수 있는 것
8GB번역, 간단한 질문, 짧은 글 다듬기
12GB코딩 도우미, 문서 요약
16GB위 전부 + 조금 더 큰 모델
24GB 이상전문적인 작업

8GB가 사실상 하한선입니다. 그 아래는 답답합니다.

5. 그래서 뭘 사야 하나요

아직 사지 마세요. 순서가 있습니다.

  1. 지금 컴퓨터로 먼저 해보세요. 8GB만 있어도 시작은 됩니다
  2. 써보고 답답한 지점이 생기면 그때 뭐가 부족한지 압니다
  3. 그다음에 사면 됩니다

로컬 LLM은 안 써보고는 뭐가 필요한지 알 수 없습니다. "코딩 보조로 쓰고 싶다"는 걸 알아야 12GB가 필요한 줄 압니다.

6. 용어 — 여기까지 왔으면 이제 봐도 됩니다

앞에서 일부러 안 썼던 말들입니다.

VRAM (브이램) 그래픽카드에 붙어 있는 메모리입니다. 위에서 확인한 "전용 GPU 메모리"가 이겁니다. 컴퓨터 램과는 다른 것입니다.

7B, 14B, 32B AI 모델의 크기입니다. B는 10억(billion)이고, 숫자가 클수록 똑똑하고 무겁습니다. 사람으로 치면 "얼마나 많이 배웠나"에 가깝습니다.

양자화 (Q4, Q8) 모델을 압축해서 용량을 줄이는 기술입니다. Q4가 사실상 표준이고, 그보다 낮추면 품질이 떨어지기 시작합니다. 몰라도 됩니다 — 기본값이 Q4입니다.

컨텍스트 AI가 한 번에 기억하는 내용의 길이입니다. 길수록 메모리를 더 씁니다. "처음엔 빨랐는데 대화가 길어지니 느려진다"가 이것 때문입니다.

Ollama (올라마) 로컬 LLM을 돌리는 프로그램 중 가장 많이 쓰는 것입니다. 설치하고 명령어 한 줄이면 시작됩니다.

7. 다음은 여기부터

이제 궁금한 게 생겼을 겁니다. 상황에 맞는 곳으로 가세요.

"일단 깔아보고 싶다"Ollama 설치부터 첫 대화까지

"그래픽카드가 없는데요"CPU로 돌리면 얼마나 느린가

"내 카드로 뭐가 되는지 더 자세히"Ollama 최소 사양 — VRAM별 정리

"8GB인데 아쉽다"8GB 카드의 한계선

"램을 늘리면 되나요"램과 VRAM은 뭐가 다른가램 16GB vs 32GB

"살 카드를 고르고 있다"5060 Ti 16GB vs 5070 — 신품 중급 → 중고 3060 12GB — 최대한 싸게 → 중고 3090 vs 신품 — 큰 모델을 노릴 때

"맥인데요"맥 통합메모리 몇 GB를 사야 하나

자주 묻는 질문

그래픽카드가 없어도 되나요

돌아가긴 합니다. 다만 CPU만으로는 매우 느려서, 한 글자씩 나오는 수준입니다. 체험은 되지만 실제로 쓰기는 어렵습니다. 왜 그런지는 CPU로 돌리면 얼마나 느린가에 계산해 뒀습니다.

노트북으로도 되나요

노트북 그래픽카드의 메모리를 확인하세요. 같은 이름이라도 데스크톱보다 메모리가 적은 경우가 많습니다. 확인 방법은 위 2번과 같습니다.

인터넷 서비스보다 성능이 떨어지나요

떨어집니다. 개인 장비에서 돌릴 수 있는 크기에 한계가 있기 때문입니다. 다만 번역·요약·간단한 코딩 보조 같은 일상적인 작업은 충분히 됩니다.

무료인가요

모델과 프로그램 모두 무료입니다. 전기요금만 듭니다. 다만 장비가 부족하면 그걸 사는 비용이 듭니다.

얼마나 어렵나요

Ollama 기준으로 설치 후 명령어 한 줄입니다. 어려운 건 설치가 아니라 내 장비로 뭐가 되는지 판단하는 것이고, 그게 이 사이트가 하는 일입니다.

정리

  1. 필요한 건 그래픽카드 메모리 하나입니다
  2. 8GB가 하한선, 12GB면 코딩 보조까지 됩니다
  3. 메모리가 모자라면 에러가 아니라 느려집니다
  4. 사기 전에 지금 장비로 먼저 해보세요
  5. 용어는 나중에 알아도 됩니다

궁금한 게 풀리지 않으면 알려주세요. 같은 질문이 반복되면 글로 정리합니다.

로컬LLM 입문 Ollama VRAM 초보