그래픽카드 두 장 — VRAM이 합쳐지나요

"8GB 카드가 두 장 있는데 16GB 처럼 쓸 수 있나요"

이 사이트의 여러 글이 FAQ 에서 한두 줄로만 답하고 넘어갔던 질문입니다. 제대로 답합니다.

결론부터

8GB × 216GB × 1
총 VRAM16GB16GB
14B 모델돌아갑니다돌아갑니다
속도더 느립니다더 빠릅니다
전력두 배한 배
슬롯·케이스까다롭습니다문제없습니다
설정손이 갑니다그냥 됩니다

총량은 같은데 나머지가 전부 불리합니다. 그래서 이 사이트는 여러 글에서 "8GB 두 장보다 16GB 한 장"이라고 적었습니다.

두 장이 의미 있는 경우는 하나뿐입니다 — 한 장으로는 아예 안 들어갈 때.

1. 합쳐지는 것과 안 합쳐지는 것

용량은 합쳐집니다. 속도는 안 합쳐집니다.

모델은 층(레이어)이 쌓인 구조입니다. 그 층을 나눠서 카드에 올릴 수 있습니다.

14B 모델의 층들
  앞쪽 절반  →  1번 카드
  뒤쪽 절반  →  2번 카드

그래서 한 장에 안 들어가던 모델이 올라갑니다. 여기까지는 이득입니다.

문제는 계산하는 방식입니다.

글자 하나를 만들 때
  1번 카드가 앞쪽 층을 계산  →  결과를 2번으로 넘김
  2번 카드가 뒤쪽 층을 계산  →  글자 하나 완성

두 카드가 동시에 일하는 게 아니라 순서대로 일합니다. 1번이 계산할 때 2번은 놀고, 2번이 계산할 때 1번이 놉니다.

그러니 속도는 두 배가 되지 않습니다. 오히려 중간 결과를 주고받는 시간이 더 붙습니다.

2. 그래서 16GB 한 장이 더 빠릅니다

같은 14B 모델을 올린다고 하면 이렇습니다.

16GB 한 장   →  카드 안에서 전부 처리. 밖으로 나갈 일 없음
8GB 두 장    →  중간에 한 번 넘김. 그만큼 시간이 더 듦

넘기는 통로가 카드 자체의 메모리보다 훨씬 느립니다. VRAM 대역폭이 수백 GB/s 인데 카드 사이 통로는 그보다 한참 아래입니다. CPU 로 넘어갈 때 느려지는 것과 같은 종류의 문제이고, 정도만 덜합니다.

예전에는 카드 두 장을 빠른 다리로 직접 잇는 방법(NVLink)이 있었습니다. 지포스에서는 3090 세대가 마지막입니다. 40·50 시리즈에는 없습니다.

그래서 요즘 두 장을 꽂으면 메인보드를 거쳐 오갑니다. 더 느린 길입니다.

3. 그럼 언제 두 장을 쓰나

한 장으로는 아예 안 들어가는 크기를 돌릴 때입니다. 그때만입니다.

"느리게라도 돌아가게 하고 싶다"   →  두 장이 답입니다
"같은 모델을 더 빠르게"          →  두 장은 답이 아닙니다

예를 들어 70B 급은 개인용 카드 한 장으로는 못 올립니다. 신품 상한이 32GB인데 70B 는 그보다 큽니다. 이때는 여러 장으로 나눠 올리는 것이 현실적인 방법 중 하나가 됩니다.

다만 그 목적이라면 맥 쪽도 함께 보세요. 통합 메모리로 128GB 까지 가고, 전력·소음·공간 문제가 없습니다 — 맥 통합메모리 글에 정리했습니다.

계산기는 한 장 기준입니다. 두 장 구성을 넣지 않은 이유는, 총량만 더해서 보여주면 속도가 같을 거라는 오해를 만들기 때문입니다.

4. 꽂기 전에 확인할 것 — 여기서 대부분 막힙니다

성능 이야기보다 이쪽이 현실적인 벽입니다.

파워서플라이

두 카드의 TDP 를 더하고 여유를 얹으셔야 합니다.

필요 용량 ≈ (카드 TDP 합) + CPU·나머지 부품 + 여유

TDP 250W 짜리 두 장이면 카드만 500W 입니다. 여기에 나머지를 더하면 850W 이상을 봐야 하고, 상급 카드면 더 올라갑니다. 파워 교체 비용이 카드값에 얹힌다고 보셔야 합니다.

슬롯 간격과 케이스

요즘 카드는 대부분 두께가 3슬롯입니다. 두 장을 꽂으려면 6슬롯이 필요한데, 일반 메인보드의 두 번째 슬롯 위치가 거기까지 안 벌어지는 경우가 많습니다.

  • 메인보드 슬롯 사이 간격
  • 케이스 길이와 폭
  • 아래 카드의 팬이 위 카드에 막히지 않는지

아래쪽 카드가 위 카드의 열을 그대로 마십니다. 온도가 확실히 올라갑니다.

두 번째 슬롯의 속도

메인보드에 따라 두 번째 슬롯이 절반 이하 속도로 떨어집니다. 모델을 처음 올릴 때 느려지는 정도이고 추론 자체에는 영향이 덜하지만, 사양표에서 한 번 확인해 두세요.

5. 서로 다른 카드를 섞어도 되나

됩니다. 다만 이득이 줄어듭니다.

  • 용량은 각자의 VRAM 만큼 더해집니다
  • 속도는 느린 쪽에 끌려갑니다. 층이 그 카드를 지나갈 때 거기서 밀립니다
  • 제조사가 다르면(라데온 + 지포스) 통로가 달라 더 까다롭습니다

남는 카드를 꽂아 용량만 늘리는 용도로는 쓸 만합니다. 성능을 기대하고 섞는 것은 권하지 않습니다.

자주 묻는 질문

8GB 두 장으로 14B 가 돌아가나요

총 16GB 라 올라갑니다. 다만 16GB 한 장보다 느리고, 전력과 발열은 두 배입니다. 같은 값이면 16GB 한 장입니다.

게임용으로 두 장 쓰던 시절처럼 안 되나요

게임에서 두 장을 묶는 방식은 사실상 사라졌습니다. 로컬 LLM 에서 두 장은 속도를 위한 게 아니라 용량을 위한 것입니다. 목적이 다릅니다.

계산기에서 두 장을 고를 수 없나요

일부러 넣지 않았습니다. 총량만 더해 보여주면 속도도 같을 거라고 읽히기 때문입니다. 돌아가는지만 보시려면 총 VRAM 과 같은 용량의 카드를 골라 보세요.

전기요금이 두 배인가요

카드 소비 전력이 두 배이므로 그만큼 늘어납니다. 계산법은 로컬 LLM 전기요금에 있습니다.

시스템 램도 늘려야 하나요

모델이 VRAM 에 전부 올라간다면 램은 그대로 두셔도 됩니다. 기준은 램 16GB vs 32GB에 있습니다.

그냥 큰 카드 한 장으로 가는 게 낫지 않나요

대부분의 경우 그렇습니다. 두 장은 한 장으로 안 되는 크기를 노릴 때의 선택지입니다.

정리

  1. 용량은 합쳐지고 속도는 안 합쳐집니다. 카드들이 순서대로 일합니다
  2. 8GB 두 장보다 16GB 한 장입니다. 총량은 같고 나머지가 전부 불리합니다
  3. NVLink 는 지포스에서 3090 세대가 마지막입니다. 지금은 메인보드를 거칩니다
  4. 두 장이 맞는 경우는 하나 — 한 장으로 아예 안 들어갈 때
  5. 실제 벽은 성능이 아니라 파워·슬롯 간격·발열입니다
  6. 큰 모델이 목적이면 맥 쪽도 함께 보세요

실제 구성 결과가 다르면 알려주세요. 확인 후 갱신합니다.

멀티GPU VRAM 로컬LLM NVLink 파워서플라이