중고 RTX 3090 vs 신품 4070 — 로컬 LLM은 어느 쪽
로컬 LLM을 시작하려는 사람이 자주 부딪히는 선택입니다. 비슷한 가격대에서 구형 상위 카드와 신형 중급 카드 중 무엇을 살 것인가.
게이밍이라면 신형이 낫습니다. 하지만 로컬 LLM에서는 답이 다릅니다.
⚠️ RTX 4070은 단종됐습니다. 지금 신품으로 사는 자리는 RTX 5070입니다. VRAM은 같은 12GB이고 대역폭이 504 → 672 GB/s로 올랐습니다.
이 글의 결론은 바뀌지 않습니다. VRAM 12GB라는 한계선이 같기 때문입니다. 다만 대역폭 격차는 줄었습니다 — 3090의 936 GB/s 대비 4070은 1.86배 차이였는데 5070은 1.39배입니다. 아래 본문은 4070 기준으로 읽으시고, 신품 구매라면 5070으로 바꿔 생각하시면 됩니다.
결론부터
로컬 LLM 용도라면 3090입니다. VRAM이 두 배이고 대역폭도 높습니다.
| RTX 3090 | RTX 4070 | |
|---|---|---|
| VRAM | 24GB | 12GB |
| 메모리 대역폭 | 936 GB/s | 504 GB/s |
| TDP | 350W | 200W |
| 출시 | 2020년 | 2023년 |
| 상태 | 중고만 | 신품 |
| 돌릴 수 있는 모델 | 20~22B (여유), 32B (빠듯) | 14B (여유), 20~22B (느림) |
LLM 추론에서 중요한 두 지표가 VRAM 용량과 메모리 대역폭인데, 3090이 둘 다 앞섭니다. 세대 차이가 이걸 뒤집지 못합니다.
두 카드를 번갈아 골라보시면 어디서 갈리는지 보입니다. 신품으로 살 수 있는 대안도 함께 나옵니다.
여유 쓸 수 있습니다
RTX 5060 Ti 16GB로 12~14B 모델은 무리 없습니다. 지금 카드를 그대로 쓰시면 됩니다.지금 카드로는 12~14B까지입니다. 더 큰 20~22B 모델까지 돌리려면 RTX 5090(메모리 32GB) 이상이 필요합니다.
이 길이에서는 대부분이 모델 가중치입니다. 짧게 써도 크게 안 줄어듭니다.
필요 10.6GB = 가중치 8.8 + 컨텍스트 0.8 + 여유 1.0 내 카드 16GB
다른 크기도 함께 보기
| 모델 크기 | 필요 메모리 | 내 카드에서 |
|---|---|---|
| 3B Llama 3.2 3B, Qwen 3B |
3.3GB 가중치 1.9 · 컨텍스트 0.4 |
여유 전부 그래픽카드 메모리에 올라감 |
| 7~8B Llama 3.1 8B, Qwen 7B |
6.5GB 가중치 5.0 · 컨텍스트 0.5 |
여유 전부 그래픽카드 메모리에 올라감 |
| 12~14B Qwen 14B, Gemma 12B |
10.6GB 가중치 8.8 · 컨텍스트 0.8 |
여유 전부 그래픽카드 메모리에 올라감 |
| 20~22B Mistral Small |
15.7GB 가중치 13.9 · 컨텍스트 0.9 |
빠듯 짧은 내용만 다루면 가능 |
| 32B Qwen 32B, QwQ 32B |
22.2GB 가중치 20.2 · 컨텍스트 1.0 |
느림 일부가 CPU로 넘어가 답답해짐 |
| 70B Llama 3.3 70B |
46.4GB 가중치 44.1 · 컨텍스트 1.3 |
불가 실사용이 어려움 |
| 120B+ Mixtral 8x22B급 |
77.6GB 가중치 75.6 · 컨텍스트 1.0 |
불가 실사용이 어려움 |
근사치입니다. 실제로 쓸 모델의 파일 크기는 배포판마다 다릅니다. 경계선에 있다면 한 단계 위 메모리를 택하는 편이 안전합니다.
왜 세대가 낮은데 유리한가
VRAM이 부족하면 성능이 아니라 가능 여부가 갈립니다
게이밍에서 VRAM이 부족하면 텍스처 품질을 낮추면 됩니다. LLM에서는 그런 타협이 없습니다. 모델이 VRAM에 안 들어가면 시스템 램으로 넘어가고, 그 순간 속도가 몇 배에서 수십 배 떨어집니다.
32B 모델 (Q4, 약 22.2GB)
3090 24GB → 빠듯하게 들어감 → 짧은 내용이면 쓸 만함
4070 12GB → 절반 이상 CPU → 사실상 불가
4070으로는 32B 모델을 "느리게 돌리는" 게 아니라 실질적으로 못 돌립니다.
🔴 2026-08-18 정정. 원래 이 자리에 "3090 은 32B 를 전부 VRAM 에 올린다"고 적혀 있었습니다. 계산기의 KV 캐시 계산을 고치면서 32B 가 22.2GB 가 되어 24GB 에서는 "여유"가 아니라 "빠듯"이 됐습니다. 긴 내용을 다루면 밀립니다. 3090 의 값어치는 여전히 크지만, 32B 를 여유롭게 쓰려면 32GB 급이 필요합니다.
대역폭이 생성 속도를 정합니다
VRAM에 다 올라간 뒤에는 메모리 대역폭이 초당 토큰 수를 좌우합니다. 3090의 936 GB/s는 4070의 504 GB/s보다 약 1.9배 높습니다.
같은 14B 모델을 둘 다 VRAM에 올려도 3090이 더 빠릅니다. 연산 성능(TFLOPS)은 4070이 앞서지만, LLM 추론은 연산보다 메모리 대역폭에 묶입니다.
3090의 실제 단점
가격만 보고 사면 후회할 수 있는 부분입니다.
1. 전력과 발열
350W입니다. 4070의 1.75배입니다.
- 파워서플라이 최소 750W 권장 (850W면 안심)
- 케이스 통풍이 나쁘면 온도가 쉽게 올라갑니다
- 24시간 돌리면 전기요금이 체감됩니다 — 누진 구간에 걸리면 더 큽니다
2. 크기
3090은 대부분 3슬롯이고 길이가 깁니다. 케이스에 들어가는지 먼저 재보세요. 미들타워라도 안 들어가는 경우가 있습니다. 무겁기도 해서 끝이 처지는 카드입니다 — 5년 된 중고라면 이미 처져 있을 수 있으니 지지대 판단 기준을 같이 보세요.
3. 중고 리스크
- 채굴 이력 — 2021~2022년 채굴 붐 시기 카드가 상당수 시장에 있습니다
- 보증 없음 — 제조사 보증이 끝났거나 승계가 안 됩니다
- 팬·서멀 노후 — 5년 넘은 카드입니다
구매 전 확인할 것:
- 판매자에게 사용 이력과 구매 시기 확인
- 가능하면 직거래로 현장 테스트 (부하 시 온도, 아티팩트)
- 보증 잔여 기간 확인
무엇을 어떤 명령으로 재는지는 중고 그래픽카드 확인법에 절차로 정리했습니다 — 채굴 이력은 못 밝히지만, 위 셋은 그 자리에서 재집니다.
4070이 나은 경우
3090이 항상 정답은 아닙니다.
14B 이하만 쓸 계획이라면 4070으로 충분합니다. Qwen 14B, Gemma 12B 정도로 코딩 보조나 문서 요약을 한다면 12GB로 됩니다.
그리고 이런 조건이면 4070이 낫습니다.
- 게이밍을 겸한다 → DLSS 3, 프레임 생성 지원
- 소형 케이스다 → 3090이 안 들어감
- 파워가 650W 이하다 → 교체 비용이 추가됨
- 중고 거래가 부담스럽다 → 보증이 있는 신품
- 전기요금이 신경 쓰인다 → 200W
다른 선택지도 있습니다
이 둘만 놓고 고민할 필요는 없습니다.
| 카드 | VRAM | 특징 |
|---|---|---|
| RTX 5060 Ti 16GB | 16GB | 신품 + 저전력(180W). 14B 여유, 32B 느림 |
| RTX 5070 Ti | 16GB | 5070보다 VRAM 4GB 많고 대역폭 896 GB/s |
| RTX 3090 Ti | 24GB | 3090과 VRAM 동일, 대역폭 약간 높음, 더 뜨거움 |
5060 Ti 16GB는 특히 눈여겨볼 만합니다. 대역폭은 3090보다 낮지만 VRAM 16GB에 신품·보증·저전력이라, 중고가 부담스러운 경우의 현실적인 대안입니다. 자세한 비교는 5060 Ti 16GB vs 5070에 있습니다.
자주 묻는 질문
3090 두 장이 4090 한 장보다 나은가요
VRAM 총량은 48GB로 4090(24GB)의 두 배라 더 큰 모델을 올릴 수 있습니다. 다만 카드 간 통신 오버헤드가 있어 같은 용량 단일 카드보다 느리고, 파워 700W 이상과 메인보드 슬롯 간격을 감당해야 합니다.
채굴 카드인지 어떻게 아나요
확실한 판별법은 없습니다. 다만 참고할 수 있는 것들이 있습니다. 같은 판매자가 여러 장을 동시에 파는 경우, 팬 소음이 유난히 큰 경우, 서멀 재도포 이력이 있는 경우는 주의합니다. 가격이 시세보다 크게 낮으면 이유를 물어보는 편이 좋습니다.
로컬 LLM만 쓸 건데 게이밍 성능은 안 봐도 되나요
네. LLM 추론 성능은 VRAM 용량 → 메모리 대역폭 → 연산 성능 순으로 중요합니다. 게이밍 벤치마크 순위와 LLM 성능 순위는 일치하지 않습니다.
맥은 어떤가요
메모리 64GB 이상 맥에서는 통합 메모리를 VRAM처럼 써서 70B 모델도 올라갑니다. 다만 대역폭이 전용 GPU보다 낮아 생성 속도는 느립니다. 용량이 필요하면 맥, 속도가 필요하면 전용 GPU입니다.
정리
- 로컬 LLM은 VRAM이 먼저입니다 — 세대나 연산 성능이 아니라
- 3090은 VRAM 24GB, 대역폭 936GB/s로 4070을 두 지표에서 앞섭니다
- 대신 350W·3슬롯·중고 리스크를 받아들여야 합니다
- 14B 이하만 쓴다면 5070이나 5060 Ti 16GB로 충분합니다 (4070은 단종)
VRAM 용량별로 어떤 모델이 돌아가는지는 Ollama 최소 사양 정리에 표로 정리했습니다.
스펙이나 시세가 실제와 다르면 알려주세요. 확인 후 갱신합니다.