RTX 5070 Ti vs 5080 — 로컬 LLM에서는 같은 카드입니다
상급으로 올라가면 5070 Ti와 5080 사이에서 고민하게 됩니다. 가격 차이는 꽤 나는데, 로컬 LLM에서 뭐가 달라지는지는 잘 안 나옵니다.
결론부터 말하면 거의 안 달라집니다.
결론부터
| RTX 5070 Ti | RTX 5080 | |
|---|---|---|
| VRAM | 16GB | 16GB — 같습니다 |
| 메모리 대역폭 | 896 GB/s | 960 GB/s (+7%) |
| TDP | 300W | 360W (+60W) |
로컬 LLM에서 중요한 두 지표 중 하나가 완전히 같고, 나머지가 7% 차이입니다.
돌아가는 모델이 완전히 같습니다
VRAM이 같으니 당연한 결과입니다.
| 모델 크기 | 필요 메모리 | 5070 Ti | 5080 |
|---|---|---|---|
| 7~8B | 약 6.5GB | 여유 | 여유 |
| 12~14B | 약 10.6GB | 여유 | 여유 |
| 20~22B | 약 15.7GB | 빠듯 | 빠듯 |
| 32B | 약 22.2GB | 느림 | 느림 |
네 줄이 전부 같습니다. 판정이 갈리는 조합이 하나도 없습니다.
여유 쓸 수 있습니다
RTX 5060 Ti 16GB로 12~14B 모델은 무리 없습니다. 지금 카드를 그대로 쓰시면 됩니다.지금 카드로는 12~14B까지입니다. 더 큰 20~22B 모델까지 돌리려면 RTX 5090(메모리 32GB) 이상이 필요합니다.
이 길이에서는 대부분이 모델 가중치입니다. 짧게 써도 크게 안 줄어듭니다.
필요 10.6GB = 가중치 8.8 + 컨텍스트 0.8 + 여유 1.0 내 카드 16GB
다른 크기도 함께 보기
| 모델 크기 | 필요 메모리 | 내 카드에서 |
|---|---|---|
| 3B Llama 3.2 3B, Qwen 3B |
3.3GB 가중치 1.9 · 컨텍스트 0.4 |
여유 전부 그래픽카드 메모리에 올라감 |
| 7~8B Llama 3.1 8B, Qwen 7B |
6.5GB 가중치 5.0 · 컨텍스트 0.5 |
여유 전부 그래픽카드 메모리에 올라감 |
| 12~14B Qwen 14B, Gemma 12B |
10.6GB 가중치 8.8 · 컨텍스트 0.8 |
여유 전부 그래픽카드 메모리에 올라감 |
| 20~22B Mistral Small |
15.7GB 가중치 13.9 · 컨텍스트 0.9 |
빠듯 짧은 내용만 다루면 가능 |
| 32B Qwen 32B, QwQ 32B |
22.2GB 가중치 20.2 · 컨텍스트 1.0 |
느림 일부가 CPU로 넘어가 답답해짐 |
| 70B Llama 3.3 70B |
46.4GB 가중치 44.1 · 컨텍스트 1.3 |
불가 실사용이 어려움 |
| 120B+ Mixtral 8x22B급 |
77.6GB 가중치 75.6 · 컨텍스트 1.0 |
불가 실사용이 어려움 |
근사치입니다. 실제로 쓸 모델의 파일 크기는 배포판마다 다릅니다. 경계선에 있다면 한 단계 위 메모리를 택하는 편이 안전합니다.
두 카드를 번갈아 골라보셔도 결과가 바뀌지 않습니다.
7% 차이가 어느 정도인가
대역폭 896에서 960이면 7% 높습니다.
지금까지 이 사이트에서 다룬 차이들과 나란히 놓으면 이렇습니다.
| 비교 | 대역폭 차이 |
|---|---|
| 5060 → 5070 | +50% |
| 4060 Ti 16GB → 5060 Ti 16GB | +56% |
| 시스템 램 → 5060 | +400% |
| 5070 Ti → 5080 | +7% |
7%는 체감하기 어려운 폭입니다. 답변이 10초 걸리던 게 9.3초가 되는 정도입니다.
그마저도 대역폭 차이가 그대로 속도 차이로 나오지는 않습니다. 실행 프로그램과 모델 구조가 함께 작용하기 때문입니다.
그럼 5080은 왜 있나
게이밍과 영상 작업에서는 의미가 있습니다. 연산 성능이 더 높습니다.
로컬 LLM이 연산보다 메모리에 묶여 있어서 그 차이가 안 드러날 뿐입니다. 3090 vs 4070에서 세대가 낮은 카드가 이겼던 것과 같은 이유입니다.
용도가 로컬 LLM 하나라면 5080의 값어치는 거의 없습니다. 게이밍을 겸한다면 이야기가 달라집니다.
16GB라는 천장이 같습니다
더 중요한 건 이쪽입니다.
둘 다 32B에서 막힙니다. 32B는 약 22.2GB가 필요한데 16GB로는 안 됩니다. "느림" 판정이라 돌아가긴 하지만 일부가 CPU로 넘어갑니다.
32B 를 여유 있게 쓰려면 → 32GB
개인용 신품 상한 → RTX 5090 (32GB)
5080에 돈을 더 쓰는 대신, 32GB로 한 번에 올라가는 편이 로컬 LLM에서는 낫습니다. 그 사이에는 아무것도 없습니다.
그럼 무엇을 사야 하나
16GB면 충분하다면 → 5070 Ti 같은 결과에 60W 덜 먹고 더 쌉니다.
16GB로 모자란다면 → 5090 (32GB) 5080은 그 중간을 메워주지 못합니다. VRAM이 5070 Ti와 같기 때문입니다.
예산이 애매하다면 → 5060 Ti 16GB 같은 16GB에 대역폭만 낮습니다(448). 그래도 돌아가는 모델은 같습니다.
| 카드 | VRAM | 대역폭 | 돌아가는 모델 |
|---|---|---|---|
| RTX 5060 Ti 16GB | 16GB | 448 GB/s | 14B 여유 |
| RTX 5070 Ti | 16GB | 896 GB/s | 14B 여유 |
| RTX 5080 | 16GB | 960 GB/s | 14B 여유 |
| RTX 5090 | 32GB | 1792 GB/s | 32B 여유 |
16GB 칸 세 줄은 돌아가는 모델이 전부 같습니다. 속도만 다릅니다. 줄이 바뀌는 건 5090 하나뿐입니다.
자주 묻는 질문
5080이 5070 Ti보다 아예 안 나은가요
로컬 LLM에서는 대역폭 7%가 전부입니다. 게이밍이나 영상 작업에서는 차이가 더 납니다. 용도를 먼저 정하시면 답이 나옵니다.
그럼 5070 Ti와 5060 Ti 16GB는요
대역폭이 896 vs 448로 두 배 차이입니다. 이건 체감됩니다. 7%와는 다른 이야기입니다. 다만 돌아가는 모델 크기는 역시 같습니다.
32B를 쓰려면 5090밖에 없나요
신품 기준으로는 그렇습니다. 중고까지 보면 3090·4090(24GB)이 있습니다. 중고 3090 글을 참고하세요.
5080 두 장은 어떤가요
VRAM 총량은 32GB가 되지만 속도가 합쳐지지 않고 전력이 720W입니다. 5090 한 장이 낫습니다. 두 장 구성의 실제 제약은 그래픽카드 두 장에 적었습니다.
5090 은 뭐가 그렇게 다른가요
VRAM 이 32GB 라 32B 가 "느림"에서 "여유"로 바뀝니다. 줄이 바뀌는 유일한 카드입니다. 대신 575W 라 파워 교체와 전기요금이 따라옵니다 — RTX 5090 32GB에 정리했습니다.
게이밍도 하는데요
그러면 5080이 의미 있습니다. 이 글은 로컬 LLM만 놓고 본 결론입니다.
정리
- VRAM이 둘 다 16GB입니다. 돌아가는 모델이 완전히 같습니다
- 대역폭 차이는 7%입니다. 체감하기 어려운 폭입니다
- 5080은 60W를 더 먹습니다
- 16GB로 모자라면 32GB로 가야 합니다. 5080은 그 중간을 못 메웁니다
- 로컬 LLM만 쓴다면 5070 Ti, 겸용이면 5080입니다
VRAM 용량별 전체 표는 Ollama 최소 사양 정리에 있습니다.
스펙이나 판정이 실제와 다르면 알려주세요. 확인 후 갱신합니다.