로컬 LLM 사양 추천과 그래픽 카드 선택 기준
로컬 LLM 그래픽 카드 추천의 핵심은 그래픽 카드 내부 전용 메모리인 VRAM(비디오 램) 크기입니다. 로컬 LLM 장비 추천 시 프로세서 성능보다 VRAM 용량이 최우선 기준이 됩니다.
기본 정밀도인 FP16(16비트 부동소수점) 상태에서는 1B(10억 개 파라미터)당 약 2GB의 VRAM이 필요합니다. 80억 개 파라미터 모델을 원래 크기로 띄우려면 약 16GB VRAM이 소요됩니다. 하지만 INT4(4비트) 양자화(모델 정밀도를 줄여 메모리 용량을 축소하는 기술)를 적용하면 1B당 메모리 소요량이 약 0.5GB 수준으로 감소합니다.
Qwen 2.5 7B Instruct의 GGUF Q4_K_M 양자화 모델은 파일 크기가 약 4.7GB 내외로 축소됩니다. 따라서 RTX 3060이나 RTX 4060 같은 8GB VRAM 그래픽 카드에서도 단독으로 실행할 수 있습니다. 반면 DeepSeek-R1-Distill-Qwen-14B의 GGUF Q4_K_M 양자화 파일 크기는 약 8.99GB입니다. 이를 구동하려면 최소 12GB 이상 VRAM을 탑재한 그래픽 카드가 필요합니다.
여기서 모델 파일 크기와 실행 중 필요한 전체 메모리를 같다고 보면 안 됩니다. 모델 가중치 외에도 입력과 출력의 문맥을 보관하는 메모리, 실행 프로그램 자체의 여유 공간이 필요합니다. 특히 컨텍스트를 길게 채울수록 추가 메모리가 늘기 때문에, 7B 모델 파일이 8GB 카드에 들어가더라도 128K나 1M 입력을 끝까지 안정적으로 처리한다는 보장은 없습니다.
장비를 사기 전에는 사용할 양자화 파일을 현재 컴퓨터에서 먼저 실행해 최고 VRAM 사용량, 초당 생성 토큰, 첫 응답 대기 시간을 기록하세요. 메모리가 부족해 일부 연산을 시스템 RAM과 CPU로 넘기면 실행은 되더라도 체감 속도가 크게 낮아질 수 있습니다. 목표가 문서 요약이라면 실제 문서 길이로, 코딩이라면 실제 저장소 일부로 측정해야 표의 파라미터 수보다 실용적인 결론을 얻을 수 있습니다.
{
"type": "bar",
"data": {
"labels": ["Qwen 2.5 7B (Q4)", "DeepSeek-R1 14B (Q4)", "1B당 FP16 소요량", "1B당 INT4 소요량"],
"datasets": [{
"label": "용량 및 VRAM 소요 (GB)",
"data": [4.7, 8.99, 2.0, 0.5],
"backgroundColor": ["#2f9e8f", "#1d6f63", "#e76f51", "#f4a261"]
}]
},
"options": {"responsive": true}
}