인터랙티브 과학 · GPU 메모리 vs 사용률
예약은 만석,
손님은 없음
VRAM이 꽉 찬 것과 GPU가 일하는 것은 다른 지표입니다. 모델을 올려두면 메모리는 가중치·KV·예약으로 차지만, GPU-Util은 ‘지금 커널이 도는가’만 보므로 놀고 있으면 0%입니다. 아래에서 직접 눌러 보세요.
이것만 기억하세요메모리 점유 ≠
연산 사용률
연산 사용률
모델 프리셋: 7B · fp16 · 24GB GPU
적재 · 추론 · 예약을 눌러 두 지표를 비교하세요
VRAM 메모리21.6 / 24 GB · 점유율 90%거의 가득
가중치 14.0 사용 중 KV 0.0 빈 KV 풀 7.6 빈 공간 2.4
GPU 사용률 (GPU-Util)커널 실행 시간 비율 · 메모리 점유율과 다른 지표
0%
프레임워크가 KV 풀을 미리 확보해 메모리는 거의 가득 찼지만, GPU-Util은 여전히 0% — 예약은 만석인데 손님은 없는 상태입니다.
단순화한 시뮬레이션이며 실제 GPU 측정값이 아닙니다. GPU-Util(NVML)은 샘플 구간에 커널이 실행된 시간 비율이라, 단순 메모리 전송만으로는 오른다는 보장이 없고 추론 92%도 설명용 부하 예시입니다. KV 캐시는 GQA/MQA에서 KV 헤드 수로 줄며, vLLM의 gpu_memory_utilization(예: 0.9, 기본값 단정 아님)은 가중치에 더하는 게 아니라 전체 목표 상한으로 시작 시 설정합니다.
참고: NVIDIA NVML(GPU-Util 정의), vLLM 메모리 설정, Hugging Face KV 캐시
실험을 마쳤다면