Llama 3.1 8B · Q4_K_M
GGUF · Q4_K_M
- Model-size signal
- 4.6 GB
- Minimum load
- 5.6 GB
- Planning memory
- 6.6 GB
- GPU VRAM
- 16 GB
16 GB dedicated VRAM meets the 6.6 GB planning memory level for Llama 3.1 8B · Q4_K_M.
This is a deterministic memory fit, not a speed or quality benchmark.