Quanta VRAM serve per eseguire LLM in locale?
La domanda principale quando si esegue un LLM locale è semplice: starà nella tua GPU? La risposta dipende dalla dimensione del modello, dalla quantizzazione e dalla lunghezza del contesto. Questa guida ti offre un punto di partenza pratico per scegliere la quantità corretta di VRAM.
Come la quantizzazione influisce sulla VRAM
La quantizzazione riduce la precisione utilizzata per memorizzare i pesi del modello. Una quantizzazione a minor numero di bit rende il modello più piccolo e utilizza meno VRAM, con una certa perdita di qualità.
| Quant | Bit per peso | Uso tipico |
|---|---|---|
| Q8_0 | 8 | Qualità molto alta |
| Q6_K | ~6.6 | Qualità molto buona |
| Q5_K_M | ~5.5 | Buona qualità e dimensione |
| Q4_K_M | ~4.5 | Buon equilibrio tra dimensione e qualità |
| Q3_K_M | ~3.5 | Meno VRAM, maggiore perdita di qualità |
Q4_K_M è una scelta comune quando la VRAM è limitata. Se si dispone di più VRAM disponibile, Q5 o Q6 consente di eseguire lo stesso modello con meno quantizzazione.
VRAM approssimativa in base alla dimensione del modello
Queste sono stime approssimative per i pesi del modello. La quantità effettiva di VRAM richiesta è più alta perché il runtime, la KV cache e il contesto utilizzano anche memoria.
| Dimensione del modello | Q8_0 | Q6_K | Q4_K_M | Q3_K_M |
|---|---|---|---|---|
| 4B | ~5 GB | ~4 GB | ~3 GB | ~2.5 GB |
| 8B | ~9 GB | ~7 GB | ~5.5 GB | ~4.5 GB |
| 12B | ~13 GB | ~10 GB | ~8 GB | ~6.5 GB |
| 14B | ~16 GB | ~12 GB | ~9 GB | ~7.5 GB |
| 27B | ~30 GB | ~22 GB | ~17 GB | ~13 GB |
| 32B | ~36 GB | ~27 GB | ~20 GB | ~16 GB |
| 70B | ~80 GB | ~60 GB | ~42 GB | ~34 GB |
Queste sono stime, non limiti rigidi. Diverse architetture dei modelli e formati di quantizzazione possono cambiare la dimensione effettiva.
Cosa può eseguire con diverse quantità di VRAM
| VRAM | Intervallo pratico | Esempi attuali |
|---|---|---|
| 8 GB | Modelli piccoli da circa 4B a 9B | Gemma 4 E4B, Qwen3.5 9B |
| 12 GB | Modelli da piccoli a medi, da circa 9B a 14B | Gemma 4 12B, Qwen3.5 9B |
| 16 GB | 12B a 27B con quantizzazione inferiore | Gemma 4 26B-A4B, Qwen3.6 27B in Q4 |
| 24 GB | 27B a 35B in Q4 a Q6 | Qwen3.8 27B, Gemma 4 31B |
| 32 GB | 27B a 35B con quantizzazione superiore | Qwen3.8 27B, Gemma 4 31B |
| 48 GB | Modelli densi grandi con quantizzazione inferiore | Modelli di classe 70B in Q3 a Q4 |
| 80 GB | Modelli densi grandi con quantizzazione superiore | Modelli di classe 70B in Q4 a Q6 |
Questi intervalli sono per modelli i cui pesi possono stare nella GPU. I grandi modelli MoE sono diversi: solo alcuni dei loro parametri sono attivi per ogni token, ma il modello deve comunque memorizzare il suo intero set di pesi. Un modello con 100B o più parametri totali quindi non sta in un budget di VRAM di 100B semplicemente perché ha meno parametri attivi.
Modelli MoE
I modelli Mixture-of-Experts contengono più gruppi di parametri chiamati esperti. Solo alcuni esperti vengono utilizzati per ogni token, il che può rendere l'inferenza più efficiente rispetto a un modello denso con lo stesso numero totale di parametri.
Tuttavia, gli esperti inattivi fanno comunque parte del modello. I grandi modelli MoE possono quindi richiedere molto più memoria di quanto suggerisca il loro numero di parametri attivi. I modelli molto grandi potrebbero aver bisogno di più GPU o di offloading della RAM di sistema.
Anche la lunghezza del contesto utilizza VRAM
I pesi del modello sono solo parte del requisito di memoria. La KV cache cresce man mano che il contesto si allunga, quindi eseguire lo stesso modello con un contesto di 64K può richiedere sostanzialmente più VRAM rispetto all'esecuzione con 4K.
- Un contesto più lungo richiede più VRAM.
- La precisione della KV cache influisce sull'utilizzo della memoria.
- Anche la dimensione del batch e gli utenti simultanei aumentano l'utilizzo della memoria.
- Lasciare un po' di VRAM disponibile per il runtime invece di riempire completamente la GPU con i pesi del modello.
Suggerimenti pratici
- Controlla la dimensione effettiva del modello quantizzato che si desidera eseguire.
- Non usare la dimensione del file del modello come requisito esatto di VRAM. Lascia spazio per la KV cache e il runtime.
- Se un modello non sta interamente nella VRAM, una parte di esso può essere scaricata nella RAM di sistema, ma l'inferenza sarà in genere più lenta.
- Per carichi di lavoro con contesto lungo o agentici, prevedi più VRAM rispetto ai soli requisiti dei pesi del modello.
- Più GPU possono dividere un modello quando una singola GPU non ha abbastanza VRAM.
Eseguilo su DaDesktop
Non è necessario acquistare una GPU per eseguire un LLM locale. DaDesktop ti offre un desktop cloud con la VRAM di cui hai bisogno, in modo da poter eseguire il modello direttamente senza possedere l'hardware.
Scegli il livello VRAM che si adatta al tuo modello, caricalo e inizia a usarlo. Nessuna configurazione, nessun acquisto di hardware, nessun problema con i driver. Consulta le GPU disponibili per le opzioni.