Calcolatore VRAM GPU per Inferenza LLM On-Prem
Stima la VRAM necessaria per eseguire un modello LLM in locale. Scegli il numero di parametri, la quantizzazione (FP16, INT8, INT4) e ottieni il tier GPU consigliato per l'hardware on-prem.
Configura
Risultato
Nessun risultato
Inserisci i valori e premi il pulsante per calcolare.
Domande frequenti
Come si calcola la VRAM necessaria per l'inferenza di un LLM?
La stima empirica più usata dalla community ML è: VRAM_GB = parametri × bytes_per_param × overhead_factor. Per un modello FP16 con 7 miliardi di parametri: 7 × 2 × 1.2 = 16.8 GB. Questo overhead del 20% copre la KV cache, le attivazioni intermedie e il footprint del framework (PyTorch, llama.cpp, Ollama). La stima è approssimativa: architetture MoE, Mamba o vision transformer possono richiedere VRAM aggiuntiva.
Qual è la differenza tra FP16, INT8 e INT4 per l'inferenza?
FP16 (float a 16 bit) è la precisione piena standard: ogni parametro occupa 2 byte. INT8 (quantizzazione a 8 bit) dimezza il consumo di VRAM con perdita di qualità minima (<1% nei benchmark principali). INT4 (quantizzazione a 4 bit, es. GGUF Q4_K_M) riduce la VRAM al 25% del FP16 con qualità ancora accettabile per la maggior parte dei task. La scelta ottimale dipende dall'hardware disponibile e dalla sensibilità del task alla qualità.
Che GPU serve per eseguire Llama 3 70B in locale?
Llama 3 70B in FP16 richiede circa 168 GB di VRAM (fuori dalla portata di una singola GPU consumer). In INT8 si scende a ~84 GB (1× NVIDIA H100 80 GB o 2× A100 40 GB). In INT4 bastano circa 42 GB (es. 2× RTX 3090 24 GB in tensor parallel, o 1× A100 80 GB). Per uso pratico on-prem con budget contenuto, considera Llama 3.1 8B (INT4: ~4.8 GB) o Llama 3 13B (INT4: ~7.8 GB) su GPU consumer.
Cos'è la KV cache e come influisce sulla VRAM?
La KV cache (Key-Value cache) memorizza i token già elaborati durante la generazione, evitando il ricalcolo ad ogni passo. La sua dimensione dipende dal contesto (numero di token): con contesti lunghi (32k-128k token) la KV cache può richiedere più VRAM del modello stesso. L'overhead di default di 1.2 (20%) è conservativo per contesti medi; per contesti >32k token considera un overhead di 1.5–2.0. Tecniche come FlashAttention-2 e quantizzazione della KV cache (GQA, MQA) riducono significativamente questo impatto.
Posso eseguire un LLM da 13B su una RTX 4090 con 24 GB di VRAM?
Sì, con la quantizzazione appropriata. Un modello 13B in INT4 richiede circa 7.8 GB (13 × 0.5 × 1.2), ampiamente compatibile con 24 GB. In INT8 sale a ~15.6 GB, ancora nei limiti della RTX 4090. In FP16 servirebbe ~31.2 GB, che supera i 24 GB disponibili. Strumenti come Ollama, llama.cpp e GPTQ rendono la quantizzazione automatica e trasparente. La RTX 4090 è una delle GPU consumer più efficienti per inferenza locale: alta VRAM (24 GB) + larghezza di banda memoria elevata (1 TB/s) la rendono ideale per modelli da 7B–30B quantizzati.
Come si usa
- Inserisci il numero di parametri
Indica il numero di parametri del modello in miliardi (B). Esempi: Llama-3-8B = 8, Mistral-7B = 7, Qwen2.5-72B = 72.
- Seleziona la quantizzazione
FP16 offre la massima qualità ma richiede il doppio della VRAM rispetto a INT8. INT4 è il più efficiente in memoria ma può ridurre leggermente la qualità dell'output.
- Imposta il fattore di overhead
Il valore predefinito 1.2 rappresenta un overhead del 20% per KV cache, attivazioni e framework. Aumenta a 1.3–1.5 per batch elevati o contesti lunghi.
- Calcola e interpreta il risultato
Il calcolatore mostra la VRAM stimata in GB e il tier GPU consigliato (consumer, prosumer, professional, datacenter). Usa il risultato per scegliere l'hardware on-prem adeguato.
VRAM e inferenza LLM on-prem: come stimare l'hardware necessario
Eseguire un Large Language Model (LLM) in locale - su un server on-prem, un VPS dedicato o una workstation con GPU - richiede soprattutto un requisito: sufficiente VRAM (Video RAM). La VRAM è la memoria della GPU, e i moderni LLM sono altamente esigenti: ogni parametro occupa da 0.5 a 2 byte a seconda della quantizzazione scelta.
La formula empirica standard della community ML è: VRAM_GB = parametri_B × bytes_per_param × overhead_factor. Per un modello da 7 miliardi di parametri (7B) in FP16, il calcolo è: 7 × 2 × 1.2 = 16.8 GB. L'overhead del 20% copre la KV cache (memoria dei token già elaborati), le attivazioni intermedie e il footprint del framework (Ollama, llama.cpp, vLLM).
La quantizzazione è il fattore più importante per ridurre il requisito VRAM senza rinunciare completamente alla qualità: INT8 dimezza la VRAM rispetto a FP16 con perdita di qualità minima; INT4 riduce a 1/4 della FP16 con qualità ancora accettabile per la maggior parte dei task di produzione. Strumenti come GGUF/llama.cpp, GPTQ e AWQ rendono la quantizzazione automatica e accessibile a chiunque.
Attenzione: questa stima è empirica (confidence MEDIUM, A4) e può sottostimare il requisito reale per architetture speciali come Mixture-of-Experts (MoE, es. Mixtral), modelli Vision (es. LLaVA), o modelli con contesti molto lunghi (>32k token). In questi casi, aumenta il fattore di overhead a 1.5–2.0.
Esempio pratico: Llama 3.1 8B in INT4 su RTX 4090
- Modello: Llama 3.1 8B (8 miliardi di parametri)
- Quantizzazione: INT4 (0.5 byte/param) - formato GGUF Q4_K_M
- Overhead factor: 1.2 (20% per KV cache + attivazioni)
- VRAM = 8 × 0.5 × 1.2 = 4.8 GB
- Tier GPU: consumer (≤8 GB) - RTX 3080/4080 con margine ampio
Glossario VRAM e inferenza LLM
- VRAM
- Video RAM - la memoria dedicata della GPU. I parametri del modello LLM vengono caricati in VRAM per l'inferenza: senza abbastanza VRAM il modello non parte o usa la RAM di sistema (molto più lenta).
- Quantizzazione
- Tecnica per ridurre la precisione numerica dei parametri da 32/16 bit a 8 o 4 bit. Riduce drasticamente la VRAM necessaria con un impatto minimo sulla qualità dell'output. Formati comuni: GGUF (llama.cpp), GPTQ, AWQ, ExLlamaV2.
- KV Cache
- Key-Value cache: struttura che memorizza i vettori chiave e valore degli attention layer per i token già elaborati. Evita il ricalcolo ad ogni passo ma occupa VRAM proporzionale alla lunghezza del contesto. Con contesti lunghi (32k-128k token) può diventare il principale consumatore di VRAM.
- Parametri (B)
- Numero di pesi del modello, tipicamente indicato in miliardi (B). Un modello 7B ha 7 miliardi di parametri. Il numero di parametri è il principale determinante della qualità e del requisito hardware.
- Overhead Factor
- Fattore moltiplicativo che stima la VRAM aggiuntiva rispetto ai soli parametri. Include: KV cache, attivazioni intermedie (forward pass), buffer del framework (Ollama, vLLM). Default 1.2 (20%) per contesti medi; aumentare a 1.5–2.0 per contesti lunghi.
- Tier GPU
- Classificazione dell'hardware GPU in base alla VRAM richiesta: consumer (≤8 GB: RTX 3080/4080), prosumer (≤16 GB: RTX 3090/4090), professional (≤80 GB: A100/H100), datacenter (>80 GB: cluster multi-GPU).
Serve un'analisi su misura?
Questo strumento è gratuito e informativo. Per un'analisi approfondita con AI on-prem - dati privati, zero cloud - contatta Federico.