Salta al contenuto principale

Calcolatore VRAM GPU per Inferenza LLM On-Prem

Stima la VRAM necessaria per eseguire un modello LLM in locale. Scegli il numero di parametri, la quantizzazione (FP16, INT8, INT4) e ottieni il tier GPU consigliato per l'hardware on-prem.

Configura

Es.: 7 per Llama-3-8B, 13 per Llama-2-13B, 70 per Qwen2.5-72B

Default 1.2 (20% overhead). Aumenta a 1.5 per contesti lunghi (>32k token).

Risultato

Nessun risultato

Inserisci i valori e premi il pulsante per calcolare.

Domande frequenti

Come si calcola la VRAM necessaria per l'inferenza di un LLM?

La stima empirica più usata dalla community ML è: VRAM_GB = parametri × bytes_per_param × overhead_factor. Per un modello FP16 con 7 miliardi di parametri: 7 × 2 × 1.2 = 16.8 GB. Questo overhead del 20% copre la KV cache, le attivazioni intermedie e il footprint del framework (PyTorch, llama.cpp, Ollama). La stima è approssimativa: architetture MoE, Mamba o vision transformer possono richiedere VRAM aggiuntiva.

Qual è la differenza tra FP16, INT8 e INT4 per l'inferenza?

FP16 (float a 16 bit) è la precisione piena standard: ogni parametro occupa 2 byte. INT8 (quantizzazione a 8 bit) dimezza il consumo di VRAM con perdita di qualità minima (<1% nei benchmark principali). INT4 (quantizzazione a 4 bit, es. GGUF Q4_K_M) riduce la VRAM al 25% del FP16 con qualità ancora accettabile per la maggior parte dei task. La scelta ottimale dipende dall'hardware disponibile e dalla sensibilità del task alla qualità.

Che GPU serve per eseguire Llama 3 70B in locale?

Llama 3 70B in FP16 richiede circa 168 GB di VRAM (fuori dalla portata di una singola GPU consumer). In INT8 si scende a ~84 GB (1× NVIDIA H100 80 GB o 2× A100 40 GB). In INT4 bastano circa 42 GB (es. 2× RTX 3090 24 GB in tensor parallel, o 1× A100 80 GB). Per uso pratico on-prem con budget contenuto, considera Llama 3.1 8B (INT4: ~4.8 GB) o Llama 3 13B (INT4: ~7.8 GB) su GPU consumer.

Cos'è la KV cache e come influisce sulla VRAM?

La KV cache (Key-Value cache) memorizza i token già elaborati durante la generazione, evitando il ricalcolo ad ogni passo. La sua dimensione dipende dal contesto (numero di token): con contesti lunghi (32k-128k token) la KV cache può richiedere più VRAM del modello stesso. L'overhead di default di 1.2 (20%) è conservativo per contesti medi; per contesti >32k token considera un overhead di 1.5–2.0. Tecniche come FlashAttention-2 e quantizzazione della KV cache (GQA, MQA) riducono significativamente questo impatto.

Posso eseguire un LLM da 13B su una RTX 4090 con 24 GB di VRAM?

Sì, con la quantizzazione appropriata. Un modello 13B in INT4 richiede circa 7.8 GB (13 × 0.5 × 1.2), ampiamente compatibile con 24 GB. In INT8 sale a ~15.6 GB, ancora nei limiti della RTX 4090. In FP16 servirebbe ~31.2 GB, che supera i 24 GB disponibili. Strumenti come Ollama, llama.cpp e GPTQ rendono la quantizzazione automatica e trasparente. La RTX 4090 è una delle GPU consumer più efficienti per inferenza locale: alta VRAM (24 GB) + larghezza di banda memoria elevata (1 TB/s) la rendono ideale per modelli da 7B–30B quantizzati.

Come si usa

  1. Inserisci il numero di parametri

    Indica il numero di parametri del modello in miliardi (B). Esempi: Llama-3-8B = 8, Mistral-7B = 7, Qwen2.5-72B = 72.

  2. Seleziona la quantizzazione

    FP16 offre la massima qualità ma richiede il doppio della VRAM rispetto a INT8. INT4 è il più efficiente in memoria ma può ridurre leggermente la qualità dell'output.

  3. Imposta il fattore di overhead

    Il valore predefinito 1.2 rappresenta un overhead del 20% per KV cache, attivazioni e framework. Aumenta a 1.3–1.5 per batch elevati o contesti lunghi.

  4. Calcola e interpreta il risultato

    Il calcolatore mostra la VRAM stimata in GB e il tier GPU consigliato (consumer, prosumer, professional, datacenter). Usa il risultato per scegliere l'hardware on-prem adeguato.

VRAM e inferenza LLM on-prem: come stimare l'hardware necessario

Eseguire un Large Language Model (LLM) in locale - su un server on-prem, un VPS dedicato o una workstation con GPU - richiede soprattutto un requisito: sufficiente VRAM (Video RAM). La VRAM è la memoria della GPU, e i moderni LLM sono altamente esigenti: ogni parametro occupa da 0.5 a 2 byte a seconda della quantizzazione scelta.

La formula empirica standard della community ML è: VRAM_GB = parametri_B × bytes_per_param × overhead_factor. Per un modello da 7 miliardi di parametri (7B) in FP16, il calcolo è: 7 × 2 × 1.2 = 16.8 GB. L'overhead del 20% copre la KV cache (memoria dei token già elaborati), le attivazioni intermedie e il footprint del framework (Ollama, llama.cpp, vLLM).

La quantizzazione è il fattore più importante per ridurre il requisito VRAM senza rinunciare completamente alla qualità: INT8 dimezza la VRAM rispetto a FP16 con perdita di qualità minima; INT4 riduce a 1/4 della FP16 con qualità ancora accettabile per la maggior parte dei task di produzione. Strumenti come GGUF/llama.cpp, GPTQ e AWQ rendono la quantizzazione automatica e accessibile a chiunque.

Attenzione: questa stima è empirica (confidence MEDIUM, A4) e può sottostimare il requisito reale per architetture speciali come Mixture-of-Experts (MoE, es. Mixtral), modelli Vision (es. LLaVA), o modelli con contesti molto lunghi (>32k token). In questi casi, aumenta il fattore di overhead a 1.5–2.0.

Esempio pratico: Llama 3.1 8B in INT4 su RTX 4090

  1. Modello: Llama 3.1 8B (8 miliardi di parametri)
  2. Quantizzazione: INT4 (0.5 byte/param) - formato GGUF Q4_K_M
  3. Overhead factor: 1.2 (20% per KV cache + attivazioni)
  4. VRAM = 8 × 0.5 × 1.2 = 4.8 GB
  5. Tier GPU: consumer (≤8 GB) - RTX 3080/4080 con margine ampio
VRAM stimata4.8 GB

Glossario VRAM e inferenza LLM

VRAM
Video RAM - la memoria dedicata della GPU. I parametri del modello LLM vengono caricati in VRAM per l'inferenza: senza abbastanza VRAM il modello non parte o usa la RAM di sistema (molto più lenta).
Quantizzazione
Tecnica per ridurre la precisione numerica dei parametri da 32/16 bit a 8 o 4 bit. Riduce drasticamente la VRAM necessaria con un impatto minimo sulla qualità dell'output. Formati comuni: GGUF (llama.cpp), GPTQ, AWQ, ExLlamaV2.
KV Cache
Key-Value cache: struttura che memorizza i vettori chiave e valore degli attention layer per i token già elaborati. Evita il ricalcolo ad ogni passo ma occupa VRAM proporzionale alla lunghezza del contesto. Con contesti lunghi (32k-128k token) può diventare il principale consumatore di VRAM.
Parametri (B)
Numero di pesi del modello, tipicamente indicato in miliardi (B). Un modello 7B ha 7 miliardi di parametri. Il numero di parametri è il principale determinante della qualità e del requisito hardware.
Overhead Factor
Fattore moltiplicativo che stima la VRAM aggiuntiva rispetto ai soli parametri. Include: KV cache, attivazioni intermedie (forward pass), buffer del framework (Ollama, vLLM). Default 1.2 (20%) per contesti medi; aumentare a 1.5–2.0 per contesti lunghi.
Tier GPU
Classificazione dell'hardware GPU in base alla VRAM richiesta: consumer (≤8 GB: RTX 3080/4080), prosumer (≤16 GB: RTX 3090/4090), professional (≤80 GB: A100/H100), datacenter (>80 GB: cluster multi-GPU).

Serve un'analisi su misura?

Questo strumento è gratuito e informativo. Per un'analisi approfondita con AI on-prem - dati privati, zero cloud - contatta Federico.

Richiedi preventivo