Salta al contenuto principale

Disclaimer: prezzi snapshot manuali 2026-05, possono variare. Token default = stime medie. Verifica i listini ufficiali prima di decisioni di acquisto.

Configura Output e Parametri

Pre-compila i token stimati medi per il tipo scelto
Stima per Chat Reply: 500token
Stima per Chat Reply: 300token
Token effettivi per output:500input+300output

Seleziona Modelli

5 selezionati

Confronto Costo Per Output

Chat Reply
Provider / ModelloCosto / outputGiornalieroMensile (30d)Risparmio vs 1°
Gemini 2.5 FlashGooglePiu economico $0.00017 $0.17$5.10 -88%
DeepSeek-V3DeepSeek $0.00070 $0.70$21.00 -50%
GPT-5 miniOpenAI $0.0014 $1.40$42.00 Baseline
Claude Haiku 4.5Anthropic $0.0016 $1.60$48.00 +14%
Ollama llama3.1:8b (on-prem)Meta / Self-hostedOn-Prem Free$0.00 (on-prem)$0.00$0.00 -100%

Costo Mensile per Modello

(on-prem Ollama escluso per scala)

Come utilizzare LLM Cost Per Output Calculator

Scegli il tipo di output

Seleziona uno dei 7 tipi (chat reply, RAG, summarization, code generation, agent loop, embeddings, classification): il tool pre-stima i token medi di input/output per quel tipo.

Imposta volume e ottimizzazioni

Indica le richieste al giorno, eventuali override manuali dei token e attiva prompt caching e/o batch API se li usi in produzione.

Confronta i modelli selezionati

Seleziona i modelli da confrontare tra 12+ provider cloud + Ollama on-prem e leggi costo per output, costo giornaliero/mensile e saving % rispetto al baseline.

Suggerimenti

  • Usa gli scenari precaricati "RAG" e "Agent Loop" per vedere rapidamente come cambiano i modelli consigliati in base al tipo di output.
  • Se il tuo workload ha prompt di sistema ripetuti su ogni richiesta, attiva il prompt caching per vedere l'impatto reale sul costo.
  • Confronta sempre almeno un modello cloud premium e uno più economico per capire il trade-off qualità/costo prima di scegliere.

Domande frequenti

Come vengono stimati i token se non li inserisco manualmente?

Ogni tipo di output ha una stima di default calibrata sul caso d'uso tipico (es. un agent loop usa molti più token di una chat reply): puoi sempre sovrascrivere input e output token con i tuoi valori reali.

Cosa cambia attivando il prompt caching?

Il prompt caching applica un saving stimato del 90% sulla porzione di input token che il provider considera cache-hit (es. prompt di sistema ripetuti): il tool lo mostra come riduzione del costo per output.

E il batch API discount?

Il batch API applica uno sconto stimato del 50% sul costo, tipico dei provider che offrono elaborazione asincrona non real-time: utile per workload non interattivi come summarization o classification massive.

Che differenza c'è con LLM Cost Optimizer?

LLM Cost Optimizer calcola il TCO complessivo mensile/annuo con break-even vs Ollama on-prem; questo tool si concentra sul costo unitario per singolo output, utile per confrontare provider a parità di caso d'uso specifico.

Il modello Ollama on-prem ha sempre costo zero per output?

Nel confronto il modello locale è marcato come tale e non entra nel calcolo del costo mensile a consumo dei provider cloud: il suo costo reale è quello fisso dell'infrastruttura che lo ospita, non stimato per singolo output in questo tool.