Salta al contenuto principale
Privacy on-prem garantita·Costo €0 vs LangSmith/Helicone·Multilingua IT/EN

Prompt da valutare

Separa prompt multipli con --- su una riga separata (max 20)
2 prompt rilevati

Una keyword per riga (stessa ordine dei prompt). Se la keyword è nel response: score 1.0 ✓, altrimenti 0.0 ✗. Lascia vuoto per scoring qualitativo manuale.

Modelli Ollama on-prem

Seleziona uno o più modelli. Ogni modello verrà valutato su tutti i prompt.

Se un model non è installato sul VPS, la cella mostrerà un messaggio di degrade anziché un errore. Esegui ollama pull <model> per installarlo.

2 prompt × 1 model = 2 celle Rate limit: 6 run/min (workload AI pesante)

Come funziona

1

Scrivi i prompt

Inserisci fino a 20 prompt separati da ---. Puoi aggiungere una keyword attesa per ogni prompt per lo scoring automatico.

2

Scegli i modelli

Seleziona i modelli Ollama installati sul VPS Hetzner. Ogni modello viene valutato su tutti i prompt (matrice M×N).

3

Analizza i risultati

Confronta latency, token count e score binario per ogni cella. Esporta in CSV per analisi offline.

Come utilizzare Prompt Eval Harness

Scrivi i prompt

Scrivi uno o più prompt nella textarea, separandoli con --- su una riga propria (max 20 prompt).

Seleziona i modelli

Seleziona uno o più modelli Ollama on-prem da valutare sui prompt inseriti.

Aggiungi keyword attese (opzionale)

Inserisci una keyword attesa per prompt per abilitare lo scoring binario automatico.

Avvia la valutazione

Leggi la matrice risultati con latency, token e score per ogni cella prompt per modello.

Suggerimenti

  • Usa keyword brevi e distintive per uno scoring binario affidabile, ad esempio termini tecnici univoci.
  • Confronta la latency tra modelli diversi per scegliere il modello più adatto al tuo caso d'uso.
  • Rispetta il rate limit di 6 run al minuto: raggruppa più prompt in un'unica esecuzione anziché lanciare run separate.

Domande frequenti

Quanti prompt e modelli posso valutare insieme?

Fino a 20 prompt, valutati su tutti i modelli Ollama selezionati. Il tool genera una matrice con una cella per ogni combinazione prompt-modello.

Come funziona lo scoring automatico?

È binario: se inserisci una keyword attesa per un prompt, la cella riceve score 1.0 se la keyword compare nella risposta del modello, 0.0 altrimenti. Senza keyword lo scoring resta qualitativo manuale.

Cosa significa quando una cella mostra "Model non disponibile"?

Il modello Ollama selezionato non è installato sul VPS. Il tool degrada la cella con un messaggio invece di generare un errore bloccante; va installato con il comando ollama pull.

I miei prompt vengono inviati a servizi cloud esterni?

No, l'inferenza avviene interamente su Ollama on-prem installato sul VPS Hetzner. Nessun dato viene inviato a provider cloud esterni.

Posso esportare i risultati della valutazione?

Sì, il pulsante CSV esporta l'intera matrice (prompt, modello, risposta, latency, token, score) in un file scaricabile.