Prompt Eval Harness
Valuta e confronta prompt per LLM con A/B test multi-modello via Ollama on-prem. Misura latency, token count e score binario keyword-match per ogni cella prompt × model. 100% privacy - nessun dato inviato al cloud.
Prompt da valutare
Separa prompt multipli con--- su una riga separata (max 20) Una keyword per riga (stessa ordine dei prompt). Se la keyword è nel response: score 1.0 ✓, altrimenti 0.0 ✗. Lascia vuoto per scoring qualitativo manuale.
Modelli Ollama on-prem
Seleziona uno o più modelli. Ogni modello verrà valutato su tutti i prompt. Se un model non è installato sul VPS, la cella mostrerà un messaggio di degrade anziché un errore. Esegui ollama pull <model> per installarlo.
Come funziona
Scrivi i prompt
Inserisci fino a 20 prompt separati da ---. Puoi aggiungere una keyword attesa per ogni prompt per lo scoring automatico.
Scegli i modelli
Seleziona i modelli Ollama installati sul VPS Hetzner. Ogni modello viene valutato su tutti i prompt (matrice M×N).
Analizza i risultati
Confronta latency, token count e score binario per ogni cella. Esporta in CSV per analisi offline.
Come utilizzare Prompt Eval Harness
Scrivi i prompt
Scrivi uno o più prompt nella textarea, separandoli con --- su una riga propria (max 20 prompt).
Seleziona i modelli
Seleziona uno o più modelli Ollama on-prem da valutare sui prompt inseriti.
Aggiungi keyword attese (opzionale)
Inserisci una keyword attesa per prompt per abilitare lo scoring binario automatico.
Avvia la valutazione
Leggi la matrice risultati con latency, token e score per ogni cella prompt per modello.
Suggerimenti
- Usa keyword brevi e distintive per uno scoring binario affidabile, ad esempio termini tecnici univoci.
- Confronta la latency tra modelli diversi per scegliere il modello più adatto al tuo caso d'uso.
- Rispetta il rate limit di 6 run al minuto: raggruppa più prompt in un'unica esecuzione anziché lanciare run separate.
Domande frequenti
Quanti prompt e modelli posso valutare insieme?
Fino a 20 prompt, valutati su tutti i modelli Ollama selezionati. Il tool genera una matrice con una cella per ogni combinazione prompt-modello.
Come funziona lo scoring automatico?
È binario: se inserisci una keyword attesa per un prompt, la cella riceve score 1.0 se la keyword compare nella risposta del modello, 0.0 altrimenti. Senza keyword lo scoring resta qualitativo manuale.
Cosa significa quando una cella mostra "Model non disponibile"?
Il modello Ollama selezionato non è installato sul VPS. Il tool degrada la cella con un messaggio invece di generare un errore bloccante; va installato con il comando ollama pull.
I miei prompt vengono inviati a servizi cloud esterni?
No, l'inferenza avviene interamente su Ollama on-prem installato sul VPS Hetzner. Nessun dato viene inviato a provider cloud esterni.
Posso esportare i risultati della valutazione?
Sì, il pulsante CSV esporta l'intera matrice (prompt, modello, risposta, latency, token, score) in un file scaricabile.