LLM Faithfulness Checker
Verifica la fedeltà di un output LLM rispetto al contesto sorgente RAG. Analisi frase per frase: supportata, non supportata, contraddetta. Score 0-100 con rilevamento contraddizioni numeriche. 100% client-side, nessun dato inviato.
Input
Come utilizzare LLM Faithfulness Checker
Incolla sorgente e output
Incolla il contesto fornito al sistema RAG nella prima textarea e la risposta generata dall'LLM nella seconda (fino a 6000 caratteri di contesto, 2000 di risposta).
Avvia la verifica
L'output viene segmentato in frasi individuali; per ciascuna si calcola l'overlap lessicale con il contesto e si rilevano contraddizioni su valori numerici e date.
Leggi score e breakdown per frase
Ogni frase riceve un verdict (supportata, non supportata, contraddetta). Lo score finale è: (supportate x1.0 + non supportate x0.3 - contraddette x0.5) / totale x 100.
Suggerimenti
- Usa contesti sorgente completi e non troncati: un contesto parziale genera falsi "non supportati" anche per frasi corrette.
- Presta particolare attenzione alle frasi marcate "contraddetta": sono l'indicatore più forte di allucinazione su dati numerici.
- Consulta il pannello best practice per confrontare la metodologia del tool con RAGAs, TruLens e Anthropic Citation Prompting.
Domande frequenti
Come viene calcolato lo score di fedeltà?
Lo score si ottiene dalla formula (frasi supportate x1.0 + frasi non supportate x0.3 - frasi contraddette x0.5) diviso il numero totale di frasi, moltiplicato per 100, con range 0-100.
Che differenza c'è tra "non supportata" e "contraddetta"?
"Non supportata" significa che la frase non trova riscontro lessicale sufficiente nel contesto, ma non lo contraddice esplicitamente. "Contraddetta" indica un conflitto rilevato, tipicamente su valori numerici o date che divergono da quelli presenti nel contesto.
Il tool usa un modello LLM per l'analisi?
No, l'analisi è completamente euristica, basata su segmentazione in frasi e overlap lessicale/numerico calcolati client-side in JavaScript: nessuna chiamata API, nessun dato inviato a server esterni.
Cosa sono i "termini chiave non ancorati"?
Sono parole o entità rilevanti presenti nell'output ma assenti dal contesto sorgente: segnalano potenziali dettagli aggiunti dal modello senza fondamento nei dati forniti.
Questo tool sostituisce framework come RAGAs o TruLens?
No, è un check rapido euristico e gratuito per un singolo confronto contesto/output. Per valutazioni sistematiche su dataset di test in produzione restano indicati framework dedicati come RAGAs, TruLens o DeepEval, citati anche nella sezione best practice del tool.