Salta al contenuto principale

Input

Come utilizzare LLM Faithfulness Checker

Incolla sorgente e output

Incolla il contesto fornito al sistema RAG nella prima textarea e la risposta generata dall'LLM nella seconda (fino a 6000 caratteri di contesto, 2000 di risposta).

Avvia la verifica

L'output viene segmentato in frasi individuali; per ciascuna si calcola l'overlap lessicale con il contesto e si rilevano contraddizioni su valori numerici e date.

Leggi score e breakdown per frase

Ogni frase riceve un verdict (supportata, non supportata, contraddetta). Lo score finale è: (supportate x1.0 + non supportate x0.3 - contraddette x0.5) / totale x 100.

Suggerimenti

  • Usa contesti sorgente completi e non troncati: un contesto parziale genera falsi "non supportati" anche per frasi corrette.
  • Presta particolare attenzione alle frasi marcate "contraddetta": sono l'indicatore più forte di allucinazione su dati numerici.
  • Consulta il pannello best practice per confrontare la metodologia del tool con RAGAs, TruLens e Anthropic Citation Prompting.

Domande frequenti

Come viene calcolato lo score di fedeltà?

Lo score si ottiene dalla formula (frasi supportate x1.0 + frasi non supportate x0.3 - frasi contraddette x0.5) diviso il numero totale di frasi, moltiplicato per 100, con range 0-100.

Che differenza c'è tra "non supportata" e "contraddetta"?

"Non supportata" significa che la frase non trova riscontro lessicale sufficiente nel contesto, ma non lo contraddice esplicitamente. "Contraddetta" indica un conflitto rilevato, tipicamente su valori numerici o date che divergono da quelli presenti nel contesto.

Il tool usa un modello LLM per l'analisi?

No, l'analisi è completamente euristica, basata su segmentazione in frasi e overlap lessicale/numerico calcolati client-side in JavaScript: nessuna chiamata API, nessun dato inviato a server esterni.

Cosa sono i "termini chiave non ancorati"?

Sono parole o entità rilevanti presenti nell'output ma assenti dal contesto sorgente: segnalano potenziali dettagli aggiunti dal modello senza fondamento nei dati forniti.

Questo tool sostituisce framework come RAGAs o TruLens?

No, è un check rapido euristico e gratuito per un singolo confronto contesto/output. Per valutazioni sistematiche su dataset di test in produzione restano indicati framework dedicati come RAGAs, TruLens o DeepEval, citati anche nella sezione best practice del tool.