Che cosa sono gli eval dei sistemi AI?
Anche: Eval · Valutazione dei modelli · AI evaluation
Definizione
Gli eval sono scenari di test automatici che verificano il comportamento di un sistema AI su casi realistici: se risponde correttamente, se usa lo strumento giusto, se chiede conferma quando deve e se resiste ai tentativi di manipolazione. Servono prima di ogni rilascio e ogni volta che si cambia modello.
Redazione Enterprise Srl · Aggiornato il
Perché i test tradizionali non bastano
Un software classico, a parità di input, dà sempre lo stesso output. Un LLM no: la stessa domanda può produrre risposte diverse, e un nuovo modello può migliorare un compito e peggiorarne un altro. Gli eval misurano il comportamento su molti casi e rendono il confronto ripetibile.
Come si costruiscono
- Si parte dai casi reali: domande vere degli utenti, documenti tipici, errori già visti.
- Per ogni caso si stabilisce cosa è corretto: la risposta, lo strumento chiamato, la richiesta di conferma, il rifiuto.
- Si includono i casi avversari: istruzioni nascoste, richieste fuori ambito, nomi ambigui.
- Si eseguono in automatico e si confrontano i risultati tra versioni.
Un esempio reale
L’agente di LOFT Enterprise, il gestionale interno di Enterprise Srl, è verificato da 45 scenari di test, compresi tentativi di prompt injection. Un modello migliore si prova sugli stessi scenari prima di sostituire quello in uso.