Vai al contenuto
Enterprise Srl
Enterprise Srl - Home
Intelligenza artificiale

Che cosa sono gli eval dei sistemi AI?

Anche: Eval · Valutazione dei modelli · AI evaluation

Definizione

Gli eval sono scenari di test automatici che verificano il comportamento di un sistema AI su casi realistici: se risponde correttamente, se usa lo strumento giusto, se chiede conferma quando deve e se resiste ai tentativi di manipolazione. Servono prima di ogni rilascio e ogni volta che si cambia modello.

Redazione Enterprise Srl · Aggiornato il

Perché i test tradizionali non bastano

Un software classico, a parità di input, dà sempre lo stesso output. Un LLM no: la stessa domanda può produrre risposte diverse, e un nuovo modello può migliorare un compito e peggiorarne un altro. Gli eval misurano il comportamento su molti casi e rendono il confronto ripetibile.

Come si costruiscono

  • Si parte dai casi reali: domande vere degli utenti, documenti tipici, errori già visti.
  • Per ogni caso si stabilisce cosa è corretto: la risposta, lo strumento chiamato, la richiesta di conferma, il rifiuto.
  • Si includono i casi avversari: istruzioni nascoste, richieste fuori ambito, nomi ambigui.
  • Si eseguono in automatico e si confrontano i risultati tra versioni.

Un esempio reale

L’agente di LOFT Enterprise, il gestionale interno di Enterprise Srl, è verificato da 45 scenari di test, compresi tentativi di prompt injection. Un modello migliore si prova sugli stessi scenari prima di sostituire quello in uso.

Tutti i termini del glossario