Evals (afkorting voor evaluations) zijn de gestructureerde tests waarmee je nagaat of de output van een AI-oplossing die op een LLM draait, correct, relevant, veilig en consistent is. Gewone software is deterministisch: een vaste input geeft altijd dezelfde output. Taalmodellen (LLM’s) zijn probabilistisch (op kansberekening gebaseerd): dezelfde prompt kan elke keer een ander antwoord opleveren. Daarom worden AI Evals vaak meerdere keren gedaan om betrouwbaar te meten in plaats van te vertrouwen op één toevallige uitkomst.
Zie ook LLM, taalmodel, GenAI, generatieve AI
Terug naar startpagina woordenboek
