AI models are evaluated across various metrics including task-quality (accuracy, F1), generative and factuality (BLEU, ROUGE), safety, fairness, and operational aspects like latency and cost.
Open the full topic