Learn practical techniques for evaluating large language models across question answering and text generation tasks. Compare model behavior using reference-based metrics, semantic similarity, log probabilities, and perplexity.
What you'll learn
understand reference-based metrics
evaluate model behavior using semantic similarity
compute log probabilities and perplexity
Course objectives
develop skills for practical evaluation of language models