模型评估与基准:从分类指标到 LLM-as-Judge
模型评估是机器学习工程中最容易被低估的环节,指标选错会让整个迭代方向出错。本文系统讲解评估体系:分类指标(准确率/精确率/召回/F1/AUC-ROC)、回归与概率校准(Brier/ECE)、生成式评估(BLEU/ROUGE/人工/LLM-as-Judge)、评测集构建(Golden set/对抗样本)、离线与在线评估(A/B 测试/影子部署)、模型卡与基准报告,以及持续评估流程中的常见陷阱。
tag
模型评估是机器学习工程中最容易被低估的环节,指标选错会让整个迭代方向出错。本文系统讲解评估体系:分类指标(准确率/精确率/召回/F1/AUC-ROC)、回归与概率校准(Brier/ECE)、生成式评估(BLEU/ROUGE/人工/LLM-as-Judge)、评测集构建(Golden set/对抗样本)、离线与在线评估(A/B 测试/影子部署)、模型卡与基准报告,以及持续评估流程中的常见陷阱。