跳到正文

评价与误差分析:一个总分不够交付

14 分钟

模型评价必须匹配用途、数据分布和错误代价。训练集、验证集和测试集职责不同;反复根据测试结果调参会让测试集变成训练信息,最终分数偏乐观。

切分与泄漏

同一用户、病人、视频或文档片段应成组切分;时间任务按时间留出。预处理统计、特征选择和阈值只用训练与验证数据。

指标选择

不平衡分类看精确率、召回、PR曲线和每类表现;概率输出还要看校准。回归报告误差分布与分位数,不只均方误差。

阈值与成本

分类阈值是决策策略,不是模型固定真理。按漏报与误报成本在验证集选择,部署分布变化后重新校准,但不能偷偷改测试阈值。

分组与长尾

按设备、地区、长度、难度和关键群体分组。总体平均提升可能掩盖少数群体退步;小组样本少时给区间而非过度排名。

错误分类学

随机抽取错误,由人工按标签问题、输入质量、域外、歧义和模型模式分类。由错误分布决定下一轮数据或模型工作。

人工审计要有清楚指南和双人一致度,避免一个人主观分类成为新噪声。发现标签错时修订版本并重新计算,不直接从测试集中删除困难样本。若模型用于高风险场景,还要报告拒答、人工接管和最坏后果,而非只给平均指标。

任务:为模型做指标卡、校准图、五类分组和100个错误审计,提出有证据的下一步。

小纸条

为什么反复查看测试集并据此调模型会使最终分数偏高?