别只看准确率:评估模型
约 10 分钟
99% 的准确率可能是废物
一个极端例子:1000 个体检者里只有 10 个病人。一个「模型」什么都不学,逢人就猜「健康」,准确率高达 99%——但它一个病人都没找出来,毫无用处。类别不均衡时,准确率会说谎。
两把更细的尺子
- 精确率:被模型抓出来的「病人」里,真病人占多少——抓得准不准。
- 召回率:所有真病人里,被模型找出来的占多少——漏得少不少。
那个全猜健康的模型:召回率 0%,当场现形。
看场景选尺子
癌症筛查:漏一个病人代价巨大,宁错杀不放过,要高召回率,门槛故意压低。垃圾邮件:把重要邮件扔进垃圾箱很恼人,要高精确率,门槛抬高。还记得第二讲那个可调门槛吗——评估指标和门槛,是同一枚硬币的两面。
常见误区
报告里只写一个漂亮数字就要警惕。正规做法是同时看精确率、召回率,以及两者的综合(叫 F1 分数);更重要的是先想清楚:这个业务里,误报和漏报哪个代价大?指标要为业务目标服务,不是反过来。
练一练:100 封邮件里 20 封垃圾邮件,模型拦下 30 封,其中 15 封真是垃圾。算算精确率和召回率各是多少。
小纸条
用给出的数字算出精确率和召回率,并说一个「宁错杀不放过」的场景。
登录 后可看答案