机器学习基础

别只看准确率:评估模型

10 分钟

99% 的准确率可能是废物

一个极端例子:1000 个体检者里只有 10 个病人。一个「模型」什么都不学,逢人就猜「健康」,准确率高达 99%——但它一个病人都没找出来,毫无用处。类别不均衡时,准确率会说谎。

两把更细的尺子

  • 精确率:被模型抓出来的「病人」里,真病人占多少——抓得准不准。
  • 召回率:所有真病人里,被模型找出来的占多少——漏得少不少。

那个全猜健康的模型:召回率 0%,当场现形。

看场景选尺子

癌症筛查:漏一个病人代价巨大,宁错杀不放过,要高召回率,门槛故意压低。垃圾邮件:把重要邮件扔进垃圾箱很恼人,要高精确率,门槛抬高。还记得第二讲那个可调门槛吗——评估指标和门槛,是同一枚硬币的两面。

常见误区

报告里只写一个漂亮数字就要警惕。正规做法是同时看精确率、召回率,以及两者的综合(叫 F1 分数);更重要的是先想清楚:这个业务里,误报和漏报哪个代价大?指标要为业务目标服务,不是反过来。

练一练:100 封邮件里 20 封垃圾邮件,模型拦下 30 封,其中 15 封真是垃圾。算算精确率和召回率各是多少。

小纸条

用给出的数字算出精确率和召回率,并说一个「宁错杀不放过」的场景。

登录 后可看答案