从训练到上线:模型部署
约 10 分钟
训练完,故事才讲到一半
模型在训练机上学成了,怎么变成你手机里秒回的应用?中间隔着一条完整的工程链路。第一步是压缩:大模型动辄几 GB,手机上跑不动——量化把权重从 32 位小数砍成 8 位整数,体积缩到四分之一,速度翻倍,精度只掉一点点;剪枝把贡献接近于零的权重直接删掉,像给树修枝。
两种跑法:云端与端侧
云端推理:模型放在服务器上,手机把请求发过去、拿回结果——ChatGPT、各类 AI 助手都是这么干的,好处是模型随便多大,坏处是要联网、有延迟、数据出了门。端侧推理:模型直接跑在手机芯片上,人脸解锁、输入法联想词、离线翻译都是本地完成,断网也能用,隐私也安全。真实产品常两头配合:简单任务本地秒回,复杂任务上云。
上线不是终点
用户数据分布会变(去年训练的模型不认识今年的网络热词),所以线上模型要持续监控:准确率掉了就收集新数据重训,形成一个「训练 → 部署 → 收集 → 再训练」的飞轮。这也是为什么你常用的应用过一阵就「变聪明了」。
常见误区
模型准确率不是上线的唯一指标:延迟、成本、隐私同样一票否决;也别以为部署完就一劳永逸——不更新的模型会悄悄过期。
练一练:找出手机里两个 AI 功能,判断它们分别在云端还是本地运行,并说明理由。
小纸条
找出手机里两个 AI 功能,判断各自跑在云端还是本地,并说明判断依据。
登录 后可看答案