机器学习
Machine Learning
机器学习
核心释义
机器学习(ML,Machine Learning)是让计算机从历史数据中自动找出规律、再用规律预测新情况的技术方法,思路与传统的按固定规则编程相反:人不告诉机器具体怎么判断,只提供大量已标注的样本让它自己学。物流中的典型应用包括到港时间预测、货量需求预测、运价走势判断、异常订单识别与客户流失预警。模型的预测能力取决于训练数据的数量、质量与代表性,数据覆盖不到的情况,模型无从学习。模型的适用范围以训练数据的覆盖边界为准,超出边界的输入会得到看似合理但实际不可靠的输出。
延伸理解
实际场景机器学习是物流数字化中的概念,涉及系统、接口与数据,支撑可视化与自动化。
相近辨析技术名词迭代快,机器学习易与相近系统或标准混淆,区分看「它指平台、协议还是数据格式」。
知识扩展
实操要点
1. 先明确预测目标与评价指标,再决定用不用机器学习,简单统计能解决的问题不必上模型;
2. 训练数据的时间跨度要覆盖完整业务周期,只拿旺季数据训练的模型在淡季会严重偏差;
3. 保留一部分数据作测试集,模型上线前的效果验证不能只看训练集表现;
4. 预测结果要给出区间而非单一数值,到港时间给区间比给确定时间点更实用;
5. 定期用新数据重新训练模型,业务环境变化后旧模型的准确率会持续下滑。
2. 训练数据的时间跨度要覆盖完整业务周期,只拿旺季数据训练的模型在淡季会严重偏差;
3. 保留一部分数据作测试集,模型上线前的效果验证不能只看训练集表现;
4. 预测结果要给出区间而非单一数值,到港时间给区间比给确定时间点更实用;
5. 定期用新数据重新训练模型,业务环境变化后旧模型的准确率会持续下滑。
常见误区
误区一:机器学习就是写死规则的自动化——两者思路相反,前者从数据中归纳规律,后者执行人设定的条件。
误区二:模型一次训练永久有效——港口、航线、季节都在变,模型需要定期重训,否则效果衰减。
误区三:准确率越高越好——样本不均衡时,一味追求整体准确率会掩盖对少数异常情况的漏判。
误区二:模型一次训练永久有效——港口、航线、季节都在变,模型需要定期重训,否则效果衰减。
误区三:准确率越高越好——样本不均衡时,一味追求整体准确率会掩盖对少数异常情况的漏判。
业务实例
用 ML 预测船舶到港时间。
来源依据
实务