一、特征工程决定上限
机器学习的经验法则告诉我们,特征的质量往往比模型的选择更重要。原始数据经过清洗、转换和构造后,模型才能学到有意义的模式。
一)数据清洗要点
缺失值处理、异常值检测和单位统一是第一步。对于时间序列数据,还要注意排序和窗口划分,避免未来信息泄漏到训练集中。
二、模型选择的思路
结构化数据场景从线性模型和树模型起步,图像和文本场景则直接使用深度学习框架。先用简单模型建立基线,再根据差距决定是否升级复杂度。
一)交叉验证
K折交叉验证能更稳定地评估模型泛化能力,比单一训练测试划分更可靠。分类任务还要关注类别不平衡问题,必要时采用重采样策略。
三、评估指标怎么选
准确率不是万能指标。二分类问题要看业务场景选择精确率、召回率或F1,回归问题关注均方误差和平均绝对误差,上线前还要做A/B测试验证真实效果。
机器学习的落地是一个不断迭代的过程,扎实的数据功夫比炫技的模型更重要。