特征工程2026:经典ML里ROI最高的技能依然没变
深度学习号称让特征工程过时了,但表格数据仍是业务ML的主流——而在表格上,特征依然决定结果。2026年的工具包是什么?
💡 你将学到
深度学习号称让特征工程过时了,但表格数据仍是业务ML的主流——而在表格上,特征依然决定结果。2026年的工具包是什么?
神经网络能从像素和文本自动学特征,但多数业务ML是表格型的——交易、客户、库存。在结构化数据上,模型学的是你给的特征,好特征集和懒特征集的差距常是5-15%的AUC,这就是这技能活下来的原因。2026工具包:聚合特征(count、sum、mean、min/max、std按有意义窗口7d/30d/90d算,customer_30d_spend永远赢customer_spend);比率和差值(最近购买天数、频次、金额,RFM三件套仍跑赢原始列);时间特征(小时、星期几、节假日标志、距事件天数);目标编码(高基数类别如邮编、产品ID按目标均值编码加平滑,必须出折计算防泄漏);交互特征(树模型下显式乘积或和,如年龄x收入);类别embedding(高基数或关系型数据用实体embedding或LLM生成类别表示,这是2026新加入的)。头号错误是泄漏:用了预测时拿不到的信息(未来、目标、全量数据)会静默吹高离线分数。经典案例:用训练加测试算的全局统计做归一化、不出折的目标编码、把预测时刻包含进时间窗口聚合。每个特征都要回答:预测时刻我会有这个值吗?评估纪律:时间序列按时间切分绝不随机(随机切把未来漏进训练);特征重要性只显示相关性不是因果;消融实验一组一组加特征,验证集不提升就砍。诚实总结:特征工程没死,是搬家了——表格ML里它仍是ROI最高的活动,现代新增是用LLM从非结构化字段生成经典流水线忽略的特征。
