or
本练习是课程的一部分
本章将带您回顾有监督学习工作流的基础:模型拟合、调优与选择,特征工程与选择,以及数据划分技巧。您将理解工作流中各步骤彼此的依赖关系,并识别它们如何共同抑制或助长过拟合——数据科学家最大的敌人。学习完本章,您将熟练掌握有监督学习,并为后续章节的进阶内容做好准备。
当前练习
在上一章,您完善了对标准有监督学习工作流的理解。本章将批判性地审视如何将专家知识融入有监督学习。这包括:识别恰当的分析单元(可能需要跨多源数据进行特征工程)、处理在标注样本时难免出现的不完美过程,以及制定能真实反映业务错误代价的损失函数,从而刻画模型错误的实际业务价值。
上一章中,您以多种方式将专家的反馈融入工作流,并用与业务价值一致的方式进行评估。现在,是时候练习将模型产品化所需的技能,并通过迭代改进,确保其后续持续良好表现。您还将学习诊断数据集漂移,并减轻环境变化对模型准确率的影响。
在之前的章节中,您已夯实了有监督学习的基础,并了解了如何将模型部署到生产环境,但始终假设可获得带标签的数据集。本章将挑战在没有或仅有极少标签的情况下进行建模。您将学习异常检测这一类无监督建模方法,以及基于距离的学习:当我们对样本间"相似性"的信念能够替代标签时,也能帮助您达到可与有监督工作流媲美的准确度。完成本章后,您将自信地知道在面对常见的真实世界难题时,应如何调整工作流与选用工具,从而在数据科学人群中脱颖而出。