当使用 gam()(文档)将输出建模为输入的可加函数时,您可以在公式中使用 s()(文档)函数,指明要用样条来建模连续变量与输出之间的非线性关系。
gam()
s()
假设您想预测一位节食者在 2 年减脂计划中会减掉多少体重(Wtloss),其自变量包括:
Wtloss
Diet
Sex
Age
BMI
您不想假设任何关系是线性的。
哪一个是最合适的公式?
本练习是课程的一部分
通过我们的互动练习之一,将理论转化为实践
本章将从机器学习的角度介绍回归的概念。我们会讲解最基础的回归方法:线性回归。您将学习如何拟合线性回归模型,以及如何基于模型进行预测。
在已经学会如何拟合基础线性回归模型之后,接下来我们将学习如何评估模型表现。我们会复习如何用图形方式评估模型,并介绍回归模型的两个基本指标。我们还将学习如何训练一个在真实环境中也能良好表现、而不仅仅在训练数据上表现出色的模型。尽管我们将以线性回归为例演示这些技术,但所有概念同样适用于用任何回归算法拟合的模型。
在进入更复杂的回归技术之前,我们会先讨论一些其他建模问题:如何处理分类输入、变量间的交互作用,以及在建模前何时需要对输入和输出进行变换。虽然更复杂的回归技术会自动处理其中的一些问题,但了解这些问题依然很重要,这样您才能判断哪些方法更适合解决特定问题——以及哪些问题仍需要您亲自处理。
在掌握线性模型之后,我们将开始探讨在不满足线性假设的情形下的建模技术。这包括预测概率与频率(取值在 0 到 1 之间)、预测计数(非负整数及相关比率),以及响应与输入存在非线性但可加性关系的情形。这些算法都是标准线性模型的变体。
当前练习
本章将介绍不依赖线性或可加性假设、并且能够学习输入变量之间有限交互的建模算法。这些算法属于基于树的方法,通过将从训练数据中学到的多棵决策树组合成集成来工作。