训练/测试划分
为避免过拟合,机器学习中通常会将数据划分为训练集和测试集。 这样可以确保模型能够正确预测新的、未见过的数据。
由于我们处理的是时间序列数据,不能使用随机划分方法,否则会让模型"看到"未来。
有一个用于打印 DataFrame 起始和结束时间的函数 show_start_end(),它只接收一个 DataFrame 参数,并返回一个字符串。
数据已存为 environment。
本练习是课程的一部分
用 Python 分析 IoT 数据
交互式实操练习
通过完成这段示例代码来试试这个练习。
# Define the split day
limit_day = ____
# Split the data
train_env = ____[____]
test_env = ____[____]