PyTorch 数据集
来复习一下您对 PyTorch Datasets 的理解!
在开始训练模型之前,您需要先加载数据,并以正确的格式传给模型。在 PyTorch 中,这由 Dataset 和 DataLoader 负责。我们先为饮用水可饮用性数据构建一个 PyTorch 数据集。
在本练习中,您将定义一个名为 WaterDataset 的类,用于从 CSV 文件加载数据。为此,您需要实现 PyTorch 期望 Dataset 具备的 3 个方法:
.__init__()用于加载数据,.__len__()返回数据大小,.__getitem()__为单个样本提取特征和标签。
以下导入已为您完成:
import pandas as pd
from torch.utils.data import Dataset
本练习是课程的一部分
PyTorch 深度学习进阶
交互式实操练习
通过完成这段示例代码来试试这个练习。
class WaterDataset(Dataset):
def __init__(self, csv_path):
super().__init__()
# Load data to pandas DataFrame
df = ____
# Convert data to a NumPy array and assign to self.data
____ = ____.____