儲存前處理後的資料集
在你的客服聊天機器人專案中,你現在已經準備好一個用來微調 Llama 模型的資料集。下一步是將這個資料集儲存起來,之後就能直接載入,而不必重做前處理步驟。這樣可以讓你的團隊在多次實驗與反覆迭代中重複使用同一份資料集。
本練習屬於課程
使用 Llama 3 進行微調
練習說明
- 將前處理後的資料集
ds儲存到磁碟。 - 將已儲存的資料集載入到新的變數
ds_preprocessed。 - 列印
ds_preprocessed的第一個元素。
動手互動練習
試著完成這個範例程式碼,體驗一下這個練習。
from datasets import load_from_disk
# Save the dataset to disk
____
# Load the dataset from disk
ds_preprocessed = ____
# Print the first element of the loaded dataset
print(____)