Bắt đầu ngayBắt đầu miễn phí

Chạy một pipeline ETL

Sẵn sàng chạy pipeline ETL đầu tiên của bạn chưa? Bắt đầu thôi!

Ở đây, các hàm extract(), transform(), và load() đã được định nghĩa sẵn. Để chạy pipeline ETL này, bạn sẽ lần lượt thực thi từng hàm. Nếu tò mò, bạn có thể xem qua hàm extract() trông như thế nào.

def extract(file_name):
    print(f"Extracting data from {file_name}")
    return pd.read_csv(file_name)

Bài tập này là một phần của khóa học

ETL và ELT với Python

Xem khóa học

Hướng dẫn bài tập

  • Dùng hàm extract() để trích xuất dữ liệu từ tệp raw_data.csv.
  • Biến đổi DataFrame extracted_data bằng hàm transform().
  • Cuối cùng, nạp DataFrame transformed_data vào bảng SQL cleaned_data.

Bài tập tương tác thực hành trực tiếp

Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.

# Extract data from the raw_data.csv file
extracted_data = ____(file_name="raw_data.csv")

# Transform the extracted_data
transformed_data = transform(data_frame=____)

# Load the transformed_data to cleaned_data.csv
____(data_frame=transformed_data, target_table="cleaned_data")
Chỉnh sửa và Chạy Mã