Bắt đầu ngayBắt đầu miễn phí

Khám phá bộ dữ liệu Jobs

Trong bài tập này, bạn sẽ khám phá DataFrame jobs mới, chứa tỷ lệ thất nghiệp của các ngành khác nhau ở Hoa Kỳ trong giai đoạn 2000–2010. Như bạn sẽ thấy, bộ dữ liệu gồm các chuỗi thời gian cho 16 ngành và 122 mốc thời gian (mỗi tháng trong 10 năm). Nhìn chung, quy trình điển hình của một dự án Khoa học Dữ liệu sẽ bao gồm làm sạch và khám phá dữ liệu, nên chúng ta sẽ bắt đầu bằng cách đọc dữ liệu và kiểm tra các giá trị khuyết.

Bài tập này là một phần của khóa học

Trực quan hóa dữ liệu chuỗi thời gian trong Python

Xem khóa học

Hướng dẫn bài tập

Chúng tôi đã import pandas với tên pd.

  • Đọc tệp csv ở url_jobs vào một DataFrame tên jobs và xem kiểu dữ liệu của từng cột.
  • Chuyển cột datestamp trong jobs sang kiểu datetime.
  • Đặt cột datestamp làm index của jobs.
  • In ra số lượng giá trị khuyết ở mỗi cột của jobs.

Bài tập tương tác thực hành trực tiếp

Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.

# Read in jobs file
jobs = ____

# Print first five lines of your DataFrame
print(jobs.head(5))

# Check the type of each column in your DataFrame
print(jobs.dtypes)

# Convert datestamp column to a datetime object
jobs[____] = ____(jobs[____])

# Set the datestamp columns as the index of your DataFrame
jobs = ____('datestamp')

# Check the number of missing values in each column
print(jobs.isnull().____())
Chỉnh sửa và Chạy Mã