Khám phá bộ dữ liệu Jobs
Trong bài tập này, bạn sẽ khám phá DataFrame jobs mới, chứa tỷ lệ thất nghiệp của các ngành khác nhau ở Hoa Kỳ trong giai đoạn 2000–2010. Như bạn sẽ thấy, bộ dữ liệu gồm các chuỗi thời gian cho 16 ngành và 122 mốc thời gian (mỗi tháng trong 10 năm). Nhìn chung, quy trình điển hình của một dự án Khoa học Dữ liệu sẽ bao gồm làm sạch và khám phá dữ liệu, nên chúng ta sẽ bắt đầu bằng cách đọc dữ liệu và kiểm tra các giá trị khuyết.
Bài tập này là một phần của khóa học
Trực quan hóa dữ liệu chuỗi thời gian trong Python
Hướng dẫn bài tập
Chúng tôi đã import pandas với tên pd.
- Đọc tệp csv ở
url_jobsvào một DataFrame tênjobsvà xem kiểu dữ liệu của từng cột. - Chuyển cột
datestamptrongjobssang kiểudatetime. - Đặt cột
datestamplàm index củajobs. - In ra số lượng giá trị khuyết ở mỗi cột của
jobs.
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
# Read in jobs file
jobs = ____
# Print first five lines of your DataFrame
print(jobs.head(5))
# Check the type of each column in your DataFrame
print(jobs.dtypes)
# Convert datestamp column to a datetime object
jobs[____] = ____(jobs[____])
# Set the datestamp columns as the index of your DataFrame
jobs = ____('datestamp')
# Check the number of missing values in each column
print(jobs.isnull().____())