Tổng hợp kiến thức (1)
Ở các bài trước, bạn đã làm quen với việc tự viết hàm. Bạn đã học cách thêm tham số vào định nghĩa hàm, trả về một hoặc nhiều giá trị bằng tuple, và cách gọi các hàm bạn đã định nghĩa.
Trong bài này và bài tiếp theo, bạn sẽ tổng hợp các khái niệm đó và áp dụng vào một bài toán khoa học dữ liệu đơn giản. Bạn sẽ nạp một tập dữ liệu và phát triển các chức năng để rút ra một vài insight cơ bản từ dữ liệu.
Mục tiêu của bài này là ôn lại cách nạp một tập dữ liệu vào DataFrame. Tập dữ liệu chứa dữ liệu Twitter và bạn sẽ lặp qua các mục trong một cột để xây dựng một từ điển, trong đó khóa là tên ngôn ngữ và giá trị là số lượng tweet bằng ngôn ngữ đó. File tweets.csv có sẵn trong thư mục hiện tại của bạn.
Lưu ý đây là dữ liệu thật từ Twitter nên luôn có khả năng chứa ngôn từ thô tục hoặc nội dung gây phản cảm (trong bài này và các bài tiếp theo cũng sử dụng dữ liệu Twitter thật).
Bài tập này là một phần của khóa học
Giới thiệu về Functions trong Python
Hướng dẫn bài tập
- Import gói pandas với bí danh
pd. - Import file
'tweets.csv'bằng hàmread_csv()của pandas. Gán DataFrame thu được vàodf. - Hoàn thiện vòng lặp
forbằng cách lặp quacol, cột'lang'trong DataFramedf. - Hoàn thiện phần thân các câu lệnh
if-elsetrong vòng lặp: if khóa đã có trong từ điểnlangs_countthì cộng thêm1vào giá trị tương ứng trong từ điển, else thêm khóa đó vàolangs_countvà đặt giá trị tương ứng là1. Sử dụng biến vòng lặpentrytrong mã của bạn.
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
# Import pandas
# Import Twitter data as DataFrame: df
df = ____
# Initialize an empty dictionary: langs_count
langs_count = {}
# Extract column from DataFrame: col
col = df['lang']
# Iterate over lang column in DataFrame
for entry in ____:
# If the language is in langs_count, add 1
if entry in langs_count.keys():
____
# Else add the language to langs_count, set the value to 1
else:
____
# Print the populated dictionary
print(langs_count)