融会贯通(1)
在前面的练习中,您已经初步体验了如何编写自定义函数。您学习了如何为函数定义添加参数,如何用元组返回单个或多个值,以及如何调用您定义的函数。
在本题及下一题中,您将把这些概念串联起来,并将其应用到一个简单的数据科学问题中。您将加载一个数据集,并开发一些功能,从数据中提取简单的洞见。
在本练习中,您的目标是回顾如何将数据集加载为 DataFrame。该数据集包含 Twitter 数据,您将遍历某一列中的条目,构建一个字典:键为语言名称,值为该语言的推文数量。文件 tweets.csv 已在您当前的工作目录中。
请注意:这些是来自 Twitter 的真实数据,因此可能包含不当语言或令人反感的内容(本练习及后续使用真实 Twitter 数据的练习都可能如此)。
本练习是课程的一部分
Python 函数入门
练习说明
- 将 pandas 包以别名
pd导入。 - 使用 pandas 函数
read_csv()导入文件'tweets.csv'。将得到的 DataFrame 赋给df。 - 通过遍历 DataFrame
df的'lang'列col,完成for循环。 - 完成循环中的
if-else语句体:如果键已在字典langs_count中,则将该键对应的值加1;否则将该键加入langs_count,并将对应的值设为1。在代码中使用循环变量entry。
交互式实操练习
通过完成这段示例代码来试试这个练习。
# Import pandas
# Import Twitter data as DataFrame: df
df = ____
# Initialize an empty dictionary: langs_count
langs_count = {}
# Extract column from DataFrame: col
col = df['lang']
# Iterate over lang column in DataFrame
for entry in ____:
# If the language is in langs_count, add 1
if entry in langs_count.keys():
____
# Else add the language to langs_count, set the value to 1
else:
____
# Print the populated dictionary
print(langs_count)