直方图
数据集 loan_data 已加载到您的工作区。此前您使用 CrossTable() 函数探索了分类变量。现在,您希望探索连续变量,以识别可能的离群值或异常的数据结构。
为此,让我们尝试使用 hist() 函数,了解不同客户贷款笔数的分布情况。
本练习是课程的一部分
R 中的信用风险建模
练习说明
- 使用 hist() 绘制直方图,仅传入一个参数:
loan_data$loan_amnt。将结果赋值给新对象hist_1。 - 使用对象
hist_1的$breaks查看直方图的分箱断点信息。了解断点位置很重要,因为如果断点设置不当,直方图可能会产生误导。 - 通过指定
breaks参数,将hist_1的分箱数改为 200。同时使用xlab参数将 x 轴命名为 "Loan amount",并使用main参数将标题设置为 "Histogram of the loan amount"。将结果保存为hist_2。为什么峰值会出现在那些位置?
交互式实操练习
通过完成这段示例代码来试试这个练习。
# Create histogram of loan_amnt: hist_1
# Print locations of the breaks in hist_1
# Change number of breaks and add labels: hist_2
hist_2 <- hist(loan_data$loan_amnt, breaks = ___, xlab = "___",
main = "___")