开始使用免费开始使用

直方图

数据集 loan_data 已加载到您的工作区。此前您使用 CrossTable() 函数探索了分类变量。现在,您希望探索连续变量,以识别可能的离群值或异常的数据结构。

为此,让我们尝试使用 hist() 函数,了解不同客户贷款笔数的分布情况。

本练习是课程的一部分

R 中的信用风险建模

查看课程

练习说明

  • 使用 hist() 绘制直方图,仅传入一个参数:loan_data$loan_amnt。将结果赋值给新对象 hist_1
  • 使用对象 hist_1$breaks 查看直方图的分箱断点信息。了解断点位置很重要,因为如果断点设置不当,直方图可能会产生误导。
  • 通过指定 breaks 参数,将 hist_1 的分箱数改为 200。同时使用 xlab 参数将 x 轴命名为 "Loan amount",并使用 main 参数将标题设置为 "Histogram of the loan amount"。将结果保存为 hist_2。为什么峰值会出现在那些位置?

交互式实操练习

通过完成这段示例代码来试试这个练习。

# Create histogram of loan_amnt: hist_1


# Print locations of the breaks in hist_1


# Change number of breaks and add labels: hist_2
hist_2 <- hist(loan_data$loan_amnt, breaks = ___, xlab = "___", 
               main = "___")
编辑并运行代码