《R语言与数据挖掘最佳实践和经典案例》—— 3.3 探索多个变量

简介:

本节书摘来自华章出版社《R语言与数据挖掘最佳实践和经典案例》一 书中的第3章,第3.3节,作者:(澳)Yanchang Zhao,更多章节内容可以访问云栖社区“华章计算机”公众号查看。

3.3 探索多个变量

查看了单个变量的分布后,还需要探索两个变量之间的关系。下面我们使用函数cov()和cor()分别计算变量之间的协方差和相关系数。
screenshot
screenshot

接下来,使用函数aggregate()计算每一个鸢尾花种(Species)的Sepal.Length的统计数据。
screenshot

然后,使用函数boxplot()绘制盒图(又称为盒形-虚线图),以展示数据分布的中位数、第一四分位数和第三四分位数(即累积分布中的位于50%、25%、75%位置上的点),以及离群点。盒图中间的横线表示中位数。图(3-5)显示了四分位差(IQR),即第三四分位数(75%)与第一四分位数(25%)的差值。
screenshot
screenshot

下面使用函数plot()绘制两个数值型变量的散布图,使用函数with()后不需要在变量名前加上“iris$”前缀。在下面的代码中,各个数据点根据不同品种设置了不同的颜色(col)和标志(pch)。
screenshot

当数据量很大时,图中的数据点可能会出现重叠。因此,在绘制散布图前使用函数jitter()添加少量噪声数据(见图3-7)。
screenshot

散布图矩阵由函数pairs()生成(见图3-8)。
screenshot

相关文章
|
2天前
|
存储 vr&ar
R语言单变量和多变量(多元)动态条件相关系数DCC-GARCH模型分析股票收益率金融时间序列数据波动率-2
R语言单变量和多变量(多元)动态条件相关系数DCC-GARCH模型分析股票收益率金融时间序列数据波动率
|
2天前
|
vr&ar
R语言单变量和多变量(多元)动态条件相关系数DCC-GARCH模型分析股票收益率金融时间序列数据波动率-1
R语言单变量和多变量(多元)动态条件相关系数DCC-GARCH模型分析股票收益率金融时间序列数据波动率
|
2天前
|
存储 vr&ar
R语言单变量和多变量(多元)动态条件相关系数DCC-GARCH模型分析股票收益率金融时间序列数据波动率
R语言单变量和多变量(多元)动态条件相关系数DCC-GARCH模型分析股票收益率金融时间序列数据波动率
|
2天前
|
机器学习/深度学习 数据可视化
R语言lasso协变量改进Logistic逻辑回归对特发性黄斑前膜因素交叉验证可视化分析
R语言lasso协变量改进Logistic逻辑回归对特发性黄斑前膜因素交叉验证可视化分析
|
2天前
|
算法 数据挖掘 数据库
R语言主成分PCA、决策树、boost预警模型在跨区域犯罪研究数据挖掘分析|数据分享
R语言主成分PCA、决策树、boost预警模型在跨区域犯罪研究数据挖掘分析|数据分享
|
2天前
R语言偏最小二乘回归PLS回归分析制药产品化学制造过程数据、缺失值填充、变量重要性
R语言偏最小二乘回归PLS回归分析制药产品化学制造过程数据、缺失值填充、变量重要性
|
2天前
|
机器学习/深度学习 算法 数据可视化
R语言组lasso改进逻辑回归变量选择分析高血压、易感因素、2型糖尿病和LDL可视化
R语言组lasso改进逻辑回归变量选择分析高血压、易感因素、2型糖尿病和LDL可视化
|
2天前
|
数据可视化 数据挖掘
数据分享|R语言IMDb TOP250电影特征数据挖掘可视化分析受众偏好、排名、投票、评分(下)
数据分享|R语言IMDb TOP250电影特征数据挖掘可视化分析受众偏好、排名、投票、评分
|
2天前
|
数据可视化 算法 数据挖掘
数据分享|R语言IMDb TOP250电影特征数据挖掘可视化分析受众偏好、排名、投票、评分(上)
数据分享|R语言IMDb TOP250电影特征数据挖掘可视化分析受众偏好、排名、投票、评分
|
2天前
|
数据挖掘 数据建模
R语言指数加权模型EWMA预测股市多变量波动率
R语言指数加权模型EWMA预测股市多变量波动率
R语言指数加权模型EWMA预测股市多变量波动率

热门文章

最新文章