【发布时间】:2012-06-28 23:45:42
【问题描述】:
探索新数据集:可视化许多(所有)变量的最简单、最快捷的方法是什么?
理想情况下,输出显示彼此相邻的直方图,具有最小的混乱和最大的信息。这个问题的关键是处理大型和不同数据集的灵活性和稳定性。我使用的是 RStudio,通常会处理大量杂乱的调查数据。
一个开箱即用的 Hmisc 示例在这里运行良好:
library(ggplot2)
str(mpg)
library(Hmisc)
hist.data.frame(mpg)
不幸的是,我在其他地方遇到了数据标签问题(plot.new() 中的错误:数字边距太大)。对于比mpg 更大的数据集,它也崩溃了,我还没有弄清楚如何控制分箱。此外,我更喜欢ggplot2 中的灵活解决方案。请注意,我刚开始学习 R,已经习惯了商业软件提供的舒适解决方案。
有关此主题的更多问题:
R histogram - too many variables
...?
【问题讨论】:
-
为数据集中的每个变量制作图表对于小型数据集来说是很好的,但如果您有 3000 个变量,这只是一个非常糟糕的想法。这种情况下的正确答案是“不要那样做”。
-
当然不是;这只是“混乱”的一个例子。
-
感谢您在这里所做的努力,但您的问题根本没有描述具体的特定编程问题。相反,它感觉很像是会导致各种建议的杂乱无章的答案,而不是一个明确的答案。确实,当我阅读您的回答时,我对您的标准比以前更加困惑。