【发布时间】:2020-09-22 09:21:31
【问题描述】:
我正在尝试查看具有以下值的变量的分布..
+-------+-------+
| Value | Count |
+-------+-------+
| 0.0 | 355 |
| 1.0 | 935 |
| 2.0 | 1 |
| 3.0 | 2 |
| 4.0 | 1 |
+-------+-------+
该表继续使用高达 1000 的值,但非常稀疏(总观测值 = 1622,几乎所有观测值都落在 0 或 1 中)
所以在绘图时我做了:
sns.distplot(kde=True, a = df.loc[(df.class == 1)].variable_of_interest)
产生以下红色分布
Seaborn 没有捕捉到值的初始集中,但对其余的值表现出更多的“敏感性”
然后我想起了pd.DataFrame.plot.kde(),所以我试了一下,它产生了这个捕捉注意力的情节
df.loc[(df.class== 1)].variable_of_interest.plot.kde()
重要提示:对于那些可能会注意到 X 轴差异的人,我确实尝试了带有 xlims(-500, 1000) 的 seaborn,但情节仍然完全相同
你知道他们为什么会产生如此不同的情节吗? 是否与他们处理数据的方式有关,还是我做错了什么?
提前非常感谢您!
【问题讨论】: