【发布时间】:2014-10-08 19:09:43
【问题描述】:
我经常处理具有非常“长尾”的数据。我想绘制直方图来总结分布,但是当我尝试使用 pandas 时,我最终会得到一个条形图,其中有一个巨大的可见条,而其他所有内容都是不可见的。
这是我正在使用的系列的一个示例。因为它很长,所以我使用了 value_counts(),所以它适合这个页面。
In [10]: data.value_counts.sort_index()
Out[10]:
0 8012
25 3710
100 10794
200 11718
300 2489
500 7631
600 34
700 115
1000 3099
1200 1766
1600 63
2000 1538
2200 41
2500 208
2700 2138
5000 515
5500 201
8800 10
10000 10
10900 465
13000 9
16200 74
20000 518
21500 65
27000 64
53000 82
56000 1
106000 35
530000 3
我猜测答案涉及以某种方式将不太常见的结果分成更大的组(53000、56000、106000 和 53000 到一组 >50000 等),并且还更改 y 索引以表示百分比出现次数而不是绝对次数。但是,我不明白我将如何自动执行此操作。
【问题讨论】:
标签: python matplotlib pandas histogram ipython-notebook