【发布时间】:2021-10-02 19:28:14
【问题描述】:
我有一个这样的数据集 -
15643, 14087, 12020, 8402, 7875, 3250, 2688, 2654, 2501, 2482, 1246, 1214, 1171, 1165, 1048, 897, 849, 579, 382, 285, 222, 168, 115, 92, 71, 57, 56, 51, 47, 43, 40, 31, 29, 29, 29, 29, 28, 22, 20, 19, 18, 18, 17, 15, 14, 14, 12, 12, 11, 11, 10, 9, 9, 8, 8, 8, 8, 7, 6, 5, 5, 5, 4, 4, 4, 3, 3, 3, 3, 2, 2, 2, 2, 2, 2, 2, 2, 1, 1, 1, 1, 1, 1, 1, 1, 1, 1, 1, 1, 1, 1, 1, 1, 1, 1, 1, 1, 1, 1, 1, 1, 1
根据领域知识,我知道更大的值是我们想要包含在分析中的唯一值。我如何确定在哪里切断我们的分析?应该不包括15及以下或50及以下等?
【问题讨论】:
-
我不会给出顶级答案,因为我不知道域是什么,但我看到这些是按降序排列的,并且元素之间的差异在之后永远不会大于 10第 26 个元素。
标签: pandas statistics median outliers standard-deviation