【发布时间】:2023-01-30 15:40:33
【问题描述】:
我在过滤掉低于数据框中总行数的 5%(特定或通用解决方案会有所帮助,因此我可以根据需要重现/调整要求)的犯罪 - “OffenseDescription” 时遇到问题。
到目前为止,这是我尝试过的方法,但它正在使内核崩溃,并且本质上是在运行无限循环/执行。
我也在 VS Code 中通过 Jupyter Notebook 执行此操作。
这是我到目前为止尝试过的代码:
tot=crime.OffenseDescription.sum() #Find sum of column
crime[crime.groupby(['OffenseDescriptiom']).transform(lambda x:
(x.div(tot)*100)<0.05)] #calculate percentage filter as per
condition
链接到我正在使用的数据框的 .head() 的屏幕截图:
TIA
【问题讨论】:
-
您可以添加一些数据样本来提问和尝试什么(您的代码)吗?
-
刚刚添加了我的尝试,我一开始忘了。
-
你为什么使用
groupby?您是否需要每组的测试值?如果是,哪些列用于分组? -
我从中提取值以设置百分比阈值的列是“OffenseDescription”。我使用 groupby 将不同的 Offenses 分组在一起。无论如何,那是我的意图
标签: python pandas dataframe visual-studio-code jupyter