【发布时间】:2018-09-12 03:39:27
【问题描述】:
我对@987654323@ 很陌生,并且有一个类似于下面的data frame
import pandas as pd
df = pd.DataFrame({'id': ["1", "2", "3","4","5"],
'mill': ["Company A Palm Oil Mill – Special Company A of CC Ltd",
"Company X POM – Company X Ltd","DDDD Mill – Company New and Old Ltd",
"Company Not Special – R Mill","Greatest Company – Great World POM"]})
id mill
0 1 Company A Palm Oil Mill – Special Company A of...
1 2 Company X POM – Company X Ltd
2 3 DDDD Mill – Company New and Old Ltd
3 4 Company Not Special – R Mill
4 5 Greatest Company – Great World POM
我想从上面的data frame 得到类似下面的东西:
有没有一种简单的方法可以将这些子字符串提取到同一列中。工厂名称有时可以在“-”之前,也可以在其他时间之后,但几乎总是以 Palm Oil Mill、POM 或 Mill 结尾。
【问题讨论】:
-
这会涉及到Nltk
-
是什么决定了你是保留连字符之前还是之后的内容?尤其是第二行并不明显。
-
"extract those substrings" 不是一个明确的问题陈述。您的意思是 " 拆分连字符(如果有),并返回以 'Mill' 或 'POM' 结尾的子字符串"
-
@smci,是的,很抱歉没有在帖子标题中明确说明。已经更新了
标签: python string pandas substring text-processing