【发布时间】:2016-04-18 07:50:01
【问题描述】:
我想像这样编辑我的文本:
arr = []
# arr is full of tokenized words from my text
例如:
"Abraham Lincoln Hotel is very beautiful place and i want to go there with
Barbara Palvin. Also there are stores like Adidas ,Nike , Reebok."
编辑:基本上我想检测专有名称并通过在 for 语句中使用 istitle() 和 isAlpha() 对它们进行分组,例如:
for i in arr:
if arr[i].istitle() and arr[i].isAlpha
在示例中,arr 一直附加到下一个单词的第一个字母不是大写。
arr[0] + arr[1] + arr[2] = arr[0]
#Abraham Lincoln Hotel
这就是我想要的新 arr:
['Abraham Lincoln Hotel'] is very beautiful place and i want to go there with['Barbara Palvin']. ['Also'] there are stores like ['Adidas'], ['Nike'],['Reebok'].
“也”对我来说不是问题,当我尝试匹配我的数据集时它会很有用。
【问题讨论】:
-
我想要一个基本的 python 代码,它总是返回正确的名称而不将它们分组,但无论如何谢谢。
-
你不能做一个基本的python代码来返回正确的名字。这并不容易,您需要使用
NTLK来归档它。 -
使用
istitle()的问题在于,Also的世界也是大写的。 -
我将检查我的数据集的正确名称。这就是为什么我不想使用 nltk。我创建了自己的语言处理程序。
标签: python nlp nltk stanford-nlp opennlp