【发布时间】:2020-06-23 06:18:15
【问题描述】:
我需要你的帮助。
目前我正在使用此代码部分进行工作;
altbaslik = []
for line in sentenceIndex:
finded = re.match(r"\w*[A-Z]\w*[A-Z]\w*|[Ö|Ç|Ş|Ü|Ğ|İ]", line)
if finded != None:
finded2 = finded.group()
altbaslik.append(finded2)
print(altbaslik)
sentenceIndex = 这是一个列表。它包含段落中的标记化句子。例如:
示例段落:
VODOFONE ARENA ŞANSI Ama asıl önemli olan nokta Murat Çetinkaya, Cumhurbaşkanı Erdoğan ve Başbakan Davutoğlu'nun ittifakıyla seçildi。 O süreci ayrıntılı olarak aktaracağım。 Hatta Cumhurbaşkanı ve Başbakan'ı aynı isim üzerinde ittifak etmeye götüren kriterlere değineceğim。 Ama bir şey var ki aktarmasam olmaz。 Merkez Bankası Başkanı'nın kaderi Dolmabahçe ile Vodafone Arena arasındaki yolculukta belirleniyor。
句子索引:
['VODOFONE ARENA ŞANSI Ama asıl önemli olan nokta Murat Çetinkaya, Cumhurbaşkanı Erdoğan ve Başbakan Davutoğlu'nun ittifakıyla seçildi.','.......', '........']
我需要一个正则表达式,它可以找到句子中所有大写字母的单词。
“VODOFONE ARENA ŞANSI”需要找到并提取此部分。我正在使用的当前正则表达式不起作用。我需要关于这个正则表达式的帮助。
注意: [Ö|Ç|Ş|Ü|Ğ|İ] 我正在研究土耳其语文本。所以我也需要注意这封信。
感谢那些愿意抽出时间并在这个问题上帮助我的人:)
【问题讨论】:
-
sentenceIndex [ "第一句话。" “第二句”“.....”] 我正在为此使用 nltk 标记器,我认为它只有在句子末尾有一个点(。)时才会分裂。 for line in sentenceIndex: line : "VODOFONE ARENA ŞANSI Ama asıl önemli olan nokta Murat Çetinkaya, Cumhurbaşkanı Erdoğan ve Başbakan Davutoglu'nun ittifakıyla seçildi。"
-
试试
print (re.findall(r'\b[A-ZÖÇŞÜĞİ]+(?:\W+[A-ZÖÇŞÜĞİ]+)*\b', line)),见this Python regex demo。 -
试过Truecasing?也许是这样:github.com/alvations/sacremoses#usage-cli(无耻的插头)
标签: python regex nltk text-extraction stringtokenizer