【发布时间】:2021-08-03 08:44:15
【问题描述】:
我正在尝试为基于方面的情感分析做一些模式匹配常规回归问题。模式匹配后,我无法处理正确位置的标点符号。
def extra_expression1(txt):
txt= str(txt)
nlp=spacy.load("en_core_web_sm")
txt=nlp(txt)
punc=''
a=len(txt)
for token in txt:
if (token.is_punct==False):
txt=str(txt)
txt=re.sub('goo+d+[^a-z]','good',txt) #"goooodddd" to "good"
a=a-1
else:
punc=token.text
if (a!=0):
txt=str(txt) + str(punc)
punc=''
else:
txt=str(txt) + str(punc)
a=a-1
return txt
和
txt1=["hotel is goood! breakfast was bad."]
df_22=pd.DataFrame(
{
'clean_review' : txt1
}
)
display(df_22)
for i,txt in enumerate(df_22['clean_review']):
txt1= extra_expression1(txt)
df_22['clean_review'].iloc[i]=txt1
df_22
输出是(处理后的最后一个):
我该如何解决这个问题?
【问题讨论】: