【发布时间】:2020-09-01 06:23:20
【问题描述】:
我正在尝试提取简历的人名。我没有得到正确的输出。到目前为止我所做的是。
import en_core_web_sm
import spacy
import pdfplumber
nlp = en_core_web_sm.load()
nlp = spacy.load("en_core_web_sm")
pdf = pdfplumber.open('C:/Person.pdf')
page = pdf.pages[0]
doc = nlp(page.extract_text())
print([(X.text, X.label_) for X in doc.ents if X.label_ == 'PERSON'])
我的输出是:
[('Mohamme mohammed24@yahoo.com\n', 'PERSON'), ('Mangalore', 'PERSON'), ('Demo Design1', 'PERSON'), ('Demo Design2', 'PERSON'), ('Demo Design3', 'PERSON'), ('Java', 'PERSON')]
我尝试了很多东西,但无法获得唯一的名字。它包括许多东西,如技能、电子邮件等。
如何从简历示例技能、电话号码、姓名、工作年限、电子邮件中提取所有详细信息。
【问题讨论】:
标签: python-3.x machine-learning nlp nltk named-entity-recognition