【问题标题】:Creating a page list from resume and get the first page从简历创建页面列表并获取第一页
【发布时间】:2019-10-19 18:36:18
【问题描述】:

我的目标是根据职位描述对简历进行排名:

为此我有以下任务:

从简历创建页面列表。

鉴于多份简历,我应该能够将它们分成几页。简历可以是 text、doc、docx、pdf 或 html 格式?

以下链接仅适用于 pdf 并且仅在出现分页时: PyPDF2 split pdf by pages

【问题讨论】:

  • 这太宽泛了,可能会被关闭!告诉我们您尝试了什么,您面临的问题是什么!

标签: python python-3.x machine-learning nltk spacy


【解决方案1】:

没有一种解决方案可以从不同的文件类型中提取文本。尝试使用 fitz 包从 pdf 中提取文本:

def extractTextfrompdf(resume):
    try:
        temp = fitz.open("pdf", resume)
        pageCount = temp.pageCount
        resumeText = ["".join(temp.getPageText(i) for i in range(pageCount))][0]
        return resumeText, pageCount
    except (TypeError,ValueError):
        logger.exception("Text extraction from pdf failed.")
        pass

您可以使用 python-docx 从 docx 文件中提取文本。逻辑应该很相似。

【讨论】:

  • 我们可以尝试使用词嵌入或 TFIDF 来做到这一点吗?
  • 是的,您可以使用 scikit-learn TfidfVectorizer 或词向量将上述函数的文本输出转换为 tf-idf。
  • 我可以使用 tfidVectorizer 将文档分成页面数组吗?
猜你喜欢
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
相关资源
最近更新 更多