【问题标题】:How to extract the experience from resume using python? [closed]如何使用python从简历中提取经验? [关闭]
【发布时间】:2016-12-02 21:09:00
【问题描述】:

我已经提取了邮件 ID、电话号码- 通过使用正则表达式 我已经使用 Core NLP 服务器提取了名称 我通过提供一组并比较单词来提取技能。 但我不知道如何提取多年使用 python 的经验- 任何人都可以请给出一个想法吗? 例子:

2 年经验

两年经验

2010-2014

这样,有很多可能性。

【问题讨论】:

  • 你的意思是这么多可能性,最后你需要找到你预期模式背后的逻辑,例如它周围的字符串,或者如果预期模式的形状有限,你可以通过多种方式使用这些结构像正则表达式。
  • @Kasramvd 列出的3种方式都是另类的上市体验方式,可能没有“很多”方式,但实际上并没有真正的模式,主要是前两种
  • 好的,但唯一的方法是使用正则表达式或者我们可以使用任何其他逻辑
  • @cricket_007 是的,看起来是这样。
  • 也许还有其他不使用正则表达式的方法,例如拆分文本并处理较小的部分,或者您可以使用正则表达式缓解问题并使用其他函数来获得真正的结果。关键是您需要调查您正在处理的文本并指定问题的各个方面。问题是目前您的信息有缺陷,我无法再提供帮助。如果您想获得正确的答案,最好用更多信息更新您的问题。

标签: python regex python-2.7 nltk


【解决方案1】:

您可以采取几种方法。如果有很多可能性,如您所说,您可以将其视为机器学习问题并使用方法 1。否则 1,如果可能性有限(例如,大约 5),您可以使用第二种方法。

方法一:

将其视为机器学习问题。根据是否包含经验年份,将文本中的每个句子分类为 0 或 1。这可以通过手动训练一些数据来完成。针对每个训练示例,您将分配一个标签。例如:

工作经验:3 年(标签 1)

学习两年(标签0)

多年来努力工作(标签 0)

两年经验(标签 1)

经验:2010-2014 年(标签 1)

一旦你有很多例子,你可以使用skicit-learn 或类似的包来训练模型。

方法2:

1- 搜索年份。或者,它可以是确切的单词(yearyears),也可以是四位数字(例如 2014)。

2- 如果1 通过,请在附近搜索单词体验(或类似的东西)。

如果12 都通过了,那么你有多年的经验。然后,根据您的需要,您可以进一步提取。

【讨论】:

  • 是的,简历可以显示日期范围内的单词体验,但我认为问题是寻求一种不需要特定格式的输入数据的方法。无论如何,列出某个工作的日期范围绝对是显示多年经验的有效方式
  • 好吧,正如我在回答中所证明的那样,所有可能性都有一个模式。无论如何,另一种方法是使用机器学习,我已经在我的回答中添加了。
  • 由于我是机器学习新手,请您解释一下方法 1
  • 扩展了我的答案。
  • 在这里使用训练有素的分类器似乎真的有点矫枉过正。
猜你喜欢
  • 2022-06-13
  • 1970-01-01
  • 2016-02-06
  • 1970-01-01
  • 2020-09-21
  • 2011-07-15
  • 2016-10-18
  • 2023-03-28
  • 1970-01-01
相关资源
最近更新 更多