【问题标题】:Parsing/identifying sections in job descriptions解析/识别职位描述中的部分
【发布时间】:2019-01-03 13:41:58
【问题描述】:

我正在尝试解决一个相当困难的问题 - 为职位描述构建一个通用解析器。这个想法是,给定一个职位描述,解析器应该能够识别和提取不同的部分,例如职位、位置、职位描述、职责、资格等。职位描述基本上是从网页上抓取的。

基于规则的方法(例如正则表达式)不起作用,因为场景过于通用。我的下一个方法是使用 SpaCy 训练自定义 NER 分类器;我以前做过很多次。但是,我遇到了几个问题。

  1. 实体的大小可以非常小(位置、职位等),也可以非常大(职责、资格等)。如果实体有几行或一段长,我不确定 NER 的效果如何?我见过的大多数用例都是实体不超过几个单词的用例。如果我要识别的实体的文本很长,Spacy 的 NER 是否能正常工作? (如果需要,我可以举例说明更清楚)。

  2. 如前所述,除了 NER 之外,还有什么其他策略可以用来解析这些职位描述吗?

这里的任何帮助将不胜感激。几个月来,我一直在摸索不同的墙壁,并取得了一些进展,但我不确定我是否走在正确的轨道上,或者是否存在更好的方法。

【问题讨论】:

  • 您说这些职位描述来自“一个”(单数)网页,究竟有多少变化?您可能可以使用 NER 提取位置,但您可能会更成功地通过依赖解析获得诸如工作职责之类的内容。
  • @AlexL 职位描述并非来自单一网页。它可以是不同的工作网站,例如 Indeed、Monster、Google Jobs 等。位置并不难,因为有 API,而且 NER 也可以更好地解决这个问题。您能否详细说明我如何通过依赖解析获得工作职责?
  • 嘿,我正在尝试实现类似的目标。你有没有进一步关注这个?或者你选择了Poorna的答案

标签: python parsing nlp spacy named-entity-recognition


【解决方案1】:

我建议使用flashtext 构建基线(基于规则)方法。根据您的数据,这实际上给出了相当不错和更快的结果。一个好的反馈机制将有助于构建您的序列标记模型来解析您的工作描述和管理数据。使用该数据使用最先进的库 flair 构建 NER 模型

【讨论】:

    猜你喜欢
    • 2018-07-27
    • 1970-01-01
    • 2020-03-06
    • 2022-06-11
    • 2013-07-26
    • 1970-01-01
    • 2023-01-24
    • 2017-04-04
    • 1970-01-01
    相关资源
    最近更新 更多