【发布时间】:2019-01-03 13:41:58
【问题描述】:
我正在尝试解决一个相当困难的问题 - 为职位描述构建一个通用解析器。这个想法是,给定一个职位描述,解析器应该能够识别和提取不同的部分,例如职位、位置、职位描述、职责、资格等。职位描述基本上是从网页上抓取的。
基于规则的方法(例如正则表达式)不起作用,因为场景过于通用。我的下一个方法是使用 SpaCy 训练自定义 NER 分类器;我以前做过很多次。但是,我遇到了几个问题。
实体的大小可以非常小(位置、职位等),也可以非常大(职责、资格等)。如果实体有几行或一段长,我不确定 NER 的效果如何?我见过的大多数用例都是实体不超过几个单词的用例。如果我要识别的实体的文本很长,Spacy 的 NER 是否能正常工作? (如果需要,我可以举例说明更清楚)。
如前所述,除了 NER 之外,还有什么其他策略可以用来解析这些职位描述吗?
这里的任何帮助将不胜感激。几个月来,我一直在摸索不同的墙壁,并取得了一些进展,但我不确定我是否走在正确的轨道上,或者是否存在更好的方法。
【问题讨论】:
-
您说这些职位描述来自“一个”(单数)网页,究竟有多少变化?您可能可以使用 NER 提取位置,但您可能会更成功地通过依赖解析获得诸如工作职责之类的内容。
-
@AlexL 职位描述并非来自单一网页。它可以是不同的工作网站,例如 Indeed、Monster、Google Jobs 等。位置并不难,因为有 API,而且 NER 也可以更好地解决这个问题。您能否详细说明我如何通过依赖解析获得工作职责?
-
嘿,我正在尝试实现类似的目标。你有没有进一步关注这个?或者你选择了Poorna的答案
标签: python parsing nlp spacy named-entity-recognition