【发布时间】:2011-04-29 10:38:31
【问题描述】:
我是自然语言处理的新手,我想通过创建一个简单的项目来了解更多信息。 NLTK 被建议在 NLP 中流行,所以我将在我的项目中使用它。
这是我想做的:
- 我要扫描我们公司的内网页面;大约 3000 页
- 我想根据某些标准解析和分类这些页面的内容,例如:人力资源、工程、公司页面等...
从我目前阅读的内容来看,我可以使用命名实体识别来做到这一点。我可以为每个页面类别描述实体,训练 NLTK 解决方案并运行每个页面以确定类别。
这是正确的方法吗?我感谢任何方向和想法...
谢谢
【问题讨论】: