【发布时间】:2014-07-29 00:51:10
【问题描述】:
我正在用 Java 编写一个名词短语提取器,并且我正在尝试使用 OpenNLP 库来标记名词。不幸的是,OpenNLP 的文档非常混乱。目前,我只是在标记一串英文文本。文档让我使用类似于以下内容来初始化令牌模型:
InputStream modelIn = new FileInputStream("en-token.bin");
try {
TokenizerModel model = new TokenizerModel(modelIn);
}
catch (IOException e) {
e.printStackTrace();
}
finally {
if (modelIn != null) {
try {
modelIn.close();
}
catch (IOException e) {
}
}
}
Tokenizer tokenizer = new TokenizerME(model);
String tokens[] = tokenizer.tokenize("An input sample sentence.");
我在这里感到困惑的是“en-token.bin”是什么,以及我在哪里可以找到它。它应该包含在压缩文件的原始下载中吗?还是我必须从 OpenNLP 的网站下载它?
这是文档的链接:https://opennlp.apache.org/documentation/1.5.3/manual/opennlp.html#tools.tokenizer
您能给我的任何帮助将不胜感激。提前谢谢!
【问题讨论】:
标签: java file-io download opennlp