【发布时间】:2018-08-30 08:15:03
【问题描述】:
我正在尝试从 R 中的语料库(文档)中删除 html 标记:
tags : </P></TEXT> </BODY> <TRAILER> NYT-06-22-98 1759EDT &QL; </TRAILER> </DOC>
我正在使用的代码:
tun<-function(x) gsub("<TRAILER>,<HTML>,<BODY>,<P>,<TEXT>,</P>,</TEXT>,
</BODY>,</HTML>", "", x)
docs <- tm_map(docs, tun)
但它无法从语料库中删除标签,这是为什么?
【问题讨论】:
标签: r text-mining gsub information-retrieval