【问题标题】:Remove html tags from a corpus in R [duplicate]从R中的语料库中删除html标签[重复]
【发布时间】:2018-08-30 08:15:03
【问题描述】:

我正在尝试从 R 中的语料库(文档)中删除 html 标记:

tags : </P></TEXT>  </BODY> <TRAILER> NYT-06-22-98 1759EDT &QL; </TRAILER> </DOC> 

我正在使用的代码:

tun<-function(x) gsub("<TRAILER>,<HTML>,<BODY>,<P>,<TEXT>,</P>,</TEXT>,
</BODY>,</HTML>", "", x)
docs <- tm_map(docs, tun)

但它无法从语料库中删除标签,这是为什么?

【问题讨论】:

    标签: r text-mining gsub information-retrieval


    【解决方案1】:

    如果您想删除所有打开和关闭 HTML 标记,那么您可以尝试查找模式 &lt;/?[^&gt;]+&gt; 并替换为空字符串:

    x <- "tags : </P></TEXT>  </BODY> <TRAILER> NYT-06-22-98 1759EDT &QL; </TRAILER> </DOC>"
    gsub("</?[^>]+>", "", x)
    
    
    [1] "tags :     NYT-06-22-98 1759EDT &QL;  "
    

    Demo

    作为一个主要的免责声明,通常您应该使用正则表达式来解析 HTML/XML 内容。在这种特殊情况下,如果您只想去除所有标签,gsub 可能是一个可行的选择。

    【讨论】:

    • 是的,我只是想从文档中删除所有标签。谢谢。
    • @akrun 你是对的,这是一个骗子,我没想过要检查。对我不好。
    猜你喜欢
    • 1970-01-01
    • 2012-04-10
    • 2014-09-15
    • 2012-12-29
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2011-09-04
    • 2021-03-01
    相关资源
    最近更新 更多