【问题标题】:Remove HTML from String - RSS从字符串中删除 HTML - RSS
【发布时间】:2014-01-10 19:33:55
【问题描述】:

我目前正在构建一个 RSS 阅读器,一些网站有奇怪的 rss-2.0 文件,我必须先对其进行修改才能显示它们。

其中一个是seen here:

问题是描述标签不仅包含描述文本还包含一些

<a href ... /><img src ... />这样的html元素

如何在不查找每个属性的情况下删除所有这些不必要的信息?

Java 中有什么可用的吗?或者在这种情况下正则表达式有用吗?

【问题讨论】:

  • 忽略所有 CDATA
  • 嗯,这很简单 :D - 如果您创建回复,我会将其标记为已解决;)

标签: java html regex parsing rss


【解决方案1】:

您可以使用此正则表达式删除 HTML 标记:

String noHtml = html.replaceAll("\\<.*?>","");

尽管如此,我还是会使用 jsoup 来解析 Java 中的 HTML 代码。

【讨论】:

  • 第一个“\\”是什么意思?据我所知,&lt;&gt; 本身并不特别
【解决方案2】:

忽略CDATA里面的所有如

<content:encoded><![CDATA[... 

【讨论】:

    猜你喜欢
    • 2018-06-23
    • 1970-01-01
    • 2022-07-01
    • 2010-09-19
    • 2017-09-06
    • 2021-11-01
    • 2019-04-19
    相关资源
    最近更新 更多