【发布时间】:2014-01-10 19:33:55
【问题描述】:
我目前正在构建一个 RSS 阅读器,一些网站有奇怪的 rss-2.0 文件,我必须先对其进行修改才能显示它们。
其中一个是seen here:
问题是描述标签不仅包含描述文本还包含一些
像<a href ... /><img src ... />这样的html元素
如何在不查找每个属性的情况下删除所有这些不必要的信息?
Java 中有什么可用的吗?或者在这种情况下正则表达式有用吗?
【问题讨论】:
-
忽略所有 CDATA
-
嗯,这很简单 :D - 如果您创建回复,我会将其标记为已解决;)
标签: java html regex parsing rss