【问题标题】:How to retrieve data from tag <content:encoded> with CDATA from RSS feed with Jsoup for android?如何使用 Jsoup for android 从带有 CDATA 的标签 <content:encoded> 检索数据?
【发布时间】:2021-01-07 06:47:09
【问题描述】:

我想使用 jsoup 从 RSS 提要中检索数据。我可以使用所有标签,但是当有 content:encoded 标签时我不能这样做。请任何人帮助我如何从内容获取数据:编码标签。 我的提要 URL 是 https://sambad.in/feed/,我的代码也是 Document doc = Jsoup.parse(String.valueOf(response)); 元素 itemElements = doc.select("item");

            for (int i = 0; i < itemElements.size(); i++) {

                Element item = itemElements.get(i);
                String title = item.child(0).text();
                String link=item.child(1).text();
                String imgUrl=extractImageUrl(item.select("description").text());
                String description = extractPostText(item.select("description").text())+"From Sambad: By Pin2";
                String fullnews=extractPostText(item.children().select("http://purl.org/rss/1.0/modules/content/encoded").text());

【问题讨论】:

    标签: java android rss jsoup


    【解决方案1】:

    要使用的选择器是content|encoded。要指定命名空间标记,请将: 替换为|。有关更多示例,请参阅jsoup selector documentation

    这是Try Jsoup 上的一个活生生的例子。

    需要注意的几点:

    1. 对于 RSS,您应该使用 XML parser 而不是(默认)解析器。通常,如果您使用Jsoup.connect(url) 加载内容,这会自动发生,因为它会根据内容类型设置解析器。但是您正在绕过它(通过提供字符串输入),因此您需要手动指定它。
    2. content|encoded 选择器的结果将是一组包含带有 HTML 标记的文本的元素(未解析的 HTML 元素)。这是因为 RSS 中的内容是 HTML 编码(转义)的。如果您希望它作为解析后的 H​​TML,接下来您应该对文本使用 Jsoup.parseBodyFragment(String) 方法。

    【讨论】:

      猜你喜欢
      • 2011-03-21
      • 1970-01-01
      • 2014-09-14
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 2015-10-06
      • 2021-08-02
      • 2012-10-23
      相关资源
      最近更新 更多