【问题标题】:How to filter the crawler data using java?如何使用java过滤爬虫数据?
【发布时间】:2016-12-07 08:03:11
【问题描述】:

我们已经使用 jsoup lib 获取了 URL 并存储在 db 中。现在我们正在寻找提取数据并存储在 db 中,但我们只查看特定字段,而不是存储整个页面。 例如:http://www.flipkart.com/shoes/ 当我们获取此链接时,我们需要品牌、价格、评论等字段。 使用java代码!! 请帮忙 !

【问题讨论】:

    标签: java web-crawler jsoup


    【解决方案1】:

    有两种方法可以过滤掉整个内容,

    1. 在响应内容上应用Regex 并提取所需字段。
    2. 使用xpath,您可以提取所需的字段(首选和推荐的解析方式)。

    例如:1 - 正则表达式

    1. 为您选择的页面生成regex 模式。
    2. String 获取响应并应用模式并检索数据。

    例如:2 - XPath

    1. 确定唯一定位每个 html 元素(或列表)的方法
    2. html/xml 形式获取响应,并将xpath 应用于检索到的内容并获取数据。

    【讨论】:

    猜你喜欢
    • 2019-11-07
    • 1970-01-01
    • 2012-08-08
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2016-02-06
    • 1970-01-01
    • 2022-10-12
    相关资源
    最近更新 更多