【发布时间】:2016-12-07 08:03:11
【问题描述】:
我们已经使用 jsoup lib 获取了 URL 并存储在 db 中。现在我们正在寻找提取数据并存储在 db 中,但我们只查看特定字段,而不是存储整个页面。 例如:http://www.flipkart.com/shoes/ 当我们获取此链接时,我们需要品牌、价格、评论等字段。 使用java代码!! 请帮忙 !
【问题讨论】:
标签: java web-crawler jsoup
我们已经使用 jsoup lib 获取了 URL 并存储在 db 中。现在我们正在寻找提取数据并存储在 db 中,但我们只查看特定字段,而不是存储整个页面。 例如:http://www.flipkart.com/shoes/ 当我们获取此链接时,我们需要品牌、价格、评论等字段。 使用java代码!! 请帮忙 !
【问题讨论】:
标签: java web-crawler jsoup
有两种方法可以过滤掉整个内容,
Regex 并提取所需字段。xpath,您可以提取所需的字段(首选和推荐的解析方式)。regex 模式。 String 获取响应并应用模式并检索数据。html/xml 形式获取响应,并将xpath 应用于检索到的内容并获取数据。 【讨论】: