【发布时间】:2023-03-11 13:25:01
【问题描述】:
我想抓取一些包含分页的网站。
我想抓取每个分页中的每个帖子。
所以,在 page/1 中,大约有 5 个帖子。
如何抓取每个分页中的每个数据?直到最后一页?
我已经搜索和研究,我发现了 2 个类似的问题,但我仍然混淆它..
这里>>
知道如何组合吗?
感谢之前
【问题讨论】:
标签: ruby-on-rails ruby pagination web-scraping
我想抓取一些包含分页的网站。
我想抓取每个分页中的每个帖子。
所以,在 page/1 中,大约有 5 个帖子。
如何抓取每个分页中的每个数据?直到最后一页?
我已经搜索和研究,我发现了 2 个类似的问题,但我仍然混淆它..
这里>>
知道如何组合吗?
感谢之前
【问题讨论】:
标签: ruby-on-rails ruby pagination web-scraping
您必须使用机械化宝石?我强烈建议您使用Nokogiri。它非常简单易用。
你可以有一个循环来获取页面并在你找不到页面时停止。
require 'open-uri'
require 'nokogiri'
pages_count = 1
loop do
@html = Nokogiri::HTML(open("somepage.com/#{pages_count}"))
...
pages_count = pages_count + 1
end
【讨论】: