【发布时间】:2016-04-21 16:03:40
【问题描述】:
过去,我正在尝试使用 Python 脚本抓取一个用于音乐演出的 drupal 网站。
在使用 wordpress 网站时,我会像这样遍历 url:
http://wordpressevents.com/?p=1 ... http://wordpressevents.com/?p=10000
...这会让我转到一个我可以抓取的页面(如果那里有的话)。实际的 URL 类似于:
http://wordpressevents.com/music/some-band-youve-never-heard-of/
我的 Drupal 站点也有部分(例如 /gigs/ 或 /classical/ 等)。
有什么方法可以找出他们的网址,以便我可以用 Python 和 BeautifulSoup 抓取它(欢迎其他建议)?
理想情况下,我会找出结构是什么......
http://drupalevents.com/drupost?=1 ... http://drupalevents.com/drupost?=10000
等等
但也许它不会像这样工作?
【问题讨论】:
标签: php python url drupal web-scraping