【发布时间】:2018-02-13 05:56:48
【问题描述】:
我是网络爬虫的初学者,我曾尝试过用于静态网络的 crawler4j。
现在,我想尝试通过 Nutch+hbase+solr 抓取这个网站 (https://weedmaps.com/brands), 但我什至不能更进一步。
我曾尝试过其他网站,例如http://sports.sina.com.cn, 我实际上可以将信息索引到 solr。
我想知道https://weedmaps.com/brands,源页面没有明确的出链接,我该如何抓取它? 任何机构都可以建议工具或文章吗?或者解释一下nutch 不起作用的原因?
非常感谢。
【问题讨论】:
标签: solr web-crawler hbase nutch