【问题标题】:Nutch cannot find out link for this kind of websiteNutch 找不到此类网站的链接
【发布时间】:2018-02-13 05:56:48
【问题描述】:

我是网络爬虫的初学者,我曾尝试过用于静态网络的 crawler4j。​​

现在,我想尝试通过 Nutch+hbase+solr 抓取这个网站 (https://weedmaps.com/brands), 但我什至不能更进一步。

我曾尝试过其他网站,例如http://sports.sina.com.cn, 我实际上可以将信息索引到 solr。

我想知道https://weedmaps.com/brands,源页面没有明确的出链接,我该如何抓取它? 任何机构都可以建议工具或文章吗?或者解释一下nutch 不起作用的原因?

非常感谢。

【问题讨论】:

    标签: solr web-crawler hbase nutch


    【解决方案1】:

    问题是https://weedmaps.com/brands 这个页面是使用 AngularJS 构建的,这意味着它基本上是使用 Javascript 呈现的,而实际存在的 HTML 很差。如果您尝试仅使用 curl,您可以看到源代码。默认情况下,Nutch 只依赖服务器发送的 HTML,不做任何客户端处理(比如解释 js 代码)。

    您可以查看https://github.com/apache/nutch/tree/master/src/plugin/protocol-selenium 并配置该协议。在这种情况下,Nutch 将通过 Selenium(能够解释 javascript)对 HTML 进行管道传输,然后将最终的 HTML 发送到正常的 Nutch 管道。

    【讨论】:

    • 豪尔赫,谢谢你的建议!我之前以为纯 nutch 可以帮助我处理 javascript,我错了。所以我仍然需要尝试其他组合来做到这一点。让我先试试 Nutch + Selenium。你知道任何其他工具对初学者来说很容易学习吗?尤其是设置环境很简单。再次感谢您!
    猜你喜欢
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2012-08-04
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2013-09-16
    • 1970-01-01
    相关资源
    最近更新 更多