【问题标题】:Web Crawler using c++使用 C++ 的网络爬虫
【发布时间】:2018-01-22 06:16:19
【问题描述】:

我正计划使用 c++ 抓取网站。我收集了有关如何从基地抓取网站的信息。我使用 winhttp 库下载网页。我想建立自己的一个而不是使用第三方库。我收集的信息是:

1.查看robots.txt,找到可以爬取的页面,找到请求时间间隔。

2.检查网站是否有sitemap.xml并从中收集信息。

3.检查所有 href 或 url 标签并找到其中的文件夹。

为了完全抓取网站,我还应该做些什么?

【问题讨论】:

    标签: c++ visual-c++ web-crawler


    【解决方案1】:

    您应该添加数据库支持。我建议使用Sqlite3。 您应该有一种机制来存储爬虫的当前状态,因此如果提前终止,它可以从上次停止的地方继续。 使用 winhttp 库有几个限制: - HTTPS 支持会受到一些限制。例如,最高支持 128 位(请参阅SSL in WinHTTP)。 - 可以被浏览器用户覆盖的无效/过期 SSL 证书的边缘情况。还有带有 HTTPS 前缀的 HTTP 站点,反之亦然。 我会使用libcurlOpenSSL 而不是winhttp。

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 2023-04-01
      相关资源
      最近更新 更多