【发布时间】:2018-01-22 06:16:19
【问题描述】:
我正计划使用 c++ 抓取网站。我收集了有关如何从基地抓取网站的信息。我使用 winhttp 库下载网页。我想建立自己的一个而不是使用第三方库。我收集的信息是:
1.查看robots.txt,找到可以爬取的页面,找到请求时间间隔。
2.检查网站是否有sitemap.xml并从中收集信息。
3.检查所有 href 或 url 标签并找到其中的文件夹。
为了完全抓取网站,我还应该做些什么?
【问题讨论】:
标签: c++ visual-c++ web-crawler