爬虫库

使用简单的requests库,这是一个阻塞的库,速度比较慢。

解析使用XPATH表达式

总体采用类的形式

多线程

使用concurrent.future并发模块,建立线程池,把future对象扔进去执行即可实现并发爬取效果

数据存储

使用Python ORM sqlalchemy保存到数据库,也可以使用自带的csv模块存在CSV中。

API接口

因为API接口存在数据保护情况,一个电影的每一个分类只能抓取前25页,全部评论、好评、中评、差评所有分类能爬100页,每页有20个数据,即最多为两千条数据。

因为时效性原因,不保证代码能爬到数据,只是给大家一个参考思路,上代码

Python多线程豆瓣影评API接口爬虫

相关文章:

  • 2021-11-22
  • 2021-12-18
  • 2021-06-25
  • 2021-10-08
  • 2021-07-19
  • 2022-01-07
  • 2022-02-07
  • 2021-11-29
猜你喜欢
  • 2022-01-01
  • 2021-04-05
  • 2021-11-24
  • 2021-08-21
  • 2021-12-10
  • 2021-12-17
相关资源
相似解决方案