用request访问网站的时候,经常会碰到中文乱码的问题,常用的中文编码格式有"utf-8"和"gb2312"

处理步骤:

1.首先检查一下网页的编码格式,打开浏览器按F12,检查源码,点击元素(Elements),搜索 "charset " 可以看出来网页的编码格式:

例如下面的网页:

requests获取源代码时中文乱码问题

 

 因此可知这个页面的编码格式是gb2312的.

 

2.用requests获取网页源码,加入编码方式

url = "http://www.baidu.com"

方法1:

 html = requests.get(url).content.decode('gb2312')

方法2:

html = requests.get(url)

html.encoding='gb2312'

 

注意:我们可以用print(html.encoding) 的方式,打印出来网页的编码,但是有的时候打印出来的有可能是乱的,最好的方式还是查看网页的charset属性

相关文章:

  • 2022-12-23
  • 2022-12-23
  • 2021-06-30
  • 2022-12-23
  • 2021-07-26
  • 2021-11-19
  • 2021-06-07
  • 2021-10-10
猜你喜欢
  • 2022-02-27
  • 2021-09-30
  • 2022-12-23
  • 2021-09-16
  • 2021-09-06
  • 2022-12-23
  • 2022-12-23
相关资源
相似解决方案