【发布时间】:2015-12-11 14:49:57
【问题描述】:
我无法将中文文本抓取到 csv 中。我尝试了 3 种不同的东西(在代码中注释),但 csv 仍然只包含乱码。
from bs4 import BeautifulSoup
import urllib2
#import codecs
url="http://v.youku.com/v_show/id_XOTU2Nzc3NDYw.html"
page = urllib2.urlopen(url,context=gcontext).read()#.decode('utf-8', 'ignore')
soup = BeautifulSoup(page)
title= soup.findAll('h1', { "class" : "title" })[0].string#.encode('utf-8')
outputfile='.../file.csv'
fd = open(outputfile,'a')
#fd = codecs.open(outputfile, "a", "utf-8")
fd.write(title)
fd.close()
【问题讨论】:
-
你应该说出什么给了
urllib2.urlopen(url,context=gcontext).headers.get('content_type')。它应该提供有关实际页面编码的提示。
标签: python encoding beautifulsoup