【发布时间】:2014-09-29 16:05:09
【问题描述】:
res = requests.get(self.urlBase)
soup = BeautifulSoup(html)
print soup.prettify()
给出错误:
'ascii' 编解码器无法对位置 10816 中的字符 u'\xa0' 进行编码: 序数不在范围内(128)
我正在使用 Requests 和 BeautifulSoup4。
我认为它与 unicode 有关?我看到的每个示例都以这种方式使用它而没有问题。不知道为什么我的编码有问题?
内容类型为text/html; charset=UTF-8
【问题讨论】:
-
显示完整的回溯。
-
你有一个编码错误;您很可能遇到
print的问题,而不是 BeautifulSoup。您是在此处重定向输出还是使用 IDE 控制台? -
你能给出一个会导致错误的示例 url 或 html 吗?
-
另外,您将回复存储在
res,但不要告诉我们您从哪里获得html。 -
PrintFails。您的抓取很好,但是从使用 C 标准库 IO 的 Python 等应用程序将 Unicode 打印到 Windows 控制台是行不通的。
标签: python unicode web-scraping python-requests